Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[SNLP2026] Scaling up Test-Time Compute with La...
Search
池田航
August 20, 2026
Research
320
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
池田航
August 20, 2026
Other Decks in Research
See All in Research
Evaluating LLM Reliability Across Facts, Evidence, and Cultures
yukiar
0
150
シングルチャネルマルチトーカー音声認識の進展
ryomasumura
0
300
[IR Reading 2026春 論文紹介] LLM-based Listwise Reranking under the Effect of Positional Bias (ECIR 2026) /IR-Reading-2026-Spring
koheishinden
PRO
0
420
typst の使い方:言語学を研究する学生のために【2026/9/15更新】
gitomochang
1
610
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
590
ros2-perf-multihost: 分散システムにおける客観的なアーキテクチャ評価フレームワーク
takasehideki
0
260
全国町字単位空き家率推定データver1.0データ仕様
microbaseinc
0
240
JPA2026_NetworkTutorial_JunKashihara
junkashihara
0
160
論文読み会 SNLP2026 Tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
s_mizuki_nlp
0
250
20260624 NLP colloquium: 単一のhubテキストがCLIPを壊す:hubnessによる埋め込みの脆弱性特定
de9uch1
2
260
2026年度 生成AI を活用した論文執筆ガイド/ワークショップ / 2026 Academic Year Guide to Writing Papers Using Generative AI - Workshop
ks91
PRO
0
230
Sleuthcon Keynote - How Cybercriminals (ab)use AI
fr0gger
0
330
Featured
See All Featured
No one is an island. Learnings from fostering a developers community.
thoeni
21
3.8k
Save Time (by Creating Custom Rails Generators)
garrettdimon
PRO
32
4.8k
How to train your dragon (web standard)
notwaldorf
97
6.8k
Effective software design: The role of men in debugging patriarchy in IT @ Voxxed Days AMS
baasie
1
520
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
290
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
410
Dominate Local Search Results - an insider guide to GBP, reviews, and Local SEO
greggifford
PRO
0
330
Ten Tips & Tricks for a 🌱 transition
stuffmc
1
230
Scaling GitHub
holman
464
140k
Agile Actions for Facilitating Distributed Teams - ADO2019
mkilby
0
280
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
520
Transcript
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth
Approach Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian R. Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, Tom Goldstein NeurIPS 2025 https://arxiv.org/abs/2502.05171 発表者: 池田 航 東北大学 M2 鈴木・赤間研究室 2026/08/30 第18回最先端NLP勉強会 2026/8/30 第18回最先端NLP勉強会 1
昨今のTest time Scaling ⚫ テスト時(推論時)に計算を追加投入して性能を 伸ばすアプローチ, Test time Scalingが注目される. ⚫
テスト時に計算量を増やす方法として推論過程を 「言語化=外在化」させるものが主流. - OpenAI o1, Deepseek-r1, etc… cf. 人間: 脳内で非言語的な思考の後に発話. - 空間的思考, 物理的直感, (運動)計画, 抽象化, etc... 2026/8/30 第18回最先端NLP勉強会 2
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 2026/8/30 第18回最先端NLP勉強会 3
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 本研究では深さ再帰(Recurrent Depth)をアーキテクチャを導入. 深さ再帰(層数)のスケールによる潜在的な推論(Latent Reasoning) はTest time scalingの新しい軸となりうるか…? 2026/8/30 第18回最先端NLP勉強会 4
検証する深さ再帰型Transformer ⚫ モデルを構成するTransformer層を3ブロックに分割. ×r プレリュード 再帰ブロック コーダ 入力されたデータを 再帰的にブロックを適用し, 潜在空間から
潜在空間に埋め込む. 潜在空間での推論を行う. 語彙空間に戻す. ⚫ 再帰ブロックの再帰ステップ数𝒓を設定することで テスト時に任意の層数/計算量にスケール可能. 2026/8/30 第18回最先端NLP勉強会 5
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 6
再帰ブロックの計算の工夫 ×r プレリュードPが コーダCが 入力トークンを 再帰ブロックの出力SR 潜在表現eに埋め込み 再帰ブロックRを を語彙空間に戻す 繰り返し適用し,
潜在表現si を更新 2026/8/30 第18回最先端NLP勉強会 7
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 8
再帰ブロックの計算の工夫 再帰ブロックでは潜在表現を プレリュードの出力eを ランダムに初期化 毎再帰ステップでinput injection Why…?: 再帰による不動点への収束を安定化させるため. 2026/8/30 第18回最先端NLP勉強会
9
任意の深さに汎化するための工夫 ⚫ テスト時に任意の再帰ステップ数rで機能するように 事前学習時に再帰ステップ数𝒓をランダムサンプリング. Log-normal Poisson分布に従う. 裾が長く,より長い再帰ステップに 汎化することが期待される. ⚫ 再帰ブロックには最後の定数ステップ分のみ勾配を流す.
Backprop時の計算量とメモリがサンプリングされた 再帰ステップ数に関わらず定数に収まる. 2026/8/30 第18回最先端NLP勉強会 10
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 再帰ステップrを揺らして評価. r = 32の場合, 実効層数は132(=2+32*4+2) 2026/8/30 第18回最先端NLP勉強会 11
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 より難易度が高い・推論を要する 単純な事実の想起を測る タスクで特に再帰モデルが優位 タスクではあまり変わらない ! 深さ再帰は推論を要するタスクにおいて優位 2026/8/30 第18回最先端NLP勉強会 12
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag GSM8K CoT (Flexible) GSM8K CoT
(Strict) Humaneval 2026/8/30 第18回最先端NLP勉強会 13
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag 再帰ステップ数を増やすと 下流タスクで性能が向上. GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval ! 深さ再帰は新しいTest Time Scalingとして有望 2026/8/30 第18回最先端NLP勉強会 14
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwagでは再帰ステップ数の HellaSwag 早い段階で性能が収束 GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval Math・Code系タスクでは性能収束 にはより多くの再帰ステップが必要 ! 必要な再帰ステップ数はタスクの難易度に依存 2026/8/30 第18回最先端NLP勉強会 15
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 “Open-book”形式 =正解を含むを記述を与えた状態で回答 (※ Closed-bookはその逆) Shot数を変化させる 2026/8/30 第18回最先端NLP勉強会 16
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 他の深さ固定モデルと比較して Closed➔Openのときの性能向上がより顕著. Shot数が増えるほど性能の収束に より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 17
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. 各再帰ステップでの学習時の性能の推移 OpenbookQAのスコア比較 “Closed-book”形式
vs “Open-book”形式 ARC-Challengeのスコア推移 再帰ステップ数が shot数の再帰ステップ数への影響の比較 大きい条件 ➔安定して性能向上 再帰ステップ数 が小さい条件 ➔ほとんど変化無し 静的なブロックに知識を埋め込むよりも 他の深さ固定モデルと比較して Shot数が増えるほど性能の収束に Closed➔Openのときの上がり幅が顕著. 再帰に適応するように学習が進行 より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 18
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 2026/8/30 第18回最先端NLP勉強会 19
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 軌道を描くパターン 算術問題など難易度の高い 入力などに対して現れる
固定点に収束するパターン 最も多くのトークンで観測 他にもスライダーなど, 様々な幾何的構造が創発. ! 高次元の潜在空間を活用した推論形式の獲得を示唆 2026/8/30 第18回最先端NLP勉強会 20
まとめ ⚫ テスト時に計算量を増やす新しい方向性として, 深さ方向の再帰を提案 ⚫ 深さ方向の再帰の特性として 1. 深さ固定に対して特に推論を要するタスクで優位 2. 再帰ステップを増やすことで性能の引き上げが可能
3. 再帰は暗記能力より推論能力に寄与 ! 総じて, Test time scalingの新しい軸として有望 ⚫ CoTが行っているような, いわゆる “推論” が潜在空間で 行われているかは今後の課題. 2026/8/30 第18回最先端NLP勉強会 21
所感 ⚫ Test Time Scaling手法として深さ固定モデルwith CoT との比較で真に効率が良いのは…?が気になる. - 深さ固定との比較で, 深さ再帰は学習時におよそ10倍,
推論時は14倍 のFLOPsを消費. - 真に公平な比較は深さ固定モデル with CoTと, FLOPsやメモリなどの 条件を固定した上での性能比較…? ⚫ “暗記能力<推論能力” の性質はRAGなどの知識を外在 化する手法と相性良し…? ⚫ 潜在で考える= 何を考えているかわからない人 - 実用上, 安全性を担保するためにも潜在空間でどのような言語的な 情報処理が行われているかを明らかにしていくことが必要. 2026/8/30 第18回最先端NLP勉強会 22