Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[SNLP2026] Scaling up Test-Time Compute with La...
Search
池田航
August 20, 2026
Research
330
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
池田航
August 20, 2026
Other Decks in Research
See All in Research
Language and AI
ayaniwa
0
320
Karkada さんの論文 × 2 の紹介: (1) Closed-Form Training Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models, (2) Symmetry in language statistics shapes the geometry of model representations
eumesy
PRO
1
820
Easy to Guess, Hard to Verify: Lessons from AIMO 3 for Olympiad-Level AI Mathematics
corochann
0
120
IA for theory
gpeyre
1
470
RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent
satai
3
600
Développer des solutions de réduction des émissions de méthane entérique : 1ers résultats Méthane 2030
institutdelelevage
PRO
0
230
【中間報告】国会議員の立法・政策実務を支える環境を巡る現状と課題
polipoli
0
690
Byzantine Eventual Consistency for Reliable Local-First Software
ept
0
140
TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis
satai
2
110
[CV勉強会@関東 CVPR2026] PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow / kantocv 67th CVPR 2026
shunk031
0
360
Evaluation génomique des femelles laitières croisées : comprendre la méthode pour accompagner les éleveurs à son utilisation
institutdelelevage
PRO
0
150
JICA QUEST 共創×革新プログラム Impact Report(海ノ向こうコーヒー)
ontheslope
0
780
Featured
See All Featured
How People are Using Generative and Agentic AI to Supercharge Their Products, Projects, Services and Value Streams Today
helenjbeal
1
350
Designing Dashboards & Data Visualisations in Web Apps
destraynor
232
55k
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.9k
Everyday Curiosity
cassininazir
0
340
Odyssey Design
rkendrick25
PRO
2
860
DevOps and Value Stream Thinking: Enabling flow, efficiency and business value
helenjbeal
1
400
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
230
23k
The SEO identity crisis: Don't let AI make you average
varn
0
580
The untapped power of vector embeddings
frankvandijk
2
1.9k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
2.2k
How to Ace a Technical Interview
jacobian
280
24k
The #1 spot is gone: here's how to win anyway
tamaranovitovic
4
1.2k
Transcript
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth
Approach Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian R. Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, Tom Goldstein NeurIPS 2025 https://arxiv.org/abs/2502.05171 発表者: 池田 航 東北大学 M2 鈴木・赤間研究室 2026/08/30 第18回最先端NLP勉強会 2026/8/30 第18回最先端NLP勉強会 1
昨今のTest time Scaling ⚫ テスト時(推論時)に計算を追加投入して性能を 伸ばすアプローチ, Test time Scalingが注目される. ⚫
テスト時に計算量を増やす方法として推論過程を 「言語化=外在化」させるものが主流. - OpenAI o1, Deepseek-r1, etc… cf. 人間: 脳内で非言語的な思考の後に発話. - 空間的思考, 物理的直感, (運動)計画, 抽象化, etc... 2026/8/30 第18回最先端NLP勉強会 2
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 2026/8/30 第18回最先端NLP勉強会 3
推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難
(より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 本研究では深さ再帰(Recurrent Depth)をアーキテクチャを導入. 深さ再帰(層数)のスケールによる潜在的な推論(Latent Reasoning) はTest time scalingの新しい軸となりうるか…? 2026/8/30 第18回最先端NLP勉強会 4
検証する深さ再帰型Transformer ⚫ モデルを構成するTransformer層を3ブロックに分割. ×r プレリュード 再帰ブロック コーダ 入力されたデータを 再帰的にブロックを適用し, 潜在空間から
潜在空間に埋め込む. 潜在空間での推論を行う. 語彙空間に戻す. ⚫ 再帰ブロックの再帰ステップ数𝒓を設定することで テスト時に任意の層数/計算量にスケール可能. 2026/8/30 第18回最先端NLP勉強会 5
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 6
再帰ブロックの計算の工夫 ×r プレリュードPが コーダCが 入力トークンを 再帰ブロックの出力SR 潜在表現eに埋め込み 再帰ブロックRを を語彙空間に戻す 繰り返し適用し,
潜在表現si を更新 2026/8/30 第18回最先端NLP勉強会 7
再帰ブロックの計算の工夫 2026/8/30 第18回最先端NLP勉強会 8
再帰ブロックの計算の工夫 再帰ブロックでは潜在表現を プレリュードの出力eを ランダムに初期化 毎再帰ステップでinput injection Why…?: 再帰による不動点への収束を安定化させるため. 2026/8/30 第18回最先端NLP勉強会
9
任意の深さに汎化するための工夫 ⚫ テスト時に任意の再帰ステップ数rで機能するように 事前学習時に再帰ステップ数𝒓をランダムサンプリング. Log-normal Poisson分布に従う. 裾が長く,より長い再帰ステップに 汎化することが期待される. ⚫ 再帰ブロックには最後の定数ステップ分のみ勾配を流す.
Backprop時の計算量とメモリがサンプリングされた 再帰ステップ数に関わらず定数に収まる. 2026/8/30 第18回最先端NLP勉強会 10
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 再帰ステップrを揺らして評価. r = 32の場合, 実効層数は132(=2+32*4+2) 2026/8/30 第18回最先端NLP勉強会 11
深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が
それぞれ(2, 4, 2)層 より難易度が高い・推論を要する 単純な事実の想起を測る タスクで特に再帰モデルが優位 タスクではあまり変わらない ! 深さ再帰は推論を要するタスクにおいて優位 2026/8/30 第18回最先端NLP勉強会 12
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag GSM8K CoT (Flexible) GSM8K CoT
(Strict) Humaneval 2026/8/30 第18回最先端NLP勉強会 13
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwag 再帰ステップ数を増やすと 下流タスクで性能が向上. GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval ! 深さ再帰は新しいTest Time Scalingとして有望 2026/8/30 第18回最先端NLP勉強会 14
再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwagでは再帰ステップ数の HellaSwag 早い段階で性能が収束 GSM8K CoT (Flexible)
GSM8K CoT (Strict) Humaneval Math・Code系タスクでは性能収束 にはより多くの再帰ステップが必要 ! 必要な再帰ステップ数はタスクの難易度に依存 2026/8/30 第18回最先端NLP勉強会 15
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 “Open-book”形式 =正解を含むを記述を与えた状態で回答 (※ Closed-bookはその逆) Shot数を変化させる 2026/8/30 第18回最先端NLP勉強会 16
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式
vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 他の深さ固定モデルと比較して Closed➔Openのときの性能向上がより顕著. Shot数が増えるほど性能の収束に より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 17
暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. 各再帰ステップでの学習時の性能の推移 OpenbookQAのスコア比較 “Closed-book”形式
vs “Open-book”形式 ARC-Challengeのスコア推移 再帰ステップ数が shot数の再帰ステップ数への影響の比較 大きい条件 ➔安定して性能向上 再帰ステップ数 が小さい条件 ➔ほとんど変化無し 静的なブロックに知識を埋め込むよりも 他の深さ固定モデルと比較して Shot数が増えるほど性能の収束に Closed➔Openのときの上がり幅が顕著. 再帰に適応するように学習が進行 より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 18
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 2026/8/30 第18回最先端NLP勉強会 19
潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 軌道を描くパターン 算術問題など難易度の高い 入力などに対して現れる
固定点に収束するパターン 最も多くのトークンで観測 他にもスライダーなど, 様々な幾何的構造が創発. ! 高次元の潜在空間を活用した推論形式の獲得を示唆 2026/8/30 第18回最先端NLP勉強会 20
まとめ ⚫ テスト時に計算量を増やす新しい方向性として, 深さ方向の再帰を提案 ⚫ 深さ方向の再帰の特性として 1. 深さ固定に対して特に推論を要するタスクで優位 2. 再帰ステップを増やすことで性能の引き上げが可能
3. 再帰は暗記能力より推論能力に寄与 ! 総じて, Test time scalingの新しい軸として有望 ⚫ CoTが行っているような, いわゆる “推論” が潜在空間で 行われているかは今後の課題. 2026/8/30 第18回最先端NLP勉強会 21
所感 ⚫ Test Time Scaling手法として深さ固定モデルwith CoT との比較で真に効率が良いのは…?が気になる. - 深さ固定との比較で, 深さ再帰は学習時におよそ10倍,
推論時は14倍 のFLOPsを消費. - 真に公平な比較は深さ固定モデル with CoTと, FLOPsやメモリなどの 条件を固定した上での性能比較…? ⚫ “暗記能力<推論能力” の性質はRAGなどの知識を外在 化する手法と相性良し…? ⚫ 潜在で考える= 何を考えているかわからない人 - 実用上, 安全性を担保するためにも潜在空間でどのような言語的な 情報処理が行われているかを明らかにしていくことが必要. 2026/8/30 第18回最先端NLP勉強会 22