Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[SNLP2026] Scaling up Test-Time Compute with La...

Avatar for 池田航 池田航
August 20, 2026

[SNLP2026] Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

Avatar for 池田航

池田航

August 20, 2026

Other Decks in Research

Transcript

  1. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth

    Approach Jonas Geiping, Sean McLeish, Neel Jain, John Kirchenbauer, Siddharth Singh, Brian R. Bartoldson, Bhavya Kailkhura, Abhinav Bhatele, Tom Goldstein NeurIPS 2025 https://arxiv.org/abs/2502.05171 発表者: 池田 航 東北大学 M2 鈴木・赤間研究室 2026/08/30 第18回最先端NLP勉強会 2026/8/30 第18回最先端NLP勉強会 1
  2. 昨今のTest time Scaling ⚫ テスト時(推論時)に計算を追加投入して性能を 伸ばすアプローチ, Test time Scalingが注目される. ⚫

    テスト時に計算量を増やす方法として推論過程を 「言語化=外在化」させるものが主流. - OpenAI o1, Deepseek-r1, etc… cf. 人間: 脳内で非言語的な思考の後に発話. - 空間的思考, 物理的直感, (運動)計画, 抽象化, etc... 2026/8/30 第18回最先端NLP勉強会 2
  3. 推論過程の言語化の本質的な限界 ⚫ 推論過程を言語として外在化する方法の問題: 1. 長いCoTデモンストレーションの専用データが必要. 2. 長いコンテキスト長が必要. 3. 離散的かつ直列な言語による探索に縛られて 柔軟な探索や非言語的な推論が困難

    (より人間的な) 連続的な空間での潜在的な推論の実現 によって解消されうる…? 本研究では深さ再帰(Recurrent Depth)をアーキテクチャを導入. 深さ再帰(層数)のスケールによる潜在的な推論(Latent Reasoning) はTest time scalingの新しい軸となりうるか…? 2026/8/30 第18回最先端NLP勉強会 4
  4. 検証する深さ再帰型Transformer ⚫ モデルを構成するTransformer層を3ブロックに分割. ×r プレリュード 再帰ブロック コーダ 入力されたデータを 再帰的にブロックを適用し, 潜在空間から

    潜在空間に埋め込む. 潜在空間での推論を行う. 語彙空間に戻す. ⚫ 再帰ブロックの再帰ステップ数𝒓を設定することで テスト時に任意の層数/計算量にスケール可能. 2026/8/30 第18回最先端NLP勉強会 5
  5. 深さ再帰 vs 深さ固定の比較 ⚫ 3.5Bパラメータ8層の深さ固定モデル(標準), 深さ再帰モデル(提案)の事前学習後の下流タスク性能を比較. - 深さ再帰モデルはプレリュード, 再帰ブロック, コーダの層数が

    それぞれ(2, 4, 2)層 より難易度が高い・推論を要する 単純な事実の想起を測る タスクで特に再帰モデルが優位 タスクではあまり変わらない ! 深さ再帰は推論を要するタスクにおいて優位 2026/8/30 第18回最先端NLP勉強会 12
  6. 再帰ステップ数のスケールに対する性能推移 ⚫ 再帰ステップ数rを増やしたときの下流タスク性能の 推移を調べる. HellaSwagでは再帰ステップ数の HellaSwag 早い段階で性能が収束 GSM8K CoT (Flexible)

    GSM8K CoT (Strict) Humaneval Math・Code系タスクでは性能収束 にはより多くの再帰ステップが必要 ! 必要な再帰ステップ数はタスクの難易度に依存 2026/8/30 第18回最先端NLP勉強会 15
  7. 暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式

    vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 “Open-book”形式 =正解を含むを記述を与えた状態で回答 (※ Closed-bookはその逆) Shot数を変化させる 2026/8/30 第18回最先端NLP勉強会 16
  8. 暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. OpenbookQAのスコア比較 ARC-Challengeのスコア推移 “Closed-book”形式

    vs “Open-book”形式 shot数の再帰ステップ数への影響の比較 他の深さ固定モデルと比較して Closed➔Openのときの性能向上がより顕著. Shot数が増えるほど性能の収束に より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 17
  9. 暗記能力 vs 推論能力 ⚫ テスト時に与える例示数を変化させ, モデル内部の知識で回答する 場合とコンテキストから推論により回答する場合を比較. 各再帰ステップでの学習時の性能の推移 OpenbookQAのスコア比較 “Closed-book”形式

    vs “Open-book”形式 ARC-Challengeのスコア推移 再帰ステップ数が shot数の再帰ステップ数への影響の比較 大きい条件 ➔安定して性能向上 再帰ステップ数 が小さい条件 ➔ほとんど変化無し 静的なブロックに知識を埋め込むよりも 他の深さ固定モデルと比較して Shot数が増えるほど性能の収束に Closed➔Openのときの上がり幅が顕著. 再帰に適応するように学習が進行 より多くの再帰ステップ数が必要. ! 深さ再帰は暗記能力よりコンテキスト内の推論能力に寄与 2026/8/30 第18回最先端NLP勉強会 18
  10. 潜在空間で何が起きているか? ⚫ 各再帰ステップの潜在表現をPCAによって次元圧縮. - PCAの最初の6次元を2次元ずつ平面で可視化し, 3つの独立な2次元平面 で共通して見られるパターンを分析. 軌道を描くパターン 算術問題など難易度の高い 入力などに対して現れる

    固定点に収束するパターン 最も多くのトークンで観測 他にもスライダーなど, 様々な幾何的構造が創発. ! 高次元の潜在空間を活用した推論形式の獲得を示唆 2026/8/30 第18回最先端NLP勉強会 20
  11. まとめ ⚫ テスト時に計算量を増やす新しい方向性として, 深さ方向の再帰を提案 ⚫ 深さ方向の再帰の特性として 1. 深さ固定に対して特に推論を要するタスクで優位 2. 再帰ステップを増やすことで性能の引き上げが可能

    3. 再帰は暗記能力より推論能力に寄与 ! 総じて, Test time scalingの新しい軸として有望 ⚫ CoTが行っているような, いわゆる “推論” が潜在空間で 行われているかは今後の課題. 2026/8/30 第18回最先端NLP勉強会 21
  12. 所感 ⚫ Test Time Scaling手法として深さ固定モデルwith CoT との比較で真に効率が良いのは…?が気になる. - 深さ固定との比較で, 深さ再帰は学習時におよそ10倍,

    推論時は14倍 のFLOPsを消費. - 真に公平な比較は深さ固定モデル with CoTと, FLOPsやメモリなどの 条件を固定した上での性能比較…? ⚫ “暗記能力<推論能力” の性質はRAGなどの知識を外在 化する手法と相性良し…? ⚫ 潜在で考える= 何を考えているかわからない人 - 実用上, 安全性を担保するためにも潜在空間でどのような言語的な 情報処理が行われているかを明らかにしていくことが必要. 2026/8/30 第18回最先端NLP勉強会 22