Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
SNLP2026 中石 発表スライド(Deriving Neural Scaling Laws...
Search
Kai Nakaishi
August 15, 2026
140
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
SNLP2026 中石 発表スライド(Deriving Neural Scaling Laws from the Statistics of Natural Language)
Kai Nakaishi
August 15, 2026
More Decks by Kai Nakaishi
See All by Kai Nakaishi
SNLP2025 中石 発表スライド (Physics of Language Models: Part 3.3)
kai1997
0
230
Featured
See All Featured
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2k
Max Prin - Stacking Signals: How International SEO Comes Together (And Falls Apart)
techseoconnect
PRO
0
430
Crafting Experiences
bethany
1
270
Fashionably flexible responsive web design (full day workshop)
malarkey
408
67k
Exploring anti-patterns in Rails
aemeredith
3
490
The State of eCommerce SEO: How to Win in Today's Products SERPs - #SEOweek
aleyda
2
11k
The SEO Collaboration Effect
kristinabergwall1
1
550
Beyond borders and beyond the search box: How to win the global "messy middle" with AI-driven SEO
davidcarrasco
3
230
Unlocking the hidden potential of vector embeddings in international SEO
frankvandijk
0
910
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
550
Build The Right Thing And Hit Your Dates
maggiecrowley
39
3.4k
Transcript
Deriving Neural Scaling Laws from the Statistics of Natural Language
F. Cagnetta, A. Raventos, S. Ganguli & M. Wyart (ICML 2026 poster) 第 18 回 最先端 NLP 勉強会 発表者:中石 海(理化学研究所,国立国語研究所) 2026 年 8 月 31 日
TL;DR ▶ ニューラルスケーリング則: LLM の損失 LAR はデータ量 P について冪関数的に減衰 LAR
∼ P −α (1) ▶ 指数 α を,自然言語のふたつの統計量の指数のみから決定する式を導出 1/21
発表の構成 ▶ 論文の内容 ▶ ニューラルスケーリング則の導出 ▶ n-グラム損失のコラプス ▶ Limitations ▶
背景:統計物理学におけるスケーリング理論 ▶ 発表者による雑感 2/21
ニューラルスケーリング則の導出 3/21
損失 ▶ n グラム損失(n-gram loss) : 過去 n 個のトークンのみを条件として次トークンを予測するときの損失 Ln
= − def E xn+1 |x1:n [log p̂(xn+1 |x1:n )] (2) ▶ 自己回帰損失(auto-regressive loss) : 文脈(長さ T )上の全てのトークンについての損失の和 1 ∑ Ln def T n=1 T LAR = (3) この損失がデータ量 P についてどう減衰するかを予言したい 4/21
損失の理論的最小値:条件付きエントロピー ▶ n-グラム損失は,モデル分布 p̂ が真の分布 p に一致するとき最小値をとる Hn = −
def E xn+1 |x1:n [log p(xn+1 |x1:n )] (4) ▶ n トークンで条件つけられた次トークンの条件付きエントロピー ▶ モデルに依存しない,データの統計的性質 5/21
余剰損失 ▶ 余剰損失(excess loss) :損失と理論的最小値の差 En = (Ln − Ln−1
) − (Hn − Hn−1 ) def (5) 6/21
Key idea:予測時間限界 ▶ トークン間の相関は,距離 n が大きくなるほど小さくなる ▶ データ量 P が有限のとき,ある距離
n∗ を超えると, 相関はノイズに埋もれてしまう ▶ n∗ より遠くの過去からは情報を得られず,学習できない (予測時間限界 prediction time horizon) ▶ よって,参照するトークン数 n を n∗ より増やしても,損失は減らない L n ≈ L n∗ for n ≥ n∗ (6) 7/21
損失の分解 ▶ n ≥ n∗ で Ln ≈ Ln∗ であることを用いると,
文脈長が予測時間限界より十分大きい(T ≫ n∗ )とき, n∗ −1 T − (n∗ − 1) 1 ∑ LAR ≈ L n∗ Ln + T n=1 T (7) ∗ ≍ Hn ∗ + n ∑ En (8) n=1 ▶ 右辺第 1 項: 予測時間限界の範囲内の情報を使って達成可能な損失の最小値 ▶ 右辺第 2 項: 予測時間限界の範囲内の構造を学習し切れていないことによる余剰の損失 ▶ 相関が見えさえすれば,その範囲内の構造は速やかに学習できるとして, 第 2 項は第 1 項と同じくらい速く減衰すると仮定すると LAR ≍ Hn∗ (9) この領域を予測限界支配領域(horizontal-limited regime)と呼ぶ (妥当性は後で検証) 8/21
損失のデータ量依存性 ▶ 予測限界支配領域では LAR ≈ Hn∗ (10) ▶ 以下がわかれば,自己回帰損失 LAR
のデータ量 P への依存性がわかる: ▶ 条件付きエントロピー Hn の n 依存性 ▶ 予測時間限界 n∗ のデータ量 P 依存性 ▶ どちらも,データの統計的性質のみで決まる! 9/21
条件付きエントロピー Hn の n 依存性 ▶ 様々なモデルで条件付きエントロピー Hn を推定 Figure
▶ モデルによらず,条件付きエントロピー Hn は n について冪関数的に減衰 Hn ≍ n−γ (11) 10/21
予測時間限界 n∗ のデータ量依存性 ▶ 距離 n のトークン間の相関(共分散行列のノルム)∥C(n)∥ を測定 Figure ▶
∥C(n)∥ は n について冪関数的に減衰 ∥C(n)∥ ≍ n−β (12) ▶ サイズ P のデータで相関を推定するとき,ノイズは ≍ P −1/2 で減衰 ▶ 予測時間限界 n∗ はデータ量 P について冪関数的に増大 n∗ ≍ P 1/(2β) (13) 11/21
ニューラルスケーリング則の導出 ▶ 以上をまとめると, LAR ≍ Hn∗ ≍ (n∗ )−γ ≍
(P 1/(2β) )−γ = P −γ/(2β) (14) ▶ データから β と γ を推定すれば, ニューラルスケーリング則の指数 α = γ/(2β) を予言できる ▶ 実験との整合性 Figure ▶ (データ量 P が増えて予測時間限界が文脈長に近づく(n∗ ≈ T )と, 理論から外れる) 12/21
n-グラム損失のコラプス 13/21
n-グラム損失のコラプス ▶ n-グラム損失 Ln はデータ量 P に依存 ▶ Ln が理論的最小値
Hn にどれだけ近づくかは, 実際のデータ量 P が予測時間限界が n を超えるためのデータ量 P ∗ (n) に どれだけ近づくかで決まるはず ▶ 本質的なのは,Ln /Hn ≍ nγ Ln の P/P ∗ (n) ≍ P/n2β 依存性 nγ Ln = ln (P/n2β ) (15) ▶ ln を様々な n についてプロットすると,同じ曲線にコラプス(collapse) Figure ▶ つまり,n によらず ln = l 14/21
予測限界支配領域の条件 ▶ l(x) = const. + x−δ と仮定する δ が大きいほど学習が速い(Ln
が理論的最小値 Hn に速く近づく) (良い近似としてというより,収束の速さを大雑把に評価するため) ▶ このとき,余剰損失の寄与は −δ if δ < γ/(2β), n∗ P ∑ En ≍ P −δ log P if δ = γ/(2β), (16) −γ/(2β) n=1 P if δ > γ/(2β) ▶ δ > γ/(2β) のとき,予測時間限界の寄与 Hn∗ と同じだけ速く減衰する (予測限界支配領域) ▶ 実験的に δ を推定すると,この条件は満たされている ▶ δ はモデルに依存する量 ▶ 条件 δ > γ/(2β) が満たされるかどうかはモデル依存 ▶ 条件を満たすモデルは,予測時間限界の範囲内の構造を速やかに学習できる ▶ トランスフォーマーはそういうモデルらしい 15/21
Limitations 16/21
Limitations ▶ 予測時間限界 n∗ が文脈長 T より十分短いこと(n∗ ≪ T )を仮定
データ量 P が増えて n∗ が T に近づく領域には適用できない ▶ 訓練データのサイズ Pmax が小さい ▶ n∗ は ∼ 10 程度 ▶ 文より大きい構造が効いてくるとどうなるか? ▶ 文脈長 T が小さい ▶ 現代的なモデルでは T ≳ 105 ▶ 「予測時間限界の範囲内はすぐ学習できる」は成り立つか? 17/21
背景:統計物理学におけるスケーリング理論 18/21
統計物理学におけるスケーリング理論 ▶ 相転移:あるパラメータ点で系の性質が質的に変化する現象 ▶ (二次)転移点近傍では ▶ 様々な統計量が冪関数的に振る舞う ▶ 統計量の振る舞いが,ある特徴的スケールとの比で支配される →
統計量をうまく再スケールすると,コラプスする ▶ これらを説明するのがスケーリング理論 ▶ 最終著者 Wyart はこの分野の第一人者 19/21
発表者による雑感 20/21
発表者による雑感 ▶ 着想は(おそらく) ▶ 「ニューラルスケーリング則をスケーリング理論で説明できるのでは」 ▶ 「ニューラルスケーリング則はデータ側の冪則に由来するのでは」 ▶ 実際どうやったらいいかはめちゃくちゃ非自明 ▶
この論文は,相当うまくそれを達成している ▶ 議論の核は 1. LLM は,相関が見えさえすればすぐに構造を学習する (だからこそ,学習はデータ側の統計的性質に支配される) 2. 自然言語の統計量は冪関数的に振る舞う ▶ 1 と 2 それぞれがなぜ成り立つのかは不思議なまま 21/21
Thank you for your attention!