Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Karkada さんの論文 × 2 の紹介: (1) Closed-Form Training...

Avatar for Sho Yokoi Sho Yokoi PRO
August 31, 2026

Karkada さんの論文 × 2 の紹介: (1) Closed-Form Training Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models, (2) Symmetry in language statistics shapes the geometry of model representations

第18回最先端NLP勉強会
https://sites.google.com/view/snlp-jp/home/2026

Avatar for Sho Yokoi

Sho Yokoi PRO

August 31, 2026

More Decks by Sho Yokoi

Other Decks in Research

Transcript

  1. D. Karkada さんの論⽂ × 2 の紹介 📄 Closed-Form Training Dynamics

    Reveal Learned Feature and Linear Structure in Word2Vec-like Models D. Karkada, J. B. Simon, Y. Bahri, M. R. DeWeese https://arxiv.org/abs/2502.09863 (NeurIPS 2025) 📄 Symmetry in language statistics shapes the geometry of model representations D. Karkada, D. J. Korchinski, A. Nava, M. Wyart, Y. Bahri https://arxiv.org/abs/2602.15029 (ICML 2026 spotlight) 🗣 読む⼈︓ 横井 祥 国⽴国語研究所・東北⼤学・理化学研究所・JST創発・ 📅 2026-08-31, 第18回最先端NLP勉強会 1
  2. ⾔語モデルの表現空間の幾何の話 私的・年間 best papers 1. word2vec の理論をまじめに再検討すると, 📄 Closed-Form Training

    Dynamics Reveal Learned Feature and Linear Structure in Word2Vec-like Models D. Karkada, J. B. Simon, Y. Bahri, M. R. DeWeese https://arxiv.org/abs/2502.09863 (NeurIPS 2025) 📄 Symmetry in language statistics shapes the geometry of model representations D. Karkada, D. J. Korchinski, A. Nava, M. Wyart, Y. Bahri https://arxiv.org/abs/2602.15029 (ICML 2026 spotlight) 2. ⾔語モデルの表現空間に不思議な曲線が現れる理由を数理的に記述できる 年号の埋め込みが蛇のように並ぶとか) 🗣 (※ 読む⼈︓ 横井 祥 国⽴国語研究所・東北⼤学・理化学研究所・JST創発・ 📅 2026-08-31, 第18回最先端NLP勉強会 2
  3. ニューラルネットに基づく表現学習・LMs ニューラルネットに基づく表現学習・LMsが実現していること︓ 意味・能⼒が分布・統計情報を介してモデルに転写される 意味の世界 コーパスの世界 モデルの世界 飼っている 飼っている 猫の写真を ⼦猫の写真

    を友達に送 を友達に送 ったところ … ったところ … 逆にモデルの内部を⾒れば,コーパス上の統計の観点で何が起 きているかを理解したり,⾔語の意味について議論できるかも 5
  4. ⾔語の表現空間の “理論的” な研究の ひとつのフレームワーク コーパスの世界 意味の世界 モデルの世界 飼っている ⾔語の表現空間について形式的に研究する際のひとつのフレームワーク︓ 飼っている

    猫の写真を ⼦猫の写真 を友達に送 以下の 意味 〜 統計 〜 幾何 の関係を使う を友達に送 ったところ … ったところ … ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ log 𝑝(𝑤, 𝑤′) − const. 𝑝 𝑤 𝑝(𝑤′) 内積 ≈ 𝒗 𝑤 !𝒗(𝑤′) 6
  5. ⾔語の表現空間の “理論的” な研究の ひとつのフレームワーク コーパスの世界 意味の世界 モデルの世界 飼っている ⾔語の表現空間について形式的に研究する際のひとつのフレームワーク︓ 飼っている

    猫の写真を ⼦猫の写真 を友達に送 以下の 意味 〜 統計 〜 幾何 の関係を使う を友達に送 ったところ … ったところ … ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ log 𝑝(𝑤, 𝑤′) − const. 𝑝 𝑤 𝑝(𝑤′) 📄 Church&Hanks ʼ89 etc.: 計算/⼼理⾔語学での経験的な知⾒ 内積 ≈ 𝒗 𝑤 !𝒗(𝑤′) 7
  6. ⾔語の表現空間の “理論的” な研究の ひとつのフレームワーク コーパスの世界 意味の世界 モデルの世界 飼っている ⾔語の表現空間について形式的に研究する際のひとつのフレームワーク︓ 飼っている

    猫の写真を ⼦猫の写真 を友達に送 以下の 意味 〜 統計 〜 幾何 の関係を使う を友達に送 ったところ … ったところ … 📄 Levy&Goldberg ʼ14: 静的な単語埋込が理想的な状況で持つ性質 ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ log 𝑝(𝑤, 𝑤′) − const. 𝑝 𝑤 𝑝(𝑤′) 📄 Church&Hanks ʼ89 etc.: 計算/⼼理⾔語学での経験的な知⾒ 内積 ≈ 𝒗 𝑤 !𝒗(𝑤′) 8
  7. ⾔語の表現空間の “理論的” な研究の ひとつのフレームワーク 単語ベクトルや⾔語モデルの表現空間について形式的な研究の多くは, コーパスの世界 モデルの世界 意味の世界 この 意味

    〜 統計 〜 幾何 の関係をスタート地点にしている. Q. なぜ加法性が成り⽴つのか,類推タスクが解けるのか 飼っている Q. ノルムにどういう情報が⼊っているのか 飼っている 猫の写真を ⼦猫の写真 Q. マルチモーダルモデルの成⽴の理由(プラトン表現仮説) を友達に送 を友達に送 ったところ ったところ2025年10⽉号 No.748 … 数理科学 cf. 📄 横井「⾔語の表現空間の形」, … 📄 Levy&Goldberg ʼ14: 静的な単語埋込が理想的な状況で持つ性質 ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ log 𝑝(𝑤, 𝑤′) − const. 𝑝 𝑤 𝑝(𝑤′) 📄 Church&Hanks ʼ89 etc.: 計算/⼼理⾔語学での経験的な知⾒ 内積 ≈ 𝒗 𝑤 !𝒗(𝑤′) 9
  8. ⼤幅に Karkada さんの仕事︓ 意味 〜 統計 〜 幾何 の接続を 精緻化

    ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ 𝑝(𝑤, 𝑤′) log − const. 𝑝 𝑤 𝑝(𝑤′) 内積 ≈ 𝒗 𝑤 !𝒗(𝑤′) 10
  9. ⼤幅に Karkada さんの仕事︓ 意味 〜 統計 〜 幾何 の接続を 精緻化

    📄 Karkada+ “Closed-Form Training Dynamics...” NeurIPS ʻ25 「PMI ~ 内積」が持つ複数の問題を解消する,より適切な関係式の提⽰ ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ 𝑝(𝑤, 𝑤′) log − const. 𝑝 𝑤 𝑝(𝑤′) 内積 ≠ 𝒗 𝑤 !𝒗(𝑤′) ⾃⼰相互情報量の2次近似 内積 𝑝 𝑤, 𝑤 " − 𝑝 𝑤 𝑝 𝑤 " 1 𝑝 𝑤, 𝑤 " + 𝑝 𝑤 𝑝 𝑤 " 2 ≈ 𝒗 𝑤 !𝒗(𝑤′) 11
  10. ⼤幅に Karkada さんの仕事︓ 意味 〜 統計 〜 幾何 の接続を 精緻化

    📄 Karkada+ “Closed-Form Training Dynamics...” NeurIPS ʻ25 「PMI ~ 内積」が持つ複数の問題を解消する,より適切な関係式の提⽰ ⾃⼰相互情報量 単語 𝑤 と 𝑤′ の 意味的連関の強さ ≈ 𝑝(𝑤, 𝑤′) log − const. 𝑝 𝑤 𝑝(𝑤′) 内積 ≠ 𝒗 𝑤 !𝒗(𝑤′) 意味的な距離 ⾃⼰相互情報量の2次近似 内積 𝐶(dist w, w " ) 𝑝 𝑤, 𝑤 " − 𝑝 𝑤 𝑝 𝑤 " 1 𝑝 𝑤, 𝑤 " + 𝑝 𝑤 𝑝 𝑤 " 2 ≈ 𝒗 𝑤 !𝒗(𝑤′) = 📄 Karkada+ “Symmetry in language statistics...” ICML ʼ26 意味と統計の関係も形式化 → LMs の表現空間で内の不思議な形状を説明 12
  11. ⼤幅に Karkada さんの仕事︓ 意味 〜 統計 〜 幾何 の接続を 精緻化

    📄 Karkada+ “Closed-Form Training Dynamics...” NeurIPS ʻ25 「PMI ~ 内積」が持つ複数の問題を解消する,より適切な関係式の提⽰ ⾃⼰相互情報量 内積 📝 ひとつひとつの研究もとても⾯⽩いのですが(このあと説明), 単語⾔語の表現空間の理論研究の基盤を⼤きくバージョンアップした 𝑤 と 𝑤′ の 𝑝(𝑤, 𝑤′) ! 𝒗(𝑤′) ≈ log − const. ≠ 𝒗 𝑤 意味的連関の強さ 𝑝 𝑤 𝑝(𝑤′) という点でも重要な研究群だと思っています 意味的な距離 ⾃⼰相互情報量の2次近似 内積 𝐶(dist w, w " ) 𝑝 𝑤, 𝑤 " − 𝑝 𝑤 𝑝 𝑤 " 1 𝑝 𝑤, 𝑤 " + 𝑝 𝑤 𝑝 𝑤 " 2 ≈ 𝒗 𝑤 !𝒗(𝑤′) = 📄 Karkada+ “Symmetry in language statistics...” ICML ʼ26 意味と統計の関係も形式化 → LMs の表現空間で内の不思議な形状を説明 13
  12. Word2vec の理論をまじめに再検討 PMI の2次近似 ~ 内積 という新しい/良いモデルを提案 📄 Closed-Form Training

    Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models Karkada et al., NeurIPS 2025 https://arxiv.org/abs/2502.09863 ※ 2本⽬ (📄 Symmetry in language statistics shapes the geometry of model representations) の Appendix B.2 でもう⼀歩精緻化 14
  13. SGNS の学習結果 (いわゆる word2vec) の Levy–Goldberg モデルとその問題 損失関数 SGNS (Skip-gram

    negative sampling) の損失関数 𝔼! "," ! log σ 𝒗 𝑤 , 𝒗 𝑤 $ 学習結果 − 𝑘 𝔼!"#$ ("$) log σ 𝒗 𝑤 , 𝒗 𝑤 $ 形式的にわかっている 実際に学習した word2vec 理想的な解 [Levy–Goldberg ʻ14] • 経験的に有⽤で, (1) 仮に ベクトルの次元が ⼗分⼤きく (d ≈ |V|), (2) 仮に 勾配法で⼤域最適解に 辿り着けるなら, しかも⾯⽩い性質を持つ • なぜ︖ 𝑝(𝑤, 𝑤′) log − const. = 𝒗 𝑤 !𝒗(𝑤′) 𝑝 𝑤 𝑝(𝑤′) 形式的にわかりたい ← を形式的に検討する為のモデル 15
  14. SGNS の学習結果 (いわゆる word2vec) の Levy–Goldberg モデルとその問題 SGNS (Skip-gram negative

    sampling) の損失関数 損失関数 𝔼! "," ! log σ 𝒗 𝑤 , 𝒗 𝑤 $ 学習結果 実際に学習した word2vec − 𝑘 𝔼!"#$ ("$) log σ 𝒗 𝑤 , 𝒗 𝑤 $ ≠ 理想的な解 [Levy–Goldberg ʻ14] • 経験的に有⽤で, ✘ 低ランクの場合 (d << |V|) の解はこうならない しかも⾯⽩い性質を持つ • なぜ︖理由1︓PMIの正負の発散 理由2︓単語ペアのサンプリング 重みを無視 ✘ 勾配法ではこの解に 辿り着かない [§5] 実際の学習結果と 全然違う (1) 仮に ベクトルの次元が ⼗分⼤きく (d ≈ |V|), (2) 仮に 勾配法で⼤域最適解に 辿り着けるなら, 𝑝(𝑤, 𝑤′) log − const. = 𝒗 𝑤 !𝒗(𝑤′) 𝑝 𝑤 𝑝(𝑤′) 16
  15. 提案︓SGNS の損失関数の良い近似を考える exp を原点中⼼に Taylor 展開 損失関数 • 近似1︓SGNS の損失関数の⼀般形

    (eq. 1) を4次近似 • 近似2︓ サンプリングのパラメータを↓で設定 [Settings 3.1] SGNS の⼯夫(⾼頻度語をサブサンプリ ング & 負例分布を ¾ 乗に)を参考に. 単語頻度分布を uniform に近づける. • 💡 → 損失関数を⾏列分解の良い形で表現できる (6) M*: PMI の2次近似 ✔ ⼆乗誤差, ✔ 単語ペア全体を 重みなし 和 → 解(学習結果)を closed-form で表現・議論できるように 17
  16. 提案︓SGNS の損失関数を4次 近似 → 学習結果 (word2vec) の むしろ良いモデル に 損失関数

    (6) 学習結果 • フルランクでの⼤域解 𝒗 𝑤 %𝒗 𝑤& & − 𝑝 𝑤 𝑝 𝑤& 𝑝 𝑤, 𝑤 ∗ = 𝑀',) ≔ 1 𝑝 𝑤, 𝑤 & + 𝑝 𝑤 𝑝 𝑤 & 2 • ✔ 低ランクな場合も解がこの形式になる [打ち切りSVD, Thm 1] − ✔ PMI もどき ∈ [-2, 2] は値が正負に発散しない − ✔ 単語ペアのサンプリング重みが考慮されている • ✔ 勾配法でもこの解に近づく [Result 3] • ✔ 経験的にも, word2vec (低ランクかつ勾配法) とこの モデルの学習結果が酷似 cf. Levy–Goldberg モデル 18
  17. 提案︓SGNS の損失関数を4次近似 → コーパスのどの信号が学習されるかがわかる 学習結果 • 学習の結果,コーパスのどの統計的な情報がモデルの幾何的 な情報に取り込まれるのかがわかる (7) •

    実際のword2vecも提案モデルも,Wikipediaから,⼈名⽅向 → 政治⽅向 → ⼟地⽅向 → … と統計的な信号を分離・抽出 Levy–Goldberg モデルは 20 信号が混ざってしまう
  18. 提案︓SGNS の損失関数を4次近似 → 学習の過程 (信号が取り込まれる順番) もわかる 学習結果 (7) 学習過程 先の順に(=PMIもどき⾏列の上位主成分から)学習が進む

    − [理論] 勾配法の離散ステップ Δt を 0 に⾶ばして学習を微分⽅程式で 表現 → 学習ダイナミクスを形式的に記述できる [Saxe+ʼ14] − [実験] 実際の word2vec の学習過程もこれに従う 第1主成分⽅向 (⼈名⽅向)が まず学習される 各軸の育ち具合 (特異値の⼤きさ) 学習ステップ 21
  19. 意味 と 統計量 の関係も形式化 → ⾔語モデルの 表現空間 に不思議な曲線 が現れる理由を数理的に記述できる 📄

    Symmetries in language statistics shape the geometry of model representations Karkada et al., ICML 2026 (spotlight) https://arxiv.org/abs/2602.15029 22
  20. 提案︓意味 〜 共起 に関する⼤胆な仮定 • 意味の距離を形式的に表現できそうな単語群が存在 ℤ+, − dist⽉(“December”, “February”)

    = 2 ⊆ℕ − dist 年(“1998”, “2026”) = 28 − dist 州(“Tokyo”, “Kyoto”) = ||(35.41, 139.41) – (35.00, 135.46)|| −90,90 × [−180,180] • コーパス上の共起は意味の距離を正定値カーネルで補正した 値になっているのでは︖ PMIの2次近似 23
  21. 提案︓意味 〜 共起 に関する⼤胆な仮定 なんと本当になっているっぽい (?!) 共起 … ⽔⾊︓実測値,ピンク︓理論値 意味の距離

    • コーパス上の共起は意味の距離を正定値カーネルで補正した 値になっているのでは︖ PMIの2次近似 24
  22. 意味の距離が定まっていれば, 表現空間の幾何的な構造を記述でき得る 例︓⽉の名前 意味の表現と距離︓ “January” ↔ 1, ... ∈ ℤ#$

    , L2 距離 → 意味の距離の⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ 巡回⾏列 → PMIの2次近似⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ 巡回⾏列 論⽂2の知⾒(共起が意味の距離 + カーネルで決まる)を使う → 表現ベクトル ∈ ℝ( の基底︓ 意味表現をフーリエ級数展開したもの 論⽂1の知⾒(基底が共起⾏列の主成分⽅向)を LLM に対して 使う → 表現ベクトルの集合の形状︓ 円が⾒える 25
  23. 意味の距離が定まっていれば, 表現空間の幾何的な構造を記述でき得る Q. 静的な単語埋め込み (共起,word type,対照損失,2層) の理論を 例︓⽉の名前 LMs (次単語予測,⽂脈付き,cross-entropy,多層)

    に適⽤できる︖ 意味の表現と距離︓ “January” ↔ 1, ... ∈ ℤ#$ , L2 距離 A.→ たぶん︕ 共起は LMs∈ が学習する主たる統計的信号になってそう 意味の距離の⾏列 ℝ 𝒱 ×|𝒱| ︓ 巡回⾏列 • LMs も低次の相関 (e.g. 共起) から学習する [Cagnetta&Wyartʼ24] → PMIの2次近似⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ 巡回⾏列 • 次単語予測も共起⾏列の⼀般化 (⾼階テンソル化) [1本⽬, Appendix D.3] 論⽂2の知⾒(共起が意味の距離 + カーネルで決まる)を使う • 実験ともよく⼀致 → 表現ベクトル ∈ ℝ( の基底︓ 意味表現をフーリエ級数展開したもの 論⽂1の知⾒(基底が共起⾏列の主成分⽅向)を LLM に対して 使う → 表現ベクトルの集合の形状︓ 円が⾒える 26
  24. 意味の距離が定まっていれば, 表現空間の幾何的な構造を記述でき得る 例︓年の名前 意味の表現と距離︓ “2011” ↔ 2011, ... ∈ ℕ

    → 意味の距離の⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ テプリッツ⾏列 → PMIの2次近似⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ テプリッツ⾏列 → 表現ベクトル ∈ ℝ( の基底︓ 意味表現の正弦波・余弦波が交互に → 表現ベクトルの集合の形状︓ リサージュ曲線が⾒える 27
  25. 意味の距離が定まっていれば, 表現空間の幾何的な構造を記述でき得る 例︓⽶国の州の名前 意味の表現と距離︓ “Ohio” ↔ (39.57, - 83.00), ...

    ∈ −90,90 × [−180,180] → 意味の距離の⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ 境界付きの距離⾏列に⾒える → PMIの2次近似⾏列 ∈ ℝ 𝒱 ×|𝒱| ︓ 境界付きの距離⾏列に⾒える → 表現ベクトル ∈ ℝ( の基底︓ “波⻑” 順に(東⻄ → 南北 → …) 28
  26. Karkada さんの論⽂を2本紹介,まとめ • 📄 Closed-Form Training Dynamics Reveal Learned Feature

    and Linear Structure in Word2Vec-like Models [NeurIPS ʻ25] − PMI ではなく PMI の2次近似 が 単語表現の内積 に対応 − 単語表現 が 共起⾏列 のどの信号をどの順で獲得しているかもわかる • 📄 Symmetry in language statistics shapes the geometry of model representations [ICML ʻ26 spotlight] − 共起 は 意味の距離 の関数になっている − 意味の距離 の構造 (周期性,境界条件) から 表現の形状 を記述できる • 意味 〜 統計 〜 幾何 の形式的理解のための基盤の精緻化 意味的な距離 ⾃⼰相互情報量の2次近似 内積 𝐶(dist w, w " ) 𝑝 𝑤, 𝑤 " − 𝑝 𝑤 𝑝 𝑤 " 1 𝑝 𝑤, 𝑤 " + 𝑝 𝑤 𝑝 𝑤 " 2 ≈ 𝒗 𝑤 !𝒗(𝑤′) = 30
  27. 感想・コメント • ものすごく⾯⽩かった − 数理,実験,⽂書,いずれの観点でも⾼い完成度 − [1本⽬] 多項式近似からこんなに遠くまで来れるなんて…… − [2本⽬]

    意味部分の形式化がとても⾯⽩い、偉い − 私的 best papers of the year • 今後 − 静的埋め込みと LMs の差分の解消︖なぜそのままで結構動く︖ – 静的埋め込み︓共起,word type,対照損失/均衡誤差,2層,…… – LMs︓次単語予測,⽂脈付き,cross-entropy/誤分類率,多層,…… − 2次近似の可解なやり⽅ と 情報幾何的なやり⽅ の差分・融合︖ – Karkada ら︓ ✔ 基底の記述,✔ 学習ダイナミクス,✔ ⼤域的な構造 – 情報幾何︓ ✔ 局所的な構造,これまでの知⾒は↑で置き換わる︖ − ⾔語的な分析も含め,⾔語モデルの理解が進むきっかけになりそう31