Upgrade to Pro — share decks privately, control downloads, hide ads and more …

論文紹介: Understanding Epistemic Language with a L...

論文紹介: Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind

Avatar for Hisao Katsumi

Hisao Katsumi

August 20, 2026

More Decks by Hisao Katsumi

Other Decks in Research

Transcript

  1. 第18回 最先端NLP勉強会 2026 論文紹介 Understanding Epistemic Language with a Language-augmented

    Bayesian Theory of Mind Lance Ying, Tan Zhi-Xuan, Lionel Wong, Vikash Mansinghka1, Joshua B. Tenenbaum 発表者: 勝見久央(NTT株式会社 / 阪大 吉野研 D1) © NTT, Inc. 2026
  2. メタ情報・概要 • タイトル:Understanding Epistemic Language with a Languageaugmented Bayesian Theory

    of Mind • 著者:Lance Ying, Tan Zhi-Xuan, Lionel Wong, Vikash Mansinghka, ※ 制約付きデコーディングに昨日の最後の発表でも Joshua B. Tenenbaum 紹介されたSMCを使っている。 • 所属:MIT, Harvard University • 採択先:Transaction of ACL © NTT, Inc. 2026 1
  3. Epistemic Statement(認識的文章) • 他者の持つ認識(Belief: 信念)を推測した文章のこと。 • 例)「吠えなかった犬」( Sherlock Holmes 「白銀号事件」

    ) › 深夜、競馬の有力馬「白銀号」が厩舎から人物Xによって盗み出された。 › 事件が起きた厩舎のすぐ前で、番犬として見張っていた犬がいた。 › 番犬はその夜は吠えなかった。 • 例1:「 『番犬は人物Xは知り合いであると確信 していた』と思う。」 • 例2:「 『番犬はもしかすると人物Xは知り合い かもしれないと考えていた』と思う。」 © NTT, Inc. 2026 4
  4. Epistemic Statement(認識的文章) • 行動系列によって適切なepistemic statementが変化する? シーン1 シーン2 Epistemic Statement シーン1

    シーン1 → シーン2 「アリスは雨が降るかもしれないと思っている。」 自然な表現であると感じる 自然な表現であると感じる 「アリスは雨が降るに違いないと思っている」 そこまでは言い切れない? 自然な表現であると感じる © NTT, Inc. 2026 5
  5. ToM: Theory of Mind • ToM: Theory of Mind(心の理論)によって、 「その時どう考えていたか?」を推定する事ができる。

    • 観測した他者の行動などから、その人の信念を推測する能力 • LLMによるToMも注目されているが限界がある。 • [Shapira et al.,2024]:社会的な推論では表面的な手掛かりに引きづられやすい。 • [Kim et al.,2023] :複数人物・複数発話にわたるToMには限界が存在する。 • [Jin et al.,2023] :マルチモーダルなToMには限界が存在する。 © NTT, Inc. 2026 8
  6. BToM: Bayesian Theory of Mind • ベイズ推定の枠組みで定量的に信念を推定するToM手法。 • 信念 𝑏

    :アリスが考えている雨が降る確率 • 観測(行動) 𝑎:アリスが傘を持って出かける • 観測をもとに信念の事後確率を推定 › 事前確率𝑃(𝑎)、𝑃(𝑏) およびモデル(ポリシー)𝑃(𝑎|𝑏)をもとに算出可能 › 𝑃(𝑎|𝑏) : 確率𝑃(𝑏)で雨が降ると考えているとき確率𝑃(𝑎)で傘を持って出かける 𝑃 𝑏 𝑎) = 𝑃 𝑏 行動𝒂を見た後 © NTT, Inc. 2026 𝑃 𝑎 𝑏) × 𝑃(𝑎) 行動𝒂を見る前 • 「アリスがどの程度の確率で雨が降ると考え ているのか」は観測によって更新される。 (i.e., 事前確率 → 事後確率) • Belief Update(信念更新) 9
  7. 提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •

    ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 10
  8. 提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •

    ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 11
  9. 提案手法: LaBToM • ゲームとしてDKG (Doors, Keys, & Gems) [Xuan et

    al., NeurIPS’20] を利用。 • プレイヤーはゴール𝑔 として指定された宝石を目指して行動する。 • 扉の向こうにある宝石には鍵が必要 • 鍵はいずれかの箱に隠されている • ゴール𝒈はプレイヤー以外は知らない • 20種類のマップ配置に対して それぞれ人手のプレイ軌跡を収集した。 © NTT, Inc. 2026 12
  10. 提案手法: LaBToM • プレイヤーの信念を含む下記をベイズ推定する。 • 𝑔: どの宝石を目指しているか • 𝑠𝑡 :

    どの箱の中に鍵が入っているか • 𝒃𝒕 : プレイヤーはどの箱に鍵が入っていると考えているか • ベイズ推定によって事後確率を算出する。 • 𝑎𝑡 : 時刻𝑡における行動 • 𝑜𝑡 : 時刻𝑡における観測(プレイヤーとゲームの状態) • 注: 事後確率推定の対象は信念𝑏𝑡 だけではない。 𝑃 𝑔, 𝑠𝑡 , 𝑏𝑡 𝑎1:𝑡 , 𝑜0:𝑡 ) © NTT, Inc. 2026 13
  11. 信念分布の離散化とベイズ推定 • 一般的に信念は信念分布として定義される。 • 𝑏𝑡 : (𝑝1 , 𝑝2 ,

    𝑝3 ) • 「『鍵は確率𝑝1 で箱1、確率𝑝2 で箱2、確率𝑝3 で箱3に入っている』と考えている。」 • LaBToMでは信念は定数𝑘で離散化する。 • 離散化の粒度𝑘は事前実験で決める。 • 例) 𝑏𝑡 = © NTT, Inc. 2026 1 2 , ,0 3 3 1 3 2 3 (𝑘 = 3): 「鍵は確率 で箱1に、確率 で箱2に入っている。」 14
  12. 信念分布の離散化とベイズ推定 • 離散化した信念を含む有限の仮説ℎ𝑖 に対する事後確率を推定する。 仮説 𝒉 目標 𝒈 鍵の場所 𝒔

    信念 𝒃𝒕 ℎ𝑖 四角の宝石 箱1 1 2 , ,0 3 3 … … … … 𝐷𝑡 = (𝑎1:𝑡 , 𝑜0:𝑡 ) ℎ𝑖 = (𝑔𝑖 , 𝑠 𝑖 , 𝑏𝑡𝑖 ) 𝑃 ℎ𝑖 𝐷𝑡 ) = 時刻𝒕まで観測したときの プレイヤーの信念𝒉𝒊 の事後確率 © NTT, Inc. 2026 時刻𝒕 − 𝟏まで観測したときの プレイヤーの信念𝒉𝒊 の事後確率 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 𝑃(ℎ𝑖 |𝐷𝑡−1 ) σ𝑗 𝑃 𝑎𝑡 𝑏𝑡𝑗 , 𝑔 𝑗 𝑃(ℎ𝑗 |𝐷𝑡−1 ) → 事後確率を全仮説𝒉𝒊 ごとに 逐次的に求めることで算出 15
  13. 信念分布の離散化とベイズ推定 • プレイヤーは合理的に行動すると仮定すると事後確率は算出できる。 • 前の時刻の信念の事後確率 𝑃(ℎ𝑖 |𝐷𝑡−1 ) は求まっている 𝑃

    ℎ𝑖 𝐷𝑡 ) = 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 𝑃(ℎ𝑖 |𝐷𝑡−1 ) σ𝑗 𝑃 𝑎𝑡 𝑏𝑡𝑗 , 𝑔 𝑗 𝑃(ℎ𝑗 |𝐷𝑡−1 ) • プレイヤーの戦略 𝑃(𝑎𝑡 |𝑏𝑡𝑖 , 𝑔𝑖 ) をボルツマン分布でモデル化する。 • 要は「鍵があると信じている箱まで最短距離を取る」戦略 exp{−𝛽𝑄෠𝑔𝑖 (𝑏𝑡𝑖 , 𝑎𝑡 )} 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 ) = σ ′ exp{−𝛽𝑄෠𝑔𝑖 (𝑏𝑡𝑖 , 𝑎′ )} 𝑎 © NTT, Inc. 2026 信念(= 鍵の位置)が𝒃𝒊𝒕 だと信じているとき、 行動𝒂𝒕 をとってゴール𝒈𝒊 に到達するまでの コスト(i.e., 距離) 16
  14. 提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •

    ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 18
  15. ELoT: Epistemic Language of Though • Epistemic statement を中間表現(epistemic formula)として出力

    させることで、低レベル表現(形式論理)に変換できる。 • Ablation Studyの結果では中間表現を介することで変換の成功率が大幅に向上 制約付きでコーディングで 中間表現に変換 ルールベースで低レベル 表現に変換 © NTT, Inc. 2026 19
  16. ELoT: Epistemic Language of Though • 低レベル表現に対して発生確率をルールベースで割り当てる。 • 例)Pr(player, ∃𝑘,

    key 𝑘 ∧ iscolor 𝑘, blue ∧ inside 𝑘, box3 ) > 0.95 (= 𝜃must ) • 「鍵が箱3の中にある確率が95%よりも大である。」ことを意味していると変換 • プレイヤーが信念として 「青い鍵が箱3のなかにある確率 が96%である」と考えていれば、 このepistemic statementは真 © NTT, Inc. 2026 事前実験によりチューニング 20
  17. 提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •

    ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 21
  18. Epistemic Statementの確からしさ • 「epistemic statementが真となる確率」をBToMで推定した信念 (仮説)の事後確率をもとに算出する。 このプレイヤーの行動を 見ると4割くらいの人間が この文章を正しいと 感じる?

    • 例)The player thought that the key in the box 3. • Pr 𝑝𝑙𝑎𝑦𝑒𝑟, ∃𝑘, 𝑘𝑒𝑦 𝑘 ∧ 𝑖𝑠𝑐𝑜𝑙𝑜𝑟 𝑘, 𝑏𝑙𝑢𝑒 ∧ 𝑖𝑛𝑠𝑖𝑑𝑒 𝑘, 𝑏𝑜𝑥3 • 「鍵が箱3の中にある確率が95%よりも大」が真である事後確率は0.4(= 0.3 + 0.1) > 0.95 仮説 箱1に鍵が ある確率 箱2に鍵が ある確率 箱3に鍵が ある確率 事後確率 ℎ1𝑡 0.0 0.04 0.96 0.3 ℎ𝑡2 0.0 0.0 1.0 0.1 ℎ𝑡3 0.1 0.2 0.7 0.6 … © NTT, Inc. 2026 22
  19. 評価実験 • LaBToMは人間の主観評価の結果と高い相関を示した。 • 一方で、GPT4oは人間の主観評価の結果と低い相関を示した。 • GPT4oには画像 + 人手テキストでの状況説明 +

    残り4文の人間評価のFew-shot • 事前実験で一番結果の良かった入力特徴量だがそれでも全く上手くいかなかった。 © NTT, Inc. 2026 24
  20. 評価実験 • Current) S4: The player believes that the red

    key must be in box 3. • • 𝑡 = 3 → 4 からbox 3に鍵が入っていないことは明らかだが、GPT-4oは𝑡 = 4までこの文章が正しいと勘違い Initial) S3: The player initially believed there might be a key in box 1. • 𝑡 = 2 → 3 でプレイヤーがbox 3狙いであることは明らかだが、GPT-4oは𝑡 = 3までこの文章が正しいと勘違い。 © NTT, Inc. 2026 25