Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
論文紹介: Understanding Epistemic Language with a L...
Search
Hisao Katsumi
August 20, 2026
Research
100
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
論文紹介: Understanding Epistemic Language with a Language-augmented Bayesian Theory of Mind
Hisao Katsumi
August 20, 2026
More Decks by Hisao Katsumi
See All by Hisao Katsumi
論文紹介: ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement
hisaokatsumi
0
220
Other Decks in Research
See All in Research
COMETAを用いたデータ民主化運動の歴史
sazimai
0
230
SOTAのさらに先へ:厳しい推論制約下での高性能モデルのPost-Training
analokmaus
0
1.5k
MIRU2026 チュートリアル講演2:三次元データ処理の動向
nnchiba
6
4.6k
2026年度 生成AI を活用した論文執筆ガイド/ワークショップ / 2026 Academic Year Guide to Writing Papers Using Generative AI - Workshop
ks91
PRO
0
220
RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent
satai
3
500
重要だけど測れていないもの:高齢者ケアの見えない課題
theoriatec2024
0
480
Google Cloud Next 2026 DM Recap Agentic Data Cloudを添えて / Google Cloud Next 2026 DM Recap
nnaka2992
0
120
Research Engineerという仕事 / Research Engineering: Bridging Research and Business
chck
1
280
Visual SLAM未来予測 / Future Prediction in Visual SLAM
koide3
1
940
HAKARI-Bench - 実運用視点での情報検索モデル評価ベンチマーク
hotchpotch
1
710
【ローカルAIに向き合う展示会vol.2】液体時間定数型モジュールを用いた オリジナルの双方向エンコーダーモデルNexteraBERT 推論速度向上検討並びにダウンストリーム評価
rikkabotan7
0
180
Data Visualization Tools in the Age of AI
flekschas
0
190
Featured
See All Featured
4 Signs Your Business is Dying
shpigford
187
23k
Scaling GitHub
holman
464
140k
Collaborative Software Design: How to facilitate domain modelling decisions
baasie
1
290
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Let's Do A Bunch of Simple Stuff to Make Websites Faster
chriscoyier
508
140k
Money Talks: Using Revenue to Get Sh*t Done
nikkihalliwell
0
480
16th Malabo Montpellier Forum Presentation
akademiya2063
PRO
0
360
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
230
23k
Designing for Performance
lara
611
70k
Claude Code のすすめ
schroneko
67
230k
Taking LLMs out of the black box: A practical guide to human-in-the-loop distillation
inesmontani
PRO
3
2.4k
How to Align SEO within the Product Triangle To Get Buy-In & Support - #RIMC
aleyda
2
1.8k
Transcript
第18回 最先端NLP勉強会 2026 論文紹介 Understanding Epistemic Language with a Language-augmented
Bayesian Theory of Mind Lance Ying, Tan Zhi-Xuan, Lionel Wong, Vikash Mansinghka1, Joshua B. Tenenbaum 発表者: 勝見久央(NTT株式会社 / 阪大 吉野研 D1) © NTT, Inc. 2026
メタ情報・概要 • タイトル:Understanding Epistemic Language with a Languageaugmented Bayesian Theory
of Mind • 著者:Lance Ying, Tan Zhi-Xuan, Lionel Wong, Vikash Mansinghka, ※ 制約付きデコーディングに昨日の最後の発表でも Joshua B. Tenenbaum 紹介されたSMCを使っている。 • 所属:MIT, Harvard University • 採択先:Transaction of ACL © NTT, Inc. 2026 1
信念の推定(前提) • 他者の認識を推定することは人間とエージェントのインタラクション を考えるうえで非常に重要なテーマとして研究されてきた。(≠ 語用論) • 例)対話システム・ユーザ状態推定 「明日の打ち合わせはいつもの 会議室ですよね?」 •
LLMの登場によりこの難しさは隠蔽されがち?(主観) © NTT, Inc. 2026 2
「彼は論文がアクセプトされるかもしれないと考えている。」 「彼は論文がアクセプトされるに違いないと考えている。」 → 使いわけを正確に言語モデルに教えられる? © NTT, Inc. 2025 3
Epistemic Statement(認識的文章) • 他者の持つ認識(Belief: 信念)を推測した文章のこと。 • 例)「吠えなかった犬」( Sherlock Holmes 「白銀号事件」
) › 深夜、競馬の有力馬「白銀号」が厩舎から人物Xによって盗み出された。 › 事件が起きた厩舎のすぐ前で、番犬として見張っていた犬がいた。 › 番犬はその夜は吠えなかった。 • 例1:「 『番犬は人物Xは知り合いであると確信 していた』と思う。」 • 例2:「 『番犬はもしかすると人物Xは知り合い かもしれないと考えていた』と思う。」 © NTT, Inc. 2026 4
Epistemic Statement(認識的文章) • 行動系列によって適切なepistemic statementが変化する? シーン1 シーン2 Epistemic Statement シーン1
シーン1 → シーン2 「アリスは雨が降るかもしれないと思っている。」 自然な表現であると感じる 自然な表現であると感じる 「アリスは雨が降るに違いないと思っている」 そこまでは言い切れない? 自然な表現であると感じる © NTT, Inc. 2026 5
「彼は論文がアクセプトされるかもしれないと考えている。」 「彼は論文がアクセプトされるに違いないと考えている。」 → 使いわけを正確に言語モデルに教えられる? 彼が実際にその時、どの程度の確信度を持っていたかを 遡って定量的に対応付けることは難しい。 © NTT, Inc. 2025
6
この論文のResearch Question: 「他者の行動を観測することで、 epistemics statement のもっともらしさは どのように変化するのか?」 © NTT, Inc.
2025 7
ToM: Theory of Mind • ToM: Theory of Mind(心の理論)によって、 「その時どう考えていたか?」を推定する事ができる。
• 観測した他者の行動などから、その人の信念を推測する能力 • LLMによるToMも注目されているが限界がある。 • [Shapira et al.,2024]:社会的な推論では表面的な手掛かりに引きづられやすい。 • [Kim et al.,2023] :複数人物・複数発話にわたるToMには限界が存在する。 • [Jin et al.,2023] :マルチモーダルなToMには限界が存在する。 © NTT, Inc. 2026 8
BToM: Bayesian Theory of Mind • ベイズ推定の枠組みで定量的に信念を推定するToM手法。 • 信念 𝑏
:アリスが考えている雨が降る確率 • 観測(行動) 𝑎:アリスが傘を持って出かける • 観測をもとに信念の事後確率を推定 › 事前確率𝑃(𝑎)、𝑃(𝑏) およびモデル(ポリシー)𝑃(𝑎|𝑏)をもとに算出可能 › 𝑃(𝑎|𝑏) : 確率𝑃(𝑏)で雨が降ると考えているとき確率𝑃(𝑎)で傘を持って出かける 𝑃 𝑏 𝑎) = 𝑃 𝑏 行動𝒂を見た後 © NTT, Inc. 2026 𝑃 𝑎 𝑏) × 𝑃(𝑎) 行動𝒂を見る前 • 「アリスがどの程度の確率で雨が降ると考え ているのか」は観測によって更新される。 (i.e., 事前確率 → 事後確率) • Belief Update(信念更新) 9
提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •
ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 10
提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •
ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 11
提案手法: LaBToM • ゲームとしてDKG (Doors, Keys, & Gems) [Xuan et
al., NeurIPS’20] を利用。 • プレイヤーはゴール𝑔 として指定された宝石を目指して行動する。 • 扉の向こうにある宝石には鍵が必要 • 鍵はいずれかの箱に隠されている • ゴール𝒈はプレイヤー以外は知らない • 20種類のマップ配置に対して それぞれ人手のプレイ軌跡を収集した。 © NTT, Inc. 2026 12
提案手法: LaBToM • プレイヤーの信念を含む下記をベイズ推定する。 • 𝑔: どの宝石を目指しているか • 𝑠𝑡 :
どの箱の中に鍵が入っているか • 𝒃𝒕 : プレイヤーはどの箱に鍵が入っていると考えているか • ベイズ推定によって事後確率を算出する。 • 𝑎𝑡 : 時刻𝑡における行動 • 𝑜𝑡 : 時刻𝑡における観測(プレイヤーとゲームの状態) • 注: 事後確率推定の対象は信念𝑏𝑡 だけではない。 𝑃 𝑔, 𝑠𝑡 , 𝑏𝑡 𝑎1:𝑡 , 𝑜0:𝑡 ) © NTT, Inc. 2026 13
信念分布の離散化とベイズ推定 • 一般的に信念は信念分布として定義される。 • 𝑏𝑡 : (𝑝1 , 𝑝2 ,
𝑝3 ) • 「『鍵は確率𝑝1 で箱1、確率𝑝2 で箱2、確率𝑝3 で箱3に入っている』と考えている。」 • LaBToMでは信念は定数𝑘で離散化する。 • 離散化の粒度𝑘は事前実験で決める。 • 例) 𝑏𝑡 = © NTT, Inc. 2026 1 2 , ,0 3 3 1 3 2 3 (𝑘 = 3): 「鍵は確率 で箱1に、確率 で箱2に入っている。」 14
信念分布の離散化とベイズ推定 • 離散化した信念を含む有限の仮説ℎ𝑖 に対する事後確率を推定する。 仮説 𝒉 目標 𝒈 鍵の場所 𝒔
信念 𝒃𝒕 ℎ𝑖 四角の宝石 箱1 1 2 , ,0 3 3 … … … … 𝐷𝑡 = (𝑎1:𝑡 , 𝑜0:𝑡 ) ℎ𝑖 = (𝑔𝑖 , 𝑠 𝑖 , 𝑏𝑡𝑖 ) 𝑃 ℎ𝑖 𝐷𝑡 ) = 時刻𝒕まで観測したときの プレイヤーの信念𝒉𝒊 の事後確率 © NTT, Inc. 2026 時刻𝒕 − 𝟏まで観測したときの プレイヤーの信念𝒉𝒊 の事後確率 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 𝑃(ℎ𝑖 |𝐷𝑡−1 ) σ𝑗 𝑃 𝑎𝑡 𝑏𝑡𝑗 , 𝑔 𝑗 𝑃(ℎ𝑗 |𝐷𝑡−1 ) → 事後確率を全仮説𝒉𝒊 ごとに 逐次的に求めることで算出 15
信念分布の離散化とベイズ推定 • プレイヤーは合理的に行動すると仮定すると事後確率は算出できる。 • 前の時刻の信念の事後確率 𝑃(ℎ𝑖 |𝐷𝑡−1 ) は求まっている 𝑃
ℎ𝑖 𝐷𝑡 ) = 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 𝑃(ℎ𝑖 |𝐷𝑡−1 ) σ𝑗 𝑃 𝑎𝑡 𝑏𝑡𝑗 , 𝑔 𝑗 𝑃(ℎ𝑗 |𝐷𝑡−1 ) • プレイヤーの戦略 𝑃(𝑎𝑡 |𝑏𝑡𝑖 , 𝑔𝑖 ) をボルツマン分布でモデル化する。 • 要は「鍵があると信じている箱まで最短距離を取る」戦略 exp{−𝛽𝑄𝑔𝑖 (𝑏𝑡𝑖 , 𝑎𝑡 )} 𝑃 𝑎𝑡 𝑏𝑡𝑖 , 𝑔𝑖 ) = σ ′ exp{−𝛽𝑄𝑔𝑖 (𝑏𝑡𝑖 , 𝑎′ )} 𝑎 © NTT, Inc. 2026 信念(= 鍵の位置)が𝒃𝒊𝒕 だと信じているとき、 行動𝒂𝒕 をとってゴール𝒈𝒊 に到達するまでの コスト(i.e., 距離) 16
信念分布の離散化とベイズ推定 • 鍵があると信じている場所 𝑏𝑖 が行動系列を観測することで変化する様子 © NTT, Inc. 2026 17
提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •
ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 18
ELoT: Epistemic Language of Though • Epistemic statement を中間表現(epistemic formula)として出力
させることで、低レベル表現(形式論理)に変換できる。 • Ablation Studyの結果では中間表現を介することで変換の成功率が大幅に向上 制約付きでコーディングで 中間表現に変換 ルールベースで低レベル 表現に変換 © NTT, Inc. 2026 19
ELoT: Epistemic Language of Though • 低レベル表現に対して発生確率をルールベースで割り当てる。 • 例)Pr(player, ∃𝑘,
key 𝑘 ∧ iscolor 𝑘, blue ∧ inside 𝑘, box3 ) > 0.95 (= 𝜃must ) • 「鍵が箱3の中にある確率が95%よりも大である。」ことを意味していると変換 • プレイヤーが信念として 「青い鍵が箱3のなかにある確率 が96%である」と考えていれば、 このepistemic statementは真 © NTT, Inc. 2026 事前実験によりチューニング 20
提案手法: LaBToM • LaBToM: Lanugage-augmented Bayesian Theory of Mind •
ゲームの状況をもとに人手や LLMで生成したプレイヤーの 信念に関するepistemic statement • 例)「プレイヤーは鍵が箱2に 入っているに違いないと考えている。」 双方を結びつける • 開始時や途中のプレイヤーの信念を ベイズ推定で算出 © NTT, Inc. 2026 21
Epistemic Statementの確からしさ • 「epistemic statementが真となる確率」をBToMで推定した信念 (仮説)の事後確率をもとに算出する。 このプレイヤーの行動を 見ると4割くらいの人間が この文章を正しいと 感じる?
• 例)The player thought that the key in the box 3. • Pr 𝑝𝑙𝑎𝑦𝑒𝑟, ∃𝑘, 𝑘𝑒𝑦 𝑘 ∧ 𝑖𝑠𝑐𝑜𝑙𝑜𝑟 𝑘, 𝑏𝑙𝑢𝑒 ∧ 𝑖𝑛𝑠𝑖𝑑𝑒 𝑘, 𝑏𝑜𝑥3 • 「鍵が箱3の中にある確率が95%よりも大」が真である事後確率は0.4(= 0.3 + 0.1) > 0.95 仮説 箱1に鍵が ある確率 箱2に鍵が ある確率 箱3に鍵が ある確率 事後確率 ℎ1𝑡 0.0 0.04 0.96 0.3 ℎ𝑡2 0.0 0.0 1.0 0.1 ℎ𝑡3 0.1 0.2 0.7 0.6 … © NTT, Inc. 2026 22
評価実験 1. ゲームを観察した被験者42名から20シナリオに対して計469の epistemic statementを収集した。 • ゲーム開始時、ゲーム中の各時刻𝑡でのepistemic statement 2. 各シナリオでルールベース&ランダムに5つの文章を選定した。
3. 選定された5つの文章を下記で評価した。 1. 被験者: 人手での7段階評価の100人平均 2. GPT4o: GPT4oで7段階評価 © NTT, Inc. 2026 23
評価実験 • LaBToMは人間の主観評価の結果と高い相関を示した。 • 一方で、GPT4oは人間の主観評価の結果と低い相関を示した。 • GPT4oには画像 + 人手テキストでの状況説明 +
残り4文の人間評価のFew-shot • 事前実験で一番結果の良かった入力特徴量だがそれでも全く上手くいかなかった。 © NTT, Inc. 2026 24
評価実験 • Current) S4: The player believes that the red
key must be in box 3. • • 𝑡 = 3 → 4 からbox 3に鍵が入っていないことは明らかだが、GPT-4oは𝑡 = 4までこの文章が正しいと勘違い Initial) S3: The player initially believed there might be a key in box 1. • 𝑡 = 2 → 3 でプレイヤーがbox 3狙いであることは明らかだが、GPT-4oは𝑡 = 3までこの文章が正しいと勘違い。 © NTT, Inc. 2026 25
評価結果 • Out-of-Context設定での評価結果から、実はLLMは行動を追いながら 信念を追跡することができていないことが明らかになった。 • 収集したepistemic statementに対して、マップは同じだが行動系列 だけが異なるepistemic statementを混ぜて評価 •
別の行動系列に対応するはずの epistemic statementを尤もらし いと評価してしまう。 • 行動系列よりも初期配置から 信念を推定していただけ? © NTT, Inc. 2026 26
この論文の面白さ • LaBToMは「他者の信念を表現する文章」と「推定した他者の信念」を グラウンディング(接地)していると解釈できる。 • 他者(プレイヤー)の信念を 推定する自然言語表現 グラウンディング • ベイズ推定によって定量化
した他者の信念 © NTT, Inc. 2026 27
この論文の面白さ • LaBToMは「他者の信念を表現する文章」と「推定した他者の信念」を グラウンディング(接地)していると解釈できる。 • 他者(プレイヤー)の信念を 推定する自然言語表現 特に、ゲーム中はプレイヤーは合理的 に動くはずなので、かなり正確に信念 をベイズ推定できる(面白い)
グラウンディング • ベイズ推定によって定量化 した他者の信念 © NTT, Inc. 2026 28
感想 • 他者の信念の言語的表現がグラウンディングされていない表現である ことに着眼し、それを視覚化したことなどは素直に面白いと思った。 • 一方で、他者の信念に対する言語的表現をLLMが上手く扱えないのは、 テキスト学習だけではグラウンディングできないからではなく、 LLMがアブダクションの能力が低いからでは?とも思った。 • 観測結果を見て原因の尤もらしい説明を考える
• Left→rightの生成に特化していることも原因? © NTT, Inc. 2026 29