Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Fluent but Unfeeling_ The Emotional Blind Spots...
Search
Wataru Hirota
August 13, 2026
Research
52
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Fluent but Unfeeling_ The Emotional Blind Spots of Language Models (2026/8/20 ウェブ・ソーシャルメディア読み会)
Wataru Hirota
August 13, 2026
More Decks by Wataru Hirota
See All by Wataru Hirota
(2022-05-28 Machine Learning 15Minutes!) 日本語ニュース分類から見る多言語モデル
tarohi24
0
99
The future of data system
tarohi24
0
97
Serializability and Snapshot Isolation.pdf
tarohi24
0
250
Entity Set Search of Scientific Literature: An unsupervised Ranking Approach
tarohi24
0
110
Other Decks in Research
See All in Research
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
710
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
610
[最先端NLP勉強会2026] Checklists Are Better Than Reward Models For Aligning Language Models
nzw0301
1
130
[BlackHatAsia2026] Hidden Telemetry: Uncovering TraceLogging ETW Providers You're Not Using (Yet)
asuna_jp
1
650
【Zozo Research 技術共有会】三次元領域の現在と展望
mickey_0226
3
560
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
500
SLAMはどこまで解決されたのか?
tomonom
0
1.1k
第64回CV・PRML勉強会 論文紹介:Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignment
sokikatayama
0
160
進学校の生徒にはア行の苗字が多いのか
ozekinote
0
530
Cross-Media Information Spaces and Architectures
signer
PRO
0
330
Google Cloud Next 2026 DM Recap Agentic Data Cloudを添えて / Google Cloud Next 2026 DM Recap
nnaka2992
0
110
nlp2026 In-Context Learningに基づく経路案内のための地理的知識の活用方法に関する検討
takashiinui
0
130
Featured
See All Featured
Dealing with People You Can't Stand - Big Design 2015
cassininazir
367
27k
AI: The stuff that nobody shows you
jnunemaker
PRO
9
930
The Pragmatic Product Professional
lauravandoore
37
7.4k
Let's Do A Bunch of Simple Stuff to Make Websites Faster
chriscoyier
508
140k
Building AI with AI
inesmontani
PRO
1
1.1k
Color Theory Basics | Prateek | Gurzu
gurzu
0
430
Documentation Writing (for coders)
carmenintech
77
5.5k
職位にかかわらず全員がリーダーシップを発揮するチーム作り / Building a team where everyone can demonstrate leadership regardless of position
madoxten
64
56k
Utilizing Notion as your number one productivity tool
mfonobong
4
550
GraphQLとの向き合い方2022年版
quramy
50
15k
The AI Revolution Will Not Be Monopolized: How open-source beats economies of scale, even for LLMs
inesmontani
PRO
3
3.7k
How to Ace a Technical Interview
jacobian
281
24k
Transcript
Fluent but Unfeeling: The Emotional Blind Spots of Language Models
著者: Bangzhao Shu, Isha Joshi, Melissa Karnaze, Anh C. Pham, Ishita Kakkar, Sindhu Kothe, Arpine Hovasapian, Mai ElSherief. (Northeastern University, UC San Diego, UMass) 読み⼿: 広⽥航 (ストックマーク株式会社)
はじめに: この論⽂の3⾏まとめ 研究のモチベーション 「LLM は⼈間の感情を正しく予測出来るか?」という問を検証。既 存の同様のベンチマークは感情カテゴリの推定問題 (悲しい‧嬉しい‧etc..) を扱っている が、もっと細かい粒度で LLM
の能⼒を知りたい。また、第三者のアノテーションではな く、その⼈⾃⾝が感じた (self-disclosed) 感情と⽐較してベンチマークしたい。 検証⽅法 感情推定を Masked Token Prediction 問題として定式化。その⼈が書いた感情を 表す トークン の部分をマスクし、その単語が当てられるか?を検証。 結果 2種類の結果が得られた。(1) どのモデルも masked token の特定精度は低い (2) 第三者に LLM と⼈の token をそれぞれ⾒せると、LLM の予測した単語の⽅がより⽂脈に 適した単語だという結果に
タスク: Masked Token Prediction
単語の⼀致に加え、より広い意味 (感情ベクトル) での⼀致も計測 プルチックの感情の輪に出る8種類の basic emontion とポジネガの2つ、合計10次 元で単語を表現。その単語がその basic emotion
(またはポジネガ) に関連してた ら 1 、そうでなければ 0 の2値表現 ベクトルのデータは EmoLex (Mohammad and Turney 2013) を使⽤。 EmoLex にない単語は Mechanical Turk でアノテーション
データセット EXPRESS これまでが⾔語モデルが感情を正しく認識しているか?について数多くの研究が⾏われてき た、いくつか限界があった - 多くのデータセット正解ラベルを第三者 (クラウドワーカー) などが付けており、⾃⼰ 開⽰ではない (後で出てくるが、⾃⼰開⽰か他者アノテーションかは結構重要)
多くの研究は⼤雑把な感情カテゴリ (喜び‧悲しみなど) への分類問題として定式化し ており、細かなニュアンスを捉えきれていない 対象となる⽂が短く、コンテキストがあまりない 本論⽂はこれらの制約を補うデータセット EXPRESS を提案し、 Masked Token Prediction の性能評価を実施
データセットの構築⽅法 データソース Reddit を使用 (著者らがクロール)。Berkeley Well-being list (Davis 2024) に含ま
れる感情語(emotion word) が1つ以上含まれる post を収集。 Emotion Masking self-disclosure emotion を抽出するために以下のパターンマッチを行う。評 価時は <emotion> の部分がマスクされる。 I + (feel / am) + <emotion> もしくは (no-pronoun) + feeling + <emotion> 統計値 合計 33,697 post を収録 (subreddit 数は 6,930)。機関: 2009/06 - 2024/04。 <emotion> の種類は 251 種類で、合計 52,632 個の <emotion> を収録。
実験1: masked emotion word を正しく特定できるか? 使用するモデル Masked LM (RoBERTa-base, Longformer),
Seq2Seq (Flan-T5), Causal LM (Llama 3.1, Gemma-2, GPT 3.5-Turbo / 4o) ※ 全体的にちょっと古い プロンプト手法 Zero-shot, Few-shot, Chain-of-Thought. (Masked LM は Zero-shot のみ)。 Few-shot はランダムに例を選択 (random) ともっとも近い事例を選択 (nearest) の2通り。CoT は “Think step by step” という文言をプロンプトにに追加 (注: 近年の LLM がネイティブサポートしてい るような <think> .. </think> とは別物)
結果。どの LM にとっても難しい ※ AccL .. 単語の⼀致, AccV .. ベクトルの⼀致,
F1V .. ベクトルの 各 dim の prec/recall から計算 → つまり右にいくほど粗い⼀致率
観点1: Few-shot ◎、CoT △ Zero-shot より精度向上 (特に nearest) CoT はイマイチ
観点2: 4o が全体的に優れている
⼈間とモデルは感情語の語彙が異なる ⼈間は happy, sad のような単語を, LLM は grateful や frustrated
のような単語を使う LLM 同⼠だと語彙の傾向が似ているのも興味深い
GPT-4o の結果は⼈も区別できない ⾃⼰開⽰の感情語と GPT-4o の予測が異なる 213個の post をサンプルし、(1) LLM の出⼒
(2) 実際の Reddit の単語 2つを出⾃を伏せて⾒せ、「ここに⼊る単語としてどちらが適切 か?(A, B, BOTH, NEITHER) 」を選択。テスターは3名の感情‧⼼理学領域でのPh.D.保持者 - LLM の予測の⽅が多く選択された (LLM 43.7% vs オリジナル投稿 40.0%) 3⼈のテスターのアノテーター間⼀致度も低い (Fleiss Kappa が 0.21) → 既存研究は第三者がアノテートしているが、それはまずいのでは?
最後に: 読み⼿ (広⽥) の感想 - 感情語を当てるというのが思ったより難しそう。最近の LLM だとどの程度なのかが気 になる。 LLM
がシンプルな感情語 (sad, happy, etc..) を⼈と⽐べてあまり使わない理由が気にな る。何かそうなるメカニズムがある? 「本⼈がどの程度許容できるか」も知りたい。第三者が⾒て LLM かオリジナルかはほ ぼ⾒分けられないという結論だったが、post を書いた本⼈がジャッジするとどうなの か?が気になる