Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
Fluent but Unfeeling_ The Emotional Blind Spots...
Search
Wataru Hirota
August 13, 2026
Research
64
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Fluent but Unfeeling_ The Emotional Blind Spots of Language Models (2026/8/20 ウェブ・ソーシャルメディア読み会)
Wataru Hirota
August 13, 2026
More Decks by Wataru Hirota
See All by Wataru Hirota
(2022-05-28 Machine Learning 15Minutes!) 日本語ニュース分類から見る多言語モデル
tarohi24
0
110
The future of data system
tarohi24
0
100
Serializability and Snapshot Isolation.pdf
tarohi24
0
260
Entity Set Search of Scientific Literature: An unsupervised Ranking Approach
tarohi24
0
110
Other Decks in Research
See All in Research
適応的スパムフィルタのための軽量な類似メッセージカウンタ / jsai2026-adaptive-spam-filter
monochromegane
0
5.3k
[BlackHatAsia2026] Hidden Telemetry: Uncovering TraceLogging ETW Providers You're Not Using (Yet)
asuna_jp
1
700
某助成金プロジェクト採択に向けて企業研究所のアウトリーチ専任者がやったこと
afroscript
0
180
長時間動画QAにおけるマルチエージェント推論 ・SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
murakawatakuya
1
200
多様なデータを許容し学習し続ける模倣学習 / Advanced Imitation Learning for VLA
prinlab
0
300
最先端NLP 2026 論文紹介: Wait, Wait, Wait... Why Do Reasoning Models Loop? / SNLP Paper Review: Wait, Wait, Wait... Why Do Reasoning Models Loop?
tkng
0
220
HackSick vol.7 LT資料【LLMアーキテクチャ入門・事前学習時の躓き所解説】 スパースなAttention・状態空間モデル
rikkabotan7
0
170
XDPerf: A High-Performance Traffic Generator Built with WASM and eBPF
takehaya
1
290
医療LLMの現在地〜最新研究から社会実装までを考える〜
kento1109
1
1.7k
ros2-perf-multihost: 分散システムにおける客観的なアーキテクチャ評価フレームワーク
takasehideki
0
250
Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering
anatolykr
0
300
SoftMatcha 2: 1兆語規模コーパスの超高速かつ柔らかい検索
e869120_sub
7
3.8k
Featured
See All Featured
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
1
2.8k
Jess Joyce - The Pitfalls of Following Frameworks
techseoconnect
PRO
1
410
Tips & Tricks on How to Get Your First Job In Tech
honzajavorek
1
730
Easily Structure & Communicate Ideas using Wireframe
afnizarnur
194
17k
Money Talks: Using Revenue to Get Sh*t Done
nikkihalliwell
0
490
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
430
Optimising Largest Contentful Paint
csswizardry
37
3.9k
Taking LLMs out of the black box: A practical guide to human-in-the-loop distillation
inesmontani
PRO
3
2.4k
Large-scale JavaScript Application Architecture
addyosmani
515
110k
Highjacked: Video Game Concept Design
rkendrick25
PRO
1
450
Amusing Abliteration
ianozsvald
1
290
Visualization
eitanlees
152
17k
Transcript
Fluent but Unfeeling: The Emotional Blind Spots of Language Models
著者: Bangzhao Shu, Isha Joshi, Melissa Karnaze, Anh C. Pham, Ishita Kakkar, Sindhu Kothe, Arpine Hovasapian, Mai ElSherief. (Northeastern University, UC San Diego, UMass) 読み⼿: 広⽥航 (ストックマーク株式会社)
はじめに: この論⽂の3⾏まとめ 研究のモチベーション 「LLM は⼈間の感情を正しく予測出来るか?」という問を検証。既 存の同様のベンチマークは感情カテゴリの推定問題 (悲しい‧嬉しい‧etc..) を扱っている が、もっと細かい粒度で LLM
の能⼒を知りたい。また、第三者のアノテーションではな く、その⼈⾃⾝が感じた (self-disclosed) 感情と⽐較してベンチマークしたい。 検証⽅法 感情推定を Masked Token Prediction 問題として定式化。その⼈が書いた感情を 表す トークン の部分をマスクし、その単語が当てられるか?を検証。 結果 2種類の結果が得られた。(1) どのモデルも masked token の特定精度は低い (2) 第三者に LLM と⼈の token をそれぞれ⾒せると、LLM の予測した単語の⽅がより⽂脈に 適した単語だという結果に
タスク: Masked Token Prediction
単語の⼀致に加え、より広い意味 (感情ベクトル) での⼀致も計測 プルチックの感情の輪に出る8種類の basic emontion とポジネガの2つ、合計10次 元で単語を表現。その単語がその basic emotion
(またはポジネガ) に関連してた ら 1 、そうでなければ 0 の2値表現 ベクトルのデータは EmoLex (Mohammad and Turney 2013) を使⽤。 EmoLex にない単語は Mechanical Turk でアノテーション
データセット EXPRESS これまでが⾔語モデルが感情を正しく認識しているか?について数多くの研究が⾏われてき た、いくつか限界があった - 多くのデータセット正解ラベルを第三者 (クラウドワーカー) などが付けており、⾃⼰ 開⽰ではない (後で出てくるが、⾃⼰開⽰か他者アノテーションかは結構重要)
多くの研究は⼤雑把な感情カテゴリ (喜び‧悲しみなど) への分類問題として定式化し ており、細かなニュアンスを捉えきれていない 対象となる⽂が短く、コンテキストがあまりない 本論⽂はこれらの制約を補うデータセット EXPRESS を提案し、 Masked Token Prediction の性能評価を実施
データセットの構築⽅法 データソース Reddit を使用 (著者らがクロール)。Berkeley Well-being list (Davis 2024) に含ま
れる感情語(emotion word) が1つ以上含まれる post を収集。 Emotion Masking self-disclosure emotion を抽出するために以下のパターンマッチを行う。評 価時は <emotion> の部分がマスクされる。 I + (feel / am) + <emotion> もしくは (no-pronoun) + feeling + <emotion> 統計値 合計 33,697 post を収録 (subreddit 数は 6,930)。機関: 2009/06 - 2024/04。 <emotion> の種類は 251 種類で、合計 52,632 個の <emotion> を収録。
実験1: masked emotion word を正しく特定できるか? 使用するモデル Masked LM (RoBERTa-base, Longformer),
Seq2Seq (Flan-T5), Causal LM (Llama 3.1, Gemma-2, GPT 3.5-Turbo / 4o) ※ 全体的にちょっと古い プロンプト手法 Zero-shot, Few-shot, Chain-of-Thought. (Masked LM は Zero-shot のみ)。 Few-shot はランダムに例を選択 (random) ともっとも近い事例を選択 (nearest) の2通り。CoT は “Think step by step” という文言をプロンプトにに追加 (注: 近年の LLM がネイティブサポートしてい るような <think> .. </think> とは別物)
結果。どの LM にとっても難しい ※ AccL .. 単語の⼀致, AccV .. ベクトルの⼀致,
F1V .. ベクトルの 各 dim の prec/recall から計算 → つまり右にいくほど粗い⼀致率
観点1: Few-shot ◎、CoT △ Zero-shot より精度向上 (特に nearest) CoT はイマイチ
観点2: 4o が全体的に優れている
⼈間とモデルは感情語の語彙が異なる ⼈間は happy, sad のような単語を, LLM は grateful や frustrated
のような単語を使う LLM 同⼠だと語彙の傾向が似ているのも興味深い
GPT-4o の結果は⼈も区別できない ⾃⼰開⽰の感情語と GPT-4o の予測が異なる 213個の post をサンプルし、(1) LLM の出⼒
(2) 実際の Reddit の単語 2つを出⾃を伏せて⾒せ、「ここに⼊る単語としてどちらが適切 か?(A, B, BOTH, NEITHER) 」を選択。テスターは3名の感情‧⼼理学領域でのPh.D.保持者 - LLM の予測の⽅が多く選択された (LLM 43.7% vs オリジナル投稿 40.0%) 3⼈のテスターのアノテーター間⼀致度も低い (Fleiss Kappa が 0.21) → 既存研究は第三者がアノテートしているが、それはまずいのでは?
最後に: 読み⼿ (広⽥) の感想 - 感情語を当てるというのが思ったより難しそう。最近の LLM だとどの程度なのかが気 になる。 LLM
がシンプルな感情語 (sad, happy, etc..) を⼈と⽐べてあまり使わない理由が気にな る。何かそうなるメカニズムがある? 「本⼈がどの程度許容できるか」も知りたい。第三者が⾒て LLM かオリジナルかはほ ぼ⾒分けられないという結論だったが、post を書いた本⼈がジャッジするとどうなの か?が気になる