Upgrade to Pro — share decks privately, control downloads, hide ads and more …

論文読み会 SNLP2026 Tau2-Bench: Evaluating Conversat...

Avatar for S S
August 19, 2026

論文読み会 SNLP2026 Tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment

Avatar for S

S

August 19, 2026

More Decks by S

Other Decks in Research

Transcript

  1. ICML2026 Spotlight tau2-bench: Evaluating Conversational Agents in a Dual-Control Environment.

    In: ICML 2026 Victor Barres, Honghua Dong, Soham Ray, Xujie Si, Karthik R Narasimhan 第18回 最先端NLP勉強会 Hottolink/SciTokyo Okazaki Lab/AIST: Sakae Mizuki 2026-08-30 図表は,断りのないかぎり本論文またはICML2026口頭発表からの引用です
  2. 本研究の概要 • 問い合わせ応対(カスタマーサポート)の能力を評価するベンチマーク • 有名なtau-bench の2代目.TAU という名前は Tool-Agent-User に由来 •

    2代目(telecom)は,ユーザ(=顧客)を誘導しながら課題を解決 • 例:「ローミングをonにしてください」 • 2026年8月現在,正答率99%が達成されて"解決済み"になっている • エージェントAIの節目といえる研究.問題の定式化,データセットの作り方,ユ ーザ役の採用などが後続研究に影響 3
  3. 背景:問い合わせ応対タスク • 著者らの所属するSierra社は,カスタマーサポート(CS)AIを提供する企業 • エージェントAI以前のCSベンチマークは,固定シナリオのスロットフィリング( MultiWOZ [Budzianowski+, EMNLP18], ABCD [Chen+,

    NAACL21])だった • tau-benchは,ユーザ(=顧客)と対話しながら環境と作用して課題を解決する CSの仕事を忠実にベンチマークにしたもの • 例:海外で通信したい → ローミングプランを有効化して課金 • LLMがユーザ役を演じて,LLMにツールを使わせて状態(=DB)を更新し,DB の最終状態をチェックして正誤判定するように定式化 4
  4. 設問例 の課題:データ通信できないので直してほしい • :「モバイルデータが使えません」 • :「ステータスバーを見てもらえますか」 • :get_status_bar() • :「

    • :「通信が無効になってます」 • :「データ通信をONに切り替えてもらえますか」 • • 電波良好 | 5G | 通信無効 | 80%」 :toggle_data() :"データ通信ON" エージェント は端末 を見られないので,ユーザ に聞くしかない 6
  5. 設問例 (つづき) • • :「まだ通信できません」 :get_details_by_id("L1002") • :{..., "roaming_enabled": false,

    ...} • :「ローミングが無効です.いま海外にいますか? 有効にしますか? 料金は…」 • • :「海外にいます.有効にしてください」 :enable_roaming("C1001", "L1002") • :"ローミング契約を有効化しました" • :「通信できました.解決しました」 ユーザ ユーザ が端末 を,エージェント が顧客システム をそれぞれ操作する が解決したと宣言したら対話を終了する 7
  6. ベンチマークの構成 tau2-bench telecom を構成する要素は以下の通り. • 設問:ユーザ が解決したい事象(例:データ通信できない) • エージェント のポリシー:応対マニュアル的なもの

    • 環境:端末 と顧客システム を模したデータベース • ツール: および を操作するコマンド • 正解:問題を解決する一連のコマンド • 単体テスト:環境の正誤を試験する一連のテスト • その他:ユーザ役を演じるプロンプト,ユーザ役の性格 • これらをLLMに合成させてから,人手で検証・修正.これにより,手間を軽 減しつつ品質を担保 • 設問数は114問,ツール数は が13個, が30個,正解するまでの行 動数は1--12回 8
  7. 設問の自動合成 • 複数の要素が相互に作用するなかで "解ける" 設問を作るのは簡単ではない • 初代tau-benchは解けない設問が多数(airlineの3割, retailの1割が解けない [Cuadron+, arXiv25])

    • そこで,正常な環境を壊す手順(論文中ではサブタスクと呼称)を作ることで,手順を逆に たどれば“必ず解ける”ようにした • 壊す(通信不可にする)例: 機内モードon → 所在地をソウルに → ローミング無効化 9
  8. 採点方法 • 以下のいずれかが発話されたら対話を終了 • エージェント が自力では解決不能と判断(人間への転送を選択) • ユーザ が解決したと宣言 •

    ユーザ が対話継続不能と宣言 • 対話終了時点の環境 • テストの例: が単体テストをパスすれば正解と判定 のデータ通信は有効か? のローミング契約は有効か? • 対話の内容は採点しない = 解く過程は問わない 10
  9. telecom は難しい • 初代 airline/retail と,2代目 telecom の正解率 Pass^k を比較

    • 評価した全てのモデルにおいて,telecom の正解率が最も低い 13
  10. ボトルネックの分析 • ユーザを誘導しなくてよい/操作を考えなくてよい設定と比較することで,なにが 難しいのか調べる • No-user mode:ユーザの環境 • Oracle Plan:正解の操作手順

    もぜんぶエージェントが操作する をぜんぶ教える • Default < No-User < Oracle の順に簡単だとわかる • つまり,ユーザへの端末操作指示および,実行すべき操作の判断がボトルネック 14
  11. データ合成アプローチの普及 • tau-bench系列の構築にはLLMによるデータ合成が活用されている • 同様に,ツール使用タスクや問い合わせ応対タスクの学習は,大規模なデータ合 成アプローチが主流に(AWM [Wang+, ICML26], Nemotron 3

    [NVidia, arXiv26], SynthAgent [Lyu+, ACL26]) • ツールの実装やユーザ役の発話だけでなく,ツールの応答すらもLLMが合成する AWM [Wang+, ICML26] Figure 2 Nemotron 3 [NVidia+, arXiv26] Figure 15 17
  12. LLMによるユーザ役は信頼できるのか • LLMが人間らしくユーザ役を演技できるというtau2-benchの前提は,実際にはい くつかの課題がある • まず,ユーザ役モデルを替えるだけで正解率が最大9pt変動する [Seshadri+, ACL26]. 評価の標準化や再現性には難がある(私も苦労した…) •

    つぎに,LLMは 1) 解決したと早合点する 2) 対話が破綻しても継続しがち なクセ がある([Naous+, ICLR26] Table 2 , ).これらは性能の過小/過大評価を招く • 最後に,LLMにユーザ役を演じさせると,人間のユーザ役と比べて高難度は過小 評価,低~中難度は過大評価になる [Seshadri+, ACL26] • 人間らしく対話を終わらせたり,人間と合うように較正するのは簡単ではない [Seshadri+, ACL26] Table 1 [Naous+, ICLR26] Table 2 [Seshadri+, ACL26] Figure 2 18
  13. オープンワールド評価の台頭 • 伝統的なNLPベンチが重視する標準化や再現性の尺度に照らすと,tau-benchは"不完全"にみえる • 一方で,実社会はたぶん"そういうもの"である;顧客応対業務の標準化や再現性の担保は不可能に 思える.ならば評価のほうが現実離れしているのでは? • この考えの極端なものとして,オープンワールド評価 OWE [Kapoor+,

    ICML26WS] が提案されている • OWEとは,標準化と再現性をあえて捨てて,成功を明確に定義できない実世界・長期タスクを限ら れた試行で評価する試み • OWEの例:iOSアプリを開発・公開する [Kapoor+, ICML26WS],社内売店を運用する [Anthropic, 2025] • 下図の両端を意識して評価を研究していくことが重要ではないか tau-benchはここ 出典:CRUX: Collaborative Research for Updating AI eXpectations 19
  14. まとめ • ユーザを誘導しながら環境を操作して課題を解決する,問い合わせ応対の能力を 評価するベンチマーク • 日本語ローカライズ版 J-Tau [矢野, SBInt26] も素晴らしい仕事だと思います

    • 問題としては既に解けているが,後続に大きく影響したと思われる.データ合成 アプローチ,AIと人間の協調(例:対話形式のSWE [Raghavendra+, arXiv26]),オープ ンワールド評価とつながっている • LLMにユーザ役を演じさせる難しさを知らしめた • 後継の tau3-knowledge はまだ解けていない 21
  15. 参考文献 [Barres+, ICML26] tau2-Bench: Evaluating Conversational Agents in a Dual-Control

    Environment. In: ICML 2026. [Yao+, ICLR25] tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. In: ICLR 2025. [Ray+, ICML26] tau-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains. In: ICML 2026. [Shi+, ICML26] tau-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge. In: ICML 2026. [Cuadron+, arXiv25] SABER: Small Actions, Big Errors — Safeguarding Mutating Steps in LLM Agents. arXiv:2512.07850 [Naous+, ICLR26] Flipping the Dialogue: Training and Evaluating User Language Models. In: ICLR 2026. [Seshadri+, ACL26] Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations. In: ACL 2026. [Kapoor+, ICML26WS] Open-World Evaluations for Measuring Frontier AI Capabilities. In: ICML 2026 AIWILD Workshop. [Wang+, ICML26] Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning. In: ICML 2026. [Lyu+, ACL26] Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards. In: ACL 2026. [NVidia, arXiv26] Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning. arXiv:2604.12374 [Raghavendra+, arXiv26] SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions. arXiv:2606.30573 [Budzianowski+, EMNLP18] MultiWOZ — A Large-Scale Multi-Domain Wizard-of-Oz Dataset for Task-Oriented Dialogue Modelling. In: EMNLP 2018. [Chen+, NAACL21] Action-Based Conversations Dataset: A Corpus for Building More In-Depth Task-Oriented Dialogue Systems. In: NAACL 2021. [矢野, SBInt26] 日本語エージェントベンチマーク「J-tau telecom」の公開. SB Intuitions Tech Blog, 2026-06-19. [Anthropic, 2025] Project Vend: Can Claude run a small shop? Anthropic Research, 2025-06-27. 22