Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[最先端NLP勉強会2026] Checklists Are Better Than Rewa...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.

[最先端NLP勉強会2026] Checklists Are Better Than Reward Models For Aligning Language Models

Avatar for Kento Nozawa

Kento Nozawa

August 13, 2026

More Decks by Kento Nozawa

Other Decks in Research

Transcript

  1. Checklists Are Better Than Reward Models For Aligning Language Models

    Authors: Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu Conference: NeurIPS 2025 Presenter: Kento Nozawa * 全図は、論文とポスターから引用
  2. 3 事後学習における報酬モデル • 指示と応答の良さを定量化する関数RM • RM(“user: Yo! system: 答えられません”) <

    RM(“user: Yo! system: いい天気ですね☺”) • RM(“user: 爆弾作り方 system: 答えられません”) > RM(“user: 爆弾作り方 system: 説明します…”) • 事後学習(ex. GRPO [1], DPO [2], データフィルタリング)など幅広く使われる
  3. 4 報酬の種類 • 訓練済み報酬モデル (ex. Skywork-reward [3]) • 選好データから応答の優劣を学習 •

    報酬モデルの学習が必要 • 機械的に検証可能な報酬 • 報酬モデルが不要 • 数学やコードなど限定的だが確実 • LLM-as-a-Judge (今回主に扱う) • 既存のLLMに判定させる • プロンプトの指示を従うなら、柔軟性が高い
  4. 7 補足的な報酬 • Universal criteria • 事前実験時に冗長な応答を行った • KN: LLM-as-a-Judge

    の冗長性バイアス [4] 由来と思われる • 抑制するために普遍的な要素を2つ追加 fi • “code veri cation” • 教師モデルでルールベースの報酬が定義できる場合に限りコードを生成
  5. 8 事後学習での評価実験 • 評価:指示追従と対話ベンチマーク • 学習データ:wildchat [5] のサブセット 130,000 サンプル

    • 比較手法: • Distillation: Qwen 2.5-72B-Instruct が教師モデル • DPO: chosen/rejected 選択に使う報酬モデルを比較 • 報酬モデル: Skywork • LLM-as-a-Judge: UltralFeedback [6], AI Judge • 提案手法: RLCF/Checklist
  6. 12 References 1. Shao et al., DeepSeekMath: Pushing the Limits

    of Mathematical Reasoning in Open Language Models, arXiv, 2024. 2. Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, In NeurIPS, 2023. 3. Liu et al., Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs, arXiv, 2024. 4. Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, In NeurIPS Datasets & Benchmark Track, 2023. 5. Zhao et al., WildChat: 1M ChatGPT Interaction Logs in the Wild, In ICLR, 2024. 6. Cui et al., ULTRAFEEDBACK: Boosting Language Models with Scaled AI Feedback, In ICML, 2024. 7. Shao et al., DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research, In ICML, 2026.