Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Agentic TaskにおけるOn-Policy Distillation入門.pdf

Avatar for mujirushi mujirushi
October 03, 2026
220

Agentic TaskにおけるOn-Policy Distillation入門.pdf

Avatar for mujirushi

mujirushi

October 03, 2026

Transcript

  1. On-Policy Distillation(OPD)とは • Studentによる途中生成をTeacherへの入力とした時の、Teacherの出力分布を Studentが学ぶ手法 ◦ off policy training :

    外部からの正解データ分布を使って学習 ◦ on policy training : Student自身が生成したデータ分布を使って学習 https://thinkingmachines.ai/blog/on-policy-distillation/#on-policy-distillation--best-of-both-worlds
  2. SFT vs RL vs OPD • • • SFTでは、学習時の外部からのデータ分布と、推論時のStudent自身が生成したデータ 分布が異なる(off

    policyによるExposure Biasが発生) RLでは、trajectory(agentによるtool操作や回答までの生成軌跡)のactionごとの寄与を 割り当てにくい(credit assignment問題) OPDでは、Student自身が生成するデータ分布で学習でき(on-policy sampling)、 Teacherの確率分布からトークンレベルの密な学習信号を得られる(dense supervision) https://thinkingmachines.ai/blog/on-policy-distillation/#on-policy-distillation--best-of-both-worlds
  3. オープンウェイトモデルにおけるOPD • Qwen3 (2025.5) ◦ Strong-to-Weak Distillation(Off-policy distillationで初期学習し、OPDで追加学習) • DeepSeek-V4(2026.4),

    Kimi K3(2026.7) ◦ Multi-Teacher On-Policy Distillation(Math, Codeなどの特化モデルを汎用モデルに統合) https://arxiv.org/abs/2505.09388 https://arxiv.org/pdf/2606.19348 https://arxiv.org/pdf/2607.24653
  4. Agentic Task OPDの舞台 • エンロンは米国のエネルギー企業。 • 粉飾決算をめぐる訴訟の過程で約50万通の社内メールが公開され、現在は研究用データ セットとしても利用されている。 https://www.amazon.co.jp/-/en/%E5%85%83%E3%82%A8%E3%83%B3% E3%83%AD%E3%83%B3%E7%A4%BE%E5%93%A1-%E3%82%B1%E3

    %83%B3%E3%83%BB%E3%83%AC%E3%82%A4-%E5%85%83CEO-% E3%82%B8%E3%82%A7%E3%83%95%E3%83%BB%E3%82%B9%E3% 82%AD%E3%83%AA%E3%83%B3%E3%82%B0-%E3%82%A2%E3%83 %B3%E3%83%87%E3%82%A3%E3%83%BB%E3%83%95%E3%82%A1 %E3%82%B9%E3%83%88%E3%82%A6/dp/B000O1OBLE
  5. 参考)Enron メールの例 ◦ Question: When will the new Weekly Report

    be delivered each week?(新し い週次レポートは毎週いつ届きますか?) ◦ Mail: for delivery 8am Monday mornings(毎週月曜の午前8時に配信予定) ◦ Answer: 8am Monday mornings.(毎週月曜の午前8時)
  6. Agentic Task OPDの概要 • • • • Task:メール検索 Dataset:Enron Mail

    Pipeline:ReAct(4つのTool: メール検索, メールベクトル検索, メール読み込み, 最終回答) Training:On-Policy Distillation(LoRA) ◦ Student Model:Qwen3 4B ◦ Teacher Model:Qwen3 14B
  7. Forward KL vs Reverse KL vs Jensen–Shannon • Forward KL

    vs Reverse KLに加えて、Jensen–Shannon(student, teacherの中間 分布でOPD学習)も追加して検証 • Forward KLが最も優れている結果 Task Success Rate forward KL Base model OPD Reverse KL Jensen–Shannon 0.60 0.71 0.66 0.66
  8. 参考. On-Policy Self-Distillation(OPSD) • OPSDは、Student,Teacherを同じモデルにしてTeacherにヒントや正解を与える • OPSDによるTask Success Rate改善は限定的 ※

    Teacherのみ特権情報(Privileged Information)を保有している故のバイアス起因の可能性 Task Success Rate https://arxiv.org/pdf/2601.18734 Base model 0.60 OPSD 0.62
  9. Takeaway • OPD = On-policy × Dense teacher signal ◦

    オープンウェイトのフロンティアモデルでOPDが採用されている • OPDはLLM事後学習の選択肢になりうる ◦ 今後のKaggleで活躍する可能性がある
  10. 参考. 学習設定 • • • • • • • Student:Qwen3-4B(LoRA、rank

    64/alpha 128) Teacher:Qwen3-14B(正解trajectoryを見ない) Batch size:64 step:100 optimizer steps Learning Rate:5×10⁻⁶ loss:Teacher分布へのforward KL(top 32) 実行環境:GPU A100 40GB × 2
  11. 参考. verl(Volcano Engine Reinforcement Learning for LLMs) • ByteDance Seed発の、LLMの強化学習・事後学習を支えるOSS

    • メール検索エージェントをverlにてOPD学習 https://github.com/verl-project/verl