Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Credit-assigned Policy Gradient for Early Stage...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.

Credit-assigned Policy Gradient for Early Stage Retrieval in Two-stage Ranking

ICML2026採択論文の解説スライド
論文: https://arxiv.org/abs/2605.26385

English version: https://speakerdeck.com/harukakiyohara_/credit-assigned-pg

Avatar for Haruka Kiyohara

Haruka Kiyohara

July 08, 2026

More Decks by Haruka Kiyohara

Other Decks in Research

Transcript

  1. ICML2026, 韓国, ソウル Credit-assigned Policy Gradient for Early-Stage Retrieval in

    Two Stage Ranking (日本語版) 清原 明加 (Haruka Kiyohara) Meta (2025) でのインターン研究 (Central Applied Science, M+TH チーム) Joint work with: (Meta) - Nitzan Razin, Mihaela Curmei, Israel Nir, Shankar Kalyanaraman, Arieal Evnine, Roxana Pop, Udi Weinsberg, (Cornell) - Thorsten Joachims, Sarah Dean July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 1
  2. 自然に定義される方策勾配 (V-PG) 次に、全体の方策を 1段階目 (ESR) と 2段階目 (LSR) に分解する。 アイテム

    𝑎𝑙 が ポジション 𝑙 で観測される周辺確率 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 8
  3. 自然に定義される方策勾配 (V-PG) 次に、全体の方策を 1段階目 (ESR) と 2段階目 (LSR) に分解する。 ここで、方策の分解を勾配計算に代入。

    結果、ESR方策の候補集合選択に対する勾配が計算できる [Ma+,20]。 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 10
  4. V-PG は一見うまくいきそうに見えるが.. V-PG には、候補集合の大きさ (K) に対してスケールしない問題がある。 • 分散の問題 • 行動空間(組合せのアイテム集合)が指数関数的に増大

    ≈ 𝑂(|𝐴|𝐾 ) • 対して、オンライン学習では基本単一の組合せしか観測されない July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 11
  5. V-PG は一見うまくいきそうに見えるが.. V-PG には、候補集合の大きさ (K) に対してスケールしない問題がある。 • 分散の問題 • 行動空間(組合せのアイテム集合)が指数関数的に増大

    ≈ 𝑂(|𝐴|𝐾 ) • 対して、オンライン学習では基本単一の組合せしか観測されない (さらに実システムでは、総アイテム数すら 𝐴 = 1,000,000 など) 組合せはどのくらい大きくなる? combinations # of組合せの総数 → 例えば総アイテム数が 𝐴 = 10 と大きくなくても、 組合せの数 (|𝐴|𝐾) は非常に大きくなってしまう..! becomes exponentially large.. ! 候補集合の大きさ candidate set size (𝐾) July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 12
  6. V-PG は一見うまくいきそうに見えるが.. V-PG には、候補集合の大きさ (K) に対してスケールしない問題がある。 • 貢献度の効率的な割当の問題 • 候補集合内のアイテムについて、均等に評価し重みづけしていない。

    ※ 勾配伝播の手順 ランキング ESRに選ばれた候補集合 c 報酬 (1) 対応するアイテムの確率を増加 c c 全てのアイテム July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 15
  7. V-PG は一見うまくいきそうに見えるが.. V-PG には、候補集合の大きさ (K) に対してスケールしない問題がある。 • 貢献度の効率的な割当の問題 • 候補集合内のアイテムについて、均等に評価し重みづけしていない。

    ※ 勾配伝播の手順 ランキング ESRに選ばれた候補集合 c 報酬 (1) 対応するアイテムの確率を増加 c (2) 対応するアイテムの抽出に使われた 候補集合の確率を増加 c 全てのアイテム July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 16
  8. V-PG は一見うまくいきそうに見えるが.. V-PG には、候補集合の大きさ (K) に対してスケールしない問題がある。 • 貢献度の効率的な割当の問題 • 候補集合内のアイテムについて、均等に評価し重みづけしていない。

    ※ 勾配伝播の手順 ランキング ESRに選ばれた候補集合 報酬 (1) 対応するアイテムの確率を増加 c (2) 対応するアイテムの抽出に使われた 候補集合の確率を増加 c (3) 候補集合に含まれていた全てのアイテムの確率を増加 c 全てのアイテム July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 17
  9. では理想的な “貢献度の割当” は何か? より効率的に勾配を伝播するため、当該するアイテムのみに伝播したい。 (勾配) ..? 仮説: 効率的に勾配伝播すれば、 分散の問題を減らせる? 報酬

    ランキング (1) 対応するアイテムの確率を増加 候補集合 (2) 対応するアイテムが候補集合に含まれうる確率を増加 c (3) 対応するアイテムのみの確率を増加するよう効率的に勾配伝播 全てのアイテム July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 18
  10. “理想的な” 貢献度の割当を実現するには? 提案手法:Credit-assigned policy gradient (CA-PG) ここで アイテム 𝑎𝑙 を任意の

    top-K 候補集合に アイテム 𝑎𝑙 が何かしらの top-K候補集合に 含みうる確率(周辺確率) 含まれていた時に、𝑎𝑙 が選ばれる周辺確率 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 20
  11. “理想的な” 貢献度の割当を実現するには? 提案手法:Credit-assigned policy gradient (CA-PG) ここで アイテム 𝑎𝑙 を任意の

    top-K 候補集合に アイテム 𝑎𝑙 が何かしらの top-K候補集合に 含みうる確率(周辺確率) 含まれていた時に、𝑎𝑙 が選ばれる周辺確率 アイテム 𝑎𝑙 を含む候補集合 𝐴𝐾 の集合 上記の候補集合のどれかを選ぶ確率 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 21
  12. 提案手法の理論的な性質 (1/3) 1) 2つの方策勾配の関係性は? • CA-PGは、V-PGの一部分のみを勾配として計算。 ESRに依存し、 CA-PGで勾配を計算 ESRに依存するが、 CA-PGでは勾配を無視

    • 個別の候補集合の影響を無視するので、CA-PGはV-PGより分散を減少。 (無視された勾配) = 各候補集合での 𝑎𝑙 の観測されやすさ July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 23
  13. 提案手法の理論的な性質 (2/3) 2) V-PG と CA-PG はそれぞれ何をもとに最適化しているのか? • 方策勾配は以下の期待値をもとに対応する変数の確率を増減する。 •

    CA-PGの報酬は2段階目 (LSR) での選ばれやすさを割引率として報酬に反映。 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 25
  14. 提案手法の理論的な性質 (3/3) 3) CA-PG が正しいアイテムの順位付けを学習できる条件は? • 2段階目 (LSR) がある程度正確にアイテムをランク付けしていることが必要。 ・正しいアイテムの順序付けによるε-貪欲方策、ソフトマックス方策は全て条件を満たす。

    ・全てのアイテムが正しい順位でなくても、上記の条件を満たす限り多少のエラーは問題ない。 ・例えば上位K個の間の順序や下位K+1位以下の順序の逆転は、影響なし。 ・ それ以外の順序逆転も、方策価値の比率が報酬比率以下であれば、影響なし。 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 27
  15. 提案手法の理論的な性質のまとめ • CA-PG は V-PG の方策勾配の一部 のみを使用している。 • CA-PG は

    対応するアイテムが ESR により選ばれうる周辺確率を見ることで、 ESR により選ばれた候補集合内のアイテムに貢献度を割り当てる。 • CA-PG は各アイテムがどの候補集合から来たのかを意図的に無視することで、 行動空間を 𝑶(|𝑨|𝑲) から 𝑶(|𝑨|) まで大幅に減少し分散を抑える。 • CA-PG は実用的にある程度正確な 2段階目方策 (LSR) を使えば、 アイテムの正確なランク付けを学習できる。 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 28
  16. 実用上の代替案: TOP1-PG 実用上では、CA-PG の特殊ケースである TOP1-PG を使うのがおすすめ! 𝑆𝐾 の代わりに、𝑆1 (候補集合の最初のアイテム) に選ばれる確率を勾配計算時のみ使用。

    𝑂(𝐿) 候補集合自体は、Plackett-Luce と呼ばれる方策を使い K個 で構成する。 July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 31
  17. 実用上の代替案: TOP1-PG 実用上では、CA-PG の特殊ケースである TOP1-PG を使うのがおすすめ! 𝑆𝐾 の代わりに、𝑆1 (候補集合の最初のアイテム) に選ばれる確率を勾配計算時のみ使用。

    𝑂(𝐿) TOP1-PG K個 が CA-PG と同値になる条件: 候補集合自体は、Plackett-Luce と呼ばれる方策を使い で構成する。 • Plackett-Luce の確率の近似に、 独立サンプリング仮定 (SwR) を使う • K個のアイテムを、混合専門モデル(MoE) ではなく単一のモデルからサンプルする July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 32
  18. ここまで出てきた方策勾配手法のまとめ 各手法の理論的性質をまとめると.. 最悪条件 / 最高条件 方策勾配 (提案手法) 行動 空間 大きさ

    勾配 依存性 正確なランク付けの学習条件 なし (いつも正確) ある程度正確な 分散 高 低 低 計算量 ※ SwR: Sampling-with-Replacement MoE: mixture-of-experts July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 33
  19. ここまで出てきた方策勾配手法のまとめ 各手法の理論的性質をまとめると.. 最悪条件 / 最高条件 方策勾配 (提案手法) 行動 空間 大きさ

    勾配 依存性 正確なランク付けの学習条件 なし (いつも正確) ある程度正確な 分散 高 低 低 計算量 実験では、以下の条件を変えて性能を比較: • 候補集合の大きさ (K), ランキングの長さ (L), LSRの正確さ → 学習した1段階目 (ESR) 方策による方策価値はどう変わる? • 候補集合の大きさ (K), ランキングの長さ (L) → 方策勾配の計算時間はどう変わる? July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 34
  20. 人工データ実験 (3/4) 人工データ実験では、モデルにより関数が (ほぼ) 学習可能な条件で実験。 この実験では、MoEで複数のモデルを使って ESR により候補集合をサンプリングしている。 CA-PG は

    MoE により複数のモデルと組み合わせることでより効果的に! (mixture of experts; MoE) July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 37
  21. KuaiRec [Gao+,22] での実データ実験 大規模なアイテム数 𝐴 = 1000, 候補集合の大きさ (𝐾) ∈

    {50, 100, 200} で実験。 人工データ実験と同様に、より現実的な設定でも CA-PG-SwR は 候補集合の大きさ (𝑲) が大きい時により有用に! July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 39
  22. 論文のまとめ • 2段階意思決定問題において、1段階目 (ESR) の最適化方法 を研究。 • 重要なのは、V-PG の 分散と貢献度割当の問題

    をどうするか。 • 周辺確率を利用した CA-PG を提案し、現実的な計算時間で問題を解決。 CA-PG-SwR は性能が良く計算も速いので、 強化学習を用いた実用的な ESR の学習を可能に! July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 40
  23. GRPO [Shao+,24] と組み合わせた実験結果 CA-PG は他の分散減少のための手法とも容易に組み合わせられる。 CA-PG を GRPO と組み合わせる手順: 1.

    文脈毎に、𝑚 個の行動と対応する報酬を観測 𝑟𝑗(𝑥, 𝑎), 𝑗 ∈ [𝑚]. 2. 報酬を正規化 𝑟 ′ 𝑗 = (𝑟𝑗 − 𝑚𝑒𝑎𝑛(𝑟))/𝑠𝑡𝑑(𝑟). 3. (報酬が正値になるように定数を足して報酬分布を移動). July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 42
  24. 参考文献 [Ma et al., 2020] Jiaqi Ma, Zhe Zhao, Xinyang

    Yi, Ji Yang, Minmin Chen, Jiaxi Tang, Lichan Hong, Ed Chi. Off-policy Learning in Two-stage Recommender Systems. WWW, 2020. [Gao et al., 2022] Chongming Gao, Shijun Li, Wenqiang Lei, Jiawei Chen, Biao Li, Peng Jiang, Xiangnan He, Jiaxin Mao, Tat-Seng Chua. KuaiRec: A Fully-observed Dataset and Insights for Evaluating Recommender Systems. CIKM, 2022. [Shao et al., 2022] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y.K. Li, Y. Wu, Daya Guo. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. 2024. July 2026 Credit-assigned policy gradient in two stage ranking @ ICML 46