Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Off-Policy Evaluation and Learning for Matching...
Search
Yudai Hayashi
November 09, 2025
Research
0
80
Off-Policy Evaluation and Learning for Matching Markets
RecSys 2025 論文読み会での発表資料です。
https://connpass.com/event/372676/
Yudai Hayashi
November 09, 2025
Tweet
Share
More Decks by Yudai Hayashi
See All by Yudai Hayashi
ジョブマッチングプラットフォームにおける推薦アルゴリズムの活用事例
yudai00
0
94
ユーザーのプロフィールデータを活用した推薦精度向上の取り組み
yudai00
0
680
MCP Clientを活用するための設計と実装上の工夫
yudai00
1
1.2k
人とシゴトのマッチングを実現するための機械学習技術
yudai00
1
77
MCPを理解する
yudai00
18
14k
データバリデーションによるFeature Storeデータ品質の担保
yudai00
1
240
「仮説行動」で学んだ、仮説を深め ていくための方法
yudai00
8
2k
相互推薦システムでのPseudo Label を活用したマッチ予測精度向上の取り組み
yudai00
1
1k
Wantedly Visitにおけるフリーワード検索時の推薦のオンライン化事例紹介
yudai00
1
330
Other Decks in Research
See All in Research
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
66
36k
2025-11-21-DA-10th-satellite
yegusa
0
110
地域丸ごとデイサービス「Go トレ」の紹介
smartfukushilab1
0
870
AI in Enterprises - Java and Open Source to the Rescue
ivargrimstad
0
1.1k
CoRL2025速報
rpc
4
4k
自動運転におけるデータ駆動型AIに対する安全性の考え方 / Safety Engineering for Data-Driven AI in Autonomous Driving Systems
ishikawafyu
0
120
"主観で終わらせない"定性データ活用 ― プロダクトディスカバリーを加速させるインサイトマネジメント / Utilizing qualitative data that "doesn't end with subjectivity" - Insight management that accelerates product discovery
kaminashi
15
20k
[Devfest Incheon 2025] 모두를 위한 친절한 언어모델(LLM) 학습 가이드
beomi
2
1.4k
社内データ分析AIエージェントを できるだけ使いやすくする工夫
fufufukakaka
1
760
生成AI による論文執筆サポート・ワークショップ ─ サーベイ/リサーチクエスチョン編 / Workshop on AI-Assisted Paper Writing Support: Survey/Research Question Edition
ks91
PRO
0
140
ACL読み会2025: Can Language Models Reason about Individualistic Human Values and Preferences?
yukizenimoto
0
120
都市交通マスタープランとその後への期待@熊本商工会議所・熊本経済同友会
trafficbrain
0
110
Featured
See All Featured
The Invisible Side of Design
smashingmag
302
51k
So, you think you're a good person
axbom
PRO
2
1.9k
Become a Pro
speakerdeck
PRO
31
5.8k
Raft: Consensus for Rubyists
vanstee
141
7.3k
Statistics for Hackers
jakevdp
799
230k
Building Adaptive Systems
keathley
44
2.9k
Winning Ecommerce Organic Search in an AI Era - #searchnstuff2025
aleyda
0
1.8k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
1.8k
<Decoding/> the Language of Devs - We Love SEO 2024
nikkihalliwell
1
120
What does AI have to do with Human Rights?
axbom
PRO
0
1.9k
Building an army of robots
kneath
306
46k
Six Lessons from altMBA
skipperchong
29
4.1k
Transcript
© 2025 Wantedly, Inc. INTERNAL ONLY Off-Policy Evaluation and Learning
for Matching Markets RecSys 2025 論文読み会 Nov. 9 2025 - Yudai Hayashi, Shuhei Goda and Yuta Saito
© 2025 Wantedly, Inc. INTERNAL ONLY 自己紹介 林 悠大 •
所属:ウォンテッドリー株式会社 • 経歴: ◦ 2022年にデータサイエンティストとして新卒入社 • 趣味: ◦ 音楽を聞くこと ◦ ウイスキー
© 2025 Wantedly, Inc. INTERNAL ONLY マッチングプラットフォームにおける推薦システム 企業 求職者 スカウト
返信 購入 ECプラットフォーム マッチングプラットフォーム ユーザー 商品 マッチング推薦の成功には、双方向の嗜好の一致が必要
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値:推薦システム(= 方策)の生み出す価値の定量化 ECプラットフォーム マッチングプラットフォーム
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値:推薦システム(= 方策)の生み出す価値の定量化 ECプラットフォーム マッチングプラットフォーム
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値:推薦システム(= 方策)の生み出す価値の定量化 ECプラットフォーム マッチングプラットフォーム
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値が正しく推定できることのインパクト 仮に既存の方策のデータから を推定することができれば、 •
A/B テストより低コストで方策評価が可能 → オフ方策評価 • 推定した方策価値 を目的関数として学習 することでより良いモデルを得るこ とができる → オフ方策学習
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値の代表的な推定量 ECプラットフォーム 非マッチング文脈において様々な推定量が提案されてきた
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値の代表的な推定量 ECプラットフォーム 非マッチング文脈において様々な推定量が提案されてきた :重要度重み
• IPS や DR で不偏推定を実現 • 正解ラベルがスパースなときや行動空間が 大きい時に、発散的に増大し推定値が不安 定化 (バリアンスの増大)
© 2025 Wantedly, Inc. INTERNAL ONLY 方策価値の代表的な推定量 非マッチング文脈において様々な推定量が提案されてきた マッチングプラットフォーム :重要度重み
• IPS や DR で不偏推定を実現 • 正解ラベルがスパースなときや行動空間が 大きい時に、発散的に増大し推定値が不安 定化 (バリアンスの増大) 双方向の嗜好が関連することにより、 正解ラベルがスパースに
© 2025 Wantedly, Inc. INTERNAL ONLY 提案手法 - DiPS :
スカウト送信ラベル : 推定スカウト返信確率 IPS part DM part スカウト送信と返信を別々に分けて扱う • 比較的密なスカウト送信ラベルは IPS のように重要度重みを利用して低バイアスに推定 • 疎なスカウト返信は、DM のように予測モデルを利用して低バリアンスに推定
© 2025 Wantedly, Inc. INTERNAL ONLY 提案手法 - DPR :
推定マッチ確率 スカウト送信と返信を別々に分けて扱う DiPS を DR 推定量と同じ形で拡張することで、さらにバリアンスを低減
© 2025 Wantedly, Inc. INTERNAL ONLY 評価指標 推定の正しさの指標 : 方策選択の正しさの指標
:
© 2025 Wantedly, Inc. INTERNAL ONLY 合成データによる検証結果 • 候補者数が多く、重要度重みが不安定になりやすい設定でもバリアンスを低く抑えられている •
従来手法よりも低 MSE, 低 Selection Error を達成
© 2025 Wantedly, Inc. INTERNAL ONLY 合成データによる検証結果 • 正解ラベルがスパースな設定においてもバリアンスを低く抑えられている •
推定モデルを使っているためバイアスは増加するが、スカウト送信側は重要度重みを利用している ため、DM よりバイアスの増加を抑えられている
© 2025 Wantedly, Inc. INTERNAL ONLY 合成データによる検証 - オフ方策学習 方策価値の推定値を最大化させるようにモデルを学習
既存方策の性能を示す基準線 (黒線) や、他の推定量を使って学習したときよりも高い性能を 示している
© 2025 Wantedly, Inc. INTERNAL ONLY 実データによる検証 Wantedly Visit の過去のオンラインテストの結果を使って検証
• バリアンスの低減効果が実データにおいても見られた • 従来手法 (IPS, DR) と比較して、バイアスも低下するような振る舞い ◦ 返信確率の誤差 + α で説明できる (詳細は論文を参照してください)
© 2025 Wantedly, Inc. INTERNAL ONLY まとめ • マッチングプラットフォームにおいて、信頼度高く新しい方策の価値を推定するための 2つの推定
量 DiPS、DPR を提案 • 合成データと Wantedly Visit の実データの両方を使って提案手法の有効性を実証 • オフ方策学習においても、従来手法よりも高い性能のモデルを得ることができることを実証 ブログ記事 arXiv