Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
PLaMo 3.0 Primeの事後学習
Search
Preferred Networks
PRO
July 30, 2026
Technology
400
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
PLaMo 3.0 Primeの事後学習
2026年7月30日に開催された「PFN LLMオープンハウス」での講演資料です。
Preferred Networks
PRO
July 30, 2026
More Decks by Preferred Networks
See All by Preferred Networks
MN-Core™ について語りたい - 第59回 情報科学若手の会
pfn
PRO
1
710
User Namespaces in Production: Enabling Root in Containers with RWX
pfn
PRO
0
110
世界最先端の研究を製品へ~PFNでのプロダクトマネジメントの難しさとその醍醐味~
pfn
PRO
0
63
PLaMo 3.0 Primeの構造化出力サポート
pfn
PRO
0
280
plamo-3-translateの開発
pfn
PRO
0
460
PLaMoを毎日の開発で使い育てていく
pfn
PRO
0
270
The Making of AI Chips
pfn
PRO
1
1.2k
国産生成AI PLaMoを支える事後学習と推論最適化
pfn
PRO
13
5.9k
Japanese SimpleQA: 日本語における事実に基づいた回答能力の評価ベンチマーク
pfn
PRO
1
510
Other Decks in Technology
See All in Technology
AIに書かせて、プラットフォームで縛る ― EKSプラットフォームで実践した責任境界と権限設計
elmodev09
1
920
認知負荷を吸収し、プロダクトをまたぐPR Preview基盤の設計事例
taiki45
2
500
音声コミュニティを守るAI監視基盤_ 90%以上の入力削減を支えたServerless設計と運用判断
shuheioka123
0
110
TiDBファミリーにDWHが新登場!! TiDB最新情報 / TiDB update 202609
yoshiakiyamasaki
0
140
AWS App Runnerから Cloudflare Workersへ移行した話
ryota09
0
110
Oracle Cloud Infrastructure(OCI):Onboarding Session(はじめてのOCI/Oracle Supportご利⽤ガイド)
oracle4engineer
PRO
3
21k
【Findyテック文化祭ワークショップ】新卒エンジニア&採用担当と作る、 なりたい姿と今やるべき一歩
dip_tech
PRO
0
130
Amazon Bedrock Agents ClassicからAmazon Bedrock AgentCoreへ移行した際、ガードレール設定が2箇所に割れた話
matsunobu
0
140
セルフサービスのオブザーバビリティ基盤をOpenTelemetryで作る / Building a Self-Service Observability Platform with OpenTelemetry
ymotongpoo
3
420
AI Agent入門〜今更聞けないAgentの話〜
hiromimaganuma
0
120
Databricksメトリクスビューはじめてのもくもく会
taka_aki
0
110
Making AI Agents Safe and Fast- Jev, Obsidian, and the Meta-Harness
x5gtrn
PRO
0
160
Featured
See All Featured
First, design no harm
axbom
PRO
2
1.3k
Building Experiences: Design Systems, User Experience, and Full Site Editing
marktimemedia
1
610
Color Theory Basics | Prateek | Gurzu
gurzu
1
480
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
74
42k
<Decoding/> the Language of Devs - We Love SEO 2024
nikkihalliwell
1
330
Navigating Team Friction
lara
192
16k
SERP Conf. Vienna - Web Accessibility: Optimizing for Inclusivity and SEO
sarafernandez
2
1.6k
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
133
19k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
310
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
750
The Art of Programming - Codeland 2020
erikaheidi
57
14k
Agile Actions for Facilitating Distributed Teams - ADO2019
mkilby
0
290
Transcript
PLaMo 3.0 Primeの事後学習 LLM開発事業部 PLaMo Post-training team 野沢 健人
PLaMo 3.0 Prime のパイプライン概略 2 Pretraining & Continual pretraining SFT
Stage 1 SFT Stage 2 RL DPO • 事前学習:(Continual) Pretraining ◦ ◦ 次のトークンを予測するように学習させ、後段のための良い初期値を得る Continual pretraining:コンテキスト長の延長 • 事後学習:SFT, RL, and DPO ◦ ◦ 利用時に期待する挙動を学習 Reasoningありの学習を紹介
SFT (Supervised fine-tuning) 3 - プロンプトと期待される応答のペアを用意し、期待する形式の応答がで きるように学習 - プロンプト:自己紹介よろ -
応答:株式会社PFNで開発されたAI PLaMoです!😀 - 応答のトークンの予測誤差を使って学習 - PLaMo 3.0 Prime では2段から構成
SFT Stage 1 4 - 大規模にReasoningを伴う応答ができるように学習 - プロンプト:1+1 - Reasoning:ユーザーが1+1…田ではなく2と回答しよう。
- 最終的な応答:2です! - データのドメインは、STEMやCodingが支配的
SFT Stage 2 5 - Stage 1で身につけたReasoning能力を、PLaMoで注力するドメインや 汎用的な対話利用でも同じように学習 - 指示追従
- 長コンテキスト - エージェント - 安全性など - Stage 1に比べて多様、小規模
RL (Reinforcement learning) 6 - SFTで身につけた能力をさらに汎化させるために、報酬関数を最大化す るように学習 - データ例: -
プロンプト:約30文字で面白いこと言って - 報酬関数:その応答の良し悪しを定量化する関数f - f(プロンプト + つまらない256文字): 0.0 - f(プロンプト + 爆笑の30文字): 1.0 - 報酬設計が重要 Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models, arXiv, 2024.
DPO (Direct preference optimisation) 7 - 最後の微調整で、chosen (望ましい応答) の応答確率が rejected
(望ま しくない応答) より高くなるように学習 - データ形式: - プロンプト:約30文字で面白いこと言って - chosen: 爆笑の30文字 - rejected: スベりたくないので拒否します - 事後学習の中でもっとも小規模 Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, In NeurIPS, 2023.
まとめ 8 Pretraining & Continual pretraining SFT Stage 1 SFT
Stage 2 RL - 紹介できなかったPLaMo 3.0 Primeに関わる開発 - 学習・評価基盤改善 - Non-reasoning modelの開発 DPO
SFT vs RL 9 「RLで汎化するなら最初からRLしたら?」 - オンラインRLは応答生成が伴うため、GPUの利用効率がSFTより悪い - “SFT memorizes,
RL Generalizes” [Chu et al., 2025] Chu et al., SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training, In ICML, 2025.