Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
2020ACL読み会_FastBERT:-a-Self-distilling-BERT-wit...
Search
Ikumi Yamashita
August 06, 2020
Technology
170
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
2020ACL読み会_FastBERT:-a-Self-distilling-BERT-with-Adaptive-Inference-Time
Ikumi Yamashita
August 06, 2020
More Decks by Ikumi Yamashita
See All by Ikumi Yamashita
2021論文紹介_When-Do-You-Need-Billions-of-Words-of-Pretraining-Data?
ikumi193
0
190
2021EACL/NAACL論文紹介_Multilingual-LAMA-Investigating-Knowledge-in-Multilingual-Pretrained-Language-Models
ikumi193
0
71
2021論文紹介_CANINE:-Pre-training-an-Efficient-Tokenization-Free-Encoder-for-Language-Representation
ikumi193
0
330
2020COLING読み会_Linguistic-Profiling-of-a-Neural-Language-Model
ikumi193
0
110
2020EMNLP読み会_Identifying-Elements-Essential-for-BERT's-Multilinguality
ikumi193
0
140
2020論文紹介_Finding-Universal-Grammatical-Relations-in-Multilingual-BERT
ikumi193
0
300
2019EMNLP読み会_Unicoder_A_Universal_Language_Encoder_by_Pre-training_with_Multiple_Cross-lingual_Tasks
ikumi193
0
75
2019論文読み会_Language-Modeling-with-Shared-Grammar
ikumi193
0
230
2019ACL読み会_Choosing-Transfer-Languages-for-Cross-Lingual-Learning
ikumi193
0
65
Other Decks in Technology
See All in Technology
JavaScript 研修 (2026)
recruitengineers
PRO
2
470
社内の7割が使うデータ基盤を、 データチーム2人で回すためにやったこと
koh_yoshi
4
1.2k
Service Connect 上のサービスに ECS Service の外側から到達できなかった話
ota1022
1
190
組織にどうSREを根付かせるか?〜IVRyの場合〜
abnoumaru
0
330
20分でわかるセキュアAPI
nwiizo
1
200
[しろおび夏祭り2026] チャットするAIから、作業するAIへ - 使われ方の変化と、その裏側で起きていること
kk0n
0
1.7k
MIRU 2026 チュートリアル
keisuke198619
0
870
取引先から届く 「セキュリティチェックシート」の読み解き方
kamadamakoto
0
140
グローバル基準のSREは、運用現場でどう機能したか:成熟度アセスメントの実践 / SRE NEXT 2026
sorawatanabe
0
140
名古屋の市バスGTFS-JPデータ×スガキヤ 最寄りバス停検索をAmazon ElastiCache Serverless for Valkeyで最適化する
usanchuu
1
520
AIは実装を速くする。では、私たちは何を今作るべきか?-立場を越えてリリースに向き合ったチーム開発の実践 / 20260801 Hiromi Nakaya and Naoki Takahashi
shift_evolve
PRO
3
450
システム思考で問題に対処する
yussak
0
210
Featured
See All Featured
How To Stay Up To Date on Web Technology
chriscoyier
790
250k
brightonSEO & MeasureFest 2025 - Christian Goodrich - Winning strategies for Black Friday CRO & PPC
cargoodrich
3
760
VelocityConf: Rendering Performance Case Studies
addyosmani
333
25k
Bioeconomy Workshop: Dr. Julius Ecuru, Opportunities for a Bioeconomy in West Africa
akademiya2063
PRO
1
210
How GitHub (no longer) Works
holman
316
150k
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.3k
Money Talks: Using Revenue to Get Sh*t Done
nikkihalliwell
0
460
Darren the Foodie - Storyboard
khoart
PRO
3
3.6k
What does AI have to do with Human Rights?
axbom
PRO
1
2.3k
Building Experiences: Design Systems, User Experience, and Full Site Editing
marktimemedia
0
570
The Myth of the Modular Monolith - Day 2 Keynote - Rails World 2024
eileencodes
28
3.6k
Primal Persuasion: How to Engage the Brain for Learning That Lasts
tmiket
0
400
Transcript
紹介者:⼭下郁海 (TMU M1 ⼩町研究室) 2020/08/06 @ ACL2020 読み会
Abstract • 速度をチューニング可能な BERT ベースのモデル FastBERT を提案 • 推論時の速度を柔軟に変更可能 (adaptive
inference) であり、冗⻑な計算 を減らしている • 学習時には knowledge distillation の考え⽅をもとにした独⾃の⼿法 self- distillation を⽤いている 1
Introduction • 近年⼤きな成功を収めている pre-trained モデルは計算コストが⾼く推論 も遅いため実⽤的ではない Ø この問題解決のために Knowledge Distillation
などの⼿法が提案され ている (DistillBERT など) • 多くの NLP のデータセットには様々な難易度のデータが含まれている ü 使⽤する層の数を動的に減らすことのできる FastBERT を提案 ü 学習時の self-distillation と推論時の adaptive inference という⼆つの新し い考え⽅を⽤いて推論速度の向上を図った 2
3 Model architecture
Model training 1. Backbone Pre-training • BERT モデルの事前学習 • BERT
ベースのモデルならなんでもいい (RoBERTa, ERNIE など) 2. Fine-tuning for backbone • 最終層の教師分類器の学習 3. Self-distillation for branch • 各層の分類器の学習 • 教師分類器からの self-distillation を⾏なっている 4
Self-distillation for branch • 教師分類器の出⼒をもとに self-distillation を⾏う ! : ⽣徒側の分類器の予測
" : 教師側の分類器の予測 • 教師分類器の出⼒があれば良いのでラベルなしデータの利⽤が可能 Ø ただしこの論⽂内にラベルなしデータを⽤いたような記述はなし • これまでの蒸留⼿法とは異なり教師側も⽣徒側も同じモデル Ø 他の pre-trained モデルを⽤意する必要がない 5
Adaptive inference • 推論時に各層で分類の出⼒を⾏う • 仮説:不確かさが低ければ精度は⾼い Ø 不確かさが低いものはその時点で出⼒を確定し後の層には回さない • 不確かさの閾値として
speed を設定 Ø 不確かさが speed 以下なら出⼒を確定 Ø この値を変える事で推論速度を調節可能 6
Settings • Data : Ø 中国語と英語の分類タスクのデータを各 6 種類 Ø Chinese
: ChnSentiCorp, Book review, Shopping review, Weibo and THUCNews Ø English : Ag.News, Amz.F, DBpedia, Yahoo, Yelp.F and Yelp.P • Model : BERT-base model (Google-research) • Baselines : BERT, DistillBERT • Evaluation Metrics : Ø Accuracy Ø FLOPs (Floating-point operations) 7
Results 8
Trade-offs • 速度の向上は最⼤12倍 • 速度を上げても精度がほとんど損なわれていない 9
Hypothesis verification • 仮説:不確かさが低ければ精度は⾼い Ø 結果を⾒るとどの層でも不確かさが低ければ精度が⾼いことがわかる • 最初の層が強そうに⾒えるがそうではない Ø 最後の層ではほとんどのデータの不確かさが低いため
10
Distribution analysis • speed が 0.8 の場合 60 % 程度のデータを最初の層
のみで処理できている • 低い層では不確かさが⾼いものが多く、低い層の 出⼒結果は⾼い層の出⼒結果によって翻っている かもしれない 11
Ablation study • without distillation : 全分類器を fine-tuning 時に学習 •
without adaptive inference : 何層で出⼒するかが事前に決められた設 定 • 同じレベルの⾼速化がなされている状態 では self-distillation と adaptive inference の双⽅を使ったモデルのスコアが最も良 い 12
Conclusion • スピードをコントロールして速度を上げられる実⽤的な BERT である FastBERT を提案 • self-distillation と
adaptive inference の⼆つの新しい⼿法を導⼊ • 結果的に精度を損なわずに速度を上げる(コントロールする)実⽤的な モデルの学習が可能になった 13