Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Poly-encoders: Architectures and Pre-training S...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Scatter Lab Inc.
February 27, 2020
Research
2.7k
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence scoring
Scatter Lab Inc.
February 27, 2020
More Decks by Scatter Lab Inc.
See All by Scatter Lab Inc.
zeta introduction
scatterlab
0
2k
SimCLR: A Simple Framework for Contrastive Learning of Visual Representations
scatterlab
0
4.5k
Adversarial Filters of Dataset Biases
scatterlab
0
2.3k
Sparse, Dense, and Attentional Representations for Text Retrieval
scatterlab
0
2.4k
Weight Poisoning Attacks on Pre-trained Models
scatterlab
0
2.2k
Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval
scatterlab
0
2.6k
Beyond Accuracy: Behavioral Testing of NLP Models with CheckList
scatterlab
0
2.4k
Open-Retrieval Conversational Question Answering
scatterlab
0
2.3k
What Can Neural Networks Reason About?
scatterlab
0
2.3k
Other Decks in Research
See All in Research
最先端NLP勉強会2026 論文紹介:Reasoning with Sampling: Your Base Model is Smarter Than You Think (ICLR 2026 paper)
kogoro
4
590
長時間動画QAにおけるマルチエージェント推論 ・SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
murakawatakuya
1
200
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
21
24k
医療LLMの現在地〜最新研究から社会実装までを考える〜
kento1109
1
1.7k
COMETAを用いたデータ民主化運動の歴史
sazimai
0
240
Karkada さんの論文 × 2 の紹介: (1) Closed-Form Training Dynamics Reveal Learned Features and Linear Structure in Word2Vec-like Models, (2) Symmetry in language statistics shapes the geometry of model representations
eumesy
PRO
1
680
MIRU2026 チュートリアル講演2:三次元データ処理の動向
nnchiba
6
4.8k
データサイエンティストの就労意識~2015 → 2026 一般(個人)会員アンケートより
datascientistsociety
PRO
0
760
大規模言語モデルは誰を覚えているか / Who Do Large Language Models Memorize?
upura
0
160
Fukui Shibiten 39 - AI Art
butchi
0
190
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
650
Sleuthcon Keynote - How Cybercriminals (ab)use AI
fr0gger
0
320
Featured
See All Featured
Game over? The fight for quality and originality in the time of robots
wayneb77
1
260
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
1
2.7k
New Earth Scene 8
popppiees
3
2.5k
Sam Torres - BigQuery for SEOs
techseoconnect
PRO
0
530
Prompt Engineering for Job Search
mfonobong
0
440
HTML-Aware ERB: The Path to Reactive Rendering @ RubyCon 2026, Rimini, Italy
marcoroth
4
580
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.1k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
710
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.3k
The Straight Up "How To Draw Better" Workshop
denniskardys
239
140k
The Myth of the Modular Monolith - Day 2 Keynote - Rails World 2024
eileencodes
28
3.6k
What does AI have to do with Human Rights?
axbom
PRO
1
2.4k
Transcript
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring (ML Research Scientist, Pingpong)
• Pretrained Transformerܳ ਊೞৈ द௫झр Pairwise োਸ ೡ ٸ ࢎਊೞח
ߑߨۿ ѱ 2о • Cross-encoder • ف द௫झܳ ೞա Encoderী زदী ੑ۱ೞৈ द௫झ р full self-attentionਸ ࣻ೯ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ જਵա, पࢎਊೞӝূ ցޖ וܿ • Bi-encoder • ف द௫झܳ ߹ب۽ ੋ٬ೞҊ ف Representation ࢎ झযܳ ҅ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ ؊ ծਵա, पࢎਊী ਬܻ • ࠄ ֤ޙীࢲח Cross-encoderࠁ पࢎਊী ਬܻೞҊ Bi-encoderࠁ ؊ ࢿמ જ Poly-Encoder ߑधਸ ઁউ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ѐਃ
• Transformers • Pretrained BERT (base) (by Devlin et al)
• о Pretrainೠ 2ѐ BERT • Pretrained BERT৬ زੌೠ Objectives + زੌೠ ؘఠࣇਵ۽ णೠ BERT • Pretrained BERT৬ زੌೠ Objectives + Redditਵ۽ णೠ BERT • न, ೞಌۄఠ ١ ੜೠ ࢸ XLM (Lample & Conneau, 2019) ࢸਸ ٮܴ • ࢎ णद INPUT (അ ޙ)җ LABEL ( ޙ)ਸ [S]ۄח ౠࣻ షਵ۽ хस • REDDITਵ۽ ࢎणೡ ٸ, Next Sentence Prediction కझ Next Sentenceח ৈ۞ ޙਵ۽ ܖয ࣻ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ӝࠄ ࢸ
• Context৬ Reply Candidateܳ ߹ب BERT۽ ੋ٬ • زੌೠ о۽
द೧ࢲ णೞח زউ ف BERTח ࢲ۽ ܰѱ সؘؽ • Reduction: BERT द௫झ ইਓುਸ Reductionೞח ߑߨ 1. ష ([S])ਸ ਊ 2. ష߹ ইਓುਸ ಣӐ 3. షࠗఠ mѐө షਸ ಣӐ • प Ѿҗ ష݅ ਊೞחѱ ઁੌ ࢿמ જও • Score: ف ੋ؊ ইਓುਸ dot-productೠ чਸ झয۽ ࢎਊ • णदীח زੌೠ ߓ ղ ܲ Reply Candidatesܳ Negatives۽ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Bi-Encoder
• Context৬ Reply Candidateܳ [S]۽ Concatೞৈ BERTী ੑ۱ • Transformer
п ۨয݃ Context৬ Reply Token-level Attention оמೞ۽ ࢿמ࢚ ਬܻ • Score • • Reply Candidatesܳ ܻ োೡ ࣻ হח ױ • IR ࠙ঠ ١ীࢲ ࢎਊೞӝ য۰ ݽ؛ ҳઑ Score(C, R) = yc,r W Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Cross-Encoder
• Replyח Pooled Outputਵ۽ ੋ٬ೞҊ Contextח Sequence Outputਵ۽ ੋ٬ •
ੌ߈ਵ۽ Contextח Replyࠁ ഻ঁ ӡ݅ Bi-Encoderীࢲח Contextܳ ೞա ߭ఠ۽ ܻ؋࣌ೞӝ ٸޙী ࠁ ࣚप ѱ ߊࢤೣ. • Contextܳ ӡ m ߭ఠ۽ അೞݶ ࠁ ࣚप ਸ Ѫ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (1/2)
• Attention ো 1. mѐ Context Codes( )ܳ where
• , Context Codesо Query, Context Sequence Output Key, Valueੋ Attention ো 2. Reply pooled outputҗ 1ߣ োਵ۽ࠗఠ য ӡ m Context ߭ఠ৬ ো where • , Reply ߭ఠо Query, Context ߭ఠо Key, Valueੋ Attention ো c1 , . . . , cm yi ctxt = ∑ j wci j hj (wci 1 , . . . , wci N ) = softmax(ci h1 , . . . , . ci hN ) yctxt = ∑ i wi yi ctxt (w1 , . . . , wm ) = softmax(ycandi y1 ctxt , . . . , . ycandi ym ctxt ) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (2/2)
• Next Utterance Retrieval ݽ؛ ҳೞҊ ೞח ч: • ױࣽ
Binary Classificationۄ оೞݶ: where • ࠄ ֤ޙীࢲ ࢎਊೠ ۚ (ױ, N ण ߓ ࢎૉ) • ח द௫झ р ࣻܳ ੧ ࣻ ח Metric (֤ޙীࢲח Dot Product) P(R|C) P(R|C) = P(L = 1|R, C) L ∈ {0,1} P(R|C) = P(R, C) ∑ k P(Rk , C) ≈ eS(R,C) ∑N k eS(Rk ,C) S(R, C) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ण ۚ
• Dialogue ࠙ঠ ߂ Article Search ࠙ঠীࢲ पਸ ࣻ೯ •
NeurIPS ConvAI2 • Facebook Persona-Chat Dataset • DSTC7 Track1 • Ubuntu chat logs • Ubuntu V2 corpus • DSTC7 Track1ীࢲ ઁҕغח ؘఠࣇࠁ ખ ؊ ࢎૉ ؘఠ • Wikipedia Article Search • য ਤఃೖ٣ই ؒীࢲ Ѩ࢝ ௪ܻ৬ ҙ۲ػ ӝࢎ ӝ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Tasks
• ण ߓ ࢎૉী ٮܲ ࢿמ ߸ച Poly-encoders: Architectures and
Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Bi- or Cross-Encoder) • Fine-tuningद Fine-tuningೞח ۄఠী ٮܲ ࢿמ ߸ച
• ࢸ • Optimizer۽ח Adamax Optimizer • Bi-, Cross-Encoder৬ח ׳ܻ
ݽٚ ۨযܳ ण • BERT last linear Layerܳ re-scale (ইਓು чী ౠ чਸ ғೣ) • ѱ ࢚҃ णী ࣻ • Context codes ѐࣻ mਸ ߄Լоݶࢲ पೣ • ӝఋ ࢸ Bi-Encoder৬ زੌ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• ஏ ࢿמ (ࢿמ ח ֤ޙ ଵҊ) • Cross-Encoder>Poly-Encoder>Bi-Encoder •
Poly-Encoderח Codes ѐࣻܳ טܾࣻ۾ ࢿמ ೱ࢚ؽ • Pretrained-BERTী ٮܲ ࢿמ ߸ച • Our BERT Pretrained on Reddit > Our BERT pertained on Toronto Books+Wiki > Pretrained-BERT (Devlin et al., 2019) • Pretrained-BERT(Devlin et al., 2019)ܳ ਊ೮ਸ ٸب ӝઓ SOTAח оߺѱ ӣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• Inference Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• BERTܳ ਊೞৈ candidate selection tasks ಽ ٸ ݽ؛ ҳઑ
߂ ࢎ ण ۚਸ ઁউ • Poly-Encoder • Context Representationsী Attendೞب۾ ೞৈ ࢿמਸ ֫ݶࢲ, ӝઓ pre-calculateೞח ҳઑܳ ਬೞৈ ࡅܲ ஏਸ оמೞѱ ೣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Ѿۿ
• Training Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Appendix (1/2) • Reduction Layer in Bi-Encoder
• Context Vectorsী ٮܲ ࢿמ ߸ച • Code Vectors৬ Attention
োद BERT Sequence Outputਸ ݽف ਊ • BERT Sequence Output mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ৬ ష(<CLS>)݅ਸ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Appendix (2/2)
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring