Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Poly-encoders: Architectures and Pre-training S...
Search
Scatter Lab Inc.
February 27, 2020
Research
2.7k
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence scoring
Scatter Lab Inc.
February 27, 2020
More Decks by Scatter Lab Inc.
See All by Scatter Lab Inc.
zeta introduction
scatterlab
0
1.9k
SimCLR: A Simple Framework for Contrastive Learning of Visual Representations
scatterlab
0
4.4k
Adversarial Filters of Dataset Biases
scatterlab
0
2.3k
Sparse, Dense, and Attentional Representations for Text Retrieval
scatterlab
0
2.3k
Weight Poisoning Attacks on Pre-trained Models
scatterlab
0
2.2k
Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval
scatterlab
0
2.6k
Beyond Accuracy: Behavioral Testing of NLP Models with CheckList
scatterlab
0
2.3k
Open-Retrieval Conversational Question Answering
scatterlab
0
2.3k
What Can Neural Networks Reason About?
scatterlab
0
2.3k
Other Decks in Research
See All in Research
IA for theory
gpeyre
0
260
長時間動画QAにおけるマルチエージェント推論 ・SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
murakawatakuya
1
160
AY 2026 Guide to Academic Writing Using Generative AI - Workshop
ks91
PRO
0
130
シングルチャネルマルチトーカー音声認識の進展
ryomasumura
0
190
Ghost in the 7‑Zip: The Shadow of Residential Proxies Creeping into Your Life
nttcom
0
1.6k
2026 東京科学大 情報通信系 研究室紹介 (大岡山)
icttitech
0
4k
言語モデルから言語について語る際に押さえておきたいこと
eumesy
PRO
6
2.5k
(SIGQS17) Frasco-VS:フラグメントに基づく薬剤候補化合物選抜の量子アニーリングによる実現
keisukeyanagisawa
PRO
0
160
敵対生成プロンプト同時探索による内省型プロンプト最適化
kinoue_smarthr
0
310
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
560
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
shunk031
4
1.1k
セマンティック通信勉強会 6Gに向けたデバイス間効率的な通信の技術紹介・課題・今後展望
satai
3
230
Featured
See All Featured
Building an army of robots
kneath
306
46k
Easily Structure & Communicate Ideas using Wireframe
afnizarnur
194
17k
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
133
19k
WENDY [Excerpt]
tessaabrams
11
38k
How To Speak Unicorn (iThemes Webinar)
marktimemedia
1
510
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
340
HU Berlin: Industrial-Strength Natural Language Processing with spaCy and Prodigy
inesmontani
PRO
0
530
Technical Leadership for Architectural Decision Making
baasie
3
440
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
180
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.1k
The Invisible Side of Design
smashingmag
301
52k
Transcript
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring (ML Research Scientist, Pingpong)
• Pretrained Transformerܳ ਊೞৈ द௫झр Pairwise োਸ ೡ ٸ ࢎਊೞח
ߑߨۿ ѱ 2о • Cross-encoder • ف द௫झܳ ೞա Encoderী زदী ੑ۱ೞৈ द௫झ р full self-attentionਸ ࣻ೯ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ જਵա, पࢎਊೞӝূ ցޖ וܿ • Bi-encoder • ف द௫झܳ ߹ب۽ ੋ٬ೞҊ ف Representation ࢎ झযܳ ҅ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ ؊ ծਵա, पࢎਊী ਬܻ • ࠄ ֤ޙীࢲח Cross-encoderࠁ पࢎਊী ਬܻೞҊ Bi-encoderࠁ ؊ ࢿמ જ Poly-Encoder ߑधਸ ઁউ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ѐਃ
• Transformers • Pretrained BERT (base) (by Devlin et al)
• о Pretrainೠ 2ѐ BERT • Pretrained BERT৬ زੌೠ Objectives + زੌೠ ؘఠࣇਵ۽ णೠ BERT • Pretrained BERT৬ زੌೠ Objectives + Redditਵ۽ णೠ BERT • न, ೞಌۄఠ ١ ੜೠ ࢸ XLM (Lample & Conneau, 2019) ࢸਸ ٮܴ • ࢎ णद INPUT (അ ޙ)җ LABEL ( ޙ)ਸ [S]ۄח ౠࣻ షਵ۽ хस • REDDITਵ۽ ࢎणೡ ٸ, Next Sentence Prediction కझ Next Sentenceח ৈ۞ ޙਵ۽ ܖয ࣻ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ӝࠄ ࢸ
• Context৬ Reply Candidateܳ ߹ب BERT۽ ੋ٬ • زੌೠ о۽
द೧ࢲ णೞח زউ ف BERTח ࢲ۽ ܰѱ সؘؽ • Reduction: BERT द௫झ ইਓುਸ Reductionೞח ߑߨ 1. ష ([S])ਸ ਊ 2. ష߹ ইਓುਸ ಣӐ 3. షࠗఠ mѐө షਸ ಣӐ • प Ѿҗ ష݅ ਊೞחѱ ઁੌ ࢿמ જও • Score: ف ੋ؊ ইਓುਸ dot-productೠ чਸ झয۽ ࢎਊ • णदীח زੌೠ ߓ ղ ܲ Reply Candidatesܳ Negatives۽ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Bi-Encoder
• Context৬ Reply Candidateܳ [S]۽ Concatೞৈ BERTী ੑ۱ • Transformer
п ۨয݃ Context৬ Reply Token-level Attention оמೞ۽ ࢿמ࢚ ਬܻ • Score • • Reply Candidatesܳ ܻ োೡ ࣻ হח ױ • IR ࠙ঠ ١ীࢲ ࢎਊೞӝ য۰ ݽ؛ ҳઑ Score(C, R) = yc,r W Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Cross-Encoder
• Replyח Pooled Outputਵ۽ ੋ٬ೞҊ Contextח Sequence Outputਵ۽ ੋ٬ •
ੌ߈ਵ۽ Contextח Replyࠁ ഻ঁ ӡ݅ Bi-Encoderীࢲח Contextܳ ೞա ߭ఠ۽ ܻ؋࣌ೞӝ ٸޙী ࠁ ࣚप ѱ ߊࢤೣ. • Contextܳ ӡ m ߭ఠ۽ അೞݶ ࠁ ࣚप ਸ Ѫ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (1/2)
• Attention ো 1. mѐ Context Codes( )ܳ where
• , Context Codesо Query, Context Sequence Output Key, Valueੋ Attention ো 2. Reply pooled outputҗ 1ߣ োਵ۽ࠗఠ য ӡ m Context ߭ఠ৬ ো where • , Reply ߭ఠо Query, Context ߭ఠо Key, Valueੋ Attention ো c1 , . . . , cm yi ctxt = ∑ j wci j hj (wci 1 , . . . , wci N ) = softmax(ci h1 , . . . , . ci hN ) yctxt = ∑ i wi yi ctxt (w1 , . . . , wm ) = softmax(ycandi y1 ctxt , . . . , . ycandi ym ctxt ) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (2/2)
• Next Utterance Retrieval ݽ؛ ҳೞҊ ೞח ч: • ױࣽ
Binary Classificationۄ оೞݶ: where • ࠄ ֤ޙীࢲ ࢎਊೠ ۚ (ױ, N ण ߓ ࢎૉ) • ח द௫झ р ࣻܳ ੧ ࣻ ח Metric (֤ޙীࢲח Dot Product) P(R|C) P(R|C) = P(L = 1|R, C) L ∈ {0,1} P(R|C) = P(R, C) ∑ k P(Rk , C) ≈ eS(R,C) ∑N k eS(Rk ,C) S(R, C) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ण ۚ
• Dialogue ࠙ঠ ߂ Article Search ࠙ঠীࢲ पਸ ࣻ೯ •
NeurIPS ConvAI2 • Facebook Persona-Chat Dataset • DSTC7 Track1 • Ubuntu chat logs • Ubuntu V2 corpus • DSTC7 Track1ীࢲ ઁҕغח ؘఠࣇࠁ ખ ؊ ࢎૉ ؘఠ • Wikipedia Article Search • য ਤఃೖ٣ই ؒীࢲ Ѩ࢝ ௪ܻ৬ ҙ۲ػ ӝࢎ ӝ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Tasks
• ण ߓ ࢎૉী ٮܲ ࢿמ ߸ച Poly-encoders: Architectures and
Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Bi- or Cross-Encoder) • Fine-tuningद Fine-tuningೞח ۄఠী ٮܲ ࢿמ ߸ച
• ࢸ • Optimizer۽ח Adamax Optimizer • Bi-, Cross-Encoder৬ח ׳ܻ
ݽٚ ۨযܳ ण • BERT last linear Layerܳ re-scale (ইਓು чী ౠ чਸ ғೣ) • ѱ ࢚҃ णী ࣻ • Context codes ѐࣻ mਸ ߄Լоݶࢲ पೣ • ӝఋ ࢸ Bi-Encoder৬ زੌ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• ஏ ࢿמ (ࢿמ ח ֤ޙ ଵҊ) • Cross-Encoder>Poly-Encoder>Bi-Encoder •
Poly-Encoderח Codes ѐࣻܳ טܾࣻ۾ ࢿמ ೱ࢚ؽ • Pretrained-BERTী ٮܲ ࢿמ ߸ച • Our BERT Pretrained on Reddit > Our BERT pertained on Toronto Books+Wiki > Pretrained-BERT (Devlin et al., 2019) • Pretrained-BERT(Devlin et al., 2019)ܳ ਊ೮ਸ ٸب ӝઓ SOTAח оߺѱ ӣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• Inference Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• BERTܳ ਊೞৈ candidate selection tasks ಽ ٸ ݽ؛ ҳઑ
߂ ࢎ ण ۚਸ ઁউ • Poly-Encoder • Context Representationsী Attendೞب۾ ೞৈ ࢿמਸ ֫ݶࢲ, ӝઓ pre-calculateೞח ҳઑܳ ਬೞৈ ࡅܲ ஏਸ оמೞѱ ೣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Ѿۿ
• Training Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Appendix (1/2) • Reduction Layer in Bi-Encoder
• Context Vectorsী ٮܲ ࢿמ ߸ച • Code Vectors৬ Attention
োद BERT Sequence Outputਸ ݽف ਊ • BERT Sequence Output mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ৬ ష(<CLS>)݅ਸ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Appendix (2/2)
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring