Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Poly-encoders: Architectures and Pre-training S...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Scatter Lab Inc.
February 27, 2020
Research
2.7k
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence scoring
Scatter Lab Inc.
February 27, 2020
More Decks by Scatter Lab Inc.
See All by Scatter Lab Inc.
zeta introduction
scatterlab
0
1.9k
SimCLR: A Simple Framework for Contrastive Learning of Visual Representations
scatterlab
0
4.4k
Adversarial Filters of Dataset Biases
scatterlab
0
2.3k
Sparse, Dense, and Attentional Representations for Text Retrieval
scatterlab
0
2.3k
Weight Poisoning Attacks on Pre-trained Models
scatterlab
0
2.2k
Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval
scatterlab
0
2.6k
Beyond Accuracy: Behavioral Testing of NLP Models with CheckList
scatterlab
0
2.3k
Open-Retrieval Conversational Question Answering
scatterlab
0
2.3k
What Can Neural Networks Reason About?
scatterlab
0
2.3k
Other Decks in Research
See All in Research
SAKURAONE:An Open Ethernet-based AI HPC System And Its Observed Workload Dynamicsin a Single-Tenant LLM Development Environment
yuukit
1
480
Dual Quadric表現を用いた動的物体追跡とRGB-D・IMU制約の密結合によるオドメトリ推定
nanoshimarobot
0
470
Fukui Shibiten 39 - AI Art
butchi
0
160
[IR Reading 2026春 論文紹介] LLM-based Listwise Reranking under the Effect of Positional Bias (ECIR 2026) /IR-Reading-2026-Spring
koheishinden
PRO
0
270
Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering
anatolykr
0
240
LA-Bench 2025:実験指示から実行可能手順を生成するためのデータセット/LA-Bench 2025: A Dataset for Generating Executable Experimental Procedures from Experimental Instructions
stktu
0
110
260624_NLP-colloquium: Hubness
de9uch1
1
150
Sequences of Logits Reveal the Low Rank Structure of Language Models
sansantech
PRO
1
300
【ローカルAI LT大会】SSE: Stable Static Embedding ー速度低下を伴わず 静的埋め込みモデルの潜在能力を引き出す Dynamic Tanh手法の提案
rikkabotan7
0
100
[CV勉強会@関東 CVPR2026] PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow / kantocv 67th CVPR 2026
shunk031
0
200
[BlackHatAsia2026] Hidden Telemetry: Uncovering TraceLogging ETW Providers You're Not Using (Yet)
asuna_jp
1
610
コーディングエージェントとABNを再考
hf149
2
800
Featured
See All Featured
Are puppies a ranking factor?
jonoalderson
1
3.7k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.5k
Heart Work Chapter 1 - Part 1
lfama
PRO
8
36k
[Rails World 2023 - Day 1 Closing Keynote] - The Magic of Rails
eileencodes
38
2.9k
Code Review Best Practice
trishagee
74
20k
Deep Space Network (abreviated)
tonyrice
0
240
Thoughts on Productivity
jonyablonski
76
5.3k
How Software Deployment tools have changed in the past 20 years
geshan
1
34k
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
35
2.5k
The SEO identity crisis: Don't let AI make you average
varn
0
520
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Pawsitive SEO: Lessons from My Dog (and Many Mistakes) on Thriving as a Consultant in the Age of AI
davidcarrasco
0
200
Transcript
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring (ML Research Scientist, Pingpong)
• Pretrained Transformerܳ ਊೞৈ द௫झр Pairwise োਸ ೡ ٸ ࢎਊೞח
ߑߨۿ ѱ 2о • Cross-encoder • ف द௫झܳ ೞա Encoderী زदী ੑ۱ೞৈ द௫झ р full self-attentionਸ ࣻ೯ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ જਵա, पࢎਊೞӝূ ցޖ וܿ • Bi-encoder • ف द௫झܳ ߹ب۽ ੋ٬ೞҊ ف Representation ࢎ झযܳ ҅ೞח ߑߨ • ੌ߈ਵ۽ ࢿמ ؊ ծਵա, पࢎਊী ਬܻ • ࠄ ֤ޙীࢲח Cross-encoderࠁ पࢎਊী ਬܻೞҊ Bi-encoderࠁ ؊ ࢿמ જ Poly-Encoder ߑधਸ ઁউ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ѐਃ
• Transformers • Pretrained BERT (base) (by Devlin et al)
• о Pretrainೠ 2ѐ BERT • Pretrained BERT৬ زੌೠ Objectives + زੌೠ ؘఠࣇਵ۽ णೠ BERT • Pretrained BERT৬ زੌೠ Objectives + Redditਵ۽ णೠ BERT • न, ೞಌۄఠ ١ ੜೠ ࢸ XLM (Lample & Conneau, 2019) ࢸਸ ٮܴ • ࢎ णद INPUT (അ ޙ)җ LABEL ( ޙ)ਸ [S]ۄח ౠࣻ షਵ۽ хस • REDDITਵ۽ ࢎणೡ ٸ, Next Sentence Prediction కझ Next Sentenceח ৈ۞ ޙਵ۽ ܖয ࣻ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ӝࠄ ࢸ
• Context৬ Reply Candidateܳ ߹ب BERT۽ ੋ٬ • زੌೠ о۽
द೧ࢲ णೞח زউ ف BERTח ࢲ۽ ܰѱ সؘؽ • Reduction: BERT द௫झ ইਓುਸ Reductionೞח ߑߨ 1. ష ([S])ਸ ਊ 2. ష߹ ইਓುਸ ಣӐ 3. షࠗఠ mѐө షਸ ಣӐ • प Ѿҗ ష݅ ਊೞחѱ ઁੌ ࢿמ જও • Score: ف ੋ؊ ইਓುਸ dot-productೠ чਸ झয۽ ࢎਊ • णदীח زੌೠ ߓ ղ ܲ Reply Candidatesܳ Negatives۽ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Bi-Encoder
• Context৬ Reply Candidateܳ [S]۽ Concatೞৈ BERTী ੑ۱ • Transformer
п ۨয݃ Context৬ Reply Token-level Attention оמೞ۽ ࢿמ࢚ ਬܻ • Score • • Reply Candidatesܳ ܻ োೡ ࣻ হח ױ • IR ࠙ঠ ١ীࢲ ࢎਊೞӝ য۰ ݽ؛ ҳઑ Score(C, R) = yc,r W Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Cross-Encoder
• Replyח Pooled Outputਵ۽ ੋ٬ೞҊ Contextח Sequence Outputਵ۽ ੋ٬ •
ੌ߈ਵ۽ Contextח Replyࠁ ഻ঁ ӡ݅ Bi-Encoderীࢲח Contextܳ ೞա ߭ఠ۽ ܻ؋࣌ೞӝ ٸޙী ࠁ ࣚप ѱ ߊࢤೣ. • Contextܳ ӡ m ߭ఠ۽ അೞݶ ࠁ ࣚप ਸ Ѫ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (1/2)
• Attention ো 1. mѐ Context Codes( )ܳ where
• , Context Codesо Query, Context Sequence Output Key, Valueੋ Attention ো 2. Reply pooled outputҗ 1ߣ োਵ۽ࠗఠ য ӡ m Context ߭ఠ৬ ো where • , Reply ߭ఠо Query, Context ߭ఠо Key, Valueੋ Attention ো c1 , . . . , cm yi ctxt = ∑ j wci j hj (wci 1 , . . . , wci N ) = softmax(ci h1 , . . . , . ci hN ) yctxt = ∑ i wi yi ctxt (w1 , . . . , wm ) = softmax(ycandi y1 ctxt , . . . , . ycandi ym ctxt ) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Poly-Encoder (2/2)
• Next Utterance Retrieval ݽ؛ ҳೞҊ ೞח ч: • ױࣽ
Binary Classificationۄ оೞݶ: where • ࠄ ֤ޙীࢲ ࢎਊೠ ۚ (ױ, N ण ߓ ࢎૉ) • ח द௫झ р ࣻܳ ੧ ࣻ ח Metric (֤ޙীࢲח Dot Product) P(R|C) P(R|C) = P(L = 1|R, C) L ∈ {0,1} P(R|C) = P(R, C) ∑ k P(Rk , C) ≈ eS(R,C) ∑N k eS(Rk ,C) S(R, C) Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring ण ۚ
• Dialogue ࠙ঠ ߂ Article Search ࠙ঠীࢲ पਸ ࣻ೯ •
NeurIPS ConvAI2 • Facebook Persona-Chat Dataset • DSTC7 Track1 • Ubuntu chat logs • Ubuntu V2 corpus • DSTC7 Track1ীࢲ ઁҕغח ؘఠࣇࠁ ખ ؊ ࢎૉ ؘఠ • Wikipedia Article Search • য ਤఃೖ٣ই ؒীࢲ Ѩ࢝ ௪ܻ৬ ҙ۲ػ ӝࢎ ӝ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Tasks
• ण ߓ ࢎૉী ٮܲ ࢿמ ߸ച Poly-encoders: Architectures and
Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Bi- or Cross-Encoder) • Fine-tuningद Fine-tuningೞח ۄఠী ٮܲ ࢿמ ߸ച
• ࢸ • Optimizer۽ח Adamax Optimizer • Bi-, Cross-Encoder৬ח ׳ܻ
ݽٚ ۨযܳ ण • BERT last linear Layerܳ re-scale (ইਓು чী ౠ чਸ ғೣ) • ѱ ࢚҃ णী ࣻ • Context codes ѐࣻ mਸ ߄Լоݶࢲ पೣ • ӝఋ ࢸ Bi-Encoder৬ زੌ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• ஏ ࢿמ (ࢿמ ח ֤ޙ ଵҊ) • Cross-Encoder>Poly-Encoder>Bi-Encoder •
Poly-Encoderח Codes ѐࣻܳ טܾࣻ۾ ࢿמ ೱ࢚ؽ • Pretrained-BERTী ٮܲ ࢿמ ߸ച • Our BERT Pretrained on Reddit > Our BERT pertained on Toronto Books+Wiki > Pretrained-BERT (Devlin et al., 2019) • Pretrained-BERT(Devlin et al., 2019)ܳ ਊ೮ਸ ٸب ӝઓ SOTAח оߺѱ ӣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• Inference Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Experiments (Poly-Encoder)
• BERTܳ ਊೞৈ candidate selection tasks ಽ ٸ ݽ؛ ҳઑ
߂ ࢎ ण ۚਸ ઁউ • Poly-Encoder • Context Representationsী Attendೞب۾ ೞৈ ࢿמਸ ֫ݶࢲ, ӝઓ pre-calculateೞח ҳઑܳ ਬೞৈ ࡅܲ ஏਸ оמೞѱ ೣ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Ѿۿ
• Training Time Poly-encoders: Architectures and Pre-training Strategies for Fast
and Accurate Multi-sentence Scoring Appendix (1/2) • Reduction Layer in Bi-Encoder
• Context Vectorsী ٮܲ ࢿמ ߸ച • Code Vectors৬ Attention
োद BERT Sequence Outputਸ ݽف ਊ • BERT Sequence Output mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ݅ਸ ਊ • BERT Sequence Output ݄݃ mѐ৬ ష(<CLS>)݅ਸ ਊ Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence Scoring Appendix (2/2)
Poly-encoders: Architectures and Pre-training Strategies for Fast and Accurate Multi-sentence
Scoring