Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
2020論文紹介_Finding-Universal-Grammatical-Relation...
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
Ikumi Yamashita
June 03, 2020
Technology
300
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
2020論文紹介_Finding-Universal-Grammatical-Relations-in-Multilingual-BERT
Ikumi Yamashita
June 03, 2020
More Decks by Ikumi Yamashita
See All by Ikumi Yamashita
2021論文紹介_When-Do-You-Need-Billions-of-Words-of-Pretraining-Data?
ikumi193
0
190
2021EACL/NAACL論文紹介_Multilingual-LAMA-Investigating-Knowledge-in-Multilingual-Pretrained-Language-Models
ikumi193
0
73
2021論文紹介_CANINE:-Pre-training-an-Efficient-Tokenization-Free-Encoder-for-Language-Representation
ikumi193
0
340
2020COLING読み会_Linguistic-Profiling-of-a-Neural-Language-Model
ikumi193
0
110
2020EMNLP読み会_Identifying-Elements-Essential-for-BERT's-Multilinguality
ikumi193
0
140
2020ACL読み会_FastBERT:-a-Self-distilling-BERT-with-Adaptive-Inference-Time
ikumi193
0
170
2019EMNLP読み会_Unicoder_A_Universal_Language_Encoder_by_Pre-training_with_Multiple_Cross-lingual_Tasks
ikumi193
0
79
2019論文読み会_Language-Modeling-with-Shared-Grammar
ikumi193
0
240
2019ACL読み会_Choosing-Transfer-Languages-for-Cross-Lingual-Learning
ikumi193
0
68
Other Decks in Technology
See All in Technology
[RSJ26] Building a VLA Model Based on Self-Distilled Classification
keio_smilab
PRO
0
190
KPIだけでは評価できないプロダクトが考えるべき Evalsという第二の評価系 / Beyond KPIs: Evals as a Second Evaluation Framework for Products #PdEConf
aki_iinuma
3
3.5k
本番に近いテストをもっと手軽に - Postmanで広がるAPIテストの世界 / Expanding the World of API Testing with Postman
yokawasa
1
240
Azure Cost Management の FOCUS コストデータを迷わず読むための“3つの軸”
tetsuyaooooo
0
140
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
sansantech
PRO
0
250
リージョンの壁を越える、 ちょっと変わったAWSサービスの話
falken
PRO
0
210
AIとペアプロを始める。人とのペアプロをやめる。ペアプロの良さを改めて知る。もっと好きになった。 / Rediscovering Pair Programming
honyanya
1
190
Hub & Spoke 環境のネットワークルーティングを分解してみる
tsuyataku
1
520
AIで実装は速くなった。なのにプロダクトは速くならない。職能の壁を越えて価値のフローを設計する
nwiizo
6
6.7k
どんな手を使っても絶対間に合わせるスケジューラ
asari194617
0
1.5k
AIエージェントの開発・提供におけるセキュリティリスクの論点と対策
flatt_security
1
540
PfEingのアプローチで働こう
rindrics
0
160
Featured
See All Featured
エンジニアに許された特別な時間の終わり
watany
108
250k
SEOcharity - Dark patterns in SEO and UX: How to avoid them and build a more ethical web
sarafernandez
0
260
Writing Fast Ruby
sferik
630
63k
Why Your Marketing Sucks and What You Can Do About It - Sophie Logan
marketingsoph
0
400
YesSQL, Process and Tooling at Scale
rocio
174
15k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
700
Design in an AI World
tapps
1
300
Lessons Learnt from Crawling 1000+ Websites
charlesmeaden
PRO
1
1.6k
HU Berlin: Industrial-Strength Natural Language Processing with spaCy and Prodigy
inesmontani
PRO
0
680
Building the Perfect Custom Keyboard
takai
2
860
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
230
Building AI with AI
inesmontani
PRO
1
1.2k
Transcript
Finding Universal Grammatical Relations in Multilingual BERT Ethan A. Chi,
John Hewitt, and Christopher D. Manning Department of Computer Science Stanford University 紹介者:⼭下郁海 (TMU M1 ⼩町研究室) 2020/06/03 @ 論⽂紹介2020
概要 • 多⾔語の BERT で⽂法知識 (構⽂知識) がどのように蓄積されているかを 調べた研究 • 各⾔語の⽂法知識が潜在領域で共有されており、ある⾔語の学習で他⾔
語の⽂法知識の復元が可能であることを⽰した • 潜在領域の状態が Universal Dependency に近いことを⽰した
先⾏研究 [Hewitt et.al., 2019] • structural probe を提案 Ø BERT
や ELMo などの⽂脈埋め込みベクトルの潜在表現を線形変換す ることで、係り受け解析の距離が得られる空間に転写 : ℓ 番⽬の⽂の i 番⽬の単語の潜在表現 : ℓ 番⽬の⽂の解析⽊ T における i 番⽬と j 番⽬の単語の距離 : ℓ 番⽬の⽂ s の⻑さ (単語数)
実験設定 • Data : Universal Dependencies v2 [Nivre et.al., 2020]
• Model : Multilingual BERT (Google-research, pre-trained) 104 languages, 12-layer, 768-hidden, 12-heads, 110M parameters • Baselines : MBERTAND : ランダム初期化された Multilingual BERT LINEAR : 全ての単語の依存構造が左から右に連なっていると仮定 したモデル • 評価⼿法 : UUAS (Unlabeled Undirected Attachment Score) : 各⽂の各単語間に正しい辺が貼られているものの割合 DSpr. : スピアマンの相関係数
構⽂知識の復元 • IN-LANG : 評価する⾔語のデータで structural probe を学習したもの • pre-trained
BERT モデルから依存構造が復元できていることがわかる
構⽂知識の復元 • 線形変換⾏列 の次元数 は 64 以上にしても結果は変わらない → 構⽂知識の部分空間は BERT
の持つ 768 次元の空間の⼀部分である • 依存構造の復元が最もよくできるのは第 7 層
Cross-lingual probing
Cross-lingual probing • 各⾔語間の部分空間⾓度を計算、転移の結果と⽐較した結果、強い正の 相関が⾒られた → 部分空間の類似度が⾼いほど転移した時良い結果が出る
Cross-lingual probing • フランス語 (形容詞の位置が不定 : 69.7% が前置形容詞) prenominal な⾔語でも
postnominal な⾔語でも noun-adjective 間の辺の 復元の精度は⼤きな差はない
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 ü 全⾔語で学習した部分空間に 100,000 の !"## を可視化
Discussion • 多⾔語 BERT は構⽂レベルで⾒ると⾔語間で知識を共有している Ø BERT は明⽰的に構⽂の知識がタグつけされたデータで学習すること なく構⽂の知識をある程度得ている •
UUAS だけでは structural probe の正しい評価はできない Ø 正しい距離を再現するのではなく単語同⼠が辺で繋がっている場合は $ を⼩さく、そうでない場合は⼤きくするようなモデルでも UUAS のスコアは上がる • 今回の研究では t-SNE を⽤いて可視化したグラフの定性的な分析しか⾏ なっていない
まとめ • Multilingual BERT の潜在領域は依存構造の知識を持っている • 依存構造の知識空間は⾔語間である程度共有されており、そのためある ⾔語で学習した structural probe
を⽤いて他の⾔語の依存構造の復元が可 能である • Multilingual BERT が持つ依存構造の知識は Universal Dependencies に近 い状態である