Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
2020論文紹介_Finding-Universal-Grammatical-Relation...
Search
Ikumi Yamashita
June 03, 2020
Technology
300
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
2020論文紹介_Finding-Universal-Grammatical-Relations-in-Multilingual-BERT
Ikumi Yamashita
June 03, 2020
More Decks by Ikumi Yamashita
See All by Ikumi Yamashita
2021論文紹介_When-Do-You-Need-Billions-of-Words-of-Pretraining-Data?
ikumi193
0
190
2021EACL/NAACL論文紹介_Multilingual-LAMA-Investigating-Knowledge-in-Multilingual-Pretrained-Language-Models
ikumi193
0
71
2021論文紹介_CANINE:-Pre-training-an-Efficient-Tokenization-Free-Encoder-for-Language-Representation
ikumi193
0
330
2020COLING読み会_Linguistic-Profiling-of-a-Neural-Language-Model
ikumi193
0
110
2020EMNLP読み会_Identifying-Elements-Essential-for-BERT's-Multilinguality
ikumi193
0
140
2020ACL読み会_FastBERT:-a-Self-distilling-BERT-with-Adaptive-Inference-Time
ikumi193
0
170
2019EMNLP読み会_Unicoder_A_Universal_Language_Encoder_by_Pre-training_with_Multiple_Cross-lingual_Tasks
ikumi193
0
75
2019論文読み会_Language-Modeling-with-Shared-Grammar
ikumi193
0
230
2019ACL読み会_Choosing-Transfer-Languages-for-Cross-Lingual-Learning
ikumi193
0
65
Other Decks in Technology
See All in Technology
メルカリのグローバルアプリで挑んだ AlloyDB 運用と課題解決の実践記
hatappi
0
240
JavaScript 研修 (2026)
recruitengineers
PRO
2
470
LanceDB入門
mocobeta
4
110
個人OSSが、机の上から世界に広がるまでの話
shinyasaita
1
370
Forza Horizon 6 のテレメトリ機能で 自動運転に使えそうな学習データを集める話
henjin0
0
150
SO-101×VLAによる3色キューブのピック&プレース
abeja
0
160
ガバメントクラウドでのランサムウェア対策
techniczna
2
1k
[しろおび夏祭り2026] チャットするAIから、作業するAIへ - 使われ方の変化と、その裏側で起きていること
kk0n
0
1.7k
侵入は突然に 〜 IoTマルウェアと悪用される家庭の機器 ~ / When Intrusion Strikes: IoT Malware and the Abuse of Home Devices
nttcom
0
1.6k
AI駆動開発は個人技からチーム戦へ:組織でAIを使いこなすための実践設計
moongift
PRO
0
480
ラジオの科学
frievea
0
280
【CEDEC2026】グラフィックスエンジニアのためのニューラルシェーディング入門
cygames
PRO
0
130
Featured
See All Featured
The MySQL Ecosystem @ GitHub 2015
samlambert
251
13k
Connecting the Dots Between Site Speed, User Experience & Your Business [WebExpo 2025]
tammyeverts
11
990
Navigating Algorithm Shifts & AI Overviews - #SMXNext
aleyda
1
1.5k
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
1
850
Bridging the Design Gap: How Collaborative Modelling removes blockers to flow between stakeholders and teams @FastFlow conf
baasie
0
640
Darren the Foodie - Storyboard
khoart
PRO
3
3.6k
Done Done
chrislema
186
16k
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.2k
Redefining SEO in the New Era of Traffic Generation
szymonslowik
1
380
How Software Deployment tools have changed in the past 20 years
geshan
1
34k
4 Signs Your Business is Dying
shpigford
187
22k
Building Applications with DynamoDB
mza
96
7.2k
Transcript
Finding Universal Grammatical Relations in Multilingual BERT Ethan A. Chi,
John Hewitt, and Christopher D. Manning Department of Computer Science Stanford University 紹介者:⼭下郁海 (TMU M1 ⼩町研究室) 2020/06/03 @ 論⽂紹介2020
概要 • 多⾔語の BERT で⽂法知識 (構⽂知識) がどのように蓄積されているかを 調べた研究 • 各⾔語の⽂法知識が潜在領域で共有されており、ある⾔語の学習で他⾔
語の⽂法知識の復元が可能であることを⽰した • 潜在領域の状態が Universal Dependency に近いことを⽰した
先⾏研究 [Hewitt et.al., 2019] • structural probe を提案 Ø BERT
や ELMo などの⽂脈埋め込みベクトルの潜在表現を線形変換す ることで、係り受け解析の距離が得られる空間に転写 : ℓ 番⽬の⽂の i 番⽬の単語の潜在表現 : ℓ 番⽬の⽂の解析⽊ T における i 番⽬と j 番⽬の単語の距離 : ℓ 番⽬の⽂ s の⻑さ (単語数)
実験設定 • Data : Universal Dependencies v2 [Nivre et.al., 2020]
• Model : Multilingual BERT (Google-research, pre-trained) 104 languages, 12-layer, 768-hidden, 12-heads, 110M parameters • Baselines : MBERTAND : ランダム初期化された Multilingual BERT LINEAR : 全ての単語の依存構造が左から右に連なっていると仮定 したモデル • 評価⼿法 : UUAS (Unlabeled Undirected Attachment Score) : 各⽂の各単語間に正しい辺が貼られているものの割合 DSpr. : スピアマンの相関係数
構⽂知識の復元 • IN-LANG : 評価する⾔語のデータで structural probe を学習したもの • pre-trained
BERT モデルから依存構造が復元できていることがわかる
構⽂知識の復元 • 線形変換⾏列 の次元数 は 64 以上にしても結果は変わらない → 構⽂知識の部分空間は BERT
の持つ 768 次元の空間の⼀部分である • 依存構造の復元が最もよくできるのは第 7 層
Cross-lingual probing
Cross-lingual probing • 各⾔語間の部分空間⾓度を計算、転移の結果と⽐較した結果、強い正の 相関が⾒られた → 部分空間の類似度が⾼いほど転移した時良い結果が出る
Cross-lingual probing • フランス語 (形容詞の位置が不定 : 69.7% が前置形容詞) prenominal な⾔語でも
postnominal な⾔語でも noun-adjective 間の辺の 復元の精度は⼤きな差はない
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 ü 全⾔語で学習した部分空間に 100,000 の !"## を可視化
Discussion • 多⾔語 BERT は構⽂レベルで⾒ると⾔語間で知識を共有している Ø BERT は明⽰的に構⽂の知識がタグつけされたデータで学習すること なく構⽂の知識をある程度得ている •
UUAS だけでは structural probe の正しい評価はできない Ø 正しい距離を再現するのではなく単語同⼠が辺で繋がっている場合は $ を⼩さく、そうでない場合は⼤きくするようなモデルでも UUAS のスコアは上がる • 今回の研究では t-SNE を⽤いて可視化したグラフの定性的な分析しか⾏ なっていない
まとめ • Multilingual BERT の潜在領域は依存構造の知識を持っている • 依存構造の知識空間は⾔語間である程度共有されており、そのためある ⾔語で学習した structural probe
を⽤いて他の⾔語の依存構造の復元が可 能である • Multilingual BERT が持つ依存構造の知識は Universal Dependencies に近 い状態である