Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
2020論文紹介_Finding-Universal-Grammatical-Relation...
Search
Ikumi Yamashita
June 03, 2020
Technology
300
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
2020論文紹介_Finding-Universal-Grammatical-Relations-in-Multilingual-BERT
Ikumi Yamashita
June 03, 2020
More Decks by Ikumi Yamashita
See All by Ikumi Yamashita
2021論文紹介_When-Do-You-Need-Billions-of-Words-of-Pretraining-Data?
ikumi193
0
190
2021EACL/NAACL論文紹介_Multilingual-LAMA-Investigating-Knowledge-in-Multilingual-Pretrained-Language-Models
ikumi193
0
73
2021論文紹介_CANINE:-Pre-training-an-Efficient-Tokenization-Free-Encoder-for-Language-Representation
ikumi193
0
340
2020COLING読み会_Linguistic-Profiling-of-a-Neural-Language-Model
ikumi193
0
110
2020EMNLP読み会_Identifying-Elements-Essential-for-BERT's-Multilinguality
ikumi193
0
140
2020ACL読み会_FastBERT:-a-Self-distilling-BERT-with-Adaptive-Inference-Time
ikumi193
0
170
2019EMNLP読み会_Unicoder_A_Universal_Language_Encoder_by_Pre-training_with_Multiple_Cross-lingual_Tasks
ikumi193
0
79
2019論文読み会_Language-Modeling-with-Shared-Grammar
ikumi193
0
240
2019ACL読み会_Choosing-Transfer-Languages-for-Cross-Lingual-Learning
ikumi193
0
68
Other Decks in Technology
See All in Technology
Bet AI Day 2026丨Agentは、「金融」という巨大産業の何を変えられるのか
layerx
PRO
0
710
なぜSRE・セキュリティは評価されないのか?守りの組織を事業成長エンジンに変えた実践
cscengineer
PRO
2
2.1k
全員がプロダクトへ向き合う組織を持続成長させるために——組織づくりのフライホイールと4象限 / The Flywheel Model and Four Quadrants for Organizational Design
hiro_torii
3
760
AI-DLCって実際どう? 〜聞きたいこと全部聞いてみる〜
news_it_enj
0
220
GuardDuty 検知対応を DevOps Agent で効率化しようとしている話 / GuardDuty Investigations with DevOps Agent
masahirokawahara
1
280
Benchmarking Vector Databases: pgvector vs. LanceDB
tsho
0
130
全社に広がるMCPサーバーを、 どう安全に管理するか MCPass開発の舞台裏
mtpooh
3
280
APIセキュリティを組織で実現するには~注力する点と設計・実装に入れたい対策~
riiimparm
3
930
Tab5をRubyで動くパソコンにする
kishima
1
130
AI時代に、プロダクトの数だけ積み上がる所有コストをどうエンジニアリングするか / Engineering the Cost of Ownership
kzkmaeda
0
940
ブラウザアプリの継続的パフォーマンスモニタリング (序) / Continuous Browser Application Performance Monitoring; Act 1
moznion
0
110
どんな手を使っても絶対間に合わせるスケジューラ
asari194617
0
1.5k
Featured
See All Featured
The Curious Case for Waylosing
cassininazir
1
490
Bash Introduction
62gerente
615
220k
Templates, Plugins, & Blocks: Oh My! Creating the theme that thinks of everything
marktimemedia
31
2.9k
The Cost Of JavaScript in 2023
addyosmani
55
10k
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.3k
Optimising Largest Contentful Paint
csswizardry
37
3.9k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.6k
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
KATA
mclloyd
PRO
35
15k
Amusing Abliteration
ianozsvald
1
280
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
320
Navigating Algorithm Shifts & AI Overviews - #SMXNext
aleyda
1
1.6k
Transcript
Finding Universal Grammatical Relations in Multilingual BERT Ethan A. Chi,
John Hewitt, and Christopher D. Manning Department of Computer Science Stanford University 紹介者:⼭下郁海 (TMU M1 ⼩町研究室) 2020/06/03 @ 論⽂紹介2020
概要 • 多⾔語の BERT で⽂法知識 (構⽂知識) がどのように蓄積されているかを 調べた研究 • 各⾔語の⽂法知識が潜在領域で共有されており、ある⾔語の学習で他⾔
語の⽂法知識の復元が可能であることを⽰した • 潜在領域の状態が Universal Dependency に近いことを⽰した
先⾏研究 [Hewitt et.al., 2019] • structural probe を提案 Ø BERT
や ELMo などの⽂脈埋め込みベクトルの潜在表現を線形変換す ることで、係り受け解析の距離が得られる空間に転写 : ℓ 番⽬の⽂の i 番⽬の単語の潜在表現 : ℓ 番⽬の⽂の解析⽊ T における i 番⽬と j 番⽬の単語の距離 : ℓ 番⽬の⽂ s の⻑さ (単語数)
実験設定 • Data : Universal Dependencies v2 [Nivre et.al., 2020]
• Model : Multilingual BERT (Google-research, pre-trained) 104 languages, 12-layer, 768-hidden, 12-heads, 110M parameters • Baselines : MBERTAND : ランダム初期化された Multilingual BERT LINEAR : 全ての単語の依存構造が左から右に連なっていると仮定 したモデル • 評価⼿法 : UUAS (Unlabeled Undirected Attachment Score) : 各⽂の各単語間に正しい辺が貼られているものの割合 DSpr. : スピアマンの相関係数
構⽂知識の復元 • IN-LANG : 評価する⾔語のデータで structural probe を学習したもの • pre-trained
BERT モデルから依存構造が復元できていることがわかる
構⽂知識の復元 • 線形変換⾏列 の次元数 は 64 以上にしても結果は変わらない → 構⽂知識の部分空間は BERT
の持つ 768 次元の空間の⼀部分である • 依存構造の復元が最もよくできるのは第 7 層
Cross-lingual probing
Cross-lingual probing • 各⾔語間の部分空間⾓度を計算、転移の結果と⽐較した結果、強い正の 相関が⾒られた → 部分空間の類似度が⾼いほど転移した時良い結果が出る
Cross-lingual probing • フランス語 (形容詞の位置が不定 : 69.7% が前置形容詞) prenominal な⾔語でも
postnominal な⾔語でも noun-adjective 間の辺の 復元の精度は⼤きな差はない
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 • 依存構造の head と dependent のペアに対して k-dimensional head- dependent
vector を次の式で定義 t-SNE を⽤いて⼆次元に可視化 ü 英語で学習した structural probe の部分空 間に英語とフランス語の !"## を可視化 ü スペイン語以外で学習した structural probe の部分空間にスペイン語の !"## を 可視化
依存構造の可視化 ü 全⾔語で学習した部分空間に 100,000 の !"## を可視化
Discussion • 多⾔語 BERT は構⽂レベルで⾒ると⾔語間で知識を共有している Ø BERT は明⽰的に構⽂の知識がタグつけされたデータで学習すること なく構⽂の知識をある程度得ている •
UUAS だけでは structural probe の正しい評価はできない Ø 正しい距離を再現するのではなく単語同⼠が辺で繋がっている場合は $ を⼩さく、そうでない場合は⼤きくするようなモデルでも UUAS のスコアは上がる • 今回の研究では t-SNE を⽤いて可視化したグラフの定性的な分析しか⾏ なっていない
まとめ • Multilingual BERT の潜在領域は依存構造の知識を持っている • 依存構造の知識空間は⾔語間である程度共有されており、そのためある ⾔語で学習した structural probe
を⽤いて他の⾔語の依存構造の復元が可 能である • Multilingual BERT が持つ依存構造の知識は Universal Dependencies に近 い状態である