Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
文献紹介:Unsupervised Word Polysemy Quantification ...
Search
Taichi Aida
July 23, 2021
Research
140
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
文献紹介:Unsupervised Word Polysemy Quantification with Multiresolution Grids of Contextual Embeddings
Taichi Aida
July 23, 2021
More Decks by Taichi Aida
See All by Taichi Aida
意味を表すベクトル表現を用いたテキスト分析
a1da4
0
170
スウェーデン滞在報告
a1da4
0
46
PhD Defence: Considering Temporal and Contextual Information for Lexical Semantic Change Detection
a1da4
1
330
文献紹介:A Multidimensional Framework for Evaluating Lexical Semantic Change with Social Science Applications
a1da4
1
430
YANS2024:目指せ国際会議!「ネットワーキングの極意(国際会議編)」
a1da4
0
360
言語処理学会30周年記念事業留学支援交流会@YANS2024:「学生のための短期留学」
a1da4
1
480
新入生向けチュートリアル:文献のサーベイv2
a1da4
19
13k
文献紹介:Isotropic Representation Can Improve Zero-Shot Cross-Lingual Transfer on Multilingual Language Models
a1da4
0
270
文献紹介:WhitenedCSE: Whitening-based Contrastive Learning of Sentence Embeddings
a1da4
1
420
Other Decks in Research
See All in Research
IA for theory
gpeyre
1
440
医療LLMの現在地〜最新研究から社会実装までを考える〜
kento1109
1
1.8k
高性能計算機クラスタを用いた大規模点群処理による森林の単木抽出と構造解析
kentaitakura
1
130
20260624 NLP colloquium: 単一のhubテキストがCLIPを壊す:hubnessによる埋め込みの脆弱性特定
de9uch1
2
280
Visual SLAM未来予測 / Future Prediction in Visual SLAM
koide3
1
1k
視覚若手の会LENSって何??
mickey_0226
0
270
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
870
「AIとWhyを深堀る」をAIと深堀る
iflection
0
660
SOTAのさらに先へ:厳しい推論制約下での高性能モデルのPost-Training
analokmaus
0
1.6k
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
21
24k
CDCL を用いた MILP の厳密解法
imai448
0
270
CVPR2026論文紹介_VLMにとって良いvision encoderとは何か?Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance
kobayashi31
1
230
Featured
See All Featured
How to make the Groovebox
asonas
2
2.4k
Making Projects Easy
brettharned
120
6.8k
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
530
Lightning Talk: Beautiful Slides for Beginners
inesmontani
PRO
2
700
Dealing with People You Can't Stand - Big Design 2015
cassininazir
367
27k
[RailsConf 2023 Opening Keynote] The Magic of Rails
eileencodes
31
10k
sira's awesome portfolio website redesign presentation
elsirapls
0
420
Bash Introduction
62gerente
615
220k
Evolving SEO for Evolving Search Engines
ryanjones
0
300
The B2B funnel & how to create a winning content strategy
katarinadahlin
PRO
1
540
AI Search: Implications for SEO and How to Move Forward - #ShenzhenSEOConference
aleyda
1
1.4k
What does AI have to do with Human Rights?
axbom
PRO
1
2.4k
Transcript
Unsupervised Word Polysemy Quantification with Multiresolution Grids of Contextual Embeddings
Christos Xypolopoulos, Antoine Tixier, Michalis Vazirgiannis EACL2021 論文紹介
導入 - 単語の多義語の度合いを予測する手法を提案 - 単語の順位付けタスクで6種類の評価指標におい て6種類の人手セットとの相関を示した 2
手法 - 仮定:文脈あり単語ベクトルが空間を占める大き さは多義語の度合いを示す - 手法: 1. D次元に圧縮して格子状に線を引く 2. 単語ごとに格子を占める比率を計算
3. 多義語の度合いを示すスコアを計算 3 多義語の度合い word 1 > word 2
手法 1. D次元に圧縮し、格子状に線を引く 4
手法 2. 単語ごとに格子を占める比率を計算 5 word 1, l = 1 の場合:
手法 2. 単語ごとに格子を占める比率を計算 6 word 1, l = 2 の場合:
word 1, l = 3 の場合:
手法 3. 多義語の度合いを示すスコアを計算 7 格子が粗くなるほどペナルティを与える
実験:多義語の度合いの順位付け - タスク:対象単語について多義語の度合いをラン キング - データ:English Wikipedia dump - 評価対象の単語選択
- English Wikipedia で頻度の高い上位2000単語を選択 - 3000文以上ある単語(2000→1822単語)を残す 8
実験:多義語の度合いの順位付け - 比較手法(Ground Truth) - WordNet:synset 数を多義語の度合いとする - WordNet-Reduced:WordNet の
synset 数を少なくした もの。synset 数を多義語の度合いとする - WordNet-Domains:WordNet に自動でドメインのラベル を割り振ったもの。ドメイン数が多義語の度合い 9
実験:多義語の度合いの順位付け - 比較手法(Ground Truth) - OntoNotes:様々なメディアのデータから構築。WordNet をまとめた inventory 数が多義語の度合い -
Oxford:Oxford Dictionary にある意味の数を数える - Wikipedia:「曖昧さ回避」にあるカテゴリの数を多義語の 度合いとした - 比較手法(Baseline) - frequency:高頻度ほど多義語 - random:対数正規分布に従いランダムに並べ替える 10
実験:多義語の度合いの順位付け - 提案手法 - 事前訓練済み ELMo の最終層から単語ベクトルを獲得 - D:PCA でベクトルの次元を圧縮(1024→2~20)
- 格子の線の数 L:2~19 11
実験:多義語の度合いの順位付け - 評価指標:6種類の指標で評価 - cosine similarity - Spearman’s rho -
Kendall’s tau - precision@k - Normalized Discounted Gain (NDCG): - Rank Biased Overlap (RBO): 12
結果:多義語の度合いの順位付け - Ground Truth(cos, NDCG は特に Wiki)との相 関が高く、2つの baseline も超えている
- その他の指標で評価した場合も同様 13
議論:パラメータ(縦軸:線の数 L, 横軸: 圧縮後の次元 D) - D=2~4, L=3,4~8 くらいで良い性能になる 14
線の数 L 圧縮後の次元 D
応用:異なる語義の抽出 - 同じ単語でも異なる格子のマスから取り出せば、 異なる語義の文を抽出できる - count:固有名詞, 番号, 数え上げ - live:住む,
ライブ - bank:銀行, 土手 15
結論 - 圧縮したベクトル空間に線を引いて、格子を占め る比率から単語の多義語の度合いを計算 - 単語の順位づけタスクで人手との相関を示す (クラスタリングと比較して欲しい) 16
手法:アイデア - 画像処理における pyramid matching と同じ 17 Beyond Bags of
Features: Spatial Pyramid Matching for Recognizing Natural Scene Categories. (Lazebnik+2006)
vs. クラスタリング - 文脈あり単語ベクトルも一様ではない - クラスタリングは空間に対して均等に分割をせず (密度ベース)、外れ値のクラスタも - クラスタ数=多義語の度合い は信頼できない
18 How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings (Ethayarajh2019)
実験:多義語の度合いの順位付け - 対象の1822単語のうち、Ground Truth で使えた 単語数 19
議論:単語の語義ごとに 意味の近い単語を抽出 - 単語の各語義が所属するマスの中で高頻度の単 語を取り出す - metal:鉱物, オリンピック, 音楽 20