Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
文献紹介: Generalizing Word Embeddings using Bag of...
Search
Yumeto Inaoka
September 26, 2018
Research
0
240
文献紹介: Generalizing Word Embeddings using Bag of Subwords
2018/09/26の文献紹介で発表
Yumeto Inaoka
September 26, 2018
Tweet
Share
More Decks by Yumeto Inaoka
See All by Yumeto Inaoka
文献紹介: Quantity doesn’t buy quality syntax with neural language models
yumeto
1
190
文献紹介: Open Domain Web Keyphrase Extraction Beyond Language Modeling
yumeto
0
240
文献紹介: Self-Supervised_Neural_Machine_Translation
yumeto
0
160
文献紹介: Comparing and Developing Tools to Measure the Readability of Domain-Specific Texts
yumeto
0
180
文献紹介: PAWS: Paraphrase Adversaries from Word Scrambling
yumeto
0
160
文献紹介: Beyond BLEU: Training Neural Machine Translation with Semantic Similarity
yumeto
0
280
文献紹介: EditNTS: An Neural Programmer-Interpreter Model for Sentence Simplification through Explicit Editing
yumeto
0
350
文献紹介: Decomposable Neural Paraphrase Generation
yumeto
0
230
文献紹介: Analyzing the Limitations of Cross-lingual Word Embedding Mappings
yumeto
0
230
Other Decks in Research
See All in Research
ウェブ・ソーシャルメディア論文読み会 第31回: The rising entropy of English in the attention economy. (Commun Psychology, 2024)
hkefka385
1
110
Remote sensing × Multi-modal meta survey
satai
4
500
なめらかなシステムと運用維持の終わらぬ未来 / dicomo2025_coherently_fittable_system
monochromegane
0
3.9k
アニメにおける宇宙猫ミームとその表現
yttrium173340
0
100
スキマバイトサービスにおける現場起点でのデザインアプローチ
yoshioshingyouji
0
250
AWSで実現した大規模日本語VLM学習用データセット "MOMIJI" 構築パイプライン/buiding-momiji
studio_graph
2
760
HoliTracer:Holistic Vectorization of Geographic Objects from Large-Size Remote Sensing Imagery
satai
3
130
MIRU2025 チュートリアル講演「ロボット基盤モデルの最前線」
haraduka
15
9k
SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing Images
satai
3
320
大学見本市2025 JSTさきがけ事業セミナー「顔の見えないセンシング技術:多様なセンサにもとづく個人情報に配慮した人物状態推定」
miso2024
0
170
言語モデルの地図:確率分布と情報幾何による類似性の可視化
shimosan
8
1.8k
2021年度-基盤研究B-研究計画調書
trycycle
PRO
0
360
Featured
See All Featured
Helping Users Find Their Own Way: Creating Modern Search Experiences
danielanewman
30
2.9k
Statistics for Hackers
jakevdp
799
220k
Unsuck your backbone
ammeep
671
58k
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
657
61k
We Have a Design System, Now What?
morganepeng
53
7.8k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
16
1.7k
Navigating Team Friction
lara
190
15k
GraphQLの誤解/rethinking-graphql
sonatard
73
11k
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
9
920
Typedesign – Prime Four
hannesfritz
42
2.8k
Designing for humans not robots
tammielis
254
26k
Intergalactic Javascript Robots from Outer Space
tanoku
273
27k
Transcript
Generalizing Word Embeddings using Bag of Subwords 文献紹介 ( 2018
/ 09 / 26 ) 長岡技術科学大学 自然言語処理研究室 稲岡 夢人
Literature Jinman Zhao and Sidharth Mudgal and Yingyu Liang. Proceedings
of the 2018 Conference on Empirical Methods in Natural Language Processing. https://arxiv.org/abs/1809.04259 2
Abstract • 文脈情報を用いずに語彙を超えて事前学習済みの Word Embeddingを汎化 • 単語をBag-of-Substringsと見做して subwordレベルの単語ベクトル生成モデルを提案 • 英単語類似度タスクでSOTAを達成
3
Word Embeddings in OOV ➔ 従来のWord Embeddingsは高頻度な単語にのみ 単語ベクトルを生成し、低頻度語をOOVとする ➔ 低頻度語には単語ベクトルを生成できない
➔ 下流のタスクで特徴が補足できず困難 4
Word Vectors for OOV words • 単語は語幹, 接辞, 修飾語など形態素に分割できる •
人間は例えば“preEMNLP”の意味を推察できる ➔ 形態素からベクトルを推測できる可能性を示唆 ➔ OOV wordsでも単語以下の単位で解析すれば 単語ベクトルを推測できる可能性がある 5
Related Works • fastText char n-gramを用いてOOVの単語のベクトルを生成 学習には大規模なコーパスが必要 (今回はenwiki) • Mimick
Char-level Bi-LSTMでChar Embeddingから Word Embeddingを推測 6
Proposed Model • 単語をBag-of-Substringsとみなす • 単語ベクトルは全部分文字列のベクトルの平均 • それを事前学習されたベクトルと一致させる学習 ➔ 文脈予測を介さずにsubwordsを学習させる
fastTextと似ているようで異なる 7
Substring Σ is the finite set of characters in the
language. 8
“<s>” = ‘<’ + s + ‘>’ Substring 9 are
hyperparameters.
Substring (example) 10 { <in, <inf, inf, infi, nfi, nfix,
fix, fix>, ix> }
Bag-of-Substring 11
Target vectors Training 12
Experiment (Word Similarity) • 単語ベクトルの類似度と、ラベル付けされた 単語類似度の相関によって評価 • 類似度は単語ベクトル間のコサイン類似度で計算 • 相関はスピアマンの順位相関係数ρで計算
13
Datasets (Word Similarity) • Polyglot, Googleは学習済み単語ベクトル • Stanford RareWord(RW)とWordSim353(WS)で評価 RWは低頻度語が多く、WSは一般的な語が多い
14
Results (Word Similarity) • BoSはEditDist, MIMICKよりも相関が強い • Googleのベクトルを用いたときにfastTextと同等 15
BoS vs. fastText • BoSの方が少ないデータ、訓練で実現 • Intel Core i7-6700 (3.4GHz)
において、 BoSはシングルスレッドのPythonで352秒 fastTextはマルチスレッドのC++で数時間 16
Expt. (syntax, semantics) • POS tags, Morphosyntactic Attributesを予測するタ スクでベクトルを評価 →
構文的、意味的特徴の補足を確認 • データセットはUniversal Dependencies (UD) • Bi-LSTMで予測 17
Result (syntax, semantics) • すべての言語で 安定して有意な 結果 • 膠着語で特に 差が大きい
18
Conclusion • 事前学習済みのWord Embeddingを拡張してOOV単 語のWord Embeddingを推定するモデルを提案 • 単語類似度タスクとPOSタグ付けタスクによって形態 論的知識の補足、より良いOOV単語の単語 ベクトルの生成を確認
19