Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
文献紹介201905_Context-Aware Cross-Lingual Mapping
Search
T.Tada
May 08, 2019
Technology
110
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
文献紹介201905_Context-Aware Cross-Lingual Mapping
T.Tada
May 08, 2019
More Decks by T.Tada
See All by T.Tada
文献紹介_202002_Is artificial data useful for biomedical Natural Language Processing algorithms?
tad
0
77
文献紹介_202001_A Novel System for Extractive Clinical Note Summarization using EHR Data
tad
0
200
文献紹介_201912_Publicly Available Clinical BERT Embeddings
tad
0
180
文献紹介_201911_EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks
tad
0
230
文献紹介_201910_Do Neural NLP Models Know Numbers? Probing Numeracy in Embeddings
tad
0
110
文献紹介_201909_Sentence Mover’s Similarity_ Automatic Evaluation for Multi-Sentence Texts
tad
0
170
文献紹介_201908_Medical Word Embeddings for Spanish_ Development and Evaluation
tad
0
73
文献紹介_201907_Is Word Segmentation Necessary for Deep Learning of Chinese Representations
tad
0
130
文献紹介_201906_Predicting Annotation Difficulty to Improve Task Routing and Model Performance for Biomedical Information Extraction
tad
0
120
Other Decks in Technology
See All in Technology
AIによるクリエイティブ生成を行う上での試行錯誤
plaidtech
PRO
0
170
ADKで始める業務改善 - AIエージェント開発時の考えと設計
harappa80
2
260
Making AI Agents Safe and Fast- Jev, Obsidian, and the Meta-Harness
x5gtrn
PRO
0
110
SREは、MCPとAutopilotをこう使え!
kazumax55
3
950
ソフトウェアDNAとクラウドエージェントのススメ
cloudace
0
120
すぐできる衛星通信対応 あとは山奥に行くだけ
tatetate55
0
140
aws-iot-platform-architecture-use-cases.pdf
ma2shita
0
510
絵ではじめるKubernetesセキュリティ
aoi1
4
700
開発投資の期待値を上げるプロダクトロードマップづくり ~プロダクトエンジニアが越境して事業を伸ばす~
kekekenta
1
240
リアーキテクチャ後の障害ゼロを目指したShadow Testingの取り組み
nihonbuson
PRO
1
170
AI 時代のスタートアップエコシステ厶から考究する技術的負債との向き合い方
m3m0r7
PRO
3
2.6k
株式会社シーエーシー エンジニア向け会社紹介資料
cac
0
57k
Featured
See All Featured
CSS Pre-Processors: Stylus, Less & Sass
bermonpainter
360
31k
HU Berlin: Industrial-Strength Natural Language Processing with spaCy and Prodigy
inesmontani
PRO
0
710
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.6k
The Illustrated Children's Guide to Kubernetes
chrisshort
51
53k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
47
8.3k
Data-driven link building: lessons from a $708K investment (BrightonSEO talk)
szymonslowik
1
1.3k
[RailsConf 2023] Rails as a piece of cake
palkan
59
7k
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
37
6.6k
DBのスキルで生き残る技術 - AI時代におけるテーブル設計の勘所
soudai
PRO
68
57k
ピンチをチャンスに:未来をつくるプロダクトロードマップ #pmconf2020
aki_iinuma
128
56k
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
410
Automating Front-end Workflow
addyosmani
1369
210k
Transcript
- 文献紹介 2019/5/7 - Context-Aware Cross-Lingual Mapping 長岡技術科学大学 自然言語処理研究室 多田太郎
About the paper 2 Authors: Hanan Aldarmaki : The George
Washington University Mona Diab : AWS, Amazon AI Conference: NAACL-HLT 2019 (short paper)
Abstract ・文レベルの類似性をより反映する、単語レベルのマッピングに代わる方法を提案 ・対訳コーパス内のアライメントされた文埋め込みを直接マッピングすることにより、 変換行列にコンテキストを組み込む ・単語アラインメントを有する対訳文を使用して、文脈化された単語埋め込みのマッピングを 実施 3
Introduction ・クロスリンガル単語ベクトルモデルは、言語間の辞書拡張などを可能にするために、複数の 言語からの単語を共有ベクトル空間に埋め込むことが目的(Upadhyay et al.,2016) ・マッピングに直交性の制約を課すことで、元のペアワイズ距離が保持され、単語の翻訳検 索が向上(Artetxe et al., 2016;
Smith et al.,2017) ・単語ベクトル空間は言語間で一貫している傾向がある(Aldarmaki et al.,2018) 語義曖昧性のある語(例: 'bank'、 'coast')および句動詞( 'stand up'の個々の単語な ど)は、使用分布が異なるため、多言語ベクトル空間では一貫性が低下 →アライメント辞書で上のような単語を使用すると、全体的に最適でないマッピング になる可能性がある 4
Introduction ・明示的な語義曖昧解消や言語資源追加なしに、文章の文脈をマッピングプロセスに組み込 むことにより、これら影響を打ち消すための2つのアプローチを提案 1. 言語モデルELMoを基にした文脈化された埋め込み(Peters et al。、2018) 対訳コーパスと単語アライメントを使用して、文脈を反映した埋め込みを抽出して、 マッピングのための辞書を構築 2.
個々の単語の埋め込みではなく、文埋め込みの変換を学習する 埋め込みは全文にわたる文脈を含んでいるので、このレベルで学習されたマッピング は個々の単語に対してよりロバストと考えられる 5
Approach - Orthogonal Bilingual Mapping - ソースとターゲットのペア<x、y> 列が対応する辞書項目のベクトル表現である行列表現XとY 直交性の制約により、元のソースベクトル空間内のペアワイズ距離が変換後も維持される 解はY
X Tの特異値分解によって求めることができる(Schönemann, 1966) Rは、ソースベクトル空間内の追加のベクトルを変換するために使用できる 6
Approach - Mapping of Contextualized Embeddings - ソース言語とソース言語の翻訳における単語埋め込みは同様の構造を有する傾向がある (Aldarmaki et
al.,2018) しかし、語義曖昧性のある語や句動詞は、使用分布が異なるため、多言語ベクトル空間では 一貫性が低下 →結果、全体的に最適でないマッピングになる可能性がある ・ELMoから文脈化された単語埋め込みを得る(Peters et al.,2018) ・文の埋め込みは、単語埋め込みを平均化しELMoから得る(Perone et al.,2018) ・単語アラインメントを有する並列コーパス、すなわちIBMモデル(Brown et al., 1993)を使用し、 アライメントから文脈化された単語埋め込みの動的辞書を抽出し使用 7
Experiments ・単語埋め込みにはFastText(Bojanowski et al., 2017)を用いたskipgramを使用 ・文脈化単語埋め込みにはELMoを使用 ・文章の埋め込みは、文脈化された平均単語埋め込みとしてELMoから計算 8
Experiments - Data - ・すべてのモデル同じ単一言語と対訳のデータセットを用いて学習をおこなう ・単言語トレーニング the 1 Billion Word
benchmark (Chelba et al., 2014) WMT’13 (Bojar et al., 2013)から約4億トークン相当のサブセット 単言語のELMoとFastTextをトレーニング(パラメータはデフォルト) ・言語間マッピング WMT’13のコモンクロールデータ ・文の翻訳検索の評価 WMT 13テストセット 9
Experiments - Evaluation Framework - ・最近傍探索を用いて、テスト対訳コーパスのターゲット側で正しい翻訳の検索精度 →文翻訳検索におけるクロスリンガルマッピングアプローチの評価をおこなう ・データからどのように影響を受けるか →トレーニングコーパスを分割して100〜100万文で実験
10
Experiments - Alignment Schemes - ELMoでは、単語の埋め込みは文脈から計算する必要がある ・Fast Align(Dyer et al.,
2013)を使用して単語レベルのアライメントを適用することで、 対訳コーパスから文脈化単語の辞書を抽出 ・ソース文とターゲット文に対する文脈化単語埋め込みを計算し,一対一のアライメントを 持つ単語から辞書を抽出した(効率のために辞書の単語数を1Mに制限) ・FastTextでも、同じ対訳セットを使用して単語アライメント確率から辞書を抽出 すべてのアライメントは、ソース言語から英語に実行 11
Experiments - Results - 12
Experiments - Word-level Evaluation - クロスリンガルの単語埋め込みは、他言語の語彙から正しく翻訳を検索する精度で評価される →単語レベルでは文脈とは離れたタスクなので、FastTextのパフォーマンスで評価 文レベルで学習した言語間の変換行列を用いて単語の埋め込みを変換する。 また,人間の判断に対するPearsonとSpearman相関係数の平均を用いて測定した SemEval’17クロスリンガル単語類似性タスク(Camacho-Colladosら、2017)についても評価
13
Experiments - Word-level Evaluation - 14
Experiments - Word-level Evaluation - 15
Conclusions ・マッピングにコンテキストを組み込んだ、単語マッピングアプローチを提案 ・単語アラインメントを有する対訳文を使用して、文脈化された単語埋め込みのマッピング を実施 ・文章翻訳検索において文脈に依存しない単語マッピングよりも優れた精度 ・文レベルの変換は、単語の翻訳品質を損なうことなく、単語レベルのマッピングに使用可 16