Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
文献紹介 4月4日
Search
gumigumi7
April 03, 2016
150
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
文献紹介 4月4日
gumigumi7
April 03, 2016
More Decks by gumigumi7
See All by gumigumi7
文献紹介 1月24日
gumigumi7
0
250
文献紹介 11月7日
gumigumi7
0
140
文献紹介 10月3日
gumigumi7
0
340
文献紹介 9月3日
gumigumi7
0
270
文献紹介 8月10日
gumigumi7
0
130
文献紹介 7月16日
gumigumi7
0
270
文献紹介 6月12日
gumigumi7
0
350
文献紹介 5月16日
gumigumi7
0
190
文献紹介 4月18日
gumigumi7
0
150
Featured
See All Featured
Into the Great Unknown - MozCon
thekraken
41
2.8k
The Cult of Friendly URLs
andyhume
79
7k
Mind Mapping
helmedeiros
1
390
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
2
930
Abbi's Birthday
coloredviolet
4
10k
How People are Using Generative and Agentic AI to Supercharge Their Products, Projects, Services and Value Streams Today
helenjbeal
1
350
Context Engineering - Making Every Token Count
addyosmani
9
1.2k
Prompt Engineering for Job Search
mfonobong
0
480
Lessons Learnt from Crawling 1000+ Websites
charlesmeaden
PRO
1
1.6k
Writing Fast Ruby
sferik
630
63k
Deep Space Network (abreviated)
tonyrice
0
350
Learning to Love Humans: Emotional Interface Design
aarron
275
41k
Transcript
文献紹介(2016/04/04) 長岡技術科学大学 B4 桾澤 優希 Microblogs as Parallel Corpora
文献 ▪ Wang Ling, Guang Xiang, Chris Dyer, Alan Black.
Microblogs as Parallel Corpora. In proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (pp.176–186)
概要 ▪ マイクロブログ(Twitterみたいなもの)からパラレルコーパス を作成する試み ▪ 一部のユーザーが2種類の言語で情報を発信することを 利用 ▪ マイクロブログ翻訳時に現存するパラレルコーパスと併用す ることで精度を向上
導入 ▪ Twitterやフェイスブックのようなマイクロブログでの文書スタ イルは様々 ▪ 口でしゃべる時のような表現 ▪ 例) R U
still with me or what? ▪ R → are , U → you ▪ 省略 ▪ 例) idk! , smh ▪ Idk → I don’t know, smh → shaking my head ▪ これらは機械翻訳などで問題となる ▪ それらに対応するためのデータが必要
導入 ▪ マイクロブログから自然発生したこれらの見つけ、抽出し、 それらに活用する ▪ ツイートが複数の言語を持っているか、それらが複数言語 感で対応が取れているかをチェックする手法の提案
理論 ▪ 一つ一つの文章に対して処理を行いスコアリング ▪ 以下の様なタプルを考える ▪ [p,q] , [u,v] は文字のインデックス
▪ l,r はそれぞれの言語 ▪ a は左と右のセグメントの単語アライメント
理論 ▪ モデルを3つに大雑把に分けて考える
理論 ▪ スパンスコア Ss ▪ セグメントが大きければ大きいほど大きな値を返す ▪ 変なところで区切る場合は Φ=0 とする
理論 ▪ スパンを変えるたびに計算しなおしになり、計算量が多い ▪ 特にビタビモデル(ワードアライメント) での計算量が O(n^6) → スパンを1ずつしか変えない ことを利用して計算量を改善
→ O(n^3) から O(n^4) にする ことが可能に
準備 ▪ TwitterとSinaWeibo(中国版Twitter)からツイートを 抽出 ▪ Twitterでは16億ツイート取得 ▪ SinaWeiboでは直近100ツイート中10ツイートが2種の言語を持つ ツイートをしているユーザーに関して6500万ツイートを取得 ▪
どちらの場合もユニコードの数字を用いて予めフィルタリング ▪ 例) ツイート中に3文字以上ラテン文字が含まれ、3文字以上中国語が 含まれる場合抽出
実験 ▪ 提案手法によってどれくらいのパラレルコーパスを取得でき るか ▪ フィルタリングしたSinaWeiboのツイートをランダムで2000 件抽出、スコアを計算する。 ▪ 上位n%を取った時の適合率、再現率、精度をグラフ化
結果
結果
実験 ▪ 抽出したパラレルコーパスがどのくらい機械翻訳の性能向 上に寄与するか ▪ Project Syndicateから新たに作成したテストセットと Weiboから抽出したツイートをテストセットとして使用 ▪ ベースラインとしてNIST,FBISのデータセットを使用
▪ 抽出したデータセット単体と、それぞれを組み合わせて実験 ▪ BLEU値で比較
結果
まとめ ▪ 一文章から複数言語になっている部分を見つけ、抽出す る手法を提案した ▪ 機械翻訳のタスクに於いて既存のものにプラスして使用す ることで翻訳の性能向上できることを確認した。