Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
NERのための転移学習
Search
altescy
September 18, 2019
Research
1.3k
2
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
NERのための転移学習
altescy
September 18, 2019
Other Decks in Research
See All in Research
Data Visualization Tools in the Age of AI
flekschas
0
180
Fukui Shibiten 39 - AI Art
butchi
0
170
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
600
IA for theory
gpeyre
1
340
AIエージェント時代のLLM-jpモデルのあるべき姿
k141303
0
560
某助成金プロジェクト採択に向けて企業研究所のアウトリーチ専任者がやったこと
afroscript
0
160
SLAMはどこまで解決されたのか?
tomonom
0
1.1k
Scalable dynamic origin-destination demand estimation enhanced by high-resolution satellite imagery data
satai
3
400
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
690
敵対生成プロンプト同時探索による内省型プロンプト最適化
kinoue_smarthr
0
360
シングルチャネルマルチトーカー音声認識の進展
ryomasumura
0
210
AGI4OPT:自然言語から数理最適化を導くエ ージェントスキル Translating Human Intent into Mathematical Optimization
mickey_kubo
0
170
Featured
See All Featured
Exploring anti-patterns in Rails
aemeredith
3
460
Leveraging LLMs for student feedback in introductory data science courses - posit::conf(2025)
minecr
1
340
Sam Torres - BigQuery for SEOs
techseoconnect
PRO
0
490
Marketing Yourself as an Engineer | Alaka | Gurzu
gurzu
0
280
Neural Spatial Audio Processing for Sound Field Analysis and Control
skoyamalab
0
410
The Pragmatic Product Professional
lauravandoore
37
7.4k
Making Projects Easy
brettharned
120
6.7k
Building a A Zero-Code AI SEO Workflow
portentint
PRO
0
660
How People are Using Generative and Agentic AI to Supercharge Their Products, Projects, Services and Value Streams Today
helenjbeal
1
260
Joys of Absence: A Defence of Solitary Play
codingconduct
1
430
The Web Performance Landscape in 2024 [PerfNow 2024]
tammyeverts
12
1.2k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
490
Transcript
NERのための転移学習 山口泰弘
自己紹介 山口 泰弘 / Yasuhiro Yamaguchi ID: @altescy 奈良先端科学技術大学院大学 修士1年
転移学習 • あるドメインのデータや学習済みモデルを使って他の ドメインのモデルを学習する手法 • 自然言語処理の分野における転移学習 ◦ Cross-Domain 例: ニュース →
SNS ◦ Cross-Lingual 例: 日本語 → 英語 • データの多いドメインから得られる知識を活用したい domain-specificなNERを行いたいと いう要求は現実問題として多そう
アプローチ 1. 単語翻訳 (cross-lingual) 2. Fine-Tuning 3. 潜在表現の共有
アプローチ: 単語翻訳 NER MODEL 翻訳 ソース言語 ターゲット言語 ラベル
アプローチ: 単語翻訳 • Cheap Translation for Cross-Lingual Named Entity Recognition
[Mayhew+, 2017] ◦ 単語翻訳によるCross-Lingual NERの提案 • Neural Cross-Lingual NER with Minimal Resources [Xie+, 2018] ◦ 単語埋め込みのアライメントによる単語翻訳 ◦ self-attentionによる語順の違いの吸収
アプローチ: Fine-Tuning NER MODEL NER MODEL ソースのデータで学習 ターゲットのデータで再学習
アプローチ: Fine-Tuning • How Transferable are Neural Networks in NLP
Applications? [Mou+, 2016] ◦ Fine-TuningによるNERタスクの転移学習の可能性を 考察 • Neural Adaptation Layers for Cross-domain Named Entity Recognition [Lin+, 2018] ◦ Fine-Tuningと,固定の学習済みエンコーダの前後に レイヤーを追加する手法の比較
アプローチ: 潜在表現の共有 NER MODEL 共有エンコーダ ソース ターゲット
アプローチ: 潜在表現の共有 • Adversarial Transfer Learning for Chinese Named Entity
Recognition with Self-Attention Mechanism [Cao+, 2018] ◦ 中国語における,単語分割→NERの転移学習 • Dual Adversarial Neural Transfer for Low-Resource Named Entity Recognition [Zhou1+, 2019] ◦ 高リソース→低リソースの転移学習 ◦ 今回はこれにフォーカスします
Dual Adversarial Neural Transfer for Low-Resource NER [Zhou1+, 2019] 概要
• 高リソース→低リソースの転移学習 • 潜在表現を共有するモデル 提案手法 • リソース同士のデータの不均衡を考慮する (データ規模・予測の難しさ) • リソース特有の特徴を考慮する • 敵対訓練による正則化を行う
Dual Adversarial Neural Transfer for Low-Resource NER [Zhou1+, 2019] DATNet-P
ソース / 共有 / ターゲット DATNet-F すべて共有
Dual Adversarial Neural Transfer for Low-Resource NER [Zhou1+, 2019] Discriminator
• 共有の潜在表現がどちらのリソースのものか判別 • エンコーダは判別器が誤るように学習 • 不均衡を考慮した誤差関数 (いわゆる Focal-Loss) データ規模の不均衡を調整 予測の難しい例を学習 Adversarial Training • 単語埋め込みに敵対的摂動を与えながら学習
Dual Adversarial Neural Transfer for Low-Resource NER [Zhou1+, 2019] POSなど追加の特徴量を使わず既存手法と同程度以上
cross-lingual cross-domain
Dual Adversarial Neural Transfer for Low-Resource NER [Zhou1+, 2019] Cross-Lingual
(英→西) • ターゲットのデータ数が少ないときはDATNet-F, 多いと きはDATNet-Pがよい Cross-Domain (ニュース→SNS) • データ規模によらずDATNet-Fがよい
サーベイの所感 • ソースとターゲットで共有する情報と,ドメイン・ 言語特有の情報の処理を分けて学習する • self-attentionを利用する ◦ 大域的な依存関係を捉える ◦ 言語ごとの語順の違いを吸収する
• データの不均衡を考慮する ◦ ソース・ターゲットのデータ規模 ◦ 予測が簡単な例・難しい例