Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
文献紹介_201908_Medical Word Embeddings for Spanish...
Search
T.Tada
August 28, 2019
Technology
0
64
文献紹介_201908_Medical Word Embeddings for Spanish_ Development and Evaluation
T.Tada
August 28, 2019
Tweet
Share
More Decks by T.Tada
See All by T.Tada
文献紹介_202002_Is artificial data useful for biomedical Natural Language Processing algorithms?
tad
0
62
文献紹介_202001_A Novel System for Extractive Clinical Note Summarization using EHR Data
tad
0
160
文献紹介_201912_Publicly Available Clinical BERT Embeddings
tad
0
160
文献紹介_201911_EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks
tad
0
220
文献紹介_201910_Do Neural NLP Models Know Numbers? Probing Numeracy in Embeddings
tad
0
100
文献紹介_201909_Sentence Mover’s Similarity_ Automatic Evaluation for Multi-Sentence Texts
tad
0
150
文献紹介_201907_Is Word Segmentation Necessary for Deep Learning of Chinese Representations
tad
0
100
文献紹介_201906_Predicting Annotation Difficulty to Improve Task Routing and Model Performance for Biomedical Information Extraction
tad
0
97
文献紹介201905_Context-Aware Cross-Lingual Mapping
tad
0
97
Other Decks in Technology
See All in Technology
今日から使える AWS Step Functions 小技集 / AWS Step Functions Tips
kinunori
7
660
What's the recommended Flutter architecture
aakira
3
1.4k
"おまじない"はもう卒業! デバッガで探るSpring Bootの裏側と「学び方」の学び方
takeuchi_132917
0
140
CloudFormationコンソールから、実際に作られたリソースを辿れるようになろう!
amixedcolor
1
180
マーケットプレイス版Oracle WebCenter Content For OCI
oracle4engineer
PRO
3
1.3k
Claude Code 10連ガチャ
uhyo
3
670
QAエンジニアがプロダクト専任で チームの中に入ると。。。?/登壇資料(杉森 太樹)
hacobu
PRO
0
220
Amazon ECS デプロイツール ecspresso の開発を支える「正しい抽象化」の探求 / YAPC::Fukuoka 2025
fujiwara3
12
2.2k
Pythonで構築する全国市町村ナレッジグラフ: GraphRAGを用いた意味的地域検索への応用
negi111111
8
3.5k
Logik: A Free and Open-source FPGA Toolchain
omasanori
0
300
やり方は一つだけじゃない、正解だけを目指さず寄り道やその先まで自分流に楽しむ趣味プログラミングの探求 2025-11-15 YAPC::Fukuoka
sugyan
1
630
それでは聞いてください「Impeller導入に失敗しました」 #FlutterKaigi #skia
tacck
PRO
0
110
Featured
See All Featured
Become a Pro
speakerdeck
PRO
29
5.6k
Designing for humans not robots
tammielis
254
26k
StorybookのUI Testing Handbookを読んだ
zakiyama
31
6.3k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
24
1.6k
The Web Performance Landscape in 2024 [PerfNow 2024]
tammyeverts
11
930
Visualization
eitanlees
150
16k
How to Think Like a Performance Engineer
csswizardry
28
2.3k
Mobile First: as difficult as doing things right
swwweet
225
10k
Automating Front-end Workflow
addyosmani
1371
200k
The Pragmatic Product Professional
lauravandoore
36
7k
Cheating the UX When There Is Nothing More to Optimize - PixelPioneers
stephaniewalter
285
14k
How GitHub (no longer) Works
holman
315
140k
Transcript
- 文献紹介 2019 Aug 28 - Medical Word Embeddings for
Spanish: Development and Evaluation 長岡技術科学大学 自然言語処理研究室 多田太郎
About the paper 2 Authors: Conference: Proceedings of the 2nd
Clinical Natural Language Processing Workshop (NAACLのワークショップ)
Abstract ・医療および臨床NLPでは、単語分散表現がNERや分類など有効なリソース ・スペイン語での医療ドメインの単語埋め込みについて学習・評価 ・生物医学ドメインのスペイン語での単語埋め込みの作成と評価にほとんど注意が払わ れていない ・英語のデータ・セットをスペイン語で活用 3
Material and Methods 4 ・分散表現手法:FastText ・学習コーパス: 1. SciELOデータベース(論文の本文とアブストラクト、スペイン語の地域は不問) 2. Wikipedia(健康、薬理学、薬局、医学、生物学のカテゴリー)
Evaluation -Intrinsic- 5 ・生物医学分野で利用できる標準的なスペイン語のデータセットはない ・学習した埋め込みの評価のため、英語のデータ・セットをスペイン語に適用 使用するデータ・セット: UMNSRSの類似性(UMNSRS-sim)および関連性(UMNSRS-rel)タスク 統合医学言語システム(UMLS)のコンセプトペアで構成されるデータセット(英語) 類似性と関連性について人手で注釈が付けられている UMNSRSsim:566ペア、UMNSRS-rel:587ペアのコンセプト
MayoSRS: 類似性評価に使用 101個のUMLSペアとそれぞれの人手でつけたスコアで構成
Evaluation 6 1.Google翻訳でスペイン語に翻訳 多義性と翻訳のエラーをチェック 2.UMLSの既に使用可能な翻訳を参照し、 翻訳された用語を正規化。(人手) 最終的な用語のペア UMNSRS-rel:384、オリジナルの65.41% UMNSRS-sim:380、オリジナルの67.14% (国や地域に依存する薬品は除いた)
Evaluation 7 Baseline Word Embedding: チリ大学NLPグループ(DCC Uchile)から入手可能な埋め込みを使用 学習データ:SBWC(Spanish Billion Word
Corpus) コーパスサイズ: 約1.4 億語 一般ドメイン 学習方法は本論文の学習モデルと同様
Experiments and Results -Intrinsic- 8 ・翻訳された各ペアが学習したモデルの語彙に存在するかチェック →公平な比較のため ・複数単語による用語については、個々の単語ベクトルの平均を使用 ・各翻訳済みデータセットの比較ペアの最終数:
UMNSRS-sim(322)、UMNSRSrel(252)、MayoSRS(101) ・各ペアのコサイン距離を計算、人手のアノテーションとのピアソン相関係数(ρ)
9 Experiments and Results -Intrinsic-
Evaluation -Extrinsic- 10 Data: スペインの臨床症例コーパス(SPACCC) ・スペインのオープンアクセスの医学出版物の臨床症例セクション ・1000の臨床症例のコレクション、16504の文、396,988語 ・生物医学文献と医学文献、および臨床記録がある ・臨床症例は腫瘍学、泌尿器科、循環器学、感染症など医学分野が限定されない ・Shered
Task に使用されている Software: NeuroNERを使用 ・NERシステム ・LSTM
Experiments and Results -Extrinsic- 11 ・コーパスには4つのエンティティラベルが付与: タンパク質、正規化可能な化学物質、正規化できない化学物質、不明な言及 ・正規化できない化学物質についての言及の数 →非常に少ない 評価には含めない
12 ・大規模な一般ドメインのモデルよりも 高精度を達成 Experiments and Results -Extrinsic-
Experiments and Results -Visual Evaluation- 13
Experiments and Results -Visual Evaluation- 14
Discussion and Conclusion 15 ・スペイン語の生物医学ドメインの単語埋め込みについて学習・評価 ・本論文の埋め込みは、一般ドメインの大規模コーパスよりも優れた性能を達成 ・ドメイン内コーパスでトレーニングされたものがより明確に単語のマッピングできる ・スペイン語の医療ドメインの学習済みモデルを公開 ・英語のデータ・セットをスペイン語で活用