Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
感性を考慮した日本語俗語の標準語変換
Search
kakubari
February 13, 2017
Technology
400
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
感性を考慮した日本語俗語の標準語変換
長岡技術科学大学 自然言語処理研究室
学部3年 角張竜晴
文献紹介:人工知能学会論文誌Vol.32(2017) No.1
kakubari
February 13, 2017
More Decks by kakubari
See All by kakubari
動詞クエリの語間の関係性に基づくクエリマイニング
kakubari
0
130
Neural Modeling of Multi-Predicate Interactions for Japanese Predicate Argument Structure Analysis
kakubari
1
190
Leveraging Crowdsourcing for Paraphrase Recognition
kakubari
0
110
Automatically Acquired Lexical Knowledge Improves Japanese Joint Morphological and Dependency Analysis
kakubari
0
120
Labeling the Semantic Roles of Commas
kakubari
0
110
Integrating Case Frame into Japanese to Chinese Hierarchical Phrase-based Translation Model
kakubari
0
130
Improving Chinese Semantic Role Labelingusing High-quality Surface and Deep Case Frames
kakubari
0
98
Exploring Verb Frames for Sentence Simplification in Hindi
kakubari
0
160
述語項構造と照応関係のアノテーション
kakubari
0
270
Other Decks in Technology
See All in Technology
Sansan Engineering Unit 紹介資料
sansan33
PRO
1
4.9k
PLATEAU で バーチャル花火大会
tatsuya1970
0
150
『三匹の子ぶた』から学ぶネットワークセキュリティの昔と今 / Network Security: Then and Now Through the Lens of The Three Little Pigs
nttcom
1
4.2k
その“隠したつもり”が命取り ── 自前と平文をやめて「正解」に委ねる
kuroneko13
0
120
Invisible to AI? Making TYPO3 Sites Quotable by AI Search Systems
wolfgangwagner
0
200
今こそ聞きたいソフトウェア設計 ドメイン駆動設計再入門
masuda220
PRO
17
7.3k
つくって納得、つかって実感! 大規模言語モデルことはじめ ver2.0
recruitengineers
PRO
4
1.6k
Eight Engineering Unit 紹介資料
sansan33
PRO
3
8.2k
トヨタ⽣産⽅式(TPS)⼊⾨
recruitengineers
PRO
3
810
第3回しろおびセキュリティスポンサーセッション
log0417
0
190
強化学習「理論」入門
enakai00
3
3.6k
AIコーディングの次。コードレビューと理解負荷を解消して組織の開発生産性を高める
moongift
PRO
2
2.5k
Featured
See All Featured
The B2B funnel & how to create a winning content strategy
katarinadahlin
PRO
1
460
How to Talk to Developers About Accessibility
jct
2
510
The Mindset for Success: Future Career Progression
greggifford
PRO
0
440
SEO for Brand Visibility & Recognition
aleyda
0
4.7k
Lightning talk: Run Django tests with GitHub Actions
sabderemane
0
230
A Modern Web Designer's Workflow
chriscoyier
698
190k
AI Search: Implications for SEO and How to Move Forward - #ShenzhenSEOConference
aleyda
1
1.3k
We Are The Robots
honzajavorek
0
300
Art, The Web, and Tiny UX
lynnandtonic
304
22k
How to make the Groovebox
asonas
2
2.3k
Product Roadmaps are Hard
iamctodd
55
12k
Amusing Abliteration
ianozsvald
1
240
Transcript
Ԭ ٕ ज़ Պ ֶ େ ֶ ࣗ વ ݴ ޠ ॲ ཧ ݚ ڀ ࣨ ֶ ෦ ֯ ு ཽ 感性を考慮した日本語俗語の標準語変換 Conversion of Japanese Slang into Standard Japanese Considering Sensibility 松本 和幸, 土屋 誠司, 芋野 美紗子, 吉田 稔, 北 研二 人工知能学会論文誌 7PM /P Q8MM"@ จಛूʮΣϒΠϯςϦδΣϯεͱΠϯλϥΫγϣϯʯ ਤදจΑΓҾ༻
概要 ˔एऀݴ༿Λҙຯతʹײੑతʹྨࣅͨ͠ඪ४ޠʹ ม͢Δ ଟ࣍ݩͷҹ࣠ ҙຯϕΫτϧ ˔͔ͬͨ͜ͱ
ϕʔεϥΠϯख๏ΑΓߴ͍.33ͷ͕ߴ͍ ඪ४ޠΒ͠͞ͷείΞٴͼײੑྨࣅʹجͮ͘ϑΟ ϧλϦϯάʹΑΓɺਖ਼ղީิͷมॱҐΛߴ͘อͯ Δ
はじめに ˔एऀݴ༿ͷதʹɺඪ४ޠΛݴ͍͑ͨදݱ͕ଟ͘ ଘࡏ͢Δɻ एऀݴ༿Λඪ४ޠʹม͢Δͱʜ ɹҙݟɾධੳײೝࣝͷਫ਼Λվળ ˔एऀݴ༿ΘΕΔظؒ໘ɺίϛϡχςΟʹ Β͖͕ͭ͋Γɺҙຯ༻๏࣌ͱͱʹมԽ͢Δɻ
8FC্ͷ4/4͔Βऩूͨ͠ςΩετͷίʔύε ײੑධՁ࣠ͱҙຯϕΫτϧΛ༻͍ͯʜ ɹҙຯతʹײੑతʹྨࣅͨ͠ඪ४ޠʹ͢Δ
実験手法 ˔एऀݴ༿ͷײੑੳ एऀݴ༿ͷײੑධՁΞϯέʔτ एऀݴ༿ͱඪ४ޠͷײੑൺֱ ˔ίʔύεͷߏங एऀ5XFFUίʔύε ˔एऀݴ༿͔Βඪ४ޠͷมख๏
จ຺ྨࣅੑʹجͮ͘ྨޠͷऔಘ ଏޠΒ͠͞ͷܭࢉ ײੑྨࣅʹجͮ͘ީิநग़
若者言葉の感性評価アンケート ˔एऀײίʔύε χίχίେඦՊ ɹޠΛબఆ ˔ධՁํ๏ ඃݧऀʹޠ ֤ޠʹରͯ͠ɺ໊̎Ҏ্͕ճ
छྨͷײੑධՁର ֤ஈ֊ͰධՁ ࣍ݩͷײੑධՁϕΫτϧʹมɾਖ਼ نԽ͠ɺࣗݾ৫ԽϚοϓΛ༻͍ͯੳ ˔ධՁ݁Ռ Α͘ࣅͨҹͷݴ༿͕͍ۙҐஔʹදࣔ 感性評価ベクトルに基づき自己組織化マップに より若者言葉を配置した例 アンケートに用いた感性評価軸
若者言葉と標準語の感性比較 ˔ޠͷதͰɺҎԼͷ݅ʹͯ·ΔޠΛநग़ ಉҰදهޠ͕طଘ͢Δඪ४ޠʹొ͞Ε͍ͯͳ͍ ҙຯ͕ಉҰ·ͨྨࣅ͢Δදݱ͕ࣙॻʹొ͞Ε͍ͯΔ ˔एऀݴ༿ͱରԠ͢Δඪ४ޠͷ QPTJUJWFOFHBUJWFOFVUSBMͷ༁ Ұக͢Δ߹ɺ
Ұக͠ͳ͍߹͋Δ एऀݴ༿͔Βඪ४ޠม͢Δͱ ɹײੑ͕มԽ͢Δ एऀݴ༿QPTJUJWFඪ४ޠOFHBUJWF͕ 若者言葉と対応する標準語の感性比較
俗語らしさの計算 ˔ޠͷಛʢ/Pd/P·ͰͷಛྔʣΛϕΫτϧͰදݱ ଏޠͱඪ४ޠͷํͰදಛྔΛநग़ɺྨࣅΛٻΊΔ ˔ଏޠΒ͠͞ͷείΞ4D XJ ɹ͕ᮢҎ্ͳΒग़ྗީิ͔Βআ֎ 文字列から抽出する表層特徴量
感性類似度に基づく候補抽出 ײੑධՁରͷछྨΛײੑධՁϕΫτϧͱ͢Δɻ ΞϯέʔτऔಘࡁΈͷएऀݴ༿ͷ֓೦ϕΫτϧʹ͓͚Δ֤࣍ݩͷ ؔ࿈ΛٻΊɺײੑධՁॏΈߦྻΛٻΊΔɻ ͦͯ͠ɺײੑධՁϕΫτϧͷಋग़Λߦ͏ɻ ೖྗ͞Εͨएऀݴ༿͔Βਪఆ͞ΕͨײੑධՁϕΫτϧͱɺม
ީิͱͯ͠ಘΒΕͨ୯ޠͷײੑධՁϕΫτϧͷײੑྨࣅΛܭࢉ ͢Δɻ ͜ͷ݁Ռͱඪ४ޠΒ͠͞ͷείΞʢ4D XJ º ʣΛֻ͚߹Θͤ ͨͰɺมީิΛॱҐ͚͢Δɻ
若者言葉の標準語への変換候補 Ұͭͷएऀݴ༿ʹ̏ޠͷඪ४ޠީิ͕ਖ਼ղީิͱͯ͠༩ ͞ΕΔɻ 若者言葉と対応する標準語の例
実験結果 ˔ϕʔεϥΠϯख๏ ඪ४ޠΒ͠͞ͷείΞܭࢉٴͼײੑྨࣅͷܭࢉ͠ͳ͍ ֓೦ϕΫτϧͷྨࣅͷΈͰͷஅ ˔ධՁํ๏ .33 .FBO3FDJQSPDBM3BOL
ͷฏۉ ݕࡧ݁Ռͷ͏ͪɺਖ਼ղͱͳΔ୯ޠ͕/ݸग़ྗ͞Εͨ߹ɺ ͦͷ୯ޠͷग़ྗॱҐ3J ͷٯͷ૯Λਖ਼ղ୯ޠͰׂͬͨ
実験結果 .33 ඪ४ޠͷਖ਼ղީิΛ࣋ͭଏޠʹରͯ͠ܭࢉ ʢඪ४ޠΒ͠͞ͷείΞٴͼײੑྨࣅʹجͮ͘ϑΟϧλϦϯάख๏ʣ .33 ΞϯέʔτʹΑΓਖ਼ղީิΛܾఆͨ͠ଏޠʹରͯ͠ܭࢉ ʢϕʔεϥΠϯख๏ʣ
˔.33 ͕.33 ΑΓ͍ ෆཁͳޠΛϑΟϧλϦϯάͰআڈ ɹ͢Δ͜ͱ͕Ͱ͖͍ͯΔɻ MRR平均の比較
実験結果 ఏҊख๏Ͱɺਖ਼ղҎ֎ͷྨࣅޠީิΛϑΟϧλϦϯά͢Δ ͜ͱͰɺਖ਼ղީิͷॱҐΛߴ͘อ͍ͯͯΔɻ 変換候補の例
実験結果 ײੑྨࣅɺ֓೦ϕΫτϧͷ࣍ݩ͕গͳ͍࣌ʹɺͦΕΛΧόʔ͢Δ ޮՌ͕େ͖͍ɻ ඪ४ޠΒ͠͞ͷείΞʹΑΔϑΟϧλϦϯάͰɺਖ਼ղΛ͢͜ͱ͕ Ͱ͖ͳ͍߹͕͋Δɻ 感性類似度のみを適用した場合の比較 標準語らしさのスコアによるフィルタリングのみを適 用した場合の比較
まとめ ˔ඪ४ޠΒ͠͞ͷείΞٴͼײੑྨࣅʹجͮ͘ϑΟϧλϦ ϯάʹΑΓɺਖ਼ղީิͷมॱҐΛߴ͘Ͱ͖Δɻ ˔ඪ४ޠΒ͠͞ͷείΞͷܭࢉํ๏ͷվળʹΑΓɺϑΟϧλ Ϧϯάͷਫ਼Λ্ͤ͞Δඞཁ͕͋Δɻ