$30 off During Our Annual Pro Sale. View Details »
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
20150820 文献紹介
Search
Yuta
August 19, 2015
Education
0
190
20150820 文献紹介
Yuta
August 19, 2015
Tweet
Share
More Decks by Yuta
See All by Yuta
20160422 文献紹介
sudo
0
170
NLP2016 報告
sudo
0
190
NLP2016 発表スライド
sudo
0
220
20160218 文献紹介
sudo
0
260
20150909 発表資料
sudo
0
140
20150708 文献紹介
sudo
0
160
20150610 文献紹介
sudo
0
190
20150512 文献紹介
sudo
0
180
20150415 文献紹介
sudo
1
230
Other Decks in Education
See All in Education
中央教育審議会 教育課程企画特別部会 情報・技術ワーキンググループに向けた提言 ー次期学習指導要領での情報活用能力の抜本的向上に向けてー
codeforeveryone
0
460
JavaScript - Lecture 6 - Web Technologies (1019888BNR)
signer
PRO
0
3.1k
Linguaxes de programación
irocho
0
500
2025年度伊藤正彦ゼミ紹介
imash
0
140
国際卓越研究大学計画|Science Tokyo(東京科学大学)
sciencetokyo
PRO
0
2.2k
自分だけの、誰も想像できないキャリアの育て方 〜偶然から始めるキャリアプラン〜 / Career planning starting by luckly v2
vtryo
1
320
AIは若者の成長機会を奪うのか?
frievea
0
130
Semantic Web and Web 3.0 - Lecture 9 - Web Technologies (1019888BNR)
signer
PRO
2
3.1k
Introduction - Lecture 1 - Web Technologies (1019888BNR)
signer
PRO
0
5.8k
沖ハック~のみぞうさんとハッキングチャレンジ☆~
nomizone
1
530
1202
cbtlibrary
0
140
1125
cbtlibrary
0
140
Featured
See All Featured
Building a Modern Day E-commerce SEO Strategy
aleyda
45
8.3k
Producing Creativity
orderedlist
PRO
348
40k
Optimizing for Happiness
mojombo
379
70k
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
48
9.8k
How to Think Like a Performance Engineer
csswizardry
28
2.4k
Building Flexible Design Systems
yeseniaperezcruz
330
39k
The Illustrated Children's Guide to Kubernetes
chrisshort
51
51k
Docker and Python
trallard
47
3.7k
The Hidden Cost of Media on the Web [PixelPalooza 2025]
tammyeverts
1
100
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.1k
The World Runs on Bad Software
bkeepers
PRO
72
12k
Keith and Marios Guide to Fast Websites
keithpitt
413
23k
Transcript
文献紹介 「やさしい日本語」作成支援のための 日本語の難易度自動推定の検討 張 萌, 伊藤 彰則, 佐藤 和之 研究報告音声言語情報処理(SLP)
2012-SLP-91 6 PP.1-6 自然言語処理研究室 B4 須戸悠太 1
概要 • 外国人の感覚に合った日本語の難易度自動 推定について検討 • leave-one-out クロスバリデーションで評価し た結果、外国人の主観評価値と自動推定値 の相関は約0.66となった。 2
やさしい日本語 • 日本語能力検定試験3級を合格した人が理 解可能なレベルを想定 – 3級、4級程度の語彙を使うことが望ましい • あいまいな表現を避け、可能な限り直接的に 表現する 3
普通の日本語 直ちに高台に避難してください。 やさしい日本語 すぐに高いところに逃げてください。
日本語の難易度のモデル化 • = 1 ⋮ 1 1 1 ⋮ 1
⋯ ⋱ ⋯ 1 ⋮ • = 1 ⋯ • リッジ回帰によるモデルパラメー タの推定は以下のようになる • = + −1 4 :日本語文の特徴ベクトル ():難易度スコア :モデルパラメータ :単位行列 (> 0):リッジパラメータ
日本語の難易度に関連する特徴量 • 作成基準 – 文の構造を簡単にする – 難しい日本語を使わない – 外来語を使わない •
文の構造 – 文の長さ、各品詞の数・割合、文節数、係り受け の距離・回数について検討 5
日本語の難易度に関連する特徴量 • 単語レベル – (旧)日本語能力検定試験の語彙レベルを利用 • 外来語 – 全ての文字シンボルがカタカナの形態素を、外来 語とみなす
• 文字シンボル – ひらがな、カタカナ、漢字のそれぞれの割合 6
評価実験 • データ – 東日本大震災において外国人のために書かれた 文章400文を抽出 – 中国人留学生30人に以下の基準で難易度の評 価を行ってもらった 7
評価基準 評価値 完全に分かる 2 ちょっと理解できる 1 全然分からない 0
各特徴量の有効性 8
自動推定の評価 • 実験データ400文のうち、399文を学習データ としてモデルパラメータを求めるのに利用 • 残り1文を評価データとする • リッジパラメータを変化させ、 leave-one-out クロスバリデーション実験を行った
9
自動推定の評価 10 • の調整により、相関が上がる
自動推定の評価 • 推定値と主観評価値の散布図( = 0.2) 11
自動推定の評価 • 2乗誤差最小基準よりリッジ回帰による推定 が有効であることが分かった • 日本語の難易度に関連すると考えられる基 準を組み合わせることで、ある程度自動で推 測可能であることが分かった 12