Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
話題の継続に着目した国会会議録要約
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
自然言語処理研究室
March 31, 2007
Research
130
0
Share
話題の継続に着目した国会会議録要約
川端 正法. 話題の継続に着目した国会会議録要約. 長岡技術科学大学課題研究報告書 (2007.3)
自然言語処理研究室
March 31, 2007
More Decks by 自然言語処理研究室
See All by 自然言語処理研究室
データサイエンス14_システム.pdf
jnlp
0
410
データサイエンス13_解析.pdf
jnlp
0
530
データサイエンス12_分類.pdf
jnlp
0
370
データサイエンス11_前処理.pdf
jnlp
0
490
Recurrent neural network based language model
jnlp
0
160
自然言語処理研究室 研究概要(2012年)
jnlp
0
160
自然言語処理研究室 研究概要(2013年)
jnlp
0
120
自然言語処理研究室 研究概要(2014年)
jnlp
0
140
自然言語処理研究室 研究概要(2015年)
jnlp
0
230
Other Decks in Research
See All in Research
2026年3月1日(日)福島「除染土」の公共利用をかんがえる
atsukomasano2026
0
570
東京大学工学部計数工学科、計数工学特別講義の説明資料
kikuzo
0
340
【NICOGRAPH2025】Photographic Conviviality: ボディペイント・ワークショップによる 同時的かつ共生的な写真体験
toremolo72
0
230
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
2
230
機械学習で作った ポケモン対戦bot で 遊ぼう!
fufufukakaka
0
180
typst の使い方:言語学を研究する学生のために
gitomochang
0
390
20年前に50代だった人たちの今
hysmrk
0
190
Using our influence and power for patient safety
helenbevan
0
340
データセンター事業者を取り巻く近年の状況とその中での研究開発動向、テストベッドへの貢献の可能性
kikuzo
1
110
Sequences of Logits Reveal the Low Rank Structure of Language Models
sansantech
PRO
1
220
Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering
anatolykr
0
150
Data Visualization Tools in the Age of AI
flekschas
0
130
Featured
See All Featured
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
52
5.9k
Six Lessons from altMBA
skipperchong
29
4.2k
Become a Pro
speakerdeck
PRO
31
5.9k
Understanding Cognitive Biases in Performance Measurement
bluesmoon
32
2.9k
Fantastic passwords and where to find them - at NoRuKo
philnash
52
3.7k
Typedesign – Prime Four
hannesfritz
42
3k
YesSQL, Process and Tooling at Scale
rocio
174
15k
How to train your dragon (web standard)
notwaldorf
97
6.6k
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
190
The SEO identity crisis: Don't let AI make you average
varn
0
460
Keith and Marios Guide to Fast Websites
keithpitt
413
23k
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
0
1.3k
Transcript
1 話題の継続に着目した 国会会議録要約 長岡技術科学大学 電気電子情報工学課程 4年 川端 正法
2 はじめに 目的の文書かどうかの判断が必要 長い文書が大量にあると全て読むのは困難 → 内容を判断するための要約が必要 電子化された大量の文書 ・技術文書
・レポート ・会議録 ・講義の書き起こし 書き言葉 話し言葉
3 目的 国会会議録 一般に公開されており、入手が容易 平均5万字という長い文書が多い 内容を判断するための自動要約手法を提案
要約は1000字以内で作成
4 処理概要 話題の手がかりの抽出 継続段落数の算出 要約 導入段落・結論段落の抽出 要約文の生成 原文
5 処理概要 話題の手がかりの抽出 継続段落数の算出 要約 導入段落・結論段落の抽出 要約文の生成 原文
6 話題の手がかりの抽出 多くの話題が存在する国会会議録では、 長く議論された話題こそが要約に必要。 話題の手がかり 助詞「の」で接続された名詞の組を原文から抽出
話題の手がかりを指標として必要な部分を抽出 例1) イラク / の / 治安 / 状況 例2) 基本計画 / の / 文案 / の / 変更
7 継続段落数の算出 全ての話題の手がかりに対して計算 イラク, 状況 イラク, 治安 イラク /
の / 治安 / 状況 イラク, 状況 第1段落 第2段落 第5段落 第30段落 継 続 段 落 数 = 4
8 処理概要 話題の手がかりの抽出 継続段落数の算出 要約 導入段落・結論段落の抽出 要約文の生成 原文
9 導入段落候補の抽出 長い話題はそのままでは1000字に収まらない → 話題の始まりと終わりを抽出 話題の導入部分であるなら 同じ話題が以前で出現しない
同じ話題が以降で多数出現 イラクの治安 イラクの治安 空自の撤退 導入部分
10 結論段落候補の抽出 導入段落候補に対してそれぞれ抽出 話題の結論部分であるなら 同じ話題が以前に多く出現した 同じ話題が以降で出現しない
継続段落数を用いて抽出 イラクの治安 イラクの治安 レバノン情勢 結論部分
11 処理概要 話題の手がかりの抽出 継続段落数の算出 要約 導入段落・結論段落の抽出 要約文の生成 原文
12 要約文の生成 導入段落候補の1位から順に出力 導入段落と結論段落を組み合わせて出力する (導) 次に、水産資源の展開であります。 (結) 流通の効率化、加工業の事業基盤強化を通じ、
水産業の構造改革を進めて参ります。
13 評価実験 導入段落と結論段落の抽出精度について評価 使用した文書 本研究室で収集した国会会議録(第1回~第165回) から無作為に抽出した計10セット
導入段落候補の評価(7セット) 結論段落候補の評価(3セット) 9千字~14万字 人手で正解データを作成
14 導入段落の評価 適合率:22%, 再現率:19% 上位に導入段落ではない段落が存在 候補の抽出時に再現率が低下
話題の手がかりが継続しない 助詞「の」で接続された名詞以外の手がかりが必要 候補の上位に導入段落が多い傾向がある
15 結論段落の評価 1位のみの精度:8%, 3位までの精度:36% 上位に結論段落が抽出される傾向がある 必ずしも1位とは限らない
1位の精度が低いのは問題あり 要約文に正しい結論段落が出力されない
16 今後の課題 話題の手がかりを増やす 段落に含まれる名詞 同義語 段落候補から不要段落を削除
段落から必要な部分を特定 話題の手がかりが必ずしも導入部分に含まれている とは限らない
17 おわりに 国会会議録を1000字に要約する手法を提案 導入段落の抽出精度:22% 結論段落の抽出精度:36% 候補の上位には正解が多い傾向があり、
不要な段落を除くことで精度の向上が見込める。 問題点 段落単位では文字数の調整が難しい 段落から必要部分の特定
18 おわり
19
20 導入段落候補の抽出精度 会議録ID 文字数[字] 適合率 再現率 再現率 (手がかりのみ) 1 9,258
0.22 0.22 0.29 2 31,047 0.08 0.07 0.11 3 29,306 0.47 0.22 0.28 4 35,630 0.18 0.15 0.18 5 146,811 0.15 0.12 0.13 6 111,169 0.27 0.16 0.18 7 66,049 0.17 0.12 0.14 平均 61,324 0.22 0.15 0.19
21 段落数と話題の手がかりの数 会議録ID 段落数 話題の手がかりの数 導入段落候補 結論段落候補 1 147 271
12 52 2 305 388 15 67 3 266 693 24 112 4 258 1,011 21 97 5 748 2,520 65 325 6 692 1,924 50 242 7 501 1,135 50 242
22 結論段落候補の抽出精度 会議録ID 導入段落候補数 1位のみの精度 3位までの精度 8 20 0.00(0) 0.20(4)
9 18 0.11(2) 0.50(9) 10 48 0.15(7) 0.37(18) 平均 0.08 0.36
23 継続段落数の算出 N1 =イラク, N2 ={治安,状況} 第1段落 第2段落 第5段落 イラク,
状況 イラク, 治安 N1 , N2 の「前向き継続段落数」=4 第5段落の「後向き継続段落数」=4 全ての話題の手がかりに対して計算