Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
構文片を用いた日報からの障害情報抽出
Search
自然言語処理研究室
March 31, 2008
Research
0
110
構文片を用いた日報からの障害情報抽出
柿元 芳文, 山本 和英. 構文片を用いた日報からの障害情報抽出. 言語処理学会第14回年次大会, pp.923-926 (2008.3)
自然言語処理研究室
March 31, 2008
Tweet
Share
More Decks by 自然言語処理研究室
See All by 自然言語処理研究室
データサイエンス14_システム.pdf
jnlp
0
380
データサイエンス13_解析.pdf
jnlp
0
470
データサイエンス12_分類.pdf
jnlp
0
330
データサイエンス11_前処理.pdf
jnlp
0
450
Recurrent neural network based language model
jnlp
0
130
自然言語処理研究室 研究概要(2012年)
jnlp
0
130
自然言語処理研究室 研究概要(2013年)
jnlp
0
93
自然言語処理研究室 研究概要(2014年)
jnlp
0
110
自然言語処理研究室 研究概要(2015年)
jnlp
0
180
Other Decks in Research
See All in Research
プロシェアリング白書2025_PROSHARING_REPORT_2025
circulation
1
810
言語モデルによるAI創薬の進展 / Advancements in AI-Driven Drug Discovery Using Language Models
tsurubee
2
370
NLP2025 WS Shared Task 文法誤り訂正部門 ehiMetrick
sugiyamaseiji
0
190
LLM-as-a-Judge: 文章をLLMで評価する@教育機関DXシンポ
k141303
3
810
データサイエンティストの採用に関するアンケート
datascientistsociety
PRO
0
970
SSII2025 [TS3] 医工連携における画像情報学研究
ssii
PRO
2
1.1k
生成的推薦の人気バイアスの分析:暗記の観点から / JSAI2025
upura
0
180
利用シーンを意識した推薦システム〜SpotifyとAmazonの事例から〜
kuri8ive
1
200
CSP: Self-Supervised Contrastive Spatial Pre-Training for Geospatial-Visual Representations
satai
3
210
チャッドローン:LLMによる画像認識を用いた自律型ドローンシステムの開発と実験 / ec75-morisaki
yumulab
1
430
Ad-DS Paper Circle #1
ykaneko1992
0
5.5k
言語モデルの内部機序:解析と解釈
eumesy
PRO
48
18k
Featured
See All Featured
Fashionably flexible responsive web design (full day workshop)
malarkey
407
66k
Embracing the Ebb and Flow
colly
86
4.7k
Producing Creativity
orderedlist
PRO
346
40k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
228
22k
Bootstrapping a Software Product
garrettdimon
PRO
307
110k
StorybookのUI Testing Handbookを読んだ
zakiyama
30
5.8k
The Straight Up "How To Draw Better" Workshop
denniskardys
233
140k
Statistics for Hackers
jakevdp
799
220k
XXLCSS - How to scale CSS and keep your sanity
sugarenia
248
1.3M
The Web Performance Landscape in 2024 [PerfNow 2024]
tammyeverts
8
670
A Modern Web Designer's Workflow
chriscoyier
693
190k
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
252
21k
Transcript
構文片を用いた 日報からの障害情報抽出 長岡技術科学大学 電気系 柿元 芳文 , 山本 和英
はじめに 日々の報告を電子文書で提出 管理職による閲覧 問題があれば対応 非常に高コスト 問題のある表現を自動的に抽出したい
障害情報の定義 ある日報の中で何らかの障害を報告 している表現 障害の内容を把握できる単位が必要 係り受けの対を基とした構文片を用いた [Aoki et al. 07] 障害情報例
サーバーが → 壊れる 椅子が → 壊れる
手法概要 Livedoor Blog 価格.com 障害 日報 非障害 日報 学習データ 辞書の
拡張 障害情報辞書 新規入力日報 入力構文片 入力日報の 障害情報抽出 構文片のスコアリング マッチング A B C
学習データ 収集ルールは人手により設定 Livedoor Blog 障害日報 2,410件 非障害日報 3,651,242件
価格.com クチコミ掲示板 障害日報 30,000件 非障害日報 1,712,999件 A
障害情報辞書の作成 構文片にスコアを付与する 障害日報と非障害日報での出現の偏りを 用いた -1~+1のスコアを付与 出現頻度による信頼性を考慮 確率の信頼区間推定法を用いた
[藤村ら 04] [Alan et al. 98] 正のスコアとなった構文片を辞書へ登録 B
辞書をそのまま用いると 学習データ中の障害情報しか抽出 できない 未知の障害への対応が必要 辞書の拡張概要 動作が遅い 検索が 表示が 対応が
・・・ 検索が遅い 表示が遅い 対応が遅い ・・・ 類似したサ変名詞 を検索 辞書へ追加 C
Webコーパス 構文片 辞書中の構文片の拡張 サ変名詞が対象 前項、後項双方に行う 係り先の類似性を基に拡張
評価実験 2つの評価 辞書を用いた二値分類精度の評価 抽出された障害情報の評価 評価データ 被験者3人により作成
障害日報、非障害日報に分類 3人一致の日報のみ使用 障害日報、非障害日報 133件、 133件
評価:辞書を用いた二値分類精度 F値の最大値 0.772 適合率 0.724 再現率 0.827
評価基準 基準(1) 何らかの障害を表している 基準(2) 直接的に障害を表してはいないが、 何らかの障害を連想することができる 基準(3)
障害を表しておらず、連想することも できない
考察:二値分類時の誤抽出 傾きが一定 → どの閾値帯でも同程度の誤りを含んでいる 障害らしい構文片を得られるが最適とは言えない
評価:得られた障害情報 基準 障害情報 (1) 画面が ⇒ 表示されない 遅延が ⇒ 発生する
音が ⇒ 途切れる (2) サポートに ⇒ 電話する 販売店に ⇒ 返品する 原因を ⇒ 特定する (3) コンセントを ⇒ 抜く 電源を ⇒ 入れる 一度も ⇒ 繋がる
評価:拡張で得られた障害情報 基準 拡張元 拡張先 (1) 悪い⇒サービス 悪い⇒イメージ 検索が⇒出来ない 表示が⇒出来ない (2)
サポートに⇒連絡する サポートに⇒相談する エラーが⇒出る マークが⇒出る (3) 連絡を⇒くれる 返事を⇒くれる 基準(1)まで正解 : 適合率 0.30 基準(2)まで正解 : 適合率 0.40
終わりに 日報から障害情報を自動的に抽出す る手法を提案 構文片を用いて辞書を自動構築 二値分類器としての評価でF値0.772 抽出された障害情報の評価で 適合率0.40
スコア算出式 P(w i ) : ある構文片w i が出現した障害日誌の数 N(w i
) : ある構文片w i が出現した障害日誌の数 P doc : 障害日報の総数 N : 非障害日報の総数
信頼区間推定法
学習データ Livedoor Blog 障害情報 タグに「トラブル」が入っている タイトルに「トラブル」が入っている 非障害情報 タイトル及び本文に「トラブル」が入っていな
い 価格.com クチコミ掲示板 障害情報 タグが「悪い」に設定されている 非障害情報 タグが「悪い」「質問」以外に設定されている
拡張の概要