Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
構文片を用いた日報からの障害情報抽出
Search
自然言語処理研究室
March 31, 2008
Research
0
110
構文片を用いた日報からの障害情報抽出
柿元 芳文, 山本 和英. 構文片を用いた日報からの障害情報抽出. 言語処理学会第14回年次大会, pp.923-926 (2008.3)
自然言語処理研究室
March 31, 2008
Tweet
Share
More Decks by 自然言語処理研究室
See All by 自然言語処理研究室
データサイエンス14_システム.pdf
jnlp
0
400
データサイエンス13_解析.pdf
jnlp
0
510
データサイエンス12_分類.pdf
jnlp
0
360
データサイエンス11_前処理.pdf
jnlp
0
490
Recurrent neural network based language model
jnlp
0
140
自然言語処理研究室 研究概要(2012年)
jnlp
0
150
自然言語処理研究室 研究概要(2013年)
jnlp
0
110
自然言語処理研究室 研究概要(2014年)
jnlp
0
140
自然言語処理研究室 研究概要(2015年)
jnlp
0
220
Other Decks in Research
See All in Research
教師あり学習と強化学習で作る 最強の数学特化LLM
analokmaus
2
890
20251023_くまもと21の会例会_「車1割削減、渋滞半減、公共交通2倍」をめざして.pdf
trafficbrain
0
180
生成AIとうまく付き合うためのプロンプトエンジニアリング
yuri_ohashi
0
140
Collective Predictive Coding and World Models in LLMs: A System 0/1/2/3 Perspective on Hierarchical Physical AI (IEEE SII 2026 Plenary Talk)
tanichu
1
250
AI Agentの精度改善に見るML開発との共通点 / commonalities in accuracy improvements in agentic era
shimacos
5
1.3k
2026.01ウェビナー資料
elith
0
220
POI: Proof of Identity
katsyoshi
0
140
[Devfest Incheon 2025] 모두를 위한 친절한 언어모델(LLM) 학습 가이드
beomi
2
1.4k
LiDARセキュリティ最前線(2025年)
kentaroy47
0
140
CoRL2025速報
rpc
4
4.2k
Thirty Years of Progress in Speech Synthesis: A Personal Perspective on the Past, Present, and Future
ktokuda
0
170
SREのためのテレメトリー技術の探究 / Telemetry for SRE
yuukit
13
3k
Featured
See All Featured
Prompt Engineering for Job Search
mfonobong
0
160
技術選定の審美眼(2025年版) / Understanding the Spiral of Technologies 2025 edition
twada
PRO
117
110k
No one is an island. Learnings from fostering a developers community.
thoeni
21
3.6k
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
440
How to build an LLM SEO readiness audit: a practical framework
nmsamuel
1
650
brightonSEO & MeasureFest 2025 - Christian Goodrich - Winning strategies for Black Friday CRO & PPC
cargoodrich
3
110
Deep Space Network (abreviated)
tonyrice
0
67
How To Stay Up To Date on Web Technology
chriscoyier
791
250k
Imperfection Machines: The Place of Print at Facebook
scottboms
269
14k
Leading Effective Engineering Teams in the AI Era
addyosmani
9
1.6k
sira's awesome portfolio website redesign presentation
elsirapls
0
150
How Software Deployment tools have changed in the past 20 years
geshan
0
32k
Transcript
構文片を用いた 日報からの障害情報抽出 長岡技術科学大学 電気系 柿元 芳文 , 山本 和英
はじめに 日々の報告を電子文書で提出 管理職による閲覧 問題があれば対応 非常に高コスト 問題のある表現を自動的に抽出したい
障害情報の定義 ある日報の中で何らかの障害を報告 している表現 障害の内容を把握できる単位が必要 係り受けの対を基とした構文片を用いた [Aoki et al. 07] 障害情報例
サーバーが → 壊れる 椅子が → 壊れる
手法概要 Livedoor Blog 価格.com 障害 日報 非障害 日報 学習データ 辞書の
拡張 障害情報辞書 新規入力日報 入力構文片 入力日報の 障害情報抽出 構文片のスコアリング マッチング A B C
学習データ 収集ルールは人手により設定 Livedoor Blog 障害日報 2,410件 非障害日報 3,651,242件
価格.com クチコミ掲示板 障害日報 30,000件 非障害日報 1,712,999件 A
障害情報辞書の作成 構文片にスコアを付与する 障害日報と非障害日報での出現の偏りを 用いた -1~+1のスコアを付与 出現頻度による信頼性を考慮 確率の信頼区間推定法を用いた
[藤村ら 04] [Alan et al. 98] 正のスコアとなった構文片を辞書へ登録 B
辞書をそのまま用いると 学習データ中の障害情報しか抽出 できない 未知の障害への対応が必要 辞書の拡張概要 動作が遅い 検索が 表示が 対応が
・・・ 検索が遅い 表示が遅い 対応が遅い ・・・ 類似したサ変名詞 を検索 辞書へ追加 C
Webコーパス 構文片 辞書中の構文片の拡張 サ変名詞が対象 前項、後項双方に行う 係り先の類似性を基に拡張
評価実験 2つの評価 辞書を用いた二値分類精度の評価 抽出された障害情報の評価 評価データ 被験者3人により作成
障害日報、非障害日報に分類 3人一致の日報のみ使用 障害日報、非障害日報 133件、 133件
評価:辞書を用いた二値分類精度 F値の最大値 0.772 適合率 0.724 再現率 0.827
評価基準 基準(1) 何らかの障害を表している 基準(2) 直接的に障害を表してはいないが、 何らかの障害を連想することができる 基準(3)
障害を表しておらず、連想することも できない
考察:二値分類時の誤抽出 傾きが一定 → どの閾値帯でも同程度の誤りを含んでいる 障害らしい構文片を得られるが最適とは言えない
評価:得られた障害情報 基準 障害情報 (1) 画面が ⇒ 表示されない 遅延が ⇒ 発生する
音が ⇒ 途切れる (2) サポートに ⇒ 電話する 販売店に ⇒ 返品する 原因を ⇒ 特定する (3) コンセントを ⇒ 抜く 電源を ⇒ 入れる 一度も ⇒ 繋がる
評価:拡張で得られた障害情報 基準 拡張元 拡張先 (1) 悪い⇒サービス 悪い⇒イメージ 検索が⇒出来ない 表示が⇒出来ない (2)
サポートに⇒連絡する サポートに⇒相談する エラーが⇒出る マークが⇒出る (3) 連絡を⇒くれる 返事を⇒くれる 基準(1)まで正解 : 適合率 0.30 基準(2)まで正解 : 適合率 0.40
終わりに 日報から障害情報を自動的に抽出す る手法を提案 構文片を用いて辞書を自動構築 二値分類器としての評価でF値0.772 抽出された障害情報の評価で 適合率0.40
スコア算出式 P(w i ) : ある構文片w i が出現した障害日誌の数 N(w i
) : ある構文片w i が出現した障害日誌の数 P doc : 障害日報の総数 N : 非障害日報の総数
信頼区間推定法
学習データ Livedoor Blog 障害情報 タグに「トラブル」が入っている タイトルに「トラブル」が入っている 非障害情報 タイトル及び本文に「トラブル」が入っていな
い 価格.com クチコミ掲示板 障害情報 タグが「悪い」に設定されている 非障害情報 タグが「悪い」「質問」以外に設定されている
拡張の概要