Upgrade to Pro — share decks privately, control downloads, hide ads and more …

不均衡データ分析入門

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest. →

 不均衡データ分析入門

LETメソドロジー研究部会(2026年10月3日)

Avatar for Yuichiro Kobayashi

Yuichiro Kobayashi

October 03, 2026

More Decks by Yuichiro Kobayashi

Other Decks in Science

Transcript

  1. はじめに • 本発表の一部は、以下の論文に基づく • Kobayashi, Y. (2026). Addressing imbalanced data

    problems in corpus linguistics: A comparative evaluation. Methodology SIG Report Series, 19, 79–93. 4
  2. 不均衡データとは • 言語コーパスのデザインは、しばしば不均衡 • British National Corpus (BNC) の話し言葉データは全体の10%程度 ↓

    • 現実世界では話し言葉の方が圧倒的に多く産出されるが、その収集・電子化 のコストが高い • ARCHER (A Representative Corpus of Historical English Registers) の British componentでは、17世紀前半の構成比率がわずか4.4%程度 ↓ • 古い時代の言語データを適切な代表性を持った形で集めることが難しい 5
  3. • 学習者のデータも、往々にして不均衡 • NICT JLE Corpusでは、中級データが圧倒的に多く、初級と上級のデータが 相対的に少ない ↓ • 習熟度が正規分布すると仮定すれば、中級が多くなるのは当然

    • Longitudinal Corpus of Spoken English (LOCSE) でも、中級データが圧倒的 に多く、上級データがほとんどない ↓ • 特定の教育機関で収集したことによる切断効果・選抜効果 6
  4. • 何が問題なのか? • サブコーパスのサイズが大きく異なると、統計的な推定の精度や検定の妥当 性に重大な影響 ↓ • グループ間の分散の不均一性が生じることで、標準的な検定手法の前提条件 が満たされないリスク •

    サイズの小さいサブコーパスの標準誤差が大きくなり、少数の特異なデータ が分析結果を歪めてしまうことで、推定が不安定になるリスク ↓ • 本来は存在しない差を有意と見なす、あるいは逆に、重要な言語的特徴を見 逃す、といった統計的な誤判断を招く恐れ 7
  5. • より一般的な不均衡データ • クレジットカードの不正利用 • ガン診断 • スパムメール etc. •

    いずれの場合も、検出すべき対象が圧倒的な少数派 • しかし、見逃してはならない 9
  6. 基本的な不均衡データ分析 • 評価指標の再検討 • Precision • Recall • F1 etc.

    • 分析手法の再検討 • Oversampling • Undersampling • SMOTE etc. 10
  7. • 主な代替指標 適合率(Precision) 少数派をどれだけ正確に捉えたかを評価 再現率(Recall) 少数派をどれだけ取りこぼしていないかを評価 F1スコア 適合率と再現率の調和平均で、両者のバランスを評価 MCC (Matthews

    Correlation Coefficient) PR-AUC (Area Under the Precision-Recall Curve) クラスの不均衡が極端な場合でも、ランダムな予測よりどの程度優れ ているかを厳密に判定(今回は割愛) 13
  8. 実験 1 • 不均衡データにおける正解率の罠 • サブコーパス間のサイズ差がモデルに与える影響を精査 • 実験データ • オープンデータセットであるSpam

    Dataset (Hasti et al., 2009) • 4601件の電子メール(nonspamが2788件、spamが1813件) • 58個の変数 • メールで使用されている語彙(48変数) • メールで使用されている記号(6変数) • 大文字の連続使用に関する平均長・最大長・総計(3変数) • nonspam / spamのラベル(1変数) • Rのkernlabパッケージにも格納 14
  9. • 実験 1の結果 Number of spam Accuracy Precision Recall F1

    1000 0.922 0.929 0.920 0.925 500 0.931 0.929 0.879 0.903 200 0.939 0.855 0.770 0.810 100 0.930 0.588 0.690 0.635 50 0.930 0.263 0.385 0.313 16
  10. 不均衡データの分析手法 • 基本的な手法 その他の手法については、 Kobayashi (2026) を参照 Undersampling 多数派のデータを減らし、少数派のサイズに合わせる。計算コス トを下げる利点があるが、貴重な多数派の情報を捨てることにな

    る。 Oversampling 少数派の既存データを単純に複製して増やす。情報が失われない 利点はあるが、同じデータを繰り返し学習するため、特定のサン プルに過剰に適合する過学習を招きやすい。 SMOTE (Synthetic Minority Over-sampling TEchnique) 少数派の近傍データ間に新しい合成サンプルを人工的に生成する。 単なる複製ではないため、オーバーサンプリングよりもデータの 多様性を確保できるが、クラス間の境界が曖昧な領域に不自然な データを生成し、ノイズを増やすリスクがある。 Cost-Sensitive Learning 少数派の誤分類に対して、多数派の誤分類よりも重いペナルティ を課すように損失関数を調整する。「1回の見逃しは、10回の誤検 知よりも重罪である」とモデルに教え込むような手法とも言える。 19
  11. 実験 2 • 基本的な手法の性能比較 • Undersampling、Oversampling、SMOTE、Cost-sensitive Learning (Weighted-GLM) • 実験データは、Spam

    Dataset(実験 1と同じ) • 分類手法も、シンプルなロジスティック回帰モデル(実験 1と同じ) • 多数派クラスと少数派クラスの比率は、20:1 22
  12. • 実験 2の結果 • 今回の実験データに対しては、SMOTEが最も有効 • 再現率のみは、オーバーサンプリングが最良 • 一般的な傾向として、多数派のデータを捨てる手法よりは、少数派のデータ を増やす手法の方が有効(な印象)

    Method Baseline Undersampling Oversampling SMOTE Weighted Accuracy 0.930 0.549 0.778 0.946 0.924 Precision 0.263 0.055 0.130 0.389 0.296 Recall 0.385 0.615 0.769 0.538 0.615 F1 0.313 0.101 0.222 0.452 0.400 23
  13. 今後の方向性 • 多クラス分類(3クラス以上の分類) • 基本的な考え方は2クラス分類と同じだが、クラス数や不均衡の度合いに よって、より高度な対応が必要になる • 発展的な手法 • アンサンブル学習

    (Yağcı et al, 2016) • 各ツリーを構築する際にサンプリング比率を調整 • 異常検知 (Das et al., 2023) • 特定のサブグループの数が極めて小さく、SMOTEに用いる近傍データ数に満たない場合 など • 深層学習 (Lin et al., 2017; Cui et al., 2019) • 正解しやすい多数派の寄与を抑え、学習が難しい例に集中 • クラスごとの有効サンプル数に基づいて、重みを動的に変化 etc. 26
  14. Thank you for your time and attention This work was

    supported by JSPS KAKENHI Grant Number 26K03997 27