Upgrade to Pro — share decks privately, control downloads, hide ads and more …

妊産婦の音声と転移学習による、精神疾患合併妊婦のスクリーニング

Avatar for Hikaru Oba Hikaru Oba
June 17, 2023
6

 妊産婦の音声と転移学習による、精神疾患合併妊婦のスクリーニング

2023年6月17日・18日 に行われた日本メディカルAI学会第5回学術集会での発表資料です

Avatar for Hikaru Oba

Hikaru Oba

June 17, 2023

More Decks by Hikaru Oba

Transcript

  1. 周産期の気分障害や不安障害、重篤な精神疾患は、母親の重度な 疾患の罹患率や死亡率、分娩費用などの有害なアウトカムと関連 妊産婦の自殺はアメリカにおける産後女性の死因の第2位 McKee, K. et al. Perinatal mood and

    anxiety disorders, serious mental illness, and delivery-related health outcomes, United States, 2006-2015. BMC Womens. Health 20, 150 (2020). Admon, L. K. et al. Trends in Suicidality 1 Year Before and After Birth Among Commercially Insured Childbearing Individuals in the United States, 2006-2017. JAMA Psychiatry 78, 171–176 (2021). 周産期アウトカムを改善するうえで、妊婦の 精神疾患を特定・治療することが重要 Hamidia, A. et al. Screening of psychiatric disorders in women with high-risk pregnancy: Accuracy of three psychological tools. Health Sci Rep 5, e518 (2022). 4/49 序論
  2. Edinburgh Postnatal Depression Scale (EPDS) Brief Symptom Inventory (BSI-53) BSI-18

    →主観的なアンケート形式で、閾値設定の妥当性が不十分なものが多い 周産期の精神疾患スクリーニングツールは いくつかある Hamidia, A. et al. Screening of psychiatric disorders in women with high-risk pregnancy: Accuracy of three psychological tools. Health Sci Rep 5, e518 (2022). 5/49 Bowling, A. Mode of questionnaire administration can have serious effects on data quality. J. Public Health 27, 281–291 (2005). 序論
  3. 異なる周波数領域および時間領域を有する 3つのメルスペクトログラムを統合し、 3チャネル画像に変換した Szep, J. & Hariri, S. Paralinguistic classification

    of mask wearing by image classifiers and fusion. in Interspeech 2020 (ISCA, 2020). 12/49 方法 ① window length=(256,512,1024) 3 channel melspectroglam 量子化数:128 -1~1の範囲で正規化 224 x 224にリサイズ 1 channel melspectroglam window length 256 window length 512 window length 1024 Time frequency 周波数領域と時間領域の解像度は トレードオフの関係
  4. Color jitter (輝度変化) Frequency masking (マスキング) Time masking (マスキング) Time

    masking + Frequency masking (マスキング) Original (オーグメンテーションなし) データオーグメンテーション Atmaja, B. T. & Sasou, A. Effects of Data Augmentations on Speech Emotion Recognition. Sensors 22, (2022). 13/49 方法 ①
  5. Audio data Audio segments After data augmentation Train data 97

    5190 25950 Validation data 32 338 338 Test data 43 549 549 Number of segments after data augmentation 32/92 Method ②
  6. Context-rich Minority Oversampling:CMO Park, S., Hong, Y., Heo, B., Yun,

    S. & Choi, J. Y. The Majority Can Help The Minority: Context-rich Minority Oversampling for Long-tailed Classification. arXiv [cs.CV] (2021). 14/49 方法 ① Foreground image 𝑥𝑥 𝑖𝑖 𝑓𝑓 , 𝑦𝑦 𝑖𝑖 𝑓𝑓 Background image 𝑥𝑥 𝑖𝑖 𝑏𝑏 , 𝑦𝑦 𝑖𝑖 𝑏𝑏 Cutmix � 𝐷𝐷𝑖𝑖=1 𝑁𝑁 𝐷𝐷𝑖𝑖=1 𝑁𝑁 𝑞𝑞 𝑘𝑘 = ⁄ 1 𝑛𝑛𝑘𝑘 𝑟𝑟 ∑ 𝑘𝑘′=1 𝑐𝑐 ⁄ 1 𝑛𝑛𝑘𝑘′ 𝑟𝑟 𝑞𝑞 𝑘𝑘 = 1 � 𝑘𝑘′=1 𝑐𝑐 𝑛𝑛𝑘𝑘′ 𝑟𝑟 k :Number of classes 𝑛𝑛𝑘𝑘 :Number of samples in class k � 𝐷𝐷𝑖𝑖=1 𝑁𝑁 :Data set with oversampling 𝐷𝐷𝑖𝑖=1 𝑁𝑁 :Data set without oversampling
  7. モデルアーキテクチャ:ImageNetで事前学習したResNextモデル 損失関数:Focal loss オプティマイザー:AdaBelief+Sharpness aware minimization ハイパーパラメータチューニング:Optuna 深層学習モデル Xie, S.,

    Girshick, R., Dollár, P., Tu, Z. & He, K. Aggregated Residual Transformations for Deep Neural Networks. arXiv [cs.CV] (2016). 16/49 方法 ② Foret, P., Kleiner, A., Mobahi, H. & Neyshabur, B. Sharpness-Aware Minimization for Efficiently Improving Generalization. arXiv [cs.LG] (2020). Zhuang, J. et al. AdaBelief Optimizer: Adapting Stepsizes by the Belief in Observed Gradients. arXiv [cs.LG] (2020). Takuya A, Shotaro S, Toshihiko Y, Takeru O,and Masanori K. 2019. Optuna: A Next-generation Hyperparameter Optimization Framework. In KDD. Xie, S., Girshick, R., Dollár, P., Tu, Z. & He, K. Aggregated Residual Transformations for Deep Neural Networks. arXiv [cs.CV] (2016). Lin, T.-Y., Goyal, P., Girshick, R., He, K. & Dollar, P. Focal Loss for Dense Object Detection. IEEE Trans. Pattern Anal. Mach. Intell. 42, 318–327 (2020).
  8. Accuracy Recall Precision F1 score ROC-AUC G-mean 0.61 0.56 0.53

    0.52 0.56 0.56 音声セグメントの分類結果 20/49 結果 ①
  9. Accuracy Recall Precision F1 score ROC-AUC G-mean 0.75 0.71 0.60

    0.60 0.71 0.71 音声アンサンブル後の結果 21/49 結果 ①
  10. 発声に問題を有する患者の32%がBSI18でうつ病、不安、身体的懸念に 関する厳格な症例基準を満たしていた 抑うつ症状が存在すると、過去 1 年間に発声の問題を報告する可能性が 約2 倍に増加 オッズ比:1.89、95% 信頼区間:1.21 -

    2.96 Marmor, S., Horvath, K. J., Lim, K. O. & Misono, S. Voice problems and depression among adults in the United States. Laryngoscope 126, 1859–1864 (2016). Misono, S. et al. Psychosocial distress in patients presenting with voice concerns. J. Voice 28, 753–761 (2014). 精神障害と発声障害 74/88 考察 ②
  11. 音声以外の画像セットで事前学習したモデルであっても、 スペクトログラムの転移学習が可能 30/49 考察 ② Szep, J. & Hariri, S.

    Paralinguistic classification of mask wearing by image classifiers and fusion. in Interspeech 2020 (ISCA, 2020).
  12. 多数派データ 少数派データ Context-rich Minority Oversampling(CMO) Park, S., Hong, Y., Heo,

    B., Yun, S. & Choi, J. Y. The Majority Can Help The Minority: Context-rich Minority Oversampling for Long-tailed Classification. arXiv [cs.CV] (2021). 34/49 考察 ② Cutmix + 少数派クラスのオーバーサンプリング + 多数派クラスのアンダーサンプリング
  13. majority class minority class 下記のような不均衡2値クラス分類問題を考える 35/49 考察 ② Wallace, B.

    C., Small, K., Brodley, C. E. & Trikalinos, T. A. Class Imbalance, Redux. in 2011 IEEE 11th International Conference on Data Mining (IEEE, 2011). doi:10.1109/icdm.2011.33.
  14. majority class minority class 真の分類決定境界𝑤𝑤を推定したい 36/49 考察 ② Wallace, B.

    C., Small, K., Brodley, C. E. & Trikalinos, T. A. Class Imbalance, Redux. in 2011 IEEE 11th International Conference on Data Mining (IEEE, 2011). doi:10.1109/icdm.2011.33. 𝒘𝒘
  15. majority class minority class 実際は多数派クラスを多く学習してしまうため、 予測された決定境界� 𝒘𝒘は少数派クラスに寄ってしまう 37/49 考察 ②

    Wallace, B. C., Small, K., Brodley, C. E. & Trikalinos, T. A. Class Imbalance, Redux. in 2011 IEEE 11th International Conference on Data Mining (IEEE, 2011). doi:10.1109/icdm.2011.33. 𝒘𝒘 � 𝒘𝒘 Bias
  16. majority class minority class 予測された決定境界� 𝒘𝒘を、真の分類決定境界𝒘𝒘に 近づけたい 38/49 考察 ②

    Wallace, B. C., Small, K., Brodley, C. E. & Trikalinos, T. A. Class Imbalance, Redux. in 2011 IEEE 11th International Conference on Data Mining (IEEE, 2011). doi:10.1109/icdm.2011.33. 𝒘𝒘 � 𝒘𝒘
  17. ブートストラップ:Bias↓ 全体としては少数クラスのオーバーサンプリング 𝑞𝑞 𝑘𝑘 = ⁄ 1 𝑛𝑛𝑘𝑘 𝑟𝑟 ∑

    𝑘𝑘′=1 𝑐𝑐 ⁄ 1 𝑛𝑛𝑘𝑘′ 𝑟𝑟 前景画像において、多数派クラスはミニバッチ内で アンダーサンプリングされる。 46/49 考察 ②
  18. Demucs (Deep Extractive Music Composition Source Separation) 、 Audition CC

    2022(Ver.23.1) を用いて、ノイズ除去を行った 処理した111人の音声のうち62人(55.8%)が学習セット、 21人(18.9%)が検証セット、28人(25.2%)がテストセットに なるように、層別にランダム分割した データの分割 8/48 方法 ①
  19. Demucsは音源分離に特化した深層学習ベースの モデル U-Net構造に基づくアーキテクチャ Bidirectional LSTM (Long Short-Term Memory) : 音声の前後のコンテキストをLSTMで同時に考慮

    するため、より良い音源分離性能を発揮する Demucs (Deep Extractive Music Composition Source Separation) ライブラリを用いて、環境音などの ノイズ除去を行った。 Rouard, S., Massa, F. & Défossez, A. Hybrid Transformers for Music Source Separation. arXiv [eess.AS] (2022). 19/88 方法 ② その後、Adobe社の音声ソフトAudition CC 2022(Ver.23.1) を用いて、残存ノイズ、 同伴者、インタビュアーなどの人物の音声信号を除去した。
  20. 音声の教師なし学習などでは、同じオーディオクリップからサンプリングされた 音声セグメントは似た性質を持つと仮定できる Saeed, A., Grangier, D. & Zeghidour, N. Contrastive

    Learning of General-Purpose Audio Representations. arXiv [cs.SD] (2020). 各音声を5秒ごとに分割し、すべての音声セグメントに 対してShort-time Fourier transform(STFT) を行い、 メルスペクトログラムを作成した 22/88 方法 ② shift
  21. F L 𝑝𝑝t = −α 1 − 𝑝𝑝t 𝛾𝛾log(𝑝𝑝t )

    正しいクラスに対する信頼度が高まるにつれスケーリングファクターが0に減衰 学習中に簡単な例の寄与を自動的に減少させ、難しいサンプルにモデルを迅速に 集中させることができる →分類が困難なサンプルに集中して学習 損失関数:Focal loss Lin, T.-Y., Goyal, P., Girshick, R., He, K. & Dollar, P. Focal Loss for Dense Object Detection. IEEE Trans. Pattern Anal. Mach. Intell. 42, 318–327 (2020). 33/88 方法 ③
  22. Sharpness aware minimization: 損失が最小かつその周辺が平坦なパラメータを目指す パラメータ周辺での最大の損失を求め、それが下がる方向でパラメータを更新 →汎化性能を向上 ① ② ③ オプティマイザー:

    AdaBelief+Sharpness aware minimization Foret, P., Kleiner, A., Mobahi, H. & Neyshabur, B. Sharpness-Aware Minimization for Efficiently Improving Generalization. arXiv [cs.LG] (2020). 35/88 方法 ③
  23. https://tech.preferred.jp/ja/blog/an-introduction-to-hyperparameter-optimization-with-optuna-ieice/ Batch size=64 epochs = 50 lr = 0.0015 𝜷𝜷𝟏𝟏

    = 0.90 γ = 2 α = 0.40 Optuna: Bayes最適化を用いたTree-structured Parzen Estimator (TPE) アルゴリズムと ランダムサーチを組み合わせたハイパーパラメータ最適化フレームワーク チューニング対象は学習率lr、AdaBeliefのβ1 、 Focal Lossのγとα ハイパーパラメータチューニング:Optuna Takuya A, Shotaro S, Toshihiko Y, Takeru O,and Masanori K. 2019. Optuna: A Next-generation Hyperparameter Optimization Framework. In KDD. 36/88 方法 ③
  24. window length (256,512,1024) 3 channel ResNext 101_32x8d Normal Abnormal 転移学習

    Fully Connected Layer (1280,2) データ拡張 Frequency masking Time masking Color jitter original Time masking + Frequency masking window length=256 1 channel window length=512 1 channel window length=1024 1 channel audio segments メルスペクトログラム作成 Context-rich Minority Oversampling Ensemble
  25. accuracy = 𝑇𝑇𝑇𝑇 + 𝑇𝑇𝑇𝑇 𝑇𝑇𝑇𝑇 + 𝑇𝑇𝑇𝑇 + 𝐹𝐹𝐹𝐹

    + 𝐹𝐹𝐹𝐹 𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝 = 𝑇𝑇𝑇𝑇 𝑇𝑇𝑇𝑇 + 𝐹𝐹𝐹𝐹 𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟 = 𝑇𝑇𝑇𝑇 𝑇𝑇𝑇𝑇 + 𝐹𝐹𝐹𝐹 𝐹𝐹1 𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠𝑠 = 2 ⋅ 𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃 ⋅ 𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅 𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃 + 𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅 FN TN TP FP TP:真陽性 TN:真陰性 FP:偽陽性 FN:偽陰性 真のラベル 予測ラベル 評価指標 40/88 結果 ①
  26. 𝑇𝑇𝑇𝑇𝑇𝑇𝑇𝑇 𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝 𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟 𝑇𝑇𝑇𝑇𝑇𝑇 = 𝑇𝑇𝑇𝑇 𝑇𝑇𝑇𝑇 + 𝐹𝐹𝐹𝐹 𝐹𝐹𝐹𝐹𝐹𝐹𝐹𝐹𝐹𝐹

    𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝𝑝 𝑟𝑟𝑟𝑟𝑟𝑟𝑟𝑟 𝐹𝐹𝐹𝐹𝐹𝐹 = 𝐹𝐹𝐹𝐹 𝐹𝐹𝐹𝐹 + 𝑇𝑇𝑇𝑇 𝐺𝐺 − 𝑚𝑚𝑚𝑚𝑚𝑚𝑚𝑚 = 𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃𝑃・𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅𝑅 FN TN TP FP TP:真陽性 TN:真陰性 FP:偽陽性 FN:偽陰性 真のラベル 予測ラベル 評価指標 41/88 結果 ①
  27. ドイツ語、イタリア語、イギリス英語などの音声データの感情分析 Data augmentationは高さのシフト、ズーム、Horizontal Flip 音声感情分類タスクにおいて、メルスペクトログラムは MFCCよりも精度が高い。 78/88 考察 ② Dossou,

    B. F. P. & Gbenou, Y. K. S. FSER: Deep Convolutional Neural Networks for Speech Emotion Recognition. in Proceedings of the IEEE/CVF International Conference on Computer Vision 3533–3538 (openaccess.thecvf.com, 2021)
  28. Sample A Sample B Sample X … Classifier A Classifier

    B Classifier X Ensemble Classifier バギング (ブートストラップ+アグリゲーティング) Voting Original data Sample A Sample B Sample X … Classifier A Classifier B Classifier X Ensemble Classifier ブースティング Original data Sample A Sample B Sample X … Classifier A Classifier B Classifier X Ensemble Classifier スタッキング Training Original data … … … … … … アンサンブル学習: 個々に学習した複数モデルの統合 31/48 考察 ②
  29. Sample A Sample B Sample X … Classifier A Classifier

    B Classifier X Ensemble Classifier バギング (ブートストラップ+アグリゲーティング) Voting Original data Sample A Sample B Sample X … Classifier A Classifier B Classifier X Ensemble Classifier ブースティング Original data Sample A Sample B Sample X … Classifier A Classifier B Classifier X Ensemble Classifier スタッキング Training Original data … … … … … … アンサンブル学習: 個々に学習した複数モデルの統合 33/49 考察 ②
  30. 多数派データ 少数派データ Context-rich Minority Oversampling(CMO) Park, S., Hong, Y., Heo,

    B., Yun, S. & Choi, J. Y. The Majority Can Help The Minority: Context-rich Minority Oversampling for Long-tailed Classification. arXiv [cs.CV] (2021). 55/88 考察 ①
  31. 多数派データ 少数派データ Context-rich Minority Oversampling(CMO) Park, S., Hong, Y., Heo,

    B., Yun, S. & Choi, J. Y. The Majority Can Help The Minority: Context-rich Minority Oversampling for Long-tailed Classification. arXiv [cs.CV] (2021). 56/88 考察 ①
  32. メルスペクトログラム EPDS データオーグメンテーション: Time masking 、Frequency masking、 Time masking +

    Frequency masking、 Color jitter、CMO モデルアーキテクチャ:MobileNetV3 損失関数:Focal Loss オプティマイザー:AdaBelief+SAM →エジンバラ産後うつ病評価尺度と ほぼ変わらない精度を維持