Upgrade to Pro — share decks privately, control downloads, hide ads and more …

音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討

Sponsored · Ship Features Fearlessly Turn features on and off without deploys. Used by thousands of Ruby developers.
Avatar for hyama5 hyama5
September 10, 2025

 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討

Avatar for hyama5

hyama5

September 10, 2025

More Decks by hyama5

Other Decks in Technology

Transcript

  1. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 背景 “テキスト”音声合成 カナ+アクセント記号-音声合成 「明日は晴れますか?」 /ア[シタ]ワ=ハ[レマ]スカ?/ • 🙆 大量のデータ収集が容易 •

    🙆 読み、韻律を制御可能 • 🙅 読み・アクセント間違いに よる不自然さの発生 • 🙅 データのアノテーションが困難 韻律制御可能な音声合成のための、自動韻律アノテーションに注目 2
  2. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 背景:言語・音声基盤モデル • 言語基盤モデルによるTTSの韻律の改善 ◦ ◦ BERT [Xiao20, Kenter20] 音素入力型

    BERT ▪ • 音声基盤モデルによる韻律推定 ◦ ◦ • PnG BERT [Wu21], phoneme-level (PL)-BERT [Li23] Whisper-encoderを利用 [Shirahata24] SSLモデルを利用 [Kurihara24] リサーチクエスチョン ◦ 言語基盤モデルと音声基盤モデルを組み合わせた韻律推定は有効? 3
  3. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 研究目的・手法 • 言語基盤モデルと音声基盤モデルを組み合わせた韻律アノテーション手法の検討 • アプローチ ◦ 韻律ラベルつきデータで学習 ▪ ◦

    言語基盤モデル ▪ ▪ ◦ 日本語話し言葉コーパス (CSJ)を使用 PnG BERT, PL-BERT vs. one-hot 単語依存や、カナ列依存で決まるアクセントの再現を期待 音声基盤モデル ▪ ▪ HuBERT, Whisper vs. melspectrogram, F0 豊富な音声の潜在的特徴による韻律ラベル推定を期待 4
  4. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 音声基盤モデル • 自己教師あり学習(SSL)モデル ◦ Wav2vec2.0, HuBERT, WavLM, … [Hsu

    et al, “HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units”, 2021] • Whisper [Radford23] ◦ 大量の音声データで学習した音声認識モデル 音響特徴量抽出に基盤モデルが有効 5
  5. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 音素入力BERT • • PnG BERT [Wu21] ◦ ◦ 音素+書記素列を入力にしたBERT

    マスクされたトークンを予測 PL-BERT [Li23] ◦ ◦ Phonemes [CLS] IY T IY Z S AH N IY [SEP] [CLS] it マスクされた音素だけでなく 音素から書記素を予測 推論時に書記素の入力が不要 Graphemes is sunny [SEP] Graphemes [CLS] it it is is sunny sunny sunny sunny [SEP] Phonemes [CLS] IY T IY Transformer layers [CLS] IY T [M] [M] S AH N IY [SEP] [CLS] it [MASK] sunny [SEP] Z S AH N IY [SEP] IY [SEP] Transformer layers [CLS] IY T [M] [M] S PnG BERT・PL-BERTは共に音声合成の自然性を上げると報告 AH N 6
  6. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 提案手法 韻律ラベル • 音声・言語基盤モデルの 中間特徴量を抽出 • アノテーションモデルを 通して韻律ラベルを予測 アノテーション

    モデル 音響入力 言語入力 + + weights weights 音素平均layers BERT layers 音素継続長 音声基盤モデル 音声波形 音素 (PL-BERT) / 音素+テキスト (PnG BERT) 7
  7. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 実験条件 • データ ◦ 日本語話し言葉コーパス(CSJ) コアデータ ▪ ◦ 学習データ

    ▪ ◦ 33.2時間 / 24.9k発話/ 1.58M音素 評価データ ▪ • 手動で付与された韻律ラベルを使用 1.3 時間 / 896発話 モデル ◦ ◦ アノテーションモデル: 6層 CNN, カーネルサイズ=5 音声入力 ▪ ◦ HuBERT (base), Whsiper-encoder (small), melspec, F0, なし 言語入力 ▪ PnG BERT, PL-BERT, one-hot, なし 8
  8. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 韻律ラベル a ACC [ HL L BI 0 PAU

    N • t * H 0 N a w ] H 1 N a # L 2 Y h a [ L 0 N r e d e ] H 1 N * L 0 N s u * L 1 N k a ? L 3 N NN [, ]: 低→高、高→低の遷移 #, ? , %: 下降調、上昇調、上昇下降調の句末音調 HL:高低 ◦ • i ACC:アクセントラベル ◦ ◦ • sj H, L: 高低ピッチアクセント • PAU ◦ Y, N: Short-Pause existence BI:境界強度 ◦ ◦ 0, 1, 2, 3: 境界なし、単語境界、アクセント句境界、イントネーション句境界 F, D: フィラー、非流暢句 9
  9. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 混同行列:アクセントラベル(ACC) True Predicted * [ ] # % ?

    * [ ] # % ? * 17363 274 405 539 1 40 * 17178 319 455 641 0 39 [ 308 5392 161 16 0 8 [ 355 5343 174 22 1 ] 445 96 3828 9 0 2 ] 451 97 3819 8 # 791 15 10 3323 14 70 # 790 21 11 % 9 2 0 44 236 39 % 10 2 ? 74 7 13 95 46 1010 ? 72 14 (a) HuBERT & PnG BERT - ] # % ? * 16690 437 647 807 1 40 10 [ 407 5151 311 16 0 0 0 5 ] 807 255 3310 7 0 1 3318 19 64 # 1035 20 18 2948 27 175 0 39 246 33 % 12 3 0 156 49 110 15 106 66 972 ? 162 5 6 575 37 460 (b) HuBERT & no linguistic input * [ (c) no acoustic input & PnG BERT HuBERTでは句末境界音調(#, %, ?)の誤りが減少 12
  10. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 混同行列: 境界強度(BI) True Predicted 0 1 2 3 F

    D 0 16768 65 6 2 5 1 99 9974 281 80 2 4 411 2258 3 3 104 F 3 D 5 1 2 3 F D 0 1 2 3 F D 9 0 16522 276 17 10 10 20 0 16784 48 3 9 1 10 2 5 1 302 9715 334 78 5 7 1 92 9748 437 139 16 9 422 6 10 2 8 388 2305 395 3 12 2 7 625 1861 603 10 5 310 2534 40 17 3 13 94 324 2520 37 20 3 15 198 561 2165 59 10 5 0 35 993 12 F 11 5 1 37 968 26 F 7 7 0 31 991 12 4 5 19 13 176 D 8 8 14 19 14 159 D 15 8 8 19 17 155 (a) HuBERT & PnG BERT - 0 (b) HuBERT & no linguistic input (c) no acoustic input & PnG BERT PnG BERTによって単語境界の有無の認識率が向上 (0 & 1) HuBERTを使うとフレーズ境界の誤りが減少 (2 & 3) 13
  11. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 推定結果 e H pau sy u ACC [ HL

    L BI 0 PAU N * H F N ] H 0 N ACC [ HL L BI 0 PAU N * H F N ] H 0 N m i g a o N g a a N * L 1 N ? L 2 Y ] H 0 N * L 0 N * # ] L L H 0 2 1 N N N (a) 手動アノテーション * L 1 N * L 0 N # L 2 N [ L 0 N * H 0 N * H 1 N ? H 3 N * L 1 N ? L 2 Y ] H 0 N * L 0 N * L 1 N * L 0 N * L 1 N * L 0 N * L 0 N * L 1 N ? L 3 N * L 0 N k u * L 1 N n ] H 1 N d e s u k e r e d o m o N N (b) 予測ラベル (HuBERT+PnG BERT) 予測したラベルは手動アノテーションと似た結果に 14
  12. 音素BERTと音声基盤モデルを用いた自動韻律アノテーションの検討 予測ラベルを用いたTTS学習の例 • 「この鼻は小さい」 “テキスト”音声合成 カナ+アクセント記号-音声合成 /コ [ ノ #

    ハ [ ナ ワ # チ [ ー サ ] イ/ • 「この花は小さい」 “テキスト”音声合成 カナ+アクセント記号-音声合成 /コ [ ノ # ハ [ ナ ] ワ # チ [ ー サ ] イ/ 15