Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Web_Speech_APIと_Google_Cloud_Speech_to_Text_比較し...
Search
Kawazu
July 02, 2020
Programming
400
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Web_Speech_APIと_Google_Cloud_Speech_to_Text_比較してみる.pdf
Kawazu
July 02, 2020
More Decks by Kawazu
See All by Kawazu
個人的に考える要件定義でやる一連の流れ
kawazu
0
440
ChatGPTで水平思考ゲームを行えるか試してみた
kawazu
0
360
新人プロダクトマネージャーの試行錯誤記録
kawazu
0
220
バックエンドエンジニアが初めてReactを触って感じたこと
kawazu
0
310
音楽仲間がいないのでバンドメンバーを実装した話
kawazu
0
120
JetsonNanoで自動作曲配信システムを作ってる途中の話
kawazu
0
780
bert-tokenizerノードを触ってみた
kawazu
0
340
BERTで文章関連度算出して戯れてみる
kawazu
0
160
Node-REDとAutomatorでプライバシーマスク作成を自動化する
kawazu
0
210
Other Decks in Programming
See All in Programming
【やさしく解説 設計編 #0】DDDのコード、読めるのに分からない人へ
panda728
PRO
2
290
型も通る、synthも通る、それでも危ない 〜AIのCDKの権限とコストを機械で検証する〜 / It Passes Type Checks, It Passes Synth Checks, but It’s Still Risky — Automatically Verifying Permissions and Costs in AI’s CDK —
seike460
PRO
1
490
Google Apps Script で Ruby を動かす
kawahara
0
120
仕様書を書く前にハーネスを作る - Agent Native開発は「探索を速く、判定を固く」
gotalab555
2
1.3k
Embedded SREと共に達成した会員管理システムのAWS移行 - SRE NEXT 2026 ランチスポンサーセッション
niftycorp
PRO
1
3.2k
OpenSpecのproposalにbrainstormingを持たせてみた
tigertora7571
1
150
音楽のための関数型プログラミング言語mimiumにおける多段階計算の活用
tomoyanonymous
1
370
AI時代のPHPer生存戦略 ~「言語、もうなんでもよくない?」に本気で向き合う~
vivion
0
210
Android CLI
fornewid
0
190
【やさしく解説 設計編・中級 #1】一つの車に、運転手は一人 ~ある倉庫システムの事例から~
panda728
PRO
0
200
Foundation Models frameworkで画像分析
ryodeveloper
1
160
【SRE NEXT 2026 Lunch Session】一人目専任SREの立ち上げを加速する ― AIと進めたオンボーディングで2分を0.04秒にした話
pkshadeck
PRO
0
3.3k
Featured
See All Featured
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
3
1.1k
Mind Mapping
helmedeiros
PRO
1
290
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
Paper Plane (Part 1)
katiecoart
PRO
1
9.9k
The SEO Collaboration Effect
kristinabergwall1
1
510
Odyssey Design
rkendrick25
PRO
2
740
The SEO identity crisis: Don't let AI make you average
varn
0
520
Lightning talk: Run Django tests with GitHub Actions
sabderemane
0
230
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
201
75k
16th Malabo Montpellier Forum Presentation
akademiya2063
PRO
0
300
Building a Scalable Design System with Sketch
lauravandoore
463
34k
Technical Leadership for Architectural Decision Making
baasie
3
450
Transcript
Web Speech APIと Google Cloud Speech to Text 比較してみる 河津正和
河津正和 株式会社博報堂アイ・スタジオ所属 • 主にバックエンド領域のテクニカルディレクター • 新規事業開発的なお仕事をしてます • コンテナ技術とか機械学習とか電子工作にも興味あり Twitter:@kawazu255_ Qiita:kawazu255
note:kawazu255
ここ数ヶ月のSpeech to Text
世はまさに大文字起こし時代
1ヶ月以内にリリースされた 文字起こしサービス AmiVoice ScribeAssist Notta GIJIREC
オンライン上でのやりとりが増えたことにより、 その中での付加価値が求められてきた 相手の顔が見えないと 伝わってるかどうか わからないなぁ 今相手が言ってたこと 聞き取れなかったけど、 聞き返しづらいなぁ オンライン飲みは 逃げ場がないよなぁ
(自宅だし) ブレストする時とか なんかやりづらくて 対面がいいなぁ
音声認識&話者認識の障壁が下がった いままで いま
各クラウドAIの強み(個人の感想) 音声認識 画像処理 チャットボット 自然言語処理 ? (Google Homeが強い?) (MS COCOのおかげ?)
(Conversation APIがいい感じ) (誰か教えて)
各クラウドAIの強み(個人の感想) 音声認識 画像処理 チャットボット 自然言語処理 ? (Google Homeが強い?) (MS COCOのおかげ?)
(Conversation APIがいい感じ) (誰か教えて)
Web Speech API Google Cloud Speech to Text API
Web Speech API • Webページ上で音声認識、音声合成を利用することができるJavascriptのAPI • 厳密にはGoogleが提供しているAPIではなく「仕様」。ただ実装されているブラウザ が現状Google Chromeのみ •
話す音声のリアルタイムな音声文字起こしが強み
None
Google Cloud Speech to Text API • Google提供のクラウドML API。その名の通りSpeech to
Textを行う • APIはREST形式で、どんなプラットフォームからでも使用できる • ストリーミングでの音声入力もできる(通信はgRPC)
None
特徴比較 Web Speech API Google Cloud Speech to Text API
リアルタイム性 高い 音声認識中の文字起こしもできる gRPC通信でなら可能 ただブラウザには対応してない プラットフォーム Google Chrome のみ どこでも使える 精度(主観) そこそこ かなり高い
Cloud Speech to Text APIを ブラウザでリアルタイムに 使いたい!
Voice Activity Detection(音声検出) • マイクへの音声入力を検知する技術 • VADって略されたりする • JSライブラリあり ◦
生JS用:https://github.com/kdavis-mozilla/vad.js ◦ npm installできる:https://www.npmjs.com/package/voice-activity-detection
{ fftSize: 1024, bufferLen: 1024, smoothingTimeConstant: 0.2, minCaptureFreq: 85, //
in Hz maxCaptureFreq: 255, // in Hz noiseCaptureDuration: 1000, // in ms minNoiseLevel: 0.3, // from 0 to 1 maxNoiseLevel: 0.7, // from 0 to 1 avgNoiseMultiplier: 1.2, onVoiceStart: function() {}, onVoiceStop: function() {}, onUpdate: function(val) {} } ノイズ検出フィルター 人間の声の周波数範囲 音声検出開始までの時間 集音環境変数
吾輩は猫である。名前はまだ無い。 どこで生れたかとんと見当がつかぬ。何でも薄暗いじめじめした 所でニャーニャー泣いていた事だけは記憶している。
吾輩はここで始めて人間というものを見た。しかもあとで聞くとそ れは書生という人間中で一番獰悪な種族であったそうだ。
注意点! • 音声検出まで若干のタイムラグがあり、喋り始めのワードを取得できない場合が多 い ◦ OK, Google的にデバイス側での準備ができないため • そもそも音声認識の精度は集音環境やマイクの性能に大きく影響を受ける ◦
Macのマイクは意外と広範囲の音を拾う ◦ SM58とかはそこそこの指向性とそこそこ狭い集音範囲 (10cmくらい)
その他やってみて思ったこと • 音声検出のみWeb Speech APIにして見た結果 ◦ VADライブラリとほぼ変わらなかった ◦ ブラウザ依存問題が出るため、 VADライブラリで十分。
• UI的な話 ◦ Web Speech APIの、話してる最中も文字起こしをしてくれる機能は唯一無二 (Androidにもあるけど) ◦ 話している途中はWeb Speech API、話終わった後の音声は Cloud Speech to Textという使い分け もありかも ◦ リアルタイム文字起こし UIにこだわるならブラウザの縛りをいれてもいいかも
オンライン会議支援サービス 開発中! ←サービス紹介ページです(事前登録できます)