Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Google Cloudでの動画解析と検索のサービス紹介と比較 Video Intellige...

Google Cloudでの動画解析と検索のサービス紹介と比較 Video Intelligence API、Vision Warehouse、Gemini+Vertex AI Search

2026年1月30日 Jagu'e'r AI/ML分科会 2026年新春LT大会 での登壇資料です。

Google Cloudで動画を扱う際の3つのアプローチ、Video Intelligence API / Vertex AI Vision Warehouse / Gemini を、実際に同じサンプル動画を解析して比較しました。

・Video Intelligence API:物体を「識別」する。116エンティティをタイムスタンプ付きで抽出できるが、検索は自前で実装する必要あり
・Vertex AI Vision Warehouse:テラバイト級の動画を「検索可能」にする。ベクトル検索・画像検索に対応するが、アノテーションの質が精度を左右する
・Gemini(3 Flash / 3 Pro):文脈を「推論」する。ラベル列挙ではなく「何が起きているか」を言語化できる。FlashとProの解析結果の差も実際に比較

最後に、テラバイト級のデータを持つ場合のハイブリッド案(Vision Warehouseで安価にフィルタリング → 絞り込んだシーンのみGeminiで文脈解析)と、Vertex AI Searchとの使い分け基準もまとめています。

#GoogleCloud #Gemini #VertexAI #生成AI #動画解析

Avatar for Shu Kobuchi

Shu Kobuchi PRO

January 30, 2026

More Decks by Shu Kobuchi

Other Decks in Technology

Transcript

  1. Google Cloudでの動画解析と検索のサービス紹介と比 較 Video Intelligence API、Vision Warehouse、Gemini+Vertex AI Search Jagu'e'r

    AI/ML分科会 2026年新春LT大会 2026年1月30日 株式会社スリーシェイク 小渕 周 Shu Kobuchi
  2. 自己紹介 • 小渕 周(Shu Kobuchi)こぶシュー • https://x.com/shu_kob @shu_kob • 2023年12月スリーシェイク入社

    ◦ Sreake 事業部 ◦ アプリケーション開発支援チーム エンジニア ◦ 生成 AI アプリケーション開発等 ◦ Gemini、Google Cloudを使用 ◦ 2025年1月 マネージャー Copyright © 3-shake, Inc. All Rights Reserved. 2
  3. アジェンダ • イントロダクション:動画データの課題 • 動画中の物体を識別する「Video Intelligence API」 • 大量の動画を検索可能にする「Vertex AI

    Vision Warehouse」 • 文脈と推論で文脈を理解する「Gemini」 • これらの使い分け Copyright © 3-shake, Inc. All Rights Reserved. 3
  4. 動画中の物体を識別する「Video Intelligence API」 【7】street light 開始時間: 1.43秒 終了時間: 1.94秒 継続時間:

    0.50秒 信頼度: 74.70% 【10】house 開始時間: 2.04秒 終了時間: 2.54秒 継続時間: 0.50秒 信頼度: 54.96% 【13】building 開始時間: 3.34秒 終了時間: 3.84秒 継続時間: 0.50秒 信頼度: 66.00% 【8】building 開始時間: 1.43秒 終了時間: 1.94秒 継続時間: 0.50秒 信頼度: 62.53% 【11】hat 開始時間: 2.64秒 終了時間: 3.24秒 継続時間: 0.60秒 信頼度: 87.75% 【14】house 開始時間: 3.94秒 終了時間: 3.94秒 継続時間: 0.00秒 信頼度: 62.11% 【9】street light 開始時間: 1.43秒 終了時間: 1.94秒 継続時間: 0.50秒 信頼度: 52.96% 【12】person 開始時間: 2.64秒 終了時間: 3.24秒 継続時間: 0.60秒 信頼度: 81.99% 【15】person 開始時間: 4.04秒 終了時間: 4.44秒 継続時間: 0.40秒 信頼度: 83.72% Copyright © 3-shake, Inc. All Rights Reserved. 116エンティティより 一部抜粋 6
  5. Google Cloud Vertex AI Visionのストリーム処理機 能 • ストリーム映像の分析及びVision Warehouseへの格納が可能 MLの組み込み

    用途 • • Copyright © 3-shake, Inc. All Rights Reserved. 監視カメラの解析 工場ラインでの不良品解析 10
  6. Video Intelligence API・Vertex AI Vision Warehouse • 両サービスの比較 比較項目 Video

    Intelligence API Vertex AI Vision Warehouse 主な役割 動画の解析・タグ付け (メタデータ抽出) 動画の保存・検索・管理 (メディアリポジトリ) 得意なこと 動画内に何が映っているかを詳細に特定する 大量の動画から特定のシーンを高速に検索する 検索機能 APIのレスポンス( JSON)を自前で検索する必要あり ベクトル検索 や属性検索、自然言語検索が可能 データの保持 解析時のみ。動画自体の保存機能はない 数千時間規模の動画を長期間保存 ・管理できる リアルタイム性 蓄積動画の解析がメイン(ストリーミングも可) リアルタイム配信( LVA)との連携に強い 主な機能 物体検知、シーン切り替え検知、ロゴ・文字認識 インデックス作成、メタデータ管理、 RAG用データソース 位置づけ スタンドアロンの分析サービス Vertex AI Vision プラットフォームの一部 利用シーン メディア資産の自動タグ付け、不適切コンテンツの検 知 セキュリティ監視、大規模な動画ライブラリの検索基盤 Copyright © 3-shake, Inc. All Rights Reserved. 11
  7. 文脈と推論で文脈を理解する「Gemini」 • Google社が公開しているGoolgleパリオフィスのサンプル動画 を Gemini-3-FlashとProで解析 https://storage.googleapis.com/cloud-samples-data/video/googlework_short.mp4 項目 Gemini 3 Flash

    Gemini 3 Pro 主な用途 リアルタイム解析、大量動画の要約 精緻な推論、複雑なシーン分析 処理スピード 極めて高速 (Proの数倍) 標準的(深い推論を優先) コンテキストウィ ンドウ 最大100万トークン 最大100万トークン 動画の長さ 約1時間(標準的な動画) 約1時間(標準的な動画) 分析の深度 高い(一般的な事象の特定に最適) 最高クラス (微細な変化や因果関係) コスト( API) 非常に安価 Flashより高価 同時動画数 最大10ファイル(並行処理に強い) 最大10ファイル(一括詳細分析) Copyright © 3-shake, Inc. All Rights Reserved. 12
  8. 文脈と推論で文脈を理解する「Gemini」 • Gemini-3-Flashでの解析 タイムスタンプ 起きていること・映像の内容 00:00 - 00:07 パリの主要な観光スポット(パレ・ロワイヤル、セーヌ川、エッフェル塔、アルシュ・ド・トリオンフなど)が次々と映 し出される。

    00:08 - 00:10 パリの街並みと、道路を走るバスや自転車、歩行者の様子が映る。 00:11 - 00:14 「Google France」のロゴ、および「RUE DE LONDRES」という通りの看板が映し出される。 00:15 - 00:18 中庭のような場所を通り、Googleオフィスの入り口へ向かう人物の様子。 00:19 - 00:20 「GOOGLE PARIS」と書かれた壁の前で、4人のスタッフが飲み物を手に座っている様子。 00:21 - 00:27 副社長のCarlo氏が、Googleにおけるパリオフィスの文化的意義と、フランスへの長期投資について語る。 00:28 - 00:32 ソフトウェアエンジニアのOmar氏が、パリの特別な点として強いフランス文化があることを語る。 00:33 - 00:34 パリの街中にある、カラフルな球体で装飾された地下鉄駅の入り口が映り、動画が終了する。 Copyright © 3-shake, Inc. All Rights Reserved. 13
  9. 文脈と推論で文脈を理解する「Gemini」 • Gemini-3-Proでの解析 タイムスタンプ 出来事 00:00 - 00:08 パレ・ロワイヤル、セーヌ川沿い、エッフェル塔(真下からのアングル)、アンヴァリッド、凱旋門、ヴァンドーム広場 など、パリの主要なランドマークが次々と映し出される。

    00:08 - 00:15 「Google France」のロゴが映る。「RUE DE LONDRES」という通りの標識が大写しになる。男性がGoogle関連 の展示パネルが並ぶ中庭を歩いていく。 00:15 - 00:20 「GOOGLE PARIS」と書かれた看板の前にある赤いソファに座った4人の男女が、カメラに向かって手を振る。 00:20 - 00:27 Carlo(Vice President)という男性が、本の背表紙のような装飾がある壁の前でインタビューに答え、Googleパリ オフィスについて語る。彼がノートパソコンを使用している様子も挿入される。 00:27 - 00:32 Omar(Software Engineer)という男性が、牛の写真が貼られた壁の前でインタビューに答える。 00:32 - 00:35 カラフルなガラス玉で装飾された地下鉄の入り口(キオスク・デ・ノクタンビュル)の前を、リュックを背負った男性が 歩いて通り過ぎる。 Copyright © 3-shake, Inc. All Rights Reserved. 14
  10. 文脈と推論で文脈を理解する「Gemini」 • マルチモーダルなGeminiにより、セマンティックな解釈が可能に Legacy API (認識) Gemini 3 (推論) {

    "labels": ["Person", "Box"] } 「顧客は破損した箱を指差しており、怒りを⾒ 限界: 「怒っている顧客が商品を返品しようと している」という⽂脈がわからない。 せています。返品または交換を要求している⽂ 脈です。」 ⾰新: 因果関係と感情の深い理解。 Copyright © 3-shake, Inc. All Rights Reserved. 15
  11. Vision Warehouse と Geminiでの動画解析 + Vertex AI Searchの使いどころ 項目 Vision

    Warehouse がおすすめ Vertex AI Search がおすすめ データ容量 1TB 以上(数千〜数万時間) 数GB 〜 数百GB 程度 主な用途 監視カメラ、放送アーカイブ、技術資 料 ECサイトの動画検索、 FAQ、マニュアル検索 検索の質 「特定の物体が映っているシーン」を 探す 「ユーザーの意図(自然言語)」を汲み取る 検索頻度 たまに 必要なシーンを探し出す 毎日大量のユーザー が検索する コスト構造 保存が安く、検索するたびに払う 検索の利便性が高く、全体的に高価 Copyright © 3-shake, Inc. All Rights Reserved. 16
  12. テラバイト級動画データを持つ場合のハイブリッド案 1. 数百万のシーンから、ターゲット(特定の部品や風景)を Vision Warehouse で、高速かつ安価にフィルタリング 2. 絞り込まれた少数のシーンのみを Gemini に渡し、

    「何が行われているか」を高度な文脈解析を実行 この構成であれば、全ての動画を Gemini に解析させるよりも 大幅にコストを削減 Copyright © 3-shake, Inc. All Rights Reserved. 17