Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
0.8BのVLMで始めるリアルタイム動画解析VLM
Search
Yusuke
August 29, 2026
38
2
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
0.8BのVLMで始めるリアルタイム動画解析VLM
https://machine-learning15minutes.connpass.com/event/401182/
Yusuke
August 29, 2026
More Decks by Yusuke
See All by Yusuke
教師あり学習を用いたSkillsの最適化
shuredev
2
1.5k
Featured
See All Featured
My Coaching Mixtape
mlcsv
0
300
A Modern Web Designer's Workflow
chriscoyier
698
190k
Navigating the Design Leadership Dip - Product Design Week Design Leaders+ Conference 2024
apolaine
2
410
Documentation Writing (for coders)
carmenintech
77
5.5k
Easily Structure & Communicate Ideas using Wireframe
afnizarnur
194
17k
Testing 201, or: Great Expectations
jmmastey
46
8.2k
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
659
62k
Mobile First: as difficult as doing things right
swwweet
225
10k
Stewardship and Sustainability of Urban and Community Forests
pwiseman
0
500
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
2
4.3k
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
310
A designer walks into a library…
pauljervisheath
211
24k
Transcript
0.8BのVLMで始める リアルタイム動画解析VLM 2026/08/29
自己紹介
自己紹介 Yusuke X: @yusuke_post
自己紹介 修士までAIの研究してた AIエンジニア スタートアップ属性
個人ミッション
個人ミッション 建設・製造・ インフラ・物流・農業 日本産業の現場を マルチモーダルAIでDXする テキスト・音声・ 動画・画像 効率化・安全・教育 ・技能継承
個人の活動 AIに関する実験をして発信してます。 フィジカルAI 動画解析AIの開発 起業コミュニティ参加 SO-101を用いた模倣学習 オープンウェイトのVLMを 産業のオープンデータを使って自分でベンチマーク KERNELメンバー・TSG MAKERS-LABの参加
研究してました 修士では研究してたりしました。 VIMA: General Robot Manipulation with Multimodal Prompts こちらのベンチマークを用いて研究してたりしました。(これは自分の研究ではないです。)
WHY
今回は、個人でやってる工作を 紹介するだけの回です。
暖かく見守っていただけると 助かります。
動画解析したのポストが1.1kいいね
ポストの動画
やること
小さめのVLMで 一人称視点の動画を解析させる
なんで?
なんでやるの? 暇だから? 面白そうだから?
なんでやるの? ちょっと違います
なんでやるの? 社会的な意義
なんでやるの? 手順の抜け・順序違い・危険な工具操作 → 人身事故/品質不良/ライン停止
なんでやるの? エッジAI・ ローカルVLM
なんでエッジAI? 現場映像はクラウドに出せない(機密・個人情報) 記録を後で見るのでは損失は防げない。作業中の本人・ 監督者に即通知したい → オフライン前提 → 2Bクラス、できればもっと小さく
エッジVLMで、 一人称視点の外の環境を リアルタイムで 分析し続けたい
※重要 フィジカルAIにつながるから
一人称の動画解析はロボットにとって、とても大事 https://humanego-ai.github.io/
WHAT
動画解析って何?
わからないです。
画像フレームではなく 動画として理解し、 タイムスタンプを入力or出力する
? ? 画像フレームではなく 動画として理解し、 タイムスタンプを入力or出力する
本LTにおける”動画解析”の定義 画像フレームの連続性を VLMが理解しないと 動画解析とは言えないよね
VLMの仕組み https://llava-vl.github.io/
VLMの仕組み あれ、動画は?
VLMが画像フレームの連続性を理解させる方法(一例) TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
VLMが画像フレームの連続性を理解させる方法(一例) TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs 画像フレーム単体ではなくて、 画像フレームの連続性を理解させないと動画
解析とは言えないよね (自論)
なんのタスク? 入出力は?
タスク定義:VTG(Video Temporal Grounding) https://www.researchgate.net/figure/ Examples-of-temporal-video-groundingThe-goal-of-temporal-video-grounding-isto-localize_fig1_385750391
VTG(Video Temporal Grounding)具体例 https://huggingface.co/NemoStation/Marlin-2B
評価指標:tIoU 正解区間と予測区間の重なり(0〜1)
やったこと 2つ
①ベンチマーク ②VLMのFT
①ベンチマーク
モデル:Marlin-2B Qwen系ベース、タイムスタンプ出力に特化して学習されたモデル。find関数にイベン トを渡す形。SFT + SimPOで学習済み
産業向け一人称データ https://huggingface.co/datasets/builddotai/Egocentric-10K Egocentric-10k(インドの工場、頭部カメラ)を使用
産業向け一人称データ https://huggingface.co/datasets/builddotai/Egocentric-10K Egocentric-10k(インドの工場、頭部カメラ)を使用
アノテーション 自作アノテーションツール
ベンチマーク結果 結論:タイムスタンプを出すことに特化していないと難しい、、
②VLMのFT
次の課題 ①区間を2つ以上出したい ②いろんなデータに対応したい ③そもそもリアルタイムで動かしたい
自分で学習させるしかないね、 アーキテクチャも考えたいね
解析し続けたい、、、 小さいモデルで、エッジデバイスで、 数分間の動画を入れて、数秒以内に答えるのっ て、難しいのでは?
リアルタイム解析アーキテクチャ 長い文脈を動画のまま持つのは非現実的 → 過去30秒はテキスト要約、直近は動画で入力 参照:Memory-efficient Streaming VideoLLMs for Real-time Procedural
Video Understanding(arXiv:2504.13915) Meta Reality Labs FAIR, Meta, National University of Singapore
リアルタイム解析アーキテクチャ 長い文脈を動画のまま持つのは非現実的 → 過去30秒はテキスト要約、直近は動画で入力 テキスト: 1分 直近動画: 20秒 参照:Memory-efficient Streaming
VideoLLMs for Real-time Procedural Video Understanding(arXiv:2504.13915) Meta Reality Labs FAIR, Meta, National University of Singapore
リアルタイム解析アーキテクチャ 長い文脈を動画のまま持つのは非現実的 → 過去30秒はテキスト要約、直近は動画で入力 タイムスタンプ テキスト: 1分 直近動画: 20秒 参照:Memory-efficient
Streaming VideoLLMs for Real-time Procedural Video Understanding(arXiv:2504.13915) Meta Reality Labs FAIR, Meta, National University of Singapore
学習設計 Qwen3.5 0.8B/ タイムスタンプ+その時のアクションを出力させる学習。Visionエンコーダは凍 結。LoRA。4bit量子化
学習データ Ego4D 試しに20時間分くらい
結果
わかったこと・課題 データ 数十時間では全く足りない、1000~10000時間分くらい は必要そう 速度 FTTFは1秒超えない 10秒の動画を10秒以内に解析することは可能 精度 zeroshotでイベントを当てることは可能、タイムスタン プが課題
クロージング
振り返り・反省
GPU 時間 がない。 学習データ
解決策 GPU: SaaS使う 時間: 仕事してる時も学習・改善 させる
これから データは?
良さそうなデータが発表された https://egosuite100k.lightwheel.ai/
ロボットの学習に適したデータセットになっている
学習・改善はClaude Codeに 手伝ってもらった →Opus5は微妙、Fableは良さそう
GPU 時間 解決 学習データ
コードは公開してます! https://github.com/ shure-dev/small-vlmsop-check