Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
2025-06-12_UTD_VISA_MotionMAE.pdf
Search
takami
August 09, 2025
18
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
2025-06-12_UTD_VISA_MotionMAE.pdf
takami
August 09, 2025
More Decks by takami
See All by takami
ICCV2025論文まとめ: VLMにおけるトークン削減 (KVTP, STTM, METEOR)
fztkm
0
220
Featured
See All Featured
Six Lessons from altMBA
skipperchong
29
4.5k
Exploring the relationship between traditional SERPs and Gen AI search
raygrieselhuber
PRO
3
4.3k
Music & Morning Musume
bryan
48
7.4k
Crafting Experiences
bethany
1
350
Stop Working from a Prison Cell
hatefulcrawdad
274
21k
Site-Speed That Sticks
csswizardry
13
1.5k
More Than Pixels: Becoming A User Experience Designer
marktimemedia
3
530
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
3k
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
52
6.1k
How To Speak Unicorn (iThemes Webinar)
marktimemedia
1
580
The Power of CSS Pseudo Elements
geoffreycrofte
82
6.6k
Balancing Empowerment & Direction
lara
6
1.3k
Transcript
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht, CVPR2025 福沢匠(名工大玉木・丁研) 2025/08/09
背景と問題設定 ◼動画理解ベンチマークは「表現バイアス」を含む ◼特に多いのがオブジェクトバイアスとシングルフレームバイアス ◼真の時系列理解能力 が過大評価 ◼既存手法 • ActionSwap [Chung+, NeurIPS2022]
• SCUBA [Li+, ICCV2023] • 動画加工による アーティファクト発生 やドメインずれ • 現実動画は少ない ActionSwap SCUBA
目的 ◼既存のベンチマークを自動的に分析し 表現バイアスを測定・軽減する手法の提案 • テキスト入力のみで測定 ◼人手アノテーション不要 ◼モデル評価の信頼性向上
提案手法概要 (UTD) ◼VLMで各フレームの詳細なキャプションを生成 ◼LLMで特定の概念を抽出 • 「objects」「activities」「verbs」など ◼抽出したテキスト × 時系列情報の組み合わせでバイアスを測定 ◼オブジェクトバイアスの高いサンプルをテストセットから除外
• UTD-splits作成
対象とするバイアスの3軸 ◼概念バイアス • 特定の情報だけで分類できてしまうか? • 「objects」「activities」「verbs」などのみ ◼時系列バイアス • フレームだけで十分か? •
順序情報が必要か? ◼常識 vs データセットバイアス • 常識バイアス:一般的な知識による推論 • データセットバイアス:訓練セット特有の相関
1.概念バイアスの測定 ◼テキスト埋め込みの生成 • 動画からVLM・LLMで抽出されたテキスト • objects: man, racket • activities:
The man holding a racket • verbs: Someone holding a something. • 正解動作ラベルテキスト: Playing tennis ◼ゼロショット分類 • コサイン類似度 • 各概念ごとに精度比較 • Objectsで性能高い → バイアス高い
2.時系列バイアスの測定 ◼時間概念の異なるテキスト埋め込み特徴を作成 • 1フレーム:画像のキャプションを埋め込み化 • 全フレーム平均:1フレームテキスト埋め込みを平均 • 順序付き全フレーム: • 1フレームテキストを時間順序で連結
• この長文をテキスト埋め込みに変換 ◼ゼロショット分類 • 各概念ごとに精度比較 • 1フレーム精度が高い → バイアス高い 中央1フレーム 最高性能1フレーム 順序付き全フレーム 全フレーム平均
3.常識 vs データセットバイアスの測定 ◼「常識的推論」か「訓練データ中の相関」に依存しているのか ◼2つの方法で性能比較 • 常識バイアス • ゼロショットでテキスト埋め込みから予測 •
モデルは訓練データ使用しない • データセットバイアス • テキスト埋め込みを入力として,線形分類器を訓練 • 訓練データとラベルの相関を学習 • データセットバイアス性能 >> 常識バイアス性能 → バイアス高い 常識バイアス データセットバイアス
バイアス除去ベンチマークの作成 ◼オブジェクトバイアスは最も支配的で 測定・除去が容易 ◼UTD-splitを作成 • オブジェクトバイアスの高いサンプルを除外したテストセット • 6個の動作認識データセットに適用 • 除外割合はデータセットごとに異なる
• UTD-balanced • クラス分布を維持したバージョンも作成 除去割合
実験結果 ◼UTD-splitでは多くのモデルで顕著に性能低下 • バイアスに頼っている可能性
まとめ ◼ 人手なしで3軸のバイアスを測定可能 • 概念 • 時間 • 常識 vs
データセット • 多くのベンチマークが強いオブジェクトバイアスを持つことを確認 ◼ UTD-splitsでより本質的な動画理解能力を評価可能 ◼ 将来 • 時系列理解を重視したベンチマーク構築、他モダリティへの適用
Text-to-video retrieval 除去割合
◼ GitHub pagesにて各UTD-split, balancedの動画idが公開 ◼ VLMのサンプルごとの詳細キャプションも利用可能