Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[Journal club] DyCoke: Dynamic Compression of ...

[Journal club] DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. DyCoke: Dynamic Compression of Tokens for Fast Video Large Language

    Models Keda Tao1,2, Can Qin3, Haoxuan You4, Yang Sui5, Huan Wang1,*, 1Westlake University, 2Xidian University, 3Salesforce AI Research, 4Columbia University, 5Rice University CVPR 2025 杉浦孔明研究室 B4 細屋達稀 Keda Tao et al., “DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models,” in CVPR, 2025
  2. 概要 ◼ 背景 ◼ Video-LLM において多数の visual token に起因する高い計算コストは課題 ◼

    従来の pruning では重要なトークンを誤って削除する可能性 ◼ 提案手法:DyCoke ◼ Visual Token Temporal Merging: フレーム間の類似度を用いて時間的な冗長性を削減 ◼ KV Cache Dynamic Pruning: 重要度の低いトークンを動的に削除 ◼ 結果 ◼ 既存手法を上回るスコア ◼ 推論速度1.5倍 ◼ メモリ使用量1.4倍削減 2
  3. 背景: Video-LLMにおいて計算量は課題 ◼ Video-LLM は複数のフレームを入力するため visual token が多数 →推論時間とメモリ使用量が大幅に増大 ◼

    Visual tokenの冗長性 →pruningが効果的である可能性 ◼ Iterationごとに注目するフレームが変化 ◼ 既存手法は attention score に基づき One-shotで visual token を削減 (FastV [Chen+, ECCV24], PruMerge [Shang+, ICCV25])  重要な情報を失う可能性 →デコードの各ステップで 動的なトークン選択が効果的な可能性 予測tokenとvisual token間のattention score X軸: 各decoding iteration Y軸: 各フレームのvisual token群 3
  4. 提案手法 (2/4): Visual Token Temporal Merging (TTM) ◼ 近接するフレーム間のコサイン類似度に基づき時間的冗長性を削減 ◼

    以下の手順により全 visual token 𝐻𝑣 ′ から k% を削減 1. 4フレームずつサンプリングし偶数 / 奇数グループに分割 2. グループ間 (1-2, 3-4) の類似度を計算 →偶数グループを pruning c 3. 奇数グループ内 (1-3) の類似度を計算 →後半フレーム (3) を pruning ◼ Text token 𝐻𝑞 と結合しLLMへの入力を得る 5
  5. 提案手法 (2/4): Visual Token Temporal Merging (TTM) ◼ 近接するフレーム間のコサイン類似度に基づき時間的冗長性を削減 ◼

    以下の手順により全 visual token 𝐻𝑣 ′ から k% を削減 1. 4フレームずつサンプリングし偶数 / 奇数グループに分割 c 2. グループ間 (1-2, 3-4) の類似度を計算 →偶数グループを pruning 3. 奇数グループ内 (1-3) の類似度を計算 →後半フレーム (3) を pruning ◼ Text token 𝐻𝑞 と結合しLLMへの入力を得る c 6
  6. 提案手法 (2/4): Visual Token Temporal Merging (TTM) ◼ 近接するフレーム間のコサイン類似度に基づき時間的冗長性を削減 ◼

    以下の手順により全 visual token 𝐻𝑣 ′ から k% を削減 1. 4フレームずつサンプリングし偶数 / 奇数グループに分割 2. グループ間 (1-2, 3-4) の類似度を計算 →偶数グループを pruning 3. 奇数グループ内 (1-3) の類似度を計算 →後半フレーム (3) を pruning ◼ Text token 𝐻𝑞 と結合しLLMへの入力を得る c 7
  7. 提案手法 (3/4): KV Cache Dynamic Pruning (iteration = 1) ◼

    Attention scoreに基づき visual token を2つの cache に分類 ◼ KV cache: 以降の計算で使用するトークンを保存 ◼ DP cache: 一時的に使用しないトークンを保存 ◼ 以下の手順により visual tokenの 𝑝% を削減 (iteration = 1) 1. 全 visual token について attention score を計算 2. トークンを各cacheに分類 • 上位 (100 − 𝑝 ) % → KV cache • 下位 𝑝 % → DP cache c 8
  8. 提案手法 (4/4): KV Cache Dynamic Pruning (iteration ≥ 2) ◼

    KV cache 内の attention score 分布と 前 iteration の分布のコサイン類似度Sを計算 a. S ≥ 閾値 → cacheは不変 • 重要なトークンは KV cache 内にあると判断 • 連続する iteration 間での分布変化は小さい傾向 →計算量を抑制 c b. S < 閾値 → 全 visual tokenで attention score を計算 • 重要なトークンが DP cache 内にも含まれると判断 • cache を再構成 ( Iteration = 1と同様の手順 ) →重要なトークンを復元 ◼ 計算量の抑制と情報の維持を両立 9
  9. 実験設定 ◼ ベースモデル ◼ LLaVA-OneVision [Li+, TMLR25] (0.5B, 7B, 72B)

    ◼ ベースライン ◼ FastV: LLM の Attentionに基づくone-shot pruning ◼ PruMerge: CLIP [Radford+, ICML21] の Attentionに基づくone-shot pruning ◼ ベンチマーク ◼ PerceptionTest [Patraucean+, NeurIPS24], VideoMME [Fu+, 24], ActivityNet-QA [Yu+, AAAI], NeXTQA [Xiao+, CVPR21], VideoDetailCaption [LMMs-Lab, 24], MVBench [Li+, CVPR24] ◼ 計算環境 ◼ NVIDIA RTX 4090, A6000, A100 10
  10. 定量的結果 (2/2):推論時間・メモリ使用量を削減 ◼ 既存手法を上回る計算効率 (例: 32フレーム,7B) ◼ 推論速度 • 1.54倍の高速化

    ◼ メモリ消費 • 1.4倍削減 ◼ スコアにおいても既存手法を上回る K: pruning rate(TTM) 12
  11. 追試およびエラー分析 ◼ TTM により近接フレーム間の変化を適切に捉えられない可能性 ◼ w/o DyCokeでは正解 → 誤りはトークン圧縮に起因 ◼

    TTMは近接フレームとの差に着目し圧縮 ◼ 時間方向のトークン削減により 物体の在否追跡が困難 ◼ 移動している既存の物体と 新規登場の物体を取り違える可能性 Question:How many objects enter the scene? GT 1 LLaVA-OV-7B w/o DyCoke 1 LLaVA-OV-7B w/ DyCoke 2 14
  12. Ablation Study:TTM かつ KV Cache DPが最良 ◼ w/o DP <

    w/ DP →動的に visual token を選択することは有効 ◼ Random Pruning < TTM →TTM が適切に visual token の冗長性を削減 K: pruning rate(TTM) L: Attention評価層 P: pruning rate(DP) 15
  13. まとめ ◼ 背景 ◼ Video-LLMにおいて多数の visual tokenに起因する高い計算コストは課題 ◼ 従来のpruningでは重要なトークンを誤って削除する可能性 ◼

    提案手法:DyCoke ◼ Visual Token Temporal Merging: フレーム間の類似度を用いて時間的な冗長性を削減 ◼ KV Cache Dynamic Pruning: 重要度の低いトークンを動的に削除 ◼ 結果 ◼ 既存手法を上回るスコア ◼ 推論速度1.5倍 ◼ メモリ使用量1.4倍削減 16