Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[Journal club] SpecVLM: Enhancing Speculative D...

[Journal club] SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token

    Pruning Yicheng Ji 1,2 , Jun Zhang 1,2 , Heming Xia 3 , Jinpeng Chen 4 , Lidan Shou 1,2 , Gang Chen 1 , Huan Li 1,2 1 The State Key Laboratory of Blockchain and Data Security, Zhejiang University 2 Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security 3 Department of Computing, The Hong Kong Polytechnic University 4 School of Computer Science, Beijing University of Posts and Telecommunications EMNLP25 慶應義塾⼤学 杉浦孔明研究室 B4 野⼝拓海 Yic he ng J i e t a l., “S pe c V L M : Enha nc ing S pe c ula tive De c o ding o f V ide o L L M s via V e r ifie r- G uide d T o k e n P r uning,” in EM N L P , 2025 -1-
  2. 概要 o 背景 • Video LLMは⼤量の video token により推論が低速 •

    既存の⾼速化⼿法は動画情報の保持と⾼速化の両⽴に課題 o 提案⼿法: SpecVLM • Training-free な Video LLM 向け speculative decoding ⼿法 • 2段階の video token pruning • Stage1: attention score に基づく pruning • Stage2: 低 attention token の空間的⼀様 pruning → Draft model の KV cache を削減し lossless に⾼速化 o 結果 • LLaVA-OneVision で最⼤2.68倍, Qwen2.5-VLで最⼤2.11倍⾼速化 -2-
  3. 背景 (1/2): Video LLMは⼤量の video tokenにより低速 o Video LLM: 動画フレームを

    video token 列に変換 • LLaVA-OneVision [Li+, 24]: 1 フレーム = 196 tokens • ⻑時間動画では video token が膨⼤ (e.g. 2 min, 60 fps > 1M tokens) o ⼤量の video token による推論の低速化 • Prefilling: attention 計算量が増加 • Decoding: KV cache の読み書きが増加 o 対策: video token reduction/pruning J Video token の削減で計算量・メモリ使⽤量を改善 L Video token の⼀部を除去 → 動画情報の⽋損 L AR による推論はそのまま → ⾼速化は限定的 -3-
  4. 背景 (2/2): Speculative decodingは losslessな⾼速化⼿法 o Speculative decoding [Leviathan+, ICML23]

    (→ appendix) • ⼀度の AR ステップで複数トークンを⽣成し⾼速化 • Draft model (軽量) : 将来のトークン列 (ドラフト) を⽣成 • Target model (元のLLM) : 尤度に基づきドラフトを検証 An Introduction to Speculative Decoding for Reducing Latency in AI Inference, NVIDIA J Lossless 理論保証: 出⼒分布は元のLLMのものと⼀致 o Video LLM では draft model が低速化 • Draft model も⼤量の video token を保持 L KV cache の読み書きがボトルネック -4-
  5. 関連研究: 既存手法は 情報保持と⾼速化の両⽴に課題 ⾼速化アプローチ Token pruning Speculative decoding 代表例 概要と課題

    FastV [Chen+, ECCV24] 冗⻑性/重要度に基づくトークン削減 → 計算量・メモリ使⽤量を抑制 DyCoke [Tao+, CVPR25] L ⼊⼒の⼀部を削除するため情報⽋落の可能性 PruneVid [Huang+, ACL25] L Decoding は AR のままであり⾼速化は限定的 EAGLE [Li+, ICML24] 軽量な draft model を導⼊しドラフトを⽣成・並列検証 TriForce [Sun+, COLM24] J ⽣成品質の低下なしに⾼速化可能 (lossless) MagicDec [Chen+, ICLR25] L Video LLMでは draft 側の KV cacheが肥⼤化し低速化 DyCoke [Tao+, CVPR25] EAGLE [Li+, ICML24] -5-
  6. 提案手法(1/3): Video LLM向けspeculative decoding o SpecVLM: video token pruning で

    draft 側の KV cache を削減 • Target model: 全 video token を保持 • Draft model: pruning した video token を使⽤ → J 出⼒品質を維持したまま⾼速化 o 2段階の video token pruning • Stage1: attention score に基づく pruning • Stage2: 空間的⼀様な pruning → J 重要トークンを抽出しつつ取りこぼし軽減 o Draft tree (cf. EAGLE [Li+, ICML24]) の使⽤ • 複数パターンのドラフトを⽣成・並列検証 -6-
  7. 提案手法(2/3): Stage1 - attention score に基づく pruning o 重要度の⾼い video

    token を保持 • Attention map: language-to-video 部分に偏り • Language token が強く参照する video token を重要視 o Attention score の計算 • 全層, 全ヘッドで平均 o Top-P retention • Attention score は long-tail 分布 • Score 上位から 累積値が閾値 λ ! を超えるまで保持 上位 10% の video token が累計値の約半分 -7-
  8. 提案手法(3/3): Stage2 – spatially uniform pruning o 低 attention score

    部分の video token • 個々の score は⼩さいが累積では無視できない重要度 → 全削除せず⼀部保持 • Attention score の差は微量 → 重要度の判別は困難 o 空間的⼀様 pruning • Stage1 で未選択の video token 集合から等間隔に選択 J 低 attention score 部分を広く補完 低 attention score 部分 o Pruning ratio 𝒓 • Stage1 の残り video token 数に応じて Stage2 の選択間隔を調整 • Video token の最終保持率 (1 − 𝑟) -8-
  9. 実験設定 o バックボーン o ベースライン • LLaVA-OneVision-{7B, 72B} [Li+, 24]

    • Vanilla: AR • Qwen2.5-VL-{7B, 32B} [Bai+, 25] • SD-Tree: draft treeのみ (pruningなし) • SD-Rand: draft tree + random pruning o ベンチマーク (各 50 件ランダム抽出) • VideoDetailCaption [LMMs-Lab, 24] o SpecVLMのSD設定 : 𝑟 = 0.9 • MVBench [Li+, CVPR24] • Std.-SD: (target model > draft model) • MLVU [Zhou+, CVPR25] • Self-SD: (target model = draft model) • LongVideoBench [Wu+, NeurIPS24] o 評価指標 o GPU • Mean acceptance length (τ) • A100 8台 • Tokens/s • Speedup ratio -9-
  10. 定量的結果 : Std.-SD, Self-SD設定ともに⾼速化 λ! = 0.4 LLaVA-OneVision o LLaVA-OneVision/Qwen2.5

    ともに⾼速化 • SpecVLMは全結果で最速 • LLaVA: 最⼤2.68倍⾼速 • Qwen: 最⼤2.11倍⾼速 o Std.-SD/Self-SD 両設定で⾼速化 • Std.-SD: ⾼速化倍率が⼤きい • Self-SD: ⽣成速度はより速い λ! = 0.5 Qwen2.5-VL o 𝜏 は SD-Tree に劣る傾向 • Pruning による draft latency の改善が ⾼速化の主因 τ: acceptance length - 10 -
  11. Demo: Qwen2.5-VL-7B Self-SD設定での⾼速化 VideoDetailCaption Prompt “Please provide a detailed description

    of the video, focusing on the main subjects, their actions, and the background scenes” 1.55倍⾼速 - 11 -
  12. 追試およびエラー分析 LLaVA-OneVision-7B Qwen2.5-VL-7B o Self-SD設定 VideoDetailCaption J Acceptance length 𝜏

    の⼀致 L Token/s, speedup の不⼀致 → 実験マシンの性能差に起因 𝜏 Token/s Speedup 𝜏 Token/s Speedup 論⽂値 3.98 16.74 1.26x 3.83 15.59 1.50x 再現値 3.70 30.27 1.46x 3.89 31.72 1.49x 成功例: 8s 失敗例: 225s o 失敗例: ⻑尺・字幕多数 • Target 側: 字幕内容に基づく回答 • Draft 側: pruning で字幕情報不⾜ L Draft の適切な予測が困難 → Acceptance length 𝜏 が悪化 8s 𝜏 Token/s Speedup 𝜏 Token/s Speedup 4.22 33.29 1.61x 2.61 23.26 1.12x LLaVA-OneVision-7B - 12 -
  13. Ablation study(1/2): 2段階 pruningはいずれも有効 o Stage1: attention score に基づく pruning

    は有効 • Stage1 なしの条件で acceptance length は低下 → 重要度の⾼い token の保持に貢献 o Stage2: 空間的⼀様 pruning は有効 • Stage2 なしの条件で acceptance length は低下 • Stage1 なしの条件と⽐較して低下幅が⼤きい傾向 → 低 attention token の寄与は無視できない - 13 -
  14. Ablation study(2/2): pruning戦略の⽐較 o SD-Attention は固定 window より有効 (上図) •

    SD-Window では front, middle, end いずれも性能低下 • Attention score が token の重要度を反映 o SD-Uniform は random/temporal ⼿法より有効 (下図) • DyCoke [Tao+, CVPR25] を上回る acceptance length • 空間的な token 削減 > 時間的な token 削減 • (e.g. SD-Frame: ⼀定間隔でフレーム抽出) - 14 -
  15. 所感 o Strength • Training-free かつ lossless に Video LLM

    の推論を⾼速化 • Self-SD 設定では追加モデル不要 o Weakness • Pruning は prefilling 時の1回のみ → ⽣成内容に応じた video token 選択不可 • 𝑟 固定 → 情報密度の⾼い動画でも⼀律で削減 o Comment • Pruning 周りの ablation が豊富 • EAGLE-2 等の既存 SD ⼿法との直接⽐較がない • Qwen の MLVU ベンチの結果がない → ベンチマークの選定に疑問 - 15 -
  16. まとめ o 背景 • Video LLMは⼤量のvideo tokenにより推論が低速 • 既存の⾼速化⼿法は動画情報の保持と⾼速化の両⽴に課題 o

    提案⼿法: SpecVLM • Training-free な Video LLM 向け speculative decoding ⼿法 • 2段階の video token pruning • Stage1: attention score に基づく pruning • Stage2: 低 attention token の空間的⼀様 pruning → draft model の KV cache を削減し lossless に⾼速化 o 結果 • LLaVA-OneVision で最⼤2.68倍, Qwen2.5-VLで最⼤2.11倍⾼速化 - 16 -
  17. Appendix(1/4): 補⾜の実験結果 o 𝒓 に関する ablation study • 最良: 𝑟

    = 0.9 で2.50倍の⾼速化 • ただし SD-Rand 条件なので SpecVLM に適⽤できるか不明 • SpecVLM での検証は記載なし o Decoding step 毎の acceptance length の⽐較 • • 最初の 10 step の値と平均値とで乖離なし → J decoding step 全体で提案⼿法は有効 最初の step の値は⽐較的⼤きい • ⽣成の先頭には特定の⽂や表現が現れやすいことに起因 - 17 -
  18. Appendix(2/4): Losslessの理論保証 o Speculative decodingのゴール: 出⼒分布を変化させずに⾼速化 • Draft modelの出⼒分布 𝑞(C)

    より𝑥 # ~𝑞(C) で候補𝑥 # を選択したとき o Target modelの分布 𝑝 𝑥 # < 𝑞 𝑥 # ならば o 𝑝 𝑥 # ≥ 𝑞 𝑥 # ならば $ % • 𝑥 # を出⼒に採⽤ (accept) • 𝛼 = min 1, ! で reject sampling & %! • accept 𝑢~Uniform 0,1 • 𝑢 < 𝛼 ⇒ 𝑥 # を出⼒に採⽤ (accept) • 𝑢 ≥ 𝛼 ⇒ 𝑥 # は不採⽤ (reject) • reject ()* +,$ % -& % 代わりに𝑝 ' 𝑥 = ∑ ()* +,$ % -& % ! ! ! からサンプリング Reject 位置より⼿前のトークンを使⽤ (それ以降はrejectされたトークンに条件づけられているので無効) →「最終的な出⼒分布が元のLLMのものと⼀致する」こと (lossless) が理論保証 - 18 -
  19. Appendix(4/4): Draft tree o Draft tree (cf. EAGLE) • Tree

    を⽤いて複数のドラフトを同時に処理 J 並列⽣成 & バッチ検証 → 実⾏時間を抑えたまま Acceptance length を向上 • • Expansion phase: treeの拡⼤ • 現在の葉ノードの次のトークンを予測 • 尤度 top-k のトークンを葉ノードとして追加 • 深さ d まで上記を繰り返す Reranking phase: 有望なドラフトの選択 • 尤度 top-m のノードを選択 Attention mask により tree の並列処理を実現 → - 20 -