Upgrade to Pro — share decks privately, control downloads, hide ads and more …

When Token Pruning is Worse than Random: Unders...

When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs

■ イベント
第67回 コンピュータビジョン勉強会@関東(後編)
https://kantocv.connpass.com/event/397925/

■登壇概要
タイトル:When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
登壇者:技術本部 研究開発部 内⽥ 奏

■ 技術本部 採用情報
https://media.sansan-engineering.com

Avatar for SansanTech

SansanTech PRO

August 28, 2026

More Decks by SansanTech

Other Decks in Technology

Transcript

  1. 第67回 コンピュータビジョン勉強会@関東(後編) When Token Pruning is Worse than Random: Understanding

    Visual Token Information in VLLMs Sansan株式会社 技術本部 研究開発部 内⽥奏
  2. ⽬次 1. 2. 3. 4. 背景 a. 視覚⾔語モデル b. トークンプルーニング

    論⽂紹介 a. 視覚トークン情報量 b. Information Horizon 実験 a. ランダムプルーニングの併⽤ b. 性能‧効率性評価 おわりに
  3. 背景: 視覚⾔語モデル(Vision-Language Model; VLM) - 視覚情報と⾔語情報を統合的に取り扱うモデル - 近年は Decoder-only アーキテクチャが主流

    ポ メ ラ ニ ア ン </s> Text Decoder <s> ⽝ 種 は 何 ? ポ メ ラ ニ ア ン Vision Encoder あくまでこれは模式図であって...
  4. 背景: 視覚トークンは多い - 回答が短いタスクにおいて、視覚トークンが⽀配的になりがち - LLaVA-1.5 [Liu+ 2024] : 576

    Qwen2.5-VL [Bai+ 2025] : 16,384 ポ メ ラ ニ ア ン </s> coder <s> ⽝ Vision Encoder 種 は 何 ? ポ メ ラ ニ ア ン
  5. 背景: 視覚トークンは多い - 回答が短いタスクにおいて、視覚トークンが⽀配的になりがち - LLaVA-1.5 [Liu+ 2024] : 576

    Qwen2.5-VL [Bai+ 2025] : 16,384 ポ メ ラ ニ ア ン </s> coder <s> ⽝ 種 は 何 ? ポ メ ラ ニ ア ン Vision Encoder 視覚トークンを削減して 推論コストを下げたい
  6. 背景: 視覚トークンの削減 - 視覚トークン削減のアプローチは複数存在 a. 統合: 複数のトークンを合成して少数トークンを取得 b. 読出: 少数のクエリが多数の視覚トークンから必要情報を集約

    c. 破棄: 元のトークンの⼀部だけ残してそれ以外を除去 統合アプローチの例(ToMe [Bolya+ 2023]) 読出アプローチの例(BLIP-2 [Li+ 2023])
  7. 背景: 視覚トークンの削減 - 視覚トークン削減のアプローチは複数存在 a. 統合: 複数のトークンを合成して少数トークンを取得 b. 読出: 少数のクエリが多数の視覚トークンから必要情報を集約

    c. 破棄: 元のトークンの⼀部だけ残してそれ以外を除去 ⽬ 注 に ーチ ロ プ ア 破棄 今回は 統合アプローチの例(ToMe [Bolya+ 2023]) 読出アプローチの例(BLIP-2 [Li+ 2023])
  8. 背景: 既存のトークンプルーニング⼿法 ① - 重要度ベースの⼿法: FastV [Chen+ 2024] - 深層で画像トークンに割り当てられる

    Attention スコアが低いことに着⽬ - - K 層⽬までに割り当てられたスコアの平均が低い順に R %除去 - - 仮説: 割り当てられるスコアが低いトークンは削減可能なのでは? LLaVA-1.5-13B (K=2, R=50%) として FLOPs を 45% 削減しながら性能維持 Attention スコアを出⼒するため、 Fused Attention と組み合わせ不可 層ごとの Attention スコア分布 (LLaVA1.5-7B)
  9. 背景: 既存のトークンプルーニング⼿法 ② - 多様性ベースの⼿法: DART [Wen+ 2025], DivPrune[Alvar+ 2025]

    - 重要度ベースの⼿法では⾼削減率で性能劣化が著しいことに着⽬ - - - 仮説: 画像全体を表現できる代表値を残せるかが重要なのでは? 残存トークンの多様性が⾼くなるようにトークンを選択 - DART : 少数の pivot + 類似度の低いトークン - DivPrune : 選択済み集合内の最⼩ペア距離の最⼤化 (MMDP) ⾼削減率帯で重要度ベースより性能が⾼く、 Fused Attention フレンドリー FastV(左)とDART(右)の⽐較
  10. 背景まとめ - - 視覚⾔語モデル(Vision-Language Model; VLM) - 視覚情報と⾔語情報を統合的に取り扱う - 系列⻑に占める視覚トークン割合が⾼く、削減による軽量化が重要

    トークンプルーニング(Token Pruning) - 不要な視覚トークンを破棄して推論コストを削減 - 重要度や多様性に基づいて削減する⼿法が多数提案 - 直感に反して、深層ではランダムプルーニングと性能差がない なぜ深層では「どのトークンを削るか」がどうでも良くなるのか?
  11. Information Horizon の位置は何によって決まるか - 視覚的複雑性‧モデル性能が⾼いほど Horizon は深層にある - 視覚的複雑性とは? -

    ⼤域情報を捉えるタスクは低い(⾚) - OCR 等の細部情報が必要なタスクは⾼い(緑)
  12. ここまでのまとめ - - 視覚トークン情報量の導⼊ - 対象トークンの存在が正解トークンに対してどれだけ寄与したかを定量化 - 情報量の低いトークンを削減すると、むしろ性能が向上する 既存⼿法の傾向 -

    - 浅層では⾼情報量トークンを保持できるが、深層では保持できない Information Horizon - 視覚トークン情報量は深層で消失し、消失して以後はトークン全削除可能 - Information Horizon の位置はタスクの複雑性とモデル性能によって変動 Information Horizon 前後で既存⼿法∕ランダムを組み合わせると良さそう
  13. 基本戦略 - 浅層は賢く、深層はランダムにプルーニング - 深層におけるトークン選別コストが削減可能 - ランダムは選別コストがほぼゼロ - - 特に既存⼿法は

    FlashAttention と相性が悪いため利得が⼤きい 残存率を段階的にコントロールすることで性能向上可能 - 既存⼿法では、浅層で最終的な本数までトークンを削る必要があった - - ⾼情報量トークンが多い領域でも強く削る必要が出てくる 組み合わせにより、浅層でのトークン過削減を抑制 - 例: 100% → [Layer 0: DivPrune] → 53% → … → [Layer 25: Random] → 25% - 切り替え層‧残存率は検証セット上で探索して決定(タスク毎に要調整)
  14. 性能評価: LLaVA-1.5-7B(抜粋) - 64 トークン保持(88.9%削減)でも、元性能の 94.9% を維持 Baseline Method SQA

    TextVQA MMB Rel. Original 1862 69.5 58.3 64.6 100.0 DART 1529 68.6 50.4 55.8 83.7 DivPrune 1614 67.9 55.0 54.6 92.4 + VTW※ 1664 68.3 53.3 60.3 91.3 DivPrune + VTW 1677 68.2 54.1 61.6 94.6 DART + Random 1670 68.4 53.4 60.4 91.5 DivPrune + Random 1693 68.3 54.5 61.3 94.9 DART Proposed MME ※ VTW [Lin+ 2025] (Visual Token Withdraw; トークン全削除)
  15. 性能評価: Qwen2.5-VL-7B(抜粋) - 視覚トークンを50%削減しても、元性能の 96.9% を維持 Baseline Method SQA TextVQA

    MMB Rel. Original 2313 71.4 85.4 79.8 100.0 DART 2295 69.2 82.1 79.6 92.7 DivPrune 2291 70.2 83.1 79.4 96.7 + VTW 2302 69.8 76.3 79.4 91.4 DivPrune + VTW 2308 70.0 75.8 79.4 94.2 DART + Random 2318 70.0 82.7 79.6 93.9 DivPrune + Random 2302 70.3 82.8 79.9 96.9 DART Proposed MME ※ ※ 位置の不確実性に対する保険として機能 🤔 ?
  16. 効率性評価 - ランダムとの組み合わせによりレイテンシが 218.2ms → 183.6ms に改善 - Qwen はトークン数が固定できないため

    LLaVA on TextVQA でのみ実験 - ⾼複雑性タスクなので DART ⽐で性能が落ちるのはご愛嬌らしい 🤨 Method # Tokens FLOPs Storage CUDA Time Latency Acc. (Rel.) Original 576 9.22 T 346.2 MB 127.4 ms 272.4 ms 58.3 (100.0) DART 192 4.12 T 156.8 MB 75.0 ms 218.2 ms 57.0 (97.8) DART + VTW 192 4.08 T 154.0 MB 67.6 ms 184.6 ms 56.4 (96.7) DART + Random 192 4.06 T 154.2 MB 67.4 ms 183.6 ms 56.8 (97.4)
  17. まとめ - - 視覚トークンは多い - 推論コストを下げるために視覚トークンを削減したい - 深層ではランダムプルーニングでも性能が下がらない 視覚トークン情報量 -

    対象視覚トークンの正解トークンに対する影響度を定量化 - Information Horizon := 情報量ゼロとなる境界 - - 前後でランダムプルーニングを併⽤すると、性能‧効率性が向上 所感 - ⽂書理解タスクは Horizon が深層にあるため、本⼿法の効果は限定的 - エッジ強度などが情報量の代理指標になりうるかを⾒てみたい
  18. 参考⽂献 [紹介論文] Y. Wang et al., "When Token Pruning Is

    Worse Than Random: Understanding Visual Token Information in VLLMs," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2026. [Bolya+ 2023] D. Bolya et al., "Token Merging: Your ViT but Faster," Proc. Int'l Conf. Learning Representations (ICLR), 2023. [Li+ 2023] J. Li et al., "BLIP-2: Bootstrapping Language-Image Pre-Training with Frozen Image Encoders and Large Language Models," Proc. 40th Int'l Conf. Machine Learning (ICML), 2023, pp. 19730–19742. [Chen+ 2024] L. Chen et al., "An Image Is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models," Proc. European Conf. Computer Vision (ECCV), 2024, pp. 19–35. [Liu+ 2024] H. Liu et al., "Improved Baselines with Visual Instruction Tuning," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2024, pp. 26296–26306. [Alvar+ 2025] S.R. Alvar et al., "DivPrune: Diversity-Based Visual Token Pruning for Large Multimodal Models," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2025, pp. 9392–9401. [Bai+ 2025] S. Bai et al., "Qwen2.5-VL Technical Report," arXiv:2502.13923, 2025. [Lin+ 2025] Z. Lin et al., "Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference," Proc. AAAI Conf. Artificial Intelligence (AAAI), 2025, pp. 5334–5342. [Wen+ 2025] Z. Wen et al., "Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More," Proc. Conf. Empirical Methods in Natural Language Processing (EMNLP), 2025.