Slide 1

Slide 1 text

第67回 コンピュータビジョン勉強会@関東(後編) When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs Sansan株式会社 技術本部 研究開発部 内⽥奏

Slide 2

Slide 2 text

内⽥ 奏 Sansan株式会社 技術本部 研究開発部 シニアリサーチャー 東京電機⼤学⼤学院⼯学研究科修⼠課程修了。 深層学習を⽤いた画像⽣成‧変換に関する研究に取り組む。 2020年に新卒でSansanに⼊社し、名刺画像の品質およびOCR (⽂字認識)精度の改善に関する研究開発に取り組む。 現在は⽂書特化基盤モデル「Viola」「Cello」「Contrabass」の 開発など、コア技術の開発に従事している。

Slide 3

Slide 3 text

⽬次 1. 2. 3. 4. 背景 a. 視覚⾔語モデル b. トークンプルーニング 論⽂紹介 a. 視覚トークン情報量 b. Information Horizon 実験 a. ランダムプルーニングの併⽤ b. 性能‧効率性評価 おわりに

Slide 4

Slide 4 text

背景

Slide 5

Slide 5 text

背景: 視覚⾔語モデル(Vision-Language Model; VLM) - 視覚情報と⾔語情報を統合的に取り扱うモデル - 近年は Decoder-only アーキテクチャが主流 ポ メ ラ ニ ア ン </s> Text Decoder <s> ⽝ Vision Encoder 種 は 何 ? ポ メ ラ ニ ア ン

Slide 6

Slide 6 text

背景: 視覚⾔語モデル(Vision-Language Model; VLM) - 視覚情報と⾔語情報を統合的に取り扱うモデル - 近年は Decoder-only アーキテクチャが主流 ポ メ ラ ニ ア ン </s> Text Decoder <s> ⽝ 種 は 何 ? ポ メ ラ ニ ア ン Vision Encoder あくまでこれは模式図であって...

Slide 7

Slide 7 text

背景: 視覚トークンは多い - 回答が短いタスクにおいて、視覚トークンが⽀配的になりがち - LLaVA-1.5 [Liu+ 2024] : 576 Qwen2.5-VL [Bai+ 2025] : 16,384 ポ メ ラ ニ ア ン </s> coder <s> ⽝ Vision Encoder 種 は 何 ? ポ メ ラ ニ ア ン

Slide 8

Slide 8 text

背景: 視覚トークンは多い - 回答が短いタスクにおいて、視覚トークンが⽀配的になりがち - LLaVA-1.5 [Liu+ 2024] : 576 Qwen2.5-VL [Bai+ 2025] : 16,384 ポ メ ラ ニ ア ン </s> coder <s> ⽝ 種 は 何 ? ポ メ ラ ニ ア ン Vision Encoder 視覚トークンを削減して 推論コストを下げたい

Slide 9

Slide 9 text

背景: 視覚トークンの削減 - 視覚トークン削減のアプローチは複数存在 a. 統合: 複数のトークンを合成して少数トークンを取得 b. 読出: 少数のクエリが多数の視覚トークンから必要情報を集約 c. 破棄: 元のトークンの⼀部だけ残してそれ以外を除去 統合アプローチの例(ToMe [Bolya+ 2023]) 読出アプローチの例(BLIP-2 [Li+ 2023])

Slide 10

Slide 10 text

背景: 視覚トークンの削減 - 視覚トークン削減のアプローチは複数存在 a. 統合: 複数のトークンを合成して少数トークンを取得 b. 読出: 少数のクエリが多数の視覚トークンから必要情報を集約 c. 破棄: 元のトークンの⼀部だけ残してそれ以外を除去 ⽬ 注 に ーチ ロ プ ア 破棄 今回は 統合アプローチの例(ToMe [Bolya+ 2023]) 読出アプローチの例(BLIP-2 [Li+ 2023])

Slide 11

Slide 11 text

背景: トークンプルーニング(Token Pruning) - 不要な視覚トークンを途中で捨てる - 直感的には、重要なトークンを選択的に残した⽅が良さそう ランダムプルーニング 重要トークン選択 🤖「ポメラニ…アン?」 🤖「ポメラニアン!!!」

Slide 12

Slide 12 text

背景: 既存のトークンプルーニング⼿法 ① - 重要度ベースの⼿法: FastV [Chen+ 2024] - 深層で画像トークンに割り当てられる Attention スコアが低いことに着⽬ - - K 層⽬までに割り当てられたスコアの平均が低い順に R %除去 - - 仮説: 割り当てられるスコアが低いトークンは削減可能なのでは? LLaVA-1.5-13B (K=2, R=50%) として FLOPs を 45% 削減しながら性能維持 Attention スコアを出⼒するため、 Fused Attention と組み合わせ不可 層ごとの Attention スコア分布 (LLaVA1.5-7B)

Slide 13

Slide 13 text

背景: 既存のトークンプルーニング⼿法 ② - 多様性ベースの⼿法: DART [Wen+ 2025], DivPrune[Alvar+ 2025] - 重要度ベースの⼿法では⾼削減率で性能劣化が著しいことに着⽬ - - - 仮説: 画像全体を表現できる代表値を残せるかが重要なのでは? 残存トークンの多様性が⾼くなるようにトークンを選択 - DART : 少数の pivot + 類似度の低いトークン - DivPrune : 選択済み集合内の最⼩ペア距離の最⼤化 (MMDP) ⾼削減率帯で重要度ベースより性能が⾼く、 Fused Attention フレンドリー FastV(左)とDART(右)の⽐較

Slide 14

Slide 14 text

背景: 直感に反する観測 - 深層において、既存⼿法はランダムプルーニングと変わらない - トークンプルーニングを適⽤開始する層を変化させて性能評価 - 浅層では既存⼿法優位だが、深層になるほど差が縮⼩(負けるケースも) LLaVa-1.5-7B Qwen2.5-VL-7B

Slide 15

Slide 15 text

背景まとめ - - 視覚⾔語モデル(Vision-Language Model; VLM) - 視覚情報と⾔語情報を統合的に取り扱う - 系列⻑に占める視覚トークン割合が⾼く、削減による軽量化が重要 トークンプルーニング(Token Pruning) - 不要な視覚トークンを破棄して推論コストを削減 - 重要度や多様性に基づいて削減する⼿法が多数提案 - 直感に反して、深層ではランダムプルーニングと性能差がない なぜ深層では「どのトークンを削るか」がどうでも良くなるのか?

Slide 16

Slide 16 text

論⽂紹介

Slide 17

Slide 17 text

書誌情報 発表動画 / GitHub - 選定理由 - 業務で複数ページドキュメントの取り扱いに苦慮しているため - トークン破産にビクビクしているため

Slide 18

Slide 18 text

概要 - 視覚トークン情報量を定義 - 深層で情報量が均⼀化‧消失する Information Horizon を発⾒ - ランダムプルーニングの併⽤が合理的であることを実験的に明らかにした 層ごとの視覚トークン情報量の可視化

Slide 19

Slide 19 text

視覚トークン情報量 ⼀⾔で⾔うと、 対象トークンが存在することで正解トークンの確率がどれだけ上がったか?

Slide 20

Slide 20 text

視覚トークン情報量 ⼀⾔で⾔うと、 対象トークンが存在することで正解トークンの確率がどれだけ上がったか?

Slide 21

Slide 21 text

視覚トークン情報量 ⼀⾔で⾔うと、 対象トークンが存在することで正解トークンの確率がどれだけ上がったか?

Slide 22

Slide 22 text

視覚トークン情報量の妥当性 - 情報量下位のトークンを削減するとモデル性能が上がる - ⼊⼒段階で88%削減した場合を除き、全ての設定で性能向上を確認 - 情報量を適切に表現しており、プルーニングの評価指標として妥当といえる 注: 情報量計測には正解が必要なため、実環境での性能向上には利⽤不可

Slide 23

Slide 23 text

視覚トークン情報量によるプルーニング⼿法の評価 - 浅層では既存⼿法、深層ではランダムが⾼情報量トークンを保持 - 第10層から第14層で急激に差が縮まり、第14層以降ではランダム優位 - トークン削減率に依らず同じ傾向が⾒られた

Slide 24

Slide 24 text

視覚トークン情報量の消失 - 深層ではどのトークンを選んでも正解に対して寄与しない - - 第10層から情報量の絶対値‧分散が⼩さくなりゼロに近づく - 重要トークンを⾒抜けなくなったのではなく、情報差そのものが無くなる - 視覚情報は浅層でテキスト側の隠れ状態に転写済 = 「読み終わった」状態? 仮説: 情報量が消失した層以降は視覚トークンを全削除できるのでは?

Slide 25

Slide 25 text

Information Horizon - 視覚トークンを全削除してもモデル性能に影響しない境界線が存在 - 情報量が消失して以降はトークン全削除がモデル性能に影響しない - ただし、 Information Horizon の位置は⼀定ではない

Slide 26

Slide 26 text

Information Horizon の位置は何によって決まるか - 視覚的複雑性‧モデル性能が⾼いほど Horizon は深層にある - 視覚的複雑性とは? - ⼤域情報を捉えるタスクは低い(⾚) - OCR 等の細部情報が必要なタスクは⾼い(緑)

Slide 27

Slide 27 text

ここまでのまとめ - - 視覚トークン情報量の導⼊ - 対象トークンの存在が正解トークンに対してどれだけ寄与したかを定量化 - 情報量の低いトークンを削減すると、むしろ性能が向上する 既存⼿法の傾向 - - 浅層では⾼情報量トークンを保持できるが、深層では保持できない Information Horizon - 視覚トークン情報量は深層で消失し、消失して以後はトークン全削除可能 - Information Horizon の位置はタスクの複雑性とモデル性能によって変動 Information Horizon 前後で既存⼿法∕ランダムを組み合わせると良さそう

Slide 28

Slide 28 text

実験 - ランダムプルーニング併⽤について -

Slide 29

Slide 29 text

基本戦略 - 浅層は賢く、深層はランダムにプルーニング - 深層におけるトークン選別コストが削減可能 - ランダムは選別コストがほぼゼロ - - 特に既存⼿法は FlashAttention と相性が悪いため利得が⼤きい 残存率を段階的にコントロールすることで性能向上可能 - 既存⼿法では、浅層で最終的な本数までトークンを削る必要があった - - ⾼情報量トークンが多い領域でも強く削る必要が出てくる 組み合わせにより、浅層でのトークン過削減を抑制 - 例: 100% → [Layer 0: DivPrune] → 53% → … → [Layer 25: Random] → 25% - 切り替え層‧残存率は検証セット上で探索して決定(タスク毎に要調整)

Slide 30

Slide 30 text

性能評価: LLaVA-1.5-7B(抜粋) - 64 トークン保持(88.9%削減)でも、元性能の 94.9% を維持 Baseline Method SQA TextVQA MMB Rel. Original 1862 69.5 58.3 64.6 100.0 DART 1529 68.6 50.4 55.8 83.7 DivPrune 1614 67.9 55.0 54.6 92.4 + VTW※ 1664 68.3 53.3 60.3 91.3 DivPrune + VTW 1677 68.2 54.1 61.6 94.6 DART + Random 1670 68.4 53.4 60.4 91.5 DivPrune + Random 1693 68.3 54.5 61.3 94.9 DART Proposed MME ※ VTW [Lin+ 2025] (Visual Token Withdraw; トークン全削除)

Slide 31

Slide 31 text

性能評価: Qwen2.5-VL-7B(抜粋) - 視覚トークンを50%削減しても、元性能の 96.9% を維持 Baseline Method SQA TextVQA MMB Rel. Original 2313 71.4 85.4 79.8 100.0 DART 2295 69.2 82.1 79.6 92.7 DivPrune 2291 70.2 83.1 79.4 96.7 + VTW 2302 69.8 76.3 79.4 91.4 DivPrune + VTW 2308 70.0 75.8 79.4 94.2 DART + Random 2318 70.0 82.7 79.6 93.9 DivPrune + Random 2302 70.3 82.8 79.9 96.9 DART Proposed MME ※ ※ 位置の不確実性に対する保険として機能 🤔 ?

Slide 32

Slide 32 text

効率性評価 - ランダムとの組み合わせによりレイテンシが 218.2ms → 183.6ms に改善 - Qwen はトークン数が固定できないため LLaVA on TextVQA でのみ実験 - ⾼複雑性タスクなので DART ⽐で性能が落ちるのはご愛嬌らしい 🤨 Method # Tokens FLOPs Storage CUDA Time Latency Acc. (Rel.) Original 576 9.22 T 346.2 MB 127.4 ms 272.4 ms 58.3 (100.0) DART 192 4.12 T 156.8 MB 75.0 ms 218.2 ms 57.0 (97.8) DART + VTW 192 4.08 T 154.0 MB 67.6 ms 184.6 ms 56.4 (96.7) DART + Random 192 4.06 T 154.2 MB 67.4 ms 183.6 ms 56.8 (97.4)

Slide 33

Slide 33 text

おわりに

Slide 34

Slide 34 text

まとめ - - 視覚トークンは多い - 推論コストを下げるために視覚トークンを削減したい - 深層ではランダムプルーニングでも性能が下がらない 視覚トークン情報量 - 対象視覚トークンの正解トークンに対する影響度を定量化 - Information Horizon := 情報量ゼロとなる境界 - - 前後でランダムプルーニングを併⽤すると、性能‧効率性が向上 所感 - ⽂書理解タスクは Horizon が深層にあるため、本⼿法の効果は限定的 - エッジ強度などが情報量の代理指標になりうるかを⾒てみたい

Slide 35

Slide 35 text

参考⽂献 [紹介論文] Y. Wang et al., "When Token Pruning Is Worse Than Random: Understanding Visual Token Information in VLLMs," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2026. [Bolya+ 2023] D. Bolya et al., "Token Merging: Your ViT but Faster," Proc. Int'l Conf. Learning Representations (ICLR), 2023. [Li+ 2023] J. Li et al., "BLIP-2: Bootstrapping Language-Image Pre-Training with Frozen Image Encoders and Large Language Models," Proc. 40th Int'l Conf. Machine Learning (ICML), 2023, pp. 19730–19742. [Chen+ 2024] L. Chen et al., "An Image Is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models," Proc. European Conf. Computer Vision (ECCV), 2024, pp. 19–35. [Liu+ 2024] H. Liu et al., "Improved Baselines with Visual Instruction Tuning," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2024, pp. 26296–26306. [Alvar+ 2025] S.R. Alvar et al., "DivPrune: Diversity-Based Visual Token Pruning for Large Multimodal Models," Proc. IEEE/CVF Conf. Computer Vision and Pattern Recognition (CVPR), 2025, pp. 9392–9401. [Bai+ 2025] S. Bai et al., "Qwen2.5-VL Technical Report," arXiv:2502.13923, 2025. [Lin+ 2025] Z. Lin et al., "Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference," Proc. AAAI Conf. Artificial Intelligence (AAAI), 2025, pp. 5334–5342. [Wen+ 2025] Z. Wen et al., "Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More," Proc. Conf. Empirical Methods in Natural Language Processing (EMNLP), 2025.

Slide 36

Slide 36 text

No content