Upgrade to Pro — share decks privately, control downloads, hide ads and more …

VLMの推論を高速化する視覚トークン削減の仕組み

Avatar for tattaka tattaka
August 17, 2026

 VLMの推論を高速化する視覚トークン削減の仕組み

Avatar for tattaka

tattaka

August 17, 2026

More Decks by tattaka

Other Decks in Research

Transcript

  1. 基本的なVLMの仕組み • Vision Encoder ◦ 画像から特徴量へ変換する • Projection ◦ 画像特徴量をLLMに入力できる画像トークンへ変換する

    ◦ シンプルなMLPだったり、動画を扱う場合は圧縮したり • Language Model ◦ 画像トークンとプロンプトトークンをまとめて受け取り テキストを出力する の3つを組み合わせるアーキテクチャが多い (図はLLaVA [1] の論文から) 3
  2. 視覚トークン数の削減手法の分類 (1/3) ▪ どうやって視覚トークンを圧縮・削減するか ▪ Merging・Poolingを用いた圧縮 ▪ 隣接するパッチや、類似した特徴を持つ トークンを結合 ▪

    ToMe [2] 、SmolVLM [3] など ▪ Pruningを用いた削減 ▪ 冗長な視覚トークンを削減 ▪ FastV [4] 、VisPruner [5] など https://arxiv.org/pdf/2305.06500 ▪ Resamplingを用いた圧縮 ▪ 学習可能トークンを使って固定長に圧縮 ▪ InstructBLIP [6] 、LLaVA-Mini [7] など https://arxiv.org/pdf/2504.05299 4
  3. 視覚トークン数の削減手法の分類(2/3) ▪ VLMのどこで削減をするか ▪ Vision Encoder内部 ▪ ToMe [2] など

    ▪ Projector / Adapter層 ▪ InstructBlip [6] 、VisPruner [5] 、 SmolVLM [3] など https://arxiv.org/pdf/2412.01818 ▪ LLM内部 ▪ FastV [4] 、 PyramidDrop [8] など https://arxiv.org/pdf/2410.17247 5
  4. 視覚トークン数の削減手法の分類(3/3) ▪ 何を使って削減するか ▪ 視覚トークン間の類似度 ▪ ToMe [2] など ▪

    テキストとの関連性 ▪ InstructBLIP [6] 、 SparseVLM [9] 、FlashVLM [10] など https://arxiv.org/pdf/2512.20561 ▪ LLMのAttentionスコア ▪ FastV [4] 、PyramidDrop [8] など https://arxiv.org/pdf/2403.06764 6
  5. Token Merging(ICLR 2023)[2] ▪ Token Mergingは軽量なマッチングアルゴリズムを 使用して、類似するトークンをVision Encoder内で 段階的に結合する手法 ▪

    類似度計算には各トークンのキー間の類似度を使う ▪ トークン間の特徴量類似度を使わないのは過剰にパラメータ化 されており、ノイズが 多くなっているため 8
  6. まとめ・所感 ▪ Pruningベースの手法がメジャーになってきている印象 ▪ 学習不要なものが多い ▪ どこをpruningしたかわかりやすい ▪ 複数の削減方法を組み合わせている手法も ▪

    高性能なオープンモデル(おそらくクローズドモデルにも)には 高度な視覚トークン削減手法はあまり採用されていない ▪ 量子化やシステム的な高速化に比べて伸び代が少ない? ▪ 単純な削減手法だと精度劣化が大きく、複雑な削減手法だと モデルや最適化が煩雑になる 23
  7. 参考文献 (1/2) [1]: https://arxiv.org/pdf/2304.08485v2 [2]: https://arxiv.org/abs/2210.09461 [3]: https://arxiv.org/abs/2504.05299 [4]: https://arxiv.org/abs/2403.06764

    [5]: https://arxiv.org/abs/2412.01818 [6]: https://arxiv.org/abs/2305.06500 [7]: https://arxiv.org/abs/2501.03895 [8]: https://arxiv.org/abs/2410.17247 [9]: https://arxiv.org/abs/2410.04417 [10]: https://arxiv.org/abs/2512.20561 24
  8. 付録:MIRU2026ポスター(IS1-140)内容(1/3) 背景と課題 本研究のアプローチ • VLMの計算コスト増大 ◦ 高解像度画像や動画を扱うVLMでは、視覚トークン数の 増加に伴う推論レイテンシとメモリ消費の悪化が実用上の 課題となっている •

    LLMの隠れ状態を活用したシンプルな視覚トークン集約 ◦ LLM自身の推論過程から得られる隠れ状態を 文脈ガイダンスとして利用する • 既存手法の課題 ◦ 入力テキストを考慮しない視覚トークン圧縮手法では 回答に必要な局所的な視覚情報が失われやすい ◦ 入力テキストを考慮する圧縮手法ではアーキテクチャの冗 長性や推論時の計算オーバーヘッドが生じる ◦ LLMの内部アテンション情報を使用する手法は FlashAttention等の推論最適化技術と競合しやすい ◦ LLMの内部構造を変更しない設計と KVキャッシュの再利用を組み合わせることで 既存の最適化技術と両立した高速な推論パイプラインを 実現できる ◦ 各種ベンチマーク評価を通じて、事前学習済みモデルを 凍結したまま推論コストの大幅な削減と高い精度の維持 を両立できることを示した 26
  9. 付録:MIRU2026ポスター(IS1-140)内容(2/3) 提案手法 Image ❄Vision Encoder Question Text Hidden States Learnable

    Query Text Projector Key ❄Projector ❄Tokenizer Text Token ❄LLM Visual Token KV Cache Text-to-Query Cross Encoder Visual Token 🔥Vision Token Compression Module Hidden States Value Compressed Token ❄LLM Vision Projector Key Value Query-to-Visual Cross Encoder Shared Weights Answer FFN • 推論時 ◦ 先行入力した質問テキストからLLMの 隠れ状態(文脈特徴量)を抽出 (図の左側) ◦ 文脈特徴量を用いて圧縮モジュール 内の学習可能クエリを条件付けし、 視覚トークンから重要な情報のみを 動的に圧縮(図の Visual Token Compression Module) ◦ 先行入力時に保存したテキストのKV キャッシュを再利用することで、 再計算コストを回避しながら推論 • 学習時 ◦ ベースとなるLLMおよび 視覚エンコーダを凍結して 圧縮モジュールのみを更新する • シンプルな2段階の視覚トークン圧縮機構 • 先にテキストのみをLLMに解釈させることで、KVキャッシュ再利用を活かした高効率な推論パイプラインを実現 • LLMの内部アテンションには一切介入せず既存の推論最適化(FlashAttention等)と互換性がある 27
  10. 付録:MIRU2026ポスター(IS1-140)内容(3/3) 定量評価 • 各種ベンチマークでの評価 pope: ハルシネーション評価 vqav2: 一般的な視覚VQA評価 GQA: 物体間の関係性などの

    推論評価 TextVQA: 画像内に 含まれる文字情報の 推論評価 MME: 多数のサブ タスクの総合評価 定性評価 • ベースモデル・ToMe・提案手法での出力の比較 Question: What kind of expression does the cat in the photo have? LLaVA-1.5: The cat in the photo has a playful and curious expression, as it is sticking its tongue out while laying on the cushion. This suggests that the cat might be enjoying its time, exploring its surroundings, or simply being a playful and curious feline. ToMe: The cat in the photo has a mean or angry expression on its face. 提案手法: The cat in the photo has a funny or silly expression on its face, as it is sticking out its tongue while laying on the chair. • クエリによる視覚トークン圧縮機構内のattentionの変化 What is the title of the book shown in the image? What is the color of the boy’s hat in the image? • 推論効率の評価 TTFT: Time To First Token, TPOT: Time Per Output Token. Image from VQAv2 dataset [Goyal+, CVPR 2017] 28