VLMのトークン削減論文まとめ
・Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
・Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
・METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models