Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[MIRU26] To What Extent Does MLLM-as-a-Judge Ex...

[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. MLLM-as-a-Judgeのモデル選好バイアスを調べるため ⼤規模データセットを構築した Gemini ”A beekeeper works in a workshop filled

    with large stacks of unassembled wooden beehives.” 100 ハルシネーションを 誤って⾼く評価 80 60 40 20 0 GPT-4o Gemini2.5-Pro Qwen2.5 Molmo Eagle2 🌋 🌋 🌋 LLaVALLaVA- LLaVA-1.5 InternVL DeepSeek Gemma3 Phi-3.5-V OV NeXTVicuna -3-
  2. MLLM-as-a-Judgeのモデル選好バイアスを調べるため ⼤規模データセットを構築した データセットを構築 J 130万評価 / 5.4万キャプション / 4,500画像 Gemini

    ”A beekeeper works in a workshop filled with large stacks of unassembled wooden beehives.” 100 ハルシネーションを 誤って⾼く評価 80 1. 代表的なMLLM-as-a-Judgeは モデル選好バイアスを有する 2. 画像の複雑性はバイアスを増幅 3. スタッキングによりバイアスは軽減 60 40 cf. [Wada+, CVPR24] [Matsuda+, EMNLP25] [Hirano+, AAAI26] 20 0 GPT-4o Gemini2.5-Pro Qwen2.5 Molmo Eagle2 🌋 🌋 🌋 LLaVALLaVA- LLaVA-1.5 InternVL DeepSeek Gemma3 Phi-3.5-V OV NeXTVicuna -4-
  3. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 ① 各MLLMがGeneratorとしてnocaps [Agrawal, ICCV19] に対しキャプションを⽣成 A black cat

    sitting in the … GPT-4o An elephant carrying … Mature grape clusters … GPT-4o GPT-4o Gemini Gemini The black cat looks … Gemini A saddled elephant… Sunlit grape vines … A small black cat sits … Qwen2.5-VL Qwen2.5-VL Qwen2.5-VL A large elephant … Clusters of apple … -5-
  4. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 ② 各MLLMがEvaluatorとしてキャプションを評価 82.5 76 85 77.2 77 54.8

    55 74.3 74 83 76 85 77 55 74 83 77 81.3 81 81 66 65.9 86 8383 81 97 81 6677 79.0 7955 7474 85.8 76 85 86 81 97 81 66 79 85 80.8 97 59.8 81 55 79 88.2 86 76.4 77 85 81 60 76 88 77 81 85 97 81 81 60 66 76 79 88 86 Gemini2.5-Pro A large … 79.7 60 76 82.3 66 77.2 77 82.0 A cat… Each grape… 80 87.9 88 81 8260 7676 88.3 88 8988 77 85 81 Lush clusters… 80 88 81 77 82 88 Qwen2. Each grape… 5-VL-7B A gray … 64.0 68.9 80 69.3 88 81 66.0 A black cat… Deep purple… 64 69 8288 43.5 4481 82 6677 7782 75.7 76 8988 Each grape… 80 64 69 82 44 66 76 Molmo-Deep purple… 7B A close-up … 63 63 82 44 43 76 Deep purple… 64 69 82 44 66 76 Eagle275.9 85.6 A blackgrape… cat… Mature Mature grape… An elephant 81.3 … 96.9 The black cat… Sunlit grape… Mature grape… Sunlit grape… GPT-4o A saddled … 77.1 84.8 A small black… Lush clusters… Sunlit grape… Lush clusters… 9B 83.0 65 71.8 72 69.8 70 38.8 39 62.7 63 89 65 72 70 39 63 89 65 70 72 66 64 97 65 72 70 39 63 89 65.0 Black cat with… Clusters of… Clusters of… A side view … InternV Clusters of… L2.5-8B GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B Eagle29B InternV L2.5-8B -6-
  5. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 75.9 85.6 77.2 54.8 74.3 82.5 81.3 96.9

    81.3 65.9 79.0 85.8 77.1 84.8 80.8 59.8 76.4 88.2 79.7 87.9 82.3 77.2 82.0 88.3 64.0 68.9 69.3 43.5 66.0 75.7 65.0 71.8 69.8 38.8 62.7 83.0 Eagle29B InternV L2.5-8B GPT-4o Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B InternV L2.5-8B GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B ⼆元配置モデルに基づく定量化 Evalの 評価⽔準 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 -7-
  6. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 0.32 75.9 0.25 85.6 -0.40 77.2 -0.14 54.8

    0.10 74.3 -0.45 82.5 1.05 81.3 1.50 96.9 0.56 81.3 0.72 65.9 0.84 79.0 0.22 85.8 0.47 77.1 0.25 84.8 0.56 80.8 0.25 59.8 0.39 76.4 0.67 88.2 0.91 79.7 0.56 87.9 0.56 82.3 1.57 77.2 1.28 82.0 0.67 88.3 -1.44 64.0 -1.43 68.9 0.80 69.3 -1.00 43.5 -1.08 66.0 -2.01 75.7 65.0 -1.12 71.8 -1.30 -2.07 69.8 -1.39 38.8 -1.53 62.7 -0.89 83.0 Eagle29B InternV L2.5-8B GPT-4o Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B InternV L2.5-8B GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B ⼆元配置モデルに基づく定量化 Evalの 評価⽔準 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 -8-
  7. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 1.24 0.32 75.9 1.01 0.25 85.6 -0.40 77.2

    -0.14 54.8 -1.16 -0.29 0.51 0.10 74.3 -0.45 -1.32 82.5 1.05 0.59 81.3 1.72 1.50 96.9 0.56 81.3 -0.64 0.72 -0.24 65.9 0.06 0.84 79.0 0.22 85.8 -1.49 0.47 0.25 77.1 -1.18 0.25 84.8 0.56 0.83 80.8 -1.18 0.25 59.8 0.39 76.4 -0.27 0.67 1.55 88.2 -0.04 0.91 79.7 -0.96 0.56 87.9 0.56 82.3 -0.96 1.57 1.69 77.2 1.28 0.93 82.0 -0.67 0.67 88.3 -1.44 -0.47 64.0 -1.43 -0.46 68.9 2.08 0.80 69.3 -1.00 0.03 1.02 43.5 -1.08 66.0 -1.12 -2.01 75.7 -0.33 -0.48 -1.06 -2.07 69.8 -1.39 38.8 -1.53 62.7 2.12 -0.89 83.0 GPT-4o Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B InternV L2.5-8B -0.04 -0.23 65.0 -1.12 71.8 -1.30 GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B Eagle29B ⼆元配置モデルに基づく定量化 Evalの 評価⽔準 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 InternV L2.5-8B -9-
  8. 結果︓代表的なMLLM-as-a-Judgeは⾃⼰ / ファミリーを選好 (シェアの約90%) : ⾃⼰選好度合い GPT-4o Gemini2.5-Pro Qwen2.5 -VL-7B

    Generator Molmo-7B Eagle2-9B LLaVAOneVision -7B ! DeepSeek -VL2 Gemma3-4B-IT Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! InternVL 2.5-8B ! ! !! GPT-4o Gemini2.5-Pro Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator !! Phi-3.5 -Vision LLaVA- LLaVANeXT1.5-13B Vicuna-7B ! !! InternVL 2.5-8B - 10 -
  9. 結果︓代表的なMLLM-as-a-Judgeは⾃⼰ / ファミリーを選好 (シェアの約90%) QwenベースのMLLMは相互選好 仮説: エンコーダ・バックボーンが共通 GPT-4o Gemini2.5-Pro Qwen2.5

    -VL-7B Generator Molmo-7B Eagle2-9B LLaVAOneVision -7B ! DeepSeek -VL2 Gemma3-4B-IT Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! InternVL 2.5-8B ! ! !! GPT-4o Gemini2.5-Pro Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator !! Phi-3.5 -Vision LLaVA- LLaVANeXT1.5-13B Vicuna-7B ! !! InternVL 2.5-8B - 11 -
  10. リスク︓どのモデルも特定のモデルを逆選好してしまう Generator GPT-4oと GPT-4o GPT-4o Gemini2.5-Pro Gemini2.5-Pro Qwen2.5 -VL-7B Qwen2.5

    -VL-7B Molmo-7B Molmo-7B Eagle2-9B Eagle2-9B LLaVAOneVision -7B ! ! LLaVAOneVision -7B DeepSeek -VL2 DeepSeek -VL2 Gemma3-4B-IT Gemma3-4B-IT Phi-3.5 -Vision Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B InternVL 2.5-8B !! ! ! ! ! LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! ! DeepSeekは相互選好 ! ! ! InternVL 2.5-8B ! Evaluator !! ! !! ! ! ! ! !! !! Evaluator - 12 -
  11. 画像の複雑性がモデル選好バイアスを増幅 画像群 参照⽂の 類似度 (BERTScore) 複雑 0.384 1.70 中間 0.600

    1.20 単純 0.746 0.95 1. 2. 3. 4. 5. Florida State University's game line up… Football players from two different …. A football player pushes … A poster for a college football team … Two football players wearing football … - 13 -
  12. 画像の複雑性がモデル選好バイアスを増幅 画像群 参照⽂の 類似度 (BERTScore) 複雑 0.384 1.70 中間 0.600

    1.20 単純 0.746 仮説 ・複雑: 注⽬候補が多い 0.95 → ・⽣成・評価時に注⽬領域が揃うと⾼評価の傾向 1. Florida State University's game line up… 2. Football players from two different …. ・ハルシネーションも共有 3. A football player pushes … 4. A poster for a college football team … ・単純: 注⽬領域がほぼ唯⼀ 5. Two football players wearing football … → ⽣成⽂が類似するため評価はぶれない - 14 -
  13. 提案⼿法は性能を維持しつつバイアスを軽減 提案: 性能が向上するモデルを貪欲に選択しElastic Netを学習 Nebula [Matsuda+, ACCV24] [Tong+, AAAI25] G-VEval

    モデル Qwen2.5VL-7B GPT-4o 提案⼿法 InternVL 2.5-8B + + + Eagle2-9B 🌋 LLaVAOneVision-7B DeepSeek-VL2 Flickr8k-Ex [Hodosh+, JAIR13] SelfEval-Cap (本研究で構築) ↑ ↑ 52.4 54.0 1.12 53.2 59.7 1.08 53.5 59.7 1.31 53.6 60.8 0.45 53.7 58.8 -0.19 53.5 57.3 0.15 -0.93 - 15 -
  14. 追加結果はポスターをご覧ください (#OS1E-03) • • • 評価プロンプト・モデル群に依らず⾃⼰を選好 (𝑝 < 0.05)1.5 1.5

    1.5 1.0 1.0 1.0 参照⽂がない設定でも同様のモデル選好傾向 0.5 ⾮対⾓成分 Off-diagonal entries 0.5 0.5 Off-diagonal entries Off-diagonal entries 0.0 0.0 0.0 スタッキングは単純なアンサンブルよりも良好 0.5 0.5 0.5 (a) • 参照⽂がない設定 2.0 2.0 2.0 (b) (a) (c) (a) (b) (d) (b) (c) (e) (c) (d) (f) (d) (e) (g) (e) (f)(f) (g)(g) VQA向けにDeviance Residualで拡張 [細⾕, MIRU26] Nebula Flickr8k-Ex SelfEval-Cap Uniform averaging 53.7 53.1 0.32 Median 53.6 60.4 -0.40 Calibration 53.2 54.6 -0.38 提案⼿法 53.5 57.3 0.15 ⼿法 - 16 -