Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【論文紹介】Beyond the Surface: Enhancing LLM-as-a-Ju...

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for MomokoShirakawa MomokoShirakawa
June 30, 2026
56

【論文紹介】Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations

Avatar for MomokoShirakawa

MomokoShirakawa

June 30, 2026

Transcript

  1. Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal

    Representations Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen ൃలίϛϡχέʔγϣϯ(2026/06/29) จݙ঺հऀɿ਺ཧ޻ֶઐ߈2೥ࠤʑ໦ݚڀࣨɹന઒౧ࢠ
  2. 今回紹介する論 文 2 📘論 文    Beyond the Surface: Enhanching

    LLM-as-a-Judge Alignment with Human via Internal Representation Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen ( NeurIPS 2025ʹ࠾୒ࡁ) 📑概要   【 目 的】     モデルの内部情報を 用 いてLLMの評価をより 人 間の感覚に近づけたい   【提案】     中間層の情報を統合しスコアを算出する軽量フレームワーク”LAGER”   【結果】     標準的なベンチマークで 人 間の感覚とLLMの出 力 の相関係数が平均4.5%改善 \\単語集をappendixに記載しました!ご活 用 ください//
  3. 研究対象 出 力 結果の確認作業を 自 動化できる 手 法 LLM-as-a-Judgeとは  

    LLMの出 力 結果を 人 間の代わりに別のLLMが評価する 手 法 【例:スコアリングタスク】    タスク →               →          予測LLM             評価LLM 👍メリット   ・スケーラビリティの確保   ・低コストかつ効率的   ・評価の根拠を参照できる(プロンプトで指定) hogehoge 5点! 予測LLMの出 力 を評価 3
  4. LLM-as-a-Judgeとは   LLMの出 力 結果を 人 間の代わりに別のLLMが評価する 手 法 【例:スコアリングタスク】評価LLMの

    自 信に差があっても,同じく「5点」として扱われてしまう    タスク →               →          予測LLM             評価LLM 解決したい課題 思考過程も考慮してJudgeしたい 👎デメリット   ・モデルの最終出 力 しか評価できず,表層的な評価に留まる   ・Chain of Thought(=CoT)は計算/APIコストが増 大 する (絶対!)5点 (多分?)5点 hogehoge 4
  5. 先 行 研究 LLMの「思考過程」が最も 人 との感覚に近い? 5   Wang[1] ら,Yang[2]

    ら,Roh[3] らの先 行 研究より   「最終層ではただの語彙処理をしていることが多い.    上層〜中間層にかけてより豊富な意味的情報及びタスクに関する情報が    符号化されている.」 内部情報をJudgeする際に活 用 することで, ニュアンスを拾いながら判定をすることが可能になるのでは?
  6. LAGERのイメージ 各層の予測結果を 用 いて期待値を出したい 7 ɹࢥߟաఔ 5点 3点 4点 5点

    【提案 手 法】変化するスコアを               重みをつけながら 足 し合わせて出 力 4点
  7. 提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 8 デコーダー専 用 LLM(=

    入力 テキストの「次に来る単語」の予測に特化している)は 入力 プロンプト が与えられた時,モデルは以下のような計算を通じ回答 を 生 成する. :埋め込み層    :デコーダー層    :出 力 投影層 : 入力 プロンプト :評価 用 タスクの説明, :ユーザー指 示 , :評価対象となる回答, :採点基準や出 力 形式の要件 :モデルの語彙 :語彙に対するスコア候補の集合   (e.g.){1,2,3,4,5} X y y = f(X) = funembd ∘ f(L) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (X) (1) fembd (X) fdecorder (X) funembd (X) X = {xd , xi , xr , xc } xd xi xr xc V S ⊂ V
  8. 提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 9 今回は「hogeタスクの点数:」に続く実際の点数を 示 すトークン

    をどう選ぶかを解説する. 評価LLMがトークン を予測する時,隠れ状態 に依存する. で前のトークン列を 示 す 式(2)で求めた隠れ状態 に出 力 投影層 を掛け合わせ, 次のトークン候補に対するロジット(=語彙 にある各単語に対する選択可能性≠確率)を計算する. xi xi hi h(L) i = f(L) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x<i ) (2) x<i = (x1 , …, xi−1 ) hi funembd (x) V ̂ zi = funembd (h(L) i ) (3)
  9. 式(3)で得られたロジット は に対して 関数に通される. 式(4)までは に対して計算した.ここからは実際に点数を選定するので に注 目 する. の中で最も式(4)の値が

    大 きいトークンを とし,その値をバニラスコアと呼ぶ.   ̂ zi V softmax PL (t|X, y<i ) = exp( ̂ zi [t]) ∑ t′  ∈V exp( ̂ zi [t′  ]) (4) V S S xi s* L = arg max s∈S PL (s|X, y<i ) (5) 提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 10
  10. 提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 11 バニラスコアは最も確率の 高 いトークンのみに依存

          →評価LLMのスコア分布という有益な情報が落ちたスコアのみを出 力 式(3)で得られたロジット は に対して 関数に通される. 式(4)までは に対して計算した.ここからは実際に点数を選定するので に注 目 する. の中で最も式(4)の値が 大 きいトークンを とし,その値をバニラスコアと呼ぶ.   ̂ zi V softmax PL (t|X, y<i ) = exp( ̂ zi [t]) ∑ t′  ∈V exp( ̂ zi [t′  ]) (4) V S S xi s* L = arg max s∈S PL (s|X, y<i ) (5)
  11. 手 法を提案するための実験 LLMの各層は 人 間の感覚とどれくらい近い? 12 提案 手 法LAGERでは,層ごとの挙動を把握し各層のバニラスコアを導出したい. まず式(6)(7)を

    用 いて各層がどれくらい 人 間の感覚と似ているかを調査するために, 任意の 層における点数を式(6)(7)を 用 いて抽出する. 層( )のロジットは 式(4)を 用 いると各語彙に対する 生 成確率を求めることができ, 層のバニラスコアを算出できる. lth lth l < L ̂ zl = funembd (f(l) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x<i )) = funembd (h(l) i ) (6) lth s* l = arg max s∈S Pl (s|X, y<i ) (7)
  12. 手 法を提案するための実験 LLMの中間層は 人 間の感覚とやはり近い 13 図1   人 間による評価とモデルの各層におけるJudgeスコアの

    一 致度 結果   最終層よりも中間層の 方 が 人 間の感覚と近い          →重みをつけながら各層のスコアを 足 し合わせたい
  13. 提案 手 法:LAGER LLMの内部情報に基づくスコア推定 15 分かりやすさを 高 めるためにLLMの出 力 である

    を (固定)と書き換える. 図1より,データセットによって何番 目 の層がより 人 間の感覚と近いかは特定できない. この課題に対応するため,層ごとに重みをつけることで ロジットを求める. 式(9)の中から について抽出し,各層におけるロジットを抽出する. funembd Wunembd ̂ zl = (f(l) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x<i ))Wunembd = h(l) i Wunembd (8) w = {w0 , w1 , w2 , . . . , wL } ̂ z = L ∑ n=0 wn ̂ zn = L ∑ n=0 wn h(n) i Wunembd (9) S
  14. 提案 手 法:LAGER LLMの内部情報に基づくスコア推定 16 に対応するトークンのインデックス番号    式(10)で得られたロジット は に対して

    関数に通される. これを 用 いてスコアの分布の期待値を計算することで,スコア分布を考慮した点数を取得可能となる. ̂ z[M] = L ∑ i=0 wi ̂ zi[M] = L ∑ i=0 wi [h(i) n Wunembd ]M (10) M = {Tokenize(s)|s ∈ S} S ̂ z[M] S softmax P(s) = exp( ̂ z[s]) ∑ s′  ∈S exp( ̂ z[s′  ]) , s ∈ S (11) s* = 𝔼 s∼P(s) [s] = ∑ s∈S s × P(s) (12)
  15. 実験 実験1〜3における設定 17 💾ベンチマーク  人 によるアノテーションがされたデータ.   1~5段階評価   ・Flask[4]

      ・HelpSteer[5]   ・BiGGen Bench[6] 🎯 比 較するスコアリング 手 法   ・LAGER   ・GPT Score(= 生 成確率に基づく)   ・Vscore(=バニラスコア)   ・E-Score(=最終層の期待値) 📋評価指標   LLMの予測するスコアと 人 による   アノテーションとの 一 致度合いを測る   ・スピアマン相関係数 ⚙設定   ・Direct:点数のみを直接出 力 する   ・Reasoning:CoTしつつ点数を出 力 する 🧠モデル   特性やパラメーター数の異なる   複数モデルを使 用   ・Mistral-7B-Instruct-v0.3   ・InternLM3-8B-Instruct   ・LLaMA3.1-8B-Instruct   ・Qwen-2.5-14B-Instruct   ・Mistral-Small-24B-Instruct   ・LLaMA-3.3-70B-Instruct   ・TIGERscore-7B   ・Prometheus2-7B
  16. 実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 18 表1 各スコアリング 手 法における, 人

    の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケース相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた
  17. 実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 19 表1 各スコアリング 手 法における, 人

    の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケースで相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた
  18. 実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 20 表1 各スコアリング 手 法における, 人

    の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケースで相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた
  19. 実験2 必ずしもCoTが良いとは限らない 21 図2   6種類のモデルにおける,推論 方 法ごとの平均性能 結果  

    (a)(b)は右肩上がり→Reasoningが 高 性能,(c)は右肩下がり→Directが 高 性能 まとめ   LAGERではDirectを採 用 することで, 高 性能低コストを実現できる
  20. 実験3 重み付けしつつ各層の情報を統合すると良い 22 スコアリング 方 法 期待値/最 大 値 情報の集約レベル

    ロジット/確率 モデルのチューニング あり/なし 表2   スピアマン相関係数を 用 いて評価した、 FLASKおよびHelpSteerデータセットに関するアブレーション研究の結果 結果   ・Exp.で最 大 +0.17%性能UP ・Tuningで最 大 +0.1性能UP ・Logits agg.で最 大 +0.07%性能UP まとめ   モデル内部のロジットを適切に重みをつけ統合すると, 人 間との感覚により近くなる
  21. 今回紹介した論 文 23 📘まとめ   【 目 的】     モデルの内部情報を

    用 いてLLMの評価をより 人 間の感覚に近づけたい   【提案】     中間層の情報を統合しスコアを算出する軽量フレームワーク”LAGER”   【結果】     標準的なベンチマークで 人 間の感覚とLLMの出 力 の相関係数が平均4.5%改善   🤔論 文 紹介者の疑問    ・ 一 般的なデコーダー専 用 LLMは 関数→ だけ抽出だが,     なぜLAGERでは逆 手 順なのか.    ・LAGERを使うことで,これまでより 人 の感覚に寄せられたが,     0.3~0.5程度までしか相関係数が伸びない.もっと感覚を寄せられないのか. softmax S
  22. 論 文 紹介者の研究との関連 24 🎯研究 目 的   認知症介護者とカウンセラーを 支

    える対話型 支 援システムの構築:   抑うつ傾向の推定と興味関 心 に基づくユーザーマッチング
  23. 引 用 [1]Wang, Q., Li, C., Zhang, Y., Xiao, T.,

    and Zhu, J.”Layer-wise multi-view learning for neural machine translation.”In Proceedings of the 28th International Conference on Computational Linguistics (COLING), pp. 4275 – 4286. 2022 [2]Yang, J., Yin, Y., Yang, L., Ma, S., Huang, H., Zhang, D., Wei, F., and Li, Z.”Gtrans: Grouping and fusing transformer layers for neural machine translation.”IEEE/ACM Transactions on Audio, Speech, and Language Processing, Vol. 31, pp. 1489 – 1498. 2022 [3]Roh, Y., Liu, Q., Gui, H., Yuan, Z., Tang, Y., Whang, S. E., Liu, L., Bi, S., Hong, L., Chi, E. H., and Zhao, Z.”Levi: generalizable fi ne- tuning via layer-wise ensemble of di ff erent views.”In Proceedings of the 41st International Conference on Machine Learning (ICML). 2024 [4] Ye, S., Kim, D., Kim, S., Hwang, H., Kim, S., Jo, Y., Thorne, J., Kim, J., and Seo, M.”FLASK: Fine-grained language model evaluation based on alignment skill sets”ICLR 2024 (Spotlight) (International Conference on Learning Representations) 2024 [5]Wang, Z., Dong, Y., Zeng, J., Adams, V., Sreedhar, M. N., Egert, D., Delalleau, O., Scowcroft, J. P ., Kant, N., Swope, A., and Kuchaiev, O.”HelpSteer: Multi-attribute helpfulness dataset for steerlm.”NAACL 2024 (The 2024 Conference of the North American Chapter of the Association for Computational Linguistics) 2023 [6]Kim, S., Suk, J., Longpre, S., Lin, B. Y., Shin, J., Welleck, S., Neubig, G., Lee, M., Lee, K., and Seo, M.”Prometheus 2: An open source language model specialized in evaluating other language models”EMNLP 2024 (The 2024 Conference on Empirical Methods in Natural Language Processing) 2024 25
  24. 単語表 27 ༻ޠ ҙຯɾղઆ LLM(=Large Language Model) Πϯλʔωοτ্ͷ๲େͳςΩετσʔλΛֶश͠ɼਓؒͷΑ͏ʹࣗવͳԠ౴จΛੜ੒ՄೳͳɼAIͷج൫ͱͳΔٕज़ɽ LLM-as-a-Judge ͋ΔAIʢLLMʣ͕࡞ͬͨճ౴ΛɼผͷAI͕ʮਓؒͷ୅ΘΓʯʹධՁɾ࠾఺͢Δख๏ɽ

    ΞϥΠϝϯτ(Alignment) AIͷධՁ΍޷ΈΛਓؒͷײ֮΍Ձ஋؍ʹҰககͤ͞Δ͜ͱɽ τʔΫϯ จষΛAI͕ॲཧ͠΍͍͢Α͏ʹࡉ͔۠͘੾ͬͨɼݴ༿ͷ࠷খ୯Ґɽ(≒୯ޠɼ͕ͩ΋ͬͱࡉ͔͍) ಺෦දݱ AIϞσϧͷ֤૚ͷ಺෦Ͱܭࢉ͞ΕΔσʔλͷ͜ͱͰɼݴ༿ͷҙຯ΍จ຺Λ਺ֶతʹڽॖͨ͠ʮߟ͑ʯͷΑ͏ͳ΋ͷɽ σίʔμʔઐ༻Ϟσϧ ݱࡏͷओྲྀͳLLMʢGPTͳͲʣͷߏ଄Ͱɼʮલͷݴ༿ʹଓ࣍͘ͷݴ༿ʯΛ༧ଌ͢Δ͜ͱʹಛԽͨ͠ܗࣜɽ ຒΊࠐΈ૚ ςΩετσʔλΛίϯϐϡʔλ͕ܭࢉͰ͖ΔϕΫτϧʹม׵͢Δ࠷ॳͷ૚ɽ ӅΕঢ়ଶ Ϟσϧͷ಺෦Λ௨աதͷσʔλঢ়ଶͷ͜ͱɽ֤૚ͰՃ޻͞Εɼ࠷ऴతͳճ౴ʢ఺਺ʣΛग़ͨ͢Ίͷ൑அࡐྉʹͳΔɽ ϩδοτ AI͕Ϟσϧͷޠኮͷ֤୯ޠ΍఺਺ͳͲʹରͯ͠ࢉग़͢ΔʮͲΕ͘Β͍ͦΕΛબͼ͍͔ͨʯΛද͢਺஋ɽ ιϑτϚοΫεؔ਺ ࣮਺શମΛऔΓ͏ΔϩδοτΛɼ߹ܭ͕1ʹͳΔΑ͏ʹ֬཰ʹม׵͢ΔͨΊͷܭࢉॲཧɽ εϐΞϚϯ૬ؔ܎਺ ࣮ࡍͷ਺஋Ͱ͸ͳ͘ɼσʔλͷॱҐʹม׵͔ͯ͠Βܭࢉ͢Δɽ֎Ε஋ͷӨڹΛड͚ʹ͍͘ɽ ϕϯνϚʔΫ AIͷੑೳΛެฏʹൺ΂ΔͨΊʹ༻ҙ͞Εͨɼඪ४తͳσʔληοτɽ νϡʔχϯά(tuning) ൚༻తͳLLMΛಛఆͷλεΫ΍෼໺ʹಛԽͯ͠௥ՃֶशΛߦ͍ɼLLMΛඍௐ੔͢Δٕज़ɽ
  25. 層の重みの軽量学習 28 今回は2種類の層の重みの付け 方 を紹介する ①平均の集計 ② 小 規模なデータセットを 用

    いて,軽量な パラメータを調整する(上〜中間層は固定) モデルの性能向上/予測結果を 人 間の感覚に合わせるため, クロスエントロピー損失( )と平均 二 乗誤差( )を組み合わせつつ, 重み付けハイパラメーター でバランスを調整する. バッチサイズ で をプロがつけた真の解とすると,LAGERでのそれぞれの層の重みを決定するため のロス関数は以下のようになる. wi = 1 L + 1 L + 1 cE MAE α B si truth LFinal = α ⋅ LCE + (1 − α) ⋅ LMAE = α ⋅ ( − 1 |B| |B| ∑ i=1 ∑ s∈S 𝕀 (s = struth i )log Pi (s) ) + (1 − α) ⋅ ( 1 2|B| |B| ∑ i=1 (s* i − struth i )2 )