Slide 1

Slide 1 text

Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen ൃలίϛϡχέʔγϣϯ(2026/06/29) จݙ঺հऀɿ਺ཧ޻ֶઐ߈2೥ࠤʑ໦ݚڀࣨɹന઒౧ࢠ

Slide 2

Slide 2 text

今回紹介する論 文 2 📘論 文    Beyond the Surface: Enhanching LLM-as-a-Judge Alignment with Human via Internal Representation Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen ( NeurIPS 2025ʹ࠾୒ࡁ) 📑概要   【 目 的】     モデルの内部情報を 用 いてLLMの評価をより 人 間の感覚に近づけたい   【提案】     中間層の情報を統合しスコアを算出する軽量フレームワーク”LAGER”   【結果】     標準的なベンチマークで 人 間の感覚とLLMの出 力 の相関係数が平均4.5%改善 \\単語集をappendixに記載しました!ご活 用 ください//

Slide 3

Slide 3 text

研究対象 出 力 結果の確認作業を 自 動化できる 手 法 LLM-as-a-Judgeとは   LLMの出 力 結果を 人 間の代わりに別のLLMが評価する 手 法 【例:スコアリングタスク】    タスク →               →          予測LLM             評価LLM 👍メリット   ・スケーラビリティの確保   ・低コストかつ効率的   ・評価の根拠を参照できる(プロンプトで指定) hogehoge 5点! 予測LLMの出 力 を評価 3

Slide 4

Slide 4 text

LLM-as-a-Judgeとは   LLMの出 力 結果を 人 間の代わりに別のLLMが評価する 手 法 【例:スコアリングタスク】評価LLMの 自 信に差があっても,同じく「5点」として扱われてしまう    タスク →               →          予測LLM             評価LLM 解決したい課題 思考過程も考慮してJudgeしたい 👎デメリット   ・モデルの最終出 力 しか評価できず,表層的な評価に留まる   ・Chain of Thought(=CoT)は計算/APIコストが増 大 する (絶対!)5点 (多分?)5点 hogehoge 4

Slide 5

Slide 5 text

先 行 研究 LLMの「思考過程」が最も 人 との感覚に近い? 5   Wang[1] ら,Yang[2] ら,Roh[3] らの先 行 研究より   「最終層ではただの語彙処理をしていることが多い.    上層〜中間層にかけてより豊富な意味的情報及びタスクに関する情報が    符号化されている.」 内部情報をJudgeする際に活 用 することで, ニュアンスを拾いながら判定をすることが可能になるのでは?

Slide 6

Slide 6 text

LAGERのイメージ 各層の予測結果を 用 いて期待値を出したい 6 ɹࢥߟաఔ 4点 5点 3点 4点 5点 【既存 手 法】 最終的な予測をそのまま出 力

Slide 7

Slide 7 text

LAGERのイメージ 各層の予測結果を 用 いて期待値を出したい 7 ɹࢥߟաఔ 5点 3点 4点 5点 【提案 手 法】変化するスコアを               重みをつけながら 足 し合わせて出 力 4点

Slide 8

Slide 8 text

提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 8 デコーダー専 用 LLM(= 入力 テキストの「次に来る単語」の予測に特化している)は 入力 プロンプト が与えられた時,モデルは以下のような計算を通じ回答 を 生 成する. :埋め込み層    :デコーダー層    :出 力 投影層 : 入力 プロンプト :評価 用 タスクの説明, :ユーザー指 示 , :評価対象となる回答, :採点基準や出 力 形式の要件 :モデルの語彙 :語彙に対するスコア候補の集合   (e.g.){1,2,3,4,5} X y y = f(X) = funembd ∘ f(L) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (X) (1) fembd (X) fdecorder (X) funembd (X) X = {xd , xi , xr , xc } xd xi xr xc V S ⊂ V

Slide 9

Slide 9 text

提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 9 今回は「hogeタスクの点数:」に続く実際の点数を 示 すトークン をどう選ぶかを解説する. 評価LLMがトークン を予測する時,隠れ状態 に依存する. で前のトークン列を 示 す 式(2)で求めた隠れ状態 に出 力 投影層 を掛け合わせ, 次のトークン候補に対するロジット(=語彙 にある各単語に対する選択可能性≠確率)を計算する. xi xi hi h(L) i = f(L) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x

Slide 10

Slide 10 text

式(3)で得られたロジット は に対して 関数に通される. 式(4)までは に対して計算した.ここからは実際に点数を選定するので に注 目 する. の中で最も式(4)の値が 大 きいトークンを とし,その値をバニラスコアと呼ぶ.   ̂ zi V softmax PL (t|X, y

Slide 11

Slide 11 text

提案 手 法解説の準備 デコーダー専 用 LLMの基本構造 11 バニラスコアは最も確率の 高 いトークンのみに依存       →評価LLMのスコア分布という有益な情報が落ちたスコアのみを出 力 式(3)で得られたロジット は に対して 関数に通される. 式(4)までは に対して計算した.ここからは実際に点数を選定するので に注 目 する. の中で最も式(4)の値が 大 きいトークンを とし,その値をバニラスコアと呼ぶ.   ̂ zi V softmax PL (t|X, y

Slide 12

Slide 12 text

手 法を提案するための実験 LLMの各層は 人 間の感覚とどれくらい近い? 12 提案 手 法LAGERでは,層ごとの挙動を把握し各層のバニラスコアを導出したい. まず式(6)(7)を 用 いて各層がどれくらい 人 間の感覚と似ているかを調査するために, 任意の 層における点数を式(6)(7)を 用 いて抽出する. 層( )のロジットは 式(4)を 用 いると各語彙に対する 生 成確率を求めることができ, 層のバニラスコアを算出できる. lth lth l < L ̂ zl = funembd (f(l) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x

Slide 13

Slide 13 text

手 法を提案するための実験 LLMの中間層は 人 間の感覚とやはり近い 13 図1   人 間による評価とモデルの各層におけるJudgeスコアの 一 致度 結果   最終層よりも中間層の 方 が 人 間の感覚と近い          →重みをつけながら各層のスコアを 足 し合わせたい

Slide 14

Slide 14 text

提案 手 法:LAGERの仕組みとは? 14

Slide 15

Slide 15 text

提案 手 法:LAGER LLMの内部情報に基づくスコア推定 15 分かりやすさを 高 めるためにLLMの出 力 である を (固定)と書き換える. 図1より,データセットによって何番 目 の層がより 人 間の感覚と近いかは特定できない. この課題に対応するため,層ごとに重みをつけることで ロジットを求める. 式(9)の中から について抽出し,各層におけるロジットを抽出する. funembd Wunembd ̂ zl = (f(l) decoder ∘ ⋯ ∘ f(1) decoder ∘ fembd (x

Slide 16

Slide 16 text

提案 手 法:LAGER LLMの内部情報に基づくスコア推定 16 に対応するトークンのインデックス番号    式(10)で得られたロジット は に対して 関数に通される. これを 用 いてスコアの分布の期待値を計算することで,スコア分布を考慮した点数を取得可能となる. ̂ z[M] = L ∑ i=0 wi ̂ zi[M] = L ∑ i=0 wi [h(i) n Wunembd ]M (10) M = {Tokenize(s)|s ∈ S} S ̂ z[M] S softmax P(s) = exp( ̂ z[s]) ∑ s′  ∈S exp( ̂ z[s′  ]) , s ∈ S (11) s* = 𝔼 s∼P(s) [s] = ∑ s∈S s × P(s) (12)

Slide 17

Slide 17 text

実験 実験1〜3における設定 17 💾ベンチマーク  人 によるアノテーションがされたデータ.   1~5段階評価   ・Flask[4]   ・HelpSteer[5]   ・BiGGen Bench[6] 🎯 比 較するスコアリング 手 法   ・LAGER   ・GPT Score(= 生 成確率に基づく)   ・Vscore(=バニラスコア)   ・E-Score(=最終層の期待値) 📋評価指標   LLMの予測するスコアと 人 による   アノテーションとの 一 致度合いを測る   ・スピアマン相関係数 ⚙設定   ・Direct:点数のみを直接出 力 する   ・Reasoning:CoTしつつ点数を出 力 する 🧠モデル   特性やパラメーター数の異なる   複数モデルを使 用   ・Mistral-7B-Instruct-v0.3   ・InternLM3-8B-Instruct   ・LLaMA3.1-8B-Instruct   ・Qwen-2.5-14B-Instruct   ・Mistral-Small-24B-Instruct   ・LLaMA-3.3-70B-Instruct   ・TIGERscore-7B   ・Prometheus2-7B

Slide 18

Slide 18 text

実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 18 表1 各スコアリング 手 法における, 人 の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケース相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた

Slide 19

Slide 19 text

実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 19 表1 各スコアリング 手 法における, 人 の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケースで相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた

Slide 20

Slide 20 text

実験1 LAGERを使うと多くのケースで 人 間の感覚と近づく 20 表1 各スコアリング 手 法における, 人 の感覚とのスピアマン相関係数の結果 結果1   36ケース中33ケースで相関が最も 大 きい 結果2   Mistral-Small-24B-Instructと   LLaMA-3.3-70B-InstructはLAGERを併 用 すれば   GPT-4o-miniに匹敵する 結果3   LAGER(w.o tuning)は6ケース中5ケースで   E-Scoreを上回り,平均4.5%の改善が 見 られた

Slide 21

Slide 21 text

実験2 必ずしもCoTが良いとは限らない 21 図2   6種類のモデルにおける,推論 方 法ごとの平均性能 結果   (a)(b)は右肩上がり→Reasoningが 高 性能,(c)は右肩下がり→Directが 高 性能 まとめ   LAGERではDirectを採 用 することで, 高 性能低コストを実現できる

Slide 22

Slide 22 text

実験3 重み付けしつつ各層の情報を統合すると良い 22 スコアリング 方 法 期待値/最 大 値 情報の集約レベル ロジット/確率 モデルのチューニング あり/なし 表2   スピアマン相関係数を 用 いて評価した、 FLASKおよびHelpSteerデータセットに関するアブレーション研究の結果 結果   ・Exp.で最 大 +0.17%性能UP ・Tuningで最 大 +0.1性能UP ・Logits agg.で最 大 +0.07%性能UP まとめ   モデル内部のロジットを適切に重みをつけ統合すると, 人 間との感覚により近くなる

Slide 23

Slide 23 text

今回紹介した論 文 23 📘まとめ   【 目 的】     モデルの内部情報を 用 いてLLMの評価をより 人 間の感覚に近づけたい   【提案】     中間層の情報を統合しスコアを算出する軽量フレームワーク”LAGER”   【結果】     標準的なベンチマークで 人 間の感覚とLLMの出 力 の相関係数が平均4.5%改善   🤔論 文 紹介者の疑問    ・ 一 般的なデコーダー専 用 LLMは 関数→ だけ抽出だが,     なぜLAGERでは逆 手 順なのか.    ・LAGERを使うことで,これまでより 人 の感覚に寄せられたが,     0.3~0.5程度までしか相関係数が伸びない.もっと感覚を寄せられないのか. softmax S

Slide 24

Slide 24 text

論 文 紹介者の研究との関連 24 🎯研究 目 的   認知症介護者とカウンセラーを 支 える対話型 支 援システムの構築:   抑うつ傾向の推定と興味関 心 に基づくユーザーマッチング

Slide 25

Slide 25 text

引 用 [1]Wang, Q., Li, C., Zhang, Y., Xiao, T., and Zhu, J.”Layer-wise multi-view learning for neural machine translation.”In Proceedings of the 28th International Conference on Computational Linguistics (COLING), pp. 4275 – 4286. 2022 [2]Yang, J., Yin, Y., Yang, L., Ma, S., Huang, H., Zhang, D., Wei, F., and Li, Z.”Gtrans: Grouping and fusing transformer layers for neural machine translation.”IEEE/ACM Transactions on Audio, Speech, and Language Processing, Vol. 31, pp. 1489 – 1498. 2022 [3]Roh, Y., Liu, Q., Gui, H., Yuan, Z., Tang, Y., Whang, S. E., Liu, L., Bi, S., Hong, L., Chi, E. H., and Zhao, Z.”Levi: generalizable fi ne- tuning via layer-wise ensemble of di ff erent views.”In Proceedings of the 41st International Conference on Machine Learning (ICML). 2024 [4] Ye, S., Kim, D., Kim, S., Hwang, H., Kim, S., Jo, Y., Thorne, J., Kim, J., and Seo, M.”FLASK: Fine-grained language model evaluation based on alignment skill sets”ICLR 2024 (Spotlight) (International Conference on Learning Representations) 2024 [5]Wang, Z., Dong, Y., Zeng, J., Adams, V., Sreedhar, M. N., Egert, D., Delalleau, O., Scowcroft, J. P ., Kant, N., Swope, A., and Kuchaiev, O.”HelpSteer: Multi-attribute helpfulness dataset for steerlm.”NAACL 2024 (The 2024 Conference of the North American Chapter of the Association for Computational Linguistics) 2023 [6]Kim, S., Suk, J., Longpre, S., Lin, B. Y., Shin, J., Welleck, S., Neubig, G., Lee, M., Lee, K., and Seo, M.”Prometheus 2: An open source language model specialized in evaluating other language models”EMNLP 2024 (The 2024 Conference on Empirical Methods in Natural Language Processing) 2024 25

Slide 26

Slide 26 text

appendix 26

Slide 27

Slide 27 text

単語表 27 ༻ޠ ҙຯɾղઆ LLM(=Large Language Model) Πϯλʔωοτ্ͷ๲େͳςΩετσʔλΛֶश͠ɼਓؒͷΑ͏ʹࣗવͳԠ౴จΛੜ੒ՄೳͳɼAIͷج൫ͱͳΔٕज़ɽ LLM-as-a-Judge ͋ΔAIʢLLMʣ͕࡞ͬͨճ౴ΛɼผͷAI͕ʮਓؒͷ୅ΘΓʯʹධՁɾ࠾఺͢Δख๏ɽ ΞϥΠϝϯτ(Alignment) AIͷධՁ΍޷ΈΛਓؒͷײ֮΍Ձ஋؍ʹҰககͤ͞Δ͜ͱɽ τʔΫϯ จষΛAI͕ॲཧ͠΍͍͢Α͏ʹࡉ͔۠͘੾ͬͨɼݴ༿ͷ࠷খ୯Ґɽ(≒୯ޠɼ͕ͩ΋ͬͱࡉ͔͍) ಺෦දݱ AIϞσϧͷ֤૚ͷ಺෦Ͱܭࢉ͞ΕΔσʔλͷ͜ͱͰɼݴ༿ͷҙຯ΍จ຺Λ਺ֶతʹڽॖͨ͠ʮߟ͑ʯͷΑ͏ͳ΋ͷɽ σίʔμʔઐ༻Ϟσϧ ݱࡏͷओྲྀͳLLMʢGPTͳͲʣͷߏ଄Ͱɼʮલͷݴ༿ʹଓ࣍͘ͷݴ༿ʯΛ༧ଌ͢Δ͜ͱʹಛԽͨ͠ܗࣜɽ ຒΊࠐΈ૚ ςΩετσʔλΛίϯϐϡʔλ͕ܭࢉͰ͖ΔϕΫτϧʹม׵͢Δ࠷ॳͷ૚ɽ ӅΕঢ়ଶ Ϟσϧͷ಺෦Λ௨աதͷσʔλঢ়ଶͷ͜ͱɽ֤૚ͰՃ޻͞Εɼ࠷ऴతͳճ౴ʢ఺਺ʣΛग़ͨ͢Ίͷ൑அࡐྉʹͳΔɽ ϩδοτ AI͕Ϟσϧͷޠኮͷ֤୯ޠ΍఺਺ͳͲʹରͯ͠ࢉग़͢ΔʮͲΕ͘Β͍ͦΕΛબͼ͍͔ͨʯΛද͢਺஋ɽ ιϑτϚοΫεؔ਺ ࣮਺શମΛऔΓ͏ΔϩδοτΛɼ߹ܭ͕1ʹͳΔΑ͏ʹ֬཰ʹม׵͢ΔͨΊͷܭࢉॲཧɽ εϐΞϚϯ૬ؔ܎਺ ࣮ࡍͷ਺஋Ͱ͸ͳ͘ɼσʔλͷॱҐʹม׵͔ͯ͠Βܭࢉ͢Δɽ֎Ε஋ͷӨڹΛड͚ʹ͍͘ɽ ϕϯνϚʔΫ AIͷੑೳΛެฏʹൺ΂ΔͨΊʹ༻ҙ͞Εͨɼඪ४తͳσʔληοτɽ νϡʔχϯά(tuning) ൚༻తͳLLMΛಛఆͷλεΫ΍෼໺ʹಛԽͯ͠௥ՃֶशΛߦ͍ɼLLMΛඍௐ੔͢Δٕज़ɽ

Slide 28

Slide 28 text

層の重みの軽量学習 28 今回は2種類の層の重みの付け 方 を紹介する ①平均の集計 ② 小 規模なデータセットを 用 いて,軽量な パラメータを調整する(上〜中間層は固定) モデルの性能向上/予測結果を 人 間の感覚に合わせるため, クロスエントロピー損失( )と平均 二 乗誤差( )を組み合わせつつ, 重み付けハイパラメーター でバランスを調整する. バッチサイズ で をプロがつけた真の解とすると,LAGERでのそれぞれの層の重みを決定するため のロス関数は以下のようになる. wi = 1 L + 1 L + 1 cE MAE α B si truth LFinal = α ⋅ LCE + (1 − α) ⋅ LMAE = α ⋅ ( − 1 |B| |B| ∑ i=1 ∑ s∈S 𝕀 (s = struth i )log Pi (s) ) + (1 − α) ⋅ ( 1 2|B| |B| ∑ i=1 (s* i − struth i )2 )