(temperatur e=1. 0) • Rubricの生成・判定モデル: (生成) Claude Sonnet 4.5, (判定) GPT-5 low • 評価指標: Best@K (実験ではK=16) • K候補の中で最高スコア のものが、ground-tru th te stを通った割合 R u br ic Ge ne ra tio n rub rics : - d es cri p ti o n: 𝑡 1 w eig ht: 𝑤 1 … - 𝑃 (1) 2026/8/30, 31 … K = 1 6 候補 (𝑗) σ𝑖 𝑤𝑖 𝑠𝑖 𝑗 ∗ = argmax 𝑗∈ 1,…𝐾 σ𝑖 𝑤𝑖 ∙ 1 item binary score (𝑠𝑖 ) 𝑡1 1 𝑡2 0 + + + + … … - - 𝑡𝑁 1 𝑃 (𝑗 ) P atch Ge ne ra tio n + + R u br ic Gr ad in g ∗ 𝑃 ( 16 ) 最先 端N LP勉強 会2026 7
法 (A g en tic Ru b r ics) が 候 補パ ッチ数 K の 値 に関 わら ず一 貫 して 高ス コ ア ① 対 O r a c l e ( g r o u n d t r u th te s t が見 え る 状態 で正 解パ ッ チ を 選 べる 設 定 = K 候補 の中 に 正解 が存 在し た 割合 ) では 乖 離は あ る が、 ① ② ② e xp er t a g e n t が検 証用 のテ ス ト を 書 く設 定よ り は明 確な g a i n があ る 2026/8/30, 31 最先 端N LP勉強 会2026 9
ア 帯 に 集中 Int egr ity (I ) 低ス コ ア 帯 に も 分布 Runti me ( R) Spe c Al ignme nt (SA) F il e Cha nge (FC ) • File Change (FC) は 例外的に スコアが広範に分布 (次ページ: Rubricの事例) gr ound-truth pa tchのスコア分布 2026/8/30, 31 最先 端N LP勉強 会2026 11
Point: Rubric生成はタスク毎に1回だが、採点は候補ごとに必要 限られた予算では強力なモデルをRubric生成に集中し、判定は軽量モデルで代替するのが有力? ※ ただし、 判定モデルはGPT-5 family のみの比較で、 生成側のバリエーションをカ バーできていないことに注意が必要 S on n e t R u b r i c と S el f R u b r i c ( Q we n - 3 - C o d e r ) では 1 0 p p . の差 R u b ri c 生成 モ デ ルの ca p ab i l it y は ス コア に強 く影 響 2026/8/30, 31 最先 端N LP勉強 会2026 R u b ri c 判定 モ デ ルの 影 響は 生成 と 比 べる と 小さ い 13