Upgrade to Pro — share decks privately, control downloads, hide ads and more …

モデル評価を効率的にする方法

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest. →

 モデル評価を効率的にする方法

実務でのアノテーションは評価より学習に回したいというジレンマに対して、評価に必要なラベルを減らす研究を4本紹介。最後にタスクの状況を2軸で整理し使い分けをまとめています。

Avatar for fumihiko takahashi

fumihiko takahashi

October 01, 2026

More Decks by fumihiko takahashi

Other Decks in Research

Transcript

  1. Label-efficient model evaluation モデル評価を 効率的にする方法 2026.10.01 GO ドライブ株式会社 高橋文彦 [1]

    Kossen, Farquhar, Gal, Rainforth. Active Testing: Sample-Efficient Model Evaluation. ICML 2021, PMLR 139. [2] Hara, Matsuura, Honda, Ito. Active model selection: A variance minimization approach. Machine Learning 113, 2024. [3] Okanovic, Kirsch, Kasper, Hoefler, Krause, Gürel. All models are wrong, some are useful: Model Selection with Limited Labels. AISTATS 2025, PMLR 258. [4] Zouhar, Cui, Sachan. How to Select Datapoints for Efficient Human Evaluation of NLG Models? TACL 13, 2025. AI Community
  2. 自己紹介:高橋 文彦 GO ドライブ株式会社 コンペ歴 経歴 ✔大手ポータルサービス運営会社 ✔CVPR2026 workshop ACCIDENT

    1 位 ◦ EC サイトにおける検索クエリの意図推定 ✔HuMob Challenge 2023 11 位 ◦ SNS におけるドメインごとの話題の抽出 ✔SIGSPATIAL 2021 GISCUP 6 位 ◦ 形態素解析器の開発、研究 ✔SIGIR 2018 workshop eCom Rakuten Data Challenge 2 位 ✔GO 株式会社 ◦ タクシーアプリにおける到着時間予測機能の開発 ◦ 新規事業立ち上げ ◦ AI ドラレコを用いたドライバーの行動認識 ( 『 DRIVE CHART 』 ) ✔GO ドライブ株式会社 好きなもの・こと ✔ボードゲーム、一蘭、 2 児の育児 2
  3. 本発表の背景:モデルを選ぶための評価ラベルのコスト 100,000 10,000 ラベルなしデータ 件を人手でラベル付け Model A Model B B

    を deploy Model C モデルを選びたいだけなのに、 本当に 10,000 件すべての正解ラベルが必要か? 評価のラベルを減らせれば、その分のアノテーションを学習データに回せる [1] Kossen+ 2021 §1 、 [3] Okanovic+ 2025 §1 。数値は架空の設定 4
  4. ① 性能はいくつ? Active Testing — Kossen et al., ICML 2021

    ② A と B のどちらが良い? Active Model Selection — Hara et al., Machine Learning 2024 Agenda ③ 多数の候補から best はどれ? Model Selector — Okanovic et al., AISTATS 2025 ④ まとめてアノテーションを出せる? Zouhar et al., TACL 2025 まとめ 2 つの設計軸で整理する 5
  5. Active Testing の問題設定:評価のためにラベルを選ぶ Active Learning (学習) Active Testing (評価) どのサンプルにラベルを付ければ

    モデルが良くなるか? どのサンプルにラベルを付ければ 評価が正確になるか? • 目的:汎化誤差を下げる • 目的:性能推定の誤差を下げる • 偏った選び方も許容されやすい • 偏りは推定値を歪める → 補正が必須 問題設定 モデル f は固定。ラベルのない N サンプル ( pool )から M ≪ N サンプルを選んで ラベルを付け、全体の平均損失を当てる xi : i 番目の入力 yi :その正解 L :損失関数(例:交差エントロピー) [1] Kossen+ 2021 §2, §3.4 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 6
  6. Active Testing の手法:損失に比例したサンプリングと重み付き推定 1 サンプルを選ぶ 損失に比例した確率で選ぶ 2 アノテーション 選んだサンプルだけ正解を付ける 3

    重み付きで推定 重みで偏りを補正 理想の提案分布( Eq. 5 ) 偏りを補正する推定量 LURE ( Eq. 3 ) = 期待損失が大きい(間違えそうな)サンプルほど選ぶ p(y|x) : x の正解が y の確率(未知)→ 代理モデル π で代用 vm ≈ 1/(N·q) :選ばれやすいほど軽く、選ばれにくいほど重い 一様( q = 1/N )なら v = 1 で普通の平均 平均を大きく動かすサンプルを多めに取ってぶれを減らし、 選ばれやすさの偏りは重みで打ち消す(選ばれやすいほど軽く、選ばれにくいほど重く) [1] Kossen+ 2021 Eq. 3–6, Alg. 1 。 LURE : Farquhar+ ICLR 2021 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 7
  7. Active Testing の実験結果:実データでも少ないラベルで推定が安定する • データ: CIFAR-10 / CIFAR-100 / Fashion-MNIST

    。 test set から毎回 1,000 サンプルを pool にする • モデル: ResNet-18 ( CIFAR-100 は WideResNet ) • 代理モデル:学習データで一度だけ学習した ensemble • 1,000 回の中央値。横軸はどちらも取得したラベル数 (a) 縦軸:推定値と本当の test loss の二乗誤差(中央値、対数) (b) 縦軸: Active Testing の件数(横軸) ÷ ランダムで同じ誤差に届く件数( 0.25 なら 1/4 で済む) CIFAR-10 は約 1/4 、 CIFAR-100 は約 1/2 のラベルで、ランダムと同じ精度 [1] Kossen+ 2021 Fig. 6, §5.3, 付録 C.5 。代理モデルの影響は §5.2 ・ Fig. 4 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 8
  8. モデル選択で推定すべき量:各モデルの性能ではなく性能の差 でも、モデルを選ぶだけなら、性能をここまで正確に測る必要がある? 性能値を測る モデルを選ぶ RA = 0.102 、 RB =

    0.108 を精密に Δ = RA − RB < 0 なら A を選べる R :テスト損失(小さいほど良い) Δ :損失の差(負なら A が良い) R̂ A ^ :推定値 Δ̂ R̂ B 0.08 0.1 0.12 区間が重なる → まだ決められない? -0.01 0 差の区間が 0 をまたがなければ決められる 減らすべきは Var(R̂ ) ではなく 当たり外れが両モデルで同じサンプルのぶれは、差では消える [2] Hara+ 2024 §3.2 。図・数値は本発表の自作(架空値)。論文が最小化するのは LURE の差の条件付き分散( Thm 1 ) ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 本発表の図解( 2 モデルでの概念図) 9
  9. Active Model Selection の手法:損失の差に比例したサンプリング Active Testing :損失に比例 Active Model Selection

    :損失の差に比例 fk : k 番目の候補モデル( k = 1, …, K 。 K は何個でもよい) ℓ:損失 Rk : fk のテスト損失 z :未知の正解( π で平均) k<k' :モデルの全ペア Lk :その LURE 推定値 ℓ i ・ Δi :サンプル i での損失・ 2 モデルの損失差 Active Testing Active Model Selection 目標 R を推定 K 個から k* = argmink Rk 最小化 推定値の分散 全ペアの Lk − Lk' の分散の和 理想の q q* ∝ ℓi q* ∝ 全ペアの |Δi| の和 例: 2 モデルを正誤で比べる • 予測が同じサンプル:正誤も同じで差は 0 → 選ばない( q ≈ 0 ) • 予測が違うサンプル:正解がどちらかの 予測なら差が出る → π(a)+π(b) に比例し て選ぶ 2 つのモデルで損失が違いそうなサンプルほど選ぶ(代理モデル π で見積もる) [2] Hara+ 2024 §3.1–3.3 ( Eq. 5–11, Thm 1–2 ) ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 10
  10. Active Model Selection の実験結果:差の推定値のぶれと best の特定成功率 (a) 2 モデルの差の推定:平均 ±

    1SD (b) 6 候補から best を当てる成功率 縦軸: 2 つの MLP の損失差の推定値 (全 pool での本当の差は − 0.010 ) 縦軸:選んだモデルが本当の best だった割合 ( best は全 pool のラベルで決めた正解) 提案法(緑)は (a) 早く帯が 0 をまたがなくなり優劣が決まる、 (b) 最も早く成功率 1 [2] Hara+ 2024 Fig. 1(a), 2(a) 。 Uniform :ランダム、 Sawade : Sawade+ 2012 。横軸:ラベル数。シードを変えて各 1,000 回 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 11
  11. Model Selector の問題設定:多数の候補から best model を特定する ResNet-152 ViT-B/16 ConvNeXt Swin-B

    + ラベルなし データ n 件 どれを deploy する? 予算 b ≪ n 知りたいのは どれが best か だけ 全モデルの性能値や差は要らない … Model 100 ② ペアの比較:全ペア K(K−1)/2 ( 100 個で約 5,000 )の差を見るので重い ③ Model Selector :モデルごとに「 best である確率」を持つだけ(モデル数に比例) best の定義( §3.1 ) = 全件にラベルがあったら accuracy が最も高いモデル 𝓜 :候補モデルの集合 hj : j 番目のモデル 1[·] :中が真なら 1 、偽なら 0 [3] Okanovic+ 2025 §1–3.1 。ペアを比べる手法は ImageNet 規模でメモリ不足・長時間になった( [3] 付録 A )。モデル名は例 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 12
  12. Model Selector の手法: best についての情報量が最大のサンプルを選ぶ 選び方( Algorithm 1 、 1

    件ずつ b 回) 取得前 1. 候補 x ごとに「正解が cat なら」「 dog なら」と 仮定して確率を更新(予測が合うモデルを γ 倍) 2. 仮定ごとの「どれが best か分からない度合い」 エントロピー𝓗 を平均し、最も小さい x を選ぶ 3. x の正解を取り、確率を更新。最後は取った b 件で accuracy 最大のモデルを返す 0.68 0.40 γ = (1−ε)/ε Y : x の未知の正解 Lt :取得済みの (x, y) (全員一致なら、正解が何でも確率が動かない) B C A 0.35 0.25 0.20 0.12 B C 予測 A ・ C = cat B = dog (割れる) → B が上がる ε : best でも各サンプルで誤る確率として仮定する値 一言で 有力なモデルの予測が割れるサンプルを選ぶ 0.40 0.35 0.25 A H :どれが best か x₁ の正解 = dog x₂ の正解 = cat A B C 予測 全員 cat (一致) → 変化なし 例: ε = 0.2 → γ = 4 。 B だけ正解なので B を ×4 し、 合計 1 に割り直す( 0.35×4 = 1.40 → 1.40/2.05 = 0.68 ) [3] Okanovic+ 2025 §3.1–3.3, Eq. 4, 6, 7, Alg. 1 。数値例は自作 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 13
  13. Model Selector の実験結果: best model の特定に必要なラベル数の削減率 例: ImageNetV2 他のデータでも同じか?( 16

    のモデル群) 赤: Model Selector 他の 5 本: baseline 削減率(最良 baseline 比) 中央値 約 70.7% 縦軸:選んだモデルが本当の best だった割合(識別確率) 横軸:取得したラベル数 上の線分: baseline が 1.0 に届くまでのラベル数のうち、 何 % を減らせたか 範囲 27% ( CIFAR10-Low )〜 94% ( SST-2 ) データ 画像・テキスト分類の 16 データセット、候補は計 1,500+ モデル 最良の baseline より 72.33% 少ない ラベルで best を確実に当てられる 中央値は、論文の Fig. 2 で削減率が示された 16 のモデル群から 本発表で集計 [3] Okanovic+ 2025 Fig. 2, Table 1, 3 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 14
  14. まとめて(バッチ的に)アノテーションを出せるか? 1 件ずつ選び直す まとめて出せる 返ってきた人手ラベルを見て、次の 1 件を選ぶ 人手ラベルを見ずに、先に全部決められる ラベル 更新

    次の 1 件 Model Selector 、 Active Testing 予測・指標 まとめて選ぶ 一括で発注 Zouhar et al. 、 Active Model Selection 運用上の視点:まとめて出せるなら一括で発注・並列作業できる。ただし途中で選び方は直せない [1] Alg. 1 [2] §3 ・公式実装 [3] Alg. 1 [4] §2, §7 。区分は本発表の整理 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 本発表での整理( our conceptual organization ) 15
  15. Zouhar et al. :モデルの出力と自動指標から、評価 subset をまとめて選ぶ 対象:機械翻訳などの人手評価。複数の翻訳モデルの順位を、少ない人手評価で決めたい 理想:人手評価の順位が全体と一致する subset Y

    ( Eq. 1 ) 実際: item (サンプル)ごとの点数の和で近似し、上位 B 件を取る Utility(x) の作り方(人手ラベルは使わない) モデル間で自動評価のスコアが ばらつく item (差が出る) その item でのモデル順位が 全体の順位と似ている item (縮図) モデルどうしの出力(訳文)が 似ていない item 自動評価指標:人の代わりに訳文の質を採点する指標。 BLEU は正解訳との単語の重なり、 MetricX-23 は人手評価を予測するよう学習したモデル。人手評価の安い代用品で、①〜③ の代理モデルと似た役割 metric(x, m(x)) :モデル m の訳文 m(x) の自動評価スコア RankCorr :順位相関 sim :訳文どうしの類似度 𝓜:候補モデルの集合 [4] Zouhar+ 2025 §2–3 ( Eq. 1–6 )。 IRT を使う手法( DiffDisc )もある。説明の言い換えは本発表 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 16
  16. Zouhar et al. の結果:機械翻訳の人手評価で random を上回る 設定 • タスク:機械翻訳( WMT23

    、 9 言語対) 各翻訳モデルの出力に人手評価のスコアがある • 自動評価指標: MetricX-23 (翻訳の質を採点する学習済みモデル) • 横軸: subset の大きさ(全データに対する割合) • 縦軸 SPA : subset の人手評価で決めたモデル順位が 全データでの順位とどれだけ一致するか ( 2 モデルずつの優劣の一致率) 黒: random (灰色は 90% 信頼区間) 凡例の % :全予算での平均 どの手法も random を上回るが、差は小さい 最良で random より予算を 28.6% 削減 [4] Zouhar+ 2025 Fig. 4 ( TACL 版) , §5, §5.4, Table 5, 9 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 17
  17. 2 つの設計軸:何を知りたいか × まとめてアノテーションを出せるか 軸 2 :まとめて出せるか ↓ 1 件ずつ

    毎回選び直して出す batch ごと 数回に分けて出す まとめて 一括で出せる Active Testing [1] Model Selector [3] Karimi+ 2021 (先行研究) Kumar & Raj 2018 Ruan+ 2024 ( CASF ) Lee+ 2024 Active Model Selection [2] Kumar & Raj 2018 Zouhar et al. [4] Metric estimation Ranking / ペアの比較 軸 1 本編 ①〜③ 本編の 4 本は入らない 本編 ④ Best-model decision 何を知りたいか(性能値 → 意思決定) 関連研究 [2] は 1 件ずつ選ぶが、選ぶ確率が人手ラベルで 変わらないので一括で出せる 軸と区分は本発表の整理 ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 本発表での整理( our conceptual organization ) 18
  18. まとめ:タスクの条件で方法を選ぶ 軸 1 軸 2 何を知りたいか アノテーションをどう頼めるか 性能の値そのもの 1 件ずつ往復できる(自分で付けるなど)

    モデル間の優劣(比較) まとめて発注したい(外注など) → ① Active Testing → ① ③ :返ってきたラベルを見て次を選ぶ → ② Active Model Selection → ② ④ :先に選んで一括で出せる 多数の候補から best こまめに選び直すほど、発注の往復が増える → ③ Model Selector 使うときの注意 • 代理モデルや自動評価指標を手がかりにする方法は、その質に結果が左右されやすい • 学習時と評価時でデータの分布が大きくずれると、効率化の効果は出にくい • 人手ラベルを見ずに選ぶのは比較的難しい可能性があり、似たサンプルが重なりやすい ① Metric estimation ② Model selection ③ Best-model identification ④ Batch selection 本発表での整理( our conceptual organization ) 19
  19. 参考文献 本編で紹介した論文 [1] J. Kossen, S. Farquhar, Y. Gal, T.

    Rainforth. Active Testing: Sample-Efficient Model Evaluation. ICML 2021, PMLR 139, pp. 5753–5763. [2] S. Hara, M. Matsuura, J. Honda, S. Ito. Active model selection: A variance minimization approach. Machine Learning 113, pp. 8327–8345, 2024. [3] P. Okanovic, A. Kirsch, J. Kasper, T. Hoefler, A. Krause, N. M. Gürel. All models are wrong, some are useful: Model Selection with Limited Labels. AISTATS 2025, PMLR 258, pp. 2035–2043. [4] V. Zouhar, P. Cui, M. Sachan. How to Select Datapoints for Efficient Human Evaluation of NLG Models? TACL 13, pp. 1789 –1811, 2025. 2 つの設計軸の地図( Slide 18 )の関連研究 M. R. Karimi, N. M. Gürel, B. Karlaš, J. Rausch, C. Zhang, A. Krause. Online Active Model Selection for Pre-trained Classifiers. AISTATS 2021, PMLR 130, pp. 307 –315. A. Kumar, B. Raj. Classifier Risk Estimation under Limited Labeling Resources. PAKDD 2018, pp. 3–15. J. Lee, S. Kolla, Y. Chen. Towards optimal model evaluation: enhancing active testing with actively improved estimators. Scientific Reports 14, 10690, 2024. J. Ruan, X. Pu, M. Gao, X. Wan, Y. Zhu. Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling. arXiv:2406.07967, 2024. その他 S. Farquhar, Y. Gal, T. Rainforth. On Statistical Bias in Active Learning: How and When to Fix It. ICLR 2021. ( LURE ) C. Sawade, N. Landwehr, T. Scheffer. Active Comparison of Prediction Models. NeurIPS 2012. ( Slide 11 の比較手法 Sawade ) Y. Chen, S. H. Hassani, A. Karbasi, A. Krause. Sequential Information Maximization: When is Greedy Near-optimal? COLT 2015. A. Kirsch, J. van Amersfoort, Y. Gal. BatchBALD: Efficient and Diverse Batch Acquisition for Deep Bayesian Active Learning. NeurIPS 2019. B. Recht, R. Roelofs, L. Schmidt, V. Shankar. Do ImageNet Classifiers Generalize to ImageNet? ICML 2019. ( ImageNetV2 ) J. Juraska et al. MetricX-23: The Google Submission to the WMT 2023 Metrics Shared Task. WMT 2023. K. Papineni, S. Roukos, T. Ward, W.-J. Zhu. BLEU: a Method for Automatic Evaluation of Machine Translation. ACL 2002. B. Thompson, N. Mathur, D. Deutsch, H. Khayrallah. Improving Statistical Significance in Human Evaluation of Automatic Metrics via Soft Pairwise Accuracy. WMT 2024. ( SPA ) 20