Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【AWS AIF対策】基盤モデルの評価

【AWS AIF対策】基盤モデルの評価

Avatar for 赤神青空

赤神青空 PRO

October 03, 2026

Video

More Decks by 赤神青空

Other Decks in Programming

Transcript

  1. ▪ラベルがないなら、事前学習の続き 前回のクイズの答えは「B」 前回のクイズ 専⾨⽤語の多い分野に慣れさせたい。 ラベルのない社内⽂書は⼤量にあるが、 ⼊⼒と正解の組は⽤意できない。 ラベルのない ⽂章が⼤量 継続的事前学習 ∕分野への適応

    ⼊⼒と正解 の組 指⽰チューニング 答えは B 今ココ おさらい A 指⽰チューニング ラベル付きの組が要る B 継続的事前学習 ラベルなしの⽂章を流し込む C プロンプトキャッシュ 料⾦と待ち時間を減らす仕組み D 温度を下げる 出⼒のばらつきの設定 2/13
  2. ▪モデル単体・アプリ全体・ビジネスの成果 評価は、3つの層で考える モデル単体 ROUGE‧BERTScore‧判定モデル アプリ全体 検索の精度‧ツールの選び⽅ ビジネスの成果 タスク完了率‧満⾜度‧コスト 出てきた⽂章の良し悪しを測る RAG

    やエージェントとして、ちゃんと動くか ⼊れてよかったのかを、業務の数字で⾒る 下に⾏くほど、測るのが難しいが、最後に効いてくる 今ココ 評価の全体像 3/13
  3. ▪モデルの評価と、RAG Bedrockの評価の2本立て の評価機能の地図 Amazon Bedrock Evaluations モデルの評価 ⾃動(プログラム) 決まった指標で 測る

    ⼈による評価 ⼈が⾒て 採点する RAG の評価 判定モデル 別のモデルが 採点する 検索だけ 取ってこられたかを測る 検索+⽣成 答えまで含めて測る 試験ガイドの「Amazon Bedrock Model Evaluation」は、左側のこと どれも⾃分で⽤意したデータセットを渡す。組み込みのデータセットを選べるのは⾃動評価だけ 今ココ 評価の全体像 4/13
  4. ▪タスクの種類ごとに、指標が用意されている 自動評価は、測れるものが決まっている 正確さ 頑健さ 有害性 ⽂章の⽣成 実世界の知識スコア 単語誤り率 有害性 要約

    BERTScore BERTScore の差分 有害性 質問応答 F F の差分 有害性 分類 正解率 正解率の差分 — ROUGE と BLEU は、Bedrock の⾃動評価では選べない 指標としては試験ガイドに挙がっている。次のページで別に⾒る 今ココ モデルの評価 5/13
  5. ▪LLM-as-a-judge。理由まで返してくれる 判定モデルに採点させる 評価される モデル プロンプトの データセット 応答 ビルトインの指標(全11種) 正確さ 論理の⼀貫性

    有害性 今ココ モデルの評価 網羅性 関連性 ステレオタイプ 忠実さ 指⽰への追従 回答拒否 有⽤性 ⽂体 +⾃作もできる 判定モデル (別のモデル) 点数と、 そう付けた理由 採点する側と、採点される側は別のモデル 6/13
  6. ▪試験の範囲としては押さえる。ただし注意がある 人による評価 できること 注意するところ ⾃分の従業員や、分野の専⾨家に 採点してもらえる 作業チームは SageMaker Ground Truth

    が 管理するプライベートワークフォース 評価の基準と、作業者への指⽰を ⾃分で決められる その Ground Truth は、新規のお客様への 提供が終了している AWS に評価者の⼿配ごと任せる形もある (別途 AWS への相談が必要) 試験の範囲としては押さえる。⼿を動かすなら ⾃動評価か判定モデルから ⼈にしか測れないものはあるが、いま新しく始められるかは別の話 今ココ モデルの評価 7/13
  7. ▪言葉の重なりで測るか、意味の近さで測るか ROUGE・BLEU・BERTScore ROUGE ⾔葉の重なり BLEU ⾔葉の重なり BERTScore ⽣成⽂と正解⽂で、単語の並びが どれだけ重なるかを⾒る 同じく重なりを⾒る。

    もともとは翻訳の評価から ⽂を意味のベクトルにして、 近さで測る 要約の評価によく使う Bedrock の⾃動評価では選べない 試験ガイドには載っている Bedrock の⾃動評価では選べない ⾔い回しが違ってもよい Bedrock の⾃動評価で選べる 意味の近さ ⾔い回しを変える要約や書き換えでは、単語の重なりだけだと低く出てしまう Bedrock の⾃動評価では、要約は BERTScore、質問応答は F で正確さを測る 今ココ 指標 8/13
  8. ▪どこで失敗しているかが分かる RAG は、検索と生成を分けて測る 検索だけ(retrieve-only) 取ってこられたかを測る。指標は2つ Context Relevance 取ってきた資料が、質問に関係しているか Context Coverage

    必要な情報を取りこぼしていないか(正解データが要る) 検索+⽣成(retrieve-and-generate) 答えまで含めて測る。指標は10種 Faithfulness 取ってきた資料から外れていないか Correctness / Completeness 答えが正しいか、漏れがないか Citation Precision / Coverage 引⽤が正しいか、引⽤漏れがないか 「拾えていない」のか「拾えているのに外れた答えを書く」のかを、分けて測れる 今ココ アプリの評価 9/13
  9. ▪AgentCoreエージェントは、評価と観測が別 Evaluations と Observability AgentCore Evaluations AgentCore Observability 応答の質‧安全性‧タスクの完了‧ ツールの選び⽅などを測る

    実⾏の経路と、途中の出⼒を⾒る ビルトインの採点は判定モデル。 カスタムはコードでも書ける 遅延‧トークン数‧エラー率を⾒る 本番のやり取りを継続的に採点する形と、 開発やCIで都度まわす形がある 問題の切り分けに使う。 採点はしない 良し悪しを採点する 何が起きたかを記録する 評価は「良し悪しの採点」、観測は「何が起きたかの記録」。役割が違う 今ココ アプリの評価 10/13
  10. ▪4つの経路を揃えるのが最低ライン 最後はビジネスの指標で見る ⾃動の品質指標 Bedrock の評価機能で、 決まった指標を継続して測る ⾏動から読み取れるもの 途中でやめた、⼈に代わった、 やり直した、の回数 利⽤者の明⽰的な評価

    役に⽴った∕⽴たなかった、 のボタンやコメント ビジネスの成果 コンバージョン率‧解決までの時間‧ 顧客満⾜度 どれか1つでは⾒落とす。4つ揃えるのが最低ライン、というのが AWS の整理 Well-Architected のエージェント向けレンズより。試験ガイドは「タスク完了率‧ユーザー満⾜度‧1回あたりのコスト」 今ココ ビジネスの評価 11/13
  11. ▪クイズの前に、持ち帰ってほしいことを振り返る 今回のまとめ 評価は3つの層で考える モデル単体‧アプリ全体‧ビジネスの成果 Bedrock の評価はモデルとRAGの2本⽴て モデル側は⾃動‧⼈による‧判定モデルの3種 Evaluations Bedrock の⾃動評価に

    ROUGE と BLEU はない 要約は BERTScore、質問応答は F で正確さを測る RAGは検索と⽣成を分けて測る Faithfulness エージェントは評価と観測が別 AgentCore 検索だけなら2指標、検索+⽣成なら10指標 採点は AgentCore Evaluations、記録は Observability 今ココ おわりに 12/13