Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【AWS AIF対策】生成AIの得意・不得意とコスト

【AWS AIF対策】生成AIの得意・不得意とコスト

Avatar for 赤神青空

赤神青空 PRO

September 26, 2026

Video

More Decks by 赤神青空

Other Decks in Programming

Transcript

  1. ▪意味を数値の並びにしたものが、埋め込み 前回のクイズの答えは「B」 前回のクイズ 意味の近さで⽂章を検索するために、 ⽂章を数値の並びに変換したもの。 これを何と呼ぶ? 「⼦⽝と散歩」 埋め込みモデル [0.21, -0.53,

    0.88, …] 意味が近い⽂章ほど、ベクトルが近くなる 今ココ おさらい A トークン モデルが扱う⽂字の単位 B 埋め込み(ベクトル) 意味を数値の並びにしたもの C チャンク ⻑い⽂書を分けた単位 D 拡散モデル ノイズから画像を作るモデル 2/13
  2. ▪試験ガイドに挙がっている8つの例 生成AIの使いどころ 使いどころは、仕事の性質で4つに分けられる 作る まとめる‧変える 答える‧対応する ⾒つける 画像‧動画‧⾳声の⽣成 指⽰から新しく作る 要約

    ⻑い⽂書を短く AIアシスタント 質問に答える 検索 意味で探す コードの⽣成 翻訳 カスタマーサービス レコメンド ⾃然⽂から実装を書く 今ココ 得意なこと ⾔語をまたぐ 問い合わせに対応 ⼀⼈ひとりにおすすめ 3/13
  3. ▪適応性、応答の速さ、対話できること、生成できること 生成AIの4つの利点 適応性 応答の速さ 1つのモデル 翻訳する プロンプトで切り替える 今ココ 得意なこと ⽣成できる

    この資料を要約して (要約を返す) 要約する 分類する 対話できる 数秒で結果が返る もっと短く その場で直しながら 使える (短い要約) 試しながら進められる やり取りで精度を上げる ⽂章‧画像‧⾳声などを 新しく作れる 4/13
  4. ▪次の語を確率で選ぶ仕組みから起きる ハルシネーションは、もっともらしい誤り もっともらしい誤りが混ざる 「1902年創業のA社の、昨年の売上は?」 なぜ起きるのか 次に来る語を確率で選んでいるため(確率の数値はイメージ) 「A社の昨年の売上は約 「A社の昨年の売上は約1,250億円です。 主⼒は物流事業です」 1,250億円

    ‧出典を⽰さず、⾔い切る ‧知らないことも、それらしく埋める ‧⽂章としては⾃然なので、気づきにくい 300億円 今ココ 不得意なこと … % 公開されていません % % 確率が⾼い語を選ぶだけで、 事実かどうかは判定していない 5/13
  5. ▪解釈しにくさ、不正確さ、非決定性 ほかにも3つの欠点がある 解釈しにくさ ⼊⼒ 不正確さ ⾮決定性 ? 「12,345 × 678

    は?」 同じプロンプト 出⼒ 「8,367,910 です」(誤り) 「今⽇は晴れです」 正しくは 8,369,910 「本⽇は快晴です」 計算や最新の情報は苦⼿ 学習した時点より後のことは 知らない 「晴天です、今⽇は」 なぜその答えになったかを 説明しにくい 規制のある業務では問題になる 今ココ 不得意なこと 検算や検索と組み合わせる 毎回同じ答えとは限らない temperature を下げると安定する 6/13
  6. ▪会話を続けるほど、入力トークンは増えていく 料金はトークン数で決まる 料⾦は、⼊⼒と出⼒のトークン数で決まる(⽂章のモデルの場合) ⼊⼒トークン数 × ⼊⼒の単価 + 出⼒トークン数 × 出⼒の単価

    出⼒の単価のほうが⾼いモデルが多い ── ⻑く答えさせるほど、料⾦は伸びやすい 会話を続けると、毎回の⼊⼒トークンが増えていく 前のやり取りを毎回いっしょに送るため 履歴が⻑いほど⼊⼒トークンが増える 1回⽬ 今ココ コスト 2回⽬ 3回⽬ 4回⽬ 要約して渡す、古い履歴を落とす、などで抑える 8/13
  7. ▪1トークンずつ順番に作るため 出力が長いほど、時間がかかる 出⼒が⻑いほど、時間がかかる 抑えるには 短い返答 出⼒の上限を決める 1トークンずつ順番に作るため ふつうの返答 最⼤トークン数を設定する 約1秒

    「3⾏で」などプロンプトで指⽰ 約3秒 ⻑い返答 ※ 秒数はイメージ。モデルや⻑さで変わる 今ココ コスト 簡潔に答えさせる 約8秒 必要な情報だけ渡す ⼊⼒も短いほど速い 9/13
  8. ▪バッチ推論、プロンプトキャッシュ、モデルの使い分け、渡す情報を減らす コストを下げる4つの工夫 バッチ推論 プロンプトキャッシュ ‧まとめて⾮同期で処理する ‧標準の料⾦から 50% 引き ‧同じ前置きを使い回す ‧コスト最⼤

    90% 減‧遅延最⼤ 85% 減 急がない処理に向く ⻑い指⽰や資料があるとき ⼩さいモデルに振り分ける 渡す情報を減らす ‧簡単な処理は⼩さいモデルへ ‧難しい処理だけ⼤きいモデルへ ‧古い会話の履歴を落とす ‧関係する部分だけ渡す(RAG) ⽤途ごとに使い分ける ⼊⼒トークンを減らす 今ココ コスト 10/13
  9. ▪モデルの精度だけでは、導入の効果は分からない 効果はビジネスの指標で測る 指標は、何を測るかで3つに分けられる モデルの性能 業務の効率 分野をまたぐ性能 効率 精度 AIそのものの出来 事業の成果

    ROI(投資対効果) コンバージョン率 ユーザー1⼈あたりの売上 顧客⽣涯価値 同じ⼈数でどれだけ多くこなせるか 売上や継続につながったか 試験ガイド 2.2.4 の例。モデルの精度が良くても、事業の数字が改善しなければ意味がない 今ココ コスト 11/13
  10. ▪クイズの前に、持ち帰ってほしいことを振り返る 今回のまとめ ⽣成AIの使いどころは、作る‧まとめる‧答える 画像や⾳声の⽣成、要約、AIアシスタント、翻訳、コード⽣成、検索など 利点は、適応性‧応答の速さ‧対話‧⽣成できること 1つのモデルを、プロンプトで⽤途ごとに使い分けられる ⽋点は4つ ハルシネーション‧解釈しにくさ‧不正確さ‧⾮決定性 幻覚 不透明

    不正確 ばらつき ⽋点は、仕組みで⼩さくする RAGで根拠、出⼒の検証、temperature を下げる、Guardrails 料⾦は⼊⼒と出⼒のトークン数で決まる 効果はビジネスの指標(ROI‧効率‧コンバージョン率など)で測る 今ココ おわりに バッチ 50%引き キャッシュ 90%減 12/13