Upgrade to Pro — share decks privately, control downloads, hide ads and more …

【AWS AIF対策】モデルの学習とファインチューニング

【AWS AIF対策】モデルの学習とファインチューニング

Avatar for 赤神青空

赤神青空 PRO

October 02, 2026

Video

More Decks by 赤神青空

Other Decks in Programming

Transcript

  1. ▪途中の手順を踏ませると、計算に強くなる 前回のクイズの答えは「B」 前回のクイズ 複数の計算を含む⽂章題を解かせている。 途中の考え⽅を⾶ばして答えだけ出し、 よく間違える。効果がありそうなのは? 「順を追って考えてから答えて」と⾜す ① ペン 120×3

    = 360円 ② ノート 250×2 = 500円 ③ 合計 360+500 = 860円 答えは B 今ココ おさらい A 温度を上げる ばらつきが増えるだけ B 思考の連鎖を使う 途中の⼿順を踏ませる C ネガティブプロンプトを⾜す 「やらないこと」の指定 D 最⼤出⼒トークン数を減らす ⼿順を書く余地がむしろ減る 2/13
  2. ▪事前学習学習は、段階で分けて考える → ファインチューニング → 使う 継続的事前学習 事前学習 ファインチューニング 使う(推論) ⼤量のラベルなしデータ

    ⾔葉の使い⽅を広く覚える 費⽤が⾮常に⼤きい 少量のラベル付きデータ ⽤途に合わせて調整する 費⽤は⼩さい プロンプトで指⽰する RAGで知識を⾜す (第10回‧第11回) 試験ガイドに挙がっている学習の要素は、事前学習‧ファインチューニング‧継続的事前学習‧蒸留の4つ 今ココ 学習の段階 3/13
  3. ▪目的・データ・ラベル・量・費用で並べる 3つの違いは、データで決まる 事前学習 継続的事前学習 ファインチューニング ⽬的 ⾔葉の使い⽅を広く覚える 分野の⾔葉を覚え直す ⽤途に合わせて振る舞いを変える データ

    ⼤量のコーパス 分野のコーパス ⼊⼒と正解の組 ラベル なし なし あり 量 ⾮常に多い 多い 少なくてよい 費⽤ ⾮常に⼤きい ⼤きい ⼩さい 「ラベル付きの正解を⽤意できるか」が、まず効く分かれ⽬ 今ココ 学習の段階 4/13
  4. ▪試験ガイドに挙がっている4つ ファインチューニングの方法 指⽰チューニング ラベルあり 特定分野への適応 ラベルなし 転移学習 別の呼び⽅ 継続的事前学習 ラベルなし

    プロンプトと応答の組を⾒せて、 指⽰に従う形に近づける 学習済みモデルを新しいデータで 学習し直すこと その分野の⽂章を流し込んで、 専⾨⽤語や⾔い回しを覚えさせる 事前学習の続きをやる。 分野への適応と考え⽅は同じ 継続的事前学習は、学習の要素としても、ファインチューニングの⽅法としても挙がっている AWSのドキュメントには「ファインチューニングは転移学習とも呼ばれる」と書かれている 今ココ ファインチューニング 5/13
  5. ▪大きいモデルの知識を、小さいモデルへ 蒸留は、先生が教材を作る ⽤意するのは プロンプトだけ 先⽣モデル (⼤きい) ラベル付きの正解を ⽤意しなくてよい 合成データ 先⽣が作った応答

    正解つきの例を渡すと 先⽣へのお⼿本として使われる ⽣徒モデル (⼩さい)を学習 今ココ ファインチューニング ⼩さく、速く、安い モデルができる 6/13
  6. ▪集めて終わりではない データの準備で見るところ データのキュレーション 使うデータを選んで整える。 重複や誤りを取り除く ラベル付け ⼊⼒と正解の組を作る。 その品質が結果に直結する 今ココ データの準備

    ガバナンス 使ってよいデータか。 個⼈情報や権利を確認する 代表性 実際に来る⼊⼒の幅を カバーできているか 量 多ければよいわけではない。 ⽤途に⾜りる量を⽤意する ⼈のフィードバックを使う RLHF は次のページ 7/13
  7. ▪並べてもらって、その好みを報酬にする RLHF は、人の好みを学習に反映させる モデルが答えを 複数出す ⼈が良い順に 並べる 好みを学習する (報酬モデル) その報酬で

    モデルを調整 ⼈の好みや価値観を、学習に反映させるための⽅法 Bedrock の Reinforcement Fine-tuning も報酬を使うが、 採点するのは⼈ではなく、Lambda のコードか、判定役のモデル 今ココ データの準備 9/13
  8. ▪BedrockAWS では、どこでやるか と SageMaker JumpStart Amazon Bedrock SageMaker JumpStart 教師ありファインチューニング

    指⽰チューニング 強化ファインチューニング 特定分野への適応 モデル蒸留 公開モデルから選ぶ ラベル付きの⼊⼒と正解の組で調整する 報酬で調整する。採点はコードかモデル 先⽣の応答から、⽣徒を学習させる ラベル付きの例で、指⽰に従う形にする ラベルなしの分野の⽂章を流し込む 選んで学習し、⾃分の環境にデプロイ 継続的事前学習は、Bedrock では対応するモデルが限られる。SageMaker AI の Nova 向けレシピでも扱える 今ココ AWSのサービス 10/13
  9. ▪第10回からの流れをまとめて判断する 結局、どれを選ぶか 前提:まずプロンプトの⼯夫を試す(第11回) 答えに必要な情報が、 よく変わる? はい RAG で外から渡す (第10回) はい

    ファインチューニング (指⽰チューニング) いいえ ⼊⼒と正解の組を ⽤意できる? いいえ 分野の⽂章だけあるなら 継続的事前学習∕分野への適応 今ココ 選び方 速く安くしたいだけなら モデル蒸留 11/13