Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
仕事はAIに任せてラスベガスへ行きたいのでDSPyで自分のクローンを作った
Search
そのだ
December 30, 2025
Technology
190
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
仕事はAIに任せてラスベガスへ行きたいのでDSPyで自分のクローンを作った
【connpass】
https://connpass.com/event/372213/
そのだ
December 30, 2025
More Decks by そのだ
See All by そのだ
DGX Sparkを2台使って いろいろ動かす話
sonoda_mj
1
160
Codex Microで 開発体験は変わるのか?
sonoda_mj
1
96
DGX Sparkを2台つないで 最強ローカルLLM環境を動かしてみた話
sonoda_mj
0
240
AGENTS.mdとSkillsで始めるAIエージェント活用
sonoda_mj
3
290
Google_ADKのSub_AgentをAgentic_Workflowに移行し_遷移成功率を改善した話.pdf
sonoda_mj
1
180
ハッカソンから社内プロダクトへ AIエージェント「ko☆shi」開発で学んだ4つの重要要素
sonoda_mj
6
2.8k
RAGの基礎から実践運用まで:AWS BedrockとLangfuseで実現する構築・監視・評価
sonoda_mj
1
2.3k
Amazon Bedrock Knowledge Basesに Data Autometionを導入してみた
sonoda_mj
1
290
Amazon Bedrock Knowledge basesにLangfuse導入してみた
sonoda_mj
2
1.2k
Other Decks in Technology
See All in Technology
ボードゲームの遊び相手をFoundation Modelsで作る / iOSDC Japan 2026
genda
0
240
メルカリにおけるAI時代の高速プロトタイピング基盤「Arca」
ryotarai
18
13k
AIエージェントを安全で速い現場監督にする:Jev・Obsidian・メタハーネス
x5gtrn
PRO
0
140
あなたの知らないAmazon VPC Route Server/Amazon VPC Route Server you don't know about
masakiokuda
0
160
GitHub Agentic Workflows を触ってみる
htkym
2
880
ログラスのマルチプロダクトを 支える認証基盤 〜テナントごとに異なる統制とどう向き合うか〜
dada4386
3
250
CI/CDではもう遅い - 人とAIが迂回しないDevSecOps Verify基盤の再設計 -
kintotechdev
1
460
Harness Engineering on Rails
joelq
0
760
「今盗んで、後で解く」に備える ― AWSのポスト量子暗号入門
yama3133
2
280
Account Factory for Terraformによる 標準化されたアカウント発行の自動化
pensuke628
0
120
20260915deck.gl-raster を使ってみた
rena1208
0
170
20260929_AmazonGuardDutyの検出通知メールにAWS DevOpsAgentの調査結果を追加する
yhana
1
380
Featured
See All Featured
Building a Modern Day E-commerce SEO Strategy
aleyda
45
9.2k
Navigating Algorithm Shifts & AI Overviews - #SMXNext
aleyda
1
1.6k
Google's AI Overviews - The New Search
badams
0
1.6k
YesSQL, Process and Tooling at Scale
rocio
174
15k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
56
3.5k
How to audit for AI Accessibility on your Front & Back End
davetheseo
0
560
SEO Brein meetup: CTRL+C is not how to scale international SEO
lindahogenes
2
2.9k
Deep Space Network (abreviated)
tonyrice
0
350
Building Applications with DynamoDB
mza
96
7.2k
Information Architects: The Missing Link in Design Systems
soysaucechin
1
1.2k
Designing for humans not robots
tammielis
254
26k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2.1k
Transcript
仕事はAIに任せてラスベガスへ行きたいので DSPyで自分のクローンを作った にんにんLT 2025 2025.12.30 そのだ(@sonoda_mj)
自己紹介
自己紹介 苑田 朝彰 普段の業務内容 • AI エージェント開発(Strands Agent, Google ADK)
• 社内AI推進(Agent開発, AI駆動開発) • クラウド(AWS, Google Cloud) 資格 • AWS Community Builders(ML) • 甲賀流忍者検定(中級) 趣味 • 月一で面白いことをするのにハマってます ◦ Spartanレース ◦ 100kmウォーキング ◦ 無人島かくれんぼ ◦ 滝行 SNS • https://x.com/sonoda_mj • https://zenn.dev/tomomj • https://note.com/sonoda_mj Tomotada Sonoda
目次 1. 背景 2. 実際につくてみる 3. まとめ
背景
そのだ、東京でAI Agentをいっぱい作ってます。 生成AIハッカソン 準優勝 AI面接官
そろそろAI Agentに仕事任せられるのでは? 〇〇のタスク よろしく!! そのだ Agent タスク AI Agentが普及した世界は、人間がAgentに指示するだけでタスクが消化され、お金を稼ぐようになる かもしれない。
まかせろり!
そろそろAI Agentに仕事任せられるのでは? 〇〇のタスク よろしく!! そのだ Agent タスク AI Agentが普及した世界は、人間がAgentに指示するだけでタスクが消化され、 お金を稼ぐようになる
かもしれない。 まかせろり!
すなわち
自分のクローンを 作ってしまえば
ラスベガスにいても お金を稼げる
かもしれない
イメージ図 in 東京 in ラスベガス そのだ Agent 指示
イメージ図 in 東京 in ラスベガス そのだ Agent 指示 〇〇のタスク よろしく!!
イメージ図 in 東京 in ラスベガス そのだ Agent 指示 まかせろり!
イメージ図 in 東京 in ラスベガス そのだ Agent 指示
イメージ図 in 東京 in ラスベガス そのだ Agent 指示
イメージ図 in 東京 in ラスベガス そのだ Agent 指示 2倍儲かる!!!
実際に作ってみる
構成図 in 東京 in ラスベガス そのだ Agent 指示
構成図 in 東京 in ラスベガス そのだ Agent 指示
従来のプロンプトチューニング 評価関数 テストデータ ユーザー 評価したい Agent スコア1.0 Input: 入力 Expected
Output: 予期する回答 Input Expected Output Output • モデルを変更した • プロンプトをチューニングした • 精度を上げるために、 Toolを追加・変更した • など • StrandsAgents Eval • DeepEval • ragas • など
DSPyとは 言語モデルをプロンプトではなくコードでプログラミングし、自動的に最適化するフレームワークです。 Signature (入出力を定義する) question -> answer Module - predict
- ChainOfThought - ReAct など ④ Optimizer - BootstrapFewShot - MIPROv2 - GEPA など ② テストデータ ③ 評価関数 ① DSPyプログラム Signature Module DSPyプログラム (最新)
1. 「自分らしさ」とは何だろう プロンプトを最適化するためには、まず「自分らしさ」を定義する必要がある。 そのだのイメージ (異論は認めん) 自分らしさを 抽出 • 口調 •
知識 • 価値観 • 性格 • 感情表現 • 対話スタイル
「自分らしさ」という曖昧なものを、 300件のテストデータで形にする。1時間くらいかかりました(二度とや りたくない)。 2. テストデータを作ってみる • 口調 • 知識 •
価値観 • 性格 • 感情表現 • 対話スタイル テストデータ 作成 300件のテストデータ (各項目50件ずつ) テストデータ
3. 評価関数を作ってみる 人間がみると、正解かどうかすぐわかりますが、 300件全部見るの正直だるいです。なので、 LLMに評 価してもらいました(LLM as a Judge)。 そのだの特徴的な口調・表現が
使われているかを評価 対象フレーズ: 「まかせろり」「せやろ」「ええで」 「クソ」「わからん」「学び」など 含まれていれば2点、なければ0 点で、そもそも質問にない場合は 2点。 回答の簡潔さを評価 (そのだは5-15文字の短い回答 が多い) - 期待の1.5倍以内 → 3点 - 期待の2倍以内 → 2点 - 期待の3倍以内 → 1点 - それ以上 → 0点 Gemini 2.5 Flashを評価者として使用 し、意味の一致とカジュアルさを評価 5点: 意味完全一致、カジュアルな口調 4点: 意味一致、やや丁寧だが許容範囲 3点: 意味ほぼ一致、口調が少し硬い 2点: 意味は合っているが口調が丁寧す ぎる 1点: 意味が部分的に一致 0点: 意味が異なる 特徴的表現のスコア( 0-2点) 長さのスコア( 0-3点) 意味と口調の評価( 0-5点) LLM αs a Judge
4. Optimizerで最適化する 作成した評価器を元に、Optimizer(MIPROv2)で最適化しました。MIPROv2はプロンプト命令と few-shotの例をベイズ最適化で自動的にチューニングします。 プロンプト命令 (ユーザーの具体的なお願い) few-shot (返答の例) ベイズ最適化 最強のプロンプト命令
最強のfew-shot
4. Optimizerで最適化する 作成した評価器を元に、Optimizer(MIPROv2)で最適化しました。MIPROv2はプロンプト命令と few-shotの例をベイズ最適化で自動的にチューニングします。 プロンプト命令 (ユーザーの具体的なお願い) few-shot (返答の例) ベイズ最適化 最強のプロンプト命令
最強のfew-shot ① 命令の候補を作る ② 返答の候補を作る ③ それぞれの候補から 最強の組み合わせを選 ぶ
最適化した結果
デモ
今回初めましての方も多いと思うので 実際に同僚に使ってもらいました。
その結果を共有します。
同僚の感想 お前は苑田じゃない。 誰?? つまらん男 時間の無駄 何なら知ってるんやお前 ゴミアプリ
結論
約30ドル!!! ゴミ作りました!! ←30ドルのゴミ
まだまだラスベガスは 行けなさそうです! ←30ドルのゴミ
まとめ
まとめ 1. テストデータや評価関数をちゃんとしないと、ゴミができる。 2. ラスベガスでの開発はまだダメそう。 3. できるところからAI Agentに任せましょう。
ご清聴ありがとう ございました!!