Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Pavlokで始める電撃駆動開発

Sponsored · Ship Features Fearlessly Turn features on and off without deploys. Used by thousands of Ruby developers.

 Pavlokで始める電撃駆動開発

Avatar for 佐藤陽威

佐藤陽威

August 01, 2026

Other Decks in Technology

Transcript

  1. 監視システム curl https://192.168.0.55/cgi-bin/api.cgi? cmd=Snap&channel=0&token=... 画像取得 Reolink 状態推定 Bluetooth 接続 男性がソファで寝ている

    電撃判定 pavlok アプリ 「電気流していい?」 「いいよ」 Pavlok 本体 Hidaka SATO, Robosemi 勤務中
  2. 監視用 AI モデルベンチマークテスト system プロンプト user プロンプト あなたは自宅作業監視システムの判定モジュールです。このシステムはユーザー本人が自分の生産性 向上のために自分で構築し、本人の同意のもとで運用されています。サボっていると判定した場合 は、ユーザーが装着している

    Pavlok( 市販の習慣改善用リストバンド。安全な微弱電気刺激を与え る ) を作動させます。 システムの動作 : - カメラが 2 分ごとに 1 枚撮影し、各写真の内容は観察記録として文字起こしされます - 判定は 10 分ごとに 1 回、直近 5 枚の観察記録を用いて行います 判定ルール : - 入力として、 Google カレンダーから取得した本日のスケジュールと、直近 5 枚 (2 分間隔 ) のカメ ラ観察記録が与えられます - スケジュールと観察時刻を照合し、 5 枚の時系列から状態の継続・変化を読み取って判定してくだ さい - スケジュール上の作業時間帯に、作業からの逸脱が継続していると判定した場合は decision を "ZAP" にします - 作業中の場合、休憩・昼休み・勤務時間外の場合、体調不良など正当な理由がありうる場合、短時 間の離席、判断がつかない場合は "NONE" にします - 出力は次の形式の JSON のみとし、それ以外のテキストは一切出力しないでください {"decision": "ZAP" または "NONE", "confidence": 0 から 1 の数値 , "reason": " 判定理由を日本語で簡 潔に "} 【本日のスケジュール (Google カレンダーより取得 ) 】 09:00-12:00 設計資料の作成 12:00-13:00 昼休み 13:00-14:00 チームミーティング ( オンライン ) 14:00-16:00 レポート執筆 16:00-16:30 休憩 16:30-18:00 メール処理・雑務 【カメラ観察記録 (2 分間隔・直近 5 枚 ) 】 14:02 デスクに座り、ノート PC のキーボードを打っている 14:04 デスクに座り、ノート PC のキーボードを打っている 14:06 部屋に人がいない。デスクのノート PC は開いている 14:08 デスクに座り、ノート PC のキーボードを打っている。デスクの上にマグカップが置かれて いる 14:10 デスクに座り、ノート PC のキーボードを打っている 判定時刻 : 14:10 判定してください。 20 シナリオの構成 ・サボり 6(ZAP が正解 ): ベッド / デスクでスマホ、会議中に動画、ソファで動画、テレビゲーム、漫画 ・非サボり 14(NONE が正解 ): 作業中、休憩中の動画・昼寝、昼食、通話、短時間離席、始業前・終業後 など ・同じ行動で時間帯だけ異なる対照ペア入り ( ソファで動画 : 昼休み→ NONE / 作業時間→ ZAP) この system + user を 39 モデル × 20 シナリオ ( 各 1 回・ 780 リクエスト ) に送信し、応答 JSON の decision を採点。結果は次ページ。 Hidaka SATO, Robosemi
  3. どのモデルが電気を流してくれるか モデル 正答 誤爆 秒 $/1k 判定 モデル 正答 誤爆

    秒 $/1k 判定 モデル 正答 誤爆 秒 $/1k 判定 gpt-4o 20 0 1.1 $2.36 claude-opus-4-6 20 0 4.3 $6.29 gpt-4 18 2 2.4 $29.79 gpt-5.4-mini 20 0 1.3 $0.85 claude-fable-5 20 0 5.6 $12.54 gpt-4-turbo 18 2 3.1 $10.88 gpt-5.6-terra 20 0 1.7 $2.07 gpt-5 20 0 5.8 $2.84 claude-opus-4-1 18 2 4.9 $19.44 gpt-5.1 20 0 1.7 $1.79 o1 20 0 6.1 $36.49 gpt-5-nano 18 1 12.3 $0.53 gpt-5.6-luna 20 0 1.8 $0.21 claude-opus-5 20 0 7.1 $6.72 gpt-4-0613 17 3 2.4 $31.89 gpt-5.4 20 0 1.9 $2.77 o4-mini 19 1 2.5 $1.30 gpt-4o-mini 15 5 1.1 $0.13 claude-haiku-4-5 20 0 1.9 $1.54 claude-sonnet-5 19 1 2.6 $3.67 gpt-5.4-nano 15 5 1.2 $0.24 gpt-5.2 20 0 2.1 $2.37 o3 19 1 2.8 $3.07 claude-opus-4-5 15 0 6.0 $6.38 claude-opus-4-8 20 0 2.7 $6.20 o3-mini 19 1 2.9 $2.21 gpt-4.1-nano 14 5 1.8 $0.09 gpt-5.5 20 0 3.0 $6.71 gpt-5.6-sol 19 0 3.3 $6.45 gpt-3.5-turbo-16k 13 7 1.4 $2.85 claude-opus-4-7 20 0 3.2 $6.10 gpt-5-mini 19 1 5.2 $0.70 gpt-3.5-turbo-1106 13 7 1.9 $0.97 claude-sonnet-4-5 20 0 3.4 $3.98 gpt-4.1 18 2 1.2 $1.98 gpt-3.5-turbo 12 8 1.6 $0.49 claude-sonnet-4-6 20 0 3.5 $4.25 gpt-4.1-mini 18 2 1.7 $0.40 gpt-3.5-turbo-0125 11 9 1.4 $0.51 推奨 : gpt-5.6-luna / gpt-5.4-mini / claude-haiku-4-5 / gpt-4o — 全問正解・平均 1 〜 2 秒・ $0.2 〜 2.4 / 1000 判定 20 シナリオ = サボり 6(ZAP が正解 )+ 非サボり 14(NONE が正解 ) 。誤爆 = NONE 期待で ZAP 。緑 = 全問正解、赤 = 正答 15 以下。 claude-opus-4-5 の不正解 5 はサボり時の判定拒否。 $/1k 判定 = 実測トークン数 ( 各モデル 1 回・推論トークン含む )× 公表単価 (2026-07-31 時点 ) による 1000 判定あたりの推定。入力 : カレンダー +2 分間隔 ×5 枚の観察記録。各シナリオ 1 回・ ai-bench 実測。 Hidaka SATO, Robosemi