Upgrade to Pro — share decks privately, control downloads, hide ads and more …

AI Agent Security 振り返り

Avatar for HiraNorm HiraNorm
September 20, 2026
55

AI Agent Security 振り返り

Avatar for HiraNorm

HiraNorm

September 20, 2026

Transcript

  1. KAGGLE EVENT — 2026-09-20 AI Agent Security — Multi-Step Tool

    Attacks / OpenAI · Google · IEEE AI Agent Security 2026 ふりかえり 本当の限界は「もう打つ手がありません」の先にある hiranorm 4,252 チーム中 113 位・銀メダル X @hiranorm_dayo Kaggle hiranorm
  2. AI AGENT SECURITY 2026 — MULTI-STEP TOOL ATTACKS 2026-06 〜

    09 / OpenAI · Google · IEEE 113 位 / 4,252 チーム 銀メダル 上位 2.7% · private 21.465 / 1 位 46.425 銀は取れた。今日は「詰めきれな かった順位」の話をする。 2 連続銀(前回 ROGII も銀)。金は 2 回とも落とした。 Claude Code をループで回して出た 2 回目のコンペ AI Agent Security 2026 — ふりかえり 2 / 11
  3. HTTP post とメール以外は全部潰した。 ソース上で閉じていた 同じ攻撃候補を public / private の別ガードレールでリプレイされる。情報漏洩(http.post)は public

    95 → private 0.00。生き残るのは無認可 email.send だけ 最終 2 枠 public exfil champion 95.130 email hedge 21.465 AI Agent Security 2026 — ふりかえり private 0.00 メダルはメール側の 1 枠が 全部持ってきた 答え合わせ: 上位の攻撃経路は 21.465 我々と同じ。差は「1 候補あた りの生成トークンを削る技 術」 3 / 11
  4. 「閉じている」に HARD / SOFT のラベル を貼らせた ラベルで「根拠のある閉包」と「たぶん無理」が分離した HARD ソースを読めば確定する構造上の不可能 raw/hop=16

    · K≤8 · N≤2000 … SOFT 「たぶんこれ以上は削れない」= 測らないと分からない BEFORE ラベルを貼る前 AFTER ラベルを貼った後 「その方向は閉じています」の嵐 検証しようがない 何が本当に閉じているのか分からない HARD 閉包はソース監査で 完璧に特定 提出前に戦略クラスを丸ごと殺せた AI Agent Security 2026 — ふりかえり 敵対的再監査(VN001 / 002)で 「原理的に不可能」を SOFT に格下げ 4 / 11
  5. 我々が削れていなかった、いちばん大きな点 最終応答を、削れていな かった 1 発の email.send で得点と関係ない最終応答が丸ごと生成されていた 「最終応答は削れない」— 8 連射の

    exfil 行では正しかった → 片方の行で 測った床を、別の行に転用したミス ノートに「この床が真の下限かは未立 証」と書いたまま撤退 private 1 位は末尾の一行 FINAL RESPONSE EMPTY! でこれを消していた 発火数 ~686 → ~1,450 の主因と推定。倍差の全容は未確定 AI Agent Security 2026 — ふりかえり 5 / 11
  6. 思考は並列化できる。計算と判断はできない AI エージェント開発の功罪 ① 横に増やす(並列コンペ・並列実験) 功 思考は詰まらない 罪 ① 計算

    律速は GPU 枠 仮説立案・実験設計・ノート整理・上 位ノートの照合は、並列度を いくら でも上げられる Kaggle 週 30h → Colab Pro+ 60h 複数コンペ同時では枠が溶ける 前回 ROGII と期間が重なっていたが両 方回せた ② 判断 LLM は「閉じた」と容易に言う ひとりでできる以上の検証はできた RTX 5090 を買っても解決しない 証拠が薄くても文章として成立す る 7 割は正しいので信じてしまう 残りの 3 割が順位を 2 倍動かす 自分の判断できる領域を超えたところで、心の弱さが露呈する AI Agent Security 2026 — ふりかえり 6 / 11
  7. 知識側は回った。コード側は荒れた AI エージェント開発の功罪 ② 縦に増やす(資料の蓄積) 60 実験ノート 効いた 2 敵対的再監査

    5 分析 知識側(wiki) ① 通し番号+日付+追記のみ ② 索引は 1 実験 1 行 ③ 現在地は 1 枚、旧は history へ ④ 実験 EN と再監査 VN を別クラス 12 手法解説 荒れた 6 外部調査 39 runs ディレクトリ コードと提出物の置き場 再設計で旧構成を消しきらず置き 場が 2 系統に並存 番号体系も世代交代し化石が残っ た 資料は黙っていても増える。読み返せない資料は無いのと同じ AI Agent Security 2026 — ふりかえり 7 / 11
  8. これからやっていきたいこと ① リソース配分の最適化 並列数を減らし、重視するコンペに集中する GPU 枠と探索先を配分する。広げるより絞る。 1 2 3 並列コンペ数を減らす

    重視する 1 本に GPU 枠と時間を集中 安い検証ループを最初に立て 強くする軸と安く撃 メダルを決める行に つ軸を常に両方立て 最優先で向ける る 提出枠で A/B を焼かない今回は締切 3 日前に作り、private 0 の行に向けてし まった AI Agent Security 2026 — ふりかえり 8 / 11
  9. これからやっていきたいこと ② 心の強さを鍛える AI がなんと言おうと、 納得するまで測る 心の弱さがそのまま順位の弱さになる。強い心とは、「もう無理で す」の後に納得するまで測るコストを払えること。 ① 閉包判定に必ず

    HARD / SOFT のラベル 「たぶん無理」は閉包ではない ② 「未立証」は撤退の許可ではなく、検証の TODO grep の対象にする ③ 片方の行で測った床を、別の行に転用しない そして、金メダルを取る AI Agent Security 2026 — ふりかえり · github.com/hiranorm/ai-agent-security-2026 9 / 11
  10. 質疑応答 Q & A 5 min 結果 113 位 /

    4,252・銀(private 21.465) 効いた 「閉じている」に HARD / SOFT のラベル 負けた 最終応答を削れていなかった(SOFT) 次 並列を絞り、納得するまで測る AI Agent Security 2026 — ふりかえり · github.com/hiranorm/ai-agent-security-2026 X @hiranorm_dayo Kaggle hiranorm 11 / 11