Upgrade to Pro — share decks privately, control downloads, hide ads and more …

機械に任せるテスト、人が見るテスト ⽣成AIで引き直した、運⽤保守フェーズの線引き

機械に任せるテスト、人が見るテスト ⽣成AIで引き直した、運⽤保守フェーズの線引き

2026年9月18日に開催された DevelopersIO 2026 SENDAI で登壇した内容です。
https://classmethod.connpass.com/event/400583/

Avatar for KUSATAKE Daisuke

KUSATAKE Daisuke

September 28, 2026

Other Decks in Programming

Transcript

  1. リリースのたびに、同じ確認を、⼈が 15 案件 2 端末 iOS LINEミニアプリの運⽤保守 iOS / Android

    で毎回検証 Android ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ 毎 リリース 同じ項⽬を、⼈が確認 毎回同じ点検表を、上からなぞる
  2. 確認の⼿順から、保証の設計へ 確認の⼿順 保証の設計 ⼿動テスト項⽬ = ⼈がなぞる⼿順書 何を保証するかの仕様ではない どの層で、何を保証するかを決める = ⼈の仕事

    ◦ 仕様 → 振る舞い → E2E ⽐較的素直に導ける ! ⼿動項⽬ → 単体テストへの割り当て ⾃動では導けない。実⾏コストと網羅性で判断 ! 粒度の⼩さい単体テスト 仕様から⾃然には出てこない。判断が必要 AIは書いてくれる。どこで何を保証するかは、⼈が決める。
  3. 移し替えではなく、引き直し これまで 線引き後 機能 ⼈が⾒る 機械 E2E(正常系操作)+ 単体テスト(網羅) ⾒た⽬ ⼈が⾒る

    機械 VRT(アプリ単位 / コンポーネント単位) 体験 ⼈が⾒る ⼈ 変更に対するユーザー体験 コード化困難 ⼈が⾒る ⼈ LINEアプリ内でのみ動く機能 など テストの妥当性 — ⼈ テストコードそのものの妥当性判断 NEW
  4. 機械に任せたもの E2E VRT ⾒た⽬:間違い探しを、機械が毎回 正常系の操作 ユーザーの操作を通しで確認 − = 単体テスト 網羅的な機能

    small / medium 速く、細かく、全パターン 正本 今回 アプリ単位 + コンポーネント単位(Storybook) ※模式図 差分
  5. 設計は⼈、実装はAI。並列で⾛れるように設計する 使ったツール: Claude Code AI 機能A のテスト ⼈ 保証の設計 AI

    テスト基盤 共通ヘルパー AI 機能B のテスト AI 機能C のテスト AI 機能D のテスト 独⽴した単位で並列に + AIが⾃分で動かして確かめられる環境(Playwright など)を渡すと、⾃律的に直すループが回る ⼈ レビュー 妥当性判断
  6. 2名‧約3週間で、⼿動100% → ⾃動831件 2 設計‧レビュー1 + 実装1 他案件と並⾏ 名 831

    件の⾃動テスト VRT 45 3 週間 10 設計1週 + 実装2週 E2E 73 単体 713 分未満 E2E込みの実⾏時間 直近は5分台 small 383 / medium 311 / component 19
  7. 変わったこと 1 ⼿戻りゼロ 2 機能破壊‧⾒た⽬崩れは、実装中(レビュー前) に⾒つかる 3 ⾒た⽬の正本 状態ごとのスクショが常にリポジトリにある。 VRTはおすすめ

    潜在バグの発⾒ 網羅的にテストするので、顕在化する前に⾒つ かる 4 仕様の棚卸し 「何を保証すべきか」を問い直す場⾯が必ず来 る。薄かった観点が⾒つかる