Upgrade to Pro — share decks privately, control downloads, hide ads and more …

AIが出てからのエンジニアの歴史と Contreaのこれまで

Sponsored · Ship Features Fearlessly Turn features on and off without deploys. Used by thousands of Ruby developers.

AIが出てからのエンジニアの歴史と Contreaのこれまで

Avatar for hirykawa

hirykawa

July 30, 2026

More Decks by hirykawa

Other Decks in Programming

Transcript

  1. ⾃⼰紹介 基本情報 • Contrea株式会社 VPoE/VPoP • X: @hirykawa • 趣味:

    サウナ‧サッカー‧居酒屋 経歴 • 2016 - 2019 医療画像システム 起業 • 2019 - 2022 Yahoo!Japanエンジニア • 2022 - Contrea 現職
  2. エンジニアの関心は「コード生成」から「開発基盤」へ 各時代に本当に熱中していたものを、1本の流れに圧縮する。 コード生成 そのもの コード補完 チャット相談 RAG / ツール接続 IDE統合

    エージェント 委任 権限・評価・ 監査基盤 GPT-3 Copilot ChatGPT LangChain Function calling Cursor Claude Code Devin Codex MCP Evals 結論の伏線 AIはコードを書く速度を上げた。しかし、ソフトウェアを安全に出荷する能力を 自動的には上げなかった。 AI-era engineering history 03
  3. 2020 PHASE 1 GPT-3:few-shotとプロンプト設計 自然言語でモデルの振る舞いを作る、という体験が出た。 ENGINEERS WERE INTO WHAT PEOPLE

    EXPECTED WHAT ACTUALLY HAPPENED 熱中: few-shot prompting、GPT-3デモ、自然 言語UI、APIラッパー 予想: 自然言語が新しいプログラミング・インター フェースになる 答え合わせ: 方向性は当たり。ただし実務開発を変え たのは Copilot、ChatGPT、GPT-4、IDE 統合以降 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 05
  4. 2021 PHASE 2 GitHub Copilot:AI pair programmer AIは「APIに投げるもの」から「 IDEに常駐する補完」へ移った。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: IDE内補完、ボイラープレート削減、テスト 雛形、コメントから関数生成 予想: 退屈なコードは AI、人間は設計・レビュー・ 意図表現へ 答え合わせ: 補完として強い、は当たり。エンジニア置 換は当たっていない 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 06
  5. 2022末 PHASE 3 ChatGPT:相談相手と検証コスト問題 答えを得るコストが下がり、正しさの検証コストが人間に移った。 ENGINEERS WERE INTO WHAT PEOPLE

    EXPECTED WHAT ACTUALLY HAPPENED 熱中: デバッガ、Stack Overflow代替、学習 チューター、 SQL/正規表現生成 予想: 検索・質問の使い方が変わる。ただし “そ れっぽい間違い ”が増える 答え合わせ: 「使う」は定着。「信じる」は定着していな い 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 07
  6. 2023 PHASE 4 Prompt injection / Function calling AIアプリは、チャットではなく「ツール・権限・確認」の設計問題になった。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: Slack bot、社内FAQ、SQL実行、メール作 成、カレンダー連携 予想: LLMアプリはツール呼び出しと権限設計の 問題になる 答え合わせ: tool calling、サンドボックス、ユーザー 確認、監査ログが中心化 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 08
  7. 2023 PHASE 5 RAG / LangChain:社内ChatGPT熱 「全部embedして社内 ChatGPT」が広がったが、ナイーブな RAGでは足りなかった。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: PDFチャット、Notion/Confluence検索、ベ クトルDB、embedding、LangChain 予想: RAGで幻覚はかなり解決する。 fine-tuningよりRAGが標準になる 答え合わせ: 標準パターンにはなったが、検索品質・権 限・引用・評価が必要だった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 09
  8. 2023 PHASE 6 AutoGPT / BabyAGI:最初のエージェント熱 「目標だけ渡せば AIが完遂する」は、概念として当たり、実用面では早すぎた。 ENGINEERS WERE

    INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: goal → 計画 → タスク分解 → 検索 → 実 行 → 反省 → 再実行 予想: チャットの次はエージェント。チケット単位で AIに任せられる 答え合わせ: 2023年は未熟。ただし後の Claude Code / Codex的ループに接続した 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 10
  9. 2023 PHASE 7 GPT-4 / Evals:評価駆動 LLM開発 プロンプトの工夫だけでなく、モデル更新に耐える評価セットが必要になった。 ENGINEERS WERE

    INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: コードレビュー、設計相談、リファクタ、テス ト生成、ドキュメント生成 予想: 自然言語が新しいプログラミング言語にな る 答え合わせ: 自然言語は実行言語ではなく、意図・制 約・レビュー観点を渡す上位 IFになった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 11
  10. 2024 PHASE 8 AIネイティブ IDE:context engineering AIの差は、モデル単体ではなく「何を文脈として渡せるか」で決まる。 ENGINEERS WERE INTO

    WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: コードベース理解、複数ファイル編集、テス ト実行、AI用README、ルールファイル 予想: エディタはAIエージェントの操作面になる 答え合わせ: IDE統合、ワークツリー、権限、履歴、レ ビュー UIが生産性を左右 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 12
  11. 2024–2025 PHASE 9 Devin:「AIソフトウェアエンジニア」論争 補完AIから、チケットを渡す “同僚風AI”へ認識が変わった。 ENGINEERS WERE INTO WHAT

    PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: AIにチケットを渡す、ブラウザ /シェル/エ ディタを使わせる、 PRを作らせる 予想: ジュニアの一部タスクは AIに渡せる。非エ ンジニアも実装依頼できる 答え合わせ: 小さく明確でテスト可能なタスクには強 い。置換ではなくレビュー前提 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 13
  12. 2025 PHASE 10 Codex / Copilot coding agent:非同期・並列 PR Pair

    programmingから、issue単位のtask delegationへ移った。 ENGINEERS WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: 並列実装、複数エージェント、 AIのPRレ ビュー、AGENTS.md、テストで拘束する運 用 予想: AIが複数案を出し、人間が選ぶ。ボトル ネックはレビュー能力になる 答え合わせ: 2026年時点で最も現実に近い。 AIが候 補を大量に作り、人間とテストが絞る 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 14
  13. 2025 PHASE 11 Vibe coding:非エンジニアのプロトタイピング 変わったのは「誰が最初の動くものを作れるか」。運用責任はまだ別問題。 ENGINEERS WERE INTO WHAT

    PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: Lovable、Bolt、Replit、v0、自然言語から UI/MVP、創業者のプロトタイピング 予想: 非エンジニアでもプロダクトを作れる。入口 が民主化する 答え合わせ: プロトタイプには強い。本番品質・権限・ 監査・保守にはエンジニアレビューが必 要 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 15
  14. 2024–2026 PHASE 12 MCP:ツール接続標準と文脈インフラ モデル単体ではなく、 context / tool / permission

    / eval layerが差になる。 ENGINEERS WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: GitHub、Slack、Drive、Postgres、CI、 Issue、ログ、監視をどう安全に接続するか 予想: AI開発の差は、文脈・権限・評価・監査のレ イヤーで決まる 答え合わせ: RAG、function calling、prompt injection、agent loopが合流し、基盤の 戦いになった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 16
  15. 過去の予想は、どれくらい当たったのか 「当たり」「条件付き」「過大」を分けると、2026年の現在地が見える。 かなり当たった 自然言語が開発 IFになる 補完・小実装は AIが高速化 RAG / tool

    callingが基本形 IDE・CLIにAIが常駐 人間は仕様・文脈・レビューへ寄る 条件付きで当たった RAGで幻覚が解決する 非エンジニアがアプリを作れる AIがジュニアの一部タスクを代替 ただし、本番運用・責任・育成は残る 過大だった AIが短期でエンジニアを不要にする 自然言語だけで本番品質が安定する エージェントが長期タスクを自律完遂 AI導入でチーム生産性が単純に何倍化 最も危険な誤解は「 AIを入れれば、チーム全体のアウトカムも自動で増える」という見方。 AI-era engineering history 17
  16. 現在のボトルネックは「実装速度」ではなく「出荷能力」 AIが候補を大量に作るほど、人間のQA・レビュー・判断の設計が重要になる。 Before AI After AI New bottleneck 人間が 少数の差分を作る

    AIが 大量の候補を作る 選ぶ・直す・ 責任を持つ AIは、コードを書く速度を上げた。 しかし、ソフトウェアを安全に出荷する能力を自動的には上げなかった。 AI-era engineering history 18
  17. 結論 エンジニアの役割は、 実装者から「 AIを含む開発システム」の設計者へ移る。 01 課題を決める AIは手段を増やす。 何を作るべきかは人間側の責任。 02 文脈を設計する

    仕様・規約・ログ・テスト・権限を AIが使える形にする。 03 レビューで出荷する 候補を選び、壊れ方を想像し、 安全に出す仕組みを持つ。 AI時代に強いチームは、速く書くチームではなく、速く学び、速く検証し、責任を持って出荷できるチーム。 AI-era engineering history 19
  18. 2025 – 2026 CONTREA 01 ミニマム専任チーム × 非エンジニアのエンジニア化 新規プロダクトでテスト。少数チームで開発 &ドメインエキスパートをエンジニア化

    TEAM PEOPLE ミニマム専任チーム 非エンジニアのエンジニア化 ・大事なのは兼任せず専属 ・1機能を1人が仕様から出荷まで通す。 ・ペインを感じる人が自ら作る。だから早くて正確 ・「依頼して待つ」から「自分で試して直す」へ。 ・エンジニアは実装より基盤・レビュー・ガードレールへ。 ・エンジニアは最後のレビュアーとして入る。 AI-era engineering history 19
  19. e2e ONLY CONTREA 02 バイブコーディングを現実に:検証を e2eに一点集約 テストを増やすのではなく、減らして固定した。合否の基準だけ人間が持つ。 01 02 意図を書く

    ▶ 自然言語で仕様と受入条件 AIが実装する エージェントに委任して候補を出す 03 ▶ e2eが判定する 画面操作単位のテストだけで合否 04 ▶ 出荷する 通ったものだけリリースに載せる WHY ONLY E2E GUARDRAILS なぜe2eだけに絞ったのか AIに渡す文脈と歯止め ・単体テストは AIが実装ごとに書き換え、守るものが消える。 ・規約・ディレクトリ構成をリポジトリ側に明文化する。 ・非エンジニアが読めるのは「画面の振る舞い」だけ。 ・Q&A Agentが仕様の根拠をコードから返す。 ・仕様=e2eにすると、中身を全部作り直しても安全。 ・本番データ・権限に触る操作は人間の確認を必須にする。 バイブコーディングを成立させたのは、速く書く AIではなく「壊れたら止まる仕組み」。 AI-era engineering history 20
  20. RESULT / ISSUES CONTREA 03 その結果と、いまの課題 組織はハマった。品質は、 e2eが書かれずに陳腐化した。 RESULT NOW

    / ISSUES 組織 いまのボトルネック ・副業1名・業務委託 1名・正社員 2名の4名体制。 ・テストを「書かせる」設計では、資産が維持されなかった。 ・ドメインの回収からリリースまでを最短最速で通す。 ・自然言語テスト × 自動実行が定着するかは検証中。 ・スプリントレビューのサイズ感としてもちょうど良い。 ・e2eで守れない領域(データ整合性・権限・移行・障害対応)は残る。 品質 ・e2eのコードを結局みんなが書かず、陳腐化した。 ・次のトライ:自然言語で書いたテスト項目を Cursor Automationで定期実行し、レ ポート化。 解けたのは「速く作る」。解けていないのは「テストを腐らせない仕組み」。 AI-era engineering history 21