Upgrade to Pro — share decks privately, control downloads, hide ads and more …

AIが出てからのエンジニアの歴史と Contreaのこれまで

AIが出てからのエンジニアの歴史と Contreaのこれまで

Avatar for hirykawa

hirykawa

July 30, 2026

More Decks by hirykawa

Other Decks in Programming

Transcript

  1. ⾃⼰紹介 基本情報 • Contrea株式会社 VPoE/VPoP • X: @hirykawa • 趣味:

    サウナ‧サッカー‧居酒屋 経歴 • 2016 - 2019 医療画像システム 起業 • 2019 - 2022 Yahoo!Japanエンジニア • 2022 - Contrea 現職
  2. エンジニアの関心は「コード生成」から「開発基盤」へ 各時代に本当に熱中していたものを、1本の流れに圧縮する。 コード生成 そのもの コード補完 チャット相談 RAG / ツール接続 IDE統合

    エージェント 委任 権限・評価・ 監査基盤 GPT-3 Copilot ChatGPT LangChain Function calling Cursor Claude Code Devin Codex MCP Evals 結論の伏線 AIはコードを書く速度を上げた。しかし、ソフトウェアを安全に出荷する能力を 自動的には上げなかった。 AI-era engineering history 03
  3. 2020 PHASE 1 GPT-3:few-shotとプロンプト設計 自然言語でモデルの振る舞いを作る、という体験が出た。 ENGINEERS WERE INTO WHAT PEOPLE

    EXPECTED WHAT ACTUALLY HAPPENED 熱中: few-shot prompting、GPT-3デモ、自然 言語UI、APIラッパー 予想: 自然言語が新しいプログラミング・インター フェースになる 答え合わせ: 方向性は当たり。ただし実務開発を変え たのは Copilot、ChatGPT、GPT-4、IDE 統合以降 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 05
  4. 2021 PHASE 2 GitHub Copilot:AI pair programmer AIは「APIに投げるもの」から「 IDEに常駐する補完」へ移った。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: IDE内補完、ボイラープレート削減、テスト 雛形、コメントから関数生成 予想: 退屈なコードは AI、人間は設計・レビュー・ 意図表現へ 答え合わせ: 補完として強い、は当たり。エンジニア置 換は当たっていない 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 06
  5. 2022末 PHASE 3 ChatGPT:相談相手と検証コスト問題 答えを得るコストが下がり、正しさの検証コストが人間に移った。 ENGINEERS WERE INTO WHAT PEOPLE

    EXPECTED WHAT ACTUALLY HAPPENED 熱中: デバッガ、Stack Overflow代替、学習 チューター、 SQL/正規表現生成 予想: 検索・質問の使い方が変わる。ただし “そ れっぽい間違い ”が増える 答え合わせ: 「使う」は定着。「信じる」は定着していな い 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 07
  6. 2023 PHASE 4 Prompt injection / Function calling AIアプリは、チャットではなく「ツール・権限・確認」の設計問題になった。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: Slack bot、社内FAQ、SQL実行、メール作 成、カレンダー連携 予想: LLMアプリはツール呼び出しと権限設計の 問題になる 答え合わせ: tool calling、サンドボックス、ユーザー 確認、監査ログが中心化 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 08
  7. 2023 PHASE 5 RAG / LangChain:社内ChatGPT熱 「全部embedして社内 ChatGPT」が広がったが、ナイーブな RAGでは足りなかった。 ENGINEERS

    WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: PDFチャット、Notion/Confluence検索、ベ クトルDB、embedding、LangChain 予想: RAGで幻覚はかなり解決する。 fine-tuningよりRAGが標準になる 答え合わせ: 標準パターンにはなったが、検索品質・権 限・引用・評価が必要だった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 09
  8. 2023 PHASE 6 AutoGPT / BabyAGI:最初のエージェント熱 「目標だけ渡せば AIが完遂する」は、概念として当たり、実用面では早すぎた。 ENGINEERS WERE

    INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: goal → 計画 → タスク分解 → 検索 → 実 行 → 反省 → 再実行 予想: チャットの次はエージェント。チケット単位で AIに任せられる 答え合わせ: 2023年は未熟。ただし後の Claude Code / Codex的ループに接続した 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 10
  9. 2023 PHASE 7 GPT-4 / Evals:評価駆動 LLM開発 プロンプトの工夫だけでなく、モデル更新に耐える評価セットが必要になった。 ENGINEERS WERE

    INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: コードレビュー、設計相談、リファクタ、テス ト生成、ドキュメント生成 予想: 自然言語が新しいプログラミング言語にな る 答え合わせ: 自然言語は実行言語ではなく、意図・制 約・レビュー観点を渡す上位 IFになった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 11
  10. 2024 PHASE 8 AIネイティブ IDE:context engineering AIの差は、モデル単体ではなく「何を文脈として渡せるか」で決まる。 ENGINEERS WERE INTO

    WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: コードベース理解、複数ファイル編集、テス ト実行、AI用README、ルールファイル 予想: エディタはAIエージェントの操作面になる 答え合わせ: IDE統合、ワークツリー、権限、履歴、レ ビュー UIが生産性を左右 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 12
  11. 2024–2025 PHASE 9 Devin:「AIソフトウェアエンジニア」論争 補完AIから、チケットを渡す “同僚風AI”へ認識が変わった。 ENGINEERS WERE INTO WHAT

    PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: AIにチケットを渡す、ブラウザ /シェル/エ ディタを使わせる、 PRを作らせる 予想: ジュニアの一部タスクは AIに渡せる。非エ ンジニアも実装依頼できる 答え合わせ: 小さく明確でテスト可能なタスクには強 い。置換ではなくレビュー前提 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 13
  12. 2025 PHASE 10 Codex / Copilot coding agent:非同期・並列 PR Pair

    programmingから、issue単位のtask delegationへ移った。 ENGINEERS WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: 並列実装、複数エージェント、 AIのPRレ ビュー、AGENTS.md、テストで拘束する運 用 予想: AIが複数案を出し、人間が選ぶ。ボトル ネックはレビュー能力になる 答え合わせ: 2026年時点で最も現実に近い。 AIが候 補を大量に作り、人間とテストが絞る 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 14
  13. 2025 PHASE 11 Vibe coding:非エンジニアのプロトタイピング 変わったのは「誰が最初の動くものを作れるか」。運用責任はまだ別問題。 ENGINEERS WERE INTO WHAT

    PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: Lovable、Bolt、Replit、v0、自然言語から UI/MVP、創業者のプロトタイピング 予想: 非エンジニアでもプロダクトを作れる。入口 が民主化する 答え合わせ: プロトタイプには強い。本番品質・権限・ 監査・保守にはエンジニアレビューが必 要 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 15
  14. 2024–2026 PHASE 12 MCP:ツール接続標準と文脈インフラ モデル単体ではなく、 context / tool / permission

    / eval layerが差になる。 ENGINEERS WERE INTO WHAT PEOPLE EXPECTED WHAT ACTUALLY HAPPENED 熱中: GitHub、Slack、Drive、Postgres、CI、 Issue、ログ、監視をどう安全に接続するか 予想: AI開発の差は、文脈・権限・評価・監査のレ イヤーで決まる 答え合わせ: RAG、function calling、prompt injection、agent loopが合流し、基盤の 戦いになった 2017 2020 2021 2022 2023 2024 2025 2026 Software 2.0 GPT-3 Prompt Copilot IDE補完 ChatGPT 検証コスト RAG / Agents AI IDE Context Codex / Vibe MCP 基盤化 AI-era engineering history 16
  15. 過去の予想は、どれくらい当たったのか 「当たり」「条件付き」「過大」を分けると、2026年の現在地が見える。 かなり当たった 自然言語が開発 IFになる 補完・小実装は AIが高速化 RAG / tool

    callingが基本形 IDE・CLIにAIが常駐 人間は仕様・文脈・レビューへ寄る 条件付きで当たった RAGで幻覚が解決する 非エンジニアがアプリを作れる AIがジュニアの一部タスクを代替 ただし、本番運用・責任・育成は残る 過大だった AIが短期でエンジニアを不要にする 自然言語だけで本番品質が安定する エージェントが長期タスクを自律完遂 AI導入でチーム生産性が単純に何倍化 最も危険な誤解は「 AIを入れれば、チーム全体のアウトカムも自動で増える」という見方。 AI-era engineering history 17
  16. 現在のボトルネックは「実装速度」ではなく「出荷能力」 AIが候補を大量に作るほど、人間のQA・レビュー・判断の設計が重要になる。 Before AI After AI New bottleneck 人間が 少数の差分を作る

    AIが 大量の候補を作る 選ぶ・直す・ 責任を持つ AIは、コードを書く速度を上げた。 しかし、ソフトウェアを安全に出荷する能力を自動的には上げなかった。 AI-era engineering history 18
  17. 結論 エンジニアの役割は、 実装者から「 AIを含む開発システム」の設計者へ移る。 01 課題を決める AIは手段を増やす。 何を作るべきかは人間側の責任。 02 文脈を設計する

    仕様・規約・ログ・テスト・権限を AIが使える形にする。 03 レビューで出荷する 候補を選び、壊れ方を想像し、 安全に出す仕組みを持つ。 AI時代に強いチームは、速く書くチームではなく、速く学び、速く検証し、責任を持って出荷できるチーム。 AI-era engineering history 19
  18. 2025 – 2026 CONTREA 01 ミニマム専任チーム × 非エンジニアのエンジニア化 新規プロダクトでテスト。少数チームで開発 &ドメインエキスパートをエンジニア化

    TEAM PEOPLE ミニマム専任チーム 非エンジニアのエンジニア化 ・大事なのは兼任せず専属 ・1機能を1人が仕様から出荷まで通す。 ・ペインを感じる人が自ら作る。だから早くて正確 ・「依頼して待つ」から「自分で試して直す」へ。 ・エンジニアは実装より基盤・レビュー・ガードレールへ。 ・エンジニアは最後のレビュアーとして入る。 AI-era engineering history 19
  19. e2e ONLY CONTREA 02 バイブコーディングを現実に:検証を e2eに一点集約 テストを増やすのではなく、減らして固定した。合否の基準だけ人間が持つ。 01 02 意図を書く

    ▶ 自然言語で仕様と受入条件 AIが実装する エージェントに委任して候補を出す 03 ▶ e2eが判定する 画面操作単位のテストだけで合否 04 ▶ 出荷する 通ったものだけリリースに載せる WHY ONLY E2E GUARDRAILS なぜe2eだけに絞ったのか AIに渡す文脈と歯止め ・単体テストは AIが実装ごとに書き換え、守るものが消える。 ・規約・ディレクトリ構成をリポジトリ側に明文化する。 ・非エンジニアが読めるのは「画面の振る舞い」だけ。 ・Q&A Agentが仕様の根拠をコードから返す。 ・仕様=e2eにすると、中身を全部作り直しても安全。 ・本番データ・権限に触る操作は人間の確認を必須にする。 バイブコーディングを成立させたのは、速く書く AIではなく「壊れたら止まる仕組み」。 AI-era engineering history 20
  20. RESULT / ISSUES CONTREA 03 その結果と、いまの課題 組織はハマった。品質は、 e2eが書かれずに陳腐化した。 RESULT NOW

    / ISSUES 組織 いまのボトルネック ・副業1名・業務委託 1名・正社員 2名の4名体制。 ・テストを「書かせる」設計では、資産が維持されなかった。 ・ドメインの回収からリリースまでを最短最速で通す。 ・自然言語テスト × 自動実行が定着するかは検証中。 ・スプリントレビューのサイズ感としてもちょうど良い。 ・e2eで守れない領域(データ整合性・権限・移行・障害対応)は残る。 品質 ・e2eのコードを結局みんなが書かず、陳腐化した。 ・次のトライ:自然言語で書いたテスト項目を Cursor Automationで定期実行し、レ ポート化。 解けたのは「速く作る」。解けていないのは「テストを腐らせない仕組み」。 AI-era engineering history 21