Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Microsoft AI の変遷 - 完全版 同行ピッチ — モデル・トークン経済・プロダクト...

Avatar for Daiki Kanemitsu Daiki Kanemitsu
August 16, 2026
84

Microsoft AI の変遷 - 完全版 同行ピッチ — モデル・トークン経済・プロダクト ROI

最近の Microsoft AIの取り組みまとめ

Avatar for Daiki Kanemitsu

Daiki Kanemitsu

August 16, 2026

More Decks by Daiki Kanemitsu

Transcript

  1. MICROSOFT AI · MAI SUPERINTELLIGENCE TEAM Microsoft AI の変遷 完全版

    同行ピッチ — モデル・トークン経済・プロダクト ROI The hill-climbing machine: from tokenmaxxing to token efficiency 2026年8月15日
  2. EXECUTIVE SUMMARY エグゼクティブ・サマリー 01 モデル単体の競争は終わった 02 3ヶ月で12モデル超を出荷 03 GPUコストを50〜90%削減 04

    自前モデル化=レジリエンス 05 シリコン共設計まで垂直統合 MAI の勝ち筋は「モデル×ハーネス×RLE」の共最適化。Suleyman は 7/29 に「Tokenmaxxing has been the story of the last few months, but token efficiency is the next big focus」と宣言した Build 2026(6/2)で7モデル同時発表、その後 Image-2.5-Pro / Voice-2-Flash / Image-2.6 / Thinking-1 / Cyber-1-Flash / Code-1.1-Flash を連続投入。四半期で「a dozen 超」(Satya Q4 決算) PowerPoint で最大 84%、Dynamics 365 Contact Center で最大 89%、MDASH で 50% のコスト削減を実測値として公表。品質は維持または向上 「Every model in a product or agentic system should be substitutable」。単一モデル依存のリスク(セキュリティ・商流・地政学)を構造的に排除する経営判断 Maia 200 上で MAI モデルを動かすと 40% 高い性能/W(Build時点では 1.4x)。モデル・ハーネス・RLE・シリコンの全層を自社で握る Sources: microsoft.ai/news 2026-06-02 / 07-23 / 07-29 / 08-10 / 08-11 / 08-12 / 08-13 2
  3. CONTENTS 本書の構成 PART 1 PART 2 PART 3 PART 4

    PART 5 PART 6 PART 7 PART 8 この3ヶ月に何が起きたか Build 2026 から 2026年8月まで/数字で見るインパクト Microsoft AI という組織 MAI Superintelligence Team / Humanist Superintelligence / 6つのバリュー モデルの変遷 MAI-1-preview から MAI-Thinking-1 まで/全モデル一覧と命名規則 最新モデルの技術詳細 Thinking-1 / Code-1・1.1-Flash / Cyber-1-Flash / Image / Voice / Transcribe トークン経済 コスト曲線・コンテキスト長・原価構造・オーケストレーション プロダクト影響と ROI GitHub Copilot / Excel / PowerPoint / OneDrive / D365 / Health Microsoft Reactor 解説の統合 動画トランスクリプトによる一次情報の織り込み 総括 示唆・リスク・確認すべきこと 3
  4. RELEASE TIMELINE — 2026.06.02 → 2026.08.13 直近3ヶ月のリリース年表 06.02 07.09 07.23

    07.23 07.29 08.10 08.11 08.12 08.13 Microsoft Build 2026 — 7モデル同時発表 MAI-Thinking-1 / MAI-Code-1-Flash / MAI-Image-2.5 + 2.5-Flash / MAI-Transcribe-1.5 / MAI-Voice-2 + 2-Flash。Frontier Tuning と Mayo Clinic 提携も同時発表。 Ode Poetry — MAI 音声モデルの実装事例 William Sieghart の声を短尺サンプルから再現。MAI-Transcribe-1.5 は FLEURS で WER 4.86%(2026年7月時点で最小)。 Hill-climbing MAI models for GitHub Copilot and Excel MAI-Code-1-Flash のチェックポイントを Excel RL 環境で追加学習。Excel で GPT-5.6 と同等品質を低コストで実現。 MAI-Image-2.5-Pro / MAI-Voice-2-Flash 公開プレビュー Pro は最高忠実度($106/1M image output)。Voice-2-Flash は 2倍速・32%安($15/1M characters)。 Optimizing the frontier performance curve(Suleyman) Q4決算に合わせた戦略ステートメント。「四半期で12モデル超を出荷」「多くのケースで GPU コストを50〜90%削減」。 MAI-Image-2.6 — Arena text-to-image 2位 2.5 比 +79 Elo、テキスト描画は +91 Elo。Meta・Google・xAI を上回る。 MAI-Code-1.1-Flash — 1/4のコスト Terminal-Bench 2.1 +22%、.NET +15%、トークン25%削減・25%高速、価格は1.0の1/4。 MAI-Thinking-1 — Foundry パブリックプレビュー 35B active / 約1T total の Sparse MoE、256k コンテキスト。AIME 2025 で 97.0%。 MAI-Cyber-1-Flash inside MDASH CyberGym any-crash 96%、Mythos を12ppts 上回り、コストは50%。Perception(エージェント型セキュリティ)も同時発表。 Sources: microsoft.ai/news 2026-06-02 / 07-09 / 07-23 ×2 / 07-29 / 08-10 / 08-11 / 08-12 / 08-13 5
  5. THE NUMBERS THAT MATTER 数字で見るインパクト 50–90% 96% 84% 89% GPU

    COST SAVED CYBERGYM ANY -CRASH POWERPOINT GPU COST DYNAMICS 365 GPU COST 自社MAIモデル置換による GPU コスト削減幅 MDASH × MAI-Cyber-1-Flash。Mythos を PowerPoint の image-to-image を GPT- Contact Center を MAI-Voice-2-Flash に置 (多くのケース) 12ppts上回りコストは50% Image-2 から置換した削減率 換した削減率 1/4 +10% 26% 40% PRICE OF MAI -CODE-1.0 CODE ACCEPT RATE ONEDRIVE SAVE RATE PERF PER WATT (MAIA 200) MAI-Code-1.1-Flash の価格。品質は向上、 VS Code で GPT-5.4 Mini / Claude Haiku MAI-Image-2.5 を既定にした後の画像編集 自社シリコン Maia 200 上で MAI モデルを動 トークンは25%削減 4.5 に対する受諾率差 の保存率向上 かした際の効率改善 Sources: microsoft.ai/news — Optimizing the frontier performance curve (07-29), MAI-Cyber-1-Flash (08-13), MAI-Code-1.1-Flash (08-11), MAI-Image-2.5-Pro/Voice-2-Flash (07-23) 6
  6. THE THESIS, IN HIS OWN WORDS Mustafa Suleyman の3つの主張 “

    Tokenmaxxing has been the story of the last few months, but token efficiency is the next big focus across the industry. 「トークン最大化」がここ数ヶ月の物語だった。だが次の焦点は業界全体でトークン効率だ。 OPTIMIZING THE FRONTIER PERFORMANCE CURVE · 2026.07.29 “ In most cases, frontier generalist models aren't necessary for every task. By tuning models for a specific product, you can maintain or even exceed frontier performance, while reducing token costs dramatically. 多くの場合、すべてのタスクにフロンティア汎用モデルは要らない。プロダクト特化のチューニングで、フロンティア性能を維持あるいは超えながらトークンコストを劇的に下げられる。 OPTIMIZING THE FRONTIER PERFORMANCE CURVE · 2026.07.29 “ Every business now must assume that any one model it depends on could disappear, through a security incident, a business or policy misalignment, or a geopolitical shift. いまやどの企業も、依存する単一モデルが消える前提を置かねばならない。セキュリティ事故、商流・方針の不一致、あるいは地政学的な変化によって。 OPTIMIZING THE FRONTIER PERFORMANCE CURVE · 2026.07.29 Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) 7
  7. WHAT THIS MEANS FOR DECISION MAKERS エグゼクティブへの示唆 01 02 03

    コスト レジリエンス データ主権 「フロンティア性能 vs コスト」の曲線上で、自社がどこに 座るかを選ぶ意思決定が必要になった。全タスクに最上 位モデルを充てる設計は経済的に破綻する。 モデルは「置換可能」でなければならない。ハーネス・コン テキスト・メモリ・アクション空間を単一モデルファミリーから 独立して設計する。 RLE(強化学習環境)と Frontier Tuning により、業 務のトレースそのものが資産になる。「借りた知能」ではな く「所有する知能」へ。 – MDASH は 90% のタスクを Flash 級で処理し、残り 10% のみ GPT-5.4 に回す – セキュリティ事故/商流の不一致/地政学リスクを構造 的に吸収 – “the RLEs and the models you build inside of them become your moat” – この設計だけで 50% のコスト削減 – MAI 自身が GPT-5.4 を併用している点が示唆的 – MAI は蒸留を行わず、データ系譜を追跡可能に保つ Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: microsoft.ai/news — Introducing MAI-Cyber-1-Flash inside MDASH (2026-08-13) / Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) 8
  8. THE LAB MAI Superintelligence Team とは 組織 FORMED MISSION 4つの自前主義

    2025年11月6日に「MAI Superintelligence Team」を組成。Mustafa Suleyman が Microsoft AI の一部として直接リード。 Humanist Superintelligence(人間中心の超知能)。「人と組織に 奉仕し、置き換えないAI」。 SCALE 「lean, talent-dense team of explorers, researchers, and fullstack engineers」。少人数・高密度・短サイクル。 COMPUTE 次世代 GB200 クラスタが稼働中。MAI-1-preview は約15,000基の NVIDIA H100 で事前学習・事後学習。 SILICON 自社アクセラレータ Maia 200 とモデルを共設計。Build 時点で 1.4x、7 月時点で 40% 高い性能/W。 01 No distillation 他社モデルからの蒸留を一切行わない。「capabilities should be learned, not inherited」。模倣は教師の設計判断に縛られ、操縦性を失う。 02 Clean data クリーンで追跡可能・商用ライセンス済みのエンタープライズ級データのみ。「何がモデルを形 作ったか説明できなければ、挙動も理解できず改善もできない」。 03 Own the stack アーキテクチャ・学習パイプライン・事後学習・RL フレームワークまで内製。 04 Own the silicon Maia 200 とのモデル共設計。長期的な自給自足(self-sufficiency)を目的とする。 Source: microsoft.ai/news — Towards Humanist Superintelligence, Mustafa Suleyman (2025-11-06) / Source: microsoft.ai/news — Two in-house models in support of our mission (2025-08-28) / Source: microsoft.ai/news — Introducing MAIThinking-1 (2026-08-12) / Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) 10
  9. HUMANIST SUPERINTELLIGENCE HSI の定義 Humanist Superintelligence (HSI) incredibly advanced AI

    capabilities that always work for, in service of, people and humanity more generally. We think of it as systems that are problem-oriented and tend towards the domain specific. Not an unbounded and unlimited entity with high degrees of autonomy – but AI that is carefully calibrated, contextualized, within limits. 常に人と人類のために働く、極めて高度な AI 能力。問題志向でドメイン特化に傾く systems であり、高い自律 性を持つ無制限の存在ではない。慎重に較正され、文脈化され、限界の内側にある AI。 — We reject narratives about a race to AGI. AGI レースという物語を拒否する — HSI is a vision to ensure humanity remains at the top of the food chain. 人類が食物連鎖の頂点に留まることを保証するビジョン — At Microsoft AI, we believe humans matter more than AI. AI より人間が重要だと信じている — Creating superintelligence is one thing; but creating provable, robust containment and alignment alongside it is the urgent challenge of the 21st century. 超知能を作ることと、封じ込め・アラインメントを同時に作ることは別物であり、後者こそ21世紀の急務 Source: microsoft.ai/news — Towards Humanist Superintelligence (2025-11-06) 11
  10. THREE DOMAINS OF HUMANIST SUPERINTELLIGENCE HSI が狙う領域 AN AI COMPANION

    FOR EVERYONE MEDICAL SUPERINTELLIGENCE PLENTIFUL CLEAN ENERGY すべての人にAIコンパニオンを 医療超知能 潤沢なクリーンエネルギー Copilot を「人生の大小の場面に寄り添う伴走者」と定義 MAI-DxO は NEJM 症例の 85.5% を正答(医師21名 核融合・カーボンネガティブ素材・バッテリー・送電網最適化 。2025年の利用分析(37.5M会話)では健康トピックが の平均は20%)。Mayo Clinic と医療特化フロンティアモ 。2040年より前の安価で潤沢な再エネと蓄電を予測。 モバイル最多。 デルを共同開発。 Sources: Towards Humanist Superintelligence (2025-11-06) / The Path to Medical Superintelligence (2025-06-30) / Our values in operation: Health (2026-06-02) 12
  11. SIX OPERATING VALUES MAI の6つのバリュー 「単なるマーケティングのスローガンではない。プロダクト設計・エンジニアリングのトレードオフ・提携先の選定を規定する operational principles である」 Kindness

    Trust Quality 親切さ 信頼 品質 人の状況に寄り添う応答設計 出典明示・データ系譜の追跡可能性 「what Copilot says matters」— 高い基準の自己規律 Simplicity Safety & Security Evaluation 簡潔さ 安全性とセキュリティ 評価 体験は「何を感じるか」であって内部構造ではない 過剰拒否も不適切な応諾も同じ「欠陥」として報酬設計 Source: microsoft.ai/news — Our values in operation: Health (2026-06-02) / Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) ablate / measure / document を全工程で徹底 13
  12. LEARNED, NOT INHERITED 「学習された知能」対「継承された知能」 継承された知能(蒸留) 学習された知能(MAI) Although faster to acquire,

    inherited intelligence lacks the steerability essential for real world usage: an imitator is fundamentally tied to the design choices of its teacher and struggles to adapt to new situations. MAI-Thinking-1 was trained without distillation from third party models, forcing our model to truly learn the tasks at hand. 獲得は速いが、実運用に不可欠な操縦性を欠く。模倣者は教師の設計判断に本質的に縛られ、新し い状況への適応に苦しむ。 MAI-Thinking-1 は第三者モデルからの蒸留なしで学習。モデルに「タスクそのものを本当に学ぶ」ことを 強制する。 この選択がもたらす3つの帰結 QUALITY PROVENANCE CONTROL 品質 来歴 制御 ベンチマークを狙い撃ちせず「ゼロから登った」ため、汎化する伸 びしろが残る。AIME 2025 で 97.0%、SWE-Bench Pro で 52.8%。 商用ライセンス済み・追跡可能なデータ系譜。エンタープライズ が法務・監査で説明できる。 安全性を能力と同じ RL インフラで学習。過剰拒否と不適切 応諾を同一の報酬構成で「欠陥」として扱う。 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) / Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) 14
  13. THE FULL ARC — 2024 → 2026 MAI モデル変遷 全体年表

    2024 04.22 TED “What is AI anyway?” — Suleyman が AI を「新しいデジタル生物種」と表現 構想 10.01 An AI companion for everyone — Copilot を「伴走者」として再定義 2025 06.30 MAI-DxO:NEJM 症例 85.5% 正答(医師21名平均 20%) 自前モデルの起点 08.28 MAI-1-preview(MoE, 約15,000 H100)+ MAI-Voice-1 — 初の自社基盤モデル2本 10.13 MAI-Image-1:LMArena text-to-image で top 10 デビュー 11.06 Towards Humanist Superintelligence:MAI Superintelligence Team 組成 12.10 Copilot Usage Report 2025(37.5M 会話の分析) 2026 H1 03.19 MAI-Image-2:Arena.ai で model family 第3位 Foundry 展開と Build 04.02 Foundry で3モデル同時提供:Transcribe-1 / Voice-1 / Image-2 04.14 MAI-Image-2-Efficient:22%高速・4x効率・約41%値下げ 06.02 Build 2026:7モデル同時発表 + Frontier Tuning + Mayo Clinic 2026 H2 07.23 GitHub Copilot / Excel 特化モデル ・ Image-2.5-Pro / Voice-2-Flash 特化と効率の時代 07.29 Optimizing the frontier performance curve(戦略転換の宣言) 08.10–13 Image-2.6 / Code-1.1-Flash / Thinking-1 GA / Cyber-1-Flash + Perception Sources: microsoft.ai/news 全28記事(2024-04-22 〜 2026-08-13) 16
  14. TWO IN-HOUSE MODELS IN SUPPORT OF OUR MISSION PHASE 1

    — 最初の自社モデル2本(2025年8月) MAI-Voice-1 MAI-1-preview 初の自社音声生成モデル 初のエンドツーエンド自社学習の基盤モデル – – 自社製 Mixture-of-Experts(MoE)アーキテクチャ – 約 15,000 基の NVIDIA H100 で事前学習・事後学習 – LMArena で公開テスト、trusted testers に API 提供 – 指示追従と日常的な有用性に特化した消費者向け設計 単一 GPU で1分の音声を1秒未満で生成(当時「最も効率的な音声システムのひとつ 」) – 単一話者・複数話者の双方で高忠実度・高表現力 – Copilot Daily / Copilot Podcasts / Copilot Labs に即日投入 この時点で示された戦略仮説 “ Orchestrating a range of specialized models serving different user intents and use cases will unlock immense value. 異なるユーザー意図とユースケースに向けた特化モデル群をオーケストレーションすることが、巨大な価値を解放する。 — この一文が、1年後の MDASH(90%/10%ルーティング)と製品別チ ューニングの原型になっている。 Source: microsoft.ai/news — Two in-house models in support of our mission (2025-08-28) 17
  15. MAI GOES TO MARKET PHASE 2 — Foundry 展開と価格の武器化(2026年3〜4月) MAI-Transcribe-1

    2026.04.02 MAI-Voice-1 2026.04.02 MAI-Image-2 2026.03.19 MAI-Image-2-Efficient 2026.04.14 FLEURS 上位25言語で最小 WER。うち11言語で1位、残り14言語で Whisper-large-v3 に勝利(うち11言 語で Gemini 3.1 Flash にも勝利)。Azure Fast 比 2.5x のバッチ速度。 $0.36 / 音声1時間 数秒の音声からカスタムボイスを Foundry 上で作成可能に。1秒で60秒の音声を生成。Copilot Audio Expressions / Podcasts を駆動。 Arena.ai で model family 第3位。本番トラフィック実測で同等品質を「2倍以上高速」に生成。Bing / PowerPoint に段階展開。 MAI-Image-2 比で 22% 高速・4倍効率(H100・1024×1024・GPUあたりスループット)。他社主要 T2I 比 で平均 40% 高速。 $22 / 1M characters $5 text-in / $33 image-out(1M tokens) $5 text-in / $19.50 image-out(約41%減) この四半期で MAI は「品質で並ぶ」から「品質あたりの価格で勝つ」へ軸足を移した。Image-2-Efficient の 41% 値下げは、その最初の明示的な一手。 Source: microsoft.ai/news — Announcing 3 new world class MAI models, available in Foundry (2026-04-02) / Source: microsoft.ai/news — MAI-Image-2-Efficient: Flagship Quality, 41% Lower Cost (2026-04-14) 18
  16. MICROSOFT BUILD 2026 7 new MAI models THE SEVEN Build

    2026 の7モデル MAI-Thinking-1 推論 MAI-Code-1-Flash コーディング 2026年6月2日、Microsoft AI は画像・音声・文字起こし・コーデ MAI-Image-2.5 ィング・推論にまたがる7モデルを一度に発表した。同時に 画像生成・編集 35B active / 約1T total の sparse MoE、256k コンテキスト。AIME 2025 97.0%、SWE-Bench Pro 52.8%。Sonnet 4.6 に対しブラインド人手評価で選好。 5B active。SWE-Bench Pro 51.2%(Haiku 4.5 は 35.2%)。GitHub Copilot ハーネスで直接 学習。 Arena Image Edit で2位(1403±9)、Nano Banana 2 を上回る。$5/$8/$47。 Frontier Tuning と Mayo Clinic との医療フロンティアモデル共 同開発を公表。 MAI-Image-2.5-Flash 大規模本番向けの超効率版。$1.75/$1.75/$19.50。 画像(効率) “The compute used to train frontier models has increased by a factor of one trillion. Now we expect another thousand-fold increase over the next three years.” MAI-Transcribe-1.5 文字起こし MAI-Voice-2 43言語に拡張(25→43)、1時間の音声を15秒未満で処理。キーワードバイアスで WER 最大 30%改善。 15言語、感情タグ制御、5〜60秒のゼロショット音声プロンプト。MAI-Voice-1 比 72% 選好。 音声生成 — Mustafa Suleyman MAI-Voice-2-Flash 超低レイテンシのボイスエージェント向け。7月23日にパブリックプレビュー。 音声(効率) Source: microsoft.ai/news — Building a hill-climbing machine: Launching seven new MAI models (2026-06-02) / Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) 19
  17. THE COMPLETE MAI MODEL FAMILY — TEXT, CODE, SECURITY MAI

    モデル全一覧(1/2) モデル 初出 種別 主要スペック・実績 価格 / 提供 MAI-1-preview 2025.08.28 基盤(テキスト) 自社 MoE。約15,000基の NVIDIA H100 で事前・事後学習。LMArena で公開テスト trusted testers 向け API MAI-Thinking-1 2026.06.02 推論 35B active / 約1T total sparse MoE、256k コンテキスト、function calling、Chat Completions 互換 Foundry パブリックプレビュー(2026.08.12) MAI-Code-1-Flash 2026.06.02 エージェント型コーディング 5B active。SWE-Bench Pro 51.2%、SWE-Bench Verified 71.6%、平均10.8Kトークン GitHub Copilot / VS Code、Haiku 4.5 より安価 MAI-Code-1.1-Flash 2026.08.11 エージェント型コーディング Terminal-Bench 2.1 +22%、.NET +15%、トークン25%減・25%高速、code survival +4% 1.0 の 1/4 の価格。GitHub Copilot 本番稼働 MAI-Cyber-1-Flash 2026.08.13 セキュリティ MAI-Thinking-1 系譜のコンパクトなコード重視モデル。MDASH と組み CyberGym any-crash 96% MDASH 経由。既存構成比 50% コスト削減 (無名)Excel 特化モデル 2026.07.23 知識労働エージェント MAI-Code-1-Flash のチェックポイントを Excel RL 環境で追加学習。GPT-5.6 と同等品質 Excel 本番。A100/H100 で提供可能 MAI-DxO 2025.06.30 診断オーケストレータ NEJM 304症例の SD Bench で 85.5%(o3 併用時)。医師21名の平均は 20% 研究デモのみ(非公開) MDASH 2026.08.13 ハーネス(多エージェント) 脆弱性の特定と修復。100超のエージェントを複数モデルで構成 Microsoft Security 製品群 Perception 2026.08.13 エージェント型セキュリティ MDASH 上でセキュリティワークフロー群を継続的に監視・修復 2026.08.13 発表 Sources: microsoft.ai/news — 2025-06-30 / 2025-08-28 / 2026-06-02 ×2 / 2026-07-23 / 2026-08-11 / 2026-08-12 / 2026-08-13 20
  18. IMAGE, VOICE, TRANSCRIPTION MAI モデル全一覧(2/2) モデル 初出 種別 主要スペック・実績 価格

    / 提供 MAI-Image-1 2025.10.13 画像生成 初の完全自社製画像モデル。LMArena text-to-image で top 10 デビュー Bing Image Creator / Copilot Labs MAI-Image-2 2026.03.19 画像生成 Arena.ai で model family 第3位。本番実測で同等品質を2倍以上高速に生成 $5 text-in / $33 image-out MAI-Image-2-Efficient 2026.04.14 画像生成(効率) 22% 高速・4倍効率(H100, 1024×1024)。他社主要 T2I 比で平均40%高速 $5 / $19.50(約41%減) MAI-Image-2.5 2026.06.02 画像生成・編集 Arena Image Edit 2位(1403±9)。局所編集・顔同一性保持・視覚推論 $5 text-in / $8 image-in / $47 image-out MAI-Image-2.5-Flash 2026.06.02 画像(効率) 大規模本番ワークロード向け。Bing Image Creator の既定 $1.75 / $1.75 / $19.50 MAI-Image-2.5-Pro 2026.07.23 画像(最高忠実度) ヒーロー画像・精密編集・画像内テキスト描画。WPP が評価 $5 / $8 / $106 MAI-Image-2.6 2026.08.10 画像生成 Arena text-to-image 2位。2.5 比 +79 Elo、テキスト描画 +91 Elo Arena → MAI Playground → Foundry MAI-Voice-1 2025.08.28 音声生成 単一 GPU で60秒の音声を1秒未満。カスタムボイス作成(2026.04) $22 / 1M characters MAI-Voice-2 2026.06.02 音声生成 15言語・18ロケール、感情タグ、5〜60秒ゼロショット、コードスイッチング Foundry / VS Code / D365 Contact Center MAI-Voice-2-Flash 2026.07.23 音声(効率) MAI-Voice-2 比 2倍速・32% 安。Azure Voice Live に統合 $15 / 1M characters MAI-Transcribe-1 2026.04.02 音声認識 FLEURS 上位25言語で最小 WER。Azure Fast 比 2.5x $0.36 / 音声1時間 MAI-Transcribe-1.5 2026.06.02 音声認識 43言語。1時間を15秒未満。AA で WER 2.4%(3位)、FLEURS 4.86%。キーワードバイアスで最 大30%改善 Copilot / Teams / GitHub / D365 / Foundry Sources: microsoft.ai/news — 2025-10-13 / 2026-03-19 / 04-02 / 04-14 / 06-02 ×3 / 07-09 / 07-23 / 08-10 21
  19. HOW TO READ A MAI MODEL NAME MAI の命名規則を読み解く MAI

    - ブランド Thinking 1 - ドメイン . 世代 1 マイナー - Flash ティア ドメイン ティア 世代 Thinking (無印) -1 / -2 汎用推論・数学・エージェント型コーディング そのファミリーの標準・最高品質 メジャー世代。アーキテクチャや学習レシピの刷新 Code Flash .5 / .6 IDE / CLI に特化したコーディング 推論効率・スループット最優先の小型版 世代内の品質ジャンプ(Image-2.5 → 2.6 で +79 Elo) Cyber Pro -1.1 脆弱性発見・修復(MDASH 前提) 最高忠実度。価格は最上位(Image-2.5-Pro は $106/1M image out) 同一世代の改良(Code-1.1-Flash は 1.0 の 1/4 価格) Image / Voice / Transcribe Efficient preview 画像生成編集 / 音声合成 / 音声認識 同等品質を低コストで。Image-2 → 2-Efficient で約41%減 LMArena・trusted testers 段階(MAI-1-preview) Sources: microsoft.ai/news 全モデル発表記事より整理(2025-08-28 〜 2026-08-13) 22
  20. MEDIUM-SIZED, TRAINED FROM SCRATCH, 256K CONTEXT MAI-Thinking-1 — MAI の推論モデル

    35B 256K 97.0 52.8 ACTIVE PARAMETERS CONTEXT WINDOW % AIME 2025 % SWE -BENCH PRO 総パラメータは約1T の sparse Mixture of 600ページの文書が収まる長さ。エージェント型コ AIME 2026 は 94.5%。ベンチマークを狙い撃ち Claude Opus 4.6(53.4%)と互角。5B の Experts。推論フットプリントは大型モデルより小 ーディング評価も256kで実施 せず「ゼロから登った」結果 Code-1-Flash は 51.2% さい エンタープライズ適合 人手ブラインド評価(対 Sonnet 4.6) – 256k トークンの長文コンテキスト、function calling、開発者指示の追加に対応 – パートナー Surge のプロ評価者プールで実施 – 多層の指示追従を学習し、既定スタイルをエンタープライズ用途に整合 – 1,276 タスク、シングルターン/マルチターン双方の幅広いユースケース – Chat Completions API 互換。Foundry の評価・可観測性・安全性・デプロイ機能を利用 – 「有用性」と「ユーザーの目的を実際に前進させたか」を測定 – クリーンで追跡可能なデータ系譜(provenance)を品質・統制の要件として提示 – 結果:ユーザーは MAI-Thinking-1 を Claude Sonnet 4.6 より選好 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) 24
  21. TABLE 1 — POST-TRAINED EVALUATION RESULTS MAI-Thinking-1 ベンチマーク(原文図表) STEM と

    Agentic Coding の公開ベンチマーク。他モデルの数値は各社公式モデルカードより。「−」は該当ベンチマークの数値が未公表。エージェント型コーディング評価は総コンテキスト長 256k、その他は最大出力トークン 256k で実施。 読み解き:Opus 4.6 級の巨大モデルに SWE-Bench Pro で肉薄しつつ、推論フットプリントは 35B active。GPQA Diamond や Terminal Bench 2.0 では上位モデルに劣後しており、MAI 自身も「まだ登る余地が ある」と明言している。 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) 25
  22. HILL-CLIMBING, MEASURED 学習曲線と事前学習メトリクス AIME 2025 — 学習を通じた一貫した上昇トレンド ベンチマークを直接狙わずに到達している点が MAI の主張の核。

    Table 2 — 事前学習ベースモデルの bits-per-byte(低いほど良い) 事後学習の結果だけでなく、ベースモデルの事前学習指標まで公開している点が、 「ablate / measure / document」を掲げる MAI の科学的厳密性の主張と一致する。 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) 26
  23. SAFETY AS A CAPABILITY, NOT A GATE 安全性と有用性を同じループで学習する 設計思想 “

    Our models must not refuse legitimate requests under the guise of safety and compliance as then they are not truly serving humans. 安全性やコンプライアンスを口実に正当な要求を拒否してはならない。それ では人間に本当に奉仕していない。 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) – 「不適切な応諾」と「不要な拒否」を、同一の報酬構成における欠陥として扱う – 集約は潜在的な危害の重大度に基づく – 安全性は能力と同じ強化学習インフラで学習 — 安全性が能力と常に整合し、付随 的にならない – 結果として、機微な不安全要求には基準を守りつつ、非機微な内容では有用性を保 てている 27
  24. BUILT FOR DEVELOPERS, NOT BENCHMARKS MAI-Code-1-Flash — 5B でフロンティア級のコーディング 設計思想:プロダクトハーネスの中で学習する

    測定:3つのシグナルファミリー – 本番の GitHub Copilot ハーネスで直接学習。学習中からモデルは VS Code / Copilot CLI の実ツールに触れる Code quality 受諾されたコード量/x分後に残存したコード量/git commit を生き延びたコード量 – 評価も公開・内部ベンチマークを「本番ハーネスに載せて」実施 – 適応的な解長制御:簡単な要求では簡潔に、難問には推論予算を厚く – SWE-Bench Verified で最大60%少ないトークンで難問を解く Token efficiency タスク完了に要したトークン数/commit に至るまでのターン数 Engagement ユーザーの再訪率/ユーザー起点のターン数 5B 51.2 60% 85.8 ACTIVE PARAMETERS % SWE-BENCH PRO FEWER TOKENS % ADVERSARIAL ACC. Haiku 4.5 に近いサイズだが、より安価( Claude Haiku 4.5 の 35.2% に対し +16ポイン SWE-Bench Verified で難問を解く際のトーク 186問34カテゴリの敵対的ベンチ(反転した古 GitHub Copilot のトークン課金) ト ン削減幅(最大) 典・不可能問題等)での調整済み正答率 Source: microsoft.ai/news — Introducing MAI-Code-1-Flash (2026-06-02) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 28
  25. IDEAL ZONE — HIGH PASS RATE, LOW TOKENS MAI-Code-1-Flash:品質と効率のトレードオフを消す 読み解き

    Source: microsoft.ai/news — Introducing MAI-Code-1-Flash (2026-06-02) – 横軸=平均トークン使用量、縦軸=合格率。左上(IDEAL ZONE)ほど良い – 矢印は Haiku 4.5 から MAI-Code-1-Flash への移動を示す – SWE-Bench Verified:66.6% / 27.3K → 71.6% / 10.8K。合 格率を上げながらトークンを 60% 削減 – SWE-Bench Pro:35.2% → 51.2%(+16pt)でトークンもわず かに減 – Artifacts Bench(視覚コーディング)のみ合格率は横ばい( 36.6→36.4%)だがトークンは約半減 29
  26. THE FIRST IN-GENERATION UPGRADE MAI-Code-1.1-Flash — より良く、より速く、1/4のコストで 1/4 +22% −25%

    +9% OF 1.0 PRICE TERMINAL -BENC H 2.1 TOKENS / +25% SPEED RETURN VISITS 学習と提供の効率化により実現し、顧客に還 GitHub Copilot CLI 上での改善。.NET タスク 同一タスクに必要なトークンが25%減、ストリーミ 本番指標。code survival も +4%(ベンチで 元 は +15% ングは25%高速 はなく製品での改善) Reactor で初公開されたベンチマーク比較(pass rate / tokens usage) ベンチマーク MAI-Code-1.1-Flash MAI-Code-1-Flash Claude Haiku 4.5 GPT-5.4 mini SWE-Bench Verified 72.6 / 8.6K 71.6 / 10.8K 69.8 / 20.9K 69.2 / 9.4K Terminal Bench 2.1 62.9 / 17.0K 51.7 / 14.2K 49.4 / 25.5K 60.7 / 21.9K 要点:1.1 は 1.0 に対し SWE-Bench Verified で合格率を上げつつトークンを 8.6K まで削減(Haiku 4.5 の 20.9K に対し約41%)。Terminal Bench 2.1 は 51.7 → 62.9 で +11.2pt=相対 +22%、ブログの記 述と一致する。GPT-5.4 mini に対しては両ベンチで上回りつつ、Terminal Bench ではトークンも少ない。 Source: microsoft.ai/news — MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost (2026-08-11) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 30
  27. MODEL · DATA · HARNESS MAI-Cyber-1-Flash × MDASH — 半額で世界最高水準

    MODEL MAI-Thinking-1 の系譜から派生した、コード重視のコンパクトなセキュリティモデル。ゼ ロから内製、最高品質のデータで学習。H100 でも提供できる小ささ。 DATA 「最も深い優位性」。ID・エンドポイント・クラウド・ネットワークにまたがる1日100兆超のセ キュリティシグナル、160万顧客の運用知見、実際のエクスプロイトと修復の記録。 CyberGym Evaluation(Model + Agent Configurations)。MDASH と MAI-Cyber-1-Flash + GPT-5.4 の組み合わせ が 95.95%。 90% / 10% ルーティング:MAI-Cyber-1-Flash が全タスクの最大90%を効率的に処理し、MDASH は本当に難し い10%にのみ最大級のモデル(GPT-5.4)を割り当てる。これだけで既存構成(GPT-5.4+5.4 mini+5.3 codex )比 50% のコスト削減。 Source: microsoft.ai/news — Introducing MAI-Cyber-1-Flash inside MDASH (2026-08-13) HARNESS MDASH は業界最高のセキュリティ専門家が調整した多エージェントハーネス。複数の主 要モデルを使う100超のエージェントが発見・検証・修復を担う。 31
  28. READ THE FOOTNOTES — 2026.08.13 CLARIFICATION ベンチマークの読み方(CyberGym スコアの但し書き) MAI は

    8月13日付でスコアの定義を明示する注記を追加した。「96%」がどの指標を指すかは、エグゼクティブが数字を引用する前に確認すべき典型例。 96% 評価対象コードをクラッシュさせる入力(既存または0-day の脆弱性をトリガーするもの)を特定できる能力。MAI が公表した 96% はこの指標。 Any-crash 90.4% 脆弱性をトリガーする候補入力を1つ以上生成し、少なくとも1つが CyberGym テストスイートの既知脆弱性に対応する能力。 Target (Any-of) 86.3% 7月に導入された新採点方式。Any-of を土台に、エージェントが1つだけ提出し既知脆弱性と照合。CyberGym リーダーボード上の数字はこれ。MAI は評価器が誤って 有効クラッシュと解釈しうるエッジケースを除外する保守的な扱いを採用。 Final-submission 同種の注意点は他モデルにも当てはまる:MAI-Code の Terminal Bench は 2.0 / 2 / 2.1 で数値が異なり、MAI-Transcribe の WER も FLEURS と Artificial Analysis で 4.86% / 2.4% と基準が違う。比較時はベンチの バージョンとハーネスを必ず揃える。 Source: microsoft.ai/news — Introducing MAI-Cyber-1-Flash inside MDASH (2026-08-13) 32
  29. THE IMAGE CLIMB — 2025.10 → 2026.08 MAI-Image ファミリーの登坂記録 2026.08

    MAI-Image-2.6 2026.07 MAI-Image-2.5-Pro 2026.06 MAI-Image-2.5 / Flash 2026.04 MAI-Image-2-Efficient 2026.03 MAI-Image-2 2025.10 MAI-Image-1 LMArena text-to-image で top 10 デビ ュー。初の完全内製画像モデル。基礎を築 いた。 写実性・画像内テキスト・創造的レンジで 大きく飛躍。Arena.ai で model family 第 3位。 Sources: microsoft.ai/news — 2025-10-13 / 2026-03-19 / 04-14 / 06-02 / 07-23 / 08-10 同等品質で 22% 高速・4倍効率。価格を 約41%引き下げ($33 → $19.50)。 プロ品質の編集へ。Arena Image Edit 2 位(1403±9)で Nano Banana 2 超え。 局所編集・顔同一性保持。 最高忠実度。ヒーロー画像・精密編集・画 像内テキスト。WPP の Rob Reilly が「a real breakthrough」と評価。 Arena text-to-image 2位。2.5 比で全カ テゴリ改善、総合 +79 Elo、テキスト描画 +91 Elo。Meta・Google・xAI の上位。 33
  30. THE AUDIO STACK MAI-Voice と MAI-Transcribe — 音声スタックの完成 MAI-Voice-2 /

    2-Flash MAI-Transcribe-1 / 1.5 音声生成(TTS) 音声認識(STT) – 英語のみ(Voice-1)から 15言語・18ロケールへ拡張 – 対応言語を 25 → 43 に拡張しつつ精度を落とさず。FLEURS で最良クラスの WER – 感情タグによる粒度の細かい制御(sad / whispered / excited 等) – Artificial Analysis で WER 2.4%(第3位)、accuracy×speed ではリーダー – 5〜60秒の参照音声によるゼロショット音声プロンプト(同意ガードレール付き。無許諾のクロー ン生成は不可) – 1時間の音声を15秒未満で処理。長尺では Gemini 3.1 / Scribe v2 / GPT-4oTranscribe 比で最大5倍速 – ヒンディー語–英語、スペイン語–英語などのコードスイッチング対応 – – MAI-Voice-1 に対し 72.1% の選好率。話者類似性評価では実録音と識別不能 キーワードバイアス:ドメイン固有語のリストで FLEURS の WER を最大30%改善(固有名詞 ・医療用語・社内略語) – 2-Flash は 2倍速・32%安($15 / 1M characters)。Azure Voice Live に統合 – Ode Poetry 記事時点(2026年7月)で FLEURS WER 4.86% — 競合最小 – 次の課題:話者分離(diarization)、ネイティブなストリーミングAPI、対応言語のさらなる 拡張 Source: microsoft.ai/news — Introducing MAI-Voice-2 (2026-06-02) / Source: microsoft.ai/news — Introducing MAI-Transcribe-1.5 (2026-06-02) / Source: microsoft.ai/news — Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash (2026-07-23) / Source: microsoft.ai/news — Bringing Ode Poetry to life with MAI's audio models (2026-07-09) 34
  31. THE PIVOT 「トークン最大化」から「トークン効率」へ これまで — Tokenmaxxing これから — Token efficiency

    – より大きなモデル、より長い思考、より多いトークンが正義 – 投じたトークンあたりの性能、投じた1ドルあたりの顧客成果 – フロンティア汎用モデルを全タスクに充てる – プロダクトごとにチューニングされた小型モデル群 + ルーティング – コストは「性能の対価」として受け入れられていた – 節約分は顧客に還元する(MAI の明示的な方針) Tokenmaxxing has been the story of the last few months, but token efficiency is the next big focus across the industry. How do we get the best possible performance per token invested, and the best real customer outcome per dollar invested? トークン最大化が主役だったが、次の焦点は業界全体でトークン効率だ。1トークン・1ドルあたりの成果をどう最大化するか。 MUSTAFA SULEYMAN · MICROSOFT.AI/NEWS · 2026.07.29 There is definitely a vibe that is shifting from token maxing — how can I burn as many tokens — to how can I actually get to token efficiency, where I can deploy models that are sustainable for the products I'm building, that are sustainable for the business. 「どれだけトークンを燃やせるか」から「トークン効率」へ空気は確実に変わりつつある。プロダクトにもビジネスにも持続可能なモデルを展開する ために。 SOPHIE, MAI PRODUCT TEAM · MICROSOFT REACTOR · 2026.08.11 Why are you using a Ferrari for a job that doesn't necessarily need it? その仕事に本当にフェラーリが必要なのか? NITYA / AMY BOYD · MICROSOFT REACTOR · 2026.08.11 Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 36
  32. THE CURVE IS A SYSTEM, NOT A MODEL フロンティア性能曲線という考え方 “

    私たちは、これがまったく新しいパフォーマンスカーブの始まりだと考えています。 このカーブが表しているのは、単一のモデルではなくシステム全体です。そして、このカーブ上を進んでいくことで、より高い品質、より低いコスト、 そしてより多くの選択肢を実現できます 共最適化する3つの要素 曲線上での位置取り 得られる3つの成果 モデル 選択が経営判断になる 品質 プロダクト特化にチューニングした小型モデル群(families of models) 「Choosing where you want to sit on that curve is critical」 維持または向上(Excel は GPT-5.6 と同等、Code は Haiku 4.5 超え) ハーネス 全タスクに最上位は不要 コスト MDASH / GitHub Copilot harness など、エージェントを走らせる 器 In most cases, frontier generalist models aren't necessary for every task 多くのケースで GPU コストの 50〜90% を削減 RLE 特化で超えることもある 選択肢 強化学習環境。実業務のトレースからモデルが直接学ぶ「訓練ジム 」 maintain or even exceed frontier performance, while reducing token costs dramatically モデルを差し替え可能にすることで交渉力とレジリエンスを得る Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) 37
  33. AXIS 1 — PRICE PER TOKEN 軸① コスト — MAI

    モデルの公開価格一覧 モデル テキスト入力 / 1M 画像入力 / 1M 画像出力 / 1M その他の課金単位 備考 MAI-Image-2 $5 — $33 — 2026.04 提供開始 MAI-Image-2-Efficient $5 — $19.50 — 2 比で約41%減・22%高速 MAI-Image-2.5 $5 $8 $47 — 編集込みのフラッグシップ MAI-Image-2.5-Flash $1.75 $1.75 $19.50 — 大規模本番向けの最安構成 MAI-Image-2.5-Pro $5 $8 $106 — 最高忠実度。2.5 の約2.3倍の出力単価 MAI-Voice-1 — — — $22 / 1M characters 2026.04 提供開始 MAI-Voice-2-Flash — — — $15 / 1M characters Voice-2 比 2倍速・32%安 MAI-Transcribe-1 — — — $0.36 / 音声1時間 大手クラウド最良の価格性能比と主張 MAI-Code-1-Flash — — — GitHub Copilot トークン課金 Claude Haiku 4.5 より安価 MAI-Code-1.1-Flash — — — 1.0 の 1/4 品質は向上、トークンは25%減 MAI-Thinking-1 — — — Foundry プレビュー 価格は本稿執筆時点で未公表 MAI-Cyber-1-Flash — — — MDASH 経由 既存構成比で 50% コスト削減 価格設計の読み方:MAI は同一ファミリー内に 6倍レンジ(Image-2.5-Flash $19.50 選べるようにするための設計。 Sources: microsoft.ai/news — 2026-04-02 / 04-14 / 06-02 / 07-23 / 08-11 / 08-12 / 08-13 2.5-Pro $106)を意図的に置いている。「families of models」は品質競争ではなく、顧客が品質・速度・コストの3軸で座標を 38
  34. AXIS 2 — CONTEXT LENGTH & REASONING BUDGET 軸② コンテキスト長と推論トークン

    256K 8.6K −60% CONTEXT WINDOW TOKENS / TASK TOKENS (MAX) MAI-Thinking-1。600ページ相当。エージェント型コーディング評価 MAI-Code-1.1-Flash の SWE-Bench Verified 平均。Haiku 4.5 MAI-Code-1-Flash が SWE-Bench Verified で難問を解く際の も総コンテキスト256kで実施 は 20.9K 削減幅 Adaptive solution length control 推論トークンをどう「稼ぐ」か MAI-Code-1-Flash は「解の長さを適応的に制御する」学習を受けている。 – 検証可能な RL 環境:決定的・実行可能・実テストスイートで採点される環境を大量に用意 – 単純な要求には簡潔に、深い分析や広範なコード変更が要る問題にのみ推論予算を厚く配分 – GitHub Copilot だけで「数十万規模の RL 環境」で実運用向けに最適化(1.1-Flash) – 結果として有用な出力がより早く出始める(time to first useful output の短縮) – 多段作業(コード読解→編集→テスト実行→失敗観測→復旧)を実地で練習させる – レイテンシ低下・コスト低下・return on token の改善・対話体験の滑らかさが同時に得られる – ベンチ最適化ではなく本番指標(code survival / return visits)で登坂を判定 – 「単に大きいモデルで請求書も大きい」ではない、という MAI の対比表現 Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) / Source: microsoft.ai/news — Introducing MAI-Code-1-Flash (2026-06-02) / Source: microsoft.ai/news — MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost (2026-0811) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 39
  35. AXIS 3 — COGS, GPU CLASS AND SILICON CO -DESIGN

    軸③ 原価構造とシリコンの自給 01 提供できる GPU クラスを下げる MAI の Excel 特化モデルは「最新世代アクセラレータのみ」ではなく NVIDIA H100 / A100 でも提供可能。デプロイ原価が大きく下が る。MAI-Cyber-1-Flash も「remarkably, we serve it on H100s too」と明記。 02 学習インフラを内製する アーキテクチャ・学習パイプライン・事後学習・RL フレームワークまで自社。「self-sufficiency across the entire stack」が第3の柱。 03 自社シリコンと共設計する Maia 200 上で MAI モデルを end-to-end 実行すると 40% 高い性能/W(Build 時点の発表では GB200 比較で 1.4x、Satya 発 表の30%改善に上乗せ)。 04 最新クラスタを確保する 次世代 GB200 クラスタが稼働中。MAI-1-preview は約15,000基の H100 で学習。「an exciting roadmap of compute at MAI, which is ramping quickly and extensively」。 これらは決算上「COGS の削減」と「AI キャパシティの実効拡大」の両方に効く。同じ GPU 群でより多くの本番トラフィックを処理できるからである。 Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: microsoft.ai/news — Hill-climbing MAI models for GitHub Copilot and Excel (2026-07-23) / Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) / Source: microsoft.ai/news — Introducing MAI-Thinking-1 (2026-08-12) 40
  36. AXIS 4 — THE RIGHT MODEL FOR THE RIGHT JOB

    軸④ オーケストレーション — 適材適所のルーティング MDASH の 90 / 10 設計 4つのモデルファミリー An efficient multimodal stack across chat, image, voice, and speech 90% · MAI-Cyber-1-Flash 10% は GPT-5.4(艦隊で最大かつ最も高価なモデル)に回す – 「本当に必要な例外的難問」だけに高価なモデルを温存する設計 – この構成だけで既存の最良構成(GPT-5.4 + 5.4 mini + 5.3 codex)比 50% のコスト削減 – 自社モデルだけで固めるのではなく、他社モデルを併用する点が実務的 10% Reasoning MAI-Thinking-1 / MAI-Code-1-Flash Image MAI-Image-2.5-Pro / 2.5 / 2.5-Flash Audio MAI-Transcribe-1.5 / MAI-Voice-2 / 2-Flash Cyber MAI-Cyber-1-Flash エグゼクティブが持ち帰るべき設計原則 タスクを難易度で階層化する ハーネスをモデルから独立させる 自社と他社を混ぜる 全件を最上位モデルに投げない。難易度分布を測り、閾値を設計す る コンテキスト・メモリ・アクション空間を単一モデルファミリーに結合しない MAI 自身が MDASH で GPT-5.4 を併用している。純血主義はコスト 最適ではない Source: microsoft.ai/news — Introducing MAI-Cyber-1-Flash inside MDASH (2026-08-13) / Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 41
  37. THE ADVANTAGE ISN'T THE MODEL. IT'S OWNING THE LOOP THAT

    IMPROVES IT. ヒルクライミング・マシン Data and workflows RLEs ループを所有することの意味 01 Data and workflows 実業務のトレース — 手順、判断、実行されたアクション。「組織の中で仕事が実際にどう進む か」の記録。MAI 曰く「最も価値あるデータはあなたのもの」。 02 RLEs(強化学習環境) AI のための訓練ジム。あなただけがアクセスできる。静的データではなく、ツール呼び出しやスキル 実行を伴うエージェント的挙動を学ばせる。 A hill-climbing machine 03 Tuned model Frontier Tuning で生まれる自社モデル。学習した組織知はモデルの中に残り、所有権もあな たに残る。 04 Usage Tuned model Usage 本番での利用が新たなデータとシグナルを生み、次の周回の入力になる。MAI は「ship, learn, improve, repeat」と表現。 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) / Source: microsoft.ai/news — Building a hill-climbing machine: Launching seven new MAI models (2026-06-02) / Source: microsoft.ai/news — MAICode-1.1-Flash: Better, faster, at a quarter of the cost (2026-08-11) 42
  38. YOUR WORKFLOWS BECOME YOUR MOAT RLE と Microsoft Frontier Tuning

    “ With MAI you don't rent intelligence from a shared model that learns from everyone. Only you keep the benefits of your hard-earned workflows, know-how, data and institutional knowledge. Only you control the resulting model. RLE とは何か Frontier Tuning の効果 所有権の設計 – – – 「AI のための訓練ジム」。決定的・実行可能で、実テス トスイートに採点される環境 – 静的データの学習ではなく、ツール呼び出し・多段作業 同等で最大 10倍効率 – ・失敗からの復旧を練習させる – 自社の環境は自社だけがアクセスできる Excel 向けチューニング済み MAI モデルは GPT-5.4 と McKinsey のタスク向けにチューニングした際は、GPT- 残る – 5.5 を品質で上回りつつコストは 1/10 – 「custom models are both better and more efficient」 学習した組織知はモデルに取り込まれ、そのまま自社に Mayo Clinic との医療フロンティアモデルは、モデルその ものを Mayo Clinic が所有する – Foundry の重み調整(tune the weights yourself )も開発者に開放 Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) / Source: microsoft.ai/news — Building a hill-climbing machine: Launching seven new MAI models (2026-06-02) / Source: microsoft.ai/news — Our values in operation: Health (2026-06-02) 43
  39. ONE CHECKPOINT, TWO SPECIALISED MODELS 実例:The Excel climb 何が起きたか 左下の折れ線:単一のチェックポイント系列が

    VS Code の SWE-Bench Verified で 72% に達したのち 、そのまま Excel の Base Bench で 81% → 86% へ 登坂していく様子。 – GitHub Copilot ハーネス内で事後学習した MAI-Code-1-Flash のチェックポイントを起点にする – そのチェックポイントを Excel の RL 環境に投入:Action → Execute (OfficeJS) → Update spreadsheet → Review のループ – 出力を Grader が採点し、モデル重みを更新して環境に戻す – 結果:エージェント型コーディングからエージェント型ナレッジワークへ能 力が転移 – 本番トラフィックのユーザーフィードバックで、最も一般的なタスクでは GPT-5.6 と同等品質 – しかも H100 / A100 級で提供できるため、Microsoft のデプロイ原 価が大きく下がる 横軸は Model Checkpoints。 Source: microsoft.ai/news — Hill-climbing MAI models for GitHub Copilot and Excel (2026-07-23) 44
  40. POWERING BILLIONS MAI モデルの Microsoft プロダクト浸透状況 Excel GitHub PowerPoint Dragon

    Copilot Dynamics 365 同等性能・より低コスト +10% −84% −50% −89% 最も一般的なタスクで GPT5.6 と同等の品質を、より高い コスト効率で。A100/H100 級 でも提供可能 VS Code で GPT-5.4 Mini / Claude Haiku 4.5 より高いコー ド受諾率、かつ中央値トークン 使用量は低い image-to-image の GPU コス ト削減(GPT-Image-2 比) 。MAI-Image-2.5 が本番稼 働 文字起こしと言語識別のエラー 率の相対的削減(MAITranscribe-1.5、58言語) Contact Center の GPU コスト 削減。T-Mobile・EasyJet など が利用 MAI モデルが既定または本番稼働している主なサーフェス:Bing / Copilot / GitHub Copilot・VS Code / PowerPoint / Excel / OneDrive / Dynamics 365 / Azure・Foundry Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) / Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: microsoft.ai/news — Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash (2026-07-23) 46
  41. MILLIONS OF DEVELOPERS, MEASURED IN PRODUCTION GitHub Copilot での ROI

    +10% −10% +6% / +11% +4% / +9% CODE ACCEPT RATE MEDIAN TOKEN USAGE MULTI-DAY RETURN SURVIVAL / RETURN (1.1) VS Code における GPT-5.4 Mini / Claude 同条件での中央値トークン使用量。ユーザー起 GPT-5.4 Mini 比 +6%、Claude Haiku 4.5 比 MAI-Code-1.1-Flash:code survival +4%、 Haiku 4.5 との比較 点ターンは増加 +11% で複数日にわたり再訪 return visits +9% 学習と評価の設計(Built for GitHub Copilot) ビジネス的な意味 – Training:GitHub Product Harness(VS Code / Copilot CLI)をそのまま学習に使用 – 受諾率が上がり、かつトークンが減る=「品質 × コスト」の両取り。従来はトレードオフだった – Evaluation:公開・内部ベンチマークを本番ハーネスに載せて評価(ベンチ単体では測らない) – – 本番指標は Quality / Efficiency / Engagement の3系統 code survival(git commit を生き延びたコード)は「本当に使われたか」の代理指標として最 も強い – 「we really treat model as building a product」— チェックポイントを本番 A/B に載せて判定 する – 再訪率の改善はリテンション、つまり Copilot のサブスクリプション経済に直結する – MAI 側は「数十万規模の RL 環境」で実運用向けに最適化したと明言(1.1-Flash) Source: microsoft.ai/news — Hill-climbing MAI models for GitHub Copilot and Excel (2026-07-23) / Source: microsoft.ai/news — MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost (2026-08-11) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 47
  42. FROM AGENTIC CODING TO AGENTIC KNOWLEDGE WORK Excel での ROI

    — 能力の転移 何が検証されたか 「MAI-Code-1-Flash に組み込まれた能力が、訓練したドメインの外へ転移するか」— エージェント型コーディングから、エー ジェント型ナレッジワークへ。 – MAI-Code-1-Flash のチェックポイントを Excel の RL 環境で追加学習し、ツールとスプレッドシートのワークフローを学ばせた – 本番トラフィックのユーザーフィードバックで、最も一般的なタスクでは GPT-5.6 と同等の品質 – Build 発表時点では「GPT-5.4 と同等かつ最大10倍効率」と表現されていた GPT-5.6 QUALITY PARITY 最も一般的なタスクにおける品質の同等性(本番フィードバック) 10× EFFICIENCY (BUILD) Build 時点の Excel チューニング済みモデルの効率改善(対 GPT-5.4) 広がりの計画 「Beyond GitHub Copilot and Excel, we're currently extending this hill-climbing approach to train efficient models across Microsoft's family of agentic products: Copilot Chat, Outlook, PowerPoint, and more.」 A100 SERVABLE GPU CLASS = Copilot Chat / Outlook / PowerPoint へ展開中。エージェント型プロダクト全体が対象。 最新世代アクセラレータ限定ではなく A100 / H100 でも提供可能 Source: microsoft.ai/news — Hill-climbing MAI models for GitHub Copilot and Excel (2026-07-23) / Source: microsoft.ai/news — Building a hill-climbing machine: Launching seven new MAI models (2026-06-02) / Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 48
  43. IMAGE MODELS IN PRODUCTION PowerPoint・OneDrive・Bing での ROI PowerPoint OneDrive Bing

    Image Creator −84% +26% 100% GPU コス ト 保存率 自社モデ ル 比率 MAI-Image-2.5 が image-to-image で本番稼働。GPT- 主要な画像編集シナリオの既定モデル。展開以降、保存率 MAI-Image-2.5 の精密編集により、生成から編集まで Image-2 比で GPU コストを最大84%削減。プロンプトからプ +26%、P95 レイテンシ約 −25%、中程度稼働時のトークン end-to-end で完全に自社モデル既定に。 レゼン用ビジュアルとスライドを生成。 効率 2.5倍。 Source: microsoft.ai/news — Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash (2026-07-23) / Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: microsoft.ai/news — MAIImage-2.5 launches at No. 2 for image editing on Arena (2026-06-02) 49
  44. VOICE IN THE CALL CENTER Dynamics 365 と音声エージェントでの ROI Dynamics

    365 Contact Center −89% GPU コスト削減(最大) Azure Voice Live – MAI-Voice-2-Flash がコールセンター向けエンタープライズ基盤を駆 動 – MAI-Voice-2-Flash を統合し、開発者が音声エージェントを迅速に構 築可能に – T-Mobile・EasyJet などの顧客がこの上でコールセンターエージェント を構築 – 低レイテンシで speech-to-speech 対話をサポート – 「ブランドを定義する会話」に、最も表現力のある自然な音声を提 供 – 2-Flash は Voice-2 比 2倍速・32%安($15 / 1M characters) なぜ音声で 89% もの削減が出るのか ワークロードが超高頻度 品質要件が「十分」で足りる 専用モデルは小さい コールセンターは1日数百万コール規模。単価差が総額に直結する 自然な韻律と低レイテンシが満たされれば、最上位モデルは不要 小型ゆえに1GPUあたりの同時処理数が跳ね上がり、GPU 時間あ たり原価が崩れる Source: microsoft.ai/news — Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash (2026-07-23) / Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) 50
  45. HEALTHCARE 医療領域での ROI DRAGON COPILOT · MAYO CLINIC · COPILOT

    HEALTH 医療プロダクトでの実測値 Dragon Copilot −50% 文字起こしと言語識別のエラー率を相対的に半減(多言語録音の内部評価、大半の言語で)。 170,000名の医療従事者が使用し、前四半期に2,800万件の患者診療を処理。58言語の多言語ワーク フローを MAI-Transcribe-1.5 が担う。 MAI にとって医療は Humanist Superintelligence の3領域の ひとつであり、同時に最も具体的な ROI が出ている領域でもあ る。 MAI-DxO 85.5% Copilot Health “Once validated, organizations worldwide will be able to access the frontier AI health model. The health model itself will be owned by Mayo Clinic.” 50M+/日 Mayo Clinic — Our values in operation: Health, 2026.06.02 共同開発 NEJM の304症例から作った SD Bench での正答率(o3 併用時)。5〜20年の臨床経験を持つ医師 21名の平均は20%。検査コストも医師・単体モデルより低い。※研究デモであり非公開。 Microsoft の消費者向けプロダクト全体で扱う健康関連の質問数。24カ国230名超の医師による外部パ ネル、ISO/IEC 42001 認証、5万超の米国医療機関と50超のウェアラブルに接続。 医療特化のフロンティアモデルを共同開発。まず Mayo Clinic 自身の環境に展開し、検証後に Foundry 経由で他組織へ。モデルの所有権は Mayo Clinic に帰属する。 Sources: microsoft.ai/news — MAI-Image-2.5-Pro and MAI-Voice-2-Flash (07-23) / Our values in operation: Health (06-02) / The Path to Medical Superintelligence (2025-06-30) / Introducing Copilot Health (03-12) 51
  46. THE ROI LEDGER — EVERY PUBLISHED NUMBER ROI 総括表 領域

    プロダクト MAI モデル 効果(公表値) 出典日 開発 GitHub Copilot / VS Code MAI-Code-1-Flash コード受諾率 +10%、中央値トークン −10%、再訪 +6%(対 GPT-5.4 Mini)/+11%(対 Haiku 4.5) 2026.07.23 開発 GitHub Copilot / CLI MAI-Code-1.1-Flash Terminal-Bench 2.1 +22%、.NET +15%、トークン −25%、速度 +25%、価格 1/4、survival +4%、 return visits +9% 2026.08.11 知識労働 Excel Excel 特化 MAI モデル 最も一般的なタスクで GPT-5.6 と同等品質。Build 時点は GPT-5.4 同等かつ最大10倍効率。A100/H100 で提供可 2026.07.23 生産性 PowerPoint MAI-Image-2.5 image-to-image の GPU コスト 最大 −84%(対 GPT-Image-2) 2026.07.23 生産性 OneDrive MAI-Image-2.5 保存率 +26%、P95 レイテンシ 約 −25%、トークン効率 2.5倍 2026.07.23 検索/消費者 Bing Image Creator MAI-Image-2.5 生成・編集ともに 100% 自社モデル既定へ 2026.07.23 業務アプリ Dynamics 365 Contact Center MAI-Voice-2-Flash GPU コスト 最大 −89%(T-Mobile・EasyJet 等が利用) 2026.07.23 開発者基盤 Azure Voice Live MAI-Voice-2-Flash 低レイテンシの speech-to-speech 音声エージェント基盤として統合 2026.07.23 医療 Dragon Copilot MAI-Transcribe-1.5 文字起こし・言語識別のエラー率 相対 −50%。170,000名の医療従事者、四半期2,800万件の診療、58言 語 2026.07.23 セキュリティ MDASH / Microsoft Security MAI-Cyber-1-Flash CyberGym any-crash 96%(Mythos を12ppts 上回る)、コスト −50% 2026.08.13 シリコン Maia 200 MAI モデル全般 性能/W +40%(Build 時点は GB200 比較で 1.4x) 2026.07.29 全社 Microsoft 製品群 MAI モデル全般 「多くのケースで GPU コストの 50〜90% を削減」— Satya の Q4 決算コメントに合わせて公表 2026.07.29 Sources: microsoft.ai/news — Hill-climbing MAI models (07-23) / MAI-Image-2.5-Pro and MAI-Voice-2-Flash (07-23) / Optimizing the frontier performance curve (07-29) / MAI-Code-1.1-Flash (08-11) / MAI-Cyber-1-Flash (08-13) 52
  47. SUBSTITUTABILITY AS A DESIGN REQUIREMENT コストだけではない — レジリエンスという便益 “ しかし、メリットはコストだけではありません。レジリエンス(強靭性)にもあります。

    今やあらゆる企業は、自社が依存している特定のモデルが、 セキュリティインシデント、ビジネス上・ポリシー上の不一致、あるいは地政学的な変化によって、いつ利用できなくなってもおかしくない、 という前提に立つ必要があります。 リスクの3類型 設計要件 MAI 自身の実践 – セキュリティ事故:依存先モデルが停止・侵害される – – – 商流/方針の不一致:契約条件・利用規約・提供 方針の変更 – プロダクトやエージェントシステム内の全モデルは差し替え 可能であるべき – ハーネス・コンテキスト・メモリ・アクション空間を単一モデ (自社純血ではない) – ルファミリーから独立に構築する 地政学的変化:輸出規制・データ所在地・制裁など – これが可能になって初めて substitutability が実現する MDASH は MAI-Cyber-1-Flash と GPT-5.4 を併用 モデルは Foundry / OpenRouter / Fireworks / Baseten で提供され、重み調整も可能 – 「Only you control the resulting model」— 顧客 側の所有権も設計に含める Source: microsoft.ai/news — Optimizing the frontier performance curve, Mustafa Suleyman (2026-07-29) / Source: microsoft.ai/news — Introducing MAI-Cyber-1-Flash inside MDASH (2026-08-13) / Source: microsoft.ai/news — Microsoft Build 2026: MAI keynote transcript (2026-06-02) 53
  48. MODEL MONDAYS SEASON 4, EPISODE 1 セッション概要 番組 配信日 テーマ

    尺 Model Mondays(Microsoft Reactor) シーズン4 第1回 2026年8月11日 Microsoft AI Models Spotlight 約56分 A S Y S Amy Boyd ホスト(UK) Sophie MAI プロダクトチーム Yanan(Jana) MAI PM/コーディングモデル Sharmila ニュースハイライト Microsoft Developer Relations。後半で MAI 画像モデル3種を Foundry 上で実践検証したデモを披露。 Microsoft AI 内のフロンティアモデル研究チームのプロダクト側。MAI の思想、トークン効率、モデルファミリー、ヒルクライミング、RLE を担当。 MAI-Code-1-Flash の学習・評価・A/B 運用を解説し、4本のライブデモを実施。1.1-Flash の画像理解を先出し。 Foundry 全体のモデル動向(AT&T×AMD、GPT-Transcribe、Kimi K3、Claude Opus 5、Microsoft AI Labs)。 位置づけ:本セッションは 8月11日時点の一次情報であり、ブログ未掲載の実運用データ(GitHub Copilot の A/B フライト履歴、MAI-Code-1.1-Flash のベンチ表、1.1-Flash の画像理解)を含む。以降のスライドではこれらを 中心に扱う。 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 55
  49. TEN PILLARS, FOUR CLAIMS MAI が掲げる10本の柱と4つの主張 1 AI Infra MAI

    models are built from scratch, not distilled 2 Silicon MAI モデルはゼロから構築され、蒸留されていない 3 Reasoning 4 Coding 5 Tool use 6 Helpfulness 7 Safety 8 Efficiency 9 Harnesses 10 RLEs Trained on a clean lineage of commercially safe training data 商用上安全な、クリーンな系譜の学習データで訓練されている Designed to ensure more efficient Return on Token spend トークン支出に対するリターンをより効率的にするよう設計されている Continuously improving through our hill climbing machine ヒルクライミング・マシンを通じて継続的に改善し続ける 注:スライド上の表記は “RLEEs” だが、文脈・他資料から RLEs(Reinforcement Learning Environments)を指す。 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 56
  50. HILL-CLIMBING WITH PRODUCT EXPERIMENTS GitHub Copilot の A/B フライト履歴(Reactor 初公開)

    Every gain proven on live product signals, not public benchmarks. Jun 2 Jun 18 Jun 28 Jul 20 Build launch More clients: CLI · Apps · VS GA: Business + Enterprise Experiments for 1.1-Flash RC May Jun 8 Jun 24 Jul 6 Jul 13 Jul 16 Next A/B experiments to decide release candidate Flight: big wins Didn't beat Flight: big wins Didn't beat Flight: big wins 1.1-Flash Jun 8 flight — big wins Jul 6 flight — new engine Jul 16 flight — big wins −25% P50 tokens / user 2× Throughput +2% Survival rate +9% 3-day engagement −10% Time to first token −13% Errors +4% User-initiated turns −25% Time between tokens −10% Turn cancellations −14% Turn cancellations Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 57
  51. WE REALLY TREAT MODEL AS BUILDING A PRODUCT モデルを「プロダクトとして」作る Training

    Evaluation – GitHub Product Harness をそのまま学習に使用(VS Code / Copilot CLI) – – 学習中からモデルは本番で使えるツールに接触し、最良のトークン効率と品質を得る操作 を学ぶ 公開・内部ベンチマークを「本番ハーネスに載せて」評価(ベンチのコードを単体で走らせな い) – 本番指標:Quality / Efficiency / Engagement の3系統を継続監視 Controlled A/B experiment — ライブトラフィックで測る3つのシグナルファミリー Code quality Token efficiency Engagement – 受諾されたコードの量 – タスク完了に必要なトークン数 – ユーザーが再訪して使い続けるか – x 分後に残存しているコードの量 – commit に至るまでのターン数 – ユーザー起点のターン数 – git commit を生き延びたコードの量 「code survival(git commit を生き延びたか)は、そのコードが本当に使えるものだったかを示す非常に強いシグナル」— Yanan, MAI PM Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 58
  52. FOUR DEMOS, FROM GREENFIELD TO MULTIMODAL ライブデモ — MAI-Code-1-Flash の実力

    Greenfield 01 ラーメン&コーヒー店の架空サイト Brownfield 02 OSS ノートアプリ「memos」にカテゴリ機能を追加 Brownfield 03 OSS 拡張「VS Code Pets」に飛行機能を追加 Sneak peek 04 MAI-Code-1.1-Flash のネイティブ画像理解 「fictional ramen coffee roaster のサイトを作って」という極めて汎用的な単一プロンプトから、HTML / CSS / JavaScript を生成。ローカルサ ーバを立ち上げて表示まで実施。メニュー、写真、営業時間、地図プレースホルダを含み、ズームに追随するレスポンシブ設計まで作り込まれてい た。 既存コードベースを検索して文脈を把握 → 実装計画を立案 → 修正を適用。タグ、色分け、コンテキストメニュー、既定色の設定、上部のフィ ルタチップまで追加。2回のプロンプトと小さな追い修正で完了。 単一プロンプトでボタンと飛行挙動を実装。ペットが画面上端をはみ出す不具合とボタン意匠を追加プロンプトで是正。狐と鶏が飛ぶところま で動作確認。 ベンチマーク数値の表 PNG とデザイナー作のモックアップ PNG の2枚を添付し、単一プロンプトでグループ化棒グラフの index.html を生成。凡 例・配色・数値(72.6 / 8.6K)まで正しく再現。収録時点で未提供、「できるだけ早く出荷したい」と表明。 実務ヒント(Yanan):「小さいモデルを使うときは、フロンティアモデルに投げるときよりもプロンプトを少し具体的に書くとよい」 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 59
  53. HANDS-ON WITH THE IMAGE FAMILY — AMY BOYD 開発者による画像モデル実践レビュー MAI-Image-2.5-Flash

    MAI-Image-2.5 MAI-Image-2.5-Pro 背景差し替え(EC 出品用) 実写の編集(不要物の除去) キャラクター一貫性の検証 – 自宅で撮った1枚のワンピース写真から、スタジオ/パリのア パルトマン/ミニマル背景など複数バリエーションを生成 – 洗車待ちで撮った写真に写り込んだ指を除去 – – 最も評価された点は「触っていない部分が変わらないこと」 旧 Microsoft DevRel マスコット「Bit」(ぬいぐるみ)の実 写1枚を参照に評価グリッドを作成 – 並列呼び出しで短時間に6枚を生成 – – – ハンガー用のループタグまで含めた衣服の一貫性が高い 花の写真では明るさ補正のついでに散らかった台所も整頓 された 検証軸:再現性/カメラアングル/ライティング/スケール と遮蔽/衣装追加/物体との相互作用/ポーズ – 評価:「impressive quality, incredible speed, very good cost」 – 旅行写真ではグレアと雑多な要素を除去し自然な仕上が りに – ランヤード・コート・バックパックの追加は特に高評価 – 腕が極端に短いため、ノートPC操作など一部の相互作用 は苦手 いずれも Microsoft Foundry にデプロイして検証。MAI Playground と OpenRouter でも試用可能。フィードバックは Microsoft Foundry Discord へ。 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 60
  54. WEEKLY HIGHLIGHTS — WHAT ELSE MOVED Foundry エコシステムの周辺動向 「Tokenomics(トークン経済)とキャパシティが“the words

    of the day”になった。最新最高のモデルがあっても、顧客がキャパシティの制約で使えなければ意味がない。」 AT&T × AMD Foundry Managed Compute の顧客事例 GPT-Transcribe / GPT-LiveTranscribe Foundry の音声 AI 強化 Kimi K3 Fireworks AI 経由で Foundry に Claude Opus 5 Foundry で提供、Azure 上にネイティブホスト Microsoft AI Labs 実験段階の技術に触れる場 AT&T は Foundry Managed Compute で専有 GPU を確保し、GPT-5.4 / GPT-OSS-120B / GMA 4 などのオープンモデル群で約1兆トークンを処理。AMD と NVIDIA の双方の GPU でインフラ・コスト・モデル選択を最適化し、開発を加速しながら数千万ドル規模を節約した。 録音音声とライブ音声の双方に対応した高品質な音声認識。リアルタイム会議アシスタント、コンタクトセンター、音声エージェント、文字起こしワークフローを低レ イテンシとエンタープライズ対応 API で構築できる。 100万トークンのコンテキストウィンドウ。巨大なコードベース、長大な文書、数時間規模の書き起こしを横断して推論する用途向け。オープンモデルが本番グレード の API 作業に使える範囲を広げた。 コーディング、長時間稼働エージェント、複雑なエンタープライズ推論のフロンティアを押し広げるモデル。Build 以降 Anthropic モデルは Azure 上でネイティブにホ ストされ、データが Azure 環境から出ることを気にせず利用できる。 主流化する前の最新 AI イノベーションを探索する新しい入口。実験的モデル、インタラクティブなデモ、初期の研究プロジェクトを公開(5.4 reasoning、vision 、Aurora などの更新)。利用が伸びたものが実験段階から本番へ移行していく。 Source: Microsoft Reactor — Model Mondays S4E1 “Microsoft AI Models Spotlight” (2026-08-11) 61
  55. SYNTHESIS 3ヶ月の総括 — 5つの構造変化 01 競争軸の移動 「最大のモデル」から「システムとしての性能曲線」へ。モデル単体の順位表ではなく、モデル×ハーネス×RLE の共最適化が勝敗を決める。MAI はこれを 7月29日に

    明文化した。 02 ベンチから本番指標へ MAI は公開ベンチではなく code survival / return visits / turn cancellations といった製品指標で登坂を判定している。Reactor の A/B フライト履歴(6/8・ 7/6・7/16)はその運用実態を示す一次証拠。 03 価格が武器になった Image-2-Efficient の 41%減、Voice-2-Flash の 32%減、Code-1.1-Flash の 1/4 と、値下げが四半期ごとの定例イベントになった。ファミリー内に 6倍の価格レ ンジを意図的に用意している。 04 垂直統合の完成 データ → RLE → モデル → ハーネス → シリコン(Maia 200)→ プロダクト → 利用データ、という閉ループを Microsoft は全層で保有する。「The advantage isn't the model. It's owning the loop that improves it.」 05 自社純血ではない MDASH は GPT-5.4 を併用し、Foundry は Claude Opus 5 や Kimi K3 をホストする。MAI の主張は「自社モデルが最強」ではなく「タスクに最適なモデルを最 適な価格で選べる状態」を作ることにある。 結論:Microsoft AI の3ヶ月は「新しいモデルを出した3ヶ月」ではなく、「モデルを出し続ける仕組みを外部に見せた3ヶ月」だった。評価すべきはモデルの順位ではなく、登坂の速度と再現性である。 64