Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
第182回 雲勉 【Gemini 3.0 Pro】AI ベンチマーク徹底比較!他モデルに比べ優...
Search
iret.kumoben
January 16, 2026
Technology
0
47
第182回 雲勉 【Gemini 3.0 Pro】AI ベンチマーク徹底比較!他モデルに比べ優れている点まとめ
下記、勉強会での資料です。
https://youtu.be/t5JX3In2Fnk
iret.kumoben
January 16, 2026
Tweet
Share
More Decks by iret.kumoben
See All by iret.kumoben
第181回 雲勉 WEB制作者のちょっとした面倒をAWSで解決!Amazon S3とAWS Lambda活用術
iret
0
46
第180回 雲勉 Abuse report の調査・確認方法について
iret
0
71
第179回 雲勉 AI を活用したサポートデスク業務の改善
iret
0
100
第178回 雲勉 Amazon EKSをオンプレで! Amazon EKS Anywhere 実践構築ガイド
iret
1
71
第177回 雲勉 IdP 移行を楽に!Amazon Cognito でアプリへの影響をゼロにするアイデア
iret
0
79
第176回 雲勉 VPC 間サービス接続を考える!Private Service Connect 入門
iret
0
65
第175回 雲勉 Amazon ECS入門:コンテナ実行の基本を学ぶ
iret
0
98
第174回 雲勉 Google Agentspace × ADK Vertex AI Agent Engineにデプロイしたエージェントを呼び出す
iret
0
140
第173回 雲勉 ノーコードで生成 AI アプリを構築!Google Cloud AI Applications(旧 Vertex AI Agent Builder)入門
iret
0
110
Other Decks in Technology
See All in Technology
データの整合性を保ちたいだけなんだ
shoheimitani
8
3.2k
コスト削減から「セキュリティと利便性」を担うプラットフォームへ
sansantech
PRO
3
1.6k
Tebiki Engineering Team Deck
tebiki
0
24k
30万人の同時アクセスに耐えたい!新サービスの盤石なリリースを支える負荷試験 / SRE Kaigi 2026
genda
4
1.4k
量子クラウドサービスの裏側 〜Deep Dive into OQTOPUS〜
oqtopus
0
150
Exadata Fleet Update
oracle4engineer
PRO
0
1.1k
茨城の思い出を振り返る ~CDKのセキュリティを添えて~ / 20260201 Mitsutoshi Matsuo
shift_evolve
PRO
1
420
マネージャー視点で考えるプロダクトエンジニアの評価 / Evaluating Product Engineers from a Manager's Perspective
hiro_torii
0
190
顧客の言葉を、そのまま信じない勇気
yamatai1212
1
370
Context Engineeringが企業で不可欠になる理由
hirosatogamo
PRO
3
680
Webhook best practices for rock solid and resilient deployments
glaforge
2
310
生成AIと余白 〜開発スピードが向上した今、何に向き合う?〜
kakehashi
PRO
0
160
Featured
See All Featured
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
440
svc-hook: hooking system calls on ARM64 by binary rewriting
retrage
1
110
Public Speaking Without Barfing On Your Shoes - THAT 2023
reverentgeek
1
310
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.1k
The Psychology of Web Performance [Beyond Tellerrand 2023]
tammyeverts
49
3.3k
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
35
2.4k
Discover your Explorer Soul
emna__ayadi
2
1.1k
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
16k
Designing for Timeless Needs
cassininazir
0
130
Scaling GitHub
holman
464
140k
Prompt Engineering for Job Search
mfonobong
0
160
Google's AI Overviews - The New Search
badams
0
910
Transcript
青木 駿弥 アイレット株式会社 【Gemini 3.0 Pro】AIベンチマーク徹底比較! 他モデルに比べ優れている点まとめ 第
182 回 雲勉
01 アジェンダ 自己紹介 02 そもそもベンチマークとは 03 Gemini 3.0 Proの優れている点 04
まとめ
青木 駿弥 • DX開発事業部 フルスタックセクション エン タープライズシステムグループ • 2025年新卒入社、アイレット歴:9ヶ月 •
緊張しますが精一杯頑張ります! アイレット株式会社 あ お き しゅ ん や Profile お写真 ★ご質問は YouTubeのコメント欄で 受け付けております。後日回答させていただきます! ★チャンネル登録よろしくお願いします!
そもそもベンチマークとは
私たちが学校で「国語」「数学」「英語」 の試験を受けて学力を測るのと同じように、 AIも「論理的思考」「画像認識」「プログラミング」 といった観点で、様々なテストを受けることで、 総合力や得意・不得意を判定します。 AIの実力テストのようなもの そもそもベンチマークとは 5 参考:https://blog.google/products/gemini/gemini-3/#gemini-3-deep-think
そもそもベンチマークとは 6 参考:https://blog.google/products/gemini/gemini-3/#gemini-3-deep-think ベンチマークの数値の差と個人的な見解で、 以下7つをピックアップ 1. ARC-AGI-2 2. GPQA Diamond
3. MathArena Apex 4. ScreenSpot-Pro 5. SWE-Bench Verified 6. Vending-Bench 2 7. SimpleQA Verified
Gemini 3.0 Proの凄さ
Gemini 3.0 Pro の凄さ 8 ARC-AGI-2 未知の法則性を見つけ出す力を測るテスト Gemini 3.0 Pro
の凄さ 31.1% の正答率 学習データにない新しい状況に直面しても、 「自ら考え、柔軟に適応して問題を解決」 する能力が高い! 参考:https://arcprize.org/arc-agi/2/ LLMに数字の2次元配列データが与えられ、 そこにある抽象的なルールを推論。 その推論に基づき正解の配列orそれを生成するコードを出力
Gemini 3.0 Pro の凄さ 9 GPQA Diamond 物理学、化学、生物学の分野で、博士号を持つ 専門家が作成した高難易度の問題集 Gemini
3.0 Pro の凄さ 博士号保持者でも7割しか解けない問題を91.9% 参考:https://epoch.ai/benchmarks/gpqa-diamond AIの知能が人類のトップ層を追い越した 専門的な科学分野のテキストによる質問と、 4つの選択肢が与えられ、正解の選択肢(A)を返す
Gemini 3.0 Pro の凄さ 10 MathArena Apex 超高難易度の数学ベンチマーク AIが正解できなかった問題だけを集めた超高難易度の問題集 Gemini
3.0 Pro の凄さ 参考:https://matharena.ai/apex/ 他AIモデルの正答率:1.0%〜1.6% Gemini 3.0 Proの正答率:23.4% 論理を組み立て、自力で正解を導き出す推論能力が非常に高い 数学オリンピックなどの問題文が与えられ、LLMは思考プロセスと回答をアウ トプット
Gemini 3.0 Pro の凄さ 11 ScreenSpot-Pro AIがプロ向けソフト(VS CodeやAutoCADなど )の画面をどれだけ正しく認識 し、操作できるかを評価するためのテスト
Gemini 3.0 Pro の凄さ 72.7% の正答率 人間のように画面を見て、マウス操作までもAIが完全 に代行できるようになる未来の可能性 参考:https://github.com/likaixin2000/ScreenSpot-Pro-GUI-Grounding 参考:https://arxiv.org/abs/2504.07981 画面のスクリーンショットと自然言語による指示(設定アイコンを開いて) が与えられ、LLMは該当箇所の座標を数値で返します
Gemini 3.0 Pro の凄さ 12 SWE-Bench Verified AIが実務レベルのソフトウェアエンジニアとして機能するかを測るテスト Gemini 3.0
Pro の凄さ 単なるコーディングだけでなく、システムの整合性を保ったまま修正でき る高度な文脈理解力 参考:https://www.swebench.com/ コーディング特化AIではないのにも関わらず、スコア76.2%を記録 まさに、高水準汎用AI Django, Flaskなど、有名なPythonライブラリの実際のバグ修正を行わせ、最 終的に実際にコードを書き換えるためのパッチファイルを返す
Gemini 3.0 Pro の凄さ 13 Vending-Bench 2 AIの「長期記憶」と「一貫性」を測る指標となるテスト Gemini 3.0
Pro の凄さ 約5,478ドル の儲け ロングコンテキストを活かした「高い信頼性と安定感」 参考:https://arcprize.org/arc-agi/2/ 自動販売機のオーナーとして、仕入れ・価格設定・在庫管理・顧客対応を行う 毎日変化するビジネスの状況が与えられる 最終的にいくら儲けたか
Gemini 3.0 Pro の凄さ 14 SimpleQA Verified 質問に対して、どれだけ正直に答えることができるか つまり、ハルシネーションがどれほど少ないかを測るテスト Gemini
3.0 Pro の凄さ 72.1% という高いスコア ビジネスや学術用途で使用する際に 「信頼感」は非常に重要なポイント 参考:https://arcprize.org/arc-agi/2/ Correct: 正しい答え Incorrect: 間違った答え(知ったかぶり) ※これが最悪の評価 Not Attempted:「分かりません」と答える (間違えるよりはマシと評価される)
まとめ
まとめ 16 1 2 Gemini 3.0 Proは高水準の汎用AIモデル AIの進化の早さは想像以上 https://deepmind.google/models/gemini/ 3
特定のAIモデルやツールに固執することなく、 様々なAIを小さく試すことが重要