Upgrade to Pro — share decks privately, control downloads, hide ads and more …

BedrockのOpenAIモデルでWeb検索が使えるようになったので、Tavilyと⽐べてみた

Avatar for Manato Sano Manato Sano
August 31, 2026
16

 BedrockのOpenAIモデルでWeb検索が使えるようになったので、Tavilyと⽐べてみた

Avatar for Manato Sano

Manato Sano

August 31, 2026

More Decks by Manato Sano

Transcript

  1. 自己紹介 マナティ / Manato Sano 2026 Japan AWS Jr.Champions 好きなAWSサービス:Bedrock,

    Lambda, Kiro 一言:みなさ~ん!さんぽ神、しませんか??^ ^
  2. 01 Bedrock Web Search とは? 2026年8月、Bedrock上のOpenAIモデル(GPT-5.4/5.5/5.6)で Web Searchが利用可能に APIに tools=[{"type":

    "web_search"}] を1つ足すだけ 外部の検索APIもオーケストレーションも不要 これまで (Tavily等) Bedrock Web Search 1. 外部検索APIを呼び出し 1. APIを1回呼ぶだけ 2. 結果をLLMにコンテキスト付与 3. 回答生成 検索→回答まで自動で完結 → API 1回で完結!外部APIキー不要 → API 2回 + 自前オーケストレーション 参考:https://aws.amazon.com/jp/about-aws/whats-new/2026/08/amazon-bedrock-web/
  3. 02 比較した3つの手法 Bedrock Web Search Nova Web Grounding Tavily +

    Claude ※ 回答を生成するAIモデルが手法ごとに異なるため、厳密には検索品質だけの比較ではございません
  4. 03 比較方法:220問 × 3手法 × 4評価軸 質問セット 評価方法 カテゴリ 問数

    狙い LLM-as-a-Judge factual 68問 事実確認 (Claude Sonnet 5 で自動採点) recent_news 32問 最新情報 technical 60問 技術説明 comparison 60問 判断・比較 事実正確性 誤情報がないか 網羅性 各側面をカバーしているか 引用品質 出典URLが適切か 情報鮮度 最新情報を反映しているか 日本語110問 + 英語110問 検出力分析で必要サンプル数を事前計算 https://aws.amazon.com/jp/blogs/machinelearning/use-custom-metrics-to-evaluate-yourgenerative-ai-application-with-amazon-bedrock/ 660回のAPI呼び出しを実行(220問 × 3手法)しました!
  5. 04 結果:全体スコア 手法 事実正確性 網羅性 引用品質 情報鮮度 総合 Bedrock Web

    Search 4.13 4.02 2.92 3.00 3.52 Tavily + Claude 3.85 3.72 3.29 3.12 3.50 Nova Web Grounding 3.60 3.55 1.06 2.38 2.65 ここだけは伝えたいポイント! = Bedrock Web Search と Tavily + Claude はほぼ互角(p=0.97、有意差なし) ! 得意分野が違う:事実正確性ならBedrock、引用と鮮度ならTavily ▼ Nova Web Grounding は両方に対して有意に低い(p<0.0001)
  6. 05 発見① 35%の質問で検索をスキップ カテゴリ別スキップ率 35.5% Bedrock Web Searchが 検索をスキップした割合 technical

    50% comparison 50% factual 22% recent_news 9% 検索あり vs なしで正確性に差あり 検索あり → 4.19 検索なし → 4.03 p=0.01 で有意差あり。 検索した方が正確なのにもったいない…
  7. 06 発見② 日本語と英語で差がある 手法 日本語 英語 有意差 Bedrock Web Search

    3.37 3.67 あり (p=0.02) Nova Web Grounding 2.53 2.77 あり (p=0.006) Tavily + Claude 3.44 3.55 なし (全てp>0.2) ポイント Bedrock / Nova は英語の方がスコアが高い → AWS Webインデックスは英語コンテンツが充実 Tavily + Claude は日英で差なし → 日本語ブログ(DevelopersIO等)も検索対象に含む 日本語メインで使うなら Tavily + Claude の安定性は大きなメリット
  8. 07 やったね!external_web_access が有効に! 8/4 8/10 8/19 Web Search GA (インデックスのみ)

    検証時 (未対応) external_web_access が有効に! 検証時: external_web_access=True でもライブWeb取得は未提供だった 8/19のアップデートで外部Webアクセスが有効に! ライブWebから直接コンテンツを取得可能になりました! bedrock-websearch:ExternalWebAccess の IAM権限が必要 情報鮮度の課題が改善される可能性あり → 再検証したい… 参考:https://aws.amazon.com/jp/about-aws/whats-new/2026/08/amazon-bedrock-web-access-web-search/
  9. まとめ 1 Bedrock Web Search と Tavily + Claude は総合スコアで互角のレベル

    得意分野が違う:正確性ならBedrock Web Search、引用と鮮度ならTavilyにしよう! 2 日本語では Tavily + Claude が安定 Bedrock Web Search / Nova Web Grounding は英語が有意に優勢 3 Bedrock Web Search は35%で検索スキップしてしまう… 検索した方が正確なので対策が必要! 4 external_web_access が有効になり 情報鮮度が改善される可能性 → 再検証したい…!
  10. おまけ 今日紹介しきれなかったことはブログ記事に書いてます!ぜひ! ブログでは他にも… 環境構築の詳細 / カテゴリ別の詳細分析 / 差が出た質問の具体例 レイテンシ比較 /

    今回見えなかったこと / コード全文 Qiita BedrockのOpenAIモデルでWeb検索が使えるように なったので、Tavilyと比べてみた https://qiita.com/manaty/items/dde0f3f0b032ac91d56e Thank you!