Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
AI時代のデータ基盤を考える問い
Search
Jun Ernesto Okumura
August 25, 2026
Technology
880
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AI時代のデータ基盤を考える問い
pUG FES 2026での基調講演のスライドです
https://pug.connpass.com/event/399492/
Jun Ernesto Okumura
August 25, 2026
More Decks by Jun Ernesto Okumura
See All by Jun Ernesto Okumura
40代データ人材のキャリア戦略
pacocat
4
4.6k
経営から紐解くデータマネジメント
pacocat
10
2.7k
GA technologiesの経営戦略から駆動するデータ基盤構築
pacocat
0
1.5k
KDD2022論文読み会:LinkedInの推薦システムから学ぶ
pacocat
0
1.6k
Introduction to Interleaving Ranking Evaluation
pacocat
1
1.8k
Airbnbの機械学習導入から学ぶ
pacocat
18
8.9k
"Causal Inference: Wha if" Chap11 - Why Model?
pacocat
0
3.4k
YouTube推薦アルゴリズムの変遷
pacocat
1
2.4k
白金鉱業Meetup Vol.11: 強化学習のビジネス活用の現場
pacocat
4
1.2k
Other Decks in Technology
See All in Technology
AIネイティブプロダクトで顧客価値を最大化するプロダクトエンジニアとFDEの協働
righttouch
PRO
0
230
株式会社シーエーシー エンジニア向け会社紹介資料
cac
0
57k
AIで仕事のやり方を変える
matsu7874
3
1.1k
例外の正しい扱い方 そのエラー try-catchして大丈夫?
jinwatanabe
3
460
多層防御と最⼩権限で実現する、安全なAIエージェント設計パターン
lycorptech_jp
PRO
1
260
From Vanilla Kubernetes to a Batteries-Included Platform: Developer Experience at 1,300+ Clusters
yosshi_
0
680
「重なり」は迎える側がつくる ― 人もAIエージェントも歓迎するプロダクトエンジニアリング ―
go0517go
PRO
0
280
20260906 「AWS運用入門」著者が教える、運用業務への生成AI活用入門
masaruogura
0
260
#jawssonic2026 あの時代が悪かった ~動かなかったSageMakerと共に迎えたイベント当日~
ktkn1129
0
140
Microsoft 365 Copilot chat -tekoälypalvelun tietosuojaongelmat
hponka
0
670
2026-09-11 【Snowflake World Tour Tokyo 2026】Snowflakeを起点に、AI Agentが自律稼働し続ける未来へ / Driving AI Agents with Snowflake
civitaspo
0
320
Multica × 長期記憶:40個のミニプロジェクト管理
eiei114
1
240
Featured
See All Featured
Why You Should Never Use an ORM
jnunemaker
PRO
61
10k
The AI Revolution Will Not Be Monopolized: How open-source beats economies of scale, even for LLMs
inesmontani
PRO
3
3.7k
Unsuck your backbone
ammeep
672
58k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2.1k
How to Grow Your eCommerce with AI & Automation
katarinadahlin
PRO
1
270
Build your cross-platform service in a week with App Engine
jlugia
234
19k
Side Projects
sachag
456
43k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
67
58k
Ruling the World: When Life Gets Gamed
codingconduct
0
330
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
52
6.1k
Accessibility Awareness
sabderemane
1
210
Templates, Plugins, & Blocks: Oh My! Creating the theme that thinks of everything
marktimemedia
31
2.9k
Transcript
AI時代のデータ基盤を考える問い #pUG FES 2026 2026.08.26 1
奥村 純 / Jun Ernesto Okumura 2014 @pacocat DeNA データアナリスト
機械学習エンジニア(強化学習) AI PdM 2019 Eureka (Match Group) 執行役員 / Data Director • データ組織(BI/AI/Data Management) の包括的なマネジメント 2024 GA technologies Group 執行役員 / Chief Data Officer • 経営戦略・データ戦略の策定と推進 好きな領域 • • • • toCビジネス データ分析 ML(推薦・強化学習) データ基盤技術 趣味 • 登山: 日本百名山挑戦中 14/100
情報発信など 出版・翻訳 note データ組織マネジメントについての発信 SpeakerDeck 推薦技術・因果推論・強化学習などの勉強会登壇 取材記事 「経験とカン」をデータで再現できるか。二人の博士が語る、変革の本質( NewsPicks. 2025)
CDOが語る - 求められるデータ人材像と、それを生かす組織風土とは( TECH+,2025) 「データの力で、GAグループ全体の意思決定の精度とスピードを加速させる」新執行役員・奥村純就任インタビュー( GAグループ公式note, 2024) 「マッチングアプリ婚」を後押しする、陰の立役者ペアーズの「質」は、どのように作り出されるか(東洋経済 , 2024) PairsのマッチングでAIが果たす役割とは?Pairs Data Director奥村純に聞く、感情感覚領域にある「AIにしかできないこと」(レバテックLAB, 2023) YouTubeの驚異のリコメンド力 強化学習は避けては通れない(日経クロストレンド , 2020) …
本講演のアウトライン technologiesの紹介 01 GA 不動産領域におけるデータ活動について 5つのテーマ 02 「AI時代のデータ基盤」を考える 国内外で注目されているトレンドを踏まえた観点の紹介 4
会社紹介 / GA technologies 5
事業紹介 / AI不動産投資サービス RENOSY
None
ワンクリックで不動産が流通する未来へ 8
不動産 × テックで広がる市場 • • 中古コンパクトマンションだけでなく、ファミリーマンションやアパート等への商材拡大 7つの国と地域を拠点に、グローバルを意図した事業展開 9
継続的な成長を支えるリアル × テック • • 事業の堅調な成長により収益・事業利益率が上昇基調 継続的な成長のために、データやテクノロジーの本質が問われる現場
不動産領域におけるデータ活動の特徴 ① サイロ化されたデータ ② 多様なデータ ③ 未発掘のユースケース • 事業主体や目的のばらつき •
データソース・仕様の多さ • 非構造化データ • 構造化データ • 不動産×データに関わる プレイヤーの少なさ データを標準化すること、 つながることで価値が生まれる 生成AI技術などで一足飛びに 活用フェーズが広がっている 新しい標準を作る面白さ 事業貢献余地の高さ 11
「AI時代のデータ基盤」を考える 5つのテーマ
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 13
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 14
従来型のデータ(分析)基盤 • • 構造化されたテーブルデータ を中心に、それらの加工と提供を前提に進化(2010s) 画像やテキストデータは機械学習パイプラインとして分岐することが多かった SQL ETL Data Lake
(半)構造化 データソース Data Warehouse Data Mart データウェアハウス DWH 特徴量 非構造化 データソース SQL 機械学習モデル 分析・ BI・可視化 検証 機械学習( ML) 15
AI利用を前提とした基盤 • • Transformer (2017) の登場で、画像/テキストの処理能力が劇的に改善(e.g. ViT, LLM) モデルへのアクセスが容易になり、構造データと非構造データを同時に扱える ように
Parsing / Embedding / SQL Table Data Lake House Vector Graph 構造化 + 非構造化 データソース 非構造データを含めた分析 BI・可視化ツール 検索・ RAG AI Agent データレイクハウス 16
不動産テック領域での非構造データ処理の意味 • • • お客様の問い合わせから物件の購入に至るまで、人が関わるプロセスが多く存在 音声・画像(e.g. 契約書、面談情報、間取り図)にこそ意味のある情報が記録される 扱いにくかった音声・画像・テキストが分析可能になることで、 いきなりデータ活用が本格化する「リープフロッグ現象」 が起きている
Web 問い合わせ Inside Sales 電話面談 Field Sales オンライン面談 ご成約 17
事例:お客様の声を示唆として提供する分析基盤 • 様々に記録されているお客様の声を加工・統合し、サービス改善に活かす 多様なソース Table Streamlit 集計 LLM LLM LLM
VoC 概要サマリー Emb. クラスタリング ベクトル化 VoC ※ Snowflake World Tour 2026 (9月10, 11日) でも詳細の解説をいたします https://www.snowflake.com/ja/world-tour/tokyo/ LLM 類似VoC検索 etc. 18
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 19
セマンティックレイヤー / オントロジーとは? データ、人間(ビジネス層)、AIをつなぐ抽象化レイヤー 新しい潮流であるが、従来型のディメンショナルモデリングの重要性は変わらない • • セマンティックレイヤー • •
複雑なデータベースやデータ基盤と、利用者の間に入る「翻訳・共通の意味」の層 売上や利益などの指標や計算ロジックを一元管理 し、誰がどのツールを使っても同じ数値や ビジネス用語でデータを扱えるようにする オントロジー • • 特定のビジネスドメインに存在する物事とその関係をモデル化した知識体系 AIやLLMにデータ同士の関係性を正しく把握させ、文脈に沿った推論や自動実行を可能にす る 20
セマンティックレイヤー( Semantic Layer)のイメージ 複雑なSQLテーブル構造やJOINルールを隠蔽し、誰がどのツールから検索しても同じ ビジネス用語(KPI・指標)で正しいデータが得られるように抽象化する 例:飛行機の遅延によるインパクトの集計 羽田発101便の欠航による影響を算出したい • 欠航損失額 =
返金対象チケット合計 + 振替ホテル代 • 顧客影響スコア = 影響を受ける人数 欠航損失額 = 1,200万円 影響顧客数 = 200人 「損失額は税抜き?」「返金手数料は引く?」といった計算ルールのブレや二重定義を防ぐ 21
オントロジー( Ontology)のイメージ ビジネスの登場人物(事物)同士が、どう繋がり、どう影響し合うかという「業務文脈」を機械に教え る [乗客] ──(予約する)──> [便] [便] ──(使用する)──> [機材]
────(割り当て)──> [後続便] [乗客] ──(所持する)──> [乗り継ぎ] ─(接続する)──> [他社便] [乗客] ──(持つ)─────> [ステータス(VIP等)] 業務文脈の定義 クエリ:「欠航した 101 便から、影響を受ける VIP乗客 と 連鎖遅延する後続便 をすべて抽出したい」 • 101便に乗る「乗客 A様」を特定 • 乗客A様は「VIP会員」であり、「国際線 301便」への乗り継ぎ予定 があることを関係性から発見 • さらに、101便に使われる予定だった「機材 X」が、折り返しで「 202便(福岡行き)」に使われる 連鎖遅延リスク を発見 単なる数値集計ではなく、ナレッジグラフ(関係性)を辿って影響を連鎖的に推論できる 22
オントロジーが注目されている背景 ベクトル検索では解決できない「複雑な文脈理解」を補うLLMとGraphRAGの組み合わせ 「実務の文脈」をAI Agentに与えることによる業務の自動化 グラフDB市場は今後も成長する見通し https://www.persistencemarketresearch.com/market-researc h/graph-database-market.asp Palantirの提唱しているオントロジーシステム https://www.palantir.com/docs/foundry/architecture-center/ontology-system 23
セマンティックレイヤーとオントロジーを通じたデータ活用基盤 AI Agentによる 業務の自動化 自然言語による分析 示唆出しの自動化 自然言語による 情報検索・示唆提供 Knowledge Graph
エンティティ リレーション Semantic Layer ビジネス用語 指標 階層 リネージ 文脈 ルール Data Warehouse / Data Lakehouse … 24
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 25
複数サービスの利用によるコストの増大 • • エンタープライズでは複数のデータサービスが同居して使われることが多い サービス毎にフォーマットやパーティションの扱い等が異なりコストがかかる ◦ 管理コスト、コミュニケーションコスト、重複コスト... Knowledge Graph …
Semantic Layer … Data Warehouse / Data Lakehouse … 26
オープンテーブルフォーマットによる製品を意識しない潮流 Netflixが「データレイク上の膨大なファイルを管理しきれない」課題を解決するために開発。 レイ クハウス基盤を実現するための事実上の標準規格として注目を集めている。 • S3やGCSなどクラウド上にあるデータに対を、単一のDWHのように扱える • メタデータ層を挟むことでデータレイク上でDWHと同等のACID保証を実現 • 統計情報を持つことによる読み込みの最適化
• タイムトラベル とスキーマ進化の機能 27
GA technologiesのデータ基盤 28
セマンティックレイヤーの標準規格 (旧 Open Semantic Interchange; OSI) ベンダー中立的で拡張可能な、セマンティックレイヤー構成要素の表現モデル • Snowflake, dbt
Labs, Cubeを中心に30+社が集まるイニシアチブになっている • YAMLによる宣言的記述 • BIツール間の連携だけではなく、AI Agentが読む前提で設計されている • https://github.com/apache/ossie で仕様が公開されている 29
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 30
再掲:LLMで広がる AIのユースケース Aのタスクをして欲しい Bについて分析して欲しい Cについて教えて欲しい … ナレッジベース LLM トランザクション (OLTP
/ DWH) AIエージェント 外部データ ツール群 31
再掲:同時に顕在化する論点たち ① 社内ナレッジをどのデータ管理するのか 今は「とりあえずやってみる」で OK。 徐々に向き合うことになる。 ナレッジベース ④ ガイドライン、民主化 •
• 活用推進体制 出力の品質管理 LLM トランザクション (OLTP / DWH) ② AIがアクセスし易いデータ基盤 ”AI向け”のデータ管理 データカタログ • • AIエージェント 外部データ ③ AIエージェントのガバナンス • • • AIのアクセスコントロール ハルシネーションなどの監視 個人情報・著作権等の法令順守 ⑤ 複雑化するシステムと組織 ツール群 • • 開発、運用体制 戦略策定機能 32
セキュリティやプライバシーだけではない管理の問題 • 「誰が」「どのデータに」アクセスできるかの設計と管理 • AI AgentやClaude Codeによるアプリケーションを誰が管理し続けるか ◦ ライフサイクルの設計 ◦
中央管理、統合するための昇格フローの設計 ◦ 利用状況の監視とログ ◦ ビジネスインパクトの把握 ◦ コストの把握と最適化(断捨離) ◦ … 活用する事業やチーム・技術領域が広がる分、統制の難易度は上がる 33
「AI時代のデータ基盤」を考える 5つのテーマ 1 構造データから非構造データへ AIを前提とした新たなデータ加工・提供を考える 2 セマンティックレイヤーとオントロジー 意味や関係、知識をどうデータ基盤として管理していくか 3 ベンダーの違いを意識しないデータ基盤
どのようなサービスを使って次世代データ基盤を構築するか 4 ガバナンス データの安全な利用をどのように守っていくか 5 マネタイズ 結局AI時代のデータ基盤でどう価値を出すのか 34
生成AIは事業に何をもたらしてくれるのか 「Generative AI and the future of work(生成AIと仕事の未来)」 セクションにて、テクノロジーによるタスク自動化(30%〜70%規模の業 務削減効果)やナレッジワーカーへの影響についての
試算が掲載されている AIの自動化がもたらす事業影響はせいぜい 2倍とも読める 単なる業務削減だけではない、本質的な活用が求められる https://www.mckinsey.com/capabilities/tech-and-ai/our-insights/the-economic-potential-of-generative-ai-the-next-productivity-frontier 35
再掲:データ基盤が目指すべき方向性 投資効率の高い経営 投資 1 利益 X倍 1の投資が、他の投資利回りを上回る利益を 生み出し、さらに再投資が加速する仕組み 利益 データが貯まったら、アプリケーションが利益を
生み、さらに良質なデータに還元される仕組み 投資効率の高いデータ基盤 データ 36
AI時代の事業変化を 5 Forces(5つの力)で考える 米国の学者マイケル・ポーターが提唱した、業界の競争環境と収益性を5つの要因から 読み解く経営フレームワーク。各力が強いほど利益を出しにくい構造と判断される。 新規参入 売り手 競合 買い手 代替品
※ 一般論の解説になるので、皆さんの事業に当てはめながら想像してみてください 37
AI時代の事業変化を 5 Forces フレームワークで考える ① 競合 新規参入 AIのコモディティ化によって、単に AIを搭載することの 技術的アドバンテージは弱まる
売り手 競合 買い手 対策例 代替品 • 自社固有データ による差別化 • オペレーションの徹底的な AI組み込みによるコス トリーダーシップの確保 38
AI時代の事業変化を 5 Forces フレームワークで考える ② 新規参入 新規参入 売り手 競合 買い手
(ソフトウェア事業の場合) AIを使ったソフトウェア開発 により、サービスの構築参入障壁が低下し、小規模プ レイヤーが参入しやすい市場に。 対策例 代替品 • 「データフライホイール(データと体験の好循 環)」 の確立 • 大手・先行だからこその課題理解やガバナンスな どの障壁の構築 39
AI時代の事業変化を 5 Forces フレームワークで考える ③ 代替品 新規参入 売り手 競合 買い手
(SaaS事業の場合)人間の操作自体が AI Agentや自 動化ワークフローに代替され、 UI/画面だけを 提供するプロダクトは無価値化していく。 対策例 代替品 • 「Point Solution(単機能ツール)」から オントロジーを使った AI Agent等を駆使した 「System of Action(行動の基盤)」への転換 • ライセンス数ではなく、 AIがもたらした成果やタス ク完了数に応じた成果報酬への転換 40
AI時代の事業変化を 5 Forces フレームワークで考える ④ 売り手 新規参入 (ソフトウェア事業の場合) LLMベンダーやクラウド企 業依存の高まりによるコスト変動リスク
売り手 競合 買い手 対策例 代替品 • マルチモデルの利用 • ベンダーを意識しない標準フォーマット への転換 41
AI時代の事業変化を 5 Forces フレームワークで考える ⑤ 買い手 新規参入 情報収集や比較能力が AIによって飛躍的に向上。 自身でのソリューション開発も可能に。
売り手 競合 買い手 対策例 代替品 • 比較に耐えうる商品設計、ブランド構築 • AISO(AI検索最適化)や LLMO(LLM最適化)へ の投資 42
まとめ • 「AI時代のデータ基盤」を考えるための5つの観点の提示 • AIの変化は早く、データ基盤は大きな変化を求められている。 不確実な中でこそ「急いでしっかり試す」が重要 • 事業を成長させること、世の中を変えること、から逃げない • もっと業界での知見交換が進むべきで、コミュニティ活動の意義は大きい
43
Data本部、積極採用中です! カジュアル面談お待ちしております!