Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
AWS Clean Roomsで結合した データを使った機械学習
Search
Sponsored
·
SiteGround - Reliable hosting with speed, security, and support you can count on.
→
西岡 賢一郎 (Kenichiro Nishioka)
June 24, 2023
Technology
260
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AWS Clean Roomsで結合した データを使った機械学習
機械学習の社会実装勉強会第24回 (
https://machine-learning-workshop.connpass.com/event/285731/
) の発表で使用した資料です。
西岡 賢一郎 (Kenichiro Nishioka)
June 24, 2023
More Decks by 西岡 賢一郎 (Kenichiro Nishioka)
See All by 西岡 賢一郎 (Kenichiro Nishioka)
AIエージェントを雇う前に決める5つのこと
knishioka
1
180
顧客に説明できる、 安全なAIの使い方 - 会計士・税理士向けAI活用勉強会 第2回
knishioka
0
110
ローカルLLM、実際どこまで使えるか
knishioka
0
88
会計士・税理士向け AI活用勉強会第1回
knishioka
0
130
権限は渡さない、操作だけ切り出す ― 自前MCPサーバー実践入門
knishioka
0
110
AIガバナンス実践 - 生成AIコネクタのデータ漏洩リスクと実務対策
knishioka
0
310
データサイエンスの現場から学ぶ 成功と失敗の実像と生成AI時代の展望
knishioka
0
120
ハーネスエンジニアリング入門
knishioka
0
870
OpenClawでPM業務を自動化
knishioka
2
720
Other Decks in Technology
See All in Technology
BedrockとLambdaで作る リアルタイム進行型推理ゲーム
kawametho
0
120
VS Code × GitHub Copilot での Fabric 開発
ryomaru0825
1
190
Oracle Cloud Infrastructure(OCI):Onboarding Session(はじめてのOCI/Oracle Supportご利⽤ガイド)
oracle4engineer
PRO
3
21k
AIに賢く動いてもらうためのコンテキスト〜Snowflake女子会 vol.8
snowwmn0824
0
200
AI駆動開発で仕様はどこまで書くべきか? ― 人とAIの責務境界から考える開発プロセスの実践
takahiromatsui
1
250
Argo CDとAtlantisで実現するインフラ管理のセルフサービス化──小規模SREチームで支えるプラットフォーム
cassius7
0
250
MCPゲートウェイを作って運用してわかったこと — Agent時代の権限管理の現在地
mtpooh
6
1.4k
AI Native Platform Engineering 〜PlatformとAgileで“作る速さ”を“価値”へ〜
uya116
0
510
Claude Designがめちゃくちゃ便利なので使ってほしい
diggymo
0
170
カンファレンスに参加した後の浮遊感とセルフケア
pauli
0
250
全社共通データ基盤をつくる。ソニーのDatabricks活用とデータガバナンス設計の裏側
sony
0
250
AWS DevOps Agent スキルをつかいこなそう / Master AWS DevOps Agent Skills
kinunori
2
640
Featured
See All Featured
HDC tutorial
michielstock
2
930
The Psychology of Web Performance [Beyond Tellerrand 2023]
tammyeverts
49
3.6k
Lightning Talk: Beautiful Slides for Beginners
inesmontani
PRO
2
710
Organizational Design Perspectives: An Ontology of Organizational Design Elements
kimpetersen
PRO
1
840
Into the Great Unknown - MozCon
thekraken
41
2.7k
A Soul's Torment
seathinner
8
3.7k
Build The Right Thing And Hit Your Dates
maggiecrowley
39
3.5k
The Art of Programming - Codeland 2020
erikaheidi
57
14k
Helping Users Find Their Own Way: Creating Modern Search Experiences
danielanewman
31
3.4k
Imperfection Machines: The Place of Print at Facebook
scottboms
270
14k
Faster Mobile Websites
deanohume
310
32k
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
430
Transcript
AWS Clean Roomsで結合した データを使った機械学習 3rd Party Dataを用いた機械学習 2023/06/24 第24回勉強会
自己紹介 • 名前: 西岡 賢一郎 ◦ Twitter: @ken_nishi ◦ note:
西岡賢一郎@研究者から経営者へ (https://note.com/kenichiro) ◦ YouTube: 【経営xデータサイエンスx開発】西岡 賢一郎のチャンネル (https://www.youtube.com/channel/UCpiskjqLv1AJg64jFCQIyBg) • 経歴 ◦ 東京大学で位置予測アルゴリズムを研究し博士 (学術) を取得 ◦ 東京大学の博士課程在学中にデータサイエンスをもとにしたサービスを提供する株式会社ト ライディアを設立 ◦ トライディアを別のIT会社に売却し、CTOとして3年半務め、2021年10月末にCTOを退職 ◦ CDPのスタートアップ (Sr. PdM)・株式会社データインフォームド (CEO)・株式会社ディース タッツ (CTO) ◦ 自社および他社のプロダクト開発チーム・データサイエンスチームの立ち上げ経験
本日のお話 AWS Clean Roomsで結合したデータを使った機械学習の可能性について紹介 • AWS Clean Roomsと2つのAnalysis Rule •
機械学習に必要なデータ • AWS Clean Roomsで生成されるデータの実例
AWS Clean Roomsと2つのAnalysis Rule
AWS Clean Roomsとは • 生データを相手に共有することなく、3rd Partyデータを結合して分析できるようにするツール • 結合のためのキーが必要 (e.g. 個人識別子)
• 結合に使用したキーは分析結果からは省かれる Data Clean Roomの分析イメージ
AWS Clean Roomsの2種類のAnalysis Rule AWS Clean Roomsの分析は2種類 • Aggregation Type
◦ COUNT、SUM、AVG関数を用いて統計情報を 任意の次元で集計するクエリーが可能 ◦ セグメント分析、測定、アトリビューション など • List Type ◦ クエリ可能なメンバーのテーブルの重なりの 行レベルのリストを出力するクエリを許可 ◦ データのエンリッチメントやセグメント構築 など
Analysis Rule Typeの制約 • 異なる種類のAnalysis Rule Typeを使うクエリを走らせることはできない • AggregationのRuleを持つテーブルのみ、もしくはListのRuleを持つテーブルのみ でクエリを構成する必要がある
• 同じテーブルをもとにしていても、Analysis Type用とList Type用それぞれのテー ブルを設定する必要がある
機械学習に必要なデータ
よくある機械学習 • 学習に必要となる変数 ◦ 教師あり学習: 説明変数と目的変数 ◦ 教師なし学習: 説明変数 •
複数ユーザのデータを用いてモデルを学習 • 学習したモデルを用いて、ユーザ一人ひとりをスコアリング
AWS Clean Roomsで学習・推論データを用意 • 学習と推論で説明変数を揃える必要がある
AWS Clean Roomsで生成されるデータ • 結合には主に個人識別子が使われる • 結合のキーは分析結果から取り除かれる • 片方のデータをフィルタリングとしてのみ使うこともありうる ◦
e. g. 属性C = Xに限定し、企業Aのデータのみでモデルを学習
Analysis Ruleによる出力結果の違い • 結合に使ったキーが取り除かれるのは、Aggregation TypeとList Typeで共 通 • Aggregation Typeでは複数ユーザが集計された結果となる
• List Typeではユーザの集計はされないが、重複する結果が削除される
AWS Clean Roomsで生成されるデータの実例
今回使用するデモデータ • 2種類のAnalysis Rule ◦ 3rd PartyデータをAggregation Typeで集計しつつ結合 ▪ 3rd
Partyに保存されている広告インプレッションデータを用いた分析 ◦ 3rd PartyデータをList Typeで結合 ▪ 3rd Partyに保存されているユーザ属性データを用いた分析
Analysis Rule: Aggregation Type • Aggregate functions ◦ 許可する集計関数とその関数を利用できるカラムを指定 ◦
COUNT, COUNT DISTINCT, SUM, SUM DISTINCT, AVGか ら選択可能 • Join controls ◦ 他のテーブルとINNER JOINするためのキーを設定 (複数 キー指定可能) ◦ JOINで使用するキーはクエリ結果には表示されない ◦ テーブル単体でのクエリ (JOINなしのクエリ) の許可 • Dimension controls (optional) ◦ 集計するためのディメンション (キー) を指定 • Scalar functions ◦ ABS, ROUND, CASTなど13個の関数 (2023/04/29現在) から選択 可能 ◦ 適用可能なスカラー関数を制御 ◦ ディメンション列に適用可能 ◦ 他の関数の上や他の関数内で使用できない • Aggregation constraints ◦ クエリ結果で返す行を制御 ◦ 最小の集計値を設定できる (2以上)
Aggregation Typeで生成されるデータ • 生成されるデータは複数のユーザがグルーピングされた状態で出力される • しきい値以下のグループは削除されるが、しきい値以上であれば人数がわか るので、レコードを分割することで学習モデルを構築することは可能
グループされたデータを分割 グループされたデータを分割すると同じ特徴を持つユーザを複数作ることとなってしまい、モ デルに影響を与えてしまう
Analysis Rule: List Type • Join controls ◦ 他のテーブルとINNER JOINするためのキーを設定
(複数キー指定可能) ◦ JOINで使用するキーはクエリ結果には表示されない • List controls ◦ 出力できるカラムを指定 • AggregationのRule Typeに比べて指定する事項は少ない
List Typeで生成されるデータ • ユーザ一人ひとりのレコードを作成できる • DISTINCTで重複は削除されてしまう • 結合に使った個人識別子は削除されてしまうので、このままだと推論に用いることができない • 個人ごとの推論が必要ない場合なら問題ない
◦ e. g. 推論値の分布などを用いたい場合など
List Typeの抜け道 • 結合に使う個人識別子と対応する別のキーがあると、ユーザごとのデータを抽出で きてしまう • このデータを用いれば、通常の学習および推論が実施できる • ただし、この使い方は、AWS Clean
Roomsを使用する目的と反する可能性がある
まとめ • Aggregation TypeとList Typeのどちらでも機械学習に必要な説明変数と目 的変数を生成することは可能 ◦ Aggregation Typeでは集計結果となるため、特徴量が平均化されてしまう ◦
List Typeでは重複する行はまとめられる ◦ 結合に用いる個人識別子はデータ生成過程で取り除かれてしまう • List Typeを用いれば、個人識別子と対応するカラムを抽出することも可能 (ただし、データを保護するという目的からずれる可能性もある) • 機械学習では、List Typeの方が使いやすい