Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
RedshiftとGlueで簡単データウェアハウス / Data Warehousing wi...
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Fukao Moto
July 12, 2018
Programming
0
630
RedshiftとGlueで簡単データウェアハウス / Data Warehousing with Redshift and Glue
クラシルの行動分析基盤の裏側の話
- 第4世代分析基盤
- 2つのダッシュボード
- RedshiftとGlue
- 時系列テーブル
Fukao Moto
July 12, 2018
Tweet
Share
More Decks by Fukao Moto
See All by Fukao Moto
現場で使えるSRE / How to Survive as The First SRE
motobrew
0
2.6k
Other Decks in Programming
See All in Programming
Best-Practices-for-Cortex-Analyst-and-AI-Agent
ryotaroikeda
1
110
「ブロックテーマでは再現できない」は本当か?
inc2734
0
1k
SourceGeneratorのススメ
htkym
0
200
そのAIレビュー、レビューしてますか? / Are you reviewing those AI reviews?
rkaga
6
4.6k
HTTPプロトコル正しく理解していますか? 〜かわいい猫と共に学ぼう。ฅ^•ω•^ฅ ニャ〜
hekuchan
2
690
AIで開発はどれくらい加速したのか?AIエージェントによるコード生成を、現場の評価と研究開発の評価の両面からdeep diveしてみる
daisuketakeda
1
2.5k
Rust 製のコードエディタ “Zed” を使ってみた
nearme_tech
PRO
0
190
高速開発のためのコード整理術
sutetotanuki
1
400
AI によるインシデント初動調査の自動化を行う AI インシデントコマンダーを作った話
azukiazusa1
1
740
AIによる開発の民主化を支える コンテキスト管理のこれまでとこれから
mulyu
3
370
QAフローを最適化し、品質水準を満たしながらリリースまでの期間を最短化する #RSGT2026
shibayu36
2
4.4k
登壇資料を作る時に意識していること #登壇資料_findy
konifar
4
1.4k
Featured
See All Featured
How STYLIGHT went responsive
nonsquared
100
6k
Mobile First: as difficult as doing things right
swwweet
225
10k
What's in a price? How to price your products and services
michaelherold
247
13k
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
68
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
110
Max Prin - Stacking Signals: How International SEO Comes Together (And Falls Apart)
techseoconnect
PRO
0
86
Visualizing Your Data: Incorporating Mongo into Loggly Infrastructure
mongodb
49
9.9k
WCS-LA-2024
lcolladotor
0
450
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
16k
Lightning talk: Run Django tests with GitHub Actions
sabderemane
0
120
A brief & incomplete history of UX Design for the World Wide Web: 1989–2019
jct
1
300
The Limits of Empathy - UXLibs8
cassininazir
1
220
Transcript
Redshift と Glue で 簡単データウェアハウス © 2018 Fukao Moto
プロの料理人(8年) タコライス研究家 宇宙兄弟好き SRE and データ可視化推進室 Fukao Moto 深尾もとのぶ
RedshiftとGlue 第4世代分析基盤 Redshiftと Glueで 簡単DWH 2つのダッシュボード 時系列テーブル
fluentd Google Analytics 分析基盤のレイヤー BigQuery 可 視 化 分 析
ロ グ 収 集 Kinesis Redshift Google Analytics Google Analytics OSS 自社開発 Athena S3 BIツール SaaS Hadoop
None
第1世代 Google Analytics 開発コストが低い 無料の制限 P r o s C
o n s SQL使えない (Exportは高め) 基本無料
第2世代 Logpose スケーラビリティ確保 ログ基盤の管理 P r o s C o
n s SQLが大変 SQLが使える スキーマ変更
第3世代 Firebase Analytics ログ基盤が管理不要 仕様変更 P r o s C
o n s BQのクエリ料金 BigQueryが使える 機能が未完成
第4世代 Sunny Metabase Eternalpose
2 つ の 新 ダ ッ シ ュ ボ ー
ド 自 社 開 発 M e t a b a s e
2 つ の 新 ダ ッ シ ュ ボ ー
ド 自 社 開 発 M e t a b a s e 誰でも SQLで分析 日次集計 ダッシュボードの カスタマイズ アドホックな分析 非定常業務
Glue Redshift OAuth2 /auth 行動ログ Metabase Kinesis ETL クロール クロール
クロール JSON Parquet
R e d s h i f t / G
l u e 何 そ れ 美 味 い の ?
Athena & Redshift 定額料金 シンプル設計 Postgres互換 CTAS SELECT INSERT 早い
フルマネージド 低い学習コスト
カ ラ ム 定 義 も デ ー タ の
ロ ー ド も 不 要 !
ワークフロー S3にJSON形式のログを配置 自動でテーブル定義が作られる 必要に応じてParquetへ変換 Glueでクローリング Redshift Spectrum でCTAS Select文の結果から Redshiftの中に
テーブルが作られる Redshift でクエリ実行 CSVやParquetも
CTAS (Create Table As Select) create table <内部スキーマ>.<テーブル名> as select
* from <外部スキーマ>.<テーブル名>; Glueでクローリングしたテーブル 例:S3上のJSONファイル 任意のテーブル データマート、 テンポラリテーブル
リラン設計 (再実行と冪等性) データウェアハウスでは データの更新や再集計を 考慮する必要がある。 しかし、RedshiftはINSERTや UPDATE、DELETEには不向き
時系列テーブルとビュー 201807 201806 201805 201804 201711 201710 201709 201708 201803
201802 201801 201712 201807 201806 201805 201804 201707 view_hot view_warm view_cold
Glue Redshift OAuth2 /auth 行動ログ Metabase Kinesis ETL クロール クロール
クロール JSON Parquet
仲間を探しています! 「70億人に1日3回の幸せを届ける」 © 2018 Fukao Moto