ストリーミング データ パイプラインを構築します。 • Google Cloudのデータ分析系サービスであるPub/Sub、BigQuery、Dataflow、Looker Studioについて 学びます。 • 内容的には、Google Cloud Professional Cloud Data Engineer 試験の内容に近いです。 (参考)A Streaming Data Pipeline for a Real-Time Dashboard with Google Cloud Dataflow
SELECT timestamp, TIMESTAMP_TRUNC(timestamp, HOUR) AS `時`, TIMESTAMP_TRUNC(timestamp, MINUTE) AS `分`, TIMESTAMP_TRUNC(timestamp, SECOND) AS `秒`, ride_id, latitude, longitude, meter_reading, ride_status, passenger_count FROM taxirides.realtime ORDER BY timestamp DESC LIMIT 1000 ) # calculate aggregations on stream for reporting: SELECT ROW_NUMBER() OVER() AS `ダッシュボード_ ソート`, `分`, COUNT(DISTINCT ride_id) AS `乗⾞合計`, SUM(meter_reading) AS `収益合計`, SUM(passenger_count) AS `乗客合計` FROM streaming_data GROUP BY `分`, timestamp
ストリームパイプラインの設定を⼿動ですることで、ストリームパイプラインのイメージができるように なった • 処理したストリーミングデータをBigQueryに格納し、可視化する⽅法を学べた • このようなダッシュボードを作成することで、ストリーミングデータの状況をリアルタイムで確認し、問 題やチャンスを素早く把握、ビジネス上の意思決定に活⽤できそう • Google Cloud Professional Cloud Data Engineer 試験対策にもなる