• 高カーディナリティ列や偏りのあるデータでも効果的にスキップを効かせる • 自動・増分でクラスタリングが進み、パーティションの過剰分割(small files)を避けられる • 有効化は CLUSTER BY <列名>(列指定)または CLUSTER BY AUTO(自動でキーを選択) 新規テーブル作成時に適用 既存テーブルに後から適用 対象列を指定 CREATE TABLE table2 CLUSTER BY (col0) AS SELECT * FROM table1; ALTER TABLE <table_name> CLUSTER BY (<clustering_columns>) 対象列を自動選択 CREATE TABLE table2 CLUSTER BY AUTO AS SELECT * FROM table1; ALTER TABLE <table_name> CLUSTER BY AUTO
作成 → タイプ:Serverless b. サイズは参加者数に応じて選択(目安:〜10名で 2X-Small〜Small、Auto-stop を有効化) c. 参加者グループに「使用可能(CAN USE)」権限を付与 d. 作成したウェアハウスの権限設定 → <参加者用グループ> グループに Can use を付与 これによりダッシュボード・Genie・Spark SQL 実行を全員が同一ウェアハウスで共用できる ※ 本ワークショップではサーバーレスコンピュートを使用するため、参加者個別のコンピュート準備は不要。
USE CATALOG ON CATALOG <ワークショップカタログ名 > TO <参加者用グループ >; GRANT USE SCHEMA ON SCHEMA <ワークショップカタログ名 >.shared TO <参加者用グループ >; -- 各参加者が自分のスキーマ( dew_<user_name>)を作成できるように GRANT CREATE SCHEMA ON CATALOG <ワークショップカタログ名 > TO <参加者用グループ >; -- マスタテーブルの参照 GRANT SELECT ON TABLE <ワークショップカタログ名 >.shared.m_customers TO <参加者用グループ >; GRANT SELECT ON TABLE <ワークショップカタログ名 >.shared.m_merchants TO <参加者用グループ >; GRANT SELECT ON TABLE <ワークショップカタログ名 >.shared.m_payment_methods TO <参加者用グループ >; -- 共有Volume(ソースParquet)の参照 GRANT READ VOLUME ON VOLUME <ワークショップカタログ名 >.shared.source_files TO <参加者用グループ >; ※ グループ名(<参加者用グループ>)とカタログ名 (<ワークショップカタログ名>)は環境に合わせて置き換え。