(418⾏ 11列) Ø 列 p PassengerId: 乗客のID p Survived: ⽣存したかどうか(0=No, 1=Yes) p Pclass: チケットのランク(1=1st, 2=2nd, 3=3rd) p Name: 名前 p Sex: 性別 p Age: 年齢 p SibSp: 同乗した兄弟/配偶者の数 p Parch: 同乗した親/⼦どもの数 p Ticket: チケット番号 p Fare: 運賃 p Cabin: 客室番号 p Embarked: 出港地 (C = Cherbourg, Q = Queenstown, S = Southampton) S3に配置してそれぞれ、redshift_ml.train、redshift_ml.testとしてCREATE⽂、COPY⽂を実⾏ Redshift MLを試す kaggleチュートリアルのタイタニックデータでモデルを作成
CREATE MODEL でモデルを訓練 2. SHOW MODEL でモデルの状態を確認 Model State が… TRAINING : 訓練中 READY : 訓練終了 FAILED : 訓練失敗(失敗例︓指定した訓練時間中に最適なモデルが⾒つからなかった場合) 3. 作成された関数を⽤いてモデルの予測 Redshift MLを試す Auto On でモデルの訓練・推論
CREATE MODEL でモデルを訓練 2. SHOW MODEL でモデルの状態を確認 Model State が… TRAINING : 訓練中 READY : 訓練終了 FAILED : 訓練失敗(失敗例︓指定した訓練時間中に最適なモデルが⾒つからなかった場合) 3. 作成された関数を⽤いてモデルの予測 Redshift MLを試す Auto Off でモデルの訓練・推論
サポートされている機能(モデル、評価指標)が少ない n 触ってみた所感 Ø AUTO ONは結構時間がかかる。例えば、titanicデータのような⼩さなデータでも、学習時間のmaxを10分 とすると最適なモデルが⾒つからないというエラーとなる Ø AUTO OFFはすぐに終わる まとめ 以下、まとめを記述