Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
データコンペを開いた話
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Yamaguchi Takahiro
September 19, 2019
Science
440
0
Share
データコンペを開いた話
データコンペを開いた時のあれこれのお話です
Yamaguchi Takahiro
September 19, 2019
More Decks by Yamaguchi Takahiro
See All by Yamaguchi Takahiro
コンペを気楽に開催しよーぜ!@関西Kaggler会
nyk510
0
1.4k
Django のセキュリティリリースを見る
nyk510
0
130
3分でMLアプリを作る 〜推論コードにちょっとのStreamlitを添えて〜
nyk510
1
1.2k
硬派で真面目なグラフを描く
nyk510
0
560
CORSをちゃんと理解する atmaバックエンド勉強会#4
nyk510
0
450
pythonで気軽にパッケージを作るのは良いという話。
nyk510
14
9.9k
RestAPIのページネーション atma バックエンド勉強会 #3
nyk510
1
1k
AWS CPU Credit を完全に理解する
nyk510
0
500
atmaCup#8 Opening
nyk510
0
310
Other Decks in Science
See All in Science
ITTF卓球世界ランキングのポイント比を用いた試合結果予測モデルの性能評価 / Performance evaluation of match result prediction models using the point ratio of the ITTF Table Tennis World Ranking
konakalab
0
120
検索と推論タスクに関する論文の紹介
ynakano
1
190
白金鉱業Vol.21【初学者向け発表枠】身近な例から学ぶ数理最適化の基礎 / Learning the Basics of Mathematical Optimization Through Everyday Examples
brainpadpr
1
710
機械学習 - pandas入門
trycycle
PRO
0
560
人生を変えた一冊「独学大全」のはなし / Self-study ENCYCLOPEDIA: The Book Which Change My Life #独学大全 #EM推し本
expajp
0
150
コンピュータビジョンによるロボットの視覚と判断:宇宙空間での適応と課題
hf149
1
630
20251212_LT忘年会_データサイエンス枠_新川.pdf
shinpsan
0
270
なぜエネルギーは保存する? 〜自由落下でわかる“対称性”とネーターの定理〜
syotasasaki593876
0
110
知能とはなにかーヒトとAIのあいだー
tagtag
PRO
0
190
20260220 OpenIDファウンデーション・ジャパン ご紹介 / 20260220 OpenID Foundation Japan Intro
oidfj
0
310
AIPシンポジウム 2025年度 成果報告会 「因果推論チーム」
sshimizu2006
3
470
AIに仕事を奪われる 最初の医師たちへ
ikora128
0
1.1k
Featured
See All Featured
What's in a price? How to price your products and services
michaelherold
247
13k
Jess Joyce - The Pitfalls of Following Frameworks
techseoconnect
PRO
1
140
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.4k
Mozcon NYC 2025: Stop Losing SEO Traffic
samtorres
0
210
How STYLIGHT went responsive
nonsquared
100
6.1k
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
510
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.4k
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
2.6k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.2k
B2B Lead Gen: Tactics, Traps & Triumph
marketingsoph
0
100
Mind Mapping
helmedeiros
PRO
1
160
sira's awesome portfolio website redesign presentation
elsirapls
0
220
Transcript
データコンペ を開いた話
Hello! 山口貴大 twitter @nyker_goto atma 株式会社 取締役/ DS / ふろんと
/ ばっくえんど / いんふら Kaggle Master kaggle.com/nyk510 京都大学大学院 最適化数理卒 SGDが好き 2
3 とつぜんですが
4 atmaCup ご存知ですよね?
5 え、知らない?
atmaCupとは atma 株式会社が主催するオンサイトデータコンペ https://atma-cup.atma.co.jp • 実際に会場に集まり、準備されたデータをテーマに沿って 分析・予測を行いその精度を競うイベント • 全員で一斉にスタートし短い時間で決着するため参加者のスキ ルがオンラインのデータコンペより強く結果に表れます。
6
atmaCup #1 8/3 #1(第2回)を開催 全参加者: 26人 (東京から10人以上) 参加者の半数が Kaggler の超ハイレベルな大会
Kaggle GrandMaster: 1人 Kaggle Master: 5人 Kaggle Expert: 7人 終了後のアンケートでは 全員が次回も参加したい(5段階評価)と回答 :D 7
しかし!! 8
コンペを作るのは なかなか大変!!! 9
大変だったこと × システムを作るのが大変 × 使うデータの選定が大変 × いい感じの解ける問題を作るのが大変 10
Kaggle っぽいシステムを作る必要性 • スコア計算/ランキング • ディスカッション・Vote • チームマージ… Vue.js +
Nuxt ✖ DjangoRestFramework GitlabCIによる自動デプロイ + AWS(ECS) つくってわかるアプリとしての Kaggle の凄さ 1.システムを作るのが大変 11
2.使うデータの選定が大変 それを解いてためになる問題にしたい • 匿名データではないリアルなデータを用意 (まあまあ大変) Train/Public/Private の分割は慎重に…… • Leakage があると何を言われるかわからないこわい
いい感じ(要出典)にハンドリングできるデータ量に • 一日しかないのでその中で扱えるぐらいのいい感じ(要出典)の データ 12
3.いい感じの解ける問題を作るのが大変 Leak とかなかったらいいかというとそうでもない • 解けないと面白くない • でも簡単すぎると差がつかない いい感じ(要出典)に差がつくような問題設定にする必要がある 13
結果どうなるか… 14
いい感じに作るの 大変すぎて病む 15
16 *コンペ前日
よかったこと!! × みんなで解くのは楽しい これは本当に、たのしい!! × [回答者として]とても勉強になる みんなが何をやっているか知れるのは大きい × [出題者として]出題の難しさを知れる 17
よだん AutoMLも参戦してました (8位/31) くわしい顛末はブログで AutoML Tablesを使ってKagglerを倒せなかった話 #atmaCup https://atma.hatenablog.com/entry/2019/08/26/180951 18
次回 10月 ~ 11月頃 開催予定 データ提供元募集中! atmaCup #2
THANKS! Arigato Gozaimashita !! 20