Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
「おすすめコンペは何?」の答え方を真面目に考える / How to Choose Kaggle...
Search
Shotaro Ishihara
July 31, 2020
Technology
2
5.2k
「おすすめコンペは何?」の答え方を真面目に考える / How to Choose Kaggle Competitions
「Rist主催 Kaggle Workshop #1」での発表資料
https://rist.connpass.com/event/182932/
Shotaro Ishihara
July 31, 2020
Tweet
Share
More Decks by Shotaro Ishihara
See All by Shotaro Ishihara
Web からのデータ収集と探究事例の紹介 / no94_jsai_seminar
upura
0
95
記者・編集者との協働:情報技術が変えるニュースメディア / Kaishi PU 2024
upura
0
65
ニュースメディアにおける生成 AI の活用と開発 / UTokyo Lecture Business Introduction
upura
0
230
マルチモーダル AI 実装の課題と解決策 / Developer X Summit
upura
0
260
ニュースメディアにおける事前学習済みモデルの可能性と課題 / IBIS2024
upura
3
790
「巨人の肩の上」で自作ライブラリを作る技術 / pyconjp2024
upura
3
970
Quantifying Memorization and Detecting Training Data of Pre-trained Language Models using Japanese Newspaper
upura
0
61
第 2 部 11 章「大規模言語モデルの研究開発から実運用に向けて」に向けて / MLOps Book Chapter 11
upura
0
490
第19回YANSシンポジウムスポンサー資料 / yans2024-nikkei
upura
0
69
Other Decks in Technology
See All in Technology
10分で紹介するAmazon Bedrock利用時のセキュリティ対策 / 10-minutes introduction to security measures when using Amazon Bedrock
hideakiaoyagi
0
150
Zenn のウラガワ ~エンジニアのアウトプットを支える環境で Google Cloud が採用されているワケ~ #burikaigi #burikaigi_h
kongmingstrap
19
7.3k
カスタムインストラクションでGitHub Copilotをカスタマイズ!
07jp27
8
1.7k
生成AIの利活用を加速させるための取り組み「prAIrie-dog」/ Shibuya_AI_1
visional_engineering_and_design
1
130
Bounded Context: Problem or Solution?
ewolff
1
200
バックエンドエンジニアのためのフロントエンド入門 #devsumiC
panda_program
15
4.7k
FastConnect の冗長性
ocise
1
9.5k
開発スピードは上がっている…品質はどうする? スピードと品質を両立させるためのプロダクト開発の進め方とは #DevSumi #DevSumiB / Agile And Quality
nihonbuson
1
210
テストアーキテクチャ設計で実現する高品質で高スピードな開発の実践 / Test Architecture Design in Practice
ropqa
3
470
インフラをつくるとはどういうことなのか、 あるいはPlatform Engineeringについて
nwiizo
4
600
Data-centric AI入門第6章:Data-centric AIの実践例
x_ttyszk
1
270
[JAWS-UG栃木]地方だからできたクラウドネイティブ事例大公開! / jawsug_tochigi_tachibana
biatunky
0
220
Featured
See All Featured
Learning to Love Humans: Emotional Interface Design
aarron
274
40k
Git: the NoSQL Database
bkeepers
PRO
427
64k
A better future with KSS
kneath
238
17k
What's in a price? How to price your products and services
michaelherold
244
12k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
226
22k
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
29
4.6k
The Invisible Side of Design
smashingmag
299
50k
[RailsConf 2023 Opening Keynote] The Magic of Rails
eileencodes
28
9.3k
BBQ
matthewcrist
86
9.4k
The Success of Rails: Ensuring Growth for the Next 100 Years
eileencodes
44
7k
[RailsConf 2023] Rails as a piece of cake
palkan
53
5.2k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
9
1.3k
Transcript
「おすすめコンペは何?」 の答え方を真面目に考える u++, 2020年7月31日(更新:2021年6月21日) 1
Q. おすすめコンペは何? 2
Q. おすすめコンペは何? A. 人それぞれだと思います 3
発表の概要 「おすすめコンペは何?」という質問への自分なりの答え (2020年7月) 4
対象の聴衆 参加者:KaggleやSignateなどデータ分析コンペに参加経験 がある中級以上の方 比較的経験が浅めの方 回答内容自体が参考になれば嬉しい 比較的経験が豊富な方 回答方法自体が参考になれば嬉しい (資料のリンクを共有する形でご活用ください) 5
自己紹介 u++ (@upura0, sishihara) Kaggle PetFinderコンペ 1位、SIGNATE 糖尿病コンペ 3位、 Nishika
株主価値コンペ 2位 『Weekly Kaggle News』の発行 『PythonではじめるKaggleスタートブック』(講談社) 4.1「参加するコンペの選び方」の内容を掘り下げました 6
選ぶ上での観点 下記の点から、自分に合ったコンペを選ぶ 扱うデータの種類・サイズ タスクの種類 開催期間 メダルの有無 実行環境の制限 タスクの面白さ プラットフォームの性質 7
扱うデータの種類・サイズ 業務で使う?知的好奇心?利用可能な計算資源? テーブル 画像 テキスト 音声 強化学習 ※ 複数を扱う「マルチモーダル」なコンペも 8
タスクの種類 テーブル:分類・回帰 画像:分類・回帰・セグメンテーション・物体検出など テキスト:分類・回帰・質問応答など 9
開催期間 2〜3カ月くらいのコンペが多い 個人的なおすすめは、終了2週間前くらいの開催中のコンペ NotebookやDiscussionに情報が転がっている (Vote数でソート) 「良コンペ」か否かの評判も出ている 最後の順位開示の瞬間の一喜一憂がたまらない 終了後の上位解法が勉強になる 過去の良コンペも選択肢になり得る(後述) 10
メダルの有無 Kaggleではコンペごとに、メダルやポイントが獲得できる・ できないが設定されている 獲得できる方が、参加者の質が高く議論も活発で学びが得や すい傾向にある Kaggleでメダルが獲得できるコンペか否か確認する, u++の備忘録 11
実行環境の制限 コンペのルール 最近は実行環境の制限(処理内容・アクセラレータ・時間など) が設定されているコンペが増えている 個々人の計算資源 自分のパソコンのスペック、Kaggle Notebook、Google Colab、 クラウド課金 など
12
タスクの面白さ 背景や社会的意義 例:Deepfake Detection Challenge 現実で適用できるコンペ設計か? 例:NFL Big Data Bowl
機械学習が必要か? 例:ルールベースでは難しい、データが十分にある 評価指標 例:「運ゲー」になりづらいか? 13
プラットフォームの性質 Kaggle以外のプラットフォームも SIGNATE ProbSpace Nishika TopCoder atmaCup Quevico ※ Discussionの有無や情報開示の可否などに注意
14
おすすめ過去コンペ kaggler-ja wiki 自分の場合はPetFinderコンペ テーブル・画像・テキストのマルチモーダル 当時使わなかったBERTやEfficientNetで良いスコアが出 て面白い 人は良い成績だったコンペをおすすめしがち 15
コンペ情報を知る twitterのKaggleリスト 『Weekly Kaggle News』 16
まとめ Q. おすすめコンペは何? A. 自分に合ったコンペを選びましょう 扱うデータの種類・サイズ タスクの種類 開催期間 メダルの有無 実行環境の制限
タスクの面白さ プラットフォームの性質 17
By Marios Michailidis (KazAnova), KDD 2018 at London, from @0verfit
’s tweet 18
おまけ:賞金は? 時給換算して金銭面だけを見ると、割りに合わない場合がほ とんど 「たまにお金がもらえるネトゲ」くらいの位置づけ ※ Deepfake Detection Challengeくらいになると別 19
おまけ:個人的印象 SIGNATE:日本最大級だが、コンペの質に不安も。コンペご との情報開示の可否が明確になったが、成果物が公開できな い場合も多い。 ProbSpace:コンペ設計に工夫が見られる。優勝解法のピア レビュー制が面白い。最終提出選択がない。日本語。 Nishika:立ち上がり期で、オープンデータを用いたコンペが 多い。日本語。 Solafune:衛星データを題材にしたコンペを過去2度開催。 TopCoder:競技プログラミング。
atmaCup:最近は日本のKaggle Grandmaster/Masterが集結 し、しのぎを削っている。運営のサポートが手厚く、初学者 おすすめ度も高い。日本語。 Quevico:Discussionなし。日本語も対応。 20