Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
machine learning with rancher and K8s on prem
Search
@ジュジュ
May 15, 2019
Technology
5
430
machine learning with rancher and K8s on prem
@ジュジュ
May 15, 2019
Tweet
Share
More Decks by @ジュジュ
See All by @ジュジュ
チーム分割においていかれたアラートをチームで責任を持てる形に再設計した
juju62q
0
110
ボトムアップでSLOを導入 2年半運用して分かった失敗と変化
juju62q
2
970
Firecracker Snapshottingを調べてみた
juju62q
1
530
SLOを活用した技術的改善
juju62q
10
8.5k
IAM Role for Pods and Instance Meta Data Service
juju62q
1
1.5k
telepresence handson
juju62q
2
4.8k
Wanna Use Vitess in Orientation
juju62q
6
1.2k
docker-handson-for-researcher
juju62q
3
300
Getting Started to CRIU
juju62q
0
110
Other Decks in Technology
See All in Technology
アジャイルな開発チームでテスト戦略の話は誰がする? / Who Talks About Test Strategy?
ak1210
1
830
JAWS DAYS 2025 アーキテクチャ道場 事前説明会 / JAWS DAYS 2025 briefing document
naospon
0
2.8k
Log Analytics を使った実際の運用 - Sansan Data Hub での取り組み
sansantech
PRO
0
120
LayerXにおけるAI活用事例とその裏側(2025年2月) バクラクの目指す “業務の自動運転” の例 / layerx-ai-deim2025
yuya4
2
610
アジリティを高めるテストマネジメント #QiitaQualityForward
makky_tyuyan
1
350
大規模アジャイルフレームワークから学ぶエンジニアマネジメントの本質
staka121
PRO
3
1.6k
プルリクエストレビューを終わらせるためのチーム体制 / The Team for Completing Pull Request Reviews
nekonenene
3
1.2k
Platform Engineeringで クラウドの「楽しくない」を解消しよう
jacopen
4
210
"TEAM"を導入したら最高のエンジニア"Team"を実現できた / Deploying "TEAM" and Building the Best Engineering "Team"
yuj1osm
1
240
入門 PEAK Threat Hunting @SECCON
odorusatoshi
0
180
OPENLOGI Company Profile
hr01
0
60k
AIエージェント元年@日本生成AIユーザ会
shukob
1
260
Featured
See All Featured
What’s in a name? Adding method to the madness
productmarketing
PRO
22
3.3k
Practical Orchestrator
shlominoach
186
10k
Gamification - CAS2011
davidbonilla
80
5.2k
Evolution of real-time – Irina Nazarova, EuRuKo, 2024
irinanazarova
6
580
Designing on Purpose - Digital PM Summit 2013
jponch
117
7.1k
A Tale of Four Properties
chriscoyier
158
23k
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
27
1.9k
XXLCSS - How to scale CSS and keep your sanity
sugarenia
248
1.3M
How to train your dragon (web standard)
notwaldorf
91
5.9k
Designing Dashboards & Data Visualisations in Web Apps
destraynor
231
53k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
11
1.3k
Unsuck your backbone
ammeep
669
57k
Transcript
オンプレK8s & Rancher で作る機械学習基盤 2019/05/15 RancherMeetupDeepDive#1@LINE株式会社 岡野兼也
$ whoami name: - 岡野兼也 - @ジュジュ belonging: - CyberAgent
- OpenSaaS Studio role: - Backend Engineer - ほうれん草 エバンジェリスト interest: - CloudNative - DevOps dream: - 働かないこと hobbies: - 登山 - キャンプ 2
注意事項 今回の発表は入社前に株式会社キスモで やっていた内容です 3
お話しすること 1. MLOpsと目指した機械学習基盤 2. Rancherを使って作った機械学習基盤概要 3. なんで機械学習をオンプレで? 4. なんでRancherを? 4
お話しすること 1. MLOpsと目指した機械学習基盤 2. Rancherを使って作った機械学習基盤概要 3. なんで機械学習をオンプレで? 4. なんでRancherを? 5
機械学習の成果がユーザに届くまで 6 Data Collect Compute Delivery リソースを用意して学習 Webサービスや エッジデバイスからデータ収集 システムに組み込んで
ユーザに届ける
データサイエンティストがやりたいところ 7 Data Collect Compute Delivery - どんなデータを集めるか - どういう手法でモデルを作るか
データサイエンティストは専門職 8 - データについての圧倒的知識 - 普段追いかけているのは新たな統計的な手法など - 必ずしもweb技術、エンジニアリングに明るくなくても インパクトを出せる
データサイエンティストがやるべき 9 Data Collect Compute Delivery データサイエンスに注力してもらう それ以外はどうする???
MLOps Machine Learning + Operation DevOpsよろしく機械学習を効率的に利用できるようにする おそらく、会社の数だけ実態がある 10
MLOps 11 Data Collect Compute Delivery データサイエンスで生まれる価値をシームレスにユーザに届ける Fluentd BigQuery Kubernetes
Rekcurd SagerMaker Kubeflow etc etc etc etc
データサイエンティストが データサイエンスだけをしても ユーザに価値が届く仕組みを作る 12
MLOps 13 Data Collect Compute Delivery データサイエンスで生まれる価値をシームレスにユーザに届ける 今日話す部分
お話しすること 1. MLOpsと目指した機械学習基盤 2. Rancherを使って作った機械学習基盤概要 3. なんで機械学習をオンプレで? 4. なんでRancherを? 14
機械学習基盤の概要図 15
機械学習基盤の概要図 16 Jujuで必要なミドルウェアをパッケージング MAASで作られたイメージをマシンに展開
機械学習基盤の概要図 17 RKEでクラスタ作る GPUの管理コンテナをDaemonSetで展開 Rancherの展開
機械学習基盤の概要図 18 学習はJupyterやコンテナの中にexecして実行 リソース管理はK8sにお任せ
お話しすること 1. MLOpsと目指した機械学習基盤 2. Rancherを使って作った機械学習基盤概要 3. なんで機械学習をオンプレで? 4. なんでRancherを? 19
時代はクラウド全盛 • 数多くのマネージドサービス • 高い信頼性を誇るストレージ • 必要な時に必要な分のリソースを利用可能 • 課金対象も使った分だけ •
世界展開も容易 20
機械学習とクラウドの相性は? • 機械学習するときだけ高価なインスタンスを立てられる • SageMaker, Google Cloud ML Engineというような学習 からデプロイまで一気通貫に行うサービス
• 高機能なストレージサービスとも容易に連携 • 推論モデルのバージョン管理も簡単 21
なぜオンプレか 22
機械学習とクラウドの相性は? • 機械学習するときだけ高価なインスタンスを立てられる • SageMaker, Google Cloud ML Engineというような学習 からデプロイまで一気通貫に行うサービス
• 高機能なストレージサービスとも容易に連携 • 推論モデルのバージョン管理も簡単 23 精度の高いモデルを作るために、 機械学習リソースは常に必要になる場合もある
高い精度で高い生産性を出すには • データサイエンティストが数多くの引き出しを持っている • 類似の学習の経験がある 24 データサイエンティストが常に 様々なデータの解析を行うことで結果的に 早く、高い精度のモデルを作ることができる
どう経験を増やす? 25
Kaggle • 主に機械学習を利用したデータ分析の世界大会が 行われるプラットフォーム • 与えられたデータをもとに少しでも高い精度が出せる ように世界中のデータサイエンティストが研鑽している • 高い精度を目指して様々な話し合いが行われている 26
キスモでの機械学習の状況 • Kaggleは業務の一環 • スケールの設定してもほぼ常に業務かKaggleで リソース上限を利用した学習が回り続ける 27 • 機械学習するときだけ高価なインスタンスを立てられる というメリットの消失
• クラウドのメリットが価格面でのコストを下回ると判断
あるKaggler(キスモ役員)の名言 28
29 オフィスに来るなら広瀬すずより 計算資源がいい あるKaggler(キスモ役員)の名言
30 < あるKaggler(キスモ役員)の名言 これほどリソースが常に求められる
お話しすること 1. MLOpsと目指した機械学習基盤 2. Rancherを使って作った機械学習基盤概要 3. なんで機械学習をオンプレで? 4. なんでRancherを? 31
機械学習基盤を導入した結果 • 嬉しいこと ◦ データサイエンティストが空きリソース、 動作中の学習などを意識することがへった ◦ コンテナ化によって変化に強くなった ◦ 学習単位がマシンに縛られなくなった
• 嬉しくないこと ◦ データサイエンティストがK8sやらないといけない ◦ データの扱い面倒臭い 32
機械学習基盤を導入した結果 • 嬉しいこと ◦ データサイエンティストが空きリソース、 動作中の学習などを意識することがへった ◦ コンテナ化によって変化に強くなった ◦ 学習単位がマシンに縛られなくなった
• 嬉しくないこと ◦ データサイエンティストがK8sやらないといけない ◦ データの扱い面倒臭い 33 データサイエンスだけ すればいい世界との落差
Kubernetesを直感的に使うには…? • GUIを使う ◦ Rancherを使った時にK8sへの初期の嫌悪感がかなり 減った • kubectlをラップする ◦ CUIから使った方が効率的なケースもある
◦ リソースを管理して学習支援 34
まとめ • RancherやK8sを使ってCompute Resourceをリソース プールとして扱う • データサイエンティストの尖った部分の穴埋めをMLOps で補い、完成度の高いモデルをいち早くユーザに届ける • データサイエンティストの研鑽の手助けをして、届ける
価値を最大化する • なるべくアレルギーの出なさそうな方法を話し合いなが ら考えると良い 35
36 https://opensaas.studio OpenSaaS Studioでは開かれた文化で サービスと寄り添ってプロダクトを 作りたい人を募集しています!