Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Data Is All You Need
Search
Elith
September 07, 2023
Technology
340
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Data Is All You Need
Elith
September 07, 2023
More Decks by Elith
See All by Elith
Elith Company & Recruiting Deck
elith
1
770
2026.01ウェビナー資料
elith
0
420
株式会社Elith_会社紹介資料
elith
1
580
Gitの使い方とチーム開発
elith
1
170
【W&B ミートアップ#19】AI エージェントは何に使うべきか - エージェント周りの分類の整理と利用すべき場面 -
elith
0
460
【Elith開催】ITSC 2024論文発表ウェビナー
elith
0
88
[ECCV2024読み会] 衛星画像からの地上画像生成
elith
1
1.7k
生成AI グローバルトレンド実務で活かす新規事業構築の5つの方法
elith
0
310
今、知っておきたい! 生成AIエージェントの世界
elith
3
1.2k
Other Decks in Technology
See All in Technology
社内の7割が使うデータ基盤を、 データチーム2人で回すためにやったこと
koh_yoshi
4
1.2k
Software Supply Chain Attackからクラウド環境を守るためにできること
lhazy
2
220
【CEDEC2026】『Relink』を拡張せよ - 『GRANBLUE FANTASY: Relink - Endless Ragnarok』の開発速度と品質を守るCI運用
cygames
PRO
0
140
メルカリのグローバルアプリで挑んだ AlloyDB 運用と課題解決の実践記
hatappi
0
240
サイバー捜査員研修(後半)
nomizone
1
810
【CEDEC2026】コードレビュー支援ツール開発から学ぶ:LLMを用いた業務システムの実践的な運用設計と誤出力対策
cygames
PRO
0
630
JavaScript 研修 (2026)
recruitengineers
PRO
2
470
【Google Cloud Next Tokyo'26】Gemini Enterprise と Oracle AI Database で実現する、業務データ活用を実現する AI エージェント実装
shisyu_gaku
0
230
ガバメントクラウドでのランサムウェア対策
techniczna
2
1k
SmartHR Engineering Team Deck
smarthr
1
1.4k
Goでデータパイプラインを作ろう
sansantech
PRO
1
360
Invisible to AI? Making TYPO3 Sites Quotable by AI Search Systems
wolfgangwagner
0
170
Featured
See All Featured
Claude Code のすすめ
schroneko
67
230k
The Illustrated Children's Guide to Kubernetes
chrisshort
51
53k
Done Done
chrislema
186
16k
SEO in 2025: How to Prepare for the Future of Search
ipullrank
3
3.7k
Navigating the moral maze — ethical principles for Al-driven product design
skipperchong
2
470
Build your cross-platform service in a week with App Engine
jlugia
234
19k
Mozcon NYC 2025: Stop Losing SEO Traffic
samtorres
1
480
Designing Dashboards & Data Visualisations in Web Apps
destraynor
232
55k
JAMstack: Web Apps at Ludicrous Speed - All Things Open 2022
reverentgeek
1
540
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
37
6.5k
Put a Button on it: Removing Barriers to Going Fast.
kastner
60
4.5k
WENDY [Excerpt]
tessaabrams
11
39k
Transcript
Data Is All You Need 株式会社Elith CEO & CTO Koki
Inoue
LLMの学習データ 一般利用可能なオープンソースデータセット • CommonCrawl:3.3TB ◦ Webサイトからアーカイブされた多言語データセット • Colossal Clean Crawled
Corpus(C4):783GB ◦ Googleによりクリーンに処理された CommonCrawlデータセット • Github:328GB ◦ Apach, BSD, MITライセンスで配布されるプロジェクトを対象 • ArXiv:92GB ◦ 170万件のArXiv論文から構成 • Gutenberg , Books3:85GB ◦ Gutenberg:パブリックドメインの電子書籍 (100,000以上のタイトル)から構成 ◦ Book3:197.000冊の電子書籍から • Stack Exchange:78GB ◦ Stack Overflowの質問・回答から構成 2 日本語LLM学習への応用方法 • 和訳 • 日本語テキストだけの利用 ◦ cc-100, mC4等
LIMA: Less Is More for Alignment LIMAは750,000tokensの学習データで良い性能を出した • LIMAはLLaMa 65Bをファインチューニングしたもの
• ドメインの多様性を確保し、高品質なデータを利用 3 合計 1,000例
Textbooks Are All You Need コード生成タスクにおいて、 少量の高品質データ と小さいモデルサイズで高性能モデルが作成できる • ネットで集めたドキュメントがしっかりした高品質データセット
: 6B tokens • GPT-3.5で生成した高品質データセット : 1B tokens程度 • Pythonの演習と回答のデータセット : 180M tokens程度 4
Llama 2: Open Foundation and Fine-Tuned Chat Models 教師あり学習 •
アノテーターに依頼し高品質データ 27,540件を作成し学習(Supervised Fine-Tuning (SFT)) 5
データアノテーション市場 6 • 海外のアノテーション市場は $1,545Mから$13,922M(9倍)まで大きくなる • 日本のアノテーション市場は $73Mから$1,363M(18倍)まで大きくなる
まとめ 性能の良いモデルを作成するためにはデータは不可欠である。 紹介した3つ論文から ①少数の高品質データ、② LLMから生成したデータ を利用することでより性能の良い LLM開発ができる可能性がある。 これからはプレイヤーとして、 LLMのデータアノテーション領域が熱い。 強いLLMプレイヤーはデータアノテーション事業者にもなり得る。
Data Is All You Need。 7