Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
ローカルAITuber勢の現在地と未来
Search
Sald ra
June 06, 2023
Technology
0
390
ローカルAITuber勢の現在地と未来
2023/06/06に開催された「第二回AITuberLT大会 」での登壇資料です。
Sald ra
June 06, 2023
Tweet
Share
More Decks by Sald ra
See All by Sald ra
AIキャラについての諸考察
sr2mg4
1
210
2023 AIAD忘年会LT 資料
sr2mg4
0
580
2023/09/23 「AIキャラクターの言動に深みを持たせる」
sr2mg4
2
930
AIキャラクター開発の側面から見る 新機能実装・検証の高速化の必要性
sr2mg4
1
820
Other Decks in Technology
See All in Technology
AWSでRAGを作る法方
sonoda_mj
1
140
E2Eテスト自動化プラットフォームにおけるAIの活用
shift_evolve
0
180
ACRiルーム最新情報とAMD GPUサーバーのご紹介
anjn
0
150
Github Actions 로 Android 팀의 효율성 극대화
hadonghyun
0
160
データ分析を支える技術 生成AI再入門
ishikawa_satoru
0
380
Docker互換のセキュアなコンテナ実行環境「Podman」超入門
devops_vtj
6
3.2k
サービスの持続的な成長と技術負債について
siva_official
PRO
10
4.4k
公共領域から学ぶ クラウド移行についてエンジニアが意識していること
kawakawa2222
0
140
スレットハンティングについて知っておきたいこと
hacket
0
130
地理情報とAPIのトレンド
nagix
0
160
LINE WORKSへ簡単通知!Incoming Webhookアプリの紹介
mmclsntr
0
110
コミュニティサービスに「あなたへ」フィードを リリースするまでの試行錯誤
takapy
1
140
Featured
See All Featured
How GitHub (no longer) Works
holman
305
140k
Stop Working from a Prison Cell
hatefulcrawdad
266
20k
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
16
1.6k
The Cult of Friendly URLs
andyhume
75
5.9k
Bash Introduction
62gerente
607
210k
Art, The Web, and Tiny UX
lynnandtonic
291
20k
Embracing the Ebb and Flow
colly
81
4.3k
jQuery: Nuts, Bolts and Bling
dougneiner
61
7.4k
Principles of Awesome APIs and How to Build Them.
keavy
124
16k
WebSockets: Embracing the real-time Web
robhawkes
59
7.2k
Designing with Data
zakiwarfel
96
5k
Producing Creativity
orderedlist
PRO
340
39k
Transcript
ローカルAITuber勢 の現在地と未来 Sald_ra(サルドラ) 2023/06/05
自己紹介 サルドラ • Web系出身のエンジニア • AITuber「さくら」開発・運営 • あいちゅーばーわーるど運営 • AITuberLT大会運営
• 「ローカルLLMに向き合う会」会長 • ローカルAITuber勢 • LLM転職者
ローカルAITuber勢とは?
ローカルAITuber勢とは? AIとの応答部分を、OpenAIやRinnaのAPIを用いず自前で用意、 手元のPCで応答させるAITuber勢のこと うちの子である「さくら」はローカルAITuber勢です
メリットとデメリット
一般的に知られている メリットとデメリット メリット • 通信失敗がなく安定している • APIの値段がかからないので、かなり格安で運用できる デメリット • 精度が悪い。会話にならないようなことを話してしまう
• 参入難易度が高い
自分が感じてる メリットとデメリット メリット • 通信失敗がなく安定している • 特定のモデルに依存しない • APIでないので、モデルが手元にあればずっと運用できる デメリット
• 精度が「少し」悪い • 参入難易度が高い • 部屋が暑くなる
「精度」って なんだろう?
AIにおける「精度」ってなんだろう 自分は「あるタスクを達成するための精度」だと考えている 分類や翻訳、生成等… 例えば「ChatGPT」は「自然と感じる回答の生成」がタスク 対話文生成が主な機能だったが、出力結果の情報精度が良すぎて別の使われ方をされている気はする
AITuberの「精度」って なんだろう?
AITuberの「精度」って 「キャラに沿った発言をしてくれること」
AITuberの「精度」 AITuberの「精度」は「キャラに沿った発言をしてくれること」 語尾が「にょ」のAITuberに「お勧めの九州のスポットは?」と聞いたとき、 どっちの方が「精度が良い」だろう? 1. お勧めの九州のスポットは福岡です。昔からある寺院を見に行けます。 2. 最近この辺に来たからよくわからないにょ!今度うさだに聞いておくにょ!
ローカルAITuberの精度について ここ数か月でローカルAITuberの精度は変化している! 課題点はあるが、 一問一答形式であれば問題なく雑談ができるレベルに到達している。 上記ツイートは30億パラメータ(1b-rinna)
精度が良くなったきっかけは? 「ファインチューニング時に食わせたデータの質」が大事! 同じパラメータ数のモデルでも、 データセットの質を上げるだけで一気に精度が上がる。 上記は左がデータセットにこだわる前、右がこだわりだした後 どちらも10億パラメータ これでも本当に「精度は悪い」?
とにかくデータセットが大事
現行の日本語データセットの特徴 日本語のデータセットは少しだけ問題を抱えている • 日本語のデータセットは主に以下の特徴がある ◦ 膨大で汎用的だが、質が凄い高いわけではない ▪ dollyやoasst1 ◦ 高品質だが全てお嬢様による回答になる
▪ OjousamaTalkScriptDataset 「小規模で良いので高品質なデータ」の需要が上がる一方で、 ニュートラルな口調且つ高品質なデータセットがない
ないなら作るしかない
小規模高品質データセット製作PJ 「sakura_dataset」
sakura_dataset(鋭意製作中) • 超小規模(500)データセット • MITライセンスのデータセットをDeepLで翻訳、手動修正 • ニュートラルな口調の回答に統一 • AITuberに最適
sakura_dataset sakura_datasetに加えて100セット程度の台詞データを付け足すと、 AITuber用のデータセットが完成するようになる →気軽にローカルAITuberが作れるように!
結局ローカルAITuber勢の未来は どうなるの?
少なくともお先真っ暗ではない
ただし、もう少し 「自分で」やりたいことを やっていく必要がある
今後とも頑張っていきましょう