Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[論文紹介] Evolutionary Optimization of Model Mergi...
Search
h0jicha
August 27, 2024
Research
63
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[論文紹介] Evolutionary Optimization of Model Merging Recipes
h0jicha
August 27, 2024
Other Decks in Research
See All in Research
長時間動画QAにおけるマルチエージェント推論 ・SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration
murakawatakuya
1
200
[CV勉強会@関東 CVPR2026] PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow / kantocv 67th CVPR 2026
shunk031
0
300
Visual SLAM未来予測 / Future Prediction in Visual SLAM
koide3
1
1k
GLIM とMegaParticles:正規分布近似の限界とタイトカップリング&パーティクルフィルタの進展 / GLIM and MegaParticles : Progress of the distribution representation in SLAM
koide3
0
820
Source Code Diff Revolution
tsantalis
0
140
重要だけど測れていないもの:高齢者ケアの見えない課題
theoriatec2024
0
520
SLAMはどこまで解決されたのか?
tomonom
0
1.3k
【中間報告】国会議員の立法・政策実務を支える環境を巡る現状と課題
polipoli
0
580
第64回CV・PRML勉強会 論文紹介:Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignment
sokikatayama
0
190
量子サマースクール2026「量子計算機アーキテクチャ分野の概観」
youten622
1
870
ros2-perf-multihost: 分散システムにおける客観的なアーキテクチャ評価フレームワーク
takasehideki
0
260
SOTAのさらに先へ:厳しい推論制約下での高性能モデルのPost-Training
analokmaus
0
1.5k
Featured
See All Featured
From Legacy to Launchpad: Building Startup-Ready Communities
dugsong
0
330
HTML-Aware ERB: The Path to Reactive Rendering @ RubyCon 2026, Rimini, Italy
marcoroth
4
630
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
世界の人気アプリ100個を分析して見えたペイウォール設計の心得
akihiro_kokubo
PRO
74
42k
実際に使うSQLの書き方 徹底解説 / pgcon21j-tutorial
soudai
PRO
202
76k
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.1k
Exploring anti-patterns in Rails
aemeredith
3
500
Creating an realtime collaboration tool: Agile Flush - .NET Oxford
marcduiker
35
2.6k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
141
35k
How to Think Like a Performance Engineer
csswizardry
28
2.8k
So, you think you're a good person
axbom
PRO
2
2.1k
Primal Persuasion: How to Engage the Brain for Learning That Lasts
tmiket
0
450
Transcript
Evolutionary Optimization of Model Merging Recipes Takuya Akiba, Makoto Shing,
Yujin Tang, Qi Sun, David Ha Sakana AI https://arxiv.org/abs/2403.13187 (v1: 2024/03/19) スライド作成:h0jicha (https://x.com/_h0jicha)
Abstract コスト効率の良い基盤モデルの作成手法であるモデルマージは 実験設定が 人間の直感や知識に依存 していて探索に制限がある 課題 以下のモデルを 自動的に 作成することができた ①
日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM ② 日本語 LLM + 英語 VLM → 日本語 VLM 結果 進化的モデルマージ:モデルマージに適した設定を進化計算で探索する 手法 2
Introduction 大規模言語モデル(LLM)のモデルマージ 追加的な訓練を必要とせずに新たな LLM を作成可能 → 訓練に基づく手法より コスト効率が良い 日本語 LLM
数学推論 LLM モデルマージ 日本語数学推論 LLM 3
Introduction 大規模言語モデル(LLM)のモデル構造 Advances in Transformer Models From Transformers to LLaMA
and Mistral https://www.linkedin.com/pulse/advances-transformer-models-from-transformers-llama-mistral-kavadiki-ofowc/ 4
Advances in Transformer Models From Transformers to LLaMA and Mistral
https://www.linkedin.com/pulse/advances-transformer-models-from-transformers-llama-mistral-kavadiki-ofowc/ Introduction 大規模言語モデル(LLM)のモデル構造 ① Feed Forward や Attention に 学習可能な重み が存在する ② 同一の構造を持つ層 が複数積み重なっている 5
Introduction 大規模言語モデル(LLM)のモデルマージ 6
Introduction モデルマージの課題 実験設定が 実験者の直感や知識に依存 → 人手による試行錯誤が必要で良いモデルを産みにくい 進化計算(進化的アルゴリズム)により LLM のモデルマージを 自動化
する 7
Introduction 進化的モデルマージ(Evolutionary model merge) モデルマージ時の最適な設定を進化計算により自動的に求める 8
Background and Related Work TIES-Merging (TRIM, ELECT SIGN & MERGE)
単純な重み加算によるモデルマージに発生する情報の欠落を改善 より性能の良い TIES-Merging with DARE もある TIES-Merging: Resolving Interference When Merging Models (NeurIPS2023) https://arxiv.org/abs/2306.01708 9
Background and Related Work CMA-ES (Covariance Matrix Adaptation Evolution Strategy)
進化戦略によるブラックボックス最適化 多変量正規分布のパラメタを更新しながら解空間を探索する 図は On the Eclipsing Phenomenon with Phase Codes https://ieeexplore.ieee.org/document/9078918 から引用 参考: Optunaから簡単に利用できる「CMA-ES」進化計算で最も有力な連続最適化問題のアルゴリズム https://logmi.jp/tech/articles/325461 10
Method PS マージ: パラメタ空間 におけるマージ DFS マージ: データフロー空間 におけるマージ PS
+ DFS マージ: 両方の空間 におけるマージ 11
Method PS マージ: パラメタ空間 におけるマージ 同一構造をもつ複数モデルの重みを TIES-Merging with DARE でマージする
12
Method DFS マージ: データフロー空間 におけるマージ 複数モデルの層間の横断を許して推論に用いる層を積み重ねる ※ 異なるモデル間を横断する際は 学習可能な重み Wij
を乗算 13
Method PS + DFS マージ: 両方の空間 におけるマージ PS マージで層の候補を追加して DFS
マージを適用する 14
Method 進化計算による最適化 • 設計変数 • PS マージ: TIES-Merging with DARE
で使用されるパラメタ • DFS マージ: 層の接続の順番・モデル横断時に使用される W • 目的関数:対象タスクの評価指標(ベンチマークスコア) • 最適化アルゴリズム • 基本的には CMA-ES • 多目的の場合は NSGA-II 15
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
② 日本語 LLM + 英語 VLM → 日本語 VLM 16
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
日本語 LLM shisa-gamma-7b-v1 数学推論 LLM WizardMath-7B-V1.1 Abel-7B-002 進化的モデルマージ 日本語数学推論 LLM 17
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
日本語数学推論 日本語一般推論 18
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
日本語数学推論 日本語一般推論 小さいモデルサイズで高い日本語数学推論性能を獲得 19
Experiments 20 質問 正解 日本語知識に 基づいた数学推論
Experiments ② 日本語 LLM + 英語 VLM → 日本語 VLM
日本語 LLM shisa-gamma-7b-v1 英語 VLM LLaVA-1.6-Mistral-7B 進化的モデルマージ 日本語 VLM 21
Experiments ② 日本語 LLM + 英語 VLM → 日本語 VLM
LLaVA-1.6-Mistral-7B (VLM) のモデル構造イメージ Mistral-7B-v0.1 (LLM) VLM 内で使用される LLM をマージ対象とする Visual Instruction Tuning (NeurIPS2023) https://arxiv.org/abs/2304.08485 22
② 日本語 LLM + 英語 VLM → 日本語 VLM Experiments
日本語 VQA 日本語 複雑な視覚的質問応答 日本語の視覚的質問応答タスクに適切に回答 23
Experiments 誤情報を 生成 説明として 不十分 正しく 詳細な説明 視覚的質問応答の例 24
付録 25
Background and Related Work Task Arithmetic ファインチューン済みモデルの重みからベースモデルの重みを 引いて タスクベクトル を作成し、加算してタスク性能を付与
Editing models with task arithmetic (ICLR2023) https://arxiv.org/abs/2212.04089 26
Method DFS マージの計算量 • 全マージ対象モデルの層の総数を M 、マージ後モデルの推論層数 を T とすると、マージ時の層の探索空間のサイズは
(M + 1)^T (軽量な設定 M = 64, T = 60 でも、天文学的な値となる) • 探索空間のサイズを下げるために Indicator array I を導入する • T = M × r とすると、探索空間のサイズは 2^T に削減される • このサイズであれば、進化計算で探索可能 27
Method DFS マージにおける重み行列 W について • Wij は モデル 1
の層 i と モデル 2 の層 j を接続するときの 分布シフトを緩和するために導入する重み • Wij も進化計算による最適化の対象 • 実際は FC 層としてモデリングする 28
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
MGSM (Multilingual Grade School Math) 問題 カーラは200ギガバイトのファイルをダウンロードしようとしています。 通常であれば1分あたり2ギガバイトの速度でダウンロードが可能なのですが、ダウンロードが40%進ん だところで、ウィンドウズがアップデートのインストールのため20分かけて再起動してしまいます。 その後、カーラは最初からダウンロードをし直すことになりました。ファイルのダウンロードにはどれほど の時間がかかりますか? 正解 160 (分) Juletxara/mgsm (https://huggingface.co/datasets/juletxara/mgsm) 日本語テストセットから抜粋 29
Experiments ① 日本語 LLM + 数学推論 LLM → 日本語数学推論 LLM
日本語 LLM 層 数学 LLM 層 ・推論前半で 日本語 LLM の最終層を除く全層 が使用される ・進化が進むと使用される層の数が減少する 進化に伴う推論時データフロー(層選択)の変化 30
Experiments ② 日本語 LLM + 英語 VLM → 日本語 VLM
主な実験設定 • ① パラメタ空間におけるマージ のみを適用 • アルゴリズムは日本語数学推論 LLM を作成したときと同様 • 最適化には Japanese Visual Genome VQA を使用 • https://github.com/yahoojapan/ja-vg-vqa 31