パラメータあたり最大 2bit という知識容量の発見 o INT8量子化はモデル容量を大幅に低下させない(INT4は低下) • 知識容量はモデルサイズに線形比例する [EMNLP'24 Findings] o Wikipedia 全体の記憶に 1000Bパラメタが必要と推定 o 内部パラメータだけで事実知識を保持するのは非効率的 o 外部記憶(RAGなど)の活用が重要 Reasoning / Tool Useが下手になる • 小規模モデルでは外部記憶との連携能力が低下 [ACL‘26] o Reasoning (CoT) / Tool Use を判断する能力が不十分 o → 大規模モデルと比較して検索回数が増加 o 指示追従能力も低下(出力フォーマットを遵守できない) o 小規模モデルから Agentic RAG の能力を引き出す事後学習法を提案 [ICLR’25] Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws [EMNLP’24 Findings] Scaling Laws for Fact Memorization of Large Language Models [ACL ‘26] Can Compact Language Models Search Like Agents? 16
Models, SLM)と そのオーケストレーションに注目 o 高速! o 低コスト! o 大量に起動して並列処理可能! • エージェント内部LLM呼び出しログを収集(10k-100k) o 複雑なタスクをLLMが分解, SLM へオフロードするワークロードへ • 小規模言語モデル(SLM)は Agntic AI の「未来」 • SLMから能力を「事後学習でいかに引き出すか」に注目 [arXiv, 2025] Small Language Models are the Future of Agentic AI 17