𝑎(1 − exp(− 𝑛𝜏 )) Mahmood et al. (2022) 目標性能に必要なデータ量を推定 “How Much More Data Do I Need?” 小規模な学習結果へ曲線を当て、目標精度へ到達するまでに必要な追加データ量を外挿する。 MOSAIC ─ Scaling-Aware Data Selection | 第 67 回 コンピュータビジョン勉強会@関東 5
▪ Rafid Mahmood et al. “How Much More Data Do I Need? End-to-End Autonomous Driving Systems.” CVPR 2026. arXiv:2604.08366 Estimating Requirements for Downstream Tasks.” CVPR 2022. arXiv:2207.01725 ▪ Feiyang Kang et al. “AutoScale: Scale-Aware Data Mixing ▪ Kimia Hamidieh et al. “Domain-Aware Scaling Laws for Pre-Training LLMs.” COLM 2025. arXiv:2407.20177 Uncover Data Synergy.” 2026. arXiv:2607.11052 ▪ Ozan Sener and Silvio Savarese. “Active Learning for Convolutional Neural Networks: A Core-Set Approach.” ICLR 2018. arXiv:1708.00489 ▪ Sang Michael Xie, Francesco Tonin, and Volkan Cevher. “Chameleon: A Flexible Data-Mixing Framework for Language Model Pretraining and Finetuning.” ICML 2025. OpenReview この版は「全部盛り」。発表時間に応じて full tables・submetrics・関連研究を appendix へ回してください。 MOSAIC ─ Scaling-Aware Data Selection | 第 67 回 コンピュータビジョン勉強会@関東 38