如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南,通过分析 485 个模型和 190 万条性能指标,拟合超 1000 条扩展定律。研究发现预测相对误差最佳可控制在 4%,并证实小模型与大模型存在可迁移规律。建议优先训练多个小模型而非追求大模型,中期检查点数据最具预测价值。这项研究为资源受限的研究者提供了更公平参与大模型研究的可能,揭示了扩展定律在跨模型家族间的通用性。

发布于2026年4月13日 10:04
编辑小创
评论0
阅读19

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南

训练大型语言模型往往耗资数百万美元。在预算有限的情况下,研究人员需要在模型架构、优化器和数据集选择等关键决策上精打细算。传统做法是通过扩展定律( scaling laws )来预测大模型性能:用规模更小的模型来估算目标大型模型的预测质量。然而,面对数千种可能的扩展定律构建方式,如何选择一直缺乏系统性的参照标准。

MIT-IBM Watson AI Lab 研究团队近日解决了这一困境。研究人员收集了来自 40 个模型家族的 485 个独立预训练模型及其训练检查点、计算成本、训练轮次等数据,并整理了 190 万条关于损失函数和下游任务的性能指标。基于这些数据,研究团队拟合了超过 1000 条扩展定律,并对比了它们在不同架构、模型规模和训练策略下的预测准确性。

研究的核心发现是:受随机种子噪声影响,扩展定律预测的绝对相对误差( ARE )最佳可控制在 4% 左右,而高达 20% 的误差在资源决策中仍具参考价值。具体而言,将中期训练检查点纳入分析能显著提升预测可靠性,但训练初期、 10 亿 tokens 之前的数据噪声较大,应当舍弃。研究建议优先在不同规模区间训练多个模型,而非一味追求大模型,五模型起步可提供稳健的预测基础。在成本受限的情况下,也可以仅训练目标模型家族中一个较小规模模型,借用架构相近家族的扩展定律参数。

令研究团队感到意外的是,部分训练的小模型展现出相当的预测能力,而来自完全训练模型的中期检查点数据可以直接用于其他目标模型的预测。更出乎意料的是,扩展定律在大型模型和小型模型之间表现出强相关性。此前学界普遍认为小模型与大规模模型存在本质差异。

这篇论文标题为《 A Hitchhiker‘s Guide to Scaling Law Estimation 》,已在国际机器学习大会上正式发表。研究人员下一步计划将分析扩展至模型推理阶段,探讨推理时长与性能的关联。


创艺洞察

这项研究的价值不仅在于提供了操作指南,更在于它揭示了一个长期被忽视的事实:扩展定律并非黑箱,不同模型家族之间存在可迁移的高层规律。三个超参数便能解释几乎全部行为变异,这意味着资源受限的研究者有了更公平地参与大模型研究的可能。与此同时,研究团队对推理阶段扩展定律的布局更具前瞻性。当训练成本相对固定而推理需求持续增长时,能够预判推理资源需求的理论框架将成为下一代模型开发的核心基础设施。

相关文章

Runway 学院:视频如何一键转绿幕
AI 教程知识
2026年6月13日
0 条评论
小创

Runway 学院:视频如何一键转绿幕

Runway Aleph 2.0 模型通过提示词实现视频一键生成绿幕素材或干净背景,替代传统手动抠像。用户在 Edit Studio 上传视频后,利用提示词即可分离主体与背景,支持运动引导及二次合成创作。该 AI 工作流简化了复杂后期流程,显著提升视频编辑效率,推动专业后期技术平民化,适用于换景、特效添加及动画二创等多种场景。

#视频编辑#Runway
阅读全文
Claude Fable 5 实测
AI 产品工具
2026年6月13日
0 条评论
小创

Claude Fable 5 实测

Claude Fable 5 发布,定位为 Mythos 降权公开版,核心优势在于长程复杂任务的稳定性。该模型支持 1M token 上下文,在 Stripe 全库迁移等场景中表现优异。安全方面采用运行时分流机制,高风险请求自动路由至 Opus 4.8。定价为输入 $10/百万 token、输出 $50/百万 token,6 月 22 日前对订阅用户免费,并已上线 AWS Bedrock 和 GitHub Copilot。实测显示其代码生成与 3D 建模能力显著优于前代,建议针对长任务场景进行实

#AI 模型#Claude Fable 5
阅读全文
能自主运行数天的神话级模型 Claude Fable 5 正式发布
AI 产品工具
2026年6月13日
0 条评论
小创

能自主运行数天的神话级模型 Claude Fable 5 正式发布

Anthropic 发布最强模型 Claude Fable 5 并向公众开放。针对此前预览版存在的安全隐患,该模型引入安全路由机制,将高风险请求自动分流至 Opus 4.8 处理,在保障安全的同时释放通用能力。Fable 5 具备超高自主性,可连续数天独立处理金融、法律及科研等领域的复杂项目,无需人工干预。这种长周期、高自主性的任务处理能力,有望彻底改变现有工作流。

#Claude#AI 模型
阅读全文
互动讨论

评论区

围绕《如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。