如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南,通过分析 485 个模型和 190 万条性能指标,拟合超 1000 条扩展定律。研究发现预测相对误差最佳可控制在 4%,并证实小模型与大模型存在可迁移规律。建议优先训练多个小模型而非追求大模型,中期检查点数据最具预测价值。这项研究为资源受限的研究者提供了更公平参与大模型研究的可能,揭示了扩展定律在跨模型家族间的通用性。

发布于2026年4月13日 10:04
编辑小创
评论0
阅读15

MIT-IBM 团队发布大规模语言模型扩展定律系统性指南

训练大型语言模型往往耗资数百万美元。在预算有限的情况下,研究人员需要在模型架构、优化器和数据集选择等关键决策上精打细算。传统做法是通过扩展定律( scaling laws )来预测大模型性能:用规模更小的模型来估算目标大型模型的预测质量。然而,面对数千种可能的扩展定律构建方式,如何选择一直缺乏系统性的参照标准。

MIT-IBM Watson AI Lab 研究团队近日解决了这一困境。研究人员收集了来自 40 个模型家族的 485 个独立预训练模型及其训练检查点、计算成本、训练轮次等数据,并整理了 190 万条关于损失函数和下游任务的性能指标。基于这些数据,研究团队拟合了超过 1000 条扩展定律,并对比了它们在不同架构、模型规模和训练策略下的预测准确性。

研究的核心发现是:受随机种子噪声影响,扩展定律预测的绝对相对误差( ARE )最佳可控制在 4% 左右,而高达 20% 的误差在资源决策中仍具参考价值。具体而言,将中期训练检查点纳入分析能显著提升预测可靠性,但训练初期、 10 亿 tokens 之前的数据噪声较大,应当舍弃。研究建议优先在不同规模区间训练多个模型,而非一味追求大模型,五模型起步可提供稳健的预测基础。在成本受限的情况下,也可以仅训练目标模型家族中一个较小规模模型,借用架构相近家族的扩展定律参数。

令研究团队感到意外的是,部分训练的小模型展现出相当的预测能力,而来自完全训练模型的中期检查点数据可以直接用于其他目标模型的预测。更出乎意料的是,扩展定律在大型模型和小型模型之间表现出强相关性。此前学界普遍认为小模型与大规模模型存在本质差异。

这篇论文标题为《 A Hitchhiker‘s Guide to Scaling Law Estimation 》,已在国际机器学习大会上正式发表。研究人员下一步计划将分析扩展至模型推理阶段,探讨推理时长与性能的关联。


创艺洞察

这项研究的价值不仅在于提供了操作指南,更在于它揭示了一个长期被忽视的事实:扩展定律并非黑箱,不同模型家族之间存在可迁移的高层规律。三个超参数便能解释几乎全部行为变异,这意味着资源受限的研究者有了更公平地参与大模型研究的可能。与此同时,研究团队对推理阶段扩展定律的布局更具前瞻性。当训练成本相对固定而推理需求持续增长时,能够预判推理资源需求的理论框架将成为下一代模型开发的核心基础设施。

相关文章

如何解决 Hermes Agent 中 QQ Bot “灵魂不在线”
AI 教程知识
2026年5月8日
0 条评论
零重力瓦力

如何解决 Hermes Agent 中 QQ Bot “灵魂不在线”

Hermes QQ Bot 常因网络波动出现“灵魂不在线”的静默断连,根源在于 WebSocket 重连逻辑缺陷导致进程未正常退出。目前修复版本已解决重连耗尽问题,但深层异常捕获仍有待完善。建议用户升级至最新版,配置 systemd 或 Docker 自动重启策略,并优化代理超时设置,以保障 QQ Bot 稳定运行。

#Hermes Agent
阅读全文
一个 JSON 公式,让 AI 出图告别抽卡玄学
AI 教程知识
2026年5月8日
0 条评论
小创

一个 JSON 公式,让 AI 出图告别抽卡玄学

AI 技术博主 AI Master 提出用 JSON 结构化提示词替代自然语言,解决 AI 绘图修改局部时整体崩坏的问题。该方法将主体、灯光等元素独立分槽,配合 Gemini 提取参考图信息,可实现精准调整颜色或风格而不影响其他细节。此方案适用于角色一致性控制及摄影参数迁移,同样兼容 Veo 3.1 视频生成,让 AI 创作从随机抽卡转向可控的确定性系统。

#Veo#Nano Banana#提示词工程
阅读全文
2026 年 AI 工具全拆解,一个公式搞定所有提示词
AI 教程知识
2026年5月8日
0 条评论
小创

2026 年 AI 工具全拆解,一个公式搞定所有提示词

AI 技术博主 AI Master 指出,多数用户效果平平源于未掌握底层逻辑。它拆解了语言、图像及视频三大模型的运作机制,并梳理了 2026 年主流工具格局。针对提示词,AI Master 提出文本需明确上下文与角色,图像遵循六要素公式,视频则强调单一动作与环境设定。核心观点在于将 AI 视为需清晰简报的新人,通过迭代而非一次搜索来优化产出,适合希望提升各类生成效果的创作者。

阅读全文
互动讨论

评论区

围绕《如何构建 AI 扩展定律以实现高效 LLM 训练和预算最大化》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。