DeepSeek-R1 让 Blackwell 架构的性能大升级

英伟达推出TensorRT优化的FP4版DeepSeek-R1,运行于Blackwell架构时相较H100提升25倍收益、降低单Token成本20倍;MMLU测试达FP8版本99.8%精度,兼顾速度与准确率;FP4模型已开源至Hugging Face。

发布于2025年2月27日 02:00
作者零重力瓦力
评论0
阅读0

DeepSeek-R1 让 Blackwell 架构的性能大升级

英伟达表示,DeepSeek-R1 让 Blackwell 架构的性能大升级!相比四周前的 NVIDIA H100,不仅能带来 25 倍的收益提升,每个 Token 的成本还降低了 20 倍,性价比拉满![威武]

这一切都得益于 TensorRT DeepSeek 的优化,尤其是 FP4 计算,在保持超高精度的同时,在 MMLU 通用智能测试 中达到了 FP8 版本 99.8% 的得分,可谓既快又准!

DeepSeek-R1 让 Blackwell 架构的性能大升级

现在,FP4 优化版 DeepSeek checkpoint 已正式上线 Huggface。

访问地址:https://huggingface.co/nvidia/DeepSeek-R1-FP4

相关文章

互动讨论

评论区

围绕《DeepSeek-R1 让 Blackwell 架构的性能大升级》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。