寒武纪完成DeepSeek-V4 Day0适配 代码已开源至GitHub
4月24日,国产AI芯片厂商寒武纪宣布,已于深度求索最新开源模型DeepSeek-V4系列发布当日完成Day 0适配,适配代码已开源至GitHub社区。
这事国内AI圈不少人关注。
本次适配覆盖285B DeepSeek-V4-flash和1.6T DeepSeek-V4-pro两个版本,基于vLLM推理框架完成。针对DeepSeek-V4的新结构,寒武纪通过自研高性能融合算子库Torch-MLU-Ops,对Compressor、mHC等模块做了专项加速;用BangC高性能编程语言,写了稀疏/压缩Attention、GroupGemm等热点算子的极致优化Kernel,把硬件底层性能完全放了出来。
寒武纪已经连续两次成为DeepSeek大模型发布后第一时间出适配的国产芯片,之前它对DeepSeek系列模型做过深入的软硬件协同性能优化,算力利用率水平在业内排得很靠前。两边能合作得这么顺,靠的是寒武纪攒了很久的自研NeuWare软件生态与芯片设计技术,也是它一直在投芯片与算法联合创新的结果。
在推理框架优化层面,寒武纪在vLLM里全支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署这些优化技术,调了调策略,在满足延时约束下拿到了最好的词元吞吐能力,端到端推理效率上去了不少。硬件特性也被挖得很透:靠MLU访存与排序加速能力,跑稀疏Attention、Indexer这些结构快了不少;高互联带宽加上低通信延时,把Prefill和Decode性能拉上去一大截。
DeepSeek-V4系列模型是4月24日11点正式上线同步开源的,在Agent能力、世界知识和推理性能上,在国内和开源领域都排得很靠前。现在DeepSeek-V4能直接跑在寒武纪芯片上。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

- 产业化进程迈出关键一步,全固态电池领域取得重大技术进展
- 戴尔上调2027财年营收预期,AI服务器积压订单达950亿美元
- 2026年将是液冷放量元年,全球智算液冷市场规模或将突破千亿元大关
- 首个化妆品强制性国标发布,行业将迈入高质量发展新阶段
- AI正深度融入药物研发全链条,产业迎来高速发展窗口期
- 三部门发布合规指引 汽车出海迈入“扎根深耕”提质新阶段(附概念股)
- 特斯拉Cybercab定档9月3日,Robotaxi量产爬坡预期增强
- HarmonyOS 6终端设备破8000万台,预计年内用户破亿:成长空间持续打开
- 国产算力芯片“爆单”,交付排期已延至一年后,相关产业迎来爆发期
- A股中期业绩快速增长!上半年A股净利润约为3.6万亿元,多家公司业绩翻倍
