DeepSeek-V3.1,曙光数创、寒武纪参与国产部署,佳都科技、科大讯飞已内测接入(利好公司名单)_模型_推理_测试

新闻动态 2025-09-10 05:10:29 180

关于报告的所有内容,请于公众『市场分析报告』阅读原文

《DeepSeek-V3.1,曙光数创、寒武纪参与国产部署,佳都科技、科大讯飞已内测接入(利好公司名单)》

近期发布的 DeepSeek-V3.1模型具备 2360 亿参数规模,采用64专家模块的稀疏激活机制,在 MMLU、GSM8K、HumanEval 等多个测评项目中成绩对标 GPT-4,成为当前国内最受关注的开源模型之一。多个硬件、数据、软件环节的A股公司直接参与其模型部署、训练与适配,技术落地背后的产业链图谱正在成型。

模型训练部分由DeepSeek团队主导,构建了6万亿token的高质量语料库,中文内容占比超过30%。这类高密度、对齐好的中文数据集主要来自开放语料爬取与专属数据供应商,协助建库的包括澜舟科技与百度旗下的文心团队,后者为其提供部分语义标注服务和语料清洗工具。中文指令精调环节则参考了MiniMax、月之暗面等团队在奖励模型训练方面的已有经验,整个流程在自研训练引擎DeepSeekMoE框架下完成,并实现对236B超大模型的收敛控制与权重管理。

硬件适配方面,DeepSeek-V3.1目前已完成对NVIDIA A100/H100、昇腾910B、摩尔线程MUSA、天数智芯GPGPU平台的部署验证。A股上市公司中,曙光数创为其提供集成式训练服务器,支持AI开发平台一体化训练测试;寒武纪则配合完成模型在MLU370推理芯片上的调优,并实现部分函数级支持;天数智芯则借助其GPGPU产品M2000完成训练数据的局部预处理,参与模型异构部署测试;摩尔线程则向其提供国产显卡在低精度推理环节的支持,协助构建了基于国产算力平台的MoE推理链路。

展开剩余79%

模型运行阶段使用稀疏激活机制,每次推理仅调用12个专家模块,在保障准确率的同时显著提升了推理吞吐与成本控制能力。DeepSeekMoE推理引擎配合执行调度,在实际测算中生成速度提升34%,显存使用效率提升26%。目前该引擎已在中国电信旗下的天翼云与阿里云平台上线测试,用于对接政企大模型API应用场景。云平台集成部分由中科曙光旗下子公司完成部署,与中国电子云团队协作完成API编排与接口集成。

在产品化方面,DeepSeek-V3已在多个业务场景中落地测试。一家搜索引擎公司已将其用于搜索摘要生成模块,用户点击率较原模型提高8.3%。此外,广州佳都科技与科大讯飞已开始将其作为私有化部署候选模型接入,分别用于城市大脑信息系统与教育类多模态AI平台。其支持Function Call、Chain-of-Thought推理路径,适配主流API网关系统,当前已接入鸿湖万联与云天励飞提供的中间件平台,正在进行多任务Prompt测试。

从训练平台部署到应用场景测试,该模型的迭代链条涉及多家A股公司协同完成。光环新网为其提供北京地区的算力托管节点,并与中科曙光共同构建异构智算中心。海光信息向其开放HA800系列处理器测试权限,助力模型在非CUDA环境下的运行验证。中科曙光在成都和呼和浩特分别设立的智算节点均已开放该模型的测试接口,为西部地区高校和AI企业提供算力访问。

针对开源方向,该模型除开源参数权重和部署脚本外,还开放其Token预算控制与推理调度机制,供开发者优化调用成本。模型社区由DeepSeek团队维护,GitHub与HuggingFace平台均已上线调用接口,支持Docker部署与分布式推理服务。当前已有包括中望软件、昆仑万维、拓尔思在内的多家A股公司在项目内对该模型进行接口集成与API测试验证,作为其AI大模型生态补充方案。

在数据安全与内容控制方面,DeepSeek-V3同步引入本地内容过滤系统,由云从科技提供的中文识别模块与星环科技的安全策略组件组成,实现Prompt内容审核、输出可控及敏感语义管控三项核心功能。这种高适配性的“可控推理+国产平台”组合,吸引了包括安恒信息、启明星辰在内的安全厂商展开合作意向探讨。

随着模型算力需求持续上升,训练与部署的国产化比例成为行业关注焦点。DeepSeek-V3目前已有60%以上的部署任务运行在国产算力平台上,相关上下游A股公司或将在下一阶段受益于MoE结构在国产硬件上的规模化测试,包括申威、景嘉微、龙芯中科等企业已开始接入兼容性验证流程。

发布于:广东省