昇腾0Day适配小红书最新开源大模型dots3-note preview!

2026年8月14日,小红书正式发布dots3-note preview开源大模型。昇腾Atlas 800 A3、Atlas 900 A3 SuperPoD超节


2026年8月14日,小红书正式发布dots3-note preview开源大模型。昇腾Atlas 800 A3、Atlas 900 A3 SuperPoD超节点已完成 dots3-note preview的全量适配,基于vLLM Ascend开源推理引擎提供完整的部署与推理能力,性能持续迭代优化。


作为dots3系列的首个版本,dots3-note preview开源大模型以280B总参数量、16B激活参数量构建能力底座,同时具备文本、视觉、语音全模态感知理解能力。在该模型发布当天,昇腾完成0Day推理部署适配与性能优化,在完整保留模型文本、视觉、语音一体化全模态理解能力的前提下,实现了稳定运行与生成效率的显著提升,为长程复杂任务场景智能落地提供高效可靠的算力支撑。


■ ots3-note preview:具备全模态感知与长程自主决策能力的开源大模型


在模型结构层面,dots3-note preview基于MLA底座构建了SWA与DSA的混合稀疏注意力机制,以极低的KV Cache开销将推理的上下文长度提升至原生512k。同时采用了更为稀疏的MoE架构,通过引入专家级别和序列级别的balance loss term来缓解不均衡性。

在文本预训练方面,dots3-note preview引入Gated attention消除Attention的训练不稳定性,同时设计并开源了UltraEP,一套面向fine-trained MoE的软硬协同负载均衡系统。可以根据runtime的实时routing状态进一步进行动态的负载均衡,显著提升训练效率。

在多模态预训练方面,dots3-note preview设计了BigMac,一套针对高效VLM训练的Pipeline Scheduling系统,解决视觉与语言模块计算特征不同带来的调度问题。BigMac通过dependency-safe nested pipeline协同调度异构workload,减少整体pipeline bubble和activation memory。

在后训练方面,dots3-note preview设计了一套Unified Reward机制,来统一SFT和RL的训练objective;同时通过group-wise length-ranking的reward function来消除length bias,提升generation效率的同时保证对齐效果。

在长程Agent能力上,dots3-note preview重点探索了面向超长程任务的强化学习方法,并叠加上同参数档位里面最出色的多模态视觉理解,从而可以对各类强视觉输入类任务有更好的表现,例如:整理琐碎的票据图像文件、用户输入图像后对齐审美设计偏好、精准定位图片中各种视觉元素等。

在推理效率上,dots3-note preview原生支持MTP Speculative Decoding,并通过自研的4bit量化、高性能attention算子、MegaKernel等技术满足多样负载特征下的极致性能需求。

■ 基于昇腾的dots3-note preview推理适配及部署

dots3-note preview 接入vLLM Ascend后,用户可完全沿用vLLM标准服务接口、调度逻辑与参数体系。vLLM Ascend原生支持Prefix Cache、Chunked Prefill、异步调度、PD分离、内存池化等核心框架特性;在适配dots3-note preview特殊模型结构与参数设计的同时,完整保留框架原有能力与使用方式,实现模型无缝融入现有vLLM推理服务体系,迁移零门槛。

★关键适配及优化点:

●全模态端到端适配

基于vLLM Ascend推理框架,完成dots3-note preview文本、图片、音频全模态能力的端到端适配,打通视觉编码器、音频特征提取与LLM主干推理的全链路,完整保留模型原生多模态理解与交互能力,支持图文、音文、视频等多模态输入场景的稳定推理。

●框架深度特性优化,释放硬件算力潜能

FlashComm通信优化:针对AllReduce后RMSNorm、Dynamic Quant、MLA QKV降维等列向无关算子的冗余计算问题,通过数学等价变换将AllReduce拆解为ReduceScatter+AllGather,把列向独立算子前移至两阶段通信之间执行,彻底消除多卡间的重复计算,有效降低推理时延。

FUSED_MC2通算融合:启用MoE层dispatch_ffn_combine融合算子,将原本“dispatch、gmm1、swiglu、gmm2、combine”等通信的多段独立Kernel合并为单一大算子,通过减少Kernel Launch次数、通信与计算深度流水、中间张量不落盘等手段,显著提升MoE推理吞吐。

●MTP投机推理原生支持,攻坚增量解码时延瓶颈

针对增量推理阶段TPOT(单Token生成耗时)这一吞吐核心瓶颈,在vLLM Ascend中原生适配dots3-note preview的MTP投机解码能力,通过单次前向并行生成多Token候选并校验复用,大幅减少解码前向次数,有效降低TPOT、提升整体生成效率,更好满足高并发在线业务的低时延诉求。

结语

昇腾0Day适配dots3-note preview再次表明,昇腾AI已具备支撑前沿大模型从发布到规模化部署的全流程能力,并始终致力于为世界提供新选择,以极致的算力与开放的生态,加速AI产业的繁荣。


相关链接



dots3-note preview昇腾部署指导:

https://docs.vllm.ai/projects/ascend/en/latest/tutorials/models/Dots3-Note.html  


dots3-note preview模型权重:

https://huggingface.co/dots-studio/dots3-note-prev


小红书官方技术blog:

https://studio.dots.ai/dots/dots3-zh.html

关于昇腾计算

基于华为昇腾系列(HUAWEI Ascend)AI处理器和基础软件构建Atlas人工智能计算解决方案,包括Atlas系列模块、板卡、小站、服务器、集群等丰富的产品形态,打造面向“端、边、云”的全场景AI基础设施方案,覆盖深度学习领域推理和训练全流程。


Atlas 800T A2训练服务器,Atlas 800I A2推理服务器,Atlas 800T A3超节点服务器Atlas 800I A3超节点服务器,Atlas 300I A2,Atlas 300I Pro 推理卡Atlas 300I Duo 推理卡


珠海华为昇腾计算产品    珠海市东道信息技术有限公司





PARTNER

成为合作伙伴

 

期待与您的合作

 

  • 您的姓名

  • 联系电话

  • 您的需求

提交

验证码
看不清?换一张
取消
确定
图片展示

珠海市东道信息技术有限公司

 

电话:0756-2252006  /  0756-2252055

手机:18023086166 / 13539556536(孙先生)

18023093616(朱先生)

13823081550(谢小姐)
15676730263(丘小姐)

邮箱:627935592@qq.com

地址:珠海香洲区凤凰南路1038号海城大厦1606房

© 东道信息技术 粤ICP备20022794号

0756-2252006

地址:珠海市香洲区凤凰南路1038号海城大厦1606室

电话:0756-2252006 / 0756-2252055

手机:18023086166 (孙先生)  13539556536(于先生) 13823081550(谢小姐)18023093613(朱先生)

邮箱:624732830@qq.com

图片展示

业务咨询微信

图片展示

公司手机网站

版权所有 © 珠海市东道信息技术有限公司 - 网站ICP备案:粤ICP备20022794号 -  粤公网安备44040202001632号   免责声明

网站建设:超凡科技

在线咨询

您好,请点击在线客服进行在线沟通!

联系方式
热线电话
18023086166
上班时间
周一到周六
扫一扫二维码
二维码
业务咨询微信
添加微信好友,详细了解产品
使用企业微信
“扫一扫”加入群聊
复制成功!
添加微信好友,详细了解产品
我知道了