2026年8月14日,小红书正式发布dots3-note preview开源大模型。昇腾Atlas 800 A3、Atlas 900 A3 SuperPoD超节点已完成 dots3-note preview的全量适配,基于vLLM Ascend开源推理引擎提供完整的部署与推理能力,性能持续迭代优化。
作为dots3系列的首个版本,dots3-note preview开源大模型以280B总参数量、16B激活参数量构建能力底座,同时具备文本、视觉、语音全模态感知理解能力。在该模型发布当天,昇腾完成0Day推理部署适配与性能优化,在完整保留模型文本、视觉、语音一体化全模态理解能力的前提下,实现了稳定运行与生成效率的显著提升,为长程复杂任务场景智能落地提供高效可靠的算力支撑。
■ ots3-note preview:具备全模态感知与长程自主决策能力的开源大模型
在模型结构层面,dots3-note preview基于MLA底座构建了SWA与DSA的混合稀疏注意力机制,以极低的KV Cache开销将推理的上下文长度提升至原生512k。同时采用了更为稀疏的MoE架构,通过引入专家级别和序列级别的balance loss term来缓解不均衡性。
在文本预训练方面,dots3-note preview引入Gated attention消除Attention的训练不稳定性,同时设计并开源了UltraEP,一套面向fine-trained MoE的软硬协同负载均衡系统。可以根据runtime的实时routing状态进一步进行动态的负载均衡,显著提升训练效率。
在多模态预训练方面,dots3-note preview设计了BigMac,一套针对高效VLM训练的Pipeline Scheduling系统,解决视觉与语言模块计算特征不同带来的调度问题。BigMac通过dependency-safe nested pipeline协同调度异构workload,减少整体pipeline bubble和activation memory。
在后训练方面,dots3-note preview设计了一套Unified Reward机制,来统一SFT和RL的训练objective;同时通过group-wise length-ranking的reward function来消除length bias,提升generation效率的同时保证对齐效果。
在长程Agent能力上,dots3-note preview重点探索了面向超长程任务的强化学习方法,并叠加上同参数档位里面最出色的多模态视觉理解,从而可以对各类强视觉输入类任务有更好的表现,例如:整理琐碎的票据图像文件、用户输入图像后对齐审美设计偏好、精准定位图片中各种视觉元素等。
在推理效率上,dots3-note preview原生支持MTP Speculative Decoding,并通过自研的4bit量化、高性能attention算子、MegaKernel等技术满足多样负载特征下的极致性能需求。
■ 基于昇腾的dots3-note preview推理适配及部署
dots3-note preview 接入vLLM Ascend后,用户可完全沿用vLLM标准服务接口、调度逻辑与参数体系。vLLM Ascend原生支持Prefix Cache、Chunked Prefill、异步调度、PD分离、内存池化等核心框架特性;在适配dots3-note preview特殊模型结构与参数设计的同时,完整保留框架原有能力与使用方式,实现模型无缝融入现有vLLM推理服务体系,迁移零门槛。
★关键适配及优化点:
●全模态端到端适配
基于vLLM Ascend推理框架,完成dots3-note preview文本、图片、音频全模态能力的端到端适配,打通视觉编码器、音频特征提取与LLM主干推理的全链路,完整保留模型原生多模态理解与交互能力,支持图文、音文、视频等多模态输入场景的稳定推理。
●框架深度特性优化,释放硬件算力潜能
FlashComm通信优化:针对AllReduce后RMSNorm、Dynamic Quant、MLA QKV降维等列向无关算子的冗余计算问题,通过数学等价变换将AllReduce拆解为ReduceScatter+AllGather,把列向独立算子前移至两阶段通信之间执行,彻底消除多卡间的重复计算,有效降低推理时延。
FUSED_MC2通算融合:启用MoE层dispatch_ffn_combine融合算子,将原本“dispatch、gmm1、swiglu、gmm2、combine”等通信的多段独立Kernel合并为单一大算子,通过减少Kernel Launch次数、通信与计算深度流水、中间张量不落盘等手段,显著提升MoE推理吞吐。
●MTP投机推理原生支持,攻坚增量解码时延瓶颈
针对增量推理阶段TPOT(单Token生成耗时)这一吞吐核心瓶颈,在vLLM Ascend中原生适配dots3-note preview的MTP投机解码能力,通过单次前向并行生成多Token候选并校验复用,大幅减少解码前向次数,有效降低TPOT、提升整体生成效率,更好满足高并发在线业务的低时延诉求。
结语
昇腾0Day适配dots3-note preview再次表明,昇腾AI已具备支撑前沿大模型从发布到规模化部署的全流程能力,并始终致力于为世界提供新选择,以极致的算力与开放的生态,加速AI产业的繁荣。
dots3-note preview昇腾部署指导:
https://docs.vllm.ai/projects/ascend/en/latest/tutorials/models/Dots3-Note.html
dots3-note preview模型权重:
https://huggingface.co/dots-studio/dots3-note-prev
小红书官方技术blog:
https://studio.dots.ai/dots/dots3-zh.html
关于昇腾计算
基于华为昇腾系列(HUAWEI Ascend)AI处理器和基础软件构建Atlas人工智能计算解决方案,包括Atlas系列模块、板卡、小站、服务器、集群等丰富的产品形态,打造面向“端、边、云”的全场景AI基础设施方案,覆盖深度学习领域推理和训练全流程。
Atlas 800T A2训练服务器,Atlas 800I A2推理服务器,Atlas 800T A3超节点服务器,Atlas 800I A3超节点服务器,Atlas 300I A2,Atlas 300I Pro 推理卡,Atlas 300I Duo 推理卡
珠海华为昇腾计算产品 珠海市东道信息技术有限公司
售前咨询