昇腾0Day支持DeepSeek-V3.2-Exp

2025-09-30 09:37:30     来源:

2025年9月29日,DeepSeek-V3.2-Exp发布并开源,引入稀疏Attention架构。昇腾已快速基于vLLM/SGLang等推理框架完成适配部署,实现DeepSeek-V3.2-Exp 0day支持,并面向开发者开源所有推理代码和算子实现。

昇腾0Day适配和参考实践

昇腾在DeepSeek-V3.2-Exp一发布开源即实现了DeepSeek-V3.2-Exp BF16模型部署,并在CANN平台上完成对应的优化适配,整体部署策略沿用DeepSeek的大EP并行方案,针对稀疏DSA结构,叠加实现长序列亲和的CP并行策略,兼顾时延和吞吐,在128K长序列下能够保持TTFT低于2秒、TPOT低于30毫秒的推理生成速度。

NPU DeepSeek-V3.2-Exp推理优化实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_inference_guide.md

昇腾针对DeepSeek-V3.2-Exp架构中两个全新的算子:Lightning Indexer (LI) 以及Sparse Flash Attention (SFA),针对性地进行算子Tiling设计、Cube核与 Vector核间的流水优化、计算流程的实现优化等,模型和融合Kernel均已开源。

NPU DeepSeek-V3.2-Exp Ascend C融合算子优化:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_ascendc_operator_guide.md

为进一步提高昇腾融合算子的编程易用性,昇腾CANN首次推出大融合算子的编程体系PyPTO,旨在简化算子开发流程,同时保持高性能计算能力。该框架创新性地采用PTO(Parallel Tensor/Tile Operation)编程范式,以Tensor为基本数据表达方式,构建计算图,实现高效计算与优化。目前在昇腾上已经基于PyPTO完成DeepSeek-V3.2-Exp模型中DeepSeek Indexer Attention和Lightning indexer算子的开发实践,仅需几百行代码即可完成动态Shape算子编程和算子整网运行。

基于PyPTO的Lightning Indexer和DeepSeek Indexer Attention算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_pypto_operator_guide.md

在昇腾上基于vLLM、SGLang推理框架部署和TileLang算子编程实践

昇腾不仅提供了DeepSeek-V3.2-Exp的官方参考实践,也同步支持vLLM和SGLang等业界主流大模型推理框架部署,提供完整功能,能够让广泛的开发者在社区直接下载相关代码体验DeepSeek-V3.2-Exp模型,可以在昇腾实现融合算子、稀疏访存、多核并行计算等深度优化能力,并持续优化DeepSeek-V3.2-Exp在主流社区的推理性能。

大模型推理框架vLLM及昇腾实现:

https://github.com/vllm-project/vllm-ascend/tree/v0.9.1-dev/examples/deepseek.md

大模型推理框架SGLang及昇腾实现:

https://github.com/sgl-project/sglang/issues/11060

TileLang是由Tile-AI社区发起的Tile-level的类Python的AI编程语言(DSL)项目,在Tile粒度上进行编程和编译,实现模型算子和硬件的高效协同。昇腾已经实现TileLang的Sparse Flash Attention和Lightning Indexer算子开发,后续将支持更完备的NPU算子并提升性能和泛化性。

NPU DeepSeek-V3.2-Exp TileLang算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek-v3.2-exp/deepseek_v3.2_exp_tilelang_operator_guide.md

TileLang-Ascend开源社区:

https://github.com/tile-ai/tilelang-ascend

昇腾凭借敏捷协同优化能力,0Day高效完成DeepSeek-V3.2-Exp适配,不仅深度开放自研编程语言AscendC及PyTorch算子源码,也积极拥抱开源生态,同步实现vLLM、SGLang等主流框架的快速支持,并携手开源社区Tile-AI共同开源NPU编程项目TileLang-Ascend。我们诚挚期待全球开发者加入昇腾社区,基于昇腾软硬件平台进行研究和创新,在Agent AI、内容理解等长文本新应用场景带来更好的用户体验,携手推进AI产业迈向新高度。

标签:

猜你喜欢

一眼沦陷的高颜值微单!佳能R50V:轻便潮酷还能打,日常创作全掌握
让意大利鞋业竞相抛出橄榄枝,中国的3D打印技术到底有什么魔力?
2025 微单专业横评:佳能 R50V 获双重认证,成 8000 元内便携双修首选机型
ChatExcel重磅发布:基于AMD锐龙AI MAX+ 395处理器的数据分析Mini AI 工作站
广西拾加壹科技旗下阶段者机器人联袂智元创新 以人机共融新模式赋能东博会
卖爆了!360 AI Note两周售罄10000台,AI记录助手引爆职场
第九届AES南非展载誉收官,成果丰硕,获权威媒体盛赞
AI正能量:方正电子以超强AI造字技术 助力数字中文建设
合肥轨道交通入驻抖音生活服务,联名地铁卡上线即被抢空
米奥兰特联展带领超1600家中企出海,深化国际经贸合作
德凯成功主办CCC Plugfest,数字钥匙V4等关键技术测试圆满落幕
洞见人与智能体协作七大趋势!蓝凌用户大会邀您11.6智启未来
奇多多AI学伴亮相2025云栖大会,无界方舟用AI“慧眼”开启智能早教时代
关于举办第七届工业互联网大赛的通知
脸色差、嗯嗯不顺?你的“肠道救星”来了!沛若冠100携600亿高活菌全新上市,由内养出好气色
核桃编程“编程未来·人工智能科普公益论坛”在西安举办
“跑分”≠“躺赚” 小心掉入洗钱陷阱
FlyLink 以创新商业模式入选世界互联网大会跨境电商实践案例集
首驱科技以“智能出行机器人”,引领出行生态变革
叠纸游戏连续出席全球性技术大会,中国游戏展现国际技术影响力
轻薄或许无需“妥协”!联想moto X70 Air宣布10月底发布
绍兴启动“高校青年专家校企双向行动”,赋能产业发展,共筑产教融合新生态
免费, 是影像SaaS的 “ 重构” 起点
迅雷游戏加速器国庆特惠|首充低至3.2折,额外加赠月卡或周卡!
神通科技吉光光场屏10月10日上市发布,打造“人-车-家”无界新体验
2025年手机影像评测报告:5000元档成谁比较强?
生态共建,新时达工博会上联合多方伙伴打造具身智能联盟
【思享无限拾遗计划】一块布,如何染出千年蓝?
美的发布5分钟超速沸电火锅:0氟健康涂层+超薄分体设计,聚会涮烤无需等待
科技工作者有了“新朋友圈”!“智链创享・科友汇”为产业链“储智”