
导语:7月18日,云天励飞于2026 WAIC宣布将来两年多AI推理芯片线路图。公司规划推出DeepVerse100P、DeepVerse100D、DeepVerse 7月18日,云天励飞于2026 WAIC宣布将来两年多AI推理芯片线路图。公司规划推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款芯片,别离针对于AI推理中Prefill、Decode及Decode FFN环节的负载特性举行专用优化。 三款芯片将面向万卡异构集群举行协同设计与部署,经由过程对于差别推理阶段举行解耦,为差别负载配置越发适配的芯片及算力资源,进一步晋升体系总体效率,连续降低Token天生成本。 推理负载连续分解,算力优化走向邃密化 从负载特性来看,当前年夜模子推理运用正于形成差别类型:以对于话、常识问答为代表的通用AI助手,以繁杂推理、编程为代表的深度推理运用,以和以Agentic Coding、多Agent协同为代表的及时智能系统统。 跟着AI运用不停深切,单次使命的上下文长度、推理链路繁杂度以和及时交互要求连续提高,对于推理体系的吞吐、延迟及成本提出了更高要求。对于在年夜范围推理部署而言,峰值算力已经难以零丁反应体系效率,计较、访存、互联及体系调理等因素,配合影响Token天生效率及成本。 年夜模子推理差别阶段的计较特性也存于较着差异。Prefill需要集中处置惩罚输入上下文,对于计较能力要求较高;Decode采用逐Token天生方式,对于内存带宽及数据拜候效率越发敏感。跟着MoE等模子架构成长,Decode阶段内部的Attention与FFN于计较、访存等方面也出现出差别的资源需求。 针对于推理负载的变化,云天励飞规划于将来推出DeepVerse100P、DeepVerse100D及DeepVerse100L三款云端年夜算力推理芯片。 DeepVerse100P面向百万级上下文Prefill场景打造。于传统混部架构中,长上下文Prefil与Decode同享算力与带宽资源,会造成资源抢占,对于Decode天生吞吐造成影响。 DeepVerse100D面向Decode环节打造专用推理引擎,拥有数倍在主流芯片的内存带宽,撑持1024卡Scale-up和光互接洽统架构。经由过程按需成立光路直连,并按照使命动态重构光路,削减传统多跳电互换及静态组网中的列队、堵塞和中间转发开消,降低多节点通讯壅闭及尾延迟,提高逐Token输出的不变性。 DeepVerse100L面向Decode 阶段计较密集型的FFN环节,采用3D Memory架构,比拟主流HBM,年夜幅晋升内存带宽,并经由过程低延迟芯片互联及激活数据快速传输,提高计较与通讯的并行效率。 三款芯片协同面向万卡异构集群 跟着AI推理进入范围化部署阶段,芯片优化也正由单颗机能晋升,进一步走向多芯协同及集群级效率优化。 于万卡范围的推理集群中,体系效率并不是单卡机能的简朴叠加。差别推理负载对于计较、内存及通讯资源的需求存于较着差异,当Prefill与Decode、Attention与FFN同享统一套通用算力资源时,轻易孕育发生资源竞争。与此同时,跟着集群范围扩展,通讯壅闭、资源等候及尾延迟等问题也会进一步影响总体推理效率。 是以,晋升Token天生效率,除了了优化单颗芯片机能,还有需要缭绕芯片于集群中的协同,对于推理历程中的计较、访存、互联及资源配置举行体系级设计。 基在DeepVerse100P、DeepVerse100D及DeepVerse100L,云天励飞规划鞭策三款芯片于万卡异构集群中的分散式部署与协同运行。根据Prefill、Decode 及Decode FFN的差别负载特性,别离配置响应芯片及资源池,并经由过程高速互联形成协同运行的异构算力体系。 这一芯片协同方案缭绕Token天生全历程举行体系优化。经由过程对于差别推理阶段举行分散,降低差别负载之间的资源滋扰,并按照现实需求配置计较、访存及通讯资源,从而晋升集群资源使用率及总体推理效率。 从面向特定推理负载举行芯片优化,到差别芯片之间的协同,再到万卡级集群运用,云天励飞正于将AI推理芯片的优化规模由单颗机能延长至集群级效率。 面向“百亿Token一分钱”的持久方针,云天励飞但愿以三款芯片为焦点,形成一套办事在年夜范围Token天生的“推理工场”,经由过程芯片、互联、软件及体系的协同优化,提高算力产出效率,连续降低单元Token成本。 IFWA软件栈:降低国产算力运用门坎 硬件异构水平及集群范围不停晋升,也对于软件栈提出了更高要求。模子可否快速完成适配、算子机能可否获得充实开释、差别硬件资源可否高效协同,直接影响DeepVerse芯片于年夜范围集群中的现实运行效率。 缭绕DeepVerse芯片和其集群运用,云天励飞连续设置装备摆设IFWA软件栈,笼罩AI模子开发、编程和体系等差别层级,为模子适配、算子优化、编译部署及软硬件协同提供软件支撑。 于兼容性方面,IFWA缭绕Transformer主流架构,连续完美PyTorch ATen算子的适配及机能优化,并增强对于vLLM、SGLang等主流推理框架的撑持。经由过程兼容主流软件接口、复用成熟开源组件,降低模子向DeepVerse平台迁徙及部署的成本。 于模子适配及开发效率方面,IFWA构建了笼罩模子量化、压缩、编译及部署的一站式主动化东西链,并引入AI Agent介入推理芯片适配及机能优化。 此前,云天励飞已经开源Houmao多Agent异构编程框架,由差别Agent协同完成模子开发、算子开发、机能优化及测实验证等使命,将部门依靠人工经验的芯片软件开发流程转化为主动履行、主动验证及连续优化,缩短新模子及新算子的适配周期。 与此同时,云天励飞还有将成熟的Triton算子能力融入FlagOS,经由过程代码孝敬、结合验证及社区复用,鞭策相干能力于国产AI软件生态中进一步同享,削减差别硬件平台于算子适配上的反复投入。 于云天励飞的计划中,IFWA并不是一套关闭的软件系统,而是经由过程对于主流模子、框架及开发东西的兼容,降低开发者的迁徙及利用成本,缩短模子于DeepVerse平台上的部署周期,让国产算力越发便捷地进入现实运用。 “1001规划”,鞭策Token成本协同优化 降低Token天生成本是一项体系工程。 从芯片架构、IP与EDA,到封装测试、体系互联、软件栈及算力平台,再到模子和运用,财产链差别环节的效率城市影响终极的Token天生成本。实现极致性价比的Token,需要财产链上下流配合介入。 本年5月,云天励飞结合30余家等单元,配合签订“1001规划”发起。“1001规划”将缭绕Token天生效率及成本,鞭策财产链上下流增强协同。经由过程越发慎密的财产互助,使模子及运用需求更早反馈至芯片和体系设计环节,鞭策成熟软件能力加速复用,同时加快芯片于集群及现实场景中的验证及运用。 跟着AI走向范围化运用,算力竞争正于进一步转向对于体系效率及单元Token成本的连续优化。芯片、软件、体系及运用之间的协同水平,也将愈来愈直接地影响AI算力的现实价值。 以“百亿Token一分钱”为持久方针,云天励飞将连续推进芯片、体系、软件及财产生态协同立异,与更多生态伙伴配合提高Token性价比,鞭策国产AI算力从“能用”迈向“好用、易用、用患上起”,为人工智能范围化运用提供越发高效、普惠的算力基础。



