8月27日,2026中国国际大数据产业博览会在贵阳召开。会上,海光信息首发了“Agent to Token开放计算架构”,依托CPU与DCU双芯协同及开放互连体系,为词元(Token)经济的规模化发展提供从芯片到应用的全新算力框架。同时,海光信息总裁助理兼智能计算产品部总经理杜夏威、海光信息总裁助理兼服务器产品部总经理张攀勇也接受了媒体采访,围绕新架构内涵、Agent 时代智能计算需求变迁、CPU 角色重构与国产算力落地等话题进行了深入解读。
从峰值算力到词元产出:Agent to Token 架构应运而生
当前,大模型正加速向产业场景渗透,Agent(智能体)成为 AI 落地真实业务的核心载体。作为连接业务需求、算力投入与服务产出的关键单元,词元的生产效率、单位成本与供给稳定性,直接决定着Agent应用的深度与词元经济的商业化进程。
一个显著的行业变化是,算力的评价逻辑正在迁移。“大家现在买卡越来越不盯着峰值算力,而看能不能把Token稳定地产出来。”面对这一趋势,杜夏威认为,这恰恰说明AI算力、AI芯片与大模型都在从技术产品本身转向业务应用视角。模型的效果、精度,芯片计算性能的高低,核心都要围绕大模型的业务化应用去服务。这种重心转移是产业走向成熟的标志。
而海光首发Agent to Token开放计算架构正是基于这一判断,面向词元经济完整价值周期,致力于打通“业务需求—智能体调度—词元生产—结果交付”闭环,以匹配Agentic AI负载的特征。
该架构通过CPU与DCU双芯及开放互连体系,将Agent与词元生产纳入统一算力调度:海光CPU承担Agent业务流的系统枢纽职能,覆盖数据预处理、多智能体沙箱隔离、任务编排决策、记忆体分级存储、向量数据库检索五大核心模块;DCU则聚焦词元生成侧的并行计算加速,承担批量解码、KV 缓存优化、预处理加速、长序列支撑等任务。双芯协同可根据 Agent并发规模、任务复杂度与词元生成量级动态调配资源。
杜夏威表示,开放计算架构既体现了双芯战略上最新的产品技术迭代,也反馈出海光一贯坚持的开放生态理念,为后续承接安全、私有化、垂直行业等产业诉求奠定基础。
全面走向业务化:DCU软硬件降低落地成本
在谈到Agent时代DCU领域的发展变化时,杜夏威表示:“Agent时代智能计算的一个核心状态就是业务化。”当人们不再聚焦算力、模型、Token话题本身,而是更多审视自身业务能获取何种助力、需要何种算力与模型,大量业务化场景需求便会随之衍生。
他判断,未来词元生产将走向云与边端全域协同。云侧代表充沛算力、便捷的Token访问与及时供给;而在私域化场景中,推理业务需要与业务流程深度整合,Token吞吐直至后端算力、模型部署都需要私有化部署,业务积累的数据还将反哺模型端,持续推动Agent与业务的契合。
业务化也带来算力选型逻辑的变化。杜夏威提醒,并非所有业务场景都需要最高算力、最大模型或最高效吞吐。“我们在Token吞吐里关注的若干毫秒或秒级延迟,放在整个业务流里可能迅速被Workflow各环节的延迟淹没掉。这时花更大力气关注毫秒级提升,业务上的投入产出比未必那么高。”他同时指出,FDE(现场部署工程师)角色正被提上日程,如何让工程人员辅助用户完成大模型打磨与算力集成,是Agent落地的关键要素。
针对国产大模型走向适配过程中面临的软件迁移难、开发门槛高、生态协同不足等挑战,海光正从两个维度推进DCU软硬件与生态建设,以降低AI应用落地的成本:
第一个维度是持续打磨自有软件栈。“我们围绕自有软件栈,持续完善其在AI生态、应用及模型支撑层面的完善度,保障最新型算子、各种数据精度以及分布式、工程化层面的功能性支撑都有完备基础,保障未来模型迭代或新算子导入都能较快支持。”杜夏威说。
第二个维度是构建开放生态,推动以大模型为核心的AI产业链走向正循环。海光通过进一步开放开源,让用户、开发者及大模型厂商等上下游伙伴能快速获取基于DCU的开发工具与方法,使其能够按自身模型研发节奏开展训练、推理与业务化部署。”不再仅仅是芯片厂商与模型侧被动适配,而是从模型研发阶段就进入,让开发者更早使用DCU做原生开发,包括训练和推理,保障未来模型迭代发布即可用、可用即好用。”
CPU回归数据中心核心:双芯协同重构算力资源配置
张攀勇也解读了Agent时代CPU角色的变化趋势:CPU将回归数据中心的核心位置。他分析,在传统AI训练场景中,大部分计算量集中在加速卡上,CPU更多承担前期数据处理与过程交互;而进入Agent时代,业务流程涵盖数据准备、任务理解、决策编排、工具调用、数据访问、结果导出等多个阶段,CPU承担了大量工作,角色愈发重要。
这一变化直接体现在CPU与加速卡的配比上。张攀勇指出,传统训练场景下两路CPU配8卡,对应即是1:4或1:8的用量;到Agent时代,随着沙箱节点、数据库节点、冷存储节点等CPU节点的增加,从1:4、1:8到1:2甚至未来收敛到1:1,成为发展趋势。他表示,综合企业级Agent 场景下各类节点的总量统计,1:1是比较合理的判断。未来随着业务继续演进,CPU占比可能进一步提高。
角色重构也对CPU提出了新的技术需求。张攀勇指出,Agent场景下CPU不一定要有非常强的计算能力,但一定要有很强的数据处理能力、带宽能力,以及CPU与DCU乃至网络之间高效统一的联动能力。具体而言,对串行处理效率、峰值判断、高并发数据交互的要求越来越高。在互联结构上,海光正推广HSL高速互连协议,提升CPU与DCU、系统内部的数据传输交互效率。CPU部则需保障更高的数据通路效率。
更深层的变化在于,CPU与DCU双芯协同正在改变传统AI算力资源的配置与使用方式。张攀勇解释,任务编排、实时处理、工具调用、条件判断、数据存取等步骤适合CPU承担,需要通用处理能力、低延迟响应与复杂逻辑处理;Token推理与生成则需要强大的并行计算能力,更适合DCU。“CPU 去做Agent的指令流,DCU去做Token的生成流,根据业务特征重新分配和组合计算资源。”他强调。海光的目标不是让单独的CPU或DCU做到最强,而是在系统层面做到最优。整体最优才是最优,才能为客户提供更好TCO(总拥有成本)的服务。
总之,面对Agent 时代的到来,海光将坚持双芯战略、开放生态,以及硬件提升与软件栈,应对新的技术形势带来的挑战。