平头哥算力峰会,我在现场听完两场演讲,一场聚焦CPU,一场聚焦网卡。
回程时一直在思考,为何这个场合留给CPU和网卡?后来重新梳理,发现台上两人绕了一大圈,其实指向同一件事:GPU之外的战场。
怎么理解呢?我试着说清楚。
先说CPU那场,主讲人是平头哥半导体产品总监黄伟。他上台定调:agent时代,CPU的角色发生了根本性变化。为什么?他说要看任务是否改变。
过去大模型推理是一问一答,这任务基本由GPU承担。
agent不同,它为了完成一个任务,需要持续循环,推理一步,调用工具,查看结果,再推理下一步,直到任务完成。
调用工具这一步,无论跑代码、查网页还是读文件,干的都是CPU的活。
还有那份必须始终保留的长上下文,模型与你的这一单的来龙去脉,每轮推理都要用它作为原料,主要由CPU侧的内存来维护。
他给出了三个数字。
在agent场景中,仅工具执行一项,就占整个请求响应时间的约60%;编码agent场景中,容器初始化加工具执行,在CPU这边要占55%到60%,总体算下来,CPU已经承担了超过一半的负载。
数据是他现场提供的,实验条件未详细展开,结论却很明确:CPU重新回到了AI计算的关键路径。
他把任务分为两类,这是整场演讲中我印象最深的框架。
一类是紧贴GPU干活的,他称之为head node,即机头。GPU负责重体力活,机头处理杂务,就像司机带了个副驾驶,请求进来先由它预处理。
KV cache归它管理,这是模型随手记录的草稿笔记,记着之前算过的内容,回答下一句时无需从头再算一遍。笔记放哪里、怎么搬运,都是它的事。
何时唤醒加速器开工,最后结果如何拼接回去,也是它负责调度和收尾。这活卡在关键路径上,机头慢一步,按小时烧钱的GPU就会空等一步。
因此,为机头改进CPU,处处冲着单核速度。
前端做宽,相当于把进料的单行道拓宽,一个节拍能多吃进几条指令。
乱序窗口放大,好比老师傅炒菜不会等一道菜出锅再备下一道菜的料,窗口大,就能往后看几十步,哪条能先算就先算哪条。
KV cache在CPU和加速器之间来回搬运,地址翻译经常找不到门牌号,每次像翻字典一样一页页查找。解法是页表预取,教CPU提前把下一页翻好。
还有一个隐蔽的问题:两条本来不相干的操作,被系统误判为占用同一个地址,明明可以并行却被排成了一条队。内存重命名就是拆穿这种误判,让路让开。
软件那头,连Python解释器派发指令的开销都一条条地抠。
缓存这头,把KV cache的元数据在三级缓存和内存之间分层摆放,常用的放近处,别让加速器等一份本该到手边的笔记。
另一类是跟推理脱钩的,agent rack,一排agent机房。
一个机柜里塞进几百个沙箱,每个沙箱里一个agent在干活,调用工具、跑代码、规划步骤、编排任务链、管理自己的状态。
这些全不碰GPU,全在CPU上。这活不求快,求多,一个机柜尽量多塞agent,还得让几百个实例别互相抢资源。
解法是另一套。
agent的循环中有大量不规则的跳转,CPU干活靠预判下一步,传统预判法在agent身上经常猜错,于是引入神经分支预测,让CPU靠经验培养出直觉。
RAG检索、图数据遍历这类活,是顺着一根藤要挖出一串薯。数据在哪条依赖链的下一环,CPU别等用到再找,图预取就是顺着链提前挖。
几百个沙箱共用缓存,等于几百户抢一个储藏室。动态缓存替换按各家的活跃度勤换货,把没人用的腾出去。
MPAM则是给每个沙箱设定水电表配额,核的周期、带宽,各用各的,谁也不能把公区挤瘫。
他对这两类活有一句原话,挺形象:机头看内存,看能不能搬得快;机房看内存,看能不能装得多。
全场还有两个数字容易被忽略,我觉得才是地基。
一个是41%。他说机头场景下一次迭代任务中,41%的活无法靠并行摊掉,尤其是调度控制面这部分。
这数字背后是阿姆达尔定律:串行的活加人没用,一锅水烧开了,再多人往灶里添柴也快不了。
整个系统的响应时间,下限就是这41%的串行段决定的。想让机器快,只剩一条路:单核本身变快。机头对单核性能的执着,根子在这。
另一个是28GB。
机房实测,单个agent实例到峰值,所需内存能达到这个量级。一个机柜要装几百个实例,内存不堆到天上,门都没有。
这也是为什么这颗CPU光有核不够,容量本身就是竞争力。
这些分析不是白做的。第二天云栖主论坛,平头哥首次公布倚天CPU路线图:2027年出倚天720和730,之后是750,第二代自研核,自研片间互联直连真武AI芯片。
黄伟页尾只提了一句路标,其实他就是给那份路标写的说明书。
第二场,网卡。主讲人是阿里云智能集团高性能网络研发负责人付斌章,一上来先算账。
他说前面好几场嘉宾都提到,现在到了推理阶段,往往是通信决定一半以上的性能。但网卡本身的成本,在集群里占不到20%,有的甚至只有一成。
意思是,整个机房投入产出比最高的一项,是大家不太回头看第二眼的小板子。
他摆了三件麻烦事。
第一件,混跑。集群租出去,租户跑什么你说了不算。训练、推理、强化学习,三种流量挤一张网。训练的流量像高速上匀速的大货车,推理的流量是不断变道的轿车。货车一被打断,整个车队跟着降速。
第二件,长距。
现在的推理流行PD分离。一道题拆成两段干:读懂题、打好草稿算一段,把答案一个字一个字往外蹦算一段。两段分别用不同的GPU跑,省卡。
麻烦在于,两段一旦不摆在同一批机柜,数据就得跑出机房,上广域网。机房里跑一个来回一百微秒,跨了城市是5到10毫秒,慢两个数量级。
网络传数据本质像车队行军,先派探路车报路况,大部队才敢加速。探路回报慢一百倍,大部队只能降速,有效带宽掉下悬崖。
第三件,弹性。
agent的活说来就来,容器秒拉起,干完就销毁。可RDMA这种快车道(机器绕开CPU直接互读内存的高速通信方式),要提前把整条通路的资源、地址都铺排好才肯干活,像包专线货运,发车前先排时刻表。
只活几十秒的容器等不起。所以,很多人最后退回TCP这种随叫随到的通用方案,性能损失自己咽。
对付这三件麻烦,他先铺开一张地图。这块信息密,记一句就行:分场景修路。
训练走HPN(高性能网络),一代比一代吃得下更多接入。上一代靠51.2T的交换芯片撑7.0版本,主力8.0用102.4T,在研的9.0上200T。T是万亿比特,芯片吞吐的单位。
卖点是两层网络就挂几十万个800G的接入端口,相当于立交桥只修两层,却上得下几万台车。
推理走新架构TPN(按token性能设计的网络),干的事一句话:把两张从没打通的网连成一张。
机房里本来两张网:机头网络跑业务进出,机尾网络连GPU之间的高速数据,互不相通。
没配机尾的小卡做PD分离,只能挤机头那条道,机尾空着。TPN在两道墙中间开了门,同一个集群里各组机器(行话叫pod)能互相喂数据,分离的两端不出机房就能对上话,长距传输直接省掉。
真要跨集群,流量走骨干网里的智算专线。阿里给它起名叫ECORE,带宽比普通骨干高一个数量级以上,全程支持RDMA。
超节点内部的互联另有一张,叫UPN(超节点网络),光互联,机器物理上不用绑死,一层铺得下千卡。
然后,是主角:磐脉920。他报的规格是400G的带宽,一秒能过4000亿比特的数据,面向智算和存储两个场景。
他讲得最起劲的倒是另一个设计。
这张网卡里内置了一个交换机,等于自带一块分电板。各家CPU对PCIe这条数据通道的脾气不一样,没有这块板子,换个计算平台就可能踩一次坑。
有了它,同一张卡插到不同平台上,都能稳定输出GPU直接读写网卡、不绕CPU的那套性能。
协议它跑两套:业界标准的RoCEv2,加上阿里自研的SolarRDMA。
自研这套最早在存储场景里磨,后来才用到智算。他的原话是:把存储和计算的坑都趟完了。最值钱的功能是按连接逐条自动选路:新卡碰新卡,自动走自研的快道;碰上老卡,退回标准协议。
老集群不用拆了重建,一张一张换就行,业务不停。他说这种无感的增量部署,工程上价值非常大。
四张成绩单,口径都是现场给的实测。
第一张之前,他先拆了一个流传很广的误区。他说:两年以前,你要说预训练用不上好协议,没毛病。大模型训练就是单一大任务,环形算法轮着传,每张网卡只跟自己的邻居说话,带宽就是一切。
今天这话过期了。现在是训推一体的集群,推理的流量随时闯进来,预训练被搅得跟着降速。
千卡任务实测:把大传输拆成小包、多条路同时飞,哪条拥塞或者哪台硬件坏了就自己绕行。数据并行的通信耗时降43.2%,端到端性能提12%。
第二张,跨集群长距。
端侧给流量打标,广域交换机照着标挑更优的路。丢包只补丢的那几张,不用整摞重发。端到端吞吐提55%。
第三张,弹性。
新的虚拟化技术把资源分配挪到软件控制路径,连接密度是传统网卡虚拟化的64倍。容器拉起时间最少省35%,最多省93.4%。
他撂了句狠话:这个弹性不拿性能换,套了虚拟化跑通信,速度和硬件直通几乎一样。按他的说法,专线的速度和网约车的灵活,目前只有这张卡能同时给齐。
第四张,小包。高性能计算传的数据正文很小,包裹没封箱带厚。这张卡走「以太网+」协议,削前导码、绕开链路层开销,正儿八经的内容能占到85.4%,他说业界最高。
落地的交代很短:磐脉920 已经跟着灵骏真武 M890 超节点上线,超节点配的就是这张卡。
两场演讲,单听各管一摊,放一起看,挺有意思。
黄伟说,agent场景里CPU扛起了过半的负载。付斌章说,推理阶段过半的性能由通信决定。两个过半,口径不一样:一个量时间,一个量性能。
但指向是同一个。请求进来之后,GPU算完的那一段,在整条路上越来越不稀罕了。剩下的大头,落在CPU、内存、网络上。
模型有多聪明,比GPU;agent把活干得多利索,比这些地基。
黄伟下台前收尾:希望倚天为Agentic AI时代的普惠算力,贡献一份计算底座。付斌章没说场面话,他只留了个落地,就是前面那句超节点上线。
倒是串场的主持人,给了句不错的总结。
人工智能的竞技场,已经从参数规模角逐,转向工程落地的深水区。单点的突破,撑不起智能体时代的系统级负载。
台上两个人讲了四十分钟,都在给这句话当证词。
我这趟带回来的,其实是个记账方式的变更。过去聊算力,问你有几张卡?往后可能得问:一个请求进来,你的时间花哪了,带宽堵哪了,内存够谁用。
卡多不等于活好,这个账,行业刚开始认真算。
注释: [1].本文内容来自我2026年9月23日在平头哥算力峰会分论坛的现场记录,演讲实测数字均为现场披露口径
本文来自微信公众号 “王智远”(ID:Z201440),作者:王智远,36氪经授权发布。
李明 回复 2026年9月11日
这篇文章对体育游戏中的音效设计分析得很透彻,尤其是球场环境音效如何影响玩家沉浸感,期待更多类似内容。
王伟 回复 2026年9月10日
签到活动的流程很清晰,我已经按照九游体育平台公布的步骤完成了本周的签到,获得了游戏内道具奖励。
张磊 回复 2026年9月9日
关卡设计部分提到的策略思路非常实用,结合具体比赛场景的解析让我对游戏理解更深了。