产业、商业与公司动态 ·
这两天受组委会邀请,去北京中关村听了一个会。
昇腾这次路线图直接摊开了。华为Fellow廖恒讲得很清楚,面向Agentic AI,芯片的算力、内存带宽、内存容量、互联IO带宽四个指标,不同场景优先级完全不同。真正决定超节点能力的,是互联。950芯片就是靠超高带宽把一堆芯片拼成集群,核心目标就一个——把推理成本打下来。
这两天受组委会邀请,去北京中关村参加了一个会议。
整场会议听下来,感觉国产 AI 算力要崛起了。。。。。。
说几个现场听到的东西。
昇腾这次路线图直接摊开了。华为Fellow廖恒讲得很清楚,面向Agentic AI,芯片的算力、内存带宽、内存容量、互联IO带宽四个指标,不同场景优先级完全不同。真正决定超节点能力的,是互联。950芯片就是靠超高带宽把一堆芯片拼成集群,核心目标就一个——把推理成本打下来。
现场有个细节挺有意思。MoE模型的EP通信是卡时延的命门,Agent时代时延要压到毫秒级,但EP的All-to-All通信颗粒细到单包7到14KB,频次随专家数量平方级涨,传统网络根本扛不住。华为的办法是把EP通信放在Scale Up域里搞定,颗粒度小用Load&Store语义,大再上DMA。这不是堆参数,是在通信层面做系统级优化。
KV Cache也动了刀子。Agent场景下模型调用频次暴涨50到100倍,序列长度从4k拉到近1兆,Cache命中率破95%。命中率高是好事,但KV Cache成本也跟着涨。华为直接给SSU单元配了UB端口,让NPU直连KVCache,省掉存储系统和文件系统那些中间层,带宽提了一个数量级。这种活,没有硬件底子干不了。
鲲鹏这边也不含糊。胡欣蔚讲得很直白,算力底座不再只为训练模型设计,而是按Agent负载来重塑。超节点TB级互联带宽、百纳秒时延、全局内存统一编址,回滚性能干到十毫秒级,Agent任务成功率直接提10%以上。通信加速底座上三个技术也很务实:灵衢SGL降20%时延、透明UBSocket再降40%还不用改源码、共享TP降90%通信内存。翻译一下,就是把这些年通信上的积累全用上了。
然后有意思的来了。
大会开着呢,5月22号晚上,DeepSeek发公告:V4-Pro模型API价格,5月31号起永久降到原价四分之一。输入缓存命中每百万tokens 0.025元,输出6块。不是促销,是永久的。
你看这个节奏。昇腾在硬件层拿超节点架构死磕推理成本,SSU直连省环节,EP通信往毫秒级压。鲲鹏在通用算力层做高密度低时延的沙箱基础设施,把Agent任务成本往下打。然后DeepSeek直接就把模型价格打穿了。
这不是巧合。硬件层把成本空间磕出来,应用层才敢把价格压到地板。反过来,用的人越多,硬件迭代越有底。
整场听下来,最大的感受是,国产算力这波不是在追单卡参数了,是在拼集群效率、拼通信时延、拼KV Cache的带宽优化、拼Agent负载下的系统级性能。单个看着都不起眼,串起来就是一个正在转动的循环。
DeepSeek这波永久降价,就是这个循环开始转的信号。
聊到这儿。AI这行说到底就三个字:用得起。国产这条线,真快跑通了。
国产雄起,让大家都用上便宜好用的模型。