商汤科技联合创始人、大装置事业群总裁 杨帆
出品|搜狐科技
作者|郑松毅
今年的WAIC展会逛下来,风向变了。以前大家盯着“人工智能”和“具身智能”,今年冒出来一个特别显眼的词——Token工厂。
这词儿听着新,逻辑却很简单:AI推理和交互全靠Token支撑,它就是算力时代的底层原子。而Token工厂,就是搞大规模、低成本算力产出的大本营。
随着Agent智能体遍地开花,全网Token消耗量直接炸裂。中国信通院副院长魏亮给出一组数据:国内AI日均Token调用量,从2024年初的1000亿,猛增到2026年3月的140万亿。两年时间,涨幅超过千倍,Token经济算是彻底站稳了脚跟。
中国工程院院士郑纬民也指出,跑一套Agent任务消耗的Token,是传统聊天模型的百倍甚至千倍。现在国内高端算力不够用,需求暴涨让供需缺口更难看,行业卡在“低端闲置、高端抢破头”的尴尬境地。
正是在这个节骨眼上,2026WAIC期间,商汤大装置在上海办了场“算创·无限——Agentic时代AI基础设施创新发展论坛”,专门聊国产算力怎么规模化落地。
会后,搜狐科技等媒体围着商汤科技联合创始人、大装置事业群总裁杨帆,以及大装置事业群CTO宣善明、首席科学家张行程等高管,问了几个关键问题。以下是对话精编:
媒体:商汤大装置为啥死磕国产异构混合算力?
杨帆:单卡性能硬碰硬,性价比太低。国产芯片跟海外顶尖产品比,确实还有差距。
所以我们换了条路,走PD分离异构混合推理。不指望单张国产卡能对标海外旗舰,而是把AI推理拆成两半:吃算力、适合国产芯片发挥的上下文读取,交给国产卡;吃显存、要低延迟的Token生成,交给高端芯片。各展所长,互补短板。
媒体:这套方案实际效果咋样?怎么证明不是纸上谈兵?
杨帆:在上海临港智算中心实测,混搭方案能让国产芯片利用率最高提升152%。跟纯国产同构比,推理性价比达到NVIDIA H系列的1.25倍,目前已经做到正毛利。
媒体:今年WAIC上全是“Token工厂”,不少创始人喊红海了,你们怎么看?
宣善明:做Token工厂的企业确实多,路子也杂。有老牌大厂,也有刚起步、一二十人就能拉起一个小厂的新团队,形态各异。
媒体:怕不怕别人复制你们的打法?商汤的技术护城河在哪?
杨帆:商汤的优势不止于技术,我们搭的是“技术-生态-商业”闭环。从性价比、适配性、能效比三个维度系统解题,推动国产算力从能用变成能赚钱。
媒体:Kimi最近发了K3大参数模型,但也坦言算力短缺。模型越来越大还是趋势吗?这对Token工厂有什么挑战?
张行程:我们跟头部模型厂商聊得多,目前看,模型越来越大,万亿甚至几万亿参数的旗舰模型,依然是主流方向。
大参数模型给算力服务出了新考题:参数虽多,但单次计算只激活少量专家,计算量增加有限。可巨量参数叠加超长上下文,对存储要求极高。不仅要靠显存、内存和高速存储组成的大规模KV Cache,还得配大显存GPU搭建PD分离分布式推理系统。
另外,供应链也是瓶颈。高端芯片紧俏,必须上下游深度绑定,从技术到供应链全链路把控,才能接住需求。
媒体:很多企业不信国产算力,你们怎么打消顾虑?
杨帆:客户主要担心三点:硬件性能、综合成本、使用信任。
硬件短板没法一夜补齐,得靠软硬件产业链联动,慢慢缩小与海外产品的差距。成本方面,Token需求暴增带来集中采购,加上异构调度拉高利用率,生产成本在降。全国一体化算力网建成后,跨区域协同还能进一步摊薄运营开销。
过去半年,我们跑通了日均万亿级Token服务能力,正在扭转行业刻板印象,愿意主动尝试的客户明显多了起来。
媒体:商汤官宣布局太空算力,涉足马斯克的地盘,为何提前押注这种短期无收益的前沿领域?
杨帆:太空算力和量子计算都是长期战略储备,商业化最快也得三年后。现在提前布局,一是抢技术先发优势,二是占稀缺的低轨太空资源。
未来有两个落地场景:一是配合自身遥感业务,比如为东南亚国家提供服务,解决应急救灾;二是覆盖地面网络够不着的偏远地区,通过星上算力直接输出Token和各类AI应用。
媒体:长期看,AI基础设施赛道拼的是什么?Token工厂以后会怎么变?
杨帆:短期行业还在拼硬件规模的内卷,但长期拉开差距的,一定是系统整合与全链路优化能力,这需要构建非常复杂的体系。
大家都把算力当智能时代的水电煤,是个长周期高增长的大赛道。正因为需求大、涨得快,入场玩家水平参差不齐——大量没持续经营能力的低效厂商扎堆进来,最后会被竞争出清。
眼下产业链还在快速迭代,服务商很难给出稳定成熟的方案。改善路径有两条:一是国产算力体系经过三至五年发展逐步成熟,产业链波动收窄;二是伴随头部专业厂商份额提升,低效落后产能被挤出,供给结构会更优。








