

过去两年,整个AI行业的注意力几乎都压在训练端。行业热点主要是哪家公司建了多大的集群、哪个模型把参数又推高了一个量级、哪家芯片的新品又把算力翻了一倍。
训练的故事还在继续,但行业真正的焦虑、真正的资本开支、真正的工程难题,正在集体挪到另一边怎么让已经做出来的模型,稳定、便宜、大规模地跑起来。而围绕这个问题的讨论,正在收敛成一个新词:Token工厂。
在AICC 2026大会上,IDC和浪潮信息联合发布的报告显示:2026年全球活跃Agent约7940万个,到2030年将达22.16亿个。而同期Token消耗量的增长更为惊人:从2026年的0.026Peta(千万亿),增长到2030年的152667Peta。Agent数量增长约28倍,Token消耗却增长数百万倍。
与此同时,斯坦福大学披露的大模型推理成本两年下降了280多倍,一边是成本的下降,另一边是中国Token消耗量的大幅暴涨,由此业内也出现了“Token通缩”的说法模型越便宜,用得越多;用得越多,越要把每一张卡、每一度电榨出更多Token。
当智能体开始替人完成真实工作,算力的消耗方式就从“一次性的峰值”变成了“常年在线的供给”。一个复杂任务的背后,已经不再是一次模型调用,而是几十次、几百次的模型推理,是多个Agent连续几小时,甚至几天的协同工作。
智能本身,正在像电一样,成为一种可以被规模化生产、计量和供给的生产要素Token,正是这种生产要素的计量单位。
浪潮信息首席AI战略官刘军在AICC 2026人工智能计算大会主论坛上,把这场变化概括为一次从“提供算力”到“生产智能”的迁移。
用刘军的话说,从ChatGPT到快速发展的Agent,AI正在发生一个关键变化从回答问题,走向解决问题:一个智能体接到任务后,要理解目标、制订计划、调用工具、执行任务、检查结果,发现问题还要重新规划,跑起来就是几个小时甚至几天。
顺着这个判断往产业里看,最直接的承接者,就是Token工厂。这种共识在AICC上体现得尤其直接,本次大会甚至专门设置了“Token工厂”分论坛,一众Infra厂商都在讨论同一件事Kaiyun官方入口怎么把算力高效地变成Token。
分论坛上,信通院专家给出了一个判断:Token正在具备“水电煤”式的属性普惠、基础、连续;围绕它的产业生态,已经从算力供给、Token生产、Token分发一路延伸到Token应用,Token工厂正成为连接AI基础设施与Agent应用的底座。因此,在不少行业人士看来,2026年已经称得上“Token元年”了。
时至今日,Token工厂的入场者已经越来越多:运营商把它当成新的大生意,云厂商把它做成新的服务形态,初创公司靠极致的算力优化把价格打下来,大型企业则把它视为守住数据与安全的私有底座。有人甚至断言:未来人人都是Token工厂。
Token工厂之所以在这个时间点集中涌现,底层原因是需求的形状变了。Agent规模化之后,一次任务从“一次模型调用”变成了“几十、上百次推理”的乘法题,而算力供给只能以线性的速度增长供需之间的缺口是结构性的,不会随着某一轮扩产而消失。而Token工厂,正是对这种结构性缺口的正面回应:把算力稳定地转化为可计量的Token供给。
更深一层看,Token成为计价单位,也意味着算力行业的商业模式正在发生迁移。过去按“资源”计价,比如卡、机房、云主机都是按配置和时长来卖的,今天算力行业第一次有了真正意义上的“计价单位”Token。
从本质来说,运营商的大生意、云厂商的新服务、初创公司的价格战、企业的私有底座,都是同一件事:从卖算力,走向了卖Token产能。“算力规模决定产能上限,优化效率直接变成利润”正在成为Token工厂这门生意的核心逻辑。
而在供给侧,算力行业接下来要走的路也越来越清晰。刘军把算力供给分为两个方向:Capability AI Compute(能力型智算)向上突破智能上限,Capacity AI Compute(容量型智算)向广实现智能充分供给。
这两个方向,也成为浪潮信息产品创新的重要着力点。面向能力型智算,浪潮信息发布元脑SD200 Ultra超节点AI服务器。元脑SD200 Ultra基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒。
面向容量型智算,浪潮信息发布元脑HC2000多元算力机组,采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化,同等投资Token产能提升10倍。
值得一提的是,容量型智算的核心,不追求用一种算力解决所有问题,而是以开放汇聚多元、以协同实现全局最优,让每一份算力都转化成更多可交付的智能而Token工厂,就是容量型智算最典型的落地形态。
当算力行业的评价标尺从“算力规模”变成了“Token产出”,产业要重构的就不是单颗芯片,而是整个系统。而要看清产业重构的方向,得先回到Agent对算力的真实要求Agent要的从来不是某一瞬间的爆发力,而是三件非常朴素的事。
其一,装不装得下更大的模型权重、更长的上下文、持续增长的KV Cache要同时驻留显存。其二,跑不跑得稳漫长任务链路上任何一次抖动,都可能让之前的推理和执行全部作废。其三,跑得划不划算推理成本要低到让企业敢把业务真正跑上去。
但这三件事,没有一件是靠“把单卡算力再提高一倍”就能解决的。究其原因,推理不是一种负载,而是一系列负载。
譬如,Prefill高并行、高计算密度,是典型的计算密集型任务,吃算力,且可以通过批处理摊薄成本。Decode逐Token串行执行,是典型的访存密集型任务,吃内存带宽,而且随着任务变长,对显存容量和显存带宽的要求还会更高每个Token的生成都串行依赖上一步,容不得半点拖沓。Attention频繁访问不断增长的KV Cache,MoE则是大规模All-to-All通信。
如果把它们硬塞进同一套代码和配置里,虽然也能跑,但很容易就会出现顾此失彼的局面。总之,用同一种算力去扛所有任务,必然有大量资源在闲置和等待简单加服务器带不来线性增长,反而让一部分算力长期闲置、另一部分持续拥塞。
如今,当我们把各家Token工厂的方案拆开看,可以发现技术路线正收敛为PD分离与多元异构,即把Prefill和Decode拆开、让不同芯片各司其职这比“一芯扛所有”更划算。
众所周知,芯片从来不是“样样精通”的峰值算力、显存容量、显存带宽、互联带宽四个维度,即使是旗舰芯片,也难在这四个维度同时做到极致,多数芯片则各有偏科。而异构部署的价值,正是让“偏科”的芯片做自己擅长的事:擅长Decode的芯片,不该被绑死在耦合部署里浪费掉。
可以预见,随着芯片百花齐放、各有专长,跨集群异构的推理架构会成为标配。那么,方向有了,谁来把这些多元算力组织起来、按业务负载动态调配,真正变成可计量的Token产能?这,正是算力机组要回答的问题。
所谓算力机组,本质上是Token工厂里负责“生产Token”的那套产能系统不要求一种芯片什么都做,而是让不同的算力干最适合自己的活。
以元脑HC2000多元算力机组来说,硬件层面基于DirectCom 2.0极速架构,以原生液冷高密整机柜为载体,把单柜供电做到300kW以上、承载256张加速卡,算力密度提升了4倍。
很显然,当单颗芯片功耗向千瓦级逼近、单机柜功率向兆瓦级逼近,散热和供电已经不是机房配套工程,而是决定Token工厂能否持续运转的主命题,液冷由此从“可选项”变成“必选项”。
与此同时,在软件层面, MCIS多元算力协同推理软件栈持续测量不同算力资源的能力与负载,根据任务需求动态分配算力,并在运行过程中实时调整资源配置,让不同负载都能找到更适合的算力。
综合来看,芯片各就其位,软件动态调度,整机柜按负载组织资源这套组合解决的不是“某一颗芯片好不好”,而是“多元算力机组怎么被用成一支配合的队伍”。落在Token工厂上,结果也很具体:在HC2000上部署主流开源大模型推理服务,同样的SLO约束下,同等投资Token产能提升10倍。
要知道,电费本就是推理成本里最大的一块刚性支出,每度电多产出10%的Token,光电费这项刚性支出就能省下近一成。也就是说,企业从算力机组里买到的,也不再是一堆零件,而是一套可以直接换算成Token产能的生产系统。
总的来说,Token工厂的评价标尺,正在从“拥有多少算力”切换到“生产多少智能”。这不是某一家公司的叙事需要,而是Agent规模化之后需求侧的真实变化客户要的不再是一次性的算力峰值,而是持续、稳定、可负担的智能供给;落到工程上,就是单位投资、单位电力能够稳定产出的Token产能。
回看技术史,一项技术的最高水平决定它能做到什么,普及程度才最终决定它能改变什么。真正改变几十亿人生活的不是ENIAC,而是个人电脑和智能手机;真正改变工业社会的不是最先进的发电技术,而是稳定廉价的电力进入千家万户。
今天,Token工厂要做的,正是把“智能”这道电,稳定廉价地送进千家万户。企业已经不太关心有多少卡了,他们只关心一件事投入的算力能替自己生产多少Token、多少智能。
此内容为【智能相对论】原创,仅代表个人观点,未经授权,任何人不得以任何方式使用,包括转载、摘编、复制或建立镜像。
文智能相对论作者陈泊丞过去两年,整个AI行业的注意力几乎都压在训练端。行业热点主要是哪家公司建了多大的集群、哪个模型把参数又推高了一个量级、哪家芯片的新品又把算力翻了一倍。那是一个“造模型”的时代。算力的全Kaiyun官方入口部意义,似乎就是支撑下一次参数竞赛。进入2026年,风向变了。训练的故事还在继续,但行业真
人形机器人涌入主题公园:赛博NPC线日,全球首个大型具身智能主题乐园在珠海横琴长隆飞船乐园正式开园。据悉,该园区由智元与长隆联合建设,部署超300台机器人,设100多个交互点,开园当日举行全球最大规模常态化人机共舞及全球首创机器人空中飞人演艺,并揭牌“具身智能文旅联合研究院”。这两年,机器人表演,成为大街小巷常见的风景。各大科
远程 Vibe Coding 怎么连?把连得上、看得见、发得出三件事一次搞定
结论先行:远程VibeCoding卡住的地方不是AI不够聪明,而是人离开了那台跑Agent的机器。要解决这个问题,本质上是三件事:连得上(两台机器像在同一个局域网)、看得见(本机浏览器能打开远端的WebUI、终端能继续跑Agent)、发得出(把跑起来的原型安全地给到别人)。这三件事可以用贝锐蒲公
文智能相对论,作者叶远风一些智能驾驶的军备竞赛,正在朝着越来越脱离用户真实体验的方向狂奔。行业里比拼的数字越来越炫目,几颗激光雷达,几百TOPS算力,覆盖多少座城市的NOA,每一项参数都在刷新行业上限。但落到真实用车场景里,用户的吐槽却从未停止。拥堵路段激进变道吓出乘客一身冷汗,雨天雾天传感器集
作者:Evin,编辑:刘致呈,审核:徐徐,出品:互联网江湖二代豆包手机发售后,个人AI设备讨论逐渐升温。手机作为个人AI终端地位没有争议,用户习惯和厂商布局都在成熟。但更值得观察的是AI主机赛道——从商业化落地看,它可能比AI手机跑得更快。AI手机市场虽然更大,却面临应用入口壁垒,豆包手机目前也只能
引言:法律AI迎来行业巨变2025年以来,以深度推理能力为核心竞争力的大模型集中涌现,法律行业也随之进入一轮明显的效率变革。无论是律所机构还是独立执业的律师,在检索、审查、起草等日常工作中借助AI,已经逐步从“偶尔尝试”变成“工作习惯”。业内普遍判断,2026年将是法律AI进一步渗透法律实务的一年。
9月23日消息,在2026杭州云栖大会上,阿里智能体平台Qoder推出“项目”(Projects)和“讨论”(Discussion)两项协作功能。团队可以在同一项目中组织研发工作,将目标拆分为具体任务,并邀请同事和Agent讨论需求、评审方案、跟进执行。Qoder还同步推出了自定义智能体和自定义智能
9月23日,在2026云栖大会上,华中科技大学同济医学院附属同济医院(以下简称“同济医院”)宣布将与阿里云共建人工智能科研转化平台,依托阿里巴巴AI大模型将科研成果转化为医院智能体、专家智能体等临床应用,推动医疗AI从科研走向临床。该平台将服务于同济医院国家医学中心,打通从基础研究、临床验证到产业转
9月23日,2026云栖大会上,千问办公启动“AI教育灯塔计划”。该计划面向全国大中小学,在教学、科研和校园管理等场景提供AIAgent产品与应用支持。北京大学、浙江大学、复旦大学、东南大学、同济大学、南开大学等高校,以及北京、上海、深圳、杭州、重庆、西安、武汉等地区域教育主管部门和中小学首批加入,
依托QuestMobile人工智能洞察数据库统计数据,一份国产AI影响力榜单正式出炉。该榜单以2026年8月底前的各主流大模型平台App端与PC网页端合计月活跃用户规模为衡量标准,按用户规模降序完成排名。本次榜单评出的国产AI影响力六强依次为豆包、千问、DeepSeek、腾讯元宝、Kimi、文心一言
人形机器人涌入主题公园:赛博NPC线,从“堆芯片”到“造Token”,AI算力竞赛换了记分卡
远程 Vibe Coding 怎么连?把连得上、看得见、发得出三件事一次搞定
NG.CASH获Blockchain Capital牵头1500万美元投资:从YouTube频道长成巴西千万用户数字银行
Kastle获2400万美元融资,Insight Partners领投:从消费信贷切入,在银行旧系统上部署AI劳动力
美国本土首家LFP储能电芯厂商FIXX Energy获2700万美元资金
AI影视的账本:有人一年赚200万,有人20天“手搓”爆款,更多的人在亏钱
英伟达35亿美元认购联发科可转债:AI生态从数据中心焊到端侧,NVLink Fusion首次开放给外部芯片
伊克罗德亮相智慧零售峰会,解密AI Agent如何赋能零售全链路数智化
中消协点名AI客服:价格答非所问、出事就甩锅,“算法自动生成”不是免责牌
快速发布之后怎么管?花生壳相比WorkBuddy等办公智能体,有哪些差异化解法?