JOTO
Contact us
← AI 智库
大语言模型

腾讯司晓:词元(Token)是智能时代最显性的脉搏

2026 年 9 月 1 日

腾讯司晓解析Token经济:5000倍消耗增长成智能时代脉搏,案例见证AI设计价值。核心内容:1. 海宁皮革城设计抄袭案例与AI文生图解决方案2. Token消耗爆发数据及个人高消耗案例(如文科研究员308亿总量)3. 机器端长程任务与工作流驱动Token增长的核心逻辑

腾讯司晓:词元(Token)是智能时代最显性的脉搏

司晓 腾讯集团副总裁,腾讯研究院院长

本文为腾讯副总裁、腾讯研究院院长司晓在2026中国国际大数据产业博览会《词元——数据要素价值释放新路径交流活动》上的主题演讲实录。
尊敬的各位领导、各位观众:
大家好。今天我想跟大家分享词元(Token)经济这个话题。通过后面几个案例,大家可能会更容易理解,为什么我选择“词元(Token)是智能时代最显性的脉搏”这句话,作为分享的副标题。
我想先从一个案例开始。2023年3月,我带着团队去地方产业带调研,那时候我们的视频号电商业务开始做微信小店。在浙江海宁的皮革城,我跟一位老板有过一段对话。他讲到一个困扰,好不容易请设计师、设计院设计了一个新产品样式,别说放到网上卖了,只要挂到档口上,很快就会被人拍照抄走,爆款马上就没了。
后来我用AI文生图,给他生成了一些设计草图,他觉得这个东西很神奇,说:“虽然我不会设计,但是我会挑。我在这个行业干了几十年,大概知道这一批里面挑哪个能火。”
这场交流之后,我就有了一个感觉,大模型卖的并不是模型本身,而是在这个场景里设计能力的智力服务。而人类作为驾驶员,核心能力在于品位和选择。
刚才从几位领导的致辞,到院长的发言,大家都提到了Token使用的爆炸式增长。我看到一组数据:2024年年初,全中国日均消耗Token数是1000亿;到了今年6月,我们公布的数据是日均500万亿,整体增长了5000倍。
这里还有两个更直观的例子。第一,是某个开源的Token消耗监测应用,安装在本地后,可以把各个AI产品的Token使用量统计加总。在它的排行榜上,第一名的用户,一个月消耗了1200亿Token。也就是说,这位国外技术大神,一个人消耗的Token,相当于中国在2024年年初全国口径日均消耗量的1.2倍。
这个人我们不知道是谁,但我可以讲一个身边的文科生案例。一位坐在我办公室附近的文科研究员,最近三个月的Token消耗非常高。她是非常极致的使用者,自己的视频号内容几乎全由数字人出镜。她有一天最高消耗17亿Token,从5月至今总量是308亿,日均2.8亿。按这个趋势,这样一个文科研究员,一年也能用到1000亿Token的量级。
这是真实发生的,我可以对数据真实性负责。还有一个关键数字,她的对话有20万轮,准确说是196,049轮。这一定不是普通的人机对话,而是Agent在背后有大量调用。
可以说,Token消耗的爆发性增长首先来源于机器端,而不是人类的直接调用。
说白了,人的注意力和时间都有限,不可能直接消耗太多Token。真正的增量,一定是来自工作流和长程任务:当机器端的AI能够持续执行3到16小时的长程任务,Token消耗才会快速上升。
就像无人驾驶一样,人类整个行驶里程的增加,一定不是靠人开车,而是到机器能够自己开、汽车能够完全自动驾驶的阶段,才会爆炸性增长。它的物理瓶颈会变成道路使用率问题。换句话说,道路使用率决定了总里程上限。
这和后面要讲的Token总量软硬件瓶颈有直接关系。粗略估计,每向上一层,消耗可能上升一到两个数量级,也就是乘以十或者乘以一百。大概是这样一种指数级消耗,能够解释刚才那两位超级个体,为什么可以使用到那么多Token。
所以这里有一个结论。这个结论的形成,其实受到刘烈宏局长很大的启发。上次在江小涓老师组织的中国数字经济年会上,我有机会向烈宏局长请教了一个问题:到底怎么看Token能卖钱、大数据不一定能卖钱这个现象。他讲了一句话,Token本身能够商业化,恰恰证明了它是大数据变现的一种方式。这是一个例证。
这个判断给了我很大的启发。从数据来说,原始数据机器不能直接训练,需要先Token化,再用于模型加工;模型加工又通过GPU运转和电力消耗生产出Token,进而售卖智力服务,最终由客户付费。
这样讲还是比较抽象,我来讲一个具体例子。英伟达创始人黄仁勋曾讲过,整个Token的成本由五层蛋糕决定。作为“卖铲子”的一方,赚钱最多的是芯片那一层。现在大家也知道,存储HBM的价格很高,又拿走了其中一大部分。所以我们的结论是,利润会流向当前最难被替代的环节,而这个瓶颈一旦变化,整个利润分配也会跟着变化。
我们现在面对的情况是:对于一个看起来像数据的产品,它的硬成本中有70%是硬件约束,由能源、芯片和基础设施决定;所谓算法的贡献,实际上只占20%,最多到30%。所以从这个角度,我甚至可以说得夸张一点,它更像一个工业制品。每生产一个Token,就像生产一个螺丝钉一样,其中有很多刚性的东西。因此,它和我们讲的比特有非常根本的区别,和互联网时代的商业模式也有根本区别。
互联网模式的边际成本基本是零。你把软件研发出来,包括SaaS服务也是一样的,只要研发出来,多一个用户,多一个微信用户、多一个淘宝用户,没有多少成本。但AI不一样,多一个AI用户,用户消耗的每一个Token都有刚性成本,没有边际成本为零的效应。
而且它还没有那么强的网络效应。什么叫网络效应?就是你在一个对话框里,可以随时切换到另外一个AI,去进行对话。用户忠诚度非常低,哪个AI强、哪个便宜,就马上切换过去。这是一个非常现实的例子。所以它的商业模式,跟互联网时代一定不一样。
这里可以得出一个结论:Token的成本主体是物理性的、重资产的。AI看上去像软件,骨子里却越来越像重工业。
这里还有一个特别有意思的例子,就是AI有两个时钟的迭代效应。
第一个时钟在软件侧,基本上按周,甚至按天迭代,这个说得一点都不夸张。从算法侧看,MoE、FlashAttention、KV Cache管理、连续解码等等,这里只是举一些大的变化,小变化基本上每周都会发生。这就是为什么在AI的排行榜上,某一个模型顶多在那里待个十天八天,没有各领风骚数百年,能各领风骚上十天都已经很牛了。
在硬件约束的情况下,算法变化能够带来局部变化,但更关键的是物理侧。这个双时钟,你可以理解为两个齿轮:一个齿轮转得飞快,另一个齿轮的咬合,使得它没有办法同样快,这另一个齿轮就是物理侧约束。比如HBM扩产,大概要12到18个月。从GPU来讲,每年都会有GPU发出来,但GPU发出来之后,总不可能把之前的GPU就扔了。从这一代GPU出来,到下一代GPU部署下来,至少要18个月到两年。数据中心的建设是18到36个月。以变压器这个行业为例,中国生产变压器的能力也是非常强的。变压器大概是2.5年,电网是5到12年,这实际上甚至是我们相对于美国的一个优势所在。
时间有限,更多物理侧的细节我们就先不展开了。这里想强调的是,AI的需求可以被软件快速拉高,但供给侧的硬件和能源不可能同步加速,HBM、GPU、数据中心、变压器、电网都有自己的建设周期。就像自动驾驶的道路,车越来越聪明、跑得越来越快,但道路容量是给定的,最终能跑多少里程,仍然受路网承载能力约束。理解了这一点,后面谈AI的商业模式,就不能只按互联网软件的逻辑来算账。
接下来是商业模式的基本推演。它从卖Token开始,是一个价值光谱。这个价值光谱的捕捉取决于商业模式设计。从最基础的按量收费、直接卖Token,到订阅制、积分制,再到按照工作流或者结果付费,以及更大授权下按照数字员工的方式订阅一个服务。从平台风险到获客单价,再到智能体复杂度,都会随之变化。
我们可以先看几个增长案例。Anthropic从2023年到2025年实现了年对年(year-on-year)十倍的收入增长。不要说在互联网历史上,即便放在人类商业史中,也很少看到一家企业在人员规模没有大幅膨胀的情况下,实现一年十倍增长。这就是AI时代卖API的直接模式。
其中,Claude Code年化收入超过25亿美元;Cursor约300人的团队,大概24个月年化收入超过20亿美元。我们的CodeBuddy和WorkBuddy,在工程师覆盖和增速上也都很快。
由此可以看到,模型可能决定上限,但工作流,包括Harness这一套,决定留存和变现。模型本身没有那么强的网络效应;但Harness这一套,Cursor也好,CodeBuddy也好,WorkBuddy也好,作为连接模型、工具和工作流的产品外壳,反而会产生忠诚度。因为用户会形成对软件界面的习惯,团队也会围绕类似产品协作,它就会沉淀出一些网络效应。这也是现在Harness这么火的原因。
这里还要讲一个例子。之前Meta内部有Token Maxxing的比赛,也就是说谁烧的Token最多,谁就更有战斗力,这是一种简单粗暴的评价模式。
这源于卖铲子的黄仁勋此前讲过的一句话:如果一个员工一年有50万美元薪水,一年用不到25万美元的Token,你就是一个不合格的开发者。当然,站在卖铲子的立场上,他有鼓励大家多用的动机。所以中间一度出现一个现象,就是大家都追求Token消耗排行榜,结果就有员工开始作弊。
现在我们已经进入比较理性的阶段。CEO拿到账单之后,一定会问:Token账单涨了这么多,你们个人提效了,公司的收益在哪里?历史上也发生过类似情况:技术很牛,讲起来很热闹,结果GDP上看不到,公司的账单和报表上也看不到,但支出是切切实实发生的。
所以,任何负责算账的公司,都不会允许员工不受约束地使用。因为免费模式下,经济学上一定没有节约约束。如果公司买账单,成本由公司承担、产出归个人,就一定会导致个人过度消耗,甚至变成表演。
这里更理性的逻辑,也是现在所有Agent产品都在进行的另一种竞争,就是我们讲的驾驭工程。模型是一匹马,马再强,直接坐在上面也没那么舒服,确实能跑、能问答;更好的方式,是给它套上好的马鞍、脚蹬,或者马车,然后坐在上面开起来才更舒服,跑得更稳,拉得更多。这一套马具,就是Harness。
WorkBuddy能够接入包括竞争对手在内的很多模型。除了我们刚刚上线、目前还在限时免费的Hy4-preview,包括GLM到Kimi等等,我们都可以接入。在一个对话框里,用户可以不停切换模型。
8月28日,我们发布了自己的Hy4-preview。大家可能觉得,腾讯前期在整个AI发展过程中,坦率说,不算太领先,并没有太多刷屏的模型。我们整体确实走过一些弯路。作为一个服务十亿级产品的公司,性价比是最重要的维度之一。
对我们来说,刚才讲的Token,像工业制品。未来会有大量的人用到微信里的小微,而它在微信里的入口可能很轻,甚至只是两个小点点。不光是成本问题,我们也要把体验打磨好。更重要的是,我们希望生态里的小程序,不是我们直接调用别人,而是要跟别人商量好,才能用别人的模型,我们走的是生态共赢的路线。
以Hy4-preview为例,770B总参数、49B激活参数,到微信场景里使用时,模型会进一步变小。尺寸更小,能力可能会弱一点,但每一个用户的成本会更低。这样我们才有可能在免费的情况下,服务十亿级用户。所以我们讲普惠,一定是算得过账的。在各种场景下,成本最优、智能最优、相互匹配的方案,才是我们追求的。
再给大家一个直观例子。今天演讲用的这份PPT,我也特别让同事去统计了一下。它是人机深度协作完成的,并不是AI直接生成,但是用了65万Token,这是比较确定的。
我们的统计方式,是在做完PPT之后反过来问WorkBuddy:如果用接入的、等效的这些模型,大概估算一下会花掉多少钱。我们用了一个汇率,也用了一个积分(credit)的模式。刚才我讲的credit,意思是用户可以选择。从用户角度,最省事的是用Auto,不用管哪个模型。在产品界面上,不同模型旁边标的“乘以多少”,可以简单理解为汇率,因为这个模型的API本身有不同价格。
一个好的产品不应该让用户去算账,而应该把模型路由模式、Auto模式设定好。如果我着急,就用极速模式,但极速模式一定是干得快、消耗得快。如果我不着急,比如晚上睡觉,就用更省Token的模式慢慢干。它调用的模型以及推理速度,都会决定整个消耗。产品要做的,就是把这些计算隐藏在后台,减少用户自己算账的负担。
在这一方面,WorkBuddy做得比较好。它就像一台汽车,可以随时更换引擎,甚至可以根据不同的“路况”(任务类型),自动更换引擎。引擎就是不同的模型,在模型的选择上,用户完全可以不用操心。
进一步说,个人提效、Token消耗,一定不等于组织整体绩效。因为从个体到组织的AI提效,这中间必然要靠组织变革。腾讯研究院作为一个智库机构,有50个研究员,现在我们已经做了一个比较彻底的调整。
先从原来的科层制里走出来,法律、经济、产业、文化、国际,是我们研究院上半年的架构,或者说过去十几年的架构。而现在,我已经把原有组织边界打散,所有研究员以AI Hub为中心,就像一个圆一样,通过AI Hub连接起来。
里面所有基础设施的开发,都是我们自己的同事完成的,所有研究员都可以贡献AI Hub的功能和想法。所以从项目A到项目B,就变成了以AI Hub临时组队、任务制协作的模式。
我觉得对于智库,或者对于公司的研发团队,大家想的事情是不约而同的,都在往同一个方向变。这样变的一个好处,就是不需要再承担科层制的信息损耗,因为AI可以增强连接和协作能力。所以整体来说,我们从知识问答,到办公智能体,再到数字员工,就能看到刚才讲的智能服务光谱,以及商业模式的演进。
我们最近也跟数研院达成了类似数字员工的合作。这里不是做广告,而是因为我们写的《Token经济:当智力成为一种可计量的服务》这本书刚刚出版。我刚才讲的所有观点,都在这本书里面。
关于此书的推荐语,我觉得腾讯公司董事会主席兼首席执行官马化腾先生讲的两句话很好。第一,Token是机器智能的最小单元,是不可切割的最小单元,也是智能时代最显性的脉搏。就像互联网时代我们看的是另一个指标,这个我觉得跟刚才两位领导的发言是不谋而合的。
腾讯司晓:词元(Token)是智能时代最显性的脉搏 配图 2
书名:《Token 经济》
作者:白惠天 袁晓辉 司晓著  腾讯研究院司晓出品
出版时间:2026.8  
第二,马化腾先生认为,技术的价值在于创新,更在于它被普通人用上。能不能有更多个人和组织用得上、用得起、用得放心,才是AI普惠真正要回答的问题。
这也是为什么我们在AI时代,在延续科技向善理念的基础上,提出腾讯的AI观:让人放心、把人放大。当然现在还是研究院刚刚提出和探索的阶段,但我觉得作为一个智库机构,我们可以先去思考一些更前沿的问题。
好,我的分享就到这里,谢谢大家。腾讯司晓:词元(Token)是智能时代最显性的脉搏 配图 3
抢先购买,一睹为快👇

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.