PEC 2026 AI创新者大会暨第三届提示工程峰会重磅来袭。
作者 | 毛 烁来源 | 至顶科技前两年搞 AI,大家见面都会先问一句:你有多少张卡?
H100几张、H200几张、集群多大、算力多少P,数字越大,似乎就越能证明实力。
到了2026 年,关注点开始变了。
大家开始问:每秒能吐多少Token?延迟多少?并发量多少?跑一次模型要花多少钱?
原因很简单。在Agentic AI时代,产生业务价值的,是模型持续生成的Token。
于是,一个带着“新工业革命”意味的词出现了:Token 工厂。
它的逻辑并不复杂:把GPU、推理引擎、数据库、网络和调度系统组织成一套完整的生产系统,让算力和数据经过这条“流水线”,持续转化成Token。
但当AI 基础设施开始从“卖算力”走向“卖 Token”,新的问题也随之出现:
Token成了新的计量单位,AI基础设施的账,也得换一种算法。
图片上传处理中...
卡还是那些卡,生意不一样了
由PEC社区联盟、至顶科技及软积木主办的第三届AI创新者大会暨PEC 2026,将于9月12日召开。
作为当天4场年度提问之一,《Token工厂——真功力与真问题》设置了一个很有意思的提问:Token工厂究竟应该由算力规格定义,还是应该看输出质量、延迟和单位成本?
这背后,也藏着一个巨大的商业变量。
比如说,两家服务商都给100张GPU,如果一家通过推理引擎、任务调度、缓存和数据系统的优化,让同样的100 张卡多产出一倍Token,同时把延迟压得更低,那么这100张卡,还是同一种商品吗?
进一步,如果客户买的不是“100 张 GPU”,而是“每秒稳定生产多少高质量 Token”,服务商要负责的就不只是提供算力。模型运行是否稳定、Token 输出质量如何、峰值并发能否扛住、延迟能否满足 SLA,以及单位 Token 的成本,都会成为服务能力的一部分,最终直接反映在价格上。
简而言之,当算力开始按 Token 计价,AI 基础设施比拼的,也就不再只是卡的数量,而是谁能用同样的卡,稳定产出更多、更快、更便宜的 Token。
这五个人,要拆解一枚Token
一枚Token 看起来很小,但要让它稳定、高效地被生产出来,背后蕴藏着一整套系统:推理引擎、GPU、网络、调度、数据库,以及最终交付算力服务的基础设施。任何一个环节出了问题,Token工厂的效率都会受到影响。
所以,这一次PEC 2026 的年度对话环节,五位嘉宾将从不同角度,把一枚 Token 背后的生产过程拆开来看:
趋境科技首席引擎架构师谢威宇,将从推理效率出发,讨论一枚 Token 究竟是怎么被“生产”出来的。
清程极智联合创始人何万青,将把视线放到推理引擎,看看同样的GPU还能榨出多少 Token。
亚康启源CMO周立宾,将从算力基础设施出发,讨论 Token 工厂需要什么样的“厂房”和产能。
PingCAP 副总裁刘松,将从数据库与数据系统切入,看看Agent 不断增长的数据如何被这座工厂接住。
首都在线解决方案总监王超,则会站在客户一侧,看看当算力开始按Token交付,客户究竟在购买什么。
当技术开始真正进入生产环节,很多过去习以为常的规则都会重新被定义。
下一轮革新,或许就藏在这些看似细小的变化里。
作者投稿邮箱:mao.shuo@zhiding.cn
PEC 2026定档9月12日:用一条Token产业链,串起AI从业者最关心的四个问题
《AI启示录》:埃森哲,100年前是电机,今天是AI,企业价值正在重新排序