全球语音大模型,角逐方向盘后的麦克风
创始人
2026-08-02 14:46:43

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:钛媒体APP)

语音AI的战争,已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。

7月,实时语音Agent战场上连爆多颗信号弹。

7月23日,Anthropic为Claude Voice做了一次重大升级,语音模式不再局限于Haiku轻量模型,Opus和Sonnet开始驱动语音推理,同时接入了Gmail、Calendar、Slack等应用。7月24日,亚马逊升级Alexa+,支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话,背后是Nova和Anthropic Claude混合路由的模型架构。

7月28日,阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录,登顶全球语音推理排行榜,但它的平均首音延迟高达4.02秒。7月29日,SpaceXAI(原xAI)发布Grok Voice Think Fast 2.0,首音延迟压到0.70秒,Big Bench Audio得分97.2%,在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先,GPT-Realtime-2.1 High是45.7%,Gemini 3.1 Flash High是37.7%。更早一些,7月6日,OpenAI也发布了GPT-Realtime-2.1。

SpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦,而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。

一场“毫秒级”军备竞赛

过去半年,实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上:首音延迟、语音识别精度、调用成本。

先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒,从用户说完话到AI开口,在大多数人尚未察觉的间隙就已完成了应答。作为对比,v1.0的TTFA是1.25秒,GPT-Realtime-2高推理模式是2.33秒,Gemini 3.1 Flash High是2.98秒,Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中,Grok TTS的流式模式首音延迟已压到285毫秒,标准模式460毫秒。2.0在此基础上进一步优化了推理效率:推理token减少60%,工具调用可以在用户说完第一句话之前就开始执行。

xAI从一开始就把语音管线做成了一体化,自研语音活动检测、自研音频分词器、自研端到端语音模型,传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释:每绕过一层中间件,就省掉一层延迟和一层错误概率。

在Artificial Analysis的综合语音质量指数上,Think Fast 2.0总评分82.9%,较v1.0的75.7%提升9.5%,超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%;Full Duplex Bench从77.8%跳升至95.1%,逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计,10倍于上一代,远超专业转录模型的水平。

但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录,超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景:Flash面向实时交互(首包延迟300毫秒级)、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中,4秒意味着不可用。

这个矛盾暴露了当前技术竞赛中一个绕不开的取舍:追求极致推理精度的模型,往往在延迟上买单,Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域,延迟是物理天花板,0.5秒以内的延迟让人感觉“在对话”,1.5秒左右就变成了“在等机器人”,到4秒,用户只会觉得“这功能坏了”。

OpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后,旗舰模型音频输入32/百万token、输出64/百万token,mini版10和20。理论折算约0.05/分钟,独立开发者实测的数据则迅速偏离理论值,一个房产导览AI的实际均价约0.07/分钟,最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀,是OpenAI语音模型商业化绕不开的难题。

Google Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉,某些模型版本从500毫秒增至1800毫秒,甚至10秒以上的等待,暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商,这种不稳定性比“慢”更致命。

如果再把镜头拉远一点,比七月更早落子的还有两个重量级玩家。

微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口,开发者不需要自己拼接语音管线。更关键的是微软的双重身份:它既是GPT-Realtime-2.1的云平台宿主(企业客户通过Azure调用OpenAI模型),又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通,支持WebSocket和WebRTC低延迟连接,直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线,客户一旦把语音Agent跑在Azure上,迁移成本远比切换一个API端点高得多。

Meta则在开源侧投下了一枚重弹。4月,Meta以Apache 2.0协议开源了Llama-Voice,一个7B参数的TTS基础模型,支持52种语言,10秒音频即可零样本声音克隆,能在消费级GPU上实时运行。上线48小时下载量突破80万,社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2,支持100多种语言的实时语音翻译,延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端,Meta拥有从开源模型到消费硬件的完整通路,OpenAI恰好缺这一块。

端到端、混合路由、轮次制、拼积木

SpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下,但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊,至少能看到四种截然不同的技术选择。

最激进的是Grok Voice的原生端到端路线。音频输入、音频输出,全由一个模型完成。这套架构最大胆的一点,是它在WebSocket连接中直接处理原始音频信号,不经过ASR转文本,也不经过TTS合成。60%的推理token压缩从侧面印证了这一点,2.0不需要把用户说的每句话都拆成详细文本再推理,模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%,而ElevenLabs为12.0%、Deepgram为13.5%。

相比之下,OpenAI的Realtime API虽然标称支持端到端,在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费,上下文越长越贵,缓存机制(0.40/百万输入token旗舰版)只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着,用户的每一轮追问都在悄悄抬高账单。

Anthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。

Anthropic选择轮次制(listen→think→speak)而非全双工,以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞,同时连接Gmail、Calendar、Slack等应用,每一步操作前都要求用户确认,核心逻辑是语音不只是一个交互界面,它应该能推动真实的工作流程。代价是交互节奏不如全双工自然,但在需要深思熟虑的场景中,轮次制的深度优于全双工的流畅。

亚马逊走多模型路由,通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理,各司其职。6亿台Echo终端是Alexa的基本盘,但7月升级释放了更重要的信号,Alexa+已经跨出硬件,进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目,投入超过1亿美元GPU算力,目标是实现多任务联动交互,但高昂成本已在内部引发争议。

这两家的共同判断是“不为全双工牺牲其他能力”,在大多数生产力场景中,用户要的是一个靠谱的结果,而不是一个能随时插话的聊天对象。

而在光谱的另一端,Deepgram和AssemblyAI代表的传统语音专业厂商,仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI在字母数字识别任务上的错误率16.7%,低于OpenAI的23.3%和Deepgram的25.5%。Deepgram一口价$4.50/小时覆盖全链路。但这种“拼积木”架构的天花板是明确的,每增加一个中间环节,就多一层延迟。对于车载和穿戴场景,传统流水线的天花板约在600至1500毫秒,而端到端方案已经下探到了300毫秒以下。

这四种路线之外,还有一个不可忽视的变量正在浮现:端侧推理。Liquid AI与奔驰的合作、Meta的Llama-Voice在消费级GPU上的实时运行,都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束,待高通、苹果和车企定制芯片的迭代完成后,端侧语音推理有可能在2027至2028年进入主流量产。届时,云端语音API的商业模式将面临根本性挑战。

当屏幕不再是默认界面

从定价策略来看,SpaceXAI的战略意图很清晰。

Grok Voice Think Fast 1.0的定价是0.05/分钟。2.0涨到0.08/分钟,但伴随的是TTFA从1.25秒压至0.70秒、转录嘈杂环境提升10倍、推理速度翻倍和Agent执行能力的跃升。更重要的一个动作是,grok-voice-latest端点将在8月5日自动从1.0迁移到2.0。大多数开发者没有理由为省$0.03而固守旧版。

OpenAI的GPT-Realtime-2.1折算约0.05至0.15/分钟。Google采用类似token计费。Qwen Audio 3.0 Realtime Plus的输入成本约4.42/小时,比GPT-Realtime-2.1的10.75/小时便宜六成,但比Grok Voice贵了近一倍。

单独看每分钟几美分的价差微不足道。换算成商业场景:一个月10万分钟通话量(对大型客服中心而言并不罕见),Grok Voice 2.0的8,000对比OpenAI的7,000至$15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互,价差将以百万美元计。

但真正透露战略野心的,是xAI独立拆分出的STT和TTS API定价。Grok STT定价0.10/小时批处理、0.20/小时流式,不到Deepgram同类服务的几十分之一。Grok TTS定价4.20/百万字符,比OpenAI的约30低86%,比ElevenLabs的约$50低90%以上。这种近乎“成本价倾销”的策略,只有在马斯克手中同时掌握特斯拉(终端)、Starlink(网络)和X(数据与分发)时才有商业合理性。语音API可以薄利甚至亏损,生态内的其他环节会加倍赚回来。

这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑,与当年AWS碾压传统IDC如出一辙。

特斯拉是目前全球最大规模的实时语音Agent生产部署。Grok Voice已经在数百万辆车中投入实战。夏季的车辆软件更新通过“Hey Grok”免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱,它能读车辆状态、规划路线、调用搜索和工具。这比任何API计费面板、任何开发者demo都更有说服力,每一次对话既是一次A/B测试,也是一条训练数据。

车载语音市场的膨胀速度佐证了这个判断。据Global Market Insights数据,全球车载语音助手市场2025年约为84亿美元,预计以9.7%的年复合增长率扩张至2035年的213亿美元。智能座舱市场则以11.8%的CAGR从2025年的82亿美元奔向2035年的250亿美元。梅赛德斯-奔驰已与Liquid AI合作,计划下半年将端侧语音AI集成入MB.OS操作系统。Lucid选择了SoundHound。每一家车企都押注同一个判断,在自动驾驶逐步解放双手之后,语音将成为座舱的主交互通道。

穿戴设备比车载走得更远。Ray-Ban Meta Gen 2已经将摄像头、麦克风和AI语音助手集成进一副与普通太阳镜无异的镜框;Rokid Glasses选择MiniMax Speech作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta没有公开其AI眼镜的语音模型供应商,但考虑到Meta与SpaceXAI的竞争关系以及OpenAI与微软的绑定,这本身就说明了一个事实,硬件厂商没有忠诚度,只有“谁更快更便宜”的判断。一旦某个语音模型在速度和成本上取得决定性优势,硬件厂商的切换只是时间问题。

中国阵营,谁是主力?

国内实时语音的竞争格局,远比一两家公司撑起来的场面要热闹。

阿里云的Qwen Audio 3.0 Realtime Plus和Flash双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道,国内至少还有五家公司在同一方向上投入了实质性力量。

字节跳动是其中最不可忽视的一家。豆包大模型搭载的Seeduplex端到端语音架构,已在超过700万辆量产车上落地,覆盖50多个汽车品牌。2026年4月,Seeduplex完成了新一轮升级,通过火山引擎向企业客户输出实时语音能力。字节的优势在于“模型加渠道”的双重杠杆,既有自研模型,又有抖音和火山引擎的庞大分发网络。

MiniMax走的是另一条路:扎根语音基础设施,把生意做到了全球。Speech 2.6模型的端到端延迟压到250毫秒以下,支持40多种语言,已被LiveKit(ChatGPT高级语音模式的技术栈)、Pipecat、Vapi等海外主流语音平台采用。在智能硬件侧,Haivivi Bubble Pal、Fuzozo、Rokid Glasses都在用MiniMax Speech。MiniMax的策略很明确:不跟OpenAI和SpaceXAI在通用大模型上正面拼,而在语音这个垂直层做到“谁的管道里都有我”。

科大讯飞是语音领域的资深玩家,在国内市场的根基远比其他几家深厚。据IDC数据,讯飞在语音语义市场的份额为15.6%,位居第一。2026年2月发布的星火X2大模型基于全国产算力训练,6月集中发布了四款企业级AI应用,将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上,而在垂直场景的深度渗透:教育口语测评、医疗语音病历、政务热线智能坐席、车载语音,每一块都是需要行业know-how的硬骨头。

百度在语音大模型上的投入也值得留意。2026年1月,百度发布了业界首个基于Cross-Attention的端到端语音语言大模型,响应延迟压到412毫秒。百度地图AI副驾在五一期间服务突破2亿人次,依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络(比亚迪、吉利等12家车企搭载了小度车载系统),在“模型加终端”的维度上,百度是国内极少数能与字节对标的企业。

智谱AI的GLM-4-Voice于2024年10月上线,是国内最早一批端到端语音大模型之一,在中文语义理解和长任务执行上建立了口碑。腾讯混元通过TRTC实时音视频平台的AI对话能力、搜狗输入法的AI语音(98%准确率、方言识别提升30%)、腾讯视频的角色扮演语音通话等产品矩阵,把语音AI嵌入已有的超级App生态中。

这六家中国公司加上阿里云,构成了国内实时语音的“七雄”格局。各自切入的角度、积累的优势、主攻的战场各不相同,但在一个方向上高度重合:车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手,但多数用户并不清楚“支持实时语音”这句话背后的延迟差距。毫秒之间,天壤之别。

三个信号

实时语音Agent的战局给出了三个清晰信号。

速度即护城河。在文本大模型领域,一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中,100毫秒的延迟差距就能被用户的下意识反应感知到。Qwen在推理精度上大幅领先,但4秒的代价意味着在车载和穿戴场景中暂时出局。0.70秒对4.02秒,这不只是快慢之分,是能用与不能用的区别。

这个物理天花板指向一个清楚的终局,端到端原生架构将逐步替代三级流水线。但Anthropic的存在提醒了另一面:速度不是唯一标准,在需要深度推理和可靠执行的场景中,“慢而靠谱”比“快而飘乎”更有价值。终点可能不是某一条路线的全面胜利,而是端到端、轮次制和混合路由各自占据不同场景的生态位。

硬件决定终局。纯API模型公司正在面对一个现实,没有自有硬件终端,语音AI的商业化天花板就是API计费。SpaceXAI通过特斯拉、Amazon通过Echo、Meta通过Ray-Ban、百度通过小度和车载合作,凡是拥有硬件出口的公司,在语音入口争夺中天然多一条命。

OpenAI和Anthropic若不能尽快通过合作或自研进入硬件领域,将在下一阶段处于被动。中国市场正以另一套武器打同一场仗,讯飞、字节、百度、阿里在车企供应链中的位置之战,复刻着同一逻辑。语音入口的竞争,说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为OpenAI发布了更快的模型就换掉车上的Grok。Ray-Ban Meta或Rokid Glasses如果绑定了某个语音模型,迁移成本也会使替换变得不划算。一旦被设为默认,换掉它的交易成本就高到让多数人选择忍受。

定价只是起点。Grok TTS定价比ElevenLabs低90%,Llama-Voice开源免费,MiniMax以250毫秒延迟服务全球平台,语音基础设施的价格正在被全面压平,但这只是表层。SpaceXAI靠生态反哺(特斯拉、Starlink、X),Meta靠开源铺设分发管道,微软靠平台锁定企业客户,亚马逊靠Echo终端和Prime会员捆绑。语音API的定价本身已经很难成为独立商业模式,真正的利润在生态的其他环节。

对于开发者和硬件厂商,此刻需要做一个关键决策:绑定单一模型,还是多模型冗余?前者的成本最低但锁定风险最高;后者的延迟和体验优化复杂度将成倍增加。无论走哪条路,都不能再用“等一等再看”的心态观望。语音入口的窗口期,不会超过18个月。

语音不是大模型的附加功能,它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下,比API合同难解除得多。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)

相关内容

热门资讯

经营现金流持续为负,能否改善?... 深圳商报·读创客户端记者 李薇 国科天成(301571)7月31日公告,根据该公司最新发布的投资者关...
孝庄去世后为何停灵37年不下葬... 17世纪中叶,盛京昭陵与北京城之间,隔着的不只是千里路程,还有满洲旧俗、汉地礼制和清朝皇室身份秩序的...
现金流为何重要买房决策更清晰? 在置业过程中,许多购房者往往过度关注房屋总价与首付比例,却忽视了维持家庭财务健康的核心要素。 资金流...
流动为何变化资产配置要关注? 在投资领域,资产配置是实现财富稳健增长的关键环节。而资产的流动性变化,更是投资者在进行资产配置时不可...
组合为何变化资产配置要关注? 在金融投资领域,资产配置是一个至关重要的概念。它不仅关系到投资者的收益,还影响着投资的风险。而资产组...