让AI听懂人类的“弦外之音”!阶跃星辰开源SOTA级端到端语音大模型
创始人
2025-09-01 12:44:33

新民晚报记者今天(1日)上午从大模型“六小虎”之一的阶跃星辰获悉,发布最强开源端到端语音大模型Step-Audio 2 mini,该模型在多个国际基准测试集上取得SOTA(State-of-The-Art,即当前最佳水平)成绩。目前,Step-Audio 2 mini已经可在GitHub、Hugging Face等平台下载并体验。

在技术层面,Step-Audio 2 mini采用了真正的端到端多模态架构,并将语音理解、音频推理与生成统一建模,不仅时延更低、输出更快,还能更加精准地理解副语言信息、非人声信号等语音要素,显著提升了语音人机交互的效率和智能上限。

据测评,这款模型在音频理解、语音识别、跨语种翻译、情感与副语言解析、等任务中表现突出,综合性能超越Qwen-Omni、Kimi-Audio在内的所有开源端到端语音模型,并在大部分任务上超越GPT-4o-audio。

随着语音交互成为人机主要交互方式,智能终端设备对语音模型的智商及情商水平提出了更高要求。Step-Audio 2 mini 首创了音频推理能力,能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应,由此让AI听懂人类的“弦外之音”;同时,该模型率先支持语音原生的Tool Calling能力,可实现联网搜索等操作,有效解决模型幻觉问题,并让语音模型像文本模型一样具有更强大的知识储备和推理能力。

Step-Audio 2 mini模型架构图

在此之前,吉利发布了搭载阶跃星辰端到端语音大模型的吉利银河M9,这是行业内端到端语音大模型首次实现量产上车。据阶跃星辰相关人士介绍,自去年发布国内首个千亿参数端到端语音大模型Step-1o Audio 以来,该公司持续迭代模型性能,并跟吉利、鲸鱼机器人、TCL、Cyan青心意创等头部终端厂商达成深度合作,让语音大模型在生活场景中为消费者提供更加智能、便捷的互动体验。

今年以来,阶跃星辰已经开源了8款性能领先的多模态模型,覆盖语音、视频生成、图像编辑、3D、多模态推理等多个类别,为全球开源社区贡献多模态力量。

相关内容

热门资讯

谷歌AI逆袭背后的头号功臣 新智元报道 编辑:艾伦 【新智元导读】谷歌 AI 在 2025 年下半年打了个漂亮的翻身仗,用 N...
低调不是无作为,而是不显摆-最...   生活是过出来的,不是想出来的。  有一种人只做两件事:你成功了,他妒嫉你;你失败了,他笑话你。 ...
浅浅的微笑、谁能读懂那种悲伤-...   我想看一场盛大的流行陨落的过程、我要一直不停许愿、许到沧海桑田瞬息万变直到靠近你微笑淡晴的脸。 ...
今日方知我是我|《意识探索》揭... 作者 | Yasmine 意识是什么 你是否曾有过这样的瞬间: 夜深人静,思绪从繁忙的工作生活抽离,...
承诺,爱情最好的协助者-QQ空...   我一点都不贪,只希望你能给我万分之一的温柔。  白天的我面对你,带着虚假的微笑,夜晚的我一个人在...