谷歌(GOOGL.US)推出Gemini 3.5 Transcribe 号称迄今精确度最高语音转文本模型
创始人
2026-08-27 11:53:53

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:智通财经)

智通财经APP获悉,谷歌(GOOGL.US)公布了Gemini 3.5 Transcribe,并称这是该公司迄今为止精确度最高的语音转文本模型。谷歌表示:“与传统语音识别模型在处理背景噪音、复杂专业术语以及口语停顿和不流畅表达清理等问题时表现不佳不同,Gemini 3.5 Transcribe能够将原始音频直接转换为准确、经过润色且格式规范的文本。”

据悉,该模型旨在轻松接入开发者的工作流程,从而支持构建语音代理、实时字幕或通话后分析处理流程。开发者可以通过Live API实现实时流式处理,也可以通过Interactions API处理预先录制的音频。其部分功能包括智能转录,可自动清理文本,例如删除口头停顿;识别自定义词汇;支持超过85种语言;并能够识别最多3名说话者。

该模型在流式处理场景下的错误率为4%,非流式处理场景下的错误率为2.6%。在涵盖多种语言的FLEURS基准测试中,其表现也更好。例如,Gemini Transcribe 3.5 Live的词错误率为5.5%,相比之下,OpenAI的GPT Live Transcribe词错误率为8.9%。

新模型从今天起面向开发者和企业用户开放公开预览。对于其他所有用户,该模型目前可在macOS版Gemini应用中以英语使用,并可在部分国家的Android版Rambler中使用。该模型很快还将登陆Chrome。

本月早些时候,谷歌发布了Gemini 3.7 Flash,Gemini应用的用户数量也突破10亿。不过,谷歌尚未发布下一代旗舰模型Gemini 3.5 Pro。在今年5月举办的2026年I/O开发者大会上,皮查伊曾表示会在6月推出Gemini 3.5 Pro模型,但该模型至今仍未上线。按照原本规划,Gemini 3.5 Pro模型应该承担谷歌重新冲击AI前沿竞争的任务。毕竟,在OpenAI、Anthropic不断刷新模型能力的背景下,Gemini Pro系列一直是外界衡量谷歌AI实力的重要标尺。但下一款旗舰模型的发布时间迟迟无法确定,也进一步加剧了外界对这家科技巨头能否超越竞争对手、并成功将巨额AI投资转化为市场领先的工具和服务的广泛疑问。

相关内容

热门资讯

中国女留学生在韩遇害案最新进展... 当地时间8月27日,韩国警方已以涉嫌杀人等罪名提请法院批捕杀害中国籍女留学生的中国籍大学讲师郑某,对...
豆包工作正式发布:让AI从生成... 8月25日,豆包工作正式发布。作为豆包面向生产力场景推出的全新Agent产品与品牌,豆包工作能围绕用...
燃油成本上涨 澳洲航空年度利润... 来源:新华社新华社悉尼8月27日电(记者 薛艳雯)澳大利亚澳洲航空集团27日公布的2026财年年报显...
A股震荡攀升,沪指半日上涨0.... 每经记者|刘明涛    每经编辑|肖芮冬     8月27日,A股震荡攀升,截至上...
山东省运会智能化水平对标国内高...   刷新纪录  本届省运会赛事设置38个大项、1081个小项,金牌总数1620枚,项目数量较上届增长...