苹果研究破解 AI“英语口音”难题,提升多语言自然性
创始人
2025-05-17 11:18:32

IT之家 5 月 17 日消息,苹果与多国高校及研究院联合发布最新成果,揭示了大语言模型存在的“英语思维定式”问题,并提出创新解决方案。IT之家注意到,科研人员中不乏中国学者的存在。

研究人员针对非英语语种输出中普遍存在的语法与词汇偏差问题展开了深度剖析,测试覆盖中文、法语、英语(基于维基百科)语料。

测试发现,即使专为中文优化的 Qwen 模型,其母语表现仍落后人类水平;Meta 的 Llama 3.1 综合表现最佳,但自然度仍存在显著差距;所有模型在非英语输出中均残留英语语法结构。

换句话说,即使模型在用中文或法语进行对话,但它仍在用英语进行“思考”,而且非英语输出仍然遵循类似英语的语法和词汇模式。

针对大语言模型的遣词造句,研究团队提出两项量化指标:

  • 词汇自然性(Lexical Naturalness):评估 LLM 用词是否符合母语习惯
  • 句法自然性(Syntactic Naturalness):检验 LLM 语句是否贴合本土语法

为了缩小差距,研究人员通过“回译法”自动生成训练样本,将人工撰写的流畅中文内容先翻译成英文,再逆向翻译成带有 "翻译腔" 的“反面”样本。利用这类对比数据训练模型加强自然表达能力,在保持基准性能的前提下显著改善语言输出质量。

论文地址:

  • https://arxiv.org/abs/2410.15956

相关内容

热门资讯

世界杯|泡沫为何说破就破?从韩... 齐鲁晚报·齐鲁壹点记者 尹成君 韩国队在经历数天煎熬之后,期望最终破灭。新华社发 本届世界杯扩军之...
他们是谁,省委书记为何要专程看... 中国共产党成立105周年即将到来之际,6月27日,省委书记刘宁去了趟漯河。 他看望了三个人,并为他们...
欧洲持续高温,中国空调为何成“... 欧洲多地连日来遭遇高温,多地打破高温纪录。热浪之下,中国空调成了“稀缺品”。 据媒体报道,有欧洲网友...
原创 得... 斗破苍穹年番新一集已经出来了。这一集看下来,要说最不讨喜的人是谁,那当属药族长老药万归了。因为他先是...
横扫五项大奖 华策《太平年》为... 玉兰绽放,荣光闪耀。6月26日晚,备受瞩目的第31届上海电视节白玉兰奖揭晓。华策集团出品的重大历史题...