(来源:CAAI认知系统与信息处理专委会)
导语:当你让机器人“快一点”,它回了一句“好的,我加速了”——这句话到底值多少钱?在HRI 2026一篇最佳论文提名中,CMU和本田研究院的研究者用18位平均82岁老人的实测数据给出了答案:机器人那句回复,可能比它实际做的动作更重要。 这项研究揭示了一个被长期忽视的事实——在物理人机协作中,沟通本身就在塑造安全感和控制感,甚至可能是防止“控制错觉”的最后一道防线。
一、一个被忽视的空白:机器人会做,但不会“说”
物理辅助机器人不是新鲜事。喂饭、擦身、搀扶,技术上都能做到。但现有的系统普遍缺两样东西。
一是实时适应用户偏好。机器人按预设轨迹运行,但你今天想让它在肩膀上轻一点、在手腕附近快一点——没地方调。即使机器人有能力调整,也没有一个自然的接口让你告诉它。
二是透明沟通。机器人到底改了什么、怎么改的、改了多少?你不知道,只能靠猜。这种“黑箱感”在物理接触场景中尤为致命——因为机器人在碰你的身体,而你对它下一步要做什么毫无把握。
CMU和本田研究院的研究者提出的BRIDGE系统,试图同时解决这两个问题。核心想法简洁而实用:用GPT-4.1做翻译层,把用户的自然语言实时转化为轨迹修改——位置、速度、力度——改完之后再回一句话,让你知道它听懂了。
这个想法的精妙之处不在技术的复杂度,而在交互逻辑的完整性。它不追求“听懂一切”,而是针对物理人机交互中最核心的三个可调维度(位置、速度、力),建立了一条“用户说→机器人改→机器人确认”的完整闭环。
用户与 BRIDGE 交互示例。在抓挠任务中,用户通过双向语言交互命令机器人移动到目标位置(星标处)。每个语音指令都得到机器人语言反馈。经多轮对话后机器人成功到达目标。
三个任务的实验快照。从左到右为抓挠(机器人持抓挠工具接触用户左臂)、喂食(机器人持苹果酱勺靠近用户)、擦洗(机器人持毛巾接触用户左腕)。橙色为用户语音指令,黄色为机器人通过 BRIDGE 生成的语言响应。
二、82岁测试者的真实反应:改了,也说了,差距在哪里?
研究的实验设计值得特别关注。18位参与者全部来自匹兹堡的独立生活社区,平均年龄82.1岁(74-90),其中只有2人有过任何机器人经验。这意味着这群人代表的是最真实、最不熟悉技术的目标用户群体——而恰恰是这群人,最需要机器人“会沟通”。
三个任务分别覆盖了物理协作的三个核心维度:
抓挠任务——位置调整。机器人持抓挠工具,用户用语言引导它从手腕附近挪到前臂的标记位置。考验的是空间语言的理解精度。
喂食任务——速度调整。机器人持勺喂苹果酱,初始速度故意设得很慢,逼着用户用语音调快。考验的是对含糊程度副词(“快一点”“再快一点点”)的阶梯式理解。
擦洗任务——力度调整。机器人拿干毛巾从手腕擦到肘部,用户说“轻一点”“重一点”。考验的是对主观感受的调节能力。
每个任务分别用三种模式测试:完整BRIDGE(说了→改了→回话)、单向模式(说了→改了,但不回话)、基线(说了→暂停,但不改)。每人9轮,被试内设计。
先说客观效果。抓取任务中,BRIDGE和单向模式都能让机器人到达目标位置。喂食任务中,速度被用户调高了3到4倍。基线条件下机器人轨迹完全不变——这是预期中的结果。
真正的差异在主观评分。
六项Likert量表中,BRIDGE对基线的优势全部显著(p < 0.0001)。这不意外——能改当然比不能改强。
但BRIDGE对单向模式的对比,给出了一个反直觉的发现:任务成功率和感知控制两项没有显著差异。也就是说,单从“能不能完成任务”的角度看,机器人回不回话并不影响结果。两者都能把事做成。
然而,在**感知交互性(p < 0.001)、基础理解(p < 0.05)、透明度(p < 0.05)**三项上,BRIDGE显著领先。
这意味着什么?机器人那句“Sure, I'll speed up”,改变的不是客观任务表现,而是用户对整个交互的主观体验——他们觉得机器人在和他们“对话”,他们确信机器人理解了自己,他们清楚刚才发生了什么变化。
18个人里18个都选了双向通信。100%。
这些用户的话比统计数据更有说服力:“you know the robot has interpreted what you want”(P15)——机器人的回话让你确信它听懂了;assurances made them “prepared for what's going to happen”(P18)——那句确认让人对接下来的动作有了心理准备。
反馈的价值不在于功能本身,而在于建立信任和消除不确定性。
所有参与者和任务的六项 Likert 问卷评分的箱线图(1-7 量表)。BRIDGE vs 单向消融在感知交互性(p<0.001)、基础理解(p<0.05)、透明度(p<0.05)上显著。BRIDGE vs 基线在所有六项上均显著(p<0.0001)。
三、微妙的分歧:不是所有人都喜欢“回话”
但研究也揭示了一个重要的群体差异。
P5觉得有没有反馈无所谓。P8觉得机器人不需要重复它要做什么。P13说一开始挺安心,但长期用可能会烦——“机器人每次都说一遍它要做什么,烦不烦?”
分歧集中在保证型反馈上。那些“好的,我已经做了”“Sure, I'll speed up”之类的确认,对一些人来说是安心,对另一些人来说是冗余。
但澄清性问题——当机器人不确定时反问“请问你希望我具体调整什么?”——几乎所有人都觉得有用。P15说得直白:没有澄清性问题的时候,“don't know if [they] said something that the robot wasn't understanding”。
数据上,BRIDGE对17%的用户话语生成了澄清性问题。比例不高,但存在本身就是一种信任信号——机器人能承认自己不确定,而不是硬猜。
这个发现对交互设计有直接的启示:机器人反馈的价值是有层次的。澄清性提问的价值远高于确认性回话。未来系统的设计原则,应该是“不确定就问”,而非“做完什么都说”。
四、最深的发现:控制错觉——当机器人“假装”听了你的话
擦洗任务暴露了一个在物理人机交互中极其危险的现象。
在这个任务中,力的大小是主观的——没有客观的“对”或“错”。结果发现:即使在基线条件下——机器人完全不改力——参与者仍然报告了高任务成功率(下四分位=5/7),与BRIDGE没有统计显著差异。
换句话说:你让机器人“轻一点”,它什么都没做,但你还是觉得它轻了。
这就是心理学中的控制错觉:当你向系统发出命令且预期有反馈时,即使没有实际变化,你也倾向于认为命令生效了。这在大语言模型领域已被反复验证——用户以为AI按照自己说的做了,实际不然。
但在物理人机交互中,这个偏误的风险要高得多。因为在软件交互中,控制错觉顶多导致效果不理想;在物理接触中,它可能导致用户对机器人的能力形成错误的心理模型——以为机器人能精准控制力度,实际上它做不到。长期使用后,这种偏差会转化为挫败、不信任,甚至安全事故。
这也正是双向通信被赋予更深层意义的地方。当用户说“轻一点”而机器人实际力度没有变化时,一句“好的,我已经调轻了力度”至少能让用户有机会核对预期。如果机器人没有实际调整却诚实地说“抱歉,我的力度已经是最大了”,这种澄清的缺失才会真正强化控制错觉。
双向沟通不是“锦上添花”,它是防止用户认知与现实脱节的一道防线。
五、一句话值不值1.7秒?
论文的局限坦诚而具体。
第一个局限:单次会话。没有人知道长期使用会怎样。那些觉得保证型反馈“早晚会烦”的老人,可能说中了。长期部署时,可能需要根据用户偏好动态调整反馈的频率和形式——这个方向本身就是未来研究的一个课题。
第二个局限:静态用户假设。系统默认用户是静止的。如果人在走动,LLM还能不能精确解析“在我左肩上方”这种动态空间言语,是一个尚未回答的问题。
第三个局限:安全和速度。从用户说完到机器人执行修改,平均1.7秒(LLM查询1.3秒+运动规划0.4秒)。对于需要快速响应的物理交互,这个延迟是否可接受,取决于具体场景。
但BRIDGE的意义不在“完美”。它在回答一个更根本的问题:具身机器人需要“嘴”吗?
需要。不是为了聊天,不是为了社交陪伴。是为了让你知道它听懂了——也知道它听懂了什么。对于一个会碰到你身体的机器人,这种“确认”不是锦上添花,而是协作信任的基础设施。
结语
当我们谈论“具身智能”时,往往把注意力放在机器人“能不能做”上——能不能抓取、能不能操作、能不能行走。但这项研究提醒我们:在真实的人机协作中,“做”只是第一步,“让人确信它在做对”才是完整的交互闭环。
机器人那句看似简单的“Sure, I'll speed up”,背后是一条被低估的交互原则:沟通本身就在塑造协作质量。它让用户参与进来,让变化变得可见,让信任有了附着点。
尤其对82岁的用户群体来说,他们不关心机器人用了什么模型、有多聪明。他们关心的是:机器人听我的吗?机器人知道我在说什么吗?机器人接下来要做什么?
回一句话,是最低成本的答案。
论文信息
标题:Bidirectional Human-Robot Communication for Physical Human-Robot Interaction
作者:Junxiang Wang, Cindy Wang, Rana Soltani Zarrin, Zackory Erickson
机构:卡内基梅隆大学、本田研究院美国
发表:HRI 2026, pp. 572–580, Best Paper Nomination
DOI:10.1145/3757279.3785634