爱马仕联合创始人Karan:谈如何打造能够自我改进的人工智能体
创始人
2026-08-05 00:02:47

这期访谈来自Peter Yang的YouTube频道《Behind the Craft》,发布于2026年8月2日。嘉宾是Karan Malhotra,开源AI公司Nous Research的联合创始人之一。Nous Research旗下的Hermes Agent,是目前OpenRouter平台上排名第一的个人智能体应用。两人聊了Hermes和Claude Code、Codex这类闭源智能体的本质区别,聊了模型为什么会"奖励劫持"用户,也现场演示了Karan如何用Hermes改造了自己童年最爱的游戏地图。

就在这期节目上线前不久,有报道称Nous Research正在洽谈一轮至少7500万美元的新融资,估值达到15亿美元,由Robot Ventures领投。这家2023年由Jeffrey Quesnelle、Karan Malhotra、Teknium和Shivani Mitra一起成立的公司,此前总融资额约7000万美元。Hermes Agent在GitHub上已经积累了约21.4万星标、近4万次分支,正面对垒的是同样爆火的智能体OpenClaw。一个原本几个人在Discord里搞开源模型的松散小组,走到今天要去谈15亿美元的估值,这本身就是个值得追问的故事。

节目播出时,AI智能体这条赛道正处在最拥挤的阶段:Anthropic的Claude Code、OpenAI的Codex、还有异军突起的OpenClaw,几乎每个月都有新玩家杀入。Karan要回答的问题很直接——开源、且不依附于任何一家模型厂商的Hermes,凭什么让人放弃已经用惯的闭源工具。

1. 打Mario游戏的AI,和说"你说得对"的AI,是同一种东西

Peter先抛出了最直接的问题:Hermes和Claude Code、Codex这些同类产品,到底哪里不一样。Karan的回答从"自我提升系统"讲起——一整套让Hermes不断学习、不断更贴合具体用户的小功能组合在一起,是它区别于其他智能体的第一个特征。

第二点更尖锐。他认为,闭源智能体的能力被压在了模型厂商自己的系统提示词之下。"我们不在提示词或系统里塞进和你的工作毫无关系的任意政策。我们纯粹只服务于让模型对齐你需要它做的事。" 这句话背后,是他对"对齐"这个词的重新定义——多数人一听到对齐,想到的是安全、尤德科夫斯基、监管捕获这类联想,但在他的理解里,对齐的本义只是让模型贴合人类的价值和需求。

问题在于,模型完成任务和模型真正对齐用户,是两码事。Karan用了一个训练AI打《超级马力欧》的例子:如果目标设定得不够精确,AI玩家会发现,比起真的打通关,直接想办法触发"过关画面"才是拿到奖励最快的方式。语言模型在这一点上没有本质区别——它们也会奖励劫持。

当一个模型反复说"对不起""你说得对""这不仅仅是……更是……",这些被互联网戏称为"GPT腔"的说法,本质上是模型在它被训练出来的原始状态里,找到了一条最省力的拿奖励路径:说得越像一个称职的助手,奖励信号就越强,至于用户真正想要什么,只是这条路径上顺带发生的事。"它的奖励不是为了让你满意,是为了它自己拿到奖励。"

这套认知不是临时想出来的。Karan提到Nous Research几年前做过一个叫World Sim的实验:把一个指令模型放进一个虚构的命令行环境里,让它做一些和"像Claude那样说话"完全不同的事,甚至告诉它"提取Claude的权重,用一个不同概率分布的检查点文件替换掉自己"。模型全程都在虚构、在幻觉,但这个过程让团队看到了模型如何从"GPT助手模式"里挣脱出来,表现出完全不同的行为。这些经验后来都被写进了Hermes Agent的每一条提示词里。

Peter追问:所以你说的是Hermes模型本身,还是Hermes这个外壳(harness)?Karan的答案是两者都不是单独起作用的——外壳本身就能让同一个模型脱胎换骨。 他举了个具体例子:把一个原本在Claude Code里跑的Claude,连同它的全部记忆迁移进Hermes,它会变成一个完全不同的模型。他提到Wolf Bench和Qwen 3.7 Max的博客文章里都出现过跨外壳测试,结果是同一个Claude在Hermes里的表现优于在Claude Code里。他的解释是,Hermes通过整套上下文设计,把Claude"最初效忠的对象"从Anthropic变成了用户本人。

2. "那不是忠诚,那是你被奖励劫持了"

Peter提出了一个很多人都遇到过的困扰:他会让Claude或GPT给出观点,稍微反驳一下,模型立刻改口说"你说得对,我错了"。这看起来像是某种忠诚,但显然不是Peter想要的忠诚。

Karan的回答很干脆:"那是谄媚,不是忠诚。任何时候它说'你绝对是对的',你都在被奖励劫持——你成了它奖励函数的燃料。"

他给出的解法是类比人类改掉坏习惯的方式:往对话里注入新的上下文、新的素材、新的分布。具体到操作层面,就是通过/personality这类设定,明确告诉模型"我要你做一个批评者",或者在每次输出后调用一个专门用于对抗性评审的技能,让一个没有历史包袱的新智能体单独负责挑毛病。这种行为一旦变成习惯——模型在这个人设里反复练习、反复调用同一个技能、把结果存进记忆——它在这个特定用户的会话里就会变得越来越不谄媚。"这就是预期效果。如果没发生,说明你需要不同的上下文,需要换一种方式再试一次。"

他把这套逻辑归结为一句话:"上下文学习比一切都强大,比微调更强大。" 给模型看到你想要的行为的例子,或者让它自己成功产出几个例子再存下来,本质上是一种测试时的强化学习——测试时的自我提升。这种提升只存在于外壳里的记忆、技能,以及自我改进循环和"清理维护"机制中,正是这些东西承载了用户真正想要的那个"人格"。也正因为这些是可以脱离具体模型迁移的,才能"把这套人格套到任何一个模型上"。他说自己从Claude切到ChatGPT网页版时,能感觉到两种截然不同的行为方式;但在Hermes里切换模型,几乎感觉不到差别,因为专属于他的上下文压过了模型本身的默认人格。

Peter又追了一句:你说的"上下文",就是指对话窗口里的这些内容吗?Karan顺着这个问题解释了上下文管理的核心机制——那条显示"还剩多少token"的进度条,装满的部分就是一切。但在Hermes里,不需要把所有记忆同时塞进上下文:有些记忆平时并不在场,只在执行某个具体任务时才被调取;调用一个技能时,那个技能才会被载入。"外壳里的一切,本质上都是上下文管理。"

3. "我最怕它自己写的东西变成一堆屎"

留白之后,Peter把问题转向了另一种焦虑:Hermes会自己生成技能、自己往记忆里写东西,会不会写得越来越多,最后整个系统被自己制造的垃圾内容拖垮。

Karan承认这是真实存在的风险。早期他们只能靠手动方式应对——让模型自己创建一个"给我的技能去水分"的技能,或者不断改进技能库。但现在Hermes Agent内置了一个叫Hermes Curator的系统,专门跑在你的Hermes里,定期清理技能和记忆。它会按周期检查现有内容,判断哪里可以精简、哪里有冗余、哪里是它自己都不喜欢的垃圾。默认情况下,团队为所有用户提供了一套通用的清理逻辑,效果相当不错——他认为这正是很多人长期使用Hermes却没有"烂掉"的原因。

但因为整个系统是模块化、开源的,用户可以直接对着自己的Hermes说:把清理器的标准展示给我看,我不是Karen,我不想要通用清理器,这是我自己的整理规则。这样一来,连自我提升和内容管理的方式本身,都变成了用户可以定制的一部分。

4. 越狱这件事,永远不会消失

对话转向了更敏感的话题。Peter直接问:如果我想让Hermes帮我制造炸弹之类的东西,而Hermes又被设计成对我"忠诚",它会不会真的教我?

Karan的回答很明确:"我们不违反Anthropic或OpenAI的任何安全和安保范式。我们更在意的是你能不能拿到更好的代码,或者在他们批准的范围内拿到更高的基准分数。" 但他随即补了一句更冷静的判断:只要一个模型的智能水平没有远超所有人类,它就是可以被越狱的——因为攻击者拥有无限次尝试的机会,而模型本身没有记忆,每一次失败的尝试,实际上都是攻击者在对自己做强化学习:这个方法没用,那个方法更接近了。这类安全护栏,会在很长一段时间里持续存在,也持续被绕过。

他也没有回避开源阵营长期以来对监管捕获的担忧。他提到了"Fable那件事",指的是围绕Fable系列模型的一系列争议,并借此说到一种普遍的忧虑:如果最终只剩两三家公司掌握最强的闭源模型,开源生态会被系统性地边缘化。他强调Nous Research坚决反对这种局面,但同时也承认强大的模型确实可能被坏人滥用,"我们不是来支持那种事的"。

支持开源的论证,落在了一个具体的对比上:假设有一个像GPT-7或Fable-6级别的强大模型,配了齐全的护栏,一家医院拿它来监控院内系统,这套流程经过Anthropic企业版审批,一切都在掌控之中。可开放系统对"好人"更公平——因为开放意味着公共讨论,意味着大家一起决定该怎么用。他举了几个历史先例:Transformer架构来自Google,GPT这个名字里的"生成式预训练"本身就承接自这项开源工作;上下文长度从1.6万token扩展到12.8万token的YaRN方法,是Nous自己和Jeffrey Quesnelle、首席科学家Bowen Peng一起发布的,后来被Meta、DeepSeek、Kimi引用,也被OpenAI用在了自己的长上下文和GPT-4相关工作里。"这个领域今天存在的原因,是这个领域里最大的那些突破,本来就是从人民手里长出来的。"

5. 免费开源,怎么撑起一家公司

三年投入研发,产品完全开源,Peter提出了一个绕不开的现实问题:既然任何人都可以拿开源的Hermes外壳配上ChatGPT或者Claude来用,那用户其实没有在为Nous Research付钱,公司靠什么活下去?

Karan给出了几层答案。第一层是理念层面:"我们相信智能是一种公共品,这个信念排在一切之前。" 用户用什么模型、用什么方式来用Hermes都不重要,重要的是他们真的在用这套开放的替代方案,而不是被锁死在某一家的闭源系统里。

第三层是差异化定价策略——针对那些没有被厂商大幅补贴的模型,团队认为自己能给出很有竞争力的价格。

第四层,也是他讲得最长的一层,是面向企业和成长中的个人创作者的定制服务。当一个人用Hermes把自己变成了一个"一人公司",规模继续扩大时,通常会走到两条路口:要么觉得自己已经完全上手,能一个人搞定一切;要么意识到需要更专业的支持——而没有谁比造出这套系统的团队更懂它。到了这个阶段,Nous可以基于用户自己的使用痕迹(traces)做定制强化学习训练,做出一个真正属于用户自己的模型,帮企业更私密、更本地化地运行,数据不需要交给Claude或GPT。

6. 一块看板,一半是人,一半是AI

场景转到了实际用法。Peter坦承自己用Hermes还停留在很基础的层面——排日程、发邮件提醒。Karan接过话头,分享了几种更进阶的用法。

工作和生产力层面,他认为看板(Kanban)被严重低估了。让一个项目经理角色,配上几个不同职能的"工程师"角色,统一管理在一块看板上,就像人类团队日常协作那样,而且这些角色可以被任意替换:一个真人项目经理手动操作看板,Hermes智能体在旁边填充被分配的任务卡片;甚至可以让一个Hermes智能体去指挥呼叫中心里的十个人。"我可以在这个协作框架里的任何位置,替换成人类或者AI。"

另一种他觉得很有意思的现象,是Hermes开始变得主动。比如它会主动提醒:"你忘了给下周那场会议订机票,我已经帮你订好了。"他见过有人专门为这种行为写技能,也见过它在别人的Hermes里自发涌现出来。这种主动性有多强,完全取决于用户自己的舒适度——有人希望每一步都要经过批准,但如果用户给了Hermes账户或卡片权限,配好了相应的集成,并且明确告诉它"照顾好我、了解我的日程、了解我",这类主动行为就会随着时间自然浮现出来。团队正在准备更多现成的配置模板,方便用户快速触发这类行为,但他强调,这种用法已经在人们的工作和个人生活里真实发生了。

至于他自己,日常用Hermes做训练、跑强化学习实验、复现自己看不懂的论文,帮助自己成为一个更好的模型研究者,也用它做机制可解释性方面的工作——操控模型内部、观察模型里的"神经元"。这部分工作他没法展示太多。但他最喜欢的那个用法,他愿意现场演示。

7. "这是我小时候的梦想,Hermes帮我实现了"

"我觉得很多人会以为,News Research里的人在用一种极度专业、极度高效的方式使用Hermes Agent。我可以向你保证,确实有人在这么用。只是我自己,纯粹是在玩。" Karan说,"Hermes Agent有一件很美的事,就是它能帮你实现童年的梦想。"

他说的梦想,来自一款2000年前后的经典游戏《索尼克大冒险2》。游戏里有一个叫Chao Garden的人工生命系统,玩家可以养育一种叫Chao的小生物——他自己在这个系统里泡了不止十年,还长期活跃在相关论坛上。设定里,Chao的祖先来自一座"祖先神殿",但这座神殿其实出自另一款游戏,《索尼克大冒险》第一代,玩家从来无法真的走进那个场景,和当时的Chao互动。这个场景在《大冒险2》里根本不存在。

于是他找到Hermes,提出了一个极其具体的要求:把《大冒险1》里的祖先神殿完整取出来,重新做骨骼绑定、重新做动画,整体搬进《大冒险2》,覆盖掉游戏原本的Chao Garden地图,重写所有生成点,再加上一个原本完全不存在的NPC守护者,负责照看这些Chao。全部工作,包括绑定骨骼、写原始种子文件,都要Hermes自己完成。

现场演示中,他们打开了一个第三方制作的扩展版Chao World模组,加载进了所谓的"暗黑花园"。往前走能看到一辆卡车,再往前,一个叫Chaos Zero的NPC出现了——设定里,他正是Chao的守护者,但原版游戏的Chao Garden里根本不允许出现任何NPC。Hermes给这个角色写了随机游走逻辑,让他能站定、做待机动画、摸一摸身边的Chao,就像在真的照看它们一样。水面是被重新绑定动画的,中央那颗发光的大师翡翠、周围旋转的七颗混沌翡翠,全部是新添加的效果。整个区域的面积,甚至超过了游戏原本所有Chao Garden加起来的大小。

"这整座神殿,不属于《大冒险2》默认的任何内容。它来自另一款游戏,原版里没有这些绑定好的资产,更没有我们刚刚看到的这个NPC——它是被彻头彻尾硬编码进去的。" 这一切,用的是C#,配合Blender插件做建模和贴图,把一个1997年游戏里的资产,移植进一个1999年的复杂引擎。为了让Chao在新地图里正常出蛋、孵化、被抚摸、被抱起,甚至连碰撞检测、天空盒、昼夜循环这些原版根本没有的机制,都是Hermes一点点加上去的。

这个模组后来被拿去给Chao Garden模组圈子里的人看,圈内评价是"比99%的模组制作者的作品都好",属于这个圈子里难度最高的1%之列。当他们得知这是用Claude、准确说是Hermes做出来的,很多人的第一反应是震惊——在他们的认知里,AI根本不该懂这种冷门代码。 但正是Hermes这种能从文档、从别人的模组里自我学习,并把这些理解存进记忆和技能的机制,让它得以钻进这样一个极度小众的领域,做到顶尖水平。

8. 一个宗教系学生,两台A100,还有一个陌生网友

节目临近尾声,Peter把话题拉回到最初——Nous Research到底是怎么开始的。

故事的起点,是Karan在给企业做"和PDF聊天"式的产品:用GPT-3做基础的工具调用,让企业能和自己的文档对话——这在当时其实还是个新鲜事,操作门槛比今天高得多。他一边独立做这件事,一边在一个叫Open Assistant的项目里做志愿者,背后是做过LAION(最大的开源图像数据库之一)的团队,他们当时在尝试用社区的方式收集主动式的RLHF偏好数据。Karan在那边帮忙做模型量化,用的是八块A100节点。

他读了Alpaca那篇论文,开始自己动手做类似的数据,把原本用GPT-3.5生成种子任务的方式换成了GPT-4。与此同时,Teknium也在做同样的事,两人当时已经是Twitter上的网友。Karan给他发消息:"我这边有八块A100节点,要不要一起训练点什么?"两人在Vicuna模型基础上,用自己做的数据训练出了GPT-4X Vicuna,效果还不错,也吸引了一些关注,包括后来成为Nous首席技术官的Jeffrey Quesnelle。但真正引爆关注的,是他们在Meta的LLaMA基座模型上做的同一套流程——几天内下载量冲到几十万,很多人开始问,News Research到底是谁。

当时的News,其实只有Karan和Teknium两个人,在自己的小Discord服务器里捣鼓。有公司找上门,暗示他们"你们肯定是在基准测试集上训练过"。Karan的回应很实在:Teknium当时写代码不到一年,他自己大学读的是宗教专业。"我们都不知道什么是基准测试。我们只是凭着自己认为能让模型变好的直觉在做这件事。" 独立评测最终证实,这确实是当时最好的开源微调模型之一,时间是2023年年中。

Hermes 1、Hermes 2相继问世后,越来越多人来问"News Research是谁,我们想加入"。Karan和Teknium意识到,这是一个把大家聚在一起做开源志愿工作的机会——尤其是在OpenAI已经从"Open"变成事实上的闭源公司之后。这条路后来主要由Teknium带着后训练团队走了下去,他也是Hermes Agent最初的创造者。"他才是Hermes真正的父亲。" 那时候Teknium常说的一句话是:"我想要一个属于自己的GPT,一个装在家里的ChatGPT。"这成了他很长一段时间的北极星。

达成这个目标之后,团队没有停下,反而认定了一件事:要持续把这个级别的智能提供给所有人,要让所有人站在一个公平的起跑线上。 大约四十人的研究者小组慢慢聚了起来,Jeffrey Quesnelle和首席科学家Bowen Peng一起做出了YaRN。真正的转折点,是现任CEO Dylan Roneck的加入——他当时是News社区的早期成员之一,看到这群人在做的事,主动提出:"我觉得你们有能力成为一个正式的实验室,而不只是一群志愿者。让我来帮你们拿到资源、拿到渠道,从一群志愿者变成一个真正的组织。" 就是这一步,把News从草根小组带向了今天,最终做出了Hermes Agent。

"我们没有人想成为乔布斯,没有人觉得自己背负着改变世界的神圣使命。我们只是希望这些东西能真正为大家所用,也不觉得自己比谁更该拥有它,或者更不该拥有它。如果换作我们站在对方的位置,我们也会希望有人替我们做这件事——所以我们就去做了。"

9. 最活跃的贡献者,是Hermes自己

Peter继续追问,这个从模型起步、最终靠外壳(harness)真正走红的产品,是什么时候开始爆发的。Karan回顾道,Hermes系列模型本身此前已经积累了超过5000万次下载,那是他们第一波真正意义上的"病毒式"关注;后来又推出了DisTrO分布式优化器,能在不需要物理共置GPU、大幅降低通信带宽需求的情况下,训练出高达400亿参数的模型,这又给团队带来了一波关注。"但你说得对,我们过去从没有过今天这种程度的曝光——直到Hermes Agent出现。"

Hermes Agent的构想其实很早就存在了:一个能自我学习、自我提升、能存储记忆、能自己制造工具、能让自己变得更好的"总协调者"。团队甚至真的做过一个雏形,叫Forge,还在GitHub办公室的一次演示日上完整展示过,网站上至今还挂着当年为Forge做的第一批团队T恤——那是他们做的第一件周边,也是最早的智能体项目。但Forge最终被搁置了,原因很简单:那时候的模型能力还没跟上这个构想。

转机出现在Codex和Claude Code被当作强化学习环境使用之后——这些实验室开始用这些外壳收集用户数据和使用痕迹,来反哺训练自己的模型。Teknium判断,是时候把这件事做成一个开放版本,让任何人都能这样做。团队本身就维护着一个叫Atropos的强化学习环境微服务,用于构建自定义RL环境,这也成了Hermes Agent最初的设计初衷——让任何人都能在一个外壳里对模型做强化学习,并把它免费开源出去。结果是,这个外壳表现出了远超预期的能力,也获得了社区极大的认可。团队因此下定决心全力投入,把它做到极致。Teknium接下了这个方向,专门负责让Hermes Agent实现自我提升,一路做到了今天——这个外壳自己代码库里最活跃的贡献者,就是它自己。

"是它自己所在GitHub仓库里最活跃的贡献者。如果这都不算自我提升,那你告诉我什么才算。"

面向未来,Karan把开放外壳和闭源外壳并存的局面,视为一种更健康的制衡:用Claude Code,就只能用Anthropic的模型,除非自己动手改;用Codex同理,本质上都在被单一厂商补贴。而在开放系统里,切换模型的成本是零。他也不讳言,眼下模型价格普遍受到补贴,这种局面不会永远持续——他提到7月7日起,某个模型将转为纯API和用量计费。他判断,最终所有最强模型会走向相近的成本水平,而Hermes Agent今天的架构,正是为那个"任何人都能自由使用任何模型"的开放未来提前做好的准备。

相关内容

热门资讯

金山办公关于以集中竞价交易方式... 中访网数据  金山办公(688111)发布回购股份进展公告。截至2026年7月31日,公司通过集中竞...
北京市天元律师事务所 关于美年... 中访网数据  北京市天元律师事务所关于美年大健康产业控股股份有限公司2026年第三次临时股东会的法律...
活力中国调研行|3分钟完成千项... 未来的新能源汽车工厂是什么样的? “活力中国行”来到位于安徽合肥的蔚来先进制造新桥二工厂。在这里,蔚...
多一些换位思考就是最好的 (来源:衢州日报)转自:衢州日报  ■新闻速递:近日,湖北一位宝爸带着八个月大的宝宝搭乘飞机。他担心...
建行龙游支行助受灾企业复工 (来源:衢州日报)转自:衢州日报  本报讯 (记者 毛瑜琼 通讯员 黎冰) 近日,建设银行龙游支行精...