大模型的"工作台"到底是怎么装东西进去的
创始人
2026-08-25 22:23:45

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

你有没有想过这样一个问题:当一个语言模型需要把某个信息"记在心里",以便一会儿灵活地拿出来用的时候,这个信息是怎么"住进"它脑子里的?

这不是一个无聊的问题。2026 年,一组研究者(Gurnee 等人)发现了一件挺有意思的事:语言模型的内部,存在一些方向,模型可以"读出"这些方向上装的内容,就像一个可以对外汇报的工作台。更关键的是,当任务要求模型灵活使用某个信息时,这个信息在工作台上就会变得更"显眼"。这个发现被称为"可言说的工作空间"。

但这篇论文追问了一个更深的问题:这个信息是怎么被"放"进工作台的?

大部分人第一反应会觉得,这肯定有个"门卫",任务一旦需要这个信息,门卫就把它放进来。这个直觉太自然了,自然到有工程师已经真的照着这个思路去设计系统了:外部控制器监测模型的"犹豫程度"(专业说法叫下一词熵),一旦超过阈值就往工作台里写东西;还有团队干脆训练了一个门控网络,专门负责把信息路由进工作台。

这篇论文的结论是:这个"门卫"根本不存在,至少不存在于大家以为的那个位置。

真正发生的事情,用论文标题的话讲,是"被收集,而非被批准"(gathered, not admitted)。信息不是被一个决策者放进已经在那儿等着的位置,而是被注意力机制像伸手一样,从别的地方拽过来的。这个区别听起来微妙,但它彻底改变了我们理解模型"思考"的方式。

门卫假设:一个听起来太合理的直觉

先说说这个"门卫"假设到底长什么样。

想象模型在处理一段话,比如一段用日语写的文章,然后被问"这段话是什么语言"。按照门卫假设,答案(日语这个概念)其实从一开始就"坐"在模型将要回答的那个位置上,在每一层都在那儿待着,只是平时被锁住不让读取。当任务需要用到它的时候,某个门打开了,这个已经存在的东西终于可以被"看见"。

这个假设的吸引力在于,它跟"工作空间"这个词本身完全贴合。工作空间里有"内容",内容需要被"放进去",放进去这个动作意味着之前有个决定的过程。这是语言的自然联想,几乎不需要论证。

问题是,研究者们用了一种叫雅可比透镜*的工具去检验这个假设,发现完全不是这么回事。

雅可比透镜:一种分析工具,把模型某一层的中间状态,通过一个针对该层专门计算出的线性映射,直接转换成最终输出层的形式,从而"偷看"模型在中间某一步到底在想什么概念。

用这个透镜去看模型处理前面提到的日语段落时,早期层(靠近输入的那些层)里几乎侦测不到"日语"这个概念的踪迹,即便任务马上就要问语言是什么。真正让这个概念变得清晰可见的,是模型中间深度的一个特定区间。论文测出来,这个区间内的信号强度,至少比区间之外的浅层高出 17 倍。

这就好比你怀疑自己家有个管家,任务一来就把你要的东西从储藏室拿出来摆到桌上。但实际调查发现,储藏室根本没这个东西,是有人跑到隔壁邻居家,现拿现取,然后端到你桌上的。储藏室是空的,东西是运过来的,不是解锁出来的。如果真有个"提前存好、按需解锁"的储藏室,你应该在储藏室的任何一层都能摸到那件东西的影子,只是摸不清楚而已;但论文测出来的是,储藏室压根没有信号,信号是空降在中间某一层才突然出现的。

显眼和存在,是两码事

这里要先讲清楚论文里最重要的一个区分:可见性*和可获得性*不是一回事。

可见性:某个概念在雅可比透镜读出来的排名有多靠前,排名越靠前说明这个概念在当前表示里越"抢眼"。

可获得性:不管透镜读出来排名如何,这个信息是不是客观上已经存在于模型的内部状态里,能不能被一个训练出来的探测器直接解码出来。

论文设计了一个精巧的实验框架,叫 JGateBench,围绕同一段文字设计了五种不同的任务指令,分别叫自动、报告、灵活、控制、给定。

这五个任务共享完全相同的上下文段落,区别只在于最后问的问题不一样。比如自动任务只是让模型续写文章,报告任务问这段文字是什么语言,灵活任务要求模型把语言代入一张符号对照表算出对应符号,控制任务问的是一个跟语言毫无关系的格式类问题(比如段落里有没有问号),给定任务则是给模型一个假的语言(不是真实语言),让它同样去查表算符号。

之所以要设计"给定"这个任务,是因为光对比"灵活"和"控制"会有个混淆:灵活任务既要模型自己判断出语言,又要套用查表这个操作;控制任务两者都不需要。这样比较出来的差异,说不清楚到底是"判断语言"这件事更难,还是"套用操作"这件事更难。给定任务把"套用操作"这部分单独拎出来(模型不用自己判断语言,直接告诉它),这样"灵活减去给定"就能干净地反映出"需要自己判断语言"这一件事到底带来了多大差异。

结果发现,控制任务里,模型的准确率是 94%,跟灵活任务一模一样,说明这两个任务对模型来说难度相当,不是谁更容易谁更难的问题。可是透镜读出来的可见性,灵活任务比控制任务高出 0.089(用百分位排名衡量),这个差距在四个不同的模型家族上都存在,说明这不是巧合。

同时,用一个训练好的探测器直接去解码模型内部状态里到底藏没藏着"这段话是哪种语言"这个信息,结果发现,无论是哪个任务,这个信息都能被解码出来,包括那个完全用不上语言信息的控制任务,准确率能达到随机猜测基线的 6.4 到 9 倍。

这就是"可见性"和"可获得性"分道扬镳的地方。信息其实一直都在,哪怕任务根本用不着它;但只有当任务真正需要灵活运用它的时候,它才会在透镜下变得格外显眼。

这有点像你办公桌抽屉里其实一直放着一支红笔,不管你今天要不要改稿子它都在那儿(可获得性),但只有你真的打算用红笔改东西的时候,你才会把它从抽屉里拿出来摆在桌面最显眼的地方(可见性)。抽屉里有没有笔,和笔有没有被摆到桌面上,是两件不同的事。如果不做这个区分,你可能会误以为"抽屉里根本没有笔",仅仅因为你平时看不到它摆在桌上。

谁在搬运:注意力,而不是"多层感知机"

既然不是解锁,那这个信息到底是怎么从"存在但不显眼"变成"存在且显眼"的?

论文给出的答案是:注意力机制把它从别处搬运过来的。

要理解这一步,得先说说 Transformer 模型内部大概是怎么工作的。模型每一层通常包含两个模块:一个叫注意力(attention),负责让不同位置的信息互相"看一眼"、互相传递;另一个叫多层感知机(MLP),只对当前这个位置自己的信息做加工,不会跟别的位置交换信息。

多层感知机(MLP):模型每层里独立处理单个位置信息的模块,不具备在不同位置之间搬运内容的能力,只能"就地加工"。

这个结构上的区别至关重要,因为它意味着,如果某个概念的显眼程度是靠"搬运"实现的,那这个功劳一定归注意力,不可能是 MLP。论文正是顺着这条线索去查的。

实验设计叫"活体移植式修补"(activation patching):找两段不同的文字(比如一段日语文章、一段西班牙语文章)分别喂给模型,在某一层某个位置,把处理西班牙语那次跑出来的内部状态,硬生生替换掉处理日语那次跑出来的对应状态,然后看模型最后读出来的答案会不会因此偏向西班牙语。如果偏了,说明这个位置这个层的信息确实是决定答案的关键。

结果非常清楚:在中间深度那个窗口区间里,把注意力模块的输出拿去替换,能有效地把答案"带偏";把 MLP 模块的输出拿去替换,完全没用,甚至是负效果,数值上是整个测试网格里最负的一格,而且在四组不同的文本配对下都稳定地表现为负数。

这就像你想知道快递包裹里的东西是从哪儿运来的。你分别去检查快递员(注意力)的车和收货点本地的加工车间(MLP)。结果发现快递员的车里确实装着从外地运来的货,而本地加工车间只是在原地打包整理,根本没往外跑过。如果你只看本地车间,你会误以为这个包裹的东西是本地凭空长出来的;但一查快递员的车,货源就清清楚楚了。

而且这个"搬运"是跟任务需求挂钩的,不是随便什么时候都在搬。论文对比了灵活任务和控制任务在同一个位置的搬运强度,灵活任务的搬运量是控制任务的 30.3 倍,两者的置信区间完全不重叠。也就是说,同样的段落放在那儿,只有当任务真的需要用到这个信息时,注意力才会卖力气去搬;不需要的时候,顶多是漫不经心地捎带一点。

论文进一步分解发现,搬运效果的大头(约 85%)来自注意力输出本身,不是全部,因为在非线性网络里,各个组件的效果不能简单相加,精确切分需要另一种叫路径修补*的方法,这篇论文没有做。

路径修补:一种比普通活体移植式修补更精细的因果分析方法,能够追踪信息具体沿着哪条计算路径传递,而不只是判断某个整体模块是否重要。

这扇窗户有两条边

既然是个"窗口",那它就应该有边界:窗口之下会发生什么,窗口之上又会发生什么?论文对这两条边界都做了专门测量,而且测量方式很讲究。

先说下边界。论文发现,如果把"移植手术"做得太浅(在很靠前的层就动手),移植进去的信息会在后续层里逐渐消失,到了后面读出来的时候几乎完全找不到了。具体数字是:在某一层移植进去的信息,追踪到几层之后几乎归零(数值从 0.0048 起步,几乎等于没有);再往深挪几层动手,能存活下来大约一半;再往深挪,基本上就能完全存活。

论文认为最可能的原因是"重新推导":因为手术只改了查询位置(模型将要给出答案的那个位置)附近的信息,原始段落本身没有被动过手脚。如果手术做得太浅,后面还有很多层可以重新"回头看"原始段落,把被篡改的值又重新算一遍纠正回来。这就好比你偷偷把某人钱包里的现金换成假钞,如果他马上就要花钱,可能没发现;但如果他先把钱包放回口袋,过一会儿又拿出来仔细数了一遍钱,他大概率会发现不对劲,然后按记忆里的真实金额重新认定。手术做得越浅,留给模型"回头核对"的机会就越多,篡改就越容易被冲刷掉。

不过论文很坦诚地说,这只是他们更倾向的一种解释,不是已经证实的结论。要真正证实,需要把原始段落在手术之后彻底遮住,不让模型有机会重新核对,这个实验他们没有做。

再说上边界。当手术做得足够深(接近模型输出层)时,效果不再是"轻推答案往某个方向偏一点",而是变成"彻底替换掉整个计算"。论文测出来,在这个深度区间,虽然被替换后的答案跟着"移植来源"走的比例确实很高,但模型解决任务本身的准确率已经暴跌到不到 20%,说明这已经不是"信息被搬运"了,而是"整个后半段计算被强行接管了"。这是两回事:前者是我们想研究的搬运机制,后者只是暴力覆盖。

论文很小心地把这两种情况区分开,还专门设计了一个"干扰项对照"公式,用来排除"手术把任务彻底搞砸,答案变成随机乱蒙"这种情况被误判为"信息被成功搬运"的可能。

这个窗口跟别的模型是不是通用的?

到这里,一个自然的疑问是:这个"中间深度窗口"是不是只在这一个模型上碰巧成立?

论文专门在另一个完全不同架构、不同厂商的模型上重复了这个实验,结果发现,虽然两个模型的层数不一样(一个 64 层,一个 62 层),但如果按"相对深度"(层数除以总层数)来看,这个窗口出现的位置几乎一致,都落在整个网络深度的 55% 到 66% 这个区间里。

这个一致性挺让人意外的。两个模型的架构、参数量、训练数据可能完全不同,却在"信息该在哪个相对深度被搬运到位"这件事上表现出高度相似的规律。这提示着,可能不是某个具体模型学出来的巧合结构,而是 Transformer 这类架构在处理这类任务时,某种更本质的、跟深度比例挂钩的计算节奏。

论文还试了第三个模型,结果这个模型本身在需要"灵活运用"信息的那类任务上表现就不太好(只有 61% 的准确率),导致整个窗口分析测不出干净的结果。作者诚实地承认,这不是对"窗口存在"这个结论的反驳,而是说明这套检测方法本身需要一个"起点准确率足够高"的模型才能用,就像你没法用一把生锈到断裂边缘的尺子去精确测量长度。

一个方向,承载了部分答案

发现了搬运的存在,论文又往前追问了一步:这个被搬运过来、变得显眼的信息,真的对模型最终给出的答案有影响吗,还是仅仅"看起来很显眼"但其实是个摆设?

这是个很关键的追问,因为可见性这个指标本身,只是"透镜读出来某个概念排名靠前",它并不天然等于"这个概念真的左右了模型的决定"。

论文做了一个巧妙的实验:既然可以用透镜把某个概念对应的方向从模型内部状态里"抠"出来,那就试试把这个方向从内部状态里减掉(专业说法是"投影去除"),看看模型的行为会不会受影响。

结果是:去掉这个方向之后,原本因为"移植手术"而产生的错误答案倾向,削弱了 19% 到 46%。作为对照,随机挑一个方向去掉(但控制去掉的幅度跟真实方向相同),效果几乎为零;去掉一个跟任务无关的"陪衬概念"方向,效果也几乎为零;而去掉真正的目标概念方向,效果显著,并且即便把其他 19 个候选概念的方向也都正交化处理掉,这个效应依然稳固存在。

这个对照设计做得挺讲究的,四组结果里两组是"空的"(随机方向、陪衬方向),两组是"实的"(目标方向、正交化后的目标方向),这样才能把"效应确实来自这个概念本身"和"随便动一下内部状态都会有点影响"区分开。

不过论文也很老实地承认,去掉这个方向之后,至少还有一半的效应残留在模型里没被解释,说明模型的最终决策不完全靠这一个方向,还有别的东西在起作用,这部分论文没有进一步追踪。

一个扎心的方法论警告

论文里有一节专门讲了个挺让人后背发凉的发现,虽然是个"负面结果",但对整个研究领域可能影响不小。

研究者们发现,在那个关键的搬运层上,把注意力模块的输出替换成来自另一段文字的版本,透镜读出来的显眼程度会大幅偏向那段"别的文字"的语言,偏移幅度是模型自身原本语言信号的 4.9 倍。听起来这应该是个很强的效果吧?

但当他们真正去看这个替换有没有让模型的最终答案改变时,结果是:80 组测试里,只有 1 组答案真的变了。而同一层的整体内部状态(不局限于注意力模块)做同样的替换,80 组里有 29 组答案变了。

这意味着什么?意味着"透镜读出来的信号偏移量有多大",跟"这个信号对最终答案有多大影响",根本不是一回事。

论文进一步测了三个不同的模型组件,它们让透镜读出的信号偏移幅度彼此相差不到 12%(几乎一样大),但它们对模型最终答案margin(领先优势)的实际影响,却相差 7.4 倍。

这个发现的分量在于,现在有不少安全性、可解释性的研究,喜欢直接拿透镜读出来的排名变化当作"这个组件对模型行为有多重要"的证据。这篇论文用一个对照实验说明,这种做法是有风险的:同样大的透镜信号变化,背后可能对应着天差地别的实际行为影响。

这就好比你去医院验血,报告单上写着某项指标"轻度异常""重度异常",听起来数字差异挺大。但如果没有临床医生进一步判断这个指标异常到底会不会引发实际症状,单看报告单上的数字标签,你没法真正知道这对身体到底意味着什么。指标的变化幅度和它的实际后果,需要分开验证,不能划等号。如果不做这层区分,你可能会把"报告单上数字变化最大的那一项"当成"最该担心的病因",结果搞错了重点。

论文自己承认的局限

这篇论文的态度挺难得的一点是,它反复强调自己排除的只是"信息一开始就坐在查询位置、只是被锁住"这一种具体假设,并没有完全排除"某种门控机制"的存在,只是这个门控如果存在,大概率是作用在"搬运的路线"上,而不是作用在"查询位置本身"。

论文观察到,在那个关键搬运层,注意力放在原始段落上的注意力权重,对任务需求的敏感程度,大约是其他非关键层同类头部的 1.9 倍(取中位数比较)。这暗示着,或许真正的"门"藏在"要不要往回看段落、看多用力"这个环节里,而这篇论文并没有把这条路线彻底摸清楚。

另外,论文测量的机制层面结论主要集中在一个主力模型和一个语言识别任务上,跨模型、跨任务的验证相对有限;而且论文只是定位了"搬运"这一步,搬运之前信息到底是怎么在段落里被计算、被编码出来的,论文完全没有触碰,坦率地把这块留成了"未定位"的黑箱。

后续的路怎么走

这篇论文本身建立在 Gurnee 等人 2026 年提出的"可言说工作空间"概念之上,那篇原始工作已经观察到有注意力头在不同位置之间搬运信息,但没有把"需求变化"和"搬运量变化"这两件事系统地关联起来测量,也没有把"信息刚被安装"和"信息能不能存活到读出时刻"这两个时间维度分开看,这篇论文正是在这两处做了补充。

论文里也提到了一批相关方向的工作:关于注意力头如何在事实性问答里把属性信息搬运到预测位置的研究,关于某些注意力头专门负责"复制"上文提到过的名字的研究,以及关于函数向量(一种压缩后的任务表示,由少数注意力头负责搬运)在演示学习场景下的因果作用的研究。这些工作共同勾勒出一个方向:注意力头承担着模型内部"跨位置信息中转站"的角色,这篇论文的贡献在于,把这个中转行为和"任务是否真的需要这份信息"直接挂上了钩,证明了搬运量本身会随需求增减,而不是一个固定不变的背景过程。

写在后面

读完这篇论文,最触动我的其实不是"工作空间没有门卫"这个结论本身,而是论文在方法论层面的那种近乎苛刻的自我审视。

它专门用一整节篇幅去讲一个不起眼的技术细节:如果任务模板设计得不对称(比如某个任务的提示词里天然带有答案标签,另一个任务没有),会人为制造出 26% 的虚假效应,而且方向恰好符合研究者原本的预期。作者说这是他们自己踩过的坑,踩过之后才加了程序化检查去防止它。这种"我们差点被自己的实验设计骗了"的坦白,比任何漂亮的结论都更让人信服这篇论文的可靠性。

还有一个细节值得单独说说:论文发现,同一个"显眼程度"指标,用两种不同的数学计算方式去衡量(一种是百分位排名,一种是对数化的排名),测出来的"效应最强的那一层"竟然能相差整整 15 层。这说明连"用什么尺子量"这件事本身,都会系统性地扭曲你看到的现象。这提醒我,任何一个"我们发现了 X 现象"的论文结论背后,都值得多问一句:如果换一把尺子,这个现象还在吗?

论文最后留下的那个开放问题也挺勾人:如果真正的"门"藏在注意力该不该往回看段落这个环节里,那这个门到底是怎么被训练出来的,它会不会在不同任务、不同语言之间表现出系统性的偏好差异?这个问题,论文没有答案。

Q&A

Q1:这篇论文说的"工作空间没有门卫"具体是什么意思?

A:论文发现,语言模型并不是在一个固定位置提前放好某个信息、然后靠一个"门"决定要不要显示出来,而是在中间深度的某个特定层,由注意力机制现场把信息从别处搬运过来,搬运量会随任务是否真的需要这个信息而变化。这个搬运过程比"提前存好、按需解锁"更符合实测数据。

Q2:为什么说透镜读出来的信号变化不能直接当作组件重要性的证据?

A:论文测了三个不同的模型组件,它们让透镜读出的显眼程度变化幅度几乎一样(相差不到 12%),但对模型最终答案的实际影响却相差 7.4 倍。这说明信号变多大和真正起多大作用,是两件不能划等号的事情,直接拿信号变化当重要性证据容易得出错误结论。

Q3:这个"中间深度窗口"在不同模型上是不是都一样?

A:论文在两个完全不同架构、不同厂商的模型上都测到了类似现象,虽然两个模型总层数不同(64 层和 62 层),但按相对深度比例看,窗口位置几乎重合,都落在整个网络深度的 55% 到 66% 之间,说明这可能是某种跨架构的共性规律,而不是单个模型的偶然巧合。

相关内容

热门资讯

中国南海新收复的岛礁大盘点 中...  中国南海新收复的岛礁大盘点:  南海诸岛  南海诸岛位于中国海南岛东面和南面海域,包括西沙群岛、东...
中国租下澳港口99年 中国为何... 中国租下澳港口99年:日前,北领地行政长官Adam Giles宣布,将澳洲北部最大港口达尔文港99年...
清华大学博士后工资解密 博士后...  博士后(Postdoctoral),是指在获得博士学位后,在高等院校或研究机构从事科学研究的工作职...
刘强东前妻龚小京曝光 龚小京资...  刘强东前妻龚小京曝光:  刘强东前妻龚小京曝光,传闻刘强东有一个儿子。刘强东跟奶茶妹妹领证结婚了,...