让AI给自己出考题:科研计划训练里那个作弊漏洞
创始人
2026-09-09 20:14:40

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

2015年,AlphaGo还没出现,深度学习刚刚在图像识别上站稳脚跟。那时候没人会想到,十年后会有一群研究者认真讨论一个问题:能不能让AI自己学会写科研计划书。

这听起来有点荒诞。写一篇论文的实验设计、提出一个新方法,这本该是博士生熬夜苦想的事情,怎么就轮到机器来做了?但这正是眼下AI科学家浪潮里最棘手的一环。你可以让AI跑代码、算数学题,因为这些任务有明确的对错。可科研计划不一样,它没有标准答案。同一个研究问题,可以有十种不同的靠谱方案,谁也不能说哪个绝对正确。

这就是本文要讲的这篇论文,PaperGym,试图解决的核心矛盾。

科研计划为什么这么难训练

先说清楚一件事:现在训练AI最有效的方法叫强化学习,英文缩写RLVR

**RLVR**:全称是Reinforcement Learning with Verifiable Rewards,带可验证奖励的强化学习。简单说就是让AI反复尝试解题,每次尝试后都能得到一个明确的对错反馈,AI根据这个反馈调整自己。

这套方法在数学题和写代码上效果惊人。DeepSeek-R1能通过强化学习把推理能力练出来,靠的就是每道数学题都有唯一答案,程序跑起来能不能通过测试一目了然。

但科研计划这事,你没法这样判断对错。它更像是让一个人去设计一个实验,你说这个实验方案好不好,得看它逻辑是不是自洽,方法是不是有创新,实验设计是不是严谨,这些都是主观判断,不是简单的0和1。

那怎么办呢?聪明人想出了一个办法:既然论文本身就记录了真实的科研问题和对应的解决方案,那不如把论文拆解开,把里面的研究目标当成"考题",把方法和实验设计部分转换成"评分标准",也就是打分用的清单。这个清单在业内叫做rubric

**Rubric(评分细则)**:把一个复杂、主观的评价任务拆解成若干条具体、可打勾的标准,每一条判断是或否,最后汇总成分数。比如判断一份科研计划"是否提出了消融实验"、"是否说明了基线对比方法",这种细分标准就是rubric的一条。

这个思路听起来挺合理,用真实论文的方法部分当参考答案,用评分细则当裁判。问题出在哪儿呢?

作弊漏洞:从同一段文字里出考题和出答案

这里就是PaperGym这篇论文发现的一个大坑。

现有的做法,从Goel等人2025年的工作开始,大都是从论文的同一批内容里,既提取问题,又提取评分标准。这就好比老师出考卷时,把题目和答案参考都印在同一张纸上,只是字体换了一下,学生稍微读一读就能猜出答案的轮廓。

PaperGym的作者们做了个实验来验证这个猜测:他们把现有数据集里的题目和评分标准拿出来,问一个大模型,"这条评分标准能不能光靠题目本身就推断出来?"结果发现,现有数据集里11.90%到34.10%的评分标准,压根不需要看答案,光看问题就能猜个大概。

这意味着什么?

意味着AI在训练时可以走捷径,只要把问题换个说法重新表述一遍,就能骗到不少分数,而根本不用真正去设计一个有创新性的方案。这就像考试作弊时不需要偷看答案,只需要把题目本身重新抄一遍,凭着题目里藏着的提示词就能蒙对一半分数。

如果这个漏洞不修,会发生什么?训练出来的AI学会的不是"如何做好科研规划",而是"如何把问题复述得更像答案"。这种能力在实际科研场景里毫无用处,因为没人会给它现成的问题描述让它去套模板,真正的科研永远要从模糊的目标出发,自己想出方法。

PaperGym怎么解决:把论文切成四块,问题和答案从不同的地方来

PaperGym的解法说起来很直白:既然作弊的根源是问题和答案取材于同一段文字,那就让它们从物理上分开,来自完全不同的段落。

具体做法是把每篇论文拆成四个阶段:研究目标、研究背景、研究方法、实验设计。这个拆解过程用了一个叫做"映射-归约"的流程

**映射-归约(Map-Reduce)**:先把长文档切成小块分别处理(映射阶段),再把处理结果按类别汇总合并(归约阶段),是处理大规模文本常用的分治策略。

在映射阶段,用Qwen3-235B-A22B这个大模型逐段扫描论文,从每一段里挖出跟四个阶段相关的信息。在归约阶段,把同一阶段的碎片信息合并成一份连贯的摘要,避免重复和矛盾。

拆出这四块之后,研究问题只从"研究目标"和"研究背景"这两块生成,而参考答案只从"研究方法"和"实验设计"这两块生成。这样一来,出题人和判卷人手里拿的材料,天然就不重叠。

这就像考试改革,以前考卷和答案是同一份材料的不同摘录,现在改成了:考题只能参考课本前半部分讲的问题背景,答案必须依据课本后半部分讲的具体解法,两部分内容互不透露。学生就算把题目背得滚瓜烂熟,也猜不出后半部分到底写了什么具体的解题步骤。

效果立竿见影,用同样的检测方法一测,PaperGym自己构建的数据集PaperGym-20k的评分标准泄露率只有3.73%,比现有数据集的11.90%到34.10%低了三到九倍。

评分标准怎么来:两条腿走路,还要分维度

光是隔开问题和答案还不够,评分标准本身的质量也很关键。PaperGym在这里用了一个双源生成的策略。

对每一个训练实例,作者用DeepSeek-V4-Flash生成两组评分标准。一组叫"问题条件化标准",只看研究问题本身就能想出来的评价点。另一组叫"答案引导化标准",需要同时看问题和参考答案才能想出来的评价点。这两组标准合并起来,去掉意思重复的,再按重要性排序,最后留下每个实例十条最核心的标准。

为什么要两条腿走路?因为只从问题出发想标准,容易想得很泛,缺乏针对性;只从答案出发想标准,又容易把答案里的具体细节直接抄进标准里,造成新的泄露风险。两边结合,取长补短。

论文还专门做了个消融实验来验证这个设计的价值。如果只用问题条件化的标准,PaperGym-Innov基准上的得分从14.16掉到13.19;如果只用答案引导化的标准,掉到12.29。这说明两个来源都有独特的贡献,缺了任何一个都会拉低整体质量。

除了来源要多样,评分标准覆盖的维度也要够全面。作者观察到一个现象:现有数据集里,那些针对具体实例定制的标准,几乎只盯着"方法创新"这一个维度,而"实验设计"这个同样重要的维度,往往只用一套放之四海而皆准的通用规则去套,缺乏针对性。这就好比评价一篇论文,光看它的核心想法新不新,却不管它的实验是不是设计得严谨、对照组选得对不对。

PaperGym的评分标准里,方法维度占63.8%,实验维度占36.2%,两个维度都是针对每个具体问题量身定制的,不是笼统套用。

除了这些针对具体问题定制的"专用标准",PaperGym还保留了一套通用标准,覆盖完整性、具体性、合理性、效率和伦理安全这几个方面,这套通用标准借用了此前HealthBench等评分体系的成熟做法,用来兜底检查一份计划最基本的质量线。

评分标准用两次:先当"私教",再当"考官"

有了干净的问题和靠谱的评分标准,接下来的问题是:怎么把这份评分标准用到训练里去,把它的价值榨干?

现有的做法通常是把rubric压缩成一个单一的分数,每次AI生成一份计划,就打一个分,这个分数反过来去调整AI的参数。这个做法有个明显的浪费:明明评分标准里列了十条具体的检查项,最后却只留下一个笼统的数字,中间那些"哪条满足了、哪条没满足"的细粒度信息,全都被扔掉了。

这就好比老师批改一篇作文,明明按十个维度打了分,最后只在成绩单上写一个总分交给学生,学生根本不知道自己哪里写得好、哪里写得差,只能瞎猜着改。

PaperGym的解法是让同一份评分标准被使用两次,分两个阶段训练,这个思路被称为"以评分标准为中心的演化"

**On-Policy Self-Distillation(在策略自蒸馏,简称OPSD)**:让同一个模型同时扮演"学生"和"老师"两个角色。学生只看得到问题,自己生成答案;老师能看到问题加上额度信息(这里是评分标准),去评判学生刚生成的这些内容片段。学生通过缩小自己和老师判断之间的差距来学习,这个差距用一种叫JS散度的数学量度来衡量。

第一阶段用的正是这套OPSD机制。老师拿着评分标准这份"考纲",去看学生每一步写下的文字,给出更细粒度的指导;学生虽然看不到评分标准本身,但通过不断模仿老师基于评分标准做出的判断,慢慢把评分标准里蕴含的原则内化进自己的行为里。

这里有个细节值得说一下:老师看到的是评分标准,不是那个唯一的参考答案。为什么这么选?因为参考答案只是无数种合理方案里的一种,如果老师死死盯着这一个答案去教学生,学生会被引导去模仿这一种写法,输出会变得单一。而评分标准描述的是一整套评价原则,不限定具体怎么写,老师因此能保留更多种合理的写法给学生看,不会把学生的思路框死。

论文用一个消融实验验证了这个判断:如果把老师看到的信息换成参考答案,PaperGym-Innov上的得分从14.16掉到13.08;如果同时给老师看评分标准和参考答案,得分反而降到13.81,比只给评分标准还差。这说明单一答案的信息一旦混进来,会干扰更抽象的原则性指导,产生冲突。

第二阶段,评分标准换了个身份,从"私教"变成了"考官"。这时候用的是另一套强化学习算法,叫GRPO

**GRPO(Group Relative Policy Optimization,群体相对策略优化)**:让模型针对同一个问题生成多份候选答案(这里是8份),比较这一组答案里谁的评分标准得分更高,谁更低,用这种组内相对比较代替绝对分数,来计算每份答案该往哪个方向调整。

这个阶段里,一个冻结的模型副本充当裁判,对每份候选计划逐条核对评分标准里的十项标准,再核对七条通用标准(比如是否遗漏重要缺陷、是否有充分的论证、是否符合伦理),给出严格的二元判断,是或否,不给中间分。这些判断汇总成一个奖励分数,反过来推动策略模型往得分更高的方向调整。

奖励的计算方式是专用标准占70%权重,通用标准占30%权重,这个比例经过了专门的敏感性测试,7比3的配比在两个基准上都拿到了最高分。

为什么要先私教再考官,不能反过来吗

这个先后顺序不是随便定的,论文专门做了对照实验来证明这一点。

如果反过来,先做GRPO再做OPSD,会发生什么?在Qwen3-1.7B这个模型上,五个基准的平均分从27.81掉到25.77,掉了整整两分。在更大的4B和8B模型上,同样是反过来做效果更差。

原因得从"熵"这个概念说起。

**熵(Entropy)**:这里指的是模型输出的多样性程度。熵高,说明模型在同一个问题下能给出的答案形式比较丰富、不单一;熵低,说明模型的输出已经收敛到某几种固定套路上。

论文观察到,OPSD阶段会让熵持续上升,因为自蒸馏是在往模型里注入新知识,新知识会拓宽模型能想到的可能性。而GRPO阶段会让熵下降,因为它在鼓励模型往高奖励的方向收敛,收敛意味着选择变少。

如果一上来就用GRPO,模型还处在冷启动状态,生成的候选答案普遍质量不高,组内比较的信号里全是噪音,根本分不出谁真的更好,大部分训练资源都浪费在了不稳定的试错上。等到OPSD预热过后再上GRPO,模型已经具备了一批相对靠谱、多样的候选方案,组内比较才有意义,GRPO才能高效地把这批方案收拢到更优的方向。

这就像先让一个刚入行的年轻厨师跟着老师傅学一段时间的基本功和菜系原理,广泛地尝试各种做法,再让他去参加比赛,评委打分才有区分度,厨师也才知道该往哪个方向精进。如果直接把他扔进比赛现场,从零开始瞎试,大概率是浪费时间,因为他连基本的门道都没摸清楚,评委给的分数也没法反映真正的水平差异。

反过来做的话,就像让厨师先去打了一场比赛,凭着运气和有限的手艺胡乱应付,评委按这场比赛给出的反馈去"纠正"他,这时候纠正的基础本身就是歪的,后面再补基本功训练,已经很难把走偏的路子拉回来。

训练效果:小模型也能打赢更大的对手

说了这么多设计原理,效果到底怎么样?

论文用Qwen3系列的1.7B、4B、8B三个规模的模型做了完整实验。结果显示,OPSD加GRPO这套两阶段方案,在每一个规模、每一个测试基准上都拿到了最高分,比单纯监督微调、单独用OPSD、单独用GROP,以及反过来做的顺序,全都要好。五个基准的平均分,1.7B模型提升了5.56分,4B模型提升了5.04分,8B模型提升了4.81分。

最让人意外的一个结果是,经过PaperGym训练的Qwen3-8B,在ResearchQA这个基准上跑到了73.48分,超过了体量远大于它的Kimi K2.6的73.19分。

| 模型 | RubricHub Science | ResearchQA | PaperGym-Innov | PaperGym-Design | 平均分 |

| Qwen3-1.7B(基础) | 31.84 | 55.14 | 10.76 | 8.58 | 22.24 |

| Qwen3-1.7B(两阶段训练后) | 34.90 | 65.93 | 17.38 | 12.45 | **27.81** |

| Qwen3-8B(基础) | 46.07 | 66.65 | 18.69 | 17.03 | 33.74 |

| Qwen3-8B(两阶段训练后) | 49.41 | **73.48** | 24.47 | 21.88 | **38.55** |

顺带一提,监督微调这个最传统的做法,效果反而不太行。在8B模型上,监督微调后的平均分从33.74掉到32.79,是负增长。原因不难理解,监督微调是让模型死记硬背那唯一一份参考答案,一个研究问题明明可以有很多种合理方案,死记硬背只会把模型的输出压缩成一种固定套路,反而丢失了灵活性。

数据量的影响:越多越好,但增速会放缓

论文还专门测了训练数据量对效果的影响,用GRPO在Qwen3-4B上跑,数据量从0.5千条一路加到15千条。

结果是个典型的边际递减曲线:PaperGym-Innov上的提升幅度从16.12涨到19.21,PaperGym-Design从13.89涨到16.96,两条曲线都符合一个幂函数的形状,增长趋势明显,但涨幅会逐渐变缓。这说明数据质量和数量的确都有价值,但不是无限加数据就能无限提升,边际收益会慢慢降下来。

用什么模型来生成评分标准也很关键。论文测试了把评分标准的生成模型换成能力更弱的Qwen3-8B,结果得分从14.16掉到12.16,掉幅比替换其他环节都大。这说明评分标准的质量才是整个流水线里最要命的瓶颈,因为判断一份科研方案好不好需要相当精细的学术判断力,强弱模型之间在这一点上的差距被放大得最明显,反倒是抽取信息这种相对机械的步骤,对模型能力没那么敏感。

三方对比实验:把变量锁死,只换数据

为了证明这套方法真正的价值来自于数据本身而不是碰巧凑出来的结果,作者还专门做了一个三方对比实验。

固定同一个训练配方,只把数据换成PaperGym-20k和另一个公开数据集RubricHub Science,训练出两个模型,再拉上一个完全没训练过的基础模型,三个一起放到一个独立的、跟训练数据完全无关的基准上做比较,让几个大语言模型充当裁判打分。

结果是用PaperGym-20k训练的模型在综合评分上以58.1%的胜率碾压另外两个,RubricHub训练的模型只拿到28.2%,未训练的基础模型垫底13.7%。三个模型的训练流程完全一致,唯一的差别是训练数据,这个巨大的胜率差距说明数据构建这一步的价值,比训练算法本身更值得重视。

写在后面

读完这篇论文,最让我意外的一点,不是那个两阶段训练的算法设计,而是数据泄露这个问题本身有多容易被忽视。

大部分人在设计训练数据时,本能地会想"评分标准要贴合内容",却很少有人会追问一句:这份贴合的评分标准,是不是也贴合到了可以从题目本身反推出来的程度?这个陷阱不是那种一眼能看穿的错误,它藏在"看起来很合理"的数据构建流程里,只有真正去测一下泄露率,才会发现11%到34%的标准根本不需要看答案。

这让我想到一个更普遍的问题:任何用大模型给大模型出题、打分的训练场景,都可能藏着类似的漏洞,只是换了形式。如果评价标准和任务描述来自同一批语料,评价者本身又是个语言模型,那模型钻语言表达的空子去骗分,几乎是必然会发生的事,只是被发现得早晚而已。

另一个值得琢磨的地方是熵的变化曲线。论文发现OPSD阶段熵持续上升,GRPO阶段熵持续下降,这个现象被拿来解释为什么先后顺序很重要。这其实揭示了一个更根本的张力:探索和收敛,永远是互相拖后腿的两件事,一个阶段负责把可能性打开,另一个阶段负责把可能性收窄,谁先谁后,直接决定了最终能不能找到真正的好答案,还是过早收敛到一个局部最优。

科研计划生成这件事,本质上考的是创造力和严谨性的平衡。一份好的科研计划,既要有让人眼前一亮的新想法,又要经得起细致的推敲。这两者常常互相打架,太保守的方案没有价值,太激进的方案立不住脚。PaperGym这篇论文没有直接回答"AI能不能真正有创造力"这个更大的问题,但它至少提供了一套更干净的训练环境,让我们能更清楚地看到,在没有作弊漏洞的情况下,AI能把这份平衡拿捏到什么程度。

Q&A

Q1:PaperGym解决的核心问题是什么?

A:解决科研计划生成任务缺乏可验证奖励的问题,通过把研究论文拆成问题和评分标准两部分来构建可训练的环境,同时避免评分标准可以直接从问题里推断出来的作弊漏洞。

Q2:PaperGym如何避免评分标准泄露?

A:把论文拆成研究目标、研究背景、研究方法、实验设计四个阶段,问题只从前两块生成,评分标准只从后两块生成,让问题和答案的信息来源完全不重叠,泄露率降到3.7%。

Q3:为什么PaperGym的训练要先做OPSD再做GRPO?

A:OPSD阶段能提升模型输出的多样性,为后续训练打好基础;GRPO阶段再在这个基础上收敛到高质量方案。反过来做会导致GRPO在冷启动阶段陷入不稳定探索,实验证明顺序颠倒会让平均分下降超过2分。

相关内容

热门资讯

俄罗斯总统新闻秘书:俄方期待恢... 当地时间9月9日,俄罗斯总统新闻秘书佩斯科夫向媒体表示,就调解俄乌冲突,目前没有已经成型的路线图,只...
【智库声音】澎湃新闻 | 蒋媛... (来源:上观新闻)近期,关于AI泡沫、智能体越狱并实施自主攻击的更多讨论和细节披露,考验着资本市场的...
瑞士一百年水电站爆炸致两人重伤 中新社北京9月9日电 伯尔尼消息:瑞士警方称,该国南部提契诺州一座水电站当地时间9日上午发生爆炸,已...
*ST卓然称可能触及重大违法强... (来源:北京商报)北京商报讯(记者 马换换 李佳雪)9月9日晚间,*ST卓然(688121)披露公告...
亚太清洁能源培训学院在北京成立 中新社北京9月9日电 (记者 王梦瑶)APEC(亚太经合组织)清洁能源创新实践专题研讨会9日在北京举...