2026/9/15 12:07:36

AI能自己变强吗:一场让大模型自己考试、自己判卷、自己复习实验

AI能自己变强吗:一场让大模型自己考试、自己判卷、自己复习实验 你有没有想过一个问题一个每天都在跟外部世界打交道的AI到底有没有从这些经历里学到东西现在的大语言模型早就不只是聊天机器人了。它们会调用工具、执行代码、跟各种环境反复交互产生大量的行为数据。听起来这应该是个宝库,毕竟人类进步的一大动力就是从经验里吸取教训。但奇怪的是,几乎所有评测AI能力的基准测试,考的都是它在某一个瞬间的水平,像一张静态的成绩单,却从来不问一个更根本的问题:这个模型能不能靠自己积累的经验,变得比昨天更聪明字节跳动Seed团队联合M-A-P、TokenWave.AI搞了一个新基准专门回答这个问题,名字叫S?Gym。这个名字里藏着三个S开头的能力:Self-Testing自我测试、Self-Judging自我评判、Self-Improvement自我提升。他们想搞清楚的是,AI能不能像人一样,先自己动手试一试再回头判断哪些做对了哪些做错了最后把这些判断转化成真正更好的行为。这事儿说起来简单做起来却处处是坑。学习这件事到底难在哪杜威和科尔布这两位教育学家早就说过一个道理经验本身不会自动变成知识只有经过反思和重新应用,经验才能沉淀成能力。卡尔·波普尔讲科学进步时也是类似的逻辑:进步靠的是不断把猜想拿去接受检验暴露错误。这套逻辑放到AI身上同样成立。一个模型光是攒了一堆交互记录是没用的,它得先自己去试出一些有信息量的证据然后判断哪些行为成功了、为什么成功最后把这些判断真正转化成下一次决策的改变。这三步环环相扣任何一环掉链子整个链条就断了。问题是经验可以用完全不同的方式被记住。最直接的方式是**上下文学习**In-Context Learning简称ICL不改变模型参数直接把过去的交互记录塞进当前的对话上下文里让模型看着这些记录做决策,把之前的对话历史原封不动地塞进上下文里,让模型下次决策时能看到这些记录。这种做法保留了细节但会把上下文塞得满满当当。另一种方式更聪明一点叫**摘要记忆**Summary Memory把冗长的交互历史压缩成简洁的策略规则、常见错误和下次改进方向类似于把一本书读薄成几条笔记,先让模型自己把冗长的交互历史提炼成几条策略规则、几个常犯的错误、几条下次该注意的方向。这就像看完一本厚厚的教材后自己整理出一页复习笔记。信息密度更高了但也可能在压缩的过程中丢掉关键细节。第三种方式最激进,直接对模型参数动手叫**参数训练**Parameter Training把筛选过的高质量交互样本转化为监督微调数据直接更新模型权重让经验永久地刻进模型里。相当于不是记笔记而是直接把知识刻进脑子里,理论上更持久,但风险也最大,万一学进去的经验本身是错的呢这三条路子各有各的算盘。原始历史保留细节但占地方,摘要节省空间但依赖判断力,训练能长久保留但可能把错误也一起学进去了。研究团队想搞清楚:这三条路到底哪条真的能让AI变强,又是在什么条件下能变强。实验场是七款小游戏S?Gym没有选那种复杂的现实任务,而是设计了七款文字类游戏,分别考察不同的能力象棋式的隐藏规则推理、扫雷式的约束满足、一个叫Nullify的数值消除游戏、俄罗斯方块式的空间规划、贪吃蛇式的长时程控制、植物大战僵尸式的资源分配、还有一个叫信任演化的多智能体博弈游戏。每款游戏都设计了两套配置一套宽松的**探索配置**Exploration Configuration条件相对宽容的环境设置比如更小的棋盘、更弱的惩罚、更多试错机会用于让模型积累经验,允许模型多试几次、犯几次错也没关系还有一套严格的**评估配置**Evaluation Configuration条件更苛刻的环境设置用来检验模型积累的经验是否真的管用而不是单纯记住了某个具体场景,规则更狠用来真正检验模型学到的东西能不能扛得住实战。这个设计其实藏着一个很关键的用心。如果探索和评估用的是同一套规则模型完全可以靠死记硬背某个具体局面来作弊而不是真正理解了策略。就像老师出考试题如果原题和平时作业一模一样考的就不是理解力是记忆力。S?Gym故意让评估环境比探索环境更严格,棋子从12个变成22个扫雷从有两条命变成一碰雷就死这样模型必须真正提炼出可迁移的规律才能在更难的场景里站得住脚。一整套流程分成五步探索、判断、整合、更新、评估。模型先在宽松环境里自由试错积累一批带着自我打分的交互记录然后自己判断哪些是好经验、哪些是坏经验接着按不同路径原始历史、摘要、训练把这些经验整合起来再用整合后的经验更新自己或者更新它能看到的上下文最后拿到严格的评估环境里接受检验。这里有个很巧妙的设计细节。在探索阶段,环境真实的验证结果也就是那个标准答案是不告诉模型的,模型只能靠自己给自己打分。这样做的目的是把模型自以为学到了什么和模型实际上学到了什么这两件事分开来看,如果这两者对不上,就说明模型的自我判断能力本身有问题,而不是它学习能力有问题。这就像一个学生做完模拟题后不给标准答案只让他自己估分然后事后再拿真实分数一对比就能看出这个学生到底有没有自我评估的眼光。上下文记忆够用吗七个模型的表现分化研究团队测试了包括GPT-4o、GPT-4.1、o3-mini、Gemini-2.5-Flash、Gemini-2.5-Pro、GPT-5.5、Gemini-3.5-Flash在内的七款主流模型,让它们分别用原始历史和摘要记忆两种方式积累经验然后在30轮探索过程中每隔3轮拿到严格环境里考一次。结果挺有意思的没有一款模型是全能冠军。在原始历史模式下Gemini-3.5-Flash在象棋任务上表现最强在贪吃蛇和信任演化任务上进步幅度最大而GPT-5.5则在扫雷、Nullify、俄罗斯方块这些脆弱任务上领先在植物大战僵尸上进步最猛。换成摘要记忆模式排名又变了GPT-5.5变成了象棋、Nullify、俄罗斯方块的第一名Gemini-3.5-Flash则继续保持在植物大战僵尸和信任演化上的领先。这说明一件挺反直觉的事模型本身有多强跟它能不能有效利用自己的经验是两回事。更值得琢磨的是摘要记忆和原始历史谁更好用这件事。答案不是一边倒的。Gemini-2.5-Flash用摘要记忆之后扫雷任务的持续进步指标从0直接冲到7.79植物大战僵尸从24.4飙到238.5。GPT-5.5的象棋成绩也在摘要模式下从0.47涨到16.84。这说明当经验能被压缩成一套稳定可复用的规则时摘要记忆确实管用。但反过来的例子也不少。GPT-5.5在植物大战僵尸上摘要模式反而让进步指标从548.5跌到33.2。Gemini-3.5-Flash的象棋进步指标从12.28直接归零信任演化任务从200跌到55。这背后的逻辑其实挺清楚的。有些游戏靠的是一套抽象策略比如信任演化博弈里对方一直背叛就跟着背叛这种规则一旦提炼出来就能到处套用。但有些游戏,比如扫雷和贪吃蛇成败取决于当前这一步棋盘上具体哪个格子是安全的、蛇头前面是不是有障碍物,这种信息高度依赖具体状态一旦被压缩成几句笼统的建议反而丢了最要命的细节。**摘要记忆不是万能药它是一种有选择性的压缩机制。**这就好比你去徒步旅行前看攻略。如果路线固定、地形规律性强,比如沿着河走就不会迷路那看一份精简攻略就够了不需要背下每一步的岔路细节。但如果是那种地形随时在变的丛林,比如今天下过雨这块地就是泥潭、那棵倒下的树昨天还没倒,你光记一句注意脚下根本没用你需要的是逐条具体的现场记录。如果这时候还硬要压缩成几条通用建议反而会让你在关键岔路口做出错误判断,因为那些真正决定生死的细节早就在压缩的过程中被丢掉了。参数训练能治病但也能致命上下文层面的记忆终究是外挂真正让人好奇的是,如果直接把经验刻进模型参数里,会发生什么研究团队拿了一个80亿参数的模型Qwen3-8B做实验让它经历20轮连续的训练检查点第0轮是原始模型第1到19轮是用探索经验持续微调后的版本。每一轮都拿到严格环境里跑一次七款游戏的评估。结果堪称一部跌宕起伏的剧情。在信任演化任务上训练效果好得惊人。分数从0一路涨到最高30分在19个更新检查点里有18个都超过了初始基线,平均分达到8.68。这说明博弈类任务里蕴含的策略确实能通过参数更新被稳定学进去。但象棋和贪吃蛇的表现就没这么给力了。象棋在大多数检查点都停留在0分只在最后一轮爬到了0.067,算是有微弱进步。贪吃蛇更是坐了过山车,在第8、12、15轮短暂达到1分之后又跌回0说明训练偶尔能发现一些好策略但没能把它稳住。扫雷、Nullify、俄罗斯方块这三款游戏在整个训练过程里干脆一分没涨过。研究者猜测可能是探索阶段成功案例太少不足以撑起一个有效的监督信号但这个猜想还需要更细致的轨迹分析来验证。最戏剧性的是植物大战僵尸。原始模型的初始分数是23分结果每一轮训练之后的分数都跌到了6分而且持续了整整19轮都没回升。**这意味着参数更新有可能把模型原本已经掌握的好行为直接覆盖掉。**这一幕让人联想到一件很朴素的生活经验。假设你原本已经能熟练地骑自行车了突然有人拿着一套新手教学视频逼你重新学一遍如果这套视频质量参差不齐甚至有几段教学动作是错的你原本流畅的骑车技能反而可能被这些错误示范污染,变得比学习之前更差。参数训练就是这样一把双刃剑,如果喂给模型的探索经验本身质量不高、或者探索环境和评估环境差异太大、又或者模型自我打分本身就不准那么这次重新学习很可能不是进步而是一场退步。自我打分靠谱吗这才是真正的瓶颈到这里就该问一个更根本的问题了模型给自己打的分,到底准不准研究团队做了一次大规模的核验覆盖七个模型、七款游戏、两种记忆模式一共98次运行、超过11万6千个交互步骤。他们把模型自己打的分和环境真实给出的验证分数逐条对比。结果显示,自我判断的可靠性参差不齐。植物大战僵尸、贪吃蛇、俄罗斯方块、扫雷、Nullify这几款游戏的事件一致性也就是模型判断这步是好是坏跟真实结果是否一致都还不错但这个高一致性很大程度上是因为大部分交互本来奖励就是零猜零蒙对的概率天然就高。真正能反映校准精度的是**归一化平均绝对误差**NMAE衡量模型自我打分的数值和真实奖励数值之间的偏差程度数值越低说明模型的打分越精准。俄罗斯方块和Nullify的NMAE很低说明模型不仅能判断对错连打分的力度都拿捏得比较准但植物大战僵尸的NMAE却是所有游戏里最高的尽管它的二元一致性看起来还不错。这说明一件挺微妙的事模型可能觉得这一步应该是有用的但对于这一步到底值多少分估计得离谱。象棋和信任演化是两个最惨烈的翻车现场。象棋的事件一致性几乎跟瞎猜差不多而且模型的**过度自信率**Over-confidence模型自己打了正分但环境实际给的是负分或零分的情况反映模型自我感觉良好但实际做错了特别高。这不难理解,象棋任务里模型要预测多枚棋子接下来的位置只要有一两个棋子的坐标猜错了整个答案就算失败但模型自己可能觉得我大部分都答对了应该给个正分这种局部正确和整体失败之间的落差恰恰是自我评判最容易翻车的地方。信任演化也是类似的情况一致性弱、误差大、过度自信率高。这些数据指向一个共同的结论**当奖励依赖于隐藏的动态过程、对手的策略、或者需要精确预测多个对象的状态时模型的自我判断能力就会明显下降。**而当奖励来自一个能立刻观察到的局部结果时自我判断反而相对可靠。更让人意外的是接下来这个发现。研究团队把探索过程切成一个个时间段逐段计算这段时间里的判断准确度然后看这个准确度能不能预测下一次评估时的分数提升。结果整体的相关系数只有-0.01左右几乎为零。也就是说**一个模型即使在某段时间里判断得特别准也不代表它在下一轮评估里就会表现得更好。**这个结果乍一听有点反常识但细想其实很合理。判断准只是第一步光是知道哪一步做对了是不够的还得知道为什么对、这个道理能不能用到别的场景、下次遇到类似情况该怎么调整策略。这就好比一个学生做完模拟题后能准确判断出哪几道题做错了但如果他不去分析错误背后的知识漏洞只是记住这道题我错了那下次换一道类似但不完全一样的题他大概率还是会栽在同一个坑里。**能识别对错和能把对错转化成可复用的策略是完全不同的两种能力。**摘要真的能提炼出有用的经验吗研究团队还专门扒出了一批具体的案例看看什么样的摘要真的管用什么样的摘要只是花架子。有几个成功案例挺说明问题。GPT-5.5在信任演化任务里摘要精准地提炼出当对方的收益结构一贯偏向背叛时就该持续背叛不要做无谓的合作试探这条规则直接带来了66.89的进步指标提升。o3-mini在俄罗斯方块里学会了同时观察当前方块和下一个方块测试不同的旋转方式优先消行保持棋面低平不留孔洞也带来了14.42的提升。Gemini-2.5-Flash在扫雷任务里总结出一套局部数字约束的推理规则比如扩展零区域、标记必然是雷的格子、揭开确定安全的格子让进步指标涨了25.49。但失败的案例同样典型而且失败的原因惊人地一致这些摘要说得都挺对但都太笼统了没法真正指导下一步的具体操作。GPT-5.5在植物大战僵尸任务里总结出优先生产阳光、早期布防、用坚果墙拖延时间、覆盖威胁车道这些建议单独拎出来看每一条都是对的但因为没有说清楚具体哪条车道现在最危险、当前阳光预算够不够所以实际执行起来分数反而从38.67跌到32.33。Gemini-3.5-Flash在象棋任务上生成了一份详细的规则摘要提醒自己记住每个棋子的移动规律提交答案前核实所有坐标结果实际对局里却直接输出了END颗粒无收进步指标暴跌33.27。**这些例子揭示了一个共同的道理一份好的摘要必须精确到能在新的具体场景里直接被执行而不是停留在正确却空洞的原则层面。**这让人想起职场里常见的一种现象。有的团队复盘会开完之后得出的结论永远是要加强沟通、要重视细节这些话听起来无懈可击但下次遇到具体问题的时候团队成员依然不知道该怎么办因为这些结论没有落到在什么场景下、遇到什么信号时、具体该做哪个动作这个颗粒度上。真正有用的复盘得像那份俄罗斯方块的摘要一样,同时看当前和下一个方块测试旋转角度优先消行每一步都能直接对应到下一次的实际操作而不是停留在要打得更好这种正确的废话上。写在后面读完这篇研究最触动我的不是某个具体的实验数字而是那个几乎为零的判断-改进相关系数。这个发现挺颠覆认知的,我们通常默认知道自己错在哪是变强的前提但这篇论文用数据说明知道错在哪和真正变强之间隔着一条巨大的鸿沟这条鸿沟不是靠更准确的打分就能填平的。还有一个细节值得单独说说植物大战僵尸那次训练崩溃初始23分掉到6分而且是持续19轮都没能恢复。这种一次训练就永久性损伤的现象某种意义上比那些没有进步的任务更值得警惕因为它说明参数训练这条路不是最差情况下原地踏步而是真的存在越训越差的可能性而且这种损伤是有惯性的不会自己修复。这让我想起一个可能有点跳跃但确实真实的联想:这跟人在遭遇一次重大失败后陷入某种思维定式、之后每次决策都被那次失败过度影响其实是同一种机制。模型如果把一次探索里质量不高的经验当成了普遍规律去学习它接下来的所有行为都会被这个错误的规律带偏而且很难靠自己纠正回来,除非有一个外部的、独立的信号能提醒它你学错了。这篇论文没有回答的问题恰恰是我觉得最值得继续追问的既然自我判断本身就不够可靠那AI要靠什么样的机制才能识别出自己判断错了这可能需要一种更高层的元认知能力,不仅要判断这一步做得对不对还要判断我判断这一步对不对的方法本身靠不靠谱。这听起来有点像套娃但恰恰是真正的自我改进绕不开的一层。QAQ1S?Gym是什么AS?Gym是字节跳动Seed团队联合M-A-P、TokenWave.AI推出的一个交互式基准测试专门用来评估大语言模型能否通过自我测试、自我评判把交互经验转化为真正的自我提升覆盖象棋、扫雷、俄罗斯方块等七款文字游戏。Q2摘要记忆和原始历史哪种方式让AI进步更快A没有绝对的答案取决于任务类型。当经验能被压缩成稳定可复用的策略规则时比如信任演化博弈、俄罗斯方块摘要记忆效果更好但当成败依赖具体状态细节时比如扫雷、贪吃蛇原始历史往往比摘要更管用。Q3AI能靠参数训练稳定变强吗A不稳定。实验中Qwen3-8B在信任演化任务上训练效果很好但在植物大战僵尸任务上出现了持续19轮的负迁移分数从23跌到6且没有恢复说明训练效果高度依赖任务、探索经验质量和自我判断的可靠性。