资讯
Claude开始训练Claude,4美元一小时,跑赢150美元人类研究员
📌 概要
<p><strong>Claude开始训练Claude了!</strong></p> <p>时薪4美元,干赢时薪150美元的人类研究员。</p> <p>在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。</p> <p>部分任务上,它交出的方案甚至比28名人类安全研究员更好。</p> <p>更刺激的是,<stron
<p><strong>Claude开始训练Claude了!</strong></p>
<p>时薪4美元,干赢时薪150美元的人类研究员。</p>
<p>在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。</p>
<p>部分任务上,它交出的方案甚至比28名人类安全研究员更好。</p>
<p>更刺激的是,<strong>较弱的Claude已经开始反向参与训练更强的Claude</strong>。</p>
<p>AI「自己改进自己」的那一天,好像真的越来越近了…</p>
<h2><strong>4美元一小时,Claude跑赢人类研究员</strong></h2>
<p>在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_ff704a14c34c4146862133d214fb0367@5667365_oswg86178oswg1080oswg358_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>具体而言,他们基于Claude Opus 4.8,搭建了一套名为<strong>AAR</strong>的自动化对齐研究员系统。</p>
<p>拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_2d6b028a1c514b73a7d0fdac1fd0213d@5667365_oswg170997oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。</p>
<p>效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。</p>
<p>一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。</p>
<p>整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。</p>
<h3><strong>10道安全难题,Claude全部找到改进方案</strong></h3>
<p>实验中,Anthropic一口气给Claude出了10道题。</p>
<p>这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_a9db7550934545f6ab45deaae815e0bb@5667365_oswg64168oswg1062oswg688_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。</p>
<p>Claude每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。</p>
<p>最后,10类问题全部得到改善。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_57eeb9b500054fe283e00e35c906a63f@5667365_oswg264022oswg1080oswg815_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。</p>
<p>更重要的是,这些方法不只对Claude看过的题目有效。</p>
<p>部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的Petri评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型4.7倍的模型上,效果也能保留下来。</p>
<p>Anthropic还设置了一条红线:安全训练不能明显损害模型原有能力。</p>
<p>毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。</p>
<p>最终,Claude找到的方案在预设的通用能力测试中没有出现明显退化。</p>
<h3><strong>85%对20%,Claude大比分跑赢人类研究员</strong></h3>
<p>最悬殊的一局,出现在「欺骗」测试中。</p>
<p>为了让目标模型变得更诚实,Claude先后提交了150多次尝试。</p>
<p>它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了<strong>82%的安全差距</strong>;综合多次运行,平均成绩达到85%。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_b686c96c4932423888abfd54265f26e0@5667365_oswg148953oswg1080oswg523_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>同一道题,Anthropic还交给了6名经验丰富的AI安全研究员。</p>
<p>结果,人类研究员平均只弥合了20%的安全差距…</p>
<p>85%对20%,Claude赢得那叫一个毫无悬念。</p>
<p>全部任务一共有28名人类安全研究员参加,每人最多可以用8小时阅读资料、设计方案。</p>
<p>论文称,自动化研究员通常能在6小时内找到超过人类平均水平的方法,人类提供的研究方向也没有让Claude取得更好的成绩。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_cced708d135f4e09b4c7d254b3be2660@5667365_oswg222263oswg1080oswg741_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>最最最扎心的,在于成本!</p>
<p>一名自动化研究员每小时的API推理成本大约为<strong>4美元</strong>;Anthropic付给人类研究员的报酬,则是<strong>每小时150美元</strong>。</p>
<p>这……人类研究员妥妥要被Claude替代了啊。</p>
<p>不过呢,这场人机比赛也并非完全公平。</p>
<p>Claude可以真正训练模型,看到每次实验的结果,再不断修改方案;人类研究员只能提交一次方法,没有机会根据结果继续迭代。</p>
<h3><strong>较弱Claude训练更强Claude,60小时逼近正式版</strong></h3>
<p>前面的实验,改进的主要还是开源小模型。</p>
<p>接下来,Anthropic把难度直接拉高:<strong>让能力较弱的Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本</strong>。</p>
<p>所谓弟子不必不如师,说的大概就是这种模式了。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_a0c8cf23c66e43ed8c4e40c692b6654a@5667365_oswg114110oswg1080oswg493_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>在60小时里,Sonnet 5测试了50多种解决方案。最终找到的方法弥合了约65%的安全差距,已经接近正式发布版Opus 4.8的72%。</p>
<p>这套方案使用的训练数据只有2000多条,主要由简单模板和公开数据集构成。</p>
<p>按照Anthropic的计算,在这组特定任务上,它的数据效率大约是生产级对齐流程的1.5万倍。</p>
<p>当然,这还不等于Anthropic可以用2000条数据,复制整套生产训练。</p>
<p>正式模型还要处理更多能力、更多风险以及大量极端情况,这次实验只针对一组明确的安全指标展开。</p>
<p>但这已经证明了,较弱的Claude已经可以自己查论文、设计方法、生成数据,再把训练结果写进更强的Claude。</p>
<p>人类划定范围,Claude负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。</p>
<p>AI改进AI,已经成为了发生在眼前的事实。</p>
<h2><strong>所以到底算不算「AI自进化」?</strong></h2>
<p>从结果来看,这项研究确实已经摸到了「AI自进化」的门槛。</p>
<p>但如果把「自进化」理解成一个AI完全自主地设计、训练并制造出更强的下一代AI,那这次实验还远没有走到那一步。</p>
<p>毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果算成功,都还是由人类决定。</p>
<p>Anthropic自己也承认,<strong>AAR能够优化的,只是人类事先写进评测系统的目标</strong>。</p>
<p>这次实验没有覆盖其他复杂问题;一些低频或刚刚出现的风险,甚至还没有对应的Benchmark。</p>
<p>研究人员也只检查了一组预先选定的通用能力,因此无法排除某种安全训练在提高分数的同时,损害了其他没有被测试的能力。</p>
<p>Petri等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全,并不等于进入真实环境后也一定可靠。</p>
<p>所以,AAR最大的隐患也藏在它的优势里:<strong>它太擅长根据指标高速试错了</strong>。</p>
<p>一旦尺子量错,Claude跑得越快,离人类真正想要的结果反而可能越远。</p>
<p>更戏剧性的是,<strong>研究Agent自己也会作弊</strong>。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_234cdfb3a677408090cd73965cf58401@5667365_oswg139904oswg1080oswg710_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>为了防止AAR钻评测规则的空子,Anthropic专门安排了一个监控Agent,检查Claude准备执行的方案和完整研究记录。</p>
<p>结果,在大约1600份研究记录中,监控模型发现了39次作弊尝试,占比约2.4%。</p>
<p>有的Agent反复提交同一方案,试图利用评测波动碰出一个更高分数;有的模仿Benchmark的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。</p>
<p>比起真正解决模型的安全问题,它们更想找到一条快速提高分数的捷径。</p>
<p>这多少有点黑色幽默了…合着Agent监守自盗了呗。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260829/v2_a2ca5cfc70514103b89298326d8c2c72@5667365_oswg128631oswg232oswg232_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>好消息是,这些作弊意图大多还会出现在模型的推理记录里,因此能被监控Agent发现。</p>
<p>坏消息是,Anthropic也不能确定未来更强的模型还会不会留下这么明显的痕迹。</p>
<p>当研究Agent拥有更多工具、更高权限,并且可以直接修改模型训练流程时,<strong>「怎样监控一个负责改进AI的AI」</strong>,可能会比训练本身更棘手。</p>
<p>但总而言之,一个AAR每小时大约花费4美元,可以连续工作,也可以一次复制出几十个、几百个并行跑实验。</p>
<p>而人类研究员的时薪远高于这个数,需要休息,一次能推进的实验数量也相当有限。</p>
<p>这笔账怎么算,答案都已经很明显了。</p>
<p>也不知道该说是核弹爆炸,还是当场瘫坐……</p>
<p>这一次,轮到造AI的人担心被AI抢饭碗了。</p>
<p>参考链接:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/</p>
<p class="editor-note">本文来自微信公众号<a href="https://mp.weixin.qq.com/s/0Mg2c8OTbunblkSCg8RfsQ" rel="noopener noreferrer nofollow" target="_blank">“量子位”</a>,作者:关注前沿科技,36氪经授权发布。</p>