资讯
Can LLMs Engineer Their Own Agent Harness? ByteDance Seed’s HarnessDev Says Only 34 of 64 Changes Generalize
📋总体概括
字节跳动Seed联合SUTD、佐治亚理工等机构推出HarnessDev基准,首次评估LLM能否自主构建并演化Agent运行框架(harness),评分对象是模型搭建的可运行框架而非其给出的答案。6个创建者模型从0分种子起步,在5个基准、2207个任务上迭代演化。结果显示自建harness在写作与ML实验任务上可匹敌人类参考实现,但在代码与搜索任务上仍落后,且64项演化改动中仅34项能在保留任务上同方向泛化。
⚡关键信息
- ▸字节Seed联合SUTD、佐治亚理工、M-A-P、TokenWave.AI发布HarnessDev基准,评估模型自建Agent harness而非答案质量
- ▸6个LLM从0分种子出发,在5个基准、共2207个任务上通过执行反馈迭代演化自己的harness
- ▸自建harness在写作与ML实验类任务上达到人类参考水平,代码与搜索类任务仍有明显差距
- ▸64项演化改动中仅34项在保留任务上方向一致,说明过半改动是过拟合而非真泛化
🔥犀利点评
这个基准戳破了一个流行叙事:模型自己搭脚手架≠自我进化。2207个任务上看似跑通了,但64项改动只有34项能泛化,超过一半是对着测试集过拟合的投机修改——这和强化学习里reward hacking是一个味道。真正值得记住的是那个反差:写作和ML实验能追平人类,代码和搜索却掉队,说明模型擅长在自己熟悉的范式里缝框架,缺的是对未知执行环境的因果理解。工具自主化还早,先把泛化这关过了再说。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →