资讯

腾讯混元:已专项优化Hy4 preview“复杂任务下的长思考、过度自我验证”等问题

36氪快讯·2026/9/7 09:50:21🔗 原文

📋总体概括

腾讯混元与WorkBuddy联合团队针对Hy4 preview模型在复杂任务中暴露的「长思考、过度自我验证」问题进行专项优化并全量上线。公告称通过Benchmark指标与人工评测双重监控,优化版本在任务效果不损失的前提下,显著降低了任务轮次及输入输出token消耗。这本质是对模型推理效率与成本的修复,也折射出 Agent 场景下过度推理已成为影响实际商用的现实痛点。

关键信息

  • 腾讯混元与WorkBuddy联合团队针对Hy4 preview的「长思考、过度自我验证」问题完成专项优化并全量上线
  • 优化采用Benchmark指标与人工评测双重监控方式验证效果
  • 官方称在不损失任务效果的前提下,显著降低了任务轮次及输入输出token消耗
  • Hy4 preview为首发接入WorkBuddy的模型,优化源于用户与开发者反馈

🔥犀利点评

说白了,这是给自家模型打补丁:推理模型爱「想太多」,token烧的是用户的钱和耐心。能承认问题并修复值得肯定,但公告通篇没有给出token降低的具体比例和对比数据,靠「显著」「不损失效果」这类形容词撑场面,说服力打折。Agent落地的胜负手恰恰是单位任务成本,建议下次直接晒账单。

本文由本站自动聚合,以下为原始来源:前往 36氪快讯 阅读全文