资讯
Sierra Open-Sources Hyper-τ-Bench, a Benchmark for Agent Construction
📋总体概括
Sierra于2026年9月8日宣布开源hyper-τ-bench,一个长时程基准,专门衡量AI编程智能体能否构建出可用的客服智能体。测试结果显示,最强的自动化配置在保留评估任务上仅通过23.9%,而一名工程师搭配前沿模型的参考组合通过率达82.2%,差距接近60个百分点。这一基准标志着评估范式从「智能体执行任务」转向「智能体构建智能体」,为具身智能体之外的软件智能体能力提供了可复现的硬指标。
⚡关键信息
- ▸Sierra于2026年9月8日开源hyper-τ-bench,专注长时程智能体构建评估
- ▸基准核心任务:让AI编程智能体构建一个能实际运行的客服智能体
- ▸最强自动化配置仅通过23.9%的保留评估任务
- ▸人类工程师搭配前沿模型的参考组合通过率达82.2%,差距近60个百分点
- ▸前作τ-bench诞生于2024年,评估重点已从「当智能体」转向「造智能体」
🔥犀利点评
23.9%对82.2%,这个近60个百分点的鸿沟撕碎了「AI程序员替代人类」的叙事幻觉。让智能体去构建另一个智能体,是比写代码片段难得多的元任务,它暴露的正是当前智能体在长时程规划、状态管理和端到端交付上的系统性短板。Sierra作为客服智能体公司亲自下场定义考卷,既是开源贡献,也是变相抬高行业门槛——考卷我出,你们慢慢追赶吧。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文 →