资讯

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

虎嗅·2026/9/5 11:44:39🔗 原文

📋总体概括

硅星人Pro借鉴开发者Simon Willison自2024年沿用至今的「自行车鹈鹕」SVG测试传统,设计了一套「你画我猜Benchmark」,用1350张图对各代模型进行横评,结果显示GPT-6以微弱优势险胜。这类测试表面是玩笑,实际考察模型将文字意图转译为结构化代码与空间布局的能力,已从社区调侃演变为观察新模型代际进步的保留节目,甚至引发模型公司是否针对性优化的猜测。

关键信息

  • 媒体借鉴Simon Willison 2024年开创的SVG画图测试传统,做成系统性Benchmark
  • 评测共生成1350张图像,规模远超此前单人随手工测试的做法
  • GPT-6在该基准中险胜,说明头部模型在视觉转译能力上差距已很小
  • 「自行车鹈鹕」测试从玩笑演变为新模型发布后的固定考察环节

🔥犀利点评

拿SVG画鹈鹕当Benchmark,看着像行为艺术,其实是聪明的平民化评测:题目开放、无法靠背题库、一次输出就能暴露模型的空间推理与代码功力。但1350张图得出「GPT-6险胜」的结论也得警惕——画风审美本无标准答案,评的就是个印象分。真正值钱的不是排名,而是让普通人用一道菜价成本看穿模型代差,这比刷榜的合成基准诚实多了。

本文由本站自动聚合,以下为原始来源:前往 虎嗅 阅读全文