资讯

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

虎嗅24小时·2026/9/5 11:44:39🔗 原文

📋总体概括

硅星人Pro模仿开发者Simon Willison自2024年延续的『自行车鹈鹕』SVG绘画测试传统,自制了一套『你画我猜Benchmark』,通过1350张生成图像对多个模型进行横向评测,结果显示GPT-6以微弱优势胜出。这一原本带有玩笑性质的测试,如今已成为新模型发布后社区观察其真实能力(尤其是指令理解与视觉表达能力)的保留节目,甚至有用户怀疑模型公司是否已针对该测试做过专项优化,折射出民间评测与官方跑分之间的张力。

关键信息

  • 『自行车鹈鹕』SVG测试由开发者Simon Willison于2024年起反复使用,成为评测新模型的社区传统
  • 硅星人Pro自制『你画我猜Benchmark』,共生成1350张图像进行横向对比
  • 评测结果显示GPT-6以『险胜』姿态排名第一,各模型差距很小
  • 该测试看似玩笑,实际考察模型的指令理解与图像表达能力
  • 有用户认真排查模型公司是否针对鹈鹕测试做过专项优化,说明民间评测已影响行业

🔥犀利点评

一只鹈鹕骑自行车能火三年,恰恰暴露了行业尴尬:官方跑分越来越好看,用户却只能靠画SVG来验证模型到底行不行。1350张图的笨办法虽然土,但比刷榜诚实——『险胜』这个词本身就说明头部模型在具象表达上没有代差。真正值得警惕的是,当玩笑测试变成基准,厂商难免开始『应试』,测试的参考价值也就进入倒计时。

本文由本站自动聚合,以下为原始来源:前往 虎嗅24小时 阅读全文