资讯
我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜
📋总体概括
硅星人Pro模仿开发者Simon Willison自2024年延续的『自行车鹈鹕』SVG绘画测试传统,自制了一套『你画我猜Benchmark』,通过1350张生成图像对多个模型进行横向评测,结果显示GPT-6以微弱优势胜出。这一原本带有玩笑性质的测试,如今已成为新模型发布后社区观察其真实能力(尤其是指令理解与视觉表达能力)的保留节目,甚至有用户怀疑模型公司是否已针对该测试做过专项优化,折射出民间评测与官方跑分之间的张力。
⚡关键信息
- ▸『自行车鹈鹕』SVG测试由开发者Simon Willison于2024年起反复使用,成为评测新模型的社区传统
- ▸硅星人Pro自制『你画我猜Benchmark』,共生成1350张图像进行横向对比
- ▸评测结果显示GPT-6以『险胜』姿态排名第一,各模型差距很小
- ▸该测试看似玩笑,实际考察模型的指令理解与图像表达能力
- ▸有用户认真排查模型公司是否针对鹈鹕测试做过专项优化,说明民间评测已影响行业
🔥犀利点评
一只鹈鹕骑自行车能火三年,恰恰暴露了行业尴尬:官方跑分越来越好看,用户却只能靠画SVG来验证模型到底行不行。1350张图的笨办法虽然土,但比刷榜诚实——『险胜』这个词本身就说明头部模型在具象表达上没有代差。真正值得警惕的是,当玩笑测试变成基准,厂商难免开始『应试』,测试的参考价值也就进入倒计时。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 虎嗅24小时 阅读全文 →