资讯

谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样

驱动之家·2026/9/8 12:55:00🔗 原文

📋总体概括

SemiAnalysis发文指控谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3在AA榜单上的亮眼成绩存在过拟合,即针对评测集刷分,此前这两家在AI竞赛中落后于OpenAI和Anthropic,新模型却一度反超两家旗舰,引发质疑。Meta AI负责人Alexandr Wang回应称OpenAI同样如此,谷歌方面暂无回应。榜单刷分在AI圈由来已久,过去矛头多指向国产大模型,这次轮到硅谷巨头,暴露基准评测公信力的系统性问题。

关键信息

  • 分析机构SemiAnalysis指谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3存在过拟合,即针对榜单刷分
  • 两款新模型在AA榜单上一度超越OpenAI与Anthropic的旗舰大模型,而这两家此前长期落后
  • Meta AI业务主管Alexandr Wang回应质疑,称OpenAI也一样,谷歌方面未见回应
  • Wang是Scale AI创始人,Meta重金收购后执掌其AI业务,Spark为其主导产物
  • 榜单刷分在AI行业早非新闻,此前国产大模型是被指责的主要对象

🔥犀利点评

Wang的回应堪称教科书级的「你也一样」——别人作弊不能证明你没作弊。小模型在榜单上碾压数倍参数的旗舰,本就该 raise 红旗,SemiAnalysis的过拟合指控切中要害。真正的问题不是谁刷分,而是整个行业把Benchmark当营销素材,评测集早已被反复琢磨透。当刷分从国产模型的「罪名」变成硅谷巨头的常态,榜单这个裁判本身就该下岗重修了。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文