资讯
谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样
📋总体概括
SemiAnalysis发文指控谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3在AA榜单上的亮眼成绩存在过拟合,即针对评测集刷分,此前这两家在AI竞赛中落后于OpenAI和Anthropic,新模型却一度反超两家旗舰,引发质疑。Meta AI负责人Alexandr Wang回应称OpenAI同样如此,谷歌方面暂无回应。榜单刷分在AI圈由来已久,过去矛头多指向国产大模型,这次轮到硅谷巨头,暴露基准评测公信力的系统性问题。
⚡关键信息
- ▸分析机构SemiAnalysis指谷歌Gemini 3.8 Flash与Meta Muse Spark 1.3存在过拟合,即针对榜单刷分
- ▸两款新模型在AA榜单上一度超越OpenAI与Anthropic的旗舰大模型,而这两家此前长期落后
- ▸Meta AI业务主管Alexandr Wang回应质疑,称OpenAI也一样,谷歌方面未见回应
- ▸Wang是Scale AI创始人,Meta重金收购后执掌其AI业务,Spark为其主导产物
- ▸榜单刷分在AI行业早非新闻,此前国产大模型是被指责的主要对象
🔥犀利点评
Wang的回应堪称教科书级的「你也一样」——别人作弊不能证明你没作弊。小模型在榜单上碾压数倍参数的旗舰,本就该 raise 红旗,SemiAnalysis的过拟合指控切中要害。真正的问题不是谁刷分,而是整个行业把Benchmark当营销素材,评测集早已被反复琢磨透。当刷分从国产模型的「罪名」变成硅谷巨头的常态,榜单这个裁判本身就该下岗重修了。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →