资讯
这个周末“首波测评”:OpenAI的GPT-6 Astra “几乎在所有方面”都表现“惊人的出色”
📋总体概括
OpenAI于9月3日发布GPT-6 Astra,48小时内早期测评呈现明显分化:模型在空间理解、机械操作与自主代理任务上成为迄今最强,测试者用它逐街重建曼哈顿与杭州、一天内做出12人联机游戏;但在写作上多名测试者认为不如前代,Artificial Analysis记录其在GDPval-AA v2经济价值基准上下滑约80个Elo。Astra定价为输入每百万token 10美元、输出50美元,是GPT-5.6 Sol的2.5倍,已通过ChatGPT各级订阅、API、Azure及AWS Bedrock推出。
⚡关键信息
- ▸OpenAI于9月3日发布GPT-6 Astra,Greg Brockman在发布简报中宣称AGI时代已经到来。
- ▸空间与代理能力突出:测试者在Unreal Engine逐街重建曼哈顿,另一人24分钟内用浏览器端3D库重建杭州全城。
- ▸衍生演示包括一天内完成的12人联机浏览器射击游戏,以及创下独立基准最高分、无声部进行错误的巴赫风格四声部合唱。
- ▸写作能力退步:Artificial Analysis记录Astra在44种职业的GDPval-AA v2基准上下滑约80个Elo,多名测试者明确批评。
- ▸Astra定价输入每百万token 10美元、输出50美元,为前代GPT-5.6 Sol的2.5倍,覆盖ChatGPT订阅、API、Azure和AWS Bedrock。
🔥犀利点评
这是一场精心编排的叙事转移:展示曼哈顿重建、自发对话的NPC和巴赫合唱,全是视觉冲击力拉满、难以量化验收的演示;而真正可测量的GDPval基准却下滑80个Elo,写作不如前代——本质是拿「看得见的惊艳」遮「测得出的退步」。再叠加2.5倍涨价和Brockman的AGI宣言,与其说是能力跃迁,不如说是在为涨价和下一轮融资预铺叙事。3D生成是亮点,但别被演示劫持了对通用能力倒退的审视。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →