ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GPT-6 Astra跑分数据频变动,OpenAI深陷“作弊”争议漩涡

时间:2026-09-06 14:00:22来源:互联网编辑:快讯

近日,OpenAI旗下新一代模型GPT-6 Astra的发布引发了一场不小的风波。外媒报道称,在官方博客上线前后,该模型的多项评测数据出现了异常波动,引发了外界对其评测数据真实性的质疑。

据披露,Astra的幻觉率在发布初期显示为4.2%,但仅数小时后便被调整至2.0%,随后又恢复原值。与此同时,竞争对手Anthropic旗下模型Fable 5.1在数学评测中的成绩也被发现从87.8%被调低至78%,最终回升至83%。更引人注目的是,ARC-AGI-3评测得分从媒体提前获取的98.6%飙升至官方宣布的99.99%。

面对质疑,OpenAI发言人回应称,这些调整属于“消除噪点的常态修正”,并解释同一模型在不同系统配置下可能产生显著差异。这一说法引发了关于“Benchmaxxing”现象的讨论,即通过反复调整测试条件以获取最高分,并将最佳成绩作为模型性能的代表。

与此同时,OpenAI发布的Astra提示词指南揭示了该模型的另一面。文档中详细列出了Astra的多个缺陷,包括对模糊指令的过度敏感、容易因外部指令冲突而卡死,以及在代码任务中存在冗余测试等问题。为解决这些问题,OpenAI建议开发者在系统提示中强制加入行动偏好指令,并提供了调试提示以帮助识别指令冲突。

在语言风格方面,OpenAI甚至主动为Astra“去油”,列出了一份“AI泔水词”黑名单,禁止使用如“delve into”“foster”等高频行话,以及“值得注意的是”“这不是A而是B”等机械句式。这一举措旨在使Astra的输出更加自然、精炼,更接近人类表达方式。

尽管面临数据争议,OpenAI的技术发展步伐并未停滞。据技术博主透露,OpenAI内部已进入递归自我改进(RSI)的早期阶段,模型之间相互协助训练,形成了一条从Sol到Astra,再到Doug和Bel的迭代链条。内部人士披露,Astra之后的下一代模型将直接以“AGI”命名,具备人类级通用理解力和全领域专家表现,预计将于11月中旬前后发布。

与此同时,竞争对手Anthropic也在紧锣密鼓地筹备新模型。内测系统卡信息显示,该公司正在开发一款名为Model 2的新模型,以及一个自称“RSI”的项目,显然是针对OpenAI的AGI战略而来。随着两大科技巨头的正面交锋,人工智能领域的竞争正进入白热化阶段。

更多热门内容
AMD发布Threadripper Halo Station工作站:96核处理器加持,可本地运行超T级大型模型
IT之家 9 月 4 日消息,AMD 高级副总裁、计算与图形事业部总经理 Jack Huynh 在 IFA 2026 上公布了Threadripper Halo Station 工作站。这一“个人超级计算机…

2026-09-06

无界动力张玉峰:具身智能5年后或达成年人劳动水平,人形机器人将进家庭
IT之家 9 月 6 日消息,据新浪科技今日消息,无界动力创始人兼 CEO 张玉峰近日在 2026年亚布力论坛夏季年会透露,如果将具身智能与智驾行业做类比,当前的具身智能大约处于 2019 年前后的自动驾驶…

2026-09-06

星动纪元席悦:人形机器人元年已至,从专用迈向通用转型加速
他指出,今年和去年相比最大的变化,人形机器人已经在各个领域开始试点验证。 此外,不管国内还是国外,家庭场景作为具身智能最终的终局场景,虽然目前还没有进入批量落地阶段,但已经有大量企业提前开展技术储备与研发工…

2026-09-06