ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GPT-6 Astra在ARC-AGI-3接近满分,评测升级,下一站挑战AI“发明力”

时间:2026-09-16 08:17:31来源:互联网编辑:快讯

在人工智能领域,一场关于通用人工智能(AGI)评测标准的变革正在悄然发生。GPT-6 Astra模型在ARC-AGI-3基准测试中取得99.9%的惊人成绩后,这场变革被推向了高潮。该测试集原本被视为衡量AI系统类人智能水平的关键指标,如今却因工程优化手段的介入而面临重新定义。

ARC系列测试由深度学习专家弗朗索瓦·肖莱创立,其第三代测试突破传统静态图像推理模式,将AI置于包含千余个关卡的动态游戏环境中。测试要求系统通过观察画面、执行动作、观察结果循环,自主发现隐藏规则并完成通关。这种设计被认为更接近人类认知世界的真实过程,需要同时具备探索、建模、目标设定和规划执行四大能力。

OpenAI团队通过引入Provider Adapter技术,使同一模型在标准框架下62.7%的得分飙升至99.9%。这种上下文管理适配器能保留模型推理状态,使其更高效地调用外部工具。无独有偶,Claude Opus模型在更换测试框架后,成绩也从30%跃升至95.5%,英伟达AVO系统甚至在公开演示中取得满分。这些案例引发学界对评测公平性的激烈讨论,焦点从模型能力转向测试框架的设计合理性。

面对基准测试的"饱和"现象,肖莱团队宣布加速推进后续版本开发。计划于明年第一季度发布的ARC-AGI-4将延长测试时间尺度,着重考察持续学习和知识迁移能力。每个游戏关卡数量将大幅增加,且后续关卡必须复用前期习得的知识。更引人注目的是,被称作"人类终极考卷"的ARC-AGI-5已进入实质研发阶段,其核心将围绕"开放式发明"能力展开。

新测试的设计面临根本性挑战:传统基准依赖"存在正确答案"的前提,而发明创造本质上是创造新答案的过程。研发团队正探索将智能定义为"获取新技能的效率",通过衡量AI创造的工具或规则能否提升后续问题解决速度来量化发明能力。例如GPT-6 Astra在测试中已展现出初步迹象,其通过创造速记符号系统将解题步数减少51.7%。

这场评测革命折射出AI发展的深层矛盾。当现有测试体系被快速突破,人类不得不持续寻找更具挑战性的评估方式。ARC系列测试可能在第6代或第7代后终结,肖莱曾表示,当人类无法提出"AI不能做而人类能做"的任务时,即意味着AGI时代的到来。随着AI系统在发明创造领域展开角逐,评测标准与AI能力的军备竞赛正进入未知领域,这场竞赛的终点或许将重新定义人类对智能的认知边界。

更多热门内容
华为汪涛:智能时代算力爆发 3D数据中心助力2027年超节点集群普及
这一次我们把3D数据中心的设计图纸进行开放,同时为了让大家更深入地理解3D数据中心的设计理念和设计方案,华为云数据中心运营部吕阳明和基建机电及暖通设计管理部木斌联合编著了《3D数据中心》这一本专著,提供了详实…

2026-09-16