ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

OpenAI新基准FrontierScience出炉:AI科研能力大检验,距一流科学家尚远

时间:2025-12-18 00:34:19来源:快讯编辑:快讯

人工智能在科研领域的表现再次成为焦点。OpenAI近日推出全新基准测试FrontierScience,通过物理、化学、生物三大领域的博士级难题,检验AI系统能否突破知识记忆层面,实现真正的科学推理能力。这项测试揭示了一个关键结论:即便在标准化考试中表现优异,当前AI距离成为独立科研工作者仍有显著差距。

该基准测试包含700余道文本型题目,分为竞赛赛道与研究赛道两大模块。竞赛赛道聚焦100道短答案题目,要求在严格约束条件下完成精准推理;研究赛道则设置60个开放式子任务,涵盖量子电动力学、合成有机化学等前沿方向,需在无标准答案的情况下构建完整逻辑链条。测试特别设置"黄金组"160道题目作为核心评估样本,其中研究赛道题目由45位领域专家设计,采用10分制评分标准,7分以上视为通过。

测试结果显示,GPT-5.2在竞赛赛道取得77%的正确率,研究赛道得分25%,暂居领先地位;Gemini 3 Pro以76%的竞赛成绩紧随其后。但深入分析错误类型发现,前沿模型普遍存在推理断层、概念混淆和计算偏差等问题。例如在量子物理题目中,某模型因混淆"自旋轨道耦合"与"角动量守恒"导致全盘错误;有机化学合成路径规划中,另一模型因忽视立体选择性反应条件而设计出不可行方案。

测试设计团队刻意排除现有模型能够解答的题目,使得评估标准更为严苛。为确保评分客观性,研究赛道采用GPT-5作为自动评分系统,通过对照专家制定的评分细则进行逐项判定。尽管这种设计可能对OpenAI自家模型形成额外挑战,但开发团队强调这有助于更真实反映模型在未知领域的适应能力。测试数据表明,模型思考时间与准确率呈正相关,在给予充分推理时间的情况下,部分题目的正确率可提升15-20个百分点。

这项基准测试也暴露出当前评估体系的局限性。OpenAI坦言,现有测试框架将复杂科研过程简化为可控题目,如同"用显微镜观察森林",难以衡量模型提出创新假设的能力,也无法评估其处理多模态数据或指导实验操作的实际价值。测试团队正在开发扩展题库,计划纳入更多跨学科场景和真实实验数据,同时建立长期追踪机制,观察AI系统如何切实辅助科研人员提升工作效率。

更多热门内容
鸣镝智能网卡:国产FPGA技术领航,网络测试迈入精准纳秒新纪元
硬件级并行处理:数据包在 FPGA 内部以并行流水线方式处理,不依赖 CPU,时延极低且高度可预测可编程性:逻辑可通过固件更新来修改和扩展,今天测试网卡,明天升级支持新协议 精准时钟控制:FPGA 内部…

2026-04-14

深圳圣大奥维:十年磨剑聚焦智慧物联,音视频管控平台创新引领行业未来
自成立以来,圣大奥维始终聚焦音视频管控赛道,以技术创新驱动业务发展,在智慧物联行业深耕不辍,积累了丰富的技术经验和行业认知。圣大奥维的C-AIoT平台正是这一趋势的积极响应,它将人工智能技术与物联网架构深度融…

2026-04-14

R-AI网络协同进化:以结构复制驱动全球化智能扩张新范式
不同于依赖短期刺激的传统模式,R-AI 通过构建网络协同结构,实现了从个体能力到系统能力的跨越。这种基于底层逻辑的自增长属性,使得 R-AI 具备了更强的韧性与扩张质量。执行力往往是决策链路中最脆弱的一环,R…

2026-04-14