在最新一期的No Priors播客中,AI推理领域知名研究者、OpenAI研究科学家Noam Brown提出了一系列引发行业深思的观点。他指出,当前主流的模型评估方式存在严重缺陷,可能导致对AI真实能力的误判。Brown强调,模型性能不应被简化为单一分数,而应被视为随计算资源投入动态变化的曲线。
Brown以OpenAI最新模型5.5为例,解释了传统Benchmark测试的局限性。他指出,新模型在发布初期因表面分数提升不明显而引发质疑,但实际使用中却展现出显著优势。问题根源在于现有评估体系未控制推理计算预算——模型思考时间越长,表现越好,但这一关键变量在传统测试中被忽视。他建议采用成本曲线替代单点分数,通过展示模型性能随Token消耗或时间投入的变化趋势,更准确地反映模型真实能力。
这位AI研究者将当前评估方式形容为"坏均衡"。他观察到,行业普遍依赖横向对比不同模型在固定Benchmark上的得分,这种惯性导致所有参与者明知缺陷却不愿改变。Brown呼吁建立新均衡:用横轴表示计算资源投入,纵轴表示模型表现,通过可视化成本曲线实现更科学的评估。他特别指出,在网络安全等关键领域,模型能力随预算增加持续提升的现象尤为明显,现有评估框架已无法适应技术发展。
讨论延伸至AI安全评估领域,Brown揭示了一个被忽视的核心问题:现有风险评估框架多形成于GPT-3时代,默认模型能力固定不变。但现代模型的能力实质是计算资源的函数——投入10美元与1000万美元预算,模型能完成的任务存在天壤之别。他强调,安全评估必须考虑不同预算场景下的模型表现,否则可能低估潜在风险。这种评估方式与模型快速迭代的发布周期形成矛盾,导致无人真正探索过现有模型的性能极限。
在具体应用层面,Brown分享了用AI构建扑克求解器的实验。他发现,从5.2版本开始,模型已能显著加速研究进程,但仍需人类引导。最新模型虽能独立完成部分任务,但在提出创新性算法方面仍显不足。这个案例印证了他的观点:AI正在改变研究方式,但尚未实现完全自主的递归式自我改进。他特别指出,数学难题Erdős单位距离猜想的解决证明,现有模型在足够预算下已具备突破性能力,只是尚未被充分挖掘。
对于多智能体协作的未来,Brown将其类比为人类文明的演进。他指出,当前AI模型如同短命个体,无法像人类那样通过世代知识积累实现指数级进步。要释放AI的真正潜力,必须建立大规模协作机制,使模型能在持续积累的知识基础上协同工作。这种"协调式复利"状态,将成为下一代AI系统的关键特征。
在实践建议方面,Brown鼓励用户重新评估AI工具的应用场景。他以税务文件解析等任务为例,说明现代模型在专业领域的辅助价值已超过部分人类专家。但他同时警示,路由层优化等新技术仍需接受预算约束检验——多个模型协作的系统未必优于单个模型深度思考,关键在于控制总计算资源投入。这场对话揭示,AI领域正面临评估体系重构的紧迫需求,而打破现有惯性需要整个行业的共同行动。
