ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

27个顶尖语言模型同台竞技:无偏见烹饪考试如何评出真“厨神”?

时间:2026-09-03 01:20:40来源:互联网编辑:快讯

语言模型在开放式任务中的表现如何评判?这一问题长期困扰着人工智能领域。传统评测方式依赖人类或AI裁判的主观判断,但不同个体口味差异大,AI裁判也可能存在偏见,导致评测结果难以客观公正。近期,一项名为FlavourBench的评测系统提出新思路:通过一套可被计算机精确执行的烹饪算法替代人工评判,为语言模型在开放式任务中的表现提供客观评分。

FlavourBench的核心是名为Epicure的烹饪算法系统。该系统将1790种食材映射到300维空间,通过计算食材间的相似度、搭配度及饮食限制可行性等指标,输出确定性数值评分。这一设计避免了主观判断的干扰,使评分过程如同编程测试用例般客观可复现。例如,在“从八种食材中选三种组成搭配”的任务中,系统会预先计算所有56种组合的分数并存储为“分数地图”,模型回答后只需查表即可得出分数,无需任何主观评判环节。

为验证系统有效性,研究者对27个主流语言模型展开测试,涵盖GPT、Gemini、Claude、Grok等知名系列。测试任务分为三类:替代类要求选出与给定食材相似且搭配合理的选项;搭配类需选择与指定食材风味互补的组合;约束类则增加素食、加工等级等硬性限制。每类任务各编制178道题目,形成两套独立题库,确保评测结果的稳定性。最终,534道被全部模型成功回答的题目构成“共同核心”考卷,保证所有模型在相同条件下竞争。

评测结果显示,Grok 4.6以65.1分位居榜首,Gemini 3.1 Pro以65.0分紧随其后,但两者差距在统计上无显著差异。GPT-5.6 Sol Pro、Muse Spark 1.2等模型分数集中在60至65分区间,形成竞争激烈的“第一梯队”;而Cohere的Command R+仅获47.9分,明显落后于其他模型。值得注意的是,所有模型得分均显著高于随机选择基线(约31.5分),表明语言模型已具备基础烹饪常识,但在处理约束类任务时表现较弱,反映出其在逻辑推理能力上的不足。

为确保结果可信度,研究者采用多重统计方法。通过5万次自助抽样计算置信区间,明确分数波动范围;对27个模型进行351次两两比较,并运用Holm校正控制假阳性风险。结果显示,仅101对比较能确认显著差异,其余250对因统计不显著被标记为“未解决”。这一设计避免了传统榜单“排名即实力”的误导性结论,更真实地反映了模型间的实际差距。

FlavourBench的突破不仅在于评测方法创新,更在于其潜在应用价值。由于所有组合分数已预先计算,该系统可直接作为训练素材:通过监督学习优化模型选择,利用分数差异进行偏好训练,或将其作为强化学习奖励函数提升决策能力。不过,研究者强调,此次实验仅用于评测,未将分数表用于训练,以避免模型“死记硬背”而非真正掌握烹饪逻辑。

尽管FlavourBench为开放式任务评测提供了新范式,但其局限性同样明显。首先,评分依据Epicure系统的理解,若该系统对特定菜系或小众食材存在偏差,可能影响排名公正性;其次,当前任务仅涉及有限选择,未涵盖完整菜谱生成、烹饪操作等复杂场景;“共同核心”机制虽保证公平,却牺牲了部分数据,未被全部模型回答的题目被排除在主榜单外。这些挑战为未来研究指明了方向:如何扩展系统覆盖范围,提升对多元文化的适应性,以及优化数据利用效率,将是进一步优化评测体系的关键。

更多热门内容
英伟达Vera CPU开启交付,以Arm架构助力AI数据中心新发展
英伟达(Nvidia)已正式启动其Vera中央处理器(CPU)的交付工作,标志着这家AI芯片巨头在数据中心计算领域的战略扩张迈出关键一步。多家大型运营商已在基础设施中部署基于Arm的芯片,以应对功耗、系统设…

2026-09-02