AI推理模型受热捧，基准测试费用为何水涨船高？-人工智能-ITBear科技资讯

随着人工智能技术日新月异的发展，推理AI模型逐渐成为了科研领域的热门焦点。这类模型能够模拟人类的思考过程，尤其在物理学等专业领域，展现出了超越非推理模型的卓越能力。然而，高昂的测试成本却成为了验证这些模型性能的一大障碍。

据第三方AI测试机构“人工智能分析”提供的数据，评估不同推理模型的费用差异显著。以OpenAI的o1推理模型为例，在七个主流的AI基准测试中的评估费用高达2767.05美元，折合人民币约20191元。相比之下，Anthropic的Claude 3.7 Sonnet混合推理模型的评估费用为1485.35美元，折合人民币约10839元。而OpenAI的o3-mini-high模型评估则仅需344.59美元，折合人民币约2514元。尽管存在费用较低的模型，如OpenAI的o1-mini评估费用仅为141.22美元，折合人民币约1030元，但整体来看，推理模型的测试成本依然偏高。

“人工智能分析”机构已投入约5200美元，折合人民币约37945元，用于评估十几种推理模型，这一投入几乎是非推理模型评估费用2400美元的两倍。OpenAI在2024年5月发布的非推理GPT-4o模型评估成本仅为108.85美元，而Claude 3.6 Sonnet的评估成本更是低至81.41美元。该机构的联合创始人乔治·卡梅伦表示，随着推理模型的开发日益增多，测试预算也将相应增加。

AI初创公司“通用推理”的首席执行官罗斯·泰勒也面临着测试成本上升的挑战。他透露，为评估Claude 3.7 Sonnet，使用了约3700个独特的提示词，费用高达580美元。泰勒估计，仅对MMLU Pro进行一次完整测试的成本就可能超过1800美元。他担忧地指出，随着资源投入的差异，学者可能无法复制实验室的报告结果。

推理模型测试成本高昂的主要原因在于其生成的token数量庞大。Token是原始文本的片段，如将单词“fantastic”拆分为多个音节。据“人工智能分析”称，在基准测试中，OpenAI的o1模型生成了超过4400万个token，是GPT-4o生成量的八倍。由于大多数AI公司按token收费，因此成本迅速累积。

现代基准测试包含复杂、多步骤任务的问题，导致模型生成大量token。Epoch AI的高级研究员让-斯坦尼斯拉斯·德内恩指出，尽管每个基准测试的问题数量总体减少，但问题本身更加复杂，旨在评估模型执行现实世界任务的能力，如编写和执行代码、浏览互联网等。最昂贵的模型每百万输出token的成本也在不断增加。例如，Anthropic发布的Claude 3 Opus模型每百万输出token的成本为75美元，而OpenAI的GPT-4.5和o1-pro模型的成本则分别为150美元和600美元。

德内恩表示，尽管随着技术进步，模型的性能提升且成本有所下降，但评估最大最好的模型仍需支付高昂费用。部分AI实验室，包括OpenAI，为测试目的向基准测试组织提供免费或补贴的模型访问权限，但一些专家担忧这可能影响测试结果的公正性。