ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

AI推理模型受热捧,基准测试费用为何水涨船高?

时间:2025-04-13 11:15:48来源:ITBEAR编辑:快讯团队

随着人工智能技术日新月异的发展,推理AI模型逐渐成为了科研领域的热门焦点。这类模型能够模拟人类的思考过程,尤其在物理学等专业领域,展现出了超越非推理模型的卓越能力。然而,高昂的测试成本却成为了验证这些模型性能的一大障碍。

据第三方AI测试机构“人工智能分析”提供的数据,评估不同推理模型的费用差异显著。以OpenAI的o1推理模型为例,在七个主流的AI基准测试中的评估费用高达2767.05美元,折合人民币约20191元。相比之下,Anthropic的Claude 3.7 Sonnet混合推理模型的评估费用为1485.35美元,折合人民币约10839元。而OpenAI的o3-mini-high模型评估则仅需344.59美元,折合人民币约2514元。尽管存在费用较低的模型,如OpenAI的o1-mini评估费用仅为141.22美元,折合人民币约1030元,但整体来看,推理模型的测试成本依然偏高。

“人工智能分析”机构已投入约5200美元,折合人民币约37945元,用于评估十几种推理模型,这一投入几乎是非推理模型评估费用2400美元的两倍。OpenAI在2024年5月发布的非推理GPT-4o模型评估成本仅为108.85美元,而Claude 3.6 Sonnet的评估成本更是低至81.41美元。该机构的联合创始人乔治·卡梅伦表示,随着推理模型的开发日益增多,测试预算也将相应增加。

AI初创公司“通用推理”的首席执行官罗斯·泰勒也面临着测试成本上升的挑战。他透露,为评估Claude 3.7 Sonnet,使用了约3700个独特的提示词,费用高达580美元。泰勒估计,仅对MMLU Pro进行一次完整测试的成本就可能超过1800美元。他担忧地指出,随着资源投入的差异,学者可能无法复制实验室的报告结果。

推理模型测试成本高昂的主要原因在于其生成的token数量庞大。Token是原始文本的片段,如将单词“fantastic”拆分为多个音节。据“人工智能分析”称,在基准测试中,OpenAI的o1模型生成了超过4400万个token,是GPT-4o生成量的八倍。由于大多数AI公司按token收费,因此成本迅速累积。

现代基准测试包含复杂、多步骤任务的问题,导致模型生成大量token。Epoch AI的高级研究员让-斯坦尼斯拉斯·德内恩指出,尽管每个基准测试的问题数量总体减少,但问题本身更加复杂,旨在评估模型执行现实世界任务的能力,如编写和执行代码、浏览互联网等。最昂贵的模型每百万输出token的成本也在不断增加。例如,Anthropic发布的Claude 3 Opus模型每百万输出token的成本为75美元,而OpenAI的GPT-4.5和o1-pro模型的成本则分别为150美元和600美元。

德内恩表示,尽管随着技术进步,模型的性能提升且成本有所下降,但评估最大最好的模型仍需支付高昂费用。部分AI实验室,包括OpenAI,为测试目的向基准测试组织提供免费或补贴的模型访问权限,但一些专家担忧这可能影响测试结果的公正性。

更多热门内容
vivo X200 Ultra影像新突破:蓝图双芯引领手机摄影新风尚
除了硬件升级,vivo还通过蓝图算法矩阵赋予了10亿参数到vivo视觉大模型里面。另外,vivo X200 Ultra还带来行业首发蓝图影像双芯——在V3+芯片基础上,再增一颗VS1芯片,拥有最高80TOP…

2025-04-14

夸克AI超级框引领潮流,月活近1.5亿成中国AI应用新霸主
智东西4月14日消息,阿里巴巴旗下的人工智能(AI)应用夸克(Quark)在完成改版后,于3月份超过字节跳动旗下的豆包,成为中国最受欢迎的AI应用。 这不仅展示了阿里巴巴在AI领域的市场洞察力,也反映了下一…

2025-04-14

快手押注AI:能否突破瓶颈,抓住新增长机遇?
于快手来说,广告业务稳健增长但天花板明显,电商模式跑通但增速放缓,并且用户增长也遇到瓶颈,急需新的故事加持;于短视频行业来看,快手正遭遇抖音和视频号的双重挤压,后两者背靠大树,在商业化、资源以及技术上优势明…

2025-04-14