在人工智能大模型领域,一场激烈的竞争正在上演,行业格局正因“斩杀线”和“毒圈”概念而发生深刻变化。如今,中英文AI圈都用这两个源自电子游戏的词汇,来形容大模型竞争的残酷态势。
2026年7月31日,DeepSeek发布V4 Flash 0731,这一新版模型在Artificial Analysis的Intelligence Index上获得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据绘制的散点图中,纵轴代表Intelligence Index得分,能力越强得分越高;横轴是每任务成本,成本越高越靠右。V4 Flash 0731位于左上角,以其为起点向右下方划出一片区域,该区域内的模型成本更高、能力却更弱,这片区域被中文AI圈称为“斩杀线”,英文则叫Kill Zone(斩杀区)。对于处于斩杀线附近的模型而言,面临的竞争压力如同游戏中不断缩小的“毒圈”,生存空间正被逐步挤压。
Agent的兴起,是大模型行业竞争转向和烈度升级的关键因素。它改变了模型的使用方式,从简单的一次对话转变为完成一项任务。完成任务需要模型连续执行多个步骤、调用外部工具,出错后还要重试,最终交付的是任务结果。这使得单次回答的准确性无法全面反映模型交付任务结果的能力,按token计价的测试也不能准确体现一项任务的支出。例如,2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT - 5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%,同一对模型在不同任务下成本高低甚至会颠倒,可见成本随任务而定,评测口径也聚焦到了“任务”上。
Intelligence Index v4.1的两个坐标轴都以“任务”为评测基准。纵轴的Intelligence Index能力指数,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%,Artificial Analysis在方法论页面明确表示权重向智能体任务倾斜。横轴的每任务成本,是模型跑完整套Intelligence Index的总成本除以各项评测的任务总数,总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。按照这一标准,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,每任务成本0.04美元;V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT - 5.6 Luna (max),得分为51分,仅高出一分,且GPT - 5.6 Luna (max)在7月30日下调价格80%后,V4 Flash 0731的每任务成本仍低约60%,凸显了其性价比优势,散点图中左上方也完全空白。
Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,而一项Agent任务的tokens消耗量高出数个数量级。模型之间单价差距不变,但最终支出会随消耗量增加而同步扩大。有论文分析八个前沿模型在SWE - bench Verified上的执行轨迹,发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元,一次消耗数千tokens的问答,两者支出差额以美分计,但在一项Intelligence Index任务上,每任务成本支出差额接近1.7美元。同时,Agent任务中消耗的tokens还在快速增长,如Artificial Analysis指出Claude Sonnet 5的每任务成本较上一代翻倍,增量全部来自tokens用量增加而非单价上涨,其在Intelligence Index任务上的max档输出tokens较前代高出约40%,在AA - Briefcase和GDPval - AA两项知识工作评测中,智能体轮次约为前代的三倍,消耗量上升使得在模型上的最终支出持续增加。
Agent的应用同样放大了模型之间的能力差距。单轮问答中,能力差异表现为一次回答的准确率差异;而Agent任务由多步骤串联,任一步骤出错整体即告失败,成功率约等于各步成功率的连乘。一次回答准确率为95%与90%相差五个百分点,二十步之后成功率分别为36%与12%,前者接近后者的三倍。Agent常设的重试机制进一步放大了差距,失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。Agent对模型能力和成本差距的放大效应,直接导致模型分化,性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。
Agent还给模型的评测带来了更多变数。7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务并用同一套评分标准。结果发现四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。
为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,包含E2B沙箱、六个固定工具、250轮上限,所有模型的Intelligence Index跑分都在这个框架里完成。V4 Flash 0731在Terminal - Bench 2.1这项Agent评测上有两个得分,Artificial Analysis使用Stirrup测得79%,DeepSeek在更新日志中公布用自家DeepSeek Harness的极简模式测得82.7%。这表明Agent已成为大模型的主流使用场景,单纯的模型能力分数不能说明全部问题,真正的能力存在于系统层级。
斩杀线意味着一旦模型落入该范围,在市场中往往直接失去竞争力。大模型的切换成本极低,与苹果等拥有网络效应的业务不同,AI大模型的API调用标准化,操作协议开放,开发者可多渠道并行触达用户,用户也不关心底层模型是谁,开发者能快速且低成本自由切换模型。同时,基础模型层进步明显放缓,同质化竞争加剧,同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集,性价比处于劣势的模型将快速失去商业潜力,“斩杀线”之内没有二等奖,所有模型厂商都必须争取第一。
即便模型厂商跟上了竞争节奏,也难以停下。目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道,但降下来的成本在激烈的价格竞争中无法转化为利润。2026年7月30日,OpenAI在GPT - 5.6的页面上追加更新,将GPT - 5.6 Luna的价格下调80%,GPT - 5.6 Terra下调20%,次日DeepSeek就发布V4 Flash 0731。只要有一家将降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。通过性价比获得的优势可以维持,但难以形成壁垒,大模型厂商进入的不是一座可以筑墙固守的城池,而是一片需要每天争夺的开阔地。
斩杀线还将继续上移,推力来自模型技术进步和基础设施投入。模型仍在不断迭代,V4 Flash 0731的架构与尺寸均未变动,仅重做了后训练,Intelligence Index得分就从40升至50,反超自家V4 Pro (max)的44分。自研芯片、自建算力、应用系统工程化与集成等投入周期长、金额大,具备形成规模壁垒的潜力,一旦转化为模型能力和成本优势,将推动“斩杀线”继续上移。大模型行业的这场竞争,已然进入生死局。