ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

DeepSeek为什么敢涨价

时间:2026-08-11 19:24:39来源:腾讯科技编辑:快讯

8月10日,Anthropic取消了Claude Sonnet 5原定于9月生效的50%涨价计划。

Sonnet 5在6月底发布时,API首发价为每百万Token输入2美元、输出10美元,原计划9月1日起恢复至3美元和15美元。最新更新显示,这一涨价安排已取消,2美元/10美元将继续作为长期价格。

此前,7月30日,OpenAI大幅下调GPT-5.6 Luna和Terra价格,其中Luna降价80%,Sol价格不变。与此同时,OpenAI还通过减少Codex、ChatGPT Work的额度消耗,以及多次重置付费用户额度,提高同等订阅价格下的可用计算量。换句话说,API和订阅两端都在变相降价。

但是,中国大模型的价格走势却完全相反。

8月11日前后,DeepSeek已在官方API定价页预告近期将整体涨价,并称“预计涨幅较大”。

DeepSeek目前仍处于全球前沿模型的最低价区间。V4-Flash每百万Token输入0.14美元、输出0.28美元,根据Artificial Analysis测算,它完成一组benchmark的平均成本约3美分,远低于GPT-5.6 Sol的1.86美元。

7月16日,月之暗面发布Kimi K3时,就把这款面向长程编程和复杂知识工作的旗舰模型放在了更高价格带:每百万Token普通输入20元、输出100元。连续两年不断向下的大模型价格曲线,出现了一次罕见的分叉。

美国头部模型开始压低价格,中国最新最强的一批模型却开始尝试提高单位价格。为什么?

图片由AI生成

01

OpenAI和Anthropic的竞争

美国大模型这轮降价最表面的原因,依然是OpenAI与Anthropic之间越来越激烈的竞争。

6月11日,在OpenAI正式降价之前,已有外媒消息称OpenAI内部正在讨论大幅削减Token价格,目的就是从Anthropic手里争夺用户。

到了7月30日,讨论变成现实。OpenAI精准砍向承担大量Agent执行工作的Terra和Luna。外媒在报道这次降价时直接指出,这会进一步向Anthropic施压:Claude在企业和开发者市场占据重要位置,价格却处于市场较高一端。

Claude Code和Codex争夺的是同一批开发者和企业工作负载。更大的使用规模除了带来收入,也会扩大真实任务和失败反馈的覆盖面。需要注意的是,OpenAI已明确表示,Business、Enterprise和API数据默认不用于训练,因此企业用户增长不能直接等同于训练数据增长。

更准确地说,模型厂商争夺的是工作负载反馈:更多真实任务会暴露Agent在哪些环节失败、重试或调用工具,从而反哺评测、产品和推理策略迭代。

Agent市场开始形成一条新的竞争链条:

降低使用门槛→更多真实任务运行→暴露更多失败模式→改进Agent→再争取更多工作负载

这也能解释Anthropic为何取消Sonnet 5原定50%的涨价。对于Agent主力模型来说,价格会直接影响调用频率;而在Agent场景中,更少步骤完成同样任务,本身就意味着更低成本。

02

中国开放权重模型

但OpenAI和Anthropic之间的价格竞争,只解释了其中一部分。另一股越来越重要的压力,来自中国开放权重模型正在迅速扩大可替代的任务范围。

DeepSeek、Qwen、Kimi、GLM等中国开放权重模型已经成为企业可以实际调用和部署的另一组选项。它们未必在所有任务上追平最强的Claude和GPT,但正在快速占领一个更有战略价值的区域:哪些工作已经不再需要最贵的模型。

Citi数据显示,OpenRouter上开放模型处理的Token占比从1月的34%升至6月的65%;当时平台最受欢迎的四个模型全部来自中国。这个数据只代表OpenRouter平台,虽然不能当做全球份额,但可以观察出多模型开发者的选择正在发生变化。

Palo Alto Networks CEO Nikesh Arora当时直接向模型公司喊话:如果想赢得企业客户,就应该按照未来更低的Token价格提前定价。

Coinbase CEO Brian Armstrong预计,未来18个月大约80%的AI工作负载会迁往成本低约99%的模型;旗舰模型仍然适合规划等复杂任务,大量执行工作并不需要如此昂贵的能力。

这里才是中国开放权重模型对OpenAI、Anthropic价格体系真正的压力。

规划和复杂推理交给Claude或GPT,分类、信息抽取、简单代码修改、格式转换等大量步骤交给DeepSeek、Qwen或者其他便宜模型。过去一个任务100%的Token都流向某一家旗舰模型,现在其中大部分可能被Router分走。

中国模型压缩了美国旗舰模型能够收取高溢价的任务范围。

所以OpenAI这次保住Sol的30美元输出价,同时把Luna砍掉80%,其实很有代表性。

守住最强模型的能力溢价,但也很不情愿把海量普通Agent工作白白让给更低价格的模型。

03

企业已经开始把模型当成可替换零件

斯坦福Digital Economy Lab今年4月发布的《Enterprise AI Playbook》,提供了一组很有意思的现实证据。

研究团队调查了41家机构、9个行业、7个国家的51个已经成功部署的企业AI项目。需要强调的是,这个样本专门研究成功案例,因此不能用来推导所有AI项目的平均ROI。

其中一个结果非常值得模型公司警惕:42%的项目认为底层模型完全可以替换。

在常规、规则明确的任务中,这一比例达到71%;到了需要复杂推理、专业知识或高风险决策的高级任务,只有18%认为模型可以随意替换,35%认为模型仍然是关键差异。

一位被斯坦福研究团队采访的科技公司运营负责人已经自己建立了“multi-LLM gateway”。他给出的原则很简单:每一个请求,都在成本、准确率、相关性和延迟之间重新判断,“这个任务真的需要deep search吗?还是mini模型已经足够?”

另一家公司的负责人也有同样的思路,自己的平台搭好之后,可以随时在模型之间切换,“谁变得更好或者更便宜,就转向谁”。

这恰恰是OpenAI和Anthropic现在面对的新市场环境。客户还在,但模型忠诚度正在下降。

04

“完成一件工作多少钱”

企业之所以越来越愿意切模型,还有一个原因:Agent让Token成本被迅速放大。

聊天时代,一个问题对应一次或者几次模型调用。Coding Agent接到一个任务之后,会读文件、制定计划、调用终端、修改代码、运行测试、查看错误,然后再循环。一次用户指令背后可能出现几十甚至上百次调用。

真正的成本越来越接近:任务成本 = Token价格 × Token数量 × Agent步骤 × 重试次数。

对于Agent,多出来的额度会直接变成更多工作。

DRadar是一个由开发者社区维护的Coding Agent实测项目,它让Codex、DeepSeek等模型持续处理真实开源仓库里的软件工程任务,并由独立环境重新验证结果,同时记录成功率、耗时和成本。它的价值不在于给模型排一个绝对能力榜,而是把“能力提升要付出多少成本”放在同一套任务里比较。

当前结果显示,高推理档位通常能获得更高任务表现,但成本会更快上升;DeepSeek V4 Flash这类低价模型虽然绝对能力略低,却能以低得多的成本完成相当一部分任务。对企业来说,这类测试更接近真实Agent经济学:并非每一步工作都值得调用最强、最贵的模型。

图:开源任务DRadar对真实软件工程任务的实测显示,模型能力提升伴随着明显的边际成本递增:高推理档位可以获得更高IQ,但成本往往以数倍甚至数十倍增长;DeepSeek V4 Flash等低价模型则落在“能力略低、成本大幅降低”的区域。数据来自开发者社区DRadar,并非官方Benchmark。

所以OpenAI频繁重置Codex额度,与API降价道理相同,就是降低每单位真实工作负载的获取成本。

这也让每百万Token多少钱开始失去一部分解释力。

企业真正关心的指标逐渐变成:Cost per successful task。

一个0.5美元的模型如果需要试40次,可能比5美元但8步完成任务的模型更贵。

斯坦福的企业研究也发现,高自主度系统已经出现明显的生产率优势。在AI自主完成80%以上任务、人类主要处理异常情况的“Escalation”模式下,中位生产率提升达到71%;每个输出都需要人工审批,以及人与AI持续协作的两种模式,中位提升均为30%。研究者同时提醒,这与任务选择有关——高频、结果可验证、错误可恢复的工作更适合高自动化。

Agent已经改变了模型经济学的计量单位。

05

DeepSeek和Kimi,两条不同的“涨价”路线

理解这一点以后,再看中国模型涨价,会发现DeepSeek和Kimi其实代表两种完全不同的商业选择。

DeepSeek最大的资产,是过去一年用极低价格建立起来的巨大使用规模和开放生态。

它现在仍然便宜得惊人。Artificial Analysis测算V4-Flash跑完其benchmark平均只需约3美分。即便价格翻几倍,它和美国旗舰之间仍然存在足够宽的价格带。

所以DeepSeek目前还无法证明自己已经拥有很强的定价权,但它已经开始拥有测试定价权的资格。

如果价格上涨两三倍,调用基本留下来了,说明DeepSeek的全球采用已经超出了“因为便宜所以用”;如果大量任务迅速迁移到Qwen、Kimi、GLM或者其他模型,极低价格在此前采用中的作用就比想象中更大。

Kimi K3这里,月之暗面从一开始就在尝试给一款长程Coding、Agent和知识工作旗舰更高的价格。K3开放权重,同时API输出价格达到100元/百万Token。

关于定价逻辑,接近Kimi的人提到:“定价主要是看模型成本。在同一个使用场景的竞品都会综合看一下,算一下自己的成本,给出一个价格。原则还是要赚钱的。但是deepseek不在考虑范围内,场景不一样。”

K3的需求至少出现了一个早期信号。模型发布仅数日后,由于需求超过计算能力,Moonshot一度暂停新的Kimi订阅,把容量优先留给现有付费用户。

虽然这还是不足以证明K3已经获得成熟定价权,但它说明中国开放权重模型进入全球市场,不再只有“价格做到美国模型十分之一”这一种打法。

06

Token的单价,已经越来越不重要

价格变化只是表层。判断一个模型的商业位置,更重要的是看它是否形成了稳定、持续并能够转化为收入的真实使用。

但目前并不存在覆盖全球模型使用量的完整统计。OpenRouter只能反映部分第三方调用,Hugging Face更偏向开放权重生态,云平台披露的数据也各有边界,任何单一指标都很难还原模型的实际采用情况。

因此,我们尝试做一个简单的模型采用度指数(Model Adoption Index,MAI),作为观察市场的参考,综合真实调用、生产部署、分发渠道、开发者生态、商业变现和持续使用六个维度进行打分;Benchmark、媒体热度和搜索指数不纳入,因为它们更多反映模型能力或市场关注度。

MAI基于目前能够获得的公开信息进行分析性评分,并非行业统计标准。对于刚发布的模型,生产部署和持续使用数据还没有充分形成,也还需要结合证据完整度和上线时间理解分数,不能简单作为模型排名。

这张表真正值得关注的地方,不在于Claude是91分、DeepSeek是81分,而在于这些分数背后的“采用结构”已经明显分化。

Claude的优势集中在企业生产部署和分发渠道;DeepSeek更像是靠低价和开放生态把使用规模做大,现在要验证这些调用能不能承受更高价格;Kimi从一开始就在尝试另一条路,开放权重负责扩大分发,高价API和商业合作负责承接更高价值的需求。

这也提醒我们,Token调用量和Token的绝对定价越来越难直接代表商业价值。一个模型调用很多,可能只是因为便宜;一个模型价格很高,也不等于真正有定价权。

所以再看今天这场价格分叉,美国模型降价、中国模型涨价,背后其实有三股力量同时发生。

OpenAI和Anthropic正在正面争夺Agent入口。中国开放权重模型又不断扩大廉价模型可以完成的任务范围。Agent和多模型Router则让企业第一次能够真正把每一步工作分配给性价比最高的模型。

价格因此开始向两边挤压。

美国高端旗舰模型过去享有的溢价正在向下压;中国开放权重模型长期依靠的巨大价格优势开始向上收缩。

最终的市场可能既不会出现所有Token无限趋近于零,也不会允许最强模型一直维持几十倍溢价。

真正被重新定价的是Task本身,每天到底有多少真实工作,愿意持续运行在某个模型或某个模型组合上。

更多热门内容
字节年内二开全员会定战略:承认差距聚焦战场,AI破局靠组织协同
承认差距之后,字节把力气花在了哪这场全员会,梁汝波还针对AI业务说了一些很坦诚的话。同时,梁汝波还给AI时代下的优秀人才下了定义:发现价值、定义问题、协调资源、创造价值。 茅庐在陪跑企业AI落地时,反复验…

2026-08-11

马斯克力挺Cloudflare预测:AI流量或5年内超人类千倍 互联网生态将变?
此前,Cloudflare曾预计机器生成的流量将在2027年超过人类流量,但事实上这一转变在已提前到2026年5月发生。照这么涨下去,5年后机器流量会是人类的1000倍。 被1000倍的机器流量稀释,你在…

2026-08-11