ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

GPT-5.6一夜爆砍80%,1元屠杀最贵Claude!

时间:2026-07-31 16:55:22来源:新智元编辑:快讯

一觉醒来,OpenAI给GPT-5.6 Luna来了一记「脚踝斩」。

价格直接砍掉了80%——

每百万Token,输入0.2美元,输出1.2美元。

价格低成这样,能力却没跟着缩水。

在专业评测Agents’ Last Exam中,Luna不仅反超了Anthropic最贵的Fable 5。

而且执行单个任务的成本,只有对方的越1%。

更魔幻的还在后面。

这轮降本的背后,是GPT-5.6 Sol亲自下场,重写并优化了运行自己的生产内核。

然后再加上其他优化,端到端服务成本就这么水灵灵地降了20%。

是的,AI开始给自己打工了。

三档模型,一夜大洗牌

GPT-5.6分三档:Sol是旗舰,Terra是日常平衡,Luna是最快最便宜那个。这次屠刀砍的是后两位。

新旧一比更直观。

Luna的输入从$1干到了$0.20,输出从$6干到了$1.20,一口气削掉八成;

Terra的输入从$2.50降到$2,输出从$15降到$12,降了两成。

Sol则维持$5和$30不变。

对开发者来说,最直接的感受是,大批量调Luna,成本几乎可以忽略不计了。

一个跑几十万次模型调用的Agent工作流,过去光token费就是一笔大开销,现在Luna把它压到不用算的程度。

而且,订阅用户也没被落下。

Codex和ChatGPT Work的月费和额度没变,但用Luna和Terra干活时消耗的积分更少了,能干的活更多了。

不仅如此,Sol这边加了个Fast mode,替代原来的Priority Processing。

最高2.5倍速度,价格翻倍,智能水平一点没变。

在Codex里对应/fast指令,之前标priority的请求自动切换。对延迟敏感的场景,这就是个用钱买速度的开关。

借着这波操作,App里那个「替我审核」(auto-approve)功能也改成了用Luna来提前拦截主agent的高风险动作,直接把成本降了约10倍。

降本的活,Sol自己干了

能砍这么狠,是因为Sol通过Codex接进了OpenAI的生产推理栈,自己动手,把跑它自己的那套系统优化了一遍。

Codex负责人Tibo把这套打法概括成两步。

首先训出一个足够强的模型,然后再用这个模型去把一切变得更好,包括但不限于运行它自己的基础设施、推理栈和内核。

具体到这次,GPT-5.6总共针对四个问题进行了优化。

1. 负载均衡。

OpenAI的请求会按地域、容量、加速器类型分发,集群内再按负载、上下文长度、缓存可用性进行分配。

解法:Sol分析了生产流量,揪出工程师之前没注意到的负载不均,测试了新的路由策略。

2. GPU内核。

模型的前向传播靠内核执行数学运算,但内存搬运、同步、数据布局不合理会让GPU闲置。

解法:Sol找到了能预计算、能跳过、能并行的工作,用Triton和Gluon这两种OpenAI维护的GPU编程语言,自主重写并优化了生产内核。这些改动加上更广泛的内核优化,把端到端服务成本压低了20%。

3. 推测解码。

这套技术让一个更小的draft模型先猜几个token,主模型并行验证,猜对了一次就能多输出几个token。

解法:Sol针对draft模型设计并跑了数百次架构实验,改尺寸、改结构、改特性,还自己启动并盯着训练流程,遇到硬件故障和训练不稳定主动介入。token生成效率因此提升超过15%。

4.KV缓存和配置调优。

batching、sharding、KV管理的最优配置高度依赖负载,由于配置空间太大,基本全靠工程师的经验来做。

解法:Sol分析生产负载,生成并评估候选配置,把过去调不动的东西调到极致。

不过,Sol写的内核不能直接上线。OpenAI会用开源工具FpSan(浮点数消毒器),把结构、数据流一项项查过去,确认没问题才放行。

看看内部数据,就能知道这个循环转得有多快。

GPT-5.6内测阶段,每位活跃研究员的日均token输出,是GPT-5.5时代峰值的两倍以上。

过去半年,内部代码推理研究算力占比涨了100倍,内部智能体token用量涨了约22倍。

省下的算力,直接变成了降价的底气。

20美分,反超Anthropic最贵的那个

毫不夸张地说,如今的GPT-5.6系列已经正式站到了价格/性能效率的帕累托曲线上。

在横跨55个领域、评估长周期专业工作流的评测Agents' Last Exam上,Luna的得分直接反超了Anthropic的旗舰Fable 5。并且,单任务成本只要1%,而速度却高达9倍。

第三方评测机构The Agent Report的拆解同样显示,GPT-5.6三档在Agents' Last Exam上均高于Fable 5。

在DeepSWE上,Luna每美元能换约24个基准分,而Fable 5只有约3.2,效率差出5到7.5倍。

收入加速,Codex杀回来了

综合来看,让GPT-5.6刚发布三周就降价的压力,主要来自两个方面:

开源模型的价格碾压:中国模型的token成本整体比美国同行便宜最高9倍

Anthropic在企业市场的猛攻:Claude Code今年初在编程工具市场领先,5月公布年化收入超过470亿美元。

但比降价先到的,是收入。

在7月29日的内部会上,CFO Sarah Friar表示——

Codex和ChatGPT Work加起来,活跃用户已经过了1000万,两周翻了近一倍。

基于此,OpenAI单7月一个月的年化经常性收入,直接超过了整个第二季度。

而且,这里面有一部分增长,还是从Anthropic那边抢来的。原因正是在于,Claude Code的账单太高,用户纷纷开始找替代方案了。

不过,虽然价格战能拉升使用量,但也会压利润率。

在EMARKETER分析师Jacob Bourne看来,「疯狂刷token的时代结束了」,企业开始要清晰的投资回报率。

但OpenAI不怕降价,因为帮它把效率推上去的,是它自己的模型。

最后,真正决定格局的,是谁能在同样一张卡上榨出更多的智能。

更多热门内容
新能源风机叶片损伤检测全攻略:智能化技术守护风电资产安全
随着科技的发达,检测方式也在迭代,今天只针对“叶片损伤”做一下检测后的分享。 通过肉眼观察风电叶片表面是否有裂纹、擦痕、变形等损伤。利用内窥镜深入风机叶片内部检查叶片内部损伤情况,如脱胶、开裂等。 利用无人…

2026-07-31

印度Sarvam AI发力AI领域:将开发T级模型,还公布两款新模型产品
IT之家 7 月 31 日消息,印度人工智能企业 Sarvam AI 在当地时间本周四开幕的首届 Sarvam Epoch会议上宣布,该公司将开发参数达到万亿量级的人工智能模型。 Sarvam AI 表示,…

2026-07-31

OpenAI再出招:GPT-5.6系列降价,智能与成本平衡新突破
OpenAI借此强调,GPT-5.6Luna能够在成本和智能之间提供更优的平衡。有网友制作了一张调侃图片:此前凭借高性价比吸引大量开发者的KimiK3,如今又迎来了价格进一步下探的GPT-5.6 Luna…

2026-07-31

AI浪潮下文科生新机遇:人文素养赋能技术 跨界融合开启就业新篇
在招聘会上,记者观察到人工智能等科技公司的岗位比较火热,其中也有一些人文社科背景的同学积极应聘。 正是这种独特的价值,让“人文学科或其他学科+AI技术”的复合能力,成为一些学生努力的方向,也成为企业招聘时的…

2026-07-31

日本川崎重工CORLEO仿生四足机器人:2028年亮相样机 2035年开启量产之路
近日,日本川崎重工就其自主研发的四足行走机器人CORLEO召开项目说明会。该项目于今年4月正式启动,组建了由数十名工程师构成的专项开发团队,并与英伟达开展技术协作,重点推进运动控制、感知决策等核心系统研发。…

2026-07-31

从实验室到产线:浙江人形机器人“进厂打工”蹚出产业新路径
许学成则补充,在某个时间节点,跳舞确实是最好的商业选择,而浙江人形的目标是工业应用落地,“国家希望机器人能真正到场景里带来价值”。工信部、国资委今年6月联合启动2026年度人形机器人与具身智能实景实训专项行…

2026-07-31

跳跃机来袭:无人机与弹簧腿的奇妙融合,开启机器人新物种探索之旅
论文发表时,王方正判断,这可能是一个机器人新品类的机会,「而且等我博士毕业,这个机会不一定还在了」——没等博士毕业,他就拉上师兄和导师,把公司做了起来。 问:在你们之前,公认跳得最好的是加州伯克利那台机器人…

2026-07-31

OpenAI连放大招:GPT-5.6优化进展、硬件研发及用户规模新突破
一是推理服务体系,通过优化负载均衡、推测解码、缓存机制、内核算子优化等流程,在硬件配置不变的前提下提升有效输出量;▲使用官方框架后,GPT-5.6 Sol在ARC-AGI-3公开数据集上的得分达到了13.…

2026-07-31