ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

刚刚,OpenAI新Transformer火了,Astra架构首次曝光

时间:2026-09-04 01:20:48来源:新智元编辑:快讯

家人们,听说了么?

OpenAI下一代Astra采用了一种循环深度(recurrent depth)全新推理方法。

思考Token大幅减少,性能反而直线拉爆!

怪不得灰测的Astra实力那么强,原来OpenAI手握了一张真正的技术王牌。

但是代价是,Astra的思考过程完全隐身了。就连OpenAI自己都难以看清AI大脑,监控更是南上加南。

消息一爆出来,全网都陷入了恐慌。

OpenAI首席科学家Jakub Pachocki,第一时间做出了回应——

内部目前最前沿的模型(包括Astra),它的计算图深度顶多也就GPT-4的两倍,没外界传的那么玄乎。

几乎同一时间,有大V爆料称,gpt-6-astra的名字已在OpenAI API上现身了。

看这架势,GPT-6预计明天就会上线。

它背后的新架构,究竟是什么来头?

循环Transformer,火遍全网

循环深度还有另外一个名字,叫循环Transformer(Looped Transformer)。

实际上,这一概念并不是由OpenAI首次提出。

在此之前,整个业界都在循环Transformer上做过不少研究。

要看懂Astra变在哪,得先看传统大模型是怎么干活的。

传统的Transformer像一栋只能走一遍的高楼,数据从第一层一路爬到最后一层,做完固定次数的运算,吐出下一个Token。

你想让它推理得更深?那就只能把楼盖得更高、参数堆得更大。代价就是极其高昂的算力和显存开销。

循环Transformer换了个极其暴力的思路:让它转起来。

信息不再是单向穿过网络一次,而是把同一组Transformer层反复循环使用。

第一圈算出的隐藏状态(Hidden States),直接送回起点继续加工,转上好几轮,最后才吐出结果。

它就像一段盘旋向上的楼梯——还是那几级台阶,但只要多绕几圈,照样能到达顶层。

这条路,学界早就走通了。

谷歌在2025年发表的一篇论文Reasoning with Latent Thoughts,给出了一个非常直观的结果——

一个包含k层、循环L次的Transformer,在不少推理任务上,可以接近拥有k×L层的普通模型。

参数量没有同步扩大,有效计算深度却被拉长了。

今年2月,一篇关于潜在推理(latent reasoning)的论文,也完美展示了这种架构的杀伤力。

研究人员拿一个35亿参数的小模型,中间的核心块反复循环跑。当转的圈数足够多时,这个3.5B的小身板,竟然打出了相当于500亿大模型的成绩。

这相当于,给测试时算力开了一个超频开关。

不加参数,不占额外显存,光靠在原有的权重里多跑几圈(拿时间换空间),能力就能越级狂飙。

对于刚被Anthropic在营收上反超、急需一个断层式大跃进的OpenAI来说,这种技术的诱惑力,根本无法拒绝。

思考是怎么隐身的

在此前爆火的AI 2027一文中,曾将这一方向称之为神经语循环。

Astra仍会通过语言来思考问题,但那些言语之间的更多思考,现在可能是无声的。

Astra的进化直接打破了AI 2027的预言

循环深度的危险就在于,它把思考逼进了盲区。

在此之前,业界必须接受一个反直觉的现实:对于现在的推理模型来说,CoT是模型真正用来打草稿的工作记忆。

过去,模型想得再深,也必须从输出下一个Token这个狭窄的漏斗里挤出来。

正是这一挤,把抽象的计算逼成了人类能读懂的文字。这也是过去两年,人们唯一能看透AI脑子里在想什么的底气。

但另一方面,循环深度拓宽了内部的计算管道。

固定层数的模型,每吐一个Token前能做的串行推理是有限的。

而现在,模型在中间的循环块里转了r圈,每个Token背后就塞进了r倍的串行计算。原本必须挤在字面上的长链条推理,现在能在向量世界里默默转完,全程不吐一个字。

省下的Token,恰好省在了那些没写出来的思考上。更麻烦的是,它在潜空间里想的,未必是人话。

正如meta早前在连续思维链(Coconut)研究中指出的:

模型用数字、用向量去推理,可能比被逼着用人类语言更准、更省。

这背后的逻辑很简单,大模型理解概念的方式,本来就是数学向量,强迫它每一步都翻译成人话,只会损失信息。

Coconut和CoT对比

这项技术的杀伤力在于,可以让一个小体积的模型,发挥出超大模型的实力,成本骤降,还能省下内存、带宽。

不过,它在省下了算力成本的同时,也彻底关上了人类的视线。

Astra真正王牌,就是新Transformer

对于数学和编程来说,循环Transformer架构极有吸引力。

许多真实任务本就依赖多次迭代:先提出方案,再检查错误,更新中间状态,继续求解。

循环Transformer,天然适合执行这种算法。

它也给模型带来了一种全新的推理时Scaling方式。

过去,让模型多想一会儿,通常意味着让它生成更多思维链Token。

现在,一部分计算可以在输出Token之前完成。模型表面上可能只停顿片刻,内部状态却已经迭代了很多轮。

Astra的实力大家是有目共睹,虽还未正式发布,一些demo验证了其在前端领域的统治力。

而且,在计算机使用方面,奥特曼也承认,Astra实力直接媲美人类水平。

正是基于这一架构的创新,Astra还打通了持续性智能体,只要不喊停能连轴转数周。

如今全网都在屏息以待,Astra/GPT-6总算要来了。

OpenAI多位研究员,包括赛博义父也在疯狂暗示强大的Astra。

今晚,就坐等GPT-6的发布了。

参考资料:

https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=epv9gi

更多热门内容