GPT-6 Astra 带火的循环 Transformer,商汤早已用在了生图模型上

众所周知,最近几年大模型的进步背后,两种 Scaling Law 发挥了相当重要的作用,这是老黄能把更多显卡卖出去的推销理由,甚至也是业界很多人相信模型还能更上一层楼的信仰。

第一种是训练时 Scaling。扩大参数规模,增加有效的训练数据,投入更多训练算力,让模型学到更强的能力。这直接推动了大模型的发展,也让我们习惯了用参数规模来判断一个模型的实力。

第二种是推理时 Scaling。模型训练完以后,给它更多计算预算,让它尝试不同解法、检查中间结果,再给出答案,对用户来说,能看到的就是更长的 COT 思维链。

这两种 Scaling Law 都是符合直觉的,前者依靠训练阶段投入资源,后者则能在推理阶段根据具体任务分配算力。

最近,GPT-6 Astra 的发布,把神秘的隐式推理(Hidden Reasoning)和 Looped Transformer 推到风口浪尖。

所谓的隐式推理,并不是指过去厂商为了防止模型蒸馏,而故意在用户端隐藏模型的思维过程,或者另外用单独的模型对 COT 进行摘要改写,而是模型自己在推理过程中,直接不再把思考过程输出为 Token。

如何实现?大家普遍猜测,靠的就是循环 Transformer:允许模型复用同一组网络层,让内部信息多经历几轮处理,再输出结果。

只不过,OpenAI 早已不再公布模型架构和详细技术论文,我们当然无从求证 GPT-6 的真实技术路线。不过,我在读相关论文和资料时,发现商汤 SenseNova 团队最近发布了一个关于 Looped MMDiT 的技术文章,就已经把这种思想用到了图像生成里。他们从今年 4 月前后开始推进这项研究,关注的就是「怎样用较小的模型,处理更复杂的生成任务」。

实验效果也很理想:一个只有 2.6 亿参数的模型,在五项测试指标上超过了参数量为 11 亿的对照模型。

所以,同一套参数反复使用,为什么能让 AI 画得更好?

参数可以复用,计算也可以继续加深

先来看“循环”这个动作。

一般来说,标准的 Transformer 可以理解为一组按顺序连接的计算模块。每一层接收上一层处理后的信息,再做一次变换。通常,要让网络更深,就要增加新的层,也会增加相应的参数。

而 Looped Transformer 则把其中一组层重复循环使用。前一轮处理后的中间结果,送回这组层继续进行计算。

参数是模型训练得到的数值,决定信息怎样被处理;隐藏状态是模型当前处理形成的中间表示,记录这次任务进行到了什么状态。在循环时,参数保持相同,隐藏状态则持续更新,所以每一轮计算都可以产生新的结果。

举个例子:如果有 10 层网络,每层循环三遍,就执行了 30 次层计算,而需要存放的独立层权重仍然只有 10 层。新增的计算深度,通过参数复用实现。

这种思路至少可以追溯到 2018 年的 Universal Transformer (arXiv:1807.03819)。

到了 2025 年,关于循环深度与潜在推理的研究,已经在数十亿参数规模的语言模型上探索:给同一组参数更多内部计算,能把推理能力提高到什么程度。

这显然给推理时 Scaling 增加了一种实现方式:生成更多 Token 是延长计算;在输出之前多更新几轮隐藏状态,也可以算作增加了计算。

现在,把这条路线放进生图场景看。

假设我们要画两个玩具大象,两个大象一共牵着五个气球。大象和气球都好理解,真正考验模型的,是把“两只”“五个”“红色”“牵着”画对。物体越多,属性、数量和位置之间需要满足的关系就越复杂。

过去,想要保证模型的效果,我们不断把提示词扩写得更长,补充更详细描述。但归根到底,想要让画面满足这些关系,需要生成网络把接收到的信息处理好才行。

Looped MMDiT 就把循环安排在这个环节。MMDiT 就是多模态扩散 Transformer,让文本信息与图像信息在网络中交互;Looped 则让其中一部分计算模块反复处理这些信息。

这就是“隐空间推理”:模型直接在内部数值表示中多轮加工,改善物体组合与空间关系的处理。画面中的关系,可以在形成最终图像之前继续调整。

对生图场景来说,这种处理很贴近用户的真实需求。

循环要有效,得让每一轮都做有用的事

不过,生图模型本来就在反复计算,Looped MMDiT 加入的是另一层循环。

大多数扩散模型(Diffusion Model)和流匹配模型,会从随机噪声出发,经过多个步骤生成图片。每一步都调用网络,预测当前状态应该怎样更新。

如果你用过 Stable Diffusion 之类的生图工具,参数里的“采样步数”或“去噪步数”,说的就是这个外层过程。

Looped MMDiT 在单次预测的内部,再让一组共享参数的模块多执行几轮。于是,模型可以分别调整两个变量:整张图分多少步生成,以及每一步内部处理多深。

这种思路听起来很直接,实际做起来却会遇到各种问题。

商汤 SenseNova 团队先是尝试了直接重复模块的方案。训练时循环四轮,推理时逐渐增加循环次数,效果虽然有改善,但很快就饱和;超过训练深度后,表现还会下降。

继续检查隐藏状态,团队发现,循环加深以后,图像信息单元的位置变得越来越难预测。反复混合信息,正在削弱局部表示。

这对生图模型来说就很麻烦。模型一边需要联系全局,处理物体之间的关系,一边又要保留局部信息,分清每个物体在哪里、具有什么属性。增加计算以后,这些信息若越来越模糊,后续处理也会受到影响。

因此,Looped MMDiT 配套做了三项设计。

第一,深度监督,Deep Supervision,让每轮循环产生的中间预测,都直接接受生成目标的训练。前几轮也要学会给出有用的预测,让训练目标覆盖到整个迭代过程。

第二,循环蒸馏,Loop Distillation,在训练时用最终轮的预测指导前面的轮次,让模型少算几轮时,也能尽早接近较深计算的结果。这为按需求选择循环深度提供了支持。

第三,自调节注意力,Self-Modulating Attention,简称 SMA,根据当前状态调节注意力更新。注意力负责让不同的信息单元互相参考,SMA 帮助控制反复更新的影响,缓解局部表示退化。

这三项改进,处理的是一组相互关联的问题:每轮朝什么目标优化,较浅循环怎样获得更好的预测,反复加工时怎样保留有用信息。

所以,虽然循环思想已经存在多年,但真正有价值的推进,是把它放进具体任务,找到失效原因,再改进训练和计算方式。这样,额外付出的算力,才算是换来了有效的性能提升。

小模型能画得更好,关键是把算力花对地方

从实验结果来看,Looped MMDiT 至少取得了三方面的效果。

首先是参数效率。在实验中,2.6 亿参数的 Looped MMDiT,在多项指标上都高于参数量级大数倍的模型。

其中,在评估模型复杂语义对齐和指令遵循能力的 DPG Bench 中,Looped MMDiT 取得了最高分为 86.0。

而且,参数复用的能让小模型也能执行更深的计算。这对需要本地部署的开发者很有吸引力。

第二方面,是复杂要求能否落实得更好。

团队把内部循环与 Qwen 提示词改写作了比较。在组合与推理测试里,加入循环带来的整体提升是 6.9 个百分点,提示词改写带来的提升是 2.9 个百分点。

这对普通用户显然会更友好,即便提示词写的没那么优秀,模型也能精准捕捉到用户的意图,减少用户抽卡的次数。

第三方面,也是最能呼应 Scaling 的结果,是计算预算的重新分配。

每增加一轮内部循环,都要付出实际计算。那么,同样一档预算,更多地用于外层去噪,还是用于每一步内部的循环,效果更好?

团队用每张图累计通过计算模块的次数衡量预算,将四轮内部循环搭配 25、50、100 个去噪步骤,与单遍基线的 50、100、200 步配对比较。在图示预算下,循环方案在 DPG、PRISM、CoRe、Spatial 四项指标上均更好。

他们还发现,减少外层步骤,把更多计算留给单步内部处理,得到了更好的生成结果。

过去,想让生图模型多算一会儿,我们很容易想到增加采样步数;现在,循环深度 Loop Depth 也成为一个值得调节的变量。

更多外层步骤,把生成过程划分得更细;更多内部循环,则让每一步的预测经过更充分的处理。对于复杂构图,如何搭配这两种计算,就会直接影响投入产出。

由此继续推演,未来的生图应用里,在找灵感、试构图时,可以用浅循环的配置;需要落实复杂关系时,再增加内部计算。

换句话说,即便不再增加模型参数,只要把同一套模型的计算用得更充分就能完成更复杂的任务。对于文生图产品来说,这意味着能用更少的预算,实现更稳定的出图效果。

写在最后

总而言之,不论是文生图模型,还是大语言大模型,下一轮竞争会越来越取决于同一组参数能做出多少有效计算。

商汤 SenseNova 研究团队计划在 9 月底开源 Looped MMDiT 研究成果,并进一步接入 SenseNova U 系列的统一生成与理解框架,继续做更大规模验证。

我觉得这是很有意义的架构探索,未来一段时间,会有更多团队把内部循环这条路继续做深,也许这真的会成为参数做大、思维做长之后的第三条 Scaling Law?

展开阅读全文

更新时间:2026-09-15

标签:科技   商汤   模型   参数   信息   更多   团队   状态   预算   深度   外层

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top