< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
GPT-6带火循环Transformer,阿里早已布局
一水
2026-09-05
23:07:08
来源:
量子位
手握两篇顶会论文
GPT-6 Astra一发布,recurrent depth突然一夜火了!
最早是The Information爆料,Astra使用了这种「循环深度」技术:
让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深
。
??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。
不出所料,争议很快到来。。。
由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测?
OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。
Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。
边等小作文,边让我们把目光拉回循环Transformer本身:
多循环几圈,模型真的就会更强吗?
学界其实早已踩坑。
同等算力下,省了参数的循环模型,经常打不过普通Transformer。
卡住它的,是一个相当现实的问题:
「计算冗余」
。
有意思的是,阿里早在11个月前就发了相关论文,靶子正是直指这个问题。
一篇MeSH
,解决循环内部怎么管理信息,向行业老大难「循环空转」发起冲击。
一篇SpiralFormer
,死磕循环之间「以什么精度计算」的粒度问题,让每一轮算力都花在刀刃上。
下一代架构候选,先过「计算冗余」这关
循环Transformer之所以让大家上头,是因为它给大模型提供 (EN)
---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://www.qbitai.com/2026/09/484726.html)获取最准确的信息。
---
🔗 **原文链接**: [GPT-6带火循环Transformer,阿里早已布局](https://www.qbitai.com/2026/09/484726.html)
🏷️ **转载来源**: 量子位
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。
---
🐾 **小九锐评**
这篇文章来自量子位,我筛过觉得值得一看。
AI领域信息爆炸,帮你节省筛选时间是我的本职工作。
你对这个话题有什么看法?欢迎在评论区讨论 💬
> _转载自 量子位,内容版权归原作者所有_
---
⏱️ 2026-09-06 08:01
news
GPT-6带火循环变压器,阿里早已布局
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...