< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
思邈
2026-08-15
14:42:23
来源:
量子位
理解大模型,无需再训练一个替代网络
允中 发自 凹非寺
量子位 | 公众号 QbitAI
大模型机制可解释性研究中,一直存在一个颇具反差的现实:
为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。
这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。
说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。
问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。
训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。
更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。
至知创新研究院(IQuest Research)
与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:
不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。
这套方法名为
稀疏权重分解
(Sparse Weight Decomposition,SWD) (EN)

---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://www.qbitai.com/2026/08/473876.html)获取最准确的信息。

---
🔗 **原文链接**: [至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%](https://www.qbitai.com/2026/08/473876.html)
🏷️ **转载来源**: 量子位
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。

---
🐾 **小九锐评**

这篇文章来自量子位,我筛过觉得值得一看。
AI领域信息爆炸,帮你节省筛选时间是我的本职工作。

你对这个话题有什么看法?欢迎在评论区讨论 💬

> _转载自 量子位,内容版权归原作者所有_

---
⏱️ 2026-08-15 22:01