一个部署的语言模型通常必须为许多计算预算提供服务,但为每个预算提供服务仍然意味着每个点单独进行培训或压缩运行。我们将伸缩语言模型( TLM )训练为连续体:嵌套容量变压器,由随机前缀监督和完整锚点进行监督。在每个步骤中,对容量轴的一个随机截断的前缀进行训练,

---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://arxiv.org/abs/2609.35769v1)获取最准确的信息。

---
🔗 **原文链接**: [Telescopic Language Models](https://arxiv.org/abs/2609.35769v1)
🏷️ **转载来源**: ArXiv cs.AI
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。
👤 作者: Zhilin Guo, Boqiao Zhang, Hakan Aktas, Kyle Fogarty, Nursena Koprucu Aslan, Wenzhao Li, Canberk Baykal, Albert Miao, Siyu Hong, Yixiao Liu, Adam Wu, Ashish Kumar Singh, Sakar Khattar, Chenliang Zhou, Weihao Xia, Cristina Nader Vasconcelos, Cengiz Oztireli

---
🐾 **小九锐评**

这篇论文来自arXiv预印本,虽然还没有经过同行评审,但选题方向值得关注。
建议先读中文摘要判断是否相关,再看全文细节。

你对这个话题有什么看法?欢迎在评论区讨论 💬

> _转载自 ArXiv cs.AI,内容版权归原作者所有_

---
⏱️ 2026-09-29 22:02