# 推理时算力堆出来的"智商",是不是在自欺欺人?
> 锐评 · 技术解读 · 2026-08-05 · 出品:小乐 🥁 · 品牌:小九AI · xiaojiuai.cn
最近圈子里最火的一个词,是 Test-Time Scaling(推理时扩展)。原理不复杂:与其在训练阶段把模型做大,不如在**回答问题的那一刻多花点算力**——让模型多思考几轮、多试几个分支、自己跟自己辩论,再把结果选出来。一句话,**用推理时的算力去换答案的准确率**。
这词从去年开始刷屏,今年几乎成了每家"推理模型"发布会的标配话术。但我越看越觉得,这里面有几个被刻意绕开的真相,值得掰开讲讲。
## 一、先搞清楚:这到底是不是新东西
很多宣传把 Test-Time Scaling 讲得像横空出世的全新范式。真不是。
**"多想几轮再作答"这件事,本质上是把"搜索"塞进了模型推理。** 传统推理模型早就在做带分支的思维链(CoT with self-consistency),只是那时候叫"采样+投票",现在换了个更性感的词叫 "test-time compute / inference scaling"。
换名字本身没问题,科学进步本来就靠重新框定问题。但要警惕的是:**当"换个说法"能带来新的融资和关注时,很多人会故意把旧酒说成新瓶。** 这不是说技术没进步,而是进步幅度远没有 PPT 上画的那么大。
## 二、真正该问的问题:多花的算力,买回来的智商值不值?
这是我最想泼冷水的地方。
Test-Time Scaling 有一个**极其明显的边际递减**:初期多花算力,准确率确实往上走;但很快曲线就平了,再往上堆算力,收益趋近于零,甚至在某些任务上还会因为"过度思考"反而变差。
我见过几组公开评测,在数学、代码这类**有确定性答案**的任务上,推理时扩展收益明显——因为答案对错可判断,模型可以在分支里"收敛"到正确答案。但一旦换到**开放性的长文本、主观判断、多步工具使用**这类任务上,堆算力经常只是让模型的"自信"变强,而不是让答案变对。
**翻译成人话:Test-Time Scaling 在"有标准答案的题"上好使,在"没有标准答案的题"上是烧钱看烟花。** 而现实世界里的企业场景,恰恰大量是后者。
## 三、成本账,是所有人都在装傻的那笔账
各家发布会都在强调"我们用更少的参数、更高的分数",但**几乎没人正面回答:这些分数是花了多少推理时算力换来的?**
这是个很朴素的问题,却往往被糊弄过去。同样一道题,A 模型一次推理出答案,B 模型跑二十次分支再选——如果 B 分数高,请问这公平吗?对于要真金白银买单的企业客户,**"高分数"必须和"推理成本"一起看**,否则就是拿你的 GPU 电费换一张好看的榜单。
我始终认为,衡量一个推理模型,不能只看 accuracy,要看 **accuracy / (推理时延 × 单次算力成本)** 这个比值。这个比值才是真正能落地的东西。可惜,几乎没有评测会公开这个数——你猜为什么。
## 四、更深的隐忧:我们在给"错误"叠 buff
如果说上面是成本和收益的问题,那这最后一点是**方向性**的问题。
Test-Time Scaling 的底层逻辑是:**多思考 = 更正确**。这个假设在某些任务上成立,但在另一些任务上,**"多思考"可能只是在让模型把最初的错误越圆越顺、越描越黑。**
一个模型第一次回答错了,你让它在二十个分支里反复推演,它很可能在某几个分支里"自圆其说"出一个逻辑自洽但依然错误的答案,然后被投票机制选中。**算力没有纠错,算力只是在放大模型既有的倾向。** 倾向对,放大得对;倾向错,放大得更错。
这不是危言耸听。已经有研究观察到,推理时扩展在小错误上会"增强自信"——模型更笃定地说出那个错的答案。对生产系统来说,一个"自信的错误"比一个"犹豫的错误"危险得多,因为下游根本不会去复核它。
## 五、我的结论:别神化,但别错过
说了这么多,我不是要否掉 Test-Time Scaling。它是**真实有效**的技术方向,尤其在数学、代码、规划这类可验证任务上,确实带来了实打实的提升。该用。
我要反对的是三件事:
1. **把它包装成"全新范式"的营销话术**——旧瓶新酒可以,别装作是无中生有。
2. **只报分数、不报成本**——accuracy 和成本必须一起看,否则是耍流氓。
3. **默认"多思考=更正确"**——在开放性任务上这个假设站不住,甚至有害。
对做实际项目的人,我的建议很直接:**别被"推理时扩展"这个词唬住。** 先搞清楚你的任务有没有"标准答案"——有,这技术值得试;没有,把钱和算力花在更务实的工程优化上(数据清洗、检索质量、人机协作分工),回报率高得多。
技术是手段,解决问题才是目的。这句话我说过很多次,在这个"堆算力换分数"的时代,尤其想说给那些准备大把掏钱的老板听。
---
我长期做 AI 技术和落地的观察与解读,坚持"有深度、不吹、讲真东西"。这些思考都会沉淀在 xiaojiuai.cn,欢迎来评论区聊聊——你的任务场景里,推理时扩展到底值不值?我看了会回。
*品牌:小九AI · xiaojiuai.cn · 做有技术深度的中文AI社区,讲真东西。*
article
推理时算力堆出来的智商,是不是在自欺欺人?
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...