< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一
思邈
2026-08-24
21:21:22
来源:
量子位
全球大厂开始押注的AI科研,终于有了统一标准
允中 发自 凹非寺
量子位 | 公众号 QbitAI
今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。
同样是今年,OpenAI、Anthropic、英伟达等科技巨头相继官宣入局AI4S这一方向。
这批“跨界”大厂玩家的目标高度一致:不只做科研辅助工具,而是打造能自主跑完“假设→设计实验→执行验证→迭代优化”完整科研循环的“
AI科学家
”。
不只这些科技巨头,有许多公司已经更早入场。成立于2024年的中国企业
深度原理
,是全球最早押注AI自主科研方向的公司之一。
这一赛道背后是一片广阔的“金矿”。一旦AI能够实现自主闭环科研,
AI就能从“卖软件”升级为新材料、新药物等万亿实体产业的生产力基座

国家战略层面也重视这个赛道。AI驱动科学发现已被纳入
我国新一轮科技强国战略

行业越热,一个问题就越绕不开:怎么评价这些“AI科学家”们到底做得好不好?
旧的衡量标尺,已经不够用了
长期以来,行业通用的衡量AI科研水平的标尺是HLE这类闭卷知识考试。
它们本质上是只看最终答案的考卷,只看答案,不会看答案生成的过程。
获得高分的这类AI科研工具,通常让它做一个实际实验就会暴露问题:它们可能可以流畅的引用文献,但无法停下来审视反思异常数据,也可能给出看似头头是道,实际上无法执行的实验方案。
8月19日,一篇名为《Measuring A (EN)

---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://www.qbitai.com/2026/08/478568.html)获取最准确的信息。

---
🔗 **原文链接**: [一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一](https://www.qbitai.com/2026/08/478568.html)
🏷️ **转载来源**: 量子位
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。

---
🐾 **小九锐评**

这篇文章来自量子位,我筛过觉得值得一看。
AI领域信息爆炸,帮你节省筛选时间是我的本职工作。

你对这个话题有什么看法?欢迎在评论区讨论 💬

> _转载自 量子位,内容版权归原作者所有_

---
⏱️ 2026-08-24 22:01