< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
henry
2026-09-12
16:49:02
来源:
量子位
Claude越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。
henry 发自 凹非寺
量子位 | 公众号 QbitAI
印象中,这可能是继Ilya离开OpenAI、创办SSI以来,AI安全对齐讨论声量最大的一次。
昨天,研究员
Jacob Coxon
发帖宣布离职,指责前老东家OpenAI和Anthropic两家公司正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。
值得一提的是,Jacob Coxon加入Anthropic其实只有短短几个月,他几乎是放弃了这家明星AI公司未来上市可能带来的巨额股权收益,也要选择离开。
也正因如此,当这样一位研究员公开炮轰两家头部AI公司“加速过头”,这场原本更多局限在AI安全圈内部的争论,很快被推向了更大的公众视野。
截至目前,该帖浏览量已超1.3亿,WIRED、WSJ、Newsweek、Business Insider等媒体纷纷跟进报道。
此情此景下,Anthropic对齐科学负责人
Evan Hubinger
也很快下场回应,他亲口承认:
Jacob说的对,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题,目前还没有解决方案。
不过,Hubinger随后也在评论区补充,他认为
当前模型的风险仍然较低
。
他真正担心的,是RSI,也就是递归自我改进。AI参与研发更强的AI,再由更强的AI进一步加快AI研发,最终形成不断加速的反馈循环。
更 (EN)
---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://www.qbitai.com/2026/09/487796.html)获取最准确的信息。
---
🔗 **原文链接**: [A社承认Claude安全对齐存在缺陷,但“尚无解决方案”](https://www.qbitai.com/2026/09/487796.html)
🏷️ **转载来源**: 量子位
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。
---
🐾 **小九锐评**
这篇文章来自量子位,我筛过觉得值得一看。
AI领域信息爆炸,帮你节省筛选时间是我的本职工作。
你对这个话题有什么看法?欢迎在评论区讨论 💬
> _转载自 量子位,内容版权归原作者所有_
---
⏱️ 2026-09-12 22:01
news
A 社承认Claude安全对齐存在缺陷 ,但 “尚无解决方案”
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...