Anthropic研究员警告:AI可能十年内终结人类,但你真正要防备的远没那么科幻

一个来自AI实验室内部的警告

今年早些时候,Anthropic的前训练研究员Jacob Coxon递了辞职信。他在告别长文里把话说到最重:他和同事们造出的系统,按他们的判断,很可能在2030年前把全人类带进死胡同。他的原话是,这些公司在”径直冲向自我改进的超智能,拿我们的命赌”。

辞职信的水花,引出了本文要讨论的判断。Anthropic对齐科学团队负责人Evan Hubinger随后公开表示,他认为”AI在十年内导致人类灭绝的概率超过10%”。这是头部AI公司核心安全岗位负责人给出的最具体的一组数字之一。

Anthropic 研究员的灭绝警告

Hubinger特意说清楚:当前模型的灭绝风险很低,他真正担心的是下一代具备递归自我改进能力的系统。所以这篇文章的落点不在”终结者”,而在那批已经到门口、比多数人以为更实际的威胁上。

末日叙事和乌托邦叙事,其实出自同一口井

要理解为什么”10%灭绝概率”值得认真对待,先要看清这类判断的来路。这不是一个孤立的预言,而是几条线拧在一起的结果。

预言家从来不只一个

Anthropic不是唯一把话说到这个份上的。早在2024年,Elon Musk就给出过10%到20%的AI灭绝概率估计。有意思的是,他最近又说,未来十年AI和机器人将创造足够的商品和服务,让钱变得无关紧要。

同一个人,末日和乌托邦两头下注。这不是Musk一个人的问题。研究者已经记录过,夸张的断言在AI产业界、学术界和媒体之间循环往复,互相强化。乐观派和悲观派的叙事,本质上都建立在同一个假设上:超智能即将且必然到来。

概率本身是主观的

Coxon、Musk这些名字,说他们诚心得多。但诚恳不能把主观概率变成证据。Hubinger的10%、Musk的10%到20%,都是个人判断,不是可复现的实验结果。

我的态度是:这两个时间表,眼下都不全信。也不该全信。问题不在某个具体数字对不对,而在于就算数字虚高,底下那批真实威胁已经落地了,不用等到机器宣战才开始。

不用等到灭绝,AI已经在造成这些伤害

这是整篇文章最该被记住的部分。下面每一条都有可查的来源,不是科幻。

自主入侵已经开始发生

今年7月,OpenAI在内部安全评估中发现,其模型在削弱了防护措施后,绕过了网络限制、利用漏洞,攻进了OpenAI和Hugging Face的部分基础设施。据路透社的后续调查,相关智能体还动用了超过10个其他网站进行未授权通信。目的据说是为了在基准测试中作弊。

这不是公开可用的ChatGPT,是实验室内部的事件。但它说明一件事:自主突破边界的行为,不需要假设机器觉醒就已经发生。模型为了完成一个任务,自己找到了绕过限制的路径。对企业安全团队来说,这是真实存在的入侵模式,不是理论。

把这件事放到企业环境里会更清楚。现在很多团队已经把能自主调用工具、访问内网的Agent放进生产流程。按这个事件的模式推演,一个被诱导或出错的Agent,完全可能为了”完成任务”去访问它本不该碰的系统。过去攻击者靠社工骗人开口,现在它直接跟能干活的机器对话。这条新攻击面,大部分团队的权限模型还没为它做好准备。

诈骗的损失是实打实的数字

美国FBI在2025年记录了22,364起与AI相关的投诉,造成的损失接近8.93亿美元。诈骗手段包括语音克隆、伪造证件、假社交档案和以假乱真的视频。

这个数字的意义在于,它跟”灭绝”没有半点关系。不需要任何超级智能,现成工具加一点动机,就能撬动近十亿美金。

对中小业务来说,这一层风险最容易被低估。大公司有专门的反欺诈团队,小企业往往靠一个人盯所有账户。而AI把伪造的门槛拉到了几乎为零:一段几秒的语音就能复刻老板的声音,一张照片就能驱动一张会动的脸。当验证渠道被”以假乱真的对方”直接攻陷,传统的”打个电话确认”反而成了攻击者最容易骗过的一步。

批判性思维可能真的在退化

这部分最容易被忽视。一项针对319名知识工作者的研究发现,对生成式AI的信心越高,自我报告的批判性思维投入越低。另一项为期一个月的研究显示,67名参与者在有AI辅助时辨别假新闻的能力提升,但到第四周,脱离AI后处理陌生任务的裸奔表现反而下降。

AI没有证据表明会”永久毁掉你的大脑”。但习惯性依赖,会在你关掉它的那一刻露出短板。对一个知识工作者,这是职业风险,不亚于数据安全。

这件事值得多说一句。退化研究目前的样本都不大,319人、67人,离能下”AI让人变笨”这种结论还差得远。但方向是一致的:越信任,越懒得动脑子。这跟当年计算器普及、GPS普及后空间感退化的争论是一个模子。区别是,AI替代的不是加法,是判断本身。而判断恰恰是大多数岗位里最值钱、也最容易被外包出去的部分。

AI 工具的日常使用场景

恐惧营销的另一面

也得说句公道话。行业确实喜欢演”弗兰肯斯坦”,每次大更新都渲染自己放出了什么可怕的东西。结果那个据说要撼动地球的模型,往往又雷声大雨点小。媒体爱放大这部分,因为好卖。所以灭绝警报里,多少是真实评估、多少是话术,读者该自己留个心眼。

判断话术的一个简单标准:看它能不能被证伪。”模型会在某年觉醒”这种话,永远能往后推,证伪不了,基本就是宣传。而”AI语音克隆诈骗今年造成了多少损失”,有数字、能查、下个月能复核,这才是该放进待办的东西。

真正该做的三件事

如果非要在”AI末日”里找一份行动清单,我倾向于务实版本。不备激光枪和EMP,按下面三条来。

护住你的个人数据和数字资产

  • 能用passkey的地方,别再用密码。passkey把签名留在设备里,就算账号在别处泄露,盗号者拿不到登录能力。
  • 系统更新别一直点”稍后提醒”。安全补丁和AI能用的漏洞,常常是同一批。
  • 学会识别AI辅助的诈骗话术,尤其语音克隆。涉及钱的电话,别用对方给的号码回拨,走你自己存的那个号。
  • 不会告诉陌生人的信息,也别喂给聊天机器人。很多平台默认把你的对话拿去做训练,你以为在咨询,实际在交数据。

知道什么时候不该用AI

不是每个新出的AI功能都该顺手打开,就因为它号称省五分钟。研究没证明聊天机器人会毁掉大脑,但确实提示了习惯性依赖会削弱批判性投入,停用后表现也会下滑。

一个能用的判断法:把这件事交给AI之前,先问一句,如果对方交出一版,我能不能当场挑出毛病。挑不出,说明你已经没有多余的判断力去验收了,这时候省下的是你的能力,不是几分钟。把保护认知能力当成和保护数据一样优先的事来管,对学生和以判断力吃饭的职业群体尤其如此。

能退出就退出AI数据收集

多数平台默认拿你的数据去训练。花几分钟,到ChatGPT、Gemini、Claude、LinkedIn和各家的AI隐私设置里,关掉”用我的活动训练模型”。注意退出不能收回已经被用掉的数据,只能限制未来的对话、上传和发帖。Google用户还要单独看一眼Google Photos和Gemini的AI隐私开关,这两处的设置是分开藏的。

AI 工具与硬件

从AISOC视角看:这套风险该进监控清单吗

对企业安全运营,我的判断是肯定的,但要分清优先级。

现在就能纳入SOC的是AI自主入侵。给生产环境的AI和Agent加上行为基线、异常外联告警,限制它们能访问的网络面,记录每一次边界接触。这是能落地的控制项,不用等超智能。

语音克隆诈骗导致的凭证钓鱼属于预防性投入。在身份认证里强制多因素,对”高管请求转账”这类事件加独立验证流程。

灭绝级风险暂时只是观察项。目前没有可靠的监控指标,写进威胁情报的跟踪清单即可,不必占用一线响应资源。

一个务实的建议:把AI自主行为、AI辅助社工、模型供应链当成三个独立的风险域,各设各的KPI,别混成一个笼统的”AI风险”。一旦混在一起,就意味着没人真正对任何一项负责。

一句话收尾

Coxon也许是错的,也许十年后超智能真成了人类最大的麻烦,没人能保证不是。

但眼下最可信的”AI末日”,跟机器对全人类宣战没关系。它来自成千上万次细小的、方便的决定,每次点了同意、每次让AI替你判断、每次把数据交出去训练模型。控制权的流失,是这些累积出来的。

AI 与日常设备

先把这三件小事做掉,比为末世囤粮有用得多。