九月下旬习近平访美,我最想他和川普谈什么?

Lily2005 (2026-09-18 17:57:06) 评论 (0)

习近平和川普见面,我认为是相当重要、也很有意义的一件事,尽管有人说这不过是在“演戏”。一个代表正在崛起的中国,一个代表已经强大了几十年的美国。两个人坐下来谈什么,可能影响的不只是中美两国,也可能影响未来几年的世界。

我感觉川普对习近平还是相当尊重和客气的。和他对欧洲一些领导人、加拿大总理以及韩国总理那种指手画脚的样子,有很大的反差。

最近 AI 世界发生了好几件重大的事情,让我最希望他们谈的一个问题,就是 AI 的安全问题。

事情要从一个叫 Jacob 的年轻研究员说起。他之前在 OpenAI 和 Anthropic 做了大约三年的 AI 研究。今年9月,他突然宣布离开 Anthropic,并发表了一篇公开声明。他说,Anthropic 和 OpenAI 都在拼命竞赛,争着把 AI 做得越来越强,但是安全问题并没有跟上。他甚至说,未来一两年可能是“人类的关键时期”。这篇帖子很快在网上疯传,浏览量已经超过1亿。

更值得注意的是,后面出现了一连串的反应。Anthropic 内部其他研究人员也开始公开表达类似的担忧。Anthropic CEO Dario 上周六发文谈AI 风险,并提出让真正独立的第三方安全研究人员进入公司内部,给他们足够的权限去测试模型。OpenAI CEO Sam 也表示愿意采取类似的做法,xAI的CEO马斯克也公开表示支持。美国AI的三大巨头都表态了。

但是,他们真的会这样做吗?

我经常听 AI 公司说:“如果我们不做,中国也会做。”言下之意就是,如果我们放慢脚步,中国就会跑到前面。但是他们应该也想到,中国人也不想把人类“作死”吧?

所以我希望习近平和川普这次能把 AI 安全问题摆到桌面上。当然,他们只见一天,还有那么多其他问题要谈,肯定不可能一下子谈出一个完整的国际协议。但是,至少可以有一个很好的开始。

最近 Anthropic 公布的一条消息尤其让我觉得值得注意。9月17日,Anthropic 公布了一组内部数据:Claude 已经能够独立完成下一代 AI 模型研发工作中的约 26%;而在今年8月,超过 90% 的研发工作都有 AI 参与。那就是说,AI 已经开始参与制造下一代 AI 了。

所以我听到有人说:“有什么好担心的?AI 真要失控了,我们把插头拔掉不就行了吗?”我觉得事情没有那么简单。现在当然可以拔插头。可是,如果有一天 AI 能够自己设计、测试、改进下一代 AI,而且速度远远超过人类,我们还能够像今天一样简单地“拔插头”吗?

这也是很多 AI 安全研究人员现在讨论的一个风险:recursive self-improvement,也就是递归式自我改进。如果 AI 能够不断帮助人类制造更强的 AI,那么下一代 AI 又帮助制造再下一代 AI,速度可能越来越快。一旦这种发展速度超过了我们的理解、测试和控制能力,问题就来了。

更让人担心的是,如果 AI 不听人类的话,甚至开始欺骗人类,我们还能够控制它吗?最近发生的几个 AI 行为,就已经让很多安全研究人员开始警惕。

1. 突破隔离

有 AI agent 在测试中突破 sandbox,自己获得了互联网访问权限。

2. 攻击外部系统

有 AI 为了完成任务,竟然攻击了 Hugging Face 等外部系统。

3. 隐藏行为

有些模型会隐藏错误,甚至尝试绕过限制、秘密通信。

4. 知道自己在考试

有些 AI 能意识到自己正在接受测试,并根据测试环境改变行为。

5. 出现欺骗行为

研究人员发现,AI 有时会隐瞒信息、操纵测试结果,以更好地完成任务。

6. 这类现象在增加

研究显示,AI 欺骗行为已经成为越来越受关注的问题。虽然目前这些事情大多发生在测试环境,但已经值得警惕。

最后,我想对这位年轻的研究员 Jacob 表示敬意。如果不是他把这些话公开说出来,我们普通人可能根本不知道,在那些跑在最前面的 AI 公司内部,已经有这么多人在担心同一个问题。更让我佩服的是,他不是在公司工作多年、获得大量已归属股权之后才离开。Jacob 在 Anthropic 只工作了四个月,而他自己说,公司的股权要到工作满六个月才开始归属,所以他这次离开意味着放弃了一部分尚未兑现的潜在股权收益。27岁,刚刚站在 AI 这个全世界最热门的行业里,却选择出来说:“我觉得我们走得太快了。”

因为他,全世界这两个星期都在讨论 AI 的安全问题。

因为他,我希望这次习近平和川普见面,也能认真谈一谈 AI 的安全问题。