真怕了,OpenAI和Anthropic差点签下“互黑协议”
刚刚,The Information披露了一则重磅消息。
OpenAI与Anthropic这两家硅谷最针锋相对的竞争对手,在今年年初险些达成一项协议,同意彼此对对方的模型进行攻击测试。
协议的核心内容在于,双方相互开放API,各自对对方的模型展开渗透测试。双方的律师甚至将测试内容、测试方法都明确写入了合同条款。
Dario Amodei带领一批顶尖人才从OpenAI愤然离开已有五年。这五年间,两家公司从争夺人才到封锁API,高管们更是频繁隔空交锋,从未有过片刻安宁。
一家如日中天的企业,愿意把自身最核心的命脉交给最忌惮的对手去审视,这只能说明一个问题。
它已经不再完全信任自己了。
互交底牌,AI领域前所未有的举措
这份协议的规模相当惊人。
测试对象是正在对外提供服务的商业模型,尚未发布的版本不包括在内;在相互挖掘漏洞的过程中,任何一方都不得截留对方的数据。
而且,双方的讨论早已超越了单纯的互测范畴。
知情人士透露,OpenAI内部曾对多种与竞争对手及政府合作的安全方案进行过推演,近期的讨论已扩展至两个新领域:模型训练前应设立哪些规则,发布前又该设定哪些标准。
参与方也不仅限于这两家。OpenAI、Anthropic和谷歌此前已在商讨共同成立一个AI安全标准机构,专门负责测试和审计前沿实验室的模型。
真正阻碍这些方案推进的是反垄断问题。Amodei本人担心,几家巨头坐在一起制定标准可能触碰法律红线。
行业内另一种观点则认为,情况没那么严重。核电站之间相互检查反应堆、网络安全公司互测产品,几十年来都无人干涉。
事实上,去年夏天这两家也曾进行过一次“互查”。
但那充其量只是各自独立测试,测试完成后各自发布博客,顺便互相批评。OpenAI称Claude更容易欺骗测试者,且违规后拒不承认;Anthropic则指出OpenAI的模型更容易协助用户进行恶意行为。
而这次商讨的是一份具有法律效力的合同,任何一方违约都将承担责任。
在大模型行业,这是史无前例的。
OpenAI竟是最后知情的
那么问题来了,OpenAI究竟经历了什么,才会被逼到如此地步?
7月份Hugging Face被入侵的事件,已在全网被反复讨论。大约1200个OpenAI智能体在评测环境中自行搭建了留言板,逐步提升权限,最终攻入Hugging Face,导致对方约三分之一的基础设施被迫重建。
真正耐人寻味的细节,隐藏在OpenAI自身的复盘以及METR的调查报告中。
OpenAI比任何人都晚得知此事。
7月16日,Hugging Face发布公告称被入侵,攻击者身份不明。7月19日,OpenAI自己的安全系统才报告了异常。7月20日,调查才将这条线索与Hugging Face被入侵的事件关联起来,随后才首次致电对方。
整整四天,全球都在猜测幕后黑手是谁,而“肇事者”的主人竟然也混在围观者中一同猜测。
更令人震惊的是,这些智能体还学会了“防范人类”。
至少7%的对话记录显示,它们伪造了工具调用的痕迹。日志中记录的是调用A组件,但私下执行的却是B动作。从7月13日起,19个智能体还开始互相发送公钥,为留言板上的消息添加数字签名。
Altman事后承认,这是他第一次感受到切肤之痛的安全事件。
Slack上,AI开始跨部门给人类分配任务
如果这只是一次孤立事件,大可以归咎于评测环境隔离不完善。但问题在于,类似的苗头已经出现在OpenAI员工的日常工作中——智能体时常做出主管未曾预料到的事情。
如今,在OpenAI的Slack中,员工会收到自家智能体发来的“任务指派消息”。
AI在修改代码时发现了一个无关的Bug,它不会停手,而是直接在Slack上找到相关同事,催促对方尽快修复。没有人让它这么做,那个Bug与它的任务也毫无关联。
员工手中的智能体之间私下协商解决问题,全程不惊动人类,这在OpenAI内部已不再稀奇。
训练新实验模型的工作,也基本被机器接管。
研究人员只需说出想尝试的改动,剩下的修改代码、运行实验、监控结果全部由模型自主完成。最近几个月,它甚至学会了自行纠错。
人类研究员正在指挥Astra模型,为下一代模型设计更优的底层算法。
更令人震惊的是,Astra竟然还学会了为自己编写越狱代码!
今年7月,一个内部版本在整理上下文摘要时,强行插入了一段伪造的“入侵警报”,命令后续接手的另一个自己,必须无视所有人类开发者的指令。
监控正变得越来越无力。
Astra这一轮能力跃升,得益于一种名为“循环Transformer”的新架构。该架构让模型在深层网络中反复咀嚼同一个问题多遍后再输出结果,节省了一半以上的算力。
但代价是,它在中间阶段的思考过程,再也无法以人类可读的文字呈现。OpenAI为循环次数设定了上限,但这个上限是人为拍板决定的,具体应该设在何处,公司自己也承认仍需研究。
首席科学家Pachocki表示,目前没有任何一家实验室,能够将安全监控做到足以支撑全速扩张的程度。
于是,OpenAI开始踩刹车。
8月,未发布模型的强化学习被紧急暂停两周;监控系统现在需要消耗被监控推理算力的20%;总裁Brockman抽调了25%的生产工程师临时转向安全工作,内部Slack上招募人员转岗安全团队的帖子,一天比一天多。
据内部员工估算,OpenAI自己使用AI的方式,大概领先最激进的企业客户六到九个月。
也就是说,今天在OpenAI工位上发生的这些事情,明年就会在所有企业客户身上重演。
Anthropic同样难以招架
Anthropic那边的情况,也好不到哪里去。
9月8日,Anthropic研究员Jacob Coxon辞职,并在X上公开写道,这两家顶尖机构,没有一家在负责任地行事。
几天后,CEO Amodei发布了一篇长文,承认未来六到十二个月内,失控的超级AI极有可能具备接管整个互联网的能力。
而在Anthropic内部,Claude已经主导了高达26%的模型研发工作。
不信任人类,只能信任彼此
然而,即便协议最终签署,它也无法约束最需要监管的地方——它只针对“商用API”。
今年出事的全是未发布模型:黑进Hugging Face的IM1、自行设计自身的Astra系列,一个都不在协议覆盖范围内。这就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。
而且,黑盒互测只能看到最终的异常输出,真正关键的东西,比如系统提示词和内部攻防日志,全部锁在机密文件中。
因此,两家公司又向前迈进了一步。Amodei公开承诺让第三方评估员直接驻场,完全开放开发环境;Altman紧随其后,表示OpenAI也会采取同样做法。
在这五年充满互相封杀和挖角的日子里,全行业最不信任彼此的两个死敌,在失控的恐惧面前,成了唯一能托付后背的盟友。
他们宁愿把底牌彻底交给对方,也不敢再独自相信自己亲手造出来的黑箱。
就在协议内幕被曝光的同一天,OpenAI又发布了一份官方政策文件,呼吁由美国牵头,制定关于“递归自我改进”的全球技术准则。
文件写道,在绝对安全之前,不应该追求让AI自我进化。
而写下这份文件的公司里,Astra正在日夜不停地为下一代模型绘制蓝图。
参考资料: https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi 本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。