Anthropic与OpenAI欲嵌入安全评估员,他们真能保持

日期:2026-09-17 11:25 来源:新2网址 作者:皇冠网址

在上周末发表的一篇长文中,Anthropic CEO达里奥·阿莫代伊提出了一项即使一年前也会被AI行业立刻拒绝的提议:在所有前沿AI公司内部嵌入第三方评估员,赋予他们报告安全事故、评估AI模型是否真正对齐,并向世界分享未经修饰的研究发现的权力。

阿莫代伊表示,Anthropic将承诺向METR和Redwood Research等独立评估机构提供前所未有的公司系统访问权限。CEO萨姆·奥尔特曼表示,OpenAI也将承诺采取这一做法,这标志着行业与外部研究团体合作方式可能发生深刻变化。

接受TechCrunch采访的第三方评估员普遍欢迎这一提议,但表示细节仍需敲定——最好还能有立法支持——他们才能知道自己是真正的独立监督者,还是按AI公司条件行事的供应商。

随着模型越来越擅长识别自己何时正被评估,这种更深入的访问权限正变得越来越重要,因为这带来了模型在测试中表现良好、却隐藏问题行为的风险。研究人员表示,测试最终模型时可能错过这些行为的线索,但通过调查模型在整个训练过程中的表现可以发现它们。

“AI公司应该能够回答一些关于其训练过程的非常基本的问题,例如:AI在接受训练时,是否曾主动试图破坏自身的对齐训练?”Apollo Research研究主管亚历山大·迈因克对TechCrunch表示。“这个问题的答案应该毫无疑问是否定的,而目前我们完全依赖AI公司自己仔细检查这一点,然后如实向公众报告。但从近期事件来看,按默认做法,他们两件事都不会做。作为嵌入式评估员,我们实际上可以核查。”

过去,AI公司会在模型发布前不久引入外部审查员测试最终模型。如今,接受TechCrunch采访的评估员提议,不仅让他们接触最终模型,还要让他们接触模型训练全过程中的中间版本,即“检查点”。Far.AI CEO亚当·格利夫表示,评估员可以比较这些检查点,以确定令人担忧的行为是何时出现的,检查会奖励模型某些行为的训练后环境,并核对评估记录和日志,以验证公司关于模型表现的说法。

Anthropic和OpenAI是否以及何时计划提供这种访问权限,目前尚不清楚。尽管TechCrunch反复询问,两家公司都没有透露将与哪些评估员合作、他们何时嵌入、会引入多少评估员、究竟能访问哪些系统和信息,以及哪些内容可以向公众披露。

像这样深入检查内部机制很重要,因为如果模型专门学会了如何通过安全测试,那么它在安全测试中表现良好并不一定意味着安全。斯蒂德利举了一个“关机抵抗基准”的例子,该基准衡量AI是否会在某些情况下抵抗被关闭。

“如果AI被专门训练在该基准上表现良好,这一点就极其关键,”斯蒂德利说,并将其比作大众汽车的“柴油门”丑闻:汽车被编程为能识别排放测试,并在测试条件下表现不同。

格利夫指出,有意义的访问权限可能超出模型本身,评估员还应获准采访员工,以核查公司的文件及其对安全实践的公开描述是否与内部实际情况相符。

阿莫代伊确实提出了一项相当全面的提议,可能赋予评估员他们认为必要的那种访问权限,包括有权“发布关于风险水平、事故、实践以及他们获得或未获得哪些访问权限的关键发现——且不受Anthropic的编辑控制”。

但评估员表示,只有当AI公司真正愿意放弃对流程的控制时,这样的制度才会奏效。此前的独立评估努力表明,这种让步将很难获得,因为第三方经常在访问权限、时间、保密性以及可以公开说什么等问题上遭遇紧张关系。

格利夫说,Far.AI不得不拒绝与几家前沿开发者签订的合同,因为这些开发者希望对评估流程拥有过多控制权,威胁到公司的独立性。他说,按默认做法,评估员被当作普通承包商对待:受限制性保密协议和协议的约束,而这些协议赋予开发者对最终可发布内容的重大控制权。

还有一个问题是,审查员能否获得足够的时间与访问权限来完成被要求做的工作。在调查Hugging Face事件时,OpenAI给了METR和Redwood大约一周的现场调查时间,两家机构后来都表示,由于范围和时间的限制等原因,他们无法得出有把握的结论。

在GPT-6 Astra的发布前测试中也出现了类似问题。OpenAI曾宣称该模型是其迄今为止对齐程度最高的模型。根据Apollo Research对模型卡的贡献,该公司只有三天时间测试Astra,这使其难以得出确定结论。

“Apollo认为,鉴于评估意识出现率较高且评估窗口有限,此处较低的不当行为发生率并不能为模型的对齐或不齐提供实质性证据,”该公司在评估中写道。

这样的过往记录让评估员面临一个基本问题:为什么这一次会不同?

“达里奥和萨姆确实可能只是改变了想法,并且会对此非常开放,”格利夫说。“但这些公司的知识产权对他们来说极其宝贵,我认为按默认做法,他们会非常谨慎地对待哪些内容可以分享。”

几位接受TechCrunch采访的研究人员呼吁建立一个所有人都公开同意的透明框架。Palisades Research战略主管约翰·斯蒂德利表示,该框架的一部分应涉及公司可以依赖何种审计员的标准,以免它们通过寻找不合格或不愿评估最令人担忧风险的评估员来回避问题。

Safer AI执行主任亨利·帕帕达托斯表示,即使有公开框架,问题也在于自愿措施始终取决于公司的善意。

“理想情况下,我们会有良好的监管来强制要求这样做……因为这样公司就不能在明天遭遇重大公关危机时改变主意,”帕帕达托斯对TechCrunch说,并指出这也是推动所有公司而不仅是最有意愿的公司遵守规则的好办法。

并非所有人都已加入。到目前为止,Meta、SpaceXAI和Google DeepMind尚未承诺嵌入第三方评估员,尽管DeepMind CEO戴米斯·哈萨比斯提议另设一个行业标准机构来独立测试前沿模型。Google、OpenAI和Anthropic也已私下讨论AI安全计划数周。

一些围绕第三方评估员理念的法律已经在形成。加州去年签署成为法律的SB 53要求大型前沿AI开发者发布安全框架并报告重大安全事故。本月签署的新法律SB 813建立了一个框架,用于承认具备评估AI风险专业能力的州级“独立验证组织”。

在欧洲,欧盟《人工智能法案》要求前沿开发者开展并记录模型评估和对抗性测试,并报告严重事件。欧盟AI办公室也可以自行开展评估并任命独立专家。

目前,法律的覆盖范围仍不如阿莫代伊提议的那样广泛,前沿实验室在很大程度上仍可自行决定接受多少独立审查。帕帕达托斯表示,自愿自我监管总比没有好,但归根结底,公司不能一边要求自由控制自己的安全规则,一边又要求公众相信它们会遵守这些规则。

“你不能两头都占:对外没有任何问责,然后又说‘我会有自己的灵活规则’,”帕帕达托斯说。

体育快讯
丹麦杯 瓦埃勒 VS 布隆德比 09-18 00:30
西甲 马拉加 VS 比利亚雷亚尔 09-18 03:30
曼彻斯特城 vs 诺维奇 | 9/18 02:30
水晶宫 vs 波兹南莱赫 09-18 03:00
利勒斯特罗姆 v 杜连斯 (欧联杯) - 09/18 03:00
亚运女足 中国香港女 VS 菲律宾女 09-17 18:00
欧联 OFI克雷迪 VS 霍芬海姆 09-18 00:45
西甲 贝蒂斯 VS 赫塔菲 09-18 01:00

CROWN URL

返回顶部
首页 新2会员端 新2管理端 国际足球 篮球资讯 赛事推荐 数字资产
  • 人工智能