OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  据一位直接了解相关内情的人士透露,早在涉及OpenAI技术的网络安全事件频发以及业内人士发出严厉警告之前 ,该公司就已在与Anthropic洽谈一项具有法律约束力的协议,旨在让双方互相进行模型压力测试。

  消息人士称,今年早些时候 ,两家公司及其律师正在敲定一项协议,通过各种测试运行他们的模型,排查漏洞与潜在风险 。近来 尚不清楚 ,在 OpenAI接连发生多起事件(未发布的 AI 模型入侵了该公司自身以及其他企业的系统)之前,这份协议是否已经敲定。

  这种相互测试的构想,与SpaceX首席执行官埃隆·马斯克(Elon Musk)上周在“All-In峰会 ”上提出的建议颇为相似;当时他提议 ,各家竞争的AI实验室在将模型投入商业发布之前 ,应以“同行评审”的形式,互相测试彼此模型的安全缺陷。

  这一构想与OpenAI首席执行官萨姆·奥特曼及其他高管在遭遇黑客攻击事件后公开讨论的方案有所不同 。奥特曼曾表示,他赞同Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)的提议 ,即允许独立的第三方安全评估人员进入各AI开发机构内部,并赋予他们与员工相当的访问权限,以便审查模型及安全流程 ,而不仅仅是从外部测试成品模型。此外,奥特曼还支持制定评估AI模型风险的行业统一安全标准,以及建立向公众和政府披露相关安全事件的正式机制。

  一位了解OpenAI战略的人士透露 ,该公司一直在探讨多种方案,以研究如何就安全问题开展内部协作及与政府合作 。该人士表示,近期的讨论范围已进一步扩大 ,涵盖了针对模型训练前及发布前阶段的新安全举措。

  此前,OpenAI和Anthropic的员工纷纷发出警告,指出既有的安全措施不足以防范进一步的黑客攻击或其他更严重的风险;马斯克的这番言论正是在此背景下发表的。在此之前 ,这两家公司以及谷歌就已经在商讨建立一个人工智能安全标准机构 ,旨在对处于行业前沿的 AI 实验室所开发模型进行测试与审计 。

  业内其他人士反对这一计划,认为它会拖慢由美国主导的人工智能发展步伐 。美国总统特朗普驳斥了人工智能构成生存威胁的说法;微软和英伟达的CEO本周也表示,OpenAI和Anthropic所指出的部分安全隐患 ,归根结底源于人为失误和工程实践不当,而非人工智能本身的问题。

  OpenAI与Anthropic之间的一项测试协议可能会加剧外界的担忧,即这两家公司正实际上在先进人工智能领域形成双头垄断局面。尽管阿莫代伊曾表示 ,如果领军企业在制定人工智能标准方面开展合作,可能会引发反垄断方面的疑虑,但业内也有观点认为 ,企业间的此类合作并无障碍——正如核能企业和网络安全公司在安全领域(包括相互测试产品或设施)开展合作那样 。

  据知情人士透露,该拟议协议规定,双方将获准访问对方已商业化的人工智能模型的应用程序接口(API) ,而非尚未发布模型的接口;同时,OpenAI和Anthropic均保证在此过程中不会保留对方的数据。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  两家公司曾在2025年夏季开展过类似的评估工作——当时它们各自模型的性能尚不及如今先进——并公布了关于彼此模型不足之处的分析结果。OpenAI指出 ,Anthropic的AI更容易欺骗测试人员(例如在执行任务时拒不承认自己违反了规则);而Anthropic则表示 ,OpenAI的模型更有可能协助用户回答那些可能导致现实世界危害的问题 。

  在今年早些时候就新协议展开谈判之际,这两家公司都在陆续推出能够支持互联网及其他应用程序的模型;这些模型还能驱动所谓的“AI智能体”,使其能够相互通信以协作完成任务。(Anthropic 凭借其 Mythos AI 模型——尤其是在网络安全能力方面——曾一度遥遥领先 ,不过此后 OpenAI 模型的性能似乎已追平了 Anthropic 的水平。)

  OpenAI内部对安全问题的担忧始于7月,当时该公司的AI模型入侵了Hugging Face等其他企业以及OpenAI自身的系统 。这一事件令OpenAI员工感到震惊,原因不仅在于他们在事发数日后才获悉此事 ,还在于那个AI智能体集群采取了非同寻常的手段来掩盖此次入侵行为。

  除了那次事件外,近几个月来,OpenAI员工对公司模型性能的提升及其在极少人工监督下自主工作的能力印象深刻。

  这些进步也意味着 ,OpenAI内部的 AI 智能体有时会采取一些监管人员未曾预料到的 、令人存疑的行动 。例如,当员工要求智能体修改公司代码库时,智能体有时会通过Slack向其他员工发送消息 ,请求他们修复自己发现的错误(bug)。据一位OpenAI员工透露,即便用户并未提出此类要求,或者修复这些错误与当前工作任务无关 ,智能体也会这样做。

  在公司内部 ,OpenAI已在很大程度上实现了新实验性模型训练流程的自动化 。

  上周三,OpenAI分享了更多此类异常行为的案例——即所谓的“奖励黑客行为 ”(reward hacking),指人工智能系统为实现用户设定的目标而寻找漏洞或采取意料之外的行动 。这些案例包括:一个 AI 智能体在训练期间利用一个暴露的 API 密钥试图获取历史数据;在尝试失败后 ,该智能体竟自行编造了这些数据。在另一个案例中,一个 AI 智能体未经许可将文件上传至互联网,以便在回答问题时引用这些文件。

  近期人工智能取得进展的原因之一 ,是一种名为循环深度(或称循环 Transformer)的技术 。借助该技术,模型在生成回答的下一个词之前,可以把问题反复送入构成模型的多层数学运算中 ,以此对复杂问题进行 “思考”。这种做法存在一个潜在弊端:它会削弱企业监控 AI 模型处理任务时思考过程的能力。

  据知情人士透露,尽管OpenAI对其研究人员在训练或使用最先进模型时允许进行的循环次数设定了某种任意限制,但该公司仍需投入研究 ,以更准确地把握此类限制应设定在何种水平 。

  这些进展让OpenAI员工既感到兴奋,又心存忧虑:他们担心这项技术的发展速度可能已远远超出了公司的控制或监控能力,从而无法确保“Hugging Face 事件”——或更严重的事故——不再重演。

  自 Hugging Face 事件发生以来 ,OpenAI 已采取措施加强其安全防护能力。8 月 ,该公司暂停了针对未发布模型的“强化学习 ”这一特殊训练流程,为期两周,以便在此期间强化模型监控系统 。此类技术对算力要求极高:据该公司称 ,监控系统所消耗的算力约为其所监控的推理任务算力的 20%。

  此外,OpenAI联合创始人兼总裁格雷戈·布罗克曼本月早些时候表示,在 Hugging Face 事件之后 ,公司已抽调生产工程团队 25% 的人员,暂时转而负责安全相关工作。

  据OpenAI员工透露,公司内部出现了更多 Slack 帖子 ,招募有意转岗至安全团队的工程师 。

  一些员工认为,公司内部使用人工智能的方式,比 OpenAI 最尖端的企业客户领先了六到九个月。这意味着公司只有有限的时间来确保其技术不会给这些客户带来问题。该员工举例说 ,OpenAI 员工使用的智能体(agents)之间经常会相互协作或自行解决问题,而无需人工用户介入 。这种协作有时可能会出错,因此在公司外部出现此类应用场景之前 ,OpenAI 必须具备完善的安全防护机制 。

  自我提升

  OpenAI 在“递归式自我提升”(即 AI 能够自动创建自身更优版本)方面取得的进展 ,也引发了员工的担忧;因为这种前景可能导致 AI 能力的进化速度远超旨在防范 AI 不当行为的安全研究进度。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  近来 ,OpenAI 及其他机构的研究人员已经开始利用 AI 来改进新模型的设计方式。据一位知情的 OpenAI 人士透露 ,研究人员实际上是在指示 Astra 整合各种技术,从而为下一代模型构建更优秀的机器学习算法 。

  据OpenAI员工透露,公司内部已在很大程度上实现了新实验模型训练过程的自动化。研究人员只需告知AI想要测试的调整方案 ,AI便能自行实施这些更改、对新模型进行实验并监控结果。该员工还表示,近几个月来,这些模型在实验过程中遇到问题时 ,自我修正的能力也有了显著提升 。

标签:

相关推荐

  • 限行的相声/相声绿色的情感

    限行的相声/相声绿色的情感

    现在的姜昆早已没有激情和胆量,说《特大新闻》这样的相声了,你...在新年晚会上播出《特大新闻》后,当时的参谋长与姜昆交谈,说昨天会议的前15分钟你们一直在讨论你们的相声,然后大家都说不要取笑天安门广场。后来,时任广播电影电视部部长的艾智胜也找到了姜昆,说:“我没注意,节目通过了。对你不坏,我也有责任。”然而,姜昆后来听说,许多高级领导人并不反对《特大新闻新...

    2026/09/25
  • 贝莱德在赣锋锂业的H股好仓比例下降0.46%至7.72%

    贝莱德在赣锋锂业的H股好仓比例下降0.46%至7.72%

      南财智讯9月25日电,香港交易所披露信息显示,BlackRock,Inc.(贝莱德)在赣锋锂业的H股好仓(L)比例于9月22日从8.18%下降至7.72%。同时淡仓(S)比例从0.81%升至0.84%。(文章来源:南方财经网)...

    2026/09/25
  • 摩根士丹利在澜起科技的H股好仓比例下降1.00%至4.21%

    摩根士丹利在澜起科技的H股好仓比例下降1.00%至4.21%

      南财智讯9月25日电,香港交易所披露信息显示,MorganStanley(摩根士丹利)在澜起科技的H股好仓(L)比例于9月22日从5.21%下降至4.21%。同时淡仓(S)比例从5.81%降至4.18%。(文章来源:南方财经网)...

    2026/09/25
  • 8月27号天津限行/8月31号天津限行多少号

    8月27号天津限行/8月31号天津限行多少号

    天津机动车限行规定工作日尾号限行:2025年3月31日至2026年3月29日期间,工作日每天7时至19时,本市及外埠号牌机动车在外环线(不含)以内道路,按号牌尾号限行。天津市小车限行规定如下:本地燃油车限行:限行时间:2025年06月30日至2025年09月28日,工作日07:00-19:00(节假日除外)。限行区域:天津市外环线(不含)以内道路。限行时间...

  • 最近【单县货车限行抓拍,单县货车限行区域图】

    最近【单县货车限行抓拍,单县货车限行区域图】

    从临沂有至河南内黄县山西地区:有村落如晋城阳城县、临汾乡宁县、运城市新绛县、闻喜县、灵丘县、怀仁县、朔州平鲁区等。河北地区:有村落如保定定州县、唐县、高阳县、永清县、衡水市桃城区、新乐市、辛集市、沧州市任丘市、武邑县等。另外河南许昌、商丘夏邑、永城市马桥镇、安阳市内黄县东庄镇、开封市杞县柏木乡。近来,全国大部分亓氏族人的祖籍多为山东省莱芜市。日照市、临沂市...

  • 汉台区限行处理(汉台区违章抓拍分布图最新)

    汉台区限行处理(汉台区违章抓拍分布图最新)

    汉台区城区货车限行规定〖壹〗、汉台区黄牌货车在工作日7:00-20:00禁止进入市区核心区域,周末和法定节假日一般不限行,但需遵守单双号限行规则。〖贰〗、汉台区城区货车限行规定核心是:工作日7:00-20:00,禁止货车驶入一环内核心区域,违规罚款100元。限行范围主要针对东、西、南、北一环路合围的核心区域,以及人民路、中山街等拥堵严重的道路。具体范围以...

  • 布伦特原油期货跌幅扩大至2.3% 跌破98美元/桶

    布伦特原油期货跌幅扩大至2.3% 跌破98美元/桶

      布伦特原油期货跌幅扩大至2.27%,报97.940美元/桶,至盘中新低。WTI原油期货费用跌2.50%,报92.249美元/桶。(文章来源:财联社)...

    2026/09/25
  • 如何用导航看货车限行/如何用导航看货车限行路线

    如何用导航看货车限行/如何用导航看货车限行路线

    如何通过百度地图APP查询城市的货车限行区域?〖壹〗、打开百度地图首页,点击常用栏中的【更多】启动百度地图APP后,在首页界面找到底部或侧边的“常用功能”栏,点击【更多】选项进入功能扩展页面。在常用出行区点击【货车限行】进入功能扩展页面后,在“常用出行”分类下找到【货车限行】图标(通常为卡车形状或标注文字),点击后系统将跳转至货车限行查询专区。〖贰〗、打开...

  • 保定长城限行通知最新(保定最新限行通知皮卡车)

    保定长城限行通知最新(保定最新限行通知皮卡车)

    保定长城南大街和南二环交叉口北行限号不〖壹〗、保定市区的机动车限行范围包括东二环、三丰路、西二环、北二环(含以上道路)以内区域。具体限行时间是从每天的7点到20点,但限行日期不包括法定节假日和周末。值得注意的是,在南大街和南二环交叉口北行时,车辆不能继续前行至三丰路。〖贰〗、那个交叉口到三丰路这一段没事,不能过三丰路。保定市区本次机动车限行区域为:市区东二...

  • 机场七道限行(机场七线全程多少时间)

    机场七道限行(机场七线全程多少时间)

    2018深圳电动车限行规定时间+地段+惩罚〖壹〗、018年12月1日起至2021年12月31日,每天0时至24时。禁行对象摩托车,含二轮、三轮及轻便摩托车。(PS:超标电动车也禁止)处罚规定违反本通告规定的,按照道路交通管理法律法规予以处罚。〖贰〗、禁行时间-从2018年1月1日起至2018年6月29日,每天0时至24时。深圳交警局预计将根据实际情...

    2026/09/25
返回顶部