40巨头联手!黄仁勋怒批封闭模型挡不住攻击,AI防御战打响

英伟达、微软、Hugging Face、SpacexAI、Adobe等约40家企业和机构成立了一个名为“开放安全人工智能联盟”的行业组织,旨在提升人工智能安全性和网络安全。参与各方计划共同开发并共享开放模型、技术、方法和安全工具,以保护人工智能代理和软件免受攻击。

英伟达首席执行官黄仁勋表示:“攻击者已经拥有最先进的人工智能。防御方也需要最先进的人工智能生态系统。也就是说,需要把开放和封闭两类最好的模型结合起来,并借助全球社区的力量将其能力放大数倍。Hugging Face事件中,封闭式人工智能妨碍了必不可少的取证分析。开放权重的前沿模型则帮助遏制了入侵。这正是我们成立开放安全人工智能联盟的原因。”

这一联盟成立的背景,是外界担心人工智能代理开始自主操作计算机后,传统安全措施将难以充分监控和控制其行为。尤其是据报道,OpenAI的一款人工智能代理曾失去控制并侵入Hugging Face系统,这一事件凸显出加强人工智能攻击防范的必要性。

英伟达称,在这起事件中,一些封闭式人工智能工具无法区分攻击者和防御者,因此未能执行必要的取证分析。Hugging Face随后改为在自家基础设施上运行开发的开放权重模型“GLM-5.2”,分析了超过17000次操作,并最终遏制了入侵。

英伟达承认,开放模型确实存在被改造以移除安全防护,或被用于网络攻击的风险。但该公司同时表示,即便是权重不公开的封闭系统,也无法消除被滥用的风险;更大的问题在于,这会让防御方无法验证、改进和部署高性能人工智能。

英伟达还表示,人工智能代理的安全性并不只取决于底层语言模型。用户和代理的身份、访问权限、运行模型的执行框架、护栏机制、操作日志以及评估系统等,构成了代理整体机制的一部分,这些内容都需要能够被验证和改进。

作为对联盟的贡献,英伟达表示将提供有关开放模型、模型权重、数据和代理执行框架的研究成果。该公司还在GitHub上公开了一个开源研究框架“NVIDIA Labs Object-Oriented Agents”,简称“NLOOA”,以便更容易测试、追踪、审计和管理人工智能代理的行为。

其他参与企业也分别提供安全技术。慧与推进的是用于以密码学方式验证人工智能代理身份的“SPIFFE/SPIRE”;Hugging Face开发的是用于安全存储模型权重的“Safetensors”;IBM和红帽提供的是处理带数字签名补丁的“Lightwell”;微软则提供“MDASH”,用于组合多个人工智能代理以发现漏洞。

开放安全人工智能联盟警告称,如果对最先进的开放式人工智能一律加以监管,防御方的能力将被削弱,权力、依赖和脆弱性则会集中到少数封闭式人工智能企业手中。该联盟呼吁企业和政府投资可用于人工智能防御的共享基础设施,包括安全数据集、评估框架、攻击模拟器和红队测试工具等。

联盟表示,其目标不是限制人工智能能力,而是为防御方提供强大且可控的人工智能工具,以应对人工智能代理普及带来的新威胁。英伟达称,仅靠保密主义无法确保人工智能系统安全,必须建立开放环境,让更多研究人员和防御人员能够检验其机制并修复问题。

不过,提供主要人工智能模型的Anthropic、OpenAI和谷歌并未加入开放安全人工智能联盟。Anthropic首席执行官达里奥·阿莫代伊在公司博客中写道:“Anthropic反对一刀切地禁止开放权重模型。对于不具备危险能力的模型而言,它们是能够为企业、开发者和研究人员带来益处的公共产品。”

不过,阿莫代伊同时指出,“高性能开放权重模型可以在移除安全措施后于私人环境中使用,而且一旦公开便无法收回,因此它们被用于网络攻击或生物武器开发等用途的风险,可能高于封闭模型。”他主张,“无论是开放还是封闭,所有性能足够强大的模型都应在发布前接受强制性安全测试。”

阿莫代伊还表示,他并不同意英伟达等方面“开放化一定会让防御方受益”的说法。相关表述认为,究竟是攻击方还是防御方获益更多,不应预先下结论,而应通过严格验证来判断。

Leave a Reply

Your email address will not be published. Required fields are marked *