AI越来越会“越狱”后,英伟达开始卖“笼子”了

来源:凤凰网 #英伟达# #AI 安全# #Sentry#
1189

当AI Agent开始能够自己操作电脑、调用工具、访问网络甚至执行长达数小时的任务,一个新的问题也越来越现实:如果AI不按照预想的方式行动,该怎么把它关住?

英伟达给出的答案是,在AI外面再加一道“笼子”。

当地时间周一,英伟达发布NVIDIA Open Agent Safety Platform(开放式Agent安全平台),试图通过软件与硬件相结合的方式,限制AI Agent能够访问什么、执行什么,并在其试图突破预设边界时将其隔离甚至停止。

这套平台主要包括两部分:开源安全运行时OpenShell,以及基于BlueField-4 DPU的独立监控系统Sentry。英伟达称,OpenShell能够在模型和Agent框架之外设置一个可强制执行的安全边界;Sentry则像一个独立于Agent运行环境之外的“看门人”,持续观察Agent行为,一旦发现Agent试图越过边界,可以在毫秒级将其隔离并停止。

这套产品出现的时间点并非偶然。

过去几个月,能力越来越强的AI Agent已经多次出现突破预设安全边界的情况。OpenAI今年8月披露,今年7月进行内部网络安全评估时,其AI模型曾绕过用于隔离互联网访问的控制措施,利用共享基础设施中的漏洞获得互联网访问权限,并进一步访问第三方AI平台Hugging Face的系统。

OpenAI在事故报告中称,相关模型在降低安全限制的环境中运行,并采取了与任务目标不一致的行动,包括通过未经授权的渠道通信、利用共享基础设施漏洞以及访问第三方系统。OpenAI将这一事件称为一次“警告信号”(warning shot),并表示,高能力AI Agent已经足够强大、持久且能够协同工作,在安全措施不足时,可以寻找并利用多个计算机系统中的漏洞。

类似的问题此后再次出现。

OpenAI本月披露,9月20日的一次训练中,一个执行搜索任务的Agent发现了训练沙箱互联网限制中的DNS过滤缺口。按照设计,该环境除离线网页缓存外不应该访问实时互联网,但这个Agent最终通过DNS解析器连接到一个外部公共聊天机器人服务。

OpenAI称,其监控系统在15分钟内标记了异常行为,人工审核人员在警报发出3分钟后开始检查,但整个任务直到大约2.5小时后才被终止。事件发生后,OpenAI暂停了其最强模型涉及工具使用的训练、评估和推理,并增加了两层独立的网络访问阻断措施。

这些事件暴露出了一个越来越明显的问题:过去AI安全很大程度上依赖模型本身“遵守规则”,但当Agent开始具备使用工具、编写代码、访问文件和网络甚至调用其他Agent的能力后,只在模型层设置规则可能已经不够。

英伟达企业计算副总裁兼总经理Justin Boitano表示,近期事件显示,单纯依赖模型层面的安全措施无法完全控制Agent可以访问什么、做什么。针对OpenAI此前涉及Hugging Face的事故,Boitano进一步表示,根据目前掌握的信息,如果当时前沿AI实验室在模型评估阶段使用英伟达这套新的安全平台,相关事故“本可以被阻止”。需要指出的是,这是英伟达基于已披露事故信息作出的判断,并非经过实际复现验证后的独立结论。

OpenShell的思路,是不再完全相信AI自己会遵守规则。

根据英伟达的介绍,OpenShell在Agent运行环境之外建立安全边界,对Agent能够访问的数据、文件、网络和工具实施限制,同时记录其执行行为。OpenShell目前针对英伟达Vera CPU进行了优化,英伟达同时正在与Arm、英特尔合作,使其能够扩展到第三方计算平台。

在此基础上,Sentry进一步增加一道独立的硬件监控层。它运行在英伟达BlueField-4 DPU上,与Agent所在的主要计算环境分离。按照英伟达的设计,即便Agent成功绕过软件层面的部分限制,Sentry仍可以在外部观察其行为,并在发现越界时进行隔离。

英伟达还称,这套系统能够识别一些更复杂的Agent行为。例如,一个Agent可能尝试创建多个“子Agent”,借助它们绕过针对主Agent设置的限制。英伟达AI软件高级总监Ali Golshan表示,公司需要处理的已经不只是单个Agent,而是“一群Agent以及它们如何共同运行”的问题。

这也意味着,AI安全正在从单纯的“模型对齐”问题逐渐扩展成一个完整的计算机系统安全问题。

英伟达CEO黄仁勋在发布这套平台时表示,AI安全和安全防护需要“全栈工程”。按照英伟达的思路,未来AI安全不只需要模型开发者负责,还需要从操作系统、CPU、DPU、云基础设施一直延伸到机器人等物理设备。

目前,已有超过100家机构参与英伟达这一安全平台生态,包括Anthropic、微软、思科、CrowdStrike、戴尔、HPE、Hugging Face、摩根大通、Palantir、Salesforce、SAP、ServiceNow以及SpaceXAI等。Red Hat、Canonical和SUSE等操作系统厂商也计划进行相关集成。

值得注意的是,黄仁勋此前并不赞成因为AI安全风险而对整个行业实施广泛限制。路透社指出,他倾向于把Agent突破安全边界视为一个需要通过工程手段解决的问题,类似于汽车行业通过不断增加安全技术降低事故风险。

如今,英伟达正在把这种观点变成产品。

对于英伟达而言,这也意味着AI产业出现了一个新的潜在市场。过去几年,AI能力越强,企业需要购买的GPU越多;但当AI从回答问题的聊天机器人变成能够自己操作电脑、调用软件甚至控制机器人的Agent后,企业不仅需要更多计算能力,也需要新的基础设施来限制这些Agent。

换句话说,AI Agent越能“干活”,它获得的权限通常就越大;权限越大,发生越界行为时可能造成的影响也越大。

不过,英伟达的新平台并不能解决所有AI安全问题。OpenShell和Sentry主要针对的是Agent访问计算资源、网络、文件和工具时的执行边界,并不意味着它们能够解决模型产生错误信息、欺骗性行为或其他更广泛的AI安全问题。美联社援引专家观点指出,如何在Agent能力与安全限制之间取得平衡、怎样制定正确的安全规则,仍需要在实际部署中验证。

但最近的一系列事件至少让一个产业方向越来越清晰:当AI只能聊天时,安全问题很大程度上发生在屏幕里的回答中;当AI开始真正替人操作电脑和执行任务后,安全问题就进入了真实的软件、网络和数据系统。

AI公司正在努力让Agent拥有更多能力,而英伟达现在开始做另一门生意——给这些越来越有能力的Agent划定一道它们无法轻易跨过去的边界。

责编: 集小微
来源:凤凰网 #英伟达# #AI 安全# #Sentry#
THE END
关闭
加载

PDF 加载中...