AI 安全是一个工程问题 —— 如何在智能体技术栈的每一层解决这一问题

AI 安全是一个工程问题。这意味着需要明确的安全要求、可执行的管理、指定的责任人以及证明保护措施有效的证据。 随着 AI 能力的提升,业界必须加速安全工程,拓宽防御工具的使用范围,并加速共享行之有效的方案。 技术在变化,安全基本原则长存 互联网和云计算改变了软件的运行方式,而核心的安全责任则不变:建立身份认证、管理访问权限、限制暴露面和验证保护措施的有效性。 AI 智能体引入了新的功能 —— 推理、调用工具和根据遇到的数据调整行动。这些功能需要将既定原则应用于新的运行条件中。 这种发展速度带来了

Sep 22, 2026 - 15:00
 2
AI 安全是一个工程问题 —— 如何在智能体技术栈的每一层解决这一问题

AI 安全是一个工程问题。这意味着需要明确的安全要求、可执行的管理、指定的责任人以及证明保护措施有效的证据。

随着 AI 能力的提升,业界必须加速安全工程,拓宽防御工具的使用范围,并加速共享行之有效的方案。

技术在变化,安全基本原则长存

互联网和云计算改变了软件的运行方式,而核心的安全责任则不变:建立身份认证、管理访问权限、限制暴露面和验证保护措施的有效性。

AI 智能体引入了新的功能 —— 推理、调用工具和根据遇到的数据调整行动。这些功能需要将既定原则应用于新的运行条件中。

这种发展速度带来了压力。组织希望获得 AI 带来的生产力优势,而用于治理和保护这些系统的实践方法仍处于发展之中。

安全性取决于完整的智能体技术栈

应用程序依赖于代码、数据、身份、服务和基础设施。安全性取决于这些组件如何协同工作,而 AI 智能体进一步扩展了这一系统

模型提供功能;Harness 组织上下文、工具和工作流;运行时环境提供用于执行操作的基础设施。技术栈的每个部分都承担着安全责任,随着数据、指令和操作在系统中传递,妥善的保护要求对每一层进行管理。

设想一个智能体正在更新客户记录。假设它在所附文档中遇到恶意指令,并试图将客户数据导出到未经授权的目标地址。

网络策略应阻止这种传输,而受保护的日志应捕获尝试的工具调用、授权决策和结果,以便安全团队能够识别所使用的工具及其试图达成的目标地址。

更新客户记录的权限不应自动扩展到导出该数据。智能体可以请求额外的访问权限,但其不能自行授权该权限。

将安全融入智能体的运行方式中

即使智能体做出错误决策,安全边界也必须依然稳固。智能体的运行环境决定了其被允许执行的操作,因此必须独立于智能体的推理过程,对文件、网络目标和进程设置限制。

指令和安全防护有助于指导行为,但安全性也需要可执行的边界。

每个智能体都需要一个可追踪的身份和仅限于其被分配的任务的凭证。组织需要制定清晰的策略,规定智能体可访问哪些信息、可更改哪些系统以及哪些操作需要批准。在这些边界内,影响重大的操作和权限变更仍然需要人工批准。

团队还需要验证智能体使用的工具、技能和依赖项的来源和完整性。如果出现问题,受保护的工具调用、授权决策和结果记录有助于调查人员还原事件情况。明确的权限撤销和事件遏制程序,可使这些证据转化为可执行的应对措施。

NVIDIA OpenShell 是一个开源的安全运行时,可在智能体无法触达的范围执行策略,并提供沙盒化执行环境,同时管理智能体访问、数据、网络和系统资源的方式。开放安全 AI 联盟的合作伙伴正在基于 OpenShell 进行构建:思科的 DefenseClaw 增加了一个治理层;JFrog 与 OpenShell 集成,用于扫描和验证智能体技能,并针对智能体可以访问的技能执行策略。

工程团队需要安全有效的证据

在部署之前,团队需要有证据表明,适当的管理能够阻止智能体获取超出其权限范围的凭据或将敏感数据发送到未经授权的目标地址的尝试。

测试范围还应涵盖更改权限或干扰监测的尝试,并在模型、工具或工作流发生重大更改后应重新进行测试。

指定的责任人必须使用这些结果来确定系统是否已做好部署准备,并确保测试失败后可带来相应的纠正措施。在测试或运行中发现的故障应被复现、调查和处理。随后,每个发现都可以成为可重复执行的测试,让团队能够检查修复程序是否在未来的版本中依然有效。

相关例子包括 CrowdStrike 的 SafeMind (通过反复的攻击模拟来测试和强化防御) 和 Palo Alto Networks 的 Prisma AIRS (随着模型和应用程序的变化,持续开展红队测试)。

防御者需要在正确的时机使用正确的工具

调查故障需要适用于任务、数据和环境的强大工具。开放和闭源模型可满足互补的需求。

闭源模型提供托管功能和服务,而开放模型则为防御者提供检查相关组件、调整策略以及在其管理的基础设施上开展工作的选项。

在事故期间,这种管理可以帮助团队复现故障,并在自身系统上测试修复程序,同时将敏感证据保留在其自己的环境中。

强大的 AI 可以协助发现漏洞、验证修复和调查攻击以支持这项工作。应通过可复现的发现结果、可验证的修复和更快的响应速度来评估其价值。

相关案例包括 Capital One 的 VulnHunter (实现 AI 驱动的代码安全),以及 ReversingLabs 的 Spectra Assure (对软件包进行 AI 驱动的分析,以检测恶意软件和篡改行为)。

通过开放工作将优势向防御者倾斜

分享失败的证据、有效的管理手段以及验证修复程序的方式,有助于其他团队增强他们自己的系统。

NVIDIA 的安全研究和开放安全 AI 联盟正通过将研究成果、实用工具和专业知识引入更广泛的安全社区来支持这种交流。

AI 安全是一个工程问题。每一次智能体部署都需要可执行的边界、可靠的责任人以及能够证明其保护措施有效的证据。开放研究和共享工具可帮助更多防御者达到这一标准,并随着能力的提升而加以改进。

详细了解 NVIDIA 的安全研究并加入开放安全 AI 联盟

Jat AI Stay informed with the latest in artificial intelligence. Jat AI News Portal is your go-to source for AI trends, breakthroughs, and industry analysis. Connect with the community of technologists and business professionals shaping the future.