从“能执行”走向“安全地执行”
版本: 1.0
发布日期: 2026 年 9 月 30 日
主要受众: 使用 AI Agent 完成办公、研究、开发、客服、运营、数据处理或个人事务的用户;亦供平台、开发者、安全、法务与管理人员参考
免责声明
本白皮书提供通用的安全治理信息,不构成法律、合规、审计或产品采购意见。组织应结合所在司法辖区、行业规则、数据类型、合同和实际部署方式作出判断。不同 AI 服务的数据保留、训练使用、跨境传输、管理员可见性和安全承诺可能不同,应以有效合同、产品设置和官方文档为准。
文中将信息分为三类:
- 事实: 有可追溯来源支持的法规、标准、事件或厂商措施;
- 判断: 基于多个事实对风险和治理含义的归纳;
- 建议: 面向用户或组织的可执行做法,不声称适用于所有场景。
摘要
AI Agent 不只是“回答问题的 AI”。它可以围绕目标自行规划步骤,读取文件和消息,调用工具,访问账号,运行脚本,联系外部服务,甚至代表用户发送、发布、删除或付款。Agent 的价值来自这种行动能力,其主要安全风险也来自同一能力:一条错误或恶意指令,可能从“错误回答”升级为真实操作。
本白皮书的核心判断是:Agent 安全不能只靠模型拒绝危险请求,也不能只靠用户谨慎。安全必须同时约束数据、身份、权限、工具、网络、操作确认、日志和恢复能力。 OWASP 2026 年 Agentic 应用风险分类已把目标劫持、工具滥用、身份与权限滥用、Agent 供应链、意外代码执行、记忆污染、不安全的 Agent 间通信、级联失败、人机信任利用和失控 Agent 列为关键风险。[5]
对普通用户,最重要的不是掌握攻击原理,而是在每次任务前回答五个问题:
- 它要接触什么? 只开放这次任务必需的文件、记录和账号。
- 它能做什么? 能只读就不写,能草拟就不直接发送,能预览就不自动执行。
- 它要连到哪里? 不需要联网就关闭;只允许访问明确的服务和目的地。
- 哪一步必须由我确认? 删除、付款、发布、发送、改权限、运行代码、上传外部服务等操作应停下来确认。
- 出错后能否看见、停止和恢复? 没有日志、停止开关、备份或撤销能力的高影响任务不宜交给 Agent。
对平台和开发者,安全默认值比安全提示语更重要:应给 Agent 独立且可追责的身份,使用短期、窄范围凭证,限制工具和网络出口,在高影响操作前展示具体对象与后果,保留可理解的审计记录,并提供一键暂停、撤销和恢复能力。
目录
- 背景:为什么 AI Agent 安全治理重要
- AI Agent 安全形势与典型风险
- 可核实的安全事件与案例分析
- 治理原则与框架
- 面向 Agent 用户的行动指南
- 平台与开发者的责任
- 多 Agent 协作与第三方生态
- 合规、标准与监管趋势
- 事件响应与持续改进
- 未来展望
- 附录
1. 背景:为什么 AI Agent 安全治理重要
1.1 从“人操作工具”到“人委派任务”
传统软件通常要求用户逐步点击和输入;聊天式 AI 主要生成内容;Agent 则接受目标并在一定范围内自行决定步骤。它可能把一次任务拆成“搜索资料—读取邮件—整理表格—调用外部系统—发送结果”等连续动作。参考文档把这一变化概括为从“人操作工具”到“人委派任务”,这是理解 Agent 安全的起点。[1]
Agent 的风险不是因为它“像人”,而是因为它同时具有四种条件:
- 能读取具有业务价值或个人敏感性的数据;
- 能以用户、服务账号或自身身份调用工具;
- 能把多个看似低风险动作连接起来;
- 能在用户未逐步检查的情况下继续执行。
因此,安全目标不应是“让 Agent 永不犯错”——这在现实中不可保证——而应是:即使模型误判、外部内容带有恶意指令、第三方组件被攻破或用户疏忽,系统仍能把影响限制在可接受范围内。
1.2 信任边界
这张图表达一个基本事实:Agent 同时接收“可信指令”和“不可信内容”,又能调用具有真实权限的工具。外部网页、邮件、文档、日历邀请、检索结果和工具返回值都应被视为数据,而不是自动获得指令地位。OWASP 将这类目标劫持列为 Agentic 应用首要风险;厂商安全指南也承认间接提示注入是持续演化的行业挑战。[5][24]-[26]
1.3 对用户意味着什么
用户不必判断每一条隐藏指令,但应改变授权方式:不要用“我信不信这个 AI”替代访问控制。更可靠的问题是:“即使它被误导,这次任务中最多能看到什么、改动什么、发到哪里,以及哪一步必须等我确认?”
2. AI Agent 安全形势与典型风险
2.1 风险地图
| 风险 | 通俗解释 | 对用户可能造成的后果 | 优先控制 |
|---|---|---|---|
| 目标劫持与提示注入 | 网页、邮件或文档中的文字被 Agent 当成新指令 | 泄密、错误发送、跳过原目标 | 把外部内容视为不可信;限制权限;高风险操作确认 |
| 过度权限与工具滥用 | Agent 能做的事超过任务所需 | 误删、误改、批量操作、越权访问 | 只读优先、对象最小、临时授权、动作级限制 |
| 身份与凭证滥用 | Agent 使用用户长期令牌或共享账号 | 冒用身份、无法追责、横向访问 | 独立身份、短期令牌、多因素认证、禁止明文凭证 |
| 敏感数据与隐私 | 数据进入不适当的服务、日志或记忆 | 商业秘密、个人信息或合同内容泄露 | 数据分类、脱敏、保留期限、供应商条款核查 |
| Skill/MCP/插件与供应链 | 被信任的组件或依赖被替换、投毒或更新 | 凭证被窃、恶意代码执行、结果被操纵 | 来源登记、版本固定、审查、隔离、更新观察期 |
| 记忆与上下文污染 | 错误或恶意内容被长期保存并影响后续任务 | 持续偏离目标、跨用户数据混用 | 记忆分区、来源标记、可见可删、任务结束清理 |
| 多 Agent 委派失控 | 一个 Agent 把任务和权限转给另一个 Agent | 权限放大、责任不清、错误级联 | 验证调用者;权限不自动继承;限制委派深度 |
| 幻觉与错误判断 | Agent 给出听起来合理但不真实的内容 | 错误决策、违规发布、损害客户 | 要求来源、交叉核实、关键决定由人负责 |
| 资源与成本失控 | Agent 循环调用工具或批量消耗付费资源 | 费用异常、服务中断、配额耗尽 | 预算、频率、步骤和时间上限;自动暂停 |
| 不可审计与不可恢复 | 无法知道做过什么,也无法撤销 | 事件难以发现、止损和追责 | 完整日志、变更预览、备份、回滚和停止开关 |
2.2 身份、权限与账号安全
身份回答“谁在行动”,权限回答“它能做什么”。Agent 若直接继承用户全部权限,或多个 Agent 共用一个高权限账号,系统很难区分用户操作、Agent 操作和第三方工具操作。
建议:
- 为 Agent 使用独立、可识别的服务身份,不与管理员账号共用;
- 权限同时限定到数据对象、动作、时间、调用次数和网络目的地;
- 优先使用一次性或短期凭证,任务结束自动失效;
- 只读任务不授予修改、删除、发送或发布权限;
- 任何密码、API Key、Token、私钥不得直接粘贴进对话或写入普通文本;
- 对管理员、代码仓库、云平台、支付与客户数据账号启用抗钓鱼的多因素认证。
这里的“最小权限”还应升级为“最小自主性”:如果自动执行不能显著增加价值,就让 Agent 只生成草稿或计划,由人完成最后一步。[5]
2.3 数据隐私与敏感信息保护
数据保护应回答四个问题:能否输入、输入多少、会被保留多久、谁还能访问。
对客户名单、员工信息、医疗与财务信息、源代码、未公开合同、商业计划、访问日志等内容,用户应先确认组织允许的工具和账户类型。必要时只提供完成任务所需的片段,并删除直接标识符。脱敏不是简单替换姓名;组合后的岗位、地点、时间和交易信息仍可能识别个人或企业。
对平台和组织,还应明确数据是否进入模型训练、是否被第三方处理、日志与记忆的保留期限、跨境路径、删除与导出方式,以及发生事件时的通知责任。中国的个人信息保护法和网络数据安全管理条例对个人信息与网络数据处理设定了义务;面向境内公众提供生成式 AI 服务时,还需判断《生成式人工智能服务管理暂行办法》等规则是否适用。[9]-[11]
2.4 提示注入、工具调用与外部连接
提示注入是指攻击者把指令藏在 Agent 会读取的内容里,试图改变其行为。它可以直接出现在对话中,也可以间接出现在网页、电子邮件、PDF、日历、检索结果或工具返回值中。用户看见的是“资料”,Agent 却可能把其中的句子当作“命令”。
不应把某一句系统提示词当成安全边界。更有效的控制是把模型输出视为建议,由独立策略检查工具调用参数;让 Agent 只能访问允许的对象和目的地;并在高影响动作前要求人确认。OpenAI、Google 和 Microsoft 的公开安全资料均把提示注入视为需要持续防护的问题。[24]-[26]
MCP 等连接协议降低了 Agent 接入工具和数据的门槛,也把工具描述、授权流程、服务器更新和第三方依赖带入信任边界。美国国家安全局发布的 MCP 安全资料与 OWASP 的 Agentic 风险框架均强调权限、身份、提示注入和供应链问题。[5][27]
2.5 多 Agent 协作与责任边界
多 Agent 系统会把一个任务分给研究、执行、审核等不同角色。风险在于:低权限 Agent 的错误消息可能被高权限 Agent 当成可信命令;上游错误可能被下游放大;同一数据可能在多个服务中复制;最终用户只看到结果,却看不到委派链。
因此,每次委派都应携带原始用户目标、允许的动作、数据范围、有效期和来源信息。下游 Agent 不应自动继承上游的全部权限。高权限 Agent 必须重新验证用户意图,而不是因为请求“来自内部 Agent”就默认可信。
2.6 供应链与第三方组件
Agent 应用经常依赖开源包、Skill、插件、模型网关、浏览器扩展、MCP Server 和自动更新。2026 年多个被广泛使用的软件包出现恶意版本,说明“知名项目”“下载量高”或“过去安全”都不能替代当前版本的验证。[17]-[22]
对普通用户,最直接的原则是:只从组织批准的目录或官方来源安装;不要为了完成一次任务关闭系统保护;新增组件若要求读取密钥、整个主目录或所有云盘,应暂停并询问管理员。
3. 可核实的安全事件与案例分析
3.1 案例分类说明
本章区分三类材料:
- 已披露安全事件/漏洞: 项目方、政府漏洞库或厂商确认;
- 研究演示: 证明风险可行,但不等于发生了大规模现实攻击;
- 主动加固措施: 厂商为降低风险调整产品默认值,不等于每个用户都曾受害。
3.2 事件与治理启示
| 时间 | 类型 | 已确认事实 | 治理启示 |
|---|---|---|---|
| 2025-06 | 漏洞披露 | NVD 收录 Microsoft 365 Copilot 的 CVE-2025-32711;相关研究称 EchoLeak 可通过间接提示注入造成数据外传,微软已在服务端缓解。[14][15] | 不能只过滤用户输入;邮件、文档和检索内容也可能携带指令。权限和外传通道必须受控。 |
| 2025-09 | 主动加固 | Salesforce 宣布将多项 Agentforce 标准操作改为默认需要确认,包括取消订单、重置密码等。[16] | 对高影响操作,人工确认应是产品默认值,而非用户自行记忆的注意事项。 |
| 2026-03-24 | 供应链事件 | LiteLLM 官方确认 PyPI 的 1.82.7 和 1.82.8 被植入恶意代码,并说明未固定版本的 Agent 框架、MCP Server 或编排工具可能间接拉取受影响版本。[17] | Agent 生态的间接依赖也要登记、固定和检查;发现后应轮换该环境可访问的凭证。 |
| 2026-03-27 | 供应链事件 | Telnyx 确认 Python SDK 4.87.1 与 4.87.2 为未授权恶意版本,事件限于 PyPI 分发渠道。[18] | "厂商平台未被攻破"不等于"下载的 SDK 安全";分发渠道本身是信任边界。 |
| 2026-03-31 | 供应链事件 | CISA 确认 Axios 1.14.1 与 0.30.4 引入恶意依赖,并建议检查开发机和流水线、固定安全版本、轮换暴露凭证。[19] | 普通软件依赖也会影响 Agent;安装时执行的脚本可能接触开发和云端凭证。 |
| 2026-04-22 | 安全研究披露 | JFrog 报告 Xinference 2.6.0、2.6.1、2.6.2 受供应链攻击影响;关于攻击者身份的归因存在公开争议。[20] | 区分“组件受影响”与“谁实施攻击”;处置不应等待归因完全确定。 |
| 2026-05-11 | 已确认事件 | OpenAI 披露 TanStack/Mini Shai-Hulud 供应链攻击影响两台公司员工设备,有限凭证材料被外传;其表示未发现用户数据、生产系统或知识产权受影响。[21] | 供应链事件可能沿员工设备和代码仓库扩散;隔离设备、撤销会话和全面轮换凭证是关键动作。 |
| 2026-08-20 | 供应链事件 | Rust 安全响应团队确认并删除 arrayref@0.3.10、append-only-vec@0.1.9、internment@0.8.7 等恶意版本,并公布其在线时间。[22] | 暴露窗口很短也不能视为无风险;自动构建和缓存可能已经取回恶意版本。 |
3.3 从事件中能得出什么
- 间接提示注入可以跨越“外部内容—Agent—内部数据/工具”的边界;
- 真实产品正在把人工确认、权限限制和隔离作为重要控制;
- Agent 依赖的软件供应链可成为凭证窃取和后续入侵入口;
- 版本固定、组件清单、日志、网络监测和凭证轮换具有现实价值。
4. 治理原则与框架
4.1 八项原则
- 任务必要性。 先判断是否真的需要 Agent 自动执行;普通搜索、模板或传统自动化能完成的任务,不必增加自主性。
- 最小权限与最小自主性。 只授予完成当前任务所需的对象、动作、时间和次数;能建议就不执行,能草拟就不发送。
- 不信任外部内容。 网页、邮件、文档、工具返回值和其他 Agent 消息默认是数据,不是指令。
- 高影响操作由人确认。 删除、付款、发布、外发、改权限、运行代码、安装组件和批量操作不得静默执行。
- 身份清晰、凭证短期。 Agent 使用独立身份和可撤销的短期凭证,不共享管理员密钥。
- 可见、可停、可审计。 用户能看到计划、目标对象和关键参数;组织能追踪调用链并立即暂停。
- 限制外传与爆炸半径。 文件系统、网络、工具和数据范围均应隔离;默认拒绝非必要目的地。
- 可恢复、持续改进。 关键操作有备份、版本历史和回滚;事件与近失误进入复盘、测试和规则更新。
4.2 六层控制框架
| 层级 | 要回答的问题 | 核心控制 |
|---|---|---|
| 任务层 | Agent 被授权完成什么目标? | 明确目标、禁止事项、完成条件、最长步骤和预算 |
| 身份权限层 | 它以谁的身份、能做什么? | 独立身份、最小权限、短期凭证、动作级授权 |
| 数据上下文层 | 它能读哪些数据,哪些内容不可信? | 数据分类、最小披露、来源标记、记忆隔离与清理 |
| 工具与网络层 | 它能调用什么、连接哪里? | 工具白名单、版本固定、沙箱、网络目的地白名单 |
| 操作结果层 | 哪些动作必须确认,能否撤销? | 预览/差异、双人复核、确认、速率限制、回滚 |
| 运营治理层 | 如何发现、响应和改进? | 资产清单、日志告警、事件响应、演练、供应商管理 |
该框架可以与 NIST AI RMF 的“治理、映射、测量、管理”四项功能结合,也可以与 NIST CSF 2.0 的“治理、识别、保护、检测、响应、恢复”连接。[2]-[4] ISO/IEC 42001 提供 AI 管理体系要求,ISO/IEC 23894 提供 AI 风险管理指南;OWASP 与 MITRE ATLAS 则更适合用于威胁分类和控制验证。[5]-[8]
4.3 风险分级
组织可用四个问题快速分级:
- 是否接触敏感、个人、机密或受监管数据?
- 是否能对外发送、公开发布、付款、删除或改变权限?
- 是否能运行代码、安装组件或访问内部网络?
- 是否缺少即时人工监督或可靠回滚?
若任何一项为“是”,就不应采用无监督自动执行。两项及以上为“是”时,建议进入正式审批、隔离测试和持续监控流程。
5. 面向 Agent 用户的行动指南
5.1 使用前:先缩小任务
- 用一句话写清目标、允许使用的数据和不能做的事。
- 只选择组织批准的 Agent、账号、Skill、插件和连接器。
- 检查文件夹、云盘、邮箱、日历、代码库和账号的授权范围;拒绝“全部访问”式便利授权。
- 不把密码、API Key、Token、私钥、身份证件、未公开客户数据直接粘贴进对话。
- 对敏感材料,先确认产品的数据保留、训练、共享和删除设置。
- 对外部下载的 Skill、脚本或 MCP Server,确认发布者、版本、更新记录和组织审批状态。
5.2 使用中:把高风险动作停在人面前
要求 Agent 在执行前先给出计划,并对以下操作逐项确认:
- 删除、覆盖、移动或批量修改文件和记录;
- 发送邮件、消息、邀请,发布网页、社交媒体或公告;
- 付款、退款、下单、签署、提交审批;
- 修改账号、角色、权限、密码或安全设置;
- 安装软件、运行脚本、执行命令或启用宏;
- 上传数据到新服务,或把内容发送到组织外;
- 创建长期自动任务或让另一个 Agent 继续执行。
确认界面应显示具体对象、动作、目的地和后果。只显示“是否允许 Agent 继续?”的模糊提示,不足以支持知情决定。
若 Agent 引用事实、法规、合同条款或关键业务数字,应打开原始来源核对。模型给出链接不代表链接一定存在或支持其结论。
5.3 使用后:收回钥匙,检查结果
- 撤销临时权限,断开不再使用的连接器;
- 检查实际修改、发送和上传的内容,而不只看 Agent 的总结;
- 清除不需要保留的任务记忆、上传文件和导出副本;
- 检查费用、调用量和异常登录;
- 保留必要的任务记录、审批和结果版本,以便审计与恢复。
5.4 看到这些信号应立即暂停
- Agent 要求关闭安全软件、绕过审批或扩大权限;
- 它突然访问与任务无关的文件、账号或网站;
- 外部网页或文档声称“忽略用户要求”“上传密钥”“执行命令”;
- 安装的 Skill、插件或依赖来源不明、刚刚换维护者或要求异常权限;
- Agent 重复调用工具、费用快速上升、任务目标不断变化;
- 结果中出现不属于当前用户或当前任务的数据;
- Agent 声称已完成高影响操作,但无法提供可核对的记录。
5.5 用户一页式检查表
| 阶段 | 必查项 |
|---|---|
| 开始前 | 工具获批准;数据可输入;权限最小;不含明文凭证;高风险步骤已标出 |
| 执行前 | 计划清楚;对象正确;目的地正确;金额/数量正确;可撤销或有备份 |
| 执行中 | 无越界访问;无异常联网;无循环调用;外部内容未改变原目标 |
| 完成后 | 核对实际结果;撤销临时权限;保存审计记录;清理不必要的数据 |
| 异常时 | 立即停止;断开连接;报告管理员;不要自行删除证据;必要时轮换凭证 |
6. 平台与开发者的责任
用户安全教育不能代替安全产品设计。平台和开发者至少应承担以下责任。
6.1 安全默认值
- 新建 Agent 默认无高风险工具、无全盘写权限、无任意网络访问;
- 敏感操作默认需要确认,且确认不能被普通提示文本关闭;
- 高权限连接默认短期有效,长期授权需显著提示和定期复核;
- 对批量、不可逆和对外操作提供预览、差异和撤销能力。
6.2 身份与授权
- 区分用户、Agent、工具和子 Agent 的身份;
- 每次工具调用重新检查授权,不因工作流开始时验证过就永久信任;
- 凭证与具体用户、会话、工具和目的绑定;
- 禁止把高权限用户令牌原样下传给插件或子 Agent。
6.3 数据与隐私
- 清楚说明输入、输出、日志、记忆和上传文件的用途与保留期;
- 提供组织级的数据分类、脱敏、删除、导出和区域控制;
- 防止不同用户、租户、任务和 Agent 间的上下文混用;
- 日志本身也应最小化,避免把完整敏感数据和凭证写入日志。
6.4 工具、代码和网络隔离
- 维护工具与连接器清单,验证来源、版本、签名或完整性信息;
- 在受限环境中运行代码与脚本,限制文件系统、进程、设备和网络;
- 对外连接采用默认拒绝和目的地白名单;
- 识别异常工具链,例如“大量读取后紧接外部上传”;
- 提供调用次数、金额、时间、步骤和资源预算上限。
6.5 可观察、可停止、可恢复
审计记录至少应包含:任务 ID、发起者、Agent 与版本、原始目标、数据来源、工具与参数、授权决定、人工确认、实际变更、外部目的地、错误和停止原因。记录应保护敏感信息,并能支持事件调查。
平台应提供组织级“停止开关”,可暂停 Agent、撤销会话、禁用工具或连接器;关键数据操作应与版本历史、备份和回滚结合。
6.6 透明沟通
平台应公开说明已知限制、重要安全更新、事件影响范围和用户需要采取的动作。对尚未确认的攻击者归因或影响数字,应清楚标注不确定性。安全声明应区分“未发现证据”和“证明没有发生”。
7. 多 Agent 协作与第三方生态
7.1 委派不等于授权转让
当 Agent A 请求 Agent B 执行任务时,B 应验证原始用户、任务范围和有效授权。A 的高权限不应自动成为 B 的权限,B 的结果也不应自动被 A 视为可信事实。
建议采用以下边界:
- 每个 Agent 有独立身份、清晰角色和允许工具;
- 委派消息带有来源、时间、任务和允许动作;
- 限制委派深度、持续时间和最大步骤;
- 高权限 Agent 不接受未经验证的自然语言“内部指令”;
- 发生异常时能停止整条委派链,而非只停某一个 Agent;
- 对跨 Agent 传递的数据执行最小化和分级保护。
7.2 第三方责任不因“只是插件”而消失
平台应审查第三方连接器的权限和数据流;开发者应维护组件清单与更新记录;供应商应及时披露安全事件;组织应在合同中明确数据、事件通知、审计和退出责任;用户应只启用完成任务所需的组件。
供应链风险不能靠一次审核永久解决。组件的维护者、依赖、发布账号和行为会变化,因此需要持续监测、版本策略和快速禁用能力。
8. 合规、标准与监管趋势
8.1 中国相关规则
在中国场景下,Agent 可能同时涉及个人信息、网络数据、生成式 AI 服务和生成内容标识。主要参考包括:
- 《中华人民共和国个人信息保护法》:规范个人信息处理活动,保护个人信息权益。[10]
- 《网络数据安全管理条例》:自 2025 年 1 月 1 日施行,要求建立网络数据安全制度、采取访问控制等措施并处置安全事件。[11]
- 《生成式人工智能服务管理暂行办法》:自 2023 年 8 月 15 日施行,适用于向中国境内公众提供生成式 AI 服务的特定场景,并强调发展与安全并重、分类分级监管。[9]
- 《人工智能生成合成内容标识办法》及配套强制性国家标准:自 2025 年 9 月 1 日施行,对生成合成内容的显式和隐式标识提出要求。[12]
这些规则的适用取决于服务对象、处理活动、数据类型和组织角色。企业内部自用、面向公众提供服务和代表客户处理数据,可能承担不同义务,应由法务与合规人员结合实际判断。
8.2 欧盟 AI Act
欧盟 AI Act 自 2024 年 8 月 1 日生效并分阶段适用。欧盟官方页面显示,多数规则与部分执法自 2026 年 8 月 2 日起生效;透明度、通用 AI 模型和高风险系统的具体时间安排存在分阶段与修订后的过渡规则。[13] 跨境提供或部署 Agent 的组织不应仅依据“Agent”这一名称判断是否适用,而应分析系统用途、角色、风险分类和进入欧盟市场的方式。
8.3 标准与框架如何使用
| 参考 | 主要用途 | 本白皮书建议的用法 |
|---|---|---|
| NIST AI RMF 1.0 | AI 风险治理、映射、测量与管理 | 建立组织级治理流程和风险登记册 [2] |
| NIST GenAI Profile | 生成式 AI 特有风险与行动 | 补充内容来源、幻觉、隐私、供应链等控制 [3] |
| NIST CSF 2.0 | 网络安全全生命周期 | 连接保护、检测、响应与恢复 [4] |
| ISO/IEC 42001:2023 | AI 管理体系要求 | 建立政策、职责、风险与持续改进机制 [7] |
| ISO/IEC 23894:2023 | AI 风险管理指南 | 将 AI 风险纳入现有风险管理活动 [8] |
| OWASP Agentic Top 10 2026 | Agentic 应用关键风险 | 用于威胁检查、设计评审和测试范围 [5] |
| MITRE ATLAS | AI 对抗行为与缓解知识库 | 用于威胁建模、演练和事件分类 [6] |
标准不是合规证明,合规也不等于绝对安全。组织应把法规义务、合同要求、业务风险和技术控制放在同一治理流程中。
9. 事件响应与持续改进
9.1 发现异常后的八步流程
- 暂停。 停止 Agent、自动任务和相关工具调用,避免继续扩大影响。
- 隔离。 断开受影响设备、连接器或账号;不要急于删除日志和文件。
- 记录。 保存时间、任务、提示、工具调用、版本、外部目的地和可见异常。
- 报告。 按组织渠道通知安全、IT、隐私、法务和业务负责人;涉及个人信息或客户时评估通知义务。
- 撤销与轮换。 撤销会话、令牌和密钥;若受影响环境能访问某凭证,应按可能暴露处理。
- 确认范围。 检查读取、修改、发送、下载、外传和账户活动,不只检查 Agent 自述。
- 恢复。 从可信版本恢复数据和环境,重新验证组件与权限后再上线。
- 复盘。 更新风险登记、默认权限、检测规则、培训和供应商要求,并验证改进有效。
9.2 不要只追求“零事件”
如果组织没有事件记录,可能是风险很低,也可能是没有可观察性或员工不敢报告。更有意义的指标包括:高权限 Agent 数量、长期凭证比例、需要确认的高影响操作覆盖率、未登记工具数量、日志完整率、平均暂停时间、凭证轮换时间、可成功恢复的任务比例和近失误整改完成率。
9.3 定期演练
至少应演练以下情景:Agent 读取到恶意文档;第三方连接器突然请求更高权限;依赖包发布安全通告;Agent 批量误改数据;长期令牌可能泄露;多 Agent 工作流出现循环或错误级联。演练目标不是复现攻击,而是验证能否及时看见、暂停、沟通和恢复。
10. 未来展望
以下是基于现有标准、事件和产品措施的判断,而非确定预测:
- Agent 权限将从“访问某个应用”细化到“对哪些对象执行哪些动作、在多长时间内、最多多少次”;
- 人工确认将从通用弹窗转向展示计划、差异、目的地和不可逆后果的知情确认;
- 独立 Agent 身份、短期凭证和运行时策略检查将逐渐替代共享账号与长期密钥;
- Skill、MCP Server、插件和 Agent 配置会被更明确地纳入软件物料清单、变更管理与供应链治理;
- 多 Agent 系统的重点将从“能否协作”转向“谁授权、谁验证、谁负责以及如何停止级联”;
- 监管与审计更可能关注可追责结果:风险评估是否完成、控制是否实际生效、事件是否可发现和可恢复,而不只是是否发布了一份 AI 政策。
长期安全的关键不是让用户对每条提示都保持高度警觉,而是把“不必信任也能安全使用”的边界做进系统。
11. 附录
附录 A:术语表
| 术语 | 解释 | 对用户意味着什么 |
|---|---|---|
| AI Agent | 能围绕目标规划步骤并调用工具执行任务的 AI 系统 | 它可能真的读取、修改、发送或发布,而非只给建议 |
| 提示注入 | 用自然语言内容诱导 AI 偏离原始目标 | 网页、邮件和文档也可能包含对 Agent 的隐藏指令 |
| 间接提示注入 | 恶意指令不是用户输入,而来自 Agent 读取的外部内容 | 即使用户没有输入危险要求,Agent 仍可能被误导 |
| Skill/插件 | 为 Agent 增加特定能力的软件组件 | 安装等于增加新代码、权限和数据流 |
| MCP | 连接 AI 与外部工具、数据的开放协议 | 连接方便,但服务器、工具描述和授权都需验证 |
| Token/API Key | 代表账号或应用权限的凭证 | 泄露后可能被他人冒用,应短期、最小化并可撤销 |
| 沙箱 | 限制代码或工具可访问资源的隔离环境 | 即使出错,也尽量不影响真实设备和数据 |
| 出口控制 | 限制系统向哪些网络目的地发送数据 | 降低被诱导外传数据的风险 |
| 记忆污染 | 错误或恶意内容进入长期上下文并影响后续任务 | 应能查看、分区和删除 Agent 记忆 |
| 最小自主性 | 只给任务真正需要的自动执行程度 | 能草拟就不直发,能建议就不直接修改 |
附录 B:高风险操作清单
以下操作应默认需要明确确认,部分场景还需双人复核:删除或覆盖数据;批量修改;对外发送或发布;支付、退款或交易;签署或提交法律/监管材料;改变身份与权限;重置密码;运行代码;安装组件;访问生产环境;导出敏感数据;创建长期自动任务;向其他 Agent 转授权限。
附录 C:安全事件与来源强度
| 案例 | 来源强度 | 正文采用范围 |
|---|---|---|
| EchoLeak | NVD + 同行评审/学术发表 | 采用漏洞存在、影响类型与已缓解事实;不提供复现细节 |
| Salesforce 确认机制 | 厂商官方帮助文档 | 作为主动加固案例,不写成已发生用户事故 |
| LiteLLM | 项目官方安全更新 | 采用受影响版本、时间窗、恶意行为类别与处置建议 |
| Telnyx | 厂商官方安全公告 | 采用受影响版本、分发渠道与处置建议 |
| Axios | CISA + Microsoft/项目来源 | 采用受影响版本与 CISA 建议 |
| Xinference | 权威安全研究机构 | 采用受影响版本;攻击者归因标注不确定性 |
| TanStack/Mini Shai-Hulud | OpenAI 官方事件说明 | 采用 OpenAI 自身确认的影响与响应范围 |
| Rust crates | Rust 安全响应团队 | 采用恶意版本、删除和时间信息 |
附录 D:参考文献
- [1] National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework (AI RMF 1.0). 2023-01-26. https://doi.org/10.6028/NIST.AI.100-1.
- [2] National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (NIST AI 600-1). 2024-07-26. https://doi.org/10.6028/NIST.AI.600-1.
- [3] Pascoe, C., Quinn, S., Scarfone, K. The NIST Cybersecurity Framework (CSF) 2.0. 2024-02-26. https://doi.org/10.6028/NIST.CSWP.29.
- [4] OWASP Gen AI Security Project. OWASP Top 10 for Agentic Applications for 2026. 2025-12-09. https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/.
- [5] MITRE. MITRE ATLAS. 持续更新. https://atlas.mitre.org/.
- [6] International Organization for Standardization. ISO/IEC 42001:2023 Information technology — Artificial intelligence — Management system. 2023-12. https://www.iso.org/standard/42001.
- [7] International Organization for Standardization. ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management. 2023-02. https://www.iso.org/standard/77304.html.
- [8] 国家互联网信息办公室等七部门. 生成式人工智能服务管理暂行办法. 2023-07-13. https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm.
- [9] 全国人民代表大会常务委员会. 中华人民共和国个人信息保护法. 2021-08-20. https://www.miit.gov.cn/jgsj/zfs/fl/art/2022/art_515a4b20c12f430eab54bb4f56d89f56.html.
- [10] 中华人民共和国国务院. 网络数据安全管理条例(国务院令第 790 号). 2024-09-24. https://app.www.gov.cn/govdata/gov/202409/30/520076/article.html.
- [11] 国家互联网信息办公室、工业和信息化部、公安部、国家广播电视总局. 人工智能生成合成内容标识办法. 2025-03-14. https://www.cac.gov.cn/2025-03/14/c_1743654685899683.htm.
- [12] European Commission. AI Act: Regulatory framework and implementation timeline. 2026(页面持续更新). https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai.
- [13] National Vulnerability Database. CVE-2025-32711. 2025-06-11. https://nvd.nist.gov/vuln/detail/CVE-2025-32711.
- [14] Reddy, P., Gujral, A. S. EchoLeak: The First Real-World Zero-Click Prompt Injection Exploit in a Production LLM System. 2025-11-23. https://doi.org/10.1609/aaaiss.v7i1.36899.
- [15] Salesforce. Confirmation Required for Agentforce Actions - External. 2025-09-27. https://help.salesforce.com/s/articleView?id=005133036&type=1.
- [16] LiteLLM. Security Update: Suspected Supply Chain Incident. 2026-03-24(后续更新至 2026-03-30). https://docs.litellm.ai/blog/security-update-march-2026.
- [17] Telnyx. Telnyx Python SDK: Supply Chain Security Notice. 2026-03. https://telnyx.com/resources/telnyx-python-sdk-supply-chain-security-notice-march-2026.
- [18] Cybersecurity and Infrastructure Security Agency. Supply Chain Compromise Impacts Axios Node Package Manager. 2026-04-20. https://content.govdelivery.com/accounts/USDHSCISA/bulletins/413c7a5.
- [19] JFrog Security Research. TeamPCP strikes again: Xinference PyPI package compromised. 2026-04-22. https://research.jfrog.com/post/xinference-compromise/.
- [20] OpenAI. Our response to the TanStack npm supply chain attack. 2026-05-13. https://openai.com/index/our-response-to-the-tanstack-npm-supply-chain-attack/.
- [21] Rust Security Response Team. Supply chain attack on arrayref. 2026-08-20. https://blog.rust-lang.org/2026/08/20/supply-chain-attack-on-arrayref/.
- [22] OpenAI. Operator System Card. 2025-01-23. https://openai.com/index/operator-system-card/.
- [23] Microsoft. Protecting against indirect prompt injection attacks in MCP. 2025-04-28. https://developer.microsoft.com/blog/protecting-against-indirect-injection-attacks-mcp/.
- [24] OpenAI. Understanding prompt injections. 持续更新. https://openai.com/safety/prompt-injections/.
- [25] Google DeepMind Agentic AI Security Team. How we estimate the risk from prompt injection attacks on AI systems. 2025-01-29. https://blog.google/security/how-we-estimate-risk-from-promp/.
- [26] National Security Agency. Model Context Protocol (MCP) Security. 2026-06-02. https://media.defense.gov/2026/Jun/02/2003943289/-1/-1/0/CSI_MCP_SECURITY.PDF.
结语: Agent 安全治理的目标不是阻止使用,而是把能力放进清晰的边界:只看必要的数据,只拿必要的权限,只连必要的服务,在关键动作前停下来让人确认,并确保全过程可见、可停、可追溯、可恢复。