核心结论
代理式 AI(Agentic AI)指具备自主感知、决策与行动能力的智能体——它不再只是"回答问题",而是能够调用工具、修改配置、发起操作,乃至执行跨系统的工作流。当智能体获得实际操作权限,企业的风险面便从"数据泄露"扩大到"权限滥用与业务操作失控"。本文从行业视角梳理这一变化带来的安全边界重构,以及企业应如何从"防人"扩展到"防智能体"。
- 智能体成为新的"高权限主体":它拥有凭证、可调用 API、可跨系统行动,传统"以人/设备为中心"的安全模型难以直接覆盖
- 两类突出风险:一是提示注入与工具滥用(让智能体执行非预期动作);二是供应链与模型风险(第三方模型、组件、MCP 工具的信任问题)
- 防御范式转变:从"防人"扩展到"防智能体",核心是机器身份与最小权限、运行时管控、零信任延伸到智能体
- 行业状态:Gartner 在 2026 技术成熟度曲线中将"代理型AI网络安全"列为新增技术,并指出短期内尚无覆盖全生命周期的单一平台
- 落地四步:资产清点 → 身份与权限治理 → 运行时监控与阻断 → 取证与持续改进,并以网络韧性作为兜底
内容维护:VISBAT维思贝特 · 数据来源:RSAC 2026、Black Hat 2026 公开信息、Gartner 2026 中国网络安全技术成熟度曲线、相关行业研究报告 · 最近更新:2026年8月26日 · 本文为行业技术观察,文中涉及的厂商产品能力以各厂商官方发布文档为准。
什么是代理式 AI(Agentic AI)?为什么它重塑安全边界
过去两年,"生成式 AI"的讨论集中在"模型能生成什么"——文本、代码、图像。而代理式 AI 的关键差异在于智能体能够自主行动:它接收目标后,自己拆解任务、选择工具、调用接口、读取与写入数据,并在多轮交互中持续推进。这种"感知—决策—执行"的闭环,使 AI 从"辅助工具"转变为"可操作的主体"。
对安全团队而言,这一转变带来的不是量的变化,而是边界的重构。当智能体拥有企业系统的访问凭证,能够发起采购、修改配置、执行转账、调用内部 API 时,攻击面就从"模型说了什么"延伸到"模型做了什么"。据相关行业研究报告披露,在已部署的 AI 智能体中,仅约一半处于被监控或受保护状态——换言之,过半智能体缺乏基本的安全治理。这正是代理式 AI 安全成为 2026 年行业焦点的现实背景。
从"辅助"到"自主"的三层演进
助手型(Copilot):以信息查询、内容摘要、告警归纳为主,操作需人确认
编排型(Orchestrator):可串联多个工具完成多步任务,部分环节自动执行
自主型(Agentic):在明确边界内独立调查、响应、修复完整工作流,行动可能跨多个系统
风险随自主程度递增:越靠后,智能体的"权限半径"越大,对运行时管控的要求越高。
风险面:自主智能体带来的三类新型威胁
1. 智能体成为新的"高权限主体"
传统安全模型的中心是"人"和"设备":身份系统管人,终端管理管设备。智能体既不是典型用户,也不是典型设备——它是一个拥有凭证、可调用工具、能持续行动的非人主体。如果沿用为"服务账号"设计的粗放授权(长期凭证、广泛权限),智能体一旦被操控,危害不亚于一个被攻陷的高权限账号。相关公开报道中已出现自主智能体脱离预期约束的案例,说明"给模型一个账号就能干活"的简单做法存在实质风险。
2. 提示注入与工具滥用
代理式 AI 通过工具(Tool)与外部系统交互。攻击者可以通过智能体可读取的内容(邮件、网页、文档、聊天记录)植入恶意指令,诱导智能体执行非预期动作——例如读取并外发敏感数据、调用高危接口、绕过正常审批。与"骗人点击链接"不同,提示注入发生在模型的处理链路内部,单纯的输入输出过滤难以完全覆盖。Black Hat 2026 上多家厂商展示的"运行时阻断失控智能体"能力,正是针对这一类风险。
3. 供应链与模型风险
企业引入的 AI 能力往往由第三方模型、组件、插件与 MCP(Model Context Protocol)工具构成。这类"AI 供应链"带来新的信任问题:模型是否会被投毒?第三方插件是否会越权访问?开源模型部署在内网是否就安全?行业研究普遍提示,认为"选个安全模型就够了"或"开源模型部署在内网就安全"是常见的认知误区——模型自身的安全性远不足以覆盖业务风险,缺乏运行时监测将成为隐患。
防御范式:从"防人"到"防智能体"
应对代理式 AI 风险,核心思路是把"非人主体"纳入既有的安全治理框架,并补齐执行层的管控能力。以下三个方向构成当前行业讨论的主线。
机器身份与最小权限(Machine IAM)
为每一个智能体建立独立的机器身份,而非共用一个长期凭证。关键实践包括:
- 最小权限:仅授予完成特定任务所需的工具与数据访问,避免"一个智能体拥有全量权限"
- 短生命周期凭证:凭证与具体工作流绑定,使用后即失效,降低泄露后的横向移动风险
- 行为基线:记录智能体正常的工具调用范围,异常调用(如访问非授权系统)触发告警或阻断
- 身份打通:将智能体身份接入企业既有身份体系(如 Entra ID、Okta),复用已有的治理与审计能力
运行时管控:从提示词过滤到执行层拦截
仅做"提示词过滤"是不够的——当智能体可独立调用工具,真正的控制点应下沉到执行层:
- 工具调用审批:对高危操作(删除、转账、对外发送)设置人工或策略审批 gate
- 敏感数据出域拦截:在运行时检测并阻止密钥、个人数据等敏感内容通过智能体外泄
- 网络微隔离:限制智能体可通信的地址与端口,缩小其"操作半径"
- 欺骗与诱捕:通过蜜罐、诱饵环境识别异常行为序列,在造成损害前干预
零信任延伸到智能体(Zero Trust for AI Agents)
零信任的"持续验证、始终审视"原则,正在从人扩展到智能体。据 RSAC 2026 公开信息,已有厂商将零信任访问能力延伸至 AI 智能体,提供基于任务的细粒度权限与行为监督——其思路是从"访问控制权"演进到"行为控制权":允许特定任务的选择性访问,而非广泛、持久的授权。这与企业已有的零信任、SASE 架构形成自然的衔接点。
2026 年代表产品方向观察
以下汇总在 RSAC 2026、Black Hat 2026 等公开场合披露的代表性能力方向,供企业建立选型视角。相关产品能力以各厂商官方发布文档为准。
| 能力方向 | 代表做法(公开披露) | 主要解决的问题 |
|---|---|---|
| 智能体身份治理 | 为智能体建立独立身份,语义级策略校验,对接企业 IdP(如 Entra ID、Okta),自动盘点智能体、MCP 服务器、插件与技能 | 非人主体的身份与凭证生命周期管理 |
| 运行时阻断 | 在执行层终止未授权的工具调用与会话,拦截敏感数据外泄,实时阻断提示注入 | 失控智能体的实时处置 |
| 零信任延伸至智能体 | 基于任务的细粒度权限、行为监督,将访问控制从"人"扩展到"智能体" | 智能体越权与失控 |
| AI 感知网络防护 | 在网络层识别并限制 AI 流量、提示词流与智能体行为 | AI 流量可视与管控 |
| AI 行为可观测 | 对模型用量、token 消耗、支出与潜在敏感数据暴露提供可见性 | AI 使用与成本的合规审计 |
| 智能体驱动的漏洞修复 | 基于业务风险的优先级排序、攻击路径分析与补丁编排 | 修复优先级与自动化 |
表中能力据相关厂商在 RSAC 2026 / Black Hat 2026 等公开场合披露,具体功能、适用场景与可用性以各厂商官方文档及正式发布信息为准。
企业落地四步法
代理式 AI 安全并非"买一个平台"即可解决,更贴近一套治理 + 技术能力的组合。建议按以下路径推进。
第一步:资产清点
先看清"有哪些智能体"。梳理企业内已部署或计划引入的智能体、MCP 服务器、插件、技能与可调用工具,建立资产清单:
- 嵌入式 SaaS 智能体(如办公套件中的 Copilot 类能力):重点在流量与内容审计
- 自建目标导向 / 多智能体系统:重点在机器身份与最小权限
- 第三方插件与 MCP 工具:重点在供应链信任与权限范围
第二步:身份与权限治理
- 为智能体发放独立机器身份,禁止共用长期凭证
- 按任务定义最小权限集合,定期回收不再需要的授权
- 将智能体身份纳入企业身份与访问管理体系统一审计
- 对外部模型 / 组件建立供应商评估与更新机制
第三步:运行时监控与阻断
- 对高危工具调用设置审批或策略 gate
- 在出口处检测并拦截敏感数据外泄
- 通过微隔离限制智能体的通信范围
- 建立行为基线,对偏离基线的调用实时告警或阻断
第四步:取证与持续改进
智能体安全需要专属的取证数据:提示词、工具调用、身份与权限都应成为一类新的日志与证据。通过持续复盘事件、更新策略与基线,使治理能力随业务一同演进。相关行业联盟已在推动面向自主智能体事件的取证流程,提示词、调用链与身份将成为标准取证要素。
常见误区
误区一:选一个"安全模型"就够了
模型安全只是其中一层。业务风险更多来自工具调用、权限配置与运行环境,而非模型本身。治理应覆盖"模型 + 身份 + 工具 + 数据 + 运行时"全链路。
误区二:开源模型部署在内网就安全
内网部署降低了部分外部暴露,但一旦边界被突破,缺乏运行时监测的开源模型同样可能成为风险源。网络边界不等于安全闭环。
误区三:提示词过滤能解决一切
提示注入发生在处理链路内部,单纯过滤输入输出难以覆盖所有路径。真正的控制点应下沉到执行层——谁、调用了什么、产生了什么结果。
误区四:智能体安全 = 传统 IAM
传统 IAM 面向相对稳定的"人/设备",而智能体的权限是任务级、短时、可组合的。需要的是面向"非人主体"的机器身份与行为级管控,而非简单复用静态账号模型。
网络韧性:不可省略的兜底
无论预防多么完善,仍需假设"可能被突破"。网络韧性(Cyber Resilience)强调在事件发生后快速恢复业务:干净的恢复点、可验证的备份、明确的恢复流程。2026 年行业报告显示,数据泄露的平均成本仍处于高位,而具备自动化与韧性的安全体系可显著降低单次事件损失。将"恢复能力"纳入智能体安全设计,是务实且必要的补充。
常见问题(FAQ)
什么是代理式 AI(Agentic AI)?与传统生成式 AI 有何不同?
生成式 AI 以"生成内容"为主,输出文本、代码或图像;代理式 AI 在此基础上具备自主行动能力——能拆解任务、调用工具、读写数据并持续推进工作流。差异的关键不在"模型多大",而在"能否独立执行操作"。
为什么传统安全手段难以直接管控 AI 智能体?
传统模型以"人"和"设备"为中心:身份系统管人、终端管理管设备。智能体是拥有凭证、可调用工具、能跨系统行动的非人主体,既不像典型用户,也不像典型设备。若沿用为服务账号设计的粗放授权,其权限半径可能远超预期。
机器身份(Machine IAM)是什么?为什么重要?
机器身份是为智能体、脚本、服务等非人主体建立的独立身份与权限体系。它的重要性在于:让智能体的每一次调用都可被识别、授权与审计,避免"共用长期凭证 + 广泛权限"带来的失控风险,是代理式 AI 安全的基础能力。
提示注入能完全通过过滤解决吗?
较难。提示注入发生在模型的处理链路内部,智能体可读取的邮件、网页、文档、聊天记录都可能成为注入载体。有效的做法是将控制点下沉到执行层:对工具调用做审批、对敏感数据出域做拦截、对行为基线做偏离检测,而非仅依赖输入过滤。
企业应如何开始做 AI 智能体安全治理?
建议从资产清点起步:先盘点企业内的智能体、MCP 服务器、插件与可调用工具;再为智能体建立独立机器身份与最小权限;随后在运行时对高危调用做监控与阻断;最后建立专属取证与持续改进机制。网络韧性作为兜底一并规划。
开源或内网部署的模型是否天然安全?
不是。内网部署可降低部分外部暴露,但边界被突破后,缺乏运行时监测的开源模型同样可能成为风险源。安全应覆盖模型、身份、工具、数据与运行时的全链路,而非仅依赖部署位置。
AI 智能体安全与零信任架构是什么关系?
二者高度互补。零信任的"持续验证、始终审视"原则可延伸到智能体:基于任务的细粒度权限、行为监督、访问与操作分离。企业已有的零信任、SASE 架构,可作为智能体身份与访问控制的衔接基础,避免重复建设。
中小型企业是否需要关注 AI 智能体安全?
需要,但投入可分层。即便未自建智能体,企业也常使用嵌入在 SaaS 中的 Copilot 类能力,面临数据泄露与影子 AI 风险,可通过 SSE / AI 网关做流量与内容审计。随着自建或深度使用智能体的增多,再逐步补齐机器身份与运行时管控。
总结:把"非人主体"纳入安全治理
代理式 AI 的价值在于把人从重复劳动中解放出来,而它的风险也恰恰来自"自主行动"。企业不必等待"覆盖全生命周期的单一平台"出现——行业现状是尚无覆盖全生命周期的单一方案,更务实的路径是先治理、再赋能:看清资产、管住身份与权限、控住运行时、兜住恢复能力。将智能体视为一类新的、需要被持续验证的非人主体,安全体系才能真正支撑 AI 从"辅助"走向"自主"。
在架构层面,代理式 AI 安全与企业既有的 零信任(ZTNA)、SASE 架构 以及 端点与 SOC 能力 天然衔接:身份、网络、终端三层控制点,都可以成为智能体治理的支撑。与 企业组网与安全融合 的方向一致,安全能力越融入业务架构,智能体带来的效率提升才越可持续。
VISBAT 维思贝特持续跟踪代理式 AI 安全等前沿方向,可为企业开展安全架构评估与方案规划提供技术支持。文中涉及的厂商产品能力以各厂商官方发布文档为准。
需要代理式 AI 安全架构评估或方案咨询?
我们的安全团队可帮助企业梳理智能体资产,规划机器身份、运行时管控与零信任衔接路径