企业级 Agent 的安全治理,核心是回答三个问题:Agent 能访问什么数据、能执行什么操作、出了问题能否追溯。与只输出文字的聊天机器人不同,Agent 会自主拆解任务、调用工具、读写业务系统,一旦出错就是真实发生的操作。本文给出一套可执行的治理框架五件套:身份与权限、敏感操作审批、输出审核、日志审计、决策可追溯,并梳理中国与欧盟的合规要点,供 CTO、CIO 在选型和上线前逐项核对。

Agent 引入的新风险面:错误会落地成操作

传统软件按预设逻辑运行,行为可预测;聊天机器人说错话,影响止于误导读者。Agent 拿到的是执行权:接收一个业务目标,自行决定查什么数据、调什么工具、做什么操作。Gartner 2025 年预测,到 2028 年至少 15% 的日常工作决策将由 agentic AI 自主做出,而 2024 年这个比例是 0。执行权交出去之后,三类新风险随之出现。

自主执行:不确定性直接进入生产系统

Agent 的行为由模型推理产生,同样的输入可能得到不同的动作序列。传统测试无法穷举它的行为空间,错误也不再停留在建议层面,而是变成对业务系统的真实写操作。

工具调用:提示注入成为第一大攻击面

Agent 在执行中会读取网页、文档、数据等外部内容,这为提示注入(Prompt Injection)打开了入口:藏在外部内容里的指令,可以在人不知情的情况下改变 Agent 的行为。OWASP《Top 10 for LLM Applications 2025》将提示注入连续第二版列为 LLM 应用第一大安全风险,并明确承认"由于 LLM 的随机性,尚不清楚是否存在万无一失的防护方法",建议以最小权限、高危操作人工审批、对抗测试做纵深防御。

数据访问:授权越宽,泄露面越大

Agent 需要足够宽的数据面才有业务价值,但宽授权同时放大泄露风险。IBM《Cost of a Data Breach Report 2025》显示,13% 的组织已报告涉及 AI 模型或应用的安全事件;而在这些发生 AI 相关安全事件的组织中,97% 缺乏适当的 AI 访问控制。

这些风险不是理论推演。斯坦福 HAI《AI Index 2025》统计,2024 年 AI 事件数据库记录的相关事故达 233 起,创历史新高,同比增长 56.4%。

治理缺口:三份独立报告指向同一个结论

三家机构从不同角度做的研究,结论指向一处:出问题的通常不是模型能力,是治理没跟上。

IBM 从安全事件侧给出证据:63% 的被攻破组织没有 AI 治理政策,或政策仍在制定中;20% 的被攻破组织失守原因是"影子 AI",即员工未经审批自用 AI 工具;影子 AI 使用程度高的组织,每次泄露平均多付 67 万美元(该报告统计的全球平均单次泄露成本为 444 万美元)。

Deloitte《State of AI in the Enterprise 2026》(2025 年 8 至 9 月调查 24 国 3235 名董事会成员与高管)从组织准备度侧印证:agentic AI 使用量将在两年内急升,但只有约五分之一的公司拥有成熟的自主 AI agent 治理模型;42% 的企业自评战略上"高度准备好",落到基础设施、数据、风险、人才的具体维度,自评信心反而更低。

Gartner 也把成本攀升、业务价值不清晰、风险控制不足列为 agentic AI 项目被取消的主要原因(具体比例与拆解见《企业 Agent 落地的十大失败模式》)。

还有一个更隐蔽的缺口是"认险不控险"。斯坦福 AI Index 引述的调查显示,64% 的组织把不准确性列为风险、63% 列合规风险、60% 列网络安全风险,但采取主动缓解措施的比例均显著更低。知道有风险与管住风险,是两回事。

Agent 治理框架五件套

治理不是买一个安全产品,而是一套贯穿 Agent 全生命周期的机制。下面五件事缺一件,就留一个洞。

企业级 Agent 治理框架五件套
企业级 Agent 治理框架五件套

一、身份与权限:给 Agent 发一个"工号"

Agent 必须有独立身份,不能借用员工或管理员账号跑任务。独立身份是其余治理机制的前提:权限随身份配置,日志随身份记录,出了问题能定位到具体 Agent 和具体场景。授权遵循最小化原则,只开放当前场景所需的数据范围与操作类型,数据侧做到行级、列级的分级控制,默认拒绝、按需开放。前文 97% 那个数字值得再读一遍:出了 AI 安全事件的组织几乎都没做好访问控制。这是回报率最高的一道防线。

二、敏感操作审批:高危动作保留人工闸口

先定义清单:哪些操作算高危。典型的有对外发送消息、批量修改数据、变更线上配置、执行资金相关动作。低风险的查询与分析放给 Agent 自主执行,高危操作必须经人工审批,并按风险等级区分审批人。这也是 OWASP 针对提示注入给出的核心缓解手段:既然无法保证注入被完全挡住,就要保证即使被注入,高危动作也过不了人这一关。

三、输出审核:错误结论不能直接进决策

输出要过三道检查:结论是否有数据来源支撑;是否包含需要脱敏的敏感信息;不确定时是否如实说明,而非编造一个确定的答案。企业级场景还要加一条触达范围控制:分析结论发给谁、报告推送到哪个群,应由规则决定,不由 Agent 临场发挥。

四、日志审计:全链路留痕,可查可警

日志要覆盖完整链路:用户输入、任务拆解、每一次工具调用、每一次数据访问、最终输出。存下来只是第一步,日志要可检索、可设告警,异常时段的批量数据访问、反常的高频调用都应触发通知。留存期限对齐企业自身的合规与内审要求。

五、决策可追溯:每个结论都能回答"依据是什么"

这是"可信决策"的落点。业务团队敢把 Agent 结论用于真实决策,前提是结论可追溯:用了哪些数据、口径是什么、推理路径如何、重跑能否复现。它与日志审计的分工在视角:审计面向安全与合规团队,回答"发生了什么";可追溯面向业务使用者,回答"凭什么信"。口径要稳,前提是有统一的语义定义。以 ThinkingAI 的全域感知为例,它强调为 Agent 提供"统一的语义体系"和一致的决策上下文,让同一个问题在不同时点、不同场景下尽量做到"同问同果"——可追溯才有稳定的口径基准。

补上底座:token 成本与资源监控

成本监控常被划到安全治理话题之外,实际是个不小的盲区。成本失控本身就是项目被取消的主因之一。Agent 的 token 消耗弹性极大,一个循环失控的任务可能在一夜之间烧掉一个月的预算。配额管理、按场景与部门归集成本、异常消耗告警,这三件事应与权限体系同批上线。

风险与对策对照表

Agent 六类核心风险与对策映射
Agent 六类核心风险与对策映射
风险典型场景对策对应治理件
提示注入网页、文档中暗藏指令改变 Agent 行为输入过滤、工具白名单、高危操作人工审批敏感操作审批
权限越界Agent 借共享账号访问超出场景所需的数据独立身份、最小权限、行列级数据授权身份与权限
敏感数据外泄分析结论中带出个人信息或商业机密输出脱敏与过滤、触达范围控制输出审核
错误结论误导决策模型幻觉产生无依据的数字与归因来源引用、口径校验、不确定时明示输出审核 + 决策可追溯
行为不可追溯出现问题无法还原 Agent 做了什么全链路日志、推理链与数据引用记录日志审计 + 决策可追溯
成本失控任务循环失控导致 token 消耗激增用量配额、成本归集、异常消耗告警成本与资源监控

这张表可以直接用于内部评审:逐行检查现有方案是否有对应机制,缺哪行补哪行。

合规要点:中国备案制与欧盟 AI Act

先说明:本节是对公开监管信息的梳理,不构成法律意见,具体义务请以法规原文和专业法律意见为准。

中国:包容审慎、分类分级、备案制

《生成式人工智能服务管理暂行办法》由网信办等七部门联合公布,2023 年 8 月 15 日施行,共 5 章 24 条,确立"包容审慎和分类分级监管"原则。与企业 Agent 落地关系最直接的几条:第七条要求训练数据来源合法;第九条规定服务提供者承担网络信息内容生产者责任;第十七条要求具有舆论属性或社会动员能力的服务开展安全评估,并按规定履行算法备案手续。

备案已形成规模。据网信办公告,截至 2026 年 4 月 30 日,累计 868 款生成式 AI 服务完成备案、530 款应用或功能完成登记;已上线的应用须在显著位置公示所使用的模型名称与备案号。对采购方的实际含义很直接:选型时确认服务商的备案状态,是尽职调查的基本动作。

欧盟:风险分级、事前合规、高额罚款

《AI Act》于 2024 年 8 月 1 日生效,分阶段适用:2025 年 2 月禁止性条款生效,2025 年 8 月通用 AI 模型义务生效。此后的义务按领域分三条时间线推进:第 50 条(Article 50)关于 AI 交互与生成内容的透明度义务,自 2026 年 8 月 2 日起适用;部分高风险领域的义务,自 2027 年 12 月 2 日起适用;作为受监管产品安全组件、嵌入产品的高风险系统,自 2028 年 8 月 2 日起适用。罚则按违规类型分档:违反禁止性条款最高罚 3500 万欧元或全球年营业额的 7%(取高者),违反其他义务最高 1500 万欧元或 3%。

对有海外业务的数据密集、高频运营型企业(例如游戏、社交、电商等出海团队),两套框架都要对齐:面向国内用户的服务对照备案要求,面向欧盟用户的产品对照 AI Act 的风险分级义务。

把治理前置到选型:上线后再补,代价翻倍

多数企业的治理动作做反了顺序:PoC 阶段用管理员权限图省事,等要上生产才发现权限体系、审计日志都要重做,工期和预算随之翻倍。"权限与安全后置"是企业 Agent 落地的十大失败模式中的典型一条,而它完全可以在选型阶段避免。

具体做法是把治理能力当硬性评估项写进平台选型清单:权限模型支持到什么粒度、审计日志覆盖哪些环节、成本管理有没有配额和告警。平台原生具备这些能力,与靠企业自己在外围拼装,长期维护成本差别很大。以 ThinkingAI Agentic Engine 为例,其企业级管理能力覆盖权限、审计与 token 成本管理;部署方式上也提供私有化部署选项,企业可按自身的数据管理要求选择。

治理同样应嵌入落地路线图的每个阶段:PoC 就用真实权限模型跑通,试点期验证审批与审计流程,而非把它们留给"以后再说"。

三个本周就能做的动作:盘点当前在用和在试的 Agent 及其权限范围;写出你所在业务的高危操作清单;把治理五件套加进正在进行的选型评估表。

常见问题

Agent 安全与传统应用安全的最大区别是什么?

治理对象从代码变成了行为。传统应用的行为由代码决定,测试可以覆盖;Agent 的行为由模型推理产生,同样输入可能有不同动作,且自然语言本身成了攻击面。所以在传统安全手段之外,还需要权限收敛、人工审批闸口和全链路行为审计。

没有专职安全团队的企业,Agent 治理从哪里开始?

从三件成本最低、收益最高的事开始:给 Agent 独立身份并按最小权限授权、给高危操作设人工审批、开启全链路日志。同时在选型时优先选择原生具备治理能力的平台,避免自己从零搭建权限与审计体系。

在中国提供或使用生成式 AI 服务需要备案吗?

按《生成式人工智能服务管理暂行办法》第十七条,具有舆论属性或社会动员能力的服务需开展安全评估并履行算法备案。截至 2026 年 4 月 30 日,累计 868 款生成式 AI 服务完成备案、530 款应用或功能完成登记。作为采购方,至少应确认服务商的备案状态;自身业务是否触发义务,建议咨询法务。

提示注入能被彻底防住吗?

按 OWASP 的结论,目前没有万无一失的方法。现实策略是纵深防御:输入过滤、工具白名单、最小权限、高危操作人工审批、对抗测试。治理目标不是杜绝注入发生,而是把单次注入的影响半径限制在可承受范围内。

token 成本为什么也算治理问题?

因为成本失控和安全失控一样能杀死项目。成本失控和安全失控一样,都是项目被取消的主因。配额、成本归集、异常消耗告警在上线第一天就该就位,而不是等账单超支后再补救。

下一步

如果你正在评估企业级 Agent 平台,想看看权限、审计、token 成本管理这些治理能力在真实产品中如何工作,可以申请体验 DEMO,用你自己的场景做一次对照检查。

申请体验 DEMO

参考资料