- 自动化程序会在公司各处悄悄冒出来,没人统计,直到有一天,谁也说不清到底有哪些东西在运行。
- 再增加下一个之前,先要有一份登记册:有哪些、谁负责、用什么数据、花多少钱。
- 每一个都应该有停止按钮,系统不可用时也要有备用的工作方式。
1. 智能体泛滥(Agent Sprawl)是能替人动手的影子 IT
这种事以前就发生过:各部门自己偷偷注册软件来用,最后公司都不知道数据散落在哪些地方。这一次会来得更快,因为做一个自动化程序用不了一小时。
以前的 SaaS 工具顶多是存数据,智能体却能调用 API、发送消息、修改记录,还能持续运行。没有登记册,公司就不知道是谁做的、用了什么数据、现在还需不需要。发起人(Sponsor)离职以后,他名下的智能体可能仍然持有凭据(Credential),按定时计划照常运行。
智能体调用其他智能体时,风险会更大。一个地方出错,可能沿着工作流一路扩散,比如数据摘要错了,接着报价和发给客户的消息也跟着错。管控要覆盖整条链路,只检查最终结果是不够的。
2. 建立智能体登记册和生命周期
问问自己:现在能不能说出公司有多少个自动化程序、各归谁负责、哪些还在用?如果答不上来,这就是要做的第一件事。

写给开发团队 · 技术指标
目录(Catalog)要能搜索,并与身份系统(Identity)关联,记录负责人(Owner)、发起人、版本、模型、知识库、工具、运行环境、KPI、成本和依赖项。状态应包括草稿(Draft)、测试中(Testing)、已批准(Approved)、已暂停(Suspended)和已退役(Retired),并附上审批证据。
写给开发团队 · 技术细节
建立受理流程(Intake Process),让各团队提交应用场景(Use Case);批准新建之前,先检查已有的智能体。使用统一的模板和连接器(Connector),减少重复建设。设定有效期:如果智能体长期没人使用,或发起人没有确认续用,系统就自动降低它的权限或直接关停。
| 生命周期 | 控制措施 | 证据 |
|---|---|---|
| 创建 | 用途、发起人、风险 | 登记记录和设计 |
| 测试 | 评测、红队测试(Red Team) | 测试报告 |
| 运行 | 身份、日志、预算 | 仪表盘 |
| 变更 | 版本 + 重新评测 | 发布记录 |
| 退役 | 撤销权限、导出、删除 | 关停证明 |
3. 智能体要像员工一样有自己的身份,护栏还要比员工多
写给开发团队 · 技术细节
禁止使用共享账号。为每个智能体创建专属身份,以便追踪每个操作(Action)来自哪个智能体。指定承担责任的发起人,按最小权限原则分配权限。要区分代表用户操作的智能体(Acting-on-behalf-of)和会话中没有人在场的自主智能体(Autonomous Agent)。
写给开发团队 · 技术细节
使用限时访问(Time-bound Access)、审批和条件策略(Conditional Policy)。智能体只读取任务需要的数据,不要为了对接方便就给管理员(Admin)权限。密钥(Secret)必须存放在密钥保管库(Vault)中,并且可以轮换。发起人调岗时,系统必须自动转交归属或暂停该智能体。
4. 划分风险等级,管控既不过严也不过松
- 第 1 级 · 辅助(Assist):读取非机密数据并生成草稿,每次都由人检查
- 第 2 级 · 内部操作(Internal Action):写入内部系统,操作可以撤回,设有抽样检查和日志
- 第 3 级 · 对外或重大操作(External/Material):联系外部人员、修改重要数据或涉及资金,必须经过审批并设定服务水平协议(SLA)
- 第 4 级 · 高影响(High Impact):涉及招聘、信贷、健康、法律或人身安全,必须做全面评估,并由专业人员全程参与
写给开发团队 · 技术细节
风险等级决定评测、监控和审批的要求,以及访问权限复核的频率。总结会议内容不必走和审批贷款一样多的流程,但每个等级都要有负责人,并明确允许使用哪些数据。
5. 可观测性(Observability)要能说明智能体想了什么、做了什么
写给开发团队 · 技术细节
日志要把请求(Request)、计划(Plan)、工具调用(Tool Call)、数据来源、策略判定(Policy Decision)、人工审批和结果(Outcome)串起来。用追踪 ID(Trace ID)跟踪跨智能体的工作。机密数据不要保存超过必要的范围,并按风险设定保存期限(Retention)。
写给开发团队 · 技术细节
仪表盘显示成功率、异常、延迟(Latency)、成本、策略违规和结果。当智能体出现异常模式、工具调用次数异常偏多或质量发生漂移(Drift)时发出告警。每次发布(Release)都抽样回放(Replay),并跑一遍黄金用例(Golden Cases)。
为重要操作生成可解释的回执(Explainable Receipt):做了什么、什么时候做的、代表谁、用了哪些数据和策略、怎样撤回。客服支持、审计和用户信任都会因此受益。
6. 用面向智能体的 FinOps 控制成本
写给开发团队 · 技术细节
多步骤的智能体可能反复调用模型和工具。要按任务、智能体、团队和月份分别设定预算。分类和信息提取用小模型,只有确实需要推理(Reasoning)的环节才用昂贵的模型。对数据做缓存(Cache),并限制循环次数。
采用分摊计费(Chargeback)或成本展示(Showback),让各团队看到自己的成本。没有产出成果或使用率低的智能体,应当合并或关停。削减成本不能让质量和安全降到护栏以下。
7. 为事故和业务连续性做好准备
写给开发团队 · 技术细节
制定应急预案(Playbook):发现(Detect)、遏制(Contain)、撤销权限(Revoke)、回滚、通知(Notify)和复盘(Learn)。每个智能体和工具都要有紧急停止开关(Kill Switch),另外还要有全局紧急模式。定期做桌面推演(Tabletop),比如模拟智能体大量发出错误数据,或者凭据泄露。
写给开发团队 · 技术细节
关键工作流要保留人工后备方案(Manual Fallback)和最低产能。备份配置、提示词(Prompt)、策略和数据血缘(Data Lineage)。即使供应商服务中断,公司也必须看得到各项工作的状态。按影响程度设定恢复时间目标(RTO)和恢复点目标(RPO)。
8. 智能体达到上百个时的运营模式
写给开发团队 · 技术细节
采用联邦式模式(Federated Model):中央平台和安全团队负责身份、策略、可观测性和目录,各业务领域团队(Domain Team)负责自己的工作流、知识和结果。设立 AI/智能体委员会(AI/Agent Council),专管标准和高风险事项,不逐一审批每天的任务。
写给开发团队 · 技术指标
每季度复盘一次智能体组合(Portfolio),决定每个智能体是扩大规模、改进、合并还是退役。把登记覆盖率、访问权限复核和事故情况与业务价值放在一起衡量。组建红队或质量团队,由开发者以外的人独立测试重要的智能体。
总结:100 个智能体要当作一支员工队伍来管理,有身份、发起人、生命周期、风险等级、成本控制和事故控制。数量少的时候就要开始建控制平面(Control Plane),因为等泛滥之后再回头清理凭据和负责人,代价很高。治理做得好,团队照样能快速开发,走的还是可审计的轨道。
在智能体数量失控之前,先把登记和管控体系建起来
您的 IT 和安全团队清楚公司能承受多大的风险、哪些数据绝不能流出系统;各业务线负责人则清楚哪些工作一旦出错损失最大。DNA Maker 把这两方面的视角整合成系统里真正强制执行的规则,规则不会只停留在政策文件上。我们帮您建立智能体登记册,写明每个智能体归谁负责、使用哪些数据、拥有哪些权限、花费多少、属于哪个风险等级,并配上从申请审批到退役的完整生命周期。
增加下一个智能体之前必须具备的条件
接下来是控制平面系统:集中管理登记册、权限、每个智能体的预算和日志,并提供一个界面,随时能回答现在有哪些东西在运行、归谁负责、花了多少钱。我们会设置告警,在费用或错误率超过阈值时通知相关人员,并为不能中断的工作配备紧急停止开关和后备方案。行之有效的起步方法,是先把今天已经存在的东西登记下来,哪怕还不完整。如果您说不出公司现在有多少个智能体或自动化程序、分别由谁负责,那就是该动手的信号。
SOFTWARE ENGINEERING GLOSSARY
软件工程术语表
这组术语讲的是,自动化系统数量很多时,怎样管好这些系统并保证安全。
| 术语 | 是什么 | 通俗示例 | 高管应问开发团队的问题 |
|---|---|---|---|
| Service Account | 供系统或智能体工作时使用的账号,与员工账号分开 | 智能体用自己的账号访问系统,不和员工共用账号 | 每个系统用的是谁的账号?能不能立即撤销权限? |
| Observability | 能够知道系统正在做什么、为什么得出某个结果的能力 | 能回查这个智能体答错之前调取了哪组数据 | 出问题时,我们要花多长时间才能找到原因? |
| FinOps | 管理系统成本,让成本能按部门或按工作项看得见、管得住 | 给每个智能体设定月度预算,快到上限时发出提醒 | 执行一次工作的成本是多少?由谁负责? |
| Risk Tier | 给工作划分风险等级,以决定需要多严格的管控 | 直接面向客户的工作,风险等级高于内部总结 | 我们按什么标准划分等级?最高等级由谁审批? |
| Decommission | 有序地让不再使用的系统退役,同时保留数据并撤销权限 | 关停没人使用的智能体,并按政策保留日志 | 由谁决定关停?剩下的数据怎么处理? |
