- 禁止使用 AI 通常不管用。员工会改用自己的手机继续用,公司反而看不见。
- 不同数据的风险高低不同。把数据分级,再规定每一级可以用哪种 AI。
- 机密文件多的公司,比如手上有投标报价、合同或客户数据,应该有一套内部 AI,按每个人的权限读取文件。
有人把数据贴进 AI 聊天框之后,数据去了哪里
采购员把所有供应商的报价表贴进 AI 聊天框,让它帮忙比较;人事专员把员工名单连同工资贴进去,让它画图表。两个人都只是想把活干得快一点,公司里却没有一个人知道,这些数据已经出去了。
贴进公共 AI 服务的内容,会发送到服务商的服务器上处理,并按照该服务的政策保存。某些个人账户允许服务商用对话内容改进模型,除非用户自己关闭这项设置。公司这边也完全没有记录,不知道谁在什么时候发出去了什么,客户或审计人员问起时,公司就答不上来。

2023 年 5 月,三星发现工程师把内部源代码和会议记录贴进了 ChatGPT,随后禁止员工在公司设备上使用公共 AI 工具。这种公司不知情的 AI 使用有个名字,叫影子 AI(Shadow AI)。只要员工有手机,每家公司都会发生。
三种选择,各自要付出什么
公司有三种选择:禁止使用;向 AI 服务商购买企业版;或者把模型部署在自己的基础设施上。每种选择得到的东西不同,代价也不同,大多数公司最后会同时用上不止一种。
| 选择 | 得到什么 | 要付出什么 | 适合谁 |
|---|---|---|---|
| 禁止使用 AI | 不用投入 | 员工改用个人渠道继续用,公司既损失效率,也失去了可见性 | 法律或合同明确禁止的特定工作 |
| AI 服务商的企业版 | 市场上最强的模型,写明不用数据训练模型的合同,以及员工账号管理功能 | 数据仍然在公司外部处理,需要看清条款和数据存放地 | 数据没有存放地限制的大多数公司 |
| 私有化部署的大模型(Private LLM),放在公司内部或私有云(Private Cloud)上 | 数据留在公司自己的基础设施里,权限和使用记录都由自己控制 | 硬件费用、维护费用,而且自己运行的模型往往落后于大服务商的最新版本 | 有合同约定的机密数据、敏感数据,或者客户和监管机构有要求的组织 |
常见的误解是,只要把模型部署在公司内部,数据自然就安全了。如果内部 AI 能读取所有文件夹,实习生也能问出管理层的工资。风险只是从泄露到公司外,变成了跨部门泄露。所以内部 AI 能看到的文件,必须限于提问者有权看到的范围。

模拟案例
工程咨询公司:一份流进 AI 聊天框的报价草稿
一家 120 人的工程咨询公司经常参加投标。一位工程师把含有单位成本的投标方案草稿贴进公共 AI 聊天框,让它帮忙润色文字,主管路过时碰巧看到了屏幕。事情报到管理层,第一个问题是:这种事以前发生过多少次?没有人答得上来。
管理层决定不禁止,因为他们知道投标团队要写大量文件,AI 确实帮得上忙。公司按下面的方法把数据分成四级,为内部级的工作购买企业版,并为机密级搭建内部助手。这个助手可以检索过往的投标方案、工作标准和合同,但只显示提问者有权打开的文件夹里的文件。公司先只在投标部门试点。
把数据分成四个等级
- 公开级:已经放在公司网站上的数据,可以用于任何 AI
- 内部级:操作手册、工作流程和一般会议记录,可以用于公司签了企业合同的 AI
- 机密级:价格、成本、合同和客户数据,只能用于控制权限、留有使用记录的内部 AI
- 受限级:健康数据、个人工资和合同禁止披露的文件。在数据负责人和法律顾问逐案批准之前,不得输入任何 AI
做法是让每个部门的主管挑出团队最常用的十种文件,逐一归级,在文件夹上标好级别,再用本部门实际工作中的例子培训员工。应该留存的依据,是文件类型及其级别的清单,以及还没归级的文件数量。这个方法可能在两个地方失败:一是分级分得太细,员工记不住;二是定了机密级,却没有获准用于这一级的 AI,员工就会回头去用公共 AI。
内部 AI 助手要具备什么,才值得信任
用 Vibe Coding(氛围编程)做一个根据文件回答问题的聊天机器人,一天就能做完。花时间的是另外三件事:按每个人的权限回答,能指出出处文件,留有可供事后核查的记录。有了这三样,法务部门和 IT 部门才会同意上线。
权限应该和公司现有的员工账号系统绑定。员工通过单点登录(SSO)用和其他系统相同的账号登录,助手只检索这个账号能打开的文件。员工调岗或离职时,助手里的权限会立即随之变化。
每个回答都应该附上所引用的文件,提问者可以点开原文,知道答案出自哪个版本。这种先检索文件、再让模型回答的系统,叫作检索增强生成(RAG)。它还有一个好处:文件修改后,回答会随之更新,不需要重新训练模型。
公司还要决定两件事:对话记录保存多久,以及谁可以查看操作日志。如果文件里有客户的个人数据,把这些数据交给外部服务商处理,就落入泰国《个人数据保护法》(PDPA)的管辖范围。公司应该和服务商签订数据处理协议,并在上线前请法律顾问或数据保护官审核。

写给开发团队 · 技术细节
在 Vector Search 这一层就按权限过滤检索结果,把 ACL 和每份文件的 Embedding 存在一起。账号通过 SSO 打通,用户组自动同步。把提问、检索到的文件和回答记入审计日志(Audit Log)。做 Model Routing:机密级用内部模型,内部级用服务商的模型。发送到公司外部之前先对 PII 脱敏,并用各部门的真实提问建立评测集(Evaluation Set),衡量准确性和引用情况。
符合以下几点,暂时不必投资私有大模型
- 公司的大部分数据属于公开级和内部级
- 没有合同或规定要求数据存放在特定地点
- 团队里还没有人能维护服务器和模型
这类公司用企业版配合数据分级政策就够了。等机密级工作多起来,再只为这部分加一个内部助手。
试点期间衡量四个指标:使用公司批准的 AI 的员工比例,每周提问次数,引用文件版本正确的回答比例,以及发现机密级数据外传的次数。如果满三个月,员工仍然把公共 AI 用在机密级工作上,说明内部助手应付真实工作的能力还不够,应该先改进回答质量,再推广到其他部门。
让团队用 AI 处理公司文件,文件仍然留在公司里
公司的权限结构,您的 IT 部门最清楚;哪些类型的数据有限制,由法律顾问和数据保护官来判断;哪些文件属于机密,各部门主管心里有数。DNA Maker 和这三方一起开工作坊,为数据分级,并梳理出一张地图:文件放在哪里,谁能打开,员工想从这些文件里问什么。
接着,我们在您的基础设施或私有云上部署语言模型,搭建一个检索内部文件、回答时附带出处的助手。助手按提问者的权限过滤结果,保留审计日志,上线前要通过回答质量评测。工作从一个部门的试点开始,衡量员工是否真的在用、回答有多准,然后再推广。如果还不确定公司适合哪种选择,可以带上员工最常用 AI 处理的文件类型清单来和我们聊聊。我们会帮您分级,并指出哪些部分需要用内部系统。
SOFTWARE ENGINEERING GLOSSARY
软件工程术语表
管理层、IT 部门和法务部门商定如何用 AI 处理公司数据时,会用到这些词。
| 术语 | 是什么 | 通俗示例 | 高管应问开发团队的问题 |
|---|---|---|---|
| Private LLM | 运行在公司自己控制的基础设施上的语言模型,输入的数据不会流向外部服务商 | 检索公司合同的助手,运行在公司自己机房的服务器上 | 每年的硬件和维护费用是多少?回答质量和外部服务相差多少? |
| On-premise | 把系统安装在公司场所内的服务器上,不租用云服务 | 运行模型的服务器放在总部的机房里 | 谁维护服务器、更新系统?服务器坏了谁负责? |
| Data Classification | 按敏感程度给数据分级,规定每一级可以怎样存储、传送和使用 | 成本价格表归为机密级,所以只能用于内部 AI | 哪些类型的文件还没有分级?分级不明确时由谁决定? |
| Shadow AI | 员工使用公司没有批准、也看不到的 AI 工具 | 员工用个人手机拍下合同,交给 AI 应用做摘要 | 我们怎么知道员工现在用哪些 AI 处理哪些工作? |
| DLP | 检测并阻止重要数据流出公司的工具,全称 Data Loss Prevention | 有人把大量身份证号码贴到外部网站时,系统发出警告 | 设定的规则覆盖哪些等级的数据?误报有多频繁? |
| Data Residency | 规定数据必须在哪个国家或地区存储和处理的要求 | 与客户的合同规定,项目数据必须存放在泰国境内的服务器上 | 我们的数据在哪些国家处理过,包括发送给 AI 的时候? |
| SSO | 用公司账号登录一次,就能进入多个系统,全称 Single Sign-On | 员工用公司邮箱账号登录 AI 助手,离职时所有系统的权限同时关闭 | 员工调岗后,助手里的权限多久会跟着改变? |
