ARTICLE 05 · PRIVATE AI · 2026-08-30

员工把客户数据贴进 ChatGPT:数据不能离开公司的企业,有哪些私有化 AI 方案

不管公司允不允许,员工已经在用 AI 帮忙干活了。管理层要回答的问题是:哪类数据可以让哪个 AI 看到。本文比较三种选择,从禁止使用、AI 服务商的企业版,到部署在公司内部的模型,并给出一套员工真正照着做得到的数据分级方法。

员工把客户数据贴进 ChatGPT:数据不能离开公司的企业,有哪些私有化 AI 方案
要点速览
  • 禁止使用 AI 通常不管用。员工会改用自己的手机继续用,公司反而看不见。
  • 不同数据的风险高低不同。把数据分级,再规定每一级可以用哪种 AI。
  • 机密文件多的公司,比如手上有投标报价、合同或客户数据,应该有一套内部 AI,按每个人的权限读取文件。

有人把数据贴进 AI 聊天框之后,数据去了哪里

采购员把所有供应商的报价表贴进 AI 聊天框,让它帮忙比较;人事专员把员工名单连同工资贴进去,让它画图表。两个人都只是想把活干得快一点,公司里却没有一个人知道,这些数据已经出去了。

贴进公共 AI 服务的内容,会发送到服务商的服务器上处理,并按照该服务的政策保存。某些个人账户允许服务商用对话内容改进模型,除非用户自己关闭这项设置。公司这边也完全没有记录,不知道谁在什么时候发出去了什么,客户或审计人员问起时,公司就答不上来。

贴进公共 AI 聊天框的数据,在没人察觉的情况下离开了公司
贴进公共 AI 聊天框的数据,在没人察觉的情况下离开了公司

2023 年 5 月,三星发现工程师把内部源代码和会议记录贴进了 ChatGPT,随后禁止员工在公司设备上使用公共 AI 工具。这种公司不知情的 AI 使用有个名字,叫影子 AI(Shadow AI)。只要员工有手机,每家公司都会发生。

三种选择,各自要付出什么

公司有三种选择:禁止使用;向 AI 服务商购买企业版;或者把模型部署在自己的基础设施上。每种选择得到的东西不同,代价也不同,大多数公司最后会同时用上不止一种。

选择得到什么要付出什么适合谁
禁止使用 AI不用投入员工改用个人渠道继续用,公司既损失效率,也失去了可见性法律或合同明确禁止的特定工作
AI 服务商的企业版市场上最强的模型,写明不用数据训练模型的合同,以及员工账号管理功能数据仍然在公司外部处理,需要看清条款和数据存放地数据没有存放地限制的大多数公司
私有化部署的大模型(Private LLM),放在公司内部或私有云(Private Cloud)上数据留在公司自己的基础设施里,权限和使用记录都由自己控制硬件费用、维护费用,而且自己运行的模型往往落后于大服务商的最新版本有合同约定的机密数据、敏感数据,或者客户和监管机构有要求的组织

常见的误解是,只要把模型部署在公司内部,数据自然就安全了。如果内部 AI 能读取所有文件夹,实习生也能问出管理层的工资。风险只是从泄露到公司外,变成了跨部门泄露。所以内部 AI 能看到的文件,必须限于提问者有权看到的范围。

内部 AI 助手按每个人的权限回答,没有权限看的数据不会显示
内部 AI 助手按每个人的权限回答,没有权限看的数据不会显示

工程咨询公司:一份流进 AI 聊天框的报价草稿

一家 120 人的工程咨询公司经常参加投标。一位工程师把含有单位成本的投标方案草稿贴进公共 AI 聊天框,让它帮忙润色文字,主管路过时碰巧看到了屏幕。事情报到管理层,第一个问题是:这种事以前发生过多少次?没有人答得上来。

管理层决定不禁止,因为他们知道投标团队要写大量文件,AI 确实帮得上忙。公司按下面的方法把数据分成四级,为内部级的工作购买企业版,并为机密级搭建内部助手。这个助手可以检索过往的投标方案、工作标准和合同,但只显示提问者有权打开的文件夹里的文件。公司先只在投标部门试点。

把数据分成四个等级

  1. 公开级:已经放在公司网站上的数据,可以用于任何 AI
  2. 内部级:操作手册、工作流程和一般会议记录,可以用于公司签了企业合同的 AI
  3. 机密级:价格、成本、合同和客户数据,只能用于控制权限、留有使用记录的内部 AI
  4. 受限级:健康数据、个人工资和合同禁止披露的文件。在数据负责人和法律顾问逐案批准之前,不得输入任何 AI

做法是让每个部门的主管挑出团队最常用的十种文件,逐一归级,在文件夹上标好级别,再用本部门实际工作中的例子培训员工。应该留存的依据,是文件类型及其级别的清单,以及还没归级的文件数量。这个方法可能在两个地方失败:一是分级分得太细,员工记不住;二是定了机密级,却没有获准用于这一级的 AI,员工就会回头去用公共 AI。

内部 AI 助手要具备什么,才值得信任

用 Vibe Coding(氛围编程)做一个根据文件回答问题的聊天机器人,一天就能做完。花时间的是另外三件事:按每个人的权限回答,能指出出处文件,留有可供事后核查的记录。有了这三样,法务部门和 IT 部门才会同意上线。

权限应该和公司现有的员工账号系统绑定。员工通过单点登录(SSO)用和其他系统相同的账号登录,助手只检索这个账号能打开的文件。员工调岗或离职时,助手里的权限会立即随之变化。

每个回答都应该附上所引用的文件,提问者可以点开原文,知道答案出自哪个版本。这种先检索文件、再让模型回答的系统,叫作检索增强生成(RAG)。它还有一个好处:文件修改后,回答会随之更新,不需要重新训练模型。

公司还要决定两件事:对话记录保存多久,以及谁可以查看操作日志。如果文件里有客户的个人数据,把这些数据交给外部服务商处理,就落入泰国《个人数据保护法》(PDPA)的管辖范围。公司应该和服务商签订数据处理协议,并在上线前请法律顾问或数据保护官审核。

部署在公司内部的 AI 模型,文件交给 AI 读取,不会离开公司
部署在公司内部的 AI 模型,文件交给 AI 读取,不会离开公司
写给开发团队 · 技术细节

在 Vector Search 这一层就按权限过滤检索结果,把 ACL 和每份文件的 Embedding 存在一起。账号通过 SSO 打通,用户组自动同步。把提问、检索到的文件和回答记入审计日志(Audit Log)。做 Model Routing:机密级用内部模型,内部级用服务商的模型。发送到公司外部之前先对 PII 脱敏,并用各部门的真实提问建立评测集(Evaluation Set),衡量准确性和引用情况。

符合以下几点,暂时不必投资私有大模型

  • 公司的大部分数据属于公开级和内部级
  • 没有合同或规定要求数据存放在特定地点
  • 团队里还没有人能维护服务器和模型

这类公司用企业版配合数据分级政策就够了。等机密级工作多起来,再只为这部分加一个内部助手。

试点期间衡量四个指标:使用公司批准的 AI 的员工比例,每周提问次数,引用文件版本正确的回答比例,以及发现机密级数据外传的次数。如果满三个月,员工仍然把公共 AI 用在机密级工作上,说明内部助手应付真实工作的能力还不够,应该先改进回答质量,再推广到其他部门。

DNA MAKER · PRIVATE AI

让团队用 AI 处理公司文件,文件仍然留在公司里

公司的权限结构,您的 IT 部门最清楚;哪些类型的数据有限制,由法律顾问和数据保护官来判断;哪些文件属于机密,各部门主管心里有数。DNA Maker 和这三方一起开工作坊,为数据分级,并梳理出一张地图:文件放在哪里,谁能打开,员工想从这些文件里问什么。

接着,我们在您的基础设施或私有云上部署语言模型,搭建一个检索内部文件、回答时附带出处的助手。助手按提问者的权限过滤结果,保留审计日志,上线前要通过回答质量评测。工作从一个部门的试点开始,衡量员工是否真的在用、回答有多准,然后再推广。如果还不确定公司适合哪种选择,可以带上员工最常用 AI 处理的文件类型清单来和我们聊聊。我们会帮您分级,并指出哪些部分需要用内部系统。

软件工程术语表

管理层、IT 部门和法务部门商定如何用 AI 处理公司数据时,会用到这些词。

术语是什么通俗示例高管应问开发团队的问题
Private LLM运行在公司自己控制的基础设施上的语言模型,输入的数据不会流向外部服务商检索公司合同的助手,运行在公司自己机房的服务器上每年的硬件和维护费用是多少?回答质量和外部服务相差多少?
On-premise把系统安装在公司场所内的服务器上,不租用云服务运行模型的服务器放在总部的机房里谁维护服务器、更新系统?服务器坏了谁负责?
Data Classification按敏感程度给数据分级,规定每一级可以怎样存储、传送和使用成本价格表归为机密级,所以只能用于内部 AI哪些类型的文件还没有分级?分级不明确时由谁决定?
Shadow AI员工使用公司没有批准、也看不到的 AI 工具员工用个人手机拍下合同,交给 AI 应用做摘要我们怎么知道员工现在用哪些 AI 处理哪些工作?
DLP检测并阻止重要数据流出公司的工具,全称 Data Loss Prevention有人把大量身份证号码贴到外部网站时,系统发出警告设定的规则覆盖哪些等级的数据?误报有多频繁?
Data Residency规定数据必须在哪个国家或地区存储和处理的要求与客户的合同规定,项目数据必须存放在泰国境内的服务器上我们的数据在哪些国家处理过,包括发送给 AI 的时候?
SSO用公司账号登录一次,就能进入多个系统,全称 Single Sign-On员工用公司邮箱账号登录 AI 助手,离职时所有系统的权限同时关闭员工调岗后,助手里的权限多久会跟着改变?
明天就可以试试:问三位部门主管:上周团队用 AI 帮忙做了哪些工作,贴进去的是哪些文件?答案会告诉您,公司的机密级数据是不是已经在往外流了。