做 AI 应用,我们和用户的数据会不会被大模型厂商拿走?
结论:使用外部大模型 API 时,发送的提示词、检索片段、文件或工具参数必然会离开你的应用并由供应商处理;是否用于训练、保存多久、存在哪个地区、谁能访问,则取决于具体产品、接口、账户配置和合同。RAG 只能让原始知识库留在企业侧,不能阻止命中的内容被发送给模型。高敏数据先做最小化和脱敏;若任何原文都不得出域,再评估本地或专有环境部署。
“会不会被厂商拿走”混合了传输、处理、留存、训练和泄露五件事。供应商为生成答案必须处理你发送的内容,这不等于它一定拿去训练,也不等于零留存。客户说明哪些数据可以用于验证、哪些绝不能出域以及适用的内部制度后,滚水科技会画出每一条数据流,核对官方数据控制文档、数据处理协议和实际控制台设置,并提交可用端点、配置与部署建议;不会把审查任务留成一句“请向供应商询问”。
在落实合规责任、证据与技术控制时,还可以对照 把需求和创意告诉你们,会不会被抄去做给别的客户?怎么保护我的想法?;这些内容补充了需要放在同一项决策中考虑的上下文。
三种使用方式的数据边界
| 使用方式 | 数据经过哪里 | 常见优点 | 主要风险 | 直接建议 |
|---|---|---|---|---|
| 消费级聊天产品 | 用户直接上传到公共产品账户 | 开通快、体验方便 | 管理员、留存、训练选择和账号审计未必满足企业要求 | 不输入客户、密钥和业务敏感数据 |
| 企业 API 或企业工作区 | 企业应用经合同账户调用供应商 | 权限、日志、数据条款和集成能力较完整 | 端点留存、地区、工具和子处理方仍需逐项核对 | 多数企业应用的起点 |
| 本地或专有环境模型 | 模型和数据主要在企业控制环境 | 内容不必发送公共模型 API | 算力、效果、漏洞、模型供应链和运维由企业承担 | 确有不出域要求且有运营能力时采用 |
本地部署也不是“数据绝对安全”:模型文件、更新源、运维人员、遥测、外部工具、备份和日志仍可能形成外流路径。反过来,合规配置的企业 API 可能比员工私自使用多个免费聊天工具更易治理。选择应依据数据等级、合同要求、任务效果和总成本,而不是只看部署地点。
RAG 到底会发送什么
典型 RAG 将文档保存在客户控制的存储中,对用户问题做检索,再把命中的若干片段连同问题交给模型。因此整库未必上传,但被检索到的原文会进入模型请求。若先把整份文件上传到供应商文件或向量存储功能,则文件还可能作为应用状态保存,其删除和留存规则与普通无状态请求不同。
发送前应删除任务不需要的姓名、电话、证件、账户、病历和商业秘密,用内部标识替代;按用户权限检索,不能先取出全公司资料再让提示词决定“不要泄露”。输出也要检查越权、敏感信息和日志泄露。缓存、可观测平台、错误追踪、内容审核、远程 MCP 或其他工具都是额外接收方,应进入同一张数据清单。
以 OpenAI API 为例说明为什么必须逐端点核对
截至 2026 年 8 月 25 日,OpenAI 官方 API 数据控制文档写明:API 数据默认不用于训练或改进模型,除非客户明确选择共享;默认滥用监控日志可能包含提示词和响应,通常最长保留 30 天;部分符合条件的客户可申请 Modified Abuse Monitoring 或 Zero Data Retention。与此同时,不同端点的应用状态不同,例如 conversations、files、vector stores 等可能保存到删除,Responses 的存储行为又受参数和账户设置影响。
这组事实只适用于 OpenAI 当前官方 API 条款,不能外推到 ChatGPT 消费产品、其他 OpenAI 产品或其他模型厂商,也不能替代客户合同。即使获批零数据保留,也要核对具体端点是否支持、图像文件例外、第三方工具、地区处理和法律保留要求。文章不再只链接泛化的“企业隐私”营销页,而是引用端点级官方文档。
滚水科技将供应商审查形成书面结论
滚水科技会逐项确认:数据是否用于基础模型训练;默认和可选留存期;哪些端点持久化应用状态;删除如何触发及多久完成;存储与推理地区;子处理方;人工访问条件;加密和密钥选项;安全事件通知;数据主体请求如何协助;合同终止后的导出与删除;远程工具、搜索和日志的额外数据流。我们会把答案、证据链接、未确认项、适用产品版本和复核日期写入方案;模型厂商仍对其条款和平台行为负责,法律结论由客户与专业顾问确认。
在中国境内处理个人信息时,还需判断企业、开发方和模型供应商分别承担什么角色,是否存在委托处理、向其他处理者提供或跨境路径,按最小必要、告知同意、敏感个人信息、影响评估和安全措施等要求处理。法律结论由客户及专业顾问结合真实数据流确认,不能因为供应商宣称“不训练”就视为全部合规。
上线前做可观察的数据流验收
为每个 AI 任务建立允许字段和禁止字段,用测试账号验证不同角色只能检索自己的资料;抓取出站请求确认实际发送内容、端点、地区域名和第三方工具;检查提示词、响应、向量、文件、缓存、应用日志和备份的保存位置与删除时间。用合成的手机号、证件号、密钥和越权文档测试拦截与告警,禁止使用真实秘密做安全测试。
验收记录包括敏感字段外发命中数、越权检索成功数、未知外部接收方数量、删除请求完成情况、配置与合同不一致项和人工复核率。目标不是口头的“绝对不泄露”,而是禁止数据不发送、允许数据有明确目的和接收方、异常可检测和处置。
滚水科技做 AI 应用时,会先把客户数据源、检索、模型、工具、日志和管理员后台画成数据流,优先使用企业账户与服务端 API,并将供应商、端点、留存配置和脱敏规则写入方案。公司可实施权限、RAG、脱敏、代理网关和本地模型,但不能替客户或模型厂商作无限的数据安全保证。AI 相关案例是第一方经验展示,最终边界以客户配置和合同为准。
当前官方依据
- OpenAI API 数据控制官方文档:用于核对 OpenAI API 的训练、滥用监控、应用状态、零数据保留和数据驻留;不外推到其他产品或厂商。
- 《中华人民共和国个人信息保护法》:用于核对个人信息处理的一般法律框架。
- 滚水科技案例中心:公司第一方 AI 项目展示,不能替代供应商数据协议和技术验收。