敏感数据要出网先脱敏?群晖 AI Console 去标识化配置全解
引言
套件接上第三方 AI 之后,MailPlus 的邮件摘要、Office 的文档辅助都要把内容送到外部模型处理——法务合同、薪酬数据、客户信息原文出网,是很多企业放开 AI 功能前迈不过去的坎。Synology AI Console 的「去标识化」功能为此而生:在把敏感数据发送给 AI 提供商之前用占位符替换敏感数据,系统将匿名化数据传输到公有云 AI 提供商,并在收到响应后安全地恢复原始信息。这篇按官方帮助把启用前置、配置步骤、语言与实体的取舍、效果边界讲全。
什么场景用它最值
一是合规敏感团队:法务、财务、人力要用 AI 辅助又不能让客户信息、薪酬数据原文出网,去标识化是前置必选项。二是已放开 AI 功能的存量环境:套件 AI 早已全员启用,事后补一道脱敏闸,不动使用习惯只改出网形态。三是内存有限的设备:去标识化对内存有硬要求,启用前先按这篇核对资源,避免开起来拖垮整机。
操作步骤
-
先确认套件侧 AI 链路已通。为什么:去标识化保护的是「套件 AI 功能发出的数据」,前提是 MailPlus、Synology Office 这些支持 AI 集成的套件已在 AI Console 里完成启用——为所有用户启用 AI、选定 API 集成、需要时用排除名单圈住部分群组或用户;这段启用链路此前已单独成文,此处不重复展开。链路没通就配脱敏,配了也没有流量可管。
-
核对两项硬前置,缺一不可。为什么:官方要求——NAS 上须从套件中心安装 Container Manager,此软件包是启用去标识化所必需的;且设备必须具有 8 GB 或更多内存,系统会在启用该功能之前检查设备的可用内存。前者缺了进不了启用流程,后者不达标直接被系统拦下;内存本来就是 8 GB 的设备,还要考虑其他套件的占用余量。
-
三步走完启用。为什么:在「去标识化」页面上单击「启用」,选择去标识化的语言后单击「下一步」,再选择要匿名化的实体并单击「应用」——语言和实体两个选择就是这台设备脱敏策略的全部开关,后面两步分别讲怎么选。
-
语言要克制,每个语言约 1 GB 内存。为什么:官方建议仅选择需要去标识化信息的必要语言——每个语言包大约使用 1 GB 的内存,要确保监控可用内存,避免在内存有限的设备上出现性能和稳定性问题。中文环境就只选中文,顺手勾全家桶的代价是内存被语言包吃掉、留给业务的余量变小。
-
实体选择要贴着自己业务的数据形态。为什么:启用流程里「选择要匿名化的实体」决定哪些类别的信息会被替换成占位符——不同企业敏感点不同:薪酬密集的团队重点是姓名与账号类实体,合同处理重点是主体与证件类实体。按实际文档形态勾选,比全选更省资源也更可核查。
-
理解「替换—上云—恢复」的机制再定数据分级。为什么:官方描述的链路是——敏感数据在发送给 AI 提供商之前被占位符替换,系统将匿名化数据传输到公有云 AI 提供商,收到响应后安全地恢复原始信息。也就是说 AI 提供商侧看不到原文,但 NAS 本地仍持有原文与映射关系;数据分级要基于这个机制定:一般商业文档可走,极高敏感内容仍应走本地化方案或不进 AI 流程。
-
给脱敏效果设定正确预期。为什么:官方明示——去标识化功能依赖于 AI 模型或正则表达式,虽然设计为准确,但不能保证 100% 屏蔽敏感数据;同时去标识化更多语言可能会降低 AI 生成信息的准确性。它显著降低泄露概率,但不是免罪牌,验收口径不能写成「零泄露」。
-
把语言与实体的选择留档。为什么:这两项选择就是脱敏策略本身——审计问「客户姓名出网前有没有处理」,答案就是这条配置记录。启用完成后把语言清单、实体清单、启用日期一起写进运行文档,策略变更时可追溯。
三条边界先知道
- 资源硬门槛:Container Manager 必装、8 GB 内存起步,语言包再按每语言约 1 GB 叠加,启用前系统会检查可用内存。
- 不保证 100% 屏蔽:功能依赖 AI 模型与正则表达式,官方明确不能保证完全屏蔽敏感数据。
- 多语言有精度代价:去标识化更多语言可能会降低 AI 生成信息的准确性,语言清单要做减法。
结语
AI 能力放开的速度可以快,数据出网的形态必须先定。去标识化把「原文直送」改成「占位符出门、原文回家」,是套件 AI 进合规环境的那道闸。贵州诚鑫致达科技在做企业 AI 套件启用交付时,会把脱敏语言清单、实体清单与数据分级口径一并写进启用记录,让每一条出网数据都有出处、有依据。