ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

企业做 AI 应用,最容易低估的不是技术,而是数据治理

企业做 AI 应用,最容易低估的不是技术,而是数据治理 很多团队做 AI 应用时精力都放在技术层- 选哪个模型- Prompt 怎么调- 架构怎么设计- RAG 怎么搭这些都重要。但真正上线之后团队往往发现**卡住的不是技术是数据。**知识不干净、权限不一致、格式混杂、过期、冲突每一个都会让前面的工程努力打折扣。数据工程的工作量往往明显超过 LLM 接入本身。这不是个别团队的问题。几乎所有做企业级 AI 应用的团队都会在数据这一层踩坑。这篇讲清楚一件事**企业做 AI 应用最容易低估的不是技术而是数据治理。**---## 一、为什么数据是新的这个首发红利消失得最快先回顾一个前面讲过的判断首发顺利是因为首发红利在撑着——知识是新的、Prompt 是精调的、用户问题结构可控、没有历史包袱。这 4 个红利里数据是新的这个红利消失得最快。### 1业务在变数据会变旧首发时知识是新的但业务在变、产品在变、政策在变、用户问题在变。知识库如果不同步更新几周后就会和现实脱节。### 2用户在用数据会变脏首发时数据是干净的但用户开始用之后会产生新的数据——新问题、新反馈、新边界。这些数据如果没人治理会越积越脏。### 3系统在跑数据会变多首发时数据量可控但系统跑起来后数据会持续增长——知识库扩张、文档累积、历史会话增多。数据量大了原本不是问题的问题会变成问题。### 4团队在改数据会变乱首发时数据结构是清晰的但团队在迭代过程中会改——改切分、改标签、改权限、改来源。改多了数据结构会变乱。数据是新的这个红利首发后几周就开始消失。如果数据治理没跟上首发再顺的系统也会在数据变旧、变脏、变多、变乱的过程中慢慢失控。---## 二、低估 1知识不干净——重复、过期、权限不一致、格式混杂这是最常见的一类低估。很多团队以为知识库就是把文档导进去、建好索引、能检索就行。但企业文档进知识库之前往往有一堆问题。### 更像真实现场的过程团队把企业文档导进知识库。上线后开始出问题- 同一份文档有 3 个版本索引里都存了检索时不知道召回哪个- 上季度的价格表还在库里用户问最新价格Agent 召回了旧版本- 某份文档标注了内部可见但权限没传到检索层外部用户也能搜到- PDF 里的表格没解析出来检索时召回了乱码### 为什么会低估- 以为文档导进去就能用没做清洗- 以为文档是新的没做版本管理- 以为权限是系统层的事没在数据层做隔离- 以为格式都能解析没做格式校验### 真正该做的- **去重**导入前去重同一文档的多版本要做版本管理- **过期管理**标注有效期过期的自动失效或降权- **权限前置**权限要在检索层就过滤不能等召回了再脱敏- **格式校验**PDF 表格、扫描件、图片要做格式解析和校验- **知识清洗**导入前做清洗——去噪、标准化、补元数据### 一句判断**知识不干净检索再准也白搭。数据工程的工作量往往超过 LLM 接入本身。**---## 三、低估 2切分和召回不是一次配置永久有效这是第二类低估。很多团队以为RAG 的切分和召回策略上线时调好就永久有效。但实际上切分和召回需要持续调。### 更像真实现场的过程团队上线时调好了切分策略——按段落切、按 token 数切。上线时效果不错。几个月后- 知识库扩张了原来切分策略对新文档不适用- 用户问题结构变了原来召回策略对新问题不适用- 新增了表格和图片切分策略没处理- 知识更新了但切分没跟着更新新旧知识切分不一致召回质量开始下降但团队不知道是切分的问题以为是模型变差了。### 为什么会低估- 以为切分是一次性配置- 以为召回策略不需要持续调- 没有定期复盘召回质量- 没有把切分策略和知识类型关联### 真正该做的- **切分策略分层**不同文档类型用不同切分策略——Markdown、PDF、表格、代码- **召回策略持续调**定期复盘召回质量按知识类型和问题类型调- **切分和召回要联动**切分变了召回策略要跟着调- **做 A/B 测试**新切分策略上线前先做 A/B 测试- **召回质量要监控**召回准确率、召回覆盖率、召回延迟要持续看### 一句判断**切分和召回不是一次配置永久有效。知识在长问题在变策略要跟着调。**---## 四、低估 3检索到不等于回答可信——引用、忠实度、覆盖率要可量化这是第三类低估。很多团队以为检索到了知识回答就可信了。但检索到和回答可信之间还有一段距离。### 更像真实现场的过程团队上线了 RAG检索召回率 90%团队觉得效果不错。但用户反馈回答不可信- Agent 召回了知识但回答时没用自己编了一套- Agent 召回了 3 条知识只引用了 1 条漏了关键信息- Agent 召回了知识但回答和知识矛盾——知识说 A回答说了 B- Agent 召回了旧知识但回答时没标注用户以为是最新信息### 为什么会低估- 以为召回率等于可信度- 没有做回答忠实度评估- 没有做引用追溯——回答引用了哪条知识- 没有做覆盖率评估——召回了 3 条用了几条### 真正该做的- **引用追溯**回答必须标注引用了哪条知识能追到原文- **忠实度评估**回答是否忠于召回的知识有没有编造- **覆盖率评估**召回了 N 条回答引用了几条覆盖率是多少- **冲突检测**召回的知识之间有没有矛盾怎么处理- **新鲜度标注**回答引用的知识是什么时候的是不是最新### 一句判断**检索到不等于回答可信。引用、忠实度、覆盖率要可量化才能说回答可信。**---## 五、低估 4权限和数据边界没前置——不同租户/部门的数据混进同一检索结果这是最危险的一类低估。企业 AI 应用里数据权限是硬要求。不同租户、不同部门、不同角色的数据不能混。但很多团队把权限做在了应用层没做在数据层。### 更像真实现场的过程团队做企业知识库 RAG权限做在了应用层——用户登录后应用层过滤该用户能看到的知识。但检索层没做权限过滤。用户 A 问了一个问题Agent 在检索时把所有租户的知识都召回了包括租户 B 的。应用层过滤的时候只过滤了展示环节但召回结果已经包含了 B 的知识Agent 在推理时已经看到了。用户 A 问竞争对手的产品怎么样Agent 召回了租户 B竞争对手的产品信息回答里泄露了 B 的数据。### 为什么会低估- 以为应用层过滤就够了没在检索层做权限隔离- 以为召回结果不展示就没事但 Agent 推理时会看到- 没有按租户/部门/角色做数据隔离- 权限没有前置到数据层和检索层### 真正该做的- **权限前置**权限要在检索层就过滤不能等召回了再脱敏- **数据隔离**按租户/部门/角色做数据隔离不同租户的数据不能混在一个索引里- **召回过滤**检索时就带权限过滤召回结果只包含该用户有权访问的- **脱敏兜底**即使召回过滤失效展示层也要做脱敏兜底- **审计**谁在什么时候检索了什么、看到了什么要可追溯### 一句判断**权限不能只做在应用层。数据层和检索层不做隔离权限就是漏的。**---## 六、低估 5知识更新没有快通道——重流程让知识永远滞后于业务这是第五类低估。知识更新是 AI 应用能不能长期跑的关键。但很多团队的知识更新流程太重让知识永远滞后于业务。### 更像真实现场的过程团队的知识更新流程是业务方提需求 → 运营整理 → 技术入库 → 重新索引。一个流程走下来几天甚至几周。但业务变化不会等流程走完- 产品价格今天改了知识库下周才更新- 新功能今天上了知识库下周才有- 政策今天调整了知识库下周才同步用户问到的永远是最新的问题但知识库给的是滞后的答案。### 为什么会低估- 以为知识更新可以走重流程- 以为业务会等知识更新- 没有建快通道——小更新即时上线- 没有把知识更新和业务变更联动### 真正该做的- **快通道**小更新即时上线大更新走评审- **联动**业务变更时知识库同步更新- **更新验证**更新后做效果验证不只是入库了就完事- **新旧不混用**新知识上线旧版本要下架不能混用- **更新监控**知识更新频率、更新效果要监控### 一句判断**知识更新没有快通道知识就会永远滞后于业务。用户问最新的你答滞后的。**---## 七、一个最小可用的企业 AI 数据治理框架如果要把上面这些落地最小可用的框架是### 第 1 层知识质量治理- 导入前清洗去重、去噪、标准化、补元数据- 版本管理同一文档的多版本要管理过期的要失效- 格式校验PDF、表格、图片要做格式解析- 权限标注每条知识标注可见范围### 第 2 层检索质量治理- 权限前置检索时就带权限过滤- 切分策略分层不同文档类型用不同策略- 召回质量监控准确率、覆盖率、延迟持续看- 切分和召回联动策略变更要一起调### 第 3 层回答可信治理- 引用追溯回答标注引用了哪条知识- 忠实度评估回答是否忠于召回的知识- 覆盖率评估召回了 N 条引用了几条- 新鲜度标注回答引用的知识是什么时候的### 第 4 层数据边界治理- 租户隔离不同租户数据不混在一个索引- 权限前置检索层就做权限过滤- 脱敏兜底展示层做脱敏兜底- 审计追溯谁检索了什么、看到了什么### 第 5 层知识更新治理- 快通道小更新即时上线- 业务联动业务变更时知识同步更新- 新旧不混用新上线旧下架- 更新验证更新后做效果验证这 5 层建起来企业 AI 应用的数据治理才算有了骨架。建不起来首发再顺的系统也会在数据变旧、变脏、变多、变乱的过程中慢慢失控。---## 八、结语企业做 AI 应用最容易低估的不是技术而是数据治理。很多团队以为选好模型、调好 Prompt、搭好架构、做好 RAG就能跑起来。但真正上线之后卡住的是数据——知识不干净、切分要持续调、回答不可信、权限有漏洞、更新跟不上业务。5 个最容易低估的点- 知识不干净——重复、过期、权限不一致、格式混杂- 切分和召回不是一次配置永久有效- 检索到不等于回答可信- 权限和数据边界没前置- 知识更新没有快通道这 5 个点不做前面的工程努力都会打折扣。数据工程的工作量往往超过 LLM 接入本身。对技术负责人来说做企业 AI 应用最该先建的不是更聪明的模型而是**能不能把数据治理住。**数据治理不是一次性工程是持续运营。而真正能把知识质量、检索质量、回答可信、数据边界、知识更新统一管起来的是一个能把数据、权限、审计、更新分层管起来的统一治理层——这正是网关层在企业级 AI 应用里该承担的角色。
返回列表