新闻详情

新闻详情

首页 / 资讯中心 / 详情

大模型时代,数据治理与AI的“双向奔赴“

发布时间:2026/9/30 12:33:06来源:尧图网络
大模型时代,数据治理与AI的“双向奔赴“
大模型时代数据治理与AI的双向奔赴有一个冷知识大模型项目的预算八成花在模型上翻车的原因八成在数据上。我们去年那个知识库项目就是标准样本。RAG架构模型用的当时最能打的一个。立项会上为选模型吵了三个钟头数据怎么整三分钟全票通过意见就四个字先跑起来再说。这句话后来被证明是全年最贵的决策。上线一个月业务方的反馈清单越来越像事故报告引用三年前废止的老制度把两个部门打架的口径搅成一锅还有最出圈的一次实习生在系统里搜出了高管的薪酬。排查到凌晨三点结论写在会议纪要上平静得近乎无情模型没有错。表格是解析器切碎的旧文件没人下线薪酬文件没人想过要拦。模型只是把喂给它的东西忠实地复述了一遍。后来看到Gartner在2024年7月的预测到2025年底至少30%的生成式AI项目会在概念验证之后被放弃首要原因不是模型能力而是数据质量差、风险控制缺位。另一条预测更狠到2026年拿不出AI就绪数据的企业六成以上的AI项目会被放弃。大模型没有制造新的数据问题它把企业过去十年欠下的数据债一次性全讨回来了。但它同时也在还一笔大礼治理数据的成本被AI实实在在打了折。讨债和还债同时发生这就是数据治理和AI的双向奔赴。先看讨债的这一面。传统数据治理有个默认边界核心库表、主数据、指标口径。这套体系通常只覆盖了企业数据里最规整的那一小块。剩下的合同、图纸、会议纪要、邮件、客服录音这些非结构化数据普遍被认为占了企业数据的八成以上没有元数据没有责任人没有版本堆在黑屋子里大家绕着走。RAG的路数恰恰是把黑屋子整个搬空把每样东西都请到模型面前。于是过去可以绕开的问题全变成了前置必答题。最先撞上的是解析。扫描件的OCR错误、PDF表格被切碎、页眉页脚混进正文人读的时候一眼就跳过去了机器读的时候全是毒药。切片会把错误固化进向量库之后每次检索都命中同一处错误。很多团队第一反应是调提示词、换模型折腾一圈才发现瓶颈在解析这一层。这也是过去一年文档解析工具能长成一条独立赛道的原因。然后是权限。传统BI的权限守在报表层而RAG的检索如果感知不到文档本身的访问控制实习生搜出高管薪酬就不是意外是迟早。这把锁现在有了名字叫权限感知检索ACL-aware retrieval企业级方案基本已经当成标配。更隐蔽的是时效。文档更新了向量库里的旧切片还躺着制度改了口径新旧两版并存检索时一并召回回答全凭运气。向量库正在长成一座新的数据仓库那就得用管数据仓库的标准来管它版本、生命周期、下线流程一样不能少。最麻烦的是血缘与合规。一份文档从哪来、谁授权的、出了错能不能溯源这些从前可以含糊现在不行了。国内的《生成式人工智能服务管理暂行办法》2023年8月施行白纸黑字要求训练数据来源合法欧盟AI法案2025年8月起要求通用大模型公开训练数据摘要。合规不再是数据团队发文件倡议而是长出牙齿的监管。过去数据质量差损失是隐性的。Gartner估算过企业每年因数据质量问题平均损失一千余万美元但报表不准还能靠人工核对兜底。AI时代没有人工兜底同一个错误人犯一次模型可以犯一万次而且每一次都理直气壮。讨债讲完了再讲还债。数据治理过去为什么总排不上优先级因为它是个赔本差事花钱、防错、收益看不见。AI恰好把这门生意的成本结构改了。最直观的是人力苦役。给表写业务口径注释一个治理专员一天写二十张写到眼睛发直现在让模型读一遍表结构和样本数据起草说明人只做核对一天几百张。敏感数据的分类分级过去靠人海一份份过手现在模型初筛、人工抽检复核快了几倍不止而且因为有人把着最后一道闸准确率反而比纯人工更稳。何况分类分级本来就是《个人信息保护法》之下躲不掉的功课从前大家只是各自躲着现在躲不动了。数据质量稽核也类似格式错乱的手机号、逻辑矛盾的日期、同一个客户八种写法这类规则的发现和验证模型已经干得不错。还有一桩容易被忽略的好处出考卷。知识库上线前应该有一套评测集一批带标准答案的问题用来度量检索和回答的质量。过去全靠人工设计出不起几道现在让模型照着真实文档批量拟题人工拣选定稿。数据整理得好不好不用再吵跑一遍考卷便知。治理这件事头一回有了自己的度量衡。成本降下来之后ROI的逻辑就反转了。整好的那批数据直接决定RAG和Agent答得准不准、上线快不快。三分模型、七分数据已经是从业者少有的共识。于是出现了一个多年未见的现象从前是治理团队追着业务要口径现在是业务方来敲治理的门“我们要上知识库你们什么时候把数据整好”我们那个翻车的知识库最后只做了三件事给文档打版本号给检索接上权限让每个回答附上出处。三个月后投诉停了。修它没有用任何高深的技术用的全是治理喊了十年、没人肯认真做的那几样。至于路径别等大而全的治理工程。先拣AI要用的那两成数据来治治一样、用一样应用的边界走到哪里治理就跟到哪里。大公司的正路多半不是另起炉灶而是在攒了多年的家底上接着盖目录、血缘、权限本来就有缺的只是接到向量库和Agent的流水线上。小公司没有历史包袱从第一个AI应用起就把元数据、权限、版本三样立起来成本远低于事后补救。最怕的是两头不靠旧的没接上新的没立规。把讨债和还债合起来看变化就不是局部的而是范式级的维度传统数据治理大模型时代治理对象库表、主数据、指标非结构化文档、语料、向量库、合成数据核心目标报表准确、过审计AI应用效果 合规 可追溯关键动作建模、定标准、质量稽核解析切分、权限感知检索、语料血缘度量口径质量分、标准覆盖率检索准确率、回答可溯源比例、评测通过率组织角色数据治理专员懂AI的数据工程师 懂数据的AI工程师过去讲治理讲的是管物把每样东西登记、擦拭、归位现在要讲管流东西从哪里来、经过谁的手、去了哪里、用过几回。这是在管一条供应链供应链就要有供应链的管法。供应链上还多了两样旧账本里没有的东西。首先是合成数据。互联网上的新语料渐渐用尽用AI生成数据再喂AI只会越来越多。2024年《自然》杂志的研究给这个隐患起了名字叫模型崩塌model collapse影子生影子真实的细节一代代磨掉像翻拍又翻拍的老照片。合成数据不是不能用但它本身成了新的治理对象来源要标注、质量要评估、混入比例要可控。更麻烦的是删除问题。数据可以从库里删掉但已经融进模型参数的知识删不掉。所以各国的新规都指向同一个方向国内的《人工智能生成合成内容标识办法》2025年9月起施行欧盟的训练数据透明义务也已生效AI用过的每一份数据都得说得出从哪来、到哪去。经常有人问数据治理工程师会不会失业。不会。失业的不是人是旧的活法从写数据标准文档的变成给AI搭数据供应链的服务对象也从一年一度的审计变成一群等米下锅的算法工程师。回到开头那个项目。它现在活得好好的业务方每周还在催着往知识库里加新文档。回头看杀死AI项目的从来不是模型救活项目的也不是模型。模型只是那条流水线上最亮的一环而流水线上游的解析、权限、版本、血缘才决定这条线到底是流水线还是瀑布。数据治理和AI从来不是谁服务谁。AI要更好的数据AI也让治理数据第一次变得划算。这两件事撞在一起做数据的人和做AI的人接下来要干的是同一份活。你们的项目翻过什么车、后来怎么修的评论区聊聊让我看看谁的最惨烈。注Gartner预测出自其2024年7月29日新闻稿即30%的GenAI项目将于2025年底前在PoC后被放弃及其关于AI-ready data的2026年预测模型崩塌出自Shumailov等发表于《自然》2024年7月的研究《生成式人工智能服务管理暂行办法》2023年8月15日施行《人工智能生成合成内容标识办法》2025年9月1日施行欧盟《人工智能法案》通用模型透明义务2025年8月2日起适用。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

YOLOv11交通事件检测实战:从模型训练到应急联动闭环 2026/9/30 13:28:53

YOLOv11交通事件检测实战:从模型训练到应急联动闭环

简介:面向智慧交通与目标检测开发者的实战型技术文档,围绕YOLOv11事故识别与应急响应联动机制,系统讲解从算法原理到系统落地的完整链路。资源为单个PDF文件,共38页,容量2.2MB,文档支持目录章节跳转与左侧大…

阅读更多 →
已经把 node_modules 提交并推送到 Gitee,怎么删掉(本地 + 远程仓库) 2026/9/30 13:28:43

已经把 node_modules 提交并推送到 Gitee,怎么删掉(本地 + 远程仓库)

问题:已经把 node_modules 提交并推送到 Gitee,怎么删掉(本地远程仓库)node_modules 一般不要提交,体积巨大,需要加入 .gitignore1. 先添加 .gitignore(防止以后再误提交) 在项目根目…

阅读更多 →
改进YOLOv8s实现隧道衬砌裂缝检测与实例分割实战 2026/9/30 13:28:27

改进YOLOv8s实现隧道衬砌裂缝检测与实例分割实战

简介:面向隧道工程安全检测与计算机视觉算法研究人员,该文档呈现了利用改进YOLOv8s算法对隧道衬砌裂缝进行精准识别与分割的完整研究方案。内容结合人工智能与深度学习技术,从隧道结构损伤检测需求入手,分析人工巡检、传感器监测等…

阅读更多 →
Agentic AI Infra实战:从模型选型到智能体工程化落地 2026/9/30 13:28:26

Agentic AI Infra实战:从模型选型到智能体工程化落地

1. 从“模型会聊天”到“模型会干活”:Agentic AI Infra到底解决什么问题 过去两年,行业内最明显的一个变化,就是大家不再纠结“哪个模型的排行榜分数更高”,而是开始问一个更实际的问题:模型能不能真的帮我把事情办了…

阅读更多 →
鹰眼免越狱 PC 端 v1.0.4.1011 版本更新|ios 免越狱群控支持 iOS15-iOS26 自动加载开发者镜像 2026/9/30 13:28:16

鹰眼免越狱 PC 端 v1.0.4.1011 版本更新|ios 免越狱群控支持 iOS15-iOS26 自动加载开发者镜像

在苹果多设备批量运维场景下,ios 免越狱群控方案凭借无需对 iPhone/iPad 进行越狱,保留设备原生系统安全特性,受到很多测试、运维人员的关注。 鹰眼免越狱 PC 端作为面向苹果设备批量管控的工具,持续迭代优化系统兼容性与投屏稳定…

阅读更多 →
音游谱面解析与本地可视化调试:JSON、判定区间与配乐对齐 2026/9/30 13:28:07

音游谱面解析与本地可视化调试:JSON、判定区间与配乐对齐

音游谱面不只是“按节奏点”:我用一套本地工具链解析「MuseDashAP Lv.3」的谱面 JSON、判定区间与 FM 电台式配乐对齐 第一次看到“MuseDashAP Lv.3 暮色電台 FM103 - Baby Pink”这个标题,很多人的第一反应是“这又是一首音游 BGM 的视频”。但这篇要聊…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉