AI 与数据结合,真正改变的不是“多了一个聊天框”,而是数据从产生到决策的整条链路。过去的数据平台主要回答发生了什么;新的 AI 数据系统还要解释原因、生成假设、预测变化,并在可控条件下触发动作。
这篇先建立全景。后续文章会分别展开大数据底座、架构演进、岗位变化和落地路线。
一、AI 进入数据链路的七个位置
| 环节 | AI 能做什么 | 典型输出 | 必须保留的控制 |
|---|---|---|---|
| 采集 | 识别文档、图片、语音和日志 | 结构化事件 | 原文、时间戳、解析版本 |
| 质量 | 发现异常、重复、缺失和口径冲突 | 质量规则候选 | 确定性校验与隔离区 |
| 治理 | 自动分类、敏感字段识别、血缘补全 | 标签和目录 | 人工确认、权限策略 |
| 分析 | 自然语言转查询、图表解释、归因假设 | SQL、图表、分析草稿 | 指标口径和查询审计 |
| 预测 | 分类、排序、需求与风险预测 | 分数和区间 | 时间切分、基线、漂移监测 |
| 知识 | 在文档和数据产品中检索并回答 | 带证据的答案 | 引用、权限继承、拒答 |
| 执行 | 根据规则和模型建议触发流程 | 工单、补货、提醒 | 阈值、审批、幂等和回滚 |
这七层不要求同时建设。多数团队最合适的起点是“带证据的检索”和“分析辅助”,因为输出仍由人复核,错误影响相对可控。
二、三类 AI 不应混成一个模型
生成式 AI适合处理非结构化文本、解释字段、生成查询草稿和总结结果。它输出灵活,但存在幻觉和不稳定性。
传统机器学习适合对结构化历史数据做分类、排序、预测和异常检测。它更容易离线评估,却仍会受到数据漂移、标签偏差和泄漏影响。
规则与优化算法适合执行权限、额度、库存、排班和资源约束。它们可测试、可审计,应当承担最后的硬限制。
一个可靠系统通常是三者协作:大模型理解意图,数据与机器学习给出证据和分数,规则引擎决定哪些动作允许执行。
三、从展示价值走向业务价值
第一层价值是节省查找时间,例如问数、文档检索和会议资料汇总。第二层是减少分析成本,例如生成 SQL 草稿、解释异常和自动形成日报。第三层是提高决策质量,例如需求预测、客户流失预警和风险排序。第四层才是有限自动执行,例如低风险补货建议、告警分派和数据质量修复工单。
价值越靠后,越需要稳定的数据契约、离线评测、线上监控和人工接管。没有可信数据底座时,智能体只是把不确定性更快地传播到下游。
四、选择第一个场景的四个条件
- 输入数据已有明确负责人和使用权限。
- 输出可以用历史样本或人工标准验证。
- 错误不会直接造成不可逆的资金、健康或权益影响。
- 现有流程有清晰基线,例如平均处理时长、错误率或人工成本。
适合起步的项目包括内部知识问答、指标解释助手、数据质量告警归类和分析报告草稿。直接自动审批、自动定价或自动影响个人权益的场景,需要更严格的评估与治理。
五、完整闭环
一个 AI 数据产品至少要保留:数据来源与版本、转换代码、特征或检索版本、模型与提示词版本、输出证据、人工反馈、业务结果和回滚记录。NIST AI RMF 将风险管理组织为 Govern、Map、Measure、Manage 四类活动,提醒团队把治理放入整个生命周期,而不是上线前补一张检查表。
下一篇从大数据底座与湖仓分层开始,把数据如何进入、变干净、可复用和可追溯讲清楚。
六、常见失败信号
如果团队无法回答数据来自哪里、指标由谁定义、输出怎样验收,就不应先增加模型复杂度。只统计调用量而不看业务结果,会把使用热度误当成价值;让同一个模型负责理解、预测和最终审批,则会把不稳定输出直接带入关键流程。
可以先对照企业 AI 数据体系落地路线图建立基线和门禁,再决定是否扩展自动化范围。每增加一种数据源、模型或行动工具,都要补充负责人、评测样本、权限和停止条件。