AI 对数据架构的核心要求,是让机器也能理解数据含义、判断证据质量,并在权限范围内调用数据和业务动作。存储规模仍然重要,但语义、上下文、评测和控制面开始成为架构中心。
一、五个阶段
阶段 1:企业数仓
结构化数据经过 ETL 进入主题模型,主要服务固定报表和经营分析。优势是口径稳定;局限是接入非结构化数据和实验型机器学习较慢。
阶段 2:数据湖
对象存储承接日志、文件、图片和原始数据,计算与存储分离。它提高了扩展性,但如果缺少目录、表格式、质量和负责人,容易形成难以发现与信任的数据沼泽。
阶段 3:Lakehouse
湖仓把开放存储与表管理、事务、模式约束和多种计算引擎结合,让 BI 与机器学习共享更多数据资产。架构重点从“放得下”转向“可信地复用”。
阶段 4:数据产品与数据网格
当中央数据团队成为瓶颈,领域团队可以负责客户、订单、供应链等数据产品,平台团队提供自助基础设施,组织层面维持统一的安全与治理标准。数据网格同时是组织设计,不能通过安装一个目录产品完成。
阶段 5:AI 原生数据平台
平台增加语义层、特征、向量索引、模型网关、评测与智能体工具。数据消费者从人和报表扩展到模型与智能体;每次回答和行动都要能定位数据、模型、规则与授权。
二、AI 原生架构的四个平面
数据平面保存表、流、文档、向量、特征和关系。
语义平面维护业务术语、指标、实体、知识关系和数据契约,让自然语言问题映射到可验证的数据对象。
智能平面负责模型路由、检索、提示词、工具调用、评测和反馈。这里不直接绕过数据权限。
控制平面统一身份、策略、血缘、审计、成本、质量和风险分级。NIST AI RMF 的 Govern、Map、Measure、Manage 可以用来检查这些能力是否贯穿系统生命周期。
三、智能体使“读数据”变成“用工具”
传统问数只生成查询;智能体可能继续创建工单、发送通知或修改配置。架构上应把每项动作封装成窄接口:明确输入模式、权限范围、幂等键、超时、审批级别和补偿动作。
智能体不应直接持有全库权限。它先从语义目录发现获准的数据产品,再通过受控查询服务获取结果,最后把行动建议交给策略引擎。高影响动作需要人工确认。
四、迁移策略
不要以“重建平台”为目标。先选择一个业务链路,记录当前数据时效、质量、交付时间和成本;补齐数据契约与负责人;让 BI、模型和知识检索复用同一可信数据;最后才增加智能体行动。
只有当领域数量、发布频率和中央团队排队时间形成真实瓶颈时,才需要把数据产品责任下放。架构演进的证据应来自交付指标,而不是概念成熟度图。
下一篇讨论数据岗位如何变化,把新的职责、技能组合和团队边界落到人。
五、架构决策的判断问题
每次引入新层或新平台前,都应回答:当前瓶颈是存储、计算、数据质量、交付组织还是模型运行?新组件替代什么旧流程?谁负责运行?故障时怎样降级?三个月后用哪个指标判断它值得保留?
还可以结合大数据底座设计检查数据分层与治理能力,避免在可信数据尚未建立前直接搭建复杂智能体。
实践检查清单
在评审方案时,要求团队画出从原始数据到最终用户的链路,并在每个节点标明输入、输出、负责人、质量阈值、访问权限、版本和失败处理。随机选择一条历史结果,确认可以根据日志与快照完整重放。
同时保留一个不使用复杂 AI 的基线方案。只有当新方案在质量、时效、成本或人工负担上产生可重复的改善,并且没有越过风险阈值,才扩大使用范围。若效果下降,应能快速切回规则、旧模型或人工流程,并把失败样本加入后续评测。