导读:别再单纯迷信“数据清洗”了。为人工智能(
AI)保留原始数据的上下文线索,或许才是你追踪致命错误预测源头、彻底消灭大模型“幻觉”的终极武器。

生成式 AI(GenAI)的“热心肠”是出了名的——热心到如果找不到与你诉求匹配的真实信息,它就会一本正经地凭空捏造(即“幻觉”)。由于过度依赖陈旧或非标准的基准数据,模型常常会给出极其离谱的错误答案,却同时附带极高的置信度分数,这让现有的安全护栏显得苍白无力。
因此,你不仅需要具备追踪数据从源头到词元(Token)的完整数据血缘(Data Lineage)的能力——这不仅是《欧盟人工智能法案》(EU AI Act)的硬性要求——你还必须考量数据的“出身”:它是否已经过时?是否发生了影响结果的突变?或者它从一开始就根本不具备相关性与权威性?
知名咨询机构高德纳(Gartner)预测,由于缺乏适当的元数据管理、数据质量监控和数据可观测性,未来将有 60% 的企业 AI 项目面临烂尾。IBM 近期收购实时数据流平台 Confluent 的举动,也深刻印证了具备血缘追踪、数据治理和策略管控的实时数据对于 AI 智能体的决定性价值。
业界通常的做法是:在数据管道(Data Pipeline)的靠后环节才添加元数据并进行验证。这其实就是典型的数据湖仓“奖牌架构”(Medallion Architecture)逻辑:从青铜层(Bronze)、白银层(Silver)到黄金层(Gold),通过一层层地过滤、清洗和增强,直到数据变得可用。
但这往往意味着极其恐怖的算力浪费。数据显示,在训练一个前沿大模型时,近 75% 的 CPU 算力都被白白消耗在数据清洗与验证上。更致命的是,过度清洗会抹杀掉大量对 GenAI 至关重要的“上下文(Context)”。
开源平台 Kubeflow 创始人、分布式数据管道供应商 Expanso 的 CEO David Aronchick(大卫·阿隆奇克)指出:与其在清洗数据时丢失原始上下文,不如尽可能多地保留数据初始状态的信息,这往往更具实效。
“追求绝对‘纯净’的数据是不切实际的。当数据被拉入机器学习(
ML)模型时,每一行数据都必须有机制标明其来源。否则,一旦数据被混在一起,你将永远无法理清头绪——你可以搜索原始内容和日志,但那些决定数据意义的‘上下文’早就灰飞烟灭了。”
物联网(IoT)数字孪生系统深谙此道:它们通常会将数据一路反向追溯到采集设备,以此来判断某次“温度飙升”究竟是需要紧急拉响警报的致命故障,还是无需理会的常规校准。这种上下文信息在后续大规模复用数据时价值连城。如果你没有在数据移动前捕获其来源要素,事后想要重建上下文,不仅困难重重,甚至根本不可能。
数据管理与标注平台 Encord 的联合 CEO Ulrik Hansen(乌尔里克·汉森)将这种前置动作称为“流内标注(In-stream Annotation)”。他严厉警告,这绝不是数据清洗的替代品:
“人们常说的‘脏数据’其实混淆了两个概念:一是真正损坏、需要修复的数据;二是‘上下文依赖缺失’——某个读数看起来像异常值,仅仅是因为你丢掉了能够解释它的参照系。传统的粗暴清洗会同时抹杀这两者。我们的重点不是停止清洗,而是停止在标准化处理中永久丢弃不可复原的业务上下文。”
他还补充了一个极为残酷的现实:上下文在数据源头捕获的成本极低,而事后恢复则难于登天。“真正的问题不在于‘是否’保留它,而在于如何高效筛选出真正有用的信息。”
Aronchick 将当前企业中绝大多数青铜层(Bronze Layer)数据的状态,犀利地形容为缺失血缘上下文的无效脏数据。其根本原因在于,原始数据在入库前未经验证,也没有在各个数据点上封装元数据(Metadata)。
“你虽然拿到了原始数据,却生生剥夺了它赖以生存的业务上下文,”Aronchick 评价道。
我们以风电场运营商为例来理解这一痛点: 当一台风机的传感器生成数据时,它自带极强的物理与环境属性——它属于某个特定风场、特定位置,运行在特定的风速、天气条件及时间点下。
“假设同一风场内其他风机也开始并网运行,尾流效应可能会导致某单台风机的发电性能下降,但整个风场的总效能却在上升。此时,单台风机性能下降并非故障信号。但如果在数据采集时没有将这些‘上下文’沉淀下来,日后当数据科学家排查效率问题时,就会陷入难以自拔的泥潭。”
Aronchick 补充强调,元数据必须更加丰富,并且要尽可能在数据管道的最早期阶段注入——因为此时你拥有最鲜活的细节,能够完美还原数据的结构与复杂性。
然而,并非所有必需的元数据都会伴随数据自动生成。你几乎必定需要对数据进行增强、标注,并重塑其结构,这在处理 POS(销售终端)系统等“元数据极度贫乏”的场景时尤为关键。
“从老旧系统中吐出的数据往往结构松散。它们不符合 OpenLineage标准,通常只是简陋的 CSV 格式或纯文本。因此,在数据的生成阶段就要采取强有力的干预措施:包括压缩、采样、格式转换、追加元数据,甚至在移动任何一比特数据之前,就强制校验模式(Schema)与数据血缘(Lineage)。”
Hansen 则给出了一个关键的边界提示:保留上下文,并不意味着要无节制地让数据变得臃肿。他建议的黄金法则是:只采集那些“零额外成本”且“事后无法恢复”的信息。“数据来源系统本身就是一个天然标签。凡是后续模型能够轻易推导出来的信息,在入库时都可以果断跳过。”
在任何组织中,应用程序接口(API)、Schema(数据模式)以及数据的采集与存储方式,都会频繁发生变更。这些变化必须实时反映在与数据共存的元数据中,或在数据生成时即刻打上烙印;而不是依赖事后某个脆弱的修补流程来重建。谷歌(Google)针对“数据缺陷级联效应(Data Defect Cascades)”的研究充分证明:上下文的丢失是何等轻易,而它对整体数据质量的摧毁又是何等致命。
解决之道在于运用 DevOps 中的“左移(Shift-Left)”思想:将 Schema 校验强制推向数据流水线的最前端。这能让你在下游做出更高效的决策。
例如,对于一个记录温湿度的传感器,你必须在数据入库前明确它使用的是哪种温标、时间戳的记录格式是什么。如果在入库瞬间进行 Schema 校验,系统就能根据“校验是否通过”,自动将数据路由到正常处理路径,或触发数据质量告警。
“面对不合格数据,我要么直接丢弃,要么将其路由到专门的人工或工具队列中进行修复,”Aronchick 说,“但它绝对无法做到的,是让污染的劣质数据混入我的核心数据流水线。通过前置的 Schema 校验,你的下游业务系统将变得坚如磐石。”
非结构化和半结构化数据亟需更深度的扩充处理。一份 PDF 或 Word 文档可能自带了作者和创建日期,但这远远不够。它是否包含作者的职级与所在部门?它是否是最新版本?是否仅面向特定客户群?是否基于某项随时会变更的会计准则?这些高价值的上下文信息一旦可获取,就必须与文档“捆绑”存储,而不是被遗忘在某个合规部门的 Excel 表格里。
像 DataHub 和 SurrealDB 这样的现代数据平台,正在尝试同步捕获和创建这些上下文。以 SurrealDB 为例,它可以利用视觉 AI 来深入解析图像内容。
“我们正竭尽所能地,从完全非结构化的数据中‘榨取’出结构。”SurrealDB CEO Tobie Morgan Hitchcock 说道。
这些结构化后的元数据,未来可以与其他数据配对,成为喂给 AI 智能体的绝佳养料。“如果你能综合记录对话记录、遥测数据、地理空间数据(Geospatial Data),并结合向量搜索与实体关联关系,那么 AI 理解事件全貌的难度将断崖式下降。”
Hitchcock 还强调,关于文档作者的元数据(例如通过打通公司通讯录)是确立数据“权威性”的关键。随着时间推移,系统可以通过评估信息更新者的权重和职级,逐步建立起一套“信任机制”。毕竟,由公司内部高级专家生成的业务信息,其可信度远高于外部用户的随机输入。
DataHub CTO Shirshanka Das(曾担任 LinkedIn GDPR 策略的核心架构师)亲眼见证过,即使在拥有严格指导方针的顶尖科技公司,数据也能变得多么混乱不堪。
“尽管我们推行了成熟的‘数据优先’和‘Schema 优先’理念,但底层数据依然像一片缺乏溯源的杂乱沼泽,”他说。为了整顿数据治理,LinkedIn 团队引入了 DevOps 的“左移”方法论。
当时,LinkedIn 要求所有接入 Kafka(开源分布式消息中间件)生态系统的数据必须自带 Schema,并通过 CI/CD(持续集成/持续交付)流水线检查向下兼容性。“我在这条流水线中卡入了一个强制收集‘合规元数据’的环节。开发人员只有明确标注清楚每一列数据的具体含义后,系统才允许他们提交代码。”
这种增加工作量的“强监管”最初遭到了开发者的强烈抵触。直到后来,那些没有参与合规标注的团队遭遇了海量的下游问题咨询工单(Ticket),被折磨得苦不堪言。这给了 Das 一个绝佳的契机,将这套“主动治理 + 源头标注”的方法论横向推广到了几乎所有的数据集上。
IDC 分析与 AI 研究副总裁 Megha Kumar 认同这种“沼泽”现象极为普遍。大多数组织采用批量(Batch)处理数据的方式,因此很难实现实时的上下文捕获。“大家不知道从何下手,所以经常向号称‘Schema 优先’的 Kafka 里狂塞混乱的 JSON 数据。”
为了打破僵局,DataHub Cloud 尝试从查询系统和 BI(商业智能)工具中反向收集运营元数据,推导出语义模型,以此重新补全上下文。“我们通过让用户参与验证来解决混乱。这最终会沉淀为一个坚实的治理层,实现‘人机协同’的源头标注。”
“这就像当年在 LinkedIn 的情况重演,”Das 总结道,“当一名数据科学家因为没写好数据文档,导致下游 AI 频频出现幻觉,利益相关者每天发来 10 倍的追责工单时,他们自然就有了在产出分析时加上规范标注的源动力——因为只有这样,他们才能从无穷无尽的甩锅扯皮中解脱出来。”
Aronchick 强调,确立数据的来源和血缘轨迹具有决定性意义。只有这样,你才能精准锁定:是谁、在什么时间、从哪里收集了这些数据?源头是否具备权威性?数据经历了哪些转换(ETL)?模型具体吃进了哪些特征?
为了规范这一过程,Aronchick 倡导引入类似于 SLSA(软件供应链安全标准)的“数据物料清单(Data BOM)”概念。借助现代工具,企业可以为上游数据添加具备加密签名的来源认证,将原本抽象的治理概念彻底具象化。
在金融行业,数据合约(Data Contract)或数据产品规范的概念正蔚然成风。Das 将其定义为:“通过一份硬性合约绑定在一起的一个或一组数据集。该合约不仅停留在表面定义,更是机器可验证的。它不仅描述数据的形态,还包含了 API 级别的服务水平目标(SLO),并提供操作特性和质量保障。”
此外,Docugami 近期推出了一项名为 DGML(文档图标记语言,Document Graph Markup Language)的新型开源规范。它承诺能够对从文档中自动提取的孤立数据点进行高精度的逆向溯源。通过将描述业务上下文的语义标签(Semantic Tags),与精确显示数据在原文中物理位置的边界框(Bounding Box)相结合,为数据的真实性提供了不可篡改的认证背书。
以上提及的所有上下文线索,正是顶级 AI 公司 Anthropic 在其《上下文工程指南》中强烈推荐提供给 AI 智能体,以确保其输出准确性的核心元数据。
“开发者早就习惯了为编程 AI 助手提供极其详尽的上下文,”Das 说,“同样的事情正在数据领域重演。当人们终于意识到,AI 智能体一旦不理解自己到底在处理什么数据,就会立刻产生‘幻觉’时,他们才开始重视数据血缘。”
如果你希望自家的 AI 客服机器人能够严格按照企业的退货政策向客户作出承诺,而不是根据网络论坛上的各种主观臆断胡言乱语,你就必须喂给它极其丰富的上下文。
“这不仅仅是元数据的堆砌,”IDC 副总裁 Kumar 补充道,“企业需要真正掌握语义、数据血缘和本体论(Ontology)。许多组织正在积极构建知识图谱(Knowledge Graph)。当系统彻底理解了数据背后的深层含义,它的回应质量将发生质的飞跃。”
同时,如果你打算对模型进行微调(Fine-tuning)——这往往需要高度相关且特定垂直领域的样本——你绝对无法容忍数据中存在噪音、重复或不相关内容。如果数据在采集早期就经过了规范的标注和验证,微调的效率将事半功倍。
Expanso 近期斩获了一项边缘 AI(Edge AI)大奖,他们的制胜秘诀是:仅仅使用了约 3200 张图像,通过注入丰富的元数据,就成功微调了一个视觉基础模型。 “只需极少样本就能奏效的根本原因在于:我能够以极度确定性的方式,明确告诉模型画面里到底有什么。这是在数据采集的瞬间就完成的标注,而不是事后花大价钱请外包团队去打标。”
Das 进一步指出,高质量的上下文数据,甚至能帮你彻底省下微调的昂贵开销。 “微调确实能让小模型在短期内以低成本跑出好成绩。但几个月后当新一代大模型发布时,这种短期优势瞬间化为乌有。企业必须时刻精算投入产出比(ROI)。”
尽管医疗、金融等强监管或迭代较慢的行业能从微调中长期获益,但对绝大多数企业而言,只要提升了底层数据质量和上下文厚度,哪怕不进行微调,也能直接获得极佳的 AI 效果。
“我们正倾向于采用类似知识图谱的路径来为大模型提供支撑保障。我们的核心判断是:业务知识是高频变动的,将其作为可随时更新的‘运行期动态数据资产’,远比将其焊死在模型内部的静态参数中要聪明得多。”
Data Lineage(数据血缘):记录数据从产生、加工、融合到流转全生命周期的轨迹。它是排查数据质量问题、满足合规审计的核心工具,能让你清晰看到“数据从哪里来,到哪里去”。
Medallion Architecture(奖牌架构):Databricks 提出的数据湖仓设计模式。通常分为青铜层(Bronze:存储原始数据)、白银层(Silver:过滤、清洗后的标准化数据)和黄金层(Gold:聚合后的业务级高价值数据)。
Shift-Left(左移):源自 DevOps 领域的思想。指将代码测试、安全审查或数据质量校验(如 Schema 校验)等工作尽可能推向开发/数据流水线的早期阶段,以大幅降低事后修复成本。
Data Contract(数据合约):数据提供方与消费者之间的一种契约,通过代码形式定义了数据的 Schema、质量标准、SLA 等。如果上游数据变更违反了合约,系统会自动拦截,防止下游业务崩溃。
Knowledge Graph(知识图谱):一种通过“节点(实体)”和“边(关系)”来结构化存储万物关联关系的技术。对于 AI 而言,它相当于外挂的“长期精准记忆库”,是目前降低大模型幻觉的最有效手段之一。

(本文作者:Mary Branscombe。Mary 是一名自由科技记者,三十多年来深度报道科技领域,内容涵盖编程语言、Web 崛起及前沿新兴技术。)
图源:Mike_shots / Shutterstock