数据漂移
机器学习系统中,线上真实数据的统计特性偏离训练集分布的现象,导致模型性能在无任何报错情况下持续下滑,是MLOps需要重点监控和应对的核心挑战之一。
核心事实
时间轴 (近 90 天)
当线上数据分布偏离训练数据时,模型性能会退化(数据漂移与模型衰减),需要触发重新训练
人工复审的结果应回流用于持续校准模型和成本,否则系统会随数据漂移而失效
生产环境数据是动态变化的,新的编程语言、密钥格式和代码模式会不断涌现,导致数据漂移
数据漂移和概念漂移会导致模型性能退化,但在服务层健康指标(延迟、吞吐、错误率)上可能没有异常,需通过统计检测手段(如KL散度、PSI、KS检验)主动发现
数据漂移或概念漂移指真实世界数据分布发生变化而模型仍基于旧数据训练时性能会显著下降,业界采用持续学习和主动学习策略应对
漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化
性能漂移是指模型输出质量随时间缓慢退化的现象,可能来自模型提供商静默更新、上下文数据分布变化以及RAG系统知识库内容更新
数据漂移(Data Drift)指生产环境中输入数据的统计分布随时间发生变化,导致模型接收数据与训练时分布不匹配
模型漂移通常分为数据漂移和概念漂移两类,数据漂移指输入数据统计分布随时间变化,概念漂移指输入与输出关系本身发生变化
全部知识事实 (9)
模型漂移通常分为数据漂移和概念漂移两类,数据漂移指输入数据统计分布随时间变化,概念漂移指输入与输出关系本身发生变化
65%待验证当线上数据分布偏离训练数据时,模型性能会退化(数据漂移与模型衰减),需要触发重新训练
50%待验证人工复审的结果应回流用于持续校准模型和成本,否则系统会随数据漂移而失效
50%待验证生产环境数据是动态变化的,新的编程语言、密钥格式和代码模式会不断涌现,导致数据漂移
50%待验证数据漂移和概念漂移会导致模型性能退化,但在服务层健康指标(延迟、吞吐、错误率)上可能没有异常,需通过统计检测手段(如KL散度、PSI、KS检验)主动发现
50%待验证数据漂移或概念漂移指真实世界数据分布发生变化而模型仍基于旧数据训练时性能会显著下降,业界采用持续学习和主动学习策略应对
50%待验证漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化
50%待验证性能漂移是指模型输出质量随时间缓慢退化的现象,可能来自模型提供商静默更新、上下文数据分布变化以及RAG系统知识库内容更新
50%待验证数据漂移(Data Drift)指生产环境中输入数据的统计分布随时间发生变化,导致模型接收数据与训练时分布不匹配
50%