微调
微调(Fine-tuning)是机器学习中的一种迁移学习技术,指在已完成预训练的大规模模型基础上,使用特定任务或领域的标注数据对模型参数进行进一步训练和调整,使其适配目标场景。微调通常只需较少的数据和计算资源,即可使通用模型在文本分类、问答、图像识别等具体任务上显著提升性能,是当前自然语言处理和计算机视觉领域的主流模型适配方法。
核心事实
时间轴 (近 90 天)
对大多数中小团队,完整自研模型是重资产选择,基于开源模型的针对性微调是更务实的折中方案
解决角色漂移的工程手段包括周期性重新注入人设摘要、对输出进行角色一致性校验以及通过微调让模型内化特定角色
微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍
垂直领域知识注入有两种技术路径:一是通过微调在基础模型层面注入领域知识但需大量标注数据且灵活性低;二是保持基础模型不变通过工具调用、RAG或结构化提示词在推理阶段动态注入且灵活性更高但对提示工程要求高
全参数微调通常需要模型参数量3-5倍的GPU显存
一次模型微调的成本从数百到数万美元不等
专业化AI模型通常通过领域特定微调、强化学习奖励模型调整、推理时计算优化等方式实现针对特定领域的深度优化
更新参数记忆需要微调或持续预训练,两者都需要额外的训练流程和计算资源
通过LoRA等参数高效微调方法,恶意行为体仅需少量计算资源和数据即可移除模型内置的安全对齐,使其无条件服从任何指令
研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移
还有 2 条时间轴事件
全部知识事实 (13)
当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)
80%已验证微调将知识烧录进模型权重,知识更新需重新训练成本高;RAG将知识存储外部数据库,更新只需修改数据库无需改动模型
65%已验证微调需要数百到数千条高质量训练样本、数小时GPU计算时间和持续维护成本,知识更新时需重复整个流程
65%待验证对大多数中小团队,完整自研模型是重资产选择,基于开源模型的针对性微调是更务实的折中方案
50%待验证解决角色漂移的工程手段包括周期性重新注入人设摘要、对输出进行角色一致性校验以及通过微调让模型内化特定角色
50%待验证微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍
50%待验证垂直领域知识注入有两种技术路径:一是通过微调在基础模型层面注入领域知识但需大量标注数据且灵活性低;二是保持基础模型不变通过工具调用、RAG或结构化提示词在推理阶段动态注入且灵活性更高但对提示工程要求高
50%待验证全参数微调通常需要模型参数量3-5倍的GPU显存
50%待验证一次模型微调的成本从数百到数万美元不等
50%待验证专业化AI模型通常通过领域特定微调、强化学习奖励模型调整、推理时计算优化等方式实现针对特定领域的深度优化
50%待验证更新参数记忆需要微调或持续预训练,两者都需要额外的训练流程和计算资源
50%待验证通过LoRA等参数高效微调方法,恶意行为体仅需少量计算资源和数据即可移除模型内置的安全对齐,使其无条件服从任何指令
50%待验证研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移
50%