[控场AI]
概念Fine-tuning / 大模型微调

微调

微调(Fine-tuning)是机器学习中的一种迁移学习技术,指在已完成预训练的大规模模型基础上,使用特定任务或领域的标注数据对模型参数进行进一步训练和调整,使其适配目标场景。微调通常只需较少的数据和计算资源,即可使通用模型在文本分类、问答、图像识别等具体任务上显著提升性能,是当前自然语言处理和计算机视觉领域的主流模型适配方法。

核心事实

时间轴 (近 90 天)

9月12日

对大多数中小团队,完整自研模型是重资产选择,基于开源模型的针对性微调是更务实的折中方案

待验证50%
9月11日

解决角色漂移的工程手段包括周期性重新注入人设摘要、对输出进行角色一致性校验以及通过微调让模型内化特定角色

待验证50%
9月11日

微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍

待验证50%
9月11日

垂直领域知识注入有两种技术路径:一是通过微调在基础模型层面注入领域知识但需大量标注数据且灵活性低;二是保持基础模型不变通过工具调用、RAG或结构化提示词在推理阶段动态注入且灵活性更高但对提示工程要求高

待验证50%
9月10日

全参数微调通常需要模型参数量3-5倍的GPU显存

待验证50%
9月9日

一次模型微调的成本从数百到数万美元不等

待验证50%
9月7日

专业化AI模型通常通过领域特定微调、强化学习奖励模型调整、推理时计算优化等方式实现针对特定领域的深度优化

待验证50%
9月6日

更新参数记忆需要微调或持续预训练,两者都需要额外的训练流程和计算资源

待验证50%
8月28日

通过LoRA等参数高效微调方法,恶意行为体仅需少量计算资源和数据即可移除模型内置的安全对齐,使其无条件服从任何指令

待验证50%
8月13日

研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移

待验证50%

还有 2 条时间轴事件

全部知识事实 (13)

已验证

当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)

80%
已验证

微调将知识烧录进模型权重,知识更新需重新训练成本高;RAG将知识存储外部数据库,更新只需修改数据库无需改动模型

65%
已验证

微调需要数百到数千条高质量训练样本、数小时GPU计算时间和持续维护成本,知识更新时需重复整个流程

65%
待验证

对大多数中小团队,完整自研模型是重资产选择,基于开源模型的针对性微调是更务实的折中方案

50%
待验证

解决角色漂移的工程手段包括周期性重新注入人设摘要、对输出进行角色一致性校验以及通过微调让模型内化特定角色

50%
待验证

微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍

50%
待验证

垂直领域知识注入有两种技术路径:一是通过微调在基础模型层面注入领域知识但需大量标注数据且灵活性低;二是保持基础模型不变通过工具调用、RAG或结构化提示词在推理阶段动态注入且灵活性更高但对提示工程要求高

50%
待验证

全参数微调通常需要模型参数量3-5倍的GPU显存

50%
待验证

一次模型微调的成本从数百到数万美元不等

50%
待验证

专业化AI模型通常通过领域特定微调、强化学习奖励模型调整、推理时计算优化等方式实现针对特定领域的深度优化

50%
待验证

更新参数记忆需要微调或持续预训练,两者都需要额外的训练流程和计算资源

50%
待验证

通过LoRA等参数高效微调方法,恶意行为体仅需少量计算资源和数据即可移除模型内置的安全对齐,使其无条件服从任何指令

50%
待验证

研究者发现只需微调模型的少量参数就能移除安全对齐(去对齐攻击),且某些越狱提示可在不同模型之间迁移

50%

来源文章