吴恩达提示词工程课精华:开发者必学的核心方法论

由AI教育领域权威吴恩达(Andrew Ng)联手OpenAI技术团队成员Isa Fulford共同推出的《面向开发者的ChatGPT提示词工程》课程,被誉为大模型入门到进阶的必修课。吴恩达曾担任谷歌大脑(Google Brain)创始人及百度首席AI科学家,也是Coursera平台的联合创始人,其创办的DeepLearning.AI已向全球超过500万学习者提供AI课程;Isa Fulford则深度参与了ChatGPT API的开发与推广工作。两人联合推出的这门课程托管于DeepLearning.AI平台,以Python代码实操为核心,所有示例均直接调用OpenAI API,填补了「理论讲解型」与「实战工程型」提示词教程之间的空白。本文基于该课程的开篇内容,梳理提示词工程(Prompt Engineering)的核心理念、模型分类以及关键实践原则,帮助开发者更高效地驾驭大语言模型。
开发者为何需要重新认识提示词工程
互联网上关于提示词的内容已经泛滥,诸如「每个人都必须知道的30个提示词」这类文章比比皆是。但吴恩达指出,这些内容大多聚焦于ChatGPT的网页交互界面,用于完成一次性的具体任务。
真正被低估的,是将大语言模型(LLM)作为开发者工具的潜力——即通过API调用LLM,快速构建软件应用。吴恩达的团队AI Fund已经与众多初创公司合作,将这些技术应用于各种场景,而LLM API所展现出的快速开发能力令人振奋。
值得注意的是,提示词工程(Prompt Engineering)作为一门独立学科,在2020年GPT-3发布后才真正进入大众视野。GPT-3的出现首次证明,超大规模预训练模型具备强大的"涌现能力"(Emergent Abilities)——即在训练时从未明确优化过的任务上,仅凭自然语言描述便能完成推理、翻译、摘要等多样任务。
深度背景:涌现能力的学术争议 涌现能力是指随着模型规模增长,某些能力在小模型上几乎不存在,但超过某个规模阈值后突然出现,呈现出近似"相变"的非线性跳跃。斯坦福大学研究团队在2022年的综述论文中系统记录了这一现象,涵盖算术推理、多步逻辑、代码生成等能力。然而,这一概念也存在学术争议:Google DeepMind的Schaeffer等人(2023年)指出,所谓"涌现"可能是评估指标选择不当造成的假象——当使用更细粒度的连续指标时,能力提升实际上是平滑渐进的而非突变。这一争论对提示词工程有直接启示:某些复杂推理任务可能对模型规模有硬性门槛,在较小模型上无论如何优化提示词都难以突破,理解这一边界有助于开发者做出更务实的技术选型。
这一特性使得"如何写好输入"本身成为一门值得系统研究的学问。它的核心研究对象是:如何通过设计输入文本来有效引导大语言模型输出高质量、符合预期的结果。这一领域的兴起,本质上是因为大语言模型的能力高度依赖输入的表述方式——同样的问题,换一种问法,可能得到截然不同的答案。
从学术角度看,提示词工程涵盖了多种技术范式,它们可以沿「信息注入量」这条轴线来理解:**零样本学习(Zero-shot)**指不提供任何示例,直接以自然语言指令驱动模型完成任务,依赖模型在预训练阶段积累的泛化能力;**少样本学习(Few-shot)**则在提示词中嵌入若干「输入-输出」示例对,利用模型的上下文学习(In-context Learning)能力,使其快速对齐目标格式或风格,无需更新任何权重——这一特性之所以成立,是因为Transformer架构的注意力机制天然支持在单次前向传播中"读取"并"类比"示例结构,本质上是一种隐式的梯度更新模拟。
深度背景:Transformer架构与注意力机制 Transformer架构是现代大语言模型的基础,由Vaswani等人在2017年论文《Attention is All You Need》中提出。其核心创新——自注意力机制(Self-Attention)——允许模型在处理序列中每个位置时,同时"关注"序列中所有其他位置的信息,并根据相关性动态加权。这一机制克服了RNN/LSTM在处理长距离依赖时的梯度消失问题,使得模型能够捕捉跨越数千个Token的语义关联。多头注意力(Multi-Head Attention)进一步允许模型从多个"子空间"并行提取不同类型的语言特征(如句法、语义、指代等),极大提升了表达能力。正是这种架构天然支持并行计算的特性,使得GPT系列在超大规模语料上的预训练成为可能,也是Few-shot In-context Learning能够在单次前向传播中完成"类比推理"的底层基础。
**思维链提示(Chain-of-Thought)**进一步要求模型在给出最终答案前先输出推理过程,是目前已知在复杂推理任务上最稳定有效的提示策略之一。这三种范式并非互斥,实际工程中常组合使用,例如Few-shot CoT(附带推理步骤的示例)往往比单独使用任一范式效果更优。从工程角度看,提示词工程直接影响AI应用的开发效率与产品质量。

课程将系统覆盖几个关键模块:软件开发中的提示词最佳实践、常见应用场景(摘要、推理、转换、扩展),以及如何用LLM构建聊天机器人。这套框架的目标,是激发开发者对新型应用场景的想象力。
两类大模型:基础模型 vs 指令微调模型
理解提示词工程,首先要搞清楚大模型的两种基本类型。吴恩达将其区分为基础模型(Base LLM)和指令微调模型(Instruction-tuned LLM)。
基础模型:根据上下文预测下一个词
基础模型(Base LLM)的训练本质上是自监督学习:模型在海量无标注文本上,通过预测"下一个词"来学习语言的统计规律和世界知识。自监督学习的关键创新在于无需人工标注,直接从原始文本中自动构造训练信号——以「预测下一个词的条件概率」为目标函数,在数以万亿计的Token上进行优化。从信息论的视角来看,这一目标等价于最小化模型分布与真实语言分布之间的交叉熵,而要持续降低这一损失,模型必须内化语言的语法结构、长距离语义依赖乃至大量事实性世界知识——因为准确预测下一个词,本质上需要理解前文的逻辑与事实含义。正是这种"被迫理解世界"的训练机制,使得GPT系列、LLaMA等基础模型在从未专门训练过的任务上也能展现出令人惊讶的泛化能力。
举例来说,输入「从前有一只独角兽」,它可能续写「它住在魔法森林里,和所有独角兽朋友一起生活」。但如果提问「法国的首都是什么」,基础模型很可能不会直接回答,而是续写出「法国最大的城市是什么」「法国的人口是多少」——因为预训练语料来自真实互联网文本(包括大量问答帖子、论坛、百科等),互联网上关于法国的文章往往本身就是问答测验题的形式。这是模型数据分布的直接映射,而非模型的「缺陷」。
纯粹的基础模型存在明显局限:它擅长"续写",但不擅长"回答",因为指令遵循并非其训练目标。这也正是指令微调技术诞生的根本原因。
指令微调模型:学会理解并遵循指令

指令微调模型是当前LLM研究与实践的主流方向,它被专门训练成能够遵循自然语言指令。同样是问「法国的首都是什么」,指令微调模型会直接输出「法国的首都是巴黎」。
指令微调(Instruction Fine-Tuning)并不需要从头训练,只需在基础模型上进行相对轻量的微调——通常仅需基础训练计算量的1%以下,便能显著改变模型的行为模式。其训练路径是:先训练基础模型,再用「指令-理想回答」这类输入输出对进行微调,通常还会进一步结合**RLHF(基于人类反馈的强化学习)**技术,使模型更善于提供帮助、遵循指令。
RLHF的基本流程分三个阶段:首先对基础模型进行监督微调(SFT),让模型学习标准问答格式;其次训练一个"奖励模型"(Reward Model),由人类标注员对模型的多个回答进行偏好排序,该奖励模型的本质是将难以量化的"人类偏好"转化为一个可微分的标量信号——训练数据通常由标注员对同一问题的多个模型回答进行两两比较(Pairwise Comparison),模型通过学习这些偏好对,建立起一个隐式的「质量评分函数」,将离散的人类判断映射为可供强化学习优化的连续奖励;最后使用PPO等强化学习算法,让大语言模型不断优化自身输出,以最大化奖励模型的得分。OpenAI的InstructGPT论文(2022年)首次系统验证了RLHF对于提升模型对齐性的有效性,此后ChatGPT、Claude、Gemini等主流模型均采用了类似路线。
然而RLHF也面临固有挑战:奖励模型本身可能存在偏好偏差(Reward Hacking),即模型学会「讨好」奖励模型而非真正提升回答质量,表现为回答越来越冗长、措辞越来越讨喜,但实质内容却未必更准确;PPO的计算开销约为SFT的3倍以上,工程实现复杂度较高,需要同时在内存中维护策略模型、参考模型、奖励模型和价值网络四个模型副本。正因如此,近年来**Direct Preference Optimization(DPO)**等无需强化学习的对齐方法受到广泛关注。DPO通过数学推导证明,RLHF的优化目标可以被等价地转化为一个仅依赖偏好数据的语言模型分类损失,从而完全绕开了奖励模型的训练与PPO的强化学习循环,将三阶段流程压缩为单阶段微调,已被Llama 3、Mistral等主流开源模型采用。
深度背景:LLaMA开源生态与指令微调的民主化 Meta于2023年发布的LLaMA系列模型(7B至65B参数)是开源LLM生态的重要里程碑。LLaMA本身作为基础模型发布,但开源社区迅速在其基础上推出了大量指令微调变体:Alpaca(斯坦福,基于Self-Instruct数据)、Vicuna(基于ShareGPT对话数据)、WizardLM(基于进化指令数据)等。这些项目证明了一个关键事实:高质量的指令微调只需要数万条精选数据,而非数十亿条——这与谷歌FLAN系列研究的发现相互印证。2024年发布的LLaMA 3系列进一步引入DPO对齐训练,其指令微调版本在多项基准上接近或超越早期版本的GPT-4,标志着开源模型与闭源模型之间的能力差距正在持续收窄。这一趋势对提示词工程师意味着:基于开源模型构建的应用,其提示词策略具有更高的可移植性与可复现性。
RLHF与DPO的核心价值都在于:将难以用规则描述的"人类偏好"转化为可优化的训练信号,从而使模型在有帮助性、真实性和无害性之间取得更好的平衡。
由于指令微调模型被训练得更「有用、诚实、无害」(helpful, honest, harmless),输出有害内容的概率也大幅降低。这也解释了为何开源社区能够基于LLaMA等基础模型,快速衍生出大量面向特定场景的指令微调版本。
课程核心建议:聚焦指令微调模型

吴恩达明确建议:网上许多提示词技巧其实更适合基础模型,但对于当今绝大多数实际应用,开发者应当把精力集中在指令微调模型上。
原因有两点:一是指令微调模型更易于使用;二是得益于OpenAI等公司的持续投入,这类模型正变得越来越安全、越来越符合人类价值观。因此,整门课程都围绕指令微调模型的最佳实践展开。
在使用指令微调模型的API时,还有一个常被初学者忽视的关键抽象层:系统提示词(System Prompt)。在OpenAI API的消息结构中,提示词分为System(系统)、User(用户)和Assistant(助手)三种角色。系统提示词由开发者在对话开始前设定,在整个会话中持续生效,用于定义模型的整体行为规范、角色设定、输出格式约束和安全边界——相当于在每次对话前先给助手下达「工作守则」。
深度背景:系统提示词的工程价值与安全边界 从实现机制看,系统提示词在多数模型中并非真正"特权"——它在底层仍被拼接为普通文本输入Transformer,只是在训练阶段通过大量「系统提示词-用户指令-助手回答」三元组,使模型学会赋予System角色更高的"指令权威"。这一设计带来两个重要工程含义:第一,精心设计的系统提示词可以将通用模型定制为特定领域专家,无需任何微调,大幅降低垂直应用的开发门槛;第二,系统提示词并非绝对安全边界,针对性的"越狱"(Jailbreak)提示词有时能诱导模型绕过系统层面的限制,这也是为何严肃的AI应用需要在系统提示词之外叠加独立的内容过滤层。许多商业AI应用(如GitHub Copilot、Notion AI)的核心竞争壁垒之一,正是经过数百次迭代、在边缘案例上高度鲁棒的系统提示词工程。
从工程角度看,这是构建可复用AI应用的核心抽象层:开发者通过精心设计系统提示词,将通用的指令微调模型定制为特定领域的专业助手,无需进行任何模型微调。许多AI应用的核心竞争壁垒,正是经过大量迭代优化的系统提示词本身。
核心心法:把模型当作聪明但不了解你的助手
这是提示词工程中最具启发性的一个类比。吴恩达建议,使用指令微调模型时,应当把它想象成在给另一个人下达指令——一个很聪明、但对你的任务背景一无所知的人。
当LLM表现不佳时,很多时候并不是模型能力不足,而是指令本身不够清晰。

以「请帮我写一篇关于阿兰·图灵的内容」为例,这个指令过于模糊。要获得理想结果,你需要补充明确信息:
- 内容侧重:聚焦他的科学贡献、个人生活,还是历史地位?
- 文本语气:专业记者的笔调,还是写给朋友的轻松便条?
- 参考素材:指定模型应参考哪些文本片段,相当于给一位刚入职的大学生提供完成任务所需的背景资料。
这个「新入职大学生」的比喻之所以贴切,还有一层深层原因:语言模型的"知识"来源于预训练语料的统计分布,它对你个人的工作语境、受众偏好、行文惯例一无所知,就如同一位才华横溢却刚刚入职的应届生——潜力巨大,但必须依赖充分的上下文信息才能发挥出最佳水平。这里有一个重要的物理约束值得关注:**上下文窗口(Context Window)**限定了模型一次能处理的Token数量上限。早期GPT-3的上下文窗口仅为4096个Token,当前主流模型已扩展至128K乃至百万级别。研究表明,模型对上下文中不同位置信息的注意力并不均匀——「Lost in the Middle」现象(Liu等人,2023年)显示,关键信息放置在上下文的开头或结尾时往往比放在中间获得更好的处理效果。这意味着在撰写长提示词时,最重要的指令和约束条件应优先放置在开头或结尾,而非埋没在大段背景描述的中间。这个「新入职大学生」的比喻贯穿课程始终:你提供的上下文越充分、要求越具体,产出结果就越符合预期。
Prompt Engineering 两大基础原则
课程提炼出提示词工程的两条核心原则,构成整个方法论的基石:
- 清晰且具体(Be clear and specific):指令要明确,避免歧义,充分提供上下文与约束条件。
- 给模型思考的时间(Give the LLM time to think):由Isa Fulford讲授的第二条原则,强调引导模型分步骤推理,而非急于得出结论。
第二条原则在技术上对应着AI领域一项重要发现——思维链提示(Chain-of-Thought Prompting,CoT)。2022年,谷歌研究人员Wei等人在论文中证明:当提示词中包含逐步推理的示例,或者明确要求模型"一步一步地思考"时,模型在复杂推理任务(如数学应用题、多步逻辑推断)上的表现会显著提升。
其背后的工作原理值得深入理解:大语言模型本质上是自回归生成模型,在生成每一个Token时只能「看到」已生成的前缀内容。当模型被要求直接输出最终答案时,它必须在单次前向传播的隐层表示中完成所有推理,而这对于多步数学或逻辑问题而言往往超出了模型的「工作记忆」上限。思维链的核心机制在于:将中间推理步骤外化为可见的文本序列,每一步的输出都成为下一步推理的显式输入,有效扩展了模型的推理深度。这在计算上相当于用更多的Token生成次数(即更多的前向传播步骤)换取更深的推理能力——一种以推理时间换推理质量的核心权衡。
「Let's think step by step」这一Zero-shot CoT触发语句(由Kojima等人2022年提出)之所以有效,根植于预训练语料的数据分布:互联网语料中充斥着大量「逐步推导」的文本模式——数学教材中的解题过程、Stack Overflow上的调试步骤、维基百科的论证结构等。预训练阶段,模型通过最小化下一词预测损失,将这些逐步推理的文本模式内化为权重中的隐式知识。当提示词中出现「step by step」等触发短语时,模型的注意力机制会激活与这类模式高度相关的权重路径,从而倾向于生成结构化、分步骤的输出——这也解释了为何该技巧在不同语言和不同任务类型上均有一定泛化效果。
深度背景:o1/o3推理模型与提示词工程的范式转变 OpenAI于2024年发布的o1模型代表了一种新的范式:将思维链(CoT)从提示层面的外部技巧内化为模型的训练目标本身。o1通过大规模强化学习训练,使模型学会在生成最终答案前自主产生隐式的"内部推理链",这些推理链不对外完全暴露但深刻影响最终输出。这一机制的副作用是:传统的CoT提示技巧在o1/o3等推理模型上效果边际递减,因为模型已经内建了"慢思考"能力。对开发者而言,这意味着提示词设计的重心正在发生转移——从"如何引导模型一步步推理"转向"如何精确定义问题的约束边界、格式要求与评估标准"。理解这一代际演变,有助于开发者在不同模型间做出正确的提示词策略选择,避免将适用于GPT-3.5时代的技巧机械地套用于推理模型。
值得注意的是,2024年发布的o1、o3等推理模型则将CoT内化为模型的训练目标本身——通过在强化学习阶段奖励能产生正确答案的推理链,使模型学会自主生成隐式思维链,标志着提示层面的思维链向模型层面的「深度思考」演进。这也预示着提示词工程本身将随模型架构的演进而持续变革:当CoT成为模型的内在能力而非外部触发技巧,提示词工程师的工作重心将从"如何引导模型思考"转向"如何定义问题边界与评估标准"。
这两条原则看似简单,却是区分「随意提问」与「专业提示词工程」的真正分水岭。
结语
吴恩达这门课程的价值,不在于罗列花哨的提示词模板,而在于建立一套底层认知框架:理解模型类型的差异、明确指令微调模型的适用场景,并掌握「清晰具体」与「给予思考时间」两大核心原则。
对于希望从入门迈向进阶的开发者而言,与其盲目收集网络上的Prompt技巧,不如先内化这套方法论。当你学会像对待聪明助手那样与模型对话,提示词工程便不再是玄学,而是可复用、可持续迭代的工程实践。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。