吴恩达提示词工程课:开发者如何用API调用大模型

文章正文
在进入Agent开发之前,掌握提示词工程(Prompt Engineering)与API调用是绕不开的基础功。吴恩达(Andrew Ng)联合OpenAI技术团队成员Isa Fulford推出的《ChatGPT Prompt Engineering for Developers》课程,正是面向开发者的入门实战教程。本文将梳理课程的核心思想,帮助你建立起面向大模型编程的正确认知。
什么是提示词工程? 提示词工程(Prompt Engineering)是一门研究如何设计和优化输入文本以引导大语言模型生成期望输出的学科。随着GPT-3、GPT-4等模型的崛起,它从实验室技巧演变为软件工程的核心能力。API调用则是将这一能力工程化的关键桥梁——开发者通过HTTP请求向模型服务端发送结构化的消息,并以编程方式处理返回结果,从而将LLM能力无缝嵌入任意应用。
从Web界面到API:被低估的开发者工具
互联网上关于提示词的教程层出不穷,诸如《人人必知的30个提示词》这类文章比比皆是。但吴恩达指出,这些内容大多聚焦于ChatGPT的网页交互界面,用户往往用它来完成一些具体的、一次性的任务。
然而,大语言模型(LLM)作为开发者工具的真正威力——即通过API调用快速构建软件应用——至今仍被严重低估。吴恩达提到,他所在的AI Fund(DeepLearning.AI的姊妹公司)与众多初创公司合作,将这些技术应用到各类场景中,见证了LLM API让开发者以惊人速度构建产品的可能性。
这门课程的价值恰恰在于此:它不满足于教你在对话框里输入几句提示词,而是系统性地讲解如何将LLM嵌入到实际的软件开发流程中。课程内容涵盖软件开发中的提示词最佳实践、常见应用场景(摘要、推断、转换、扩写),并最终引导你用LLM亲手搭建一个聊天机器人。
Token与API调用的底层机制: 理解API调用,首先要理解词元(Token)这一基本单位——它是大模型处理文本的最小计量粒度,英文中大约每4个字符对应1个token,中文每个汉字约对应1-2个token。API调用的成本与速度均以token数量计量。更重要的是「上下文窗口」(Context Window)的概念:它限制了单次请求中模型能处理的最大token总量(包括输入与输出),GPT-3.5约为16K tokens,GPT-4 Turbo可达128K tokens。超出窗口的内容会被截断,开发者在设计处理长文档的应用时必须将此纳入架构考量。此外,通过OpenAI API调用指令微调模型时,消息采用结构化的三角色格式:「system」(系统提示,在用户不感知的情况下设定模型行为准则)、「user」(用户输入)和「assistant」(模型历史回复)。其中system消息是开发者深度定制模型行为最有力的工具,也是构建聊天机器人与Agent系统的基础脚手架。

两类大模型:基础模型 vs 指令微调模型
要真正用好大模型,首先需要理解模型的两大类型。吴恩达在课程中将其清晰地划分为基础模型(Base LLM)和指令微调模型(Instruction-tuned LLM)。
基础模型:预测下一个词
基础模型的训练目标是根据海量文本预测下一个最可能出现的词。这些数据通常来自互联网及其他来源。举例来说,如果你输入「从前有一只独角兽」,它可能会自然地续写成「它住在一片魔法森林里,还有许多独角兽朋友」。
自监督学习的本质: 基础模型的核心训练范式称为「自监督学习」(Self-supervised Learning)。模型在数万亿词元(token)的语料上通过「下一词预测」(Next Token Prediction)任务学习语言的统计规律,无需人工标注。这一范式赋予模型强大的语言理解与生成能力,但同时也意味着模型本质上是在「模拟训练数据的分布」,而非真正理解指令意图——这正是基础模型在遵循指令方面存在天然局限性的根本原因。值得补充的是,现代基础模型(如LLaMA、Mistral)本身已因训练语料的海量与多样化而具备相当强的「涌现能力」(Emergent Abilities),能完成简单的推理、翻译甚至编程任务,但这些能力的发挥高度依赖精巧的提示词设计,远不如指令微调模型稳定可控。
但问题在于,如果你问它「法国的首都是什么?」,基础模型很可能不会直接回答,而是继续生成一连串类似的问题,比如「法国最大的城市是哪里?」「法国的人口是多少?」——因为在训练数据中,这类问题往往以测验题列表的形式成组出现。
指令微调模型:学会遵循指令
与之相对,指令微调模型经过专门训练,能够遵循指令。当你问它「法国的首都是什么?」,它会直接输出「法国的首都是巴黎」。

这类模型的训练路径是:先用海量文本训练出一个基础模型,再用「指令+优质回答」的数据对进行微调,最后通过**基于人类反馈的强化学习(RLHF)**进一步优化,使系统更善于提供帮助并遵循指令。
RLHF技术详解: 基于人类反馈的强化学习(RLHF, Reinforcement Learning from Human Feedback)是当代指令微调模型的核心对齐技术。其流程分三阶段:首先用监督学习(SFT)在高质量指令-回答对上微调基础模型;其次训练一个「奖励模型」(Reward Model),由人类标注者对多个模型输出进行排序以提供偏好信号;最后以PPO(Proximal Policy Optimization)等强化学习算法,用奖励模型的分数反向优化语言模型,使其输出更符合人类偏好。InstructGPT与ChatGPT正是这一流程的代表性产物,这也是为何它们相比原始GPT基础模型更善于遵循用户指令。近年来,RLHF的替代方案不断涌现——Anthropic提出的「宪法AI」(Constitutional AI)通过让模型自我批评来替代部分人工标注,Meta提出的DPO(Direct Preference Optimization)则绕过了奖励模型的训练,进一步降低了对齐的工程复杂度。
为什么推荐使用指令微调模型
指令微调模型的训练目标可以概括为三个关键词:有帮助(Helpful)、诚实(Honest)、无害(Harmless)。相比基础模型,它们更不容易输出有害或有毒的内容。
HHH对齐框架的由来: 「有帮助、诚实、无害」(Helpful, Honest, Harmless,简称HHH)最初由Anthropic公司提出,现已成为业界广泛认可的AI安全标准。「有帮助」要求模型真正满足用户的实质性需求而非表面请求;「诚实」要求模型不捏造事实、承认不确定性,避免产生幻觉(hallucination);「无害」要求模型拒绝生成可能造成物理、心理或社会伤害的内容。值得注意的是,这三个维度之间存在内在张力——过于强调「无害」可能导致模型过度拒绝合理请求,如何动态平衡三者是模型训练团队持续迭代的核心挑战。
吴恩达明确建议:网上流传的许多提示词技巧其实更适合基础模型,但对于当今绝大多数的实际应用,开发者应当把重心放在指令微调模型上。它们不仅更易于上手,而且得益于OpenAI等公司的持续投入,正变得越来越安全、越来越对齐(aligned)。

因此,整门课程都聚焦于指令微调模型的最佳实践,这也是作者推荐在大部分应用场景中优先采用的方向。
提示词核心心法:把模型当成聪明的实习生
在正式进入技巧之前,吴恩达给出了一个非常实用的思维框架:当你使用指令微调模型时,把它想象成在给另一个人下达指令——这个人很聪明,但并不了解你任务的具体细节。
很多时候大模型「不听话」,并非能力不足,而是指令不够清晰。举个例子,如果你说「请帮我写一段关于阿兰·图灵的内容」,模型其实无从判断你的真实需求:
- 你想聚焦他的科学成就,还是个人生活,抑或是历史地位?
- 你希望文本采用什么语气?是专业记者的严谨口吻,还是随手写给朋友的轻松便条?
- 你能否提供一些参考文本片段,让模型有据可依?

吴恩达打了个生动的比方:这就像你请一位刚毕业的大学生帮你完成任务。如果你能明确告诉他应该关注什么、用什么风格、提前阅读哪些材料,就能大大提升他成功交付的概率。同样的逻辑完全适用于大模型。
少样本提示(Few-Shot Prompting):让示例说话: 在具体化指令这一原则下,有一种极具杠杆效应的进阶技术值得特别介绍——少样本提示(Few-Shot Prompting)。其核心思想是在提示中直接提供若干「输入→期望输出」的示例对,让模型通过类比推理理解任务模式,而无需用大段文字抽象描述。相比「零样本提示」(Zero-Shot,不提供任何示例)和「单样本提示」(One-Shot),研究表明精心挑选的3-5个示例在格式化输出、专业风格迁移和复杂分类任务上往往能显著超越冗长的文字说明——因为示例直接「展示」期望行为,而非「描述」它。这一技术在需要严格输出格式(如JSON结构化数据提取)的工程应用中尤为实用。
两大提示词原则:清晰具体 + 给模型思考时间
课程后续将围绕两条核心提示词原则展开:
-
清晰而具体(Be clear and specific):不要以为「清晰」等同于「简短」。恰恰相反,更详细的提示往往能提供更多上下文,引导模型输出更相关、更精准的结果。
-
给模型时间思考(Give the model time to think):对于复杂任务,与其要求模型直接给出答案,不如引导它一步步推理,从而减少草率和错误的输出。
思维链提示(Chain-of-Thought)的科学依据: 「给模型时间思考」这一原则在技术层面对应「思维链提示」(Chain-of-Thought Prompting,CoT)。谷歌研究人员Wei et al.(2022)发现,在提示中加入「Let's think step by step」或提供逐步推理示例,能显著提升模型在数学推理、逻辑判断等复杂任务上的准确率,有时提升幅度可达数十个百分点。其背后机制在于:逐步生成中间推理步骤相当于为模型提供了「草稿纸」,允许其在有限的上下文窗口内分解问题,从而减少因一步跨越到答案而引入的幻觉(hallucination)错误。CoT的进化版本「自洽性」(Self-Consistency)通过对多条推理路径投票取最优答案进一步提升准确率,而OpenAI的o1/o3系列模型则将「思考时间」从提示层面内化到了模型架构本身,在推理阶段动态分配计算资源——这正是「慢思考」模型设计哲学的集中体现。
这两条原则贯穿了整个提示词工程的实践,也是从「会用ChatGPT」进阶到「用API构建应用」的关键分水岭。
结语:Agent之路始于扎实的基础
对于希望进入AI Agent开发领域的人来说,这门课程提供的正是最扎实的前置基础。理解基础模型与指令微调模型的区别、掌握API调用方式、内化提示词的两大原则,是构建复杂Agent系统前必须打牢的地基。
值得一提的是,这套课程由吴恩达与OpenAI团队(包括Andrew Main、Lillian Wang等)以及DeepLearning.AI团队共同打磨,兼具权威性与实操性。如果你想真正释放大模型作为开发工具的潜力,从这里开始是个明智的选择。
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。