AI Agent入门第一课:如何调用大模型

为什么学Agent要从调用大模型开始
很多初学者在接触AI Agent开发时,容易陷入一个误区:一上来就钻研大模型的底层原理,试图搞懂Transformer架构、注意力机制这些复杂的概念。但对于以应用为目标的开发者来说,这条路径既费时又打击信心。
更务实的做法是——先学会怎么调用大模型。当你掌握了调用这个最核心的动作后,Agent中的工具(Tools)、记忆(Memory)、决策(Decision)等模块就会变得容易理解。因为它们本质上都是围绕大模型这个「大脑」展开的辅助能力。
简单回顾一下Agent的四个组成部分:
- 大模型:负责思考
- 工具:负责执行
- 记忆:负责保存信息
- 决策:负责决定下一步怎么做
本文聚焦第一块,也就是Agent的「大脑」,讲清楚大模型到底是怎么被调用的。
用云平台调用大模型,别急着自己部署
调用大模型最简单的方式就是使用云平台。目前国内的选择非常丰富,包括 DeepSeek、智谱、阿里云百炼、火山方舟等,大部分平台都提供免费额度,对于学习阶段来说完全够用。
这里要特别提醒新手:千万不要一上来就想着自己部署模型。本地部署不仅需要昂贵的算力成本(以DeepSeek-V3为例,完整模型需要数百GB显存,即便量化后的小模型也至少需要一块消费级以上的GPU),还会耗费大量时间在环境配置、模型下载、显存调优上,对入门阶段的学习几乎没有帮助。

在众多平台中,比较推荐使用阿里云百炼平台,主要原因是它的文档非常全面和细致,对新手非常友好。你几乎可以在控制台里通过可视化的调试工具,不写一行代码就完成第一次大模型调用。
调用大模型就像发短信
理解调用过程,可以用一个生活化的类比:调用大模型很像用手机发短信。
发短信的三个步骤是:填对方号码 → 输入内容 → 等对方回复。而调用大模型对应的就是:
- 选择一个模型(相当于填号码)
- 发送一些内容(相当于输入短信)
- 等待返回结果(相当于等对方回复)
具体操作上,打开百炼控制台,找到上方的「API参考」,点击「OpenAI 兼容 - Chat」,右边就会出现一个调试按钮。这个OpenAI兼容接口是目前的行业事实标准——OpenAI在2022年底推出ChatGPT后,其Chat Completions API的接口设计迅速被全行业采纳。国内外众多大模型厂商(如阿里通义、智谱GLM、DeepSeek、Moonshot等)都选择采用与OpenAI相同的接口格式,包括请求路径、参数命名、返回结构等。这意味着你只需要学会这一套接口规范,就能通过简单切换base_url和model参数来调用不同厂商的模型,极大降低了迁移和学习成本。这也是为什么很多Agent框架(如LangChain、AutoGen)默认以OpenAI接口格式作为底层通信协议。
在调用之前,你需要先获取一个 API-Key。它相当于你的调用凭证,用来标识身份和计费。API-Key本质上是一种基于令牌的身份认证机制,类似于门禁卡。每次调用大模型时,平台通过API-Key识别调用者身份,并据此进行用量统计和费用结算。大模型的计费通常按Token数量计算——Token是模型处理文本的最小单位,中文大约1个汉字对应1-2个Token,英文大约1个单词对应1-4个Token。需要特别注意的是,API-Key一旦泄露,他人就可以用你的账户额度进行调用,因此绝不能将API-Key硬编码在前端代码或公开的代码仓库中。顺着平台指引创建 API-Key,复制粘贴到对应位置即可。

请求体里的两个核心参数
我们发送给大模型的内容,在计算机术语里叫做请求体(Request Body),里面的内容叫参数,参数后面跟的叫做值。入门阶段,你只需要理解两个关键参数。
Model参数:决定发给哪个模型
第一个参数是 model,它决定你要把请求发送给哪一个模型。比如填 qwen-plus(通义千问 Plus),也可以填 deepseek-chat 等其他模型。每个可选值官方文档都有说明,入门阶段直接用默认值即可。
Messages参数:组织你的对话内容
第二个参数是 messages,这是整个调用的核心。它是一个数组,里面每一个大括号 {} 都代表一条消息(Message)。每条消息又包含两个关键字段:
- role(角色):标识这条消息是谁说的
- content(内容):具体的消息文本
最常见的两种角色是:
system(系统消息):告诉大模型让它扮演什么角色,比如「你是一个乐于助人的助手」user(用户消息):也就是你要问大模型的具体问题
这里有一个重要的背景知识需要理解:messages数组的设计揭示了大模型对话的一个本质特性——大模型本身是无状态的,它不会记住之前的对话内容。每次调用都是一次独立的请求,模型看到的"上下文"完全依赖于你在messages数组中传入的所有消息。这意味着如果你想实现多轮对话,就需要在每次请求时把之前的对话历史(包括用户说的和模型回复的)全部拼接在messages数组中重新发送。这也解释了为什么Agent需要"记忆(Memory)"模块——它负责管理哪些历史消息需要保留、哪些可以压缩或丢弃,以在有限的上下文窗口(Context Window)内最大化对话质量。

通过 system 消息设定角色、user 消息提出问题,你就完成了一次最基础但完整的对话组织。
发送请求与解析返回结果
填好参数后,点击「发送」,就完成了对大模型的一次调用。右边的响应区域会出现模型返回的结果。
返回内容通常包含很多字段,但入门阶段我们只需要关注一个:choices 中的 content,它就是模型真正的回答。点击「解析内容」,平台会只展示 content 里的文本,比如让它介绍「Agent 是什么」,它就会给出对应的解释。

这里有一个有趣的细节可以验证 system 消息的作用:如果把系统角色设定为「房地产经纪人」,再问它「给我介绍 Agent」,由于 Agent 这个词本身有「代理、经纪人」的含义,模型就会结合角色设定,返回一些经纪人相关的信息。这个例子直观说明了系统消息如何影响模型的输出方向。
事实上,system消息的作用机制涉及到一个重要的实践领域——提示工程(Prompt Engineering)。大模型在预训练阶段学习了海量文本中的语言模式,而system消息相当于在推理时为模型设定一个"行为框架",引导模型在特定角色、语气、知识范围内生成回答。在实际的Agent开发中,system消息往往承载着复杂的指令,包括角色定义、输出格式要求、工具使用规则、安全限制等,有时可达数千字。精心设计的system prompt是Agent能力的关键组成部分,也是很多商业AI产品的核心竞争力所在。
小结:从「会聊天」到「能做事」
到这里,你已经掌握了调用大模型最基础的方式:选模型、组织消息、发送请求、解析结果。这套流程虽然简单,却是所有Agent开发的地基。
不过需要清醒地认识到——现在的大模型只会聊天,还没办法真正完成任务。它能回答问题、生成文本,但不能帮你查天气、发邮件、操作数据库。要让大模型从「会聊天」进化到「能做事」,就需要引入 Agent 的下一个核心模块:工具(Tools)。
实现这一跨越的关键技术是**Function Calling(函数调用)**机制。其原理是:开发者在请求中除了messages外,还传入一组可用工具的描述(包括工具名称、功能说明、参数定义),模型在理解用户意图后,会判断是否需要调用某个工具,并生成结构化的调用参数。开发者的程序拿到这些参数后执行实际操作(如调用天气API),再将结果返回给模型进行最终总结。这个"模型决策→程序执行→结果回传"的循环,正是Agent能够完成复杂任务的核心机制。
下一步的学习重点,就是理解工具如何与大模型配合,让模型不仅能思考,还能调用外部能力去执行真实任务。掌握了「调用大模型」这个基础动作,后续理解工具调用、记忆管理和决策逻辑都会水到渠成。
核心要点
相关推荐

AI生成视频封面实战:分层提示词告别模板套图
B站UP主七爷分享AI生成视频封面的完整方法论,揭示如何通过分层拆解提示词避免AI模板味,涵盖标题层级划分、主视觉取舍、缩略图适配等实用技巧,附公开提示词模板可直接复用。

梯度下降训练的普适性:神经网络架构选择真的重要吗
探讨梯度下降训练的普适逼近能力,分析神经网络架构选择与可学习性的关系。从普适逼近定理到神经正切核理论,解读为什么梯度下降能在不同架构下稳定收敛,以及这对深度学习架构设计的启示。

DIY空气净化器:用PC风扇和铝框打造静音CR盒子
详解如何用电脑机箱风扇和铝制框架DIY一台低噪音Corsi-Rosenthal空气净化器,涵盖PC风扇选型、PWM调速方案、性能对比及成本分析,适合追求静音和美观的硬件爱好者。