AI玩转《宝可梦红》:Jev仅花2美元通关两个道馆

AI模型Jev边玩《宝可梦红》边自建工具链,不到2美元已通过两个道馆。
一位Reddit用户让AI模型Jev实时游玩经典游戏《宝可梦红》,并由Opus 5在游戏推进过程中同步构建控制框架(harness)。这种"边跑边搭"的模式不仅展示了AI的工程推理与自主执行能力,更令人关注的是其极低的运行成本——击败两个道馆的全程token消耗不到2美元。这一数字折射出两个趋势:新一代模型推理效率的显著提升,以及精细任务编排对无效调用的有效压缩。《宝可梦红》因涵盖长期记忆、地图导航、战斗策略等多维挑战,已成为评估AI长时序规划能力的理想基准。这次社区自发实验表明,AI智能体从"回答问题"到"自主完成复杂任务"的转变正在以极低的门槛快速落地。
一次低成本的AI游戏实验
一位Reddit用户分享了一个颇具趣味的AI实验:让名为Jev的AI模型实时游玩经典游戏《宝可梦红》(Pokemon Red),而游戏运行所需的"harness"(控制框架/中间层)则由Opus 5在过程中同步搭建。这种边玩边构建工具链的做法,展示了当前AI在自主任务执行上的灵活性。
据发帖者描述,Jev已经击败了游戏中的两个道馆(gym),而截至分享时,运行Jev所消耗的token总成本还不到2美元。这个数字本身就是这次实验最引人注目的亮点——它说明AI玩复杂游戏的门槛正在快速下降。

为什么"harness"是关键
让AI游玩一款像《宝可梦红》这样的回合制RPG,并不是简单地把游戏画面丢给模型就能完成。AI需要一套中间层来读取游戏状态、解析画面信息、并把决策转化为具体的操作指令。这套框架通常被称为"harness"。
值得关注的是,在这次实验中,harness并非事先写好,而是由Opus 5实时构建。这意味着模型在游戏推进的同时,还在不断完善与游戏交互的工具接口。这种"边跑边搭"的模式,考验的是AI的工程能力与任务分解能力,也让整个过程更接近真实的自主智能体(agent)工作流。
从技术实现角度来看,harness通常需要完成以下几个核心职责:通过模拟器API(如PyBoy或BizHawk)读取游戏内存中的状态数据(角色位置、HP、背包物品等);将游戏画面截图或结构化状态转化为模型可理解的文本/图像输入;接收模型输出的行动指令并映射为实际按键操作;以及维护一个"记忆缓冲区"来避免模型在长对话中遗忘关键进度。Opus 5在游戏过程中实时生成这套框架,本质上是在执行一种"工具使用(tool use)+ 自我反思"的循环:模型先尝试某种接口设计,根据游戏反馈判断是否有效,再迭代修改。这种能力与近年来兴起的"LLM作为程序员"范式高度契合,也是评估模型工程推理能力的重要维度。
成本才是真正的信号
在过去,让大型模型完成长时序、多步骤的游戏任务往往意味着高昂的推理成本。而这次不到2美元就打完两个道馆的记录,反映出两个趋势:
- 模型效率提升:新一代模型在完成同样任务时消耗的token更少。
- 任务编排更精细:合理的harness设计能减少无效的推理调用,避免token浪费。
对于开发者和爱好者而言,低成本意味着这类实验不再是资源雄厚的实验室的专利。任何人都可以用几美元的预算,跑一场自己的AI游戏挑战。
用游戏检验AI能力的价值
《宝可梦红》作为AI基准测试的载体并不是偶然。这类游戏包含长期记忆、地图导航、战斗策略、资源管理等多重挑战,能够综合检验一个模型的规划与执行能力。相比一次性问答,通关游戏要求AI在数百甚至上千步操作中保持目标一致性。
Anthropic此前也曾用《宝可梦》系列作为衡量Claude长时序能力的参考。这次社区用户的自发实验,某种程度上延续了这一思路——用一个人人熟悉的游戏,直观地展现AI能力的边界。
《宝可梦红》发布于1996年,是Game Boy平台的回合制RPG经典,整个游戏包含8个道馆、151种可捕捉精灵以及线性叙事主线。从AI基准测试的角度看,它的优势在于:状态空间有限但决策树极深(通关需要数百步有效操作);游戏规则对人类玩家高度透明,便于评估AI是否"真正理解"而非随机试探;且社区工具链成熟,便于低成本接入。2024年,一个名为"Twitch Plays Pokémon AI"的项目和Anthropic内部的Claude评测都曾以此为测试场景。相比抽象的数学推理题或代码生成任务,游戏通关进度是一个直观且可量化的里程碑,使得不同模型、不同时间节点的能力对比更为清晰。
结语:小实验,大想象
这条Reddit帖子本身信息量不大,但它折射出的方向值得留意:AI智能体正在从"回答问题"走向"完成任务",而完成任务的成本正在急剧下降。当一个AI能用不到2美元玩转经典游戏并自建工具链时,我们有理由对更复杂、更实用的自主智能体应用抱有期待。
感兴趣的读者可以关注原作者的后续更新,围观这场AI宝可梦挑战能走多远。
相关推荐

14K Star开源桌面端cc-haha:5个AI Agent自主分工协作
开源桌面端cc-haha已获14K Star,集成Anthropic实验性功能Agent Teams,让5个AI Agent自主分工协作完成前后端开发。本文解析其队长带队机制、使用方法及4000万token的成本边界。

Claude Code入门实战:小白也能用AI高效写代码
Claude Code是一款本地运行的AI编程助手,能通读整个项目并自动调错生成准确代码。本文对比Copilot、Cursor、TRAE、Codex等工具,帮小白从0入门AI写代码,理解其为何强于对话式编程。

国内零成本使用 Claude Code 教程:接入免费国产模型全流程
本文手把手教你在国内零成本使用 Claude Code:从命令行与插件两种安装方式,到接入美团免费开源模型 LongCat 的 API 配置全流程,纯新手也能跟着跑通并开发小工具。