MiniMax M3编程实测:价格仅为Opus的1/765,代码质量却更高?

MiniMax M3 是近期备受关注的一款开源大模型,由中国AI实验室 MiniMax 于6月1日发布。它拥有百万级上下文窗口、原生多模态能力,而价格低到令人咋舌——同样花20美元,获得的token数量是 Claude Opus 的765倍。
但便宜真的能有好货吗?YouTube/B站博主 Tech With Tim 通过三组实际编程任务,将 MiniMax M3 与 Cursor 内置的 Composer 2.5 进行了正面对决,结果颇为值得玩味。
MiniMax M3核心参数:百万上下文、开源权重与碾压级定价
MiniMax M3 来自中国AI实验室 MiniMax,与 Anthropic 和 OpenAI 的闭源路线不同,MiniMax 选择了完全开放权重——你可以下载、微调、自由使用。这一策略与当前AI行业的两大阵营形成鲜明对比:Anthropic(Claude系列)和OpenAI(GPT系列)采用闭源模式,用户只能通过API调用模型,无法获取模型参数;而Meta的LLaMA系列、Mistral、DeepSeek等则走开源路线。开源权重意味着开发者可以在本地部署模型、针对特定任务进行微调(fine-tuning),甚至在此基础上构建商业产品——这对于数据隐私要求高的企业(如医疗、金融)尤为重要,因为数据无需离开自有服务器。
模型的核心参数包括:
- 上下文窗口:最大100万token,最低保证51.2万token。100万token大约相当于750万个英文单词,或者约1500页的技术文档。作为对比,GPT-4 Turbo的上下文窗口为12.8万token,Claude 3.5 Sonnet为20万token。百万级上下文的实现通常依赖于稀疏注意力机制(Sparse Attention)、滑动窗口注意力或线性注意力变体等技术,以避免标准Transformer架构中注意力计算的二次方复杂度问题。对于编程场景,这意味着模型可以一次性"阅读"整个大型代码库,理解跨文件的依赖关系和架构设计,而不需要将代码分块处理后拼接上下文。
- 多模态支持:原生训练支持图像、视频、文本生成(非后期拼接)。所谓"原生多模态"是指模型在预训练阶段就同时使用文本、图像、视频等多种数据进行训练,使模型从底层就具备跨模态理解能力。与之相对的"后期拼接"方案——先训练纯文本模型,再通过适配器将视觉编码器接入——在处理需要深度跨模态推理的任务时(如根据UI截图生成代码),表现通常不如原生方案,因为不同模态的表征空间没有在训练中充分对齐。
- 开源可用:权重完全开放,支持API调用
- 自主运行能力:官方演示中曾连续自主运行12小时无需人工干预

最让人震撼的是定价策略。以每月20美元计算,MiniMax M3 可提供约17亿token;而同样的预算,Claude Opus 仅能提供约220万token,Claude Sonnet 约370万,Claude Haiku 约1110万。换算下来,MiniMax M3 的性价比是 Opus 的765倍。这个数字足以改变很多开发者的模型选择策略。
实测一:从零构建URL缩短器——快而糙 vs 慢而精
第一个任务是用同一个prompt让两个模型从零构建一个URL缩短器Web应用,要求包含API端点、重定向功能、仪表盘页面和现代化UI。
Composer 2.5 的表现
Cursor是目前最受欢迎的AI编程IDE之一,基于VS Code深度定制,内置了多种AI辅助功能。Composer是Cursor中的核心AI代理功能,允许用户通过自然语言描述需求,由AI自动生成、修改和重构代码。与直接调用API不同,Composer能够感知整个项目的文件结构、读取相关文件内容,并直接在编辑器中应用代码变更,这使得它在实际开发工作流中的集成度非常高,也是本次对比中它作为"基准对手"的原因。
Composer 在约2分钟内完成任务,生成了7个文件。功能基本实现——URL缩短、重定向、点击统计、深色/浅色模式切换都能正常工作。但代码结构比较粗糙,所有逻辑堆在少数几个大文件中,没有测试代码,没有输入验证,也缺乏注释。用博主的话说,"给了绝对的最低限度"。
MiniMax M3 的表现
MiniMax M3 耗时约15分钟,但生成了21个文件。代码结构清晰——配置、数据库、错误处理、路由、服务层、工具函数各自独立,文件大小适中。更重要的是,它自动编写了完整的测试用例,还会在浏览器中实际验证功能,发现问题后自行修改。

耗时长的原因有两个:一是代码量更大,二是模型会先起草完整方案再逐步实现,并在过程中反复自我审查和修正。虽然慢了5-6倍,但产出质量明显更高——这是一个典型的"快而糙" vs "慢而精"的对比。
实测二:Rust光线追踪器——底层编程能力的硬核检验
第二个任务跳出了Web开发的舒适区,要求用Rust从零编写一个光线追踪器,渲染4-5个球体在棋盘格地面上的场景,输出PPM格式图像。这是一个计算密集型的底层编程任务,对模型的Rust语言能力和算法理解都是严峻考验。
光线追踪(Ray Tracing)是计算机图形学中的经典渲染技术,通过模拟光线从摄像机出发、与场景中物体交互的物理过程来生成逼真图像。实现一个基础光线追踪器需要掌握向量数学(点积、叉积、法线计算)、光线-几何体相交检测算法、Phong或Blinn-Phong光照模型、递归反射与折射计算等知识。选择Rust语言更增加了难度——Rust以严格的所有权系统(Ownership)和借用检查器(Borrow Checker)著称,编译器会在编译期拒绝任何可能导致内存安全问题的代码。PPM(Portable Pixmap)是一种简单的无压缩图像格式,常用于图形学教学和测试,因为它不需要任何外部库即可生成。这个任务综合考验了模型的数学推理、算法实现和语言特性掌握能力。

结果差异显著:
- Composer 2.5:生成的图像是上下颠倒的,翻转后反射效果也存在明显错误,球体的镜面反射出现了异常的镜像问题。代码缺少注释,虽然文件结构尚可,但核心算法实现有bug。
- MiniMax M3:生成的图像方向正确,球体的三维感和反射效果明显更好。虽然仍有一个球体被裁切,但整体渲染质量更高、更准确。代码注释清晰,文件组织合理。
两个模型生成的代码量相近,但MiniMax M3花了3-4倍的时间进行更深入的分析和验证。博主由此得出一个关键观察:MiniMax M3的架构似乎专为长时间运行的复杂任务设计,它会充分利用百万token上下文窗口进行深度分析,而不是追求最快的输出速度。
实测三:复杂代码库功能扩展——最接近真实工作的考验
第三个任务最接近真实工作场景——在一个包含数万行代码的全栈应用(Python后端 + TypeScript前端)中,添加一个"每日连续学习天数"(Daily Streak)功能。这要求模型先理解现有代码库的架构,然后在正确的位置添加后端API、前端UI和核心服务逻辑。

这个任务的结果差距相对较小,但仍有明显区别:
- Composer 2.5:快速完成,在UI上添加了一个简单的Daily Streak组件,只写了一个较小的测试文件,改动以小型UI补丁为主。
- MiniMax M3:在Composer已经完成任务时,它还在分析代码库。最终产出包含更详细的代码、更多注释、额外的"最佳纪录"(Best of 17 days)等附加功能,以及更完善的测试覆盖。
博主指出,虽然这次代码质量差距不如前两个任务那么大,但MiniMax M3的代码在可维护性方面仍然更胜一筹。
MiniMax M3适合谁?优劣势与适用场景总结
经过三轮编程实测,MiniMax M3的定位已经非常清晰。
核心优势
- 价格碾压级——同等预算下token量是Claude Opus的765倍
- 代码质量高——自动生成测试用例、注释和清晰的项目结构
- 百万token上下文窗口——适合大型代码库分析和理解
- 自我审查能力强——会主动发现并修复代码问题
- 开源权重——可下载、微调,灵活性极高
主要劣势
- 速度明显较慢——复杂任务可能需要15分钟以上
- 并非当前绝对最强的编程模型
- 倾向于"过度工程化"——简单任务也可能生成大量代码
推荐使用场景
- 对成本敏感的个人开发者和小团队
- 需要长时间自主运行的AI Agent任务。这反映了AI行业从"对话式助手"向"自主代理(Autonomous Agent)"演进的重要趋势——传统AI编程助手需要开发者逐步下达指令,而AI Agent能够自主规划任务、执行操作、检验结果并迭代修正。实现长时间自主运行需要解决上下文管理(避免在长对话中丢失关键信息)、错误恢复(遇到异常时能自主诊断和修复)等多个技术挑战,而百万级上下文窗口让Agent能够在整个运行过程中保持对任务全貌的记忆。
- 大型代码库的分析和重构
- 对代码质量和测试覆盖有较高要求的项目
正如博主总结的:"这不是当前最好的模型,但对于90%以上的任务,你用它会更划算,因为它便宜太多了,而且依然能把活干好。"
在AI编程工具的选择中,性价比正在成为一个越来越重要的维度。MiniMax M3用实际表现证明了,"够好且极便宜"可能比"最好但昂贵"更适合大多数开发者的日常需求。
核心要点
相关推荐

MCP-Builder.ai:用自然语言几分钟搭建AI数据连接器的托管平台
MCP-Builder.ai 让开发者用自然语言描述即可自动构建、托管和保护MCP Server,几分钟内将数据库、API、第三方应用连接到Claude、ChatGPT、Cursor等AI工具,无需处理部署和安全配置。

PostHog Desktop深度解析:AI Agent驱动的产品协作工作台
PostHog Desktop是一款将产品数据、AI智能体和代码构建整合到统一工作台的桌面应用。本文深度解析其核心功能、多Agent协作模式及与GitHub的深度整合,探讨AI原生开发平台如何重塑产品迭代流程。
