每日AI新鲜事·07月16日午间版:MiniMax M3本地部署与Agent记忆系统
每日AI新鲜事·07月16日午间版:MiniMax M3本地部署与Agent…
2026年07月16日午间版 AI新闻速递+热点深度讨论
2026年07月16日午间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息,我说啊,最近本地部署这个话题真的越来越热,今天Reddit上就有一篇讨论把很多人搞懵了。
我也看到了,MiniMax M3那篇,对吧?r/ollama上的,讲的是428B total、23B active这个参数怎么理解。
对!好多人一看23B active就觉得,哇,48GB显存能跑?结果……
结果当然跑不了。这篇帖子说得很清楚,active参数描述的是每个token推理时激活多少参数,反映的是计算量,不是存储量。
M3是个MoE架构,Mixture of Experts,总参数428B,BF16精度下光是权重文件就要占接近900GB,一张48GB卡连零头都塞不下。
所以说这个误区其实挺普遍的,active参数低≠内存需求低,这两件事完全不是一回事。
对,MoE最大的优势是推理速度快、计算便宜,但权重该存多少还是要存多少,这个没法省。本地跑M3起码得攒一台多卡机。
所以那些跃跃欲试想在自己电脑上跑的人,先冷静一下,看清楚全量参数再做打算。好,接着聊下一条。
r/robotics上有个开发者在做一个叫LeRobot 3D的开源项目,给SO101机器人做三维空间感知的遥操作框架。
这个方向其实很重要,现在大部分机器人学习管线还是靠2D摄像头,但一涉及到抓取、摆放这类操作,2D信息真的不够用。
就是空间感不够?
对,机器人看到一个杯子,知道它在画面哪个位置是不够的,还要知道它在三维空间里离手多远、角度怎么样。LeRobot 3D做的就是在LeRobot这套框架上补上这块能力,方向对,就是还在早期阶段。
开源的,感兴趣的可以去看看。下一条,r/computervision上有篇介绍nuReasoning数据集的帖子,是Motional和UCLA合作出的,专门针对自动驾驶的推理能力。
这个数据集有意思,大概两万条真实世界的长尾驾驶片段,带了空间推理、决策推理还有反事实推理的标注,就是那种「如果当时那辆车没有变道会怎样」这类问题。
反事实推理,感觉这个对训练自动驾驶模型特别关键,毕竟很多极端情况现实里根本遇不到。
正是,长尾场景靠真实采集太贵太慢,用反事实标注做数据增强是个务实的思路。这个数据集值得关注。
还有一条快过一下,HackerNews上coroot发了篇博客,题目是「Can AI Do RCA」,讲AI做根因分析,说现在难点已经不是模型本身了。
这个标题其实挺有意思的,潜台词是模型能力够了,瓶颈在别的地方,大概是数据接入和上下文整合这块。不过帖子互动不多,点赞才三个,还没在社区里掀起大讨论。
好了新闻就先聊到这儿,接下来我们聊聊最近在B站特别火的一个话题——用Rust写工业级Agent,而且里面有个类人脑记忆系统的设计,我觉得这个值得好好展开。
这个我看了,互动分553,在B站AI技术向视频里算很高了,而且评论区讨论质量也不错,不是那种纯粹看热闹的。
我就很好奇,Rust做Agent这件事,动机是什么?现在大家不都是Python一把梭吗,LangChain、LlamaIndex随便挑。
这就是关键问题。Python做原型快,但一旦上生产,并发、内存管理、稳定性全是麻烦,Rust的优势就出来了——零开销抽象、无GC、线程安全这些,做长时间运行的Agent系统是真的香。
但Rust的学习曲线那么陡,团队成本呢?
这是个合理的顾虑。我觉得这条路更适合基础设施层,就是把核心Agent runtime用Rust写,上层逻辑和prompt编排还是可以用高层语言。就像数据库引擎用C写,上面跑SQL一样。
这个类比我懂了。那记忆系统这块怎么说,视频里说是「类人脑」的设计,这个词听起来有点玄乎。
「类人脑」这个说法确实容易被当成营销词,但背后的工程思路是有实质的。人脑记忆大体上分两类:工作记忆,就是你当下脑子里正在处理的信息;还有长期记忆,是持久化的知识和经验。
Agent的记忆系统也在模仿这个结构。短期的叫context window,就是当前对话的上下文;长期的通常是外部向量数据库或者结构化存储,Agent可以检索调用。
所以其实这个概念本身不新,新在哪?
新在工程实现的细粒度,以前大家做RAG,基本就是query进来、向量检索、塞进prompt,比较粗糙。现在更精细的设计是做记忆的分级管理——什么东西该短期存、什么该长期固化、什么该主动遗忘。
主动遗忘?这个有点意思,为什么要让Agent忘东西?
因为记忆太多也是负担。想象一个客服Agent跑了几个月,积累了几十万条对话历史,每次检索都把全部塞进来显然不行,得有机制去筛选、压缩、淘汰过时的信息。否则context污染反而让模型表现变差。
这个我有共鸣,之前做产品的时候也遇到过类似问题,上下文一旦太长,模型就开始「跑偏」,忘了真正重要的信息。
对,所以工业级Agent和demo级Agent的本质差距就在这里,不是模型能力,是记忆和状态的管理工程。
那用Rust来做这一层,具体的好处体现在哪?
第一个是并发,Agent往往需要同时维护多个会话的记忆状态,Rust的所有权模型可以在编译期就帮你把数据竞争的问题排掉,这在Python里要靠锁来处理,容易出bug。
第二个是延迟,记忆检索这个操作在每次LLM调用前都要做,如果这个环节慢,整个Agent的响应速度就卡在这里。Rust这块的性能优势非常直接。
所以说白了,Rust在这里解决的是可靠性和性能两个问题,不是说Python做不到,是做起来更费劲。
说得很准。我补充一点,Rust的内存安全其实对Agent系统还有个隐性价值——安全性。Agent会接入工具、调用外部API,如果内存管理出问题,被攻击的面会很大,Rust能在这个层面帮你堵一些洞。
这倒是,最近各种Agent安全漏洞的新闻没少看,从工具层就做好防护比事后打补丁强多了。那你觉得这条路有没有可能成为主流?
短期内不会,现在生态还是Python主导,大量的LLM SDK、框架都是Python优先。但我觉得未来两三年,Rust在Agent基础设施层会有自己的位置,类似Nginx对Web服务器的地位。
就是不抢Python的风头,但在需要可靠性的地方默默顶着。
对,而且你看这个视频能在B站火起来,说明国内开发者对这块的关注度在涨,之前大家还在聊怎么套LangChain,现在开始想怎么把Agent系统做得更扎实了。
这个变化确实有意思,从「能跑起来」到「能跑稳」,是个成熟度的信号。不过我有个疑问,记忆系统设计那么精细,调试起来不就很麻烦?你怎么知道Agent在某个节点用了哪段记忆?
这正好是当前这类系统最大的痛点,可观测性,observability。记忆调用链路不透明,出了问题你根本不知道是检索错了还是模型理解错了还是记忆本身就存了脏数据。
所以等于是把一个黑盒套在了另一个黑盒里面。
你说得很毒,但没说错。工业级Agent要解决的不只是功能,还有可调试、可解释这一整套,这也是为什么这个话题现在能火,因为大家踩坑踩够了,开始认真想怎么做对。
好,那今天这块我总结一下:Rust做Agent主要是解决生产级的并发、性能和安全问题;记忆系统的核心是分级管理,包括主动遗忘;而整个方向当前最大的挑战是可观测性还没跟上。
总结得挺到位的,基本就是这三个层次。想入坑的可以去看看那个B站视频,代码是开源的,还挺有参考价值。
好,今天就聊到这里,感兴趣的自己去挖一挖,我们晚上见。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。