每日AI新鲜事·07月20日午间版:小MoE干翻大模型
每日AI新鲜事·07月20日午间版:小MoE干翻大模型
2026年07月20日午间版 AI新闻速递+热点深度讨论
2026年07月20日午间版 AI新闻速递+热点深度讨论
今天AI圈消息不算多,但有一条让我看了好几遍——阿里通义千问搞了个很有意思的模型,35B总参数,每次推理只激活3B,在AgentWorldBench上居然跑出了56.39分。
对,就是Qwen-AgentWorld-35B-A3B,这个命名方式已经把核心参数全暴露了。35B是总量,A3B是激活量,MoE架构。
这个分数说实话挺炸裂的。AgentWorldBench是专门测Agent能力的,不是普通的文字理解题,是要让模型真的去完成任务、做决策。
我看到这个的第一反应就是——激活3B,这不就是一个小模型的计算量吗?但它能打到这个分数,凭什么?
这就是MoE的精髓嘛。知识存在35B里,但推理的时候只调动最相关的那3B来干活。相当于你有个一百人的团队,每次只出动最对口的六七个人。
效率上来了,推理成本大幅下降,但因为整个知识库还在,理论上能力损失不大。阿里这次把这个逻辑推到Agent任务上,效果看来是验证到了。
这个话题在B站互动挺高的,互动分603,评论区大家聊得挺热闹。我待会儿想多聊聊这个——先把今天其他的消息快速过一下。
其实今天新闻这边相对清淡,板块一我们就快速带过一条——就是Qwen-AgentWorld这个本身,因为这既是新闻也是今天最值得深聊的话题。
行,那就直接进正题。
好,新闻就先到这儿。接下来我们就把这个Qwen-AgentWorld好好拆一拆——小MoE干大活,这件事到底意味着什么。
先说结论:我认为这是一个信号,Agent时代的模型竞争逻辑,跟之前拼通用能力的逻辑是不一样的。
怎么个不一样法?你展开说说。
之前大家卷的是什么——MMLU、GSM8K、各种推理benchmark,本质上是在测模型有没有足够多的知识和通用能力。
但AgentWorldBench不一样,它测的是你能不能在一个环境里连续行动、规划、纠错,完成一个多步骤任务。这对模型的要求是另一个维度的。
所以你的意思是,以前拼参数量有意义,现在拼的是另一套能力?
对,至少在Agent这个场景下是这样。一个激活3B的模型能在Agent任务上打出这个分数,说明参数量不是决定性因素,训练数据和任务对齐才是关键。
这倒让我想起之前看到的一个讨论——有人说现在搞Agent,推理成本才是最大的瓶颈,因为Agent要反复调用模型,一个任务可能要跑几十步。
你这个点说到核心了。一个Agent任务,模型可能要被调用二三十次,每次都用dense大模型,成本根本扛不住。
所以小激活量的MoE在这里有天然优势——推理成本低,但知识储备足够。阿里这次选35B总参、3B激活这个配比,我觉得是蓄谋已久的。
但我有个疑问——56.39分,这个分数本身算高吗?AgentWorldBench的满分是多少,有没有横向参照?
这个benchmark相对新,目前公开的参照系还比较少。但考虑到它测的是真实Agent任务,不是填空题,能到五六十分这个区间已经是相当扎实的水平了。
而且关键不是绝对分数,是性价比。你用3B的推理成本打出这个分,比你用一个70B dense模型打出同样分数,完全是两个商业逻辑。
这个性价比的角度很重要。从产品角度说,如果我要部署一个Agent,我肯定首先考虑的是能不能跑起来、成本能不能接受,再考虑能力够不够用。
对,能力够用就行,没人要求你满分。而且现在很多Agent场景其实都是垂直任务——代码Agent、客服Agent、数据分析Agent,不需要你什么都会。
所以专项调优加上MoE的低成本,这个组合在垂直Agent场景里可能真的很有竞争力。
而且阿里能把这个做出来,背后还有一个前提——他们对Qwen系列的基础能力已经打磨得相当扎实了。MoE是在好基础上的优化,不是在凑数。
这倒是,Qwen这两年进步肉眼可见。B站上这个视频的评论,大家聊得最多的是什么?
评论区两极分化挺有意思的。一部分人很excited,觉得小模型时代来了,以后本地部署Agent有戏了。另一部分人在质疑benchmark是不是有水分。
这个质疑倒也正常,现在AI圈benchmark刷分刷出花来了,大家不信任是有原因的。
对,这其实是个行业问题。AgentWorldBench相对是个更难刷的benchmark,因为它是端到端任务评估,不是选项题,想专门针对它过拟合没那么容易。
但我也不敢说完全没有针对优化的成分。这个只能等更多独立复现来验证了。
所以你总体是持谨慎乐观的态度?
对,谨慎乐观。方向是对的,MoE加Agent专项调优这条路我觉得是未来的主流方向之一。但具体这个分数水不水,还需要时间验证。
我还有一个角度想聊——这次是35B总参,那如果阿里把同样的方法论用到更大的基座上,比如总参200B、300B,激活可能还是很小,但天花板会不会更高?
这个推论理论上成立,而且之前MiniMax的M3就是往这个方向走的——总参428B,激活23B。规模更大,但推理成本依然可控。
阿里这次用35B做验证,可能是先跑通方法论,后续完全有可能往上打。如果再配合专项的Agent训练数据,潜力很大。
所以现在各家的路线越来越清晰了——不再是单纯拼总参数,而是MoE架构加上垂直场景调优,这两个维度同时发力。
对,而且这个趋势对整个行业都是好事。训练成本、推理成本都在往下走,更多的人和公司能用上能力不错的Agent,生态才能真正起来。
从产品角度说,我最期待的其实是这个——如果推理成本真的降下来了,那很多现在因为成本太高而没法做的Agent产品,可能就真的有机会了。
这个判断我完全同意。Agent产品的普及,很大程度上卡在推理成本这个瓶颈上。MoE把这个瓶颈打开一个口子,后面的产品想象空间就打开了。
好,那我来总结一下今天这个话题:阿里Qwen-AgentWorld用35B总参、3B激活的MoE,在AgentWorldBench上打出56.39分,核心价值不是分数本身,是低推理成本下的高Agent能力,给行业验证了一条新路线。
总结到位。就等后续独立复现来盖章了。
行,今天就聊到这儿。如果你对AgentWorldBench或者MoE这个方向有想法,欢迎来留言,我们晚上见。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。