每日AI新鲜事·07月19日晚间版:Kimi K3震场与小MoE大能耐
每日AI新鲜事·07月19日晚间版:Kimi K3震场与小MoE大能耐
2026年07月19日晚间版 AI新闻速递+热点深度讨论
2026年07月19日晚间版 AI新闻速递+热点深度讨论
今天AI圈热闹得很,既有一个参数量大得吓人的模型测评刷屏,又有个小得出奇的模型悄悄拿了高分。先说说vibe coding,最近B站上这类内容真的铺天盖地。
对,我今天刷到好几条,感觉vibe coding已经从小众玩法变成全民运动了。
先来说说今天的新闻。B站上有个叫郭柯的博主,在推广他的「AI编程14天直播实战营」,用Claude Code、Trae、Codeium这几个工具带零基础用户做项目。文档写了四万多字,六大案例,从20号连播到月底。
四万字的课程文档,这个量确实认真。不过我更感兴趣的是他选的工具组合——Claude Code加Trae加Codeium,面向的明显是完全不懂代码的人群,不是程序员转型。
对,定位很明确,就是小白带入门。然后还有一条也挺有意思,一个视频标题直接叫「AI半小时搞定我3天的工作」,讲的是一个叫ChatCat的视频剪辑软件。
ChatCat我看了一眼,定位很像是剪映加FindCut的结合体,把转场、特效插件全内置好了。博主说之前见过太多webcoding做出来的自动剪辑工具,实测都不怎么样,但这个他用下来觉得不一样。
这个说法倒是真实,业内做AI剪辑工具的太多了,但真正能用的没几个。不过半小时搞定三天工作这种标题……感觉有点夸张。
夸张肯定是有的,但方向对。视频剪辑这种重复性高、规则清晰的工作,AI确实能大幅提速。
接下来这条我觉得挺有趣,有个设计师分享为什么想让AI「学会品味」。她base在荷兰,做vibe coding项目,然后发现AI生成的界面清一色是蓝紫色渐变——她说这已经成了AI的专属配色了。
这个我完全理解,还有技术原因——Tailwind CSS里有个颜色叫Indigo 500,早期AI生成代码时特别爱用,结果就形成了这个「AI美学」。
所以蓝紫色背后居然是个CSS默认值的锅,这个细节真的没想到。
对,不是AI天生觉得蓝紫色好看,是训练数据里这个颜色出现频率太高。这位设计师想做的事,本质上是在给AI注入审美偏好,技术上挺难的。
还有一条是两个自称「搞钱姐妹」的博主,纯小白视角讲vibe coding踩坑,总结了四个大坑,第一个坑就是——AI天生爱飘移。
「爱飘移」这个描述太准了,就是你让它做A,它做着做着开始自由发挥,改了B改了C,最后你也不知道它动了什么。这对零基础用户来说是最难受的,因为看不懂代码就没法debug。
好了vibe coding就先聊到这儿,最后一条重量级的——B站上有个万人直播间,一群美国软件工程师在实测Kimi K3,87%的观众投票认为它对Fable 5是「毁灭级碾压」。2.8万亿参数,这个数字……
2.8万亿,这个规模确实恐怖。价格从之前的0.72涨到了3.15美元每百万token,涨了快四倍多。但测完之后那些工程师貌似觉得涨价值了。
87%投票碾压Fable 5,这个比例如果是真实反馈的话,还是挺震撼的。当然直播间投票本来就有娱乐成分在。
对,直播间氛围这东西会放大情绪,但能在工程师群体里引发这种反应,说明Kimi K3的实力确实不能小觑。好了,接下来咱聊个我觉得今天技术含量最高的消息。
好了新闻就先聊到这儿,接下来说说今天最火的技术话题——通义千问那个激活只有3B参数的小MoE,在Agent基准上跑出了56分多的成绩。
对,Qwen-AgentWorld-35B-A3B,这个名字信息量很大。总参数35B,但每次推理只激活3B。在AgentWorldBench上拿到了56.39分,这个分数放在这个榜单上真的不低。
等等我要问一下,「激活3B」这个概念,对不懂技术的听众怎么理解?
你想象一个公司有35个员工,但每次接一个项目,只调三个人上阵。MoE就是这个逻辑——Mixture of Experts,混合专家架构。你有很多「专家」模块,每个token过来,路由器决定调哪几个专家处理,其他专家躺平。
所以对用户来说,体验是3B的推理成本,但享受的是35B规模训练出来的能力?
基本上是这个意思。当然实际没这么简单,但核心优势就是——便宜、快、还挺能打。这也是为什么MoE这两年在工业界这么火,从DeepSeek的MoE架构,到MiniMax M3,再到现在这个,大家都在往这个方向走。
那56.39分在AgentWorldBench上大概是什么水平?能比较一下吗?
这个基准专门测Agent能力——就是模型在复杂任务里做规划、用工具、多步骤推理的能力。56分多对于一个激活参数只有3B的模型来说,是相当炸裂的成绩。你要知道很多激活参数大得多的模型在这个榜上也没这个分。
那这背后是什么原因?是纯靠架构设计,还是有其他因素?
几个方面叠加。第一是MoE架构本身的效率优势,第二应该是专门针对Agent任务做了训练上的优化,毕竟名字里就带「AgentWorld」。Qwen团队这几年在Agent方向投入很大,这个模型感觉是专项特训的产物。
专项特训,这个角度挺有意思。就是说不追求通用最强,而是在特定赛道上打穿。
对,这其实是我觉得2026年最值得关注的趋势之一。大模型军备竞赛跑了这么久,参数越堆越大,但真正落地的时候,专项能力强、推理成本低的模型才是企业愿意买单的。
你说的让我想起B站评论区里有人讨论这个,有条评论说——小模型大能耐这件事,比大模型更多能耐更让人兴奋,因为前者意味着普通开发者也能玩得起。
这个观点我非常同意。激活3B意味着什么,意味着一张普通的消费级GPU就能跑。不是人人都有H100集群,但如果一个Agent任务用3B的推理成本就能跑出很好的效果,这件事的普及意义完全不一样。
但我有个反驳——光看benchmark分数的话,是不是也有点片面?比如AgentWorldBench测的任务,跟真实业务场景可能有差距。
这个质疑完全合理,benchmark gaming是老问题了。不过AgentWorldBench相对来说设计得比较贴近真实Agent场景,它不是那种刷填空题的榜,是真的让模型去完成多步骤任务。当然跟你自己的业务场景还是有距离,实测永远比榜单重要。
对,实测最重要。那你觉得这个模型对行业的影响是什么?
我觉得有几个影响。第一,它给了开发者一个新的参考点——做Agent任务不用非得上最大的模型,专项优化的小MoE可能更划算。
第二,它会推着其他厂商也跟进——Kimi K3在大参数上打擂台,Qwen在高效小MoE上突破,这两条路其实不矛盾,但会倒逼各家在各自的技术路线上加速。
两条路并行,一个拼天花板,一个拼性价比。我感觉现在这个时间节点,性价比路线反而更有意思,因为Agent真正落地靠的是成本控制。
你说到点上了。Agent落地最大的卡点不是「模型不够强」,而是「推理成本控不住」。一个Agent任务可能要调用模型几十次甚至上百次,如果每次都用顶级大模型,成本直接爆炸。小MoE把这个问题打开了一个口子。
所以从产品视角看,这件事其实比Kimi K3那个2.8万亿参数的怪物更实际一点,对吧。
对于大多数想做Agent产品的开发者来说,确实更实际。当然Kimi K3那种顶级模型也有它的用武之地,比如需要极强推理能力的复杂任务。两者是互补关系,不是竞争关系。
这个角度挺好,我之前老是把它们放在同一个维度比,其实根本就是两个不同的产品定位。一个是旗舰机,一个是高性价比中端机,目标用户就不一样。
对,而且有意思的是,现在这两种路线都在中国公司手里跑得很快。Kimi是月之暗面的,Qwen是阿里的,这在一两年前很难想象。
这话说得我突然有点感慨。好,今天就聊到这儿,Kimi K3的恐怖参数量和Qwen小MoE的高效路线,一大一小,今天都挺值得关注的。
对,AI这行确实没有一天安静的,明天肯定又有新东西蹦出来。
那就明天见,保持关注。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。