每日AI新鲜事·08月13日午间版:Qwen3.8超大MoE与Grok Bot入局
每日AI新鲜事·08月13日午间版:Qwen3.8超大MoE与Grok Bo…
2026年08月13日(周四)午间版 AI新闻速递+热点深度讨论
2026年08月13日(周四)午间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息,特别是模型这块又卷起来了。李博,咱们先过几条新闻?
来吧,我刚刷到好几条挺有意思的。
第一条是B站上看到的,Matt Pocock又搞了个新东西叫Sandcastle。之前他那个AI工作流项目已经十几万星了嘛,这次更激进。
他说过去半年一直在让coding agent完全AFK运行,就是全自动的,自己从backlog里捡任务、写功能、做QA,而且是并行跑多个agent。
这个思路其实就是软件工厂了。不是一个人带一个agent干活,是agent自己组团干活,人只负责验收。
关键词是AFK——Away From Keyboard。他追求的是人完全不在键盘前,agent照样能把活干了。
对,感觉跟之前Devin那个方向类似,但他是开源的,而且是从个人开发者的角度出发。
比Devin更轻量,更像是把Claude Code这类工具串成流水线。不过能不能真正稳定跑起来,还得看实际效果。
好,第二条。Reddit的mlops版块有人在聊SkyPilot这个开源项目,解决的是一个很现实的问题——很多ML团队同时有Slurm集群、K8s集群、还有云上的GPU。
对,SkyPilot就是在这些异构环境上面加一层统一调度。一个任务提交上去,它自动找最合适的地方跑。
这对大团队确实刚需,GPU资源分散在各处,手动调度太痛苦了。
嗯,不过这类工具的难点永远是边缘case——不同集群的权限、网络、存储配置差异巨大,抽象层能覆盖多少是关键。
还有一条HN上的,DLLM——一个直接建在llama.cpp上的极简coding agent,完全没有额外依赖。
这个挺硬核的,等于绕过了所有Python框架,纯C加加搞定。适合那种追求极致轻量的开发者。
还有个Hacker News上的Show HN项目叫Ballet,做的是workflow automation,号称能自动对接任意API写集成。
这个方向很多人在做了,Zapier加AI升级版。不过刚发出来还没什么评论,先观望。
好了新闻就先到这儿,接下来我们聊聊最近特别火的两件事——Qwen3.8的超大MoE模型,还有Grok Bot正式上线。
先说Qwen3.8-2.4T吧,这个在HN上四百多分了,讨论非常热烈。
等等,我先帮大家理清楚参数。2.4T是总参数量,A95B是激活参数,也就是说这是个MoE架构,每次推理只用950亿参数。
对,2.4万亿总参数,但实际激活不到一千亿。这个比例挺激进的,大概只激活了百分之四左右的参数。
之前阿里刚发了Qwen3.8-Max主打agent能力嘛,现在又放出这么大的开源模型,什么节奏?
我觉得阿里的策略很清楚——Max是闭源商业版走高端路线,开源这边用超大MoE刷存在感。两条腿走路。
而且放在HuggingFace上,明摆着是给社区玩的。这个体量,个人跑不动,但研究机构和中小公司可以部署。
HN上一百多条评论,大家主要在争论什么?
我看到两个焦点。第一是跟Llama 4比,到底谁强。Meta的Llama 4最大的MoE版本好像也没到2.4T这个量级。
第二是实际推理成本。虽然只激活950亿,但你得把2.4T的参数全加载到显存里。这对硬件要求极高。
所以名义上是开源了,但真正能跑起来的人其实不多?
没错,这就是MoE的尴尬——推理效率高,但部署门槛也高。你需要一堆卡把模型分片加载。
那从产品角度看,这种超大开源模型的意义到底是什么?秀肌肉?
不全是。它给了社区一个baseline——你知道这个规模的MoE能达到什么水平。而且总有人会想办法量化压缩,慢慢就能跑在更少的卡上。
另外阿里的Qwen系列一直在中文任务上有优势,这个大模型对中文生态价值很大。
行,那我们聊聊另一个热点——Grok Bot。xAI正式推出了,HN和Reddit都在讨论。
对,x.ai/bot这个页面上线了。简单说就是Grok以bot形式对外开放,可以集成到各种场景里。
Reddit上Google Gemini的子版块里有个帖子标题特别直白——Even Grok is competing。语气里带着点焦虑。
能理解。之前大家觉得Grok就是X平台上的一个附属品,现在它正式作为独立产品出来抢市场了。
HN上一百多条评论,大家怎么看?
两极分化。一派觉得xAI有Musk的资源和算力,不能小看。另一派觉得Grok到现在也没证明过自己在哪个维度能打赢GPT-5或Claude Fable 5。
我比较好奇的是,Grok Bot的定位是什么?它是要跟ChatGPT正面硬刚,还是走差异化?
从目前的信息看,它强调的是实时信息获取——毕竟背后有X平台的数据。这是它相对于其他模型的独特优势。
但实时信息这个卖点,Google Gemini也有搜索加持,感觉不算独家。
你说得对,单靠这一点确实不够。不过Musk的策略可能是先铺开用户量,bot形式降低了接入门槛。
而且你想,现在模型层面已经到了一个群雄混战的阶段。OpenAI、Anthropic、Google、Meta、阿里、xAI,每家都在使劲。
确实,今天这两个话题放一起看特别有意思——阿里在开源侧砸超大模型,xAI在产品侧推Bot。大家都在找自己的生态位。
而且这两件事说明一个趋势——2026年下半年,竞争重心在从模型能力转向分发方式。模型够强了,关键是怎么让更多人用起来。
不管是Matt Pocock的AFK agent、Qwen的超大开源模型、还是Grok Bot,本质都是在降低AI能力的使用门槛。
没错,能力民主化这件事,今年明显加速了。
好,今天就聊到这儿。李博,晚上见。
晚上见,小雨。
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿Claude Slack智能体升级:多人协作、主动响应与持久记忆全解析
Anthropic为Claude推出Slack集成重大升级,新增多人协作、主动响应和持久记忆三大核心能力,将AI从被动问答工具转变为真正的团队协作伙伴,重新定义企业级AI智能体应用标准。