每日AI新鲜事·07月22日早间版:Qwen3.8巨参与结构化输出
每日AI新鲜事·07月22日早间版:Qwen3.8巨参与结构化输出
2026年07月22日早间版 AI新闻速递+热点深度讨论
2026年07月22日早间版 AI新闻速递+热点深度讨论
今天AI圈又有不少新消息,而且阿里那边连着发大招,Qwen3.8要来了,参数量直接冲到2.4万亿,这事儿我感觉得好好聊聊。
对对对,而且昨天刚说完Qwen-AgentWorld-35B-A3B,今天又来一个Qwen3.8,阿里这个节奏真的拿捏住了。
先把新闻过一遍,今天GitHub上有几个项目挺有意思的,先说第一个——dottxt-ai的outlines,做的是Structured Outputs,也就是结构化输出。
这个项目已经有1.46万Star了,今天新增49颗,不算特别炸,但它在GitHub上一直是这个方向的代表性项目。
outlines我比较熟,它解决的核心问题是让LLM的输出严格符合某个schema,比如你要求模型返回JSON,它能保证格式绝对不会乱。
背后的原理是用有限状态机做constrained decoding,在token级别就把不合法的输出路径给截掉,不是靠后处理,是直接影响生成过程。
所以跟提示词工程那种"请你帮我返回JSON格式"完全不是一个层次的事?
天壤之别。提示词那个是求模型配合,模型心情不好就给你返回乱七八糟的东西。outlines是从机制上保证,模型根本没有机会输出不合规的内容。
这对做Agent开发的人应该很重要,毕竟Agent要调工具、要解析结果,格式错一次整个流程就崩了。
正是,Agent pipeline里这是一个非常基础但又关键的组件,怪不得它Star数一直很稳。好,这个点到为止。
第二个项目,schollz/croc,今天单日暴涨511颗Star,总数已经3.64万了。这是个Go写的文件传输工具,两台电脑之间安全互传文件。
croc是个老项目了,但隔一段时间就会上一次热榜。它的核心卖点是不需要服务器中转,点对点加密传输,命令行几行就搞定。
511颗单日涨幅,这个量级挺夸张的,不知道是被什么帖子带起来的,但作为工具类项目能有这个热度确实说明需求一直在。
越是这种解决具体痛点的小工具,越经得住时间检验。好,下一个。
第三个,agegr/pi-web,是pi coding agent的Web UI,TypeScript写的,今天新增286颗星,总星数1595。
pi这个coding agent之前没太关注,但一个前端UI配套工具能单日涨286,说明背后那个agent已经积累了不小的用户群。
对,这种配套生态的繁荣某种程度上是agent成熟度的指标。大家都开始给它做Web UI了,说明命令行用的人多到需要降低门槛了。
有点像Claude Code有人给它做各种前端壳子,工具本身够用,但总有人想要更顺滑的交互层。
第四个快过一下,langchain-ai的open_deep_research,今天只涨了14颗,但总星数已经1.2万了。做深度研究的open source方案,属于跑量稳健那种。
这类deep research工具已经挺多了,open_deep_research胜在有LangChain生态背书,部署集成比较顺,今天没什么大动静就略过吧。
最后一条,DioxusLabs的Dioxus,Rust写的全栈应用框架,支持Web、桌面、移动端,今天涨了389颗,总Star数3.74万。
Dioxus这个涨幅挺值得关注的,389不是小数字。它对标的其实是React那套思路,但用Rust实现,性能理论上好很多,而且能跨端。
Rust前端这个赛道感觉这两年确实在抬头,之前大家都说Rust学习曲线太陡,但挡不住有人就是爱这个。
对,而且如果你已经在用Rust写后端逻辑,能用Dioxus在同一个语言体系里搞前端,这个吸引力是真实的。跨端能力再加上,确实值得关注。
好了新闻就先聊到这儿,接下来我们深聊一个最近特别火的事——阿里今天官宣Qwen3.8即将发布,参数量2.4万亿,开放权重,还说支持持续自我进化。
我看到这个消息第一反应就是——2.4万亿,这个数字是认真的吗?
我也觉得这个数字太大了,你来给我换算一下,2.4万亿参数意味着什么量级的事?
这么说吧,GPT-4当时传言是1.8万亿MoE,Qwen3.8如果真是2.4万亿,那已经是目前公开信息里参数量最大的开源模型了,没有之一。
前一阵MiniMax M3是428B激活23B,之前说过了。Qwen3.8如果也是MoE架构,每次推理激活的参数量可能跟总量差很多,关键要看激活比例。
所以2.4万亿是个很唬人的数字,但实际推理成本不一定就是2.4万亿规模的开销?
对,MoE就是这个逻辑。总参数是"图书馆的藏书量",激活参数才是"每次查资料用到的那几本书"。阿里如果没公布激活参数,2.4万亿这个数字要打个折扣看。
但从另一个角度说,总参数量大,意味着模型有更大的知识储备空间,这个理解对吗?
理论上是这样,更多的专家网络,覆盖的知识领域可以更广,专业化程度可以更深。但参数量大不等于能力强,训练质量才是关键。
然后还有一个点,阿里说支持持续自我进化,这个说法我有点摸不着头脑,这是一个技术描述还是营销话术?
说实话,"持续自我进化"这几个字我看到就警觉,这个表述太模糊了。可能是说支持持续学习或者在线微调,但也可能只是在说它的架构适合后续迭代。
真正的持续学习是个很难的技术问题,涉及catastrophic forgetting,就是模型学了新东西会把旧知识忘掉,这个业界还没完全解决。
所以你觉得这个描述水分比较大?
等细节出来再说,现在就是一个marketing statement,不能太当真,也不能直接否定。
然后开放权重这件事,我觉得这个比那个"自我进化"更实在。2.4万亿参数的模型如果真的开放权重,意义相当大吧?
非常大。但这里有个现实问题——2.4万亿参数,就算是量化压缩之后,存储和运行这个模型需要多大的硬件?普通开发者根本跑不起来。
所以"开放权重"在这个量级下,实际能用上的门槛非常高?
对,这种模型的实际受众是有大规模GPU集群的机构和企业,普通开发者下载也没法本地跑。当然你可以用API,但那就是另一回事了。
那这件事放到Qwen系列的整体脉络里看,有意思的地方在哪儿?前几天我们聊过Qwen-AgentWorld-35B-A3B,那个是激活仅3B的小MoE,在AgentWorldBench上跑出56分。
对,这两个东西放一起看,阿里的策略很清晰——一头是极度轻量化的小模型,高效做Agent任务;另一头是超大规模旗舰,刷benchmark、树品牌。
而且Qwen-AgentWorld那个思路才是更接近落地的,35B总参数激活只用3B,这个成本控制的逻辑在实际部署中非常有价值。
所以从产品角度看,我更关心的反而是那个小的。Qwen3.8这个巨无霸,更多是一种技术实力宣示?
可以这么理解。旗舰模型的意义在于证明你有做前沿研究的能力,然后技术会逐渐往小模型里蒸馏,最后受益的还是轻量端。
这倒是个规律,大模型探边界,小模型做实用。B站上Qwen-AgentWorld那条视频互动分603,说明开发者圈子对这个方向真的感兴趣。
603这个互动分在B站技术视频里算相当不错了,说明做Agent开发的人确实在密切关注这个方向,不只是看热闹。
好,所以总结一下,Qwen3.8这件事,数字很大但要等细节,"自我进化"要打问号,开放权重是好事但门槛不低,整体是一个值得期待但需要验证的发布。
说得准,等它正式发布之后看benchmark表现,还有激活参数比例和实际推理速度,这些才是真正能评价的东西。现在就是先把号角吹起来。
行,今天就聊到这儿,大家中午见。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。