腾讯混元HY3正式版开源:300B以下最强,1元/百万tokens

腾讯混元HY3正式版发布并开源
继4月发布HY3预览版之后,腾讯混元团队正式推出并开源了HY3正式版。此次正式版并非简单的版本迭代,而是在预览版基础上经过系统性后训练优化(Post-training)后推出的成熟产品。
所谓后训练,是指在完成海量数据预训练之后,通过指令微调(SFT)、基于人类反馈的强化学习(RLHF)以及直接偏好优化(DPO)等手段,让模型在不改变底层架构的前提下,在特定能力维度上实现针对性提升。后训练技术的演进轨迹可追溯至2022年OpenAI发布InstructGPT的里程碑论文。在此之前,大型语言模型虽然拥有强大的文本生成能力,却常常输出有害、虚假或与用户意图偏离的内容——这被称为「对齐问题」(Alignment Problem)。InstructGPT首次系统性地将RLHF引入大模型后训练,证明了通过人类反馈可以显著提升模型的有用性与安全性,由此开创了现代对话大模型的技术范式。
值得注意的是,这三个阶段各有侧重,且存在内在的技术逻辑递进关系:**SFT(监督微调)**使用高质量的人工标注问答对让模型学会「照着做」,通常需要数千至数万条精心筛选的示范数据,数据质量远比数量重要;RLHF通过训练奖励模型来模拟人类评判者,再用强化学习优化策略——其核心挑战在于奖励模型本身可能被「钻空子」(Reward Hacking),即模型学会了欺骗奖励模型而非真正改善输出质量,这一现象在强化学习文献中被称为「古德哈特定律」(Goodhart's Law)的体现;DPO则是RLHF的简化替代——由斯坦福团队于2023年提出,其核心洞见是将强化学习目标直接转化为对偏好数据的监督学习,从根本上绕过了奖励模型训练不稳定的问题,直接在偏好数据对(一个更优回答与一个较差回答的配对)上优化,省去了独立训练奖励模型的步骤,更加稳定高效,迅速成为业界广泛采用的对齐方案。在DPO之后,SimPO、ORPO等变体进一步简化了参考模型的依赖,使对齐训练的工程成本持续下降。这套组合拳也是当前主流大模型厂商提升模型「对齐」质量和实用性的核心方法论。经过这一系统性后训练流程,HY3正式版在多个核心领域实现了显著提升。
从官方公布的基准测试数据来看,混元HY3正式版在智能体(Agent)、推理、编码以及长上下文处理等关键领域的进步尤为突出。大模型语境下的「智能体」并非科幻小说中的自主AI,而是一种赋予模型「工具调用+多步规划」能力的工程范式。其核心架构通常包含四个组件:感知(接收任务描述和环境状态)、规划(将复杂任务分解为可执行子步骤)、行动(调用搜索引擎、代码解释器、数据库查询等外部工具)以及记忆(维护短期对话上下文和长期知识存储)。2023年由普林斯顿发布的ReAct框架率先将「推理」与「行动」交织融合,成为Agent领域的奠基性工作,此后OpenAI Function Calling、Anthropic Tool Use等官方API设计将Agent能力标准化。
值得一提的是,Agent能力的评估体系本身也在快速演进:早期以单步工具调用成功率为核心指标,如今业界更关注多跳推理链的稳定性(即模型在连续5步以上的规划中不发生「幻觉漂移」的能力)、工具调用的参数准确率(尤其是结构化JSON输出的格式合规率),以及在任务失败时的自我修正能力。WebArena、AgentBench等专项评估基准的兴起,正是对这一需求的直接回应。这几个方向正是当前大模型竞争最激烈、也最能体现实用价值的能力维度。对开发者而言,编码与智能体能力的增强意味着模型在真实生产环境中的落地潜力显著提升。

官方明确表示,HY3在大部分场景中优于参数规模相当的Deepseek V4 Flash,并在内部盲测中平均得分高于GLM系列模型。腾讯将其定位为「300B参数规模以下最强模型」,既是对自身产品力的自信表态,也折射出国产大模型在中等参数规模区间的激烈角逐。
极具竞争力的定价与开放策略
混元HY3正式版最值得关注的是其激进的成本策略。API定价为百万tokens输入1元、输出4元,在同类模型中极具竞争力。这一定价背后有其技术经济学逻辑:输出价格通常高于输入价格,是因为输出阶段需要进行自回归解码(每生成一个token都要完整跑一次前向推理),而输入阶段可以利用KV缓存(Key-Value Cache)机制对已处理的上下文进行复用,计算量相对较低。低廉的调用成本大幅降低了开发者的试错门槛,有助于推动模型在各类应用场景中的规模化落地。

目前,HY3已在WorkBuddy及腾讯元宝等平台面向用户免费开放体验,并以Apache 2.0协议正式开源。Apache 2.0是AI开源领域最受企业欢迎的许可证之一,与GPL等「传染性」协议截然不同——它允许任何人免费使用、修改和分发源代码,甚至可将修改后的版本用于闭源商业产品,而无需将衍生代码回馈开源社区。唯一的要求是保留原始版权声明并在文档中说明使用了该项目。
从AI开源许可证的竞争格局来看,Apache 2.0与MIT许可证并列为企业友好度最高的两种方案,区别在于Apache 2.0额外提供了专利授权条款——即原作者明确授权使用者在其专利权范围内使用该代码,这对大型企业的法务合规尤为关键。相比之下,Meta早期Llama 1使用了附加商业限制的自定义协议,引发社区批评;Llama 2和Llama 3逐步放开限制但仍保留月活用户超7亿须重新授权的条款,而Llama 3.1起改用接近完全开放的许可证,这一系列变化清晰展示了大厂在「开放性」与「生态控制权」之间动态博弈的轨迹。腾讯采用Apache 2.0协议,意味着创业公司、独立开发者乃至大型企业均可基于HY3构建商业产品,对国产开源生态的繁荣具有积极推动作用。
美团开源万亿参数模型LongCat 2.0
与腾讯同步发力,美团也正式开源了旗下万亿参数模型LongCat 2.0。该模型总参数量达1.6T,采用MoE(混合专家,Mixture of Experts)架构,平均激活参数约48B。
MoE架构是当前超大规模语言模型的主流设计范式之一,其现代形态可追溯至Google 2017年发表的「Outrageously Large Neural Networks」论文,真正引爆MoE时代的是2022年Google的Switch Transformer,证明了万亿参数规模的稀疏模型可以高效训练。其核心思想是将模型划分为多个「专家」子网络,每次推理时由一个轻量级的「路由器」(Router)动态选择少数几个专家参与计算,而非激活全部参数。
当前主流MoE实现中,路由机制主要分为两类:Top-K路由(每个Token选择K个专家,通常K=2)和Expert Choice路由(每个专家主动选择处理哪些Token)——前者是DeepSeek、Mixtral等模型的标准选择,后者在负载均衡上更有优势但实现更复杂。路由器本身通常是一个极轻量的线性层加Softmax,参数量极小,但其决策质量对整体模型性能影响深远:路由崩溃(Router Collapse)是训练早期的常见病症,表现为所有Token都被分配给同一个或少数几个专家,导致大多数专家「饿死」而得不到有效训练。为此,训练时通常需引入辅助负载均衡损失(Auxiliary Load Balancing Loss)和专家容量因子(Expert Capacity Factor)两种手段,前者通过梯度引导路由器分配均匀,后者则为每个专家设置Token处理上限,超出上限的Token将被丢弃或溢出处理。
这种稀疏激活机制使得模型可以拥有极大的总参数量(提升模型容量上限),但实际推理时只需调用其中一小部分参数(控制计算成本)。以LongCat 2.0为例,1.6T总参数中每次推理平均只激活约48B参数(激活比例约3%),计算量与一个普通的480亿参数稠密模型相当,却能享有万亿参数规模带来的更强知识表达能力,这与DeepSeek-V3的671B/37B配比代表了当前MoE设计追求容量与推理成本最优平衡的主流取向。
然而MoE并非没有代价:除路由不均衡问题外,在分布式推理时,不同专家可能分布在不同设备上,Token需要在设备间动态路由传输,这要求集群内进行大量的All-to-All通信(即每块GPU需要向其他所有GPU发送和接收数据)。All-to-All通信的带宽需求随专家数量和集群规模线性增长,对网络互联带宽要求极高——这也是NVLink高速互联在MoE部署场景中价值远超普通InfiniBand的核心原因之一。正因如此,GPT-4、Mistral、DeepSeek等采用类似设计的主流模型,在大规模部署时都面临非常高的工程门槛。

LongCat 2.0最具里程碑意义之处在于:它是业界首个在5万张国产算力卡集群上完成推理的万亿参数模型。自2022年10月美国商务部工业和安全局(BIS)发布出口管制规则,将英伟达A100、H100系列GPU纳入对华出口限制清单并持续升级管控力度以来,国产AI算力自主可控成为产业战略重点,华为昇腾910B、寒武纪MLU370等国产芯片迎来前所未有的需求。
然而,在这些芯片集群上稳定训练和推理超大规模模型面临巨大工程挑战。英伟达的CUDA平台历经20余年迭代,积累了超过4000个经过深度优化的算子库,cuDNN高度优化的算子库、NCCL高效集合通信框架、TensorRT推理加速引擎以及与PyTorch深度集成的开发体验——这套软件栈的成熟度是英伟达「护城河」的真正所在,远比芯片硬件本身更难复制。国产芯片厂商正以「CUDA兼容层」(如昇腾的CANN框架、天数智芯的CUDA-over-ILUVATAR方案)路径快速追赶,但算子覆盖率、编译器成熟度、自研通信框架稳定性与之仍有显著差距——尤其是在MoE模型所依赖的All-to-All通信优化方面,国产方案的成熟度更是面临重要考验。美团LongCat 2.0的成功,不仅是工程能力的有力证明,更对国产AI基础设施的自主可控具有重要示范价值。
美团还同步开源了基于国产卡的推理代码,使其他团队可以直接参考和复用这套经过大规模生产验证的工程方案——相当于为整个行业提供了一份「避坑指南」,可显著降低在国产硬件上迁移适配的成本与风险,对整个国产AI生态的协同发展意义深远。在编码和智能体场景中,LongCat 2.0同样展现出出色的表现。
阿里千问FoneASR实时语音识别重磅升级
阿里千问团队宣布,实时语音识别模型FoneASR Realtime迎来重要升级,新版本支持16种方言及30种语言,覆盖范围大幅扩展。

性能方面,该模型在16种方言测试中字符准确率达88%,首字延迟控制在百毫秒级别,流式识别准确率已接近离线识别水平。理解这一成果需要了解流式ASR技术的演进脉络:早期基于HMM-GMM的统计模型天然支持逐帧输出;2014年百度Deep Speech系列引入CTC损失函数,使端到端深度学习ASR成为主流——CTC通过引入空白符允许模型在对齐未知的情况下进行序列学习,支持贪心逐帧解码,流式特性出色,但无法利用右侧上下文信息;2019年前后,Attention编码器-解码器架构在准确率上全面超越CTC,但自回归解码机制带来较大延迟;为此业界提出了Chunk-based Attention(将音频切分为固定时间窗口分块处理)等方案,在延迟与准确率间取得平衡;当前最前沿的趋势是将LLM引入ASR后处理链路,利用语言模型强大的上下文理解能力纠正识别中间结果。
方言识别是ASR领域长期悬而未决的技术难题,根源在于数据稀缺性与语言内部差异的双重困境:普通话有海量标注语料支撑,但粤语、闽南语、吴语等方言的高质量标注数据量级往往相差两到三个数量级;更棘手的是,同一「方言」内部往往存在显著的地域变体(如粤语的广州腔与香港腔在声调和词汇上均有差异),这要求模型具备细粒度的方言内部泛化能力。近年来多语言预训练模型(如OpenAI Whisper在680000小时多语言数据上的预训练)为方言识别带来了新的解题思路——通过大规模多样化数据的联合训练,模型可以学到跨方言的共享声学特征表示,再结合方言特定的微调数据实现精准适配。FoneASR在16种方言上达到88%字符准确率,正是这一技术路线在中文方言场景的实战验证。
离线识别(Offline ASR)在用户说完整段话后才开始处理,可充分利用完整的前后文上下文,准确率较高;而流式识别(Streaming ASR)需要在用户说话的同时实时输出文字,对延迟极为敏感——流式ASR的核心矛盾在于,准确的识别需要足够的上下文,而实时输出又要求模型不能等待过多未来信息。「首字延迟」(Time to First Token,TTFT)是衡量流式ASR响应速度的核心指标,指从用户开口到屏幕上出现第一个识别字符的时间。百毫秒级别在人类感知上几乎是「即时」的(认知心理学研究表明,人类对约200ms以内的视听反馈延迟通常无明显感知,而超过300ms则会产生明显的「卡顿感」),这对实时字幕、同声传译、语音助手等场景至关重要。让流式识别准确率接近离线水平,正是业界长期攻克的技术难点,FoneASR的这一突破正是Chunk-based流式推理架构创新与高度优化的工程实践协同作用的成果。目前该模型的API已上线阿里云百炼平台,开发者可直接调用。
首届全球AI治理对话在日内瓦举行
技术竞逐之外,AI治理议题持续升温。据财联社报道,首届全球人工智能治理对话在瑞士日内瓦举行,约1500名来自世界各地的代表出席。
此次对话在全球AI治理体系建构的关键窗口期召开,背景值得关注。2023年英国布莱切利庄园AI安全峰会开创了大国政府就前沿AI风险进行正式对话的先例,中美均参与签署了《布莱切利宣言》;2024年首尔AI峰会进一步推进了「前沿AI安全」的国际共识构建;与此同时,欧盟《人工智能法案》(EU AI Act)于2024年正式生效,成为全球首部系统性AI监管立法,对高风险AI系统实施强制合规要求——该法案采用基于风险分级的监管框架,将AI系统分为不可接受风险(直接禁止)、高风险(严格合规义务)、有限风险(透明度要求)和最低风险(基本自由)四个等级,对全球AI产品出口欧洲市场产生深远影响。
此次为期两天的对话聚焦四大核心议题:人工智能的机遇与影响、能力建设与AI领域的鸿沟、安全可信的人工智能,以及人权与人类监督。「AI鸿沟」(AI Divide)议题的提出,折射出国际社会对AI红利分配不均的深层忧虑——发展中国家在算力基础设施、AI人才储备和数据资源方面与发达国家差距悬殊,存在技术加速拉大南北发展差距的风险。值得关注的是,这一担忧并非杞人忧天:根据斯坦福大学AI Index报告,全球AI私人投资高度集中于美国、中国和英国三国,其余国家合计占比不足20%,而算力基础设施的地理分布更为极端。日内瓦作为众多国际组织的总部所在地,选择在此举办首届全球AI治理对话,也具有鲜明的象征意义——将AI治理纳入与WTO、WHO、ILO并列的全球多边治理框架之中,意在赋予这一议题超越双边博弈的普遍性正当性。这些议题反映出全球社会对AI发展的共同关切——如何在拥抱技术红利的同时防范风险、弥合数字鸿沟并守护人类价值。
小结
从腾讯混元HY3经过系统性后训练优化后的高性价比开源,到美团LongCat 2.0凭借MoE架构在国产算力上实现的万亿参数突破,再到阿里千问在流式语音识别延迟与准确率上的双重突破,这一系列进展集中体现了国产大模型在能力、成本与自主可控三个维度上的协同推进。另一边,日内瓦的全球治理对话提醒我们:技术高速发展的背后,构建安全可信的AI体系同样不容忽视。国产开源力量正以前所未有的速度重塑全球AI格局。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。