Qwen
Qwen(通义千问)是阿里巴巴集团研发并开源的大语言模型系列,支持文本生成、对话、代码编写、多语言理解等多种自然语言处理任务。该系列涵盖不同参数规模的基础模型与对话微调版本,具备较强的中英文双语能力,可供研究人员和开发者进行下游任务微调与部署应用。
核心事实
时间轴 (近 90 天)
VQ 仓库默认配置针对 Qwen 架构,但作者称可快速适配到任意模型架构
运行Qwen、Llama等较大参数的开源模型通常需要足够的VRAM和高性能显卡
Khoj 兼容多种大模型,包括在线的 GPT、Claude、Gemini 及本地部署的 Llama、Qwen、Mistral
Qwen 系列和 DeepSeek 均提供了允许商业使用的宽松开源协议
近年来国产大模型的开源节奏明显加快,从阿里的 Qwen 系列到 DeepSeek 再到 Moonshot 的 Kimi K2
Gemma 是 Google 开源的轻量级模型系列,Llama 来自 Meta,Qwen 是阿里巴巴开源的中英双语模型
locally-uncensored 支持通过 Ollama 运行本地开源模型,包括 Gemma、Llama、Qwen 等
一款拟人化的 Qwen 模型在 Reddit 相关社区登顶并引发讨论
Qwen、DeepSeek、MiniMax、Gemma 以及基础版 Llama 通过提示词工程都能达到接近专门微调的拟人化效果
GQA是目前主流开源模型(Llama、Mistral、Qwen等系列)的标配设计
还有 40 条时间轴事件
全部知识事实 (20)
GPT-4和Mixtral等主流大模型也采用了MoE架构
85%已验证千问(Qwen)系列是阿里云通义实验室开发的开源大语言模型家族
80%已验证Meta于2023年发布LLaMA系列模型,随后Mistral、Qwen、DeepSeek等相继跟进形成开源生态
70%已验证Qwen(通义千问)是阿里巴巴开源的模型,在中文任务上表现优异
70%已验证Meta开源了Llama系列模型,阿里开源了Qwen系列,Mistral AI也采用开源策略
70%已验证当前开源大模型领域形成多极竞争格局,包括Meta的Llama、阿里巴巴的Qwen、Mistral AI和DeepSeek
65%已验证Qwen系列在架构层面引入了GQA(分组查询注意力)机制,相比标准多头注意力降低了KV缓存的内存占用
65%已验证Qwen系列采用Apache 2.0协议开放,允许商业使用和二次修改
65%已验证Meta的Llama 3系列、Mistral、Qwen、DeepSeek等模型在多项基准测试上已接近甚至超越早期的GPT-4水平,且支持本地部署
65%已验证Qwen 3.5架构使用改进的Transformer变体,融合了分组查询注意力(GQA)和旋转位置编码(RoPE)等技术
65%已验证Qwen是阿里巴巴达摩院开发的大语言模型系列,于2023年首次发布
65%待验证开源AI大模型阵营以Meta(Llama系列)、DeepSeek、Mistral、阿里(Qwen)等为代表
90%待验证千问(Qwen)和DeepSeek都提供了基于MOE架构的版本
90%待验证Open-source models such as Llama, Qwen, and DeepSeek have further compressed deployment costs
85%待验证Qwen系列模型已开源多个版本(Qwen-7B到Qwen-72B),在多项国际基准测试中表现优异
80%待验证千问(Qwen)系列模型在爱马仕Agent中基本正常运行
80%待验证2024-2025年间Llama 3、Qwen 2.5等开源模型在多项基准测试中已接近甚至匹敌闭源商业模型
75%待验证Llama.cpp supports dozens of mainstream open-source model architectures including Qwen, Mistral, Phi, and Gemma
60%待验证VQ 仓库默认配置针对 Qwen 架构,但作者称可快速适配到任意模型架构
50%待验证运行Qwen、Llama等较大参数的开源模型通常需要足够的VRAM和高性能显卡
50%