共 245 篇相关文章

Miles团队联合AMD官方宣布,DeepSeek-V4 Flash强化学习训练完整迁移至AMD Instinct MI355X GPU,基于ROCm平台实现端到端稳定运行,AIME数学推理基准pass@1从0.39提升至0.49,标志着大模型训练算力生态多元化的重要突破。

深度解析DeepSeek-V4系列模型:1.6万亿参数MoE架构、CSA+HCA混合注意力机制、MHC与MUON优化器三大核心创新,推理FLOPs降至V3.2的27%,百万Token上下文成本大幅下降,重新定义开源大模型SOTA。

Unsloth v0.1.481-beta正式发布,新增DeepSeek-V4-Flash完整支持、NVFP4/FP8/imatrix GGUF多格式量化导出,GRPO训练提速1.3倍,MoE训练加速3-5倍,Studio升级为OpenAI兼容API服务系统,覆盖微调、导出、推理全链路。

Unsloth v0.1.48-beta版本发布,新增NVFP4/FP8量化导出、OpenAI兼容API热切换、MoE训练提速3-5倍、GRPO提速1.3倍,全面覆盖大模型微调、量化与本地部署全链路。
产品体验GPT-5.5与DeepSeek-V4四轮全方位实测对比,涵盖世界知识、上下文记忆、逻辑推理和编程开发,详解两大旗舰AI模型的真实表现差异与各自优劣势。
教程攻略详细介绍如何将DeepSeek-V4接入Claude Code的完整配置流程,包括Node.js安装、环境变量配置、模型映射设置及实战编码能力测试,帮助开发者用开源模型获得接近顶级商业模型的AI编程体验。

深度分析国内用户使用ChatGPT面临的注册、访问障碍,客观评估第三方镜像聚合平台的真实风险,并提供官方API自建、国产大模型等更安全可靠的替代方案。

Cursor推出面向印度市场的Start套餐,月费仅₹649(约55元人民币),包含Grok 4.5和Composer Agent能力。深度解析这一购买力平价定价策略背后的市场逻辑与行业影响。

深入解析Spring AI框架的核心特性,包括提供商无关的统一API抽象、RAG检索增强生成、结构化输出等能力,帮助Java开发者快速构建企业级AI应用。

深度解析Kimi K3模型:3万亿参数的最大开源权重模型,在Agentic编码领域超越Opus级模型,采用896专家MoE架构支持100万token上下文,以Sonnet价格提供前沿性能,重新定义开源与闭源差距。

Thinking Machines发布Inkling开源多模态大模型,近万亿参数MoE架构,100万tokens上下文窗口,Apache 2.0协议开源。本文深度解析其技术架构、基准表现、实测体验与定价策略。

Colibri开源项目通过MoE冷热分离架构和4-bit量化,实现在消费级硬件上运行GLM 5.2等千亿参数大模型。本文详解其三级内存架构、专家按需加载和投机解码等核心技术原理。

月之暗面Kimi K3正式接入Telnyx Inference API,开发者可通过统一接口调用Kimi K3的长上下文与中文理解能力。本文解析Kimi K3技术定位、Telnyx推理平台价值及中国大模型出海趋势。

Ollama紧急扩容迎接万亿参数级开源模型,Kimi K3、Qwen 3.8等即将开源。同期Hugging Face向OpenAI提出1亿美元安全补偿,阿里Coder移动端上线,DeepSeek暂停融资。一文梳理开源大模型生态最新动态。

解读DeepSeek创始人梁文峰罕见对话记录,深入分析DeepSeek以愿景驱动团队、战略克制聚焦AGI、坚持开源的核心哲学,以及这套理念对中美AI竞争格局的深层意义。

中国开源模型如Kimi K3、DeepSeek以极低价格逼近美国闭源模型性能,本文深度分析从性能收敛到价格竞争再到估值重估的传导链条,拆解美国AI泡沫的真正来源与三个关键跟踪信号。

英伟达CEO黄仁勋公开为AI开源模型辩护,称知识蒸馏是合法学习方式而非抄袭,高度评价DeepSeek和Kimi等中国模型。联合微软、Meta等20多家企业发公开信支持开源AI,OpenAI和谷歌缺席。深度解析黄仁勋力挺开源背后的技术信念与商业逻辑。

OpenRouter数据显示中国AI模型已占美国AI消费量58%。DoorDash、Airbnb等硅谷巨头纷纷采用Kimi、DeepSeek、通义千问等中国开源大模型,凭借低价高性能和开源权重优势快速渗透全球市场。