共 143 篇相关文章

深入拆解LLM大模型推理的成本构成与盈利模型,从GPU吞吐量、MoE架构、KV Cache到规模效应,算清推理服务每一笔账,揭示API价格战背后的商业逻辑与行业趋势。

Kimi K3将采用全新架构,参数量达2.5T,上下文窗口1M token。MiniMax M3 Pro参数预计2.7-3T。同期OpenAI用户破700万,HY-OCR 1.5开源拿下SOTA,高德发布世界模型。

Cursor推出面向印度市场的Start套餐,月费仅₹649(约55元人民币),包含Grok 4.5和Composer Agent能力。深度解析这一购买力平价定价策略背后的市场逻辑与行业影响。

Colibri开源项目通过MoE冷热分离架构和4-bit量化,实现在消费级硬件上运行GLM 5.2等千亿参数大模型。本文详解其三级内存架构、专家按需加载和投机解码等核心技术原理。

深入评测Poolside发布的Laguna S 2.1开源编程模型,解析其MoE架构、强化学习训练方法、DGX Spark本地部署技巧及实际编程能力测试,探讨80亿激活参数如何实现智能体编程。

DeepSeek V4正式版即将发布,V4 Pro版本参数量达1.6万亿,支持百万字上下文处理。本文解析D-SPARK推理加速框架、风骨定价策略及V4从对话工具到生产级应用的技术跃升。

谷歌正式推送升级版3.6 Flash与3.5 Flash-Lite模型,用户可通过网页端和移动应用直接切换体验。本文解析Flash系列轻量模型的定位、升级亮点及其对开发者和企业的实际价值。

AI从业者实测Opus 5:模型能力强大但推理速度过慢,点名Cerebras硬件加速方案。深度分析大模型竞争从智能比拼转向推理速度军备竞赛的行业趋势。

DeepSeek联合北京大学开源推理加速技术DSpark,在高并发场景下单用户生成速度提升57%~85%。本文详解DSpark三大核心设计:半自回归草稿、置信度评分与自适应调度器,以及配套开源框架DSpec的完整内容。

D-Flash通过快扩散并行草稿与目标特征KV注入,解决投机解码中自回归Drafter的延迟瓶颈。16个Token仅需6毫秒,HumanEval加速达3.5倍,全面超越EAGLE3和MTP方案。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

DeepSeek开源推测解码工具库DeepSpec,生产环境实测推理速度提升60-85%,吞吐量最高提升661%。集成三大算法、九个预训练Checkpoint与九个评测基准,三步即可上手,MIT协议免费商用。

面对美国芯片封锁与闭源垄断,中国AI开源模型凭何持续反击?本文深度拆解开源定价权博弈、光互联卡位、端侧场景三大核心路径,解析国产大模型韧性背后的真实逻辑。

Kimi、阿里千问、DeepSeek凭借MoE架构、本土数据优势与开源飞轮效应,以极低成本逼近OpenAI、Anthropic等闭源巨头。本文深度拆解国产开源大模型的追赶逻辑与商业哲学差异。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

前沿AI模型正加速走向通用化:成本大幅下降、通用模型在数学推理与竞赛编程中超越专用模型、小型编程任务趋近自动化、多智能体工作流持续进化。本文深度解析这些信号背后的技术逻辑与行业影响。

近期Reddit社区出现大量Gemini模型表现下滑的反馈,用户直呼"越来越难用"。本文深度解析AI模型退化的成因——从静默更新、安全对齐收紧到推理资源分配,并提供理性评估模型表现的实用方法。

小米悄然在Hugging Face上传MiMo-V2.5-DFlash权重,附带独立MTP模型,有望解决llama.cpp兼容问题,让300B超大模型本地推理速度翻倍。社区正期待GGUF量化转换。