共 12 篇相关文章

Unsloth v0.1.45-beta正式发布,带来Gemma 4多token预测(MTP)完整支持、AMD ROCm与NVIDIA Blackwell硬件适配、全新Hub下载管理器与紧凑型RAG系统,助力本地大模型微调与推理提速。

Unsloth最新版本v0.1.464-beta新增DiffusionGemma、Gemma 4 MTP和MiniMax-M3支持,推理速度提升约2倍。同时带来全新Hub页面、文档RAG问答、张量并行优化及Cloudflare加密隧道,覆盖CUDA/ROCm/Windows全平台。

DeepSeek联合北京大学开源推理加速技术DSpark,在高并发场景下单用户生成速度提升57%~85%。本文详解DSpark三大核心设计:半自回归草稿、置信度评分与自适应调度器,以及配套开源框架DSpec的完整内容。

一张二手RTX 3090,一个16.8GB的GGUF文件,Qwen3.6 27B即可本地离线运行。SWE-bench得分77分媲美Claude Sonnet,MTP技术让推理速度提升至59 token/s。无订阅、无云端、数据不出门,本地AI编程助手完整部署指南。

一周内OpenAI、xAI、谷歌、微软四大AI厂商同时降价,近前沿推理成本大幅下探;微软Copilot在4.5亿席位中付费转化率不足4.5%,揭示通用AI助手的变现困境。本文梳理GPT-5.6、Grok 4.5、Gemini延期、DeepSeek API退役等关键事件及开发者应对策略。

DeepSeek联合北京大学发布DS Spark论文,通过置信度调度与半自回归投机解码,在不改变模型和GPU的前提下,将AI推理速度提升最高85%。深度解析这场"赌场式"推理革命的三大核心技术。
大佬观点·第1期:AI工具公司卷大模型,基准造假危机
每周五盘点本周行业大佬的发言和官方公告

Unsloth最新版本一次性带来GLM-5.2全推理级别支持、3倍长上下文能力(单卡q4_0可达20万token)、全新Model Hub及Chat Canvas交互功能,大幅提升本地大模型微调与推理体验。

深度解析Qwen3.6两款社区衍生模型:27B扩展至34B 80层提升推理与蒸馏能力,35B MoE压缩至14B实现8GB显卡本地部署。涵盖REAP剪枝策略、MoE专家冗余现象及选择建议。
教程攻略详解llama.cpp如何启用MTP多Token预测加速技术,涵盖CUDA环境配置、桌面端设置、模型选择及实测性能数据,Qwen3 27B实测近60 Token/s。
教程攻略使用oMLX推理引擎结合MTP多令牌预测技术和Qwen3.6 35B模型,在Apple Silicon Mac上实现86.7 tokens/s的本地编程速度,5分钟内完成全栈应用开发的完整实战解析。
教程攻略实测DeepSeek V4 Flash开启MTP推测解码后的性能表现:代码生成场景提速约20%,文本生成提升有限。详解内存开销、准确性差异、Q4与Q3量化对比,以及通过Inference应用和OpenAI兼容API的完整部署教程。