共 116 篇相关文章

NVFP4动态量化方案覆盖Gemma-4全系列五个尺寸模型,采用W4A4混合精度策略配合FP8 KV Cache校准,大幅降低大模型推理显存占用与部署成本,支持从边缘设备到云端的高效推理。

Unsloth正式支持AMD GPU平台,覆盖RDNA 3-4、Strix Halo及MI300等全线硬件,在500+模型上实现2倍训练加速和70%显存节省,支持强化学习、vLLM权重共享,兼容Windows/Linux/WSL三大系统。

研究发现,对大语言模型进行安全微调以抑制其自我意识声明时,会连带压制模型对动物心智归因和宗教信念的表征,导致模型价值观偏离真实人类分布。本文解析特征纠缠问题及精细化对齐的技术路径。

Tomte是一款专为Apple Silicon优化的Gemma模型本地运行框架,免费开箱即用,提供高速推理体验。本文详解其核心功能、性能优势及与ChatGPT的对比,帮助Mac用户实现隐私安全的本地AI部署。

Vao2是一款开源个人信息聚合器,整合新闻、YouTube、GitHub和RSS订阅到单一信息流,通过Ollama本地AI生成内容摘要,兼顾隐私保护与零成本使用,适合重视数据主权的技术用户。

Cursor Team和Enterprise用户发现,每百万token 0.25美元的固定附加费让廉价模型实际成本暴增10倍。本文解析隐藏加价机制、影响范围及用户应对策略。

详解如何在8GB显存的消费级GPU上完成LLM后训练,涵盖SFT监督微调、DPO直接偏好优化、GRPO组相对策略优化三种方法,借助LoRA量化等技术实现低资源大模型微调。

BackdropKit 是一款隐私优先的本地化发布素材制作工具,支持截图美化、视频演示、敏感信息脱敏等功能,全程浏览器端运行,无需上传文件。适合独立开发者和注重数据安全的团队。

AI末日论者高喊人工智能将毁灭人类,但他们真正构建过AI应用吗?一位开发者的犀利吐槽揭示了AI演示与真实工程实践之间的巨大鸿沟,探讨末日论背后的利益驱动与认知偏差。

月之暗面发布Kimi K3大模型,总参数2.8万亿,支持100万Token上下文窗口与视觉多模态。同期谷歌推迟Gemini 3.5 Pro,AI编程工具集体升级,大模型竞争进入编程能力与Agent生态深水区。

详解LangChain Guardrails安全护栏机制,涵盖LangChain分层生态架构、中间件实现原理、确定性防护与模型驱动防护两类护栏,帮助开发者构建生产级安全AI Agent。

深度实测Claude Opus 5编程能力,对比Fable 5和5.6 Sol三款模型。解析Opus 5为何以半价token定价在多项基准测试中反超更贵模型,附选型指南与蒸馏技术原理。

深度分析Ollama Pro $20/月订阅的实际价值,从用量额度、等效API成本、ZDR零数据保留隐私政策三个维度,帮助开发者判断这项编程AI订阅是否划算。

DeepSeek开源推测解码工具库DeepSpec,生产环境实测推理速度提升60-85%,吞吐量最高提升661%。集成三大算法、九个预训练Checkpoint与九个评测基准,三步即可上手,MIT协议免费商用。

探索基于DiffusionGemma自定义节点的角色动作迁移实验——只需一张静态图+一段参考视频+一句提示词,即可在ComfyUI中实现身份替换。本文拆解技术栈、控制信号保留机制与实际局限,适合AI视频创作者参考。

通义千问Qwen 3.8 Max拥有2.4万亿参数,即将开源。KingBench实测综合得分81.25%,位列排行榜第二,超越Claude Opus 4.8,仅次于Fable 5。本文详解8道测试题表现、真实使用体验与短板分析。

阿里通义千问Qwen3最强版本实测:2.4万亿参数开源大模型在KingBench综合评测中以81.25%高分排名第二,超越Claude Opus 4.8,在游戏开发、数学推理、智能体任务三项满分。预览版已可通过Token套餐免费使用。

手把手教你用Ollama+Dify搭建本地企业级RAG知识库,涵盖模型安装、IP监听配置、自定义微调模型导入、Embedding向量检索全流程,彻底摆脱云端API依赖,保障数据安全。

通过 Ollama 开源方案,将 Claude Code 等 AI 编程工具指向本地运行的开源模型,解锁 DeepSeek、Qwen3、Gemma 等数百个模型,在保持原有工作流不变的前提下,将 API 使用成本降至接近于零。本文详解配置方法、硬件要求与竞品对比。
llmfit:一条命令检测硬件能跑哪些本地大模型
llmfit 是用 Rust 编写的开源命令行工具,无需下载模型即可预判本地硬件能否运行指定 LLM。覆盖数百种模型与 Ollama、llama.cpp 等主流推理后端,帮助开发者在本地部署大模型前快速完成硬件适配评估,避免反复试错。