共 96 篇相关文章

开发者开源动态量化方法 Voodoo Dynamic Quant,采用 MIT 协议。它用梯度下降优化 GGUF 模型的逐张量量化布局,在激进低比特档位优于 Unsloth Dynamic 3.0,为低显存本地部署提供新工具。
Portable Computer登陆Windows:RTX GPU本地跑A…
Portable Computer现已支持搭载NVIDIA RTX GPU的Windows PC,可在本地运行AI harness、agents和模型,无需上传云端即可处理本地文件与连接应用,并在需要时调用前沿云端模型。

本地LLM硬件多久能回本?Hacker News热门工具Sunk Cost帮你量化自建大模型设备与云端API的成本对比,深入分析回本周期的关键变量与隐性因素。

K2 Horizon 7B 在 Artificial Analysis 智能指数上排名介于 Qwen 3.6 27B 与 35BA3b 之间,用 70 亿参数逼近数倍体量模型的表现,成为本地部署用户的高性价比选择。

从Anthropic Opus迁移35KB长提示词到自托管Ollama的实战踩坑笔记:上下文窗口截断、模型能力差异、提示模板兼容性等关键问题及迁移检查清单。

Reddit社区发起"智能权"倡议,呼吁保护个人在本地运行AI的权利。在AI安全监管升级的背景下,开源模型可能成为牺牲品,本文剖析本地AI为何关乎隐私、自主与技术民主化。

一位Reddit用户用约3000美元自建128GB显存、256GB内存的本地AI推理服务器,采用4张V620显卡加EPYC平台,实测运行Qwen3-Next-Flash可达70 tokens/s。本文拆解硬件清单、功耗与性能表现。

如何在不额外消耗大量显存的前提下检测本地大模型的幻觉?本文基于1.5B到120B模型的实测经验,解析置信度、自洽性、轻量校验等低开销检测思路,为本地LLM部署者提供实用参考。

开源项目 claude-code-local 让 Claude Code 100% 本地离线运行于 Apple Silicon,基于 MLX 支持 Qwen 3.5 122B 等模型,65 tok/s 推理速度,专为 NDA、法律、医疗等隐私敏感工作流打造。

locally-uncensored 是一款本地 AI 桌面应用,集成聊天、Agent 模式、图像与视频生成,支持 Ollama、Gemma、Llama、Qwen 及 OpenAI、Anthropic,单 exe 运行无需 Docker。

有人在2020年16GB M1 Mac Mini上运行DeepSeek v4.1 Flash,每个token耗时约23秒。本文分析这一现象背后的内存瓶颈与算力限制,并给出在旧Mac上本地部署大模型的实用建议。
教程攻略详细介绍Hermes Agent本地部署完整流程,涵盖Windows环境下WSL2安装、Git配置、DeepSeek模型接入等步骤,帮助你快速搭建具备自学习能力的开源AI Agent助手。
教程攻略详解如何用本地部署的AI Agent实现全自动发票报销流程,涵盖OCR识别、信息提取、报销单生成等环节,包含硬件配置方案、软件栈选择(MinerU+Qwen3+千问Po)及保密场景下的完整落地思路。
教程攻略详解Ollama本地大模型管理工具的核心功能与特点,包括免费开源、跨平台支持、智能GPU/CPU调度、API集成等能力,帮助你零成本在本地运行DeepSeek等开源大模型。
教程攻略详解OpenClaw(小龙虾)本地部署全流程,涵盖Windows安装、云部署、微信/飞书/钉钉多平台接入及自定义Skills编写,零基础用户10分钟即可完成部署上手。
教程攻略详细介绍如何使用Ollama在本地电脑部署大语言模型,涵盖下载安装、模型选择、一键部署到对话的完整流程,无需编程基础,支持离线运行且完全免费。
教程攻略详解如何借助DeepSeek大模型将ASR本地AI项目启动脚本从倒计时模式改写为基于输出内容的智能判断模式,解决启动时机不准确的痛点,附完整操作步骤与常见问题排查。
教程攻略详解如何用Ollama本地部署Gemma 4模型运行Codex,实现零成本AI编程。涵盖安装配置、模型选择、实际效果演示,替代每月20-200美元的付费方案,适合独立开发者和预算有限的团队。