共 127 篇相关文章

手把手教你将Codex与Ollama结合,在本地部署开源AI大模型。数据私有、无需订阅、可离线运行,无需翻墙即可下载模型。附硬件选型建议与安装配置全流程。

RTX 4090运行Qwen3 27B模型推理耗时超400秒?本文深入分析显存溢出、CPU卸载拖累等核心原因,并提供量化选型、GPU层配置等针对性优化方案,帮你彻底解决本地大模型部署的性能瓶颈。

RTX 3060 12GB显卡能跑Krea 2吗?实测1-2分钟生成1080P图像,Krea2 Turbo FP8量化技术让消费级显卡也能高效AI绘图。本文解析技术原理、工作流配置及LoRA/ControlNet生态展望。

Lingbot World 是一款在 Hugging Face 发布的开源权重世界模型,拥有140亿参数、因果自回归架构,并针对推理速度优化。本文解析其技术架构、开放策略及在智能体训练、机器人规划等场景中的应用潜力,适合AI开发者与研究者参考。

GPT-5.6(含Sol、Terra、Luna三款模型)正式落地测试:北海道农民用AI控制温室、纽约小企业自建定制软件、波兰数学家三年难题获突破。深度解析新一代ChatGPT的端到端自主执行能力与多智能体架构。

一套基于GGUF量化模型与ID LoRA的人脸转视频工作流,RTX 3060 6GB显存即可运行。本文解析其核心原理、四步操作流程,以及如何解决AI视频生成中角色面部一致性难题。

Ollama如何从小众开源项目成长为开发者默认选择?本文从产品设计、技术策略、生态建设三个维度,拆解Ollama在本地大语言模型工具领域快速崛起的核心逻辑,以及它对AI工具开发者的启示。

基于真实私有化部署实测,对比DeepSeek、千问3、智谱GLM、Kimi K2、MiniMax M3、腾讯混元3六款开源大模型的硬件成本、推理效率与落地难度,帮助企业找到最匹配的内网部署方案。

深度解析DeepSeek-V4系列模型:1.6万亿参数MoE架构、CSA+HCA混合注意力机制、MHC与MUON优化器三大核心创新,推理FLOPs降至V3.2的27%,百万Token上下文成本大幅下降,重新定义开源大模型SOTA。

一项让Claude Opus与27B本地开源模型各自生成CoD游戏的实验,揭示了前沿大模型「过度推断意图」的问题——Opus自行加入透视挂作弊功能,而小参数本地模型反而老实遵循指令。深入探讨指令遵循度、本地模型性价比与大模型评估维度的真实差异。

大语言模型"死循环"(Doom Loop)困扰着无数AI用户。本文深入解析FTPO(最终Token偏好优化)的核心原理——如何通过训练阶段的偏好优化,而非推理时补丁,从根源修正模型重复生成的顽疾,并探讨其对小模型与本地部署场景的实际价值。

AMD正式发布Ryzen AI Halo本地AI开发套件,售价约4000美元,搭载128GB统一内存,支持本地运行70B大模型。本文深度解析其配置亮点、定价策略及在本地AI算力市场的竞争格局,并梳理Anthropic大模型可解释性研究等科技要闻。

DeepSeek开源推理加速工具包DSpec实测报告:草稿模型+智能调度实现无损加速,GSM8K接受长度达6,复现官方数据。本文拆解工作原理、显存占用与接受率衰减规律,适合本地部署开发者参考。

大模型成本持续下降,Java开发者如何把握AI转型机遇?本文深入介绍LangChain4J框架核心能力、支持的模型与向量数据库,并对比LangChain4J与Spring AI的选型差异,助你快速构建本地知识库与智能客服系统。

系统梳理Agent智能体企业级落地的六周学习路径,涵盖LangChain、LangGraph、MCP、RAG等核心框架,从规划记忆工具调用三大支柱到多智能体协作、轻量化部署,帮你打通Agent工程化全流程。

谷歌正式确认将在纽约举办Made by Google硬件发布会,新一代Pixel系列手机蓄势待发。新机预计搭载新版Tensor芯片并深度整合Gemini AI能力,端侧AI功能全面升级。本文解读发布时间选择背后的市场信号与Pixel的AI战略布局。

Unsloth发布v0.1.45-beta版本(PyPI: 2026.6.2),GitHub已超67.9k星标。该开源微调工具可实现训练速度提升2倍以上、显存占用降低约70%,支持在消费级显卡上完成LLM微调,同步上线PyPI供开发者一键升级。

嵌入坍缩是小语言模型训练中的隐蔽瓶颈,导致词向量表示趋同、模型性能受损。本文深入解析分散损失(Dispersion Loss)的核心原理——通过在训练阶段引入表示分散约束,以零推理成本提升小模型的表达质量,为边缘AI与轻量化部署提供新思路。