共 93 篇相关文章

详解如何在Cursor中接入第三方AI模型,包括Fireworks.ai、OpenRouter等平台配置方法,通过自定义OpenAI兼容端点实现模型自由切换,降低成本并避免厂商锁定。

详细讲解如何从零搭建本地无审查AI模型,涵盖硬件要求、Ollama安装、text-generation-webui配置、模型量化格式选择及abliteration技术原理,助你完全离线运行大语言模型。

智谱AI正式确认神秘模型Ox Alpha即GLM 5.3 Flash,并宣布公开发布模型权重。本文解析GLM 5.3 Flash的Flash定位、开放权重战略意义,以及对开发者和开源大模型生态的深远影响。

深入分析AI商业模型中隐藏的"对齐税"成本:安全护栏带来的token开销、误拒导致的认知产出退化、模型漂移的隐性损失,以及自托管开放模型作为替代方案的经济账。帮助企业量化并管理这笔被忽视的AI预算黑洞。

加州大学伯克利分校开源FreeToken推理系统,利用MoE架构稀疏性实现753B参数模型单卡运行。本文解析其分层调度原理、三档硬件实测结果及关键性能限制,帮助本地部署从业者重新评估硬件需求。

Gotcha是全球首个安卓端AI语音副驾开源项目,支持端侧运行保护隐私,内置100+原生设备工具,通过Samosa AIR引擎实现语音指令到设备操作的完整闭环,免费开源可定制扩展。

详细讲解Ollama本地部署大模型的完整流程,包括安装配置、模型下载管理、上下文长度调优实测,以及接入DeepSeek Harness等智能体工具的方法,帮助新手零成本运行本地AI大模型。

本地部署AI Agent速度慢、频繁超时?本文从Agent框架隐藏开销、硬件瓶颈出发,提供精简配置、轻量工具选择、模型量化等针对性优化方案,并介绍通过Telegram Bot远程交互的实用技巧。

Unsloth Desktop发布重大更新,新增实验性自动压缩功能解决长对话上下文管理难题,支持LAN与远程访问,合并超200个PR提升性能体验。详解混合RAG压缩策略与本地大模型部署新能力。

Anthropic发布Opus 5模型,核心亮点是跨领域Token效率显著提升,同时智能水平再创新高。在编程任务中表现出色,响应更快、成本更低,标志着大模型竞争进入效率优化新阶段。

8月22日AI行业动态汇总:ZCode赠送1亿GLM Token、OpenAI GPT API降价超20%、DeepSeek多模态模型上线、Kimi AI同事Mira入驻飞书、GPT Image 2支持透明背景,AI竞争进入价格战与多模态能力竞赛新阶段。

深入分析Google Colab训练AI模型的真实能力边界,涵盖免费版与Pro版GPU差异、模型规模上限、LoRA微调实践,以及本地+云端协作工作流的优劣与实战建议。

实测Qwen3 27B开源模型在单张RTX 3090上的表现,涵盖推理速度、Agent能力、多模态视觉及工具调用等维度,对比DeepSeek V-Flash等闭源模型,解析其性价比优势与本地部署方案。

EMNLP 2026录用通知即将发布,本文深入分析NLP顶会同行评审机制、大模型时代研究热点迁移,以及学术社区的集体等待现象,为NLP研究者提供投稿建议与趋势参考。

系统梳理AI Agent开发的完整学习路径,涵盖大模型基础、提示词工程、RAG知识库检索、LangChain框架、自动化任务Agent及多智能体协作,帮助零基础开发者快速建立系统性认知,避开常见弯路。
fx:极简开源原生编码智能体深度解析
深度解析fx开源编码智能体,探讨其Tiny、Open、Native三大核心理念,分析极简AI编程工具在可控性、隐私保护和模型无关性方面的独特价值与局限。

详解vLLM大模型推理部署与Unsloth高效微调全流程,涵盖命令行一键部署、Python代码调用、AutoDL云服务器环境搭建、ModelScope国内加速等实操细节,以DeepSeek-OCR视觉模型为例演示完整链路。

OpenAI员工在Reddit分享ChatGPT速度改进方向,涵盖推理优化、模型蒸馏、基础设施扩容等技术路径,解析响应延迟问题及未来优化趋势。

Meta发布开源多模态模型Muse Glimmer,30B参数支持24GB显存单卡运行,Apache 2.0许可证。实测RTX 5090推测解码达233 tokens/秒,支持128K上下文、图像理解与前端代码生成,附带GGUF格式开箱即用。

深入探讨如何在macOS虚拟机环境中利用Apple Silicon统一内存架构加速llama.cpp推理,涵盖Metal后端配置、内存分配、量化格式选择等优化策略,帮助开发者在虚拟化环境中实现接近裸机的LLM推理性能。