共 147 篇相关文章

Colibri开源项目通过MoE冷热分离架构和4-bit量化,实现在消费级硬件上运行GLM 5.2等千亿参数大模型。本文详解其三级内存架构、专家按需加载和投机解码等核心技术原理。

深度解析OpenAI GPT-5.6 Value Maxing策略,涵盖Sol/Terra/Luna模型选择、KV缓存优化、Prompt压缩、程序化工具调用等实操技巧,帮助开发者用更少Token撬动更高产出。

解读DeepSeek创始人梁文峰罕见对话记录,深入分析DeepSeek以愿景驱动团队、战略克制聚焦AGI、坚持开源的核心哲学,以及这套理念对中美AI竞争格局的深层意义。

AI从业者实测Opus 5:模型能力强大但推理速度过慢,点名Cerebras硬件加速方案。深度分析大模型竞争从智能比拼转向推理速度军备竞赛的行业趋势。

深入解析Kimi K3模型量化部署方案,对比q4与q8量化的存储需求、精度差异与硬件配置要求,帮助开发者评估本地自托管的可行性与最佳实践。

面对美国芯片封锁与闭源垄断,中国AI开源模型凭何持续反击?本文深度拆解开源定价权博弈、光互联卡位、端侧场景三大核心路径,解析国产大模型韧性背后的真实逻辑。

Redis作者antirez开发纯C推理引擎DS4「矮星」,通过不对称量化将DeepSeek V4 Flash从500GB压缩至80.8GB,实现128GB统一内存本地部署,每秒生成26.7个Token。本文深度解析MoE架构优势、三档部署现实与本地大模型的真正门槛。

一位不会写代码的独立游戏开发者,用Fable 5、GPT 5.6和Claude Opus深度实测AI协作开发流程。他的结论出人意料:模型不需要拉满,真正的瓶颈是你有没有想清楚要做什么。

小米悄然在Hugging Face上传MiMo-V2.5-DFlash权重,附带独立MTP模型,有望解决llama.cpp兼容问题,让300B超大模型本地推理速度翻倍。社区正期待GGUF量化转换。

DeepSeek一篇名为《Thinking with Visual Primitives》的论文上线仅4小时即被撤下。论文提出用边界框与点作为视觉推理基元,让模型在思考时直接"指向"图像,在迷宫导航、路径追踪、细粒度计数等任务上大幅超越GPT、Gemini和Claude,为多模态AI推理开辟新方向。

上下文工程是构建高效AI Agent的核心方法论,涵盖查询增强、RAG检索、提示设计、记忆管理与工具调用五大模块。掌握Write、Select、Compress、Isolate四个核心动作,从根源解决大语言模型幻觉问题。

平头哥在WAIC发布开源AI软件栈T-Head SAIL,降低国产芯片开发门槛;Kimi K3登顶WebDev榜单,千问3.8 Max Preview激进降价;月之暗面筹备赴港IPO;Oracle数据中心改用燃料电池微电网,AI行业动态一览。

Moonshot AI的Kimi K3发布即登顶开源模型榜单,K3.1随即预热;Grok 4.6即将完成2万亿参数训练;DeepSeek新模型灰度测试;Anthropic订阅策略反复调整。本文梳理AI领域关键动向,解析开源与闭源系统的差距为何正在快速缩小。

AI创业公司Prismo宣称将270亿参数模型压缩至4GB,在iPhone 17 Pro上实现全参数本地运行,支持离线复杂对话、代码生成与自主编程代理。本文深度解析其压缩技术原理、与苹果MoE方案的差异,以及端侧AI的真实能力边界。

当ChatGPT能直接给出答案,检索技术还有存在的价值吗?来自微软、IIT Delhi等机构的六位专家激辩:参数化记忆的局限、BM25为何仍是强基线、以及检索与推理的真实边界在哪里。

OpenAI发布GPT Live语音模型,支撑ChatGPT Voice实时对话体验。本文深度解析语音AI的核心挑战——延迟、打断处理与上下文理解,并探讨AI交互入口从打字向实时语音迁移的趋势。

本文融合微软研究院峰会两场报告核心观点,深度解析AI推理提效的两条关键路径:帝国理工Hongxiong Fan提出的测试时扩展与可变粒度搜索,以及微软研究院印度的验证式推理框架,探讨如何让AI推理兼具效率与可信性。

深入解析AI可解释性研究:从思维链、探针技术到稀疏自编码器,探讨科学家如何理解神经网络内部机制,评估AI对齐与安全性,揭示黑箱背后的运作逻辑。

QuantaMind是一款免费开源的本地AI Agent可靠性测试工具,采用pass^k评分与确定性评分机制,支持多步序列测试与故障注入,覆盖Ollama、llama.cpp、vLLM等主流部署方案,帮助团队在上线前发现隐藏的序列级失败风险。
千元预算搭建外置GPU跑本地LLM:eGPU选购与配置实用指南
在1000美元预算内搭建eGPU方案运行本地LLM?本文详解显卡选择策略、扩展坞成本分配、RTX 3090/3060性价比对比,以及Ollama、llama.cpp等主流工具推荐,帮你把每一分预算花在刀刃上。