共 555 篇相关文章

Rocky是一款极简透明的开源编程智能体,核心Loop仅几百行Python代码,原生集成DeepSeek搜索与Research模式,内置SWE基准测试环境,适合学习Coding Agent原理、文献调研与可复现的Agent实验。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

DeepSeek开源推测解码工具库DeepSpec,生产环境实测推理速度提升60-85%,吞吐量最高提升661%。集成三大算法、九个预训练Checkpoint与九个评测基准,三步即可上手,MIT协议免费商用。

前沿AI模型正加速走向通用化:成本大幅下降、通用模型在数学推理与竞赛编程中超越专用模型、小型编程任务趋近自动化、多智能体工作流持续进化。本文深度解析这些信号背后的技术逻辑与行业影响。

记录开发者用Fan Browser Agent全自动申请韩国旅游签证的真实过程:自主理解申请流程、高速填写30余项表单、处理文件上传报错,直观展示浏览器Agent在复杂网页任务中的实际能力边界。

全面解析DeepSeek Math V2:IMO金牌级数学推理能力、97.3%的Math500正确率、Apache 2.0完全开源可商用。从技术架构、版本演进、核心能力到本地部署,带你彻底读懂这款开源数学大模型的过人之处。

为何有用户宁选旧版Gemini 3.0 Flash,也不用「更先进」的3.5 Flash?本文深度解析AI安全对齐机制如何导致模型变得保守,以及「对齐税」对心理学、哲学类深度对话用户的真实影响,并提供实用应对建议。
Ego-lite:专为人与AI Agent并行工作设计的开源浏览器
ego-lite 是 citrolabs 团队推出的开源 AI 原生浏览器,支持人类用户与 AI Agent 在同一环境中并行工作。本文深入解析其设计理念、并行协作模式及对开发者的实际价值。

Coday是一款Windows桌面端AI编程代理工具,支持BYOK(自带密钥)模式,可自动识别Cursor、Windsurf、Devin等主流IDE协议,统一调用自配置的API模型。本文通过实测演示,详解其协议转换、MCP支持与工具调用能力。

GPT-5.6正式开放,一次推出Sol、Terra、Luna三款模型。本文结合权威基准数据与真实用户反馈,深度解析三款模型的性能差异、强项弱点,并给出清晰的选型建议,帮你找到最适合自己的那一款。

小米悄然在Hugging Face上传MiMo-V2.5-DFlash权重,附带独立MTP模型,有望解决llama.cpp兼容问题,让300B超大模型本地推理速度翻倍。社区正期待GGUF量化转换。

深度评测Panel AI 1.1.1版本:秒级安装、无公网组网、算力集群批量管理,企业AI私有化部署门槛大幅降低。涵盖应用市场、角色权限、商业授权等核心功能解析,助力中小团队快速落地企业级AI解决方案。

全面解析Spring AI核心模块:ChatModel对话、EmbeddingModel向量化、RAG检索增强生成、Tool Calling工具调用及MCP协议。Java开发者快速接入DeepSeek、ChatGPT等大模型的实战教程,涵盖Milvus向量数据库与Ollama本地模型集成。

OpenAI推出的Codex Plugin for Claude Code,让Claude Code负责编写、Codex独立审查,实现双Agent分工协作。本文解析其三组核心功能入口、使用前提与成本口径,帮你判断是否适合引入这一工作流。

巴黎AI语音初创公司Gradium完成1亿美元种子轮融资,获英伟达战略加持。本文深度解析英伟达生态投资逻辑、欧洲AI公司全球化野心,以及AI语音赛道最新竞争格局。

什么是Harness AI工程化编程?本文解析从"古法编程"到AI驾驭式开发的转变,涵盖企业级项目落地痛点、Claude Code实战技术栈选择,以及如何构建约束机制让大模型稳定交付高质量代码。

OpenAI发布GPT-5.6家族,推出Sol、Terra、Luna三款分级模型,配合ChatGPT Work执行环境,AI正式从「聊天回答」跃迁至「多智能体协同工作流」,直接操作本地文件与业务系统,重塑生产力底层逻辑。

阿里通义千问Qwen 3 Max深度评测:2.4万亿参数、即将开放权重,八项测试综合得分81.25%高居榜单第二,超越Claude Opus、Kimi K3和GPT-4系列,国产大模型迎来重要突破。