共 912 篇相关文章

Google DeepMind工程师揭示:超过5万个AI智能体技能几乎无一附带评估。本文系统梳理技能评估的核心方法,涵盖技能描述优化、测试用例设计、评估harness搭建及退役机制,帮助你告别盲目发布。

DeepSeek创始人梁文锋在四小时深度对话中,揭示了从思维链到具身智能的AGI五步路线图。在仅两万张GPU算力约束下,如何用TileLang编译器破解国产替代难题,API现金流如何为AGI探索托底?本文梳理这套克制而自洽的战略逻辑。

Rocky是一款极简透明的开源编程智能体,核心Loop仅几百行Python代码,原生集成DeepSeek搜索与Research模式,内置SWE基准测试环境,适合学习Coding Agent原理、文献调研与可复现的Agent实验。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

DeepSeek开源推测解码工具库DeepSpec,生产环境实测推理速度提升60-85%,吞吐量最高提升661%。集成三大算法、九个预训练Checkpoint与九个评测基准,三步即可上手,MIT协议免费商用。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

OpenAI推出GPT-5.6模型家族(Sol、Terra、Luna)及ChatGPT Work、全新桌面应用与Sites托管功能。AI从问答工具升级为能自主完成长周期任务的工作伙伴,覆盖财务分析、文件整理、网站生成等真实场景。

前沿AI模型正加速走向通用化:成本大幅下降、通用模型在数学推理与竞赛编程中超越专用模型、小型编程任务趋近自动化、多智能体工作流持续进化。本文深度解析这些信号背后的技术逻辑与行业影响。

记录开发者用Fan Browser Agent全自动申请韩国旅游签证的真实过程:自主理解申请流程、高速填写30余项表单、处理文件上传报错,直观展示浏览器Agent在复杂网页任务中的实际能力边界。

全面解析DeepSeek Math V2:IMO金牌级数学推理能力、97.3%的Math500正确率、Apache 2.0完全开源可商用。从技术架构、版本演进、核心能力到本地部署,带你彻底读懂这款开源数学大模型的过人之处。

为何有用户宁选旧版Gemini 3.0 Flash,也不用「更先进」的3.5 Flash?本文深度解析AI安全对齐机制如何导致模型变得保守,以及「对齐税」对心理学、哲学类深度对话用户的真实影响,并提供实用应对建议。

OpenAI正式发布旗舰模型GPT-5.6,编码与长任务能力大幅提升;Anthropic紧急重置Claude使用额度;苹果起诉OpenAI专利盗窃;百度搭子智能体日均提问暴增20倍;机器人预判控制模型开源发布。一文速览AI行业最新动态。
Ego-lite:专为人与AI Agent并行工作设计的开源浏览器
ego-lite 是 citrolabs 团队推出的开源 AI 原生浏览器,支持人类用户与 AI Agent 在同一环境中并行工作。本文深入解析其设计理念、并行协作模式及对开发者的实际价值。

Coday是一款Windows桌面端AI编程代理工具,支持BYOK(自带密钥)模式,可自动识别Cursor、Windsurf、Devin等主流IDE协议,统一调用自配置的API模型。本文通过实测演示,详解其协议转换、MCP支持与工具调用能力。

GPT-5.6正式开放,一次推出Sol、Terra、Luna三款模型。本文结合权威基准数据与真实用户反馈,深度解析三款模型的性能差异、强项弱点,并给出清晰的选型建议,帮你找到最适合自己的那一款。

小米悄然在Hugging Face上传MiMo-V2.5-DFlash权重,附带独立MTP模型,有望解决llama.cpp兼容问题,让300B超大模型本地推理速度翻倍。社区正期待GGUF量化转换。

深度评测Panel AI 1.1.1版本:秒级安装、无公网组网、算力集群批量管理,企业AI私有化部署门槛大幅降低。涵盖应用市场、角色权限、商业授权等核心功能解析,助力中小团队快速落地企业级AI解决方案。

全面解析Spring AI核心模块:ChatModel对话、EmbeddingModel向量化、RAG检索增强生成、Tool Calling工具调用及MCP协议。Java开发者快速接入DeepSeek、ChatGPT等大模型的实战教程,涵盖Milvus向量数据库与Ollama本地模型集成。

OpenAI推出的Codex Plugin for Claude Code,让Claude Code负责编写、Codex独立审查,实现双Agent分工协作。本文解析其三组核心功能入口、使用前提与成本口径,帮你判断是否适合引入这一工作流。

Claude Code不只是聊天AI,它能直接读取项目、修改代码、运行命令。本文从交互方式、上下文理解、执行力、记忆、工具调用五个维度,对比Claude Code与普通AI的核心差异,帮你快速判断是否值得上手。