共 456 篇相关文章

OpenAI宣布不再推荐SWE-Bench Pro作为AI编程评测基准,折射出数据污染、指标局限等深层问题。本文深入解析AI代码生成能力评测的信任危机成因,以及动态测试、质量评估等新一代评测范式的发展趋势。

mini-SWE-agent团队对GPT-5系列在SWE-bench基准上的评测显示,GPT-5性能与Claude Sonnet 4持平,而GPT-5-mini以不到五分之一的成本仅损失约5个百分点性能,成为AI编程Agent的最佳性价比选择。

深入解析SWE-bench Multilingual基准测试,涵盖9种编程语言、300个真实GitHub任务,了解其设计方法、语言分布、评估指标及对AI编程助手能力评估的重要意义。

SWE-bench团队公开作弊检测方法,通过逐Hunk精确匹配分析提交方案与标准补丁的相似度。结果显示大多数模型精确匹配率仅2%-7%,但发现一个匹配率高达87%的异常案例。详解检测原理、分析结果及对AI基准测试的行业意义。

深度解析DeepSWE编程基准测试如何揭露SWE-Bench Pro的数据污染和作弊问题。GPT-5.5以70%通过率领先,开源模型差距明显。涵盖测试结果、成本对比与开发者实用建议。
产品体验Rovo Agent是Atlassian推出的AI编程CLI工具,每天免费提供2000万Claude 4 Sonnet Token,SWE-bench排名第一。本文详解其自适应记忆系统、安装教程及实战体验,对比Gemini CLI等竞品优势。

Z.ai发布GLM-5.3大模型,通过大规模后训练扩展在同一底座上实现编程能力跃迁,在智能体编程任务上达到开源SOTA水平,并在漏洞发现与网络防御领域展现涌现能力。深度解析其技术路线与行业意义。

ChatGPT在过去一年损失22个百分点的网络市场份额,Google Gemini、Claude、Perplexity等竞品快速崛起。本文深入分析份额下降的真实原因、数据解读误区及对OpenAI的战略影响。

Meta Muse Glimmer 30B实测评测,296亿参数稠密模型采用Apache 2.0开源协议,视觉理解能力出色,支持128K上下文,24GB显存即可本地运行。详解基准测试、多模态识别表现与局限。

AI编程助手正在改变开发者的角色定位。本文探讨与AI协作编程如何从代码执行转变为任务管理,以及开发者需要培养哪些新的核心技能来适应这种工作范式转变。

深入解析 Cursor 这款 AI 原生编程工具的核心特性,包括智能代码生成、上下文感知、多模型支持等功能,对比传统 IDE 的关键差异,帮助从零基础到资深开发者快速上手 AI 编程。

Bullet是一款主打速度的编程智能体,通过并行化处理、智能模型选择和定向代码搜索,实现比Claude Code和Codex快30%-60%的效率提升。SWE-bench得分95.8%位列前三,支持复用现有订阅和本地模型。

开发者反馈Ollama Cloud调用GLM模型在OpenCode中频繁随机停止响应,本文分析流式超时、停止符误判等可能原因,并提供调整超时参数、拆分任务等实用解决方案。

深度解析AI编程工具Harness之争:CloudCode、OpenCode、Pi等编程外壳在速度、Token消耗、模型自由度和成本上的全面对比,揭示同一模型为何性能差异达4倍。

DeepSeek官方开源awesome-deepseek-agent资源仓库,汇集Agent开发框架、工具链与应用案例,已获5500+Star。本文解读这份官方精选库的定位、收录内容及其对Agent开发者的实际价值。

DeepSWE基准测试显示Gemini 3.7 Flash编程能力超越Opus 4.8,且成本仅为七分之一、速度快6倍。深入分析小模型逆袭现象及对开发者模型选择策略的实际启示。

深入剖析AI Agent的内部构造与工作原理,从感知-推理-行动闭环、工具调用、上下文管理到错误处理,揭示智能体的真实运作机制与工程挑战,帮助开发者理解Agent的能力边界。

深度实测Meta开源Muse-Glimmer-30B模型,九大维度403道题综合均分76.04,工具调用90+分碾压同级。4bit量化几乎无损,24G显存轻松驱动,D-Flash加速3.1倍达233tokens/秒,是本地部署玩家的高性价比首选。