共 2 篇相关文章
每日AI新鲜事·08月18日早间版:AI代码修复引发安全漏洞与法官AI判决豁免
2026年08月18日(周二)早间版 AI新闻速递+热点深度讨论
ViBench是首个基于真实世界任务的端到端应用创建基准测试,评估AI从零构建完整应用的能力。测试结果显示Claude Opus 4.8在性能和性价比上领先,揭示了传统SWE-bench与实际开发能力的差距。