共 6 篇相关文章

mini-SWE-agent团队对GPT-5系列在SWE-bench基准上的评测显示,GPT-5性能与Claude Sonnet 4持平,而GPT-5-mini以不到五分之一的成本仅损失约5个百分点性能,成为AI编程Agent的最佳性价比选择。

腾讯HY3开源大模型正式发布,2950亿MoE架构仅激活210亿参数,实测前端开发、3D模拟、代码生成表现出色,性价比碾压同级竞品,与DeepSeek V4 Pro正面竞争,Apache 2.0商用免费。

Anthropic Claude Code Artifacts正式面向Pro/Max用户开放,支持生成交互式网页并实时部署。本文盘点AI Agent最新动态:阿宝公测、字节EdgeBench评测、微软Frontier Company成立,及OpenAI、Anthropic的算力布局。

阿里巴巴因安全风险禁用Claude Code,引发技术社区热议。本文深度解析企业使用云端AI编程工具的数据泄露隐患,探讨本地部署AI的崛起趋势,以及AI行业从能力竞赛转向信任建设的深层逻辑。
科技前沿阿里开源Qwen3.6 35B模型,256专家MoE架构仅需3B激活参数,SWE Bench成绩逼近Claude Opus。xAI发布Voice Cloning API支持28种语言,NVIDIA开源OpenShell安全沙箱,Sam Altman表态模型智力优先。
科技前沿Anthropic发布Claude Haiku 4.5,作为Sonnet 4.5的蒸馏版本,编码性能接近旗舰级水平,速度提升一倍,成本降至三分之一。SWE-Bench评测73.3分,稳居AI编码第一阵营,是开发者降本增效的理想选择。