共 56 篇相关文章

系统解析AI时代自动化测试的三大主流方案:AI编程生成代码脚本、Agent直接执行测试用例、Skill技能封装复用。帮助测试工程师理解大模型如何重塑测试范式,构建可落地的AI测试工作流。

阿里Qwen3 Max预览版完成重要迭代,前端代码生成质量显著提升,智能体工具调用更稳定可靠。本文基于PinBench实测数据,深度解析2.4万亿参数旗舰模型的核心改进、性能表现及免费使用方式。

OpenAI发布GPT-5.6模型家族(Sol/Terra/Luna)及ChatGPT Work、全新桌面应用与Hosted Sites。AI定位从"回答问题"转向"完成任务",支持本地操作、跨源整合与长周期自主执行,正式进入工作伙伴时代。

深入讲解Databricks Agent Framework(Mosaic AI)核心用法:通过ChatAgent统一封装LangGraph/OpenAI智能体,结合MLflow记录评估、Unity Catalog版本管理,一键部署Model Serving Endpoint,构建生产级AI智能体系统。

GLM-5.2凭借74.4分的Frontiers-WE成绩超越GPT-5.5,跻身开源权重模型编程能力第一。MIT开源许可支持本地部署,Vercel CEO公开背书,开源与闭源旗舰的差距正在快速收窄。

OpenAI提前发布GPT-5.6系列三款模型Soul、Terra、Luna,配备150万Token超大上下文。深度解析编程能力跃升、Fable 5下架国安博弈、GLM 5.5中美竞赛白热化,以及AI工作流经济学新趋势。

用Ollama+Hermes构建完全私有的本地AI系统:零费用、无速率限制、数据不出本地。本文详解部署步骤、模型选择技巧及私有/云端混合工作流,助你真正"拥有"AI而非"租用"AI。
AI导师效应量达1.30:达特茅斯实验如何逼近教育界「两西格玛」圣杯
达特茅斯学院最新研究显示,AI导师系统在真实课程中取得0.71至1.30标准差的学习效应量,远超大多数教育干预手段。本文解读这一数字的真实意义、背后的技术逻辑,以及需要保持的审慎态度。

Anthropic正式发布Claude Sonnet 5,官方称其为最具代理能力的Sonnet模型。新模型支持规划任务、调用浏览器与终端工具、自主运行,将旗舰级Agent能力带入中端价位,大幅降低开发者构建AI自动化应用的成本门槛。

Claude Sonnet 5号称性能逼近Opus 4.8,定价更具吸引力,但实测揭示一个关键陷阱:新分词器导致同等内容消耗更多Token,综合成本远超预期。本文深度拆解Sonnet 5的真实表现与性价比,帮你判断是否值得切换。

AI写代码在企业环境中频繁翻车,根源不是模型能力不足,而是缺少完整的应用体系。本文通过真实案例,拆解知识库、Skill、MCP、Agent四大核心能力层,帮你搭建靠谱的企业级AI开发与运维体系。

深入解析Devin后台代理架构设计,包括大脑与沙箱分离、环境配置、MCP集成、记忆系统、多代理协作等核心技术决策,揭示AI编程代理从概念到生产落地的关键挑战。

OpenAI将Codex深度整合进ChatGPT,同步推出六大岗位AI插件、Sites一键建站和Annotations标注迭代三大功能,标志着ChatGPT从聊天工具向企业操作系统的全面转型。

Skill和MCP是AI Agent开发中两个易混淆的核心概念。本文用厨房比喻直观讲解Skill(菜谱/方法论)与MCP(后厨助理/工具连接)的本质区别、各自职责及协同工作方式,帮你精准搭建AI工作流。

深度解析OpenAI Codex数据分析插件的核心能力,包括跨系统数据整合、智能图表生成、数据溯源机制及Google Slides模板化导出,探讨AI如何重塑数据分析工作流。

分享一条经过验证的AI Agent学习路线,涵盖四个核心要素、主流架构模式、多智能体协作与项目实战,帮助零基础开发者在三个月内掌握企业级AI Agent开发能力。

深入解析Agent Skill的核心概念与内部结构,详解skill.md、references、scripts、assets四大组件,通过餐厅海报Skill实例演示如何定制专属AI技能包,助你快速上手主流Agent平台。

Google发布Gemini 3.5 Live Translate语音对语音翻译模型,支持70+语言实时翻译。本文详解其端到端技术原理、与Grab合作落地场景,以及通过Google Translate和Live API的开放接入方式。