共 110 篇相关文章

深入解析Prompt Caching工作原理,揭示AI Agent重复发送token导致成本飙升的真相。通过实测案例展示1090万token仅花6美分的效果,并提供系统提示词设计、缓存过期管理等最佳实践。

深度分析使用Oh My Pi等工具调用Cursor私有接口搭建OpenAI兼容代理是否违反ToS,解读官方条款与员工表态,明确唯一合规路径为Cursor CLI/Agent SDK。

DeepSeek V4 Flash 0731在Terminal-Bench 2.1基准测试中取得82.7%成绩,采用公开评测框架。本文解析这一成绩对AI Agent能力下沉、轻量模型实用化的意义,以及开发者应如何理性看待。

Soup CLI是一款开源命令行工具,通过逐层流式加载技术,让仅有4GB显存的笔记本显卡也能微调Llama-3.1-8B等80亿参数大模型。本文详解其技术原理、实测数据与使用方法。
大佬观点·第4期:OpenAI一周连发七条推文,从自我优化到AI减速机制
每周五盘点本周行业大佬的发言和官方公告

Homebench是一款开源的本地大模型评测工具,从速度、内存占用和输出质量三个维度综合评估LLM在本地硬件上的真实表现,帮助开发者做出最优的模型选型和量化方案决策。

深入解析Harness工程如何大幅提升AI Agent实际表现。从Codex案例出发,探讨工具编排、上下文管理、执行环境等harness设计如何成为AI应用差异化竞争的核心战场。

Tau是一款开源AI编程代理工具,整合22家AI提供商,支持免费模型和低价方案,兼容Claude Code生态的Skills、Plugins和MCP Server,为开发者提供低成本AI编程解决方案。

Agenta是一款开源AI Agent协作平台,支持自托管模型和任意Agent执行框架,被视为Claude Cowork的开源替代方案。本文详解其核心架构、适用场景及与闭源方案的对比。

Thinking Machines发布Inkling开源多模态大模型,近万亿参数MoE架构,100万tokens上下文窗口,Apache 2.0协议开源。本文深度解析其技术架构、基准表现、实测体验与定价策略。

资深AI实践者Remy深度拆解从聊天模型到AI代理的跨越:讲透代理运行原理、上下文/工具/技能三大支柱、MCP工具连接与实操架构,助你把AI放在业务最前沿,成为效率翻倍的「百倍员工」。

Claude Code从入门到企业级实战全攻略:涵盖CLI安装、CC Switch接入国产大模型、基础命令、Git工作流打通、自动化修Bug及MCP、SubAgents等工程化能力,助你从零掌握AI编程协作新范式。

Notion联合创始人Simon Last深度分享:从GPT-4初体验到个人智能体、自定义智能体的完整演进历程。揭秘每半年重写AI框架的秘诀、工程师如何变身"智能体经理",以及Notion成为"模型界瑞士"的战略布局。

系统梳理当前AI编程全景:从ChatGPT到Claude Code的演进历程、大模型能力梯队排名、Cursor/Copilot等主流工具阵营,以及Agent时代最值得掌握的三件武器——MCP协议、Skills技能包与CLI工具链,助你构建高效AI编程工作流。

Rocky是一款极简透明的开源编程智能体,核心Loop仅几百行Python代码,原生集成DeepSeek搜索与Research模式,内置SWE基准测试环境,适合学习Coding Agent原理、文献调研与可复现的Agent实验。

Poolside 发布开源智能体编程模型 Laguna S 2.1,118B总参数仅激活8B,DeepSWE基准得分40.4%,超越DeepSeek V4 Pro Max约4.5倍。支持百万Token上下文,单台工作站可部署,OpenRouter定价$0.10/百万Token起,256K上下文端点免费。

前沿AI模型正加速走向通用化:成本大幅下降、通用模型在数学推理与竞赛编程中超越专用模型、小型编程任务趋近自动化、多智能体工作流持续进化。本文深度解析这些信号背后的技术逻辑与行业影响。

AI编程时代,单靠氛围编程只能做玩具项目。本文深度解析从Vibe Coding到SDD规范驱动开发的完整工程化路径,涵盖Claude Code、Codex工具选型、SuperPower插件实战,以及国产大模型横评,帮助开发者掌握企业级AI编程方法论。

Vibe Coding遭遇天花板?本文深度解析AI编程三段式进阶路径,涵盖Claude Code、Codex工具选型、SuperPower规范驱动开发(SDD),以及从氛围编程走向企业级工程化的完整方法论,助你跨越屎山代码困境。

通义千问Qwen 3.8 Max拥有2.4万亿参数,即将开源。KingBench实测综合得分81.25%,位列排行榜第二,超越Claude Opus 4.8,仅次于Fable 5。本文详解8道测试题表现、真实使用体验与短板分析。