每日AI新鲜事·06月29日早间播报:AI编程Agent进化现状
每日AI新鲜事·06月29日早间播报:AI编程Agent进化现状
06月29日早间播报 AI领域热点新闻速递,10条精选资讯
06月29日早间播报 AI领域热点新闻速递,10条精选资讯
今天AI圈的内容挺集中的,基本都在聊一个主题——AI编程到底走到哪一步了。
对,我刷了一圈B站,感觉半个首页都是AI写代码相关的。
那我们先聊个重磅的吧。B站上有个视频讲Devin的进化史,说它现在能做到80%的代码是自主提交的。
从辅助编程到自主提交,这个跨度听着挺吓人的。
这个我得先泼点冷水。80%这个数字,你得看它怎么定义的。
如果是按commit数量算,那很多可能是格式调整、依赖更新这种机械性工作。真正涉及架构决策的核心代码,占比肯定没那么高。
你的意思是,量大不等于质高?
没错。但话说回来,Devin的架构演进方向是对的。它不是单纯让模型更强,而是在agent层面做了很多工程优化。
比如怎么拆任务、怎么做上下文管理、怎么自我验证。这些才是从demo到production的关键。
说到这个,还有一条也很有意思。有个项目叫Omni,号称99%的代码都是Claude写的,用来构建AI Agent的分析架构。
这种「用AI造AI」的套娃模式现在越来越多了。
但我好奇的是,那剩下的1%是什么?
大概率是最初的prompt和架构设计思路吧。就是告诉Claude「我要什么」的那部分。
这其实恰恰说明了一个趋势——未来写代码的能力可能不是核心竞争力,定义问题和设计架构才是。
这就接上另一个话题了。有个视频专门聊「AI编程成绩造假」,说真相来了。
这个我看了,其实就是说很多AI编程工具宣传的benchmark成绩,跟实际使用体验差距很大。
这种事在AI圈也不是第一次了吧。
太常见了。benchmark本身就有局限性,很多公司会针对测试集做优化,实际到复杂工程场景就不行了。
所以业内有句话叫「不要看demo,要看daily use」,这个判断标准放到现在依然成立。
对了,还有条挺有意思的。有人聊法律AI智能体怎么借鉴编程Agent的架构,Legora这个项目。
这个方向我觉得特别值得关注。编程Agent的那套方法论——任务分解、工具调用、自我校验——其实是通用的。
相当于编程领域先趟出了一条路,其他垂直领域直接抄作业。
对,法律场景其实很适合这套框架。大量的条文检索、案例匹配、逻辑推理,都可以拆成子任务让agent去跑。
再快速过几条。有个视频说Opencode是普通人最好的AI入门工具,还有讲Cursor七分钟做商用网页的。
这类教程现在确实铺天盖地。说明AI编程工具的用户群体在快速下沉,不只是程序员在用了。
还有一条我觉得标题就很到位——「AI没有职场认知,不是因为它笨,是因为没人教它什么叫工作」。
这个观点我非常认同。现在很多人抱怨AI不好用,其实是context给得不够。
模型能力已经很强了,瓶颈往往在于人类没有把业务逻辑和工作流程讲清楚。
所以归根结底还是那句话,会提问的人才能用好AI。
没错,prompt engineering这个词可能过时了,但背后的能力只会越来越重要。
好,今天基本都在聊AI编程这条线,感觉这个领域确实在加速。
对,从工具到agent到跨领域迁移,整个链条都在往前跑。值得持续关注。
行,那今天就先聊到这儿,我们晚上见。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。