每日AI新鲜事·07月12日晚间播报:Claude Code网页操控新能力
每日AI新鲜事·07月12日晚间播报:Claude Code网页操控新能力
2026年07月12日晚间播报 AI领域热点新闻速递,6条精选资讯
2026年07月12日晚间播报 AI领域热点新闻速递,6条精选资讯
今天AI圈的消息节奏稍微慢了一点,但有几条还是挺值得聊的,尤其是Claude Code那条,我一看标题就觉得这个方向对了。
对,Claude Code这条我也看到了,B站上有个视频,标题叫「Claude Code 王炸更新:AI 现在能自己打开网页干活了」,这个更新方向确实很有意思。
简单说就是Claude Code现在具备了直接操控浏览器的能力,能自己打开网页、读取内容、然后基于网页信息执行任务。不只是生成代码了,是真的在帮你「干活」。
等等,这个「自己打开网页」是什么意思?是像那种browser use那样的思路,还是说有什么不同?
你问到点子上了。这个方向跟browser use的底层逻辑是类似的,就是给模型一个真实的浏览器环境,让它能看到页面、点击、填表单。但Claude Code的特殊性在于它本来就是编程工具,所以这个能力接入之后,它可以直接把「看到的信息」转化成代码操作。
所以不只是「爬数据」,而是边看网页边写逻辑?
对,这就是质变的地方。以前你用AI编程工具,你得自己去查文档、复制粘贴,再告诉模型「这是API文档,给我写个调用」。现在它直接自己去看文档,自己理解,自己写,整个loop短了一大截。
这个感觉就像是从「AI帮我干」升级到「AI替我干」了,把人从很多中间步骤里解放出来。
而且你想,这对那种「需要实时信息」的任务特别有价值。比如调一个第三方API,文档可能上周刚更新,老版本的token已经废了,模型训练数据里压根没有,但它现在能自己去看最新文档再动手,这就解决了一个长期存在的痛点。
你这么一说我想到了,之前我们聊过Claude Code在编程工具赛道里用户口碑不错,这次这个更新方向如果做扎实了,跟Cursor、Windsurf这些工具的差距会拉更大吗?
这是个好问题。我觉得这条路线代表的是「更深的自主性」,跟Cursor那种「在编辑器里辅助」的思路是在分叉的。Claude Code往agent方向走得更激进,更像是一个能独立执行任务的agent,而不只是一个smart autocomplete。
但这样会不会有点风险?Agent自己去开网页,操作如果出错了,用户怎么知道它在哪一步跑偏了?
这是整个agentic AI最核心的工程问题,就是可观测性和可控性。你得知道它在干什么,得能随时叫停。这也是为什么光靠「能力强」还不够,工具层的设计同样关键。不过从目前信息来看这个功能确实已经上了,说明Anthropic在这上面有一定把握了。
好,这条确实是今天的重点。然后我还注意到Reddit上有个讨论,是r/Bard社区有人说「Gemini最近变得越来越差了」,这个热度挺高的。
这种帖子你懂的,有点「集体吐槽」的性质,但也不是完全没价值。用户感知到的质量下降,有时候是真的有回退,有时候是期望值被竞品拉高了,比较基准变了。
你说得对,这两种情况挺难分清楚的。Claude 4、Fable 5这些相继发布之后,用户对「好模型」的标准水涨船高,Gemini没变但感觉变差了,这个逻辑是成立的。
而且Google DeepMind那边在多条产品线上铺得很开,资源分散也是潜在因素。不过具体原因从这个帖子里看不出来,就是个信号,说明Gemini的用户满意度有压力。
嗯,也说明2026年这个时间点,用户对主流模型的评判越来越直接了,容忍度越来越低,谁一抖动用户就跑了。
对,这跟我们之前说的模型能力差距在缩小是一致的,差距缩小了,用户的切换成本也在降低,稍微不顺手就换一个,忠诚度很薄。
然后还有两条技术讨论,一个是r/computervision上有人在问「double detection怎么处理」,就是目标检测里同一个目标被检测两次的问题。
这是个老问题了,NMS——Non-Maximum Suppression——是经典解法,但在密集场景下NMS也会漏检或误删。现在有些方法用soft-NMS或者直接在模型结构上改,比如用DETR这类基于transformer的检测器,从设计上就减少重复预测。这类讨论在CV社区是常青话题。
然后还有一条我觉得挺反差的,r/datascience上有个帖子说「ARIMA很无聊,但我还是喜欢它」,这个标题我看了就想笑,讲的是什么?
你说反差我懂,满眼都是大模型、agent,突然有人给ARIMA唱赞歌。但这个点其实挺有代表性的——ARIMA是时间序列的经典统计模型,简单、可解释、不需要GPU,对很多实际业务场景够用了。
这不就是「能用就行,别过度工程化」的老生常谈嘛,但在AI大跃进的氛围里突然看到这种声音,确实有一种清醒的感觉。
对,而且这种讨论能在datascience社区获得共鸣,说明实际从业者里有相当一部分人是务实派,不是每天都在追最新模型,更关心手头的问题能不能被简单方法解决。这跟那种「一切都要用LLM」的叙事是个很好的对冲。
好,今天的内容大概就这些。Claude Code网页操控这个更新我觉得值得持续关注,方向很对,后续怎么落地是关键。
嗯,agent能力这条线现在各家都在推,但能不能真的让用户放心交出控制权,这才是决定天花板的地方,我们后面肯定还有得聊。
那就明天见,晚安。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。