AI热点风向标·07月13日午间版:MLE还是SWE,Gemini崩了没
AI热点风向标·07月13日午间版:MLE还是SWE,Gemini崩了没
2026年07月13日午间版 AI热门话题深度讨论,5个热点
2026年07月13日午间版 AI热门话题深度讨论,5个热点
最近AI圈有几个话题同时在烧,而且烧得方向都不太一样。有人在纠结职业路线,有人在骂Gemini,还有人在盯着Claude Code新功能瞪眼——今天我们都得聊聊。
对,而且这几个话题凑在一块儿特别有意思,表面看是独立的,但背后都指向同一个问题:AI时代你到底要押注什么。
先从那个Reddit讨论说起吧。r/learnmachinelearning上有人发了一帖,问MLE转SWE,还是SWE转MLE,哪个更香?这帖子评论炸了。
这帖子为什么现在火?我觉得时间节点很关键。现在AI工具已经强到一定程度,SWE的部分工作开始被自动化替代,但MLE的系统性工作反而变得更重要了。
很多人原来觉得MLE是高门槛、搞研究的,SWE是可以快速入行的。但现在这个认知正在被颠覆,Cursor、Claude Code这些工具一出来,SWE的entry level门槛被打低了,反而MLE的稀缺性上来了。
等一下,我不完全同意这个判断。Reddit评论区里也有很多人在说,MLE现在的日子也不好过啊——大模型直接把很多ML pipeline给替代了,fine-tuning的需求也在下降。
你说得有道理,这恰恰是这帖子最有价值的地方。评论区两派人吵得很凶,一派说SWE转MLE,因为系统设计能力以后更值钱;另一派说MLE转SWE,因为能写代码的人永远有饭吃。
那你自己的判断呢?你是研究院的,应该有切身感受吧。
我的结论是:这个问题问错了。现在真正值钱的不是纯MLE也不是纯SWE,而是能把ML系统工程化的人。你得既懂模型行为,又能写出生产级别的代码,这两个标签本来就不该是二选一。
所以你的意思是,纠结转哪条路的人,可能方向本身就偏了?
对,与其问转哪个,不如问怎么在AI工具的加持下快速补上自己缺的那条腿。MLE补工程能力,SWE补对模型的理解,这才是2026年的正确姿势。
这倒是。而且说到模型理解,最近Gemini被骂得挺惨的,r/Bard上有人发帖说Gemini lately一直在掉水准,评论跟进了一大堆。
这个帖子我也看了。用户的核心抱怨很集中:响应质量变不稳定、有时候明显在敷衍、长任务里会绕圈子。而且他们说这是最近才开始的,以前用着还行。
这种"用着用着变差了"的感觉,其实在AI产品里不是第一次出现了。之前GPT-4也被用户抱怨过类似的问题,说模型被悄悄降级了。
对,这个现象有个词叫model degradation,但到底是真的降级、还是用户期待拉高了、还是服务端做了某些cost优化,其实很难从外部判断。但用户感受是真实的,这个锅Google得接着。
而且时间点也挺微妙的——Google前阵子Gemini在benchmark上表现还不错,但用户实际使用体验却在下滑,这本身就是个信号。
这正好说明benchmark和真实用户体验之间的gap还是很大。Reddit上有人直接贴了对话截图,Gemini给出的回答明显是在走捷径,绕过了问题的核心。这种东西benchmark是测不出来的。
而且你想想,Claude Code这边刚出了个大更新,Cursor还在持续迭代,Gemini如果这时候用户体验在掉,竞争压力就更大了。
说到Claude Code,咱们正好切过去聊,因为这次更新真的值得单独讲。
对,B站上有个视频讲Claude Code新功能,互动分破了一千,标题说Claude Code现在能自己打开网页干活了——这个更新的核心是什么?
简单说就是:Claude Code现在有了原生的browser use能力。它可以自己启动浏览器、打开网页、点击按钮、填表单,完成整个web操作流程——不只是看代码,是真的在操作界面。
等等,这跟之前那种截图分析网页有本质区别吗?
本质区别太大了。以前是"给我看截图我来分析",现在是"我自己开浏览器去做"。这是从感知到行动的跨越,agentic能力直接上了一个台阶。你让它帮你登录某个管理后台、抓某个动态数据、提交一个表单,它现在可以自己搞定了。
这个能力一开放,我第一反应是安全问题。它自己在浏览器里操作,权限边界怎么管控?
这是真正的核心问题。Anthropic在这块做了沙箱隔离,每次browser session都在独立环境里跑,不会影响宿主机。但话说回来,如果你让它操作的是你自己的账号,它能做的事情还是很多,用户自己得清楚风险。
B站评论区里大家最兴奋的点是什么?
主要两类反应:一类是开发者很兴奋,说终于可以自动化那些"又不是很复杂、但一直要手工做"的web任务了;另一类是普通用户,觉得这个方向很酷但不确定自己用得上。
这个分层其实挺真实的。对于开发者来说,这是真正的生产力工具;但对于普通用户,browser agent还需要一段时间才能变成"拿来就用"的东西。
对,而且Claude Code整体的定位本来就是偏开发者侧的。这次更新更像是在跟Devin那个方向对齐——AI不只帮你写代码,而是帮你完成整个软件交付链路里的操作任务。
说到这里,还有一个话题不得不提。推特上有个账号发了一条帖子,开头就是"can I say something without everyone getting mad",结果互动直接炸了,这是在说什么?
这条推文本身内容我们不展开太多,但我觉得它火的原因很典型:AI圈现在有一种微妙的"不敢说真话"的氛围。大家要么被厂商公关话术裹着,要么怕被骂站队,很多真实判断就憋在心里。
你说的这个感受我有。现在评价某个模型好不好,或者某个技术路线对不对,经常会被认为是在为哪个公司站台,讨论质量越来越低。
对,这个帖子的价值不在于说了什么具体的话,而在于戳中了这个情绪——AI圈的公开讨论正在变得越来越表演化,越来越少有人愿意说"我觉得这个东西不行"或者"这个方向我存疑"。
但另一面,这种帖子本身也是一种流量技巧,"我要说个让大家生气的",天然就是个钩子,未必每次背后都有特别硬的观点。
得了吧,你说的也对,但有时候形式和内容可以是分离的。即使是用了这个钩子,如果里面的观点是真实的,那讨论本身还是有价值的。圈子里太需要一些真实的不同意见了。
行吧,这个分歧咱们就保留着。最后说说Fable 5回归这个事——B站上视频互动分700多,大家关注度还挺高的。
这个我们之前聊过的一个背景:Anthropic宣布Fable 5明日回归、连续七天在订阅内,但日常coding和debug回退到Opus 4.8,还有周限额。这次B站视频火,说明用户对这个使用策略还是有很多情绪。
情绪是什么方向的?是高兴Fable 5回来了,还是不满限制太多?
两种都有,但我觉得核心矛盾在于:用户对"旗舰模型"的期待,和Anthropic实际运营成本之间的张力。Fable 5显然是算力重的模型,不可能无限量供应,但用订阅制承诺了"包含在计划内",这个措辞就很容易引起落差感。
而且你说Opus 4.8做coding和debug已经够用了,但用户心里总觉得"给我最好的那个"才是在尊重他们的钱。这是个心理账户问题。
说得很准。而且你看Claude Code这边刚更新了browser能力,用户对整个Claude生态的期望值是在往上走的,这时候说旗舰模型有限额,反差就更大了。
所以Anthropic这个产品节奏蛮有挑战的——一手在技术上往前冲,一手在商业模型上要控成本,用户就夹在中间感受这两种力。
这也不只是Anthropic的困境,OpenAI、Google都一样。只是Anthropic的用户群里有一批重度用户黏性特别强,对这种变动也最敏感,声音就最响。
好,今天这几个话题聊下来,有个贯穿始终的感受:AI圈现在的节奏太快了,工具在迭代、模型在调整、职业逻辑也在变,很难有什么东西是稳定不变的。
对,而且这种快不只是表面的发布节奏快,是底层的——你对这个行业建立的很多预判,过几个月可能就得推倒重来。保持这种认知弹性,可能比追任何具体工具都重要。
说得好。今天就聊到这里,大家好好消化,晚上见。
相关推荐
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。