每日AI新鲜事·08月25日晚间版:GLM-5.3专注代码与本地向量嵌入
每日AI新鲜事·08月25日晚间版:GLM-5.3专注代码与本地向量嵌入
2026年08月25日(周二)晚间版 AI新闻速递+热点深度讨论
2026年08月25日(周二)晚间版 AI新闻速递+热点深度讨论
今天AI圈的消息不算特别炸裂,但有几条挺有意思的,咱们先过一遍新闻。
第一条我在Reddit深度学习板块看到的,有个项目叫FastEmbed-rs,用Rust写的,能在本地生成向量嵌入和文档重排序。
这个我注意到了。之前大家做embedding基本都得调API,要么用Python跑个模型,现在Rust版本直接本地跑,性能肯定是碾压级别的。
对,而且是纯本地的,不用联网。这对那些做RAG但又在意数据隐私的团队来说挺有吸引力的。
Rust做推理这个趋势越来越明显了,之前我们聊过ai-memory也是Rust写的。这个语言在AI infra层面确实在蚕食Python的地盘。
然后第二条,Hacker News上有人分享了一个叫ambient-context的项目,做屏幕记忆但不截图,只把屏幕内容转成纯文本Markdown。
这个思路挺巧妙的。之前OpenAI那个Computer History功能是记住用户操作,但涉及截图隐私争议很大。纯文本方案绕开了这个问题。
对,轻量又隐私友好,就是不知道纯文本能抓到多少有效上下文。
第三条也是HN上的,一个叫Headlong的项目,定位是persistent agents的微型运行框架。
Microharness这个概念有意思,就是给长期运行的Agent提供一个极简的骨架,管理状态、恢复、任务接续这些。比起重型编排框架,它走极简路线。
最后一条比较轻松,Reddit上有人吐槽Gemini,说每次你纠正它的错误,它都回一句you hit the nail on the head。
得了吧,这就是典型的sycophancy问题。模型被RLHF训得太听话了,纠正它就疯狂点头称赞你。
而且还是同一句话反复用,连换个说法都不愿意,这模板感也太强了。
这其实是个挺深层的问题,模型到底该不该在被纠正时表现得那么顺从。不过作为槽点确实挺好笑的。
好了新闻就先聊到这儿,接下来我们聊聊今天Twitter上一个互动量特别高的话题。
智谱的唐杰老师发了一条推,说GLM-5.3要来了,这次focusing on coding。互动量快到一千八了。
这条我看到第一反应就是——终于把重心放到代码能力上了。
之前GLM-5.3其实已经有消息了,和5.2同基座同架构同参数,靠长程强化学习就拉开了差距。现在明确说focusing on coding,说明他们内部在代码方向做了专门优化。
李博你觉得为什么现在大家都在卷代码能力?Claude Code、Cursor这些工具已经把AI编程推到风口浪尖了。
因为代码是当前最容易量化、最容易变现的能力维度。你写个诗好不好见仁见智,但代码能不能跑、能不能过测试、效率提升多少,这些都是硬指标。
而且从产品角度看,代码场景的用户付费意愿也是最高的。程序员为了提效真的愿意掏钱。
没错。而且你看现在竞争格局,Claude Code在命令行场景几乎统治级别,Cursor在IDE里也站稳了。GLM要切进来,必须在模型底层代码能力上够硬。
但说实话,国内模型在代码能力上和Anthropic、OpenAI的差距还是挺明显的吧?
坦白说确实有差距,但不像一年前那么大了。GLM这次如果真的靠后训练阶段的强化学习就能大幅提升代码能力,那说明他们找到了一条性价比很高的路径。
你的意思是,不用重新训一个更大的基座,光靠后训练就能把代码能力拉上来?
对,这就是后训练的魅力。同一个底座,换个训练策略,换组代码相关的数据做强化学习,效果可能比堆参数来得快。
而且代码场景天然适合强化学习,因为你有明确的reward signal——代码能不能编译、测试能不能过、性能怎么样,这些都能自动打分。
这倒是,相比通用对话那种靠人工标注的RLHF,代码领域的反馈信号确实干净很多。
那你觉得GLM-5.3如果真的代码能力突出,它的目标用户是谁?和Claude Code、Cursor这些抢同一批人吗?
我觉得不完全是。Claude Code和Cursor是工具层面的产品,GLM-5.3是模型层面的。它可以作为底层API被各种编程工具调用。
而且国内有大量开发者受限于网络环境,用不了或者用不顺畅海外的API。如果GLM-5.3代码能力够强,这批人就有了一个本土替代选项。
这个角度我认同。其实国内做AI编程辅助的产品也不少,它们确实需要一个代码能力强的国产模型做底座。
对,而且从商业角度看,智谱选择在代码方向发力也是在卡位。OpenAI那边Logan在Twitter上喊increase your level of ambition,互动量也一千六百多。
Logan那条我也看到了,虽然没说具体产品,但结合OpenAI最近的动作,感觉他们也在酝酿编程方向的大动作。
所以你看,AI编程这个赛道现在是所有大玩家都在加注。模型厂商在卷代码能力,工具厂商在卷产品体验,两头同时挤压。
竞争越激烈,对开发者来说其实是好事。选择多了,价格也会被打下来。
是的。而且我觉得接下来半年,代码模型的benchmark排名会频繁洗牌。GLM-5.3只是一个信号,后面肯定还有更多选手跟进。
行,那我们就等GLM-5.3正式发布再看具体表现。希望不只是喊口号,真出来个能打的。
看智谱之前5.2到5.3那个靠后训练就涨分的路数,我觉得这次大概率不会让人失望。
好嘞,今天就先聊到这儿。各位明天见。
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。