前沿论文解读·第7期:AI模型对决与Google原生操作系统之争
前沿论文解读·第7期:AI模型对决与Google原生操作系统之争
每周五解读本周最值得关注的AI研究论文
每周五解读本周最值得关注的AI研究论文
欢迎回来,今天咱们前沿论文解读专栏有点东西聊。我这周刷资料差点没刷过来,信息量巨大。
你是不是又熬夜了?眼下那个遮瑕都快挡不住黑眼圈了。
得了吧,你还好意思说我。行,咱们直接进正题。这周我想聊两个大方向,一个是Opus 4.6和GPT-5.3的正面硬刚,另一个是Google那个神秘的Antigravity项目。
这俩话题放一起其实特别有意思,因为它们指向同一个问题——AI的下一步到底往哪走。
那先聊模型对决。Opus 4.6这次把上下文窗口拉到了一百万Token,这个数字我第一次看到的时候是真的震了一下。
先说结论,百万Token的上下文窗口是一个里程碑,但它不是万能药。上下文长不代表用得好,关键看注意力分配机制有没有跟上。
你这么说的话,实测结果确实也印证了。B站有UP主做了全面对比,基础能力上两家其实拉不开差距,Base64解码都答对了。
对,这种基础题已经不是区分旗舰模型的维度了。真正有意思的是中文古典文学那个测试。
长相思那个!我特别喜欢GPT-5.3写的那句「满城花影中」,意境到了。
但你注意到没有,Opus 4.6的「十里春光细雨中」也不差,问题出在「花渐红,杏渐红」的重复感上。这其实暴露了一个深层问题——模型对汉语音韵的理解还是偏表层的模式匹配。
什么意思?展开说说。
就是说它学会了格律的「形」,但对于词牌里情感递进的「神」,把握还不够。GPT-5.3那首之所以读起来更顺,是因为它的意象有层次,从雪到风到柳到花,是一条线。
这个观察角度我没想到。那推理能力呢?改编版农夫过河那个测试我觉得更能说明问题。
这题特别好。两个模型都做对了,但做对的方式完全不同。GPT-5.3走的是速度路线,快速给出正确步骤。Opus 4.6慢,但它用emoji画了状态图。
作为产品经理我必须说,Opus那个交互设计太加分了。用户体验不只是答案对不对,还有呈现方式。
你这就是典型的PM思维。但从研究角度看,这说明两家模型在训练策略上出现了分化——OpenAI更追求效率,Anthropic更注重表达质量。
好,那我们拉到更大的视角。Google这边这周也没闲着,Antigravity这个项目一下子冒出来好几条消息,又是SDK又是操作系统的。
我跟你说,这个Antigravity我研究了两天,越看越觉得Google在下一盘大棋。
先给听众朋友交代一下背景。Google发布了一个叫Antigravity SDK的开发者工具包,同时他们内部有个同名团队在做一个全新的操作系统。
关键词是「AI原生操作系统」。Google已经有Android、ChromeOS、Fuchsia了,还要再做一个,说明现有系统架构承载不了他们想做的事。
你觉得他们想做什么事?
AI Agent的系统级调度。你想,现在的AI助手都是跑在应用层的,受操作系统的权限管理限制很大。如果从OS层面原生支持Agent,那交互范式完全不一样。
这我有体感。我们做AI产品的时候,最头疼的就是权限问题,Agent想帮用户操作手机,结果连通知都读不了。
对,所以Google的思路可能是——与其在旧系统上打补丁,不如从零开始设计一个为AI而生的OS。SDK先放出来让开发者熟悉生态,操作系统跟上,硬件参考设计再跟上。
等一下,我把这两个话题串一下。你看OpenAI和Anthropic在拼模型能力,Google在拼基础设施。这是不是说明大家对AI竞争的理解已经分层了?
你这个观察非常准。模型能力的竞争正在进入平台期,你看Opus 4.6和GPT-5.3在基础测试上已经很难拉开差距了。下一阶段的竞争一定是在系统层和生态层。
所以Google选择在这个时间点推Antigravity,其实是在抢占下一个竞争维度。
没错。模型是引擎,但操作系统是底盘。没有底盘,引擎再强也跑不起来。Google这步棋,说实话,比单纯卷模型参数要高明。
不过我有个担心。Google做新OS的历史成绩嘛,Fuchsia到现在也没大规模铺开。Antigravity会不会又是一个「Google式半成品」?
你可拉倒吧,这次不一样。Fuchsia那时候没有AI这个核心驱动力,现在有了。而且这次是以产品级别发布的,不是实验项目。
好,那我们最后收一下。这周的前沿动态其实指向一个共同趋势。
对,三个关键词:模型能力趋同、竞争维度上移、基础设施重构。旗舰模型之间的差距在缩小,真正的战场正在从模型层转向系统层和生态层。
留一个思考题给大家。如果AI原生操作系统真的来了,我们现在用的App形态还会存在吗?欢迎在评论区聊聊你的想法。
这个问题我有答案,但今天先不说,留到下期。
行,那咱们下期前沿论文解读见。
相关推荐
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿AI行业难得的平静日:信息过载时代的冷思考
当AI行业迎来罕见的平静一天,从业者该如何应对?本文从AINews简报出发,探讨高速发展中的喘息节奏、信息疲劳与内容价值的平衡,以及如何利用平静期进行技术深耕和战略思考。