Claude新模型泄露、AI自主设计蛋白质,本周AI大事盘点

本周AI领域再度迎来密集更新。从疑似泄露的Anthropic下一代模型,到OpenAI暂停前沿强化学习训练,再到Claude自主设计蛋白质结合剂的突破性实验,多条重磅消息接连出现。本文对这些进展逐一梳理,并分析其背后的行业信号。
注:原始素材中部分产品名称(如"Fable""Astra""Cloud"等)疑似为语音转录导致的误译,结合上下文,本文推测其实际指向Anthropic的Claude系列模型与OpenAI的下一代模型,特此说明。
Claude下一代模型疑似进入灰度测试
据爆料,Anthropic下一代模型(推测为Claude的小版本升级)目前正处于内部红队测试阶段,这意味着距离正式发布可能已经很近。红队测试(Red Teaming)源自冷战时期的军事演习术语,美军用"红队"代表假想敌进行对抗推演。在大模型领域,红队测试已成为发布前的标准流程,红队成员通常包括安全研究员、伦理学家和领域专家,他们会系统性地尝试越狱攻击(jailbreak)、提示注入(prompt injection)和社会工程学手段,试图诱导模型生成有害内容、测试其在敏感场景下的表现,以及评估模型可能被滥用的风险。有迹象显示,部分选择当前旗舰模型的Claude网页应用账户,在后台被悄悄切换到了不同的模型,而这种测试很可能也已扩展到Claude Code。

有意思的是,Anthropic此前多次采用这种"灰度推出"策略——在广泛发布前先对小范围用户放量测试。灰度发布(也称金丝雀发布,名称源自矿工携带金丝雀入矿井以检测有毒气体的做法)是软件工程中的渐进式部署策略,先将新版本推送给极小比例的用户,通过监控这些用户的体验数据和系统指标来发现潜在问题,再逐步扩大范围。Anthropic将灰度发布与红队测试深度结合,形成了一套独特的模型验证流程——既能在真实流量中验证模型性能、获取真实用户交互数据,又能在出现问题时将影响范围控制到最小,同时保持对风险暴露面的精确控制。上一代旗舰在正式发布当天,也经历了极其类似的灰度阶段。因此,尽管官方尚未确认,但从测试信号强度来看,新模型的发布可能就在近期。
更耐人寻味的是技术层面的证据:来自Claude服务端"思考协议缓冲区"的一个字段,似乎暴露了生成响应的实际内部模型代号,即便模型选择器和API仍然显示为当前版本。其底层采用的Protocol Buffer(protobuf)是谷歌在2001年内部开发并于2008年开源的一种高效数据序列化格式,相比JSON或XML,protobuf的编码效率高3到10倍,这对于需要在毫秒级延迟内处理数十亿请求的大模型推理系统至关重要。当研究人员发现缓冲区中包含的内部模型代号与前端显示不一致时,实际上暴露了后端模型路由系统的运作方式。模型路由系统(model router)是大规模AI服务架构中的关键组件,负责根据预设策略将用户请求分配到不同版本的模型实例上——服务端可以在不改变用户界面显示的情况下,将请求静默转发到不同版本的模型进行A/B测试。这类代号可能是部署修订版,也可能就是新一代模型本身。当然,在官方正式确认之前,这些仍属推测。
OpenAI暂停前沿RL训练:安全信号值得关注
本周另一则引发广泛猜测的消息来自OpenAI:该公司透露已暂时暂停基于最新部署模型的强化学习训练两周,其规模最大的前沿RL运行也处于暂停状态。

这里的强化学习(Reinforcement Learning, RL)特指在大模型预训练完成后,通过人类反馈强化学习(RLHF)或其他奖励机制进一步提升模型能力的训练阶段。RLHF的典型流程包括三个步骤:首先收集人类对模型不同输出的偏好排序,然后训练一个奖励模型来预测人类偏好,最后使用近端策略优化(PPO)等算法让模型在奖励信号引导下自我改进。前沿RL运行(frontier RL run)是指使用最大规模计算资源、针对最先进模型进行的强化学习训练,通常涉及数千甚至上万块GPU的集群。此次暂停的原因相当严肃——OpenAI认为其即将推出的模型可能已经触及关键的网络安全能力阈值。
这一阈值对应OpenAI自身制定的《准备框架》(Preparedness Framework)中的分级标准。该框架发布于2023年12月,是业内首个将模型风险评估系统化的公开框架,将模型在网络安全、生物威胁、说服力和自主性等维度的风险划分为低、中、高、关键四个等级。框架建立了由安全系统团队、准备团队和外部审计组成的多层评估机制。当模型能力达到"高"级别时,需要额外的安全审查和缓解措施才能继续训练或部署。此次暂停是这一框架在实践中的一次重大触发,值得注意的是,此次暂停也可能与美国AI安全研究所(AISI)的评估合作有关,该机构在多家前沿实验室的模型发布前参与安全评估。暂停表明大模型的攻击性网络安全能力——如自主发现漏洞、编写利用代码、进行渗透测试——已经发展到了令开发者自身感到需要谨慎对待的程度。
官方声明意味着,这些模型已强大到需要在进一步推进前,建立更完善的安全监控与保障机制。具体措施包括:隔离高风险工作负载、加强研究环境、扩大对齐训练,以及对前沿模型引入更积极的监控。据称,新的监控要求适用于具备较强能力或工具使用能力的模型,而下一代旗舰将受到更严格对待。
消息一出,外界普遍猜测新旗舰是否会因此延期。但Sam Altman随后在X上澄清:新旗舰是一个非常出色的模型,此次暂停的影响只针对更远期的发布。这个区分至关重要——它表明近期即将发布的模型并未被推迟,反而可能暗示其能力已足够强大。
Claude自主设计蛋白质结合剂:AI药物发现的里程碑
本周最具震撼力的消息,来自Anthropic在科学领域的一次实验。研究人员给Claude下达了一个任务:从零开始设计一种新型蛋白质结合剂——这是开发能附着并影响体内特定靶点药物的关键早期步骤。

蛋白质结合剂(protein binder)是一种能够特异性识别并结合目标蛋白质的分子,是药物发现流程中的关键环节。传统药物开发中,找到一个合适的结合剂通常需要数月甚至数年的实验迭代,涉及分子动力学模拟、文库筛选、结构优化和体外验证等复杂步骤,成本往往高达数百万美元。近年来,DeepMind的AlphaFold解决了蛋白质结构预测问题,David Baker实验室开发的RoseTTAFold和ProteinMPNN则推动了从头蛋白质设计(de novo protein design),Baker也因此获得2024年诺贝尔化学奖。
结果令人惊讶:在15个生物靶点中,Claude成功为其中14个自主设计出了结合剂。这些结合剂随后由Adaptive Biotechnologies和Twist Bioscience两家外部生物技术公司实际构建并测试。Adaptive Biotechnologies是一家专注于免疫驱动医学的上市生物技术公司,利用免疫系统的自然适应性开发诊断和治疗工具;Twist Bioscience则以其硅基DNA合成平台闻名,能够在微型芯片上高通量制造定制DNA序列、蛋白质和抗体。两家公司的参与为实验结果提供了独立的第三方验证。整个过程中,模型自己构建工具,几乎唯一的人类干预就是不断告诉它"继续"。值得一提的是,15个靶点中14个的成功率在传统计算蛋白质设计领域属于极高水平——Claude的突破在于,它并非一个专门训练的蛋白质设计模型,而是一个通用语言模型通过调用现有工具和推理能力完成了这一任务,即使是专门为蛋白质设计开发的工具,也难以保证如此高的一致性命中率。这暗示通用智能在科学发现中的潜力可能远超预期。
更有意思的是,长达约1.6万字的提示中,很大一部分并非生物学专属内容,而是聚焦于长时程(long-horizon)代理行为——即如何让模型在扩展任务中长时间自主操作。长时程代理行为是当前AI研究中最具挑战性的方向之一,与单次问答不同,长时程任务要求模型在数小时甚至数天的时间跨度内保持目标一致性、管理上下文状态、处理中间失败并自主调整策略。其核心难点包括多个层面:首先是上下文管理问题,即使Claude拥有20万token的上下文窗口,在数小时的连续任务中产生的信息量也可能远超这一限制,模型必须学会选择性记忆和遗忘;其次是规划与回溯能力,当某一步骤失败时,代理需要判断是重试当前步骤还是回溯到更早的决策点重新规划;再次是错误累积效应,一个早期错误可能在后续步骤中被不断放大;最后是工具链编排,在蛋白质设计任务中,Claude需要自主决定使用哪些计算工具、以何种顺序调用、如何解读中间结果。Anthropic在提示工程中大量关注这一维度而非单纯的生物学知识注入,说明他们认为通用的代理规划与执行能力才是解锁专业领域应用的瓶颈。这也与当前业界的"能力涌现"观察一致——足够强的通用推理能力可以在无需专门训练的情况下迁移到特定领域。
需要强调的是,这并不意味着AI已经能治愈癌症。但它确实标志着一个重要信号:通用AI模型开始在狭窄却极其重要的科学领域,展示出真正强大的能力,且无需专门的模型微调。这才是真正开创性的部分。
Claude Code与Claude应用的实用升级
除了重磅研究,Anthropic也为Claude Code带来一系列实用改进:
- 使用限制提升50%:每周使用限制大幅提升,延长至8月底,并有望永久化
- 启动速度翻倍:桌面版启动速度较一个月前快约两倍
- GPU占用优化:CLI在P99场景下的GPU占用也减少约两倍
这里的P99是性能监控中的常用指标,指第99百分位数——即99%的请求的GPU占用低于该值。P99场景通常代表系统在高负载下的极端情况,该指标的优化意味着Claude Code在最繁重工作负载下的资源消耗也得到了显著改善。
最亮眼的更新是处于研究预览阶段的"设计技能"——用户可在Claude Code中使用Design命令生成可编辑的UI草稿,选定设计并微调后,让Claude直接将其实现到应用中。这一功能本质上将设计-开发工作流压缩为单一对话流程,消除了设计师与开发者之间的交接摩擦。
此外,Claude网页应用获得了对Gmail和Google Drive的更深访问权限。现在Claude可以直接在对话中起草、发送邮件,并管理Google Drive中的文件,同时保留用户对关键操作的批准权。这种"人在回路"(human-in-the-loop)的设计确保AI在执行不可逆操作(如发送邮件)前必须获得用户明确授权,在赋予AI行动能力的同时维持用户对关键决策的最终控制权。该功能正向所有付费计划推出,标志着Claude从聊天机器人向真正的AI助手迈进了一大步。
Gemini大更新:迈向桌面代理
谷歌方面也在密集准备Gemini的多项升级。

据报道,Gemini Live将获得新的"引导视觉"模式,通过摄像头实时视觉引导用户操作应用。这一功能依赖于多模态大模型同时处理视频流和语音输入的能力,模型需要实时理解摄像头画面中的界面元素、识别用户当前操作的上下文,并以自然语言提供即时指导。Gemini应用预计将新增类似Notebook的"项目"功能,方便用户对文件、指令和对话进行分组管理;其代理组件也可能获得独立的记忆系统,使代理能够跨会话保持对用户偏好和历史任务的记忆,而非每次对话都从零开始。
更值得关注的是,谷歌的"计算机使用"(Computer Use)功能被发现正在Gemini桌面应用中测试——这意味着Gemini将能够控制其他应用程序,并访问用户明确授权的文件夹。所谓计算机使用,是指AI模型通过模拟鼠标点击、键盘输入和屏幕截图读取等方式,像人类用户一样操作图形界面。这一能力最早由Anthropic在2024年10月的Claude 3.5 Sonnet更新中推出,随后迅速成为各大模型厂商竞相追赶的方向。其技术实现通常包含三个核心模块:屏幕理解模块将GUI截图解析为结构化的界面元素描述,决策模块基于当前状态和目标任务规划下一步操作,执行模块将模型输出转化为实际的系统级输入事件。据称谷歌还在添加高级备份选项,可在Gemini修改文件前自动备份至Google Drive。这正是AI代理开始在个人电脑上采取实际行动所需要的安全保障——当AI可以直接操作文件系统和应用程序时,自动备份成为防止误操作的最后一道防线,本质上为AI的每一次操作创建了一个可回滚的检查点。这标志着Gemini从"回答问题"向"桌面代理"的转变。
其他值得关注的AI进展
无审查本地模型
Qwen 3系列衍生出针对Apple Silicon优化的本地MLX构建(拒绝移除版本),提供2/4/6/8位量化选项,无需依赖云端。MLX是苹果专门为Apple Silicon芯片(M系列处理器)开发的机器学习框架,于2023年底开源,充分利用了苹果统一内存架构(Unified Memory Architecture)的优势——CPU和GPU共享同一物理内存池,省去了传统架构中CPU内存与GPU显存之间的数据拷贝开销,使得在Mac设备上高效运行大模型成为可能。量化(Quantization)则是一种模型压缩技术,通过降低模型权重的数值精度(如从32位浮点数降至4位整数)来大幅减少内存占用和计算量。具体而言,2位量化意味着每个权重仅用2比特表示,一个原本需要64GB内存的模型可能压缩至不到4GB,虽然精度损失较大但模型体积极小,适合内存受限的设备;4位量化在当前实践中被广泛认为是质量损失可接受的最低精度,是社区最常用的选择;8位量化则在质量和效率之间取得最佳平衡,精度损失几乎不可察觉。所谓"拒绝移除版本"是指通过微调去除了模型内置的安全拒绝机制,使模型不会拒绝回答特定类型的请求。这类模型在安全研究、创意写作等部分场景下降低了使用门槛,但用户务必阅读免责声明并注意合规风险。
开源多代理工作空间
Hermes重新引入了机器人模式,可视为Grok开源替代方案。用户能创建多个带有独立角色、模型、记忆和工具的命名机器人,且这些机器人之间可相互通信、协调任务——例如一个负责研究、一个负责编码、一个负责规划,在同一环境中协同工作。这种多代理协作架构是分布式人工智能的经典研究方向,其理论根基可追溯到1980年代的分布式AI研究。核心思想是将复杂任务分解给多个具有不同专长的自主代理,通过通信和协调机制实现整体目标。在大模型时代,每个代理可以是一个独立的LLM实例,配备不同的系统提示来定义角色和行为、选择不同的底层模型以匹配任务特性(例如研究代理使用擅长信息检索的模型,编码代理使用擅长代码生成的模型)、维护独立的记忆系统保持上下文连贯,以及接入专用的工具集如代码执行器、搜索引擎或数据库。这种架构的优势在于整体系统的能力远超单一模型——各代理可以并行工作、交叉验证输出结果,同时也更容易调试和扩展,因为可以独立替换或升级某个代理而不影响整体系统。
推理芯片新突破
Cerebras推出的CS4号称是目前最快的AI推理硬件,据称最终可运行高达10万亿参数模型,速度约每秒1000个token。Cerebras的标志性技术是晶圆级引擎(Wafer-Scale Engine)——传统芯片制造将一片300毫米硅晶圆切割为数百个独立芯片,而Cerebras将整片晶圆作为单个处理器使用,面积约为NVIDIA最大GPU的56倍。CS4基于第四代架构,集成了数百万个AI优化核心和大规模片上SRAM(静态随机存取存储器)。SRAM的访问速度比GPU常用的HBM(高带宽内存)快一个数量级以上,这使得Cerebras在推理场景下能够极大缓解"内存墙"瓶颈。所谓内存墙是指处理器运算速度的增长远快于内存访问速度的增长,导致大部分计算时间实际花在等待数据读取上。AI推理的核心瓶颈正在于内存带宽而非计算能力:生成每个token时,模型的全部参数都需要从内存中读取一次,因此内存读取速度直接决定了推理速度的上限。对于10万亿参数的模型,即使以低精度存储也需要数十TB的内存容量和极高的带宽。如果能在该规模真正交付,每秒1000个token的推理速度意味着用户几乎不需要等待响应——相当于每秒输出约750个英文单词,远超人类阅读速度。这意味着AI代理可以在几秒内完成原本需要数分钟的思考和规划过程,将从根本上改变编码代理和长时程工作流的运作方式,使得"AI思考比人类阅读更快"成为现实。
结语
综合本周动态可以看出几条清晰的主线:模型能力仍在快速逼近前沿,以至于安全对齐成为大厂不得不主动踩下的刹车;AI代理正从对话走向真实操作,无论是Claude接管邮件、Gemini操作桌面,还是Claude自主设计药物分子,都指向同一个方向——AI正在从"回答问题"进化为"完成任务"。而这一趋势背后,能否守住安全底线,将成为下一阶段行业竞争的核心议题。
核心要点
核心要点
相关推荐

LynnReal-Omni:32B统一视频扩散模型开源,四步生成多任务全覆盖
LynnReal-Omni 是基于 MiniMax H3 架构的 32B 统一视频扩散模型,支持文生视频、图生视频、姿态引导、视频修复等多任务,四步快速生成,Flash 版单张 H100 上 377ms 完成 540p 视频,权重与 ComfyUI 节点已开源。

Anthropic联合创始人:AI"紧急停止开关"或应强制立法
Anthropic联合创始人向BBC表示,AI系统的"紧急停止开关"(kill switch)可能需要通过法律强制推行。本文分析这一呼吁背后的产业逻辑、技术挑战以及监管与创新之间的张力。

AI数据中心建设热潮,正冲击工业创伤深重的城市
AI数据中心建设热潮正与曾受重工业创伤的城市社区激烈碰撞。以费城为例,全国性反对声浪聚焦能耗、水资源与环境公平问题,揭示AI增长与地方利益的结构性冲突。