蛋白质设计新范式:机器学习如何突破自然序列限制

从模仿到创造:蛋白质设计的范式转变
蛋白质设计领域正在经历一场深刻的变革。蛋白质是由氨基酸序列折叠成特定三维结构的生物大分子,是生命活动的主要执行者。蛋白质设计指的是通过计算方法预测和设计特定氨基酸序列,使其折叠成预期的三维结构并实现目标功能。蛋白质折叠本身是生物学中最核心的问题之一——1972年诺贝尔化学奖得主Christian Anfinsen提出了著名的热力学假说:蛋白质的天然三维结构完全由其氨基酸序列决定,对应于吉布斯自由能的全局最小值。然而,Cyrus Levinthal随后指出了"Levinthal悖论"——如果一个蛋白质随机搜索所有可能的构象,即使每个构象只停留飞秒级时间,也需要超过宇宙年龄的时间才能找到正确折叠。这意味着蛋白质折叠遵循特定的动力学路径,而非随机搜索。理解这一过程对蛋白质设计至关重要,因为设计的序列不仅需要热力学上稳定,还需要在动力学上能够高效地折叠到目标构象。
传统的计算蛋白质设计方法往往依赖于对自然界已存在序列的模仿和优化——从自然界已知的约20万个蛋白质结构中学习规律。这种思路虽然稳妥,却也限制了人工蛋白质的创新空间。理论上20种天然氨基酸可以组成的序列空间是天文数字,对于一个100个氨基酸的蛋白质,可能的序列组合达到20^100种(约为10^130,远超可观测宇宙中原子的总数10^80),而自然进化只探索了其中极小的一部分——据估计地球上所有已存在过的蛋白质序列不超过10^50种。
最新的机器学习框架打破了这一束缚,将目标从"复现自然"转向"超越自然",为合成生物学和药物设计开辟了全新的可能性。

这一转变的核心在于重新定义设计目标:不再将自然序列视为唯一的标准答案,而是把功能实现作为最终评判标准。这意味着研究者可以探索自然进化未曾触及的序列空间,设计出具有全新特性的蛋白质分子。
机器学习框架的核心技术突破
新的蛋白质设计框架在多个维度上实现了创新。近年来,深度学习技术在蛋白质领域取得了革命性突破。AlphaFold2在2020年解决了蛋白质结构预测这一50年难题,能够从序列准确预测三维结构——在CASP14竞赛中达到了实验级别的预测精度,中位GDT分数超过92(满分100)。在此基础上,新一代蛋白质设计工具如RFdiffusion、ProteinMPNN等采用了扩散模型和图神经网络等先进架构。
扩散模型(Diffusion Models)最初在图像生成领域大获成功(如DALL-E和Stable Diffusion),其核心思想是通过正向过程逐步向数据添加噪声直至变为纯随机噪声,然后训练神经网络学习反向去噪过程。在蛋白质设计中,RFdiffusion将这一概念应用于三维蛋白质结构:从随机的原子坐标出发,逐步去噪生成物理上合理的蛋白质骨架结构。图神经网络(GNN)则特别适合处理蛋白质的结构数据——蛋白质可以自然地表示为图,其中氨基酸残基为节点,空间接触关系为边。ProteinMPNN利用消息传递神经网络(Message Passing Neural Network)在给定骨架结构的条件下预测最优氨基酸序列,本质上解决的是"逆折叠"问题。这两种技术的结合形成了强大的设计管线:先用扩散模型生成骨架,再用GNN设计序列。这些模型不再简单地从自然序列中插值,而是学习了蛋白质折叠的物理化学规律,能够生成训练数据之外的全新序列。
评价体系的根本转变:框架不再将"与自然序列的相似度"作为主要优化指标,而是直接针对蛋白质的稳定性、功能性等物理化学性质进行优化。传统蛋白质设计采用基于同源性的方法,通过序列比对(如BLAST、HMM-profile)和进化信息(如多序列比对中的共进化信号)来指导设计,其核心假设是相似的序列具有相似的结构和功能,这将设计空间限制在已知序列的邻域内。新框架则采用从头设计(de novo design)策略,直接以物理化学性质为优化目标:包括折叠自由能(蛋白质折叠态与展开态之间的能量差,典型值为5-15 kcal/mol)、溶剂可及表面积、氢键网络、疏水核心的紧密度等可计算的量化指标。这意味着即使一个序列与任何天然蛋白质相似度很低,只要它在物理上稳定且功能正确,就是成功的设计。
值得注意的是,从头设计与另一种主流蛋白质工程方法——定向进化(directed evolution)形成互补。2018年诺贝尔化学奖授予了Frances Arnold以表彰其在定向进化领域的开创性工作。定向进化模拟自然进化过程:对已知蛋白质进行随机突变,然后通过高通量筛选选择性能改善的变体,重复多轮。这种方法的优势在于不需要理解蛋白质的结构-功能关系,但受限于起始序列的邻域。从头设计则从零开始,不依赖于任何天然模板,理论上可以访问整个序列空间。当前最前沿的策略是将两者结合:先用计算方法从头设计候选序列,再通过定向进化进行微调优化,既保证了创新性又提高了实用性。
这种评价体系的转变看似微小,实则彻底改变了搜索空间的维度,使得设计空间从自然序列的局部邻域扩展到整个理论可行的序列空间。
智能约束机制:框架引入了新的约束机制,能够在保证设计结果可实验验证的前提下,最大化探索非自然序列的潜力。传统方法往往因为过度保守而错失创新序列,而新框架通过更精准的可行性预测,显著提高了蛋白质设计的成功率。
提升设计成功率的关键策略
负样本学习:从失败中提炼规律
成功率的提升来自于对失败案例的深度学习。负样本学习是机器学习中的重要概念,在蛋白质设计中尤为关键。传统训练数据主要包含天然蛋白质(正样本),但缺乏失败案例(负样本)的系统性记录。框架不仅分析成功的设计案例,更重要的是系统性地研究了那些在实验中失败的设计,识别出导致失败的序列特征和结构模式——如容易形成聚集的疏水片段、破坏折叠路径的脯氨酸分布、引起免疫原性的表位等。
从技术实现上,对比学习(Contrastive Learning)是实现负样本学习的核心范式,其思想是通过拉近正样本对的表征距离、推远负样本对的表征距离来学习有意义的特征。在蛋白质设计中,这意味着模型学习将成功折叠的序列-结构对映射到表征空间的相近位置,将失败案例映射到远离的位置。具体的失败模式包括:蛋白质聚集(疏水残基过度暴露在表面导致分子间非特异性结合,形成无功能的聚集体,这是蛋白质药物开发中最常见的失败原因之一)、错误折叠(序列折叠为非目标构象)、以及表达失败(mRNA中的稀有密码子导致核糖体暂停,触发蛋白质质量控制机制而被降解)。系统记录和分析这些失败模式,构建高质量的负样本数据库,对于训练更鲁棒的设计模型至关重要。
这种"负样本学习"使模型不仅知道什么是好的设计,更重要的是明确知道什么应该避免,从而能够更准确地判断哪些非自然序列具有实际可行性。在实践中,这将设计成功率从早期的5-10%提升到了现在某些应用场景下的50%以上。
多目标优化策略
蛋白质设计需要同时满足多个约束条件,这在数学上构成了一个多目标优化问题——各目标之间往往存在帕累托冲突(Pareto trade-off),即改善一个目标可能导致另一个目标恶化:
- 稳定性:确保蛋白质在目标环境中保持折叠状态。稳定性可以通过热稳定性(熔解温度Tm)和化学稳定性(对变性剂的抵抗能力)来量化,通常通过差示扫描量热法(DSC)或圆二色谱(CD)进行实验测量
- 可表达性:保证序列能在宿主细胞中高效表达。这涉及多个层面的生物学约束:密码子优化(不同生物体对特定密码子的偏好不同)、mRNA稳定性(避免形成二级结构导致翻译效率低下)、翻译后修饰(如二硫键形成需要特定的细胞环境)、蛋白质折叠的细胞机制(需要伴侣蛋白如GroEL/GroES的协助)等。在大肠杆菌、酵母、哺乳动物细胞等不同表达系统中,这些约束各不相同
- 功能性:实现预期的催化、结合或调控功能。功能性的预测是最具挑战性的环节,因为蛋白质功能通常取决于少数关键残基的精确空间排列(如酶活性位点中催化三联体的几何构型)
新框架通过整合宿主特异性的表达数据和更智能的权衡机制——如帕累托前沿搜索算法和多目标进化策略——能够针对目标表达系统优化序列,避免了传统方法中常见的"顾此失彼"问题,在多个目标之间找到最优平衡点。
对合成生物学和药物设计的深远影响
这一框架的意义不仅在于技术层面,更在于它拓展了蛋白质工程的想象边界。非自然蛋白质的独特优势在于它们不受自然进化约束的限制。自然进化是在特定环境压力下的优化过程,存在历史包袱(进化过程中积累的中性或弱有害突变)和局部最优陷阱(蛋白质的适应度景观中存在大量局部极值,自然进化难以跨越适应度低谷到达全局最优)。例如,大多数天然酶在37°C和中性pH下工作,因为这是生物体的内环境,但工业应用常需要高温、强酸碱或有机溶剂环境。
当设计不再受限于自然序列的模板,研究者可以针对特定应用场景定制全新的生物分子:
- 工业应用:设计更高效、更耐受极端条件的工业酶。非自然蛋白质可以针对这些极端条件从零设计,不需要妥协于生物体内的其他功能要求。例如,洗涤剂行业需要在高温碱性条件下工作的蛋白酶和脂肪酶,生物燃料行业需要能在高温下分解纤维素的纤维素酶,这些应用场景与天然酶的进化环境截然不同
- 医药领域:开发更精准的药物载体和治疗性蛋白质。非自然蛋白质还能避免与人体天然蛋白的交叉反应,提高治疗的特异性和安全性。当前治疗性蛋白质(如单克隆抗体)市场规模已超过3000亿美元,而从头设计的蛋白质药物有望解决传统抗体药物在组织穿透性、稳定性和生产成本方面的局限性。例如,David Baker团队设计的从头蛋白质已进入临床试验,用于流感和新冠病毒的预防
- 基础研究:构建具有全新催化机制的人工酶。某些全新的化学反应在自然界中不存在(如点击化学中的叠氮-炔烃环加成、碳氟键形成、非天然氨基酸的选择性修饰等),设计能催化这些反应的人工酶需要突破自然序列空间。这一方向与合成生物学中"正交生物系统"的概念相呼应——创建与天然生物系统互不干扰的全新生化通路
从长远来看,这种"超越自然"的设计理念可能会催生一个全新的蛋白质库,其中包含自然进化从未产生过的功能模块。这些非自然蛋白质可能在极端环境耐受性、催化效率、特异性识别等方面展现出超越天然蛋白质的性能。
当前挑战与未来研究方向
尽管前景广阔,这一方向仍面临诸多挑战:
实验验证瓶颈:每一个非自然序列的设计都需要通过实验来确认其功能,而高通量实验技术的发展速度尚未完全跟上计算设计的步伐。当前最先进的技术包括:酵母展示(yeast display)可以筛选10^8-10^9个变体、噬菌体展示(phage display,George Smith因此获得2018年诺贝尔化学奖)用于抗体和肽段的筛选、微流控芯片实现单细胞水平的功能检测、以及新兴的DNA编码化合物库(DEL)技术。然而,这些方法的通量相比计算设计能力仍然有数个数量级的差距——先进的生成模型可以在数小时内产生数百万个候选序列,但实验验证每个序列可能需要数周(包括基因合成、蛋白质表达纯化、结构和功能表征等步骤)。这种不匹配导致了实验验证成为创新周期的限速步骤。
预测准确性:对于偏离自然序列较远的设计,其行为预测的准确性仍有待提高。这一挑战的根本原因在于训练数据的分布偏移问题——当前所有模型都是在自然蛋白质数据上训练的,当设计的序列远离训练数据分布时,模型的外推能力(extrapolation)本质上是不可靠的。分子动力学模拟可以作为补充验证手段,但对于大型蛋白质系统,达到生物学相关时间尺度(微秒到毫秒)的全原子模拟仍然计算成本极高。
未来的研究方向可能包括:
- 将框架与自动化实验平台深度整合,形成"设计-合成-测试-学习"(DBTL)的闭环。这一闭环的核心是主动学习(Active Learning)策略——算法根据已有实验结果,智能选择下一批最具信息量的候选序列进行实验,而非盲目测试。贝叶斯优化是常用方法,通过构建替代模型估计序列空间中每个点的预期改善量,优先测试不确定性高且预期性能好的区域,可以将所需实验次数减少一到两个数量级。结合云端自动化实验室(如Emerald Cloud Lab)和AI驱动的自驱动实验室(self-driving lab)概念,未来有望实现真正的闭环自动化设计
- 开发更精细的物理模型来指导非自然序列的探索,包括结合量子力学/分子力学(QM/MM)方法提高活性位点设计的精度,以及利用增强采样技术更准确地评估折叠自由能景观
- 建立非自然蛋白质的性能评估标准体系,包括统一的基准测试集(benchmark)、标准化的实验验证流程,以及开放的数据共享平台,使不同研究组的成果可以公平比较和积累
这一框架的出现标志着蛋白质设计从"工程学"向"创造学"的转变。自然进化虽然伟大,但并非序列空间的全部——在那些未被进化触及的角落,可能隐藏着更多等待发现的可能性。正如合成化学在20世纪让人类超越了天然产物的限制,创造出无数自然界不存在的药物和材料,计算蛋白质设计可能在21世纪实现同样的突破——让我们不仅能读懂生命的分子语言,更能用这种语言书写全新的篇章。
核心要点
核心要点
相关推荐

tiun.:为AI开发者打造的一站式认证与支付系统
登顶 Product Hunt 的 tiun. 为 AI 开发者提供认证、支付、账单、客户数据与分析的一体化系统,一条命令即可安装,帮助开发者当天上线付费产品。本文解析其定位、卖点与竞争格局。

Voiskey:能读懂语境的AI语音输入工具
Voiskey是一款登上Product Hunt排名第3的AI语音输入工具,能根据场景和读者自动调整语气,比打字快5倍,支持iOS、macOS、Android、Windows四大平台及100多种语言。

Axari:让AI分身接管你的安全运营琐事
Product Hunt新品Axari主打「AI分身」概念,帮安全团队自动处理重复性运营琐事,可在Slack、MS Teams中指派目标并自主推进任务。本文解析其产品逻辑、行业定位与需要冷静看待的问题。