生成式蛋白质设计
01概述和价值链
标记:[EC: De Novo Protein Engineering | OECD: biotech-health | Regulator: FDA (美国), NMPA (中国), EMA (欧盟)]
生成式蛋白质设计代表了现代生物技术中最根本的范式转变之一。与预测生物学(计算天然存在的序列的3D结构,例如AlphaFold)不同,生成式设计从头(de novo)构建蛋白质。利用超过千亿参数的先进扩散模型和蛋白质大型语言模型(LLM),科学家可以通过计算设计非天然的3D结构及其对应的氨基酸序列,以解决特定的医疗、工业或生态挑战。这种计算方法绕过了数百万年的进化,使创建超紧凑微型结合体(通常为50-80个氨基酸)、自组装纳米颗粒疫苗和高度稳定的人工生物催化剂成为可能。该技术将从靶标识别到功能原型的时间从数年大幅缩短至数周,结合亲和力比经典单克隆抗体高出几个数量级。
生成式蛋白质设计的主要方向是:
- 主链扩散模型 (Backbone Diffusion Models): 利用数学扩散过程(例如RFdiffusion或Chroma),通过生物物理约束引导,从随机原子坐标图中迭代去噪,以产生稳定的蛋白质主链。
- 蛋白质大型语言模型 (Protein LLMs): 在数亿个天然蛋白质序列上训练Transformer网络(例如xTrimo或ESM),以生成功能变体并预测突变稳定性。
- 蛋白质反向折叠 (Inverse Protein Folding): 部署ProteinMPNN等神经网络,计算能在热力学上折叠成生成的3D主链的最佳氨基酸序列。
- 从头生物传感器 (De Novo Biosensors): 设计定制的高对比度发光蛋白质开关(例如LucCage),在检测到特定病毒或生物标志物靶标时立即发光。
行业价值链
[Backbone Generation] ──> [Sequence Design] ──> [Gene Synthesis] ──> [Yeast Display]
│
(Protein Optimization)
│
▼
[Clinical Application] <─── [SPR Validation] <─────┘价值链层级
| 层级 | 描述 | 关键输入/输出 |
|---|---|---|
| 1. 主链生成 | 使用扩散模型从头设计3D结构支架以匹配目标几何形状 | 输入: 3D目标结构(表位)。 输出: 生成主链的3D坐标。 |
| 2. 序列设计 | 使用反向折叠计算PDB主链的最佳氨基酸序列 | 输入: 生成的3D主链。 输出: 氨基酸序列。 |
| 3. 基因合成 | 化学合成编码de novo蛋白质的DNA寡核苷酸 | 输入: 氨基酸序列。 输出: 物理DNA质粒文库。 |
| 4. 酵母展示 | 用DNA文库转化酵母细胞以在细胞表面表达生成的蛋白质 | 输入: DNA文库,酵母细胞。 输出: 表达新型蛋白质的酵母文库。 |
| 5. FACS筛选 | 通过机器人分选出与荧光标记靶标强结合的细胞 | 输入: 酵母文库,靶标分子。 输出: 表现最佳的酵母克隆。 |
| 6. SPR验证 | 使用表面等离子体共振测量精确的结合动力学和亲和力 | 输入: 纯化的蛋白质。 输出: 表征后的结合体。 |
该领域的跨领域技术:
- 大规模平行筛选: 整合机器人FACS和高通量测序,同时评估数百万个de novo设计。
- MoClo (模块化克隆): 将数千个DNA片段标准化、高效地组装到表达载体中。
- 深度学习硬件: 依赖大型GPU/TPU集群(如Nvidia H100s)来运行计算量极大的扩散和语言模型。
02美国
美国在生成式蛋白质设计领域占据主导地位,这得益于蛋白质设计研究所(IPD)的巨大重大学术突破以及资本雄厚的生物技术衍生公司。
基础AI模型、临床转化、高通量筛选
- Institute for Protein Design (IPD): de novo设计的全球中心,开创了RFdiffusion和ProteinMPNN等开源架构。
- Generate:Biomedicines: 将Chroma平台商业化,以推进大量de novo治疗蛋白质进入人类临床试验。
- A-Alpha Bio: 提供蛋白质-蛋白质相互作用的超高通量图谱,这对于生成训练下一代预测模型所需的海量数据集至关重要。
03中国
中国在超大型蛋白质语言模型方面发展迅速,利用国内庞大的计算能力加速抗体和酶的发现。
蛋白质语言模型、巨型AI、治疗药物生成
- BioMap (百图生科, xTrimo): 开发跨模态、千亿参数的蛋白质LLM,旨在计算生成和优化复杂的多特异性抗体和酶。
- 国家支持的AI基础设施: 利用国家超级计算中心在大量基因组数据集上训练基础生物学模型。
- 工业生物催化: 应用生成模型设计新型工业酶,使其能够在化工领域的极端pH值和温度条件下工作。
04欧盟
欧盟在复杂免疫原和下一代疫苗的计算设计方面表现出色,将强大的学术机构与深厚的生物制药专业知识相结合。
拓扑表位、下一代疫苗、结构免疫学
- EPFL (Bruno Correia Lab): 欧洲领先的计算免疫工程学术中心,专注于de novo组装拓扑表位,用于先进的疫苗开发。
- European Molecular Biology Laboratory (EMBL): 提供庞大的结构数据库和基础预测工具,支持生成AI的训练。
- 循环生物经济协同: 利用生成算法设计新型塑料降解酶(例如PETase),专为满足欧洲的废物回收指令而定制。
05领先企业与研究机构
| 公司 / 研究所 | 国家 | 关键产品 / 平台 | 技术特点 | 状态 2026 |
|---|---|---|---|---|
| Institute for Protein Design | 🇺🇸 美国 | RFdiffusion, ProteinMPNN | 开源基础蛋白质 AI | commercial |
| Generate Biomedicines | 🇺🇸 美国 | Chroma platform | 结构与序列的协同扩散 | commercial |
| BioMap | 🇨🇳 中国 | xTrimo LLM | 1000 亿参数蛋白质语言模型 | commercial |
| Monod Bio | 🇺🇸 美国 | LucCage sensors | 从头设计发光生物传感器 | commercial |
| EPFL | 🇨🇭 瑞士 | 疫苗免疫原 | 拓扑表位支架化 | operating |
| A-Alpha Bio | 🇺🇸 美国 | AlphaSeq | 高通量相互作用图谱 | commercial |
06技术栈与创新
生成式蛋白质设计在深度学习物理学、云计算和高通量合成生物学的交叉点上运行。
- 基于扩散的生成式AI:
- 受图像生成的启发,RFdiffusion和Chroma在生物物理约束的引导下,迭代地从随机的3D坐标图中去除高斯噪声,以产生稳定的蛋白质主链。
- 这些网络可以“幻觉”出新的蛋白质拓扑结构,或围绕刚性病毒靶蛋白有条件地设计结合体。
- 反向折叠神经网络:
- 像ProteinMPNN这样的模型在几毫秒内将给定的3D主链转化为最佳氨基酸序列,取代了数周的Rosetta物理模拟。
- 极大地提高了实验室的成功率(通常>50%的设计序列在体外正确折叠)。
- 高通量验证:
- 酵母表面展示文库允许在单个试管中合成并物理测试多达一亿(100 million)个不同的de novo蛋白质。
- 荧光激活细胞分选(FACS)和下一代测序精确解码哪些生成设计成功结合了靶标,并将数据反馈给AI模型。
07价值链和生产管道
de novo蛋白质生成的工业管道 (ISO 23418)
┌───────────────────────────┐ ┌───────────────────────────┐
│ 1. Target definition │ ───> │ 2. Backbone generation │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 4. DNA library synthesis │ <─── │ 3. Sequence design │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 5. Physical screening │ ───> │ 6. Affinity optimization │
└───────────────────────────┘ └───────────────────────────┘阶段 1: 靶标定义
从冷冻电镜数据库中以数字方式分离目标分子(例如病毒刺突蛋白或癌症受体)的3D结构,用作结合位点。
阶段 2: 主链生成
在GPU集群上运行扩散模型,幻觉出10,000个不同、几何形状互补且物理上包裹目标表位的蛋白质主链。
阶段 3: 序列设计
部署ProteinMPNN,快速计算最能保持这10,000个生成的3D主链的热力学稳定氨基酸序列。
阶段 4: DNA文库合成
将这10,000个计算序列作为混合的寡核苷酸文库向商业DNA合成仪订购,并将其克隆到酵母表达质粒中。
阶段 5: 物理筛选
在酵母细胞表面表达蛋白质文库,并使用机器人流式细胞术(FACS)物理分离出与荧光标记靶标强烈结合的前1%的细胞。
阶段 6: 亲和力优化
在将胜出的de novo蛋白质推进至临床前试验之前,对其进行深度突变扫描,以进一步将其结合亲和力提高至皮摩尔水平。
| 供应商 | 价格 | 交期 | 认证 | 风险 | 置信度 |
|---|---|---|---|---|---|
| Institute for Protein Design | custom | on request | 低 | HIGH | |
| Generate Biomedicines | custom | on request | 中 | HIGH | |
| BioMap | custom | on request | 中 | HIGH | |
| Monod Bio | custom | on request | 低 | HIGH | |
| EPFL | custom | on request | 低 | HIGH | |
| A-Alpha Bio | custom | on request | 低 | HIGH |