# 生成式蛋白质设计

利用扩散网络和大型语言模型，从头开始创建完全新颖、非天然的蛋白质结构和序列，用于治疗药物和生物传感器。

Source: https://cn.bioecon.ru/technology/generative-protein-design/
Updated: 2026-08-18



## 概述和价值链

标记：[EC: De Novo Protein Engineering | OECD: biotech-health | Regulator: FDA (美国), NMPA (中国), EMA (欧盟)]

生成式蛋白质设计代表了现代生物技术中最根本的范式转变之一。与预测生物学（计算天然存在的序列的3D结构，例如AlphaFold）不同，生成式设计从头（*de novo*）构建蛋白质。利用超过千亿参数的先进扩散模型和蛋白质大型语言模型（LLM），科学家可以通过计算设计非天然的3D结构及其对应的氨基酸序列，以解决特定的医疗、工业或生态挑战。这种计算方法绕过了数百万年的进化，使创建超紧凑微型结合体（通常为50-80个氨基酸）、自组装纳米颗粒疫苗和高度稳定的人工生物催化剂成为可能。该技术将从靶标识别到功能原型的时间从数年大幅缩短至数周，结合亲和力比经典单克隆抗体高出几个数量级。

生成式蛋白质设计的主要方向是：
1. **主链扩散模型 (Backbone Diffusion Models):** 利用数学扩散过程（例如RFdiffusion或Chroma），通过生物物理约束引导，从随机原子坐标图中迭代去噪，以产生稳定的蛋白质主链。
2. **蛋白质大型语言模型 (Protein LLMs):** 在数亿个天然蛋白质序列上训练Transformer网络（例如xTrimo或ESM），以生成功能变体并预测突变稳定性。
3. **蛋白质反向折叠 (Inverse Protein Folding):** 部署ProteinMPNN等神经网络，计算能在热力学上折叠成生成的3D主链的最佳氨基酸序列。
4. **从头生物传感器 (De Novo Biosensors):** 设计定制的高对比度发光蛋白质开关（例如LucCage），在检测到特定病毒或生物标志物靶标时立即发光。

### 行业价值链

```
[Backbone Generation] ──> [Sequence Design] ──> [Gene Synthesis] ──> [Yeast Display]
                                  │
                          (Protein Optimization)
                                  │
                                  ▼
[Clinical Application] <─── [SPR Validation] <─────┘
```

### 价值链层级

| 层级 | 描述 | 关键输入/输出 |
|:---|:---|:---|
| **1. 主链生成** | 使用扩散模型从头设计3D结构支架以匹配目标几何形状 | **输入：** 3D目标结构（表位）。<br>**输出：** 生成主链的3D坐标。 |
| **2. 序列设计** | 使用反向折叠计算PDB主链的最佳氨基酸序列 | **输入：** 生成的3D主链。<br>**输出：** 氨基酸序列。 |
| **3. 基因合成** | 化学合成编码de novo蛋白质的DNA寡核苷酸 | **输入：** 氨基酸序列。<br>**输出：** 物理DNA质粒文库。 |
| **4. 酵母展示** | 用DNA文库转化酵母细胞以在细胞表面表达生成的蛋白质 | **输入：** DNA文库，酵母细胞。<br>**输出：** 表达新型蛋白质的酵母文库。 |
| **5. FACS筛选** | 通过机器人分选出与荧光标记靶标强结合的细胞 | **输入：** 酵母文库，靶标分子。<br>**输出：** 表现最佳的酵母克隆。 |
| **6. SPR验证** | 使用表面等离子体共振测量精确的结合动力学和亲和力 | **输入：** 纯化的蛋白质。<br>**输出：** 表征后的结合体。 |

该领域的跨领域技术：
- **大规模平行筛选:** 整合机器人FACS和高通量测序，同时评估数百万个*de novo*设计。
- **MoClo (模块化克隆):** 将数千个DNA片段标准化、高效地组装到表达载体中。
- **深度学习硬件:** 依赖大型GPU/TPU集群（如Nvidia H100s）来运行计算量极大的扩散和语言模型。

---

## 美国

美国在生成式蛋白质设计领域占据主导地位，这得益于蛋白质设计研究所（IPD）的巨大重大学术突破以及资本雄厚的生物技术衍生公司。

### 基础AI模型、临床转化、高通量筛选
- **Institute for Protein Design (IPD):** *de novo*设计的全球中心，开创了RFdiffusion和ProteinMPNN等开源架构。
- **Generate:Biomedicines:** 将Chroma平台商业化，以推进大量*de novo*治疗蛋白质进入人类临床试验。
- **A-Alpha Bio:** 提供蛋白质-蛋白质相互作用的超高通量图谱，这对于生成训练下一代预测模型所需的海量数据集至关重要。

---

## 中国

中国在超大型蛋白质语言模型方面发展迅速，利用国内庞大的计算能力加速抗体和酶的发现。

### 蛋白质语言模型、巨型AI、治疗药物生成
- **BioMap (百图生科, xTrimo):** 开发跨模态、千亿参数的蛋白质LLM，旨在计算生成和优化复杂的多特异性抗体和酶。
- **国家支持的AI基础设施:** 利用国家超级计算中心在大量基因组数据集上训练基础生物学模型。
- **工业生物催化:** 应用生成模型设计新型工业酶，使其能够在化工领域的极端pH值和温度条件下工作。

---

## 欧盟

欧盟在复杂免疫原和下一代疫苗的计算设计方面表现出色，将强大的学术机构与深厚的生物制药专业知识相结合。

### 拓扑表位、下一代疫苗、结构免疫学
- **EPFL (Bruno Correia Lab):** 欧洲领先的计算免疫工程学术中心，专注于*de novo*组装拓扑表位，用于先进的疫苗开发。
- **European Molecular Biology Laboratory (EMBL):** 提供庞大的结构数据库和基础预测工具，支持生成AI的训练。
- **循环生物经济协同:** 利用生成算法设计新型塑料降解酶（例如PETase），专为满足欧洲的废物回收指令而定制。

---

## 领先企业与研究机构

| 公司 / 研究所 | 国家 | 关键产品 / 平台 | 技术特点 | 状态 2026 |
|:---|:---|:---|:---|:---|
| **Institute for Protein Design** | 🇺🇸 美国 | *RFdiffusion, ProteinMPNN* | 开源基础蛋白质 AI | commercial |
| **Generate Biomedicines** | 🇺🇸 美国 | *Chroma platform* | 结构与序列的协同扩散 | commercial |
| **BioMap** | 🇨🇳 中国 | *xTrimo LLM* | 1000 亿参数蛋白质语言模型 | commercial |
| **Monod Bio** | 🇺🇸 美国 | *LucCage sensors* | 从头设计发光生物传感器 | commercial |
| **EPFL** | 🇨🇭 瑞士 | *疫苗免疫原* | 拓扑表位支架化 | operating |
| **A-Alpha Bio** | 🇺🇸 美国 | *AlphaSeq* | 高通量相互作用图谱 | commercial |

---

## 技术栈与创新

生成式蛋白质设计在深度学习物理学、云计算和高通量合成生物学的交叉点上运行。

1. **基于扩散的生成式AI:**
   - 受图像生成的启发，RFdiffusion和Chroma在生物物理约束的引导下，迭代地从随机的3D坐标图中去除高斯噪声，以产生稳定的蛋白质主链。
   - 这些网络可以“幻觉”出新的蛋白质拓扑结构，或围绕刚性病毒靶蛋白有条件地设计结合体。
2. **反向折叠神经网络:**
   - 像ProteinMPNN这样的模型在几毫秒内将给定的3D主链转化为最佳氨基酸序列，取代了数周的Rosetta物理模拟。
   - 极大地提高了实验室的成功率（通常>50%的设计序列在体外正确折叠）。
3. **高通量验证:**
   - 酵母表面展示文库允许在单个试管中合成并物理测试多达一亿（100 million）个不同的*de novo*蛋白质。
   - 荧光激活细胞分选（FACS）和下一代测序精确解码哪些生成设计成功结合了靶标，并将数据反馈给AI模型。

---

## 价值链和生产管道

### de novo蛋白质生成的工业管道 (ISO 23418)

```
┌───────────────────────────┐      ┌───────────────────────────┐
│ 1. Target definition      │ ───> │ 2. Backbone generation    │
└───────────────────────────┘      └───────────────────────────┘
                                                 │
                                                 ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 4. DNA library synthesis  │ <─── │ 3. Sequence design        │
└───────────────────────────┘      └───────────────────────────┘
              │
              ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 5. Physical screening     │ ───> │ 6. Affinity optimization  │
└───────────────────────────┘      └───────────────────────────┘
```

#### 阶段 1: 靶标定义
从冷冻电镜数据库中以数字方式分离目标分子（例如病毒刺突蛋白或癌症受体）的3D结构，用作结合位点。

#### 阶段 2: 主链生成
在GPU集群上运行扩散模型，幻觉出10,000个不同、几何形状互补且物理上包裹目标表位的蛋白质主链。

#### 阶段 3: 序列设计
部署ProteinMPNN，快速计算最能保持这10,000个生成的3D主链的热力学稳定氨基酸序列。

#### 阶段 4: DNA文库合成
将这10,000个计算序列作为混合的寡核苷酸文库向商业DNA合成仪订购，并将其克隆到酵母表达质粒中。

#### 阶段 5: 物理筛选
在酵母细胞表面表达蛋白质文库，并使用机器人流式细胞术（FACS）物理分离出与荧光标记靶标强烈结合的前1%的细胞。

#### 阶段 6: 亲和力优化
在将胜出的*de novo*蛋白质推进至临床前试验之前，对其进行深度突变扫描，以进一步将其结合亲和力提高至皮摩尔水平。

