生成式蛋白质设计

foundries-design 2 分钟
核实于 25 Jun 2026 有效期至 置信度 HIGH 33 来源
fda ema nmpa

01概述和价值链

标记:[EC: De Novo Protein Engineering | OECD: biotech-health | Regulator: FDA (美国), NMPA (中国), EMA (欧盟)]

生成式蛋白质设计代表了现代生物技术中最根本的范式转变之一。与预测生物学(计算天然存在的序列的3D结构,例如AlphaFold)不同,生成式设计从头(de novo)构建蛋白质。利用超过千亿参数的先进扩散模型和蛋白质大型语言模型(LLM),科学家可以通过计算设计非天然的3D结构及其对应的氨基酸序列,以解决特定的医疗、工业或生态挑战。这种计算方法绕过了数百万年的进化,使创建超紧凑微型结合体(通常为50-80个氨基酸)、自组装纳米颗粒疫苗和高度稳定的人工生物催化剂成为可能。该技术将从靶标识别到功能原型的时间从数年大幅缩短至数周,结合亲和力比经典单克隆抗体高出几个数量级。

生成式蛋白质设计的主要方向是:

  1. 主链扩散模型 (Backbone Diffusion Models): 利用数学扩散过程(例如RFdiffusion或Chroma),通过生物物理约束引导,从随机原子坐标图中迭代去噪,以产生稳定的蛋白质主链。
  2. 蛋白质大型语言模型 (Protein LLMs): 在数亿个天然蛋白质序列上训练Transformer网络(例如xTrimo或ESM),以生成功能变体并预测突变稳定性。
  3. 蛋白质反向折叠 (Inverse Protein Folding): 部署ProteinMPNN等神经网络,计算能在热力学上折叠成生成的3D主链的最佳氨基酸序列。
  4. 从头生物传感器 (De Novo Biosensors): 设计定制的高对比度发光蛋白质开关(例如LucCage),在检测到特定病毒或生物标志物靶标时立即发光。

行业价值链

价值链层级

层级描述关键输入/输出
1. 主链生成使用扩散模型从头设计3D结构支架以匹配目标几何形状输入: 3D目标结构(表位)。
输出: 生成主链的3D坐标。
2. 序列设计使用反向折叠计算PDB主链的最佳氨基酸序列输入: 生成的3D主链。
输出: 氨基酸序列。
3. 基因合成化学合成编码de novo蛋白质的DNA寡核苷酸输入: 氨基酸序列。
输出: 物理DNA质粒文库。
4. 酵母展示用DNA文库转化酵母细胞以在细胞表面表达生成的蛋白质输入: DNA文库,酵母细胞。
输出: 表达新型蛋白质的酵母文库。
5. FACS筛选通过机器人分选出与荧光标记靶标强结合的细胞输入: 酵母文库,靶标分子。
输出: 表现最佳的酵母克隆。
6. SPR验证使用表面等离子体共振测量精确的结合动力学和亲和力输入: 纯化的蛋白质。
输出: 表征后的结合体。

该领域的跨领域技术:

  • 大规模平行筛选: 整合机器人FACS和高通量测序,同时评估数百万个de novo设计。
  • MoClo (模块化克隆): 将数千个DNA片段标准化、高效地组装到表达载体中。
  • 深度学习硬件: 依赖大型GPU/TPU集群(如Nvidia H100s)来运行计算量极大的扩散和语言模型。

02美国

美国在生成式蛋白质设计领域占据主导地位,这得益于蛋白质设计研究所(IPD)的巨大重大学术突破以及资本雄厚的生物技术衍生公司。

基础AI模型、临床转化、高通量筛选

  • Institute for Protein Design (IPD): de novo设计的全球中心,开创了RFdiffusion和ProteinMPNN等开源架构。
  • Generate:Biomedicines: 将Chroma平台商业化,以推进大量de novo治疗蛋白质进入人类临床试验。
  • A-Alpha Bio: 提供蛋白质-蛋白质相互作用的超高通量图谱,这对于生成训练下一代预测模型所需的海量数据集至关重要。

03中国

中国在超大型蛋白质语言模型方面发展迅速,利用国内庞大的计算能力加速抗体和酶的发现。

蛋白质语言模型、巨型AI、治疗药物生成

  • BioMap (百图生科, xTrimo): 开发跨模态、千亿参数的蛋白质LLM,旨在计算生成和优化复杂的多特异性抗体和酶。
  • 国家支持的AI基础设施: 利用国家超级计算中心在大量基因组数据集上训练基础生物学模型。
  • 工业生物催化: 应用生成模型设计新型工业酶,使其能够在化工领域的极端pH值和温度条件下工作。

04欧盟

欧盟在复杂免疫原和下一代疫苗的计算设计方面表现出色,将强大的学术机构与深厚的生物制药专业知识相结合。

拓扑表位、下一代疫苗、结构免疫学

  • EPFL (Bruno Correia Lab): 欧洲领先的计算免疫工程学术中心,专注于de novo组装拓扑表位,用于先进的疫苗开发。
  • European Molecular Biology Laboratory (EMBL): 提供庞大的结构数据库和基础预测工具,支持生成AI的训练。
  • 循环生物经济协同: 利用生成算法设计新型塑料降解酶(例如PETase),专为满足欧洲的废物回收指令而定制。

05领先企业与研究机构

公司 / 研究所国家关键产品 / 平台技术特点状态 2026
Institute for Protein Design🇺🇸 美国RFdiffusion, ProteinMPNN开源基础蛋白质 AIcommercial
Generate Biomedicines🇺🇸 美国Chroma platform结构与序列的协同扩散commercial
BioMap🇨🇳 中国xTrimo LLM1000 亿参数蛋白质语言模型commercial
Monod Bio🇺🇸 美国LucCage sensors从头设计发光生物传感器commercial
EPFL🇨🇭 瑞士疫苗免疫原拓扑表位支架化operating
A-Alpha Bio🇺🇸 美国AlphaSeq高通量相互作用图谱commercial

06技术栈与创新

生成式蛋白质设计在深度学习物理学、云计算和高通量合成生物学的交叉点上运行。

  1. 基于扩散的生成式AI:
    • 受图像生成的启发,RFdiffusion和Chroma在生物物理约束的引导下,迭代地从随机的3D坐标图中去除高斯噪声,以产生稳定的蛋白质主链。
    • 这些网络可以“幻觉”出新的蛋白质拓扑结构,或围绕刚性病毒靶蛋白有条件地设计结合体。
  2. 反向折叠神经网络:
    • 像ProteinMPNN这样的模型在几毫秒内将给定的3D主链转化为最佳氨基酸序列,取代了数周的Rosetta物理模拟。
    • 极大地提高了实验室的成功率(通常>50%的设计序列在体外正确折叠)。
  3. 高通量验证:
    • 酵母表面展示文库允许在单个试管中合成并物理测试多达一亿(100 million)个不同的de novo蛋白质。
    • 荧光激活细胞分选(FACS)和下一代测序精确解码哪些生成设计成功结合了靶标,并将数据反馈给AI模型。

07价值链和生产管道

de novo蛋白质生成的工业管道 (ISO 23418)

阶段 1: 靶标定义

从冷冻电镜数据库中以数字方式分离目标分子(例如病毒刺突蛋白或癌症受体)的3D结构,用作结合位点。

阶段 2: 主链生成

在GPU集群上运行扩散模型,幻觉出10,000个不同、几何形状互补且物理上包裹目标表位的蛋白质主链。

阶段 3: 序列设计

部署ProteinMPNN,快速计算最能保持这10,000个生成的3D主链的热力学稳定氨基酸序列。

阶段 4: DNA文库合成

将这10,000个计算序列作为混合的寡核苷酸文库向商业DNA合成仪订购,并将其克隆到酵母表达质粒中。

阶段 5: 物理筛选

在酵母细胞表面表达蛋白质文库,并使用机器人流式细胞术(FACS)物理分离出与荧光标记靶标强烈结合的前1%的细胞。

阶段 6: 亲和力优化

在将胜出的de novo蛋白质推进至临床前试验之前,对其进行深度突变扫描,以进一步将其结合亲和力提高至皮摩尔水平。

供应商价格交期认证风险置信度
AI 推荐 买家须知: 生成式蛋白质设计已迅速从学术概念转变为商业服务。采购策略应区分基础AI模型提供商(如蛋白质设计研究所,提供开源算法)和垂直整合的临床生物技术公司(如Generate Biomedicines)。对于海量数据集生成和蛋白质语言模型,请考虑BioMap等公司的深厚资源。目前的瓶颈已经从计算设计转移到高通量物理验证和制造。
合规 Bioecon 是信息中介,并非监管机构、认证机构或法律顾问。在与公共部门客户合作时 (依据 44-FZ / 223-FZ 的采购),Bioecon 仅作为独立分析平台,不收取供应商任何报酬。