# 菌株工程（合成生物学 CRO）

以改造微生物或酶本身为业的合同研究机构——定向进化、计算蛋白设计与生产菌株基因组编辑——交付的是可测量的工艺收益，如底物负载由 5 g/L 提升至 67 g/L、酶用量由 100 wt% 降至 3 wt%，而非出售分子本身。

Source: https://cn.bioecon.ru/technology/strain-engineering-synbio-cro/
Updated: 2026-08-18



## 概述与价值链

Markers: [EC: 欧盟工业生物技术计划 / TRL 1–6 放大 | OECD: 2.8 工业生物技术 | Regulator: EPA（美国）]

菌株工程合同研究机构出售的是生物催化剂而非产品：针对给定的反应或分子，交付一个能让工艺具备经济性的酶变体或生产菌株。工作以"设计—构建—测试—学习"循环组织，而当代的差异化在于设计环节由什么训练——十五到二十年积累的自有实验数据集，而不仅是公共序列数据库。收益在工艺层面可度量：在一个有据可查的制药级联中，改造后的酶把底物负载从 5 g/L 提升到 67 g/L，将一种酶的用量从 100 wt% 降至 8 wt%、另一种从 100 wt% 降至 3 wt%，反应时间由 21 小时缩短至 12 小时，同时对映体过量与非对映体过量均保持在 99% 以上。价值主张可以一句话概括：同样的化学，以高一个数量级的浓度、用一小部分催化剂完成。该行业分为出售改造酶的商业平台公司、把项目从研究带到预工业规模的公私合营生物铸造厂，以及由寡核苷酸起家、成长为完整分子生物学服务栈的大型基因合成企业。

菌株工程服务的关键方向是：
1. **定向进化平台：** 将机器学习、生物信息学与实验流程整合于"设计—验证"闭环的酶工程平台，其模型以二十余年的自有实验数据训练，而不仅依赖公共数据。
2. **计算蛋白设计：** 由 AI 智能体驱动、基于自有结构化数据集的物理化 de novo 设计，目标命中率较以诱变为主的筛选高出十至一百倍，并一路推进至可制造性与配方，而非止步于序列。
3. **生产菌株基因组编辑：** 专为编辑工业宿主——*E. coli*、*Bacillus*、*Pichia*、*Aspergillus*——开发的 CRISPR 核酸酶家族，在原核与真核生物中均具活性，用于优化底盘细胞而非治疗疾病。
4. **公私合营生物铸造厂：** 由联盟资助的设施，把微生物细胞工厂项目贯穿 TRL 1 至 6，将合成生物学、微生物资源管理、生物工艺开发与放大集于一处。

### 行业价值链

```
[目标定义] ──> [设计] ──> [构建与筛选] ──> [菌株/酶交付]
                                  │
                          (测试数据反馈)
                                  │
                                  ▼
[工业化工艺] <─── [生物工艺放大] <────────┘
```

### 价值链层级

| 层级 | 描述 | 关键输入/输出 |
|:---|:---|:---|
| **目标定义** | 把客户的反应、分子或工艺约束翻译为蛋白或菌株规格，其中包含催化剂必须承受的条件 | **输入：** 目标反应、工艺条件、商业约束。<br>**输出：** 酶或菌株的设计规格。 |
| **设计** | 由计算设计提出变体——物理化 de novo 设计，或以自有实验数据训练的 ML 模型——而非随机诱变 | **输入：** 规格、自有设计数据集、模型。<br>**输出：** 供构建的排序变体库。 |
| **构建与筛选** | 变体经合成并在底盘中表达，随后在贴近应用的条件下筛选；结果回流至设计模型 | **输入：** 变体设计、基因合成、表达宿主。<br>**输出：** 变体性能实测值、更新后的模型。 |
| **菌株与酶交付** | 所选变体或生产菌株连同性能数据一并交付，且已在真实工艺条件而非检测条件下验证 | **输入：** 最优变体、验证数据。<br>**输出：** 交付的酶或生产菌株。 |
| **生物工艺放大** | 把生物学从实验台带到预工业规模，此处效价、底物负载与催化剂用量决定工艺是否经济 | **输入：** 交付菌株、发酵与下游开发。<br>**输出：** 处于预工业 TRL 的可放大工艺。 |
| **工业化工艺** | 客户在生产中运行改造后的生物学，收益体现为更高底物负载、更低酶用量与更短周期 | **输入：** 放大工艺包。<br>**输出：** 工艺经济性改善的商业化生产。 |

行业跨领域技术：
- **自有设计数据集：** 十五至二十年间企业内部真正构建并测量过的结构化记录，正是它把设计平台与公共数据库筛选区分开来。
- **闭环"设计—构建—测试—学习"：** 把每一轮筛选变成下一轮设计训练数据的工程循环，如今日益由 AI 智能体而非人工迭代驱动。
- **工业宿主基因组编辑：** 按在生产型生物体（而非哺乳动物细胞系）中的活性挑选的核酸酶家族，使得可以对真正生产产品的底盘进行定点编辑。

---

## 美国

美国掌握商业平台层：把改造蛋白作为产品出售的私营公司，背靠长期积累的自有数据集，并通过具名的制药合作得到验证。

### Codexis 的 CodeEvolver、Arzeda 的计算设计、有据可查的工艺收益
- **Codexis（CodeEvolver）：** 一个整合机器学习、生物信息学与实验流程的自有酶工程平台，构成完整连通的"设计—验证"工作流，其模型以 Codexis 自身二十余年的实验数据而非仅公共数据训练，应用覆盖制药、RNA 疗法与诊断。
- **有据可查的工艺收益：** 在与 Bristol Myers Squibb 就 BMS-986278（针对肺纤维化的 LPA1 拮抗剂）的合作中，Codexis 构建了三酶生物催化级联，通过进化 ERED 与 KRED，使对映体与非对映体过量均保持 99% 以上，同时把底物负载由 5 g/L 提升至 67 g/L，ERED 用量由 100 wt% 降至 8 wt%、KRED 由 100 wt% 降至 3 wt%，反应时间由 21 小时缩短至 12 小时。
- **Arzeda（Intelligent Protein Design）：** AI 智能体在自有多年数据集之上驱动闭环"设计—构建—测试—学习"，采用物理化蛋白设计而非诱变或公共序列；公司称拥有十五年以上的结构化设计数据，目标命中率高出十至一百倍，并把设计推进至产品化、配方与可制造性，而不止于交付序列。

---

## 中国

中国的菌株工程服务基础源自基因合成而非酶进化：龙头企业从寡核苷酸与基因合成起步，扩展为完整的分子生物学与生物药服务栈，而其所处的政策环境已把生物制造列为优先的未来产业。

### 金斯瑞的基因合成起点、完整服务栈、生物制造的政策优先级
- **金斯瑞（GenScript）：** 2002 年在美国新泽西成立，以基因合成为基础，从提升基因克隆效率、降低成本与稳定质量出发，扩展至抗体、试剂、多肽合成、蛋白表达以及抗体与蛋白工程，并进一步延伸到免疫治疗与生物药 CDMO，服务于一百多个国家的科研人员。
- **国内合成生物 CRO 行业（定性）：** 中国行业分析将该领域描述为围绕"设计—构建—测试—学习"循环、作用于 *E. coli* 与酿酒酵母等底盘细胞而组织，产业链分为上游"读—改—写"底层技术、中游平台型企业与下游应用场景——但 2026 年的信源中未能独立确认第二家国内菌株工程 CRO，故此处以定性方式描述该行业而不列入表格。
- **政策拉动：** 在 2025 年中国政府工作报告关于建立未来产业投入增长机制的表述中，生物制造位列所提未来产业首位；该领域亦维持着自身的产业会议序列，第四届中国合成生物学及生物制造大会于 2026 年 1 月在深圳举办。

---

## 欧盟

欧洲的独特贡献偏制度而非企业：一种把项目从研究带到预工业规模的公私合营生物铸造厂模式，以及一家其基因组编辑知识产权直指生产菌株的上市工业生物技术公司。

### TWB 公私合营生物铸造厂、BRAIN Biotech 的 BMC 核酸酶、TRL 1–6 覆盖
- **Toulouse White Biotechnology（TWB）：** 法国的公私合营生物铸造厂，由 INRAE、INSA 与 CNRS 共同管理，2012 年创立，以联合服务单元形式运作，联盟成员约 45–50 家。其覆盖合成生物学、微生物资源管理、生物工艺开发与放大，跨越 TRL 1 至 6，每年开展约 50 个研发项目，创立以来累计完成 400 余项。
- **BRAIN Biotech（BMC 核酸酶家族）：** 其 BRAINBiocatalysts 板块提供工业用酶、微生物与配料，同时开展 CRO 业务与生产菌株开发，并已获得 CRISPR-BMC 核酸酶的欧洲专利（EP4301852 B1）。该核酸酶在细菌、酵母、真菌、植物与哺乳动物细胞等原核与真核生物中均具高活性，并明确面向 *E. coli*、*Bacillus*、*Pichia*、*Aspergillus* 等微生物生产菌株的优化。
- **预工业断层：** 欧洲模式恰恰围绕高校与商业客户都不愿承担的环节构建——把已验证的菌株从实验室结果推进到可交付产业的生物工艺；这也是生物铸造厂以共享联盟资产而非私营服务公司形式存在的原因。

---

## 领先公司与研究机构

| 公司 / 机构 | 国家 | 关键产品 / 平台 | 技术特点 | 2026 年状态 |
|:---|:---|:---|:---|:---|
| **Codexis** | 🇺🇸 美国 | *CodeEvolver 酶工程平台* | ML 与生物信息学构成"设计—验证"闭环；模型基于 20 余年自有数据；与 BMS 的级联把负载由 5 提升至 67 g/L、酶用量降至 3–8 wt% | commercial；制药、RNA 疗法与诊断 |
| **Arzeda** | 🇺🇸 美国 | *Intelligent Protein Design Technology* | AI 智能体驱动闭环 DBTL；物理化 de novo 设计；15 年以上结构化设计数据；目标命中率 10–100 倍；从设计直至配方 | commercial；从设计到产品的全栈 |
| **Toulouse White Biotechnology** | 🇫🇷 法国 | *公私合营生物铸造厂，TRL 1–6* | INRAE、INSA 与 CNRS 的联合服务单元；2012 年创立；联盟成员约 45–50 家；每年约 50 个项目，累计 400 余项 | operating；聚焦预工业放大 |
| **BRAIN Biotech** | 🇩🇪 德国 | *BMC 核酸酶家族、BRAINBiocatalysts* | 欧洲专利 EP4301852 B1（CRISPR-BMC）；在细菌、酵母、真菌、植物与哺乳动物细胞中具活性；面向 E. coli、Bacillus、Pichia、Aspergillus 菌株 | commercial；CRO 业务加自有产品布局 |
| **金斯瑞** | 🇨🇳 中国 | *基因合成与分子生物学服务* | 2002 年成立；基因合成、多肽合成、抗体定制、蛋白表达与工程；扩展至免疫治疗与生物药 CDMO | commercial；服务 100 多个国家 |

---

## 技术栈与创新

该技术栈围绕一个循环组织——设计、构建、测试、学习——竞争差异在于设计环节由什么训练，以及服务方把结果向制造推进到多远。

1. **结合机器学习的定向进化：**
   - 整合平台把计算设计与实验验证连接于单一工作流，自有模型基于服务方自身二十余年的实验结果训练，而不仅依赖公共序列数据。
   - 产出以工艺指标衡量：三酶级联在对映体与非对映体过量均超过 99% 的同时，底物负载由 5 g/L 升至 67 g/L，酶用量由 100 wt% 分别降至 8 wt% 与 3 wt%，反应时间由 21 小时降至 12 小时。
2. **物理化计算蛋白设计：**
   - 由物理与自有结构化数据集引导的 de novo 设计，配合运行 DBTL 循环的 AI 智能体，被明确对标诱变与公共序列方法，目标命中率高出十至一百倍。
   - 其范围超出序列本身：设计在贴近应用的条件下验证，并推进至配方与可制造性，因为无法生产或配制的蛋白不构成产品。
3. **面向工业宿主的基因组编辑：**
   - 已获欧洲专利的 BMC 核酸酶家族在原核与真核生物中具高活性，并针对生产底盘——*E. coli*、*Bacillus*、*Pichia*、*Aspergillus*——的定点编辑，而非治疗性编辑。
   - 这一点之所以重要，是因为工业发酵的限制因素通常是宿主自身的代谢，而非孤立的通路酶。
4. **生物铸造厂基础设施与放大：**
   - 公私合营生物铸造厂在同一单元内覆盖合成生物学、微生物资源管理、生物工艺开发与放大，跨越 TRL 1 至 6，年均约 50 个项目、累计完成 400 余项。
   - 联盟结构之所以存在，是因为预工业阶段成本高昂、由约 45–50 家成员分摊，而这一阶段正是多数实验室成果未能转化为工艺之处。

---

## 价值链与生产 pipeline

### 菌株工程项目的工业 pipeline（TRL 1–6 推进，EPA 对工程生物体的监管）

```
┌───────────────────────────┐      ┌───────────────────────────┐
│ 1. 目标规格确定           │ ───> │ 2. 计算设计               │
└───────────────────────────┘      └───────────────────────────┘
                                                  │
                                                  ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 4. 工艺条件下筛选         │ <─── │ 3. 构建与表达             │
└───────────────────────────┘      └───────────────────────────┘
               │
               ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 5. 生物工艺放大           │ ───> │ 6. 交付与生产             │
└───────────────────────────┘      └───────────────────────────┘
```

#### 阶段 1：目标规格确定
客户的反应或分子被翻译为蛋白或菌株规格，其中包含催化剂必须承受的条件——底物浓度、温度、溶剂与周期时间。按真实工艺条件而非检测条件设定规格，决定了最终变体能否经受住装置的考验。

#### 阶段 2：计算设计
变体由物理化 de novo 设计或以服务方自有数据集（十五至二十年的结构化内部结果）训练的机器学习模型提出，而非随机诱变。十倍至百倍命中率的主张正出自此处，仅依赖公共数据的方法也在此被明确指为不足。

#### 阶段 3：构建与表达
设计好的变体在选定底盘中合成并表达。当宿主本身构成限制时，用在 *E. coli*、*Bacillus*、*Pichia* 或 *Aspergillus* 中具活性的核酸酶进行基因组编辑，改造的是生产菌株而不仅是通路酶。

#### 阶段 4：工艺条件下筛选
变体在贴近应用的条件下测量，结果作为下一轮设计的训练数据回流——正是这一闭环把平台与一次性筛选项目区分开来。真正重要的是工业指标：底物负载、催化剂用量、立体化学纯度与反应时间。

#### 阶段 5：生物工艺放大
已验证的生物学被从实验台推进至预工业规模，即生物铸造厂所要覆盖的 TRL 1 至 6 区间。联盟模式正是为资助这一阶段而存在：其成本高昂、由约 45–50 家成员分摊，也是多数实验室成果未能成为工艺的节点。

#### 阶段 6：交付与生产
改造后的酶或菌株连同验证数据一并交付，收益在客户装置上体现为更高的底物负载、更低的酶用量与更短的周期——在前述有据可查的案例中，是浓度提升一个数量级、催化剂用量降至个位数质量百分比，而这正是生物催化路线得以与化学路线竞争的原因。

