# 生物多样性基因组学

对所有真核生物的基因组进行测序和存档，以支持生态系统恢复和生物勘探。

Source: https://cn.bioecon.ru/technology/biodiversity-genomics/
Updated: 2026-08-18



## 概述和价值链

标记： [EC: Convention on Biological Diversity | OECD: genomics-bioinformatics | Regulator: USDA-APHIS, EFSA, MOA]

生物多样性基因组学旨在解码地球上所有真核生物多样性的遗传蓝图。地球生物基因组计划（Earth BioGenome Project, EBP）——常被称为生物学的"登月计划"——是其中的核心行动：一个为期十年的联盟，目标是对地球上大约 150-180 万种真核生物（植物、动物、真菌与原生生物）进行测序、编目并公开其染色体级参考基因组。该档案支撑三大应用领域：生物勘探（挖掘次级代谢产物合成途径，以移植到合成生物学生产底盘，用于药物与绿色化学）；保护遗传学（检测近交衰退、厘清争议分类，指导遗传拯救计划）；以及粮食安全（通过基因组编辑，将作物野生近缘种的抗逆基因转移到商业品种）。随着每个高质量参考基因组的测序成本降至 1000 美元以下，重点已转向自动化的超长 DNA 提取与开放、去中心化的数据共享。

生物多样性基因组学的关键方向是：
1. **参考基因组生成：** 为关键物种和濒危物种生成染色体水平的组装。
2. **环境 DNA (eDNA) 监测：** 通过对脱落到土壤和水中的 DNA 进行测序来跟踪生物多样性变化。
3. **生物勘探：** 挖掘基因组数据库，寻找可用于工业的新型酶和次级代谢产物。
4. **保护遗传学：** 评估孤立种群内的遗传多样性，以指导繁育计划。

### 行业价值链

```
[样本采集] ──> [DNA 提取] ──> [测序] ──> [生物信息学组装]
                                  │
                                (注释)
                                  │
                                  ▼
[生态系统监测] <─── [开放数据归档] <─────┘
```

### 价值链层级

| 层级 | 描述 | 关键输入/输出 |
|:---|:---|:---|
| **样本采集** | 依据《名古屋议定书》进行野外组织采集，并做形态学凭证归档。 | **输入：** 动植物、采集许可。<br>**输出：** 速冻凭证组织。 |
| **DNA 提取** | 无剪切地分离超高分子量 DNA。 | **输入：** 冷冻组织、Nanobind 磁盘。<br>**输出：** 高于 100 kb 的 UHMW-DNA。 |
| **测序** | 在 PacBio HiFi 与 Oxford Nanopore 平台上进行长读长测序。 | **输入：** UHMW-DNA。<br>**输出：** 高于 Q30 的长读长。 |
| **生物信息学组装** | 从头重建完整染色体。 | **输入：** 长读长、Hi-C 接触数据、Hifiasm/YaHS。<br>**输出：** 染色体级组装。 |
| **开放数据归档** | 将序列存储于公共数据库。 | **输入：** 组装数据。<br>**输出：** 经整理的参考基因组（NCBI、ENA）。 |
| **生态系统监测** | 将数据用于保护政策。 | **输入：** 基因组、eDNA。<br>**输出：** 物种恢复计划。 |

该行业的跨领域技术：
- **长读长测序：** 像 Nanopore 和 PacBio 这样的技术可以实现高度连续的基因组组装。
- **空间转录组学：** 直接在组织切片内绘制基因表达图谱，以了解复杂的生物学。
- **云计算：** 处理 PB 级基因组数据所需的大规模可扩展基础设施。

---

## 美国

美国是全球生物多样性倡议的中央管理枢纽，负责协调地球生物基因组计划 (EBP) 的标准和数据协议。

### EBP 协调、高通量测序、云基础设施
- **EBP 协调枢纽：** 加州大学戴维斯分校（Harris Lewin 工作组）协调全球 EBP 网络及其组装质量指标（叠连群 N50 高于 1 Mb，碱基准确度高于 Q40）。
- **脊椎动物基因组计划（VGP）：** 洛克菲勒大学 Erich Jarvis 团队主导 VGP，依托 PacBio HiFi 读长，目标为全部约 70,000 种脊椎动物生成参考基因组。
- **史密森学会标本与 NCBI：** 史密森学会为美国生态系统测序计划提供标本与凭证库管理，而 NCBI 归档开放的基因组数据。

---

## 中国

中国正在向大规模测序基础设施投入巨资，利用自动化技术快速对数千种亚洲动植物物种进行测序。

### Stereo-seq、万种植物基因组计划 (10KP)、大规模自动化
- **空间基因组学：** BGI-Research 将其专有的 Stereo-seq 空间转录组学平台与稀有亚洲植物的全基因组组装相结合。
- **大规模项目：** 万种植物基因组计划（10KP）及配套的真核生物项目在 BGI 的 DNBSEQ 平台上对苔藓、蕨类、藻类与特有动物进行测序；昆明动物研究所拥有中国野生哺乳动物进化动物地理学方面最领先的数据库。
- **国家数据库：** 中国国家基因库（CNGB）安全托管该国海量的生物多样性数据集。

---

## 欧盟

欧盟专注于深度生态基因组学，对整个生态系统进行测序以了解气候变化的影响并发现新的生物产品。

### 达尔文生命之树、海洋基因组学、数据主权
- **达尔文生命之树：** 由 Wellcome Sanger 研究所主导的 DtL 项目目标是对不列颠及爱尔兰全部约 70,000 种真核生物进行测序，运行着全球产能最高的从头组装流水线之一。
- **海洋生物勘探：** 法国 Genoscope 测序海洋微生物组（尤其是 Tara Oceans 考察），筛选可用于绿色化学的极端酶。
- **组装算法与开放数据：** 马克斯·普朗克研究所（Myers 实验室）开发了现代组装器背后的重叠-布局图数学，EMBL-EBI 托管开放的欧洲生物信息学基础设施。

---

## 领先公司和研究机构

| 公司 / 机构 | 国家 | 关键产品 / 平台 | 技术特点 | Status 2026 |
|:---|:---|:---|:---|:---|
| **Wellcome Sanger** | 🇬🇧 英国 | *达尔文生命之树* | 大批量从头组装 (de novo) | commercial |
| **BGI** | 🇨🇳 中国 | *Stereo-seq 平台* | 空间转录组学 | commercial |
| **UC Davis** | 🇺🇸 美国 | *EBP 枢纽协调* | 标准化 >Q40 指标 | commercial |
| **Max Planck Institute** | 🇩🇪 德国 | *生物信息学工具* | 复杂多倍体组装器 | commercial |
| **Genoscope** | 🇫🇷 法国 | *海洋宏基因组学* | 环境筛查 | commercial |
| **Oxford Nanopore** | 🇬🇧 英国 | *MinION/PromethION* | 超长读长测序 | commercial |

---

## 技术栈和创新

现代生物多样性基因组学完全依赖于提取超长 DNA 分子和高重复区域算法组装的突破。

1. **UHMW-DNA 提取：**
   - Nanobind 磁盘（纳米二氧化硅涂层）在轻柔摇动下缠绕超长 DNA，保留长读长测序所需的 100 kb 以上片段。
   - 温和的低剪切裂解保护兆碱基级染色体，避免离心柱试剂盒造成的断裂。
2. **测序技术：**
   - PacBio HiFi 与 Oxford Nanopore 产生高于 Q30 的数千碱基读长，可解析短读长无法解析的重复区。
   - Hi-C 染色质构象捕获以甲醛固定染色质，并对物理上邻近的 DNA 进行邻近连接，生成将叠连群搭建成染色体的接触图。
3. **生物信息学算法：**
   - Hifiasm 由 HiFi 读长构建精确叠连群，Purge_dups 去除单倍型重复，YaHS 利用 Hi-C 接触将叠连群排序为染色体级支架。
   - Braker3 等 AI 注释流水线可快速标注新物种中的基因、调控元件与生物合成基因簇。

---

## 价值链和生产管线

### 参考基因组生成的工业管线 (EBP 标准)

```
┌───────────────────────────┐      ┌───────────────────────────┐
│ 1. Tissue Sampling        │ ───> │ 2. UHMW-DNA Extraction    │
└───────────────────────────┘      └───────────────────────────┘
                                                 │
                                                 ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 4. Bioinformatics Assembly│ <─── │ 3. Long-Read Sequencing   │
└───────────────────────────┘      └───────────────────────────┘
              │
              ▼
┌───────────────────────────┐      ┌───────────────────────────┐
│ 5. Gene Annotation        │ ───> │ 6. Public Release         │
└───────────────────────────┘      └───────────────────────────┘
```

#### 阶段 1：组织采样
野外生物学家收集新鲜组织样本，立即将其冷冻在液氮中，以完美保存细胞 DNA 的完整性。

#### 阶段 2：UHMW-DNA 提取
实验室利用专门的磁性纳米盘轻轻分离超高分子量 (UHMW) DNA，而不会发生机械剪切。

#### 阶段 3：长读长测序
提取的 DNA 通过 Nanopore 或 PacBio 系统进行处理，生成大量连续的数千碱基读长的数据集。

#### 阶段 4：生物信息学组装
超级计算机运行复杂的图算法将片段拼接在一起，利用 Hi-C 数据将叠连群 (contigs) 搭建成完整的染色体。

#### 阶段 5：基因注释
自动化的 AI 流程扫描组装好的染色体，以识别基因、调控元件和结构变异。

#### 阶段 6：公开发布
经过全面整理的高质量参考基因组被上传到 GenBank 或 ENA 等中央数据库，以供公开科学访问。

