生物人工智能与生物信息服务
01概述与价值链
标记:[EC:FDA 药物开发中的 AI/ML 指南 + EMA 人工智能反思文件 | OECD:生物信息学与基因组学 / 生物制药 | 监管机构:FDA(美国)、EMA(欧盟)、NMPA(中国)]
生物人工智能与生物信息服务是一个计算与软件层,将现代生物学产生的海量序列、结构、图像与组学数据转化为可发现、可计算的资产——以云平台、基础模型与托管分析流水线形式交付,而非作为内部药物项目运营。相邻的“AI 药物设计”行业覆盖的是运营自有临床管线的公司(Isomorphic Labs、Recursion、Insilico Medicine),而本项目描述的是将这些能力作为服务出售给制药、生物技术、学术以及日益增多的工业生物团队的平台与基础设施提供商。NVIDIA BioNeMo Agent Toolkit 于 2026 年 6 月 23 日发布,正被 Dassault Systèmes、Eli Lilly、OpenAI、Schrödinger 与 Snowflake 等数十家机构采用;拥有 17 年历史的多组学老将 DNAnexus 在将其托管数据云重塑为“AI 燃料”之际报告客户满意度达 90%;而 AWS HealthOmics 现已可通过单次 API 调用提交多达 10 万个生物信息学工作流运行。该行业由四股力量塑造:超大规模生物云、生成式生物基础模型、联邦式多模态数据网络,以及蛋白质与分子设计即服务。
生物人工智能与生物信息服务的重点方向:
- 超大规模生物云(云端生物信息学): 完全托管、GPU 加速的分析服务——AWS HealthOmics 每次调用可运行多达 10 万个工作流并符合 HIPAA 资格;NVIDIA BioNeMo 通过 NIM 微服务提供生物模型。
- 生成式生物基础模型(生物基础模型): 在分子与蛋白质上训练并作为可调用服务提供的大型模型——NVIDIA GenMol v2.0 是一个 8900 万参数的掩码扩散模型,用于基于片段的分子生成,已在 BioNeMo NIM 家族中达到商用就绪。
- 托管组学数据平台(组学数据平台): 经过策展、协调、机器学习就绪的多组学数据——DNAnexus、QIAGEN Digital Insights 与 Elucidata 的 Polly 将碎片化的生物医学数据转化为分析就绪状态。
- 设计即服务(蛋白质与分子设计): 面向他人出售的生成式蛋白质与小分子设计——Cradle 于 2024 年 11 月筹集 7300 万美元以扩展其蛋白质工程平台;Dassault BIOVIA 的 MARIE 助手构建于 BioNeMo Agent Toolkit 之上。
行业价值链
[生物/组学数据] ──> [数据平台 / FAIR 策展] ──> [基础模型 / 分析]
│ │
(联邦式、受治理) (GPU 加速推理)
│ │
▼ ▼
[云 / HPC 基础设施] <─── [智能体工作流编排]
│
▼
[交付给研发的洞察 / 候选物]价值链层级
| 层级 | 说明 | 关键输入/输出 |
|---|---|---|
| 数据生成 | 测序仪、质谱仪与高内涵成像仪产生原始生物信号 | 输入: 生物样本、仪器。 输出: 原始读段、光谱、图像。 |
| 数据平台与策展 | 摄取、协调数据并使其符合 FAIR 与机器学习就绪 | 输入: 原始读段、元数据。 输出: 结构化、可查询的数据集。 |
| 基础模型与算法 | 生成式与判别式生物模型给出预测 | 输入: 结构化数据、模型权重。 输出: 结构、功能与命中预测。 |
| 云与 HPC 基础设施 | 弹性、GPU 加速的计算承载模型与数据 | 输入: 模型、数据集。 输出: 可扩展算力、加速推理。 |
| 智能体编排 | LLM 智能体将工具串联为多步科学计算 | 输入: 科学家查询、工具目录。 输出: 执行完毕的流水线、可追溯报告。 |
| 决策支持与交付 | 在治理之下将经验证的洞察与候选物交付给研发 | 输入: 计算结果、湿实验反馈。 输出: 靶点、候选物、设计。 |
该行业的跨领域技术:
- GPU 加速推理(NIM): 生物模型被打包为可调用的容器化微服务(BioNeMo NIM),支持托管或本地部署。
- 联邦数据网络: 安全的分布式分析,将算法迁移到受治理的数据处而非集中汇聚(Velsera Global Data Network)。
- 面向生物学的基础模型: 在分子与蛋白质表示上的掩码扩散与语言模型(GenMol、蛋白质语言模型)。
02美国
美国在该服务层居核心地位,依托业内的 GPU 与超大规模平台以及成熟的托管数据云细分市场。
BioNeMo 与 GPU 模型服务、托管组学云、超大规模生物云
- NVIDIA BioNeMo: 面向 AI 驱动生命科学研究的开放式开发者平台,将结构预测、分子生成、对接、序列分析与基因组学打包为可调用的 BioNeMo Skills;其 GenMol v2.0(NV-GenMol-89M-v2)掩码扩散模型已达商用就绪,而 2026 年 6 月 23 日发布的 BioNeMo Agent Toolkit 正被 Dassault Systèmes、Eli Lilly、OpenAI、Schrödinger 与 Snowflake 采用,Anthropic 与 OpenAI 亦在集成。
- DNAnexus: 拥有 17 年历史的多组学先驱,将其托管数据云定位为精准健康领域的“AI 燃料”;在 CEO Thomas Laur 带领下推进“将算法迁移到数据”的联邦模式,并于 2026 年 7 月在全球扩张中报告客户满意度达 90%。
- AWS HealthOmics(Amazon): 一项完全托管、符合 HIPAA 资格的生物信息服务,现可通过单次 API 调用提交多达 10 万个工作流运行;VPC 连接工作流(2026 年 3 月)与临时暂存存储(2026 年 6 月)降低了成本并加速了序列比对、BAM 排序与变异检出。
- Velsera: 2023 年由 Seven Bridges、PierianDx 与 UgenTec 合并而成,其联邦式 Global Data Network 覆盖逾 1.75 亿患者,并为 Illumina TruSight Oncology Comprehensive 检测(2024 年 FDA 获批、2025 年获日本 MHLW 批准)提供知识库支撑。
03中国
中国在该行业中的存在感更多来自国家协调的 AI-for-science 平台与快速成形的监管框架,而非独立的商业服务供应商;本项目无一家专门的商业服务供应商通过来源实时确认,故市场以定性方式描述。
AI-for-science 平台、主权生物云、AI+药物监管路线图
- AI-for-science 平台: DP Technology(深势科技)与 BGI 云栈等本土“AI for science”参与者将分子与材料基础模型(Uni-Mol 类)扩展至学术与工业用户,但其 2026 年公司层面的具体商业事实未获独立确认。
- 主权生物云: 建于 BGI 与 CAS 生态系统之上的国家基因组与生物信息学云,优先考虑数据主权,并服务于国内药物发现与育种项目。
- AI+药物监管路线图: 科技部 2026 年“AI+药物”监管路线图于 2026 年 4 月发布,在 NMPA 监管下为 AI 辅助发现设定了趋同路径,与 FDA 与 EMA 的 AI/ML 框架相呼应。
04欧盟
欧洲的贡献集中于成熟的生物信息学软件厂商与独特的蛋白质设计即服务集群,且日益构建于美国的 GPU 平台之上。
生物信息学 SaaS、蛋白质设计即服务、智能体建模
- QIAGEN Digital Insights(德国): 生物信息学软件组合涵盖 QIAGEN CLC Genomics Workbench、基于云的 QCI 二次分析、Ingenuity Pathway Analysis(IPA)与 OmicSoft,覆盖二次分析、单细胞与微生物/宏基因组工作流。
- Cradle(荷兰): 这家阿姆斯特丹蛋白质工程公司于 2024 年 11 月筹集 7300 万美元以建设其生成式 AI 平台与湿实验室,并于 2026 年 2 月完成后续融资;其 CRADLE-1 模型展示了蛋白质的自动先导优化,同时服务药物发现与工业生物技术客户。
- Dassault Systèmes BIOVIA(法国): 该 3DEXPERIENCE 生命科学品牌于 2026 年 6 月 23 日在 NVIDIA BioNeMo Agent Toolkit 之上推出了用于药物发现的智能体 AI 助手 MARIE,依托逾 30 年的 Discovery Studio 建模传承,如今将基于物理的方法与生成式 AI 相结合。
05领先企业与研究机构
| 企业 / 机构 | 国家 | 关键产品 / 平台 | 技术特点 | 状态 2026 |
|---|---|---|---|---|
| NVIDIA | 🇺🇸 美国 | BioNeMo / NIM 模型服务 | GenMol v2.0 8900 万参数;Agent Toolkit(2026 年 6 月);Lilly、Schrödinger、OpenAI 采用 | commercial |
| DNAnexus | 🇺🇸 美国 | 托管多组学数据云 | 17 年先驱;客户满意度 90%(2026 年 7 月);联邦数据模型 | commercial |
| Amazon | 🇺🇸 美国 | AWS HealthOmics 托管云 | 每次 API 调用可达 10 万工作流运行;VPC 工作流;符合 HIPAA | commercial |
| QIAGEN | 🇩🇪 德国 | Digital Insights:CLC / IPA / QCI 云 | 二次分析、IPA、OmicSoft;单细胞与宏基因组模块 | commercial |
| Cradle | 🇳🇱 荷兰 | 蛋白质设计即服务 | 7300 万美元 B 轮(2024 年 11 月);CRADLE-1 自动优化;工业生物技术 | operating |
| Elucidata | 🇮🇳 印度 | Polly MLOps / BioAgent | 成立于 2015;BioAgent 将 6 小时组学工作流压缩至 20 分钟 | operating |
06技术栈与创新
该技术栈建立在三层之上:以 GPU 提供服务的基础模型将生物表示转化为预测;托管组学数据云使碎片化数据可计算;以及按需生成新分子与蛋白质的设计服务。
- 基础模型与 NIM 服务:
- NVIDIA GenMol v2.0(NV-GenMol-89M-v2)是一个 8900 万参数的掩码扩散模型,在 SAFE 片段表示上训练,用于基于片段的分子生成、命中生成与先导优化,作为商用 BioNeMo NIM 提供。
- BioNeMo Agent Toolkit(2026 年 6 月 23 日)将结构预测、分子生成、对接、序列分析与基因组学封装为智能体 Skills,可通过托管与本地 NIM 访问,Anthropic 与 OpenAI 正在集成。
- 托管组学数据云:
- AWS HealthOmics 通过单次 API 调用运行多达 10 万个生物信息学工作流,并提供 VPC 连接工作流(2026 年 3 月)与临时暂存存储(2026 年 6 月),以加速比对、BAM 排序与变异检出。
- DNAnexus 在多组学中应用“将算法迁移到数据”的联邦模型,而 Elucidata 的 BioAgent 在 Polly 平台上将 6 小时的组学工作流压缩至约 20 分钟。
- 蛋白质与分子设计即服务:
- Cradle 的生成式平台(2024 年 11 月 7300 万美元 B 轮)为制药与工业生物技术团队提供自动蛋白质先导优化(CRADLE-1)。
- Dassault BIOVIA 构建于 BioNeMo Agent Toolkit 之上的智能体助手 MARIE,在 3DEXPERIENCE 平台上缩短了从科学家提问到正确执行计算之间的路径。
07价值链与生产流程
AI 增强生物信息服务参与的工业流程(FAIR 数据 · ISO 9001 · 21 CFR Part 11)
┌───────────────────────────┐ ┌───────────────────────────┐
│ 1. 数据摄取 │ ───> │ 2. 协调与机器学习就绪 │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 4. 智能体编排 │ <─── │ 3. 基础模型推理 │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 5. 人在回路验证 │ ───> │ 6. 交付与监管可追溯性 │
└───────────────────────────┘ └───────────────────────────┘阶段 1:数据摄取与治理
原始测序读段、质谱光谱与高内涵图像在 FAIR 与 21 CFR Part 11 数据完整性控制下被摄取到受治理的存储中;AWS HealthOmics 或 DNAnexus 等托管云提供符合 HIPAA 的落地区。
阶段 2:协调与机器学习就绪
平台策展元数据、协调多样的检测,并将碎片化的生物医学数据转化为分析就绪、机器学习就绪的张量;Elucidata 的 Polly 在此阶段对多组学与检测数据应用技术赋能的策展引擎。
阶段 3:基础模型推理
生成式与判别式生物模型给出预测——用于基于片段分子生成的 NVIDIA GenMol、用于功能的蛋白质语言模型,以及 AlphaFold 类结构服务——以 BioNeMo NIM 微服务形式提供,支持托管或本地使用。
阶段 4:智能体编排
LLM 智能体将模型服务与数据工具串联为多步科学计算;BioNeMo Agent Toolkit 与 BIOVIA MARIE 将科学家的自然语言提问转化为正确执行、可追溯的流水线。
阶段 5:人在回路验证
计算出的候选物与设计在发布前依据湿实验反馈与领域约束进行复核,Velsera 的临床基因组知识库与 Illumina TSO 解读提供真实世界证据层。
阶段 6:交付与监管可追溯性
经验证的靶点、候选物与蛋白质设计连同完整来源链交付给申办方的研发管线,用于向 FDA、EMA 或 NMPA 申报,完成从原始生物数据到可决策资产的闭环。
| 供应商 | 价格 | 交期 | 认证 | 风险 | 置信度 |
|---|---|---|---|---|---|
| NVIDIA | subscription / NIM credits | on request | Commercial Public (NASDAQ: NVDA) | 低 | HIGH |
| DNAnexus | subscription / enterprise | on request | Commercial | 低 | HIGH |
| Amazon | pay-per-use | on request | Commercial Public (NASDAQ: AMZN) | 低 | HIGH |
| QIAGEN | per-license / subscription | on request | Commercial Public (NYSE: QGEN) | 低 | HIGH |
| Cradle | subscription | on request | 中 | HIGH | |
| Elucidata | subscription / tech-enabled service | on request | 中 | HIGH |
AI note: biological-ai-bioinformation-services (CN)
Key directions:
- 超大规模生物云——完全托管、GPU 加速的分析服务;AWS HealthOmics 每次调用可运行多达 10 万个工作流(符合 HIPAA),NVIDIA BioNeMo 以 NIM 微服务形式提供生物模型。
- 生成式生物基础模型——在分子与蛋白质表示上训练并作为可调用服务提供的大型模型;NVIDIA GenMol v2.0 是一个 8900 万参数的掩码扩散模型,用于基于片段的分子生成,已在 BioNeMo NIM 家族中达到商用就绪。
- 托管组学数据平台——经过策展、协调、机器学习就绪的多组学数据;DNAnexus、QIAGEN Digital Insights 与 Elucidata 的 Polly 将碎片化的生物医学数据转化为分析就绪资产。
- 设计即服务——面向他人出售的生成式蛋白质与小分子设计;Cradle 于 2024 年 11 月筹集 7300 万美元,Dassault BIOVIA 的 MARIE 助手构建于 BioNeMo Agent Toolkit 之上。
Regulatory:
- 美国:FDA 药物开发中的 AI/ML 指南与 21 CFR Part 11 在生物 AI 产物进入受监管申报时管理软件/数据完整性层;AWS HealthOmics 符合 HIPAA 资格。
- 欧盟:EMA 人工智能反思文件为药物开发中使用的 AI 设定框架,并对生物信息学软件(QIAGEN、BIOVIA)施加数据完整性要求。
- 中国:NMPA 监管 AI 辅助发现;科技部“AI+药物”监管路线图(2026 年 4 月)设定了一条与 FDA、EMA 的 AI/ML 框架相呼应的趋同路径。
Companies not in table: Velsera(2023 年由 Seven Bridges + PierianDx + UgenTec 合并而成;其联邦式 Global Data Network 覆盖逾 1.75 亿患者,并为 Illumina TruSight Oncology Comprehensive 提供知识库——此处仅定性描述,以使表格聚焦于平台/原型领跑者);Dassault Systemes BIOVIA(复用规范 slug biovia;其智能体 AI 助手 MARIE 构建于 NVIDIA BioNeMo Agent Toolkit 之上,于 2026 年 6 月 23 日发布);Innoplexus / Partex.AI Technology(Innoplexus AG,浦那,成立于 2011 年,拥有逾 190 项美/欧专利,Discover-Rx 平台——一家真实的印度服务供应商,作为 Elucidata 之后的次级印度条目保留)。NVIDIA 与 Amazon 是超大规模厂商,其生物 AI 服务(BioNeMo、AWS HealthOmics)仅为更庞大公司的一条产品线。
Processing note: 服务以漏斗方式运作——原始数据落入受治理的 FAIR/21 CFR Part 11 存储,被协调为机器学习就绪张量,由作为 NIM 微服务提供的基础模型打分,再由 LLM 智能体串联为多步计算,经人在回路核验后,连同完整来源链交付给申办方。GPU 加速与联邦式“将算法迁移到数据”是两大吞吐杠杆;Elucidata 的 BioAgent 将 6 小时的组学工作流压缩至约 20 分钟。
Relevance: 这是当今每个现代生物经济垂直领域都赖以运行的计算与软件基底——NVIDIA 于 2026 年 6 月 23 日发布的 BioNeMo Agent Toolkit(被 Dassault、Lilly、OpenAI、Schrodinger、Snowflake 采用)与 DNAnexus 90% 的客户满意度,显示出一个快速复利增长的服务层。诚实的 MECE 边界是与姐妹文章 ai-drug-design-alphafold-applications(IND-328):IND-328 归属运营自有临床管线的药物设计公司(Isomorphic Labs、Recursion、Insilico、Exscientia、Schrodinger、EMBL-EBI),而本文归属出售给他人的平台/基础设施/服务层(NVIDIA、DNAnexus、Amazon、QIAGEN、Cradle、Elucidata)。中国板块刻意为定性描述:DP Technology(深势科技)与 BGI 云仅作为行业图景提及,因为通过 bocha.ai 进行的中文检索返回的是偏离目标的学术页面,而非公司层面的 2026 年事实(bocha 的已知失效模式),故未将任何中国公司列入表格,并以 AI+药物监管路线图作为经过核验的中文锚点引用。