生物计算与 DNA 计算
01概述与价值链
Markers: [EC: 研究阶段,无专门合规路径 | OECD: 1.6 基因组学与生物信息学 | Regulator: FDA(美国)、EMA(欧盟)]
生物计算包含共享同一基质的两个不同命题。其一是存储:DNA 以磁介质与光介质无法企及的密度承载数据,并可保持数百年可读,因此工程难题不在容量而在访问——低成本写入、在数十亿条中找到某一文件,并在会破坏数据的合成与测序流程之下完成恢复。已发表的六种代表性编解码器对比显示,编码层单独评估时可容忍约 14% 的错误率与约 65% 的序列丢失,这正是让一种天然"有损"介质变得可用的余量。其二是计算:活细胞内执行逻辑的基因线路;2026 年的工作以正交反式剪接 AND 门与合成 microRNA 构建,演示了三输入组合逻辑门、半加器、全加器与动态多路复用器——由细胞而非晶体管执行的算术。围绕两者还存在一支规模较小的"非常规计算"传统,把黏菌与真菌菌丝视作计算基质。对上述一切,2026 年的诚实定位是:这是研究与专利活动,而非产品市场;被点名的参与者是企业研究实验室、高校与提交专利的平台公司,且生物计算机并不存在任何合规评定路径。
生物计算的关键方向是:
- DNA 数据存储与随机访问: 把数据编码进合成的多核苷酸并从池中取回特定文件;专利工作把全池扩增与测序仪内随机访问相结合,使访问与读取合并为工作流中的单一步骤。
- DNA 存储的纠错编码: 使有损介质变得可靠的编解码层;六种代表性方案的对比显示,单独评估时可容忍约 14% 的错误率与约 65% 的序列丢失,而现实部署下的可用密度低于这些孤立数值所暗示的水平。
- 基因线路计算: 在哺乳动物细胞内以正交反式剪接 AND 门、原生—合成杂合启动子与实现抑制逻辑的合成 microRNA 构建的逻辑;2026 年在少数计算层内演示了三输入门、半加器、全加器与动态三选一多路复用器。
- 非常规与生物混合计算: 把活系统作为计算与传感基质——驱动机器人导航的 Physarum polycephalum 元胞自动机模型,以及被提出作为分布式传感、自愈与异常检测层的真菌菌丝网络。
行业价值链
[编码与设计] ──> [分子写入] ──> [存储/执行] ──> [分子读取]
│
(纠错)
│
▼
[恢复的数据 / 输出] <─── [解码] <───────┘价值链层级
| 层级 | 描述 | 关键输入/输出 |
|---|---|---|
| 编码与设计 | 把数据或逻辑映射到核苷酸序列——码字设计、约束处理与纠错方案均在合成之前确定 | 输入: 源数据或逻辑规格、编解码器选择。 输出: 带约束与冗余的序列设计。 |
| 分子写入 | 合成序列,这是整个领域在成本与保真度上的瓶颈;高通量、低成本、高保真合成是明确的研究目标 | 输入: 序列设计、合成平台。 输出: 承载有效载荷的物理 DNA 池。 |
| 存储或执行 | 将池归档;在计算分支中,等效步骤是在活细胞中表达线路,由细胞自身机制评估逻辑 | 输入: DNA 池或工程细胞、存储或培养条件。 输出: 稳定归档,或已执行的生物计算。 |
| 分子读取 | 以测序取回,并通过随机访问定位被寻址的子集而非通读整池;访问与读取可在测序仪内合并 | 输入: 归档池、访问引物或测序仪内方法。 输出: 被寻址数据的原始读长。 |
| 纠错与解码 | 编解码器在替换、插入、缺失与整条序列丢失之下重建有效载荷——决定介质是否可用的一层 | 输入: 带错误与丢失的原始读长。 输出: 纠正后的码字、恢复的有效载荷。 |
| 恢复的数据或输出 | 返回原始文件,或把细胞线路的逻辑输出作为生物信号读出 | 输入: 解码数据或线路输出。 输出: 经校验的数据,或被触发的细胞响应。 |
行业跨领域技术:
- 分子电子学传感: 使用 DNA 报告标签、面向多重基因分析的单分子电子传感器,提供电学而非光学的读出。
- 高保真 DNA 合成: 存储与线路构建共用的写入步骤,其通量、成本与保真度共同决定经济可行的边界。
- 仿生与元胞自动机算法: 取自生物体(尤以 Physarum polycephalum 为代表)的计算模型,既用于驱动生物混合硬件,也作为常规机器人学中的算法。
02美国
美国的贡献分为两端:一家把 DNA 视作归档存储层的企业研究项目,以及一家构建分子电子学读出的平台公司;两者主要通过专利申请而非出货产品可见。
微软的 DNA 存储随机访问、Roswell 的分子电子学、处于专利阶段的成熟度
- Microsoft(DNA 数据存储): Microsoft Technology Licensing 的一项专利申请描述了在保留随机访问读取能力的前提下复制存储容器中全部多核苷酸编码数据的方法,将全池扩增与测序仪内随机访问结合,使访问与读取在单一工作流步骤内完成——正面解决了把 DNA 归档与 DNA 样本区分开来的取回问题。
- Roswell Biotechnology(分子电子学): 这家圣迭戈公司的申请覆盖使用 DNA 报告标签、面向多重基因分析的分子电子传感器,以及用于生物传感的 N 端多功能肽偶联与α-螺旋肽。文件描述的是技术平台而非成品,其源头可追溯至 2020 年的临时申请。
- 坦率给出的成熟度: 2026 年信源中,两家公司可见的是知识产权与平台描述,而非营收、部署规模或融资披露——这正是美国商业部门中分子计算与存储的准确状态。
03中国
中国的活动集中于高校项目,它们把 DNA 信息存储视为需要端到端优化的工程流水线,招聘方向直指合成与纠错这两个瓶颈。
上海交大 Bio-X 的 DNA 信息存储、合成平台优化、编码与纠错
- 上海交通大学(Bio-X 研究院): 师咏勇团队于 2026 年明确面向 DNA 信息存储与 DNA 合成平台优化招聘博士后,涵盖 DNA 编码设计、数据写入、测序读出、错误校正与信息恢复,作为一条连贯的工作流。
- 合成被明确列为瓶颈: 同一项目把目标表述为高通量、低成本、高保真 DNA 合成,并把实验方案设计、流程优化与性能评估列为具体工作——准确反映出当前限制该领域的是写入而非读取环节。
- 招聘的学科广度: 候选人来自分子生物学、合成生物学、化学生物学、生物化学、核酸化学、生物工程、生物信息学、计算生物学、信息存储与测序技术等背景,并把 DNA 信息存储与编码/纠错算法列为优先——正是该领域所需的跨学科画像。
04欧盟
欧洲提供了让 DNA 存储值得信赖的理论层,以及历时最久的非常规计算传统;两者均属学术而非商业。
ETH Zurich 的编解码器对比、UWE Bristol 的非常规计算、真菌生物混合系统
- ETH Zurich(纠错编码对比): 2026 年 3 月发表于 Nature Communications 的研究在 in silico 与 in vitro 条件下系统对比了六种面向序列式 DNA 数据存储的代表性编解码器,发现单独评估时可容忍约 14% 的错误率与约 65% 的序列丢失,而现实部署意味着可用存储密度低于这些孤立数值所暗示的水平。
- UWE Bristol(非常规计算实验室): 包括 Genaro J. Martínez 与 Andrew Adamatzky 在内的研究者制作了警戒机器人 McIntosh I,其导航由基于 Physarum polycephalum 复杂元胞自动机模型的仿生算法驱动,合作方包括墨西哥人工生命与机器人实验室以及捷克非常规算法与计算实验室。
- 真菌生物混合系统: 同一传统的工作提出以活体真菌菌丝网络作为面向安全与韧性的生物混合基质——分布式传感、自愈材料与低可观测性的异常检测,凭借去中心化控制、具身记忆与自主修复,用于基础设施保护与环境监测。
05领先公司与研究机构
| 公司 / 机构 | 国家 | 关键产品 / 平台 | 技术特点 | 2026 年状态 |
|---|---|---|---|---|
| 上海交通大学 | 🇨🇳 中国 | Bio-X DNA 信息存储项目 | 端到端流水线:编码设计、数据写入、测序读出、纠错与恢复;目标为高通量、低成本、高保真合成 | research;2026 年在招 |
| ETH Zurich | 🇨🇭 瑞士 | DNA 存储纠错编码对比 | 在 in silico 与 in vitro 下系统对比六种编解码器;单独评估约 14% 错误容限、约 65% 序列丢失;实际密度更低 | research;Nature Communications,2026 年 3 月 |
| UWE Bristol | 🇬🇧 英国 | 非常规计算实验室、McIntosh I | Physarum polycephalum 元胞自动机导航;真菌菌丝网络作为分布式传感与自愈基质 | research;国际合作 |
| Roswell Biotechnology | 🇺🇸 美国 | 分子电子传感器 | 以 DNA 报告标签进行单分子电子传感、面向多重基因分析;N 端肽偶联生物传感 | platform stage;专利申请,未声明产品发布 |
| Microsoft | 🇺🇸 美国 | DNA 数据存储随机访问 | 全池扩增结合测序仪内随机访问,把访问与读取合并为一步 | research;专利申请 |
06技术栈与创新
该技术栈宜读作两列——存储与计算——共同架设在同一物理层(分子合成与测序)之上,旁侧则并行着一条非常规计算传统。
- DNA 存储:写入、寻址、读取:
- 数据被编码为受生化约束的核苷酸序列并合成;写入是成本与保真度的瓶颈,因此明确的研究目标是高通量、低成本、高保真合成,而非更高密度。
- 取回才是归档与样本的分水岭:全池扩增结合测序仪内随机访问,使得在复制整池的同时仍能读取特定被寻址子集,把两步操作并为一步。
- 纠错编码:
- 在 in silico 与 in vitro 条件下对六种代表性编解码器的对比显示,各自单独评估时可容忍约 14% 的错误率与约 65% 的序列丢失。
- 同一工作明确指出,现实部署意味着可用存储密度低于孤立编解码器性能所暗示的水平——这正是基准测试与可用归档之间的落差。
- 基因线路计算:
- 由正交反式剪接 AND 门、原生—合成杂合启动子与实现抑制逻辑的合成 microRNA 构建的哺乳动物基因线路,在少数计算层内即可运行,这正是其可扩展的原因。
- 2026 年演示的线路包括三输入组合逻辑门、半加器、全加器与动态三选一多路复用器——与数字电子学相同的原语,却由细胞机制求值。
- 分子电子学与生物混合基质:
- 分子电子传感器借助 DNA 报告标签以电学方式读取单分子事件,用于多重基因分析,完全绕开光学检测。
- 生物混合计算把生物体本身当作机器:Physarum polycephalum 元胞自动机模型驱动机器人导航,真菌菌丝网络则被提出作为具备具身记忆与自主修复的分布式传感与自愈层。
07价值链与生产 pipeline
DNA 信息存储项目的工业 pipeline(研究阶段;无专门合规路径,FDA/EMA 仅在生物学输出涉及临床时相关)
┌───────────────────────────┐ ┌───────────────────────────┐
│ 1. 编解码器与序列设计 │ ───> │ 2. DNA 合成(写入) │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 4. 随机访问取回 │ <─── │ 3. 池存储 │
└───────────────────────────┘ └───────────────────────────┘
│
▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ 5. 测序读出 │ ───> │ 6. 纠错与恢复 │
└───────────────────────────┘ └───────────────────────────┘阶段 1:编解码器与序列设计
有效载荷在生化约束下被映射到核苷酸序列,纠错方案须在合成之前选定,因为冗余必须设计进码字之中而非事后附加。这一选择关系重大:受测编解码器在可承受的替换错误与整条序列丢失上的表现各不相同。
阶段 2:DNA 合成(写入)
设计好的序列被合成为物理池。这是该领域的约束条件——通量、成本与保真度三者合一——也是专门研究项目所声明的攻关目标,而非已被解决的常规环节。
阶段 3:池存储
合成池被归档,DNA 的密度与长寿正是驱动整套方法的优势所在。在计算分支中,等效阶段是在活细胞中表达线路,由细胞机制求值逻辑而非储存数据。
阶段 4:随机访问取回
在不通读全部内容的前提下找到某一文件,才使归档具备实用性。专利工作把全池扩增与测序仪内随机访问结合,在复制池的同时保留按址取回,并把访问与读取步骤合并。
阶段 5:测序读出
被寻址的子集经测序产生带有替换、插入、缺失与丢失的读长。原始读出必然受损;整条流水线的设计前提正是介质有损,而由编码层加以补偿。
阶段 6:纠错与恢复
编解码器重建有效载荷,在孤立基准下可容忍约 14% 的错误率与约 65% 的序列丢失。现实的端到端部署所得可用密度低于这些孤立数值的暗示——这正是衡量 DNA 存储在 2026 年真实位置的诚实标尺。
| 供应商 | 价格 | 交期 | 认证 | 风险 | 置信度 |
|---|---|---|---|---|---|
| Microsoft Research | custom | null | 中 | HIGH | |
| Shanghai Jiao Tong University | custom | null | 中 | HIGH | |
| ETH Zurich | custom | null | 中 | HIGH | |
| UWE Bristol | custom | null | 高 | HIGH | |
| Roswell Biotechnology | custom | null | 高 | HIGH |
AI note: biocomputing-dna-computing (CN)
关键方向:
- DNA 数据存储与随机访问——Microsoft Technology Licensing 关于全池扩增结合测序仪内随机访问的专利,使复制整池的同时仍保留按址取回,并把访问并入读取步骤。DNA 存储的难题在访问而非容量。
- 纠错编码——2026 年 3 月 Nature Communications 的研究(ETH Zurich)在 in silico 与 in vitro 下对比六种代表性编解码器:单独评估时可容忍约 14% 错误率与约 65% 序列丢失,但同一工作指出现实部署意味着可用密度低于这些孤立数值。两半都要引用:那条限定本身就是结论。
- 基因线路计算——2026 年 Nature Communications 关于在少数计算层内运行的模块化哺乳动物基因线路的工作:正交反式剪接 AND 门、原生—合成杂合启动子、实现抑制逻辑的合成 microRNA;已演示三输入组合门、半加器、全加器与动态三选一多路复用器。未归属于表中任何机构——见下。
- 非常规与生物混合计算——UWE Bristol 非常规计算实验室(Genaro J. Martínez、Andrew Adamatzky)制作了警戒机器人 McIntosh I,其导航基于 Physarum polycephalum 复杂元胞自动机模型,并有墨西哥与捷克合作方;另有真菌菌丝网络被提出作为生物混合的分布式传感、自愈与低可观测异常检测。
法规:生物计算机并不存在合规评定路径。FDA/EMA 保留在 front matter 中,仅在生物学输出进入临床时才相关。2026 年三个区域的准确状态都是研究与专利活动而非产品市场——应如实书写,不得暗示商业成熟度。
未列入表格的公司:MIT 已剔除。其最初 5/5 的相关性得分是子串匹配的假象(“MIT” 出现在 “transmitted”/“limited”/“submitted” 之中);在词边界修复(bf65cbc4)之后得分为 1/5,而那唯一一条匹配是 Nature Biomedical Engineering 关于药物响应型自扩增 RNA 的论文,与生物计算无关。因此方向 3 的基因线路成果以 2026 年的领域发现引用,不作机构归属,因为检索到的信源并不能确立其归属。在没有点名 MIT 于 DNA/细胞计算的信源之前,不要重新加入 MIT。
工艺说明:在生化约束下进行编解码器与序列设计(冗余须设计进码字而非事后添加)-> DNA 合成,通量、成本与保真度上的约束条件 -> 池存储,或在计算分支中于活细胞内表达线路 -> 随机访问取回,这正是归档与样本的分界 -> 测序读出,必然带有替换、插入、缺失与丢失 -> 纠错与恢复,约 14%/约 65% 的容限在此适用,而现实密度低于基准值。
相关性:INT-010 归入 bioinformatics-omics。三种语言中均写明的诚实说明:Microsoft 与 Roswell 仅以专利与平台描述可见,未披露营收、部署规模或融资,文中已如实指出;ETH Zurich 与 UWE Bristol 是研究团队而非供应商;上海交大以 2026 年招聘项目而非产品列入。