论文笔记· 科学证据 · Frontier

AI 已经能快速设计上万种蛋白,实验室怎么跟上?

David Baker 团队这次没有再推一个更强的蛋白质生成模型。他们转向的是 AI4S 越来越绕不开的一个麻烦:模型几天就能吐出上万个候选,实验室却常常连几十个都验证不完。

更新于 10分钟阅读

同行评审论文 + 公开研究材料

当前边界目前主要验证的是 IPD 内部的筛选流程;复杂蛋白、跨实验室复现和自动选择下一轮实验仍未完成

这项工作推进的是让蛋白候选更快进入实体生产与标准化测量

  1. MODEL理解 / 预测
  2. DECIDE选择下一步
  3. INTERACT执行与测量
  4. UPDATE改变下一轮

01|发生了什么

2026 年 8 月 20 日,David Baker 团队在 Nature Communications 发表《Accelerating protein design by scaling experimental characterization》。工作主要来自华盛顿大学生物化学系和 Institute for Protein Design,活 RSV 中和实验由 Karolinska Institutet 的合作者完成。论文介绍了 SAPP 与 DMX 两套互相衔接的实验流程。[S1]

这篇论文在解决什么RFdiffusion、ProteinMPNN 几天就能给出上万条候选;传统湿实验往往几周才能表达、纯化和测量出几十条。设计端越快,等着被现实检验的队列反而越长——这是一个很容易被忽略的失衡。[S1]

计算机给出一条看起来不错的序列,不等于它在现实中能高效表达、保持可溶、不聚集,或形成预期的寡聚结构。这些问题最终都要回到实验室。大型 pooled assay 虽然能同时筛很多序列,却往往只读出 binding 或 stability 等少数性质,也很难告诉研究者每个独立蛋白是否真的好做、好纯化、状态正确。[S1]

Baker 团队这次没有再造一个更强的设计模型,而是重做设计之后的生产和测试流程。论文称,SAPP 与 DMX 已在 IPD 内部用于生产和表征数万种从头设计的蛋白质。它们要更快回答一个实际问题:这些候选里,到底哪些真的能做出来?[S1]

02|What Changed

SAPP 把蛋白质实验从逐个处理改成批处理

原来的队列拖在哪DNA 组装后,常规流程还要转化、涂板、挑单 colony、培养、提质粒、测序确认,再把正确质粒转进表达菌株。这一段会花掉数天,而且挑克隆很难大规模并行。[S1]

工程上的取舍SAPP 用 Golden Gate Assembly,并在接收载体里放入致死基因 ccdB。目标片段正确插入时会替换 ccdB;没插进去的背景载体受到强烈抑制。组装产物因此可以直接进入 E. coli 表达菌株,从 linear DNA 到接种好的 192 个表达培养物,大约只要两小时。[S1][S4]

这条捷径可靠吗?它并没有消除 DNA 合成与克隆错误。作者回查 929 个组装反应,89.3% 的样本中主克隆纯度超过 90%;对 863 个最终纯化蛋白做质谱,约 90% 的质量落在预期值 ±1 Da 内。正确 construct 通常是混合池里的主导成分,足以用于筛选,代价是偶尔漏掉真阳性。[S1]

测序并没有变得不重要。SAPP 只是把筛选和最终确认拆开:第一轮允许少量漏检,快速扫过几百上千个候选;找到值得继续的蛋白后,再做严格的单克隆和序列确认。

更关键的一步:每个样品都做 SEC,实验开始变成数据生产线

传统 96 孔筛选常常先跑 SDS-PAGE,看哪些蛋白“表达出来了”,再挑少数 candidate 放大培养。但有表达离“这是一个好蛋白”很远:它可能聚集、形成错误的 oligomer,或根本没有保持设计中的 native state。[S1]

SAPP 让每个样品先做亲和纯化,再直接进入体积排阻色谱(SEC)。色谱不仅负责纯化,也能同时读出可溶性产量、样品是否分散、估算分子量、聚集情况和寡聚状态。192 个样品约 15 小时过夜跑完,单样品不到五分钟。[S1]

Python 程序批量分析色谱,并自动生成液体处理机器人的操作步骤,完成组分合并和浓度归一化。最后得到一块装有纯化蛋白的 96 孔板,以及一份包含全部结果的标准化数据文件。整条 SAPP 流程约 48 小时,研究人员实际站在实验台前的时间约六小时。[S1][S3]

每个设计因此会以相同格式返回一组可以比较、也能继续交给程序处理的实验数据。

论文图 1:SAPP 从序列优化、质粒组装、表达、纯化到机器人合并的工作流与实验验证
论文图 1:SAPP 从序列优化、质粒组装、表达、纯化到机器人合并的工作流与实验验证

论文 Fig. 1 摘图。上方展示从 DNA 组装、SEC 到机器人合并的流程;下方是克隆纯度、质谱、色谱产量与重复性验证。Qian et al., Nature Communications (2026),CC BY 4.0。 [S1]

吞吐量为什么重要?几何结构的效果很难提前猜中

荧光蛋白案例先证明 SAPP 能在一周内为 96 个重新设计的 constructs 返回可比较数据。部分变体与 wild type 只有约 50%–80% sequence identity,却在 95°C 加热一小时后仍保持单体与吸收峰;另一些则出现明显不同的发射光谱。[S1]

更能说明问题的是 RSV。团队先从约 31,000 个针对 RSV F protein site III 的 minibinder 设计中筛出 cb13,亲和力为 35 nM;cryo-EM 显示实际结合结构与设计模型接近,binder backbone 的 Cα RMSD 为 1.9 Å。随后,他们把 cb13 接到 27 种寡聚化骨架上,做出 58 个 constructs,SAPP 选出 19 个表达和组装状态较好的样品送去做活病毒中和。[S1][S5]

两个构建体的 IC50 达到 40 pM 和 59 pM,而 cb13 单体是 5.4 nM,论文中的单抗 MPE8 对照为 156 pM。但更有信息量的是失败与分叉:同样是 cb13 二聚体,两个结构差约 25 倍;同一三聚化骨架,只把 binding domain 从 N 端换到 C 端就差近十倍;C6、C8 高价构型也没有自然变强。[S1]

吞吐量高了以后,研究者不必只验证模型最有信心的几个候选,还能系统比较目前很难提前排序的几何结构。一次只能做三五个构建体时,这类搜索几乎不会发生;一次能做几十或上百个后,它才变成一个可以靠实验回答的问题。

论文图 3:RSV 结合蛋白的寡聚构型、结构验证、色谱与中和实验结果
论文图 3:RSV 结合蛋白的寡聚构型、结构验证、色谱与中和实验结果

论文 Fig. 3 摘图。读图重点:本节主要看 f panel,同一个 cb13 binder 换成不同 oligomer geometry 后,RSV neutralization 可以相差约 25×;其余 panels 展示设计、组装与结构验证。Qian et al., Nature Communications (2026),CC BY 4.0。 [S1]

SAPP 跑通以后,下一个瓶颈马上出现:DNA 太贵

这是整篇论文里很典型的一条 systems story:瓶颈会移动,不会消失。蛋白表达、纯化和初步表征提速以后,作者发现大规模测试的主要成本开始变成 DNA synthesis。逐条订完整 gene fragment 很方便,可规模一旦上到几百、几千条,DNA 本身就会吃掉大部分预算。[S1]

便宜的 DNA 是 pooled 的,但实验需要的是 arrayed 的:一孔一个 construct,而且必须知道它是谁。

寡核苷酸池便宜得多,却把所有序列混在一起。DMX 处理的是这个格式错位:便宜的 DNA 是混合的,后续实验需要的却是一孔一个、身份明确的克隆。[S1][S2]

DMX:把便宜的序列池拆成“每孔一条,而且知道是哪条”

DMX 先把 DNA 库克隆进统一载体,再把菌落挑进 384 孔板。每孔的基因在细菌裂解液中接上组合条形码,随后重新混合,用 Nanopore 长读长测序建立条形码与基因序列的对应关系。分析程序输出挑取清单,液体处理机器人再把确认正确的菌落重排到新板中。[S1][S3]

四组各 24 个 barcode 理论上可以标记 24⁴,也就是 331,776 个 wells。一个包含 1,500 条设计的测试库中,团队分析 4,608 个 colonies,找回 78% 的目标变体,接近该采样深度下约 92% 的理论上限。[S1]

论文估算,相比逐条订 gene fragments,500-design campaign 的 DNA 成本约低五倍,2,000-design campaign 约低八倍;代价是多出约五天流程。因此一两百条设计直接用 SAPP 更省事,进入千级规模后,先用 DMX 降成本再接 SAPP 更合理。[S1][S2]

论文图 4:DMX 从寡核苷酸池、克隆挑取、条形码和测序到序列确认克隆库的流程
论文图 4:DMX 从寡核苷酸池、克隆挑取、条形码和测序到序列确认克隆库的流程

论文 Fig. 4 摘图。读图重点:沿着 oligo pool → colony picking → combinatorial barcode → Nanopore mapping,理解 DMX 怎样把混合序列池重新拆成一孔一个、身份明确的克隆库。Qian et al., Nature Communications (2026),CC BY 4.0。 [S1]

03|关键数字

48 小时

SAPP 完成一轮蛋白生产与标准化表征[S1]

约 6 小时

整轮流程中需要研究人员站在实验台前的时间[S1]

< 5 分钟 / 样品

SEC 分子筛层析的单样品时间[S1]

约 300 / 天

一台 chromatography instrument 的样品吞吐量,也开始成为下一道硬件边界[S1]

89.3%

929 个组装反应中,主克隆纯度达到 90% 以上的比例[S1]

5–8×

DMX 相比逐条订购 gene fragments 的估算 DNA 成本优势[S1]

04|为什么重要

SAPP 让每个设计经过相近的生产和表征流程,并把可溶性产量、样品分散情况、估算分子量、聚集与寡聚状态整理成统一的数据结构。[S1][S3]

湿实验由此可以持续返回格式一致的真实测量。模型提出候选,实验室把它们做出来并测量,这些结果才有机会进入下一轮模型训练或主动学习。[S1]

SAPP + DMX 提供了自动化蛋白质实验室需要的一部分基础设施,但还没有形成完整闭环。论文推进了蛋白质生产、测试和数据整理,还没有自动根据上一轮结果选择下一轮实验。[S1]

WHAT CHANGED

AI4S 层级
Experimental validation / Lab infrastructure
原有瓶颈
蛋白质生产与生化表征跟不上设计速度
这次改变
SAPP:48 小时完成一轮、每天处理数百个 designs,并输出标准化实验数据
关键证据
48 小时|SAPP 完成一轮蛋白生产与标准化表征
仍未解决
Complex proteins、application-specific assays,以及完整的 closed-loop experiment selection

EVIDENCE IN CONTEXT

编辑状态
前沿
证据场景
湿实验验证
证据怎样产生
实体实验
来源与可检查性
同行评审 · 公开材料
证据上限
它证明了蛋白生产和标准化表征可以显著提速,但没有证明实验反馈会自动改善下一轮设计。
谁做了什么
自动化处理重复步骤;研究人员定义候选、监督流程并完成特定功能实验

05|证据状态与边界

同行评审的方法论文,不是完整闭环的证明论文提供了流程、规模数据、案例和公开代码,但利用实验数据继续设计模型、自动选择下一轮实验,仍是未来方向。现在能说的是实验流程向前推进了一步,还不能说自主蛋白质发现已经跑通。[S1][S3]

筛选,不是最终金标准跳过 single-clone sequencing 会带来 false negative;gene 越长,DNA synthesis error 导致的 polyclonality 越明显。最终 hit 仍需要严格的单克隆与序列确认。[S1]

适用范围仍有限流程主要为容易获得较高表达量的 engineered 或 designed proteins 优化。需要复杂表达条件、特殊纯化、其他宿主或 application-specific functional assays 的蛋白,不能直接套用。[S1]

下一步要看的证据其他实验室能否在没有 IPD 原有经验的情况下稳定复现;流程能否扩展到更复杂的蛋白和功能实验;标准化数据接回模型以后,下一轮设计命中率是否真的提高。代码、Addgene 质粒和 cb13 结构已经公开,作者也披露了相关专利申请。[S1][S3][S4][S5]

06|What I Learned

01|AI4S 的瓶颈会移动,而不是消失我最想记住的不是 48 小时或 40 pM,而是瓶颈移动的过程:设计端变快后,湿实验验证浮出来;SAPP 把验证提速,DNA 成本又浮出来;DMX 压低 DNA 成本以后,SEC、特定功能实验和更复杂的表达体系还会继续出现。以后看一个 AI4S 模型或公司,可以先问:它把设计、生产、测试、学习中的哪一道瓶颈往后推了一步?

02|Screening 与最终验证不必使用同一套精度标准SAPP 接受少量假阴性,换取更大的候选覆盖;最终命中结果再严格确认。筛选与确认使用不同精度,是为了避免第一轮就被成本和时间拖垮。

03|实验室自动化先重做流程,再决定哪里用机器人SAPP 的数量级提升主要来自删掉不适合大规模筛选的步骤、统一 plate format、用 auto-induction 减少人工干预,并把 purification 与 characterization 合并。机器人只接手 pooling、normalization 等高度重复的工作。Lab automation 不等于 robot everywhere,很多时候 process design 才是第一层杠杆。

04|吞吐量会改变我们能够提出什么问题RSV 案例里,同一个结合蛋白、同样的价数,只换几何结构就能差 25 倍。一次只能做三五个构建体时,研究者很难系统探索这种空间;一次能做几十或上百个后,原本只能靠直觉的问题开始能被实验回答。

05|闭环 AI 需要标准化真实数据,不只是更快的实验如果结果仍要研究人员手工看图、每个项目又使用不同格式,再快的实验也很难持续积累可用数据。SAPP 把每个设计的结果整理成统一结构;只有湿实验能稳定、低成本地返回这些真实测量,设计、生产、测试和学习才可能接起来。

资料来源

文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。

  1. S1通过扩展实验表征加速蛋白质设计Nature Communications · 2026.08.20 · 同行评审论文
  2. S2论文预印本与早期数据、代码入口bioRxiv · 2025.08.06 · 预印本
  3. S3SAPP 与 DMX 分析和自动化代码GitHub · bwicky/SAPP_DMX · 2025 · 开源代码
  4. S4SAPP 与 DMX 相关质粒和条形码试剂Addgene · 2025 · 实验材料
  5. S5RSV F 与设计结合蛋白 cb13 的复合物结构RCSB Protein Data Bank · 2026 · 公开结构数据