← Library 文献库

Machine learning-guided evolution of pyrrolysyl-tRNA synthetase for improved incorporation efficiency of diverse noncanonical amino acids

Nature Communications · 2025 · Zhang Q, Jiang L, Niu Y, et al. (Haoran Yu lab)

蛋白工程 PylRS遗传密码扩展FFT-PLSR零样本预测定向进化 精读 CC BY 4.0 在线阅读(DOI) 下载 PDF

一句话点评:用「小数据有监督模型(FFT-PLSR)+ 零样本深度模型(ESM-1v / MutCompute / ProRefiner)」挖掘 PylRS 的 tRNA 结合域,得到 Com2-IFRS:非天然氨基酸掺入效率较起点提升 30.8 倍,且突变可移植到 7 种衍生酶、覆盖 6 类非天然氨基酸。

精读笔记

本文为开放获取文献(CC BY 4.0),PDF 可在本页下载;以下为我的阅读整理。

研究问题

方法:三段式机器学习路线

  1. 有监督小数据探索组合空间:以 IFRS(Mm PylRS N346I/C348S,底物换用更便宜的 3BrF)为起点,汇总 12 个已报道 N 端单突变的数据 → FFT-PLSR(AAindex 编码 + FFT 变换 + PLS 回归)预测 2¹²=4096 个组合;用 25 个双/三突变作测试集(R²=0.843),扩充训练集后预测 top8 → Com1-IFRS(D2N/V31I/T56P/R61K/H62Y/T122S/S193R),SCS 效率较 IFRS 提升 11 倍
  2. 零样本深度模型找新位点:ESM-1v(序列)、MutCompute(结构)、ProRefiner(逆折叠,输入 AlphaFold3 预测结构)共构建并测试 95 个单突变;随后用三编码 FFT-PLSR(R²=0.926)扫描全 TBD,并对 9 个位点做饱和突变绘制”可突变性图谱”,把空间收敛到约 11,520 个组合;以 92 个双突变训练、测试集 R²=0.729,预测 top20 全部实测(15 个提升 >2 倍)→ Com2-IFRS(N7Y/H63L/K67N/V74W),较 IFRS 提升 30.8 倍,荧光强度已接近野生型 sfGFP。
  3. 通用性验证:把 Com1/Com2 移植到 7 种 PylRS 衍生/嵌合酶,覆盖 Phe、Tyr、Trp、Cys、His、Lys 六类 ncAA 衍生物;对连续 2–5 个琥珀密码子的抑制效率提升 53–122 倍;应用示例是把 3-甲基组氨酸装进肌红蛋白 H93 位点,产量由 4.5 提升到 28.3 mg/L

机制解释(计算为主)

我的评价与保留