ISMB/ECCB 2025 · Bioinformatics

VenusREM

检索增强的适应度预测,衔接高通量突变评估与湿实验定向进化——融合结构 / 序列蛋白质语言模型信号与显式 MSA 检索。

Yang Tan, Ruilin Wang, Banghao Wu, Liang Hong, Bingxin Zhou

VenusREM 概览图
VenusREM 将 PLM logits 与检索到的 MSA 上下文融合,用于零样本适应度预测。

方法

VenusREM 做零样本突变评分:给定野生型序列、结构与可选替换列表,无需实验特异微调即可估计相对适应度。 结构与序列 PLM 信号结合 MSA 检索——同源比对以 EVCouplings a2m 或 ColabFold a3m 准备,随 VenusREM 数据集发布于 Hugging Face。

同一推理路径支持 ProteinGym 规模评估与单蛋白湿实验:准备序列、结构、结构 token 与比对后运行 compute_fitness.py。 设置 --alpha 0 可恢复无 MSA 重加权的 ProSST 风格分数,便于对照。

结果

2025 年 4 月在 ProteinGym Substitution 排行榜位列第 1;VenusMutHub 等相关套件亦表现强劲。 家族对比见英文 排行榜页;官方实时排名以 ProteinGym 为准。

相关工作

  • ProtSSN——氨基酸坐标上的几何编码(无需 MSA)。
  • ProSST——局部结构 token 与解耦序列–结构注意力。
  • VenusREM——在结构感知 PLM 评分之上叠加显式 MSA 检索。

三者互补:深度、信息丰富的比对可用时检索更有利;MSA 浅或构建成本高时,坐标 / token 级结构模型往往更合适。 VenusREM 已集成进 VenusFactory2venusfactory.bio)。

引用

若使用 VenusREM,请引用:

@article{tan2025venusrem,
    author = {Tan, Yang and Wang, Ruilin and Wu, Banghao and Hong, Liang and Zhou, Bingxin},
    title = {From high-throughput evaluation to wet-lab studies: advancing mutation effect prediction with a retrieval-enhanced model},
    journal = {Bioinformatics},
    volume = {41},
    number = {Supplement_1},
    pages = {i401-i409},
    year = {2025},
    doi = {10.1093/bioinformatics/btaf189}
}