ISMB/ECCB 2025 · Bioinformatics
VenusREM
检索增强的适应度预测,衔接高通量突变评估与湿实验定向进化——融合结构 / 序列蛋白质语言模型信号与显式 MSA 检索。
方法
VenusREM 做零样本突变评分:给定野生型序列、结构与可选替换列表,无需实验特异微调即可估计相对适应度。
结构与序列 PLM 信号结合 MSA 检索——同源比对以 EVCouplings a2m 或 ColabFold a3m 准备,随 VenusREM 数据集发布于 Hugging Face。
同一推理路径支持 ProteinGym 规模评估与单蛋白湿实验:准备序列、结构、结构 token 与比对后运行 compute_fitness.py。
设置 --alpha 0 可恢复无 MSA 重加权的 ProSST 风格分数,便于对照。
结果
2025 年 4 月在 ProteinGym Substitution 排行榜位列第 1;VenusMutHub 等相关套件亦表现强劲。 家族对比见英文 排行榜页;官方实时排名以 ProteinGym 为准。
相关工作
三者互补:深度、信息丰富的比对可用时检索更有利;MSA 浅或构建成本高时,坐标 / token 级结构模型往往更合适。 VenusREM 已集成进 VenusFactory2 (venusfactory.bio)。
引用
若使用 VenusREM,请引用:
@article{tan2025venusrem,
author = {Tan, Yang and Wang, Ruilin and Wu, Banghao and Hong, Liang and Zhou, Bingxin},
title = {From high-throughput evaluation to wet-lab studies: advancing mutation effect prediction with a retrieval-enhanced model},
journal = {Bioinformatics},
volume = {41},
number = {Supplement_1},
pages = {i401-i409},
year = {2025},
doi = {10.1093/bioinformatics/btaf189}
}