ICLR 2026
VenusX
大规模基准,面向残基、片段与结构域层面的细粒度蛋白质功能注释与配对。
方法:评测什么
全局蛋白标签与全序列嵌入只讲述部分故事。VenusX 要求模型在生物学真正发生的位置——局部位点、片段与匹配的子结构——解析功能,包含三类互补任务:
- 残基级二分类——识别功能重要残基(活性位点、结合位点、保守位点、基序、结构域等)。
- 片段级多分类——在家族感知划分下为序列片段赋予生物学角色。
- 成对功能相似性评分——匹配功能相关的蛋白或片段,推理时无需显式功能标签。
结果要点
许多基准奖励全局能力;这些信号有价值,却可能掩盖局部 grounding 不足。 VenusX 将该差距显性化:跨家族残基任务对强预训练基线仍难,而混合家族与部分片段 / 成对设定则容易得多。
结构感知模型(如 SaProt)常领先困难的跨家族残基与片段 MF50;强序列 PLM(Ankh、ESM2)可主导较易的混合家族残基任务。 成对 F50 活性位点匹配由 ESM-IF、Foldseek 等结构感知 / 对齐方法领先。 完整表格见英文 排行榜页;交互榜单见 ai4protein.github.io/venusx。
数据与相关工作
数据集以 Hugging Face collection 发布: AI4Protein/venusx-dataset。 划分含跨家族、混合家族、MF50、F50 / P50;注释主要来自 InterPro(及 BioLiP / SAbDab 等选定设定)。 VenusX 亦集成于 VenusFactory2。
引用
若使用 VenusX,请引用:
@inproceedings{tan2026venusx,
title={{VenusX}: Unlocking Fine-Grained Functional Understanding of Proteins},
author={Yang Tan and Wenrui Gou and Bozitao Zhong and Huiqun Yu and Liang Hong and Bingxin Zhou},
booktitle={The Fourteenth International Conference on Learning Representations},
year={2026},
url={https://openreview.net/forum?id=zcmL592XRG}
}