ICLR 2026

VenusX

大规模基准,面向残基、片段与结构域层面的细粒度蛋白质功能注释与配对。

Yang Tan, Wenrui Gou, Bozitao Zhong, Huiqun Yu, Liang Hong, Bingxin Zhou

VenusX:残基、片段与成对功能任务框架
VenusX 在残基、片段与成对相似性设定下评估细粒度功能理解。

方法:评测什么

全局蛋白标签与全序列嵌入只讲述部分故事。VenusX 要求模型在生物学真正发生的位置——局部位点、片段与匹配的子结构——解析功能,包含三类互补任务:

  • 残基级二分类——识别功能重要残基(活性位点、结合位点、保守位点、基序、结构域等)。
  • 片段级多分类——在家族感知划分下为序列片段赋予生物学角色。
  • 成对功能相似性评分——匹配功能相关的蛋白或片段,推理时无需显式功能标签。

结果要点

许多基准奖励全局能力;这些信号有价值,却可能掩盖局部 grounding 不足。 VenusX 将该差距显性化:跨家族残基任务对强预训练基线仍难,而混合家族与部分片段 / 成对设定则容易得多。

结构感知模型(如 SaProt)常领先困难的跨家族残基片段 MF50;强序列 PLM(Ankh、ESM2)可主导较易的混合家族残基任务。 成对 F50 活性位点匹配由 ESM-IF、Foldseek 等结构感知 / 对齐方法领先。 完整表格见英文 排行榜页;交互榜单见 ai4protein.github.io/venusx

数据与相关工作

数据集以 Hugging Face collection 发布: AI4Protein/venusx-dataset。 划分含跨家族、混合家族、MF50、F50 / P50;注释主要来自 InterPro(及 BioLiP / SAbDab 等选定设定)。 VenusX 亦集成于 VenusFactory2

引用

若使用 VenusX,请引用:

@inproceedings{tan2026venusx,
   title={{VenusX}: Unlocking Fine-Grained Functional Understanding of Proteins},
   author={Yang Tan and Wenrui Gou and Bozitao Zhong and Huiqun Yu and Liang Hong and Bingxin Zhou},
   booktitle={The Fourteenth International Conference on Learning Representations},
   year={2026},
   url={https://openreview.net/forum?id=zcmL592XRG}
}