Journal of Cheminformatics 2024

PETA

系统研究子词分词——BPE 与 Unigram 相对逐氨基酸词表——如何塑造蛋白质预训练及其向下游应用的迁移。

Yang Tan, Mingchen Li, Ziyi Zhou, Pan Tan, Huiqun Yu, Guisheng Fan, Liang Hong

PETA:蛋白质迁移学习中的子词分词
PETA 在匹配的预训练与微调协议下,比较逐残基与子词蛋白质分词器。

方法

多数蛋白质语言模型按氨基酸逐个分词。选择简单且符合生物学直觉,却忽略了 NLP 的教训: 子词单元可压缩重复基序、改变上下文长度,并改写 Masked LM 所学表征。

PETA 在架构与预训练预算大致固定时,比较不同规模的 BPE / Unigram 词表与经典逐 AA 分词器在真实下游蛋白任务上的表现。 项目在 Hugging Face 发布系列 Masked LM 检查点(AI4Protein/deep_*):

  • 逐 AA 基线——AI4Protein/deep_base(词表 33)
  • BPE——词表 50 → 3200(deep_bpe_*
  • Unigram——词表 50 → 3200(deep_unigram_*

结果

除发布预训练模型外,PETA 提供微调脚手架(peta/train.py):选择数据划分、池化头、精度,以及全骨干或仅头微调。

结论偏评估性而非“永久最佳分词器”:子词方案改变序列压缩与归纳偏置,对迁移的影响依赖任务与词表规模——PETA 提供可控对照以度量该权衡。

引用

若使用 PETA,请引用:

@article{tan2024peta,
  title={PETA: evaluating the impact of protein transfer learning with sub-word tokenization on downstream applications},
  author={Tan, Yang and Li, Mingchen and Zhou, Ziyi and Tan, Pan and Yu, Huiqun and Fan, Guisheng and Hong, Liang},
  journal={Journal of Cheminformatics},
  volume={16},
  number={1},
  pages={92},
  year={2024},
  publisher={Springer},
  doi={10.1186/s13321-024-00884-3}
}