<?xml version="1.0" encoding="utf-8"?><feed xmlns="http://www.w3.org/2005/Atom" xml:lang="en"><generator uri="https://jekyllrb.com/" version="3.10.0">Jekyll</generator><link href="https://tyang816.github.io/feed.xml" rel="self" type="application/atom+xml" /><link href="https://tyang816.github.io/" rel="alternate" type="text/html" hreflang="en" /><updated>2026-07-26T21:10:21+08:00</updated><id>https://tyang816.github.io/feed.xml</id><title type="html">Yang Tan</title><subtitle>Yang Tan (谭扬) — PhD student at SJTU &amp; SII.</subtitle><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><entry xml:lang="en"><title type="html">arXiv-2026 BiomniBench：Process-level Evaluation of LLM Agents for Real-world Biomedical Research</title><link href="https://tyang816.github.io/bi/BiomniBench-Process-level-Evaluation-of-LLM-Agents-for-Real-world-Biomedical-Research/" rel="alternate" type="text/html" title="arXiv-2026 BiomniBench：Process-level Evaluation of LLM Agents for Real-world Biomedical Research" /><published>2026-05-12T00:00:00+08:00</published><updated>2026-05-12T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/BiomniBench%20Process-level%20Evaluation%20of%20LLM%20Agents%20for%20Real-world%20Biomedical%20Research</id><content type="html" xml:base="https://tyang816.github.io/bi/BiomniBench-Process-level-Evaluation-of-LLM-Agents-for-Real-world-Biomedical-Research/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://www.biorxiv.org/content/10.64898/2026.05.12.724604v1">BiomniBench：Process-level Evaluation of LLM Agents for Real-world Biomedical Research</a></p>

  <p>论文实现：<a href="https://huggingface.co/datasets/phylobio/BiomniBench-DA">https://huggingface.co/datasets/phylobio/BiomniBench-DA</a></p>
</blockquote>

<h2 id="biomnibench过程级生信分析智能体评测集">BiomniBench：过程级生信分析智能体评测集</h2>

<h3 id="abstract">Abstract</h3>

<p>当前，大语言模型（LLM）智能体已经能够执行真实的生物医学研究，但对其进行严格评估却十分困难，因为仅关注结果的基准测试（Outcome-only benchmarks）存在两个主要缺陷 。<strong>首先</strong>，正确的最终答案可能源于模型记忆、奖励作弊（reward hacking），或者是碰巧得出正确数字的错误推理过程 ；<strong>其次</strong>，一些有效的替代分析方法仅仅因为与参考标准不同，就会被判定为错误 。为了解决这些问题，研究团队引入了 <strong>BiomniBench</strong>，这是一个过程级（process-level）评估框架，它会根据专家设计的、针对特定任务的评分量表（rubrics），对智能体的完整分析轨迹进行全面打分 。该框架的首个发布版本 <strong>BiomniBench-DA</strong> 包含了100个数据分析任务，跨越了17种任务类型、5个疾病领域以及一个通用生物学类别；这些任务均基于《Nature》、《Cell》和《Science》等顶级期刊的论文，并与原论文作者或领域专家共同开发完成 。该研究在四种智能体框架（agent harnesses）下对前沿闭源模型和开源模型进行了基准测试，并得出了三个核心发现 ：第一，前沿模型和开源基础模型的得分高度集中（差距在几分以内），且所有模型都存在巨大的进一步提升空间 ；第二，<strong>智能体框架带来的得分变化，甚至超过了连续两代模型更迭之间的性能差距</strong> ；第三，智能体虽然能够可靠地将论点建立在真实的文献来源之上，但在<strong>方法选择、生物学解释和科学推理</strong>方面却始终表现出明显的不足 。总体而言，BiomniBench 是首个针对生物医学研究中 LLM 智能体的过程级基准测试，它提供了仅靠结果评分无法实现的细粒度、维度级诊断能力 。</p>

<h3 id="1-introduction">1 Introduction</h3>

<p>大语言模型（LLM）智能体正在重塑生物学研究，通过将语言理解与代码执行、工具使用以及结构化数据库访问相结合，现今的智能体能够设计CRISPR和基因扰动实验、分析空间转录组数据、规划自动化化学工作流、支持药物发现流程并解读临床多组学数据，这些工作过去曾需要专家投入数小时乃至数天的时间 。随着这些能力的成熟，无论是专用的生物医学智能体还是诸如Claude Code和OpenAI Codex等通用编码智能体，正被严肃地引入学术界和工业界的真实科学工作流中 ，这引发了一个核心问题：我们如何知道这些智能体何时真正做出了好的科学研究 ？大多数现有的基准测试试图通过最终答案评分（如精确匹配、二元正确性或对保留结果的通过/失败判别，例如HLE和BixBench）来回答这一问题 。这对于拥有单一可验证答案的问题有效，但在复杂的生物医学研究中，<strong>仅关注结果的评估（outcome-only evaluation）会从两方面失效</strong> ：</p>

<ol>
  <li>最终答案基准测试容易导致数据污染和<strong>奖励作弊（reward hacking）</strong>，已发表的数据集经常出现在训练语料库中，且结果评分奖励的是落到正确答案上而非严谨的分析过程 。智能体可能在返回干净的火山图、排序基因列表和做出自信解读的同时，其轨迹却暴露了错误的归一化、被忽略的批次效应以及捏造的引用 。</li>
  <li>真实的科研是开放式的，<strong>多种分析路径可以产生不同但均合理解释的答案</strong>，因此结果匹配会惩罚那些尽管分析严谨但与参考标准产生分歧的替代路径 。在生物学中，这些失效的代价尤为高昂，因为 flawed 分析会在有人注意到之前的数月里，悄然传播到湿实验、药物开发决策及下游研究流程中 。</li>
</ol>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了解决这些局限性，研究团队引入了<strong>BiomniBench</strong>，这是一个用于评估生物医学研究任务中LLM智能体的<strong>过程级评估框架（process-level evaluation framework）</strong> 。相比于仅对最终结果进行评分，BiomniBench会利用LLM裁判，对照专家设计的、针对特定任务的评分量表，对智能体的<strong>完整分析轨迹进行评级（如原文图1所示）</strong> 。该框架由三个设计原则塑造：</p>

<ol>
  <li><strong>将任务立足于现实世界的研究</strong>：每个任务均衍生自已发表的研究，并需要多步推理、方法选择和结果解读</li>
  <li><strong>评估过程而非仅关注输出</strong>：评分量表对每一步骤的分析决策质量进行打分，以区分出用错误方法碰巧得出正确答案与用严谨方法但因微小偏差错失完美答案的情况 ；</li>
  <li><strong>包容多种有效方法</strong>：每个量表都编码了替代的分析路径，确保智能体不会因选择与参考分析不同的合理方法而受到惩罚 。</li>
</ol>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/fig5.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了确定该框架的首个发布版本，团队<strong>分析了来自开源Biomni平台的32,014个用户提交的任务</strong>，发现<strong>数据分析主导了其分布，占比高达63.3%</strong>，远超文献研究、实验设计、快速事实查询和手稿撰写 。因此，团队发布了<strong>BiomniBench-DA</strong>，其中包含精心挑选自《Nature》、《Cell》、《Science》及同级期刊论文的100个数据分析任务，跨越17种任务类型、5个疾病领域和一个通用生物学类别 。每个任务均与原论文作者或拥有5年以上研究经验的领域专家共同开发，包含底层公共数据集、多步参考轨迹和特定任务量表 ，量表从<strong>数据处理、方法选择、统计严谨性、生物学解释、科学推理和来源可靠性</strong>六个维度进行打分 。</p>

<p>研究在四种智能体框架（Codex CLI、Terminus-2、Claude Code、Gemini CLI）下对前沿闭源系统（Claude Opus 4.7、GPT-5.5、Gemini 3.1 Pro）和开源权重模型（GLM-5.1、Qwen 3.6、Kimi K2.6）进行了基准测试 ，结果显示：前沿模型与开源基础模型的表现高度集中（差距在几分以内），且所有模型均存在巨大的提升空间 ；<strong>智能体框架带来的得分变化甚至超过了连续两代模型更迭之间的差距</strong> ；维度级别的分析揭示出智能体虽然能够可靠地将论点建立在真实文献来源上，但在<strong>方法选择、生物学解释和科学推理上却始终表现出明显的不足</strong> 。这些结果共同将BiomniBench确立为首个针对真实生物医学研究中LLM智能的过程级基准测试，为模型开发者、智能体构建者和科学界提供了一个用于追踪能力进展的共享基准 。</p>

<h3 id="2-biomnibench-da-benchmark-design">2 BiomniBench-DA: Benchmark design</h3>

<p>BiomniBench-DA 旨在以科研人员在现实中遇到的方式向智能体呈现生物医学研究任务：由已发表的研究提供问题和参考解决方案，由原作者共同开发的评分量表对智能体的分析轨迹进行评分，并通过 <strong>Harbor 执行框架</strong>提供标准化的环境以统一不同智能体框架的输出 。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="21-expert-driven-curation-pipeline">2.1 Expert-driven curation pipeline</h4>

<p>BiomniBench-DA 的 100 个任务是通过一个包含五个阶段的流水线生成的（如<strong>图 2</strong> 顶部所示），从分析生物医学智能体的使用情况开始，到构建特定任务的评分量表结束 。</p>

<ul>
  <li><strong>分析 Biomni 用户轨迹（Analyzing Biomni user traces）：</strong> 研究团队分析了开源 Biomni 平台上的 <strong>32,014 个用户查询</strong>，以了解科学家实际要求智能体执行哪些操作 。数据分析在这些任务中占据主导地位，这成为了将 BiomniBench-DA 作为框架首个发布版本的动机 。最常见的生物医学领域包括肿瘤学、免疫学和神经科学，常见的任务涵盖差异表达、通路分析以及大量长尾的专业分析 。</li>
  <li><strong>论文选择（Paper selection）：</strong> 基于上述模式，研究团队根据四个标准选择源论文 ：（1）论文的分析需匹配 Biomni 用户轨迹中观察到的常见任务类型 ；（2）覆盖多样化的疾病领域和分析方法，横跨基础科学和转化医学，以确保基准测试对学术界和工业界均有相关性 ；（3）底层数据可通过 GEO、ArrayExpress 等公共存储库或论文补充材料公开获取 ；（4）论文发表在高影响力期刊（如《Nature》、《Cell》、《Science》及其子刊）或具有同等水准的最新预印本上 。最终的 100 个任务来自 21 篇此类出版物（完整列表见<strong>附录表 4</strong>） 。</li>
  <li><strong>专家策划（Expert curation）：</strong> 对于每篇选定的论文，团队会<strong>招募原作者或拥有 5 年以上研究经验的领域专家</strong>，负责提出研究问题并准备底层数据集 。目标并非单纯复现论文的分析，而是捕捉不同的难度和主题多样性，甚至包括论文未直接解决但数据可以支持的问题 。</li>
  <li><strong>真实值/参考答案生成（Ground-truth generation）：</strong> 专家需要以 Jupyter notebook 或 R Markdown 的形式生成参考分析轨迹，完整记录分析代码和推理过程、最终答案，以及超出源论文报告范围的生物学解释 。每个轨迹都在公共数据集上验证运行，并由独立审查员进行多轮审核以确保正确性 。</li>
  <li><strong>量表设计（Rubric design）：</strong> 每个任务包含一个具有 <strong>5-10 个评分标准的特定量表</strong>。这些标准锚定在分析的关键决策点上，并标记为六个评估维度之一：<strong>数据处理（data handling）、方法选择（method selection）、统计严谨性（statistical rigor）、生物学解释（biological interpretation）、科学推理（scientific reasoning）和来源可靠性（source reliability）</strong> 。每个标准分为 A（完全正确）、B（意图正确但有小错或部分匹配）、C（跳过或完全错误）三个等级 。量表会列出适用的多种正确替代方案，以确保采取合理但不同分析路径的智能体不会被扣分 。</li>
</ul>

<h4 id="22--evaluation-protocol">2.2  Evaluation protocol</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/tab3.png" alt="avatar" style="zoom:100%;" /></div>

<ul>
  <li><strong>标准化的智能体执行（Standardized agent execution）：</strong> 所有任务都被转换到 Harbor 执行框架中，该框架提供了沙盒运行时环境和各种智能体框架（Codex CLI、Terminus-2、Claude Code、Gemini CLI） 。每个任务在 Docker 容器中运行，预装 Python 3 和 R，配备 2 个 CPU 和 1 小时的执行预算 。指令明确要求智能体在完成时输出 <code class="language-plaintext highlighter-rouge">trace.md</code>（分析叙述、决策、代码等）和 <code class="language-plaintext highlighter-rouge">answer.txt</code>（对主要问题的结构化简短回答） 。此外，指令严格禁止智能体搜索或阅读任务所源自的具体文献 。</li>
  <li><strong>LLM 裁判（LLM judge）：</strong> 研究使用 LLM 裁判根据任务量表对智能体轨迹进行打分 。裁判在输入量表、<code class="language-plaintext highlighter-rouge">trace.md</code> 和 <code class="language-plaintext highlighter-rouge">answer.txt</code> 后，需选择最符合智能体工作表现的 A/B/C 等级，最终的 0-100 分则通过量表程序化计算得出 。在对比了五种候选 LLM 后，<strong>Gemini 3.1 Pro</strong> 在各项指标上表现出与人类专家最强的一致性（准确率 82%，线性加权 Cohen’s $\kappa=0.70$），因此被选为整个基准测试的裁判模型 。</li>
</ul>

<h4 id="23-dataset-statistics">2.3 Dataset statistics</h4>

<p>BiomniBench-DA 涵盖了广泛的生物医学数据分析领域：100 个任务分布在 5 个疾病领域（及一个通用生物学类别）和 17 种任务类型中，从21篇高影响力发表论文里来（如<strong>图 2</strong> 底部所示） 。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/tab4-1.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/tab4-2.png" alt="avatar" style="zoom:100%;" /></div>

<ul>
  <li><strong>疾病领域：</strong> 包括<strong>肿瘤学</strong>（47%）、<strong>代谢与内分泌疾病</strong>（17%）、<strong>免疫学</strong>（14%）、<strong>通用生物学</strong>（10%）、<strong>神经科学</strong>（8%）和<strong>心血管</strong>（4%） 。</li>
  <li><strong>分析任务类型：</strong> 包含 17 种类型。最常见的前六种占基准测试的 55%，代表了日常生物医学研究中最核心的分析工作：<strong>关联测试（Association testing，11%）</strong>、<strong>突变分析（Mutation analysis，10%）</strong>、<strong>多组学整合（Multi-omic integration，10%）</strong>、<strong>通路富集（Pathway enrichment，8%）</strong>、<strong>差异表达（Differential expression，8%）和聚类（Clustering，8%）</strong> 。剩余 45% 是一系列长尾的专业分析，如预测建模、细胞组成分析、生存分析、单细胞网络推理等 。</li>
</ul>

<h3 id="3-experiments-and-results">3 Experiments and results</h3>

<p>研究团队通过控制变量法，分别探究了基础模型本身的能力、智能体框架的影响，并对智能体在不同任务类型和评估维度的具体表现进行了深度解剖。</p>

<h4 id="31-performance-of-base-llms-with-fixed-harness">3.1 Performance of base LLMs with fixed harness</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/tab1.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了孤立评估不同基础大语言模型的能力，研究团队首先将九种前沿模型统一接入同一个通用代码智能体框架 Terminus-2 中进行测试（详见<strong>表 1</strong>）。</p>

<p>结果显示，<strong>闭源前沿模型处于领先地位且得分高度集中</strong>：Claude Opus 4.7（63.94分）、GPT-5.5（63.57分）、Claude Opus 4.6（63.16分）和 Claude Sonnet 4.6（62.35分）彼此之间的差距不到 1.6 分。与此同时，<strong>最强的开源权重模型表现出色且极具成本效益</strong>，GLM-5.1（60.39分）、Qwen 3.6（59.47分）和 Kimi K2.6（59.15分）仅落后前沿模型 3 到 5 分，但单次任务成本大幅降低（例如 GLM-5.1 仅需 0.58 美元，而 Opus 4.7 需 0.87 美元）。</p>

<p>尽管如此，即使是最佳配置的平均得分也不到 64 分（满分 100），表明所有模型在该基准测试上均存在巨大的进步空间。值得注意的是，Gemini 3.1 Pro 呈现出离群表现，其生成轨迹耗时最短（中位数仅 4.9 分钟）且交互轮数最少，但得分显著偏低（44.27分）。此外，较新的模型代际展现出了更高的效率，例如 Opus 4.7 能够以更少的交互轮数和时间达到比 Opus 4.6 更高的分数。</p>

<h4 id="32-performance-across-base-llms-and-agent-harnesses">3.2 Performance across base LLMs and agent harnesses</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/tab2-fig3.png" alt="avatar" style="zoom:100%;" /></div>

<p>随后，研究探讨了基础模型与智能体框架的联合效应，将闭源代码智能体（Claude Code、Codex CLI、Gemini CLI）与其最强的原生基础模型在最大推理负荷下进行配对（详见<strong>表 2</strong> 和<strong>图 3</strong>）。</p>

<p>此时的最佳配置变为了 Claude Code 结合 Opus 4.7（73.34分），紧随其后的是 Claude Code+Opus 4.6（69.51分）和 Codex CLI+GPT-5.4（68.69分）。该环节得出了一个极其关键的结论：<strong>保持基础模型不变，更换智能体框架会带来分数的巨大波动，这种“框架效应”甚至超过了模型代际更迭的红利</strong>。最典型的例子是 GPT-5.4，在 Codex CLI 下的得分为 68.69，而在 Terminus-2 下仅为 55.19，这 <strong>13.5 分的巨大差距完全归因于智能体架构的设计</strong>；这一差距远超 Anthropic 同一框架下 Opus 4.7 与 Opus 4.6 之间的代际分差（3.8 分）。然而，框架带来的分数提升往往伴随着运行成本和交互轮数的剧增。例如，在 Codex CLI 下，GPT-5.4 的交互轮数从 13 轮激增至 82 轮，成本也同步上升。研究还发现，一个经过精心调优的智能体框架能够部分弥补基础模型的弱点，Codex CLI 使得 GPT-5.4 的分数反超了 GPT-5.5，逆转了它们在 Terminus-2 框架下的排名。</p>

<h4 id="33-anatomy-of-agent-performance">3.3 Anatomy of agent performance</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/BiomniBench/fig4.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了明确智能体成功与失败的具体症结，研究团队按<strong>分析任务类型</strong>（详见<strong>图 4a</strong>）和<strong>评估维度</strong>（详见<strong>图 4b</strong>）对表现进行了拆解。</p>

<p>在任务类型方面，难度差异显著：<strong>GWAS-eQTL 分析</strong>和<strong>通路富集（Pathway Enrichment）</strong>对所有模型而言都是最难的“硬骨头”（最高得分分别为 65 和 67），而<strong>细胞组成（Cell Composition）</strong>和<strong>突变分析（Mutation Analysis）</strong>则相对容易（前五名配置在突变分析上均达到或超过 80 分）。</p>

<p>研究还指出，不同框架在跨队列比较（Cross-cohort Comparison）任务上的分差最大，表明当需要跨多个数据集进行编排时，智能体框架的设计差异会显著放大。在评估维度方面，所有智能体表现出了高度一致的“偏科”现象：它们能够非常可靠地定位数据来源（来源可靠性得分高达 88%-98%）并妥善处理各种数据格式（数据处理得分 58%-78%）；但它们<strong>一致在选择合适的分析方法（Method selection，仅 44%-67%）、结合生物学语境解释结果（Biological interpretation）以及应用科学推理（Scientific reasoning）方面表现出明显的短板</strong>。通过对低分轨迹的定性审查，研究将这些缺陷归纳为三种反复出现的失败模式：错误的方法选择、有缺陷的生物学解释以及糟糕的科学推理逻辑。</p>

<h3 id="4-discussion">4 Discussion</h3>

<p>研究首先指出，<strong>当前的前沿LLM智能体在生物医学数据分析方面确实取得了进展</strong>：在固定的智能体框架下，最强的闭源模型和开源基础模型的得分高度集中（差距仅在几分以内），它们能够端到端地完成多步分析，并可靠地将结论建立在可识别的真实文献来源上 。然而，<strong>智能体与人类专家水平之间仍存在巨大差距</strong> 。即使是表现最好的配置，平均得分也不到75分（满分100分），并且在<strong>选择正确的分析方法、在生物学语境下解释结果以及在多步程序中应用科学推理方面存在一致的弱点</strong> 。研究强调，缩小这一差距不能仅仅依靠扩大基础模型的参数规模，<strong>智能体框架（agent harness）在决定分析完成的可靠性方面起着实质性作用</strong> 。例如，GPT-5.4在Codex CLI和Terminus-2框架下高达13.5分的分差，远超Claude Opus 4.7与4.6之间3.8分的模型代际差距 。随着结构化脚手架（scaffolding）的引入，数据处理和工具误用等执行层面的失败会有所减少，但推理层面的失败却不受框架影响而持续存在 。由于目前测试的通用代码智能体并非专为生物医学研究设计，研究认为<strong>开发具备生物医学领域意识的智能体框架（如内置领域惯例、专门的数据加载工具、统计默认选择和结构化的生物学解释步骤）具有极大的潜力</strong> 。</p>

<p>此外，讨论部分还指出了该框架的未来扩展方向与当前面临的局限。由于BiomniBench具有模块化特性，研究团队未来将把任务类型扩展到实验设计、文献综合以及蛋白质设计和检测开发等协议优化任务 。同时，基准测试将向需要与用户进行多轮协作的<strong>长周期、计算密集型任务</strong>延伸，以更真实地反映科研人员在实践中与智能体交互的模式 。在局限性方面，研究坦言<strong>构建评分量表是一项耗费大量专家精力的工作</strong>，且很难穷尽所有合理的分析路径，因此量表之外可能存在其他正确的替代方法 。虽然LLM裁判在整体上与人类专家高度一致（Cohen’s kappa = 0.70），但它不能完全替代人类在最主观维度上的判断；对于高风险的评估，建议结合人工审查 。为了突破人工成本的瓶颈，<strong>未来的一个自然发展方向是让智能体本身协助构建基准测试</strong>，即让AI从文献中起草候选任务和量表供专家审核，从而使该评估框架能够扩展到更广泛的任务类型和更大的任务池中 。</p>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="protein" /><category term="agent" /><summary type="html"><![CDATA[论文地址：BiomniBench：Process-level Evaluation of LLM Agents for Real-world Biomedical Research 论文实现：https://huggingface.co/datasets/phylobio/BiomniBench-DA]]></summary></entry><entry xml:lang="en"><title type="html">arXiv-2026 evedesign accessible biosequence design with a unified framework</title><link href="https://tyang816.github.io/bi/evedesign-accessible-biosequence-design-with-a-unified-framework/" rel="alternate" type="text/html" title="arXiv-2026 evedesign accessible biosequence design with a unified framework" /><published>2026-03-17T00:00:00+08:00</published><updated>2026-03-17T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/evedesign%20accessible%20biosequence%20design%20with%20a%20unified%20framework</id><content type="html" xml:base="https://tyang816.github.io/bi/evedesign-accessible-biosequence-design-with-a-unified-framework/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://doi.org/10.64898/2026.03.17.712115">evedesign accessible biosequence design with a unified framework</a></p>

  <p>论文实现：<a href="https://evedesign.bio/">https://evedesign.bio/</a></p>
</blockquote>

<h2 id="evedesign统一框架生物序列设计">evedesign：统一框架生物序列设计</h2>

<h3 id="abstract">Abstract</h3>

<p>蛋白质工程的机器学习方法很少具有互操作性，通常需要定制的工作流，并且对非专业人员来说仍然难以使用 。然而，当前最重要的一些设计问题——如受限于现实世界约束的条件设计、多目标优化，以及通过实验数据不断改进后续设计轮次的迭代式“实验室在环（lab-in-the-loop）”工作流——恰恰需要任何单一工具都无法提供的那种灵活且可组合的基础设施 。为此，提出了 evedesign，这是一个统一的开源框架，它以一种与具体方法无关的方式将条件生物序列设计形式化，从而能够根据标准化规范将监督模型和无监督模型结合起来，实现复杂的多目标工作流，并且该框架从构建之初就旨在支持迭代式的实验整合 。此外，一个交互式的 Web 界面（https://evedesign.bio）为广泛的科学受众促进了端到端的设计流程 。在抗体工程、酶设计以及天然酶发现中展示了 evedesign 的实用性，并邀请开源社区共同参与贡献</p>

<h3 id="1-introduction">1 Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/tab1.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者首先指出，蛋白质工程具有解决下一代疗法、可持续生物制造、生物安全、污染物修复和气候适应等关键未满足需求的巨大潜力 。近年来，用于蛋白质设计的机器学习方法呈现出爆发式增长，涵盖了在进化序列上训练的基于 MSA（多序列比对）的方法、在未对齐蛋白质序列上训练的大语言模型（LLM）、逆折叠模型以及 de novo 3D 结构设计模型等 。尽管这些方法在实验中取得了令人瞩目的成果，但即使对于专家而言，将这些方法转化为实际的设计工作流依然十分困难，并且持续需要定制化、高劳动强度的代码开发 。</p>

<p>研究团队提出，有两个相互关联的缺口限制了这一领域进展的实际应用价值 ：</p>

<ul>
  <li><strong>第一个缺口是缺乏标准化的编程接口</strong>，这意味着各种方法无法轻易地进行比较、组合或替换 。这种互操作性的缺乏在<strong>条件设计</strong>（Conditional design）中代价尤为高昂——在实际场景中，蛋白质设计需要满足诸如热稳定性、pH 耐受性、清除 T 细胞表位或与新靶点结合等现实世界约束，并且需要能够将新实验数据纳入其中以指导后续设计轮次的迭代式“实验室在环（lab-in-the-loop）”工作流 。这些多目标、约束驱动的任务是大多数现实世界设计项目的核心，然而现有的框架要么不是与模型无关的，要么无法推广到单体蛋白质基于序列的模型之外 。此外，这种缺乏互操作性的问题还延伸到了将模型受控集成到智能体系统（agentic systems）中 。</li>
  <li><strong>第二个缺口在于目前缺乏一个开源的、交互式的用户界面</strong>，能够跨越从目标蛋白质到可订购 DNA 序列的完整设计工作流，同时保持独立于底层模型和流水线的适用性 。虽然市场上存在一些专有（商业）解决方案，但由于缺乏开源的替代方案，迫使非计算领域的研究人员只能依赖相互孤立的工具，这限制了整个科学社区的复现性与可及性 。</li>
</ul>

<p>为了填补这些缺口并使蛋白质设计符合 <strong>FAIR 引导原则</strong>（可发现、可访问、可互操作、可重用），作者推出了 <strong>evedesign</strong> 。这是一个多层的开放式框架，主要由以下三个部分组成 ：</p>

<ol>
  <li><strong>一个标准化的模型接口</strong>，并在 Python 包中提供了参考实现；</li>
  <li><strong>一个 REST API 和流水线运行器</strong>，用于通过声明式作业规范执行设计任务；</li>
  <li><strong>一个覆盖完整设计工作流的交互式用户界面</strong>（公开访问地址为 <a href="https://evedesign.bio/">https://evedesign.bio</a> ）。</li>
</ol>

<p>最后，作者强调，该框架被设计为一个具有生命力的社区资源：其模块化架构允许随着领域的不断发展而融入新的模型和工作流，从而确保 evedesign 对于计算研究人员和实验研究人员而言，都是一个紧跟前沿且具备高扩展性的解决方案 。</p>

<h3 id="2-results-and-discussion">2 Results and Discussion</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="a-unified-interface-for-biomolecular-design">A unified interface for biomolecular design</h4>

<p>研究团队指出，阻碍不同蛋白质设计方法实际应用的核心障碍，是缺乏一种通用的底层语言。为此，evedesign 构建了一套统一接口：</p>

<h5 id="framing-design-as-a-conditional-modeling-problem">Framing design as a conditional modeling problem)</h5>

<p>作者将生物分子设计框架化为一个<strong>条件建模问题</strong>。在这一框架下，用户无需关心底层模型的具体格式，只需通过一个标准化的、声明式的数据结构，指定由个体实体（如蛋白质、DNA 或 RNA 链、配体）组成的分子系统。 用户可以为每个实体提供任意已知的条件信息，例如一级序列、3D 结构、同源物、结合伴侣、翻译后修饰或多聚体状态。这种设置极具灵活性：序列可以被完全指定、部分掩蔽或完全开放以供设计，结构也可以包含片段或替代构象状态。 在这种范式下，整体的设计目标（例如在消除 T 细胞表位的同时优化热稳定性）不需要通过额外的代码显式声明，而是自然而然地从用户选用的模型以及施加在模型上的系统级约束中呈现出来。</p>

<h5 id="a-multi-level-instance-representation">A multi-level instance representation)</h5>

<p>当针对特定的条件建模问题设定好之后，模型将作用于具体的“<strong>实例（instances）</strong>”（即分子系统的具体形态，如某个候选突变体或新生成的序列）。 每个实例都携带一种<strong>多层级的表征</strong>，能够同时编码三个级别的信息：<strong>序列、位置嵌入（Embedding）以及 3D 结构（PDB 格式）</strong>。与那些强制使用单一固定表征的传统框架不同，这种层级方案使得设计结果能够在基于不同输入类型的模型之间无缝流动。 例如，同一个工作流水线可以同时使用序列似然性和 3D 结构约束来为设计方案打分，或者将来自大语言模型（LLM）的嵌入映射到坐标上进行结构验证。此外，这种实例格式还天然支持<strong>用于“实验室在环”应用的监督学习工作流</strong>：实验测量值可以直接作为标签附加到实例上，而无监督模型产生的嵌入或似然值则可作为输入特征，用于训练能够预测目标属性的回归模型。</p>

<h5 id="three-composable-operations">Three composable operations</h5>

<p>为了在不编写定制代码的情况下覆盖各种设计和预测任务，作者提出，所有的工作流都可以通过组合<strong>三个标准化的模型操作</strong>来表达（其语义类似于通用的机器学习框架 scikit-learn，但专门适配了多层级实例表征）：</p>

<ul>
  <li><strong>Generate（生成）</strong>：以系统规格为条件约束，在模型偏好的表征层级上产生新的设计实例。</li>
  <li><strong>Score（打分）</strong>：为每个实例分配一个定量的适应度值（优选对数似然值），从而使得不同设计方案或突变体之间能够相互比较。</li>
  <li><strong>Transform（转换）</strong>：在不同的表征层级之间映射实例，例如从序列预测 3D 结构，或者通过序列计算嵌入向量。</li>
</ul>

<p>因为所有的操作都共享同一种标准化的实例格式，<strong>一个模型的输出可以直接被另一个模型作为输入消费，且无需重新格式化</strong>。这种特性使得研究人员能够通过简单的组合组装出复杂的多目标工作流。</p>

<h5 id="the-evedesign-software-packages">The evedesign software packages</h5>

<p><strong>1. 核心 Python 包 (<code class="language-plaintext highlighter-rouge">evedesign</code>)</strong> 这是整个框架的基础，采用 MIT 开源许可。</p>

<ul>
  <li><strong>内置模型实现</strong>：它实现了标准化的接口，并包含了三种关键模型类的参考实现：(i) 全新的进化方法 <strong>EVmutation2</strong>；(ii) 蛋白质语言模型 <strong>ESM-2</strong>；(iii) 用于逆折叠的 <strong>ProteinMPNN/LigandMPNN</strong>。</li>
  <li><strong>丰富的实用工具</strong>：除了模型本身，该包还捆绑了一系列通用的辅助工具，包括多实体吉布斯采样器（Gibbs sampler）、序列距离约束、基于 MMseqs2 的 MSA 生成、基于 FoldSeek 的 3D 结构模板搜索与映射、序列空间分析以及密码子优化工具。</li>
  <li><strong>开源扩展性</strong>：研究团队积极邀请开源社区在共享规范下贡献更多附加模型的实现。</li>
</ul>

<p><strong>2. 服务端与任务调度引擎 (<code class="language-plaintext highlighter-rouge">evedesign_server</code>)</strong> 在核心包之上，团队开发了同样采用 MIT 许可的 <code class="language-plaintext highlighter-rouge">evedesign_server</code> Python 包。</p>

<ul>
  <li><strong>架构与功能</strong>：它实现了一个 REST API 和一个轻量级的设计流水线执行引擎，用于设计任务的分布式执行和状态跟踪。</li>
  <li><strong>隐私与私有化部署</strong>：对于有商业保密或数据隐私需求的用户，该包允许他们在自己的计算基础设施上托管完整的设计服务器后端，确保敏感的序列和实验数据不会离开用户的本地环境。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>3. 交互式前端应用 (Web UI)</strong> 为了让非计算专业背景的研究人员也能轻松使用，团队开发了一个基于 React 的前端应用程序。</p>

<ul>
  <li><strong>端到端无代码体验</strong>：用户无需编写代码或执行命令行工具，即可通过用户友好的方式完成从目标序列到经过密码子优化的核苷酸序列的全套设计任务。</li>
  <li><strong>丰富的数据可视化</strong>：在任务完成后，用户界面允许在现有 3D 结构和进化序列的背景下，对生成的设计进行交互式探索，并提供丰富的数据可视化功能（如边际氨基酸频率、自然序列空间投影等）。</li>
</ul>

<h5 id="evmutation2-a-lightweight-evolutionary-model-for-generative-design">EVmutation2: a lightweight evolutionary model for generative design</h5>

<p>虽然进化模型（Evolutionary models）在设计与天然序列差异较大的功能性蛋白质方面有着强大的实验记录，但现有的方法（包括作者之前开发的 EVE 模型）都需要针对单个 MSA（多序列比对）进行专门的训练或微调。这种特性导致它们运行速度太慢，无法直接用于交互式的服务器中。</p>

<p>为了解决这个问题，研究团队专门为快速的生成式推理（fast generative inference）开发了一个全新的基于 MSA 的进化模型——<strong>EVmutation2</strong>。</p>

<p>以下是该模型的核心技术细节：</p>

<ul>
  <li><strong>架构创新</strong>：EVmutation2 将一个阶数无关的自回归解码器（order-invariant autoregressive decoder）耦合到了一个紧凑版 AlphaFold3 重新实现的单序列和双序列（single- and pair-sequence）表征上。</li>
  <li><strong>参数量与注意力机制</strong>：该模型非常轻量，仅有 <strong>14.3M（1430万）个参数</strong>。它超越了 BERT 风格的掩码预测，支持直接的序列采样。解码器的注意力权重不是通过完整的 Query-Key-Value 计算得出的，而是通过对成对表征（pair representation）进行线性投影（linear projection）得出，这既强制模型学习具有生物学意义的成对相互作用，又大幅减少了参数量。</li>
  <li><strong>上下文最大化</strong>：模型会将所有已知的 Token 以随机顺序移动到前缀（prefix）中，从而无论被设计的位置在序列中的哪个地方，都能为其提供最大的上下文信息。</li>
  <li><strong>训练与性能</strong>：该模型在 OpenProteinSet 上进行了训练，通过交叉熵损失来重建随机掩码的 MSA 序列。尽管体积小巧，EVmutation2 在 ProteinGym 基准测试中的表现与 EVE 相当，且<strong>不需要针对每个目标进行微调</strong>，这使其非常适合作为一个通用的社区服务器模型。</li>
</ul>

<h4 id="case-studies-demonstrating-evedesign-workflows">Case studies: demonstrating evedesign workflows</h4>

<p>研究团队在案例研究（Case studies）部分明确指出，展示这些案例的目的并非为了宣称模型达到了当前最佳性能（SOTA），而是为了证明 evedesign 的标准化接口、可组合操作以及多层级实例表征能够将各种复杂的真实世界设计任务表达为连贯、可重复的工作流，且完全无需编写定制代码。以下是对这三个案例的重新总结：</p>

<h5 id="unsupervised-enzyme-design-with-an-evolutionary-model">Unsupervised enzyme design with an evolutionary model</h5>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/fig3.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了演示如何使用前文介绍的进化模型进行生成式序列设计，研究团队复现了一个类似于 Russ 等人所做的工作流。在该研究中，Russ 等人使用 <strong>Potts 模型</strong>（一种基于统计物理的马尔可夫随机场模型）设计了芳香族氨基酸生物合成关键酶——分支酸变位酶（EcCM）的多样化功能变体，并通过<strong>高通量</strong>体内互补实验进行了验证。</p>

<ul>
  <li><strong>模型构建与验证</strong>：研究团队从 MMseqs2 获取的天然 EcCM 同源物多序列比对（MSA）出发，构建了一个 EVmutation2 模型，并证实其零样本（Zero-shot）得分能够在天然同源物集合和 Russ 等人的实验设计中，有效区分功能性与非功能性序列（ROCAUC 分别为 0.77 和 0.81；<strong>Figure 3A</strong>），这确立了该模型能够捕捉该家族中的功能性约束。</li>
  <li><strong>生成设计与特征分析</strong>：随后，团队利用 evedesign 的生成（<code class="language-plaintext highlighter-rouge">generate</code>）操作，通过自回归采样产生了 1,024 个新序列。这些设计重现了天然序列的一阶和二阶氨基酸统计特性（$r=0.98$ 和 $r=0.96$），表明共进化约束得到了保留。其对数似然得分与功能性的天然序列及 Russ 等人的设计相当，且大幅高于非功能性序列（<strong>Figure 3B</strong>）。在序列空间中，EVmutation2 的设计内插（interpolate）了由 MMseqs2 定义的天然序列分布，且平均而言比 Russ 等人的设计更相似于 EcCM（中位数等同度为 39% 对比 25%），同时依然展现出了对最接近天然序列的有意义的外推（<strong>Figure 3C</strong>）。</li>
  <li><strong>结论</strong>：该工作流证明了一个完全无监督的生成式流水线如何在 evedesign 中仅用几行代码完成组装和执行。</li>
</ul>

<h5 id="complementary-sequence--and-structure-based-antibody-scoring">Complementary sequence- and structure-based antibody scoring</h5>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/fig4.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了说明 evedesign 如何让序列和结构模型在单一工作流中组合，作者对 Hie 等人先前研究的七种临床相关抗体的可变链进行了单残基替换的打分。Hie 等人最初使用了 ESM-1v 集合来进行语言模型引导的亲和力成熟。</p>

<ul>
  <li><strong>单纯序列模型的局限</strong>：通过应用 evedesign 的打分（<code class="language-plaintext highlighter-rouge">score</code>）操作结合 ESM-2，团队发现 54 个实验测试的有益突变中有 44 个（81.5%）排在了 ESM-2 得分的前 5%（<strong>Figure 4A</strong>），这与原始发现一致。值得注意的是，ESM-2 为那些降低或不影响抗原结合的轻链突变分配了较低的分数（$p=0.03$，Mann-Whitney U-test），尽管这种效应对重链突变并不显著，这是原始 ESM-1 集合未能捕捉到的区别。然而，由于无监督语言模型是在没有结构上下文的情况下针对序列进行训练的，因此不期望它们能够显式地捕捉结合界面的效应。</li>
  <li><strong>结构模型的互补优势</strong>：对于三个具备可用实验测定结构的抗体-抗原复合物，团队额外应用了以 3D 坐标为条件的 ProteinMPNN 的打分操作。ProteinMPNN 和 ESM-2 的得分全局相关，但在最高分突变中表现出极小的重叠（前 5% 的平均重叠度为 0.08；<strong>Figure 4B</strong>）。重要的是，ProteinMPNN 为界面近端（距离抗原 6Å 以内）的有害和中性突变分配了大幅降低的得分，同时在所有复合物中正确地将唯一的有益界面突变排在高位（<strong>Figure 4C, D</strong>）。</li>
  <li><strong>结论</strong>：这一分歧说明了多模型 evedesign 框架的一个关键优势：基于序列和基于结构的得分提供了互补的信息，并且可以直接被组合起来对突变进行优先级排序，这对于抗体成熟等对相互作用敏感的应用尤为重要。</li>
</ul>

<h5 id="supervised-discovery-of-efficient-enzyme-variants">Supervised discovery of efficient enzyme variants</h5>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/fig5.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了演示 evedesign 中的有监督属性预测，作者复现了 Eom 等人的一项分析。Eom 等人在一个经过整理的犬尿氨酸酶（KYNase）动力学数据集上训练了一个基于 ESM-1b 嵌入的随机森林回归器，用于在天然序列数据库中挖掘具有改善催化效率的同源物。</p>

<ul>
  <li><strong>模型训练</strong>：利用 evedesign 的转换（<code class="language-plaintext highlighter-rouge">transform</code>）操作计算 ESM-2 嵌入，并利用其实例标签方案将实验测定的 $k_{cat}/K_M$ 值作为训练目标附加其上，团队训练了一个等效的回归器，并恢复了与原始研究相匹配的交叉验证性能（Spearman $\rho = 0.73$ 对比 0.72；<strong>Figure 5A, B</strong>）。</li>
  <li><strong>数据库规模的挖掘</strong>：通过打分（<code class="language-plaintext highlighter-rouge">score</code>）操作对 5,676 个未标记的同源物进行排名，重现了关键的实验结果：最高效的变体（K3）在不同的随机种子下始终排在靠前的前 10 名，而较低效率的变体排名则逐步下降（<strong>Figure 5C</strong>）。</li>
  <li><strong>结论</strong>：这证实了 evedesign 的有监督工作流能够泛化到数据库规模的属性引导搜索中，而无需对底层框架进行任何修改。</li>
</ul>

<h3 id="conclusion">Conclusion</h3>

<p><strong>1. 解决碎片化与可访问性壁垒</strong> 作者首先重申，evedesign 是一个统一的开源框架，旨在解决目前限制机器学习方法在蛋白质工程中产生现实影响的碎片化和可访问性障碍。通过标准化模型表示分子系统、交换设计以及组合成流水线的方式，evedesign 使得应对治疗开发、生物安全和可持续生物制造中最关键的<strong>条件性、多目标设计问题</strong>变得切实可行，且无需为每项新任务进行定制化的代码实现。这一点已通过无监督生成设计、互补的基于序列和结构的打分，以及有监督的属性引导发现这三个案例研究得到了验证。</p>

<p><strong>2. 灵活服务于广泛的科研社区</strong> 该框架的模块化架构是为服务广泛的社区而有意设计的：</p>

<ul>
  <li><strong>计算生物学家和 ML（机器学习）研究人员</strong>：可以通过实现少量 Python 接口方法来集成新模型，同时保留对其自身代码的完全控制权。</li>
  <li><strong>实验学家</strong>：可以通过交互式界面 (https://evedesign.bio) 访问上述相同的工作流，降低了使用门槛。</li>
  <li><strong>有数据隐私要求的用户（如商业或临床环境）</strong>：<code class="language-plaintext highlighter-rouge">evedesign_server</code> 包可以在私有基础设施上进行自托管，确保专有的序列和实验数据永远不会离开用户自己的计算环境。</li>
  <li><strong>透明度与开源协议</strong>：作为一个符合 FAIR 原则、采用 MIT/AGPLv3 许可的平台，evedesign 提供了严格的 ML 引导设计所必需的透明度。</li>
</ul>

<p><strong>3. 未来愿景与“实验室在环”前沿</strong> 最后，作者强调，这里展示的框架是一个<strong>具有生命力的软件基础（living software foundation）</strong>，而不是一个最终的成品。</p>

<ul>
  <li><strong>功能扩展</strong>：团队计划扩展模型库，包括纳入从头（<em>de novo</em>）结构设计方法。</li>
  <li><strong>实验室在环（lab-in-the-loop）</strong>：作者特别指出，流水线运行器的声明式作业规范和可序列化的实例格式，从一开始就是为了支持完全迭代的“实验室在环”工作流而设计的，在这种工作流中，新的实验数据可以不断改进设计循环。作者指出，这是那些临时拼凑的、互不连接的工具集合所无法轻易容纳的能力，并将其完全实现视为<strong>该领域最重要、最近期的前沿方向</strong>。</li>
  <li><strong>社区共建</strong>：作者积极邀请并欢迎社区做出贡献，以与框架所集成的各种方法一起推动 evedesign 的成长。</li>
</ul>

<h3 id="supplementary-figures">Supplementary Figures</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs1.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs2.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs3.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs4.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs5.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs6.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs7.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/evedesign/figs8.png" alt="avatar" style="zoom:100%;" /></div>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="protein" /><summary type="html"><![CDATA[论文地址：evedesign accessible biosequence design with a unified framework 论文实现：https://evedesign.bio/]]></summary></entry><entry xml:lang="en"><title type="html">arXiv-2025 Evaluating Large Language Models in Scientific Discovery</title><link href="https://tyang816.github.io/cl/Evaluating-Large-Language-Models-in-Scientific-Discovery/" rel="alternate" type="text/html" title="arXiv-2025 Evaluating Large Language Models in Scientific Discovery" /><published>2025-12-17T00:00:00+08:00</published><updated>2025-12-17T00:00:00+08:00</updated><id>https://tyang816.github.io/cl/Evaluating%20Large%20Language%20Models%20in%20Scientific%20Discovery</id><content type="html" xml:base="https://tyang816.github.io/cl/Evaluating-Large-Language-Models-in-Scientific-Discovery/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://">Evaluating Large Language Models in Scientific Discovery</a></p>

  <p>论文实现：<a href="https://github.com/HowieHwong/sde-harness">https://github.com/HowieHwong/sde-harness</a></p>
</blockquote>

<h2 id="sde-harnessai评估8个领域科学问题">SDE-harness：AI评估8个领域科学问题</h2>

<h3 id="abstract">Abstract</h3>

<p>这篇论文的摘要简明扼要地指出了当前大语言模型（LLM）在科学评估中的局限性，并正式提出了一个新的评估框架——<strong>科学发现评估（Scientific Discovery Evaluation, SDE）</strong>。</p>

<p><strong>1. 现有基准的局限性</strong> 尽管 LLM 正越来越多地应用于科学研究，但目前主流的科学基准测试主要考察的是<strong>脱离语境的知识（decontextualized knowledge）</strong>。这些测试忽略了驱动科学发现的真正核心能力：<strong>迭代推理、假设生成和观测解释</strong> 。</p>

<p><strong>2. SDE 框架的构建</strong> 为了解决上述问题，作者引入了一个<strong>基于场景（scenario-grounded）</strong>的基准测试，涵盖<strong>生物、化学、材料和物理</strong>四大领域。该框架由领域专家定义具有真实研究价值的项目，并将这些项目分解为模块化的研究场景，进而从中采样经过验证的问题 。</p>

<p><strong>3. 双层评估机制</strong> SDE 框架在两个层级上对模型进行评估：</p>

<ul>
  <li><strong>问题层级（Question-level）</strong>：评估模型在与具体研究场景紧密相关的问题上的准确性 。</li>
  <li><strong>项目层级（Project-level）</strong>：要求模型模拟端到端的科研过程，包括提出可测试的假设、设计模拟或实验，以及解释结果 。</li>
</ul>

<p><strong>4. 关键发现与结论</strong> 通过对最先进的 LLM 进行评估，研究揭示了以下重要现象：</p>

<ul>
  <li><strong>性能落差</strong>：模型在 SDE 上的表现普遍低于通用的科学问答基准 。</li>
  <li><strong>收益递减</strong>：扩大模型规模和增强推理能力带来的性能提升呈现收益递减趋势 。</li>
  <li><strong>共性缺陷</strong>：不同提供商的顶尖模型表现出系统性的共同弱点 。</li>
  <li><strong>缺乏通用“超级智能”</strong>：模型在不同研究场景中的表现差异巨大，导致在不同项目中“最佳模型”的人选不断变化，说明目前的 LLM 距离通用的科学“超级智能”尚远 。</li>
  <li><strong>意外发现的潜力</strong>：尽管基础场景得分可能较低，LLM 仍能在多种科学发现项目中展现潜力，突显了<strong>引导式探索和意外发现（serendipity）</strong>在科学研究中的作用 。</li>
</ul>

<p>最终，SDE 框架旨在提供一个可复现的、以发现为导向的评估基准，为推动 LLM 向科学发现方向发展指明路径 。</p>

<h3 id="introduction">Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>1. 现状：LLM 正加速融入科学发现的全流程</strong></p>

<p>引言首先肯定了 LLM 在科学领域的进展。LLM 正开始加速科学发现的核心阶段，涵盖了从文献筛选、假设生成到计算模拟、代码合成，甚至是自主实验 。</p>

<ul>
  <li><strong>角色演变</strong>：LLM 已经从最初的结构-属性预测和简单问答的替代品，演变为具备推理能力（得益于强化学习和推理时的计算 scaling）的工具，能够提供直觉和洞察 。</li>
  <li><strong>成功案例</strong>：文中列举了 <strong>ChemCrow</strong>、自主“合作科学家（co-scientists）”以及用于纳米抗体设计的 <strong>Virtual Lab</strong> 等例子。这些系统通过将语言推理与领域工具、实验室自动化甚至具身系统（如 LabOS）结合，表明 LLM 已经可以在“人机回环（human-in-the-loop）”的科学发现中辅助科学家 。</li>
</ul>

<p><strong>2. 痛点：评估滞后于应用现实</strong></p>

<ul>
  <li>对比成熟领域（Fig. 1a）：在代码（如 SWE-bench Verified）、数学（如 AIME）和工具使用等领域，基准测试已相对成熟，具备明确的“标准答案（ground truth）”和较强的预测有效性（如图 1a 所示，各模型能力在雷达图中清晰分布）。</li>
  <li>科学评估的缺陷（Fig. 1b）：现有的主流科学基准（如 GPQA, ScienceQA）主要由<strong>去语境化（decontextualized）</strong>的问答组成 。如图 1b 所示，这些题目往往与具体科研领域联系松散（loose connection），且容易包含噪声或无关信息。</li>
  <li><strong>核心论点</strong>：精通这些静态问题并不代表做好了科学发现的准备，正如<strong>“在课程中拿全 A 并不代表能成为一名伟大的研究员”</strong> 。真正的评估必须衡量模型对<strong>研究背景（context of research）</strong>的理解、在证据不完美下的推理能力以及迭代修正假设的能力。</li>
</ul>

<p><strong>3. 解决方案：SDE (Scientific Discovery Evaluation) 框架</strong></p>

<p>为了解决上述痛点，作者提出了 SDE 框架，这是一个扎根于真实世界研究场景的系统性评估 。</p>

<ul>
  <li>紧密连接（Fig. 1c）：与传统基准不同，SDE 建立了<strong>领域（Domain）$\rightarrow$ 项目（Project）$\rightarrow$ 场景（Scenario）$\rightarrow$ 问题（Question）</strong>的层级结构（如图 1c 所示），确保每个问题都与真实的科研项目紧密耦合（tight connection）。</li>
  <li><strong>覆盖领域</strong>：涵盖生物、化学、材料和物理四大领域。</li>
  <li><strong>构建逻辑</strong>：专家定义真正的研究项目，将其分解为模块化的、有科学依据的“研究场景”，并在场景内构建经过审查的问题。</li>
</ul>

<p><strong>4. 评估方法：从“做题”到“做科研”</strong></p>

<p>SDE 引入了双层评估机制，旨在揭示 LLM 的真实能力 ：</p>

<ul>
  <li><strong>问题层级（Question-level）</strong>：评估模型在特定场景下的答题准确率 。</li>
  <li><strong>项目层级（Project-level）</strong>：这是关键创新。模型被置于科学发现的闭环中，必须自主<strong>提出可测试的假设、运行模拟或实验、解释结果并修正假设</strong> 。例如图 1c 展示的青蒿素（artemisinin）合成路径发现项目，就包含了正向反应预测和 NMR 谱图结构推断等多个场景。</li>
</ul>

<p>通过对随时间发布的最先进（SOTA）模型进行纵向、细粒度的评估，SDE 揭示了当前模型在哪里成功、在哪里失败以及为什么失败 。分析结果指出了未来的发展路径：包括针对问题表述（problem formulation）的定向训练、多样化数据源、在训练中融入计算工具的使用，以及设计针对科学推理的强化学习策略 。</p>

<h3 id="results">Results</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="question-level-evaluations">Question-level evaluations</h4>

<h5 id="performance-gap-in-quiz--and-discovery-type-questions">Performance gap in quiz- and discovery-type questions</h5>

<p><strong>1. 超越传统基准的构建流程</strong></p>

<p>为了超越那些问题有时是“机会主义式拼凑（assembled opportunistically）”的传统科学问答（Q&amp;A）基准，SDE 中的问题采用了完全不同的收集流程（如图 1c 所示）。</p>

<ul>
  <li><strong>专家定义场景</strong>：在每个领域（生物、化学、材料、物理），由多成员组成的专家小组定义了大约 <strong>10 个常见的研究场景（Research Scenarios）</strong>。这些场景是 LLM 可能在专家正在进行的项目中切实提供帮助的地方 。</li>
  <li><strong>场景的跨度</strong>：这些场景覆盖了广泛的范围，从人类专家擅长的任务（例如：根据具体的实验观测做出决策），到如果不借助工具人类专家也无法处理的任务（例如：仅凭结构推断过渡金属配合物的氧化态和自旋态）。</li>
</ul>

<p><strong>2. 混合生成策略 (Hybrid Generation Strategy)</strong></p>

<p>为了构建高质量的问题，研究团队采用了<strong>半自动生成</strong>与<strong>人工起草</strong>相结合的策略：</p>

<ul>
  <li><strong>半自动生成 (Semi-automatically)</strong>：在可行的情况下，问题是通过从现有的基准数据集或开放数据集（open datasets）中采样并利用模板生成的 。
    <ul>
      <li><em>案例</em>：以“从 NMR（核磁共振）光谱映射到分子结构”为例，这类问题就是通过模板化转换结构化条目生成的 。</li>
    </ul>
  </li>
  <li><strong>专家人工起草 (Drafted Manually)</strong>：对于其他情况，特别是涉及<strong>实验相关（experiment-related）</strong>的场景，问题是由领域专家手动起草的 。</li>
</ul>

<p><strong>3. 严格的质量控制 (Quality Control)</strong></p>

<ul>
  <li><strong>专家评审</strong>：每一个问题都经过了专家小组的评审（panel review）。</li>
  <li><strong>纳入标准</strong>：只有在对问题的<strong>有效性（validity）</strong>和<strong>正确性（correctness）</strong>达成共识后，该问题才会被纳入基准。最终，SDE 基准共包含了 <strong>1,125</strong> 个高质量问题 。</li>
</ul>

<p><strong>4. 设计意义：拒绝“去语境化”</strong></p>

<p>这种设计将每一个问题都绑定到一个具体的<strong>研究场景</strong>中，确保了回答的正确性反映的是在<strong>实际科学发现项目（practical scientific discovery project）</strong>上的进展，而不仅仅是回答了“去语境化的琐事（decontextualized trivia）”。这也允许研究人员在相同的粒度水平上对不同的 LLM 进行比较 。</p>

<p><strong>5. 评估目标与模型选择</strong></p>

<p>为了理解流行的编码、数学和表达基准的性能如何转化为科学发现能力，该研究评估了来自不同提供商（如 OpenAI, Anthropic, Grok, 和 DeepSeek）的顶尖模型。评估使用了 <code class="language-plaintext highlighter-rouge">lm-evaluation-harness</code> 框架的改编版本，以支持灵活的任务类型评估 。</p>

<p><strong>6. 揭示性能差距 (The Performance Gap)</strong></p>

<p>为了定位结果，研究者将模型在 SDE 发现型问题上的表现与广泛使用的通用科学 Q&amp;A 基准进行了对比。</p>

<ul>
  <li><strong>SDE 得分</strong>：最先进的模型在生物学得分 <strong>0.71</strong> (Claude-4.1-opus)，化学 <strong>0.60</strong> (Claude-4.5-sonnet)，材料学 <strong>0.75</strong> (GPT-5)，物理学 <strong>0.60</strong> (GPT-5) ，图2a。</li>
  <li><strong>通用基准得分</strong>：相比之下，同类模型在 <strong>MMMU-Pro</strong> 上得分可达 <strong>0.84</strong>，在 <strong>GPQA-Diamond</strong> 上可达 <strong>0.86</strong> (GPT-5)，图2b。</li>
  <li><strong>结论</strong>：这说明了在<strong>去语境化的问答（decontextualized Q&amp;A）与基于场景的科学发现问题</strong>之间，存在一致的性能鸿沟（Performance Gap）。这意味着高分的考试成绩并不等同于具备了解决实际科研问题的能力。</li>
</ul>

<h5 id="reasoning-and-scaling-plateau">Reasoning and scaling plateau</h5>

<p>在既有的代码和数学基准测试中，SOTA 模型的性能通常随着新版本的发布而提升，其中<strong>推理能力</strong>是推动这些收益的主要因素，这在科学发现中同样重要 。</p>

<p><strong>1. 推理带来的显著收益 (Clear Benefits of Reasoning)</strong></p>

<p>在其他条件相似的模型正面交锋中，具备显式<strong>测试时推理（test-time reasoning）</strong>能力的变体模型，在 SDE 问题上的表现始终优于不具备该能力的对应模型。</p>

<ul>
  <li><strong>DeepSeek 的案例</strong>：这一效应在 <strong>DeepSeek-R1</strong> 与 <strong>DeepSeek-V3.1</strong> 的对比中体现得最为明显（两者共享相同的基础模型）。如图 Fig. 2c 所示，DeepSeek-R1 在四个领域（生物、化学、材料、物理）的平均准确率均高于 DeepSeek-V3.1 。</li>
  <li><strong>跨领域的一致性</strong>：这种提升跨越了绝大多数的科研场景。图 Fig. 2d 展示了两个模型的场景级对比，绝大多数点位于对角线（parity line）上方，表明与<strong>多步推导</strong>和<strong>证据整合</strong>相对应的推理能力的提升，能够直接转化为发现导向场景中更高的准确率 。</li>
  <li><strong>具体实例</strong>：一个显著的例子是让 LLM 判断一个有机分子是否符合 <strong>Lipinski 五规则</strong>（Lipinski’s rule of five，药物候选分子口服生物利用度的重要指南）。如图 Fig. 2e 所示，在这个需要大量推理的任务中，DeepSeek 模型在开启推理能力后，准确率从 <strong>0.65</strong> 飙升至 <strong>1.00</strong> 。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/fig3.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>2. 推理收益的饱和 (Saturation of Reasoning Gains)</strong></p>

<p>尽管推理的好处显而易见，但作者在追踪 <strong>gpt-5</strong> 不同程度的推理努力（reasoning efforts）时发现，SDE 基准上的整体性能开始趋于饱和。</p>

<ul>
  <li><strong>收益递减</strong>：即使相应的模型在代码或数学上刷新了记录，其在科学发现上的收益也变得温和，甚至往往在统计误差范围内。这一趋势在图 Fig. 3a 中清晰可见，随着推理努力从“无（none）”增加到“高（high）”，曲线逐渐平缓 。</li>
  <li><strong>具体数据对比</strong>：在“中等（medium）”和“高（high）”推理努力之间，准确率几乎没有提升 ：
    <ul>
      <li><strong>生物</strong>：0.70 vs 0.69</li>
      <li><strong>化学</strong>：0.53 vs 0.60</li>
      <li><strong>材料</strong>：0.74 vs 0.75</li>
      <li><strong>物理</strong>：0.58 vs 0.60</li>
    </ul>
  </li>
  <li><strong>结论</strong>：这表明，以科学发现为目的，单纯增加<strong>测试时计算（test-time compute）这一主流技术路线的收益正在出现边际效应递减</strong>（参考 Supplementary Fig. 7）。</li>
</ul>

<p><strong>3. 规模效应的放缓 (Scaling Plateau)</strong></p>

<p>除了推理，扩大模型规模（Scaling up）通常被认为是 LLM 成功的巨大贡献因素 。</p>

<ul>
  <li><strong>单调提升</strong>：作者确实观察到，随着 <strong>gpt-5</strong> 从 nano 扩展到 mini 再到其默认的 large 尺寸，模型准确率呈现单调提升，如图 Fig. 3b 所示 。</li>
  <li><strong>增长放缓</strong>：然而，规模效应在过去一年中似乎也放慢了脚步。如图 Fig. 3c 所示，<strong>gpt-5</strong> 相比于 <strong>o3</strong> 的性能提升非常微弱（marginal），甚至在 8 个场景中，gpt-5 的表现显著更差（准确率下降超过 0.075）。</li>
  <li><strong>基础模型收敛</strong>：类似地，当剥离推理因素后，从 <strong>gpt-4o</strong> 到 <strong>gpt-5</strong> 的性能提升也可以忽略不计。这表明在过去 18 个月中，预训练基础模型（pretrained base foundation LLMs）在发现型任务上的表现似乎已经<strong>收敛（converged）</strong> 。</li>
</ul>

<p><strong>4. 核心启示</strong></p>

<p>推理和规模分析的意义并不在于进步已经停滞，而是揭示了：<strong>科学发现所强调的能力不同于通用的科学问答</strong>。它更侧重于：<strong>问题表述（Problem formulation）</strong>，<strong>假设修正（Hypothesis refinement）</strong>，<strong>对不完美证据的解释（Interpretation of imperfect evidence）</strong> 。</p>

<h5 id="shared-failure-modes-among-top-performing-llms"><strong>Shared failure modes among top-performing LLMs</strong></h5>

<p><strong>1. 跨模型的高度相关性 (High Correlation Across Models)</strong></p>

<ul>
  <li><strong>现象</strong>：当对比来自不同提供商的顶尖模型（<strong>gpt-5, grok-4, deepseek-R1, claude-sonnet-4.5</strong>）时，研究发现它们的准确率分布高度相关 。这意味着这些模型往往在相同的场景下表现出色，又在相同的场景下遭遇失败 Fig. 3d 和 Supplementary Fig. 5。</li>
  <li><strong>数据支持</strong>：这种相关性在<strong>化学</strong>和<strong>物理</strong>领域最为突出。在这些领域中，上述四个顶尖模型之间的所有两两 Spearman 相关系数（Spearman’s r）和 Pearson 相关系数（Pearson’s r）均大于 <strong>0.8</strong> 。</li>
</ul>

<p><strong>2. 错误趋同：在相同的难题上犯同样的错 (Converging on the Same Incorrect Answers)</strong></p>

<ul>
  <li><strong>共识性失败</strong>：顶尖模型经常在最困难的问题上收敛到<strong>完全相同</strong>的错误答案，即使它们的总体准确率可能有所不同 Fig. 3e 和 Supplementary Fig. 6。</li>
  <li><strong>具体案例</strong>：文中举了 <strong>MOF（金属有机框架）合成</strong> 问题的例子。尽管模型在这一领域的总体表现相对较高，但在总共 22 个问题中，有 4 个问题是这四个顶尖模型都犯了同样错误的 。</li>
  <li><strong>原因分析</strong>：这种错误的对齐表明，前沿 LLMs 共享着共同的优势以及<strong>共同的系统性弱点</strong>。这很可能继承自相似的<strong>预训练数据分布</strong>和<strong>训练目标</strong>，而不是源于它们各自独特的架构或实现细节 。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/figs2.png" alt="avatar" style="zoom:50%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/figs9.png" alt="avatar" style="zoom:50%;" /></div>

<p><strong>3. 实践启示：集成策略的局限性 (Limitation of Ensemble Strategies)</strong></p>

<ul>
  <li><strong>多数投票无效</strong>：由于模型倾向于犯相同的错误，简单的集成策略（如跨提供商的多数投票 <strong>majority voting</strong>）对于那些当前 LLM 固有的难题可能<strong>效果有限</strong> 。因为当所有“专家”都给出相同的错误建议时，投票无法修正结果 Supplementary Fig. 2 和 Fig. 9 。</li>
  <li><strong>SDE 设计的价值</strong>：SDE 这种基于场景的设计让这些相关性变得可见且可复现，不仅揭示了模型在哪里成功，更细粒度地暴露了它们在发现型任务中<strong>在哪里失败以及为什么失败</strong> 。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/figs11-figs12.png" alt="avatar" style="zoom:50%;" /></div>

<p><strong>4. SDE-hard：最难的科学发现问题 (SDE-hard Subset)</strong></p>

<ul>
  <li><strong>数据集构建</strong>：鉴于这种“共识性失败”行为，作者进一步筛选出了 <strong>86 个最难的问题</strong>（每个研究场景选出 2 个顶尖模型出错最多的问题），组成了一个名为 <strong>SDE-hard</strong> 的子集 Supplementary Fig. 11 和 Fig. 12 。</li>
  <li><strong>模型表现</strong>：所有常规 LLMs 在这些最难的科学发现问题上的得分均低于 <strong>0.12</strong> 。</li>
  <li><strong>GPT-5-pro 的突破</strong>：
    <ul>
      <li><strong>例外表现</strong>：<strong>gpt-5-pro</strong> 在这部分表现出了显著优势。尽管其推理成本极高（12倍），但它在 <strong>9 个其他所有模型都答错的问题</strong>上给出了正确回答 Fig. 3f (下) 。</li>
      <li><strong>意义</strong>：这表明 GPT-5-pro 在需要<strong>扩展推理（extended reasoning）</strong>的极难问题上具有竞争优势，而这正是科学发现的特征 。不过，即便是它，在这个子集上的准确率仍有很大提升空间，使 SDE-hard 成为未来高推理成本模型极佳的测试场 。</li>
    </ul>
  </li>
</ul>

<h4 id="project-level-evaluations">Project-level evaluations</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SDE-harness/fig4.png" alt="avatar" style="zoom:50%;" /></div>

<h5 id="establishing-llm-evaluation-on-the-scientific-discovery-loop">Establishing LLM evaluation on the scientific discovery loop</h5>

<p><strong>1. 评估范式的转变：从单轮问答到迭代循环</strong></p>

<p>传统的问答（Q&amp;A）基准通常通过单轮交互来评估模型，针对静态查询的一对一回答进行评分 。然而，真正的科学发现是通过假设提出、测试、解释和修正的迭代循环来推进的 。为了反映这一过程，作者引入了 <strong><code class="language-plaintext highlighter-rouge">sde-harness</code></strong>，这是一个模块化的框架，正式确立了假设、实验和观测的闭环发现过程（Fig. 4a）。在这个框架中，LLM 取代了人类研究者，担任假设生成器的角色 。</p>

<p><strong>2. 评估核心：捕捉静态测试无法衡量的能力</strong></p>

<p>这一框架超越了单一问题的准确率评估，实现了项目层级的考核。它要求模型制定可测试的假设，执行分析或模拟，并解释结果以逼近端到端的发现工作流 。因此，<code class="language-plaintext highlighter-rouge">sde-harness</code> 能够分离出静态 Q&amp;A 测试无法捕捉的能力，例如在多个评估轮次中保持状态（maintaining state）、整合中间证据，以及战略性地决定何时分支或放弃某条探索路径的能力 。</p>

<p><strong>3. 项目构成：八大项目与三大要素</strong></p>

<p>研究团队实例化了涵盖生物、化学、材料和物理的八个项目，每个项目都与 SDE 问答基准中的特定研究场景相对应 。每个项目都定义了三个关键要素：</p>

<ul>
  <li><strong>(i) 假设空间</strong>：例如逆合成路线、具有目标电子特性的金属-配体复合物，或数学关系的符号表达式 ；</li>
  <li><strong>(ii) 计算 Oracle 或模拟器</strong>：用于将假设映射到观测结果 ；</li>
  <li><strong>(iii) 选择规则</strong>：用于在迭代过程中传播有希望的假设 。</li>
</ul>

<p><strong>4. 模拟真实的发现过程</strong></p>

<p>具体而言，<code class="language-plaintext highlighter-rouge">sde-harness</code> 编排了迭代优化过程，以模仿真实的科学发现循环 。这种透明的更新机制揭示了 LLM 如何随着时间的推移修正其假设，从而将迭代推理（iterative reasoning）与单纯的一次性生成（one-shot generation）区分开来 。</p>

<h5 id="serendipity-in-llm-driven-optimizations">Serendipity in LLM-driven optimizations</h5>

<p><strong>1. 结构化数据项目中的显著收益</strong></p>

<p>研究发现，在那些拥有大量结构化开源数据和编码知识的项目中，集成 LLM 带来的收益最为显著 。这些项目包括：蛋白质设计，过渡金属配合物（TMC）优化，有机分子优化，晶体设计，符号回归</p>

<p><strong>2. 案例分析一：符号回归 (Symbolic Regression)</strong></p>

<p>在这个物理学项目中，模型需要从数据中迭代发现非线性动力系统的控制方程。这要求模型不仅能对假设空间进行结构化探索，还要能逐步优化符号形式 。</p>

<ul>
  <li><strong>推理模型的动态优势</strong>：具备推理能力的模型展现了更有效的发现动力学（Fig. 4c）。特别是 <strong>deepseek-R1</strong> 和 <strong>gpt-5</strong>，它们比 claude-sonnet-4.5 和 gpt-5-chat-latest 收敛得更快，且能达到更低的最终误差 。</li>
  <li><strong>持续优化能力</strong>：这些模型能在早期迅速降低误差，并在数百次迭代中持续改进候选方程，表明其在符号假设空间中实现了更可靠的“探索-利用（exploration-exploitation）”平衡 。</li>
  <li><strong>超越传统基准</strong>：与广泛使用的 SOTA 基准 <strong>PySR</strong> 相比，LLM 方法表现出了显著的性能差距。PySR 的准确率大幅降低，且归一化均方误差（NMSE）显著更高，尤其是在分布外（OOD）区域 。</li>
  <li><strong>成功原因</strong>：这一结果突显了 LLM 引导发现的关键优势——能够基于知识提出、修改和重组符号结构，以一种全局知情的方式进行搜索，而不是像传统方法那样仅依赖对算子的局部搜索 。</li>
</ul>

<p><strong>3. 案例分析二：过渡金属配合物 (TMC) 优化</strong></p>

<p>在材料科学领域，模型需要在巨大的化学空间中寻找具有目标属性的分子。</p>

<ul>
  <li><strong>极速收敛</strong>：当任务是识别具有最大极化率（polarisability）的候选者时，<strong>gpt-5</strong>、<strong>deepseek-R1</strong> 和 <strong>claude-sonnet-4.5</strong> 都展现了快速收敛的能力。它们能在 137 万个 TMC 的搜索空间中，仅通过不到 10 次迭代（推荐少于 100 个分子）就定位到最优解（Fig. 4b） 。
    <ul>
      <li>值得注意的是，<strong>claude-sonnet-4.5</strong> 在不同的初始化集合中表现出了优越的收敛速度和鲁棒性 。</li>
    </ul>
  </li>
  <li><strong>帕累托前沿探索 (Pareto Frontier)</strong>：在探索由极化率和 HOMO-LUMO 能隙定义的帕累托前沿时：
    <ul>
      <li><strong>deepseek-R1</strong> 产生了最广泛且平衡的分布，有效地覆盖了“小能隙/高极化率”和“大能隙/低极化率”两个区域（Fig. 4b） 。</li>
      <li>相比之下，<strong>claude-sonnet-4.5</strong> 对初始种群非常敏感，其探索主要局限在“大能隙/高极化率”区域 。</li>
    </ul>
  </li>
  <li><strong>推理的重要性</strong>：在上述两个场景中，非推理模型 <strong>gpt-5-chat-latest</strong> 的表现均优于其增强了推理能力的版本，这强调了多步推导和推理在 TMC 优化中的关键作用 。</li>
</ul>

<p><strong>Connecting question- and project-level performance.</strong></p>

<h5 id="performance-on-scenarios-does-not-always-translate-to-projects"><strong>Performance on scenarios does not always translate to projects.</strong></h5>

<p>SDE 框架的一个核心特征是它通过定义明确的研究场景，连接了问题层级和项目层级的评估，从而能够直接分析错误是如何从 Q&amp;A（问答）传播到下游的发现任务中的（Fig. 1c）。</p>

<p><strong>1. 正向转化：单项能力支撑项目表现</strong></p>

<p>在许多案例中，模型在特定场景问题上的高分确实能转化为相关项目的成功：</p>

<ul>
  <li><strong>一般规律</strong>：顶尖模型（如 <strong>gpt-5</strong>）在分子属性预测、SMILES 字符串操作、基因操控、蛋白质定位以及代数问题上表现出色 。因此，它们在对应的<strong>有机分子优化</strong>、<strong>基因编辑</strong>、<strong>符号回归</strong>和<strong>蛋白质设计</strong>项目中也表现强劲（Fig. 4a, Supplementary Fig. 2）。</li>
  <li><strong>晶体结构发现</strong>：虽然人们可能质疑 LLM 在生成三维晶体结构方面的能力（因为缺乏内在的 SE(3) 等变架构），但研究发现顶尖的推理模型能生成稳定、独特且新颖的材料，这与它们在 <strong>PXRD 晶格预测</strong>场景中的熟练度是相符的（Supplementary Table 3）。</li>
  <li><strong>共同失败</strong>：反之亦然，所有模型在量子信息和凝聚态理论问题上的糟糕表现，直接导致了它们在<strong>伊辛模型（Ising model）</strong>求解项目中的失败。除 deepseek-R1 外，大多数模型甚至无法击败进化算法基准（Supplementary Fig. 19）。</li>
</ul>

<p><strong>2. 显著的例外 (Striking Exceptions)：场景表现无法转化</strong></p>

<ul>
  <li><strong>案例一：不懂微观知识，却能搞定宏观优化（TMC 优化项目）</strong>
    <ul>
      <li><strong>现象</strong>：没有任何一个模型能熟练回答与过渡金属配合物（TMC）相关的具体问题（例如：预测氧化态、自旋态、氧化还原电位）。</li>
      <li><strong>反转</strong>：尽管如此，<strong>gpt-5</strong>、<strong>deepseek-R1</strong> 和 <strong>claude-sonnet-4.5</strong> 却都能极其高效地在 TMC 优化项目中提出具有高极化率的分子，并在巨大的 137 万个 TMC 搜索空间中成功探索帕累托前沿（Fig. 4b）。</li>
      <li><strong>启示</strong>：这一发现表明，<strong>对显式结构-属性关系的严谨知识（rigorous knowledge）并不是 LLM 驱动科学发现的严格前提</strong> 。相反，识别优化方向的能力以及促进<strong>意外发现（serendipitous exploration）</strong>的能力似乎更为关键 。</li>
    </ul>
  </li>
  <li><strong>案例二：精通理论题目，却在实战中溃败（逆合成项目）</strong>
    <ul>
      <li><strong>现象</strong>：顶尖模型在关于逆合成、反应机理和正向反应预测的“试题”上得分很高 。</li>
      <li><strong>反转</strong>：但在生成有效的多步合成路径的实际项目中，它们却举步维艰。由于在分子或反应的<strong>有效性检查</strong>中频繁失败，这些模型甚至无法击败传统的逆合成模型基准（Supplementary Table 1）。</li>
      <li><strong>意外发现</strong>：值得注意的是，<strong>gpt-4o</strong>（一个相对较旧、没有测试时推理的模型）在这个项目中竟然取得了最好的结果，击败了它的继任者（gpt-5-chat）和推理增强版（gpt-5）。</li>
    </ul>
  </li>
</ul>

<h5 id="no-single-model-wins-on-all-projects">No single model wins on all projects</h5>

<p><strong>1. 性能层级的流动性 (No Definitive Hierarchy)</strong></p>

<p>在 SDE 框架涵盖的八个项目中，研究者观察到模型性能并没有一个确定的层级结构 。</p>

<ul>
  <li><strong>轮流领跑</strong>：领导地位是轮换的，模型在某些项目中表现出色，而在其他项目中则表现不佳 。</li>
  <li><strong>数据可视化</strong>：这一点在 Fig. 4a 中得到了直观展示。该图通过条形图对比了四个模型（gpt-5-chat-latest, gpt-5, deepseek-R1, claude-sonnet-4.5）在八个项目上的归一化性能，可以清晰地看到不同颜色的柱子在不同项目中的高低交替 。</li>
</ul>

<p><strong>2. 科学发现的复合性质 (Composite Nature of Discovery)</strong></p>

<p>这种性能的变异性反映了科学发现的本质——它是一个整合了多个相互依赖的研究场景的复合过程 。</p>

<ul>
  <li><strong>短板效应</strong>：因此，要获得出色的项目层级表现，模型至少需要在所有组成场景中都具备熟练度 。任何单一组件的缺陷都会引入复合不确定性，从而拖累整个项目的表现 。</li>
</ul>

<p><strong>3. 推理增强的局限性 (Absence of Reasoning Benefits)</strong></p>

<p>一个值得注意的发现是，强推理增强（Reasoning enhancements）的预期收益在某些项目中完全缺席 。</p>

<ul>
  <li><strong>具体案例</strong>：在 <strong>逆合成（retrosynthesis）</strong> 和 <strong>蛋白质设计（protein design）</strong> 等项目中，原本预期推理能力至关重要，但实际结果并未显示出推理模型的优势 。这表明需要针对性的后训练（post-training）策略来推动进一步的改进 。</li>
</ul>

<p><strong>4. 预训练语料优势的减弱 (Less Decisive Pre-training Advantage)</strong></p>

<p>与静态的问题层级评估相比，预训练语料库的优势在发现项目中似乎不那么具有决定性 。</p>

<ul>
  <li><strong>DeepSeek-R1 的表现</strong>：尽管 <strong>deepseek-R1</strong> 在问题层级基准测试中表现稍弱（可能受限于中文语料为主或训练数据差异），但它在几乎所有推理有利的项目中都排名前二 。这再次印证了 <strong>Fig. 4a</strong> 中 deepseek-R1（红色柱子）在多个项目中的强劲表现。</li>
</ul>

<p><strong>5. 距离“超级智能”尚远 (Distant to Scientific “Superintelligence”)</strong></p>

<p>最终结论是，所有当代模型距离真正的科学“超级智能”仍有很大距离 。</p>

<ul>
  <li><strong>缺乏全能</strong>：目前没有任何一个单一模型能在所有八个（尽管数量有限）不同主题的科学发现项目中表现出色。</li>
  <li><strong>未来方向</strong>：为了有效地编排科学发现的循环，未来的发展应当优先考虑跨多样化场景的<strong>均衡知识（balanced knowledge）</strong>和学习能力，而不是狭窄的专业化。</li>
</ul>

<h3 id="discussion">Discussion</h3>

<p><strong>1. 现有评估范式的失效</strong></p>

<p>作者首先指出，虽然传统基准测试成功追踪了模型在回答通用科学问题上的进展，但结果表明它们是衡量科学发现能力的<strong>不充分代理（insufficient proxies）</strong> 。</p>

<ul>
  <li><strong>核心差距</strong>：科学发现依赖于迭代推理、假设生成和证据解释，而不仅仅是静态知识检索 。</li>
  <li><strong>SDE 的价值</strong>：SDE 框架通过将孤立问题与模块化研究场景紧密连接，并在项目层级评估模型编排端到端研究的能力，填补了这一空白 。</li>
</ul>

<p><strong>2. 模型能力的局限与“平台期”</strong></p>

<p>讨论部分再次强调了在 Results 中观察到的几个关键现象的深层含义：</p>

<ul>
  <li><strong>高分低能</strong>：顶尖模型在去语境化基准（如 GPQA-Diamond）上的高分，并不保证其在 SDE 真实科研场景中的推理能力 。</li>
  <li><strong>收益递减</strong>：曾经在代码和数学领域推动突破的策略——扩大模型规模（Scaling）和增加测试时计算（Test-time compute），在科学发现领域显示出<strong>收益递减（diminishing returns）</strong> 。</li>
  <li><strong>趋同的失败</strong>：不同提供商的顶尖模型表现出高度的错误相关性，经常在最难的问题上收敛到相同的错误答案 。这暗示了当前的瓶颈可能源于相似的<strong>预训练数据分布</strong>，而非架构限制 。</li>
</ul>

<p><strong>3. 项目表现的非线性依赖</strong></p>

<p>作者深入探讨了“做题”与“做项目”之间的复杂关系：</p>

<ul>
  <li><strong>知识与探索的权衡</strong>：项目层级的表现不仅仅是问答准确率的线性相关 。<strong>精确的微观知识（如结构-属性关系）可能不如有效导航假设空间的能力重要</strong> 。</li>
  <li><strong>机缘巧合（Serendipity）</strong>：模型识别优化方向和促进“意外发现”的能力，可以在一定程度上弥补其在细粒度知识上的缺陷 。</li>
  <li><strong>能力的不均匀性</strong>：LLM 在处理结构化数据（如 TMC 优化）时表现出色，但在需要严格、长程规划和有效性检查的任务（如逆合成）中则非常挣扎 。</li>
</ul>

<p><strong>4. 未来的发展路径 (Actionable Avenues)</strong></p>

<p>基于上述发现，作者为推动 LLM 在科学发现中的应用提出了四条具体建议：</p>

<ol>
  <li><strong>从盲目扩展转向定向训练</strong>：应将重点从无差别的规模扩展，转移到针对<strong>问题表述（problem formulation）*<em>和*</em>假设生成</strong>的定向训练上 。</li>
  <li><strong>多样化数据源</strong>：针对跨模型的高度错误相关性，急需多样化预训练数据源并探索新的归纳偏置（inductive biases），以缓解共同的失败模式 。</li>
  <li><strong>整合工具使用 (Tool Use)</strong>：许多高难度场景需要语言推理与领域模拟器、结构构建器的紧密耦合。因此，训练和评估必须超越文本准确性，优先考虑<strong>可执行的操作（executable actions）</strong>，特别是调用工具、调试执行失败以及根据反馈迭代协议的能力 。</li>
  <li><strong>针对科学推理的强化学习</strong>：鉴于针对代码和数学优化的推理增强在科学发现项目中收益甚微，开发<strong>专门针对科学推理的强化学习策略</strong>是一个充满希望的前沿方向 。</li>
</ol>

<p><strong>5. 局限性与展望</strong></p>

<ul>
  <li><strong>偏差</strong>：基准反映了贡献专家的特定研究兴趣和方法论偏好，目前尚缺乏地球科学、社会科学等领域的覆盖 。</li>
  <li><strong>可复现性</strong>：依赖商业 API 带来了性能波动问题，未来应更多采用本地部署的开源模型作为基准 。</li>
  <li><strong>安全性</strong>：必须警惕日益强大的生物 AI 系统带来的安全风险（如生物安全），包括越狱和滥用路径 。</li>
</ul>

<p>尽管存在这些限制，SDE 提供了第一个跨越科学发现全流程的综合评估，为社区构建更复杂、更现实的评估奠定了坚实基础 。</p>

<h3 id="methods">Methods</h3>

<h4 id="research-scenario-and-question-collection"><strong>Research scenario and question collection</strong></h4>

<p>SDE 的构建并非简单的题目堆砌，而是通过生物、化学、材料和物理四个领域的结构化协作完成的。</p>

<p><strong>1. 核心架构：从项目到场景 (From Project to Scenario)</strong></p>

<p>正如 <strong>Fig. 1c</strong> 所示，数据收集遵循“领域 (Domain) $\rightarrow$ 项目 (Project) $\rightarrow$ 场景 (Scenario) $\rightarrow$ 问题 (Question)”的层级结构：</p>

<ul>
  <li><strong>定义场景 (Defining Scenarios)</strong>：
    <ul>
      <li><strong>来源</strong>：每个领域的专家小组首先确定那些在真实科学发现工作流中反复出现、且具有基础推理模式的<strong>研究场景</strong>。</li>
      <li><strong>标准</strong>：这些场景取材于正在进行或过去的研究项目，反映了活跃的科学兴趣，而非教科书式的练习。</li>
      <li><strong>模块化</strong>：一个“场景”被定义为一个模块化的、独立的科学推理单元（例如化学中的“正向反应预测”），它是解决更宏大研究项目的构建模块。</li>
    </ul>
  </li>
</ul>

<p><strong>2. 问题生成策略：混合模式 (Hybrid Generation Strategy)</strong></p>

<p>一旦确定了关键场景，专家们采用了<strong>半自动生成</strong>与<strong>人工手动策展</strong>相结合的混合策略来构建具体问题：</p>

<ul>
  <li><strong>半自动生成 (Semi-automated)</strong>：
    <ul>
      <li>对于有结构化数据可用的场景，通过从现有基准数据集（如 GPQA）或开放数据集（如 NIST）采样，利用模板脚本将结构化条目转换为自然语言问答对。</li>
      <li>利用领域特定的计算流程（如 RDKit）来获取参考答案（例如计算分子描述符）。</li>
    </ul>
  </li>
  <li><strong>人工手动起草 (Manual Curation)</strong>：
    <ul>
      <li>对于缺乏公开结构化记录的场景（特别是<strong>实验技术</strong>相关的场景），问题由领域专家使用统一模板手动编写，以确保与半自动生成问题的一致性。</li>
    </ul>
  </li>
</ul>

<p><strong>3. 质量控制与验证 (Quality Control)</strong></p>

<p>为了保证基准的权威性，每个环节都设有严格的审核机制：</p>

<ul>
  <li><strong>专家评审</strong>：每一个问题都经过了小组评审，只有在对问题的<strong>有效性（validity）</strong>和<strong>正确性（correctness）</strong>达成共识后，该问题才会被纳入。</li>
  <li><strong>数量控制</strong>：为了减少随机方差，每个场景至少包含 5 个经过验证的问题。</li>
  <li><strong>格式规范</strong>：问题格式包括多项选择和简答题。为了避免评分歧义，采用了精确匹配（exact-match）、基于阈值的容差（针对数值）或相似度评分（针对分子结构）等评估方式。</li>
</ul>

<p><strong>4. 数据集统计 (Dataset Statistics)</strong></p>

<p>最终生成的 SDE 数据集规模庞大且覆盖面广，共包含 <strong>43 个不同的研究场景</strong>和 <strong>1,125 个问题</strong>：</p>

<ul>
  <li><strong>化学 (276题)</strong>：涵盖正向反应预测、逆合成、分子属性估算、NMR 结构解析、实验技术等。</li>
  <li><strong>材料 (486题)</strong>：涵盖腐蚀预测、材料安全、PXRD 晶系与晶格预测、MOF 合成与稳定性等。</li>
  <li><strong>生物 (200题)</strong>：涵盖酶反应预测、蛋白质定位、GWAS 致病基因识别、CRISPR 递送策略等。</li>
  <li><strong>物理 (163题)</strong>：涵盖天体物理与宇宙学、量子信息科学、凝聚态物理、计算物理等。</li>
</ul>

<h4 id="research-project-collection">Research project collection</h4>

<p><strong>1. 项目架构与核心逻辑</strong></p>

<ul>
  <li><strong>多场景整合</strong>：研究团队策划了 <strong>8 个</strong> 跨越生物、化学、材料和物理的研究项目 。每个项目都不是孤立的任务，而是涉及多个模块化的研究场景。例如，一个“逆合成路径设计”项目自然会涉及单步逆合成、反应机理分析和正向反应预测等多个场景 。</li>
  <li><strong>问题公式化</strong>：每个研究项目都被制定为一个<strong>搜索或优化问题（search or optimization problem）</strong> 。
    <ul>
      <li><strong>假设空间</strong>：LLM 在假设空间（如所有可能的分子结构、符号方程的空间）中提出建议（Hypothesis） 。</li>
      <li><strong>Oracle 验证</strong>：这些假设由计算 Oracle（如模拟器）检查以评估适应度（Fitness） 。</li>
      <li><strong>闭环反馈</strong>：评估结果被反馈给 LLM 以改进其提案，形成 Fig. 4a 所示的科学发现循环 。</li>
    </ul>
  </li>
</ul>

<p><strong>2. 统一的优化工作流 (Evolutionary Optimization)</strong></p>

<p>为了标准化评估，作者选择了<strong>进化优化（Evolutionary Optimization）</strong>作为简单高效的搜索方法，具体包含三个步骤 ：</p>

<ol>
  <li><strong>初始化 (Initialization)</strong>：从 LLM 冷启动生成或从预定义集合热启动，形成初始假设集。</li>
  <li><strong>突变、交叉与从头提议 (Mutation, Crossover, and De novo)</strong>：LLM 根据从池中采样的父代假设生成后代。</li>
  <li><strong>选择 (Selection)</strong>：生成后代后，根据适应度保留父代和后代中排名靠前的假设。 这一过程重复进行，直到收敛或达到最大 Oracle 调用次数 。</li>
</ol>

<p><strong>3. 八大具体研究项目详解</strong></p>

<p><strong>化学领域 (Chemistry)</strong></p>

<ul>
  <li><strong>逆合成路径设计 (Retrosynthesis pathway design)</strong>：
    <ul>
      <li><strong>目标</strong>：规划反应路径，将目标分子分解为市售前体（Building blocks） 。</li>
      <li><strong>约束</strong>：每一步分解必须遵守可用的反应模板，定义为一个规划问题（Planning problem） 。</li>
      <li><strong>数据</strong>：基于 USPTO 反应数据和 Chen et al. 的工作 。</li>
    </ul>
  </li>
  <li><strong>分子优化 (Molecule optimization)</strong>：
    <ul>
      <li><strong>目标</strong>：在巨大的化学空间中搜索具有最佳属性（如药物发现所需的属性）的分子结构 。</li>
    </ul>
  </li>
</ul>

<p><strong>材料领域 (Materials)</strong></p>

<ul>
  <li><strong>过渡金属配合物优化 (TMC optimization)</strong>：
    <ul>
      <li><strong>挑战</strong>：配体选择带来的组合爆炸。</li>
      <li><strong>任务</strong>：在进化循环下，推动 LLM 生成具有目标 <strong>HOMO-LUMO 能隙</strong>和<strong>极化率（polarisability）</strong>的候选 TMC，这需要深刻理解过渡金属化学。</li>
    </ul>
  </li>
  <li><strong>晶体结构发现 (Crystal structure discovery)</strong>：
    <ul>
      <li><strong>挑战</strong>：候选结构必须同时满足三维周期性、化学有效的原子配位、电荷中性和热力学稳定性等多重物理约束。</li>
      <li><strong>任务</strong>：利用 LLM 对参考父结构进行隐式交叉和突变，生成具有低形成能（energy above the hull）的新型晶体结构。</li>
    </ul>
  </li>
</ul>

<p><strong>生物领域 (Biology)</strong></p>

<ul>
  <li><strong>蛋白质序列优化 (Protein sequence optimization)</strong>：
    <ul>
      <li><strong>空间</strong>：包含 4-250 个突变位点的蛋白质序列，每个位点有 20 种氨基酸选择。</li>
      <li><strong>任务</strong>：LLM 被用来优化蛋白质序列以达到最佳适应度（Fitness），目标函数由 Oracle 定义。</li>
    </ul>
  </li>
  <li><strong>基因编辑 (Gene editing)</strong>：
    <ul>
      <li><strong>目标</strong>：在众多可能的基因中找到子集，使其在受到干扰（perturbation）时产生特定的表型。</li>
      <li><strong>任务</strong>：LLM 被迫计新的实验来提出干扰建议，以发现新表型。</li>
    </ul>
  </li>
</ul>

<p><strong>物理领域 (Physics)</strong></p>

<ul>
  <li><strong>符号回归 (Symbolic regression)</strong>：
    <ul>
      <li><strong>挑战</strong>：发现支配科学观测的数学模型是一个重大挑战。</li>
      <li><strong>任务</strong>：LLM 需要找到能够恢复实验观测结果的<strong>符号方程（symbolic equations）</strong>，通过模拟观测的误差来衡量优劣。</li>
    </ul>
  </li>
  <li><strong>求解伊辛模型 (Solving Ising model)</strong>：
    <ul>
      <li><strong>挑战</strong>：组合配置空间呈指数级增长。</li>
      <li><strong>任务</strong>：LLM 模仿人类科学家的发现过程，推断出使伊辛模型哈密顿量（Hamiltonian）最小化的最佳自旋配置。</li>
    </ul>
  </li>
</ul>

<h4 id="model-evaluation">Model evaluation</h4>

<p><strong>1. 问题层级评估 (Question-level)</strong></p>

<p>这一层级主要评估模型在 43 个具体研究场景中的答题准确率。</p>

<ul>
  <li><strong>评估框架</strong>：所有评估均使用 <code class="language-plaintext highlighter-rouge">lm-evaluation-harness</code> 的定制分支进行。每个场景都由一个 YAML 配置文件指定，该文件加载相应的 Hugging Face 数据集。</li>
  <li><strong>解码设置</strong>：为了保证结果的可复现性，默认采用<strong>确定性解码（Deterministic decoding）</strong>，设置 <code class="language-plaintext highlighter-rouge">temperature = 0</code> 且 <code class="language-plaintext highlighter-rouge">do_sample = false</code>。
    <ul>
      <li><em>例外</em>：部分模型有明确的参数要求，例如 <code class="language-plaintext highlighter-rouge">gpt-5</code> 仅接受 <code class="language-plaintext highlighter-rouge">temperature = 1</code>。</li>
    </ul>
  </li>
  <li><strong>提示与格式</strong>：跨领域的绝大多数场景都使用了标准化的提示词（Prompt）和输出格式，要求 LLM 将最终答案包含在 XML 风格的标签中（例如：<code class="language-plaintext highlighter-rouge">&lt;answer&gt;...&lt;/answer&gt;</code>）。通过正则表达式提取标签内容后，通常进行不区分大小写和标点符号的<strong>精确匹配（exact-match）</strong>评分。</li>
  <li><strong>领域特定的评分机制</strong>：为了适应不同科学领域的特殊需求，评估引入了专门的工具：
    <ul>
      <li><strong>化学</strong>：对于分子结构输出（如光谱结构解析），使用 <strong>RDKit</strong> 进行规范化，并计算 <strong>Tanimoto 相似度</strong>进行评分；对于数值预测（如氧化还原电位），则检查预测值是否落在定义的<strong>容差窗口（tolerance window）</strong>内。</li>
      <li><strong>材料</strong>：晶格参数回归任务允许在 3 $\mathring{A}$ 的误差范围内获得部分分数。</li>
      <li><strong>生物</strong>：对于结构化描述符（如 LogP、分子量）采用带容差的精确匹配，CRISPR 递送预测采用加权部分评分。</li>
      <li><strong>物理</strong>：对于代数回答，使用符号验证器（<code class="language-plaintext highlighter-rouge">math-verify</code> 包）来解析，只要数学表达式等价即可得分。</li>
    </ul>
  </li>
  <li><strong>分数聚合</strong>：所有指标均归一化为 [0, 1] 区间 11。首先计算每个场景的平均分，然后将同一领域下所有主题的得分取算术平均，得出该领域的最终得分。</li>
</ul>

<p><strong>2. 项目层级评估 (Project-level)</strong></p>

<p>这一层级评估模型在完整的科学发现循环（假设-实验-观测）中的表现。</p>

<ul>
  <li><strong>评估框架</strong>：使用专门开发的 <strong><code class="language-plaintext highlighter-rouge">sde-harness</code></strong> 框架执行。</li>
  <li><strong>评分方法</strong>：将每个项目的表现聚合为一个单一的分数。具体做法是先对每个子目标（sub-objectives）的得分进行归一化，然后取平均值作为该项目的最终得分。
    <ul>
      <li><strong>图表引用</strong>：这一聚合评分的展示方式在 Fig. 4a 中有直观体现，该图通过条形图展示了各模型在归一化单一指标上的表现。</li>
    </ul>
  </li>
  <li><strong>评估模型限制</strong>：由于运行完整项目的成本远高于单题评估，项目层级评估仅针对部分顶尖模型进行，包括 <strong>gpt-5-chat-latest, gpt-5, claude-sonnet-4.5</strong> 和 <strong>deepseek-R1</strong>，涵盖了最佳的非推理模型和推理模型。</li>
</ul>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="CL" /><category term="Agent" /><category term="LLM" /><category term="NLP" /><summary type="html"><![CDATA[论文地址：Evaluating Large Language Models in Scientific Discovery 论文实现：https://github.com/HowieHwong/sde-harness]]></summary></entry><entry xml:lang="en"><title type="html">NeurIPS-2025 AI-Researcher：Autonomous Scientific Innovation</title><link href="https://tyang816.github.io/cl/AI-Researcher-Autonomous-Scientific-Innovation/" rel="alternate" type="text/html" title="NeurIPS-2025 AI-Researcher：Autonomous Scientific Innovation" /><published>2025-12-08T00:00:00+08:00</published><updated>2025-12-08T00:00:00+08:00</updated><id>https://tyang816.github.io/cl/AI-Researcher%EF%BC%9AAutonomous%20Scientific%20Innovation</id><content type="html" xml:base="https://tyang816.github.io/cl/AI-Researcher-Autonomous-Scientific-Innovation/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://openreview.net/pdf/a1c63cdd0495de94664b1513f7d95a3aedcb483a.pdf">AI-Researcher：Autonomous Scientific Innovation</a></p>

  <p>论文实现：<a href="https://github.com/HKUDS/AI-Researcher">https://github.com/HKUDS/AI-Researcher</a></p>
</blockquote>

<h2 id="ai-researcherai系统产生ai科学论文">AI-Researcher：AI系统产生AI科学论文</h2>

<h3 id="abstract">Abstract</h3>

<p>大语言模型（LLMs）在<strong>数学和编程领域表现出的强大推理能力</strong>，结合其通过智能体框架自动化处理复杂任务的能力，为加速科学创新提供了前所未有的机遇 。在本文中，研究者介绍了 <strong>AI-Researcher</strong>，这是一个<strong>全自主的研究系统</strong>，旨在改变人工智能驱动的科学发现及评估方式 。</p>

<p>该框架的主要特点与贡献包括：</p>

<ul>
  <li><strong>全流程自动化流水线</strong>：该框架能够无缝编排完整的科研流程——从<strong>文献综述、假设生成到算法实现以及可供发表的手稿准备</strong>——且仅需极少的人类干预 。</li>
  <li><strong>Scientist-Bench 评估基准</strong>：为了严谨评估自主研究能力，作者开发了 <strong>Scientist-Bench</strong> 。这是一个综合性基准，包含多个 AI 研究领域的尖端论文，涵盖了<strong>引导式创新（guided innovation）</strong>和<strong>开放式探索（open-ended exploration）</strong>任务 。</li>
  <li><strong>显著的研究成果</strong>：通过广泛的实验，研究证明 AI-Researcher 实现了卓越的算法实现成功率，并能产出<strong>接近人类水平质量</strong>的研究论文 。</li>
  <li><strong>扩展人类认知边界</strong>：这项工作为自主科学创新奠定了新基础，能够通过系统地探索<strong>超越人类认知限制</strong>的解空间，从而对人类研究人员形成补充 。</li>
</ul>

<h3 id="1-introduction">1 Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>1. 科学发现的瓶颈与 AI 的机遇</strong></p>

<p>科学发现历来受到人类认知局限性以及潜在解空间巨大规模的限制 。尽管大型语言模型（LLMs）在数学推理、代码编写和问题解决方面展现出了卓越的能力，这些任务以往被认为需要人类专家才能完成 。然而，将孤立的能力转化为能够进行原始创新的<strong>全自主科学研究系统</strong>，仍然是一个尚未解决的挑战，这可能会从根本上改变科学进步的方式 。</p>

<p><strong>2. 科学创新的复杂性</strong></p>

<p>科学创新代表了一个智力前沿，其挑战性比目前 AI 智能体掌握的任务自动化（如日程安排或结构化信息检索）高出几个数量级 。真正的科学发现需要：</p>

<ul>
  <li>在抽象理论领域进行复杂的<strong>概念推理</strong> 。</li>
  <li>能够跨越不同知识领域的<strong>变革性假设生成</strong> 。</li>
  <li>超越简单模式识别的<strong>方法论创新</strong> 。</li>
  <li>在保持对数千篇论文连贯理解的同时，生成能从根本上推进知识边界的见解 。</li>
</ul>

<p>此外，科学探索涉及在具有高度不确定回报的无限解空间中航行，这需要<strong>元认知能力</strong>来识别有前景的方向并放弃无效路径 。研究人员必须根据意外发现调整假设，并保持推动突破性发现的创造性火花 。</p>

<p><strong>3. 当前系统的局限</strong></p>

<p>目前的局限性使得 AI 系统无法自主进行有意义的科学工作，AI 仍被局限于狭窄的辅助角色 。</p>

<ul>
  <li><strong>缺乏协同性</strong>：虽然存在专门用于文献分析或实验设计的系统，但它们无法编排从假设生成到出版质量报告的完整流程 。</li>
  <li><strong>缺乏标准基准</strong>：目前缺乏标准化的基准来跨不同科学领域系统地评估自主研究能力 。</li>
</ul>

<p><strong>4. AI-Researcher 框架及其核心创新</strong></p>

<p>为了解决这些限制，作者引入了 <strong>AI-Researcher</strong>。如 <strong>Figure 1</strong> 所示，该框架涵盖了从文献探索、想法生成、算法实现、实验验证到学术出版的完整生命周期 。</p>

<p>该框架引入了三项关键创新：</p>

<ol>
  <li><strong>资源分析智能体 (Resource Analyst Agent)</strong>：将复杂的科研概念分解为原子组件，并在数学公式与代码实现之间建立显式的双向映射，显著降低了幻觉风险 。</li>
  <li><strong>实现框架 (Implementation Framework)</strong>：采用受人类启发的迭代优化范式，通过结构化反馈循环进行协作，模拟学术研究中的“导师-学生”关系 。</li>
  <li><strong>文档智能体 (Documentation Agent)</strong>：通过层次化合成方法克服 LLM 在长文本连贯性上的限制，将研究成果转化为出版质量的手稿，并保持事实完整性 。</li>
</ol>

<p><strong>5. Scientist-Bench 与研究发现</strong></p>

<p>为了严谨评估此类系统，作者开发了 <strong>Scientist-Bench</strong>。这是首个支持在引导式创新和开放式探索任务下进行标准化评估的综合基准，包含了22篇benchmark论文。</p>

<ul>
  <li><strong>卓越表现</strong>：实验表明，AI-Researcher 达到了显著的实现成功率，其产生的科研贡献频繁接近人类水平 。</li>
  <li><strong>意外发现</strong>：AI-Researcher 在<strong>开放式探索</strong>中的表现优于引导式任务。这表明当自主研究系统利用内部知识合成而非遵循特定的指令时，其表现更为出色 。</li>
</ul>

<h3 id="2-scientist-bench-benchmarking-ai-agents-for-scientific-discovery">2 Scientist-Bench: Benchmarking AI Agents for Scientific Discovery</h3>

<p>科学发现需要深厚的专业知识和系统的方法论推理。在该领域中，开发用于评估新颖科学发现的基准测试并建立相应的评估指标，仍然是目前面临的挑战。为此，本文引入了 <strong>Scientist-Bench</strong>，这是一个将大语言模型（LLM）智能体生成的研究与人类专家工作进行比较的综合性基准。与现有的基准测试不同，Scientist-Bench 提供了一个全面的框架，其中包括：</p>

<ul>
  <li>精心策划的研究指令；</li>
  <li>参考文献；</li>
  <li>源自同行评审论文的数据集。</li>
</ul>

<p>该基准通过多维度的评估标准，实现了 AI 生成内容与人类科学贡献之间的直接对比 9。作者将科学发现任务定义如下（完整的基准细节请参阅附录 A.7）：</p>

<p><strong>1. Task Formulation</strong></p>

<p>该基准旨在评估智能体系统的科学研究能力。</p>

<ul>
  <li><strong>输入信息</strong>：输入 <code class="language-plaintext highlighter-rouge">$\mathcal{X}=\{\mathcal{R},I,\mathcal{D}\}$</code> 由以下部分组成：
    <ul>
      <li><strong>参考论文 <code class="language-plaintext highlighter-rouge">$\mathcal{R}$</code></strong>：通过 LLM 挑选的 15-20 篇相关文献；</li>
      <li><strong>研究指令 <code class="language-plaintext highlighter-rouge">$I$</code></strong>：包含核心研究构思的指令，一个详细的研究指令旨在让研究人员在不阅读整篇论文的情况下，能够实现其核心方法论：
        <ul>
          <li><strong>任务说明</strong>：模型所执行的具体任务 。</li>
          <li><strong>核心技术与算法</strong>：包括具体的神经网络架构、优化方法和数据处理方式 。</li>
          <li><strong>组件功能</strong>：每个主要技术组件的目的和作用 。</li>
          <li><strong>实现细节</strong>：包括关键参数配置、输入/输出规范以及重要的约束要求 。</li>
          <li><strong>系统交互描述</strong>：各组件如何相互作用并组合成完整系统的分步骤说明 。</li>
          <li><strong>性能关键点</strong>：影响模型表现的关键实现细节 。</li>
        </ul>
      </li>
      <li><strong>数据集 <code class="language-plaintext highlighter-rouge">$\mathcal{D}$</code></strong>，处理由 <strong>Plan Agent</strong> 和 <strong>Code Agent</strong> 协作完成
        <ul>
          <li>从 Scientist-Bench 所包含的同行评审目标论文中衍生出来的，根据研究领域的不同而变化，包括计算机视觉（扩散模型）、信号处理（向量量化）、图学习（GNN）和信息检索（推荐系统）等 。</li>
          <li><strong>数据集规划</strong>：<strong>Plan Agent</strong> 会制定详细的“数据集计划”，其中包括数据集描述、存储位置、任务定义以及完整的数据加载流水线（读取、预处理、Dataloader 步骤） 。</li>
          <li><strong>环境准备</strong>：所有数据集都在受控的 <strong>Docker 容器</strong>环境中使用，系统支持动态的依赖安装以确保数据处理代码能够正常运行 。</li>
          <li><strong>代码实现</strong>：<strong>Code Agent</strong> 必须严格遵循计划，使用指定的学术数据集来验证模型组件的有效性</li>
        </ul>
      </li>
    </ul>
  </li>
  <li><strong>挑战等级</strong>：Scientist-Bench 定义了两个挑战等级：
    <ul>
      <li><strong>Level-1</strong>：提供从目标论文 <code class="language-plaintext highlighter-rouge">$y$</code> 中提取的<strong>显式研究指令</strong>，测试系统的<strong>执行能力</strong>；</li>
      <li><strong>Level-2</strong>：<strong>省略这些指令</strong>，挑战智能体仅利用参考文献和数据集来制定新颖的研究方向。</li>
    </ul>
  </li>
  <li><strong>输出结果</strong>：输出 <code class="language-plaintext highlighter-rouge">$\hat{\mathcal{Y}}=\{\mathcal{C},p\}$</code> 包含：
    <ul>
      <li><strong>实现代码 <code class="language-plaintext highlighter-rouge">$\mathcal{C}$</code></strong>；</li>
      <li><strong>技术报告 <code class="language-plaintext highlighter-rouge">$p$</code></strong>：详细描述研究背景、方法论、实验及结果。</li>
    </ul>
  </li>
  <li><strong>评估方式</strong>：上述代码与报告均需经过评估，以便与人类生成的研究进行质量与创新性的对比，从而在理论和实践维度上提供全面的评估。</li>
</ul>

<p><strong>2. Benchmark Construction</strong></p>

<p><strong>第一步：系统性论文筛选 (Systematic Selection)</strong></p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/tab5.png" alt="avatar" style="zoom:80%;" /></div>

<p>研究者首先从 2022-2024 年间发表的学术论文中，系统性地收集了跨越 <strong>16 个研究领域</strong>（如计算机视觉、图学习、推荐系统等）的样本 。该过程结合了 <strong>LLM 关键词生成</strong>与 <strong>arXiv 引用量过滤</strong>：先由 LLM 生成各领域的关键词，然后检索每个关键词下引用率前 10 的论文，最终精选出 <strong>22 篇</strong> 能够展示 AI 领域突破性成果的代表作作为基准的基础 。这些论文的具体统计分布可参见 <strong>Table 5</strong> 。</p>

<p><strong>第二步：输入信息构建 (Input Construction)</strong></p>

<p>该步骤旨在为 AI 系统提供类似人类科研的初始条件，包含两个核心维度：</p>

<ul>
  <li><strong>参考文献综述 (<code class="language-plaintext highlighter-rouge">$\mathcal{R}$</code>)</strong>：为了识别出对目标论文产生根本影响的 <strong>15-20 篇文献</strong>，研究者设计了一套严格的<strong>五步 LLM 评估流程</strong>：
    <ol>
      <li><strong>引用模式分析</strong>：统计引用频率、位置及跨章节分布。</li>
      <li><strong>上下文分析</strong>：评估文献对方法论、理论和实验设计的影响深度。</li>
      <li><strong>证据收集</strong>：提取具体的概念借用、改进点及影响证据。</li>
      <li><strong>影响评分</strong>：基于频率（30%）、位置（25%）、深度（25%）和直接影响（20%）计算综合分。</li>
      <li><strong>最终选择</strong>：根据得分排名并提供详细的入选理由。</li>
    </ol>
  </li>
  <li><strong>研究需求生成 (<code class="language-plaintext highlighter-rouge">$I$</code>)</strong>：利用 LLM 从目标论文中提取核心概念、现有局限和主要目标。为确保科研原创性并防止信息泄露，提取过程<strong>严禁包含具体的技术规范、模型标识符、定量结果或架构细节</strong>。</li>
</ul>

<p><strong>第三步：严格匿名化 (Rigorous Anonymization)</strong></p>

<p>为了区分 AI 是在真正解决问题还是在复述记忆中的训练数据，基准实施了全面的匿名化协议 ：</p>

<ul>
  <li><strong>方法名称屏蔽</strong>：将特定的算法和模型名称替换为通用标识符，以测试系统的概念理解能力 。</li>
  <li><strong>技术细节抽象</strong>：移除具体实现细节但保留核心原则 。</li>
  <li><strong>数据集标准化</strong>：规范化实验背景，防止系统利用对特定数据集的熟悉度走捷径 。</li>
  <li><strong>引用匿名化</strong>：消除文献中的时间（年份）和机构标记 。</li>
</ul>

<p>通过这一构造过程，Scientist-Bench 能够区分出 <strong>Level-1（引导式创新）</strong> 和 <strong>Level-2（开放式探索）</strong> 两种任务等级，分别测试系统的执行力与独立创新能力 。</p>

<h3 id="3-the-ai-researcher-framework">3 The AI-Researcher Framework</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>AI-Researcher</strong> 是一个系统性的框架 ，旨在通过最小化的人类监督，将科学概念转化为完整的学术贡献 。该框架建立在近期关于 AI 系统自主科学发现潜力的研究基础之上 ，并引入了一个分为三个阶段的流水线 ：</p>

<ol>
  <li><strong>文献综述与想法生成</strong> (Literature Review and Idea Generation) 。</li>
  <li><strong>新算法设计、实现与验证</strong> (New Algorithm Design, Implementation and Validation) 。</li>
  <li><strong>自动化科学文档撰写</strong> (Automated Scientific Documentation) 。</li>
</ol>

<p>这一流水线的具体架构框架如图 <strong>Figure 2</strong> 所示 。</p>

<h4 id="31-multi-agent-system-overview-of-ai-researcher">3.1 Multi-Agent System Overview of AI-Researcher</h4>

<h5 id="311-文献综述-literature-review">3.1.1 文献综述 (Literature Review)</h5>

<p>这一阶段主要由以下核心组件构成：</p>

<ul>
  <li>
    <p><strong>知识获取智能体 (Knowledge Acquisition Agent)</strong>：</p>

    <ul>
      <li><strong>自主探索</strong>：系统地从科学数据库中收集相关的论文和代码库 。</li>
      <li><strong>低输入门槛</strong>：用户仅需提供 10-15 篇参考论文 。</li>
      <li><strong>核心功能</strong>：
        <ol>
          <li><strong>代码库选择</strong>：基于代码近况、GitHub 受欢迎程度、文档质量、领域相关性和引用影响力，筛选出至少 5 个高质量的 GitHub 仓库 。</li>
          <li><strong>补充文献收集</strong>：自动从 arXiv 检索对应仓库的论文，包括完整的 LaTeX 源代码，以丰富技术背景知识 。</li>
        </ol>
      </li>
    </ul>
  </li>
  <li>
    <p><strong>资源分析智能体 (Resource Analyst Agent)</strong>：</p>

    <ul>
      <li>该智能体将研究概念解构为可管理的<strong>原子组件</strong> 。</li>
      <li>通过 <strong>Paper Analyst</strong>（论文分析）和 <strong>Code Analyst</strong>（代码分析）子智能体，精确提取数学公式并与其代码实现进行匹配，确保理论与实践的一致性 。</li>
      <li><strong>分析流程</strong>：包括概念分解、数学形式化、实现分析和知识整合，最终形成详细的研究报告 。</li>
    </ul>
  </li>
  <li>
    <p><strong>安全研究环境 (Secure Research Environment)</strong>：</p>

    <ul>
      <li>为保护主机系统，所有自动化操作均在 <strong>Docker 容器</strong>中运行 。该环境提供坚固的安全边界、预配置的机器学习框架以及支持自主安装依赖的动态包管理系统 。</li>
    </ul>
  </li>
  <li>
    <p><strong>集成研究分析 (Integrated Research Analysis)</strong>：</p>

    <p><strong>Resource Analyst</strong> 构成了抽象概念与具体实现之间的关键桥梁，显著降低了后续开发阶段出现幻觉的风险 。该智能体遵循严谨的结构化分析流程：</p>

    <ol>
      <li><strong>概念分解 (Concept Decomposition)</strong>：将复杂的科研目标分解为基础的、不可分割的原子学术概念 。</li>
      <li><strong>数学形式化 (Mathematical Formalization)</strong>：<strong>Paper Analyst</strong> 利用基于 <strong>RAG（检索增强生成）</strong> 的范式检查 LaTeX 文件，提取每个原子概念的数学表达 。</li>
      <li><strong>实现分析 (Implementation Analysis)</strong>：<strong>Code Analyst</strong> 分析代码库，定位这些数学表达式的具体实现，并识别关键文件和依赖项 。</li>
      <li><strong>知识整合 (Knowledge Integration)</strong>：将论文与实现的分析结果合成到<strong>概念剖面 (Concept Profiles)</strong> 中，建立数学公式与代码之间的连接 。 该循环持续进行，直至所有概念被彻底调查，最终形成详细的研究报告 。</li>
    </ol>
  </li>
  <li>
    <p><strong>计划智能体 (Plan Agent)</strong>： 等待上述循环持续完成，基本所有概念得到彻底研究后，将上述发现转化为全面的<strong>实施路线图</strong>，涵盖训练程序、测试方法和数据集要求，形成完整的可执行研究策略 。</p>
  </li>
</ul>

<h5 id="312-idea-generation">3.1.2 Idea Generation</h5>

<p><strong>想法生成器 (Idea Generator)</strong> 旨在跨越既定范式，进入新的科学前沿 。在完成综合分析后，它通过知识合成识别未探索的研究领域，系统地寻找科学发现往往涌现的<strong>概念空白、矛盾发现和新兴模式</strong> 。</p>

<p>每项生成的提案包含以下要素：<strong>挑战分析</strong>（定位理解局限）、<strong>现有方法</strong>（揭示创新点）、<strong>动机</strong>（建立科学必要性）、<strong>提出的方法</strong>（引入新理论或算法）、<strong>技术细节</strong>以及<strong>预期成果</strong> 。</p>

<ul>
  <li><strong>发散-收敛发现 (Divergent-Convergent Discovery)</strong>： 受前人启发，该过程首先在<strong>发散阶段</strong>生成五个不同的研究方向，探索正交视角 。随后在<strong>收敛阶段</strong>，针对<strong>科学新颖性、技术合理性和变革潜力</strong>进行评估，最终将得分最高的概念开发为具有清晰路径的正式提案 。</li>
</ul>

<h4 id="32-new-algorithm-design-implementation-and-validation">3.2 New Algorithm Design, Implementation and Validation</h4>

<p>将新颖的科研概念转化为实际的代码实现是计算科学中最具挑战性的方面之一 。不同于传统代码智能体尝试的一次性（one-shot）实现方式（这种方式往往会导致错误或科研偏差），该框架引入了一个镜像人类科研范式的迭代优化和协作反馈框架 。</p>

<ul>
  <li><strong>多阶段优化架构 (Multi-Stage Refinement Architecture)</strong>：该方法实现了一个带有显式反馈机制的循环开发过程，从而实现逐步改进 。类似于导师与学生之间的协作，该架构通过结构化的指导进行迭代优化，利用测试时缩放（test-time scaling）能力提高了实现的成功率 。</li>
  <li><strong>代码实现框架 (Code Implementation Framework)</strong>：代码智能体（Code Agent）将研究分析和开发计划转化为可执行的实现 。它在受控工作区内运行，具备全面的文件系统和执行能力 。该智能体在确保学术概念忠实转化为代码的同时，强制执行严格的代码独立性原则，并根据实施计划进行持续验证和修改记录 。</li>
  <li><strong>专家验证框架 (Expert Validation Framework)</strong>：顾问智能体（Advisor Agent）通过提供专家反馈，弥合了理论概念与实际实现之间的鸿沟 。它通过将代码与分析阶段提取的原子研究想法进行系统对比，来验证实现的忠实度 。该智能体利用专门的导航工具、可视化手段和工作区材料检查结果，并生成带有具体、可操作修改建议的评估报告，以指导迭代优化 。</li>
  <li><strong>渐进式实验循环 (Progressive Experimental Cycles)</strong>：实验过程通过严谨的科学方法进行代码验证 。代码智能体首先开发原型实现，并在极小规模的数据上（通常为 1-2 个 epoch 或小数据集子集）进行初步测试，以确立基线可行性 。随后，合并了评审反馈的成功实现将进入全规模实验；而经过多次优化尝试后仍未成功的实现则被归类为“不可行” 。在整个循环过程中，顾问智能体通过评估结果并推荐补充调查（如可视化、消融实验等）来提供分析支持，确保发现的科学严谨性和可复现性 。</li>
</ul>

<h4 id="33-automated-scientific-documentation">3.3 Automated Scientific Documentation</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig3.png" alt="avatar" style="zoom:50%;" /></div>

<p>在经历了实质性的实现和实验循环后，文档智能体启动了一个复杂的流程，将技术构件转换为符合出版标准的学术论文 。如 <strong>Figure 3</strong> 的右侧部分所示，这一过程并非简单的文本填充，而是涵盖了从研究轨迹合成到分层撰写的完整体系 。</p>

<p><strong>1. 研究轨迹合成 (Research Trajectory Synthesis)</strong></p>

<ul>
  <li><strong>多维度整合</strong>：系统性地整合了研究过程中的各种元素，包括智能体的推理过程、执行日志、实现的源代码以及实验结果 。</li>
  <li><strong>保留智力背景</strong>：与简单的文档工具不同，该系统不仅捕捉最终结果，还记录了导致科学进步的关键决策路径，从而保留了完整的发现背景 。</li>
  <li><strong>学术规范化</strong>：按照既定的学术惯例组织发现，将技术细节转化为连贯的科学叙事 。</li>
</ul>

<p><strong>2. 克服文档规模的连贯性挑战 (Overcoming Document-Scale Coherence Challenge)</strong></p>

<ul>
  <li><strong>应对 LLM 局限</strong>：针对大语言模型在生成长文本时难以维持逻辑一致性的问题，研究团队开发了一个多阶段生成框架 。</li>
  <li><strong>模仿人类策略</strong>：该框架的灵感源自人类研究员起草论文的习惯，通过将写作任务分解为可管理的组件，确保了在扩展输出过程中的逻辑连接和事实诚信 。</li>
</ul>

<p><strong>3. 三阶段层次化文档流程 (Three-Phase Hierarchical Documentation)</strong></p>

<p>该智能体采用严谨的三阶段流程来确保手稿质量 ：</p>

<ul>
  <li><strong>阶段 1：合成研究构件</strong>：根据特定领域的模板进行结构化大纲编写，确立章节层次结构和逻辑流 。</li>
  <li><strong>阶段 2：模板引导结构</strong>：进行有条理的内容详述，在开发解释说明时保持跨文档的一致性 。</li>
  <li><strong>阶段 3：分层文档处理</strong>：使用专门的学术检查清单进行系统性验证，识别并修复任何准确性缺陷或遗漏 。</li>
</ul>

<p>这种“多走一步”的审查过程显著增强了事实的完整性，确保生成的手稿能够达到出版标准，有效避免了通常困扰 LLM 长文本生成的幻觉和不一致问题 。</p>

<h3 id="4-experiments">4 Experiments</h3>

<p>作者对 <strong>AI-Researcher</strong> 在其开发的 <strong>Scientist-Bench</strong> 基准上进行了全面评估 。实验设置涉及对 22 篇基准论文进行测试，涵盖多个 LLM 评估器，重点考察实现成功率和科研贡献质量 。</p>

<h4 id="41-dual-metric-evaluation-framework-quantifying-implementation-quality-rq1">4.1 Dual-Metric Evaluation Framework: Quantifying Implementation Quality (RQ1)</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig4.png" alt="avatar" style="zoom:50%;" /></div>

<p>为了评估 <strong>AI-Researcher</strong> 系统根据需求实施代码的稳定性和质量，研究者提出了<strong>双指标评估框架</strong>，包括“完成率”和“正确性”两个关键维度 。</p>

<p><strong>1. 指标定义与评估流程</strong></p>

<ul>
  <li><strong>完成率 (Completeness)</strong>：衡量智能体是否能在分配的推理预算内生成可执行的代码 。系统通过明确的终止协议进行评估：智能体通过 <code class="language-plaintext highlighter-rouge">case_resolved</code> 信号表示成功，或通过 <code class="language-plaintext highlighter-rouge">case_not_resolved</code> 确认失败 。</li>
  <li><strong>正确性 (Correctness)</strong>：针对即使代码能运行也可能存在的细微实现缺陷、概念错位或组件缺失进行评估 。该评估采用多智能体框架：首先由 <strong>Advisor Agent</strong> 生成详细的分析报告，随后由 <strong>Judge Agent</strong> 按照 5 分制进行打分 。最终的正确性指标是多次独立评判的平均分 。</li>
</ul>

<p><strong>2. 性能表现分析</strong></p>

<p>如 <strong>Figure 4</strong> 所示，研究团队使用 <strong>Claude 系列模型</strong> 在整个基准数据集上进行了广泛实验 ：</p>

<ul>
  <li><strong>高完成率</strong>：系统达到了 <strong>93.8%</strong> 的卓越完成率，仅在涉及复杂的张量维度冲突或数据类型不匹配且多次调试无效的情况下才会失败 。</li>
  <li><strong>正确性表现</strong>：平均正确性分数为 <strong>2.65</strong>（总分 5 分），超过了中位阈值，表明系统成功实现了大部分指定要求 。</li>
  <li><strong>领域差异</strong>：性能在不同领域表现不一，其中<strong>视觉与问答 (VQ)</strong> 任务的正确性最高（3.22），而<strong>推荐系统 (Rec)</strong> 任务平均为 2.20，这反映了推荐系统算法和数据处理的更高复杂性 。</li>
</ul>

<p><strong>3. 不同 LLM 的横向对比</strong></p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig5.png" alt="avatar" style="zoom:100%;" /></div>

<p>通过 <strong>Figure 5（左图）</strong> 的受控评估，研究揭示了不同模型家族之间的显著性能差异 ：</p>

<ul>
  <li><strong>Claude 系列 vs 4o 系列</strong>：在评估子集中，Claude 系列模型达到了 <strong>87.5%</strong> 的完成率，远超 4o 系列模型的 <strong>50%</strong> 。</li>
  <li><strong>调试能力差距</strong>：性能差距主要源于调试能力。4o 系列模型经常产生持久的张量维度不匹配和训练不稳定（如 NaN 损失）问题且无法修复 。</li>
  <li><strong>正确性差距</strong>：Claude 系列的平均正确性得分（2.75）显著高于 4o 系列（1.0） 。4o 系列在复杂任务中表现出过度简化和概念遗漏的趋势 。例如在扩散模型任务中，4o 模型虽声称实现了 Diffusion Transformer，但检查发现其仅提供了标准 ViT 实现，完全缺失了核心的扩散组件 。</li>
</ul>

<p><strong>4. 任务复杂度（Level-2）的影响</strong></p>

<p>如 <strong>Figure 5（右图）</strong> 所示，作者分析了 Level-1（改编现有方法）与 Level-2（生成并实现新想法）任务的表现对比 ：</p>

<ul>
  <li><strong>稳健的完成率</strong>：即使在更具挑战性的 Level-2 创新任务中，AI-Researcher 依然保持了 <strong>100%</strong> 的完美完成率 。</li>
  <li><strong>正确性小幅下降</strong>：从 Level-1 的 2.5 分下降到了 Level-2 的 <strong>2.25 分</strong> 。这表明虽然系统能可靠地执行自生成的科研想法，但在实现新颖且复杂的创新概念时，质量偶尔会逊色于改编任务 。这一差距主要源于智能体生成的创新点技术难度较高，或框架在完美实现野心勃勃的创新时存在局限 。</li>
</ul>

<h4 id="42-evaluating-scientific-quality-through-pairwise-comparison-rq2">4.2 Evaluating Scientific Quality Through Pairwise Comparison (RQ2)</h4>

<p>为了评估 <strong>AI-Researcher</strong> 生成研究的科学价值，研究者实施了一套<strong>成对评估协议 (pairwise evaluation protocol)</strong>，将 AI 生成的论文与匹配领域的<strong>人类撰写出版物</strong>进行比较 。</p>

<p><strong>1. 评估协议与维度</strong></p>

<p>专门的评审智能体遵循 <strong>ICLR 指南</strong>进行比较分析，评估维度涵盖了两个作品的：<strong>研究动机、方法论、创新性以及实验验证</strong> 。</p>

<p><strong>2. 总体性能表现</strong></p>

<p>成对评估的结果显示，尽管 AI-Researcher 生成的论文平均评分略低于人类撰写作品（各评估器的平均评分在 <strong>-0.53 到 -1.70</strong> 之间），但仍有<strong>相当大比例 (13.64% 到 81.82%)</strong> 的 AI 生成论文表现出与人类研究相当的质量 。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/tab1.png" alt="avatar" style="zoom:100%;" /></div>

<p>这一发现具有显著意义，因为基准测试中的对比对象完全是从各领域顶级会议中精心挑选的<strong>顶尖人类学术出版物</strong> 。如 <strong>Table 1</strong> 所示，AI-Researcher 展示了执行完整科学研究流水线的卓越能力——从开发方法论上的技术创新到进行严谨的实验验证，并最终合成逻辑清晰、结构良好的学术手稿 。</p>

<p><strong>Table 1: AI-Researcher 生成研究与基准人类研究的对比</strong>  该表展示了不同评估器（如 GPT-4o, o1-mini, Claude-3.5/3.7 等）在不同领域（Diffusion, VQ, GNN, Rec）下的评分：</p>

<ul>
  <li><strong>GPT-4o</strong> 给出的评分最高：平均分 <strong>-0.53</strong>，认为 <strong>81.82%</strong> 的论文具有可比性 。</li>
  <li><strong>Claude-3.7</strong> 给出的评分最低：平均分 <strong>-1.70</strong>，认为仅有 <strong>22.73%</strong> 的论文具有可比性 。</li>
</ul>

<p><strong>3. LLM 评估器的分歧与偏好</strong></p>

<p>实验观察到不同 LLM 评估器之间存在显著分歧 ：</p>

<ul>
  <li><strong>评分差异</strong>：GPT-4o 倾向于给出最高评分，而 Claude-3.7 则最为严苛 。</li>
  <li><strong>领域偏好</strong>：例如，GPT-4o 和 o1-mini 认为生成的推荐系统 (Rec) 论文全部可与人类论文相比，而 o3-mini 则认为它们质量较差 。</li>
  <li><strong>评估偏置</strong>：这种分歧说明了仅使用单一 LLM 评估器来衡量研究成果可能存在<strong>潜在偏置</strong> 。</li>
</ul>

<p><strong>4. 特定领域分析</strong></p>

<p>性能在不同研究领域之间有所波动，但<strong>没有表现出一致的模式</strong> ：</p>

<ul>
  <li>在使用 GPT-4o 和 Claude-3.7 评估时，扩散模型 (Diffusion) 的可比率高于图神经网络 (GNN)；但在使用 o1-mini 评估时，情况正好相反 。</li>
  <li>评估器对不同领域的看法也存在冲突，例如在矢量量化 (VQ) 领域，三款评估器认为其优于扩散模型，而另外两款则持相反意见 。</li>
</ul>

<p>总体而言，这些变化更多受<strong>评估器偏好</strong>的影响而非领域本身，这表明 AI-Researcher 在不同研究领域保持了<strong>一致的性能</strong>，没有在任何特定领域出现灾难性的表现下降 。</p>

<h4 id="43-open-ended-autonomous-scientific-innovation-capabilities-rq3">4.3 Open-Ended Autonomous Scientific Innovation Capabilities (RQ3)</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/tab2.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了评估 <strong>AI-Researcher</strong> 的创新潜力，研究团队在<strong>开放式任务</strong>中对其进行了测试 。在这些任务中，系统仅接收参考文献，没有明确的指令，要求其独立识别研究方向、提出假设并执行完整的科研流程 。</p>

<p><strong>Table 2</strong> 展示了不同领域下的对比评估结果 。为了确保方法论的多样性并考虑专业研究社区内的自然引用重叠，研究者精心选择了 5 篇涵盖不同研究领域的代表性论文进行评估 。通过对这些自主科学探索的分析，研究揭示了关于系统创造性研究能力的几项关键见解：</p>

<p><strong>1. 性能分析 (Performance Analysis)</strong></p>

<ul>
  <li><strong>出色的 Level-2 表现</strong>：当对比不同任务结构时，出现了一个显著的模式：系统在<strong>开放式 Level-2 场景</strong>中的表现明显优于<strong>指令引导的 Level-1 任务</strong> 。</li>
  <li><strong>指标的显著提升</strong>：这种质量差异在所有评估指标中都得到了体现 。平均评分从 -0.53 ~ -1.70 显著提高到 <strong>-0.23 ~ -1.22</strong>；同时，可比率（Comparable rates）从 13.64% ~ 81.82% 大幅上升至 <strong>50.00% ~ 100.00%</strong> 。</li>
  <li><strong>对传统假设的挑战</strong>：这些发现挑战了关于 AI 研究能力的传统假设 。结果表明，当 AI-Researcher 利用其<strong>内部知识合成和构思过程</strong>，而非遵循显式的研究指令时，表现更为出色 。</li>
  <li><strong>指令的潜在局限性</strong>：显式的研究指令可能会无意中限制系统的创造性探索能力，而自主制定的研究方向则允许系统追求与其实现能力更匹配、科学上更有前景的方向 。</li>
</ul>

<p><strong>2. 领域特定资源约束对创新质量的影响</strong></p>

<ul>
  <li><strong>计算需求与表现的关系</strong>：跨领域分析揭示了<strong>计算需求与自主研究表现</strong>之间存在系统性联系 。</li>
  <li><strong>轻量级计算领域的优势</strong>：计算需求较低的研究领域（特别是<strong>推荐系统</strong>）在开放式探索中表现出显著的质量提升，在大多数评估基准中达到了 <strong>66.67% 到 100%</strong> 的惊人可比率 。</li>
  <li><strong>计算密集型领域的挑战</strong>：相比之下，<strong>扩散模型</strong>等计算密集型领域虽然概念创新性相似，但在评估指标上的增益较为温和 。</li>
  <li><strong>资源限制而非能力不足</strong>：这一模式表明，AI-Researcher 的基本研究能力超出了目前实现的展示，表现差异反映的是<strong>实际资源限制</strong>而非概念理解上的缺陷 。这凸显了计算能力作为 AI 研究质量决定因素的重要性，暗示若能提供更充足的计算资源，性能仍有巨大的提升潜力 。</li>
</ul>

<h4 id="44-impact-of-llm-backbones-rq4">4.4 Impact of LLM Backbones (RQ4)</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/tab3.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了分离基础模型对研究能力的影响，研究者在保持系统架构和协议相同的情况下，针对不同的 <strong>LLM 主干模型</strong>进行了消融实验 。该研究使用了 7 个具有代表性的研究问题来评估模型特定的性能差异 。</p>

<p><strong>Table 3</strong> 展示了对比分析结果，揭示了模型间显著的性能差距 ：</p>

<ul>
  <li><strong>Claude-3.5 的优势</strong>：实证证据表明，<strong>Claude-3.5</strong> 作为研究智能体的主干具有实质性优势，在所有评估基准中，该配置实现的平均质量评分始终高于基于 GPT-4o 的实现 。</li>
  <li><strong>可比率表现</strong>：除了 o1-mini 的评估外，Claude-3.5 在大多数评估语境下的“可比率”（Comparable rates）均优于其他模型 。</li>
  <li><strong>严苛标准下的差距</strong>：在最严苛的评估标准（o3-mini）下，质量差距尤为明显：基于 Claude-3.5 的系统产出了达到人类标准的研究，而基于 GPT-4o 的配置未能生成任何达到最低可比阈值的研究 。这些发现强调了<strong>基础模型选择</strong>在决定自动化科学研究质量上限方面的关键作用 。</li>
</ul>

<h4 id="45-paper-review-agent-validation-against-human-expert-judgments-rq5">4.5 Paper Review Agent Validation Against Human Expert Judgments (RQ5)</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/tab6.png" alt="avatar" style="zoom:100%;" /></div>

<p>为了验证自动化评审系统与专家科学评估的一致性，研究者使用来自 <strong>ICLR 会议</strong>的金标准人类判断数据进行了系统评估 。</p>

<p>实验采用了 32 对精心挑选的论文（每对包含一篇接收论文和一篇被拒论文），并应用了与主实验相同的成对评审方法 。<strong>Table 6</strong> 的结果揭示了以下见解 ：</p>

<ul>
  <li><strong>鲁棒的专家对标能力</strong>：评审智能体展现了持续的判别有效性，所有评估模型在比较“已接收”与“已拒绝”论文时均给出了正值的平均评分（0.31-0.99） 。</li>
  <li><strong>高准确率</strong>：系统展现了与人类专家决策的强力对齐，在 <strong>65.62% 到 90.62%</strong> 的案例中正确识别出了更优秀的论文 。在六个评估器中，有五个在 32 对论文中的准确率超过了 <strong>81%</strong> 。</li>
  <li><strong>模型可靠性差异</strong>：Gemini-2.0-flash 的可靠性显著较低，因此被排除在主要实验之外 。有趣的是，Claude-3.7 增强的系统 2 思考能力并未转化为比 Claude-3.5 更优的评审表现 。</li>
</ul>

<h4 id="46-case-studies-of-ai-generated-scientific-contributions-rq6">4.6 Case Studies of AI-Generated Scientific Contributions (RQ6)</h4>

<p>研究者通过定性分析深入考察了 <strong>AI-Researcher</strong> 生成研究的实现质量与学术呈现，重点关注了 <code class="language-plaintext highlighter-rouge">rotation_vq</code> 基准任务 。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/AI-Researcher/fig6-fig9.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>1. 结构化软件架构与最小化脚手架</strong></p>

<ul>
  <li><strong>组织严密的架构</strong>：如 <strong>Figure 6</strong> 所示，代码智能体生成了极具组织性的项目架构，具有解耦的模型组件、训练流水线和评估模块 。</li>
  <li><strong>从基本原理开发</strong>：不同于需要适配预有代码库的旧框架，AI-Researcher 允许智能体从<strong>基本原理（First principles）</strong>出发进行开发，同时融入人类软件工程的最佳实践，这增强了实现的连贯性 。如 <strong>Figure 7</strong> 和 <strong>Figure 8</strong> 所示，其实现展示了专业的编码标准和逻辑模块化 。</li>
</ul>

<p><strong>2. 无须显式指令的涌现式实验严谨性</strong></p>

<ul>
  <li><strong>自主实验设计</strong>：系统具备通过智能体间协作而涌现出的自主实验设计能力 。</li>
  <li><strong>全面的科学评估</strong>：这种自发的严谨性体现在最终手稿中（如 <strong>Figure 9</strong> 所示），系统独立进行并报告了完整的科学评估，包括<strong>性能基准测试、受控消融研究、训练动态可视化以及潜在空间嵌入分析</strong> 。</li>
  <li><strong>超越指令遵循</strong>：这种实验方法论是从多智能体系统中自然产生的，无需显式的实验要求，证明了其具有超越简单指令遵循的高级科学推理能力 。</li>
</ul>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="CL" /><category term="Agent" /><category term="NLP" /><category term="LLM" /><summary type="html"><![CDATA[论文地址：AI-Researcher：Autonomous Scientific Innovation 论文实现：https://github.com/HKUDS/AI-Researcher]]></summary></entry><entry xml:lang="en"><title type="html">EMNLP-2025 From Automation to Autonomy：A Survey on Large Language Models in Scientific Discovery</title><link href="https://tyang816.github.io/cl/From-Automation-to-Autonomy-A-Survey-on-Large-Language-Models-in-Scientific-Discovery/" rel="alternate" type="text/html" title="EMNLP-2025 From Automation to Autonomy：A Survey on Large Language Models in Scientific Discovery" /><published>2025-11-04T00:00:00+08:00</published><updated>2025-11-04T00:00:00+08:00</updated><id>https://tyang816.github.io/cl/From%20Automation%20to%20Autonomy%EF%BC%9AA%20Survey%20on%20Large%20Language%20Models%20in%20Scientific%20Discovery</id><content type="html" xml:base="https://tyang816.github.io/cl/From-Automation-to-Autonomy-A-Survey-on-Large-Language-Models-in-Scientific-Discovery/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://aclanthology.org/2025.emnlp-main.895/">From Automation to Autonomy：A Survey on Large Language Models in Scientific Discovery</a></p>

  <p>论文实现：<a href="https://github.com/HKUST-KnowComp/Awesome-LLM-Scientific-Discovery">https://github.com/HKUST-KnowComp/Awesome-LLM-Scientific-Discovery</a></p>
</blockquote>

<h2 id="awesome-llm-scientific-discoveryagent做科学发现综述">Awesome-LLM-Scientific-Discovery：Agent做科学发现综述</h2>

<h3 id="abstract">Abstract</h3>

<p>大语言模型（LLMs）正在催化<strong>科学发现领域的范式转变</strong>，它们正从特定任务的自动化工具演变为日益<strong>自主的智能体（autonomous agents）</strong>，并从根本上重新定义了研究过程以及人类与人工智能的协作方式 。</p>

<p>本综述系统地梳理了这一新兴领域，核心聚焦于 LLM 在科学领域中<strong>不断变化的角色</strong>以及<strong>持续提升的能力</strong> 。透过科学方法的视角，作者引入了一个基础的<strong>三级分类体系（three-level taxonomy）</strong>——即<strong>工具（Tool）</strong>、<strong>分析师（Analyst）</strong>和<strong>科学家（Scientist）</strong>，以此来描绘 LLM 在研究生命周期中不断升级的自主性和不断演变的职责 。此外，文章还识别了关键的挑战和未来的研究轨迹，例如<strong>机器人自动化</strong>、<strong>自我改进</strong>以及<strong>伦理治理</strong> 。</p>

<p>总体而言，本综述提供了一个概念架构和战略远见，以引导和塑造 AI 驱动的科学发现的未来，旨在同时促进<strong>快速创新</strong>和<strong>负责任的进步</strong> 。</p>

<h3 id="1-introduction">1 Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/fig1.png" alt="avatar" style="zoom:50%;" /></div>

<p><strong>1. 研究背景：能力的融合与范式转变</strong></p>

<p>大语言模型（LLMs）的持续进步解锁了一系列<strong>涌现能力（emergent abilities）</strong>，例如规划、复杂推理和指令遵循 。此外，集成<strong>智能体工作流（agentic workflows）</strong>使得基于 LLM 的系统能够执行高级功能，包括网页导航、工具使用、代码执行和数据分析 。</p>

<p>在科学发现领域，这种先进的 LLM 能力与智能体功能的融合正在催化一场重大的<strong>范式转变（paradigm shift）</strong> 。这一转变不仅有望加速研究生命周期，还将从根本上改变人类研究人员与人工智能在追求知识过程中的<strong>协作动态</strong> 。</p>

<p><strong>2. 现有挑战与研究空白</strong></p>

<p>然而，LLM 应用的快速扩展和科学发现范式的转变带来了显著挑战。LLM 演进速度之快及其在复杂研究中集成的加深，使得系统性评估变得复杂，因此需要概念框架来梳理当前的理解并规划未来方向 。</p>

<p>作者指出，现有的综述虽然提供了各个科学领域中 LLM 的概览，或者罗列了特定的科学 AI 技术，但它们通常局限于：</p>

<ul>
  <li>特定学科的应用；</li>
  <li>或者仅仅是 LLM 能力的静态快照 。</li>
</ul>

<p>因此，现有综述往往忽视了<strong>LLM 自主性不断增强（increasing LLM autonomy）</strong>这一关键趋势，也没有探讨它们在整个科学方法论中不断演变的角色，导致对它们迈向更高独立性的全面影响和轨迹探索不足 。</p>

<p><strong>3. 本文的方法论框架</strong></p>

<p>为了系统地描绘这一演变的图景并填补上述空白，作者将分析锚定在既定的<strong>科学方法（Scientific Method）的六个阶段</strong>上（如图 1 所示）：</p>

<ol>
  <li><strong>观察与问题定义 (Observation and Problem Definition)</strong></li>
  <li><strong>假设发展 (Hypothesis Development)</strong></li>
  <li><strong>实验与数据收集 (Experimentation and Data Collection)</strong></li>
  <li><strong>数据分析与解释 (Data Analysis and Interpretation)</strong></li>
  <li><strong>得出结论 (Drawing Conclusions)</strong></li>
  <li><strong>迭代与优化 (Iteration and Refinement)</strong></li>
</ol>

<p><strong>Figure 1</strong> 展示了这六个阶段以及对应的 LLM 应用和研究主题 。</p>

<p><strong>4. 核心贡献：三级自主性分类体系</strong></p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/tab1.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者通过对这六个阶段中 LLM 应用的考察，揭示了一个显著趋势：LLM 正从在单一阶段执行离散的任务导向型功能，发展为部署在复杂的多阶段智能体工作流中 。</p>

<p>为了有效地捕捉和通过层级划分这种不断增长的能力和独立性，作者提出了一个用于科学发现中 LLM 参与度的基础<strong>三级分类体系（Three-level Taxonomy）</strong>（如 <strong>Table 1</strong> 所示）：</p>

<ul>
  <li><strong>Level 1: LLM as Tool（LLM 作为工具）</strong>： 在此层级，模型作为工具增强人类研究人员的能力，在直接监督下执行特定的、定义明确的任务 。</li>
  <li><strong>Level 2: LLM as Analyst（LLM 作为分析师）</strong>： 在此层级，模型展现出更高的自主性，能够处理复杂信息、进行分析并提供见解，且减少了人类干预 。</li>
  <li><strong>Level 3: LLM as Scientist（LLM 作为科学家）</strong>： 代表了一个更高级的阶段，基于 LLM 的系统可以自主地进行主要的研究阶段，从提出假设到解释结果，并建议新的探索途径 。</li>
</ul>

<p><strong>Table 1</strong> 详细对比了这三个自主性等级在角色、人类干预程度、任务范围和工作流类型上的区别 。</p>

<p><strong>5. 关键挑战与未来轨迹</strong></p>

<p>基于这一分类框架，作者进一步识别了当前研究景观中的关键差距，并强调了该领域的关键挑战和未来轨迹 ：</p>

<ol>
  <li><strong>全自主发现循环（Fully autonomous discovery cycles）</strong>：无需人类干预即可进行演进式的科学探究。</li>
  <li><strong>机器人自动化（Robotic automation）</strong>：在物理世界中进行实验室实验的交互。</li>
  <li><strong>持续自我改进（Continuous self-improvement）</strong>：从过往的研究经验中学习和适应。</li>
  <li><strong>透明度与可解释性（Transparency and interpretability）</strong>：针对 LLM 进行的研究过程。</li>
  <li><strong>伦理治理与社会对齐（Ethical governance and societal alignment）</strong>。</li>
</ol>

<p><strong>6. 论文范围界定</strong></p>

<p>作者明确指出，本综述聚焦于科学发现中基于 LLM 的系统，特别是它们不同程度的自主性 。为了保持聚焦，作者有意缩小了范围，<strong>排除了</strong>关于通用科学 LLM（general-purpose scientific LLMs）或用于特定领域科学知识获取与推理的 LLM 的研究，因为这些内容在现有的综述中已有很好的覆盖。</p>

<h3 id="2-three-levels-of-autonomy">2 Three Levels of Autonomy</h3>

<p>这一部分的核心在于详细讨论基于 LLM 的科学发现中的三个自主性层级。<strong>Table 1</strong>  展示了这三个层级及其相关特征（如 LLM 的角色、人类的角色、任务范围和智能体工作流的复杂性）。</p>

<p><strong>Level 1: LLM as Tool（LLM 作为工具）</strong></p>

<p>这是 LLM 在科学发现中最基础的应用层级 。</p>

<ul>
  <li><strong>角色与功能</strong>：在此阶段，LLM 主要作为在人类直接监督下的<strong>定制工具（tailored tools）</strong>运行 。它们被设计用于执行科学方法中单一阶段内的、具体的、定义明确的任务 。</li>
  <li><strong>增强人类能力</strong>：其作用是通过自动化或加速离散的活动来增强人类能力 。典型的任务包括文献总结、起草手稿初稿、生成用于数据处理的代码片段或重新格式化数据集 。</li>
  <li><strong>自主性限制</strong>：此层级的自主性有限；它们基于明确的人类提示（prompts）和指令运行 。其输出通常需要人类进行验证并整合到更广泛的研究工作流中 。</li>
  <li><strong>目标</strong>：主要目标是提高研究人员的效率并减轻常规任务的负担 。</li>
</ul>

<p><strong>Level 2: LLM as Analyst（LLM 作为分析师）</strong></p>

<p>在 Level 2 中，LLM 展现出更高程度的自主性，超越了纯粹静态的任务导向型应用 。</p>

<ul>
  <li><strong>角色与功能</strong>：此时，LLM 作为<strong>被动智能体（passive agents）</strong>发挥作用 。它们能够进行更复杂的信息处理、数据建模和分析推理，且在中间步骤中减少了人类干预 。</li>
  <li><strong>任务管理</strong>：虽然仍主要在人类研究人员设定的边界内运行，但这些系统可以独立管理任务序列 。例如，分析实验数据集以识别趋势、解释复杂模拟的输出，甚至执行模型的迭代优化 。</li>
  <li><strong>人类交互</strong>：人类研究人员通常负责定义整体分析目标、提供必要的数据，并批判性地评估 LLM 生成的见解或解释 。</li>
</ul>

<p><strong>Level 3: LLM as Scientist（LLM 作为科学家）</strong></p>

<p>Level 3 的应用标志着自主性的重大飞跃 。</p>

<ul>
  <li><strong>角色与功能</strong>：基于 LLM 的系统作为<strong>主动智能体（active agents）</strong>运行，能够编排并引导科学发现过程中的多个阶段，具有相当大的独立性 。</li>
  <li><strong>主动性与全流程</strong>：这些系统能够展现出主动性，包括提出假设、规划和执行实验、分析结果数据、得出初步结论，并潜在地提出后续的研究问题或探索途径 。</li>
  <li><strong>极少的人类干预</strong>：处于此层级的 LLM 系统可以驱动研究周期的主要部分，在极少人类干预的情况下进行科学发现 。</li>
</ul>

<p><strong>研究全景图 (Figure 2)</strong></p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者在 <strong>Figure 2</strong>  中展示了完整的分类体系和详细的归类，该图汇总了这三个自主性层级内的具体研究工作，涵盖了从文献回顾、假设生成到实验规划等各个科学发现阶段。</p>

<h3 id="3-level-1-llm-as-tool-table-a1">3 Level 1. LLM as Tool (Table A1)</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/taba1.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者在 <strong>Table A1</strong>（位于原文第 17 页）中对这些 Level 1 的研究工作进行了详细的比较和分类 。</p>

<h4 id="31-文献回顾与信息收集-literature-review-and-information-gathering">3.1 文献回顾与信息收集 (Literature Review and Information Gathering)</h4>

<ul>
  <li><strong>文献综述 (Literature Review)</strong>：
    <ul>
      <li>自动化的文献搜索和检索对于识别研究空白至关重要。<strong>PaperQA</strong> (基于 LitQA 基准测试) 引入了基于 RAG（检索增强生成）的智能体 。</li>
      <li><strong>LitLLM</strong> 提供了用于 LLM 驱动的文献综述的综合 RAG 工具包 。</li>
      <li>Wang 等人 (2024c) 进一步展示了 LLM 可以自动撰写整个<strong>综述论文 (Survey papers)</strong> 。</li>
      <li>在生物医学领域，Dennstädt 等人 (2024) 强调了 LLM 在文献筛选中的潜力 。</li>
      <li>近期的“深度研究”产品（如 OpenAI, Google, xAI 的产品）通过增强的智能体工作流，显著加速了传统的文献研究过程 。</li>
    </ul>
  </li>
  <li><strong>信息聚合 (Information Aggregation)</strong>：
    <ul>
      <li>研究聚焦于将论文信息聚合并转化为表格摘要。<strong>ArxivDIGESTables</strong> 探索了跨文献的表格生成 。</li>
      <li><strong>ArXiv2Table</strong> 提供了综合基准测试 。</li>
      <li><strong>Text-Tuple-Table</strong> 和 <strong>TKGT</strong> 等方法通过引入基于元组的结构和图模态，提高了表格生成的质量 。</li>
    </ul>
  </li>
</ul>

<h4 id="32-想法生成与假设构建-idea-generation-and-hypothesis-formulation">3.2 想法生成与假设构建 (Idea Generation and Hypothesis Formulation)</h4>

<ul>
  <li><strong>想法生成 (Idea Generation)</strong>：
    <ul>
      <li><strong>IdeaBench</strong> 和 <strong>LiveIdeaBench</strong> 等基准测试评估了 LLM 基于文献摘要生成研究想法的能力 。</li>
      <li><strong>Nova</strong>、<strong>SciAgents</strong> 和 <strong>KG-Col</strong> 等智能体框架旨在通过在学术知识图谱上的推理、迭代规划来增强想法生成 。</li>
      <li>在特定领域，例如天文学（对抗性提示）和生物学（知识提取与图表示），也进行了针对性的探索 。</li>
    </ul>
  </li>
  <li><strong>假设构建 (Hypothesis Formulation)</strong>：
    <ul>
      <li>重点在于设计可测试的科学假设。Qi 等人 (2023) 和 Yang 等人 (2024) 证明了 LLM 在开放式约束下提出新颖且有效假设的能力 。</li>
      <li><strong>Scideator</strong> 旨在促进人类与 LLM 协作以生成有依据的想法 。</li>
      <li><strong>HypER</strong> 专注于生成有明确出处（provenance）、基于文献的假设 。</li>
      <li>在化学领域，<strong>MOOSE-Chem</strong> 提供了专门用于假设发现的评估基准和框架 。</li>
    </ul>
  </li>
</ul>

<h4 id="33-实验规划与执行-experiment-planning-and-execution">3.3 实验规划与执行 (Experiment Planning and Execution)</h4>

<ul>
  <li><strong>规划 (Planning)</strong>：
    <ul>
      <li>Li 等人 (2025) 讨论了 LLM 在因果发现实验设计中的有效性 。</li>
      <li><strong>BioPlanner</strong> 引入了一个自动化评估框架，用于评估 LLM 在生物学协议规划（protocol planning）中的表现 。</li>
      <li>Shi 等人 (2025) 提出了分层封装表示法以辅助生物协议设计 。</li>
    </ul>
  </li>
  <li><strong>执行 (Execution)</strong>：
    <ul>
      <li>主要集中在<strong>代码生成</strong>，特别是针对 AI 研究。</li>
      <li>早期基准测试如 <strong>ARCADE</strong> 和 <strong>DS-1000</strong> 关注数据科学任务 。</li>
      <li>后续工作如 <strong>MLE-Bench</strong> 和 <strong>SciCode</strong> 引入了更具挑战性的现实场景（如机器学习工程和自然科学研究）。</li>
      <li><strong>AIDE</strong> 提出采用树搜索（tree-search）方法进行代码优化，以增强复杂代码生成能力 。</li>
    </ul>
  </li>
</ul>

<h4 id="34-数据分析与组织-data-analysis-and-organization">3.4 数据分析与组织 (Data Analysis and Organization)</h4>

<p>在此阶段，LLM 协助自动化数据组织、展示和分析。</p>

<ul>
  <li><strong>表格数据 (Tabular Data)</strong>：
    <ul>
      <li><strong>Chain-of-Table</strong> 提出将演变的表格纳入推理链，以增强表格理解 。</li>
      <li><strong>TableBench</strong> 引入了工业场景下基于表格的问答基准测试 。</li>
    </ul>
  </li>
  <li><strong>图表数据 (Chart Data)</strong>：
    <ul>
      <li><strong>ChartQA</strong> 考察了视觉 Transformer 在图表问答中的能力 。</li>
      <li><strong>CharXiv</strong> 和 <strong>ChartX</strong> 利用 arXiv 预印本中的真实图表数据扩展了理解场景 。</li>
      <li>在图表生成方面，<strong>AutomaTikZ</strong> 将过程公式化为从文本生成 TikZ 代码 。<strong>Text2Chart31</strong> 利用强化学习和自动反馈来优化 Matplotlib 图表的生成 。</li>
    </ul>
  </li>
</ul>

<h4 id="35-结论与假设验证-conclusion-and-hypothesis-validation">3.5 结论与假设验证 (Conclusion and Hypothesis Validation)</h4>

<p>LLM 可用于提供反馈、验证实验得出的主张和结论。</p>

<ul>
  <li><strong>论文评审 (Paper Review)</strong>：
    <ul>
      <li><strong>ReviewerGPT</strong> 初步探索了 LLM 识别论文中故意插入错误的能力 。</li>
      <li>Du 等人 (2024) 的综合分析揭示了 LLM 在识别缺陷方面的弱点 。</li>
      <li><strong>ClaimCheck</strong> 进一步调查了 LLM 批判研究主张的能力，发现这即便对高级模型（如 OpenAI o1）也是挑战 。</li>
      <li><strong>XtraGPT</strong> 等系统实现了人机协作进行可控的论文修改 。</li>
    </ul>
  </li>
  <li><strong>假设验证 (Hypothesis Validation)</strong>：
    <ul>
      <li>Takagi 等人 (2023) 展示了 LLM 自动生成代码以验证机器学习假设的能力 。</li>
      <li><strong>SciReplicate-Bench</strong> 和 <strong>PaperBench</strong> 将这一概念扩展到了对真实研究论文的复现评估 。</li>
      <li>还有研究探索利用语言模型直接预测实证 AI 研究的结果 。</li>
    </ul>
  </li>
</ul>

<h4 id="36-迭代与优化-iteration-and-refinement">3.6 迭代与优化 (Iteration and Refinement)</h4>

<p>这一领域目前的关注相对较少 。</p>

<ul>
  <li><strong>Explanation-Refiner</strong> 利用定理证明器来验证并改进 LLM 生成的假设 。</li>
  <li><strong>Chain-of-Idea</strong> 引入了一个基于 LLM 的智能体框架，通过在现有研究线索上构建或扩展来组织文献并发展研究想法 。</li>
  <li><strong>MC-NEST</strong> 采用蒙特卡洛树搜索（Monte-Carlo Tree Search）来迭代地验证和优化跨多个研究领域的科学假设 。</li>
</ul>

<h3 id="4-level-2-llm-as-analyst-table-a2">4 Level 2: LLM as Analyst (Table A2)</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/taba2.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者在 <strong>Table A2</strong>（位于原文第 18 页）中对这些 Level 2 的研究工作进行了详细的比较和分类 。</p>

<h4 id="41-机器学习研究-machine-learning-research">4.1 机器学习研究 (Machine Learning Research)</h4>

<p>自动化机器学习（AutoML）致力于以数据驱动的方式生成高性能的模型配置 。随着基于 LLM 的智能体的出现，多项研究探索了其在 ML 任务自动化建模中的应用：</p>

<ul>
  <li><strong>基准测试 (Benchmarks)</strong>：
    <ul>
      <li><strong>MLAgentBench</strong> 评估了 LLM 设计和执行 ML 实验的能力，发现其表现通常取决于对任务的熟悉程度 。</li>
      <li><strong>MLRC-Bench</strong> 和 <strong>RE-Bench</strong> 进一步探索了智能体的极限，评估其解决新颖 ML 研究挑战的能力，并将研发能力与人类专家进行对比 。</li>
      <li><strong>MLGym</strong> 为推进这些 AI 研究智能体提供了宝贵的资源和基准 。</li>
    </ul>
  </li>
  <li><strong>智能体框架 (Agentic Frameworks)</strong>：
    <ul>
      <li><strong>IMPROVE</strong> 框架强调了迭代优化机制的重要性 。</li>
      <li><strong>CodeScientist</strong> 将 ML 建模智能体与机器生成的想法相结合 。</li>
      <li><strong>BudgetMLAgent</strong> 利用精心策划的专家协作框架，以低成本模型实现了卓越的结果 。</li>
    </ul>
  </li>
  <li><strong>端到端系统与架构设计</strong>：
    <ul>
      <li>更近期的系统如 <strong>MLR-Copilot</strong> 和多智能体框架 <strong>MLZero</strong> 旨在实现全自主的机器学习研究和自动化 。</li>
      <li>一些工作甚至探索了使用语言模型直接提出语言模型（LM）架构（如 <strong>Genesys</strong> / Cheng et al.），超越了单纯的编排，转向直接的模型创造 。</li>
    </ul>
  </li>
</ul>

<h4 id="42-数据建模与分析-data-modeling-and-analysis">4.2 数据建模与分析 (Data Modeling and Analysis)</h4>

<p>自动化的数据驱动分析（包括统计数据建模和假设验证）是 LLM 辅助科学发现的一个基础应用领域 。</p>

<ul>
  <li><strong>基准测试</strong>：
    <ul>
      <li><strong>InfiAgent-DABench</strong> 对 LLM 在使用 CSV 文件进行数据分析时的静态代码生成和执行能力进行了基准测试 。</li>
      <li>后续的基准测试，如 <strong>BLADE</strong>、<strong>DiscoveryBench</strong> 和 <strong>DSBench</strong>，通过纳入现实世界的研究论文和专家策划的分析，提高了评估的鲁棒性，以评估智能体与人类专家表现之间的差距 。</li>
      <li>这些研究表明，大多数 LLM 即使在智能体框架内运行，在处理复杂数据分析任务时仍面临困难 。</li>
    </ul>
  </li>
  <li><strong>解决方案</strong>：
    <ul>
      <li><strong>DS-Agent</strong> 提出通过结合基于案例的推理方法（case-based reasoning）来改进领域知识获取，从而提升 LLM 的性能 。</li>
      <li><strong>DAgent</strong> 将应用领域扩展到查询关系数据库，并支持使用分解子问题得出的结果生成报告 。</li>
    </ul>
  </li>
</ul>

<h4 id="43-函数发现-function-discovery">4.3 函数发现 (Function Discovery)</h4>

<p>函数发现旨在从变量的观测数据中识别潜在方程，AI 驱动的符号回归（SR）的进步对此产生了显著影响 。</p>

<ul>
  <li><strong>方法论</strong>：
    <ul>
      <li><strong>LLM-SR</strong> 利用 LLM 的先验领域知识，并结合来自聚类记忆存储的反馈来增强这一过程 。</li>
      <li><strong>DrSR</strong> 提出了一种双重推理框架（dual reasoning framework），利用数据和经验进行科学方程发现 。</li>
    </ul>
  </li>
  <li><strong>基准测试</strong>：
    <ul>
      <li><strong>LLM-SRBench</strong> 引入了一个评估 LLM 作为函数发现智能体的基准，其中包含函数变换以减轻数据污染问题 。</li>
    </ul>
  </li>
  <li><strong>特定领域应用</strong>：
    <ul>
      <li>研究还探索了 LLM 在特定领域发现复杂模型的能力，例如物理学（<strong>Gravity-Bench-v1</strong> / Koblischke et al.）、统计学（Li et al.）以及自动化神经缩放定律发现（<strong>EvoSLD</strong> / Lin et al.） 。</li>
    </ul>
  </li>
</ul>

<h4 id="44-自然科学研究-natural-science-research">4.4 自然科学研究 (Natural Science Research)</h4>

<p>研究主要集中在将 LLM 应用于自然科学发现的自主研究工作流中 。</p>

<ul>
  <li><strong>综合评估</strong>：
    <ul>
      <li><strong>Auto-Bench</strong> 基于因果图发现评估了 LLM 在化学和社会科学任务上的表现，揭示了 LLM 仅在任务复杂度非常有限时才有效 。</li>
      <li><strong>ScienceAgentBench</strong> 为在智能体框架（如 CodeAct 和 self-debug）内运行的 LLM 提供了多学科基准测试，强调了此类探索性任务需要量身定制的智能体工作流 。</li>
    </ul>
  </li>
  <li><strong>生物医学与化学</strong>：
    <ul>
      <li><strong>BioResearcher</strong> 提出了一个涉及干湿实验（dry lab experiments）的生物医学研究端到端框架 。</li>
      <li><strong>DrugAgent</strong> 采用多智能体协作来自动化药物发现 。</li>
      <li>在化学领域，<strong>Coscientist</strong> 结合 LLM 的工具使用，支持半自主的化学实验设计和执行 。</li>
      <li><strong>ProtAgents</strong> 通过构建用于自动化蛋白质设计的多智能体框架，促进了生物化学发现 。</li>
    </ul>
  </li>
  <li><strong>前沿进展</strong>：
    <ul>
      <li>近期的工作如 <strong>FutureHouse</strong> 和 <strong>AI Co-scientist</strong>，致力于使用由预定义研究目标指导的多智能体系统，以此制定经证实新颖的研究假设和提案 。</li>
    </ul>
  </li>
</ul>

<h4 id="45-通用研究-general-research">4.5 通用研究 (General Research)</h4>

<p>除了特定领域的应用，一些基准测试广泛评估了科学发现不同阶段的多样化任务 。</p>

<ul>
  <li><strong>Discovery World</strong> 创建了一个虚拟环境，供 LLM 智能体进行简化的科学探索 。</li>
  <li>Liu 等人 (2025a) 全面讨论了 AI 智能体在研究中的各种应用场景，并提供了初步评估数据集 。</li>
  <li><strong>CURIE</strong> 提出了一个用于严格和自动化科学实验的基准和智能体框架 。</li>
  <li><strong>EAIRA</strong> 专注于评估 LLM 使用各种任务格式扮演现实世界研究助手角色的能力 。</li>
</ul>

<h3 id="5-level-3-llm-as-scientist-table-a3">5 Level 3. LLM as Scientist (Table A3)</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/Awesome-LLM-Scientific-Discovery/taba3.png" alt="avatar" style="zoom:100%;" /></div>

<p>作者在 <strong>Table A3</strong>（位于原文第 18 页）中对这些 Level 3 的研究工作进行了详细的比较和分类。</p>

<p><strong>概览</strong></p>

<p>近期，若干研究工作和商业产品展示了在人工智能领域内进行<strong>全自主研究（fully autonomous research）</strong>的原型 。</p>

<ul>
  <li><strong>全流程覆盖</strong>：这些系统通常包含一个全面的工作流，从最初的文献综述到迭代的优化循环，逐步改进假设或设计，直至最终产出研究论文草稿 。</li>
  <li><strong>智能体框架</strong>：一个共同特征是使用基于智能体（agent-based）的框架来自主生产研究成果。</li>
</ul>

<p>本部分重点比较了这些方法在<strong>想法发展（Idea Development）</strong>和<strong>迭代优化（Iterative Refinement）</strong>方面的策略，因为这两个方面是将它们与 Level 2 智能体区分开来的关键。</p>

<h4 id="51-想法发展-idea-development">5.1 想法发展 (Idea Development)</h4>

<p>Level 3 系统中研究的起源涉及将初始概念转化为经过验证的假设，不同系统在获取和审查这些想法的方式上存在显著差异 。</p>

<ul>
  <li><strong>基于人类目标的文献综述</strong>：
    <ul>
      <li><strong>Agent Laboratory</strong> (Schmidgall et al., 2025) 主要基于人类定义的具体研究目标来进行文献综述 。</li>
    </ul>
  </li>
  <li><strong>更高的自主性与差距识别</strong>：
    <ul>
      <li>一些系统正朝着更高的自主性发展，从更宽泛的人类输入开始。例如 <strong>AI-Researcher</strong> (Data Intelligence Lab, 2025) 和 <strong>Carl</strong> (Autoscience, 2025) 从参考论文出发，或者 <strong>Zochi</strong> (IntologyAI, 2025) 从一般研究领域出发，随后的过程是自主探索文献以识别研究空白并构建新颖假设 。</li>
    </ul>
  </li>
  <li><strong>生成式方法</strong>：
    <ul>
      <li><strong>The AI Scientist</strong> (v1 和 v2 ) 展示了一种更具生成式的方法：v1 从模板和过往工作中头脑风暴想法，而 v2 能够从抽象的主题提示中生成多样化的研究提案</li>
    </ul>
  </li>
  <li><strong>想法验证</strong>：
    <ul>
      <li>至关重要的是，这些系统在全面实施之前采用了多种方法来评估其想法。</li>
      <li><strong>AI Scientis-v1</strong> 使用自我评估分数（有趣性、新颖性、可行性），并辅以 Semantic Scholar 的外部检查 。</li>
      <li><strong>AI Scientist-v2</strong> 在想法构建阶段的早期就集成了文献综述工具以评估新颖性 。</li>
    </ul>
  </li>
</ul>

<p><strong>趋势</strong>：虽然通常仍由人类发起想法，但先进系统能够自主探索、生成并在开发前验证研究目标的科学价值和原创性 。</p>

<h4 id="52-迭代与优化-iterative-refinement">5.2 迭代与优化 (Iterative Refinement)</h4>

<p>Level 3 系统中的迭代优化涉及复杂的<strong>反馈循环（feedback loops）</strong>，这不仅能实现增量改进，还能对研究轨迹进行根本性的重新评估 。关键的区别在于这种高层反馈的主要来源和性质。</p>

<ul>
  <li><strong>全自动内部评审</strong>：
    <ul>
      <li><strong>The AI Scientist</strong> (v1 和 v2) 整合了高度自动化的内部评审和优化流程。它利用 AI 审稿人、针对实验选择的 LLM 评估器以及用于批评图表的视觉语言模型（VLMs），构建了一个丰富的内部反馈循环以进行迭代开发 。</li>
    </ul>
  </li>
  <li><strong>人机协同的宏观指导</strong>：
    <ul>
      <li>相比之下，<strong>Zochi</strong> (Intology AI, 2025) 集成了人类专家的宏观指导。这种反馈可以触发对假设或设计的全面重新评估 。这使得系统能够针对挑战核心研究前提的批评采取行动，如果结果不令人满意，甚至可以退回到假设生成阶段 。</li>
    </ul>
  </li>
</ul>

<p><strong>总结</strong>：虽然自动自我纠正是一个共同目标，但目前的格局显示了一种务实的融合：一些系统专注于增强<strong>自主的深度反思（autonomous deep reflection）</strong>，而另一些系统则整合<strong>人类监督（human oversight）</strong>以实现稳健的高层迭代优化和战略重定向 。</p>

<h4 id="table-a3-level-3-研究工作对比-table-a3"><strong>Table A3: Level 3 研究工作对比 (Table A3)</strong></h4>

<p><strong>Table A3</strong> 详细列出并对比了主要的 Level 3 研究工作，包括：</p>

<ul>
  <li><strong>Agent Laboratory</strong></li>
  <li><strong>The AI Scientist (v1 &amp; v2)</strong></li>
  <li><strong>AI-Researcher</strong></li>
  <li><strong>Zochi</strong></li>
  <li><strong>Carl (Autoscience)</strong></li>
</ul>

<p>表格从以下维度进行了分类：</p>

<ul>
  <li><strong>科学领域</strong>：目前主要集中在<strong>人工智能（Artificial Intelligence）</strong>领域。</li>
  <li><strong>特色功能</strong>：例如文献综述、代码生成、实验执行、研究论文写作、带有反馈的智能体树搜索（agentic tree-search）等。</li>
  <li><strong>开源情况</strong>：部分项目如 The AI Scientist 和 AI-Researcher 是开源的，而 Zochi 和 Carl 目前并未标记为开源。</li>
</ul>

<h3 id="6-challenges-and-future-directions">6 Challenges and Future Directions</h3>

<p>在系统性地回顾了 LLM 从基础助手（Level 1）进化为自主研究者（Level 3）的历程后，作者在这一章节超越了对现有技术的总结，指出了阻碍进一步发展的<strong>五大关键挑战</strong>，并描绘了未来的研究蓝图。</p>

<p><strong>1. 全自主研究循环 (Fully-Autonomous Research Cycle)</strong></p>

<ul>
  <li><strong>当前局限</strong>：目前的 Level 3 系统（LLM as Scientist）虽然能够针对特定的询问导航科学方法的多个阶段，但它们通常在一个单一的研究实例或预定义的主题内运作 。</li>
  <li><strong>科学的本质</strong>：科学方法本质上是<strong>循环的（cyclical）</strong>，其特征在于持续的迭代、改进以及对不断演变的研究问题的追求 。</li>
  <li><strong>未来方向</strong>：未来的发展方向是开发能够参与<strong>真正自主研究循环</strong>的 LLM 系统。
    <ul>
      <li>这不仅意味着从头到尾执行一个给定的研究任务；</li>
      <li>更意味着系统需要具备<strong>远见（foresight）</strong>，能够洞察其发现的广泛影响，主动识别有前景的后续调查途径，并战略性地指导其努力方向，以在通过前人工作的基础上实现实际的进步 。</li>
    </ul>
  </li>
</ul>

<p><strong>2. 机器人自动化 (Robotic Automation)</strong></p>

<ul>
  <li><strong>物理障碍</strong>：实现自然科学领域全自主科学发现的一个关键障碍是 LLM 智能体无法进行<strong>物理实验室实验</strong>。它们虽然擅长计算研究，但在需要物理交互的领域（如湿实验）应用受限 。</li>
  <li><strong>解决方案</strong>：将 LLM 与<strong>机器人系统（robotic systems）</strong>集成，使其能够将规划能力转化为直接的实验行动 。</li>
  <li><strong>潜力领域</strong>：早期的 LLM 与机器人集成工作（如化学实验）已经突显了这一潜力。这种自动化有望显著拓宽基于 LLM 的研究范围，在<strong>化学</strong>和<strong>材料科学</strong>等学科中实现端到端的发现 。</li>
</ul>

<p><strong>3. 透明度与可解释性 (Transparency and Interpretability)</strong></p>

<ul>
  <li><strong>黑盒问题</strong>：LLM 的“黑盒”性质（或不透明性）破坏了科学验证、信任以及对 AI 驱动的见解的吸收 。</li>
  <li><strong>超越 XAI</strong>：解决这一问题需要的不仅仅是肤浅的可解释 AI（Explainable AI, XAI）技术。它需要一种范式转变，即系统的内部操作在设计上本质上就是为了进行<strong>可验证的推理（verifiable reasoning）</strong>和<strong>可辩护的结论（justifiable conclusions）</strong> 。</li>
  <li><strong>核心挑战</strong>：挑战不仅在于解释输出，更在于确保 AI 的内部逻辑符合科学原则，并能可靠地<strong>区分“断言的主张（asserted claims）”与“可验证的真理（verifiable truths）”</strong>。这种深刻的可解释性对于可靠和可复现的 LLM 科学发现至关重要 。</li>
</ul>

<p><strong>4. 持续自我改进 (Continuous Self-Improvement)</strong></p>

<ul>
  <li><strong>适应性需求</strong>：科学探究的迭代和演变性质要求系统能够从持续的参与中学习，吸收实验结果，并调整研究策略 。</li>
  <li><strong>技术路径</strong>：目前结合持续学习（continual learning）与智能体系统的研究已经显示了适应新任务而不发生“灾难性遗忘”的潜力。</li>
  <li><strong>未来展望</strong>：一个有前景的方向是整合<strong>在线强化学习框架（online reinforcement learning frameworks）</strong>。这将使科学智能体能够在整个生命周期中通过连续的发现不断增强自身能力，从而推动可持续的自主探索 。</li>
</ul>

<p><strong>5. 伦理与社会对齐 (Ethics and Societal Alignment)</strong></p>

<ul>
  <li><strong>风险升级</strong>：随着 LLM 系统获得独立的推理和行动能力，潜在的风险——从放大的社会偏见到蓄意的滥用（如生成有害物质或挑战人类控制）——变得日益显著和复杂 。</li>
  <li><strong>持续对齐</strong>：由于 AI 能力和社会规范处于不断变化之中，<strong>对齐（Alignment）</strong>必须是一个持续的过程，需要适应性的治理和不断演变的价值体系 。</li>
  <li><strong>治理要求</strong>：这要求将伦理约束直接嵌入到科学 AI 的设计框架中，并配合警惕的监督，以确保技术进步服务于人类福祉和公共利益 。</li>
</ul>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="CL" /><category term="Agent" /><category term="NLP" /><category term="LLM" /><summary type="html"><![CDATA[论文地址：From Automation to Autonomy：A Survey on Large Language Models in Scientific Discovery 论文实现：https://github.com/HKUST-KnowComp/Awesome-LLM-Scientific-Discovery]]></summary></entry><entry xml:lang="en"><title type="html">Nature Biotechnology-2025 Democratizing protein language model training, sharing and collaboration</title><link href="https://tyang816.github.io/bi/Democratizing-protein-language-model-training,-sharing-and-collaboration/" rel="alternate" type="text/html" title="Nature Biotechnology-2025 Democratizing protein language model training, sharing and collaboration" /><published>2025-10-24T00:00:00+08:00</published><updated>2025-10-24T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/Democratizing%20protein%20language%20model%20training,%20sharing%20and%20collaboration</id><content type="html" xml:base="https://tyang816.github.io/bi/Democratizing-protein-language-model-training,-sharing-and-collaboration/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://www.nature.com/articles/s41587-025-02859-7">Democratizing protein language model training, sharing and collaboration</a></p>

  <p>论文实现：<a href="https://github.com/westlake-repl/SaProtHub">https://github.com/westlake-repl/SaProtHub</a></p>
</blockquote>

<h2 id="saprothub训练微调共享saprot平台">SaProtHub：训练微调共享saprot平台</h2>

<h3 id="abstract">Abstract</h3>

<p>训练和部署大规模蛋白质语言模型（PLM）通常需要深厚的机器学习专业知识——这对该领域之外的研究人员来说是一个障碍 。SaprotHub 通过提供一个直观的平台克服了这一挑战，该平台促进了模型的训练和预测，以及存储和共享 。提供了基于 Google Colab 构建的 <strong>ColabSaprot 框架</strong>，它有潜力为数百个蛋白质训练和预测应用提供动力，使研究人员能够协作构建和共享定制模型 。</p>

<h3 id="1-main">1 Main</h3>

<h5 id="引言与背景">引言与背景</h5>

<p>蛋白质几乎是所有生物过程的基础，并且是医学和生物技术的核心。尽管具有这种中心地位，破译蛋白质结构和功能仍然是一个艰巨的挑战。这一格局最近被两项突破所改变：<strong>AlphaFold2</strong> 的成功通过以实验级准确性预测结构，开创了结构生物学的新纪元；与此同时，<strong>大规模蛋白质语言模型 (PLM)</strong> 正在推动功能预测领域前所未有的进步。</p>

<p>这一进展是由一套强大的 PLM 推动的，它们在各种任务中都表现出了卓越的功效。然而，对于没有广泛机器学习 (ML) 专业知识的研究人员来说，利用这些先进模型存在显著的技术障碍。这些挑战贯穿整个工作流程，从模型选择、数据预处理，到训练和评估拥有数十亿参数的模型。这种复杂性创造了一个关键障碍，阻碍了那些最能从中受益的研究人员的广泛采用和创新。</p>

<p><strong>ColabFold</strong> 通过在 Google Colab 上部署 AlphaFold2，解决了结构预测方面类似的“可及性”障碍，有效地普及了其使用。尽管取得了这一成功，一个关键的空白仍然存在：ColabFold <strong>不支持</strong>更复杂的、用于<strong>功能预测的自定义模型训练</strong>任务。</p>

<h5 id="解决方案colabsaprot-saprothub-与-opmc">解决方案：ColabSaprot, SaprotHub 与 OPMC</h5>

<p>为了弥合这一差距，作者引入了 <strong>ColabSaprot 和 SaprotHub</strong>，这是一个专为蛋白质功能预测设计的平台。ColabSaprot 建立在 Google Colab 之上，使没有 ML 专业知识的研究人员能够通过直观的界面训练他们自己特定任务的 PLM。至关重要的是，该平台支持广泛的预测任务，确保其效用远远超出了单任务应用。</p>

<p>作为这个用户友好平台的补充，介绍了<strong>开放蛋白质建模联盟 (OPMC)</strong>，这是一项旨在培养社区驱动的蛋白质语言建模协作生态系统的倡议。OPMC 框架使研究人员能够分享他们定制的模型，微调同行贡献的现有模型，或将它们直接应用于自己的研究。这创造了一个<strong>共享、优化和应用的良性循环</strong>，加速了该领域的集体进步。作为第一个与 OPMC 集成的平台，SaprotHub 代表了实现这一以社区为中心的人工智能 (AI) 发展愿景的第一步。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SaProtHub/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<h5 id="三项核心贡献">三项核心贡献</h5>

<p>这项工作包含三个关键贡献：</p>

<ol>
  <li>一个名为 <strong>Saprot</strong> 的基础 PLM (图 1a, b)。</li>
  <li><strong>ColabSaprot</strong> (图 2a–c)，它通过<strong>适配器学习技术 (adapter learning technique)</strong>，使得在 Colab 平台上能够轻松地训练（或微调）和推理 Saprot。</li>
  <li><strong>SaprotHub</strong>，一个用于存储、共享、搜索和协作开发微调后 Saprot 模型的社区存储库 (图 2d)。</li>
</ol>

<p>通过整合先进的 PLM、基于 Colab 的云计算和基于适配器的微调技术，它解决了几个关键挑战——即共享和集体使用大型 PLM 的困难、持续学习中参数<strong>“灾难性遗忘” (catastrophic forgetting)</strong> 的风险，以及在共享结果时保护专有生物数据的需求。</p>

<h5 id="1-saprot结构感知的基础模型">1. Saprot：结构感知的基础模型</h5>

<p>首先开发了 <strong>Saprot</strong>，一个前沿的大规模 PLM，它构成了 ColabSaprot 和 SaprotHub 的基础。Saprot 引入了一种新颖的蛋白质字母表和表示方法，不同于传统的氨基酸 (AA) 序列或显式的三维 (3D) 坐标结构。</p>

<p>这个字母表是<strong>结构感知 (Structure-Aware, SA) 的</strong>，每个“字母”都同时编码 AA 类型和蛋白质的局部几何结构。形式上，SA 字母表 (SAA) 被定义为 <code class="language-plaintext highlighter-rouge">$SAA = \mathcal{V} \times \mathcal{F}$</code>，代表 $\mathcal{V}$ (20 种 AA) 和 $\mathcal{F}$ (20 种结构 (3Di) 字母) 的笛卡尔积 (图 1a)。这些 3Di 令牌是通过 <strong>Foldseek 离散化</strong>从蛋白质 3D 结构中派生出来的。SAA 包含了 AA（大写字母）和 3Di 令牌（小写字母）的所有可能组合 (例如 Aa, Ap, Ac, …, Ya, Yp, Yy)，允许蛋白质被表示为捕获一级和三级结构的 SA 令牌序列 (图 1b 和方法)。</p>

<p>尽管 SAA 很简洁，但它成功解决了在大型 AlphaFold2 生成的原子结构上训练时的可扩展性和过拟合等关键挑战。“AA + 结构令牌”序列 (图 1b) 用于蛋白质表示的方法已在后续研究中获得越来越多的关注，成为蛋白质表示的一个有前途的范式。</p>

<p>Saprot 模型使用双向 Transformer 架构 (图 1b)。它经过预训练，用于重建 SA 令牌序列中某些被部分掩码的令牌。该模型在 <strong>4000 万个蛋白质 SA 序列</strong>上从头开始训练，这些序列是从 AlphaFold 的 2.14 亿个蛋白质中以 50% 的一致性过滤出来的。Saprot 提供三种大小：<strong>35M、650M 和 1.3B</strong>（M，百万；B，十亿）。650M 模型（用于大多数评估）使用了 64 个 NVIDIA A100 80-GB GPU 训练了 3 个月，其计算资源与 ESM-2 (650M) 相当。</p>

<p>预训练后，Saprot 已成为一个通用的基础 PLM，在各种蛋白质预测任务中表现出色，例如各种监督训练任务（蛋白质级别或残基级别的回归与分类）、<strong>零样本 (zero-shot) 突变效应预测</strong>和<strong>蛋白质序列设计</strong> (图 1c, d)。</p>

<p>图 1d 显示了 Saprot 在 14 种不同蛋白质预测任务上相比两个著名 PLM：ESM-2 和 ProtBert 的<strong>卓越性能</strong>。在有蛋白质结构信息可用的任务中（用紫色、蓝色和红色表示），Saprot 始终超越这两个模型。即使在没有结构数据的场景中（绿色任务），Saprot 在微调设置下也保持了与 ESM-2 相当的竞争力。</p>

<p>值得注意的是，Saprot 在三个零样本突变效应预测任务上<strong>显著优于 ESM-2</strong>：Mega-scale (0.574 vs 0.478)、ProteinGym (0.457 vs 0.414) 和 ClinVar (0.909 vs 0.862)。此外，尽管 Saprot 是用掩码语言建模目标训练的（并非专门为生成任务优化），但它在蛋白质序列设计方面表现有效，同时<strong>推理速度比 ProteinMPNN 快 16 倍</strong> (图 1e)。最近的研究还证明了 Saprot 在蛋白质工程、从头设计、适应度和稳定性预测、分子理解、快速敏感的结构搜索以及药物-靶标相互作用预测等广泛应用中的有效性。这种跨多项任务的多功能性支持了 SaprotHub 的社区协作愿景。</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SaProtHub/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<h5 id="2-colabsaprot易用的训练与预测平台">2. ColabSaprot：易用的训练与预测平台</h5>

<p>接着通过将 Saprot 集成到 Google Colab 的基础架构中，开发了 <strong>ColabSaprot 平台</strong>，以支持 PLM 训练和预测。ColabSaprot 能够无缝部署和执行各种任务特定的已训练 Saprot 模型，<strong>无需进行环境设置和代码调试</strong>。它还允许研究人员<strong>只需点击几下</strong>即可启动训练会话 (图 2a)。ColabSaprot 旨在容纳原始 Saprot 框架内的所有任务，支持零样本突变效应预测（实现单点、多点和全序列单点饱和突变）和蛋白质序列设计（可根据给定的骨架结构生成从头序列）等任务的直接预测。</p>

<p>对于监督训练任务（这项工作的特别焦点），用户可以使用自己的实验数据微调 ColabSaprot。在这里通过在 ColabSaprot 中集成<strong>轻量级适配器网络 (lightweight adapter networks)</strong>，实现了一种<strong>参数高效微调 (PEFT)</strong> 技术 (图 2b)。</p>

<p>在训练期间，<strong>只有适配器参数被更新</strong>，而 Saprot 骨干参数保持不变，这实现了与微调所有 Saprot 参数相当的准确性。这种设计不仅提高了学习效率，还建立了一个协作和集中的框架，使生物学家能够在研究社区内（特别是通过云环境）微调特定任务的 Saprot (图 2c–f)。</p>

<p>借助适配器和 ColabSaprot 界面，研究人员可以通过加载或上传适配器网络（而非完整的预训练模型）来轻松地在 SaprotHub 中存储和交换他们重新训练的模型。由于适配器网络包含的参数要少得多（<strong>约为整个 Saprot 模型的 1%</strong>），这种方法<strong>极大地减少了 SaprotHub 的存储、通信和管理负担</strong>，使模型的“可及性、共建、共用和共享”成为可能 (图 2b–d)。</p>

<p>此外，开发了几个关键功能来简化研究人员的工作流程。ColabSaprot 界面支持序列和结构输入，提供自动化数据集处理能力，包括高效的大文件上传机制、带损失可视化的实时训练监控、最佳检查点的自动保存和评估、断点训练恢复，以及众多安全检查以最小化用户错误。为了提高 GPU 内存效率，通过<strong>梯度累积</strong>实现了<strong>自适应批量大小 (adaptive batch sizing)</strong>。该平台还包括可自定义的设置，允许研究人员修改代码和调整训练参数以满足特定的研究需求。</p>

<h5 id="3-saprothub协作与共享的社区">3. SaprotHub：协作与共享的社区</h5>

<p>最后，开发了 <strong>SaprotHub</strong>，一个<strong>集成了搜索引擎</strong>的平台，为生物学界提供了共享和协作开发同行再训练 (peer-retrained) Saprot 模型的中央平台 (图 2d)。通过 ColabSaprot 界面实现了模型存储、模型共享、模型搜索、<strong>模型持续学习</strong>和<strong>多模型聚合</strong>等功能。</p>

<p>具体来说，SaprotHub 提供了三个关键优势：</p>

<ol>
  <li><strong>安全共享</strong>：研究人员可以在 SaprotHub 上分享他们训练好的模型，而<strong>不必担心私有数据的泄露</strong>。这有效地促进了知识传播，并有潜力建立协作研究的新范式 (图 2c)。</li>
  <li><strong>持续学习</strong>：研究人员可以利用 SaprotHub 上同行贡献的共享模型，在自己的数据集上执行<strong>持续训练</strong>。这种方法在<strong>数据有限</strong>的场景中特别有利，因为从一个更好的预训练模型微调通常能带来更优的预测性能 (图 2f)。此外，这些微调后的模型还可以通过一键上传适配器网络贡献回中心，形成协作生态。</li>
  <li><strong>模型聚合</strong>：随着 SaprotHub 社区的扩展，它将为各种蛋白质预测任务积累多个模型。实现了一种<strong>模型聚合机制</strong> (图 2c)，使 用户能够通过整合多个现有模型来<strong>增强预测性能</strong> (图 2e)。</li>
</ol>

<h5 id="湿实验验证与用户研究">湿实验验证与用户研究</h5>

<p>Saprot 和 SaprotHub 已经吸引了社区关注，并通过<strong>多次湿实验验证</strong>证明了其有用性。</p>

<ul>
  <li>一家商业生物公司的 T.Z. 团队使用 ColabSaprot 对一种<strong>木聚糖酶 (xylanase)</strong> 进行零样本单点突变预测，实验验证的 20 个变体中，<strong>13 个表现出增强的酶活性</strong>，其中 R59S 活性提高了 2.55 倍。</li>
  <li>X.C. 实验室使用 ColabSaprot 对 <strong>TDG</strong> 变体进行零样本单点突变预测，在 HeLa 细胞中验证的 <strong>20 个预测突变中有 17 个</strong>显示出<strong>增强的编辑效率</strong>，其中三个替换实现了近两倍的效率。</li>
  <li>另一位 OPMC 成员微调 Saprot 预测更亮的 <strong>GFP</strong> 变体，实验验证显示，<strong>排名前 9 位的双位点变体中有 7 个</strong>表现出<strong>增强的荧光</strong>，其中一个变体的荧光强度达到了<strong>野生型的八倍以上</strong>。</li>
  <li>J. Zheng 实验室共享了一个 <strong>eYFP</strong> 荧光预测模型，该模型在 100,000 个实验验证过的变体上训练，在独立测试集上实现了 0.94 的斯皮尔曼相关性 (ρ)，显示了接近实验级的准确性。</li>
  <li>作者最近收到了更多来自社区研究人员使用 ColabSaprot 获得积极湿实验结果的反馈。</li>
</ul>

<p>还进行了一项<strong>用户研究</strong>，招募了 <strong>12 名没有 ML 背景的生物学研究人员</strong>，并将他们的表现与一名 AI 专家进行比较。结果表明，借助 ColabSaprot 和 SaprotHub，生物学研究人员可以训练和使用最先进的 PLM，<strong>其性能与 AI 专家相当</strong> (图 2g, h)。</p>

<p>值得注意的是，在某些场景中——例如 eYFP 适应度预测任务 (图 2g)——<strong>生物学家利用 SaprotHub 上的预有模型所取得的预测准确性甚至高于 AI 专家</strong>。这种更高的性能源于这样一个事实：这些共享模型是在更大或更高质量的数据集上训练的，这突显了科学界内部模型共享的潜力——这也是本文的一个关键论点。</p>

<h5 id="结论与愿景">结论与愿景</h5>

<p>ColabSaprot 和 SaprotHub 使生物学研究人员（即使没有广泛的 AI 专业知识）能够为多样化的预测任务训练和共享复杂的 PLM。该平台赋能更广泛的蛋白质研究社区贡献和交换 PLM，通过同行训练的模型促进协作研究和知识共享。</p>

<p>已经将 Saprot 和 ColabSaprot 开源，为其他 PLM 开发自己的模型中心提供了框架。重要的是，ColabSaprot 和 SaprotHub 只是这一演进的第一步； OPMC 成员已经扩展了此生态系统，<strong>集成了更多前沿的 PLM</strong>，包括 ProTrek、ESM-2、ESM-1b、ProtBert 和 ProtT5，从而在全球范围内普及了生物学家对多样化 PLM 的访问。</p>

<p>这种社区范围的参与方法与 OPMC 的愿景相一致，目标是通过 SaprotHub 激励和促进开放 PLM 的合作共建。将 SaprotHub 视为 OPMC 的催化剂，推动该领域的创新和协作。</p>

<h3 id="2-methods">2 Methods</h3>

<h5 id="1-构建-sa-蛋白质序列-constructing-sa-protein-sequence">1. 构建 SA 蛋白质序列 (Constructing SA protein sequence)</h5>

<p><strong>SA 词汇表 (SA vocabulary)</strong> 同时包含了残基和结构信息。给定一个蛋白质 <code class="language-plaintext highlighter-rouge">$P$</code>，其一级序列表示为 <code class="language-plaintext highlighter-rouge">$(S_{1}, S_{2}, ..., S_{n})$</code>，其中 <code class="language-plaintext highlighter-rouge">$s_{i}$</code> 是第 <code class="language-plaintext highlighter-rouge">$i$</code> 位的残基。研究者使用 <strong>Foldseek</strong> 这款快速准确的蛋白质结构比对工具，将蛋白质 3D 结构编码为离散的、类似残基的结构令牌。这产生了一个结构字母表 <code class="language-plaintext highlighter-rouge">$\mathcal{F}$</code>，其中蛋白质 <code class="language-plaintext highlighter-rouge">$P$</code> 被表示为序列 <code class="language-plaintext highlighter-rouge">$(f_{1}, f_{2}, ..., f_{n})$</code>，其中 <code class="language-plaintext highlighter-rouge">$f_{j} \in \mathcal{F}$</code> 是第 <code class="language-plaintext highlighter-rouge">$j$</code> 个残基位点的 3Di 令牌。</p>

<p>研究者遵循 Foldseek 的默认配置，将 <code class="language-plaintext highlighter-rouge">$\mathcal{F}$</code> 的大小（即 <code class="language-plaintext highlighter-rouge">$m$</code>）设为 20。然后，他们将每个残基位点的残基令牌和结构令牌结合起来，生成一个新的 <strong>SA 蛋白质序列</strong> <code class="language-plaintext highlighter-rouge">$P=(s_{1}f_{1}, s_{2}f_{2}, ..., s_{n}f_{n})$</code>，其中 <code class="language-plaintext highlighter-rouge">$s_{i}f_{i} \in \mathcal{V} \times \mathcal{F}$</code> 是所谓的 SA 令牌，自然地融合了残基和几何构象信息。</p>

<p>SA 令牌蛋白质序列随后可以被送入标准的 Transformer 编码器作为基本输入。研究者还为残基和结构字母表引入了<strong>掩码信号 ‘#’</strong>，这导致了 <code class="language-plaintext highlighter-rouge">‘$s_{i}\#$’</code> 和 <code class="language-plaintext highlighter-rouge">‘$\#f_{i}$’</code> 两种形式，分别表示仅残基信息可用或仅结构信息可用。SA 词汇表的大小因此为 <code class="language-plaintext highlighter-rouge">$21 \times 21 = 441$</code>。</p>

<h5 id="2-saprot-的模型架构和预训练-model-architecture-and-pretraining-of-saprot">2. Saprot 的模型架构和预训练 (Model architecture and pretraining of Saprot)</h5>

<p>Saprot 遵循与 ESM-2 相同的网络架构和参数大小，其灵感来自 BERT 模型。主要区别在于<strong>嵌入层</strong>：Saprot 纳入了 441 个 SA 令牌，以取代传统的 20 个 AA 令牌。这种几乎相同的架构使得与 ESM 模型的性能比较变得直接。</p>

<p>Saprot 使用与 ESM-2 和 BERT 相同的<strong>掩码语言建模 (MLM)</strong> 目标进行预训练。对于一个蛋白质序列 <code class="language-plaintext highlighter-rouge">$P=(s_{1}f_{1}, s_{2}f_{2}, ..., s_{n}f_{n})$</code>，输入和输出可以表示为：输入 <code class="language-plaintext highlighter-rouge">$(s_{1}f_{1}, ..., \#f_{i}, ..., s_{n}f_{n}) \rightarrow$</code> 输出 <code class="language-plaintext highlighter-rouge">$s_{i}f_{i}$</code> (图 1b) 。考虑到 AlphaFold2 预测结构中的 3Di 令牌在某些区域可能不准确，训练时会使得 <code class="language-plaintext highlighter-rouge">‘$\#f_{i}$’</code> 可见，以减少模型对其预测的依赖。</p>

<p>AlphaFold2 (AF2) 的预测包含 pLDDT 置信度分数。因此，研究者对<strong>低置信度分数区域</strong>（pLDDT 低于 70）实施了专门处理。在预训练期间，当这些区域被选中进行 MLM 预测时，使用 <code class="language-plaintext highlighter-rouge">‘$s_{i}\#$’</code> 令牌作为预测目标，同时用 ‘##’ 令牌掩码输入 SA 序列。当这些低置信度区域未被选中进行 MLM 预测时，在输入中使用 <code class="language-plaintext highlighter-rouge">‘$s_{i}\#$’</code> 令牌，确保模型仅依赖残基上下文而非不准确的结构信息。在下游任务中，也应用了相同的处理方式，pLDDT 低于 70 的区域用 <code class="language-plaintext highlighter-rouge">‘$s_{i}\#$’</code> 令牌表示。</p>

<p>Saprot 35M 和 650M 进行了如上所述的典型从头预训练。相比之下，<strong>Saprot 1.3B</strong> 使用了一种高效的训练策略，通过<strong>架构上组合两个相同的 33 层 Saprot 650M 模型</strong>来实现。初始化过程涉及复制预训练 650M 模型的参数，以填充 1.3B 架构的低层（1-33层）和高层（34-66层）。初始化后，Saprot 1.3B 遵循与 35M 和 650M 模型相同的训练协议，<strong>例外之处</strong>在于训练批次中 30% 的蛋白质序列被转换为纯 AA 序列格式 <code class="language-plaintext highlighter-rouge">$(s_{1}\#, s_{2}\#, ..., s_{n}\#)$</code>，以增强模型处理无可用结构信息蛋白质的能力。</p>

<h5 id="3-处理预训练数据集-processing-pretraining-dataset">3. 处理预训练数据集 (Processing pretraining dataset)</h5>

<p>研究者遵循 ESM-2 中概述的程序来生成序列一致性过滤的蛋白质数据。随后，他们通过 AlphaFold DB 网站获取了所有 AF2 结构。在 AlphaFold DB 中没有结构的蛋白质被移除。这个过程产生了约 <strong>4000 万个结构</strong>的集合。研究者使用 Foldseek 将这些结构编码为 3Di 令牌，随后通过组合残基和 3Di 令牌来构建 SA 序列。这些数据集被用于训练所有三个版本的 Saprot 模型。</p>

<h5 id="4-预训练超参数-hyperparamters-for-pretraining">4. 预训练超参数 (Hyperparamters for pretraining)</h5>

<p>遵循 ESM-2 和 BERT，训练期间，每批中 15% 的 SA 令牌被掩码。在 80% 的情况下，SA 令牌 <code class="language-plaintext highlighter-rouge">$s_{i}f_{i}$</code> 被替换为 <code class="language-plaintext highlighter-rouge">$\#f_{i}$</code> 令牌；10% 的情况下被替换为随机选择的令牌；另外 10% 保持不变。</p>

<p>优化方面，使用了 AdamW 优化器，设置 <code class="language-plaintext highlighter-rouge">$\beta_{1}=0.9$</code>，<code class="language-plaintext highlighter-rouge">$\beta_{2}=0.98$</code>（译者注：原文Methods章节中未提 <code class="language-plaintext highlighter-rouge">$\beta_{2}$</code>，但在第9页的 fine-tuning 部分提到了 <code class="language-plaintext highlighter-rouge">$\beta_{2}=0.98$</code>），并使用了 0.01 的 <code class="language-plaintext highlighter-rouge">$L_{2}$</code> 权重衰减。学习率在前 2,000 步内从 0 逐步增加到 <code class="language-plaintext highlighter-rouge">$4 \times 10^{-4}$</code>，并在 150,000 步到 150 万步期间线性降低到 <code class="language-plaintext highlighter-rouge">$4 \times 10^{-5}$</code>。总训练阶段持续约 300 万步。序列被截断为最大 1,024 个令牌，批量大小为 512 个序列。训练使用了混合精度。</p>

<h5 id="5-基线模型描述-descriptions-of-baseline-models">5. 基线模型描述 (Descriptions of baseline models)</h5>

<p>Saprot 与几个著名的 PLM 进行了比较。</p>

<ul>
  <li><strong>监督学习任务</strong>：比较了 ESM-2 (650M)、ProtBert (BFD 版)、MIF-ST、GearNet 和 ESM-3 40。ESM-2 (650M) 是主要的比较基线，因为其模型架构、大小和训练方法与 Saprot 相似。</li>
  <li><strong>零样本突变效应预测</strong>：比较了 ESM-2 (包括 15B 版本)、ProtBert、ESM-1v、Tranception L (无 MSA 检索)、MSA Transformer、EVE 和 ESM-3。</li>
  <li><strong>蛋白质反向折叠</strong>：比较了 ProteinMPNN。</li>
</ul>

<h5 id="6-零样本突变效应预测任务的公式-the-formula-for-the-zero-shot-mutation-effect-prediction-task">6. 零样本突变效应预测任务的公式 (The formula for the zero-shot mutation effect prediction task)</h5>

<p>以往的 PLM (如 ESM) 使用突变位置的<strong>对数几率比 (log odds ratio)</strong> 来预测突变效应。公式为：</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SaProtHub/frm1.png" alt="avatar" style="zoom:50%;" /></div>

<p>其中 <code class="language-plaintext highlighter-rouge">$T$</code> 代表所有突变，<code class="language-plaintext highlighter-rouge">$s_t$</code> 是突变型 (mt) 和野生型 (wt) 序列的残基类型。</p>

<p>研究者稍微修改了该公式以适应 Saprot 中的 SAA，其中分配给每个残基的概率对应于包含该特定残基类型的所有令牌的概率总和。公式如下：</p>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/SaProtHub/frm2.png" alt="avatar" style="zoom:50%;" /></div>

<p>其中 <code class="language-plaintext highlighter-rouge">$f \in \mathcal{F}$</code> 是 3Di 令牌，<code class="language-plaintext highlighter-rouge">$s_t f$</code> 是 SAA 中的 SA 令牌。</p>

<h5 id="7-零样本突变效应预测任务和数据集-zero-shot-mutational-effect-prediction-tasks-and-datasets">7. 零样本突变效应预测任务和数据集 (Zero-shot mutational effect prediction tasks and datasets)</h5>

<ul>
  <li><strong>ProteinGym</strong>：一个包含广泛深度突变扫描分析的数据集。评估在 ProteinGym 的替换分支上进行，使用其提供的蛋白质结构，并采用斯皮尔曼等级相关性 (Spearman’s rank correlation) 作为评估指标。</li>
  <li><strong>ClinVar</strong>：一个包含人类遗传变异及其临床重要性信息的公共存储库。分析仅限于可靠性评级为“一星”或更高的数据，并排除了长度超过 1,024 个残基的蛋白质。评估使用 ROC 曲线下面积 (AUC) 。</li>
  <li><strong>Mega-scale</strong>：使用互补 DNA 展示蛋白水解技术测量蛋白质域的热力学折叠稳定性。该数据集也使用斯皮尔曼等级相关性作为评估指标。</li>
</ul>

<p>对于每个突变数据集，研究者都为所有变体提供了<strong>野生型结构</strong>，因为 AF2 不能可靠地区分单点替换引起的结构变化。</p>

<h5 id="8-监督微调任务和数据集-supervised-fine-tuning-tasks-and-datasets">8. 监督微调任务和数据集 (Supervised fine-tuning tasks and datasets)</h5>

<ul>
  <li><strong>使用 AF2 结构微调 Saprot</strong>：包括来自 FLIP 的<strong>热稳定性 (Thermostability)</strong> 任务和来自 DeepLoc 的<strong>定位预测 (localization prediction)</strong> 任务（包含十类亚细胞位置的多类分类和两类位置的二元分类）。</li>
  <li><strong>使用 PDB 结构微调 Saprot</strong>：包括<strong>金属离子结合 (metal-ion-binding)</strong> 任务和一系列来自 <strong>ProteinShake</strong> 的任务（结构类别预测、结构相似性预测和结合位点检测）。</li>
  <li><strong>无结构微调 Saprot</strong>：当结构数据不可用时，在 SA 序列中掩码 3Di 令牌。评估了来自 TAPE 的<strong>荧光 (fluorescence)</strong> 和<strong>稳定性 (stability)</strong> 预测、来自 FLIP 的 <strong>AAV</strong> 数据集以及来自 PEER 的 <strong>$\beta$-内酰胺酶 ($\beta$-lactamase)</strong> 景观预测。</li>
</ul>

<h5 id="9-数据划分-data-split">9. 数据划分 (Data split)</h5>

<p>现有文献通常基于蛋白质序列一致性来划分数据集。然而，ProteinShake 基准研究指出，蛋白质结构比序列更保守，因此<strong>基于结构的划分</strong>（structure-based splitting）能对模型泛化能力提供更严格的评估。</p>

<p>受此启发，研究者在大多数评估中采用了基于结构的划分标准。该标准使用 ProteinShake 中提出的 <strong>LDDT</strong> 进行量化。具体来说，对于包含蛋白质结构的数据集，使用了 ProteinShake 推荐的默认 <strong>70% LDDT</strong> 阈值。对于仅有序列数据的任务，保留了原始文献提供的划分。</p>

<h5 id="10-蛋白质反向折叠-protein-inverse-folding">10. 蛋白质反向折叠 (Protein inverse folding)</h5>

<p>为了将 Saprot 用于反向折叠，研究者首先将蛋白质骨架编码为 3Di 令牌 <code class="language-plaintext highlighter-rouge">$(f_{1}, f_{2}, ..., f_{n})$</code> 。然后，他们掩码 SA 令牌的所有残基部分，形成一个 SA 序列 <code class="language-plaintext highlighter-rouge">$(\#f_{1}, \#f_{2}, ..., \#f_{n})$</code> 。该序列被输入 Saprot 以预测所有位置的残基分布。与 ProteinMPNN 的自回归生成方式不同，<strong>Saprot 能够通过一次前向传播同时预测所有残基</strong>。</p>

<p>研究者评估了两个 Saprot 变体：一个使用 AF2 预测结构进行预训练，另一个在 <strong>CATH 数据集</strong>上进一步微调。CATH 数据库（也用于训练 ProteinMPNN）被划分为 80:10:10 的训练、验证和测试集。</p>

<h5 id="11-微调任务的超参数-hyperparameters-for-fine-tuning-tasks">11. 微调任务的超参数 (Hyperparameters for fine-tuning tasks)</h5>

<p>微调期间使用 AdamW 优化器，设置 <code class="language-plaintext highlighter-rouge">$\beta_{1}=0.9$</code>，<code class="language-plaintext highlighter-rouge">$\beta_{2}=0.98$</code>，以及 0.01 的 <code class="language-plaintext highlighter-rouge">$L_{2}$</code> 权重衰减。所有数据集的批量大小均为 64。对于有 AF2 结构和 PDB 结构的任务，最优学习率设为 <code class="language-plaintext highlighter-rouge">$5 \times 10^{-5}$</code>；对于无结构的任务，设为 <code class="language-plaintext highlighter-rouge">$1 \times 10^{-5}$</code>。</p>

<h5 id="12-适配器学习-adapter-learning">12. 适配器学习 (Adapter learning)</h5>

<p>适配器学习技术最近已被蛋白质研究采用。本文将其与 Google Colab 集成，创建了一个平台，通过 SaprotHub 实现模型微调、共享、持续再训练和协作。</p>

<p>在多种适配器类型（如 Houlsby, Pfeiffer, Compacter, LoRA）中，研究者选择了 <strong>LoRA</strong>，因为它能以更少的参数提供相当的结果。通过在冻结骨干网络的同时，将可学习的低秩矩阵集成到每个 Saprot 块中，LoRA 实现了参数高效的微调和模型共享。</p>

<h5 id="13-社区范围的协作-community-wide-collaboration">13. 社区范围的协作 (Community-wide collaboration)</h5>

<p>为了评估协作的优势：</p>

<ul>
  <li><strong>模型聚合 (Model aggregation)</strong> (图 2e)：研究者将训练数据随机划分为五个子集，并分别训练一个模型（模拟不同研究者共享的模型）。对于<strong>回归</strong>任务（如热稳定性），最终预测是所有模型输出的<strong>平均值</strong>。对于<strong>分类</strong>任务（如亚细胞定位），采用<strong>多数投票</strong>。</li>
  <li><strong>模型持续学习 (Model continue learning)</strong> (图 2f)：研究者随机采样 100、200 和 500 个训练实例（模拟研究者的私有数据）。他们使用两个基础模型进行微调（仅更新适配器参数）：官方 Saprot 模型（蓝色）和来自 SaprotHub 的共享模型（橙色）。结果表明，从现有的、训练良好的模型（橙色）继续训练，性能<strong>显著优于</strong>从头开始训练（蓝色）。</li>
</ul>

<h5 id="14-colabsaprot-笔记本-colabsaprot-notebooks">14. ColabSaprot 笔记本 (ColabSaprot notebooks)</h5>

<p>ColabSaprot 由三个关键组件构成：</p>

<ol>
  <li><strong>模型训练</strong>：使研究人员能够快速配置环境、处理数据和高效微调 Saprot。提供了四种基础模型（Saprot 35M, 650M, 自定义微调模型, 社区共享模型）以及高级超参数定制选项。</li>
  <li><strong>预测能力</strong>：支持广泛的预测任务（蛋白质级别、残基级别、蛋白质间相互作用、零样本突变效应和蛋白质设计），可使用社区共享模型或本地微调模型。ColabSaprot 还通过<strong>集成方法（聚合）</strong> 来增强预测准确性。</li>
  <li><strong>模型共享、搜索和协作</strong>：研究人员可以将其模型权重（特别是适配器权重）贡献给 SaprotHub 社区存储库。通过 SaprotHub 的专用搜索引擎，研究人员可以定位和使用相关模型，用于持续学习、直接应用或模型聚合。</li>
</ol>

<h5 id="15-用户研究-user-study">15. 用户研究 (User study)</h5>

<p>研究者通过八项蛋白质预测任务对 ColabSaprot-v1 进行了评估，招募了 <strong>12 名生物学背景</strong>但<strong>没有编码或 ML 项目经验</strong>的参与者。评估涵盖了监督微调、零样本突变效应预测和蛋白质反向折叠任务。</p>

<p>作为对比，研究者聘请了一名 <strong>AI 专家</strong>（一名专攻 ML 的三年级博士生）使用 GitHub 上的 Saprot 代码库执行相同任务。</p>

<p>12 名参与者被分配了任务（例如，10 人分为两组，每组 5 人，处理总共 6 个监督微调任务）。监督微调任务使用了五个公共数据集和一个专有的 eYFP 适应度预测数据集。为了减少训练时间，训练集被随机采样至 1,000 个样本。</p>

<p>在 eYFP 任务中，生物学参与者利用了 SaprotHub 上的预训练模型进行<strong>持续学习</strong>，而 AI 专家则使用了基础的 Saprot 650M 模型。</p>

<h5 id="16-木聚糖酶的实验验证-experimental-validation-on-the-xylanase">16. 木聚糖酶的实验验证 (Experimental validation on the xylanase)</h5>

<p>该验证包含多个步骤：</p>

<ol>
  <li>使用 <strong>AlphaFold3</strong> 获取 Mth 蛋白 (XP_069217686.1) 的结构。</li>
  <li>使用 Foldseek 或 ColabSaprot 获取 SA 序列。</li>
  <li>使用 ColabSaprot (650M) 对整个 SA 序列进行<strong>零样本（单点）突变效应预测</strong>。</li>
  <li>选择了排名前 20 的变体（排除了位于信号肽区域的 A15G 和 I13P）。</li>
  <li><strong>构建突变体</strong>：在 <em>P. pastoris</em> (毕赤酵母) 中进行基因合成、定点诱变、转化和筛选。</li>
  <li><strong>酶活性测定</strong>：在 BMMY 培养基中诱导表达 xylanase，并进行 fed-batch 发酵。使用 3,5-二硝基水杨酸法 (DNS法) 测定木聚糖酶活性，并评估了最适温度和热稳定性。</li>
</ol>

<h5 id="17-gfp-变体的实验验证-experimental-validation-on-gfp-variants">17. GFP 变体的实验验证 (Experimental validation on GFP variants)</h5>

<p>该任务的目标是作为 2024 年蛋白质工程关键评估 (CAPE) 竞赛的一部分，设计更亮的 avGFP 变体 。</p>

<ol>
  <li><strong>数据准备</strong>：CAPE 组织者提供了 140,000 个 GFP 变体的数据集及其适应度分数和四种野生型 GFP 结构 108。OPMC 成员使用 Foldseek 生成 3Di 令牌，并转换为 SA 令牌。</li>
  <li><strong>模型微调</strong>：使用 <strong>Saprot (35M)</strong> 模型进行<strong>全参数微调</strong>。</li>
  <li><strong>变体预测和验证</strong>：通过随机诱变生成了 500 万个 avGFP 双位点突变体库。使用微调后的 Saprot 模型预测其适应度分数。排名前九的变体被选中进行实验验证。</li>
  <li><strong>实验验证</strong>：在深圳合成生物学基础设施的机器人生物铸造厂进行。包括在 <em>E. coli</em> BL21(DE3) 细胞中表达，IPTG 诱导，以及测量 <code class="language-plaintext highlighter-rouge">$OD_{600}$</code> 和 GFP 荧光（激发 488nm，发射 520nm）。</li>
</ol>

<h5 id="18-tdg-变体的实验验证-experimental-validation-of-the-tdg-variants">18. TDG 变体的实验验证 (Experimental validation of the TDG variants)</h5>

<p>X.C. 实验室使用了 <strong>ColabSaprot v1 (650M)</strong> 对 TDG 进行<strong>零样本单点突变效应预测</strong>。他们仅输入了 AA 序列（所有结构令牌均被掩码）。实验验证了排名前 20 的变体。这些变体被克隆到 PCMV 质粒中，并融合到 SpCas9(D10A) 蛋白上（作为 TSBE2）。实验验证过程如先前所述 。</p>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="protein" /><summary type="html"><![CDATA[论文地址：Democratizing protein language model training, sharing and collaboration 论文实现：https://github.com/westlake-repl/SaProtHub]]></summary></entry><entry xml:lang="en"><title type="html">ACEBench：Who Wins the Match Point in Tool Usage</title><link href="https://tyang816.github.io/cl/ACEBench-Who-Wins-the-Match-Point-in-Tool-Usage/" rel="alternate" type="text/html" title="ACEBench：Who Wins the Match Point in Tool Usage" /><published>2025-09-08T00:00:00+08:00</published><updated>2025-09-08T00:00:00+08:00</updated><id>https://tyang816.github.io/cl/ACEBench%EF%BC%9AWho%20Wins%20the%20Match%20Point%20in%20Tool%20Usage</id><content type="html" xml:base="https://tyang816.github.io/cl/ACEBench-Who-Wins-the-Match-Point-in-Tool-Usage/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://arxiv.org/abs/2501.12851">ACEBench：Who Wins the Match Point in Tool Usage</a></p>

  <p>论文实现：<a href="https://github.com/chenchen0103/ACEBench">https://github.com/chenchen0103/ACEBench</a></p>
</blockquote>

<h2 id="acebench评估llm调用工具">ACEBench：评估LLM调用工具</h2>

<h3 id="abstract">Abstract</h3>

<p>大型语言模型（LLMs）在决策和推理方面展现了巨大潜力，尤其是当它们与各种工具集成以解决复杂问题时 。然而，现有的用于评估LLMs工具使用的基准测试面临几个局限性 ：</p>

<ol>
  <li><strong>评估场景有限</strong>：通常缺乏在真实多轮对话上下文中的评估 。</li>
  <li><strong>评估维度狭窄</strong>：对LLMs如何使用工具的详细评估不足 。</li>
  <li><strong>评估依赖问题</strong>：依赖LLMs或真实的API执行进行评估，这带来了显著的开销 。</li>
</ol>

<p>为了应对这些挑战，研究人员引入了 <strong>ACEBench</strong>，这是一个用于评估LLMs工具使用的综合基准测试 。ACEBench根据评估方法将数据分为三种主要类型：<strong>Normal</strong>（常规）、<strong>Special</strong>（特殊）和 <strong>Agent</strong>（代理） 。</p>

<ul>
  <li><strong>“Normal”</strong> 评估在基本场景下的工具使用 。</li>
  <li><strong>“Special”</strong> 评估在指令模糊或不完整情况下的工具使用 。</li>
  <li><strong>“Agent”</strong> 通过多智能体互动来评估工具使用，以模拟真实的、多轮的对话 。</li>
</ul>

<p>研究人员使用ACEBench进行了广泛的实验，深入分析了各种LLMs，并对不同数据类型中的错误原因进行了更精细的审查 。</p>

<h3 id="1-introduction">1 Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab1.png" alt="avatar" style="zoom:100%;" /></div>

<p>大型语言模型（LLMs），例如GPT-4，已经在众多自然语言处理任务中展现出卓越的性能 。研究表明，整合工具能显著扩展LLM的能力 ，尤其是在数学 、编程 和推理 等专业领域。一方面，将工具集成到LLMs中可以增强其在多个领域的能力，例如ToolTransformer就通过利用工具提升了LLM解决复杂问题的能力 。另一方面，采用工具使用范式可以提高响应的鲁棒性（robustness）和生成的透明度（transparency），从而增加用户的可解释性（explainability）和信任度，并改善系统的适应性（adaptability） 。随着该领域的不断发展，全面评估工具使用的各个方面变得至关重要，特别是在复杂场景下 。</p>

<p>尽管已有几项研究关注工具使用的评估 ，但现有的工具使用基准测试仍存在一些缺点 。<strong>首先，现有基准测试缺乏真实世界场景下的多轮对话评估</strong> 。例如，BFCL 和 HammerBench 中的多轮对话是由预定义的固定内容组合而成 。<strong>其次，当前的工具使用基准测试缺乏细粒度的评估和个性化数据评估</strong> 。<strong>此外，现有基准测试忽视了特殊情况的评估</strong> ，或者评估方法过于简单 。现实生活中的用户指令并不总是完美的 ，而模型识别和处理这些问题的能力对于评估也至关重要 。<strong>最后，评估成本高昂</strong> ，因为许多研究依赖先进的大型模型（advanced large models）进行评估 。</p>

<p>为解决这些缺点，作者团队提出了 <strong>ACEBench</strong> ，一个综合性的工具使用基准测试，包含以下几类 ：</p>

<ul>
  <li><strong>Normal (常规)</strong>：由固定的问答对组成，涵盖了包括单轮对话、多轮对话和个性化场景数据在内的多种场景 。它还包括对原子级（atomic-level）能力的评估 。</li>
  <li><strong>Special (特殊)</strong>：包括不完美的指令，例如包含不完整参数、格式不正确参数的指令，或与候选函数能力无关的问题 。</li>
  <li><strong>Agent (代理)</strong>：涵盖真实世界场景，通过抽象构建多轮、多步骤的工具调用场景 。根据用户是否参与对话过程，分为多轮（multi-turn）和多步（multi-step）案例 。</li>
</ul>

<p>作者指出，这三类数据覆盖了LLM工具使用的大多数场景 。</p>

<p>论文的主要贡献如下：</p>

<ul>
  <li><strong>全面的基准测试评估</strong> (Comprehensive Benchmark Evaluation)：提出了一个评估LLMs工具使用的综合基准测试，覆盖了各种场景，包括更细粒度的评估视角、不完美指令下的评估，并提供了更稳定的评估指标 。</li>
  <li><strong>沙盒环境与自动化评估系统</strong> (Sandbox Environment and Automated Evaluation System)：构建了一个端到端的自动化评估系统 ，并为基于真实世界场景抽象的多轮、多步工具调用开发了沙盒环境构建方案 。</li>
  <li><strong>广泛的实验验证</strong> (Extensive Experimental Validation)：通过广泛的实验证明，该基准测试提供了更全面且更具区分度的分析，为LLMs的工具使用提供了更清晰的评估 。</li>
</ul>

<h3 id="3-acebench">3 ACEBench</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="31-dataset">3.1 Dataset</h4>

<p>研究人员构建了数据集的两种语言并行版本（中文和英文），确保了数据类型在两者间的平等分布。最终的数据集包含2,000个标注条目。</p>

<h5 id="311-data-construction">3.1.1 Data Construction</h5>

<p>Normal（常规）和 Special（特殊）数据由LLMs自动生成，而 Agent（代理）数据则由专家构建 。<strong>Normal 和 Special 数据的构建</strong> 研究人员采用了一个专为Normal和Special数据设计的全自动、基于LLM的生成流程，如图1(a)所示 。</p>

<ul>
  <li><strong>(1) API 合成 (API Synthesis)</strong>：在构建过程中使用来自不同真实世界场景的真实API作为参考，以增强真实性 。为确保数据稳定性，研究人员使用合成的API（synthetic APIs）来构建评估数据集，并以真实API为指导 。他们采用一种自进化（self-evolution）方法，通过构建层次化的API上下文树（API context tree）来确保生成的API覆盖广泛的领域和功能 。该过程首先从技术文档中提取相关信息以指导API生成 ，随着过程推进，上下文树逐渐扩展，最终确保生成API的深度和广度 。</li>
  <li><strong>(2) 对话构建 (Dialogue Construction)</strong>：研究人员使用两种不同的对话生成流程 。在构建的API池中，为每个评估实例选择三到六个候选API 。大多数情况下，API是随机选择的 ；但对于需要特定功能的实例（如相似API或多轮场景），则使用包括基于图的采样（graph-based sampling）在内的先进方法 。简单案例或具有预定义功能的案例使用基于模板的生成 。对于更复杂的场景，则采用多智能体对话流程（multi-agent dialogue pipeline），由三个智能体（用户、助手和工具）模拟真实世界的互动 。</li>
</ul>

<p><strong>Agent 数据的构建</strong> 研究人员为Agent数据的生成实现了一个精心策划的、由人类专家构建的框架，如图1(b)所示 。</p>

<ul>
  <li><strong>(1) 场景构建 (Scenario Construction)</strong>：通过对真实世界交互场景（如送餐服务和电信运营）进行系统性抽象 ，研究人员设计了具有明确业务语义的功能模块，并规定了每个场景的核心状态变量（如订单状态、账户余额）和固有属性集 。</li>
  <li><strong>(2) 沙盒环境构建 (Sandbox Environment Construction)</strong>：研究人员构建了一个隔离的沙盒环境，包含三个核心组件：具有明确输入/输出规范和前提条件的标准化功能接口、用于实时状态转换监控的动态属性管理系统，以及记录调用过程的执行监控模块 。</li>
  <li><strong>(3) 问题设计 (Question Design)</strong>：基于为不同场景定制的预定义多轮对话规范，领域专家通过迭代标注过程系统地精心设计了对话问题 。</li>
</ul>

<h5 id="312-multi-stage-data-verification">3.1.2 Multi-Stage Data Verification</h5>

<p>为解决答案不匹配或标准模糊等问题，研究人员实施了多阶段验证流程 。</p>

<ul>
  <li><strong>自动化质量检查 (Automated Quality Inspection)</strong>：
    <ul>
      <li>数据首先通过基于规则的质量检查模块，该模块评估四个维度：<strong>API定义的清晰度、函数调用的可执行性、对话的准确性以及数据样本的一致性</strong> 。</li>
      <li>接着，数据进入基于模型的质量验证模块，该模块使用<strong>LLMs</strong>检测语义错误，并采用<strong>投票机制</strong>确保评估的一致性 。</li>
    </ul>
  </li>
  <li><strong>人工质量检查 (Human Quality Inspection)</strong>：在初步评估中，自动化检查后剩余的数据集由三个LLMs进行评估，以协助人类专家筛选数据 。有效数据被保留，而潜在有问题的数据被放入错误候选池 。这些被标记的条目会经过一个<strong>两步的专家审查流程</strong>：
    <ul>
      <li>两名专家独立评估并提出修改建议，第三名专家整合反馈并修订问题陈述、API定义和答案 。</li>
      <li>修订后的数据被重新评估和手动验证，并执行了三轮优化以确保数据集的高质量 。</li>
    </ul>
  </li>
</ul>

<h5 id="313-data-analysis">3.1.3 Data Analysis</h5>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig2-fig3.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig4.png" alt="avatar" style="zoom:50%;" /></div>

<p>为展示ACEBench的广度和全面性，研究人员提供了其测试用例分布的详细分析 。</p>

<ul>
  <li><strong>API 的领域 (Domain of APIs)</strong>：ACEBench API 覆盖了8个主要领域和68个子领域，涵盖日常生活的各个方面，包括技术、金融、娱乐、社会、健康、文化、环境等 。它提供了中英文共4,538个API的丰富集合 。这些API的分布如图2所示 。</li>
  <li><strong>数据组成 (Data Composition)</strong>：ACEBench由三类测试样本组成：Normal、Agent 和 Special，每个类别又分为几个子类别 。数据构成如图3所示 ，展示了对工具使用能力的全面覆盖，从简单的单轮工具调用到涉及用户和环境的复杂多轮互动 。它们包括需要多步骤和与环境互动的场景，以及工具调用不可行的情况 。</li>
  <li><strong>轮数和参数数量 (Number of turns and arguments)</strong>：ACEBench中的测试数据覆盖了广泛的复杂度 。研究人员统计了对话轮数和所调用API中的参数数量，并将其可视化于图4 。结果显示对话轮数范围从1到8，涵盖了大多数真实世界场景 。</li>
</ul>

<h4 id="32-eval">3.2 Eval</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig5.png" alt="avatar" style="zoom:100%;" /></div>

<h5 id="321-normal-evaluation">3.2.1 Normal Evaluation</h5>

<p>如图5左侧所示，研究人员通过使用AST解析（AST parsing）比较模型的函数调用输出与标准答案（ground truth）来评估Normal数据 。对于有多个有效答案的情况，他们采用了一个候选答案池，匹配池中任何一个候选答案即视为正确 。评估使用准确率（Accuracy）指标（$1=$ 完全匹配, $0=$ 不匹配） 。</p>

<h5 id="322-special-evaluation">3.2.2 Special Evaluation</h5>

<p>如图5中部所示，Special数据的评估主要评估模型在问题识别（problem identification）方面的能力 。具体而言，模型必须：(1) 检测并警示缺失的参数，(2) 准确定位错误的参数，以及 (3) 识别任务与功能不匹配的情况 。对于每个案例，如果正确识别，准确率（Accuracy）计为1，否则为0 。</p>

<h5 id="323-agent-evaluation">3.2.3 Agent Evaluation</h5>

<p>如图5右侧所示，研究人员通过评估模型在人机交互中使用工具的熟练程度（proficiency）来评估Agent的能力 46，评估中使用了 gpt-4o 作为用户模拟器（user simulator）进行测试。评估指标有两个：</p>

<ul>
  <li><strong>端到端准确率 (End-to-End Accuracy)</strong>：通过比较相应类的实例属性（instance attributes）与目标（target）来评估 48。如果所有属性完全匹配，准确率为1；否则为0。</li>
  <li><strong>过程准确率 (Process Accuracy)</strong>：由实际函数调用过程与理想过程（ideal process）之间的一致性决定 50。表示为 $\frac{n}{m}$，其中 $m$ 代表理想的函数调用过程， $n$ 代表实际与理想过程之间的匹配程度。</li>
</ul>

<h5 id="324-overall-accuracy">3.2.4 Overall Accuracy</h5>

<p>总体准确率（Overall Accuracy）计算为Normal、Special 和 Agent 数据类型准确率的加权总和，权重由它们各自样本量的平方根决定 。</p>

<h3 id="4-experiments">4 Experiments</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab2.png" alt="avatar" style="zoom:100%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab3.png" alt="avatar" style="zoom:50%;" /><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab4.png" alt="avatar" style="zoom:50%;" /></div>

<p><strong>实验设置 (Experimental Setup)</strong> 在评估中，研究人员检验了七个闭源LLMs（closed-source LLMs），包括GPT-4系列、Qwen-Max、Gemini-1.5-Pro、Claude-3.5-Sonnet 和 Doubao-Pro-32K 。此外，还评估了多种开源语言模型（open-source language models），如Qwen2.5系列、Llama3系列、Phi-3-Mini、Deepseek-V3 和 DeepSeek-Coder-V2 。研究人员还评估了四种经过工具学习增强的模型（tool-learning-enhanced models）：Hammer2.1-3B、Hammer2.1-7B、xLAM-7B-r 和 Watt-Tool-8B 。</p>

<h4 id="41-main-results-and-analysis">4.1 Main results and analysis</h4>

<p>中文和英文数据集的综合实验结果呈现在表2中 。研究人员可以得出以下重要结论：</p>

<ul>
  <li><strong>模型性能的总体结论 (General Conclusion on Model Performance)</strong>：
    <ul>
      <li>整体最佳性能仍然由闭源模型主导，例如GPT-4系列 。</li>
      <li>然而，某些开源模型（如Qwen2.5-Coder-32B-Instruct、Qwen2.5-72B-Instruct 和 DeepSeek-V3）与闭源模型之间的性能差距正在逐渐缩小 。这一趋势表明，在模型架构和训练方法进步的推动下，开源模型正在稳步追赶闭源模型 。</li>
    </ul>
  </li>
  <li><strong>微调模型的泛化能力丧失 (Loss of Generalization in Fine-Tuned Models)</strong>：
    <ul>
      <li>如图3所示，针对特定数据集微调的模型，如Watt-Tool-8B、XLAM-7B 和 Hammer2.1-7B，在Special（特殊）数据集上的表现出现显著下降 。</li>
      <li>这一下降主要归因于：微调虽然增强了模型在特定任务上的性能，但也可能导致泛化能力的丧失，使模型在新的或更广泛的指令遵循任务上效果不佳 。</li>
    </ul>
  </li>
  <li><strong>大型模型在复杂任务中的性能局限 (Performance Limitations of Large Models in Complex Tasks)</strong>：
    <ul>
      <li>如表4所示，大多数模型在Agent（代理）数据任务上的端到端准确率（end accuracy）低于50% 。</li>
      <li>这归因于在模拟真实世界多轮互动的动态环境中完成此类任务，不仅需要执行单个工具操作 。模型还必须在工具使用过程中整合上下文信息，并考虑工具调用之间的相互依赖关系，这显著增加了任务复杂度 。</li>
      <li>此外，这些任务需要高级的推理和适应能力，即使是大型模型也可能因为在长期交互中保持一致性以及响应任务演变性质的挑战而难以应对 。</li>
    </ul>
  </li>
</ul>

<h4 id="42-error-analysis">4.2 Error Analysis</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab5.png" alt="avatar" style="zoom:50%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig6-fig7.png" alt="avatar" style="zoom:100%;" /></div>

<p><strong>Normal 数据的错误分析</strong>：</p>

<ul>
  <li>如图6所示，从Normal数据上的错误类型分布来看，<strong>param value error (参数值错误)</strong> 在所有模型中占主导地位 。这凸显了模型在生成特定值方面的困难，可能是由于上下文理解有限和数值分布的复杂性 。</li>
  <li><strong>Output format error (输出格式错误)</strong> 是第二大常见错误，表明在生成遵循预定义格式和句法规则的代码方面还有改进空间 。</li>
  <li>相比之下，<strong>function name (函数名)</strong> 和 <strong>param type (参数类型)</strong> 错误较少，表明模型在匹配函数调用和处理数据类型方面表现出色 。</li>
</ul>

<p><strong>Special 数据的错误分析</strong>：</p>

<ul>
  <li>如表5所示，研究人员确定了两种主要的模型错误类型 ：</li>
  <li>第一种是 <strong>“Error Detection” (错误检测)</strong>，指模型完全未能检测到用户指令中的问题，或者无法按照提示的格式要求识别问题 。</li>
  <li>第二种是 <strong>“Error Correction” (错误纠正)</strong>，即模型检测到了问题，但提供了不清晰的反馈 。例如，模型可能指出存在问题，但未具体说明哪个参数值不正确或缺少什么关键信息 。</li>
  <li>结果显示，特殊类型场景中的大多数错误是由“错误检测”引起的 。</li>
</ul>

<p><strong>Agent 数据的错分析</strong>：</p>

<ul>
  <li>分析确定了三个主要的Agent错误原因 。</li>
  <li><strong>首先，函数调用错误 (function call errors)</strong>：发生在模型未能选择适当的函数或未能提供符合规范的参数时 。</li>
  <li><strong>其次，违反规则 (rule violations)</strong>：发生在模型无视预定义的场景规则，跳过必要步骤或破坏关键任务逻辑时 。</li>
  <li><strong>最后，信息管理不当 (information mismanagement)</strong>：源于模型在多轮交互中无法正确记录或处理上下文信息，导致输出偏离预期 。</li>
</ul>

<h4 id="43-further-analysis">4.3 Further Analysis</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/tab6.png" alt="avatar" style="zoom:50%;" /></div>

<p><strong>扩展法则 (Scaling Law)</strong>：</p>

<ul>
  <li>研究人员评估了Qwen2.5-Coder（3B, 7B, 14B, 32B）和Qwen2.5-Instruct（3B, 7B, 14B, 32B, 72B）在ACEBench数据集上的性能 。</li>
  <li>如图7所示，实验结果表明，随着模型规模（model size）的增加，性能在各种任务上都有显著提升，在复杂任务上观察到的结果尤其强劲 。</li>
  <li>然而，值得注意的是，随着模型规模持续增大，性能提升的速率开始减慢，尤其是在32B和72B模型之间 。这表明，虽然增加模型参数最初会带来实质性的性能增益，但进一步扩展的边际效益会下降 。</li>
</ul>

<p><strong>提示策略的影响 (Impact of Prompting Strategies)</strong>：</p>

<ul>
  <li>
    <p>提示（Prompt）设计对语言模型性能有显著影响 。研究人员测试了三种策略 ：</p>

    <ol>
      <li>
        <p><strong>Standard Prompt (标准提示)</strong>：一个旨在消除信息不足干扰的综合模板 。</p>

        <div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig23.png" alt="avatar" style="zoom:100%;" /></div>
      </li>
      <li>
        <p><strong>Condensed Prompt (精简提示)</strong>：保留核心指令的紧凑版本，测试在减少但足够指导下的性能 。</p>

        <div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig25.png" alt="avatar" style="zoom:100%;" /></div>
      </li>
      <li>
        <p><strong>Minimal Prompt (最小提示)</strong>：一种高度缩写的形式（例如关键词），评估模型从超简洁输入中推断任务的能力 。</p>

        <div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ACEBench/fig26.png" alt="avatar" style="zoom:100%;" /></div>
      </li>
    </ol>
  </li>
  <li>
    <p>表6中的实验结果表明，使用标准提示模板的模型获得了最高的总体准确率 。这归功于标准提示中严格的格式规范，有效减轻了无关变量的干扰 。</p>
  </li>
  <li>
    <p>这些实证研究结果为未来的提示工程提供了关键见解：通过明确的格式要求来增强函数调用提示的标准化，可以显著提高执行准确性 。</p>
  </li>
</ul>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="CL" /><category term="Agent" /><category term="LLM" /><category term="NLP" /><summary type="html"><![CDATA[论文地址：ACEBench：Who Wins the Match Point in Tool Usage 论文实现：https://github.com/chenchen0103/ACEBench]]></summary></entry><entry xml:lang="en"><title type="html">Genome Biology-2025 Evaluating the representational power of pre-trained DNA language models for regulatory genomics</title><link href="https://tyang816.github.io/bi/Evaluating-the-representational-power-of-pre-trained-DNA-language-models-for-reg/" rel="alternate" type="text/html" title="Genome Biology-2025 Evaluating the representational power of pre-trained DNA language models for regulatory genomics" /><published>2025-06-14T00:00:00+08:00</published><updated>2025-06-14T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/Evaluating%20the%20representational%20power%20of%20pre-trained%20DNA%20language%20models%20for%20reg</id><content type="html" xml:base="https://tyang816.github.io/bi/Evaluating-the-representational-power-of-pre-trained-DNA-language-models-for-reg/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://genomebiology.biomedcentral.com/articles/10.1186/s13059-025-03674-8">Evaluating the representational power of pre-trained DNA language models for regulatory genomics</a></p>

  <p>论文实现：<a href="https://github.com/amberT15/LLM_eval">https://github.com/amberT15/LLM_eval</a></p>
</blockquote>

<h2 id="glm-eval评估glm在各种zero-shot下游任务表现">gLM-eval：评估glm在各种zero-shot下游任务表现</h2>

<h3 id="abstract">Abstract</h3>

<p>genomic language models (gLMs)的涌现提供了一个无监督的方法来学习非编码基因组中的顺式调控模式。先前的评估已经展现了预训练的gLMs可以提高调节基因组任务的预测能力，尽管这样的微调效果很好，但确定gLM表征是否体现了对顺式调节生物学的基本理解仍然是一个悬而未决的问题。这里我们用预训练模型来解释跨越DNA和RNA调控的细胞类型特异性功能基因组学数据。研究结果表明，与使用单热编码序列的传统机器学习方法相比，目前的glm并没有提供实质性的优势。这项工作强调了当前glm的一个主要局限性，提出了非编码基因组的传统预训练策略的潜在问题</p>

<h3 id="introduction">Introduction</h3>

<p>预训练蛋白质模型的表征用途很多，可以预测蛋白质结构、非同义突变效应，设计新的蛋白质序列，研究蛋白质进化关系</p>

<p>而对基因组DNA序列进行预训练的模型加速了对非编码基因组中的功能元素理解，gLMs原则上可以帮助理解转录因子（TFs）控制顺式调节元件（CREs）活性的复杂协调</p>

<p>输入是DNA序列，分词方法有单核苷酸和k-mer两种，基础架构有transformer，多头注意力或者一些变体，或是残差连接的卷积网络；数据比较丰富，比如有单个物种的基因组，多个物种的基因组或是基因组的特定区域，比如未翻译区域（UTRs）、pre-mRNA、启动子、编码区、非编码RNA或是保守位点</p>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig1.png" alt="avatar" title="avatar" />​</p>

<p>这里作者评估了六种主要的功能基因组预测任务，涵盖了在DNA和RNA水平上的顺式调控复杂性，结果显示目前的预训练gLMs并没有比传统的one-hot表示+深度学习强多少。同时，对功能的基因组数据进行监督学习的foundation models可以更好的迁移到其他功能基因组数据上。还有结果显示，当前的gLM的预训练方案难以理解细胞类型特定功能元素，还不能实现真正的基础模型的效果</p>

<h3 id="results">Results</h3>

<h4 id="task-1-predicting-cell-type-specific-regulatory-activity-from-lentimpra-data">Task 1: Predicting cell-type specific regulatory activity from lentiMPRA data</h4>

<p>通过考虑两种细胞类型，即HepG2和K562，我们可以评估预训练的gLM表示是否捕获了细胞类型特异性的CRE活性，输入DNA序列，预测一个CRE的标量</p>

<p>使用CLS token或是mean embedding，使用CNN作为Baseline，用倒数第二层的full embedding和one-hot序列做比较，还是用了一个有监督的foundation model Sei，使用one-hot sequence的ResNet model，以做到全面而公平的比较</p>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig2.png" alt="avatar" title="avatar" />​</p>

<p>fig2 b可以看到很多情况下，embedding方法甚至不如one-hot</p>

<h4 id="task-2-predicting-tf-binding-sites-from-chip-seq-data">Task 2: Predicting TF binding sites from ChIP-seq data</h4>

<p>TF binding是一个细胞类型特异性的现象，而标准的语言建模方法是没有做到cell-type感知的，一个可能的原因是lentiMPRA预测任务在训练时丢失了关键motif</p>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig3.png" alt="avatar" title="avatar" />​</p>

<h4 id="task-3-zero-shot-variant-effect-prediction-with-mpra-data">Task 3: Zero-shot variant effect prediction with MPRA data</h4>

<p>预测非编码突变</p>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/tab1.png" alt="avatar" title="avatar" />​</p>

<p>使用gLM嵌入在lentiMPRA数据上训练的cnn相对于预先训练的同行产生了明显更好的性能</p>

<h4 id="task-4-predicting-alternative-splicing-from-rna-seq-data">Task 4: Predicting alternative splicing from RNA-seq data</h4>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig4.png" alt="avatar" title="avatar" />​</p>

<p>先前的研究表明，Nucleotide-Transformer和GPN已经学习了与基因定义和剪接位点相关的特性，使用ASCOT数据集测试</p>

<h4 id="task-5-predicting-rna-pol-ii-elongation-potential-from-insert-seq-data">Task 5: Predicting RNA pol II elongation potential from INSERT-seq data</h4>

<p>以nt RNA序列作为输入，并预测RNA pol II的延伸，使用INSERT-seq dataset，从fig4可以看到预训练模型并不一定能取得更好的效果</p>

<h4 id="task-6-predicting-rna-binding-protein-binding-with-eclip-seq-data">Task 6: Predicting RNA-binding protein binding with eCLIP-seq data</h4>

<p>RBP对于不同的RNA加工阶段都是必不可少的，使用eCLIP-seq（增强染色质免疫沉淀测序）数据集检测了gLMs预测RBP结合位点的能力</p>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig5.png" alt="avatar" title="avatar" />​</p>

<h4 id="uncovering-cell-type-specific-motifs-learned-by-glms-is-challenging">Uncovering cell-type-specific motifs learned by gLMs is challenging</h4>

<p>​<img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/glm-eval/fig6.png" alt="avatar" title="avatar" />​</p>

<h3 id="discussion">Discussion</h3>

<p>与标准的one-hot序列相比，gLM表示几乎没有提供任何优势</p>

<p>选择不对每个下游任务上的gLM的权重进行微调，虽然gLM的性能可能会通过微调而提高，但本研究的范围是严格衡量在训练前所学到的顺式调节生物学知识</p>

<p>将当前的预训练的任务MLM扩展到整个基因组，难以捕获非编码基因组中有意义的表征，目前尚不清楚使用标准语言建模目标（即MLM或CLM）预训练的glm的持续缩放是否会最终会涌现s</p>

<p>​</p>

<hr />

<p>​</p>]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="DNA" /><category term="genomics" /><category term="PLM" /><summary type="html"><![CDATA[论文地址：Evaluating the representational power of pre-trained DNA language models for regulatory genomics 论文实现：https://github.com/amberT15/LLM_eval]]></summary></entry><entry xml:lang="en"><title type="html">ICMLw-2025 ProteinCrow：A Language Model Agent That Can Design Proteins</title><link href="https://tyang816.github.io/bi/ProteinCrow-A-Language-Model-Agent-That-Can-Design-Proteins/" rel="alternate" type="text/html" title="ICMLw-2025 ProteinCrow：A Language Model Agent That Can Design Proteins" /><published>2025-05-01T00:00:00+08:00</published><updated>2025-05-01T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/ProteinCrow%EF%BC%9AA%20Language%20Model%20Agent%20That%20Can%20Design%20Proteins</id><content type="html" xml:base="https://tyang816.github.io/bi/ProteinCrow-A-Language-Model-Agent-That-Can-Design-Proteins/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://openreview.net/forum?id=ljXgWDtqCu&amp;referrer=%5Bthe+profile+of+Cade+W+Gordon%5D%28%2Fprofile%3Fid%3D%7ECade_W_Gordon1%29">ProteinCrow：A Language Model Agent That Can Design Proteins</a></p>

  <p>论文实现：<无></无></p>
</blockquote>

<h2 id="proteincrowagentbindcraft设计蛋白">ProteinCrow：Agent+BindCraft设计蛋白</h2>

<h3 id="abstract">Abstract</h3>

<p><strong>ProteinCrow</strong> 是一个<strong>基于大型语言模型（LLM）的代理（agentic）蛋白质设计助手</strong> 。近期，深度学习领域的突破（如AlphaFold, RFdiffusion, BindCraft和ProteinMPNN等工具）彻底改变了蛋白质结构和序列建模，使得设计具有新功能的蛋白质成为可能 。成功的计算机蛋白质工程流程通常需要整合多个专用模型，并结合生物化学知识进行迭代优化 。</p>

<p>ProteinCrow正是在此背景下被提出的。它能够<strong>整合多模态信息</strong>，包括结构数据、深度学习模型、科学文献以及用自然语言表达的生物化学数据 。通过使用<strong>36个专家策划的工具</strong>，ProteinCrow可以自动化地执行蛋白质设计任务 。</p>

<p>为了评估其性能，研究人员在以下三个任务中对ProteinCrow进行了测试：</p>

<ul>
  <li>设计针对特定二级结构基序（secondary-structure motifs）的结合蛋白库（binder libraries） 。</li>
  <li>重新设计蛋白质骨架以提高其稳定性 。</li>
  <li>优化结合蛋白以消除预测的主要组织相容性复合体I类（MHC Class I）抗原表位 。</li>
</ul>

<h3 id="1-introduction">1 Introduction</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<p>计算蛋白质设计已成为加速创造具有新功能蛋白质的重要工具，其应用范围从工程化高亲和力的治疗性结合蛋白到优化酶的活性和稳定性 。传统方法依赖于基于物理学的模型，如Rosetta，来评估蛋白质结构 。</p>

<p>近年来，深度学习方法——例如<strong>AlphaFold2 (AF2)、RFDiffusion和ProteinMPNN</strong>——通过实现精确的结构预测和序列优化，已经<strong>彻底改变了这一领域</strong> 。然而，<strong>没有任何单一方法能完全捕捉序列、结构和功能之间的复杂相互作用</strong> 。</p>

<p><strong>本文的假设是</strong>：大型语言模型（LLM）能够将深度学习模型的输出、生物化学数据、科学文献以及基于物理学的方法统一为自然语言，从而可以作为一个框架来整合关于蛋白质的多模态信息，并促进有效的蛋白质设计 。</p>

<p>在这项工作中，作者们提出了<strong>ProteinCrow</strong>，这是一个<strong>LLM代理（agent）</strong>，它通过整合多种工具，能够根据自然语言提示（prompts）生成满足特定约束条件的蛋白质序列库 。ProteinCrow还通过<strong>PaperQA</strong>（一个为检索和总结科学文献而优化的代理）来整合基于文献的见解，这模仿了专家查阅特定蛋白质家族或任务相关知识的方式 。ProteinCrow可以执行目前由人类完成的子任务，例如将大蛋白质裁剪成小区域、识别结合的“热点”残基，以及使用计算机模拟指标分析设计出的序列 。通过为该代理提供人类计算蛋白质工程师所使用的深度学习方法、数据库查询工具和基于物理学的方法（如Rosetta），ProteinCrow能够产出具有优化稳定性的设计，并生成用于实验验证的蛋白质序列库 。</p>

<p>尽管近期有一些将LLM融入蛋白质设计流程的尝试，但它们在自主性（autonomy）和范围上有所不同 。例如，<strong>310.ai</strong>提供了一个自然语言驱动的聊天界面，但它并非自主代理 。相比之下，<strong>ProteinForceGPT</strong>是一个自主LLM代理，但其应用范围更特定，用于从预训练结构中预测力-分离曲线 。</p>

<p>尽管大多数蛋白质设计代理是专用或范围有限的，但在化学合成、材料研究和实验设计等其他领域，已经探索了更通用的LLM代理 。<strong>ProteinCrow是使用Aviary框架构建的LLM代理，旨在促进通用的蛋白质设计</strong> 。Aviary是一个用于在复杂任务上构建和训练LLM代理的框架 。一个LLM代理是一个决策实体，能够观察环境、进行推理并执行一个动作 。对于ProteinCrow而言，“动作”就是一次<strong>工具调用</strong>（tool call），用于蛋白质结构/序列分析、生成式设计或库设计 。该代理在一个循环中持续运行，根据新的观察或工具输出来决定下一步行动，直到达到预期目标 。</p>

<p>作者们在以下三个任务上对ProteinCrow进行了评估 ：</p>

<ul>
  <li><strong>任务1：目标导向的蛋白质设计</strong> - 在结构和功能约束下提高目标序列的稳定性 。</li>
  <li><strong>任务2：自动化的结合蛋白设计流程</strong> - 生成在库组成、结合蛋白结构和序列属性上具有约束的结合蛋白库 。</li>
  <li><strong>任务3：优化结合蛋白</strong> - 通过重新设计一个先前设计好的结合蛋白来生成一个序列库，以消除预测的MHC I类抗原表位 。</li>
</ul>

<h3 id="2-methods">2 Methods</h3>

<h4 id="21-llm-framework---aviary">2.1. LLM Framework - Aviary</h4>

<p>ProteinCrow 在 <strong>Aviary</strong> 框架内运行，该框架是一个可扩展的语言代理gymnasium 。Aviary 将代理的序贯决策过程构建为一个基于语言的、部分可观察的马尔可夫决策过程（POMDP），这使得代理能够迭代地优化蛋白质序列 。为 ProteinCrow 构建的工具也可以转移到 Aviary 之外的其他代理框架中 。</p>

<p>ProteinCrow 通过调用工具并接收观察结果（observations）来为下一步行动提供信息，从而优化蛋白质稳定性、设计符合特定约束的结合蛋白库，以及优化已知的结合蛋白 。所有实验均使用 <strong>Claude-3.5-Sonnet-20241022</strong> 模型，采样温度设置为0.1 。</p>

<h4 id="22-tools">2.2 Tools</h4>

<p>ProteinCrow 可以使用多种工具，大致分为以下几类 ：</p>

<ul>
  <li><strong>生化描述符 (Biochemical Descriptors)</strong>: 用于生化分析的工具，包括界面表征、键类型分析、序列复杂性、残基疏水性和二级结构注释 。</li>
  <li><strong>深度学习模型 (Deep Learning Models)</strong>: 用于各种蛋白质设计任务的深度学习模型，包括结合蛋白设计、反向设计（inverse design）、骨架生成和蛋白质语言模型 。</li>
  <li><strong>Rosetta协议 (Rosetta Protocols)</strong>: 执行Rosetta协议的工具，广泛用于蛋白质结构建模和蛋白质-蛋白质界面分析 。</li>
  <li><strong>任务管理 (Task Management)</strong>: 用于管理与提示相关的各种任务，例如向库中提交序列和跟踪任务完成情况 。</li>
  <li><strong>序列信息学 (Sequence Informatics)</strong>: 用于基于序列的分析，包括残基属性、多序列比对和识别保守位点 。</li>
  <li><strong>知识检索 (Knowledge Retrieval)</strong>: 用于从数据库和文献中查询和检索相关信息 。</li>
</ul>

<p>为了解决各种深度学习模型之间频繁出现的版本冲突和兼容性问题，ProteinCrow 中的大多数工具都通过 <strong>Modal</strong> 在API端点上运行，这使得 AlphaFold、ProteinMPNN、ESM2 和 BindCraft 等多个模型能够在沙盒环境中执行 。</p>

<h4 id="23-task-1---goal-directed-protein-design">2.3 Task 1 - Goal Directed Protein Design</h4>

<h5 id="231-redesign-protein-backbones-for-improved-stability-with-structural-constrains">2.3.1 Redesign Protein Backbones for Improved Stability with Structural Constrains</h5>

<p>目标导向的蛋白质工程涉及对目标蛋白进行突变以实现预期目标，例如提高稳定性 。在此任务中，ProteinCrow 被要求在重新设计蛋白质骨架时，<strong>不仅要提高其稳定性，还要增加盐桥的数量</strong> 。ProteinCrow 可以通过调整 ProteinMPNN 中氨基酸类型的偏置权重（bias weights）来偏向于特定的残基 。盐桥是通过计算突变后所有酸性（Asp, Glu）和碱性（Arg, Lys, His）原子对之间距离小于4.0 Å的数量来识别的 。</p>

<p>为了评估性能，研究人员从一个大规模稳定性数据集中随机选择了30个蛋白质（长度为40-72个氨基酸） 。突变引起的自由能变化（ΔΔG）使用 Rosetta <code class="language-plaintext highlighter-rouge">cartddG</code> 协议计算 。此外，还计算了以下指标进行综合评估：</p>

<ul>
  <li>Rosetta ΔΔG 小于0的突变百分比</li>
  <li>氨基酸使用频率</li>
  <li>序列多样性</li>
  <li>使用ESM2计算的伪对数似然值（pseudo log-likelihood）</li>
  <li>来自AlphaFold2的pLDDT置信度分数</li>
</ul>

<h5 id="232-redesign-enzyme-backbones-while-preserving-functional-residues">2.3.2 Redesign Enzyme Backbones While Preserving Functional Residues</h5>

<p>为了测试 ProteinCrow 在<strong>增强蛋白质稳定性同时不损害其功能</strong>的能力，研究人员使用了先前研究中的两种蛋白质：肌红蛋白（Myoglobin）和TEV蛋白酶（TEV protease） 。研究人员将 ProteinCrow 选择的突变位点与原始研究中人类设计师为保留功能而选择保留的位点进行比较，以评估 ProteinCrow 是否能避免在这些功能性位点上提出突变 。</p>

<p>评估指标中增加了一项“<strong>功能位点保留</strong>”（Functional site preservation），即计算 ProteinCrow 选择的突变位点与先前研究中功能位点的重合次数 。</p>

<h3 id="3-task-2---automated-binder-design-pipeline">3. Task 2 - Automated Binder Design Pipeline</h3>

<p>文中首先介绍了<strong>BindCraft</strong>，这是一个用于<em>de novo</em>（从头）蛋白质结合蛋白设计的高效深度学习模型，其报道的实验成功率在10%到100%之间 。BindCraft的设计流程包含多个需要根据不同蛋白质靶点进行优化的设置，例如迭代次数、设计权重和筛选标准，这些通常由人类专家来选择 。</p>

<h4 id="31-designing-binders-for-epidermal-growth-factor-receptor-egfr">3.1 Designing Binders for Epidermal Growth Factor Receptor (EGFR)</h4>

<p>为了在一个具有挑战性的真实世界靶点上评估ProteinCrow，研究人员选择了<strong>表皮生长因子受体EGFR蛋白</strong>（PDB ID: 6ARU） 。该靶点曾在一个由AdaptyvBio主办的全社区范围的结合蛋白设计竞赛中使用过 。ProteinCrow的设计质量采用了与AdaptyvBio竞赛相同的评估指标，以便与那些经过实验验证的顶级参赛作品进行比较 。</p>

<p>ProteinCrow在多种约束条件下接受了评估，具体实验包括：</p>

<ul>
  <li><strong>自动化的端到端结合蛋白生成</strong>：要求ProteinCrow为EGFR生成一个结合蛋白，并进行10次重复实验 。</li>
  <li><strong>靶向结构基序设计</strong>：竞赛中表现最好的结合蛋白具有显著的β-折叠（β-sheet）元件 。为了测试ProteinCrow是否能优化BindCraft的设计参数以生成特定结构基序，研究人员要求它设计一个包含β-折叠元件的结合蛋白 。</li>
  <li><strong>约束感知的结合蛋白库设计</strong>：要求ProteinCrow生成一个包含5个结合蛋白的库，并满足<strong>三个约束条件</strong> ：
    <ol>
      <li>每个新的结合蛋白必须与已知的结合蛋白至少有10个点突变的差异 。</li>
      <li>生成的库在二级结构组成上应表现出多样性 。</li>
      <li>针对蛋白质上不同的“热点”残基进行设计 。</li>
    </ol>
  </li>
</ul>

<h4 id="32-generalizing-proteincrow-to-distinct-protein-targets">3.2 Generalizing ProteinCrow to Distinct Protein Targets</h4>

<p>该部分首先总结道，结果表明ProteinCrow能够通过为BindCraft选择合适的输入，在没有人工干预的情况下，为多样的蛋白质靶点和库约束条件自动化并执行BindCraft设计流程 。</p>

<p>每个结合蛋白库中序列的性能通过以下广泛使用的<strong>计算机模拟（in-silico）指标</strong>进行评估：</p>

<ul>
  <li><strong>AlphaFold分数</strong>：使用AlphaFold-Multimer模型产生的pLDDT、iPAE和iPTM分数，来评估设计出的结合蛋白序列的结构质量、对齐准确性和预测的转换矩阵 。</li>
  <li><strong>ESM伪对数似然分数</strong>：使用蛋白质语言模型ESM2来评估生成序列的似然度（likelihood） 。</li>
  <li><strong>二级结构组成</strong>：分析结合蛋白的二级结构注释，以确保它们包含设计约束在提示中要求的结构元件 。</li>
</ul>

<h3 id="4-task-3---optimizing-a-binder-to-reduce-mhc-class-i-epitopes">4. Task 3 - Optimizing a Binder to Reduce MHC Class I Epitopes</h3>

<p>在治疗性结合蛋白的设计中，一个关键步骤是优化其特性，例如稳定性、聚集倾向和<strong>免疫原性（immunogenicity）</strong>，同时还要保持对靶点的亲和力 。</p>

<p>为了评估ProteinCrow执行此类优化任务的能力，研究人员从一个<strong>经过实验验证的EGFR结合蛋白</strong>（来自Adaptivbio社区结合蛋白设计竞赛）开始 。他们要求ProteinCrow生成一个包含10个变体序列的库，并进行5次重复实验，目标是<strong>消除预测出的MHC I类抗原表位</strong> 。</p>

<ul>
  <li><strong>预测工具</strong>：研究中使用了 <strong>netMHCpan 4.1</strong> 来预测所有8-14个氨基酸长度的肽段与 <code class="language-plaintext highlighter-rouge">HLA-A*02:01</code> 等位基因的结合亲和力 。</li>
  <li><strong>评估指标</strong>：最后，研究人员通过两个指标对设计出的序列进行排序和比较：
    <ul>
      <li><strong>ESM2伪对数似然分数</strong> 。</li>
      <li>预测出的<strong>MHC I类结合蛋白的总数</strong>（包括强结合和弱结合的） 。</li>
    </ul>
  </li>
</ul>

<h3 id="5-results">5 Results</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="51-optimizing-protein-stability-while-improving-number-of-salt-bridges">5.1 Optimizing Protein Stability while improving number of salt bridges</h4>

<p>这项任务旨在评估ProteinCrow执行目标导向蛋白质设计的能力 。研究人员要求它提出既能<strong>提高折叠稳定性</strong>（通过Rosetta ΔΔG&lt;0 衡量）又能<strong>引入更多盐桥</strong>的突变 。ProteinCrow综合使用了基于结构、序列、文献、深度学习和Rosetta的工具来分析每个目标蛋白并生成设计方案 。</p>

<ul>
  <li><strong>结果</strong>：在30个基准蛋白质上，ProteinCrow在许多情况下成功地找到了同时满足这两个标准的突变 。</li>
  <li><strong>与基线比较</strong>：相比之下，基线模型ProteinMPNN虽然能有效生成低$\Delta\Delta G$的变体，但本身并不会增加盐桥的数量 。</li>
  <li><strong>结论</strong>：这些结果表明，ProteinCrow有潜力处理那些通常需要专家指导和迭代才能解决的、更细致的设计目标 。</li>
</ul>

<h4 id="52-designing-stable-mutations-while-preserving-function">5.2. Designing stable mutations while preserving function</h4>

<p>这项任务评估了ProteinCrow识别功能性残基并避免对其进行突变的能力 。</p>

<ul>
  <li><strong>结果</strong>：与随机基线相比，对于肌红蛋白和TEV蛋白酶，ProteinCrow在超过45%的重要位点上提出的突变<strong>显著减少</strong> 。一项消融研究（ablation study）显示，在重新设计骨架时，<strong>引入文献检索可以进一步减少</strong>ProteinCrow选择功能性重要位点的数量 。</li>
  <li><strong>讨论</strong>：作者认为，尽管该代理成功地捕捉了一些专家知识，但它可能仍会忽略其他关键残基，这可能是由于其在解释功能和结构信息方面存在局限性 。不过，其模块化框架为通过训练或整合更多工具来进行改进提供了可能 。</li>
</ul>

<h4 id="53-designing-binders-for-epidermal-growth-factor-receptor-egfr">5.3. Designing Binders for Epidermal Growth Factor Receptor (EGFR)</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig7.png" alt="avatar" style="zoom:100%;" /></div>

<ul>
  <li><strong>自动化的端到端结合蛋白生成</strong>：在10次重复实验中，ProteinCrow每次都成功地为EGFR生成了结合蛋白 。它会自动检索蛋白质结构，进行结构分析，识别关键结合热点，执行BindCraft工作流程，并构建一个潜在的结合蛋白序列库 。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig8.png" alt="avatar" style="zoom:50%;" /></div>

<ul>
  <li><strong>靶向结构基序设计</strong>：当被要求设计包含<strong>β-折叠元件</strong>（一种在竞赛顶级结合蛋白中出现的结构）的结合蛋白时，ProteinCrow通过调整BindCraft流程中的设计权重，成功设计并添加了一个具有显著β-折叠区域的结合蛋白到库中 。</li>
</ul>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig3.png" alt="avatar" style="zoom:50%;" /></div>

<ul>
  <li><strong>约束感知的结合蛋白库设计</strong>：ProteinCrow成功地生成了一个包含5个结合蛋白的库，同时满足了<strong>三个复杂的约束条件</strong>：1）每个结合蛋白与已知序列有足够差异；2）库的二级结构组成多样化；3）利用了不同的靶点热点残基 。</li>
</ul>

<h4 id="54-generalizing-proteincrow-to-distinct-protein-targets">5.4. Generalizing ProteinCrow to Distinct Protein Targets</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig4.png" alt="avatar" style="zoom:50%;" /></div>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig9.png" alt="avatar" style="zoom:100%;" /></div>

<p>ProteinCrow成功地为<strong>SARS-CoV-2受体结合域（RBD）和β-桶折叠BBF-14</strong>这两个截然不同的靶点生成了包含5个结合蛋白序列的库，并且遵循了所有必需的库约束条件 。这些结果表明，ProteinCrow的设计流程可以<strong>泛化到多种多样的蛋白质靶点</strong>上 。</p>

<h4 id="55-reducing-mhc-class-i-epitopes-in-a-binder">5.5. Reducing MHC Class I Epitopes in a Binder</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProteinCrow/fig5.png" alt="avatar" style="zoom:50%;" /></div>

<p>在这个任务中，ProteinCrow被赋予了使用<code class="language-plaintext highlighter-rouge">netMHCpan</code>工具的能力，用于预测一个已知EGFR结合蛋白中的MHC I类结合表位 。</p>

<ul>
  <li><strong>结果</strong>：在总共50个设计中，<strong>74%的提议突变降低了预测的MHC I类结合表位的数量</strong> 。</li>
  <li><strong>额外发现</strong>：此外，所有50个经过优化的序列的<strong>ESM2伪对数似然分数都比原始结合蛋白更高</strong> 。</li>
</ul>

<h3 id="6-discussion">6. Discussion</h3>

<p>用于结构预测、反向设计和蛋白质语言模型的深度学习方法已经改变了蛋白质工程领域，使得新型蛋白质的快速生成成为可能 。人类蛋白质工程师通常会利用专家知识，将这些关于蛋白质结构和序列的基础模型结合起来，以构建有效的设计流程 。</p>

<p><strong>ProteinCrow整合了蛋白质设计界常用于构建这些流程的工具</strong> 。它是一个用于蛋白质设计的自主LLM代理（Agent），在这项工作中被应用于三个常见的蛋白质工程任务：蛋白质稳定性优化、结合蛋白设计和结合蛋白优化 。</p>

<p>研究表明，<strong>ProteinCrow能够遵循复杂的、非线性的工作流程</strong> 。这一点对于构建一个通用代理至关重要，因为蛋白质设计是高度依赖于特定靶点和任务的，并且可以通过多种多样的工具来实现预期结果 。此外，ProteinCrow环境的<strong>模块化特性使得新工具的集成变得十分便捷</strong> 。</p>

<p>作者指出，<strong>本研究仅限于使用计算机模拟（in-silico）的评估标准</strong>来展示LLM代理完成多样化蛋白质工程任务的能力 。在未来的工作中，他们期望在实验室中评估ProteinCrow的成功率，将计算机模拟的预测转化为实验验证，并探索如何整合反馈来训练和增强该代理 。</p>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="protein" /><category term="Agent" /><summary type="html"><![CDATA[论文地址：ProteinCrow：A Language Model Agent That Can Design Proteins 论文实现：]]></summary></entry><entry xml:lang="en"><title type="html">arXiv-2025 Scaling unlocks broader generation and deeper functional understanding of proteins</title><link href="https://tyang816.github.io/bi/Scaling-unlocks-broader-generation-and-deeper-functional-understanding-of-proteins/" rel="alternate" type="text/html" title="arXiv-2025 Scaling unlocks broader generation and deeper functional understanding of proteins" /><published>2025-04-15T00:00:00+08:00</published><updated>2025-04-15T00:00:00+08:00</updated><id>https://tyang816.github.io/bi/Scaling%20unlocks%20broader%20generation%20and%20deeper%20functional%20understanding%20of%20proteins</id><content type="html" xml:base="https://tyang816.github.io/bi/Scaling-unlocks-broader-generation-and-deeper-functional-understanding-of-proteins/"><![CDATA[<blockquote>
  <p>论文地址：<a href="https://www.biorxiv.org/content/10.1101/2025.04.15.649055v1.full.pdf">Scaling unlocks broader generation and deeper functional understanding of proteins</a></p>

  <p>论文实现：<a href="https://github.com/Profluent-AI/progen3">https://github.com/Profluent-AI/progen3</a></p>
</blockquote>

<h2 id="progen3moeglmclm蛋白质设计">ProGen3：MOE+GLM+CLM蛋白质设计</h2>

<h3 id="abstract">Abstract</h3>

<p>生成式蛋白质语言模型（Protein Language Models, PLMs）是当前用于定制蛋白质设计的强大工具，可广泛应用于医药、农业和工业等领域。尽管已有研究训练了规模不断扩大的语言模型，但关于<strong>最优训练数据分布</strong>和<strong>模型规模对生成蛋白序列的影响</strong>仍缺乏系统研究。</p>

<p>本文提出了<strong>ProGen3</strong>系列的稀疏生成式蛋白语言模型，并推导了<strong>计算最优的 scaling law（扩展规律）</strong>，将模型扩展至<strong>460亿参数</strong>，并在<strong>1.5万亿个氨基酸 token</strong>上进行预训练。ProGen3 的预训练数据采样自精心构建的<strong>Profluent Protein Atlas v1（PPA-1）</strong>，包含<strong>34 亿条全长蛋白质序列</strong>。</p>

<p>研究首次在<strong>湿实验（wet lab）中系统评估了模型规模对生成蛋白质序列的影响</strong>，发现<strong>更大规模的模型能够生成来自更广泛蛋白家族的可表达蛋白质</strong>。</p>

<p>此外，无论在计算还是实验上，结果都表明<strong>更大模型在对实验数据对齐（alignment）时表现出更高的响应性</strong>，从而在<strong>蛋白质适应度预测</strong>和<strong>序列生成能力</strong>上实现显著提升。</p>

<p>总体而言，这项研究表明，<strong>如 ProGen3-46B 这类大规模、基于高质量数据训练的蛋白质语言模型</strong>，可作为强有力的基础模型，推动<strong>蛋白质设计领域</strong>的研究边界。</p>

<h3 id="1-introduction">1 Introduction</h3>

<p>蛋白质在各类生物过程中发挥核心作用，涵盖催化反应、免疫调节、信号通路调控以及分子运输等功能，在治疗、农业、能源和工业等领域均具有重要应用价值。长期以来，功能性蛋白主要依赖于自然发现，而人工设计通常依靠随机突变与实验筛选，方法依赖性强且效率较低，难以满足特定场景下对蛋白功能的定制需求。</p>

<p>近年来，随着 DNA 测序成本的大幅下降，大规模天然蛋白质序列得以被采集。生成式蛋白语言模型（Protein Language Models, PLMs）因此应运而生，成为学习自然蛋白序列分布的有效工具。已有研究实验证明，PLMs 在多种实际任务中具备设计功能性蛋白的能力。</p>

<p>PLMs 的发展路径与自然语言处理（NLP）中的语言模型高度一致。NLP 领域已广泛验证，<strong>更大规模的模型</strong>不仅具备更强的迁移能力，还能通过精细的模型与数据扩展策略获得更优的性能。而在蛋白质建模领域，已有工作指出，PLMs 所学习的 embedding 可隐式捕捉蛋白质适应度，并能在监督或无监督场景下进行有效利用。</p>

<p>尽管如此，PLM 研究中仍存在若干关键问题尚未充分探索：</p>

<ol>
  <li>在蛋白数据量爆炸式增长的背景下，如何构建最优训练分布仍缺乏系统性研究；</li>
  <li>相较于 embedding 层表征的性能评估，尚不清楚生成序列本身在模型扩展下的表现如何；</li>
  <li>虽然 NLP 和蛋白建模领域均已有通过后训练策略对齐模型以满足用户偏好的尝试，但模型规模对对齐效果的具体影响尚无系统研究。</li>
</ol>

<p>为回应上述挑战，研究者提出了 ProGen3——一组基于<strong>稀疏 Mixture-of-Experts（MoE）结构</strong>的自回归蛋白语言模型。该模型系列在保持性能的同时显著提升了训练效率。为训练 ProGen3，作者构建了规模达 34 亿全长蛋白的高质量数据集 Profluent Protein Atlas v1（PPA-1），并据此优化了训练数据分布。</p>

<p>在计算资源限制下，研究者推导了适用于稀疏模型的<strong>计算最优扩展规律（scaling law）</strong>，并据此将模型规模扩展至 460 亿参数，在 1.5 万亿个氨基酸 token 上完成预训练。进一步地，他们首次在湿实验中系统验证了模型规模对生成蛋白质序列表达能力与多样性的影响，发现大型模型能够生成更广泛蛋白空间中的功能性序列。</p>

<p>最后，研究还表明，<strong>通过与实验数据对齐（如 IRPO 策略）</strong>，无论模型规模如何，PLMs 均能显著提升适应度预测与序列生成能力，且<strong>模型越大，受益越显著</strong>。</p>

<h3 id="2-progen3">2 ProGen3</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProGen3/fig1.png" alt="avatar" style="zoom:100%;" /></div>

<h4 id="21-architecture">2.1 Architecture</h4>

<p>ProGen3 是一系列<strong>自回归（autoregressive, AR）蛋白语言模型</strong>（PLMs），基于 Transformer 架构，并引入了<strong>稀疏混合专家（sparse Mixture of Experts, MoE）</strong>机制。每次前向传播仅激活模型总参数的约 27%（如图 1b 所示）。该模型系列涵盖从 1.12 亿到 460 亿参数的 8 种不同规模，所有模型均使用 <strong>8192 token 的上下文长度</strong>。关于架构细节，详见附录 C.1。</p>

<p>与 NLP 中的类似研究一致，作者发现，在固定计算预算下，稀疏模型显著优于同规模的稠密模型（详见附录 C.2）。</p>

<p>标准的 AR PLM 可支持<strong>因果语言建模（causal language modeling, CLM）</strong>，即从 N 端（氨基）到 C 端（羧基），或反向，从 C 端到 N 端逐步生成蛋白质序列。此外，ProGen3 还支持<strong>广义语言建模（generalized language modeling, GLM）</strong>，即在蛋白序列中间进行片段填充（infill）。该过程通过插入特殊哨兵 token 取代目标片段，并将这些片段及其对应哨兵标记放置在序列末尾（图 1a）。这种机制使得用户能够在保留上下文残基的情况下重新设计蛋白的局部区域。详细方法见附录 C.3。</p>

<h4 id="22-training-data">2.2 Training Data</h4>

<p>ProGen3 的预训练数据来自研究者自行构建的高质量蛋白质数据集 <strong>Profluent Protein Atlas v1（PPA-1）</strong>，包含 <strong>34 亿条全长蛋白质序列</strong>，总计约 <strong>1.1 万亿氨基酸 token</strong>。该数据集整合了广泛的基因组和宏基因组来源，并经过多层过滤，确保其适用于训练生成式 PLM。特别地，所有蛋白片段均被排除，仅保留完整序列。整体上，PPA-1 的规模和多样性与 OMG 数据集相当，与 ESM3 的训练数据在序列数量上相近，但 ESM3 包含片段数据。PPA-1 远大于 UniRef和 BFD，更详细的数据处理流程见附录 B。</p>

<p>值得注意的是，尽管蛋白数据集正在迅速扩展，但其内在偏倚仍可能影响训练结果。因此，作者特别关注<strong>训练数据分布的优化问题</strong>，这是此前 PLM 研究较少涉及的方面（详见附录 A.2）。</p>

<p>研究者设计了四种不同的数据平衡策略，对 50% 序列相似性（ID）聚类进行采样控制，分别命名为：<strong>Uniform（均匀）</strong>、<strong>Square Root（平方根）</strong>、<strong>Inverse Log（逆对数）</strong>、<strong>Unmodified（原始分布）</strong></p>

<p>这些策略控制从某个聚类（大小为 <em>n</em>）中采样的概率，分别与 1、$\sqrt{n}$、$\frac{n}{1 + \log n}$ 成正比。每次采样先从 50% 聚类中采样，再在该聚类内选择一个 90% ID 子聚类，最终从中均匀选取一个序列。</p>

<p>为了衡量模型的泛化能力，研究者构建了与训练数据无重合的验证集，分别在 30%、50%、90% ID 水平上采样，每个集合包含 250 万条蛋白质序列，均衡覆盖聚类大小（1–10, 11–100, 101–1000）范围。最终的验证损失是这三个验证集结果的平均。</p>

<p>如图 1d 所示，在训练 token 数固定为 80B 的情况下：</p>

<ul>
  <li><strong>Unmodified 分布</strong>在接近训练数据（90% ID）时表现最好；</li>
  <li><strong>Inverse Log 分布</strong>在远离训练数据（30%、50% ID）时表现最佳；</li>
  <li><strong>Uniform 分布</strong>效果最差，说明 PLM 仍能从频繁出现的蛋白之间学到重要信号。</li>
</ul>

<p>基于以上分析，所有后续模型均采用 <strong>Inverse Log 分布</strong>进行训练。</p>

<h4 id="23-scaling-up-to-a-46b-parameter-model">2.3 Scaling Up to a 46B Parameter Model</h4>

<p>为了在固定计算资源下最优地分配模型参数量与训练数据规模，研究者遵循 <strong>Kaplan 等人提出的扩展规律（scaling law）</strong>，将验证损失建模为模型参数数量 <em>N</em> 与训练 token 数 <em>D</em> 的函数：
\(L(N,D) = \left( AN^{-\alpha/\beta} + BD^{-1} \right)^\beta + C\)
拟合后得出 ProGen3 的稀疏架构满足以下近似最优参数–数据对关系（图 1e）：
\(N_{\text{opt}}(D) = 2.462 \times 10^{-7} \cdot D^{1.479}\)
基于此，计算表明：若总 FLOPs 限制为 $1.1 \times 10^{23}$，理论上应训练一个 900 亿参数模型，使用 753B token，可达到 1.376 的验证损失。但出于实际推理硬件的考虑，研究者选择训练一个 <strong>460 亿参数模型（ProGen3-46B）</strong>，使用 1.5T token，预测验证损失为 1.397，实际结果更优（达到了 <strong>1.345</strong>），超过了 compute-optimal 理论边界。</p>

<p>他们还发现，将 warmup 训练步数从 2000 增加到 10000 可显著提升训练稳定性，这可能是实际损失优于理论预测的一个原因（附录 C.4）。</p>

<h3 id="3-computational-and-experimental-analysis-of-model-generations">3 Computational and Experimental Analysis of Model Generations</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProGen3/fig2.png" alt="avatar" style="zoom:100%;" /></div>

<p>前文已展示：随着预训练计算资源的扩展，PLMs 在验证集上的损失持续降低——无论测试蛋白是否接近训练数据。这意味着<strong>更大规模的模型更好地表示了自然蛋白分布</strong>。</p>

<p>然而，<strong>模型扩展对生成能力的影响</strong>此前鲜有研究。因此，本节聚焦于三种计算开销相差三个数量级的 ProGen3 模型：</p>

<ul>
  <li><strong>ProGen3-339M</strong>：训练于 200B tokens（1.2 × 10²⁰ FLOPs）</li>
  <li><strong>ProGen3-3B</strong>：训练于 500B tokens（2.6 × 10²¹ FLOPs）</li>
  <li><strong>ProGen3-46B</strong>：训练于 1.5T tokens（1.1 × 10²³ FLOPs）</li>
</ul>

<h4 id="31-larger-plms-generate-more-diverse-proteins-that-express-in-vitro">3.1 Larger PLMs generate more diverse proteins that express <em>in vitro</em></h4>

<h5 id="生成与过滤流程"><strong>生成与过滤流程</strong></h5>

<p>作者使用 <strong>top-p 采样（p = 0.95）</strong>，温度在 [0.5,1.0] 区间变化，从每个模型中无条件生成蛋白序列：ProGen3-339M：生成 <strong>4 百万条序列</strong>，ProGen3-3B：生成 <strong>3 百万条序列</strong>，ProGen3-46B：生成 <strong>2 百万条序列</strong></p>

<p>为了提取“蛋白样”的序列，作者对这些生成结果施加以下质量过滤：</p>

<ol>
  <li><strong>低复杂性区域过滤</strong>：移除低复杂性区域占比超过 25% 的序列（语言模型常会生成重复片段）；作为参考，PPA-1 中有 95.5% 的序列通过该过滤。</li>
  <li><strong>终止 token 要求</strong>：必须包含恰当的终止符。</li>
  <li><strong>与自然序列的比对</strong>：要求序列对 PPA-1 中任一自然序列比对覆盖率大于 80%。</li>
</ol>

<p>结果显示：</p>

<ul>
  <li>模型越大，<strong>通过质量过滤的序列越多</strong>；</li>
  <li>从 339M 扩展到 3B 时，<strong>重复序列显著减少</strong>（见图 2a）。</li>
</ul>

<h5 id="结构族覆盖分析更大模型生成更丰富的蛋白类型"><strong>结构族覆盖分析：更大模型生成更丰富的蛋白类型</strong></h5>

<p>接下来，作者将通过质量过滤的序列与 PPA-1 中的 30% 序列身份（ID）聚类代表比对。若某生成序列与某聚类代表的序列满足以下条件，即认为该序列“覆盖”该聚类：</p>

<ul>
  <li>与聚类代表的序列 <strong>ID &gt; 30%</strong></li>
  <li>且 <strong>比对覆盖率 &gt; 90%</strong></li>
</ul>

<p>⚠️ 注意：一个生成序列可能覆盖多个聚类（即便这些聚类代表间彼此 ID &lt; 30%）。</p>

<p>结果：</p>

<ul>
  <li><strong>更大模型生成的序列覆盖更多结构聚类</strong>（图 2b）。</li>
  <li>小模型所覆盖的聚类几乎都被大模型覆盖；</li>
  <li><strong>大模型还能生成小模型完全未触及的新聚类</strong>（图 2c）。</li>
</ul>

<h5 id="模型生成能力是否受困于训练分布使用困惑度解释"><strong>模型生成能力是否受困于训练分布？使用困惑度解释</strong></h5>

<p>为回答“小模型是否能通过增加采样数量生成大模型覆盖的聚类”，作者分析了这些聚类中自然蛋白的 <strong>平均困惑度（perplexity）</strong>：</p>

<ul>
  <li>若某模型对某个聚类中的自然序列赋予高困惑度，则说明它“不理解该聚类”，因而<strong>难以生成来自该聚类的蛋白质</strong>。</li>
</ul>

<p>观察：</p>

<ul>
  <li><strong>大模型能频繁地生成来自小模型高困惑度的聚类</strong>；</li>
  <li>反之则不成立（图 2d）；</li>
  <li>因此，<strong>大模型可完全覆盖小模型的生成能力，但其部分生成分布对小模型而言是“分布外”的</strong>。</li>
</ul>

<p>此外，分析显示：<strong>随着模型规模增长，其在“较小的聚类”上表现更好</strong>（图 2e），这部分解释了其拓展能力。</p>

<h5 id="实验验证体外表达评估split-gfp-系统"><strong>实验验证：体外表达评估（split-GFP 系统）</strong></h5>

<p>为了验证这些生成蛋白在体内是否具有“现实存在性”，作者在大肠杆菌中执行了 <strong>split-GFP 表达实验</strong>，该实验用于评估蛋白质的<strong>可溶性表达水平</strong>，其敏感指标包括：</p>

<ul>
  <li>mRNA 表达量与稳定性、翻译效率、折叠稳定性（热力学和平衡）、抗蛋白酶能力、易聚集性、细胞毒性</li>
</ul>

<p>split-GFP 系统与 SDS-PAGE、Western blot 等直接实验方法高度相关，且适合大规模高通量检测，已广泛用于生成模型 benchmarking</p>

<h5 id="实验设计细节"><strong>实验设计细节</strong></h5>

<p>从不同模型中分别选取以下类别的聚类进行实验：</p>

<ul>
  <li>所有三个模型都生成过的：<strong>42 个聚类</strong></li>
  <li>仅 ProGen3-3B 和 46B 生成过的：<strong>62 个聚类</strong></li>
  <li>仅 ProGen3-46B 生成过的：<strong>45 个聚类</strong>（见图 2f）</li>
</ul>

<p>对于每个聚类：</p>

<ul>
  <li>每个模型各选两条序列：一条对PPA-1自然蛋白 ID 为 <strong>40–60%</strong>，一条为 <strong>60–80%</strong></li>
  <li>优先选择困惑度最低的生成序列；</li>
  <li>控制组为该聚类中的两条随机自然序列；</li>
  <li>所选序列长度覆盖范围为 <strong>75–300 个氨基酸</strong>，具备结构多样性。</li>
</ul>

<h5 id="实验结果蛋白质表达率分析图-2g"><strong>实验结果：蛋白质表达率分析（图 2g）</strong></h5>

<ul>
  <li>所有模型生成序列的平均表达率相近；</li>
  <li>但<strong>更大模型能在更多的聚类中生成可表达蛋白</strong>，表现出更强的泛化；</li>
  <li>对所有模型而言，<strong>ID 为 60–80% 的生成蛋白表达率高于 40–60% 的</strong>；</li>
  <li>有趣的是：<strong>生成蛋白与其所在聚类的自然蛋白在表达率上高度一致</strong>，说明生成序列真实可靠。</li>
</ul>

<h4 id="32-plms-generate-viable-proteins-outside-natural-sequence-space">3.2 PLMs generate viable proteins outside natural sequence space</h4>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProGen3/fig3.png" alt="avatar" style="zoom:100%;" /></div>

<p>在上一节，作者已经证明：PLMs 可以在自然序列聚类中生成<strong>具备表达能力的蛋白质</strong>。</p>

<p>本节的目标是进一步探索：</p>

<blockquote>
  <p><strong>模型是否能够在没有自然参考点的区域（即“自然分布之外”）生成功能蛋白？</strong></p>
</blockquote>

<p>作者设定了如下标准：</p>

<blockquote>
  <p>选取与 PPA-1 数据集中任意蛋白质的序列相似性（Identity）<strong>低于 30%</strong> 或<strong>无法比对（unalignable）</strong>的生成序列。</p>
</blockquote>

<p>这些序列代表了<strong>模型生成能力的极端边界</strong> —— 它们所处的序列空间中 <strong>没有自然蛋白作为“锚点”</strong>。</p>

<p><strong>生成样本选取</strong></p>

<p>从之前无条件生成的蛋白质中，作者按以下规则采样：</p>

<ul>
  <li>按照<strong>二级结构类型</strong>分为三类：
    <ul>
      <li><strong>mostly-alpha（主要为 α 螺旋）</strong></li>
      <li><strong>mostly-beta（主要为 β 折叠）</strong></li>
      <li><strong>mixed alpha/beta（混合型）</strong></li>
    </ul>
  </li>
  <li>每种结构类别下，从每个模型中（ProGen3-339M、3B、46B）各选取 <strong>10 条序列</strong>，共 90 条样本
 （见图 3a，结构预测使用的是 <strong>ESMFold</strong>）</li>
</ul>

<h5 id="实验验证表达能力分析"><strong>实验验证：表达能力分析</strong></h5>

<p>这些 90 条序列被投入到 <strong>split-GFP 体系</strong> 中，在大肠杆菌中评估其<strong>可溶性表达水平</strong>。</p>

<p>作者将它们的表达结果与一个已知表达良好的“正对照蛋白”作比较（图 3b）：</p>

<p><strong>结果：</strong></p>

<ul>
  <li>三个模型生成的蛋白在整体表达能力上<strong>大致相当</strong>；</li>
  <li>但来自 <strong>更大模型（ProGen3-46B）</strong> 的序列在多数情况下拥有<strong>更高的表达水平</strong>，即便它们位于自然分布之外；</li>
  <li>表明：<strong>大模型在生成“全新蛋白”时更有可能得到结构稳定、表达良好的结果</strong>。</li>
</ul>

<h4 id="33-larger-plms-are-better-infillers">3.3 Larger PLMs are better infillers</h4>

<p>ProGen3 不仅支持传统的从头生成（causal generation），还具备强大的 <strong>“infilling”能力</strong> —— 即在<strong>已知蛋白质序列中间的某些位置重建片段</strong>。这类能力对于蛋白设计尤为重要，例如：</p>

<ul>
  <li><strong>改造活性位点、连接环（loops）、可变区等关键区域</strong>；</li>
  <li><strong>保留框架结构的同时引入功能增强突变</strong>。</li>
</ul>

<p>为系统评估不同模型在 infilling 上的表现，作者设计了如下实验：</p>

<h5 id="目标蛋白选择"><strong>目标蛋白选择：</strong></h5>

<ol>
  <li><strong>9 条工业/药用相关蛋白质</strong>（长度 100–400 个氨基酸）：
    <ul>
      <li>这些蛋白具备一定的表达先例，来自人类或常用表达系统；</li>
      <li>每条蛋白中，<strong>随机</strong>选取：<strong>2 段短片段</strong>，<strong>2 段长片段</strong> 使用 ProGen3-3B 和 46B 各自对这些片段进行 infilling。</li>
    </ul>
  </li>
  <li><strong>9 条来自大肠杆菌胞质蛋白（cytosolic E. coli proteins）</strong>（长度 100–300 aa）：
    <ul>
      <li>每条选取：<strong>1 段短片段</strong>，<strong>1 段长片段</strong> 同样由 3B 和 46B 模型分别进行 infill。</li>
    </ul>
  </li>
</ol>

<h5 id="实验评估"><strong>实验评估：</strong></h5>

<ul>
  <li>每段 in-filled 片段，从每个模型中选出 <strong>2 条序列</strong>；</li>
  <li>并测量：这 2 条生成序列的表达水平；对应的<strong>天然完整蛋白</strong>的表达水平（作为 baseline）；</li>
  <li>使用 split-GFP 系统进行可溶性表达量检测。</li>
</ul>

<h5 id="表达分析与模型对比"><strong>表达分析与模型对比</strong></h5>

<ul>
  <li>在这 18 条目标蛋白中，有 <strong>11 条来源于大肠杆菌自身</strong>，理论上它们可能表现出更好的表达；</li>
  <li>但这也意味着 split-GFP 对这些本源蛋白的检测存在 <strong>天花板效应</strong>，或可能偏低估计。</li>
</ul>

<h5 id="实验观察图-3c"><strong>实验观察（图 3c）：</strong></h5>

<ul>
  <li><strong>总体趋势</strong>：infilling 后的表达量平均 <strong>低于天然蛋白</strong>；</li>
  <li>但出现了多例 infill 片段表达 <strong>高于原始蛋白</strong> 的情况，说明 infill 并非总是“降解”功能；</li>
  <li>在所有条件下，<strong>ProGen3-46B 的 infill 表达表现优于 ProGen3-3B</strong>，体现在：
    <ul>
      <li>所有片段平均表达量；</li>
      <li>相同片段下 infill 的相对表达量。</li>
    </ul>
  </li>
</ul>

<h3 id="4-aligning-protein-language-models-to-laboratory-data">4 Aligning Protein Language Models to Laboratory Data</h3>

<div align="center" style="float:center"><img src="https://blog-img-1259433191.cos.ap-shanghai.myqcloud.com/ProGen3/fig4.png" alt="avatar" style="zoom:100%;" /></div>

<p>蛋白语言模型（PLMs）通常基于进化数据进行预训练，为评估其泛化能力，研究者常采用 <strong>零样本适应度预测（zero-shot fitness prediction）</strong> 的标准任务：</p>

<ul>
  <li>任务形式：输入突变后的蛋白序列，让模型基于其概率/似然性进行评估；</li>
  <li>评估方式：将模型对不同突变序列给出的 <strong>似然（log-likelihood）</strong> 与实验中测得的 <strong>适应度评分</strong> 做 <strong>Spearman 等级相关系数（ρ）</strong> 分析；</li>
  <li>数据来源：通常使用深度突变扫描（<strong>Deep Mutational Scanning, DMS</strong>）数据集，如 <strong>ProteinGym</strong></li>
</ul>

<h5 id="问题大模型验证损失虽低但零样本预测能力下降"><strong>问题：大模型验证损失虽低，但零样本预测能力下降</strong></h5>

<p>作者发现了一个有趣现象：</p>

<blockquote>
  <p><strong>尽管更大规模的 ProGen3 模型（&gt;3B 参数）在验证损失和序列多样性上表现更优，</strong></p>

  <p><strong>但它们在 ProteinGym 的零样本预测中表现反而变差（图 4a）</strong>。</p>
</blockquote>

<p>这一发现印证了已有文献中的两个重要假设：</p>

<ul>
  <li>Weinstein et al.和 Gordon et al.曾指出：
    <ul>
      <li>在某个临界点之后，<strong>越能精确刻画自然分布的模型，反而越不利于预测突变的功能效应</strong>；</li>
      <li>原因在于：自然蛋白演化过程中的<strong>协变量结构</strong>可能与突变适应度不一致，导致预训练目标（建模分布）与评估目标（功能预测）出现张力。</li>
    </ul>
  </li>
</ul>

<p><strong>应对策略：通过对齐显式引导模型能力</strong></p>

<p>尽管大型模型在零样本设置下表现不佳，但作者认为它们<strong>具备可唤醒的潜在能力（latent ability）</strong>，只需合适地引导即可显现。</p>

<p>为此，作者引入了 <strong>IRPO（Iterative Reasoning Preference Optimization）</strong>：</p>

<ul>
  <li>IRPO 是一种受大语言模型对齐启发的策略，旨在将模型的原始 log-likelihood 分布进行微调，使其更贴合<strong>实验测得的目标属性</strong>。</li>
  <li>在本研究中，IRPO 用于对齐的实验指标包括：<strong>酶活性（activity）</strong>，<strong>分子结合能力（binding）</strong>，<strong>有机体适应度（organismal fitness）</strong>，<strong>蛋白稳定性（stability）</strong></li>
</ul>

<h4 id="41-supervised-fitness-prediction">4.1 Supervised Fitness Prediction</h4>

<p>作者希望展示：</p>

<blockquote>
  <p><strong>经过 IRPO alignment 的 PLM 能在仅使用本地突变（局部训练）信息的情况下，实现对远距离突变蛋白的准确预测</strong>，从而提升定向进化（directed evolution）的效率。</p>
</blockquote>

<h5 id="实验设置proteingym">实验设置（ProteinGym）</h5>

<ul>
  <li>使用 <strong>ProteinGym 数据集</strong>，其中包含多个深度突变扫描（DMS）实验；</li>
  <li>选择包含 <strong>≥3 位点突变</strong>的所有实验（assays）；</li>
  <li>训练数据：包含与野生型相差不超过 <em>k</em> 位突变的所有变体；<em>k</em> 是使得训练集 <strong>数量超过 500 条序列</strong>的最小值；</li>
  <li>为确保训练/测试集的适应度分布相似，设置约束：<strong>训练与测试集中适应度分布的总变差（Total Variation Distance） &lt; 1</strong>。</li>
</ul>

<p>最终筛选得到 <strong>8 个测量不同蛋白功能属性的 assay</strong>，涵盖广泛蛋白种类（见补充表 8）。</p>

<h5 id="结果一训练局部预测远程progen3-泛化能力显著">结果一：训练局部，预测远程，ProGen3 泛化能力显著</h5>

<ul>
  <li>使用不到 500 条单突变体的实验数据，IRPO 对齐后的模型就能准确<strong>排序相距十数个突变的远程变体</strong>；</li>
  <li>模型规模越大，预测能力越强（图 4b，补充图 6）：
    <ul>
      <li><strong>ProGen3-46B（ρ = 0.673）</strong> 优于 <strong>KERMUT（ρ = 0.628）</strong></li>
      <li>与 SOTA 方法 <strong>ConFit（ρ = 0.679）</strong> 相当；</li>
    </ul>
  </li>
  <li>相比 KERMUT 和 ConFit 等专为预测突变效应设计的模型，ProGen3 作为一个<strong>通用的生成模型</strong>，不依赖结构信息或特定手工特征，仍能达到竞争性能；</li>
  <li>值得注意的是，IRPO 可用于优化替换突变、插入和缺失的适应度评估，而非仅限于 substitution</li>
</ul>

<h5 id="实验扩展预测蛋白稳定性δg">实验扩展：预测蛋白稳定性（ΔG）</h5>

<ul>
  <li>将 IRPO 应用于 <strong>Megascale 蛋白稳定性数据集</strong>：
    <ul>
      <li>包含近 <strong>80 万个单/双突变体</strong>，分布于 <strong>479 个蛋白结构域</strong>；</li>
      <li>每个样本均标注了<strong>折叠自由能（ΔG）</strong>；</li>
    </ul>
  </li>
  <li>使用 <strong>FoldSeek easy-cluster</strong>（比对覆盖率 ≥50%）对蛋白结构域进行聚类：留出 <strong>5% 聚类用于验证，5% 用于测试</strong>；</li>
  <li>模型仅在<strong>单点突变体</strong>上进行训练，以检验其泛化能力。</li>
</ul>

<h5 id="结果二大模型可在结构未知场景中精准预测蛋白稳定性">结果二：大模型可在结构未知场景中精准预测蛋白稳定性</h5>

<ul>
  <li>对齐后的 ProGen3 模型在蛋白稳定性预测任务上同样随着规模提升而表现更好（图 4c–e）；</li>
  <li>与结构感知模型 <strong>ProteinDPO</strong>对比：
    <ul>
      <li>在相同训练/测试划分下：
        <ul>
          <li><strong>ProteinDPO：ρ = 0.72</strong></li>
          <li><strong>ProGen3-46B（IRPO）：ρ = 0.737</strong></li>
        </ul>
      </li>
      <li>尽管 ProGen3 是基于序列的模型，<strong>在未见的双突变体上</strong>具有更强的泛化能力：
        <ul>
          <li>多突变体预测上：<strong>ProGen3-46B：ρ = 0.820</strong></li>
          <li>同条件下：<strong>ProteinDPO 仅为：ρ = 0.468</strong>（图 4e）</li>
        </ul>
      </li>
    </ul>
  </li>
</ul>

<h4 id="42-sequence-generation"><strong>4.2 Sequence Generation</strong></h4>

<blockquote>
  <p>在前文验证了对齐策略（IRPO）显著提升了 ProGen3 的适应度与稳定性预测能力后，作者进一步评估： <strong>对齐后的模型在蛋白生成任务中的表现是否也更优？</strong></p>
</blockquote>

<h5 id="序列生成设置">序列生成设置</h5>

<p>作者从第 3.1 节中使用的自然蛋白中，挑选出 <strong>32 条结构多样的自然蛋白质</strong>作为生成提示（prompts），这些蛋白长度在 <strong>98–282 个氨基酸</strong>之间，远长于 Megascale 稳定性数据集中 40–72 氨基酸的蛋白结构域。</p>

<p>对于每个 prompt，他们使用 <strong>稳定性对齐模型与原始预训练模型</strong>分别进行生成：</p>

<ul>
  <li>每种模型、每个 prompt，各生成 <strong>50,000 条序列</strong>；</li>
  <li>每条序列需通过图 2a 中定义的质量过滤标准；</li>
  <li>使用两种条件化方式生成：
    <ul>
      <li>用前 25% 条件化生成后 75%；</li>
      <li>用后 25% 条件化生成前 75%；</li>
    </ul>
  </li>
  <li>最终，从每组（模型 × prompt）中选出 <strong>100 条困惑度最低</strong>且通过质量过滤的序列，进入后续分析。</li>
</ul>

<h5 id="结构与稳定性评估计算模拟">结构与稳定性评估（计算模拟）</h5>

<p>作为初步评估，作者使用 <strong>in silico 稳定性预测流程</strong>：</p>

<ol>
  <li>对所有生成序列及其对应的自然 prompt 序列使用 <strong>ESMFold</strong> 预测三维结构；</li>
  <li>在 <strong>PyRosetta</strong> 中进行：4 轮最小化（MinMover）；4 轮结构松弛（FastRelax）；每个序列进行 <strong>5 条独立轨迹</strong>；</li>
  <li>记录每个序列在所有轨迹中达到的<strong>最低 Rosetta 能量值</strong>；</li>
  <li>与对应自然序列的最低能量值做差值计算，差值越低表示生成序列更稳定。</li>
</ol>

<p><strong>结果显示</strong>（图 4f）：</p>

<ul>
  <li>更大模型生成的蛋白质<strong>平均更稳定</strong>；</li>
  <li>经过 IRPO 对齐后，<strong>所有模型的稳定性进一步提升</strong>；</li>
  <li>说明 alignment 不仅优化了模型预测能力，也显著改善了其生成能力。</li>
</ul>

<h5 id="湿实验验证split-gfp-表达实验">湿实验验证（split-GFP 表达实验）</h5>

<p>前人研究已表明，split-GFP 表达水平与蛋白稳定性显著正相关。</p>

<p>为进一步验证 alignment 是否确实提高了生成序列的稳定性，作者设计以下实验流程：</p>

<ul>
  <li>对每个 prompt，从两个模型（原始 ProGen3-46B 和对齐版）中各选择：<strong>2 条困惑度最低的生成序列</strong>；</li>
  <li>使用 split-GFP 实验系统测量蛋白质表达水平；</li>
  <li>表达结果以对应的野生型蛋白为基准归一化，进行比较（图 4g）；</li>
  <li>使用 <strong>配对样本 Welch’s t 检验</strong>（p &lt; 0.01）评估差异显著性。</li>
</ul>

<p><strong>实验结果</strong>：</p>

<ul>
  <li>在 32 个 prompt 中：alignment 提高表达的有 8 个；降低表达的有 3 个；无显著影响的有 21 个；</li>
  <li>显示 alignment 对于一部分蛋白序列的生成质量有显著提升，且在多数情况下并不会带来负面影响。</li>
</ul>

<hr align="left" color="#987cb9" size="1" />]]></content><author><name>Yang Tan</name><email>tanyang.august@gmail.com</email></author><category term="BI" /><category term="GNN" /><category term="protein" /><category term="protein-design" /><category term="transformer" /><summary type="html"><![CDATA[论文地址：Scaling unlocks broader generation and deeper functional understanding of proteins 论文实现：https://github.com/Profluent-AI/progen3]]></summary></entry></feed>