评测

Claude 设计蛋白质成功率冲到 35.1%:AI 开始真正进入湿实验了吗?

Anthropic 在 2026 年 8 月 18 日公布了一组很值得关注的生命科学实验结果:Claude Opus 4.8 和 Mythos Preview 被用于设计全新的蛋白质 binder,并交给第三方实验机构实际合成和测试。在 15 个目标蛋白中,Claude 对其中 14 个成功设计出能够结合的 binder;多靶点模式下 Mythos Preview 和 Opus 4.8 的总体 hit rate 分别达到 26.7% 和 22.6%,而 Mythos Preview 在单靶点模式下进一步达到 35.1%。Anthropic 给出的对照是,当今很多蛋白设计 campaign 的典型命中率约为 10%~15%。真正重要的不是“Claude 自己取代了蛋白专用模型”,而是它开始像一个科研 Agent 一样,能够调用专业蛋白结构设计、序列设计和 co-folding 模型,连续执行设计、筛选、优化,并把结果送进湿实验验证。

# Claude 设计蛋白质成功率冲到 35.1%:AI 开始真正进入湿实验了吗? ## 文章摘要 Anthropic 在 2026 年 8 月 18 日公布了一组很值得关注的生命科学实验结果:Claude Opus 4.8 和 Mythos Preview 被用于设计全新的蛋白质 binder,并交给第三方实验机构实际合成和测试。在 15 个目标蛋白中,Claude 对其中 14 个成功设计出能够结合的 binder;多靶点模式下 Mythos Preview 和 Opus 4.8 的总体 hit rate 分别达到 26.7% 和 22.6%,而 Mythos Preview 在单靶点模式下进一步达到 35.1%。Anthropic 给出的对照是,当今很多蛋白设计 campaign 的典型命中率约为 10%~15%。真正重要的不是“Claude 自己取代了蛋白专用模型”,而是它开始像一个科研 Agent 一样,能够调用专业蛋白结构设计、序列设计和 co-folding 模型,连续执行设计、筛选、优化,并把结果送进湿实验验证。 --- 很多“AI 科研”演示停留在论文总结、资料搜索、代码辅助和假设生成。真正困难的是,模型提出的结果能不能进入真实世界验证。蛋白质设计必须经历候选设计、序列生成、结构预测、筛选、合成、折叠和实际结合测试。只在计算机里得到一个高分,并不能说明蛋白真的能工作。 这次值得关注,就是因为 Anthropic 公布的是湿实验数据,而不是只展示模型自己的评分。 ## Claude 在实验里到底做了什么? 这不是“输入一个靶点,Claude 直接吐出神奇蛋白序列”的故事。更准确的流程是: ```text 选择靶点 ↓ 搜索论文和公开资源 ↓ 选择结构设计方法 ↓ 生成候选骨架 ↓ 调用序列设计模型 ↓ 调用 co-folding 模型预测结合 ↓ 多轮计算优化 ↓ 筛选表达、可溶性和结合潜力 ↓ 提交候选 ↓ 第三方实验室实际合成与检测 ``` Claude 获得了互联网、科学资料、连接器以及 GPU 资源,并调用公开的专业蛋白设计与 folding 模型。因此,它更像一个“计算蛋白设计负责人”:决定下一步用什么工具、如何组织候选、什么时候继续优化、哪些结果值得送去实验。 这个角色很重要。科研 AI 的长期形态很可能不是“一个大模型替代所有科学软件”,而是“一个强 Agent 学会操作完整科研工具链”。 ## 15 个靶点里,14 个成功 Anthropic 选择了 15 个蛋白靶点,其中包括常用 benchmark,也加入了更具挑战性和更新的目标。最终,Claude 对 14 个靶点产生了经过实验验证的 binder。 整个 campaign 一共形成: - 1,320 个设计; - 354 个经过验证的 binder; - 成功覆盖 14 个目标。 这已经不是一次“运气好刚好蒙中”的小样本。 ## 35.1% hit rate 到底意味着什么? 蛋白设计里的 hit rate,可以粗略理解为:送去实验的候选里,有多少真的与目标结合。 Anthropic 报告的结果是: - Mythos Preview,多目标模式:26.7%; - Opus 4.8,多目标模式:22.6%; - Mythos Preview,单目标模式:35.1%。 Anthropic 给出的典型蛋白设计 campaign 命中率范围约为 10%~15%。 因此,这次结果的价值不在于“AI 生成了很多候选”,而在于相当一部分候选进入了真实实验并成功工作。 ## 为什么单目标模式反而更强? 单目标模式中,一个 Session 只围绕一个蛋白连续工作。多目标模式则需要在多个目标之间切换上下文和优化策略。 这其实给 Agent 架构一个非常通用的启示:并行不意味着把所有事情塞进一个巨大上下文。更合理的设计往往是: ```text Orchestrator ├── Target Agent A ├── Target Agent B ├── Target Agent C └── ... ``` 每个 Agent 保持自己局部目标、局部记忆和工具调用历史,顶层 Agent 负责编排。 这和企业多 Agent 系统里“一个总控 + 多个专业 Agent”的设计逻辑高度一致。 ## Claude 没有取代专业蛋白模型 这点必须说清楚。 Claude 不是 AlphaFold、序列设计模型或结构生成模型的直接替代品。它使用这些模型,就像人类科学家使用专业仪器和软件。 可以把它理解为: ```text Claude = Scientist / Orchestrator 专业蛋白模型 = Scientific Instruments ``` 未来真正有价值的科学 Agent,不一定是每一项底层能力都最强,而是能否知道: - 什么时候调用哪个模型; - 结果是否可信; - 下一轮优化应该怎么做; - 什么时候该停止计算并进入实验。 ## TNFα 的结果很有意思 Anthropic 特别提到 TNFα。它是一个重要的炎症相关靶点,也是很多成熟药物作用路径中的关键蛋白。 在这个目标上,Mythos Preview 没有成功,反而是总体能力相对低一档的 Opus 4.8 设计出了多个 binder,其中一些还能跨物种结合人、食蟹猴和小鼠 TNFα。 这说明一个现实:更强的通用模型并不会在每一个具体科研任务上必然胜出。 对企业和科研团队来说,这再次证明了真实 Evaluation 的必要性。不能因为某个模型在综合榜单上更高,就默认它在你的具体任务里一定更好。 ## 失败结果同样值得看 Anthropic 也公布了失败样本。比如在 maltose-binding protein 上,90 个设计中没有一个被确认成功结合。 这反而让这份结果更可信。真实科研不会每个靶点都成功,也不会因为一个总体数字很漂亮,就意味着问题已经解决。 AI 科研是否成熟,一个重要标志就是:不仅展示最好的成功案例,也展示失败边界。 ## 这为什么可以叫 Agentic Science? 传统科研 AI 常常是: ```text 科学家 ↓ AI 模型 ↓ 一个答案 ``` 而这次更接近: ```text 科学家 ↓ Research Agent ├── Literature Search ├── Protein Design Model ├── Folding Model ├── GPU Compute ├── Data Analysis ├── Collaboration Tools └── Experiment Planning ↓ Wet Lab ↓ 实验数据 ↓ 下一轮研究 ``` AI 从单个工具,开始向“科研流程执行者”移动。 ## 同一篇研究里,还有一个更容易落地的方向:化学分析 Anthropic 还展示了 Claude Opus 5 对 NMR 和 LC-MS 原始数据的分析。 它只拿到合同实验室的原始文件和两句话 Prompt,就分别在 23 分钟和 19 分钟完成分析。其中一组纯度结果:Claude 给出 96.4%,实验室自己的结果是 96.33%。 这种“专业但重复、数据量大、人工耗时”的工作,可能比“AI 自己发现全新药物”更早形成稳定商业价值。 科研 AI 的第一波真实生产力提升,很可能来自: - 分析自动化; - 计算流程编排; - 候选筛选; - 实验前准备; - 实验后数据解释。 ## 科学家的工作会怎么变? 更现实的变化不是“科学家消失”,而是单个科学家的工作杠杆变大。 过去一个研究员可能需要花大量时间: - 找论文; - 跑模型; - 写脚本; - 整理候选; - 处理格式; - 做重复分析。 未来 Agent 可以先执行大量机械步骤,人类科学家集中在: - 研究目标; - 假设; - 异常判断; - 实验设计; - 风险; - 最终解释。 这和 AI Coding 正在发生的变化很像:人从“逐行写”转向“设计、审核和判断”。 ## 未来瓶颈可能从计算变成湿实验吞吐 AI 可以在很短时间内生成大量候选,但现实世界验证依然需要: - 合成; - 试剂; - 仪器; - 培养; - 测定; - 人工或机器人操作。 因此,随着科研 Agent 能力提高,瓶颈可能从“有没有想法”转移到“实验室每周能验证多少候选”。 自动化实验室、机器人、高通量筛选和实验数据 API,会因此变得更重要。 ## 科研 Agent 不能只保存最终答案 生产级科学 Agent 必须保留数据血缘: ```text experiment_id 目标 模型版本 Prompt 工具版本 输入数据 候选 筛选过程 模拟结果 湿实验结果 人工审批 ``` 否则一个结果几周后出现异常时,无法复现。 在科研场景里,“可复现”比“回答看起来聪明”重要得多。 ## 双重用途风险也会更突出 蛋白设计能够加速药物和基础科研,也可能被滥用于危险生物研究。因此更高水平的生命科学 Agent 能力,很可能不会像普通聊天模型那样完全无门槛开放。 未来可能出现分层访问: ```text 普通用户能力 ↓ 研究人员认证 ↓ 机构审批 ↓ 受控高能力科学 Agent ``` 这种模式很可能成为科学 AI 与普通 AI 产品最大的不同之一。 ## 对制药行业该怎么理解? 不要把这次结果解读成“以后几周就能造出新药”。 药物研发还包括: - 毒理; - 药代; - 动物实验; - 临床试验; - 工艺; - 法规; - 生产; - 商业化。 更准确的判断是:AI 正在压缩早期发现阶段中原本非常依赖计算专家和人工分析的一部分时间。 ## 科研 Agent 应该用什么指标评测? 真正有意义的指标包括: - Proposal Quality:实验方案是否有价值; - Tool Selection:专业模型选择是否合理; - Execution Reliability:长任务能否稳定运行; - Reproducibility:结果能否复现; - Experimental Hit Rate:湿实验命中率; - Cost per Validated Result:得到一个真实有效结果需要多少成本。 这比普通问答 Benchmark 更接近科研生产力。 ## 总结 这次 Claude 蛋白质设计实验最重要的不是“AI 要取代科学家”,而是通用 AI Agent 已经开始能够编排专业科学模型,并把输出送进真实实验验证。 关键数据是: - 15 个靶点; - 14 个成功产生 binder; - 1,320 个设计; - 354 个验证 binder; - Mythos Preview 多目标 hit rate 26.7%; - Opus 4.8 多目标 hit rate 22.6%; - Mythos Preview 单目标 hit rate 35.1%。 这仍然不是自动药物研发的终点,却很可能代表一个重要拐点:AI 从“帮科学家写和算”,正在进入“帮科学家连续执行研究流程”。 想继续了解 AI 科研、Agent 和前沿模型进展,可以访问 **智元选**:https://www.zyentorpicks.com/。我们会持续把真正有技术含量的新进展拆解成可理解、可判断的内容。

免责声明:工具功能和价格可能随时变化,请以官网信息为准。部分链接可能包含推广代码。