Robin: A Multi-Agent System
for Automating Scientific Discovery
摘要
科学发现是由观察、假设生成、实验和数据分析的迭代过程驱动的。尽管近年来在将人工智能应用于生物学方面取得了进展,但尚未有系统能够实现所有这些阶段的自动化。在此,我们介绍Robin,这是首个能够完全自动化实验生物学假设生成和数据分析的多智能体系统。通过将文献搜索智能体与数据分析智能体相结合,Robin能够生成假设、提出实验方案、解释实验结果并生成更新的假设,从而实现科学发现的半自主方法。通过应用该系统,我们能够确定干性年龄相关性黄斑变性(dAMD)的潜在治疗候选药物,而dAMD是发达国家失明的主要原因。Robin提出将增强视网膜色素上皮细胞吞噬作用作为一种治疗策略,并在体外鉴定和证实了利帕舒地尔和KL001的疗效。利帕舒地尔是一种临床使用的Rho激酶(ROCK)抑制剂,此前从未被提议用于治疗dAMD。为了阐明利帕舒地尔诱导吞噬作用上调的机制,Robin随后提出并分析了一项后续RNA测序实验,该实验揭示了ABCA1的上调,ABCA1是一种脂质外排泵,可能是新的靶点。本报告正文中的所有假设、实验方向、数据分析和数据图表均由Robin生成。作为首个在迭代的“实验室闭环”框架内自主发现并验证新型治疗候选药物的人工智能系统,Robin为人工智能驱动的科学发现建立了新范式。
研究背景与动机
科学发现通常是一个不断迭代的过程。但在生命科学,尤其是药物研发领域,这个循环的推进速度却异常缓慢。文章从三个角度拆解了背后的原因。
观察现象
从已有数据或文献中找到值得研究的问题。
提出假设
基于观察提出可检验的科学假设。
设计实验
通过实验验证假设的正确性。
分析数据
从实验结果中得出结论,更新假设,进入下一轮迭代。
知识爆炸,但合成能力滞后
近年来生物学数据量呈指数级增长,但我们对这些知识的整合、解读和假设生成能力却远远跟不上。Paul Nurse 在 Nature 上指出:
生物学不能只产生数据,还必须产生想法。
数据不等于知识,知识不等于洞见——从海量数据中提炼可检验的假设,恰恰是最困难的环节。
药物重定位的机会被延迟发现
已有药物的安全性已经过验证,可大幅缩短研发周期。但相关的生物学知识散落在不同文献里——知识的碎片化与学科隔阂导致大量「低垂的果实」未被及时摘取。
更多的药物重定位机会可能通过逻辑连接现有的生物学研究来识别。
| 药物 | 原适应症 | 重定位用途 | 滞后 |
|---|---|---|---|
| Dabrafenib | BRAF 突变癌症 | 听力保护 | 10 年 |
| Ketamine | 麻醉剂 | 抗抑郁 | 22 年 |
| KarXT | 阿尔茨海默症 | 精神分裂症 | 13 年 |
这些例子说明,科学见解早已存在于文献中,但临床转化总是滞后数年甚至数十年。
现有 AI 系统各自为战
近年来出现了不少基于 LLM 的 AI 系统——有的能自动生成假设,有的能预测药物性质,有的能辅助文献检索。但问题是:没有一个系统能够同时完成假设生成、实验设计、数据分析和假设更新的完整闭环。
系统架构总览
Robin 基于 Aviary 框架 构建,核心理念是不同 Agent 各司其职,协同完成科学发现闭环。
基座:PaperQA2 | 调用:$4.33
针对特定问题做简洁的文献综述,回答疾病机制问题,筛选实验策略。
基座:PaperQA2 | 调用:$6.43
对候选药物生成深度评估报告——科学依据、药理特性、局限性。质量的守门人。
基座:Aviary+ReAct
不依赖预设模板,而是实时生成分析逻辑,适应不同的数据分布。
Robin 是如何发现新药的
第 1 步 · 锁定治疗策略
输入:「干性年龄相关黄斑变性(dAMD)」
Robin 首先对 dAMD 的病理机制进行了广泛的文献审阅。Crow 分析了 151 篇论文,提出了 10 个可能的疾病因果机制。经过 LLM Judge 排序,排名最高的策略是:增强视网膜色素上皮(RPE)细胞的吞噬功能。
这个选择的内在逻辑是:dAMD 的核心病理之一是 RPE 细胞无法有效清除脱落的视杆外段(ROS),导致 drusen 沉积和细胞死亡。如果能增强 RPE 的天然吞噬能力,就可能延缓或逆转疾病进程。
第 2 步 · 从文献到候选药物
确定了体外模型(RPE 细胞吞噬实验)后,Robin 进行了更大规模的文献搜索——Crow 再分析约 400 篇论文,提出了 30 个候选药物。接着 Falcon 对每个候选药物进行了深度评估,包括作用机制、药代动力学、已知毒性、以及支持证据的可靠性。经过 LLM Judge 锦标赛排序,前 5 名进入实验验证。
人类团队在 ARPE-19 细胞系上进行了流式细胞术吞噬实验。 随后将原始数据直接交给 Robin 的数据分析代理 Finch。Finch 完全自主地对流式数据进行了设门、统计检验和可视化分析,自动得出结论,结果清晰:Y-27632(一种 ROCK 抑制剂)显著增强了 RPE 细胞的吞噬能力。阳性对照 MFGE8 有效,其他候选无效。
551 篇论文 30 分钟 ~$10.76
第 3 步 · 自主探索机制(AI 的好奇心)
在第一轮实验后,Robin 没有止步于「Y-27632 有效」这个结论。它自主提出了一个后续实验建议:对 Y-27632 处理的 RPE 细胞进行 RNA-seq,以探究其增强吞噬的分子机制。
人类团队执行了实验,将原始测序数据交给 Robin。Finch 启动了 8 条独立的分析轨迹,每条轨迹独立完成差异基因表达分析。元分析的结果令人惊讶:
- ABCA1 上调 3 倍(adj. p = 2.13 × 10⁻⁸³)——在超过半数的分析轨迹中一致确认
- ABCA1 是 ABC 转运蛋白家族成员,负责胆固醇和磷脂的跨膜外排
- GO 富集显示:肌动蛋白骨架组织、小 GTP 酶信号、自噬通路被激活
- 值得注意的是,Apo-E(ABCA1 的脂质受体)正是一种已知的 AMD 遗传易感基因
第 4 步 · 迭代的力量——更好的答案
基于 RNA-seq 的新发现,Robin 利用「实验增强的文献综合」机制,在第二轮迭代中生成了更精准的候选药物列表。这一次的候选药物充分考虑了第一轮的实验数据和新发现的机制通路。
人类团队测试了 Robin 在第二轮中提出的 10 个候选药物。这一次的结果更令人振奋:
- Ripasudil——同样是一种 ROCK 抑制剂,但在日本已获批用于青光眼的治疗。它比 Y-27632 具有更高的效力和已知的临床安全性。在 RPE 吞噬实验中,Ripasudil 的表现优于 Y-27632。
- KL001——一种此前从未与 RPE 吞噬功能关联过的化合物,代表了全新的治疗方向。
两种药物均在原代人 RPE 细胞(RPE-SC,来自 >60 岁老年供体)中进行了验证,使用了更生理性的 pHrodo 标记的牛视杆外段作为吞噬底物。
与 OpenAI Deep Research 的对比
作者将同样的候选生成任务交给 OpenAI Deep Research(一个通用的多步研究 Agent)。DR 生成了 17 个唯一候选药物,但没有一个在吞噬实验中有效,而且 DR 完全没有提出 ROCK 抑制作为治疗策略。
这说明了关键区别:Robin 的成功不是来自「更好的 LLM」,而是来自专用架构——Crow 的超高效文献检索 + Falcon 的严格评估 + Finch 的数据分析 + Lab-in-the-loop 的迭代机制。
通用 Agent 做广度检索,专用架构做深度科学发现。
核心贡献
三大 Agent 详解
Crow · 文献搜索 Agent
Crow 是 Robin 的文献搜索专家,基于 PaperQA2 构建,专门负责从海量文献中快速提取关键信息。它的核心设计理念是广度优先、引用可验证、低成本——不追求深度分析,而是快速覆盖多个方向,为后续筛选提供素材。
PaperQA2 是一个超人类水平的文献检索 Agent,能够自主搜索、阅读和理解论文全文。Crow 每次调用从文献库中筛选并阅读约 10-20 篇相关论文,最终输出简洁的综述和具体答案。
四大核心功能
- 疾病病理探索:给定疾病名后,Robin 先提出一系列关于病理机制的问题(如「dAMD 的主要病理机制有哪些?」),然后调用 Crow 逐一回答。
- 因果机制识别:基于 Crow 的汇报,Robin 识别出 10 个潜在因果机制(如氧化应激、自噬受损、RPE 吞噬功能下降等)。
- 体外模型提案:针对每个机制,Crow 搜索适合的体外细胞模型和实验方法。
- 文献基础构建:为后续 Falcon 的深度评估提供文献引用基础,确保每个候选药物都有至少 20-50 篇相关文献支撑。
Falcon · 深度评估 Agent
Falcon 是 Robin 的质量守门人,同样基于 PaperQA2,但采用了不同的工作模式——从「广度搜索」切换到「深度验证」。
Falcon 的设计哲学是「生成-验证」分离:Crow 负责提出候选假设(发散),Falcon 负责严格评估每个候选(收敛)。这种分离架构避免了 LLM 对自己提出的假设产生「自证偏见」——评估者和提议者是两个独立的 Agent。
五维评估体系
| 维度 | 评估内容 |
|---|---|
| 科学依据 | 该化合物是否已有文献支持其在目标疾病中的作用?证据强度如何? |
| 药理特性 | 药代动力学是否合理?给药途径是否可行?血脑屏障穿透性? |
| 安全性 | 已知毒副作用?临床安全性记录?长期使用的风险? |
| 局限性 | 该化合物的已知限制是什么?什么条件下可能无效? |
| 引用验证 | 每个结论是否有可靠文献支撑?引用的论文是否可获取? |
Finch · 数据分析 Agent
Finch 是 Robin 的数据分析引擎,也是最独特的技术贡献之一。它不是一个简单的工具调用器,而是一个生成式推理引擎——实时编写可执行的 Python/R 代码来分析实验数据。
Finch 基于 Aviary 框架构建。Aviary 是一个可扩展的「gymnasium」风格的 Agent 环境,专为科学任务的评估和迭代求解而设计。它提供了标准化的软件环境、一致的工具访问和结构化的多步推理支持。
极简双工具设计
Finch 只通过两个工具与环境交互,这种极简设计确保了行为的可控性:
edit_cell:编辑和执行 Python/R 代码单元格。支持安装新依赖、读取和分析数据。submit_answer:提交最终分析答案,结束一次分析轨迹。
八迹共识机制
每次数据分析,Robin 都启动 8 条独立的 Finch 分析轨迹。每条轨迹使用相同的提示和数据,但由于 LLM 推理的随机性以及 gating 选择、过滤参数等分析决策的差异,每条轨迹可能产生不同的结果。
- 独立运行:每条轨迹在各自的 Docker 容器中独立运行,互不干扰
- 共识阈值:每条轨迹在 最多 10 步内 必须提交最终答案,超时或未提交视为分析失败。
- 元分析:8 条轨迹的答案汇总后进行交叉验证——只有在多条轨迹中一致出现的结论才被采纳
- 可重复性:标准化的 Docker 环境确保了评估的可重复性,将评估限制在 Finch 的分析能力本身,而非依赖安装或环境配置
准确率对比
论文专门用 BixBench 基准对 Finch 进行了细粒度评估:
| 评估场景 | 准确率 |
|---|---|
| Robin 工作流内(流式细胞术) | ~100% |
| Robin 工作流内(RNA-seq 分析) | ~86% |
| Finch 独立(BixBench 整体) 标准 Agent 框架,覆盖全部 BixBench 任务 | ~22.8% |
| 纯大模型基线(无 Agent 框架) 直接提示 GPT-4o,无 Finch 工具、无代码执行 | ~1.6% |
| BixBench · 生物统计学任务 单步计算、干净表格数据 | ~47.9% |
| BixBench · 生物信息学任务 RNA-seq 完整分析流程、多步参数敏感管道 | ~15.3% |
Finch 在 Robin 工作流内的准确率远高于独立基准,这归功于任务特定的多步提示策略 + 有限步骤的结构化环境。BixBench 的表现差异也揭示了当前的瓶颈:生物信息学任务的多步流水线复杂度远高于单步统计计算,这正是未来改进的方向。
LLM Judge 排序机制
工作流程
生成候选列表
- Crow + Falcon 搜索与评估
- 产出候选药物
构建评估提示词
- 专家先做小样本标注
- Gemini 2.5 Pro 据此生成评判模板
两两比较锦标赛
- ≤25 候选:全排列 Round Robin
- >25 候选:随机抽 300 对
BTL 模型计算排名
- 成对结果→全局强度评分
- λ 值排序,消除位置偏差
Bradley-Terry-Luce 模型原理
BTL 模型假设每个候选方案 i 有一个潜在的实力参数 λi。当方案 i 和 j 比较时,i 被认为优于 j 的概率为:
P(i > j) = λi / (λi + λj)
LLM Judge 的每一次比较结果(胜/负)都是一次观测数据。BTL 模型通过最大似然估计,计算出能最佳解释所有比较结果的 λ 值集合,按 λ 值排序得到最终排名——比简单计票更稳健,能有效减少位置偏差。
为什么是两两对比?
BTL模型把零散的"两两对决"整合成了全局排名。但为什么非要搞锦标赛,而不是一次性给LLM喂30个候选让它直接排第1到第30?Robin团队发现:直接排序存在三大陷阱,而"两两对比+BTL"正好一一化解。
分数膨胀
❌ 直接打分
LLM的"老好人"倾向,30个候选分数扎堆在7-9分,拉不开差距,细微优劣无从分辨
✅ 两两对比
强制"A vs B"二元推理,LLM必须深度对抗思考,区分精度远超打分制
中间迷失
❌ 全量排序
列表过长导致"Lost in the Middle"——LLM过度关注首尾,中间项被严重忽略
✅ 两两对比
每次只聚焦两个候选,输入极小,LLM保持高度专注、公平判断
位置偏差
❌ 简单计票
单次对决的左右顺序偏差直接污染排名——"左边A"往往被优先选中
✅ BTL统计对冲
300对随机组合 + 最大似然估计,单次偏差在大量随机数据中被稀释抵消
本质:两两对比是为了迁就LLM的认知特性。全量排序好比让一个裁判同时盯着30个运动员打分,容易疲劳和偏视;两两对比则是每场只让两名选手对抗,裁判专注判罚当下,最后由统计员(BTL模型)汇总全局排名。
可靠性验证
验证结论:LLM Judge 不仅与专家意见高度吻合(7.25/10),而且在自一致性上远超人类(88% vs 61%)。这意味着它在稳定性上甚至优于领域专家——这对大规模、高频次的候选筛选尤为重要。
消融实验
| 条件 | 幻觉率 | 质量 |
|---|---|---|
| 完整 Robin | 低 | 最高 |
| 消融 Crow | 低 | ↓ |
| 消融 Falcon | ~44% | ↓↓ |
| 消融 Crow+Falcon | 高 | ↓↓ |
限制与未来
在详细介绍了 Robin 系统的出色表现之后,作者明确指出,Robin 在现阶段存在几个关键限制。针对上述限制,论文也提出了非常具体的改进路径。
当前限制
实验方案不够精细
Robin 能够生成实验的整体框架,例如建议使用哪种体外模型、检测什么指标。但它还不能自动生成精确、可执行的实验操作流程。换句话说,从"建议做某个实验"到"真正在实验台上操作",仍然需要研究人员进行大量的人工翻译和补充。
数据分析依赖专家提示工程
虽然 Finch 表现不错,但它仍然依赖领域专家精心设计的提示词才能得到可靠的分析结果。如果换成更复杂的数据类型或分析任务,Finch 并不能完全自主地生成最优分析策略。
多步骤生物信息学任务表现有限
论文在扩展数据图 5 中用 BixBench 基准做了细粒度评估:生物统计学任务(单步计算、干净表格数据)准确率约 48%,但生物信息学任务(RNA-seq 完整分析流程、多步参数敏感管道)仅 15%。这说明系统在面对多步推理、参数选择敏感的真实生物学问题时,还有很大提升空间。
基于特定模型
目前 Robin 的表现依赖于 2025 年初的商用前沿模型(如 OpenAI o4-mini、Claude 3.7)。如果更换基础模型,性能可能会发生变化。
改进方向
生成精确、可执行的实验协议
未来版本的 Robin 将能够输出详细的方法学步骤,使实验室执行只需要最少的人工转换,真正实现从"建议"到"动手"的自动化。
让 Finch 自主生成分析提示
目前 Finch 依赖人类专家写提示。未来目标是让 Finch 根据数据模态自主生成或调整提示,从而构建更自主的发现流水线。
模型无关架构的持续扩展
Robin 的架构是模型无关的(model-agnostic),因此随着底层基础模型能力的提升,Robin 的性能也会自然增长,不需要重新设计整个系统。
坚持领域特定架构的重要性
作者特别指出:即使未来通用编码代理的能力很强,领域特定的架构仍然至关重要——因为它能严格执行实验约束、可靠编排专用生物信息学工具链。
讨论与启示
从自主 Agent 到确定性工作流——务实主义的胜利
论文最初实现的 Robin 是一个完全自主的 Agent——系统自己决定什么时候调用 Crow、Falcon、做排名。但在实践中发现,Robin 几乎总是以完全相同的顺序调用这些工具。于是作者做了一个非常务实的决定:把 agentic 实现改成了确定性的 Jupyter notebook 工作流,每一步预先定义好。
不要为"智能感"牺牲稳定性
在结构化任务中,与其让 LLM 反复"思考"下一步,不如把可预测的路径固化下来。
自主性在结构化任务中被高估
科学发现流程本身就是线性管道。用工作流编排 LLM,比全自主 Agent 可靠得多。
先 Agent 再简化,理解任务结构
先做 Agent 探明路径,再简化成工作流——这个逆向过程本身就是对任务结构的深刻理解。
多 Agent 分工与幻觉的层级纠正
Robin 用了两个文献 Agent:Crow 负责简洁检索,Falcon 负责深度报告。消融实验揭示了关键机制:同时去掉 Crow 和 Falcon 时幻觉引用率飙升;只去掉 Falcon 幻觉率也很高;但只去掉 Crow(保留 Falcon)幻觉率没有显著上升。
作者的解释:Crow 搜集初步文献时可能产生幻觉,但 Falcon 在撰写最终报告时会重新检索并验证 Crow 的信息,从而纠正了大部分幻觉。Falcon 就是那个"幻觉过滤器"。
功能互补,缺一不可
Crow 做"广度"——快速扫描大量文献;Falcon 做"深度"——交叉验证和综合研判。
幻觉可被"层级纠正"
让一个 Agent 生成信息、另一个验证,通过多轮"提出-验证"循环大幅降低最终输出的幻觉率。
清晰的架构参考
检索 → 交叉验证 → 综合撰写。每一步独立 Agent 负责,后一步对前一步做事实核查。
性价比极高的验证层
Crow 和 Falcon 调用成本仅 $4.33 + $6.43,却换来显著的质量提升——关键环节多一步验证,性价比非常高。
Finch 多轨迹共识分析——拥抱随机性
LLM 的分析结果天然具有随机性——即使同样的数据和提示,两次运行也可能不同。作者没有试图压制这种随机性,而是反过来加以利用:对同一份实验数据并行启动 8 条独立的 Finch 分析轨迹,每条独立完成完整流程(写代码、做图、统计检验),最后进行元分析,看哪些结论是大多数轨迹都支持的,形成"共识驱动"的最终结论。
拥抱随机性,而非对抗它
固定种子只是隐藏随机性。通过多次运行把随机性暴露出来,用共识评估结论的稳健性。
"集成学习"的 LLM 翻版
就像随机森林用多棵决策树投票提高准确性一样,多轨迹共识过滤了单次 LLM 的偶然错误。
为 AI 科学引入置信度
报告"共识比例"等价于给数据分析加了一个置信度指标,对科学可重复性意义重大。
低成本的容错机制
8 条轨迹并行的时间和金钱成本很低,但结论可靠性的提升是实实在在的——值得推广的设计模式。
三个设计启示 · 总结
确定性工作流比完全自主的 Agent 更可靠
多 Agent 分工 + 层级验证,可有效降低幻觉
不压制随机性,通过多轨迹共识评估结论稳健性
核心技术栈
| 技术 | 类型 | 作用 |
|---|---|---|
| PaperQA2 | 文献检索 | 超人类文献检索与综合 |
| Aviary | Agent 框架 | 代码执行、工具调用 |
| BixBench | 基准 | 计算生物 LLM 基准 |
| ReAct | 策略 | 推理+行动交替 |
| BTL 模型 | 排序 | Bradley-Terry-Luce |
| o4-mini | 基座 | 假设生成 |
| Claude 3.7 | Judge | 配对比较 |
| Gemini 2.5 Pro | 提示 | Judge 提示生成 |
论文原图附录
以下为论文中的 Extended Data 附图,供讨论会参考:






实验结果
第一轮·Y-27632
Test 5 个候选:Y-27632(ROCK 抑制剂)显著增强 RPE 细胞吞噬能力。Finch 分析与人类分析完全一致。
RNA-seq·ABCA1 上调 3 倍
Finch 自主分析差异基因表达,发现 ABCA1 上调 3 倍(adj.p=2.13x10^-83)。GO 富集:肌动蛋白骨架、小 GTP 酶信号、自噬通路。Apo-E(ABCA1 受体)是 AMD 最强遗传风险位点。
第二轮·Ripasudil+KL001
Robin 提出 10 个新候选。Ripasudil(日本已获批青光眼 ROCK 抑制剂)优于 Y-27632。KL001 为全新促吞噬化合物。均在老年供体原代 RPE 细胞中验证。
参考文献
- Boiko et al. Nature 624,570-578(2023)
- Skarlinski et al. arXiv:2409.13740(2024)-PaperQA2
- Mitchener et al. arXiv:2503.00096(2025)-BixBench
- Narayanan et al. arXiv:2412.21154(2024)-Aviary
- Mao & Finnemann. Cells 10,1927(2021)
- Lu et al. arXiv:2408.06292(2024)-AI Scientist
- Gottweis et al. arXiv:2502.18864(2025)-AI co-scientist
Hermes Agent-Nature 2026-Ghareeb et al.-doi:10.1038/s41586-026-10652-y-2026-06-14