从科研助手到AI Scientist:自主科研系统的能力边界与验证难题
摘要
随着大语言模型与 AI 智能体技术快速演进,AI 在科研场景中的角色已经从单点任务工具,逐步向具备多步骤规划能力的自主科研系统演进,“AI Scientist” 成为科研自动化领域的重要研究方向。但当前业界对 AI Scientist 概念存在泛化解读,不同成熟度的系统被混为一谈,难以客观评判科研自动化真实发展水平。本文构建四级能力分析框架,区分科研 AI 工具、科研助手、自主科研智能体、AI Scientist 的层级差异,结合 The AI Scientist、Robin 等代表性实证案例,剖析自主科研系统在假设证伪、结果可信性、实验安全、过程可追溯方面的现实瓶颈,辨析人机分工的未来定位。研究表明,现阶段的核心挑战并非单纯提升模型生成能力,而是建立配套的验证、溯源与风险管控机制,为人机协同开展自动化科研提供方法论参考。
关键词:AI Scientist;自主科研系统;科学智能体;人机协同科研;科研自动化;科研可追溯;科研验证
一、自主科研的核心辨析:任务执行不等于自主科学研究
(一)AI 介入科研的范式转变
早期人工智能介入科研,大多用于完成边界清晰的单点任务,例如蛋白质结构预测、数据分析、文献检索、代码生成、结果文本总结。伴随大语言模型与智能体技术发展,AI 已经可以实现任务拆解、多工具调用、中间结果研判、迭代方案调整。到 2026 年,研究界讨论的核心问题已经由 “AI 能不能辅助科学家工作”,转向AI 是否可以独立完成完整的科学研究,“AI Scientist” 也从科幻设想转变为现实研究方向。
但当前该概念存在明显泛化现象:能够做文献摘要的科研助手、可调用多工具的智能体、可以生成完整研究流程的系统,都被笼统冠以 AI Scientist 名称。评判一套系统的水平,不应看其搭载 AI 模块的数量,而应当考察系统在完整科学认识形成链条当中承担何种角色。
(二)科学研究并非多项任务的简单拼接
文献检索、数据清洗、统计分析、代码编写、论文撰写,均属于独立科研任务。即便系统可以高效完成以上全部单项工作,也不代表实现了自主科研。科学研究的真正难点大量存在于各个任务的衔接环节:获得证据之后如何提出合理假设;实验结果和预期不符时,区分是实验故障、数据噪声还是原有假设错误;多套假说均可以解释现有数据时,如何设计实验进行区分;统计显著结果如何甄别是真实机制还是样本、流程带来的假象。
科研是证据与假设持续迭代的闭环过程。任务自动化解决的是 “怎么做” 的执行问题;而真正的自主科研,还需要回答 “下一步为什么这样做” 的决策问题。
二、科研智能体的能力跃迁:从单次输入输出到过程式参与
(一)传统单点式科研 AI 的特点
早期科研人工智能属于 “输入‑输出” 模式,输入限定条件,输出对应结果。例如蛋白质预测模型、传统学术检索系统。这类系统目标边界清晰,输出结果具备成熟、独立的评测指标,方便开展效果校验。
(二)智能体带来的过程化科研变革
大模型驱动的科学智能体改变了运行模式:接收宏观目标后,自动完成信息检索、文献阅读、工具选择、代码编写、结果观测、方案修正、迭代执行。AI 不再只是接收单次查询的模型,而成为科研全流程的过程参与者。
2026 年《IEEE Transactions on Pattern Analysis and Machine Intelligence》的综述文献指出,评价科学智能体不能仅看能够完成多少项科研任务,还需要从科研生命周期覆盖度、真实科研环境下的可靠性两个维度开展综合评估。在长链条、充满不确定性的科研流程中持续做出可靠决策,是衡量系统水平的关键标尺。
三、四级分析框架:从科研 AI 工具到 AI Scientist
说明:下文四级层级为本文综合现有公开研究归纳的分析框架,并非国际学术界统一标准。
(一)第一级:科研人工智能工具
该层级系统用于解决单一、边界明确的科研任务,例如分子性质预测、图像分割、蛋白结构解析、学术文本翻译、特定统计运算。部分工具性能甚至优于人类研究者,但系统不会自主衍生新的研究目标,仅回答 “这个任务如何完成”,不会判断 “接下来应当研究什么”。
(二)第二级:人工智能科研助手
科研助手可处理开放性自然语言需求,接受研究者指令完成领域进展梳理、论文对比、结果解读、假设生成、代码与实验方案草拟。Google 在 2025 年提出的 AI co‑scientist 就是该层级代表,由多子智能体分工完成假设生成、反思排序、迭代优化,但其定位明确为科学家协作工具,不以完全取代人类科研为目标。
本层级的核心特征:人类定义科研总目标,AI 拓展研究者信息获取与执行层面的能力边界。
(三)第三级:自主科研智能体
进入该层级后,研究者仅输入高层级研究目标,系统自主拆解子步骤、调用工具、解析中间结果,依据反馈修改后续执行方案,开始拥有局部科研决策权。例如自主判断检索方向、筛选分析方法、选定计算实验、决定哪些中间结果值得继续深挖。
2025 年发布的 BixBench 基准数据集,专门面向计算生物场景评测该类智能体能力。该基准采用真实生物信息学分析任务开展测试,即便采用 GPT‑4o、Claude 3.5 Sonnet 这类当时最前沿的大模型,在开放式问答场景下整体准确率仅约 17%,多选题模式下表现不优于随机猜测。这一基准结果揭示:即便单点工具能力可观,把多步操作串联形成完整、稳定可信的科研分析链路,仍是当前智能体难以突破的瓶颈。由于模型迭代速度很快,该套基准测得的具体分数不宜直接套用于当下最新系统,但它所暴露出的长链条分析可靠性短板仍具备参考价值。
(四)第四级:AI Scientist,完整闭环式科学发现
AI Scientist 要求形成完备的科学闭环:理解现有知识 → 提出科学假设 → 设计验证方案 → 获取实验结果 → 解释观测现象 → 更新原有假设 → 迭代开展后续研究。
系统不只是执行预设任务、生成执行计划;新产生的证据必须切实改变系统认知,并反向指导后续科研行为。到达这一层级,AI 才从流程执行层迈入知识生产的决策层。
四、现有系统的能力边界:端到端可行不等于高质量稳定产出
(一)The AI Scientist 的案例启示
The AI Scientist 项目经历多轮迭代:v1 版本 2024‑08 首次公开,迭代后的 v2 版本产出 3 篇 AI 生成稿件,提交至 ICLR 2025 研讨会参与同行评审,其中 1 篇达到研讨会接收标准,全部稿件按照预先设定的实验协议予以撤回;该项目完整研究成果于 2026‑03‑25 正式在《Nature》刊出。给定研究方向,系统可以独立完成文献调研、实验构思、代码实现、仿真实验、绘图、成文与自动同行评审。但该研究同时暴露出大量现实短板:3 篇稿件均达不到 ICLR 主会质量;系统常见缺陷包括构思简单、研究深度不足、代码 bug、实验错误、图表重复、引用失实等。该案例证明两点:端‑到‑端的科研自动化路径具备可行性;但自动化流程不能稳定输出高质量、可靠的科学结论。
但该研究同时暴露出大量现实短板:3 篇稿件均达不到 ICLR 主会质量;系统常见缺陷包括构思简单、研究深度不足、代码 bug、实验错误、图表重复、引用失实等。该案例证明两点:端‑到‑端的科研自动化路径具备可行性;但自动化流程不能稳定输出高质量、可靠的科学结论。
(二)湿实验场景下半自主科研的现实约束
机器学习仿真环境中,全部构思、实验、分析均可在计算机内部完成;而化学、生物、材料等学科涉及真实物理实验,试剂制备、样品处理、仪器漂移、细胞状态、各类不可完全编码的现实扰动,都会影响观测结果。
2026 年《Nature》刊出的 Robin 多智能体系统,可完成文献分析、提出疾病机制假说、筛选药物候选、分析实验数据,用于干性年龄相关性黄斑变性方向研究。但该系统被定义为半自主科学发现系统:药物候选方案经过人工审核,全部湿实验操作由人类完成,实验流程同样存在人工干预环节。
评判此类系统自主程度,需要完整追溯知识链条:谁定义实验、谁执行实验、谁处理异常现象、谁判定结果可信度、谁规划后续研究。
半自主科研模式下,很有必要完整留存整套研究探索上下文,清晰区分系统输出内容和人类确认的判断,做好科研链路梳理、多源文献关联以及中间证据沉淀。不少科研平台已经开始重视这一需求,UniResearch 便把文献检索、知识关系挖掘与分析过程记录整合到同一流程中,为半自主科研提供过程层面的支撑,但这并不代表平台本身实现了真正的自主科学发现。
五、自主科研的核心难点:假说生成不等于假说证伪
生成大量看上去逻辑自洽的解释,是大模型非常擅长的工作,可用于科研头脑风暴。但真正的科学假设,核心不在于解释已有现象,而在于具备可证伪性。
当多种假说都可以匹配现有观测数据,科研的重点不是继续叠加更多解释,而是设计实验区分竞争性假说。需要开展反事实推演:假设该假说成立会观测到什么;假说不成立又会出现什么;何种观测结果可以排除某一种解释;实验未达到预期时,区分是实验故障还是理论本身缺陷。
科学研究的关键能力,是主动寻找能够否定自身猜想的证据。一套真正成熟的 AI Scientist,必须具备自我证伪的推理能力,而不是仅搜集能够支撑当前假说的材料。
六、生成完整论文,不能等同于完成可信的科学研究
论文只是科研活动的输出载体,不等价于科学研究本身。系统可以输出格式完备,包含摘要、引言、方法、实验、图表、参考文献的完整文稿,但形式完整无法保证内在结论可靠。
The AI Scientist 的实践充分体现该风险:即便自动跑完全部实验流程并成文,依然会出现代码实现缺陷、对比不公平、引用错误等隐藏问题。从研究价值、代码实现、实验公平性、统计处理到引用佐证,链条上任意一环出错,最终论文就会丧失科学可信度。
自动化科研追求的目标,不应当是 “产出一篇格式完整论文”,而是产出一套能够被独立复现核验的科学结论,这也是自主科研系统和普通文本生成工具最本质的分野。
当越来越多科研步骤交由 AI 自动执行,研究者不能只关注最终输出结论,还需要能够回溯中间数据、参数选择与迭代路径,核查每一步推导的来源依据,防范长链条自动化流程带来的错误传递风险。部分工具已经在向这个方向设计,例如 UniResearch 内置的参数与分析历史回溯模块,正是为了适配这类溯源诉求。
七、验证难题:自主科研系统的核心瓶颈
行业过去普遍认为 AI Scientist 的主要矛盾是模型智能程度不足。随着智能体可以覆盖越来越多科研步骤,验证难题上升为首要瓶颈:如何检验 AI 推导出来的科学结论是否属实。
传统人工科研已经发展成熟的风险防控体系:实验记录、同行评审、数据公开、代码开源、复现实验、多团队独立验证、科研伦理监管。当 AI 大规模参与知识生成,整套机制都需要重新适配。其中尤其需要警惕模型自我评价闭环:使用同一套或者同源 AI 系统评判自身生成的科研结果,系统性缺陷会无法被识别。
The AI Scientist 虽然搭建自动评审模块,但研究团队明确指出自动评审分数不能作为科学事实的终极判定依据。同行评审只能评估稿件质量维度,不能直接证明客观科学事实;可靠科学证据仍然依赖独立数据集、独立实验、竞争性假设比对、多方后续重复验证。面向未来,自主科研不能只追求生成端能力,还需要建设与生成主体尽量解耦的独立验证体系。
八、实体实验接入带来的新增安全风险
当科研智能体只运行在计算机仿真环境,错误带来的主要后果是算力浪费、错误文稿输出、知识污染。一旦系统拥有操控真实物理实验设备的权限,风险性质将发生质变。
2025 年《Nature Communications》观点文献指出,评价具备实体实验操控能力的 AI 科研系统,不能仅审核最终输出文本,必须审视完整决策链路:工具调用记录、每一步操作选择、决策信息来源、异常识别能力、风险边界约束、环境反馈下的终止机制。即便最终报告文本安全无害,中间步骤也可能出现危险操作。已经执行的物理实验无法简单撤回,这是 AI Scientist 和普通对话 AI 的关键区别。
九、人机角色迁移:人类研究者并未消失,而是重心转移
在 AI 完成检索、整理数据、编写代码、调参绘图、整理参考文献等流程性工作之后,人类不会退出科研链条,而是发生角色迁移,工作重心向高阶科学判断转移。主要集中于四类核心任务。
- 定义有价值的研究问题:AI 可以批量产出候选方向,但有限科研资源如何分配,涉及理论价值、现实需求、伦理约束的综合权衡,需要人类完成。
- 甄别证据可信度:区分异常值属于测量噪声还是新科学现象;辨析统计显著结果来自真实机制还是数据处理偏差;多套证据冲突时做取舍研判,高度依赖领域经验。
- 识别和解读真正意外的实验现象:自动化系统擅长处理目标明确的任务;而重大科学突破常常来源于意料之外的观测,识别意外背后的科研价值,是人类不可替代的能力。
- 承担科研全部责任:无论自动化工具参与多少环节,研究问题、实验风险、数据解读、公开成果的全部责任,必须由人类主体承担;工具能力可以委托,但科研责任不可转移。
十、可追溯性:自主科研系统的硬性内在要求
大众存在一种误区:系统越强大,人类越不需要理解内部过程。但在科研场景恰好相反。当 AI 可以自主筛选文献、淘汰假说、选择分析方案、剔除异常样本、设计实验,每一处自动化决策,都会影响最终科学结论。
因此科研系统需要完整留存全部研究轨迹:检索过的文献集合、假说被淘汰的理由、执行过的代码、软件模型版本、关键参数、失败实验记录、分析方法变更节点、人类干预点位。完备记录不是附加功能,而是保障自动化科研可信度的核心组成。即便最终结论事后被证明正确,如果无法复现推导路径,该结论的科学价值也会大打折扣。
想要实现这种可复核的效果,就需要工具能够把原本隐性的 AI 决策转化为可读可查的显性记录,完整保存文献筛选、假设迭代、参数调整与整条分析链路,UniResearch 的研究轨迹留存模块便是围绕这一目标设计,方便研究者追溯自动化流程内部每一步判断的来源,用于后续科研溯源和证据校验。
十一、总结:自主科研的竞争是可靠知识生产能力的竞争
如果以 “自动生成完整形式论文” 作为标准,机器学习领域已经实现端‑到‑端自动化科研;以 “半闭环连接文献‑假说‑实验‑迭代” 作为标准,Robin 等系统也已经完成初步示范。
但以 “独立遴选高价值科学问题、产出新颖稳健知识、自主安全完成实体实验、妥善处理意外观测、产出可复现成果” 作为标准,现有系统距离真正的 AI Scientist 还有显著差距。
2026 年科学智能体领域综述强调,评估系统不能只看任务覆盖广度,更要看真实科研环境中的可靠性。未来人机科研系统比拼的,并非如何彻底移除人类研究者,而是能否稳定产出可验证、可追溯的可靠科学知识。自动化仅仅提升产出速度,不等于提升科学认知质量;如何让 AI 生成的发现经得起整套科学体系的检验,才是自主科研领域真正需要攻克的核心命题。
参考文献
[1] Wang X, Xu J, Lian S, et al. The Hitchhiker’s Guide to Autonomous Research: A Survey of Scientific Agents[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026. DOI:10.1109/TPAMI.2026.3721500.
[2] Gottweis J, Weng W‑H, Daryin A, et al. Towards an AI co‑scientist[R]. arXiv:2502.18864, 2025.
[3] Mitchener L, Laurent J M, Andonian A, et al. BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology[EB/OL]. arXiv preprint arXiv:2503.00096, 2025. https://doi.org/10.48550/arXiv.2503.00096.
[4] Lu C, Lu C, Lange R T, et al. Towards end‑to‑end automation of AI research[J]. Nature, 2026, 651:914‑919. https://doi.org/10.1038/s41586‑026‑10265‑5.
[5] Ghareeb A E, Chang B, Mitchener L, et al. A multi‑agent system for automating scientific discovery[J]. Nature, 2026, 655(8122):497‑505. https://doi.org/10.1038/s41586‑026‑10652‑y.
[6] Tang X, Jin Q, Zhu K, et al. Risks of AI scientists: prioritizing safeguarding over autonomy[J]. Nature Communications, 2025, 16:8317. DOI:10.1038/s41467‑025‑63913‑1.
[7] Messeri L, Crockett M J. Artificial intelligence and illusions of understanding in scientific research[J]. Nature, 2024, 627:49‑58. DOI:10.1038/s41586‑024‑07146‑0.
数据与框架使用说明 文中全部定量事实引自原始公开文献。The AI Scientist 相关评审分数、研讨会与主会接收率、Robin 半自主科研定位均来自原论文;BixBench 为预印本基准,文中只引用其揭示的现象,不直接采信当时模型跑分;本文 “科研人工智能工具 — 人工智能科研助手 — 自主科研智能体 —AI Scientist” 四级层级,属于面向科研实践的归纳分析框架,并非国际统一标准;本文关于 “验证成为自主科研核心瓶颈” 为综合多篇前沿文献形成的分析观点,不是单一文献给出的定论。