智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 科学研究的自动化是 AI 研究领域长久以来的宏愿。尽管学界在自动化科学研究流程的各个单独环节上已取得显著进展,但一个能够自主完成从构思到发表全部研究生命周期的系统,迄今仍未实现。
The AI Scientist 是一个能够全流程自动化的科研系统,通过以下四个阶段实现自动化科研:
首先利用大语言模型(LLM)基于已有的学术文献自动提出研究点。为了确保研究的新颖性,系统会连接学术数据库进行搜索和比对,剔除与现有工作高度相似的想法,从而保留具有创新性的研究假设。
在确定研究方案后,系统会自动编写相应的实验代码并运行。实验过程中,系统具备自动调试功能,能够识别运行错误并进行修复。所有的实验数据、生成的图表以及观察结果都会被详细记录在实验日志中。
基于实验日志和数据分析结果,系统会自动撰写完整的科学论文。它使用标准的 LaTeX 排版格式,生成包含引言、方法、结果、结论等章节的文档,并能自动插入相关的图表和引用。
最后,系统内置的自动审稿人(Automated Reviewer)会对生成的论文进行评估。该模块模拟学术会议的评审标准,对论文的稳健性、呈现方式和贡献度等方面进行打分,并提供详细的反馈意见,以此完成对科研成果的质量控制。
为了验证 The AI Scientist 的实际能力,研究团队设计了相关实验。
研究团队向 ICLR 2025 的 ICBINB 研讨会提交了 3 篇完全由 The AI Scientist 生成的论文。为了确保公平性,审稿过程采用了盲审机制:审稿人被告知提交列表中包含 AI 生成的论文,但并不知晓具体是哪几篇。
实验结果显示,其中一篇由 The AI Scientist 生成的论文获得了 6.33 分(三位审稿人评分分别为 6、7、6),高于该研讨会的平均录用线。研讨会组织者表示,如果不是根据预先制定的协议因 "AI 生成" 而撤回,这篇论文极大概率会被接收。另外两篇论文则因质量未达标未能通过评审。
为了能够大规模、自动化地评估生成论文的质量,研究团队开发了Automated Reviewer。测试数据显示,该系统在判断论文是否应被录用这一任务上,其表现与人类审稿人具有高度一致性。基于NeurIPS会议历史数据的评估表明,自动审稿人的F1分数和平衡准确率与人类审稿人之间的表现相当,甚至在部分指标上优于人类平均水平。
研究团队还分析了影响 AI 科学家产出质量的关键变量。结果发现,随着基础模型能力的提升,生成的论文质量呈现明显的上升趋势。此外,在实验执行阶段投入更多的计算资源,也能显著提升最终论文的得分。这表明,随着算力成本的降低和模型能力的增强,该系统的产出质量有望进一步提高。
The AI Scientist 的成功运行标志着 AI 在科学推理领域迈出了重要一步。该系统生成的论文能够通过同行评审,证明了 AI 已经具备了处理复杂科学任务的能力。特别是在计算机实验领域,这种端到端的自动化系统有望显著加速科学发现的进程,提高科研效率。
尽管取得了重大进展,The AI Scientist 仍有较大的提升空间。在实验中,仅有 1 篇论文通过了评审,且该研讨会的接收率远高于 ICLR 主会,这意味着目前的 AI 尚未达到顶级学术会议的发表标准。
研究还发现,系统常见的失败模式包括:生成的创意较为浅显或未充分发展、代码实现存在错误、缺乏深层的方法论严谨性,以及在引用文献等方面出现的幻觉问题。
展望未来,该系统的发展与底层基础模型的进步紧密相关。研究数据显示,随着大模型能力的提升,The AI Scientist 所产出论文的质量也呈现出明显的正相关上升趋势。这意味着,随着 AI 技术的持续迭代,该自动化科研系统有望攻克更具挑战性的科研难题,并在更广泛的科学领域发挥作用。
与任何具有重大影响力的新技术一样,这一系统也潜藏着不容忽视的风险,包括加剧本已不堪重负的审稿系统的压力,以及向科学文献中引入"噪音"。然而,如果能以负责任的方式加以发展,此类自主系统有望大幅加速科学发现的进程。
