智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 在学术科研的过程中,研究者需要面对形态各异的数据来源:我们从ArXiv获取最新论文以追踪学术前沿,从 OpenReview 的开放评审中学习 Rebuttal 的技巧……
随着科研人员越来越多地借助机器学习(如LLM、GNN等)来辅助各类研究任务,一个关键问题随之浮现:
「我们是否能建立一个统一的数据接口,来支持不同学术任务中机器学习模型的开发?」
解决这一问题,将为Specialized Research Agents的发展奠定基础,促进auto-research的实现,也让我们更进一步地迈向让AGI真正理解科研与知识的奥秘的新阶段。
近日,伊利诺伊大学厄巴纳–香槟分校(UIUC) Jiaxuan You教授团队发布了新作,提出了基于图结构的统一科研数据接口,收集并处理了形式各异的科研数据,以辅助不同机器学习模型在各种科研任务上的训练,展望利用AI高效辅助科研的未来。
平台和平台之间缺少统一的结构化连接。模型拿到的往往只是一段段拼接好的,很难
论文里最有信息密度的内容,经常不是摘要,而是:方法流程图、实验表格ablation与结果对比、对于前人工作的引用。
但传统数据集与基准常常把这些「结构」压扁成纯文本,导致模型无法接触到「论文内部的组织逻辑」。
科研不是一次性写完的。尤其在顶会投稿场景里,论文会经历:reviewer评论 rebuttal、revision(多轮修改)
这些是「科研互动」和「论文进化」的核心信号,但在很多数据里它们要么缺失,要么只是散落文本。
研究人员提出的ResearchArcade是一个基于图结构的数据接口,连接了多个学术数据源,统一了学术任务定义,并支持广泛的机器学习模型的训练。
ResearchArcade利用多表格格式以图的结构去组织来自不同来源的数据,包括ArXiv的学术语料库和OpenReview的同行评审,也储存多模态信息(如图形和表格)。
同时ResearchArcade还保留了论文自身前后修改的版本信息以及不同论文的发表时间,支持论文修订以及更广泛的研究趋势的研究。更重要地,表格管理数据的方式便于图的动态扩展,一个新的数据个体的加入和在对应表格中加一行是一样的,ResearchArcade支持每日的不断添加ArXiv上更新的文章。
它把数据组织成表格的形式,其中包括节点表(比如 paper/author/paragraph/figure/table/review/revision),和边表(比如 authorship、citation、paragraph-to-figure/table、review-to-revision 等),使得数据库到异构图的转换更加直接。
除此之外,我们还支持SQL,CSV,JSON格式的数据导入导出,这样既可以把它当作结构化数据库来使用,支持LLM的训练,也可以无缝转成异构图来训练 GNN 这样的图模型。
ResearchArcade用两步把各式学术任务统一成同一个范式,便于任务的定义以及数据的调用:
这件事看起来简单,但它直接解决了「每个科研任务都要重写数据管线」的经典问题。
对于ArXiv部分,ResearchArcade收集了66,918篇ArXiv论文,跨11个科学领域,并进一步拆到更细粒度:
包含 569,501 个 section 、 8,014,095 个 paragraph 、 876,636 张 figure 、 324,648 个 table ,并且捕捉它们之间的连接关系 。
同时它支持持续爬取更新(可以按周/按日更新),保证数据实时更新,反应最新科研热点。
对于OpenReview部分,它收集了OpenReview上来自ICLR, NeurIPS, ICML, and EMNLP来自189,038位作者的 57,278篇投稿,以及884,875 条review与 54,467次 rebuttal/revision过程中的修改记录。除此之外,ResearchArcade把OpenReview投稿与对应的ArXiv论文按标题匹配相连接,最终有25,969篇(约45.34%)成功对齐。
同时,ResearchArcade 在论文中还列了一些「未来可扩展的新任务」,比如 idea generation、experiment planning、abstract writing、review generation 等(即覆盖科研流程更多阶段)(文中对「学术任务统一定义」的论证与扩展思路与此一致)。
如果把它放到「科研智能体」的语境里,你可以想象一个更完整的闭环
论文里提到,在revision generation / rebuttal generation上,经过训练的小模型(如Qwen3-0.6B)性能显著提升,并能接近更大模型表现,侧面验证了ResearchArcade 的数据与任务定义是「可学习」的。
revision retrieval / revision generation 展示了论文内演化建模的能力;而acceptance prediction 最好 accuracy 也只有0.55,几乎接近随机,说明「预测科研趋势」本身就很难。
论文直接对比了「图模型 vs 非图模型」,在 revision retrieval 上观察到显著提升(文中给出 67% 的增益量级),在 acceptance prediction 上也有一定改善;并且多跳邻域(比如从 1-hop 扩到 3-hop)能让 acceptance prediction 的表现上升到 0.55,说明高阶上下文很重要。
ResearchArcade 试图做的不是再造一个「更大的数据集」,而是把科研过程中那些原本被分割、被压扁、被静态化的信息,重新组织成可连接、可追溯、可扩展的「计算对象」。
一旦数据接口具备了这种统一的结构表达,科研任务就不必各自为政:引用、写作、修改、回复、预测乃至更复杂的科研规划,都可以在同一套范式里被定义、被训练、被比较,也就为 Specialized Research Agents 的规模化演进,auto- research的系统化落地,以至于最终能够理解科研学术奥秘的AGI提供了更稳的地基。
