首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

科研数据不再碎片化!一张可计算图,连起整个科研世界

发布日期:2026-03-24 来源:腾讯网作者:腾讯网

UIUC研究团队打造ResearchArcade:构建动态科研知识图谱,统一AI科研数据接口

【新智元导读】UIUC研究团队打造ResearchArcade,将ArXiv论文、OpenReview评审、图表代码等碎片数据连接成动态知识图谱。模型可直接学习引用关系、修改轨迹与审稿互动,让AI更好辅助科研写作、修订与预测,为下一代科研智能体奠定统一数据基础。

在学术科研的过程中,研究者需要面对形态各异的数据来源:我们从ArXiv获取最新论文以追踪学术前沿,从 OpenReview 的开放评审中学习 Rebuttal 的技巧……

随着科研人员越来越多地借助机器学习(如LLM、GNN等)来辅助各类研究任务,一个关键问题随之浮现:

我们是否能建立一个统一的数据接口,来支持不同学术任务中机器学习模型的开发?

解决这一问题,将为Specialized Research Agents的发展奠定基础,促进auto-research的实现,也让我们更进一步地迈向让AGI真正理解科研与知识的奥秘的新阶段。

近日,伊利诺伊大学厄巴纳–香槟分校(UIUC)Jiaxuan You教授团队发布了新作,提出了基于图结构的统一科研数据接口,收集并处理了形式各异的科研数据,以辅助不同机器学习模型在各种科研任务上的训练,展望利用AI高效辅助科研的未来。

论文链接

研究动机

痛点一:数据分散在多个平台,科研语义被割裂

研究一篇文章时,我们常常:

  • 在ArXiv找相关论文(内容、图表、引用)
  • 在OpenReview看审稿意见、看rebuttal、看版本修改
  • 在GitHub或附录里找代码、找实验细节
  • 在DBLP/Google Scholar看作者与引用网络

平台和平台之间缺少统一的结构化连接。模型拿到的往往只是一段段拼接好的,很难对平台间的跨源关系做建模。

痛点二:图表/段落/引用这些「高价值结构」,长期被当作噪声处理

论文里最有信息密度的内容,经常不是摘要,而是:方法流程图、实验表格、ablation与结果对比、对于前人工作的引用。

但传统数据集与基准常常把这些「结构」压扁成纯文本,导致模型无法接触到「论文内部的组织逻辑」。

痛点三:科研是「演化过程」,但我们常把它当成「静态快照」

科研不是一次性写完的。尤其在顶会投稿场景里,论文会经历:reviewer评论、rebuttal、revision(多轮修改)

这些是「科研互动」和「论文进化」的核心信号,但在很多数据里它们要么缺失,要么只是散落文本。

ResearchArcade 将科研世界模拟成一张动态图

研究人员提出的ResearchArcade是一个基于图结构的数据接口,连接了多个学术数据源,统一了学术任务定义,并支持广泛的机器学习模型的训练。

本文转载自腾讯网, 作者:腾讯网, 原文标题:《 科研数据不再碎片化!一张可计算图,连起整个科研世界 》, 原文链接: https://new.qq.com/rain/a/20260324A03K9Y00。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅