智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 【新智元导读】UIUC研究团队打造ResearchArcade,将ArXiv论文、OpenReview评审、图表代码等碎片数据连接成动态知识图谱。模型可直接学习引用关系、修改轨迹与审稿互动,让AI更好辅助科研写作、修订与预测,为下一代科研智能体奠定统一数据基础。
在学术科研的过程中,研究者需要面对形态各异的数据来源:我们从ArXiv获取最新论文以追踪学术前沿,从 OpenReview 的开放评审中学习 Rebuttal 的技巧……
随着科研人员越来越多地借助机器学习(如LLM、GNN等)来辅助各类研究任务,一个关键问题随之浮现:
我们是否能建立一个统一的数据接口,来支持不同学术任务中机器学习模型的开发?
解决这一问题,将为Specialized Research Agents的发展奠定基础,促进auto-research的实现,也让我们更进一步地迈向让AGI真正理解科研与知识的奥秘的新阶段。
近日,伊利诺伊大学厄巴纳–香槟分校(UIUC)Jiaxuan You教授团队发布了新作,提出了基于图结构的统一科研数据接口,收集并处理了形式各异的科研数据,以辅助不同机器学习模型在各种科研任务上的训练,展望利用AI高效辅助科研的未来。
研究一篇文章时,我们常常:
平台和平台之间缺少统一的结构化连接。模型拿到的往往只是一段段拼接好的,很难对平台间的跨源关系做建模。
论文里最有信息密度的内容,经常不是摘要,而是:方法流程图、实验表格、ablation与结果对比、对于前人工作的引用。
但传统数据集与基准常常把这些「结构」压扁成纯文本,导致模型无法接触到「论文内部的组织逻辑」。
科研不是一次性写完的。尤其在顶会投稿场景里,论文会经历:reviewer评论、rebuttal、revision(多轮修改)
这些是「科研互动」和「论文进化」的核心信号,但在很多数据里它们要么缺失,要么只是散落文本。
研究人员提出的ResearchArcade是一个基于图结构的数据接口,连接了多个学术数据源,统一了学术任务定义,并支持广泛的机器学习模型的训练。
