智算多多联系我们

官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)
关注我们

公众号

视频号
◎2025 北京智算多多科技有限公司版权所有 京ICP备 2025150592号-1
京公网安备11010602202532号
京公网安备11010602202532号 为了更准确地衡量并提升其能力,我们构建了 ComputeEval,一个可靠且开源的基准测试工具,用于评估 AI 模型和智能体在 CUDA 编程任务中的表现。
几个月前,我们发布了 ComputeEval 的首个版本,今天,我们推出其首次重大扩展,新增一百多个 CUDA 挑战。
随着此版本的发布,该数据集已扩展至共包含 232 个 CUDA 及 CUDA 计算核心库(CCCL)相关问题。我们有针对性地引入了更多复杂挑战,要求大语言模型运用现代 CUDA 技术,例如 Tensor Core、高级共享内存模式以及线程束级基元,从而提升了测试标准。新增问题重点考察对 CUDA 图、流和事件等机制的协调能力,并置于动态模拟等真实应用场景之中。
我们的团队在 ComputeEval 上对多个领先的大语言模型进行了评估,旨在建立基准性能指标,并深入理解 AI 辅助 CUDA 编程的当前发展状况(见表 1)。
| Model | ComputeEval 2025.2232 新问题集上的一 |
|---|---|
| GPT-5(中) | 0.5819 |
| Cloude Sonnet 4.0 | 0.5517 |
| gpt-oss-20B(高) | 0.5474 |
| gpt-oss-120b(高) | 0.5302 |
| Claude Opus 4.0 | 0.5216 |
| DeepSeek-R1 | 0.4397 |
| gpt-oss-120b(中) | 0.4224 |
| gpt-oss-20b(中) | 0.4224 |
| gpt-oss-120b(低) | 0.4052 |
| DeepSeek-V3.1 | 0.3750 |
| Llama 4 Maverick 17B 128E | 0.3448 |
| Llama 3.1 405B | 0.3405 |
能力在减弱,而是反映出该基准测试的难度有所提升。随着每个版本的发布,我们不断提高对人工智能的要求,推动其更深入地理解加速计算中的各种细微之处。
我们将持续扩展数据集与评估框架的功能,目前已着手将 ComputeEval 的覆盖范围延伸至更多 CUDA-X 库,包括 cuBLAS、CUTLASS、cuDNN 和 RAPIDS 等。我们诚邀更广泛的 HPC 与 AI 社区参与贡献、开展合作。欢迎在 GitHub 上查阅代码,并通过 Hugging Face 获取相关数据集。
| 特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。 | ||||
![]() 赛博对话 |
![]() 热搜时代 |
![]() 一天零一页 |
![]() 无双 |
![]() 热浪之外 |
关键字: CUDA, AI基准
