智算多多联系我们

官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)
关注我们

公众号

视频号
◎2025 北京智算多多科技有限公司版权所有 京ICP备 2025150592号-1
京公网安备11010602202532号
京公网安备11010602202532号 4月13日举办的GOSIM2025大会上,中国软件评测中心与清华大学联合发布了《2025大模型服务性能排行榜》,并由清程极智提供技术支持,形成数据展示平台——AI Ping(https://aiping.cn/),为企业用户、开发者选择MAAS服务提供全面、客观、真实的技术信息。
智算云模型即服务快速发展,极大地丰富了大模型产品市场的同时也带来应用开发者和开发商选型难题。不同模型服务商在延迟、吞吐量、可靠性、价格、上下文长度以及最大可输出长度等关键性能指标上存在显著差异。以国内知名互联网大厂、运营商为例,同样是DeepSeek模型,输出吞吐最高相差4.9倍,首字延迟最高相差4.3倍。
本次评测工作以开发者使用场景的服务质量追踪为主,对不同服务商所提供的MaaS API在相同模型、提示词、时间窗口下的性能表现进行持续监测,从延迟、吞吐、可靠性等关键指标切入,通过长周期、高频率、多时段的数据监测,榜单可直观呈现MaaS服务商的实时服务质量表现,最终形成了包含十个性能榜单和一个模型丰富度榜单的综合评测结果。
测评涵盖了21家大模型服务商提供的226个模型服务,包括阿里云百炼、并行科技、硅基流动、火山方舟等知名平台,以及DeepSeek-R1-0528、DeepSeek-V3.1、Kimi-K2-Instruct、Qwen3-235B-A22B和Qwen3-32B等大模型。
各大MaaS服务商的DeepSeek、Qwen、Kimi等模型的平均吞吐和首字延迟的性能榜单如下。
| 模型名称 | 服务商 | 平均吞吐(tokens/s) | 首字延迟(ms) |
|---|---|---|---|
| DeepSeek-R1-0528 | 服务商A | 128.4 | 210 |
| DeepSeek-R1-0528 | 服务商B | 26.2 | 903 |
| Qwen3-32B | 服务商C | 96.7 | 285 |
| Qwen3-32B | 服务商D | 42.1 | 762 |
| Kimi-K2-Instruct | 服务商E | 85.3 | 310 |
| Kimi-K2-Instruct | 服务商F | 38.9 | 820 |
