智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 当你第一次接触人群计数任务时,面对琳琅满目的数据集可能会感到无从下手。我刚开始做这个方向时,就曾经花了整整两周时间反复测试不同数据集的效果。今天我就用最直白的语言,帮你理清主流数据集的特性与适用场景。
人群计数数据集的核心差异主要体现在三个方面:场景复杂度、密度等级和标注精细度。以最常见的ShanghaiTech为例,它的Part A主要采集自街头场景,人群密度中等;而Part B则集中在车站等相对封闭环境,密度更高且分布更集中。这种差异会直接影响模型训练效果——我曾经用Part A训练的模型直接测试Part B数据,结果MAE指标直接翻倍。
实际选型时,建议先问自己三个问题:
这个数据集可以说是人群计数的“MNIST”,我的第一个计数模型就是在它上面练手的。Part A包含482张图片,最大的特点是场景单一且标注干净。但要注意几个坑:
Part B的716张图片都是标准的1024×768横屏,适合快速验证模型架构。我通常会先用Part B做原型验证,再用Part A测试泛化能力。
当你的显卡显存≥24GB时,一定要试试这个数据集。它包含5109张超高分辨率图片(平均2191×3209),最大的那张19044×4028的图片,我的3090跑batch_size只能设为1。三个实用建议:
这个数据集最厉害的是提供了luminance label和scene level标注,做多任务学习特别方便。我曾经结合scene level信息,让模型的MAE降低了15%。
这个4372张图片的数据集堪称“地狱难度”,包含了雾霾、下雨、下雪等恶劣天气样本。标注信息也最为丰富:
我在处理这些数据时总结了几点经验:
