计算机视觉SCI期刊 · 人群计数与多尺度注意力
HCMA人群计数模型详解:双流跨层特征交互、多尺度注意力及SCI期刊投稿指南
本文围绕复杂场景中的密集人群计数,讲清HCMA网络为什么采用两条自顶向下的解码流,SCAM、DPP和MSEA分别解决什么问题,以及三套公开数据集、消融实验和计算成本透露出的真实结论。

人工智能SCI期刊
人工智能SCI期刊涵盖机器学习、计算机视觉、智能系统、图像识别、目标检测、密度估计和多模态学习等方向。准备人群计数论文时,除了说明网络结构和实验精度,还要交代跨数据集表现、消融实验、模型参数、计算量、推理速度和可复现性。选刊阶段则需要弄清SCI期刊是什么、SCI期刊如何发表,并通过SCI期刊官网完成SCI期刊查询、SCI期刊分区查询和SCI期刊影响因子查询。本专题以HCMA多尺度注意力网络为例,保留其双流跨层交互、SCAM、DPP、MSEA、联合损失和三套公开数据集结果,同时比较多本智能系统期刊的研究范围。读者可以据此判断一篇计算机视觉SCI期刊论文是否具备完整的方法证据,也能避开只看影响因子、不看Aims and Scope的选刊误区。
一、人群计数为什么需要跨层特征与全局上下文
人群计数的任务不只是判断画面里“有多少人”,还要估计人员在图像或视频中的空间分布。大型活动踩踏风险预警、交通枢纽客流引导、城市公共空间管理和应急疏散,都需要模型在密集遮挡、背景干扰和尺度剧烈变化的条件下保持稳定。
卷积神经网络天然具有层级结构。浅层特征保留边缘、纹理和空间位置,对定位远处的小型头部目标很重要;深层特征拥有较大的感受野和更强的语义表达,有利于区分人群与复杂背景。早期MCNN利用并行多分支感受野处理尺度变化,CSRNet则在VGG16后端采用空洞卷积扩大感受野。这些方法证明了多尺度信息的重要性,也暴露出两个长期问题。
第一个问题是跨层融合仍然粗糙。直接相加要求不同层具有相近的特征分布,直接拼接又把对齐任务留给后续卷积。当分辨率、通道统计和语义抽象程度相差较大时,浅层细节与深层语义未必能够真正互补。AFF和BiFPN虽然引入自适应权重或重复双向聚合,但复杂遮挡场景中的精细对齐仍然困难。
第二个问题是全局场景感知不足。普通卷积更擅长局部建模,远距离区域之间的关系不能被显式表达。在极密集图像中,局部错误会破坏整体密度分布;在稀疏区域,背景纹理又可能被误判为人物。HCMA正是围绕“跨层交互”和“全局关系”两个问题建立结构。
相关研究路线如何发展
CNN人群计数最初主要围绕感受野和密度图回归展开。MCNN使用并行多列结构提取多尺度特征,但分支之间容易出现特征相似、参数冗余和效率不足;CSRNet把空洞卷积接到VGG16后端,在不明显牺牲空间分辨率的情况下扩大感受野。后来研究开始从密度回归转向分布学习和点定位:P2PNet取消中间密度图,借助匈牙利匹配完成点到点定位;DM-Count则使用最优传输比较预测密度与真实点分布,使密度图监督具有更清楚的分布含义。
多尺度融合大致分为同一语义层内的横向多尺度建模,以及不同特征层之间的纵向融合。SANet、并行卷积、大核或空洞卷积和空间金字塔池化属于前一类;跳跃连接、编码器—解码器和特征金字塔属于后一类。AFF使用局部与全局通道注意力调整融合权重,BiFPN则反复进行带归一化学习权重的双向聚合。HCMA与这些方法的区别,在于两条独立的自顶向下流通过乘法门控耦合,而不是只对同一组特征做加权求和。
Transformer路线更强调长距离关系。TransCrowd把计数写成弱监督的序列到数量预测,CCTrans把金字塔视觉Transformer与多层特征聚合结合,CrowdFormer和CounTr分别使用重叠Patch建模及层级编码器—解码器,CLTR把定位写成集合预测,CHS-Net则让卷积头与Transformer头交换监督信息。自注意力擅长全局建模,但计算量随Token数量近似二次增长,也不天然拥有卷积的局部归纳偏置。因此,HCMA保留卷积主干,只在选定融合层使用DPP。
监督目标方面,DM-Count把最优传输应用于归一化预测与标注分布,同时增加总人数约束;非平衡最优传输放宽等质量限制;广义损失进一步用透视信息调整定位成本。HCMA没有重新设计运输理论,而是把Sinkhorn正则运输、图像级人数误差和归一化密度分布误差组合起来。
二、HCMA总体结构:两条自顶向下的功能流
HCMA的全称是Hierarchical Context-Aware Multi-Scale Attention Network,即层级上下文感知多尺度注意力网络。编码器采用ImageNet预训练的VGG16,移除分类器后使用Block 2至Block 5四级特征。对应通道数为128、256、512和512,空间分辨率依次约为输入图像的1/2、1/4、1/8和1/16。
网络包含两条独立参数化的深到浅解码流。第一条是注意力门控流,负责生成空间门控;第二条是密度特征流,携带最终用于密度图估计的表示。两条流都会逐级上采样深层特征,与相邻浅层特征拼接,再经过通道对齐、DPP、MSEA及增强操作。最后,注意力流产生Sigmoid门控,通过逐元素乘法调制密度特征,再交由预测头生成密度图。
这里的“bidirectional”容易被误解。它并不是传统特征金字塔中显式的自底向上与自顶向下循环,而是两条功能不同的自顶向下流之间发生协作:一条流提供注意力指导,另一条流保留计数表示。理解这一点,有助于在SCI期刊论文中准确说明方法创新,避免标题表述大于实际结构。
| 组成部分 | 核心操作 | 主要作用 | 需要注意的边界 |
|---|---|---|---|
| 双流跨层交互 | 两条独立自顶向下流,门控流逐元素调制密度流 | 连接浅层空间细节与深层语义 | 不是常规底向上/顶向下双向金字塔 |
| SCAM | 局部与扩张深度卷积、空间门控、加权融合 | 按内容选择不同尺度上下文 | 早期训练特征噪声可能影响门控可靠性 |
| DPP | 图像均值Token、随机扰动、单头关系聚合 | 建立远距离区域的全局关系 | 不是Transformer编码器,也不是持久位置编码 |
| MSEA | 1×1、3×3、5×5空间分支与通道校准 | 增强高层语义中的多尺度判别能力 | 标准多核卷积带来额外参数和计算量 |
三、SCAM:根据场景内容选择局部与大感受野信息
SCAM即Selective Context-Aware Attention Module。其目的不是简单堆叠三种标准卷积,而是利用不同运算形成细粒度、中等尺度和粗尺度上下文。BSConv先使用5×5深度卷积提取局部信息,再用膨胀率为3的7×7深度卷积构建有效约19×19的感受野。随后,两组1×1卷积把局部特征和上下文特征投影到原通道数的一半。
Contextual Spatial Attention会分别对两组特征做通道平均和通道最大描述,得到两张空间门控图。Adaptive Weighted Fusion再将局部分支和大上下文分支按位置加权相加。两张门控都经过Sigmoid独立约束在0至1之间,但没有被强制要求相加等于1。因此,它更像两组可同时开启或抑制的空间控制信号,而不是二选一的Softmax权重。
融合结果通过1×1卷积恢复通道数,然后与原输入逐元素相乘。这样做使网络能够在密集区域强化大范围上下文,在小目标或边界区域保留局部细节。需要说明的是,门控图来自中间特征,训练初期若特征尚不稳定,空间权重也可能不够可靠。
四、DPP:不用完整Transformer也能建立全局关系
DPP即Dynamic Positional Pooling。输入特征首先按行优先顺序展开为Token序列,再计算全图平均Token并放在序列首位。若特征图包含H×W个位置,增强后的序列长度就是H×W+1。每次前向传播时,DPP都会重新采样服从高斯分布的Token级扰动,并将同一次采样广播到整个批次。
DPP没有额外学习Query、Key和Value投影,而是直接令Q、K、V等于加入扰动后的序列,使用单头相似度完成关系聚合。聚合结束后舍弃全局Token,把剩余Token折叠回原空间布局,并通过残差连接加回输入。
“Dynamic”指的是随机矩阵会随当前特征尺寸生成,并在每次前向传播重新采样。它不是能够长期保存坐标意义的绝对位置编码,也不是由图像内容预测的位置表示。DPP没有多头拆分、前馈网络、层归一化或学习型Q/K/V,因此不应被描述成Transformer编码器。不过,Token两两计算仍会增加运算量,这一成本必须在复杂度分析中如实给出。
五、MSEA:把通道权重与多核空间特征放在一起
MSEA即Multi-Scale Enhancement Attention Module。通道分支分别对输入做全局平均池化和最大池化,两组描述经过共享的两层1×1 MLP后相加,再用Sigmoid得到通道权重。MLP的通道压缩比例为16,激活函数采用负斜率0.1的LeakyReLU。
空间分支同时使用1×1、3×3和5×5标准卷积,每个分支输出2C通道,拼接后得到6C通道表示,再通过1×1卷积压缩回C通道。压缩后的多尺度空间特征与通道权重逐元素相乘,最后通过残差连接与输入相加。
MSEA与CBAM或MSCA的差别不只在有没有平均池化和最大池化。CBAM通常先做通道注意力,再从通道池化描述中形成空间掩码;MSCA更依赖大核深度卷积分支;MSEA则明确构建1×1、3×3、5×5三种标准卷积空间表示,再用双统计通道权重完成校准。
六、联合损失:同时约束总人数与空间质量分布
HCMA的总目标由三部分组成:Sinkhorn正则化的最优传输项、图像级人数误差,以及归一化密度分布误差。第一项比较预测密度和标注点分布之间的运输成本;第二项比较预测密度图积分与真实人数之间的绝对误差;第三项先把预测图和离散点标注归一化,再计算L1距离,并用真实人数恢复与计数规模相关的权重。
原公式把第三项写作Ltv,但它并不是常见的Total Variation梯度平滑正则项,也不惩罚水平、垂直或对角梯度。更准确的理解是“归一化密度分布差异”。论文写作中应主动说明这一点,否则审稿人很容易把符号与经典TV损失混淆。
总目标:Ltotal = Lot + Lcount + Ltv
最终权重:λot = 0.10,λtv = 0.01;Sinkhorn熵正则为10,迭代100次。
研究通过5×5网格搜索比较λot为0.01、0.05、0.10、0.20、0.50,以及λtv为0.001、0.005、0.010、0.050、0.100的组合。每种配置都训练1000个Epoch,最终0.10与0.01的组合获得最低MAE和RMSE。结果同时说明,增大损失权重并不会带来单调提升,过强的传输约束反而会损害计数精度。
七、数据集、评价指标与训练配置
| 数据集 | 规模与特点 | 主要检验能力 |
|---|---|---|
| ShanghaiTech | Part A含482张高密度自然场景图;Part B含716张较稀疏街景图 | 高密度与低密度场景之间的适应性 |
| UCF-QNRF | 1400张高分辨率图,每张人数49至12,865,尺度和密度跨度很大 | 多尺度感知、全局关系和高分辨率处理 |
| NWPU-Crowd | 5109张图、超过200万个标注实例,场景、光照和视角多样 | 真实场景变化、严重遮挡与非均匀人群分布 |
所有数据集使用官方训练/测试划分,点标注以离散点图表示,并采用保持总人数不变的求和池化进行下采样。评价指标为MAE和RMSE。MAE反映预测人数与真实人数之间的平均绝对偏差;RMSE对大误差更敏感,因此更能反映困难场景中的稳定性。两项指标都是越低越好。
实验硬件为Intel i7-13700KF、24GB内存和一张24GB显存的RTX 3090;软件环境为Ubuntu 22.04.2、Python 3.8.20、PyTorch 2.0.0及CUDA 11.7,没有启用自动混合精度。编码器和其他网络层共同优化,Adam固定学习率1×10−5,β1=0.9、β2=0.999、ε=1×10−8,权重衰减1×10−4。
模型训练1000个Epoch,批量大小为6,没有学习率调度、Warm-up、梯度裁剪、梯度累积、EMA或早停。第2个Epoch开始逐轮验证,以2×RMSE+MAE选择模型。ShanghaiTech、UCF-QNRF和NWPU-Crowd的裁剪尺寸分别为256×256、512×512和384×384,仅使用概率0.5的水平翻转。测试采用整图推理、批量大小1、不做测试时增强,输出步幅为2。
实验没有设置固定随机种子或确定性CUDA模式,cuDNN benchmark处于开启状态,精度来自单次运行。参数量和计算量按1×3×256×256输入统计;延迟在100次预热后测量1000次同步GPU推理,不包含数据加载和后处理。这个细节很重要:没有重复运行就无法量化不同随机初始化带来的波动。
八、三套公开数据集的主要结果
| 数据集 | HCMA结果 | 与代表性结果比较 | 应如何解读 |
|---|---|---|---|
| ShanghaiTech Part A | MAE 52.2,RMSE 85.4 | MAE比CLTR的56.9低8.3%;RMSE比DM-Count的84.6高0.9% | 平均计数误差占优,但极端误差稳定性并非所有指标最优 |
| ShanghaiTech Part B | MAE 6.5,RMSE 10.7 | MAE追平CLTR;RMSE比其10.6高0.9% | 在较稀疏街景中保持竞争力 |
| UCF-QNRF | MAE 81.3,RMSE 127.6 | 分别比CLTR的87.3和142.4低6.9%与10.4% | 说明多尺度与全局建模对高分辨率密集场景有效 |
| NWPU-Crowd | MAE 73.2,RMSE 314.3 | 比MTDNet的MAE 74.9低2.3%;比MAN的RMSE 323.0低2.7% | 在场景变化更大的数据集上保持较稳定表现 |
在ShanghaiTech的可视化比较中,HCMA在密集区域保留较细的头部粒度,在稀疏区域产生更紧凑的响应;MCNN更容易出现大面积模糊和背景误报,CSRNet在极端尺度变化下可能漏检,DM-Count则可能出现密度峰位置漂移。不同方法的热力图如果分别归一化,颜色只能展示各自图内的相对强弱,不能直接跨模型解释为绝对密度。
受控经典基线比较中,HCMA在ShanghaiTech Part A的MAE和RMSE分别比DM-Count低15.3%和12.5%。代价是33.86M参数、132.28 GFLOPs,以及每张256×256输入约14.86ms的推理时间。它采取的是“用更高计算成本换取精度”的路线,并非轻量实时模型。
九、收敛与消融实验透露了什么
训练过程中,人数损失从116.43下降到第1000个Epoch的6.53,最低为4.97,平均值为11.29±7.29,大约在第537个Epoch进入稳定范围。记录的带符号Sinkhorn贡献从−2.80×10−7变化到−1.03×10−7,约第47个Epoch接近稳定。这个值是实现层面的记录量,不是理论上非负的原始运输成本,不能把负值理解为“负运输距离”。
加权Ltv基本维持在1.50至1.68附近,平均约1.69±0.06。人数损失与OT、人数损失与Ltv、OT与Ltv的Pearson相关系数分别约为−0.0233、0.1429和0.0319。弱线性相关只能说明三个标量轨迹不同步,不能证明梯度之间没有冲突。
| 消融项目 | 关键结果 | 结论 |
|---|---|---|
| 骨干网络 | VGG16精度最好;MobileNetV2将参数从33.86M降至21.51M、GFLOPs从132.28降至24.22,但MAE增加7.47;ResNet50延迟最低但误差最高 | VGG16适合精度优先,MobileNetV2可作为低成本替代 |
| 联合损失 | 最佳权重得到52.20/85.40;去掉Ltv后为56.36/97.63 | 归一化分布约束有助于减少扩散响应,但权重敏感 |
| 三大核心模块 | 基础模型62.10/101.10;SCAM单模块58.15/91.30;完整模型52.20/85.40 | SCAM、DPP、MSEA各自有效,组合后具有互补性 |
| SCAM尺度角色 | 2角色57.6/91.1,3角色52.2/85.4,4角色56.3/89.4 | 三个尺度角色在覆盖范围与复杂度间更平衡 |
| SCAM子结构 | 移除AWF为53.1/90.4,移除CSA为56.7/99.3,移除BSConv为68.77/112.3 | BSConv贡献最大;局部与大感受野信息不能被其他部分完全代替 |
| 门控方式 | 把乘法门控改为加法后,MAE增加5.66、RMSE增加8.84,参数量不变 | 支持内容依赖的乘法调制,但不能断言其直接抑制噪声 |
| DPP替换实验 | DPP比GAP、SPP和Non-local获得更低误差,同时增加1.55M参数、6.05 GFLOPs,延迟从12.53ms升至14.86ms | 全局建模有效,但计算成本真实存在 |
| MSEA替换实验 | 基线56.4/102.5,EMA为55.7/88.1,MSCA为56.5/106.2,MSEA为52.2/85.4 | 双统计通道校准与多核空间分支更适合当前结构 |
十、研究局限与后续改进方向
HCMA在三套人群计数基准中取得了有竞争力的结果,但这些实验只能说明它在所测人群计数场景中的跨场景鲁棒性,不能证明模型会自然迁移到车辆计数、遥感目标计数或其他密集预测任务。
DPP每次前向传播重新采样随机矩阵,没有持久或内容条件化的位置表示,同时Token关系计算把完整模型成本提高到132.28 GFLOPs和14.86ms。VGG16虽然在已测骨干中精度最好,但33.86M参数会限制边缘设备或资源受限场景部署。
结果来自没有固定随机种子的单次训练,尚未报告均值、标准差或显著性检验,因此运行间波动未知。SCAM在训练早期也可能产生不稳定门控;现有加法/乘法消融证明了乘法调制有利于计数误差,却没有直接证明具体的噪声抑制机制。后续工作应考虑轻量骨干、模型剪枝、蒸馏、量化、重复实验与跨域验证。
十一、这类计算机视觉SCI期刊论文如何发表
把创新边界说准确。说明双流交互、SCAM、DPP与MSEA相较现有特征金字塔、注意力或Transformer方法究竟改变了什么。
实验必须覆盖证据链。至少要有多套公开数据集、主流方法比较、模块消融、超参数敏感性、参数量、GFLOPs、延迟及定性可视化。
补齐可复现性。报告数据划分、裁剪、增强、优化器、学习率、训练轮数、随机种子、模型选择规则、推理协议与统计次数。
先做SCI期刊查询。在Web of Science Master Journal List核验SCIE收录,在当年JCR查看影响因子和JCR分区。
从SCI期刊官网核对范围。判断期刊关注计算机视觉方法、智能系统、工业应用还是人本系统,不要只按影响因子选刊。
准备投稿文件。正文之外通常还需要投稿信、亮点、图文摘要、代码和数据声明、利益冲突、作者贡献及补充实验。
回复审稿意见。对创新性、对比公平性、随机性、复杂度和泛化能力的质疑,要用补充实验或明确边界回应。
十二、智能系统期刊查询与HCMA主题适配
“Advanced Intelligent Discovery影响因子”“Complex & Intelligent Systems几区”“International Journal of Intelligent Systems几区”都属于会随年份变化的查询。下面按照2026年8月出版社官网可见信息整理。具体SCI分区查询仍应以当年JCR或所在单位采用的中科院分区为准。
| 常见搜索词 | 官网信息与判断 | HCMA稿件适配度 |
|---|---|---|
| Advanced Intelligent Discovery影响因子 | Wiley开放获取新刊,官网当前未展示JIF,应查JCR实际记录 | 中等:需要强调计算方法如何支持实际发现或设计任务 |
| Complex & Intelligent Systems几区 | 官网列2025 JIF 4.5;具体几区按当年JCR类别查询 | 较高:复杂场景视觉分析与智能系统方向较契合 |
| International Journal of Intelligent Systems几区 | Wiley官网列JIF 4.8;分区必须结合年份与类别 | 较高:需突出方法贡献、充分验证与通用意义 |
| Advanced Intelligent Systems版面费 | Wiley官网列JIF 6.7;APC按录用时政策及机构协议核验 | 中等:需要较强的方法新颖性和技术影响 |
| International Journal of Machine Learning and Cybernetics LetPub | Springer混合出版,官网列2025 JIF 2.9 | 较高:人群计数、深度学习和视觉任务与范围相近 |
| Human-Centric Intelligent Systems LetPub | 官网列Scopus与EI等收录、当前免APC,但索引列表未列SCIE | 中等:突出公共安全和人本价值时更匹配 |
| Journal of Intelligent Manufacturing怎么样 | 官网列2025 JIF 7.7并显示SCIE收录,核心范围是AI制造应用 | 偏低:落到工厂安全或制造监控时才更适合 |
LetPub、论坛和“SCI期刊 Dcard”内容可以辅助了解投稿体验,但不宜用来最终确认SCI期刊影响因子查询、收录状态或版面费。SCI期刊网站负责提供范围、文章类型、投稿入口和费用政策;Web of Science Master Journal List用于确认收录;JCR用于查看影响因子和JCR分区。
我的智能系统SCI投稿经验
优客网ukthesis创立于1999年。长期接触计算机视觉和智能系统稿件后,我发现不少论文并不是模型没有结果,而是创新边界、对比公平性和复现信息没有讲清楚。像HCMA这样的论文,审稿人通常会追问双流结构是否真正有别于特征金字塔、随机DPP是否稳定、复杂度是否值得,以及单次训练能不能支撑结论。
我们提供研究定位、结构梳理、SCI期刊查询、英文润色、图表规范、投稿材料和审稿回复等连续协助,SCI发表辅导/投稿无限期服务直到见刊。网络上有人用“SCI期刊代写代发”搜索相关服务,而我更看重稿件能否经得起方法和实验层面的追问。优客网ukthesis自1999年持续运营至今,积累的价值就在于把选刊、修改和投稿中的实际问题逐项处理,而不是只在表面上改几句话。
十三、结论
HCMA通过注意力门控流和密度特征流建立跨层交互,以SCAM选择局部与大感受野上下文,用DPP补充全局关系,再由MSEA完成多核空间增强与通道校准。三套公开数据集结果表明,它在尺度变化、遮挡和非均匀分布条件下具有竞争力。
这项方法的优势与代价同样明确:误差下降的同时,参数量、GFLOPs和延迟增加;随机DPP缺少持久位置含义;单次运行和三套基准尚不能证明运行稳定性或跨任务泛化。更有价值的后续工作,是在保持计数精度的前提下完成轻量化、重复实验、跨域验证和真实场景评估。
常见问题 FAQ
SCI期刊是什么?
通常所说的SCI期刊,是指被Web of Science核心合集Science Citation Index Expanded收录的期刊。是否收录、影响因子与分区应按期刊、年份和学科类别分别核验。
HCMA解决了传统人群计数模型的什么问题?
它主要处理浅层空间细节与深层语义交互不足,以及遮挡和尺度变化场景中的全局关系建模不足。核心结构包括注意力门控流、密度特征流及SCAM、DPP和MSEA。
Complex & Intelligent Systems几区?
几区必须说明年份、学科类别以及采用JCR还是中科院分区。具体结果应在当年JCR或单位认可的分区表中查询。
Advanced Intelligent Systems版面费怎么查?
应从Wiley期刊官网进入开放获取与作者指南页面,按照录用日期、作者国家、机构协议及减免政策核算实际APC。
人群计数论文适合Journal of Intelligent Manufacturing吗?
如果研究明确用于工厂安全、生产空间人员监控或制造系统,可以考虑;如果只是通用人群计数基准研究,匹配度通常有限。
SCI期刊如何发表计算机视觉论文?
先明确方法贡献和应用边界,完成多数据集验证、消融实验、复杂度分析、复现说明与局限性讨论,再从期刊官网核验范围、收录、分区和格式要求。