PERSON RE-ID · COMPUTER VISION · OCCLUSION · DEEP LEARNING
同一个人走进不同摄像头以后,为什么AI有时候认得出来,有时候却因为换了角度、被遮挡或者只露出半个身体就开始认错?这正是Person Re-Identification,也就是行人重识别长期研究的核心问题。传统模型往往依赖整个人体的全局特征,但在商场、地铁、街道和监控视频中,行人经常会被其他人、车辆、背包或者画面边缘遮挡,完整人体信息并不存在。近年来,研究开始把人体解析、局部身体区域、注意力机制和全局上下文结合起来。一项DPBF行人重识别研究进一步把SPD人体部位判别、AFICF局部全局特征融合、PCC相关性筛选、PCA降维和Hybrid Loss放进统一框架,在Market-1501、DukeMTMC-ReID、CUHK03、Occluded-ReID等多个Benchmark上验证。本文不只讲模型结构,更重点解释:为什么人体不同部位提供的信息并不一样,为什么简单特征拼接可能反而降低效果,以及遮挡Person Re-ID论文真正应该怎样设计实验。

一、Person Re-ID到底是什么?
Person Re-Identification,简称:
Person Re-ID。
它解决的不是:
“图片里有没有人?”
而是:
“这个人,是不是之前另一个摄像头里出现过的那个人?”
例如:
摄像头A里出现一个穿蓝色上衣、背黑色背包的人。
几分钟以后:
摄像头B里又出现一个相似的人。
系统需要判断:
是不是同一个Identity。
这类技术常用于:
智能视频分析;
跨摄像头目标跟踪;
大型公共空间行为分析;
智能交通研究;
计算机视觉Benchmark。
二、为什么Person Re-ID比普通图像分类难很多?
普通Image Classification:
一张猫。
只需要识别:
Cat。
但Person Re-ID需要区分:
人与人之间非常细微的差异。
例如两个人可能:
都穿黑裤子。
都穿白鞋。
都背双肩包。
身高还差不多。
这时候模型必须依赖:
服装纹理;
局部颜色;
背包形状;
身体比例;
鞋子;
姿态;
局部身体特征。
因此:
Person Re-ID本质上是一种细粒度视觉识别任务。
三、真正棘手的问题其实是Occlusion
现实监控画面里:
人很少规规矩矩站在摄像头正中央。
更常见的是:
前面有人。
旁边有车。
下半身被桌子挡住。
背包挡住躯干。
只拍到半个身体。
甚至:
只有上半身还在画面里。
这就是:
Occluded Person Re-ID。
遮挡并不是简单“少几个像素”,而是模型最依赖的身份信息可能整个消失。
四、为什么只提取整个人的Global Feature不够?
早期很多Person Re-ID模型会把整张人体图片:
输入CNN。
最后得到:
一个Global Embedding。
这种方法有一个明显问题。
如果:
下半身被遮挡。
或者:
身体一半是背景。
Global Feature里就会混入大量无效信息。
比如模型本来应该学习:
蓝色外套。
结果却学到:
旁边车辆。
墙面。
另一个行人的衣服。
因此:
局部身体区域开始成为Person Re-ID的重要研究方向。
五、PCB为什么成为经典Part-based方法?
PCB,也就是:
Part-Based Convolutional Baseline。
核心思路很直观。
不要把整个人当成一个区域。
而是把Feature Map:
横向切成几个部分。
比如:
头部;
上身;
腰部;
腿部。
然后:
分别提取Part Feature。
这样就算腿被遮挡:
上身仍然可能提供有效Identity Cue。
六、但“横着切几块”也有问题
人的姿态不会永远保持一致。
有人站直。
有人弯腰。
有人坐着。
有人侧身。
有人只露出半边身体。
如果固定按照:
图像高度20%、40%、60%
去切:
某一个区域里可能同时出现:
手臂。
衣服。
背景。
甚至另一个人。
这就是固定Part Partition的局限。
七、为什么Human Parsing开始进入Person Re-ID?
Human Parsing:
可以理解成:
让AI先判断图片里哪些像素属于头、躯干、手臂、腿等人体区域。
这比:
“横着切五块”
更符合人体语义结构。
例如模型可以知道:
这是Left Arm。
这是Torso。
这是Leg。
而不是简单:
这是Image Height 40%–60%。
八、DPBF到底是什么?
这项研究提出的整体架构叫:
Dynamic Part-Based Fusion。
简称:
DPBF。
它主要包含两个模块:
SPD
Salient Part Discrimination
负责找出人体不同语义区域中真正具有身份辨识度的局部特征。
AFICF
Adaptive Feature Integration and Contextual Fusion
负责把人体局部特征与整个人的Global Context更加合理地融合。
九、DPBF真正的创新点在哪里?
这里要特别注意。
这篇论文自己并没有说:
“Attention是我们发明的。”
也没有说:
“Human Parsing是全新的。”
PCC。
PCA。
Triplet Loss。
同样都不是新的方法。
真正的Contribution在于:
把Parsing-guided Part Feature、Attention、Correlation-aware Feature Integration和Hybrid Supervision协调到统一的Occluded Person Re-ID流程里。
这种研究思路其实很值得做应用型SCI的人参考。
创新并不一定意味着:
一定要重新发明一个全新的数学公式。
也可以是:
已有技术以前没有以这种方式协同解决某个明确问题。
十、SPD模块到底负责什么?
SPD:
Salient Part Discrimination。
它想解决的是:
人体不同区域的信息价值并不相同。
例如:
一个人的上衣图案:
可能非常有辨识度。
但:
下半身完全被遮挡。
这时候:
模型不应该继续强行依赖Leg Feature。
SPD会通过Attention Map:
强调:
当前图片里真正可见、真正有Identity Information的区域。
十一、SPD为什么还要结合SCHP?
研究使用:
Self-Correction for Human Parsing,SCHP。
它帮助生成Weakly Supervised Human Parsing Label。
模型不需要人工为每一张Person Re-ID图片:
手动标记:
哪里是Head。
哪里是Torso。
哪里是Arm。
哪里是Leg。
而是借助Pretrained Parsing Model:
得到初步人体区域。
再用Attention机制:
帮助进一步调整。
十二、为什么不能完全相信Parsing Label?
因为Human Parsing也会错。
尤其在:
严重遮挡;
极端姿态;
低分辨率;
身体截断;
多人重叠。
场景下。
比如:
腿只剩一小部分。
Parsing Model可能直接分错。
如果Re-ID模型完全依赖这个错误Label:
误差就会继续向后传播。
所以SPD不是:
“Parsing Label是什么就完全信什么。”
而是:
Parsing提供语义初始位置,Attention负责寻找更有辨识度的区域。
十三、什么是Part Attention Map?
简单理解:
模型给人体每一个区域生成一张:
“我现在应该关注哪里的热力图”。
比如Torso Attention:
可能重点响应:
衣服Logo。
纹理。
颜色组合。
Head Attention:
可能关注:
帽子。
头发区域。
肩部轮廓。
这些Attention Map最后和原Feature Map:
进行Element-wise Multiplication。
达到:
强化关键区域、削弱无关背景。
十四、CP-SFMM又是什么?
完整名字:
Cross-Part Spatial Feature Modulation Map。
它的任务:
把不同身体区域得到的Attention:
作用到原Feature Map。
得到:
Part-specific Feature Map。
形式很简单:
Part Feature = Attention Map × Original Feature Map
但它解决的是一个很实际的问题:
不同身体区域:
不应该共享完全一样的Spatial Response。
十五、为什么有了Local Feature,还必须保留Global Feature?
因为Local Feature也不是万能的。
例如:
只看鞋子:
很多人鞋子一样。
只看裤腿:
也可能非常相似。
Global Feature可以提供:
整体身体比例;
颜色组合;
整体外观;
上下区域关系。
所以:
Person Re-ID真正理想的Representation:
往往不是:
Global。
也不是:
Local。
而是:
Local + Global。
十六、那为什么不能直接Concat?
这是这篇研究非常重要的一个点。
很多模型会:
Local Feature。
Global Feature。
直接:
Concatenate。
看起来信息更多。
问题是:
里面可能存在大量:
Redundant Features。
例如:
上衣颜色:
已经出现在Global Feature。
Torso Feature里又出现一次。
Upper-body Feature再出现一次。
直接Concat以后:
Feature Dimension越来越大。
但:
真正的信息量不一定增加。
十七、AFICF就是为了解决这个问题
AFICF:
Adaptive Feature Integration and Contextual Fusion。
它不直接把:
Local。
Global。
全部简单拼起来。
而是先判断:
哪些Feature互补。
哪些Feature高度重复。
然后:
再进行融合。
十八、为什么这里会出现Pearson Correlation?
Computer Vision论文里:
看到Pearson Correlation可能有点奇怪。
但在这里:
它的作用非常直接。
假设:
Feature A。
和Feature B:
相关性特别高。
说明:
它们很可能在表达类似信息。
如果全部保留:
可能只是:
增加Dimension。
而没有增加新的Discriminative Cue。
所以:
PCC被用来检查:
Feature Redundancy。
十九、PCA在这里又是干什么?
PCC之后:
研究继续使用:
Principal Component Analysis。
也就是PCA。
目标不是:
“让模型看起来更复杂。”
而是:
进一步压缩:
Local + Global Feature。
去掉剩余冗余。
最后生成:
512维Compact Feature Representation。
这样既保留主要Discriminative Variance:
又避免Representation无限膨胀。
二十、整个Feature Fusion逻辑可以这样理解
第一步:提取Global Feature。
第二步:根据人体Parsing和Attention提取Part Feature。
第三步:PCC检查Local与Global之间的Feature Redundancy。
第四步:PCA进一步生成Compact Representation。
第五步:Adaptive Fusion得到最终Person Embedding。
二十一、为什么Loss也不能只用一个?
Person Re-ID通常同时面临两个目标。
第一个:
Identity Classification。
这个人是谁。
第二个:
Metric Learning。
同一个人的Feature:
要靠近。
不同人的:
要远离。
所以:
只用Cross-Entropy:
不一定充分优化Embedding Distance。
只用Triplet Loss:
又可能缺少稳定的Identity Classification监督。
二十二、Hybrid Loss是怎么组合的?
研究采用:
Cross-Entropy + Triplet Loss。
简单理解:
Cross-Entropy:
让模型知道:
“这到底是哪一个Identity。”
Triplet Loss:
让模型学会:
“同一个人的Embedding应该靠近,不同人应该拉远。”
两个Loss:
共同优化Global和Part-level Representation。
二十三、这篇到底用了哪些Benchmark?
二十四、Person Re-ID最重要的评价指标是什么?
主要两个:
Rank-1。
和:
mAP。
Rank-1是什么意思?
给模型一张Query。
从Gallery里找同一个人。
如果排在第一名的就是正确Identity:
这次Rank-1成功。
mAP是什么意思?
Mean Average Precision:
不只关心第一张结果。
而是:
正确身份图片在整个Ranking List里的排序质量。
所以:
mAP往往比单独Rank-1:
提供更完整的检索表现。
二十五、DPBF在普通Benchmark上表现如何?
Market-1501
R-1 96.0%
mAP 89.3%
DukeMTMC-ReID
R-1 92.0%
mAP 82.8%
CUHK03-Labeled
R-1 89.5%
mAP 82.6%
在当前论文采用的比较协议下:
DPBF:
Market-1501 Rank-1:
相较最接近方法提升约:
0.3个百分点。
DukeMTMC-ReID:
约:
1.0个百分点。
CUHK03-Labeled:
提升更加明显。
二十六、真正拉开差距的是Occluded-ReID
这篇研究最值得关注的结果:
不是普通无遮挡数据。
而是:
Occluded-ReID。
在这个Benchmark上:
DPBF相较最近竞争方法:
Rank-1:
提高10.6个百分点。
mAP:
提高16个百分点。
这说明DPBF真正体现优势的地方,不是普通清晰图片,而是人体信息不完整时怎样利用剩余可见区域。
二十七、是不是每个遮挡Benchmark都第一?
不是。
这一点网站文章必须讲清楚。
例如:
在部分Occlusion Benchmark中:
BPB Re-ID仍然有某些指标更高。
所以不能写:
“DPBF全面超过所有现有行人重识别模型。”
更准确的是:
DPBF在多个普通与遮挡Benchmark上具有竞争力,并且在Occluded-ReID数据上取得了特别明显的提升。
二十八、为什么Ablation Study非常重要?
模型里现在有:
SPD。
AFICF。
PCC。
PCA。
Global Feature。
Part Feature。
Hybrid Loss。
这么多组件。
Reviewer一定会问:
到底哪个真的有用?
如果只是:
全部放一起。
然后报告:
Performance提高。
并不能说明:
某一个Module是必要的。
二十九、Feature Integration实验说明了什么?
在Occluded-ReID:
同时加入:
Global Feature;
Body-part Feature;
PCC;
PCA;
Cross-Entropy;
Triplet Loss。
完整HLF配置:
获得:
mAP 73.7%。
Rank-1 86.5%。
逐步去掉Part Feature或者Loss Components:
表现明显下降。
这说明:
模型优势更可能来自:
多个组件协同。
而不是:
某一个单独Attention Layer。
三十、人体所有部位的重要性一样吗?
完全不一样。
这是这篇实验很有价值的一部分。
研究发现:
Upper-body Region:
整体更稳定。
Lower-body Region:
更容易出现Performance Degradation。
为什么?
现实摄像头里:
腿和脚:
更容易被:
其他人;
车辆;
桌子;
画面边缘;
低分辨率;
遮挡。
三十一、Lower-body为什么特别脆弱?
研究里的Part Embedding分析显示:
部分Lower-body Embedding:
在严重遮挡数据中:
Rank-1和mAP下降非常明显。
最弱部位与最强部位之间:
Rank-1差距:
最高达到约90个百分点。
这说明:
严重遮挡不是简单让全部Feature一起下降一点。
而是:
某些Body Part Feature会直接失去可用信息。
三十二、所以真正的问题可能不是“被遮挡”,而是“没有信息”
如果一条腿:
只是被部分挡住。
模型还可以:
尝试从剩余纹理提取Feature。
但如果:
整个Lower-body完全不存在。
任何Attention Model:
也不可能:
从不存在的像素:
得到真实身份信息。
因此真正Extreme Occlusion问题是:
Missing Visual Evidence。
这也是很多Occluded Re-ID模型目前仍然没有彻底解决的问题。
三十三、为什么未来需要Adaptive Part Weighting?
现在一个很自然的改进方向是:
模型自己判断:
哪一个Body Part现在可靠。
比如:
腿完全不见了。
就应该:
Lower-body Weight ↓。
Torso清晰可见:
Upper-body Weight ↑。
这种:
Visibility-aware Adaptive Part Weighting
比固定给每个Part相同权重:
更符合真实遮挡场景。
三十四、Transformer为什么也会继续进入Person Re-ID?
Transformer最大的特点:
擅长:
Long-range Dependency。
在Person Re-ID里:
它可以建立:
头部。
Torso。
Leg。
不同Region之间:
更灵活的Global Interaction。
比如:
腿虽然被挡。
模型仍然可以根据:
剩余Upper-body。
Backpack。
Global Silhouette。
重建更完整的Identity Representation。
三十五、CLIP和Vision-Language Model也可能影响Re-ID
传统Person Re-ID:
主要学Visual Embedding。
现在越来越多研究开始加入:
CLIP。
Text Prompt。
Vision-Language Alignment。
比如:
模型不仅知道:
某一区域Feature是什么。
还可以建立:
“蓝色夹克”。
“黑色背包”。
“白色运动鞋”。
这样的Semantic Representation。
未来:
Vision-Language Person Re-ID
可能会继续成为热门方向。
三十六、训练用了什么Backbone?
主要两个:
ResNet-50
输入分辨率256 × 128,兼顾计算效率和经典Person Re-ID配置。
HRNet-w32
输入分辨率384 × 128,更强调高分辨率Spatial Representation。
HRNet有一个明显特点:
网络中持续维持高分辨率Feature。
这对:
Body Part。
Fine-grained Cue。
Human Parsing。
通常更加友好。
三十七、完整训练配置也很重要
| 训练设置 | 配置 |
|---|---|
| Optimizer | Adam |
| Initial Learning Rate | 3.5 × 10⁻⁴ |
| Warm-up LR | 3.5 × 10⁻⁵ |
| Training Epochs | 150 |
| Triplet Margin | 0.3 |
| Feature Dimension | 512 after PCA refinement |
| Augmentation | Random Crop、Normalization、Random Erasing |
三十八、为什么Random Erasing特别适合Person Re-ID?
Random Erasing:
会在训练图片中:
随机遮掉某些区域。
这其实相当于:
人为制造:
部分Occlusion。
让模型不要:
过度依赖某一个固定Body Region。
例如:
如果训练时永远能看到完整鞋子:
模型可能特别依赖Foot Feature。
一旦真实画面里鞋子不见:
Performance就会迅速下降。
三十九、计算效率有没有测试?
有。
研究还比较:
Dual TITAN Xp。
和:
Single RTX 4090。
结果显示:
RTX 4090:
在Feature Extraction和Optimizer Step中:
整体计算效率明显更好。
同时:
不同Hardware环境下:
Rank-1和mAP变化很小。
这说明:
模型表现不是:
只在某一块GPU上偶然成立。
四十、为什么计算机SCI现在越来越需要报告FLOPs和Parameters?
因为:
单纯提高0.5% Rank-1:
并不一定有意义。
假如:
模型参数增加10倍。
推理速度下降20倍。
实际部署价值:
可能反而下降。
所以现在比较完整的Computer Vision论文:
越来越需要报告:
Parameters;
FLOPs;
Inference Time;
Memory Usage;
GPU Configuration。
四十一、这篇论文有一个需要特别注意的比较限制
原研究自己明确说明:
部分Baseline结果:
是从原论文中收集的。
并不是:
所有方法都在完全统一代码环境:
重新训练。
这意味着:
不同方法之间可能存在:
Backbone差异;
Input Resolution差异;
Data Augmentation差异;
Optimization差异;
辅助训练方法差异。
因此:
它更适合看作:
Standard Protocol下的Reference Comparison。
而不是:
绝对严格统一的Benchmark。
四十二、为什么这点对SCI论文特别重要?
很多计算机论文很容易写:
“我们的模型比A提高2%,比B提高3%。”
但如果:
A使用ResNet-50。
你使用HRNet。
A输入256×128。
你使用384×128。
A没有Random Erasing。
你用了很多Augmentation。
这种提升:
不一定全部来自:
你提出的新Module。
所以真正高质量实验:
最好加入:
Unified Reproduction。
四十三、如果继续完善这篇研究,最值得增加什么?
第一:
Strict Same-backbone Ablation。
所有方法统一:
ResNet-50。
统一Input Resolution。
统一Augmentation。
统一Training Epoch。
第二:
Cross-dataset Generalization。
例如:
Market-1501训练。
直接去Duke测试。
看看模型是不是只记住某一个Dataset Style。
第三:
更严重Synthetic Occlusion Test。
可以控制:
遮挡10%。
30%。
50%。
70%。
观察Performance Curve。
四十四、Person Re-ID未来比较值得关注哪些方向?
Occluded Person Re-ID;
Partial Person Re-ID;
Vision Transformer Re-ID;
CLIP-based Re-ID;
Text-to-Person Retrieval;
Cross-domain Re-ID;
Unsupervised Domain Adaptation;
Self-supervised Re-ID;
Video Person Re-ID;
Multi-modal Re-ID;
Visibility-aware Feature Learning;
Occlusion Reconstruction;
Adaptive Part Weighting。
四十五、做Person Re-ID SCI论文最容易犯什么错误?
| 常见问题 | 为什么不够 | 更合理做法 |
|---|---|---|
| 只报Rank-1 | 不能完整反映Ranking Quality | 同时报告mAP、R-5、R-10 |
| 不同Backbone直接比较 | 很难判断提升来自哪里 | 统一Backbone重新实验 |
| Module很多没有Ablation | 无法证明每个模块必要性 | 逐模块Remove/Replace |
| 只测无遮挡Dataset | 无法证明Occlusion Robustness | 增加Occluded/Partial Benchmark |
| 只看最终Embedding | 不知道Body Part为什么有效 | Part-wise Analysis + Heatmap |
| 不报告计算开销 | 无法判断实际部署价值 | Parameters + FLOPs + Speed |
四十六、SCI发表辅导:计算机视觉论文真正应该先解决什么?
Person Re-ID、目标检测、图像识别和计算机视觉一直都是人工智能SCI里非常活跃的方向。
但现在简单写:
“我们增加一个Attention Module,准确率提高1%。”
越来越难形成足够完整的Research Story。
Reviewer通常会继续问:
为什么一定需要这个Module?
有没有Same-backbone Comparison?
有没有Occlusion Test?
有没有Ablation?
有没有Part-wise Analysis?
有没有Cross-dataset Generalization?
计算开销是多少?
最差案例在哪里?
所以对于已经有人工智能、计算机视觉、Person Re-ID、目标检测、Transformer、人体解析、深度学习相关代码、实验或者论文初稿的研究者,我们可以提供SCI发表辅导,结合现有研究梳理Research Gap、模型结构、Baseline、Ablation Study、评价指标、实验设计、结果解释、Discussion以及目标SCI期刊方向。
如果论文已经进入投稿或者返修阶段,也可以根据项目实际情况选择投稿无限期服务直到见刊,在约定服务范围内持续协助期刊匹配、投稿材料整理、Reviewer Comments分析、返修逻辑和必要情况下的后续改投。具体审稿周期以及最终录用结果仍由研究质量、实验完整度和期刊同行评审决定。
FAQ:Person Re-ID、遮挡行人重识别与AI视觉常见问题
Q1:Person Re-ID是什么意思?
Person Re-Identification指从不同摄像头或不同图像中识别同一个人的视觉检索任务,核心是学习具有身份辨识能力的Embedding。
Q2:Person Re-ID和人脸识别有什么区别?
人脸识别主要依赖Face Region,而Person Re-ID通常依赖整个人体外观,包括服饰、身体结构和局部视觉特征,在没有清晰人脸时仍需要完成匹配。
Q3:为什么遮挡会严重影响行人重识别?
因为身份辨识所需的关键Body Region可能直接消失,而且遮挡还会引入背景和其他人体特征,导致Global Representation被污染。
Q4:什么是Part-based Person Re-ID?
它把人体表示拆分为多个局部区域分别学习Feature,再与Global Representation组合,以提高对姿态变化和局部遮挡的鲁棒性。
Q5:什么是Human Parsing?
Human Parsing是一种人体语义分割技术,把图像中的人体进一步划分为头、躯干、手臂和腿等语义区域。
Q6:DPBF是什么?
DPBF即Dynamic Part-Based Fusion,它通过SPD提取具有辨识度的人体局部表示,再通过AFICF融合局部和全局上下文特征。
Q7:为什么还要使用PCC和PCA?
Local和Global Feature可能存在大量重复信息,PCC用于发现高度相关特征,PCA用于进一步压缩冗余并形成更紧凑的Representation。
Q8:Rank-1和mAP有什么区别?
Rank-1关注第一名检索结果是否正确,而mAP评价多个正确Gallery Sample在整个排序列表中的综合排名质量。
Q9:为什么Triplet Loss适合Person Re-ID?
Triplet Loss可以让同一身份的Feature距离更近,不同身份Feature距离更远,因此非常适合视觉检索和Metric Learning。
Q10:遮挡Person Re-ID未来有哪些方向?
可以继续研究Adaptive Part Weighting、Occlusion Reconstruction、Transformer Global-local Interaction、CLIP、Vision-Language Re-ID以及Cross-domain Generalization。
Q11:Person Re-ID SCI实验至少需要哪些内容?
建议包含标准Benchmark、Rank-1和mAP、强Baseline、Ablation、Occlusion Test、Feature Visualization、Part-wise Analysis以及Computational Complexity。
Q12:SCI发表辅导可以协助计算机视觉研究哪些内容?
可以结合已有研究协助Research Gap、模型逻辑、Baseline、Ablation、评价指标、实验设计、结果解释、选刊和Reviewer Response等环节。
结语:遮挡Person Re-ID真正难的,不是看不见整个人,而是怎样用好剩下的信息
Person Re-ID过去很长一段时间:
非常依赖Global Representation。
但真实世界不是Benchmark里的标准行人照片。
有人被挡住。
有人只剩上半身。
有人转身。
有人处于极低分辨率。
这种情况下:
真正有效的模型必须学会:
哪些区域还可信。
哪些区域已经失去信息。
局部与全局怎样互补。
哪些Feature只是重复。
以及:
某一个身体部位缺失以后:
还能不能从其他Visible Cue恢复稳定Identity Representation。
DPBF的价值就在这里。
它不是简单:
“再加一个Attention。”
而是把:
Human Parsing。
Part Attention。
Global Context。
Correlation Analysis。
Dimensionality Reduction。
Cross-Entropy。
Triplet Loss。
组合到同一个Feature Learning过程。
实验也显示:
这个方法真正优势最明显的:
恰恰是Occluded-ReID。
不过研究同时暴露了一个无法回避的问题:
如果某个Body Region已经完全不可见,再好的Attention也不能凭空创造真实身份特征。
所以未来更值得研究的方向:
可能不是继续机械增加Part数量。
而是:
Visibility-aware Weighting。
Cross-part Reasoning。
Occlusion-aware Reconstruction。
Transformer。
以及Vision-Language Representation。
对于计算机视觉SCI来说,这也是一个值得借鉴的研究思路:
真正好的模型,不只是“在完整图片上识别得更准”,而是在信息不完整的时候,仍然知道哪些证据值得相信。