CT里看到一根很短的肋骨,到底是真正的胸腰段残肋,还是扫描范围不够导致肋骨只显示了一部分?这个问题看起来很细,却会影响椎体编号、胸腰段异常判断以及部分手术规划。传统方法通常依赖医生人工观察完整肋骨,但现实CT重建并不一定覆盖整段肋骨,因此仅靠长度判断有时并不可行。本文围绕医学影像AI、CT图像分割、nnUNet、肋骨分割和自动测量展开,介绍一套从三维CT中自动获得完整肋骨分割、进行单根肋骨实例匹配、计算肋骨长度,并利用肋骨起始方向以及肋骨和椎体之间的形态关系识别thoracolumbar stump rib的方法。研究中最低两对肋骨的自动分割与长度测量正确率达到98.2%;更有意思的是,即使只看到肋骨起始大约22 mm,MLP或线性SVM仍可利用形态学特征取得约0.84的F1。对于医学影像、深度学习、AI辅助诊断以及相关SCI发表辅导方向,这是一套非常典型的“分割—测量—特征—分类”研究框架。

正常情况下,人类脊柱在骶骨以前通常有24节椎骨:
7节颈椎;
12节胸椎;
5节腰椎。
但真实人体并不是每个人都完全符合这个标准数字。
部分人会出现:
Thoracolumbar Transitional Vertebra,TLTV。
也就是胸腰段移行椎。
这种椎体可能同时具有:
胸椎部分特征;
腰椎部分特征;
异常发育或发育不全的肋骨。
这种发育异常的短肋骨通常被称为:
Stump Rib,SR。
研究采用目前较常见的定义:
肋骨长度≤38 mm。
符合这一长度标准的最低胸椎肋骨,可以作为Stump Rib判断依据。
不过这篇研究很重要的一点是:
它没有只停留在38 mm这个长度阈值。
因为现实CT并不一定把整根肋骨拍完整。
胸腰交界区本身就是脊柱生物力学变化比较明显的位置。
如果同时存在:
椎体数量异常;
胸腰段移行椎;
异常短肋;
肋骨形态改变;
就可能增加椎体编号和定位的难度。
对于手术规划而言:
准确识别椎体层级非常重要。
如果胸腰段存在解剖变异,而影像又没有被正确识别,可能影响术前定位和相关评估。
最直观的方法当然是:
把肋骨完整显示出来。
然后测长度。
但问题是:
很多CT的Field of View并不足以覆盖整根肋骨。
尤其是针对脊柱重建的CT图像。
图像可能主要围绕椎体。
肋骨外侧部分已经超出扫描范围。
这时候医生看到的是:
“一根只显示了部分长度的肋骨。”
究竟是真的短,还是图像没拍完整,就不容易判断。
研究不是简单做一个CT Segmentation Model。
整个目标可以拆成四步。
| 步骤 | 需要解决的问题 |
|---|---|
| 第一步 | 从CT中完整分割肋骨 |
| 第二步 | 把每根肋骨和对应椎体匹配 |
| 第三步 | 自动计算每根肋骨长度 |
| 第四步 | 肋骨不完整可见时利用形态特征识别Stump Rib |
这才是这项工作的完整逻辑。
如果后面需要计算:
Length;
Volume;
Direction;
Orientation;
椎体和肋骨之间的位置关系;
那么第一步得到的Segmentation Mask必须足够完整。
只分割肋骨大概位置不够。
尤其:
肋骨靠近椎体的Rib Head不能丢。
研究发现:
RibFrac提供的RibSeg Annotation:
并没有完整覆盖Rib Head。
TotalSegmentator也存在类似问题。
这对于单纯检测“这里有没有肋骨”也许影响不大。
但如果目标是:
精确测量整根肋骨长度。
起始部分缺失就会直接影响结果。
研究指出:
TotalSegmentator的Rib Segmentation运行在:
1.5 mm isotropic resolution。
而本研究使用:
0.8 mm isotropic resolution。
更高Spatial Resolution能够获得更平滑、更完整的Rib Contour。
nnUNet在医学图像分割中非常常见。
它的重要特点并不是发明了一种完全新的Neural Network。
而是根据Dataset自动配置:
Preprocessing;
Network Architecture;
Training Strategy;
Post-processing。
对于3D CT Segmentation来说:
它是一个成熟而且非常强的Baseline。
最开始:
研究选取内部数据中:
27名Subject。
这些样本具有比较高质量的Rib Annotation。
使用:
nnUNet 3D Full Resolution。
进行训练。
| 参数 | 设置 |
|---|---|
| Model | nnUNet 3D Fullres |
| Patch Size | 192×192×192 |
| Epoch | 300 |
| Cross-validation | 3-fold |
| Voxel Resolution | 0.8 mm isotropic |
| Data Augmentation | Elastic deformation + random horizontal flipping |
医学影像分割很容易产生一个误解:
Resolution越高一定越好。
理论上更高分辨率可以提供更多细节。
但3D CT Data的Memory和计算量增长非常快。
研究把0.8 mm选择为:
Segmentation Accuracy和Computational Feasibility之间的折中。
它并不是经过大规模Hyperparameter Search得到的绝对最佳值。
第一版模型先在Public Dataset上进行Inference。
然后研究人员从预测结果中选择:
VerSe:17名Subject;
RibFrac:11名Subject。
再增加:
45名随机选择的Public Dataset Subjects。
进行Expert Manual Correction。
人工修正由具有经验的研究人员完成。
另外还有:
两名拥有3年和23年经验的专家进行监督和复核。
最终:
45名随机Subjects被单独作为:
Test Set。
剩余训练数据最终达到:
55名Subjects。
医学影像人工标注非常耗时。
如果从0开始:
逐Voxel手工勾画几十例完整肋骨:
工作量非常大。
先让初始Model自动Segmentation。
再由Expert Correction:
通常比完全Manual Annotation效率更高。
初始nnUNet输出的是:
Binary Rib Mask。
它只能告诉我们:
这个Voxel属于肋骨。
或者:
不属于肋骨。
但下一步要测:
左侧第12肋多长?
右侧第11肋多长?
所以还需要:
Instance assignment。
研究使用椎体Instance Segmentation作为Anchor。
VerSe本身已经包含专家级椎体标注。
RibFrac则使用:
SpineR。
生成单节椎体Instance Segmentation。
然后:
计算Binary Rib Mask里的Connected Components。
根据空间距离把每个Rib Component:
匹配到相应椎体。
为了降低错误匹配:
研究加入两个非常符合解剖结构的约束。
第一:
一节椎体最多对应两根肋骨。
第二:
一根肋骨只能被分配给一个椎体。
同时根据肋骨相对椎体的位置判断:
Left。
或者:
Right。
一根肋骨不是直线。
所以:
不能直接用:
起点到终点的Euclidean Distance。
那样一定会低估真实长度。
需要找到一条:
沿肋骨内部走向的中心路径。
研究因此设计了:
Rib Length Measurement Algorithm,RLMA。
先把:
单根肋骨。
以及:
对应椎体。
裁剪出来。
然后重新采样到:
0.5 mm isotropic resolution。
并填充3D Hole。
确保Segmentation Mask保持Dense。
如果Resolution更高:
计算成本快速上升。
如果Resolution降低:
Voxel Discretisation引起的Interpolation Error会增大。
所以:
0.5 mm是测量精度和计算复杂度之间的折中。
第一步:
找到肋骨Segmentation Surface上:
距离对应椎体Corpus Center最近的位置。
然后:
对周围Segmentation Voxels取Average。
再投影回Rib Surface。
这样做的目的:
不是让起点落在肋骨边缘或某个角落。
而是尽可能进入:
肋骨起始部分的中心。
算法从当前Path Point出发。
寻找距离:
14.5–15.5 mm。
范围内的Candidate Points。
然后删除:
更靠近以前Path Points的Candidate。
这样避免算法:
沿肋骨往回走。
计算所有Candidate Points的平均位置。
再形成一个Direction Vector。
沿这个Direction移动大约一半距离。
把Target重新投影到最近Segmentation Voxel。
就得到:
下一个Path Point。
这个过程不断重复。
当当前位置已经无法再找到有效Candidate:
说明接近Rib End。
然后:
算法沿最后的Direction使用一组Ray Cast。
寻找最远可达到的Segmentation Point。
作为:
Final Endpoint。
把所有连续Path Points之间的距离:
逐段相加。
得到Estimated Rib Length。
然后和:
38 mm。
进行比较。
≤38 mm:
Stump Rib。
>38 mm:
Regular Rib。
现实CT可能只显示一部分Rib。
假设实际Rib长200 mm。
但CT只拍到前30 mm。
如果直接拿可见长度和38 mm比较:
就会误判成Stump Rib。
所以研究继续问:
能不能只看肋骨刚从椎体长出来的那一小段形态,就判断它更像Stump Rib还是普通肋骨?
其中一个是:
DRC,Direction Rib Corpus。
它描述:
肋骨起点。
和:
对应椎体Corpus Center。
之间的3D空间关系。
PDRC:
Posterior Component of DRC。
可以理解为:
肋骨起点相对于椎体中心向后偏了多少。
研究发现:
Stump Rib平均Posterior Distance:
−19.2±3.8 mm。
Regular Rib:
−13.8±2.5 mm。
差异具有统计显著性。
Stump Rib:
260.6±103.4 mm²。
Regular Rib:
563.6±127.1 mm²。
同样:
p<0.01。
说明Stump Rib在Shape和Thickness Distribution方面存在不同趋势。
PPR:
Path Point Relation。
它关注:
RLMA得到的前几个Path Points之间:
方向怎么变化。
例如:
2-PPR。
就是:
从Rib Start Point到第二个Path Point之间的Direction Vector。
是。
2-PPR大约对应:
肋骨起始约7 mm。
实验发现:
Stump Rib的Posterior Component:
0.39±0.17。
Regular Rib:
0.64±0.13。
Stump Rib Inferior Component:
0.32±0.23。
Regular Rib:
0.15±0.30。
普通肋骨刚从椎体发出以后:
更加向后。
Stump Rib则相对:
更向外。
并且:
更向下。
这种初始方向差异就是:
Partial Field-of-view环境下识别Stump Rib的重要依据。
经过Exclusion Criteria以后:
共有:
648名Subjects。
其中:
2464根Individual Ribs。
全部属于:
最低肋骨。
或者:
第二低肋骨。
2464根肋骨中:
159根。
648名受试者中:
133人至少有一根Stump Rib。
约:
20.5%。
但这个比例不能直接解释成普通人群的Stump Rib患病率。
因为Dataset并不是普通Population Cohort。
因为研究使用的Public Dataset是:
VerSe;
RibFrac。
它们本身就包含:
脊柱异常;
脊柱骨折;
肋骨骨折;
等特殊影像背景。
因此:
不能代表一般人群。
研究使用:
SVM;
Logistic Regression;
MLP。
模型输入不是完整CT Image。
而是:
已经计算好的Morphological Features。
这种任务的Feature Dimension并不高。
真正的Training Samples也不算特别大。
对于:
Small-sample Structured Feature Classification。
SVM依然是非常有竞争力的模型。
所有分类实验:
重复10个不同Random Seeds。
使用:
70/30 Subject-wise Train/Test Split。
评价:
F1;
Balanced Accuracy;
AUC。
最后报告:
10次平均值和标准差。
因为同一个Patient可能有多根Rib。
如果:
左侧肋骨进入Training。
同一个人的右侧肋骨进入Testing。
模型可能间接利用Patient-specific Anatomy。
从而造成:
Data Leakage。
所以应该按Subject划分,而不是按单根肋骨随机划分。
只使用肋骨起点和椎体之间的位置关系:
SVM F1:
0.59±0.05。
MLP:
0.62±0.06。
说明:
只知道“从哪里长出来”还不够。
如果使用前三个Path Points:
也就是大约:
15 mm可见Rib Segment。
Polynomial SVM:
F1=0.67±0.05。
MLP:
F1=0.71±0.03。
已经具有一定区分能力。
使用4个Path Points:
Polynomial SVM:
F1=0.77±0.04。
MLP:
F1=0.84±0.02。
这是一个非常关键的结果。
平均大约:
22 mm。
换句话说:
真实Stump Rib定义阈值是:
38 mm。
但Model可能只需要看到:
最开始约22 mm。
就能利用Shape和Orientation做出具有较好区分度的判断。
综合:
4-PPR + DRC。
使用:
MLP。
或者:
Linear SVM。
最佳F1达到:
约0.84。
| Feature | 代表性F1结果 | 需要看到多少肋骨 |
|---|---|---|
| DRC | 约0.59–0.62 | 主要依赖起点和椎体 |
| 3-PPR | 约0.67–0.71 | 约15 mm |
| 4-PPR + DRC | 最高约0.84 | 约22 mm |
如果整根Rib完全显示:
直接算Length就可以判断。
真正困难的是:
Rib被CT边界截断。
只显示15–22 mm。
如果Shape Feature仍然具有区分度:
系统就有机会在:
不依赖完整长度。
的情况下提供辅助判断。
研究由专家人工Review:
两个Public Dataset中的最低两根Rib。
结果:
98.2%的Ribs被正确Segmentation和Measurement。
只有:
1.8%。
存在会影响Length Measurement的Segmentation Error。
也不是。
研究进一步Manual Review以后发现:
大部分Length Error并没有接近:
38 mm。
因此即使Length稍有偏差:
也不会改变最终SR / non-SR Label。
只有:
一根Rib。
测量结果接近38 mm Threshold。
研究的鲁棒性分析发现:
大多数差异低于1 mm。
真正容易造成明显Length Error的是:
Merged Ribs;
Large Missing Segment;
Split Rib;
Bone Tumour;
Partially Resected Rib。
这类较严重结构异常。
比较典型的是:
Rib和Costal Process发生融合或非常接近。
这种情况下:
Model可能难以区分:
真正的Rib。
和:
Lumbar Vertebral Costal Process。
甚至可能把Costal Process错误Segment成Rib。
如果:
不同Vertebral Level的Ribs:
在Segmentation Mask里发生连接或融合。
Connected Component就可能把两根Rib看成一个Structure。
这会导致:
Instance Assignment失效。
医学AI研究不能只写:
“我们的Dice更高。”
研究使用:
Wilcoxon Signed-rank Test。
比较不同Segmentation Model的Dice。
并使用:
Wilcoxon Rank-sum Test。
比较Stump Rib和Regular Rib的Morphological Feature Distribution。
显著性:
p<0.05。
是。
在45名经过人工校正的Test Subjects中:
自建nnUNet Rib Segmentation:
优于TotalSegmentator。
在RibFrac相关比较中:
也优于:
官方RibSeg Annotation。
并且多个比较:
p<0.01。
这并不代表医学AI只需要几十例就一定足够。
这个案例能够获得较好分割效果:
至少与以下因素有关:
任务结构相对明确;
nnUNet是成熟的医学影像分割框架;
使用3D CT;
高质量专家修正Annotation;
Data Augmentation;
比较一致的Image Resolution。
换一个更加复杂的器官或者病灶:
数据需求可能完全不同。
除了Morphological Feature Classification。
作者另外进行了Image-based Ablation。
使用:
3D CNN;
3D Vision Transformer。
直接从CT Grayscale Image预测:
Stump Rib / Regular Rib。
实验显示:
当CT Image只截取到与4-PPR相近的Rib Segment时:
3D CNN可以获得与形态学Feature Classifier接近的表现。
Vision Transformer则:
表现落后。
如果使用整根Rib Image:
Image Model表现明显更好。
这相当于:
完整Field-of-view情况下的Performance Upper Bound。
这是医学AI论文里非常值得保留的结果。
Vision Transformer现在很热门。
但:
热门Architecture并不代表在小规模3D Medical Dataset上自动更好。
Dataset Size、Inductive Bias、Image Resolution以及Training Strategy都会影响结果。
作者尝试使用Morphological Features:
直接Regression:
Full Rib Length。
测试:
Linear Regression;
Linear SVM;
Polynomial SVM;
MLP。
MLP表现最好。
最佳MAE:
2.33±0.07 cm。
如果目标只是估计普通Rib大概有多长:
这个数量级有一定参考价值。
但如果目标是:
判断38 mm的Stump Rib。
这个Error太大。
38 mm也就是:
3.8 cm。
而MAE已经:
2.33 cm。
相当于:
平均误差超过半根Stump Rib长度。
所以研究明确:
不建议用这种Regression替代Stump Rib Classification。
这篇研究这里也比较谨慎。
作者移动38 mm Threshold重新做实验以后发现:
并没有出现:
刚好在38 mm位置有非常明显的性能突变。
这说明:
Stump Rib Morphology可能更接近:
Continuous Biological Spectrum。
而不是严格的:
37.9 mm是一类。
38.1 mm突然完全变成另一类。
因为:
这是此前Literature中比较常见的Clinical Reference Cutoff。
为了:
与已有研究保持可比性。
所以继续使用。
但未来可以考虑:
Continuous Modeling。
或者:
Alternative Threshold。
| 传统问题 | 研究解决方式 |
|---|---|
| 现有肋骨分割不完整 | 训练0.8 mm nnUNet完整分割肋骨 |
| Binary Mask无法区分单根肋骨 | 结合椎体Instance进行Rib Assignment |
| 弯曲肋骨难以自动测长 | 设计RLMA中心路径测量 |
| CT视野不完整无法看全长 | 利用DRC和PPR形态特征分类 |
| 只依赖38 mm Cutoff | 证明肋骨起始15–22 mm本身也包含分类信息 |
第一:
自动辅助发现Thoracolumbar Transitional Anatomy。
第二:
帮助正确编号Vertebral Level。
第三:
在有限CT Field of View中判断Stump Rib。
第四:
降低Radiologist手工追踪和测量肋骨的工作量。
第五:
为胸腰段相关Surgical Planning提供解剖信息。
目前还不能这样下结论。
因为研究存在几个重要Limitations。
首先:
没有独立External Test Dataset。
Segmentation和Downstream Analysis主要还是围绕VerSe与RibFrac。
VerSe和RibFrac并不是General Population Dataset。
它们涉及:
Spinal Anomaly;
Spine Fracture;
Rib Cage Fracture。
所以不能利用当前样本建立:
普通人群肋骨形态Normative Values。
这是一个现实难点。
目前并没有公认的:
人工测量肋骨长度Gold Standard。
因此研究无法拿自动RLMA和一个统一的Manual Measurement进行严格数值比较。
主要依靠:
Expert Qualitative Review。
有可能。
初始Model先预测。
再由Expert Correction。
虽然这样大幅提高Annotation Efficiency。
但:
初始Prediction可能轻微影响最终Manual Correction习惯。
原研究也承认这种Potential Bias。
研究只使用:
nnUNet。
没有系统比较:
SwinUNETR;
UNETR;
3D U-Net其他变体;
Transformer Segmentation。
作者理由是:
nnUNet已经获得非常好的Segmentation Result。
但从科研角度:
这仍然属于Limitation。
研究发现:
有些Regular Rib的PDRC也很大。
Manual Review以后发现:
问题并不一定出在Rib。
而可能是:
Enlarged Fovea;
Vertebral Corpus Anomaly;
Corpus Center发生偏移。
因此:
如果把Vertebral Morphology一起输入模型,可能进一步提高Stump Rib Classification。
目前648名Subjects已经能够验证方法。
但如果要回答:
Stump Rib真实Prevalence是多少;
和Sex有没有关系;
和Height有没有关系;
和Weight有没有关系;
和Lumbosacral Anomaly有没有关系;
就需要:
更大、更具代表性的人群数据。
这是一个挺有意思的Future Direction。
正常Rib的:
Length;
Orientation;
Volume-to-length Ratio;
应该存在一定合理范围。
如果某次Segmentation产生:
特别异常的Length或Direction:
可能本身就是:
Segmentation Failure Signal。
也就是说:
形态学测量不仅可以用于Diagnosis。
还可以用于:
自动Quality Control。
| 研究环节 | 常见问题 | 更完整的做法 |
|---|---|---|
| 图像分割 | 只报告Dice | 同时分析Surface Error和Instance Quality |
| Clinical Task | Segmentation完成就结束 | 继续验证下游Measurement和Classification |
| 数据划分 | 按Image或Structure随机Split | 优先Subject-wise Split |
| 模型比较 | 只看最高Accuracy | 加入Statistical Test、Robustness和Failure Analysis |
| 临床结论 | 小数据直接声称可临床应用 | 说明External Validation和Population Bias |
3D CT Segmentation;
nnUNet Medical Imaging;
Automated Rib Measurement;
Spine AI;
Thoracolumbar Transitional Vertebra Detection;
Medical Image Morphometry;
Partial Field-of-view Classification;
Anatomical Anomaly Detection;
Medical Segmentation Quality Control;
CNN与Vision Transformer医学影像比较;
Explainable Morphological AI;
Surgical Planning AI。
医学影像、人工智能、深度学习和CT图像分割类研究,现在真正影响论文质量的通常不是“有没有用最新的Transformer”,而是研究问题、标注设计、验证方式以及临床意义有没有形成完整闭环。
例如这篇肋骨研究,如果只训练一个nnUNet并报告Dice,即使Segmentation Score很高,也很容易停留在普通医学图像分割论文层面。
真正让研究更完整的是继续追问:
分割结果能不能用于自动测量;
长度测量误差有多大;
分割错误是否改变临床分类;
CT扫描不完整时还能不能识别异常;
形态学Feature和直接Image Classification谁更合适;
换Population以后是否仍然成立。
对于已经有医学影像研究方向、CT或MRI数据、标注结果、Python代码或者论文初稿的作者,我们提供SCI发表辅导,可以根据项目阶段协助Research Gap、Dataset Design、Segmentation Pipeline、Baseline、统计设计、Ablation Study、结果解释、图表整理、英文表达以及目标期刊方向等内容。
医学AI论文尤其需要避免“模型分数高,所以可以直接用于临床”这类过度推断。像这项研究虽然最低两对肋骨的自动分割与长度测量成功率达到98.2%,形态分类F1也可以达到约0.84,但仍然缺少代表普通人群的大规模外部验证,因此更准确的定位应该是方法学验证和辅助影像分析工具。
对于需要持续跟进投稿周期的项目,也可以选择投稿无限期服务直到见刊,在约定服务范围内持续协助目标期刊筛选、投稿材料准备、审稿意见分析、返修以及必要情况下重新匹配期刊等环节。具体审稿周期和最终结果仍然取决于研究质量、稿件完整度以及目标期刊实际审稿流程。
Stump Rib通常指胸腰交界区域出现的发育异常短肋,本文采用文献中常见的≤38 mm长度作为分类参考。
胸腰段移行椎可能伴随椎体数量和肋骨形态异常,正确识别这些解剖变异有助于准确定位椎体层级并辅助相关手术规划。
nnUNet是医学影像分割领域常见的成熟框架,可以针对数据自动配置多项训练设置。研究使用3D full-resolution nnUNet并以0.8 mm各向同性分辨率进行训练。
研究发现TotalSegmentator容易遗漏靠近椎体的Rib Head,并且1.5 mm分辨率在细节上有限,因此不完全满足整根肋骨长度测量需求。
RLMA是Rib Length Measurement Algorithm,通过在3D肋骨分割中逐步寻找中心路径点并累积相邻路径距离,估算弯曲肋骨的实际长度。
专家复核显示,研究中最低两对肋骨约98.2%能够被正确分割并测量。多数典型自动分割误差导致的长度差异低于1 mm。
研究表明具有一定可行性。利用肋骨起始方向和其与椎体之间的形态关系,只观察起始约22 mm的肋骨即可获得最高约0.84的F1。
DRC描述肋骨起点与对应椎体中心之间的空间关系,PPR则描述RLMA前几个肋骨路径点之间的方向关系,两者共同用于量化残肋的初始形态。
研究中MLP和线性SVM整体表现最好。将4-PPR与DRC组合以后,最佳F1约为0.84。
在额外影像分类实验中,3D CNN在部分肋骨CT图像上的表现与形态学分类接近,而Vision Transformer表现相对落后;使用完整肋骨图像时模型表现会进一步提升。
38 mm是目前文献常用参考值,但研究移动阈值后没有观察到明显的生物学突变点,因此残肋形态可能更接近连续变化,未来仍可以研究其他阈值或连续模型。
目前不能简单这样理解。研究缺少独立外部测试集,而且VerSe和RibFrac并不代表普通人群,因此还需要更大规模、多中心和代表性更强的数据验证。
可以继续研究3D医学图像分割、脊柱AI、自动形态测量、解剖异常检测、有限视野影像分类、多中心验证以及自动分割质量控制等方向。
可以根据研究阶段协助Research Gap、医学影像数据设计、Segmentation Pipeline、Baseline、统计分析、Ablation Study、Results与Discussion、图表和目标期刊方向等内容。
主要指在约定服务范围内持续跟进目标期刊筛选、投稿材料准备、审稿意见分析、返修以及必要情况下重新匹配期刊等流程,而不是只处理第一次投稿。
这项研究给医学影像AI论文一个很值得参考的思路。
一个高质量Segmentation Model当然重要。
但真正的临床问题通常并不是:
“Dice能不能再提高0.01?”
而是:
分割以后到底能做什么。
在这项工作中,nnUNet只是第一步。
后面进一步完成单根肋骨实例匹配、RLMA长度测量、残肋自动判断、形态学特征提取以及部分Field-of-view条件下的分类。
特别是只利用起始约22 mm肋骨就可以获得约0.84的F1,这个结果说明,残肋和普通肋骨之间的差异并不只是“长短”,其最开始的空间方向和相对椎体位置本身就包含有价值的信息。
当然,这套方法还需要更大规模、多中心和普通人群数据验证。现有数据主要来自VerSe和RibFrac,不能直接用于推导普通人群残肋发生率,也不能简单把实验结果等同于成熟临床诊断工具。
但从研究设计角度看,它完成了一个很完整的链条:
医学影像分割 → 自动测量 → 形态学量化 → 机器学习分类 → 临床问题。
这也是很多医学人工智能SCI研究真正值得借鉴的地方。