这 5 个工具覆盖了一条完整的数字病理科研流水线——从一张全切片,到 patch / 细胞 / 特征,再到诊断模型与横向评测。按它们在流水线里的位置讲最清楚。
一张全切片(WSI)动辄上百亿像素,没法直接喂给模型。TRIDENT 负责把它变成可计算的东西:组织区域分割(抠掉玻璃背景/笔迹)→ 按网格切成 patch → 用病理基础模型(UNI / CONCH / Virchow / GigaPath 等)把每个 patch 编成特征向量,甚至整张片子压成一个 slide 级向量,输出 H5 特征文件。
它是"打地基"的工具,下游的 MIL 训练直接吃它的产物。
病理的现实是:一张片子只有一个标签(癌/非癌、分期、预后),但里面有成千上万个 patch。MIL(多实例学习)就是解决这种弱监督的标准范式。MIL_BASELINE 把 AB-MIL、CLAM、TransMIL、DTFD-MIL 等近 60 种方法塞进同一套代码 + 同一份 YAML 配置——换方法只改配置、不改代码,且与 TRIDENT 的 H5 特征打通。
作用:用特征做分类 / 预后 / 分型实验的公平竞技场。
粒度再往下一层:不是 patch 特征,而是把每一个细胞核精确抠出来(实例分割)并分类(上皮/炎症/间质/肿瘤…)。基于 ViT(+SAM 骨干)+ HoVer-Net 头,在 PanNuke 上是 SOTA。
作用:细胞计数、细胞组成、肿瘤微环境空间分析这类"逐细胞"定量研究。与上游互补——TRIDENT 管 patch,CellViT 管单个细胞。
病理基础模型(PFM)一堆,谁强谁弱、在什么任务/器官上强没有统一答案。HistoBoard 把 12 个基准、48 个模型、400+ 任务的公开评测结果汇总成可对比的看板(Leaderboard / Arena 对比 / 模型画像 / scaling laws / 时间线),每周刷新。
它是评测与选型参考平台(静态网站),不是拿来训练的工具——决定 TRIDENT 里该用哪个 encoder 时查它。
论文、数据集、基准、开源代码一网打尽,外加一个给 agent 用的文献检索 skill。作用不是"运行",而是调研和找轮子时的入口地图,少踩重复造轮子的坑。