ARTICLES
最新分享
关于医疗数据集建设的一线实践笔记,持续更新。
医疗数据三层脱敏实践:从规则到落地的完整清单
结合真实项目梳理患者身份信息的识别、泛化与扰动策略,以及如何兼顾脱敏强度与数据可用性。
阅读全文 →标注一致性怎么保证?双人标注 + 仲裁机制的实操流程
Kappa 系数之外,更重要的是建立可持续的标注培训、抽检与反馈闭环,这篇文章讲透流程设计。
阅读全文 →一个合格医疗数据集应该附带的五份文档
数据字典、标注规范、质控报告、伦理批件、使用协议——写清楚这些,你的数据集才真正可用、可引用。
阅读全文 →影像 + 文本 + 检验:多模态对齐中最容易忽视的三个细节
时间对齐、ID 映射、缺失模式记录——决定多模态数据集上限的,往往不是模型而是这些脏活。
阅读全文 →TOPICS
专栏方向
🛡️
数据脱敏与合规
个人信息保护法规下的匿名化实践、伦理审查与授权管理。
🏷️
标注体系搭建
标注规范制定、标注员培训、一致性评估与仲裁机制。
🔬
全流程质控
从采集到发布的每一步质控点设计,让问题在源头被发现。
📘
数据文档与标准
数据字典、使用协议与数据卡(Datasheet)的撰写方法。