多模态匿名器:开启AI医疗研究新纪元!
人工智能在医疗领域的应用前景广阔,尤其在整合文本、图像、波形和实验室数据等多模态信息方面,有望显著提升医疗质量与效率。然而,这一潜力的实现受限于高质量、大规模数据集的获取。据统计,目前仅有约3%的医院数据被用于研究,主要障碍在于医疗数据中充斥着大量直接或间接的患者身份信息。要在保护隐私的前提下将数据用于二次研究或AI模型开发,可靠高效的去标识化处理不可或缺。为此,本研究开发并评估了名为“多模态匿名器”的模块化多智能体系统,旨在解决这一关键瓶颈。
该系统核心是一个完全本地化部署的多智能体协作框架,设计哲学在于整合不同计算策略的优势:利用多模态大语言模型进行上下文推理,利用专用神经网络处理特定模态任务,并利用基于规则的方法进行确定性转换。系统以中央多模态大语言模型作为协调器,当文件输入后,协调器首先识别类型并路由至相应专业处理流水线。预处理步骤包括由大语言模型智能体对文件和文件夹名称进行去标识化,以及通过正则表达式检测所有日期并施加患者特定的随机时间偏移,以保留时间序列结构。模态专用处理流水线中,文本和表格数据直接由多模态大语言模型检测和替换患者身份信息;图像、PDF和视频结合光学字符识别与多模态大语言模型分析,识别嵌入标识符并通过模糊匹配定位隐去,同时集成RetinaNet、ResNet-UNet和TrOCR等专用神经网络;音频文件先转录、去标识化再重新合成语音;DICOM文件则分别处理图像像素数据和元数据。所有流水线输出都会经过验证智能体迭代比较,发现残留标识符或未转换日期并触发修正。系统还提供基于浏览器的图形化界面,允许用户拖拽上传数据、选择模型、自定义提示词并下载保留原始文件夹结构的压缩结果,无需编程知识。
本研究评估数据集基于MIMIC-IV数据库构建,向其中所有模态注入带有精确标注的合成患者身份信息,并加入公开头颅CT、面部图像、手写笔记、音频和合成德语临床文档数据集,还使用外部德语文本语料库和柏林夏里特医院250份产程图进行验证。研究将16种多模态大语言模型作为中央协调器进行配置,并与现有去标识化工具对比。主要评估指标包括去标识化敏感性、临床关键内容保存率和临床内容保存率。结果显示,最佳本地部署模型取得98.80%的患者级别去标识化敏感性和99.82%的PII实体级别敏感性,患者级别关键临床内容保存率达99.60%,整体临床内容保存率为99.61%。系统在所有测试模态上均表现强劲,去标识化敏感性均超过98%,在柏林夏里特医院本地德语产程图数据集上更达到100%敏感性和关键临床内容保存率。
本研究成功开发并验证了多模态匿名器,这是一个全本地化、易于使用的多智能体系统,能够对临床环境中各种模态数据进行高效、准确、安全的去标识化处理。系统通过精妙协作设计,在接近完全移除标识符的同时出色保存临床关键信息,性能和实用性显著优于现有常用工具。尤为重要的是,该系统证明使用本地开源模型即可达到与最先进专有模型相当甚至更优的效果,在数据隐私和合规性要求极高的医疗领域具有重大实际意义。热门微博 医学新闻 ai医疗 哈勃观察员


