← 返回列表
新闻资讯2026年9月8日

多模态ICU数据光学压缩为视觉记忆 通用模型预测危重病情轨迹

medRxiv最新预印本研究提出"临床视觉记忆"通用基础模型,将电子病历、生命体征、心电图波形、胸片与临床文本五种ICU异构数据统一渲染为图像并压缩至共享视觉空间,在MIMIC-IV数据集上对48小时死亡风险等指标取得较高预测效能,为危重病情连续轨迹预测探索新范式。

当前临床人工智能多依赖专科化、碎片化的单一任务模型,难以处理重症监护室(ICU)内多源异构数据的联合分析。研究团队提出一种新的解决思路:将多模态临床感知重新定义为纯视觉问题,通过"光学压缩"将异构数据融入统一的视觉表征空间,从而推动临床预测从孤立标量预测向连续生成式轨迹预测转变。

该研究在MIMIC-IV成人ICU数据上开展回顾性建模,在排除24小时以下住院记录后,共纳入54,551名患者、68,546次住院和74,829次ICU入住记录,并采用严格的患者级别划分避免数据泄漏。研究者将结构化电子病历、生命体征、10秒心电图波形、胸部X光片以及临床文本统一渲染为二维图像,再由冻结的DINOv2视觉Transformer编码,借助模态感知的潜在查询交叉注意力机制,将这些高度异构的数据压缩为1024维的共享"临床视觉记忆"。

作为统一输出接口,该记忆空间驱动一个条件指令调优的图像生成器,可在3至48小时不同时间窗口下解码涵盖八个临床领域的恶化轨迹。实验中模型对48小时死亡风险预测的AUROC达到0.852(95% CI 0.821-0.882),并在仅保留1%源像素的压缩条件下验证视觉保真度。研究者还利用事件相关投影轴几何刻画关键临床转折点,尝试捕捉模型对状态转换的感知能力。

【空音视角】 该研究折射出医疗AI的两条演进路径:一是把多源异构信号纳入统一表征,与WiFi感知领域将射频CSI、环境上下文融合做生命体征监测的思路相通;二是从单点预测转向连续轨迹预测,与空音关注的非接触睡眠呼吸监测、连续健康状态评估在方向上趋同。但视觉方案需将数据先图像化,对实时连续波形与射频信号的支持仍有局限,落地成本与延迟也值得关注。

—— 本文基于公开报道由空音编辑部 AI 辅助改写 来源:medRxiv 预印本 原文链接:https://www.medrxiv.org/content/10.64898/2026.09.03.26361736v1?rss=1

来源:medRxiv 预印本查看原文