PhysAgent:基于多智能体验证机制的远程心率估计新框架
针对远程光电容积脉搏波(rPPG)技术在面部视频心率估计中易受运动、光照、遮挡等因素干扰的难题,研究者提出PhysAgent推理时多智能体验证框架。该方法不重新训练rPPG模型,也不直接由多模态大模型输出心率,而是将多个基础估计器的结果视为待验证的生理假设,借助轻量级视觉语言模型驱动多智能体推理,并配合确定性生理校验器完成最终融合。在多个公开rPPG基准数据集上的实验显示,该框架在跨数据集与跨域场景下均提升了融合的稳定性与可靠性。
远程光电容积脉搏波(rPPG)技术通过面部视频实现非接触式心率估计,在医疗健康监测、远程监护等场景中具有应用潜力。然而,该技术提取的生理信号幅度微弱,容易受到头部运动、光照变化、面部遮挡、肤色差异以及摄像头噪声等因素干扰,导致不同模型在同一段视频上可能给出看似合理却彼此冲突的估计结果。
PhysAgent采用了一种与直接预测不同的思路:将多个基础rPPG估计器的输出视为候选生理假设,而非最终结论。框架使用一个轻量级4B参数的多模态大语言模型Qwen3-VL-4B驱动多智能体推理,从视频采集条件、信号可信度以及候选估计之间的分歧等维度展开讨论与权衡。在此基础上,一个确定性的生理校验器对多智能体提出的融合方案进行复核,再由可复现的数值融合流程输出最终心率,避免了直接由大模型给出心率带来的生理不一致与结果不可复现问题。
实验部分在多个公开rPPG基准数据集上展开,覆盖不同的源域设置。结果表明,PhysAgent相较于直接预测方法与无约束的集成融合策略,在跨数据集与跨域条件下均能提升融合的稳定性与可靠性。该工作展示了将大模型的推理能力与传统生理信号处理相结合、用作验证与仲裁而非直接预测的可行性。
【空音视角】 从非接触生命体征监测的视角看,PhysAgent的核心思路值得关注:当单一模型在不同干扰条件下输出冲突结果时,与其追求一个更强的端到端模型,不如建立一套对候选结论进行交叉验证与仲裁的机制。这一思路与WiFi感知领域面临的挑战相似——同一段CSI信号在环境变化下也可能被不同算法给出差异较大的呼吸或心率估计。PhysAgent以多智能体推理加确定性校验的双层结构提升结果可信度,体现了行业从'单模型高精度'向'多源融合+可验证性'演进的趋势,对非接触监测走向临床级可靠性具有借鉴意义。
—— 本文基于公开报道由空音编辑部 AI 辅助改写 来源:arXiv 计算机视觉 原文链接:https://arxiv.org/abs/2608.00066
来源:arXiv 计算机视觉(查看原文)