Command Palette
Search for a command to run...
WearableQA:面向真实世界可穿戴数据的健康推理基准
WearableQA:面向真实世界可穿戴数据的健康推理基准
Ji Soo Lee Xilun Chen Pierce Chuang Ashish Shenoy Jason Wei Dohwan Ko Hyunwoo J. Kim Benoit Corda
摘要
可穿戴感知的最新进展使得对生理与行为信号的持续监测成为可能,然而现有基准很少评估 AI 系统是否能够对真实用户的长期可穿戴记录进行推理。我们提出了 WearableQA,一个包含 4,084 道 10 选项选择题的基准,这些题目基于 200 名真实用户的可穿戴时间序列、血液生物标志物及人口统计学数据构建,每位用户拥有长达 500 天的每日测量记录。WearableQA 保留了真实的可穿戴数据分布,包括设备噪声和个体间差异。为评估不同的推理能力,我们引入了 16 种问题类型,并沿两个互补的维度进行组织:数据推理与健康推理,区分对纵向测量数据的计算与生理学解读;单信号推理与跨信号推理,区分对单个信号的推理与对多信号的整合。为大规模构建可靠的问题,我们采用了一种双重锚定框架,将文献锚定的生理学发现与统计验证的人群锚定生理模式相结合。这使得我们能够捕捉在真实世界可穿戴数据中观察到的有意义关系。对 14 个闭源和开源大语言模型的评估表明,WearableQA 能够有效区分模型能力,其性能在 10% 的随机基线之上,从 19.6% 到 72.9% 不等。此外,WearableQA 远未被解决:大多数模型的准确率低于 60%。总体而言,WearableQA 为评估大语言模型在真实世界可穿戴数据上的推理能力提供了一个真实且具有诊断性的基准。
一句话总结
来自 Meta、KAIST 和高丽大学的研究者提出 WearableQA,一个基于 200 名用户长期可穿戴数据构建的 4,084 道多选题基准,涵盖 16 种推理类型,并采用结合文献支撑与人群支撑模式的双重支撑框架,以保留真实的生理分布;结果显示 LLMs 的准确率仅为 19.6%–72.9%,表明基于真实世界可穿戴数据的健康推理远未得到解决。
核心贡献
- WearableQA 是一个包含 4,084 道多选题的基准,基于 200 名真实用户的长期可穿戴时间序列、血液生物标志物和人口统计数据构建,保留了设备噪声和个体间差异;对 14 个 LLMs 的评估显示准确率从 19.6% 到 72.9%(随机概率 10%),有效区分了模型能力。
- 沿两个轴定义了 16 种问题类型的诊断分类法:数据推理与健康推理,以及单信号与跨信号推理,从而对长期健康记录上的不同推理技能进行细粒度评估。
- 双重支撑框架通过将文献支撑的生理发现与统计验证的人群支撑模式相结合,大规模构建可靠问题,确保问题捕捉到有意义的真实世界关系。
引言
可穿戴传感器现已能够持续追踪心率、睡眠和活动,而大语言模型(LLMs)正越来越多地被用于解读这些信号以实现个性化健康。然而,此前用于评估 LLMs 对可穿戴数据推理能力的基准依赖于合成或模拟信号,未能捕捉真实世界测量中的噪声、个体间差异和健康背景。作者提出 WearableQA,一个基于 200 名真实用户的长期可穿戴记录、血液生物标志物和人口统计数据构建的 4,084 道多选题基准。它采用双重支撑框架,结合文献推导和人群验证的模式来生成确定性真值,并沿两个轴评估模型:数据推理与健康推理,以及单信号与跨信号推理。
数据集
作者构建了 WearableQA,一个用于评估可穿戴健康推理的基准。它基于真实世界的用户数据和生物医学文献构建,随后用于测试模型在需要解读长期可穿戴信号和血液面板的多选题上的表现。
数据集构成与来源
- 用户队列: 从一个更大规模的真实场景可穿戴数据集中抽样选取 200 名真实用户,选择时考虑了人口统计学多样性(年龄、性别、BMI、种族)。每位用户贡献最多 500 天的每日聚合记录。
- 信号: 涵盖四个领域的 16 项每日可穿戴指标:心肺健康(静息心率、心率变异性、VO₂max)、活动/能量(步数、活动卡路里消耗、基础代谢卡路里、锻炼次数/时长/平均心率、METs)、睡眠(时长、效率、深睡百分比、REM 百分比、就寝规律性)以及平均压力水平。
- 血液面板: 每位用户的 17 项生物标志物(例如胰岛素、HbA1c、血糖、血脂)。
- 队列参考百分位数: 针对五项核心指标(静息心率、步数、心率变异性、睡眠时长、睡眠效率),在一个更大的真实世界队列上计算百分位数,以便进行同龄人比较。
- 问题: 4,084 道多选题,每题 10 个选项(随机概率 = 10%),答案位置均衡。问题按照 2×2 分类法组织:数据推理与健康推理,以及单指标与跨指标支撑。此外,每个问题都标注了其真值来源:文献支撑或人群支撑。
各子集的关键细节
- 数据推理(2.7k 道问题): 要求对原始传感器测量值进行计算(趋势、异常、偏移、恢复时间、跨信号关系)。答案直接从可穿戴记录中的数值确定。
- 健康推理(1.4k 道问题): 要求进行临床和生理学解读(预后框架、建议、鉴别推理、表型分析、一致性)。答案在信号之上叠加了领域知识。
- 单指标(1.7k 道问题): 仅关注单一信号。
- 多信号(2.4k 道问题): 要求整合两个或更多信号(例如,活动与静息心率之间的耦合)。
- 文献支撑问题: 源自 11 篇锚定论文(同行评审、观察性研究、全文验证、至少有两项独立的同方向研究支持)。每个关系都记录为结构化卡片,包含 DOI/PMID、阈值和明确的局限性。不引入任何特定于研究的截断值。
- 人群支撑问题: 直接从队列中挖掘模式(28 天窗口),并且仅在通过统计一致性检验后才被采纳:效应量(强相关性 |ρ|≥0.5,获胜者优势 ≥0.15)、稳健性(bootstrap 重采样、留一法、死区拒绝)和真实性(跨用户零假设检验,FDR ≤ 0.20)。
论文如何使用数据 该基准仅用于评估;未定义训练集。模型会看到用户的长期可穿戴轨迹(以及可选的血液面板和人口统计数据),并必须回答多选题。确定性真值由相同的测量值计算得出,从而实现可重复的评分。
处理细节
- 先发现后标注方法: 首先从文献或人群模式中识别出推理目标。然后,一个确定性程序根据每位用户的真实测量值计算答案。
- 计算原语: 可复用操作(例如,滞后相关性、阈值标记)被组合成显式计算图,保证相同输入产生相同答案。
- 答案构建: 对于文献支撑问题,使用个性化基线(例如,高于用户近期 28 天均值 1.5 个标准差);丢弃标准未定义或模糊的用户。对于人群支撑问题,答案遵循用户自身轨迹中发现的关系。
- 干扰项构建: 对于数据推理,干扰项包括相反趋势、相邻窗口或从队列分布中抽取的错误幅度。对于健康推理,干扰项是临床上合理但与个体测量值不符的替代解释。所有选项都经过验证,确保只有正确答案满足计算条件。
- 验证: 通过确定性标注和统计检验确保计算有效性。质量控制包括去重、答案平衡、干扰项验证和捷径审计(例如,移除可预测的指标对,如活动消耗与步数,并修改生成流程以防止模型在不依赖时间序列的情况下作答)。
方法
作者通过双重支撑策略构建 WearableQA 基准,确保每个问题要么锚定在已发表的生物医学证据中,要么锚定在直接从大型可穿戴队列中发现的、经过统计验证的模式中。这种设计调和了两个目标:探究具有临床意义的推理,并反映真实世界记录中真正出现的生理行为。对于这两种来源,答案并非先验断言,而是从底层用户测量值中重新推导得出,使基准忠实于人群且能抵抗记忆化。
文献支撑问题源自一个经过筛选的同行评审消费级可穿戴研究池。仅保留那些可穿戴暴露和临床结果均可在队列上计算的观察性研究,从而得到一组经过全文深度阅读的锚定论文。为防止虚假发现,每个保留的关系必须得到至少两项独立、同方向且经过原始记录验证的研究支持。每个关系都记录为结构化卡片,包含标识符、逐字阈值、队列详情,以及关于来源未建立之内容的明确声明,以防止过度推断。特意不引入特定于研究的截断值,因为它们很少能跨人群迁移。
人群支撑问题直接从队列中挖掘生理模式,以 28 天窗口为目标,揭示时间趋势、异常事件、恢复动态、跨信号关系以及高阶多信号交互。候选模式只有在通过三个轴的统计一致性检验序列后,才会被提升为问题。第一,效应量要求目标强且分离良好:耦合必须超过最小相关幅度 ∣ρ∣≥0.5,且在窗口的两半部分符号一致;对于比较性问题,获胜选项必须以至少 0.15 的优势击败次优选项。第二,稳健性要求模式在扰动下保持稳定:标注结果必须在 bootstrap 日重采样下持续存在(30 次重采样中重现率 ≥ 80%),在任意单日留一法移除下持续存在,并且在一系列基线窗口选择中持续存在,死区内的近边界情况将被拒绝。第三,真实性通过跨用户零假设检验来保证:在故意错配的用户配对中重新计算每个统计量,并将零假设流行率与观察流行率的比值用作经验错误发现率;模式仅在 FDR≤0.20(阳性预测值 ≥ 80%)时保留。文献支撑和人群支撑问题共同提供互补覆盖,将既定的临床知识与来自真实世界数据的新兴生理行为相结合。
对于标注,作者采用先发现后标注的方法。首先从文献发现或人群支撑模式中发现推理目标。然后,通过在对个体真实测量值执行确定性程序来确定其答案。推理被表达为从共享库中抽取的可复用计算原语的组合。例如,最强配对问题使用 lagged_correlation(max_lag=3) 和 argmax_pair 在最多 ±3 天的滞后上进行操作;血液状态问题对生物标志物应用 threshold_flags 并聚合标记。每个实例都表示为一个显式计算图,保证相同输入始终产生相同答案,并实现完全可重复的评估。
选定的原语在每位用户的长期可穿戴轨迹上执行。对于文献支撑问题,计算使用个性化基线和队列相对统计量(例如,静息心率升高 ≥ 高于用户近期 28 天均值 1.5 个标准差)来实例化已发表的生理关系。仅当数据确定性地满足标准时,该场景才会被采纳;模糊或未定义的情况将被丢弃。对于人群支撑问题,答案直接遵循用户自身轨迹中发现的关系。在这两种情况下,真值完全从底层测量值计算得出。
干扰项针对两种推理类型采用不同方式构建。对于数据推理问题,每个模板定义一个干扰项类别(例如,相反趋势方向、相邻时间窗口或从队列分布中抽取的错误幅度)。同一个可执行计算评估所有十个选项,仅当正确选项唯一满足条件时,题目才会被保留。对于健康推理问题,干扰项源自支撑发现本身:对同一生理关系在临床上合理但与个体测量值不符的错误解释。
实验
评估在 WearableQA 上测试了 14 个大语言模型,该基准包含 4,084 道源自 200 名用户真实世界可穿戴和健康数据的多选题,涵盖数据推理与健康推理以及单信号与跨信号复杂度。性能差异很大,最佳闭源模型达到 72.9% 的准确率,而数据推理和跨信号任务对大多数系统来说仍然特别具有挑战性。思维链提示减少了位置偏差并提高了准确率,尤其是对闭源模型,而提供 Python 工具访问带来了显著提升,表明显式计算有助于弥合文本推理与对长期健康信号进行定量分析之间的差距。
闭源模型在 WearableQA 上大幅优于开源替代方案,Gemini 3.1 Pro 取得了最高的总体准确率,并大幅领先次优模型。大多数模型认为健康推理比数据推理更容易,但 Gemini 3.1 Pro 独特地扭转了这一趋势,在数据推理上表现出色。对闭源模型而言,单信号问题通常比跨信号问题更容易,但 Gemini 3.1 Pro 在两者上表现相当。Gemini 3.1 Pro 以 72.9% 的准确率领先所有模型,超过次优闭源模型 12 个百分点以上。对大多数模型来说,数据推理始终比健康推理更难,部分模型差距超过 25 个百分点,而 Gemini 3.1 Pro 是唯一在数据推理上取得更高准确率的模型。跨信号问题降低了大多数闭源模型的性能,但 Gemini 3.1 Pro 在单信号和跨信号子集上表现出几乎相同的准确率。最强的开源模型 Gemma-4-26B-A4B 达到 42.5% 的准确率,落后最佳闭源模型超过 30 个百分点。
在评估信号关联时,一些模型在定义性配对上的表现远好于需要数据驱动推断的经验性配对,尽管两组配对具有可比的关系强度。例如,Gemini-2.5-Pro、GPT-5.4 和 GPT-4o 表现出超过 35 个百分点的巨大差距,而 Claude Opus 4.6、Claude Sonnet 4 和 Gemini 3.1 Pro 仅表现出约 4 个百分点的微小差异。这一模式揭示了一些模型严重依赖熟悉的信号关系,而不是从长期测量中恢复用户特定的关联。Gemini-2.5-Pro、GPT-5.4 和 GPT-4o 在有利于定义性配对上的巨大性能差距,表明它们强烈依赖先验知识。Claude Opus 4.6、Claude Sonnet 4 和 Gemini 3.1 Pro 在两种配对类型上表现相似,表明它们几乎可以同样有效地从数据中推断经验关系,如同推断定义性关系一样。
时间序列数据的文本表示产生了可比的中等准确率,而可视化图表导致性能大幅下降。提供汇总统计量带来小幅改进,但最显著的提升来自 agentic Python 工具访问,将准确率提高了超过 20 个百分点。允许模型在多种表示中进行选择并未带来额外好处。逐行、逐列、CSV 和 Markdown 格式均实现了相似的总体准确率,其中附加统计信息的 CSV 和 Markdown 表现略好。可视化表示,无论是分信号独立图表还是范围分组图表,与文本基线相比,总体准确率降低了超过 14 个百分点,而在 CSV 中添加图表并不能弥补这一损失。在 agentic 设置中启用 Python 工具访问,相比逐行基线大幅提高了总体准确率,但多视图表示选择相比固定表示并未提供额外增益。
消融长期历史记录会急剧降低依赖历史记录的问题的性能,而窗口范围内的准确率基本保持不变。移除所有可穿戴时间序列导致所有问题类型的性能灾难性下降,证实模型将答案建立在所提供的测量值之上,而非依赖人口统计或队列先验。仅移除历史上下文会使依赖历史记录的准确率降低近一半,而窗口范围内的准确率保持稳定。保留所有时间序列输入会使总体准确率崩溃至 17.3%,窗口范围内准确率降至 13.7%,证明了模型对可穿戴数据的依赖性。
实验在 WearableQA 上评估了大语言模型,该基准用于对长期可穿戴传感器数据进行推理,比较了闭源与开源模型、信号关联类型、数据表示以及输入上下文的作用。闭源模型大幅优于开源模型,Gemini 3.1 Pro 独特地逆转了健康推理比数据推理更容易的常见趋势,并且处理跨信号问题与单信号问题同样出色。对信号关联的分析显示,一些模型严重依赖先验知识处理定义性配对,而另一些模型则从数据中推断经验关系,并且 agentic Python 工具访问在数据表示中带来了最大的准确率提升。消融研究证实,模型将其答案建立在所提供的时间序列数据之上,因为移除历史记录会急剧降低依赖历史记录的准确率,而保留所有可穿戴数据则会导致灾难性的性能崩溃。