医疗数据荒将至:AI 最饱受期待垂类背后的最大短板

医疗 AI 正走向一场碰撞。一方面,对医疗数据 —— 影像检查、临床笔记、生物信号、基因组序列、医患对话、医生验证的推理 —— 的需求,是所有 AI 领域中增长最快的之一。另一方面,这些数据的供给受到其他 AI 垂直领域不会面临的限制:被隐私法牢牢锁定、依赖稀缺的临床专家进行标注、且无法令人信服地伪造。这两条曲线之间的差距就是医疗数据荒(medical data crunch),而它到来的速度,比大多数构建医疗 AI 的团队所准备的要快得多。
需求端:市场数据说明了一切
2026 年,医疗 AI 训练数据集市场规模约为 6.39 亿美元,预计到 2035 年将增长至约 41 亿美元 —— 年复合增长率达 22.94%,使医疗跻身增长最快的 AI 数据垂直领域之列。涵盖全行业的更广泛 AI 训练数据集市场,2026 年规模约为 39 亿至 44 亿美元。再叠加专门针对医疗领域的agentic AI市场 ——2026 年约 12 亿美元,预计到 2036 年将达到 248 亿美元,CAGR 高达 35.4%—— 不难看出,多个医疗 AI 类别正在同时推高对真实临床数据的需求。
医疗数据之所以享有溢价,原因很简单:涉及患者护理的模型,对数据质量、来源和合规性的要求远高于基于网络文本训练的聊天机器人,而达到这一标准的成本不菲。上述每一条增长曲线,都在争夺同一个有限的可用临床数据池。
基础模型已从实验室走进临床
2026 年是一个转折点。1 月,Aidoc 获得 FDA 批准,推出医疗领域首个由基础模型驱动的综合 AI 分诊解决方案 —— 一套腹部 CT 系统,覆盖 14 种急性病症(11 种新获批,3 种此前已获批)。在 FDA 审查的关键性研究中,新适应症的平均灵敏度达 97%,平均特异度达 98%。目前 FDA 已批准超过 1,500 种 AI 算法,其中仅放射科就占约四分之三。这些系统依赖于在海量多模态数据集上预训练的视觉 - 语言基础模型 —— 数百万份来自生物样本库和医疗系统的影像 - 报告配对 —— 因此能够跨影像模态泛化,而无需为每种模态重新训练。
同样的模式也在影像之外上演:药物发现、精准医疗和基因组学,都在依托越来越大、标注精良的数据集来训练模型,而这些模型过去需要定制化的、狭窄的训练过程。随着这些用例从试点走向成熟的临床部署工具,对数据的胃口也随之增大 —— 而且与算力不同,这不是任何人可以简单 "买更多" 的资源。
语音和对话是下一个数据前沿
临床诊疗本身 —— 医生与患者之间的口头对话 —— 已成为医疗 AI 中最受追捧的数据类型之一。医疗文档语音识别市场预计将从 2023 年的约 86 亿美元增长至 2031 年的 241 亿美元,增幅近两倍;更广泛的环境智能市场预计将从 2025 年的约 370 亿美元攀升至 2030 年的超过 910 亿美元。Abridge 和 Suki AI 等环境记录员(ambient scribes)在 2026 年再次扩大了在美国医疗系统中的部署,它们聆听医患对话并直接将其转化为结构化临床笔记。
这一切只有在底层模型已在海量真实临床语音和对话上完成训练和测试时才有效 —— 跨专科、口音和语言,而不仅仅是干净的实验室录音。2026 年发表在 npj Digital Medicine 上的一项研究介绍了AgentClinic,这是一个针对使用工具的临床 AI 智能体的基准测试,它清楚地揭示了风险所在:当大型语言模型在真实的、连续的医患对话场景中(而非静态多项选择题中)接受测试时,诊断准确率可能降至纸笔考试表现的十分之一以下。该基准涵盖九个医学专科和七种语言,正是因为狭窄的单一语言对话数据无法泛化。随着 agentic AI 从 "聊天" 转向 "实际采取临床行动",考试题目表现与真实对话表现之间的差距,恰恰需要更多、更好、更真实的语音和对话数据来弥合。
为什么短缺是结构性的,而非暂时的
这不是一个 "砸更多钱" 就能自动解决的供给问题。在美国,患者记录受 HIPAA 保护,去标识化既非可选,也不简单。将数据从 PHI 限制中解放出来,意味着要么采用安全港(Safe Harbor)方法 —— 剥离全部 18 种已定义的标识符,要么采用专家确定(Expert Determination)—— 由统计学家认证重新识别风险足够低。哪怕遗漏一个标识符,数据在法律上仍然是 PHI。面对这一困境,许多团队退而求其次:合成数据(缺乏真实临床质感)或公开数据集(很少匹配其特定用例)—— 两者都不是真实、标注精良的临床数据的理想替代品。
标注本身进一步加剧了稀缺性。针对特定临床任务的医疗数据集,按 AI 标准通常很小 —— 往往只有 700 到 2,000 个标注样本 —— 因为罕见病和临床细节无法像通用图像或文本标注那样规模化。正确标注它们需要真正的临床专业知识:构建临床语言模型的研究团队越来越依赖已通过委员会执业资格考试的医生培训人员;而专门的生物信号工作需要电生理学家、睡眠技师、神经科医生或心脏科医生 —— 而非通用标注员。要达到临床使用所需的高质量,通常意味着三级审核流程(初始标注、同行评审、专家裁定),这能将错误率压至 5% 以下,但每单位数据比标准标注多耗费 30%–40% 的时间。
这也是为什么临床医生始终坚持需要human in the loop。飞利浦 2026 年未来健康指数(Future Health Index)发现,93% 的美国医疗专业人员表示,随着 AI 进步,保持人在回路中至关重要 —— 尽管近半数人报告,通过 AI 辅助工作流程每年可节省超过 130 小时。临床医生愿意信任 AI 带来的实际时间节省和能力扩展,但前提是背后有真正的医学专业知识,而非仅仅是通用标注。
简而言之:每个构建医疗 AI 的团队,都在同时争夺同一种稀缺、受严格监管、依赖专家的资源。从需求端看,这就是繁荣的模样。
数据荒中的赢家与输家
在数据荒中胜出的组织,不一定是模型最好的 —— 许多团队都在使用相似的架构。真正的分界线在于数据:谁能够以临床部署所需的数量和质量,在不损害合规性或患者安全的前提下,完成医疗数据的获取、去标识化和专家级标注 —— 跨影像、文本和语音。解决了这一问题的团队,将在短缺加剧时持续交付;未能解决的团队,将停滞在试点阶段,苦等无法获得的数据。有资质的医学专业知识、可辩护的去标识化流程、以及大规模严格的多级 QA,如今本身就是一条竞争护城河。
澳鹏如何提供帮助
澳鹏从两个方向应对数据荒。对于需要快速推进的团队,澳鹏提供跨多个领域(包括医疗)的现成数据,这些数据来自真正的主题专家而非通用众包,团队可直接授权使用已适配临床用例的数据,而非从零起步。
对于有更具体或敏感需求的团队,澳鹏的定制数据服务依托一个包括外科医生、全科医生、心理学家及其他有资质医疗专业人员在内的专家人才池,能够生成、审核和验证数据 —— 影像、临床文本、临床语音与对话皆可 —— 并具备通用标注员根本不具备的领域判断力。随着医疗 AI 在诊断、医学推理和环境临床文档领域持续扩展,现成数据与按需医学专业知识的结合,为医疗 AI 团队提供了一条从原始临床数据到可部署模型的更快、更安全路径。

沪公网安备31011502401377号