2026年8月18日,美国食品药品监督管理局(FDA)发布
“Considerations for the Regulation of Generative AI-Enabled Medical Devices”
讨论文件,
就
Generative Artificial Intelligence(GenAI,生成式人工智能)医疗器械
未来可能采用的监管思路公开征求意见。
此次工作由FDA
Center for Devices and Radiological Health(CDRH)
下属的
Digital Health Center of Excellence(DHCoE)
牵头。
FDA希望听取:
- 医疗器械制造商;
- 临床医生;
- 研究人员;
- 消费者;
- 公众;
- 其他相关利益方。
对GenAI医疗器械未来监管框架的意见。
此次讨论文件重点涉及:
- 风险评估;
- 上市前评价;
- 上市后监测;
- Foundation Models(基础模型);
- Agentic AI Systems(代理式AI系统);
- 其他与GenAI医疗器械相关的监管问题。
相关公众意见应通过Docket:
FDA-2026-N-7874
提交,截止日期为:
2026年10月19日
一、为什么FDA开始单独讨论生成式AI医疗器械?
人工智能已经广泛应用于医疗器械,
例如:
- 医学影像分析;
- 诊断辅助;
- 疾病风险预测;
- 连续监测;
- 临床决策支持;
- 软件驱动治疗。
但生成式AI与传统AI或机器学习医疗器械相比,
具有一些新的技术特点。
例如GenAI可能:
- 生成自然语言内容;
- 生成分析结果;
- 根据上下文进行动态推理;
- 处理复杂、多模态输入;
- 在不同场景中产生非完全固定的输出;
- 基于基础模型构建不同医疗功能。
因此,
FDA认为GenAI-enabled Medical Devices
在带来临床创新机会的同时,
也可能产生不同于传统软件医疗器械的风险。
二、什么是GenAI-enabled Medical Device?
FDA此次讨论的重点,
并不是所有使用生成式AI的普通软件。
核心仍然是:
当一个包含或利用生成式AI功能的软件或系统符合FDA医疗器械定义时,
才可能进入医疗器械监管框架。
因此,
是否属于GenAI医疗器械,
不能只看“产品有没有接入大模型”,
而需要进一步判断:
- 产品预期用途;
- 是否用于诊断、治疗、预防或疾病管理;
- 软件功能是否属于Device Software Function;
- AI输出是否直接影响临床决策;
- 用户如何使用相关输出。
三、这次文件是不是FDA新的正式指南?
不是。
这是本次公告最需要注意的一点。
FDA明确说明,
此次发布的是:
Discussion Paper and Request for Feedback
该文件:
- 不属于Draft Guidance;
- 不属于Final Guidance;
- 不代表FDA已经形成新的正式监管政策;
- 不代表FDA已经确定未来上市申报所需的证据要求。
FDA此次发布文件的目的,
主要是:
在正式形成监管框架之前,
尽早听取行业、临床、研究机构和公众意见。
四、FDA提出了什么样的风险评估思路?
FDA在讨论文件中提出了一个可能的
Two-Axis Risk Framework(两轴风险框架)。
FDA希望通过两个维度,
帮助判断不同GenAI医疗器械可能需要多严格的监管评价。
讨论文件的核心思路是:
- 看设备具体执行什么活动;
- 看用户依赖错误输出时可能造成什么后果。
也就是说,
风险不能仅由“是否使用GenAI”决定。
更重要的是:
GenAI在临床工作流程中承担什么功能,以及错误输出可能造成多严重的后果。
五、为什么“错误输出的后果”特别重要?
对于GenAI医疗器械,
输出可能具有较高的语言自然度和说服力。
如果用户对系统输出高度信任,
错误信息可能影响:
- 诊断判断;
- 药物选择;
- 治疗方案;
- 患者分流;
- 临床操作;
- 风险评估。
因此,
FDA关注的不仅是:
“AI会不会出错?”
还包括:
“一旦出错,用户会如何使用这个结果,最终可能造成什么临床后果?”
六、FDA提出的Competency-Based Approach是什么?
此次讨论文件中,
一个非常值得关注的概念是:
Competency-Based Approach
可以理解为:
基于能力的评价思路。
FDA提出,
对于GenAI医疗器械,
可能不适合单纯通过穷举所有输入场景,
来证明产品在所有情况下都不会出现问题。
FDA因此借鉴了医生培训和评价的一些高层逻辑:
- 先评价知识和分析能力;
- 再在更接近真实临床的环境中确认表现;
- 上市后继续观察实际使用情况。
七、Competency-Based Approach包括哪两部分?
FDA目前讨论的思路主要包括:
- Non-Clinical Device Benchmarking
- Clinical Confirmation
即:
非临床设备基准测试 + 临床确认
八、什么是Device Benchmarking?
FDA讨论文件中的Device Benchmarking,
是指通过结构化的测试方式,
评价GenAI医疗器械是否具备支持其预期用途所需的能力。
可能评价:
- 临床知识;
- 分析能力;
- 安全行为;
- 沟通表现;
- 泛化能力。
FDA提出,
这类Benchmarking应当针对:
最终面向用户实际部署的完整医疗器械,
而不是只对底层Foundation Model进行孤立测试。
九、为什么不能只测试底层Foundation Model?
一个GenAI医疗器械可能由多个部分构成:
- Foundation Model;
- Prompt或System Instructions;
- 数据接口;
- 检索系统;
- 知识库;
- 风险控制机制;
- 用户界面;
- 其他软件逻辑。
即使底层模型本身表现良好,
最终部署后的医疗器械仍可能因为:
- Prompt设计;
- 输入格式;
- 系统集成;
- 临床工作流;
- 用户行为。
产生不同的实际表现。
因此,
FDA更关注:
最终用户实际使用的完整设备是否安全、有效。
十、Benchmarking需要注意哪些原则?
FDA讨论文件提出,
未来如果采用Benchmarking思路,
可能需要关注:
- 测试方法应提前确定;
- Acceptance Criteria应在测试前预先设定;
- 评分标准应与临床指南或可靠专家意见相匹配;
- 专家评价人员应具有足够独立性;
- 测试数据应能代表预期部署环境;
- 测试范围应覆盖产品预期用途涉及的重要临床问题。
对于复杂GenAI系统来说,
仅使用一个简单Benchmark Score,
可能并不足以支持完整的安全性和有效性判断。
十一、什么是Clinical Confirmation?
FDA认为,
即使Benchmarking做得非常全面,
仍然不一定能够完全预测产品在真实临床中的表现。
因为GenAI医疗器械的实际效果还可能受到:
- 临床工作流程;
- 用户操作方式;
- 患者群体;
- 医疗环境;
- 设备和其他系统之间的交互。
影响。
因此,
FDA提出可能还需要:
Clinical Confirmation
即通过真实或具有临床代表性的环境,
确认设备是否能够按照预期用途表现。
十二、Clinical Confirmation是不是都要做前瞻性临床试验?
FDA目前并没有这样规定。
讨论文件明确提出,
Clinical Confirmation:
不一定在所有情况下都要求Prospective Clinical Study。
具体需要什么证据,
可能取决于:
- 产品风险;
- 预期用途;
- AI执行的临床任务;
- 错误结果可能造成的后果;
- 现有Benchmarking证据;
- 其他已有临床数据。
十三、为什么GenAI医疗器械尤其需要上市后监测?
GenAI医疗器械与传统固定算法软件相比,
在真实世界使用中可能面临更多动态因素。
例如:
- 患者群体变化;
- 临床实践变化;
- 输入数据变化;
- 用户行为变化;
- 底层模型升级;
- 系统集成环境变化。
这些因素可能影响产品上市后的实际表现。
因此,
FDA讨论文件提出了多种
Risk-Proportionate Postmarket Monitoring
思路。
十四、什么是Risk-Proportionate Postmarket Monitoring?
可以理解为:
上市后监测强度与产品风险相匹配。
并不是所有GenAI医疗器械都采用完全相同的监测方式。
高风险产品可能需要:
- 更频繁的性能评估;
- 更严格的异常监测;
- 更系统的真实世界数据分析;
- 明确的风险触发和响应机制。
而低风险产品的监管方式可能有所不同。
十五、Foundation Model为什么成为FDA关注重点?
很多GenAI医疗器械并不是从零训练一个模型,
而可能建立在第三方
Foundation Model
基础上。
这可能带来新的监管问题,
例如:
- 制造商是否完全了解底层模型;
- 模型版本是否可能发生变化;
- 第三方模型更新会不会影响医疗器械性能;
- 训练数据透明度如何;
- 制造商如何验证最终设备;
- 供应链责任如何划分。
因此,
未来监管重点可能不只是:
“底层是什么模型?”
更重要的是:
“制造商如何控制、验证和持续管理最终医疗器械。”
十六、什么是Agentic AI?
Agentic AI通常是指能够:
- 根据目标自主规划任务;
- 执行多个步骤;
- 调用工具或系统;
- 根据结果继续做出后续行动。
的AI系统。
与只生成文本或图像的普通GenAI不同,
Agentic AI可能在医疗环境中:
- 主动检索患者信息;
- 生成诊疗建议;
- 调用其他医疗软件;
- 执行连续决策流程。
这也可能带来新的风险,
因此FDA在讨论文件中专门提出相关监管考虑。
十七、FDA是不是已经决定GenAI医疗器械怎么申报?
没有。
此次文件的核心仍然是:
讨论和征求意见。
FDA明确表示,
该文件并没有:
- 确定未来510(k)申报要求;
- 确定De Novo申报要求;
- 确定PMA申报要求;
- 正式规定Benchmarking测试标准;
- 正式规定Clinical Confirmation标准;
- 建立新的强制上市后监测制度。
因此,
企业不能把讨论文件中的框架直接理解成
已经生效的正式FDA要求。
十八、对510(k)、De Novo和PMA项目有什么启示?
虽然讨论文件还没有形成正式监管要求,
但对于正在开发GenAI医疗器械的企业,
已经可以看到一些值得提前关注的方向。
例如未来上市前申报可能更关注:
- 最终产品的整体表现,而不仅是底层模型;
- 临床知识能力;
- 推理和分析能力;
- 安全行为;
- 泛化能力;
- 临床环境中的真实表现;
- 错误输出可能造成的后果;
- 上市后的持续性能。
十九、中国医疗AI企业应该提前准备什么?
对于计划进入美国市场的中国医疗AI企业,
现在可以开始检查:
- 产品是否属于FDA医疗器械;
- 产品预期用途是否清晰;
- GenAI在设备中承担什么功能;
- 最终用户是否直接依赖AI输出进行临床决策;
- 错误输出可能造成什么临床后果;
- 底层Foundation Model是否来自第三方;
- 模型版本变化如何管理;
- Benchmarking方案是否具有临床代表性;
- 是否需要Clinical Confirmation;
- 上市后如何持续监测性能。
二十、GenAI医疗器械与传统AI医疗器械最大的区别是什么?
传统AI医疗器械很多采用相对固定的算法输出,
例如:
- 分类;
- 预测;
- 图像识别;
- 风险评分。
而GenAI产品可能生成:
- 自然语言建议;
- 复杂临床解释;
- 个体化回答;
- 多步骤推理结果;
- 动态生成内容。
这种更开放的输出空间,
意味着产品验证可能不能完全依靠
传统固定测试集和单一准确率指标。
这也是FDA提出Competency-Based Approach的重要背景之一。
二十一、企业还能只看Accuracy吗?
对于GenAI医疗器械,
单一Accuracy指标可能越来越不足以反映实际风险。
企业可能还需要考虑:
- Clinical Knowledge;
- Reasoning;
- Safety Behavior;
- Communication Quality;
- Generalizability;
- 错误结果的严重程度;
- 用户对输出的依赖程度。
因此,
未来GenAI医疗器械的评价可能更接近:
多维度能力评价 + 临床确认 + 持续上市后监测
二十二、FDA现在已经批准多少AI医疗器械?
FDA当前持续维护
Artificial Intelligence-Enabled Medical Devices
公开列表。
截至2026年9月,
FDA表示已经有
超过1,600个AI-enabled medical devices
获准在美国市场销售。
这些产品覆盖:
- 医学影像;
- 诊断;
- 疾病检测;
- 传感器;
- 治疗支持;
- 其他数字健康领域。
但GenAI医疗器械相较于传统AI产品,
可能需要进一步建立更适配其技术特点的监管科学方法。
二十三、公众可以针对哪些问题向FDA反馈?
FDA此次讨论文件围绕多个主题提出问题,
主要包括:
- GenAI医疗器械风险应该如何评估;
- 两轴风险框架是否合理;
- Competency-Based Approach是否可行;
- Benchmarking应该如何设计;
- Clinical Confirmation应该使用哪些证据;
- 上市后监测应该如何与风险相匹配;
- Foundation Model应该如何评价;
- Agentic AI应该如何监管;
- 还有哪些GenAI特有问题需要FDA考虑。
二十四、意见如何提交?
FDA此次公众意见Docket为:
FDA-2026-N-7874
FDA鼓励:
- 制造商;
- 临床医生;
- 研究人员;
- 消费者;
- 公众;
- 其他相关利益方。
通过Regulations.gov提交意见。
截止日期为:
2026年10月19日
FDA同时说明,
提交意见的人并不需要回答讨论文件中的全部问题,
可以仅针对自己具有经验或专业能力的部分进行反馈。
二十五、这次讨论文件真正值得关注的是什么?
此次FDA行动并不意味着
已经建立了一套新的GenAI医疗器械法规。
真正重要的是:
FDA正在从传统“AI模型性能评价”进一步走向
“风险、能力、临床表现和全生命周期监管”的综合框架。
未来GenAI医疗器械的监管,
可能不会只关注:
- 模型准确率;
- 单一测试集表现;
- 底层算法。
而会更加关注:
- 最终设备整体表现;
- 错误输出的临床后果;
- 设备在真实环境中的能力;
- 用户与AI的交互方式;
- 上市后的持续性能。
ALL REG提醒
FDA此次发布的是
Discussion Paper and Request for Feedback,
并不是Draft Guidance或Final Guidance。
因此,
企业现阶段不应把讨论文件中的
Two-Axis Risk Framework、
Competency-Based Approach、
Device Benchmarking
或Clinical Confirmation
直接理解成已经生效的强制要求。
但是,
对于正在开发GenAI医疗器械的企业,
这些内容已经提供了非常重要的监管方向信号。
建议企业提前梳理:
- 产品预期用途;
- GenAI功能边界;
- 设备风险;
- 错误输出的临床后果;
- 底层Foundation Model管理;
- Benchmarking测试方案;
- 临床确认策略;
- 上市后性能监测机制。
对于计划通过510(k)、De Novo或PMA进入美国市场的GenAI医疗器械,
后续FDA是否基于此次公众反馈进一步形成
正式Guidance或其他监管文件,
值得持续关注。
FDA官方信息来源
- FDA — FDA Seeks Public Feedback to Inform Regulatory Approach for Generative AI-Enabled Medical Devices
- FDA — Considerations for the Regulation of Generative AI-Enabled Medical Devices: Discussion Paper and Request for Feedback
- FDA — Artificial Intelligence-Enabled Medical Devices
- FDA — Digital Health Center of Excellence