国内医疗人工智能领域迎来重要进展,中文医疗大模型评测基准MedBench完成5.0版本全面升级。此次升级聚焦专科化评测与安全防护能力提升,标志着我国医疗AI评测体系向专业化、精细化方向迈出关键一步。
新版本由上海人工智能实验室牵头,联合广州实验室、广州医科大学附属第一医院钟南山院士团队及复旦大学附属中山医院葛均波院士团队共同研发。研发团队首创医疗原子技能评测范式,通过拆解医疗场景中的基础能力单元,构建起覆盖诊断、治疗、用药等全流程的评测指标体系。该范式可精准识别AI模型在复杂医疗场景中的能力短板,为模型优化提供量化依据。
针对医疗AI安全痛点,升级后的系统实现全维度幻觉校正功能。通过引入多模态验证机制和临床知识图谱交叉比对,可有效识别并修正模型生成的错误医疗建议。测试数据显示,新系统在罕见病诊断、多药联用方案等高风险场景的准确率提升显著,为临床应用筑牢安全屏障。
作为国内首个原生医疗垂直评测平台,MedBench已获上海市委网信办与卫健委联合认证,成为医疗AI产品上市前的必经评测通道。该平台累计完成超过200个医疗大模型的评估测试,其评测结果直接影响产品临床准入资格,在推动行业规范化发展方面发挥核心作用。此次升级将进一步强化其在医疗AI质量监管领域的技术权威性。

