首页 > 新闻 > 专题文章

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

医库软件董事长涂宏钢:AI+医疗行业亟需建立中立性“标尺”

第一财经 2026-07-19 14:24:06 听新闻

责编:吴琪

日前举办的2026世界人工智能大会期间,7月18日,一场题为AI+医健产业可持续创新论坛上,医库软件董事长涂宏钢分享题为“盲测平台创新探索医疗AI的评价基石”的演讲。涂宏钢直指当前医疗大模型评测体系存在重大漏洞,并对外发布AI公平性盲测平台,通过盲测比对、双榜单校验、动态迭代机制,打造客观透明、贴合临床真实场景的医疗 AI 评测生态。

Grand View Research数据显示,2024年全球AI医疗市场规模约为266.5亿美元,预计到2033年将达约5055.9亿美元,年复合增长率达38.8%。随着生成式AI监管政策逐步收紧,厂商、医院需在AI幻觉校正、临床基准测试等领域做更多验证,垂类评测中心正在逐步进入行业视野。

 

涂宏钢在主题演讲开篇称,当前,业内两份权威研究出现完全相悖的评测结论:Nature Medicine测评显示通用大模型表现优于专业医疗模型,而基于执业医师实测的测评却得出专业模型全面领先的结果。

“传统评测模式存在三大先天缺陷,严重影响评测公信力。”涂宏钢指出:一是评测样本与出题方存在倾向性,测试样本量偏小,极易引导结果偏向自有模型;二是评测存在主观干预空间,评测人员知晓被测模型品牌,易产生先入为主的主观偏好,评价标准模糊;三是评分缺乏统一标准答案,评审拥有自由裁量权,榜单结果难以服众。针对上述行业痛点,一则专业的医疗AI盲测平台有巨大应用前景与价值。

为此,涂宏钢以医库软件搭建的“医库医疗AI公平性盲测平台”为例表示,核心创新模式应该分为三层。第一,是采用双引擎盲测对比机制。平台输出专业临床问题,随机调用两款 AI 模型生成回答,全程隐藏模型名称,由一线执业医师匿名打分,如同 “盲选” 一般,彻底消除品牌、厂商带来的主观偏见,评测结果完全依托模型真实临床应答能力。

第二,是搭建动态持续更新评测体系。医疗大模型迭代速度极快,平台实时收录最新上线模型,动态更新榜单。如7月16日全新发布的Kimi医疗搜索,仅经过 800 余次测试便登顶榜单,平台通过调整权重兼顾评测时效性与样本量,真实反映模型最新水平。

第三,是首创“人类医师 + AI 评委”双榜单互验机制。同一组问答样本,一方面由临床医师人工打分排名,另一方面引入 5 组独立 AI 评委同步评分,两份榜单交叉校验,最大限度降低单一评价主体带来的偏差,提升评测可信度。

谈及该盲测平台中立性优势,涂宏钢表示,医库手握189万执业医师资源,是国内头部医生服务平台,同时自身未研发自有医疗AI产品,不存在“既当运动员又当裁判员”的利益冲突,能够公平聚合全行业各类医疗大模型,为医院、医生、企业提供中立参考标尺。

“未来,该盲测平台的产业赋能价值也在进一步展现。这包括海量临床真实问答数据可形成标准化标注素材,反向供给各AI厂商用于模型迭代优化;平台面向全行业免费开放体验,无需注册即可参与评测,降低行业测试成本等。”涂宏钢说。

举报
一财最热
点击关闭