|
医生们则切身感受到了其中的利弊。
纽约大学朗格尼医学中心专攻渐冻症(ALS)的神经科医生金西·安德鲁斯(Jinsy Andrews)表示,经常有患者带着打印出来的ChatGPT聊天记录来就诊。她说,对于渐冻症这种进行性、无法治愈的神经系统疾病,ChatGPT有时确实能促使人们尽早就医、更早确诊,但也可能造成不必要的困扰。有位前来就诊的人士担心自己得了渐冻症,因为ChatGPT说肌肉跳动可能是病因之一。安德鲁斯说,实际并非如此,但这“加剧了这位求医者的焦虑”。还有一位患者要求尝试ChatGPT推荐的实验性疗法,但它引用的相关研究根本就是虚构的。“要花工夫纠正、厘清这些搜索来的错误信息,结果就会耽误深入研究实际病情、讨论治疗方案的时间。”她说。
奥尔巴尼医疗健康系统一位不愿具名的医生分享了多起案例:患者搬出ChatGPT给出的建议,质疑医生的诊断,还提出毫无科学依据的治疗方案。有一名患者把自己的症状输入ChatGPT后,模型提示他可能患有自身免疫性疾病。“他不愿意再做任何其他检查来明确诊断,还一口咬定:‘我得的就是这个病。ChatGPT说了,我就该用这个方法治。’”这位医生说。
OpenAI十分清楚这些隐患,为此组建了一支由260多名医生组成的团队,优化ChatGPT给出的健康建议。这些医生会对ChatGPT的回复进行评分,研讨具体病例,更关键的是,他们会训练模型在信息不足时不胡乱给出建议。
“我刚加入的时候,觉得它的表现并不好,”丽贝卡·索斯金·希克斯(Rebecca Soskin Hicks)说。她是斯坦福大学培养的儿科医生,约两年半前被OpenAI聘请参与模型的红队测试,现在担任公司医师网络负责人。“说实话,那时候给它下套、让它出错并不是什么难事。”
从那以后,这支团队已审核了超过70万份回复样本,大幅提升了模型回答普通用户和临床医生时的准确率。OpenAI称,目前每周有数百万临床医生使用ChatGPT。OpenAI自研的基准测试工具HealthBench从急症分级、必要时主动表达不确定性等4.8万个评分标准评估模型表现,结果显示,OpenAI新款模型在医疗任务上的表现较旧版本有显著提升,但在主动询问缺失信息方面仍有不足。
不过在医疗运营场景中,OpenAI的模型可靠性更高。
总部位于佛罗里达州、旗下拥有50多家医院的AdventHealth表示,使用OpenAI模型处理行政事务后,相关工作耗时减少了80%。纽约纪念斯隆·凯特琳癌症中心已面向1000人启动试点项目,但目前评估OpenAI带来的实际影响还为时尚早。“初期反馈很不错,”该中心战略创新副总裁奥菲莉亚·邱(Ophelia Chiu,音译)表示,“尽管过去三年市场营销炒得火热,但医疗机构对AI的应用还处在非常早期的摸索阶段。”
OpenAI的格罗斯表示,公司在医疗领域的很多愿景,都将借由基于其模型开发新产品的创业公司和企业来实现。
以市值230亿美元的诊断巨头Labcorp为例。该公司近期一项调查显示,已有41%的人会用AI解读检验报告,但不同工具的信息准确程度参差不齐。因此今年5月,该公司与OpenAI合作推出了一款搭载AI技术的新移动应用,帮助用户理解检验结果、跟踪长期指标变化趋势。
“我们请了医生来给它挖坑、挑它的毛病,结果它的准确率非常高。”Labcorp首席信息与技术官博拉·奥耶贡瓦(Bola Oyegunwa)表示。
还有数千家机构和创业公司,比如Abridge、Ambience和EliseAI,也都在使用OpenAI的模型。
以Abridge为例,这家公司最知名的技术是自动记录医患对话并生成临床病历。该公司机器学习团队负责人戴维斯·梁(Davis Liang,音译)表示,公司同时采用OpenAI和Anthropic的前沿大模型,搭配自研模型,为临床医生打造最优产品。OpenAI的模型在病历记录和通用用户任务上表现尤其出色,但在评估患者症状、生成诊断编码(同时也可用于计费结算)方面表现稍弱。“这项任务难度很大,因为对精确度要求极高,”他说,“OpenAI可能只会判断某患者患有糖尿病,但实际上这个患者得的是糖尿病合并近视性视网膜病变。”
尽管如此,AI技术发展速度极快,很难预判半年后这个领域会是什么样,更别说五年之后了。
“想要撬动一个占GDP 20%的产业,没有什么万能良方,”OpenAI的格罗斯说,“我们能做的只有确保自己的模型能切实帮到人们。”
本文译自: https://www.forbes.com/sites/amyfeldman/2026/07/07/how-openai-plans-to-win-over-doctors-patients-and-hospitals/
文:Amy Feldman 翻译:Lemin |