Frontiers的调查显示,在同行评审中使用AI的受访者中,59%用其辅助撰写评审报告;29%借助AI总结手稿、识别研究空白或核查参考文献;28%标记潜在的学术不端行为,例如剽窃和图像重复(见“AI辅助”)。
美国西北大学范伯格医学院研究学术伦理与诚信的Mohammad Hosseini表示,这项调查“是一次有益的尝试,来了解AI在同行评审中的可接受度,及不同场景下的普遍状况”。
部分研究人员正自行开展测试,以评估AI模型应用于同行评审的表现。上个月,美国休斯顿大学的工程科学家Mim Rahimi设计了一项实验,测试大型语言模型(LLM)GPT-5能否评审他与人合著的一篇《自然-通讯》论文[1]。
他设计了四种不同的测试设置:从仅输入基础提示词让大模型在无额外背景信息的情况下评审论文,到提供相关文献中的研究文章、帮助大模型评估其论文的创新性和严谨性。随后,Rahimi将AI生成的评审结果与该期刊给出的实际同行评审报告做比较,并在一段YouTube视频中分享了自己的发现。
他的实验表明,GPT-5能够模仿同行评审报告的结构,使用流畅的语言,但无法提供建设性反馈,且存在事实性错误。即便使用更复杂的提示词,也未能提升AI的表现。甚至,复杂的测试设置生成的评审质量还差。另一项研究发现,AI对20份手稿的评审结果“虽然在整体上与人类评审的结论趋于一致,但在提供详细批评意见方面存在明显不足”。
Rahimi表示,这次实验让他认识到,AI工具“或许能提供一些信息,但如果有人完全依赖这些信息,可能很有害处。”