刷到癌症研究"突破"新闻先别激动,可能有一成是假的
你有没有过这种经历——看到一篇"癌症重大突破"的新闻热血沸腾,点进去一看,发现那项研究早就被撤稿了,或者压根就是假的?
这种事发生的频率,可能比你想的要高得多。好消息是,现在终于有人出手了,搞了个专门揪出"论文造假工厂"的AI工具。
给学术论文装个"垃圾邮件过滤器"
这个工具是昆士兰科技大学的阿德里安·巴尼特教授团队搞出来的。他们用AI分析了1999年到2024年间发表的260万篇癌症研究论文,目标是找出那些看起来像是"论文工厂"出品的东西。
论文工厂是什么呢?简单说就是专门批量生产假论文或者垃圾论文的公司,有组织、有规模、成批量地往外供货。
巴尼特教授说:"这些工厂正在以工业化的规模生产'研究',而我们发现这个问题在癌症研究领域的严重程度,远超大多数人的想象。"
这个AI系统的思路挺巧妙的,本质上就是个垃圾邮件过滤器。它基于一个叫BERT的语言模型,被训练去识别假论文的"文字指纹"——比如反复使用的模板句式、读起来怪怪的英文表达(说明作者可能压根不是母语者,甚至根本不是科研人员)、以及那种明显是流水线作业的生产痕迹。
测试结果相当亮眼:面对已知是造假的论文,它能91%的时间都能识别出来。这个准确率对于一个反学术造假的工具来说,已经很高了。
数字看着挺吓人
更让人担忧的还在后面。
研究人员发现,有超过25万篇论文都带有可疑特征。但真正让人睡不着的是这个趋势——
2000年代初,只有大约1%的已发表癌症研究存在这些问题。到2022年,这个比例已经飙升到超过16%。
每六篇就有一篇有问题。
这可不是什么躲在角落里的小问题,这是大洪水。
而且这些假论文也不是乱分布的,明显集中在某些领域:分子癌症生物学、早期实验室研究,以及胃癌、肝癌、骨癌、肺癌这几个方向。至于为什么是这几个,可能是这些领域更赚钱,也可能是更好造假,背后的原因值得琢磨。
跟你到底有啥关系?
你可能会说:"我又不是科学家,这关我啥事?"
关系大了。
新药研发、临床试验设计,都是在现有研究基础上推进的。如果这个"基础"里有几十万篇是造假论文,那真正的研究人员可能花好几年追一个根本不存在的方向。临床试验可能基于错误假设设计,药物研发可能一条路走到黑。
巴尼特教授说:"癌症研究直接影响临床试验、药物研发和患者治疗。如果造假论文混进证据库,就会误导真正的科学家,最后拖慢患者的治疗进展。"
换个角度想:每多一篇假论文发表,不只是浪费大家时间,更是在消耗本该属于正经研究的资源,甚至可能把整个领域带偏。
好消息还是有的
当然,也不是完全没有希望。
已经有三家科学期刊开始用这个AI工具了,在稿件送审之前先过一遍。这挺重要的,因为同行评审虽然必要,但说实话,审稿人时间精力都有限,面对精心包装的造假论文,有时候真不一定能看出来。
研究团队还打算把这套系统推广到癌症研究之外的其他领域。而且随着更多已确认的论文工厂案例被收集起来训练它,准确率估计还能再往上走。
不过有一点必须说清楚:这个系统只是标记可疑论文,不是一锤定音说人家造假。那些被标出来的论文,还是需要真人专家去核实、去做最终判断。它是个帮助筛选的工具,不是自动判决的机器。
背后更大的问题
这事说起来其实挺讽刺的。
学术圈有句老话叫"不发表就出局"——评职称、拿经费都得看论文数量。这种压力客观存在,而有些人就在这上面动歪脑筋。
论文工厂之所以能存在,说白了就是有市场。有人需要买论文署名,有人需要冲论文数量,而原来的系统又抓不住他们。直到现在,情况可能才有所改变。
但我想说的是,这并不意味着我们应该开始怀疑所有科研结论。大部分科学家做的是正经、扎实的工作。只是单个研究结论的可信度,我们需要更理性地看待。科学本身是会自我纠错的,但这个纠错过程不是瞬间完成的。
话说回来,科学家自己研发工具、自己把问题公开,这本身就说明科研体系还是有自我净化能力的。内部人抓内部的问题、曝光内部的蛀虫——这其实是科学该有的样子。
当然,这也提醒我们:每一篇靠谱的研究背后,都是真人真功夫在撑着。我们欠那些认真做科研的人一个干净的环境,别让流水线生产的垃圾污染了整个领域。
你怎么看? 以后再看"重大突破"的新闻,会不会有不一样的想法了?评论区聊聊。