为什么社会科学中有那么多论断是虚假的
![]() | ![]() |
本文虽然探讨的是美国的学术不端问题。但在我看来,中国的问题更甚。很多大学的人文学院纯粹是浪费国家的钱在养一群神棍和江湖术士。本文是RCI关于“科学欺诈的常态化”系列文章的一部分,汇有钱途编译。
当今社会面临的最紧迫问题之一是AI可能对教育和劳动力市场产生的影响。因此,两位科学家试图给出答案也就不足为奇了。他们进行了一项荟萃分析(元分析),表明将ChatGPt纳入学校教育后,学生的学习成果显著提升。社交媒体和各大网络平台将这项2025年的研究宣传为一束明亮的希望之光。
问题在于,这些研究人员的结论后来被发现并不可靠,该研究于4月份被撤稿,这又一次打击了公众对科学的信心。
科学家们越来越热衷于在医疗健康、气候变化、AI等领域追寻重大问题的答案。学术研究行业激励他们产出尽可能重大的发现,以制造轰动性的头条新闻,推动职业晋升。然而,这类发现在科学领域实属罕见,结果往往是大量夸大其词、方法存疑以及信息误传。
根据最近的一篇学术综述,“现代科学的激励结构使得‘先简化,再夸大’的策略已成为主导,即使只是心照不宣。”“为了在领先期刊上发表,为了获得资助,为了被聘为博士后或教职人员,一种系统性的对新颖性、夸大和讲故事的偏好已经出现。”
正如RealClearInvestigations此前报道的那样,近年来已有大量质量低劣的学术和科学研究被揭露。Hindawi曾是主要科学出版商Wiley旗下的一部分,不得不撤回数千篇科学文章,其中许多据称出自论文工厂,这些论文工厂批量生成从未存在过的研究报告。
尽管彻头彻尾的学术欺诈已引发广泛关注,但一种更为隐蔽的问题正在研究界蔓延。那些结论前后矛盾、方法论粗糙或实际意义有限的研究成果,往往被包装成宏大、笼统却不可靠的论断,久而久之,公众对科学的信心也随之动摇。
近期数起备受瞩目的论文撤稿事件,揭示了宏大的科学论断是如何建立在存疑数据之上的。一篇近期论文声称,禁止性交易会导致强奸案增加。这篇关于性交易的论文在社交媒体上引发广泛关注,随后才有持怀疑态度的学者指出无法复现其研究结果。另一起重大案例中,几位经济学家在一篇论文中估算气候变化将对全球经济造成毁灭性冲击,该论文在银行业广泛传播且颇具影响力,但最终因其他学者指出重大错误而遭到撤稿。
在每一起案例中,科学"侦探"们都发现那些耸人听闻的论断并不符合实际情况。据监督机构Retraction Watch的数据,过去二十年间撤稿数量急剧攀升,每年达数千篇,但专家认为,真正被发现的存疑研究只是其中的一小部分。
抛硬币
罗格斯大学心理学杰出教授、社会科学的常见批评者Lee Jussim估计,绝大多数心理学研究结论都是错误的。他还指出,心理学复现大多数研究发现的能力,不比抛硬币强多少。
这场危机的核心,是一套失灵的体制,它迫使研究人员不断在高影响力期刊上发表越来越多的论文,而这些期刊青睐大胆的结论,而非渐进式(或零效应)的发现。相关的激励机制包括:
1.学术奖励体系根据研究人员的发表数量和大胆论断来决定晋升、终身教职和科研经费,而非看重严谨的学术研究
2.期刊往往靠吸引眼球的发现来获取订阅收入和媒体关注
3.新闻媒体则凭借关于人类行为的戏剧性、往往出人意料的说法来赢得订阅量和点击量
4.政客们断章取义地援引耸人听闻的科学论断来推行自己偏好的政策,同时对相反的证据视而不见
"学术界日益激烈的竞争和'不发表就出局'的文化可能与研究的客观性和诚信相冲突,因为这迫使科学家不惜一切代价产出'可发表'的成果,"赫瑞-瓦特大学和伦敦经济学院的元科学家Daniele Fanelli在最近一篇论文中指出。
为遏制耸人听闻和错误发现而建立的同行评审制度,近年来被汹涌而来的研究论文所淹没,根本无力将科学园地中的杂草一一清除。同行评审者都是繁忙的学者,大多没有报酬,即便借助新兴AI工具也已捉襟见肘,而这些工具本身在准确性上也存在问题。最近一篇论文估计,在任何一年中,同行评审者集体投入的工作量相当于15000年,若按实际薪酬计算,仅美国、中国和英国的评审者就需花费约25亿美元。
即便发现了错误,更正和撤稿也是一个充满争议的过程,往往需要数年时间。出版商和编辑担心声誉受损以及来自研究人员的诉讼,这使得即便怀疑存在学术不端,纠正记录的动力也寥寥无几。
数字游戏
一种常见的研究夸大现象源于对"统计显著性"发现的宣传。这一措辞的严肃性可能让公众将相关发现解读为可靠且具有实际价值的结论。但事实往往并非如此,这是因为大多数社会科学和医学研究的发现效果非常微弱,微弱到可能是由这些研究中的方法论缺陷(或杂质)所导致的。尽管如此,科学家们仍有动力去强调统计显著性研究的所谓重要性,以博取关注,即便这些研究并不值得如此对待。
打个比方,想象一只蝴蝶和一块铸铁分别落在头上,两者的区别显而易见。两者都会对头部施加可测量的重量,因此都会产生"统计显著"的结果。但其影响的大小,即效应量,却相差悬殊。大多数人会更在意避免铁砧砸到头上,而不是蝴蝶。这正是为什么"统计显著"并不能告诉我们一项发现的实际重要性。
即便是具有标准效应量的发现也未必可靠。例如,社会心理学家Daryl Bem在美国心理学会的一本权威期刊上发表了一篇报告,声称普通人具有超感知觉,即预测未来的能力。这一难以置信的发现在当时引发了相当大的争议。
问题在于,Bem使用了社会科学领域普遍存在的薄弱研究方法,发表了不可能成立的结果。Bem长期以来一直是超感知觉的支持者,他在早期的一篇论文中明确指出,超感知觉的效应与心理学其他领域的发现相似,并表示,"与其他存在争议的人类表现研究领域相比,平均效应量相当可观。"Bem未回应置评请求。
Fanelli教授表示,糟糕的培训和不切实际的期望在一定程度上解释了为什么社会科学家会在数据传播上出现偏差。"我认为,有益的文化变革应朝着更深入理解和接受社会科学局限性的方向发展,"Fanelli在一封电子邮件中写道。"然而,现实情况似乎在某种程度上强化了所谓的'统计显著性崇拜',即以一种机械而简单化的方式将[统计显著性]奉为有效性的标杆。"
这种夸大结果的呈现方式背后,是一个由五大公司主导的学术出版行业,这些公司坐拥丰厚的利润空间。这五大公司(Elsevier、Sage、Springer Nature、Taylor & Francis、Wiley)通常被称为"五巨头",它们与科研经费资助方、学术终身职位评审机制以及媒体一道,共同激励学者追求戏剧性效果,夸大薄弱的研究结果。在科学领域,一项显示无效果的负面发现与正面发现同样重要,但负面发现鲜少得到发表。
政策制定者往往会让情况雪上加霜。Catherine Knibbs是一位心理治疗师,也是“儿童与科技”的创始人,她曾参与英国颇具争议的针对16岁以下青少年社交媒体禁令的相关讨论。她指出,政策制定者在接触科学时往往带着既定结论,而非开放性的问题,对于不符合其议程的数据似乎也缺乏探究的兴趣。
"说实话,我觉得科学是复杂的,虽然我很喜欢这一点,但我感到相当孤独,"Knibbs在一封电子邮件中写道。"人们往往只是粗略浏览数据,寻找能印证自身观点的证据。很少有人愿意放慢脚步,调动更深层的认知过程。这就是为什么我们总会看到那种'天要塌了'的危言耸听。"
推动改革
好消息是,越来越多的研究人员正在积极推动改革,以提升科学研究成果的可信度。其中一个令人鼓舞的迹象是"开放科学运动"的兴起,该运动鼓励研究预注册,从而减少研究人员为得出预期结果而操纵数据分析的可能性。此外,该运动倡导更高的数据透明度,有助于对研究结论进行更充分的验证。
弗吉尼亚大学心理学教授Brian Nosek是开放科学运动的领军人物,他对此持乐观态度。"我最乐观的看法是,我们已经建立起更强的自我审视文化和持续改进机制,"他说。"我不知道这些实践层面的改变成效如何,但我相信,尝试新的研究方法,并致力于评估哪些有效、哪些无效,终将引领我们走向积极的方向。"
一些学者正在脱离五大学术出版商,自行创办非营利性学术期刊。在某些情况下,这是因为期刊向作者收取高昂的论文公开发表费用。一项新的联邦法律诉讼同样指控五大出版商通过不合理的出版收费欺诈政府,而这些费用往往由政府拨款支付。除了学者承担的经济成本外,独立期刊还有可能使学者摆脱对阳性结果的过度关注,即发表偏倚问题。
少数研究机构也在尝试直接解决某些不良激励机制。在评定晋升和终身教职时,这些机构不再过分强调研究人员发表论文的数量及期刊的声望,而是将论文质量作为核心评判标准。
《当代心理学》主编Ric Ferraro教授强调,并非所有学者或期刊都存在不良行为,有些人确实在努力做正确的事,产出扎实的研究成果。但要打破这种扭曲的激励循环并非易事,因为从学者、学术期刊到新闻媒体和政界人士,从中获益者大有人在。
在研究激励机制得到更广泛改变之前,公众将持续接收到大量关于人类行为的大胆论断,而这些论断所依托的基础却并不牢固。
![]() | ![]() |





