看起来很有道理的数据,常常在说错话


title: 看起来很有道理的数据,常常在说错话
date: 2026-10-05 10:00:00
categories:

  • 1

tags:

  • 科普
  • 认知
  • 生活科学

三个很常见的判断:

冰淇淋卖得多的月份,溺水也多,所以冰淇淋导致溺水。一支球队去年战绩极端地好,今年回落,所以他们“退步了”,或者“被针对了”。成功的创业者都说自己每天工作到很晚,所以拼命就是成功的原因。

三句话都像有数据撑着。问题通常不在数字本身,而在你用数字时跳过了哪一步:你把“一起出现”当成了“一个导致另一个”,把“极端之后没那么极端”当成了实力蒸发,又把“还站在台上的人”当成了全体。

这三条不是鸡汤式的“要有批判思维”。它们是统计学里很老、也很稳的区分。看懂它们,日常判断会少犯一类特定的错:证据还没强到那个程度,结论却已经下完了。

科学上真正在说什么

相关不是因果。 两个东西一起升降,只说明它们在这组数据里有关联。关联至少有四种常见来源:A 推动 B,B 推动 A,第三个因素同时推着两边,或者只是碰巧。教科书里的冰淇淋和溺水,指的就是第三种。热天既让人买冰淇淋,也让更多人下水。把冰淇淋禁掉,溺水不会因此消失。

这个例子轻,结构不轻。医学史上有过更严肃的版本。宫颈癌的早期流行病学线索指向性传播感染,疱疹病毒一度看起来很像元凶,因为它和危险因素绑在一起出现。后来能站得住的证据指向的是人乳头瘤病毒,不是疱疹。相关把研究者带到了正确的邻域——问题确实和感染有关——但相关本身没有指出是哪一个病毒。从“一起出现”走到“这个导致那个”,靠的是更强的设计:谁先谁后、暴露越强结果是否越明显、替代解释能不能排除、不同人群里能否重复,以及机制是否说得通。观察性关联是起点,不是终点。

新闻标题最常省略的就是这一步。它写“研究发现 A 与 B 有关”,读者读成“A 造成了 B”。这两句之间,常常还隔着一整层没被测量的生活条件:年龄、收入、吸烟、本来就已经不舒服所以才改变饮食。第三因素不必神秘,它只是没被放进同一句话里。

回归均值不是一种拉力。 今天统计学上说的回归均值,指的是:如果两次测量并不完全一致,那么第一次特别极端的人,第二次的平均会没那么极端。它不是一股把人拽回平均线的神秘力量,也不是“天赋会消退”或“物极必反”。

19 世纪,高尔顿研究身高遗传时描述过类似现象:特别高的父母,子女往往仍然偏高,但没有父母那么极端。史学上,他本人当时究竟把这理解成生物上的“返祖”,还是纯粹的统计现象,学者仍有争论,不宜把后人的教科书版本直接安到他头上。今天课堂上更干净的讲法是:一次极端表现里,混着比较稳定的部分,也混着一次性的运气、测量误差和当天状态。下次再量,运气那一部分不会自动再来一次,所以这一组人的平均数会往中间靠。

所以,球队的“次年下滑”、疼痛“用了某种方法就好多了”,经常有这一层。不一定是实力蒸发,也不一定是方法立功。如果你专挑最疼的那一天开始治疗,下一次没那么疼,有一部分只是因为你不会永远停在最疼的那天。这不证明治疗没用,只证明“前后一比就宣布有效”太快了。

回归均值解释的是群体的期望,不是每一个人的命运。稳定的优势可以留下。高个子父母的孩子通常仍然偏高,只是平均而言没有父母在样本里看上去那么极端。

幸存者偏差,是你没看见的那些人。 你只能采访还在场上的人,于是场上的人看起来像全体。

二战期间,统计学家亚伯拉罕·沃尔德面对的是返航飞机上的损伤数据。广为流传的“在没有弹孔的地方加装甲”,是教学上的简化,不宜当成他某张原图的逐字结论,那张漫画比原始备忘录流传得广得多。可核实的核心是:手头只有活下来的飞机,缺失的是没回来的那些。返航机身上的洞,更像是“中了这里仍能回来”的证据,而不是“这里最该补”的证据。决策要针对看不见的失败,不能只对着看得见的伤口下笔。

创业回忆录、基金排行榜、网红学习法,是同一结构。失败的公司不写成功学,清盘的产品退出榜单,半途放弃的人不会来给你做方法分享。你看见的共同习惯,是筛选之后的残差,不是实验组。

证据强弱,要分开看

已有较强共识的,可以当判断工具用:

相关不等于因果。这是统计推断的基本区分,不是某一篇新论文的临时结论。混淆、反向因果、巧合,都是标准教材里的类别,不需要等一篇“最新研究”来批准。

回归均值是不完全相关下的数学后果。只要两次测量不是一一对应,极端组再测时的平均就会向总体均值靠拢。它不需要神秘机制,也不要求你相信“宇宙喜欢平均”。

只分析通过筛选的样本,会系统性偏乐观。这就是幸存者偏差。沃尔德关于飞机生存性的工作,是这个逻辑进入真实决策的著名例子;流行叙事比原始材料更戏剧化,逻辑本身站得住。

有限证据,或容易被讲过头的:

某一条健康新闻里的“A 增加 B 的风险”,往往来自一次观察性研究。它可以提示关联,不能单靠这一次就定因果。剂量关系是否存在、混杂有没有被认真处理、换一批人还能不能重复,都要另看。一篇科普文不该替那些研究把话说死。

“极端之后一定下滑”也不是生活定律。回归均值说的是:在没有其他变化时,极端表现的期望值会没那么极端。如果训练、规则、人员、病情真的变了,真实变化可以盖过这层统计回落,也可以和它叠在一起。不先分开,就会把两件事记在同一个账上,然后挑选一个更好听的故事。

沃尔德故事的漫画版传播极广,细节被简化过。用它理解“缺失数据”,可以;用它假装自己读过军方原始备忘录,不行。科普最容易在这里滑向另一个错误:为了把道理讲顺,补上没有来源的数字和对话。

常见误解,证据并不支持:

“统计学上显著,就是原因找到了。”显著大致是说,这组数据不太像纯偶然晃出来的。它不自动排除第三个因素,也不等于效应大到值得你改变生活。一个很小的差异,样本够大时也可以“显著”。

“回归均值意味着一切都会变平庸。”不是。它说的是极端值里的噪声成分不会原样重复,稳定的差异可以留下。把回归均值理解成一种道德上的拉平,是把数学读成了寓言。

“幸存者的建议一定是错的。”也不一定。活下来的人可能真掌握了有用的东西。错的是把他们的共同习惯当成充分原因,却不问有多少人做了同样的事,然后从样本里消失了。没有分母的分子,看起来总是很满。

生活里怎么用,不过度

三件可以当天就做的事,都很小,也不打算替你做医疗或投资决定。

第一,听到“A 和 B 有关”,先问第三变量,再决定要不要改自己的生活。季节、年龄、收入、生病之后才改变的习惯,经常同时推着两边。冰淇淋和溺水是玩笑版;“某种食物和某种病一起出现”是同一问法的严肃版。问完仍可能值得小心,但小心的理由应该是证据强度,不是标题的语气。

第二,看到极端表现,先等一次再测量,再宣布“退步”或“有效”。一次考试特别差、一次疼痛特别重、一个季度特别好,都含有不容易重复的部分。拿第二次和第一次比之前,先问:我是不是专挑最极端的那次当起点。这不是叫你忽视真实变化。训练真的松了,病情真的重了,都该被认真对待。它只是叫你别把噪声记成趋势,也别把“从最坏的一天开始算”当成疗效证明。个体差异很大,身体症状应该就医,而不是用统计直觉替代检查。

第三,听成功学之前,先找分母。如果某种作息只出现在成功者访谈里,你不知道失败者里有多少人也是这样过的。更有用的问题不是“成功的人做了什么”,而是“做了这件事的人,后来怎样了”。后者通常没有现成的榜单,所以答案会难看一些,也更接近你真正要做的决定。看不见失败样本时,至少把结论的信心降一档,而不是把访谈录读成因果实验。

这三问也有边界。不是所有相关都是假的,不是所有回落都是回归均值,不是所有经验都因为来自幸存者就作废。它们的作用是拦住一种过快的跳跃:数据还只说明“这些被看见的人、在这些条件下、这两次测量之间有关联”,嘴上已经说成了“所以你应该这样生活”。

一句话

数据会说话,但你没问到的那一部分——混在一起的第三因素、不会重复的运气,以及根本没出现在样本里的人——往往比你看见的数字更决定结论。

本文著作权归作者 [ doudoudoubao ] 享有,未经作者书面授权,禁止转载,封面图片来源于 [ 互联网 ] ,本文仅供个人学习、研究和欣赏使用。如有异议,请联系博主及时处理。

发表留言