成语揭晓:特异功能测试 测特殊能力的科学方法
有人声称能用意念弯勺子,或者隔墙看字。怎么判断真假?光靠嘴说不行,得摆上实验台。特异功能测试不是街头把戏,它需要一套严谨到近乎刻板的科学方法。这套方法的基础,是把模糊的说法变成可检验的命题。“我能透视”这种话,要转化成在严密控制下,猜对密封信封里图片主旨的准确率高于随机概率。这步叫作操作化定义。把口头声明转化为明确的、可重复的测量步骤,谁来执行都一个样,没有模糊空间。声明越花哨,定义就得越死板。说能预知未来,就要约定预测什么事,提前多久,书面留证,事后对账。少了这步,测试就是空中楼阁。
测特异功能,永远默认它不存在。这个默认状态叫零假设。收数据的目的,是看能不能用强证据把零假设推翻。零假设是无特异功能的基准立场。推翻的门槛设得很高。偶尔猜对几次,在零假设下原本就可能出现,纯属随机波动。要宣称拥有特殊技能 ,数据必须强到让零假设难以维持。零假设不是咬定没这回事,而是给出一个清晰的参照线,任何偏离都需要过硬证据,不能凭感觉下定论。实验的整套逻辑,就是攒足偏离量,扛住各种质疑。
隔空认字这类测试,最大的漏洞是感官泄露。被试可能听见纸张摩擦声,看到反光,闻到墨水味道,甚至捕捉到实验员下意识的表情。控制条件要把这些路全堵死。控制条件的目标是切断所有正常感官通道。用隔音隔光的屋子,字卡放在另一个房间,由电脑随机呈现,只传输数字信号,物理线索彻底抹掉。有的测试让被试戴上眼罩耳罩,塞进电磁屏蔽室,连手机振动都防住。条件控得越死,怀疑空间就被压缩得越小。一个环节没封严,整个结果就废了。
刺激的顺序不能由人定。人会不知不觉带出规律,偏爱某个符号,或者形成无意识模式。随机化用物理过程或算法打乱次序,保证每次试验独立,下一回出现什么完全不可预测。随机化让刺激序列失去可预测性。早年的猜牌实验,泽纳牌用机器洗牌,每张牌出现概率严谨相等。不随机,统计检验就架在沙子上。真随机源配合严控条件,才能搭出一个干净的测试环境。赌的就是任何超常表现,不可能是钻了规律的空子。
知道答案的实验员,一个咳嗽、一次停顿、眉毛微微挑动,都可能把信息漏出去。双盲法要求,所有直接接触被试的人,完全不知道当前试次的目标是什么。双盲设计屏蔽了实验者效应与有意作弊。刺激由计算机独立管理,分派序列、记录反应、判分的角色彼此信息隔绝。直到整个数据锁存,才揭盲看结果。双盲不单防人使坏,更防那种不知不觉的暗示。这套程序已经成了检验特异功能的黄金标配,缺了它,再惊人的结果也没有讨论的价值。
瞎猜也能撞上几次正确。统计检验就是算,看到的结果纯由运气造成的概率有多大,这个值叫p值。常规把p小于0.05定为显著线,意思是零假设成立的话,这么极端的数据平均每二十次实验才会撞见一回。p<0.05是统计学筛掉随机波动的约定门槛。一次实验要是同时测好几种技能 ,或者反复扒拉数据,碰巧显著的机遇就积攒起来了。必须事先锁死主假设,并对多个检验做校正,比如邦费罗尼法把阈值压得更低。事后挑好看的数据报,跟作弊没区别。
许多宣称的超技能 效应极其微小,猜对率只比随机高两三个百分点。效应量就是衡量偏离零假设的幅度。微小效应量必须配对足够大的样本,否则结果立不住。几十次试次的实验,统计功效低得可怜,真有微弱效应也检不出,偶尔蹦出的显著多半是噪音。扎实的测试会倒推所需样本量,实验前就定好终止规则,不能说停就停。样本量不够,哪怕走运拿到一回显著,换批人立马哑火。
一个效应要让人信,得换实验室、换被试群体,还能稳定复现。重复实验的流程与数据处理方法,必须跟原版对齐,差一点就变味。预注册是在动手收集数据之前,把假设、设计、处理方案整个挂到公开平台,打上不可篡改的时间戳。可重复性加上预注册,把选择性报告的后门焊死。这手砍掉了事后改假设、挑着报结果的灵活性。特异功能领域有不少热闹过的发现,一上独立复制就消失得干干净净,问题往往就出在缺了这两项。
把多个同类实验的数据并到一块看总趋势,叫合并效应量估计,或者叫元研究。它能评估有没有发表偏向,整体效应是不是在零附近打转。合并证据通常显示总体效应不偏离随机水平。实验全程还得堵死作弊可能。无死角录像,被试不能带电子设备,有的测试直接请魔术师当顾问,把手法漏洞找干净。整套科学方法一层套一层,走完这一圈,那些声称的特殊技能 ,还没相同能通盘过关。筛了几十年,结果就摆在桌面上。
声明:五行查询网所有文章资源内容,除特别标注[原创]标识外,均为通过公开渠道采集的网络资源。侵权处理:如发现本站内容侵犯原著者合法权益,请通过以下方式提交书面通知:邮箱:yangming912@qq.com,要求:需提供权利人身份证明及侵权内容具体链接,处理时限:本站将在收到合规通知后72小时内处理。
