||
假设检验的考量
显著性水平
假设检验是一种用数据来检验想法或假设的方法。它包括两个假设:零假设(H0)和替代假设(H1)。零假设通常是两个变量之间没有关系或两组之间没有差异的陈述。替代假设与零假设相反,代表想要测试的想法或假设。收集数据后,通过统计测试,查看数据是否支持零假设或替代假设。如果数据提供了足够的证据反对零假设,就拒绝它,并得出结论,替代假设是正确的。显著性水平是用户选择的导致假设检验的结论有利于替代假设(H1)的概率。一般选择非常小的显著性水平,比如概率密度曲线下总面积的5%、2.5%或者1%。例如,通过选择5%的显著性水平,在分布曲线上划定了一个区域,如果H0为真,就有5%的机会获得落入该区域的结果。
显著性水平是当零假设为真时拒绝零假设的概率。由于这种概率非常小,在这一区域获得的结果可用于表明零假设可能不成立。在进行实验之前,研究者必须选择显著性水平。例如:在法庭上,被告在被证明有罪之前被认为是无辜的;这类似于假设检验中的零假设(H0),假设两个变量之间没有关系,或者两组之间没有差异,直到有足够的证据表明不是这样(H1)。正如检察官必须拿出证据证明被告有罪,排除合理怀疑一样,研究人员必须收集数据并进行统计测试,以确定是否有足够的证据拒绝零假设。如果证据足够有力,无效假设被拒绝,替代假设被接受,正如如果不利于被告的证据足够有力,被告可能被判有罪。
假设检验的效力
假设检验的效力(1-β)用于判定发生II类错误的可能性有多大。II类错误的发生概率用字母beta (β)表示,当数据的统计分析未能拒绝某个假设(当原假设为假时),就会出现这种错误(即假阴性)。假设检验的效力受到一些因素的影响,比如:检验了多少次?多次检验的差别有多大等;假设检验的效力可以从0到1。假设检验的效力越高意味着发生II型错误的几率越低。反之,假设检验的效力越低意味着发生II型错误的几率越高。假设检验的效力是通过从概率密度曲线下的总面积中减去β误差的值来获得的(1-β)。因为,II错误是当H0为假时不拒绝它的概率。因此,如果有一个6%的β误差值,假设检验的效力将是1-β=94%。这意味着有6%的概率在应该拒绝H0的时候不拒绝它,有94%的概率正确拒绝H0。
效应大小
效应大小是有用的,因为它可以帮助你理解差异是否重要。在现实生活中,有时差异可能非常小,微不足道。其它时候,差异可能非常大,并产生重大影响。效应大小可以帮助你决定一个差异是否值得关注。有不同的方法来计算效应大小,这取决于你在比较什么。一些常见的方法有科恩的d和皮尔逊的r。科恩的d告诉你两组的平均值之间相差多少个标准差。皮尔逊的r告诉你两个变量之间的关系有多强。效应大小的范围可以从0到1或更大。更高的效应大小意味着更大的差异或更强的关系。
效应大小是可以用来支持假设检验结论的统计资源之一。在某些情况下,仅显著性水平检验不足以评估给定效应的实际显著性。一个实验产生很高的统计显著性,但缺乏有意义的实际显著性,这种情况并不少见;在这种情况下,通过评估观察到的效应差异的显著性就显得十分重要了。例如:使用“Cohen's d”来评估与每个实验的标准差相关的、观察到的效应之间的差异大小,就能够推导出如下四种可能的结果:
(1)假设检验具有统计显著性,实验差异在实际上显著;
(2)假设检验具有统计显著性,实验差异在实际上不显著;
(3)假设检验缺乏统计显著性,实验差异在实际上显著;
(4)假设检验缺乏统计显著性,实验差异在实际上不显著。
可见,上述四种可能的结果中,(1)和(3)才是有价值的、值得进一步深入研究的课题。
随机化
随机化意味着事情的发生是偶然的,而不是有计划的。例如,如果你掷硬币,你无法预知它究竟是正面还是反面。那就是一件随机的事情。随机序列是一系列没有顺序或模式的数值序列。用动物做实验时,必须控制许多变量,以确保实验结果不会有偏差或无效(这些变量包括:动物的体重、年龄、产仔数、颜色等)。为此,必须采用随机数值序列对实验动物进行随机分组。此外,虽然这些变量以及许多其它变量都在研究者的严格控制之下;但是,仍然不能保证所有实验动物在本底信息和统计分析上是平等的。在这一批或那一批实验动物中没有观察到的趋势效应,有可能是来源于未被研究人员注意到的实验偏差。因此,在下结论时,需谨慎。
可再现性
可再现性是指在科学研究中,独立的研究者使用相同的方法、数据和条件能够重复实验或计算,并获得相同或非常相似的结果。这是科学研究的一个基本原则,以确保研究结果的可靠性和有效性。可再现性是科学的本质特征之一,也是当前科学研究中的一个卡脖子问题。科学论断的价值不应取决于提出者的地位或权威性,而应取决于其支撑证据是否具有可再现性。即便是一些质量上乘的研究,也可能因为随机误差或系统误差而出现无法重复的实验结果。常见的导致可再现性失败的原因有很多,其中包含却不限于--实验样品处理不当、实验仪器故障、实验过程犯错、实验对象的生理与病理因素差异、实验对象的心理与生活习惯差异、造假、选择性报道数据、发表偏移、 样本量不足、统计学效力低、数据的分析方法有误等。所以,对科学与技术领域的研究工作而言,可再现性是一个不可或缺的、必须认真应对的重要问题。
参考资料略
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-17 13:18
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社