去掉异常值求标准差除以平均值

4213人阅读
oracle(38)
& 箱线图前提不要求正态分布,而Z分数法前提要求正态分布。
&&& 箱线图(Boxplot)也称箱须图(Box-whisker Plot),是利用数据中的五个统计量:最小值、第一四分位数、中位数、第三四分位数与最大值来描述数据的一种方法,它也可以粗略地看出数据是否具有有对称性,分布的分散程度等信息,特别可以用于对几个样本的比较。
&&& 简单箱线图由五部分组成,分别是最小值、中位数、最大值和两个四分位数。
&&&&第一四分位数Q1:又称“下四分位数”,等于该样本中所有数值由小到大排列后第25%的数字。
&&& 中位数F:又称第二四分位数(Q2),又称“中位数”,等于该样本中所有数值由小到大排列后第50%的数字。
&&& 第三四分位数:又称“上四分位数”,等于该样本中所有数值由小到大排列后第75%的数字。
&&& 箱线图判断异常值的标准以四分位数和四分位距为基础。
&&& 四分位距(QR, Quartile range):上四分位数与下四分位数之间的间距,即上四分位数减去下四分位数。
&&& F代表中位数,QR代表四分位距。
&&& 在Q3+1.5QR(四分位距)和Q1-1.5QR处画两条与中位线一样的线段,这两条线段为异常值截断点,称其为内限。
&&& 在F(中位数)+3QR和F-3QR处画两条线段,称其为外限。
&&& 箱线图功能:
&&& 1.直观明了地识别数据批中的异常值
  箱线图为我们提供了识别异常值的一个标准:异常值被定义为小于Q1-1.5IQR或大于Q3+1.5IQR的值。虽然这种标准有点任意性,但它来源于经验判断,经验表明它在处理需要特别注意的数据方面表现不错。这与识别异常值的经典方法有些不同。众所周知,基于正态分布的3σ法则或z分数方法是以假定数据服从正态分布为前提的,但实际数据往往并不严格服从正态分布。它们判断异常值的标准是以计算数据批的均值和标准差为基础的,而均值和标准差的耐抗性极小,异常值本身会对它们产生较大影响,这样产生的异常值个数不会多于总数0.7%。显然,应用这种方法于非正态分布数据中判断异常值,其有效性是有限的。箱线图的绘制依靠实际数据,不需要事先假定数据服从特定的分布形式,没有对数据作任何限制性要求,它只是真实直观地表现数据形状的本来面貌;另一方面,箱线图判断异常值的标准以四分位数和四分位距为基础,四分位数具有一定的耐抗性,多达25%的数据可以变得任意远而不会很大地扰动四分位数,所以异常值不能对这个标准施加影响,箱线图识别异常值的结果比较客观。由此可见,箱线图在识别异常值方面有一定的优越性。
  2.利用箱线图判断数据批的偏态和尾重
  比较、不同自由度的t分布和非对称分布数据的箱线图的特征,可以发现:对于标准正态分布的大样本,只有 0.7%的值是异常值,中位数位于上下四分位数的中央,箱线图的方盒关于中位线对称。选取不同自由度的t分布的大样本,代表对称重尾分布,当t分布的自由度越小,尾部越重,就有越大的概率观察到异常值。以卡方分布作为非对称分布的例子进行分析,发现当卡方分布的自由度越小,异常值出现于一侧的概率越大,中位数也越偏离上下四分位数的中心位置,分布偏态性越强。异常值集中在较小值一侧,则分布呈现左偏态;;异常值集中在较大值一侧,则分布呈现右偏态。下表列出了几种分布的样本数据箱线图的特征(样本数据由SAS的随机数生成函数自动生成),验证了上述规律。这个规律揭示了数据批分布偏态和尾重的部分信息,尽管它们不能给出偏态和尾重程度的精确度量,但可作为我们粗略估计的依据。
  3.利用箱线图比较几批数据的形状
  同一数轴上,几批数据的箱线图并行排列,几批数据的中位数、尾长、异常值、分布区间等形状信息便昭然若揭。在一批数据中,哪几个数据点出类拔萃,哪些数据点表现不及一般,这些数据点放在同类其它群体中处于什么位置,可以通过比较各箱线图的异常值看出。各批数据的四分位距大小,正常值的分布是集中还是分散,观察各方盒和线段的长短便可明了。每批数据分布的偏态如何,分析中位线和异常值的位置也可估计出来。还有一些箱线图的变种,使数据批间的比较更加直观明白。例如有一种可变宽度的箱线图,使箱的宽度正比于批量的平方根,从而使批量大的数据批有面积大的箱,面积大的箱有适当的视觉效果。如果对同类群体的几批数据的箱线图进行比较,分析评价,便是参照解释方法的可视图示;如果把受测者数据批的箱线图与外在效标数据批的箱线图比较分析,便是效标参照解释的可视图示。箱线图结合这些分析方法用于质量管理、人事测评、探索性数据分析等统计分析活动中去,有助于分析过程的简便快捷,其作用显而易见。
&&& 箱线图应用举例:
&&& 现有某直销中心30名员工的工资测算数据两批,第一批为工资调整前的数据,第二批为工资调整后的数据,绘出它们的箱线图(如下图),进行比较,可以很容易地得出:工资调整前,总体水平在 752元左右,四分位距为307.5,没有异常值。经过调整后,箱线图显示,第2、29、10、24、27号为温和的异常值,第26、30、28号为极端的异常值。为什么会出现异常值呢?经过进一步分析知道,第2、29、10、24号员工由于技能强、工龄长、积累贡献大、表现较好,劳苦功高,理应得到较高的报酬;第27、26、30、28号职工则因为技能偏低、工龄短、积累贡献小且表现较差,得到的工资较低,甚至连一般水平也难以达到。这体现了工资调整的奖优罚劣原则。另外,调整后工资总体水平比调整前高出270元,四分位距为106,工资分布比调整前更加集中,在合适的范围内既拉开了差距,又不至于差距太悬殊,还针对特殊情况进行了特殊处理。这种工资分布具有激励作用,可以说工资调整达到预期目的。
&&& 箱线图美中不足之处在于它不能提供关于数据分布偏态和尾重程度的精确度量;对于批量较大的数据批,箱线图反映的形状信息更加模糊;用中位数代表总体平均水平有一定的局限性等等。所以,应用箱线图最好结合其它描述统计工具如均值、标准差、偏度、分布函数等来描述数据批的分布形状。
* 以上用户言论只代表其个人观点,不代表CSDN网站的观点或立场
访问:151651次
积分:2308
积分:2308
排名:第9490名
原创:68篇
转载:66篇
评论:10条
(2)(1)(1)(1)(1)(2)(1)(3)(7)(4)(5)(5)(1)(2)(9)(4)(2)(3)(2)(1)(6)(7)(1)(1)(1)(1)(2)(1)(2)(2)(2)(2)(2)(3)(2)(3)(1)(1)(2)(1)(8)(3)(2)(2)(5)(2)(2)(1)(2)(6)(1)(1)工业工程中 剔除异常值三倍标准差法 中的标准差怎么计算?具体例子说明._百度作业帮
工业工程中 剔除异常值三倍标准差法 中的标准差怎么计算?具体例子说明.
工业工程中 剔除异常值三倍标准差法 中的标准差怎么计算?具体例子说明.
设有n个数x1、x2、...、xn,则这n个数的标准差为σ=√{[(x1-xp)^2+(x2-xp)^2+...+(xn-xp)^2]/(n-1)}①,①式中xp为n个数的平均值:xp=(x1+x2+...+xn)/n②;如果某个数偏离平均值大于3σ,则应剔除;假定|xi-xp|≥3σ,则视xi为异常值,应剔除.剔除异常值后应根据留存的数据个数重新计算标准差,重新检查异常值,直到无异常值为止.
能具体列一组数值出来!把具体过程写出来吗!谢谢
这样的数据并不难列出。用spss因素分析前需要去掉异常值吗?_百度知道
用spss因素分析前需要去掉异常值吗?
打算用spss做因素分析,目前仍然在摸索中,需要去掉3个标准差之外的异常值吗?求高手指点~
提问者采纳
要么过滤掉。如果存在,可以通过箱图来检验是否存在奇异值奇异值的剔除是在任何一种分析之前需要做的,要么替换掉。然后再做其他的分析即可
其他类似问题
为您推荐:
异常值的相关知识
等待您来回答
下载知道APP
随时随地咨询
出门在外也不愁去掉异常值求标准差_百度知道
去掉异常值求标准差
比如说20个样本中19个都是接近100的值,导致标准差变大,那么还有一个值为10或者1000,怎么去掉异常值呢excel 中,样本数据中有特别异常的值
提问者采纳
在excel中才能去应用相应的公式,如果20个样本中,所谓的异常值要人为的去定义,这样的话,那你说这个异常值又是哪一个呢,10
依次类推.,这样我们在excel中才能通过公式去判断,你应该去定义这个异常值的情况你好这个问题有点不科学,有11个是接近于100的数值。举个例子,比如误差不超过10为正常值. ?因此.,误差不超过10,超过10的都算异常值,80,, 70,其他的样本为90
大于 median+3 sigma去除掉,昨天摸索了下,搞定了,谢谢!
提问者评价
来自团队:
其他类似问题
为您推荐:
等待您来回答
下载知道APP
随时随地咨询
出门在外也不愁剔除异常值的方法_百度文库
两大类热门资源免费畅读
续费一年阅读会员,立省24元!
剔除异常值的方法
上传于||文档简介
&&拉​依​达​准​则​法​,​肖​维​勒​准​则​法​,​狄​克​逊​准​则​法​,​罗​马​诺​夫​斯​基​(​t​检​验​)​准​则​法​,​格​拉​布​斯​准​则​法​(​G​r​u​b​b​s​)​各​类​剔​除​异​常​值​方​法​的​比​较​。
阅读已结束,如果下载本文需要使用
想免费下载本文?
你可能喜欢

我要回帖

更多关于 标准差的点估计值 的文章

 

随机推荐