第4章 抽样与抽样分布练习:4.1 一个具有个观察值的随机样本抽自于均值等于20、标准差等于16的总体。⑴ 给出的抽样分布(重复抽样)的均值和标准差⑵ 描述的抽样分布的形状。你的回答依赖于样本容量吗?⑶ 计算标准正态统计量对应于的值。⑷ 计算标准正态统计量对应于的值。(2)以组距为10进行等距分组,整理成频数分布表,并绘制直方图;(3)绘制茎叶图,并与直方图作比较。2.5 下面是北方某城市1~2月份各天气温的记录数据:-32-4-7-11-1789-6-7-14-18-15-9-6-15-4-9-3-6-8-12-16-19-15-22-25-24-19-21-8-6-15-11-12-19-25-24-18-17-24-14-22-13-9-6-15-4-9-3-32-4-4-16-175-6-5(1) 指出上面的数据属于什么类型;(2) 对上面的数据进行适当的分组;(3) 绘制直方图,说明该城市气温分布的特点。2.6 下面是某考试管理中心对2002年参加成人自学考试的12000名学生的年龄分组数据:年龄18~1921~2122~2425~2930~3435~3940~4445~59%1.934.734.117.26.42.71.81.2(1) 对这个年龄分布作直方图;(2) 从直方图分析成人自学考试人员年龄分布的特点。2.7 下面是A、B两个班学生的数学考试成绩数据:A班:4457596061616263636566666769707071727373737474747575757575767677777778787980808285858686909292929396B班:3539404444485152525455565657575758596061616263646668687070717173747479818283838485909191949596100100100(1) 将两个班的考试成绩用一个公共的茎制成茎叶图;(2) 比较两个班考试成绩分布的特点。2.8 1997年我国几个主要城市各月份的平均相对湿度数据如下表,试绘制箱线图,并分析各城市平均相对湿度的分布特征。月份北京长春南京郑州武汉广州成都昆明兰州西安149707657777279655167241687157758083654167347507768818081584974450397267758479614670555566863718375584158657547357748782724342769708274818684845862874798271738478745755968667167718175775565104759755372807876456511665982777872787153731256578265827582715272资料来源:《中国统计年鉴1998》,中国统计出版社1998,第10页。4.2 参考练习4.1求概率。⑴<16; ⑵>23; ⑶>25; ⑷.落在16和22之间; ⑸<14。4.3 一个具有个观察值的随机样本选自于、的总体。试求下列概率的近似值:4.4 一个具有个观察值的随机样本选自于和的总体。⑴ 你预计的最大值和最小值是什么?⑵ 你认为至多偏离多么远?⑶ 为了回答b你必须要知道吗?请解释。4.5 考虑一个包含的值等于0,1,2,…,97,98,99的总体。假设的取值的可能性是相同的。则运用计算机对下面的每一个值产生500个随机样本,并对于每一个样本计算。对于每一个样本容量,构造的500个值的相对频率直方图。当值增加时在直方图上会发生什么变化?存在什么相似性?这里和。4.6 美国汽车联合会(AAA)是一个拥有90个俱乐部的非营利联盟,它对其成员提供旅行、金融、保险以及与汽车相关的各项服务。1999年5月,AAA通过对会员调查得知一个4口之家出游中平均每日餐饮和住宿费用大约是213美元(《旅行新闻》Travel News,1999年5月11日)。假设这个花费的标准差是15美元,并且AAA所报道的平均每日消费是总体均值。又假设选取49个4口之家,并对其在1999年6月期间的旅行费用进行记录。⑴ 描述(样本家庭平均每日餐饮和住宿的消费)的抽样分布。特别说明服从怎样的分布以及的均值和方差是什么?证明你的回答;⑵ 对于样本家庭来说平均每日消费大于213美元的概率是什么?大于217美元的概率呢?在209美元和217美元之间的概率呢?4.7 技术人员对奶粉装袋过程进行了质量检验。每袋的平均重量标准为克、标准差为克。监控这一过程的技术人者每天随机地抽取36袋,并对每袋重量进行测量。现考虑这36袋奶粉所组成样本的平均重量。(1)描述的抽样分布,并给出和的值,以及概率分布的形状;(3) 假设某一天技术人员观察到,这是否意味着装袋过程出现问题了呢,为什么?4.8 在本章的统计实践中,某投资者考虑将1000美元投资于种不同的股票。每一种股票月收益率的均值为,标准差。对于这五种股票的投资组合,投资者每月的收益率是。投资者的每月收益率的方差是,它是投资者所面临风险的一个度量。⑴ 假如投资者将1000美元仅投资于这5种股票的其中3种,则这个投资者所面对的风险将会增加还是减少?请解释;⑵ 假设将1000美元投资在另外10种收益率与上述的完全一样的股票,试度量其风险,并与只投资5种股票的情形进行比较。4.9 某制造商为击剑运动员生产安全夹克,这些夹克是以剑锋刺入其中时所需的最小力量(以牛顿为单位)来定级的。如果生产工艺操作正确,则他生产的夹克级别应平均840牛顿,标准差15牛顿。国际击剑管理组织(FIE)希望这些夹克的最低级别不小于800牛顿。为了检查其生产过程是否正常,某检验人员从生产过程中抽取了50个夹克作为一个随机样本进行定级,并计算,即该样本中夹克级别的均值。她假设这个过程的标准差是固定的,但是担心级别均值可能已经发生变化。⑴ 如果该生产过程仍旧正常,则的样本分布为何?2.9 某百货公司6月份各天的销售额数据如下(单位:万元):(1)计算该百货公司日销售额的均值、中位数和四分位数;(2)计算日销售额的标准差。2.10 甲乙两个企业生产三种产品的单位成本和总成本资料如下:比较哪个企业的总平均成本高?并分析其原因。2.11 在某地区抽取的120家企业按利润额进行分组,结果如下:计算120家企业利润额的均值和标准差。2.12 为研究少年儿童的成长发育状况,某研究所的一位调查人员在某城市抽取100名7~17岁的少年儿童作为样本,另一位调查人员则抽取了1000名7~17岁的少年儿童作为样本。请回答下面的问题,并解释其原因。(1)哪一位调查研究人员在其所抽取的样本中得到的少年儿童的平均身高较大?或者这两组样本的平均身高相同?(2)哪一位调查研究人员在其所抽取的样本中得到的少年儿童身高的标准差较大?或者这两组样本的标准差相同?(3)哪一位调查研究人员有可能得到这1100名少年儿童的最高者或最低者?或者对两位调查研究人员来说,这种机会是相同的?2.13 一项关于大学生体重状况的研究发现,男生的平均体重为60公斤,标准差为5公斤;女生的平均体重为50公斤,标准差为5公斤。请回答下面的问题:(1)是男生的体重差异大还是女生的体重差异大?为什么?(2.以磅为单位(1公斤=2.2磅),求体重的平均数和标准差。⑵ 假设这个检验人员所抽取样本的级别均值为830牛顿,则如果生产过程正常的话,样本均值≤830牛顿的概率是多少?⑶ 在检验人员假定生产过程的标准差固定不变时,你对b部分有关当前生产过程的现状有何看法(即夹克级别均值是否仍为840牛顿)?⑷ 现在假设该生产过程的均值没有变化,但是过程的标准差从15牛顿增加到了45牛顿。在这种情况下的抽样分布是什么?当具有这种分布时,则≤830牛顿的概率是多少?4.10 在任何生产过程中,产品质量的波动都是不可避免的。产品质量的变化可被分成两类:由于特殊原因所引起的变化(例如,某一特定的机器),以及由于共同的原因所引起的变化(例如,产品的设计很差)。一个去除了质量变化的所有特殊原因的生产过程被称为是稳定的或者是在统计控制中的。剩余的变化只是简单的随机变化。假如随机变化太大,则管理部门不能接受,但只要消除变化的共同原因,便可减少变化(Deming,1982,1986;De Vor, Chang,和Sutherland,1992)。通常的做法是将产品质量的特征绘制到控制图上,然后观察这些数值随时间如何变动。例如,为了控制肥皂中碱的数量,可以每小时从生产线中随机地抽选块试验肥皂作为样本,并测量其碱的数量,不同时间的样本含碱量的均值描绘在下图中。假设这个过程是在统计控制中的,则的分布将具有过程的均值,标准差具有过程的标准差除以样本容量的平方根,。下面的控制图中水平线表示过程均值,两条线称为控制极限度,位于的上下3的位置。假如落在界限的外面,则有充分的理由说明目前存在变化的特殊原因,这个过程一定是失控的。当生产过程是在统计控制中时,肥皂试验样本中碱的百分比将服从和的近似的正态分布。⑴ 假设则上下控制极限应距离多么远?⑵ 假如这个过程是在控制中,则落在控制极限之外的概率是多少?⑶ 假设抽取样本之前,过程均值移动到,则由样本得出这个过程失控的(正确的)结论的概率是多少?4.11 参考练习4.10.肥皂公司决定设置比练习4.10中所述的这一限度更为严格的控制极限。特别地,当加工过程在控制中时,公司愿意接受落在控制极限外面的概率是0.10。⑴ 若公司仍想将控制极限度设在与均值的上下距离相等之处,并且仍计划在每小时的样本中使用个观察值,则控制极限应该设定在哪里?⑵ 假设a部分中的控制极限已付诸实施,但是公司不知道,现在是3%(而不是2%)。若,则落在控制极限外面的概率是多少?若呢?4.12 参考练习4.11。为了改进控制图的敏感性,有时将警戒线与控制极限一起画在图上。警戒限一般被设定为。假如有两个连续的数据点落在警戒限之外,则这个过程一定是失控的(蒙哥马利,1991年)。⑴ 假设肥皂加工过程是在控制中(即,它遵循和的正态分布),则的下一个值落在警戒限之外的概率是什么?⑵ 假设肥皂加工过程是在控制中,则你预料到画在控制图上的的这40个值中有多少个点落在上控制极限以上?⑶ 假设肥皂加工过程是在控制中,则的两个未来数值落在下警戒线以下的概率是多少?
设X11,X 2,.,X5是取自正态分布N(0,σ²)的一个简单随机样本,若X11,X 2,.,X5服从t分布,求a和t分布的自由度.
设approx N(a,(sigma )^2),则approx N(a,(sigma )^2)服从的分布为( )A.approx N(a,(sigma )^2)B.approx N(a,(sigma )^2)C.approx N(a,(sigma )^2)D.approx N(a,(sigma )^2)
设X~b(1,p),其中p为未知参数,X_1,X_2, dots ,X_n为来自于总体X的一个样本,在下列选项中,()是统计量。A. X_1+X_2B. max(X_i) C. X_n+2 p; _D. 2(X_n-X_1)^2
必要的数据处理是数据分析的前提A. 正确B. 错误
描述等比数列资料的集中趋势的最佳指标是A. 算术均数B. 相对数C. 几何均数D. 中位数E. 频数
46-关于固定样本调查的描述错误的是()。A. 从长期来看节约了调查费用和资源B. 对总体推断更加准确C. 可以利用各期的调查信息作为辅助信息D. 回答负担会加重
下列不属于兴利调节的基本原理的是()A. 概率论B. 水量平衡C. 数理统计D. 代表期法
下列数据属于定序数据的是()。A. 性别B. 学历C. 温度D. 身高
计算总指数时,综合指数法要依据全面资料计算,平均指数可根据______资料计算。作业:作业4.1某市三个企业某年的下半年产值及计划执行情况如下:要求:[1 ]试计算并填写上表空栏,并分别说明(3)、(5)、(6)、(7)是何种相对数;[2]如果丙企业能完成计划,则该市三个企业将超额完成计划多少(从相对数和绝对数两方 面说明)?作业4.2某企业产值计划完成为105%,比上年增长7%,试计算计划规定比上年增长多少?单 位产品成本上年为420元,计划规定今年成本降低5%,实际降低6%,试确定今年单位 成本的计划数字和实际数字,并计算出降低成本计划完成程度指标。课后综合练习1:下面已知的数据是美国总统在他们举行就职典礼时的年龄。要求:(1)编制单项数列(2)编制组距为5,第一组的下限为40的组距数列(3)根据组距数列绘制直方图(4)计算平均数、中位数、众数、标准差、变异系数(5)对数据进行解释说明。课后综合练习2:下面已知的数据是在交通事故中严重受伤时,摩托车手的年龄。要求:如果目的是向年轻人(35岁及以下)描绘摩托车的危险,请绘制最能达到目的的统计图形, 计算最能达到目的的统计指标,并进行说明。作业5.1已知某地区各工业企业产值计划完成情况以及计划产值资料如下:要求:(1 )根据上述资料计算该地区各企业产值计划的平均完成程度。(2 )如果在上表 中所给资料不是计划产值而是实际产值,试计算产值计划平均完成程度。作业5.2已知某厂三个车向生产不同的产品,其废品率、产量和工时资料如下:计算:(1)三种产品的平均废品率;(2)假定三个车间生产的是同一产品,但独立完成, 产品的平均废品率是多少;(3)假定三个车间是连续加工某一产品,产品的平均废品率是 多少。作业5.3对某车间甲、乙两工人当日产品中各抽取1 0件产品进行质量检查,得资料如下:试比较甲乙两工人谁生产的零件质量较稳定。作业5.4某企业工人工资资料如下:要求:(1)分别计算基期工人总平均工资和报告期工人总平均工资填入上表空格处;(2)说明报 告期工人总平均工资比基期工人总平均工资降低(或提高)的原因。作业6.1某电池厂生产2号电池100,000节,按规定,电流强度在5安培以上者为合格品,抽取0.1%进行检查,结果如下表,试计算平均电流强度的抽样平均误差及合格率的抽样平均误差。作业6.2某农场进行小麦产量抽样调查,小麦播种总面积为1万亩,采用不重复简单随机抽样,从 中抽选了100亩作为样本进行实割实测,测得样本平均亩产400斤,方差144斤。要求计算:以95.45%的可靠性推断该农场小麦平均亩产可能在多少斤之间?作业6.3某纱厂某时期内生产了10万个单位的纱,按纯随机抽样方式抽取2000个单位检验,检验 结果合格率为95%,废品率为5%,试以95%的把握程度,估计全部纱合格品率的区间范 围及合格品数量的区间范围?作业6.4某农场进行小麦产量抽样调查,小麦播种总面积为1万亩,采用不重复简单随机抽样。根 据以往资料知道,总体平均亩产400斤,方差144斤。要求计算:若概率保证程度95.45%,要求抽样允许误差不超过1斤,问至少应抽多少亩 作为样本?作业6.5为调查农民生活状况,在某地区5000户农民中,按不重复简单随机抽样法,抽取400户进 行调查,得知这400户中拥有彩色电视机的农户为87户。要求计算:(1)、以95%的把握程度估计该地区全部农户中拥有彩色电视机的农户在多大比 例之间?(2)、若要求抽样允许误差不超过0.02,概率保证程度为95%,其它条件不变,问应抽多 少户作为样本?作业7.1某工厂上半年工人数和工业总产值资料如下:(注:七月初工人数为2250人) 就上表资料进行如下计算和分析:(1)计算第一季度和 第二季度平均工人数,并对比两季度的变化情况;(2)计算第一季度和第二季度平均每月 总产值,并对比两季度月平均产值的变化情况;(3)计算第一季度和第二季度平均月劳动 生产率,并对比两季度月劳动生产率的变化情况。作业7.2根据表中我国1998年〜2003年GDP(单位:亿元)的资料计算各种动态分析指标,填入 表中相应的空格内。作业7.3(1)某公司2000年产值为2400万元,若今后以每年递增19.235%的速度发展,则到2008年将达到什么水平?(2)我国2000年国内生产总值为89404亿元,根据“十五”计划, 要在2005年达到125000亿元,每年应递增百分之几才能达到预期的目的?我国2000年人 口数为12.5亿,在“十五”计划内人口增长率控制在0.9%,到2005年我国人均国内生产 总值将达到多少?作业7.4某企业历年利润资料如下:单位:万元试用最小平方法拟合趋势直线,并预测2004年该企业利润总额。作业7.5某企业若干年指标资料如下:试根据上述资料,计算表中所缺的其它数字及2001年和2004年增长1 %的绝对值。计算1999-2004年的平均增长量和平均增长速度。作业8.1某农贸市场销售三种农产品资料如下:要求:1、分析三种农产品销售量的综合变动情况,以及销售量的变动对销售额的影响额。2、分析三种农产品销售价格的综合变动情况,以及价格的变动对销售额的影响额。作业8.2有三种产品的生产资料如下:要求:计算三种产品产量总指数,并分析由于三种产品产量的变动对生产费用的影响。作业8.3有三种产品的生产资料如下:要求:计算三种产品单位成本总指数,并分析由于三种产品单位成本的变动对生产费用的 影响。作业8.4三种农产品销售资料如下:要求:对三种农产品销售额的变动进行因素分析。作业8.5根据作业8.3的资料,对企业的生产总费用变动进行因素分析。作业8.6两企业有关资料如下:要求:对两个企业工人劳动生产率总平均变动情况进行因素分析。.
热门问题
假定用于分析的数据包含属性age.数据元组[1]中age的值如下(按递增序):13,15,16,16,19,20,20,21,22,22,25,25,25,30,33,33,35,35,36,40,45,46,52,70, 问题:使用按箱平均值平滑方法对上述数据进行平滑,箱的深度为3。第二个箱子值为:A. 18.3B. 22。6C. 26。8D. 27。9
44.2021年,我国人均预期寿命提高到了()。A. 78岁B. 79岁C. 78.2岁D. 79.2岁
48皮尔逊相关系数的取值范围为0到正无穷。()A. 错误B. 正确
对研究对象制定明确的纳入标准和排除标准,是为了保证样本的A. 可靠性B. 可行性C. 代表性D. 合理性E. 科学性
以下几种数据挖掘功能中,〔〕被广泛的用于购物篮分析.A. 关联分析B. 分类和预测C. 聚类分析D. 演变分析
重测信度用重测相关系数来表示,相关系数越趋近于下列哪一数值时,则重测信度越高A. 1B. 0.7C. 2D. 3
请你从下表中找出1~100中所有质数.并数一数一共多少个. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100
下列哪项属于常见的池化方式。()A. 反向传播B. 最大池化C. 方差池化D. 协方差池化
皮尔逊相关系数的取值范围为0到正无穷。()A. 正确B. 错误
像从性不好的资料是()A. 由于死亡或者其他原因不能继续试验B. 能按照试验规定要求完成实验C. 重复参加试验D. 由于纳入标准不合格导致选择的研究对象不符合试验要求E. 能完成试验但是不能按照规定要求完成试验
下列哪项属于常见的池化方式。()A. 协方差池化B. 方差池化C. 反向传播D. 最大池化
下列说法正确的是()A. 方差数值上等于各个数据与样本方差之差的平方和之平均数B. 协方差衡量了多个变量的分布C. 协方差和方差的计算方式完全一致D. 方差描述了样本数据的波动程度
可以从最小化每个类簇的方差这一视角来解释K均值聚类的结果,下面对这一视角描述正确的A. 每个样本数据分别归属于与其距离最远的聚类质心所在聚类集合B. 每个簇类的质心累加起来最小C. 最终聚类结果中每个聚类集合中所包含数据呈现出来差异性最大D. 每个簇类的方差累加起来最小
1. 名词解释 假设检验 (请在答题纸上手写并拍照上传)
下列说法正确的是()A. 方差数值上等于各个数据与样本方差之差的平方和之平均数B. 协方差和方差的计算方式完全一致C. 协方差衡量了多个变量的分布D. 方差描述了样本数据的波动程度
设随机变量XY都服从N(0,1),则有()A. X+Y服从正态分布B. X+Y服从x^2分布 C. X^2和Y^2都服从x^2分布 D. (X^2)div (Y^2)服从F分布
{15分)常规情况下,下列不属于人口学变量的是A. 民族B. 收入C. 年龄D. 睡眠时间E. 性别
{1.5分)确定研究总体和样本时,不需要考虑A. 立题依据B. 样本量C. 抽样方法D. 目标总体E. 纳入及排除标准
5.聚类分析可以看作是一种非监督的分类。()
下列关于回归分析的描述不正确的是()A. 回归分析模型可分为线性回归模型和非线性回归模型B. 回归分析研究不同变量之间存在的关系()C. 刻画不同变量之间关系的模型统称为线性回归模型D. 回归分析研究单个变量的变化情况