未来城市实验室:邻居统计

卡方统计

跨学科课程

关键词: 零假设,偏见,统计意义,卡方,p值,社会科学
缩图
资料来源:www.flickr.com/franciscodaum

目标

学生将

  • 派生并使用卡方检验  

  • 在纽约市人口统计学背景下解释此测试的使用 

  • 将社会科学与所谓的“硬科学”进行比较和对比 

  • 考虑统计数据在何种程度上对人类研究有用 

材料

  • 每对学生一袋30个珠子(或吃喝玩乐)。 应该有五种不同的颜色。 

  • 讲义(两份学生活动讲义,一份数据表和一把教师钥匙)

  • 计算器 

标准: 

  • CCSS.ELA-LITERACY.RST.9-10.7:将文本中用文字表达的定量或技术信息翻译成视觉形式(例如,表格或图表),并将视觉或数学形式(例如,方程式)表达的信息翻译成文字。

  • CCSS.MATH.CONTENT.HSS.MD.A.4:建立随机变量的概率分布,该随机变量定义在样本空间中,其中概率是根据经验分配的;求期望值。

引导性问题

  1. 如何测试组是否随机分布? 

  2. “硬科学”和“社会科学”之间的主要区别是什么?每种数据的局限性是什么? 

  3. 我们如何利用今天的统计数据来帮助我们了解过去? 

    程序

    卡方表是帮助科学家理解数据是否与随机结果存在显著差异的工具——换句话说,就是是否存在需要解释的外部因素。课堂上通常使用无生命物体或非人类对象(例如珠子、基因结果)来演示卡方检验。本课将探讨卡方检验等统计方法是否可用于评估人类行为,以及它是否可以作为历史课堂教学的工具。非科学教师可以访问以下链接获取有用的教程:http ://www.ling.upenn.edu/~clight/chisquared.htm

    在本课程的第一部分中,学生通过测试磁珠的分布来得出卡方值。 然后,给学生们提出了一个更棘手的问题:纽约的不同种族是否随机分布? 学生可以使用计算器来确定。 (将为他们提供的纽约市所有邻里都具有极高的卡方值。)然后,老师将带领学生讨论这些类型的工具在分析人类行为方面是否有意义,并讨论社会科学与“硬科学”之间的差异更为普遍。 最后,本课程以讨论这些工具是否对分析历史有用的方式结束,并指向探索影响纽约市人们为什么非随机分组的历史因素的资源。 

    下载邻居统计信息珠活动工作表

    下载社区统计人口统计资料

    下载邻居统计数据表

    下载邻居统计教师密钥

  1. 「Hook」
  2. 向学生提出怪异的主张,例如“穿纽扣衬衫的人比穿T恤的人跳得更高。” 找到一个不同意你的学生。 问课:谁有举证责任? 没有证据,我们应该假设哪个? 为什么? 让学生分享回应。 

    所有实验的目标都是为了检验零假设。假设是对现象的可检验解释。零假设是指将所有差异解释为随机性/偶然性造成的假设。在发现充分的证据之前,我们不能接受新的(替代的)假设。

    教师提出的具体替代假设(H alt)是:人们跳跃高度的差异可以通过他们所穿衬衫的类型来预测。

    对于 T 恤衫的例子,零假设 (H 0 ) 是:人们跳跃高度的差异与他们所穿的衬衫无关。

    我们如何找出正确的呢? 这就是卡方分析的用武之地。 

  3. 练习
  4. 向学生解释,你在每个袋子里都装了30颗珠子,每种颜色有五种。他们的任务是判断你是随机分配的还是有偏差的。检查学生的回答:哪个解释是零假设?(答案:零假设是珠子是随机分配的,没有偏差。)

    问:如果零假设(无偏差)成立,你认为珠子的分布会是什么样的?(答:我预期30颗珠子,5种颜色,每种颜色会有6颗。)

    科学家/统计学家如何确定实际(观察到的)数字与预期的距离有多远? 让学生有时间集体讨论潜在的数学解决方案。 他们应该能够提出减法作为衡量差异的方法。 

    卡方的等式为: 

    = [SUM] ( o – e ) ² / e

    o =已观察到(这实际上是每个类别有多少个) 

    e =预期(这是随机机会预测的数量) 

    该差异表示每个值与 H 0预测值的距离。

    差异被平方以消除负数。 然后将它们除以期望值。 这就像取平均值。 

    所有结果值相加(用总和或讲义中的 sigma表示)。差异越大,卡方值越大。请注意,这里没有考虑样本量,因此样本量越大,卡方值通常也越大。

    解释:卡方值衡量的是观测值与预期值之间的偏差程度。如果偏差足够大,我们就可以拒绝原假设。换句话说,在这种情况下,我们可以说老师的行为并非随机。相反,出于某种原因,你选择了给每个小组分发哪些珠子,因此你的行为存在偏差。当然,这个检验无法确定这种偏差的来源。请学生们提出他们自己的备择假设。例如:

    1.)与其他颜色珠相比,教师更喜欢使用某种颜色珠。 

    2.)老师的选择是随机的,但是珠子的原始来源没有每种颜色相同的数目。  

    让学生按照讲义上的说明测试自己的书包。 将需要计算自由度(颜色数– 1),并被教导使用p值图表。 工作表中提供了所有表格和图表。  

  5. 结语
  6. 学生分组分享结果,分组决定珠子分布是否有偏差。 

  7. 在断裂前,
  8. 学生们将获得来自纽约市教育局的真实社区人口统计数据。第一个任务是确定零假设:如果美国人口普查数据显示29%的纽约市民为西班牙裔,那么零假设会如何描述纽约市特定社区的人口构成?(答案:我们预期每个社区中29%的人口为西班牙裔。)

    学生从提供的数据讲义中选择一个邻域进行测试。 由于卡方仅适用于较小的样本量,因此不应使用原始数据。 他们可以使用百分比作为样本,就像每个邻里只有100个人一样。 这项工作可以在讲义上用计算器完成。 

  9. 分析数据
  10. 请学生分享他们的结果。为什么每个社区的卡方值都显著?这在统计学上意味着什么?(每个社区的卡方值都显著。这意味着我们可以拒绝人口随机分布的零假设。)

    强化:数据显示,纽约市这些社区的人口分布并非随机——但数据也无法解释其原因。卡方分析仅仅表明存在某种形式的偏差,并且实际结果与预期结果之间的差异具有统计学意义。在这种情况下,探究其原因通常是社会科学的范畴,而非统计学的范畴。

  11. 讨论:社会科学的本质
  12. 使用这些问题来指导有关学生刚刚学习的技能的潜在应用的深入讨论和/或写作活动。 

    向学生解释,传统上卡方是用于不施加选择的人群(例如在第一次活动中使用珠子或吃喝玩乐的情况)。 分析人类的行为通常是所谓的“社会科学”(例如心理学,经济学,社会学,政治科学和历史)的领域。  

    :自然科学和社会科学有什么共同之处?

    :社会科学面临哪些独特的挑战?为什么从人类研究中得出结论比从植物甚至像小鼠这样的模式动物研究中得出结论更难?量化人类行为有用吗?人口统计数据有哪些潜在用途?这类统计研究的局限性是什么?

    :为什么在我们分析的所有社区中,我们都能拒绝原假设?(预期答案类似于:人们可以选择居住地,或者人们的居住地受限于他们的经济能力。

    关于移民的选择:为什么不同群体的人会选择居住在彼此附近?

    关于其他外部因素:还有哪些因素可能会限制移民在居住地方面的选择?

  13. 讨论:历史因素简介
  14. 在纽约市的历史上,某些群体一直被迫或被强迫居住在特定区域——或者至少被阻止居住在城市中最“理想”的地段。20世纪中期,种族隔离政策(即“红线区”)——即拒绝向传统黑人社区的非裔美国人提供抵押贷款——使许多非裔美国人无法拥有住房(从而无法跻身中产阶级),并导致非裔美国人集中在城市的某些特定区域。另一方面,许多非裔美国人迁往哈莱姆区等传统黑人社区,这些社区在种族隔离时期的美国社会中成为一片安全之地,并允许人们享有创作、思想和言论的自由,从而孕育了哈莱姆文艺复兴。

    借助历史的推挽作用以及多种历史因素和背景来告知人类参与者的选择(或缺乏选择),我们是否可以将统计分析用作历史上有意义的工具? 如果您正在撰写历史论文,您会考虑包括卡方分析来支持您的论点吗? 

更多资讯 

利用这个网站来讲解“红线区”的历史:20 世纪 40 年代的政策如何导致城市中事实上的种族隔离:https://dsl.richmond.edu/panorama/redlining/

有关“红线区”政策的全面历史,请参阅理查德·罗斯坦的《法律的颜色:美国政府如何种族隔离的被遗忘的历史》(Liveright,2017 年)。

实地考察:本内容灵感来源于博物馆旗舰展览“纽约核心”中的“世界城市,1898-2012”“未来城市实验室”展厅。如果条件允许,不妨带领学生进行实地考察!访问http://mcny.org/education/field-trips了解更多信息。

致谢

本系列课程计划是与纽约市公立学校教师焦点小组共同制定的,该小组成员包括:Joy Canning、Max Chomet、Vassili Frantzis、JoAnn Gensert 博士、Jessica Lam、Patty Ng 和 Patricia Schultz。

本项目得以实现,部分原因要归功于博物馆和图书馆服务协会

这些课程中表达的观点,发现,结论或建议不一定代表博物馆和图书馆服务学院的观点,发现,结论或建议。