Cultural Views on Intelligence

文化对智力的看法

Linas Juozenas
释放智力 · 社会与机会

当机会扩大,智力就能成长

推理、知识、记忆、创造力和熟练判断力彼此相关,但又是不同的能力。它们的发展和外在表现会受到教育、健康、练习、语言、反馈和有意义的挑战影响。社会塑造人们获得这些条件的机会,也影响能力得到认可的可能性。

智商与认知成长 文化与期望 教学与评估 语言与残障 健康与保护 贫困与学校经费 技术与人工智能 循证政策

核心理念

测得的认知能力存在可靠的个体差异,能够预测一些结果,而且并非不可改变。设计良好的认知和成就测量,能够为明确界定的构念提供有用证据。额外的教育能够提升认知测试中的表现;知识和专业能力能够贯穿一生不断增长;特定技能的提升也能支持学习和独立生活。

然而,每一个分数或表现都同时反映了一个人以及其表现时所处的条件。饥饿、铅暴露、产前酒精暴露、不良教学、无法使用的材料、不熟悉的语言、强烈的恐惧、睡眠不足或不合适的测试,都可能降低观察到的表现、干扰学习,或同时造成这两种影响;单凭分数无法区分这些机制。因此,重视智力不仅仅是欣赏高分,还需要营造条件,让更多人的思维变得更强,并展现他们所掌握的知识。

先读这里 · 高标准与真正的机会

高标准需要真正的机会

公平的体系坚持高要求的目标,并消除与这些目标无关的障碍。它教授成功所需的知识和策略,给予人们真正的练习机会,准确衡量预期能力,并在证据表明机会或教学未能发挥作用时作出回应。

01 · 衡量重要的事物

能力、成就、专业知识和机会是不同的变量

推理测试、学校考试、工作样本和过往机会记录回答的是不同问题。任何单一材料都不应被解读为涵盖这四个方面的证据。

02 · 先培养,再评判

高期望需要高质量的实现途径

“你可以进步”只有与明确的教学、有用的反馈、充足的时间、练习、书籍、营养、安全保障以及在需要时提供的专业支持相结合,才会变得可信。

03 · 尊重真实的能力特征

多样化的优势不需要未经支持的固定类型

人们在语言、空间、数量、记忆、注意、创造、运动、社交和特定领域技能方面确实存在差异。这些差异本身并不能证明加德纳所提出的领域是彼此独立的智力,也不能证明应根据固定的学习风格标签匹配教学。

04 · 结合语境解读

文化会改变意义与表达方式

不同社群对值得珍视的知识、被称为明智的行为、所使用的语言,以及专长发展的环境各不相同。在每一种文化内部,差异仍然很大。

05 · 审查后果

善意还不等于良好的系统

招生规则、算法、资优项目、合理便利和资金分配公式,都应根据效度、可及性、学习效果、错误模式和长期结果进行评估,而不是根据品牌宣传。

重视智力最清晰的方式,是发展智力

认真对待认知能力。谨慎测量。以高标准教学。保护大脑免受可预防的伤害。为人们提供反复学习并展示掌握程度的路径。然后庆祝经过验证的进步——无论它表现为更高的认知分数、流利的阅读能力、更强的数学推理能力、修复好的机器、新的科学思想,还是在压力下更明智的行动。

从机会到能力的链条 这是一种诊断性启发式框架,而非普遍适用的因果顺序:各阶段相互作用,其中一环薄弱可能压制其他环节。政策应调查失效的环节,而不是责怪学习者。
  1. 01 保护发展 营养、医疗保健、安全的孕期指导、清洁的空气和水、睡眠、安全,以及免受神经毒性物质暴露。
  2. 02 保障获取 出勤、语言支持、残障支持、交通、书籍、网络连接,以及不会被生存所需耗尽的时间。
  3. 03 教得好 连贯的课程、专家讲解、有指导的练习、反馈、提取练习、挑战,以及及时响应的支持。
  4. 04 公平测量 可靠的工具、有效的解释、恰当的语言和规范、合理便利,以及不止一个相关信息来源。
  5. 05 开放机会 高阶学习、学徒培训、就业、康复、领导力,以及真正运用不断增长的能力的机会。
01

智力是真实存在的——而且人类的能力特征确实多种多样

一个社会不必在认真对待认知测量与承认多种有价值的专长之间二选一。

在一项高难度认知任务中表现出色的人,平均而言往往也能在其他任务中表现出色。这种反复出现的“正向流形”支持一种一般认知因素,通常称为 g以及言语理解、流体推理、空间加工、记忆和加工速度等广泛能力。在来自31个非西方国家的97个样本中,一项综述发现,大多数样本中存在第一个一般因素,其余大多数样本中则存在二阶一般因素。这支持认知任务之间正相关在跨文化范围内反复出现;但这本身并不能确立完全相同的因素结构、测量不变性、有效的本地常模,或无偏的群体均值比较。

经过充分验证的认知测量结果与教育表现、培训成果以及日后功能的某些方面存在相关性,并且能够对它们作出不完美的预测。预测并不能说明测得的能力单独造成了某种结果,而预测效度取决于人群、效标和决策情境。这些能力和测量确实重要。这是发展认知能力和改进评估的理由,而不是把一个人简化为一个排名。这些关系是概率性的;它们并不能决定一个人的未来、品格、创造力、勇气、知识、机会或价值。

是的——测得的智力可以提高

一项荟萃分析汇总了来自42个数据集的142个效应量,涉及超过60万名参与者;研究使用纵向控制、义务教育改革和入学年龄截止点进行估计,发现教育年限每增加一年,认知测验分数大约提高1–5个智商点,具体取决于研究设计和结果指标。这支持教育对测得的认知表现具有因果影响;但这并不意味着每位学习者都会受到相同影响,也不意味着收益可以无限累加,或能等量迁移到每一项认知任务中。这是有力证据,表明学校教育能够提升测得的认知表现,而不只是按照先前表现对学生进行筛选。

一个共同因素并不意味着拥有一个完全相同的心智

总体得分相同的两个人,可能获得不同的分测验分数,并且在知识、兴趣、感官获取、语言经历和策略方面存在差异。只有当分数差异超过测量误差,且对预期决策有效时,才能解读个体内部表面上的优势与弱点。音乐才能、机械技能、社会推理、运动控制、艺术创作和生态知识都是真实的成就。有些成就很大程度上依赖一般推理能力;另一些则更多取决于练习、知觉、动机、运动控制、人格、文化和领域专门知识。

Howard Gardner 的多元智能框架帮助许多教育工作者不再局限于语言和数学课业。其人性化的初衷——发现更多才能——值得保留。但其更强的科学主张,即所提出的领域是彼此独立的智能,尚未得到证实。直接检验发现,各领域之间存在大量共同的认知变异,而且其中一些所谓的“智能”把能力与兴趣、人格或自我报告混为一谈。负责任的结论并不是只有一种才能重要,而是能力的多样性是真实存在的,但不需要一组彼此独立且固定不变的智能类型

向左或向右滑动以比较 →

机构应当分开看待的四个概念
构念 它所回答的问题 有用的证据 它单独无法确立的内容
认知能力 在明确条件下,这个人能多有效地推理、记忆、处理信息或学习? 经过验证的认知任务,结合适龄常模和不确定性进行解读 总体知识、动机、道德、创造力、实践掌握程度或固定不变的潜能
成就 到目前为止,这个人掌握了哪些课程内容或知识体系? 考试、演示、项目和累积性作业 学习为何发生、获得了哪些教学,或学习新材料的速度有多快
专业能力 这个人能否在真实领域中可靠地完成复杂活动? 工作样本、监督下的练习、作品集、观察到的表现和结果 向无关领域广泛迁移,或不存在未测量的优势
机会 这个人获得了哪些学习、健康、时间、语言、技术和社会支持条件? 历史、背景、出勤、获取机会和接触经历的数据 能力本身——但它会改变我们应如何解读表现,以及哪些干预措施是合理的

群体变化使环境因素的作用清晰可见

在20世纪的大部分时期,许多国家的智商测试表现都有大幅提升——这就是弗林效应;而在一些地方和某些领域,这种提升已经放缓或出现逆转。挪威的家庭内部分析支持环境因素能够解释上升和下降。确切的因素组合仍有争议,但大规模的群体世代变化表明,不能把一个群体的测量表现视为永恒不变或由生物因素固定。

02

文化塑造能力的含义及其表现方式

文化会影响目标、工具、语言和认可方式,但不会把社区中的每个人都变成相同的学习者。

“谁是聪明人?”至少可以有三种含义:谁能高效解决陌生的认知问题,谁掌握了某个社群所重视的知识,以及谁能以该社群认为负责任的方式运用判断力。标准化认知测试会在特定条件下对选定的构念进行操作性定义——例如推理、后天习得的知识、记忆或加工速度;它们并不能回答更广泛的道德或文化问题。家庭、学校和工作场所往往会将这三者混合在一起。当其中一种答案被当作完整定义时,混淆便由此开始。

针对特定社群的研究说明了具体化为何重要。在一项针对肯尼亚罗族儿童的研究中,当地人对聪明人的描述不仅包括认知能力,还包括尊重、理解和社会责任;传统的认知测量和学校测量主要与其中的认知成分相关。对赞比亚切瓦族社群的研究同样将 nzelu 描述为兼具快速理解能力和负责任的社会行为。这些发现有助于理解所研究的社群,但并不能据此提出“非洲文化重视群体性智力”这样的笼统论断。每一个宽泛标签内部的国家、地区、语言、世代、阶层、家庭和个人都各不相同。

问题
心理测量视角
文化视角
机构责任
重视的究竟是什么?
推理、记忆、速度、知识或其他明确界定的构念
对当地有意义的能力、责任、专长和目的
明确说明所测构念,而不是把每一种受重视的品质都称为“智力”
分数可以比较吗?
检验测量结构、题目功能、信度、常模和预测能力是否支持这种比较
考察语言、受教育经历、熟悉程度、动机、作答规范和利害关系
证据不足时,对比较加以限定或拒绝比较
接下来应该做什么?
在存在不确定性的情况下,将结果用于具体且经过验证的目的
加入历史、当地知识、观察和有意义的表现
根据证据的程度提供相应的支持和机会,而不是赋予永久性的身份标签

熟悉的情境可以揭示学校题型容易遗漏的策略

在巴西,曾在市场工作的儿童有时在商业情境中比在类似学校的题型中更成功地解决等值算术题,并会使用适应任务的策略。对阿拉斯加尤皮克族青少年的研究发现,在以当地情境为基础的默会知识测量中,农村参与者表现更好;而在晶体智力测试中,城市参与者表现更好。在农村环境中,当地知识能更好地预测社区对实际能力的评价。这些研究并不表明学术推理是不真实的或没有必要。它们表明,知识的表现形式在一定程度上取决于情境、表征方式和实践经历

这一点对教育很重要。学习者可能需要明确帮助,才能将非正式策略转化为数学记号、学术语言或新的职业情境。正确的回应既不是“学校考试就是一切”,也不是“学校知识并不重要”,而是把已有能力与强有力的新表征、词汇和可推广的方法连接起来。

把文化当作问题,而不是答案

  • 询问学习者和社区哪些知识与成果对他们重要,同时确保他们能够接触共同的科学、数学、语言和公民知识。
  • 使用与相关群体有关的具体证据,而不是基于国籍、族裔或宗教的假设。
  • 教授机构所期待的论述方式和考试惯例;隐藏规则会惩罚那些从未有人向其展示这些规则的人。
  • 在家庭、社区、工作场所和学术形式的专业知识之间搭建桥梁。
  • 让标准清晰可见。情境响应式教学并不是对学习的豁免,而是进入学习的一条路径。
03

标签、期望、刻板印象与归属感

当信念改变了教学、机会、关注、压力或坚持下去的意愿时,它们的影响最大。

期望不是心灵感应。教师不能仅凭相信就把学习者变成天才,敌意的刻板印象也不会自动决定每一次表现。但期望可以改变行为:谁会得到有难度的问题、耐心的讲解、详细的反馈、领导角色、再次尝试的机会,或被推荐参加高级学习。这样的待遇差异可能改变学习机会,尽管所引用的综述发现,平均而言,自我实现效应通常很小,而且消退的情况多于累积。

一项对课堂中自我实现预言的长期综述得出结论:这类效应确实存在,但通常很小,往往会逐渐消退,并且经常与基于早期表现的准确预测同时存在。对于已经受到污名化或面临较低期望的人,这些效应可能更为重要。后来一项针对19项旨在改变教师期望的干预措施的综述报告称,教师期望和学生成绩的平均效应均为正向,但不同研究及实施情况之间存在差异。真正有用的启示不是“期望会创造智商”,而是“要审查期望在不知不觉中控制了哪些机会”。

教学前

谁可以访问?

课程安置、资优筛查、纪律处分、残障转介和语言分类,可能在学习者有机会作出回应之前,就决定其多年课程的开启或关闭。

教学期间

谁能获得认知挑战?

有些学习者会得到解释和具有挑战性的问题;另一些人却只能做简化的填充性任务。没有智力要求的支持可能变成另一道天花板。

表现之后

谁能获得另一条路径?

同一个错误,在一个人身上可能被看作暂时的困惑,在另一个人身上却被视为固定的无能。重新教学和再次评估会揭示这种双重标准。

刻板印象可能拖累表现——但不是放之四海而皆准的解释

当负面的群体刻板印象在评估期间变得相关时,有些人会经历额外的自我监控、压力或注意力分散。元分析发现这些影响确实可能出现,但在现实测试情境中的估计通常可以忽略不计或很小,而且发表偏倚令人担忧。不应利用刻板印象威胁来解释所有分数差距,对其平均影响大小的质疑也不应成为歧视、敌意线索或机会偏差的借口。

归属感同样是具体的。它不是一张写着“欢迎所有人”的海报,而在于学习者是否能看到与自己相似的人在从事严肃的工作,问题是否得到尊重,欺凌是否被制止,错误是否可以得到修正,合理便利是否成为常态而非羞辱,以及标准是否得到一致执行。

积极刻板印象的危险

“女孩天生更有同理心”、“亚裔学生擅长数学”、“自闭症患者是出色的模式识别者”以及“读写障碍者很有创造力”听起来可能是在称赞。他们仍然把群体脚本强加给个体。不符合这些描述的人可能被忽视或受到指责,而真正的支持需求则被神话掩盖。描述已经展现出的优势;不要根据身份推断优势。

公平的期望协议

  1. 用可观察的术语明确学习目标
  2. 审查证据,包括不确定性和学习机会。
  3. 提供高要求的支持:示范、提示、练习、反馈和充足的时间。
  4. 不要重复最初的标签,收集新的表现证据
  5. 当证据发生变化时,更新安置与支持
04

成长型信念:有用的许可,不充分的干预

希望可以让学习者继续投入任务。只有学习条件和有效行动才能培养能力。

成长取向认为,当前表现并非最终上限,能力可以通过学习、策略、反馈和支持而改变。这比对陷入困境的学习者说“你要么有这个能力,要么没有”更准确,也更人性化。然而,对成长的信念本身并不等于成长。关于成长型思维干预的荟萃分析发现,其平均效果较小且存在异质性;一些更严格的分析在考虑偏差和研究质量后发现,对学业成就几乎没有令人信服的影响。

一项大规模预注册的美国试验发现,九年级成绩较低的学生成绩小幅提高,整体上选修高等数学的学生也有所增加。效果在一定程度上取决于学校环境:同伴是否支持学业挑战。这一条件性结果恰恰说明了重点:当课程、教学、规范和下一步机会使进步成为可能时,同一条信息会产生不同的效果。

信念

进步是可能的

学习者将困难视为信息,并愿意继续尝试具有挑战性的下一步。

方法

下一步行动是有效的

教学、提取练习、反馈、纠正、刻意练习和帮助,都应针对实际障碍进行匹配。

条件

环境允许学习

时间、安全、健康、材料、语言支持、残障支持以及切实可行的进步路径,支撑着这项工作。

准确地赞扬过程

空泛地赞扬努力——“你很努力,所以这很棒”——可能会造成误导。有用的反馈会说明哪里有了改进,以及下一步是什么:“你的图示揭示了缺失的关系;现在用第二个案例检验它。”努力很重要,但前提是它有明确方向、以信息为依据并不断调整。坚持使用无效策略并不是美德;监控并改变策略是有效自我调节的一部分。

这样说

“这个得分评估的是已界定的能力;它不是不可逾越的上限。”

如果结果表明需要培养的是某项学业技能,就应使用适当的学业成就测量来教授并重新评估该技能。解读认知得分变化时,应考虑信度、标准误、练习效应、均值回归、持续性,以及是否迁移到受训任务之外。

避免这样说

“只要相信得足够坚定,任何人都能取得任何成就。”

这种承诺忽视了差异、偶然性、健康状况、时间和结构性障碍,并把机构的失败转化为个人的责任。

庆祝证据,而不是神话

学习者阅读更流畅、能在头脑中记住更多信息、能推理解决更难的问题、学会第二语言,或在排除预期的测量和练习效应后仍表现出可靠的认知得分提升,这些都表明取得了有意义的进步。明确说出这项提升。保留记录。开启下一个挑战等级。真正严肃的成长文化既不否认局限,也不崇拜局限。

05

认知基础设施:健康、安全与保护

大脑无法脱离维持它的身体和环境而独立学习。

学校教育处于公共卫生影响链的下游。产前护理、营养、疫苗接种、清洁的空气和水、免受暴力侵害、稳定的住房、视力和听力保健、睡眠、心理健康支持,以及避免接触神经毒性物质,都可能通过不同途径影响健康、出勤、注意力和学习。因暴露因素和环境而异,因果证据的强度和影响大小也各不相同。一个在容忍可预防脑损伤的同时赞美智力的社会,是在赞美结果,却忽视了其基础。

预防有毒物质暴露

铅会损害发育中的大脑

世界卫生组织指出,铅会对儿童大脑发育造成永久性影响,降低智商和注意力,并损害受教育程度。对于儿童而言,目前没有任何已知的血铅浓度可被认为是安全的。预防——确保油漆、土壤、水、产品和工作场所安全——比等待症状出现更具保护作用。

如实说明酒精的影响

合法且常见并不意味着无害

酒精会扰乱记忆、判断力、协调能力和大脑沟通。世界卫生组织表示,任何饮酒模式都不存在无风险的情况;风险通常会随饮酒量和频率增加。在妊娠期间,卫生部门建议不存在已知的安全饮酒量或安全时段,因为胎儿发育中的大脑在整个妊娠期都可能受到影响。

建设健康能力

营养与回应式照护是学习政策

营养食物、积极回应式互动、游戏、语言以及医疗服务,有助于大脑结构发育和入学准备。这些并非可有可无的额外措施。它们帮助建立后续教学能够发挥作用的生物和关系条件。

对所有致醉物质采用同一套证据标准

当一种合法、应纳税或在文化上备受推崇的物质被描述为正常,而谈及其他毒品时却只诉诸恐惧,毒品政策就会被扭曲。酒精是一种精神活性药物,尼古丁、大麻、镇静剂、兴奋剂、阿片类药物以及许多药品也是如此。它们的风险特征会因剂量、效力、使用途径、年龄、频率、混用情况、健康状况和环境而异。诚实的教育应以一致的标准比较证据:急性损害、依赖可能性、过量或中毒、对妊娠和发育的影响、慢性疾病、事故、暴力、心理健康,以及对他人的伤害。

这并不要求声称每种物质的危害都相同,也不意味着每个使用某种物质的人都会经历相同的结果。这要求拒绝“被社会接受,所以安全”和“违法,所以格外危险”这两种错误分类。只有当信息具体、可信,并与替代选择、支持性关系、早期照护以及减少商业压力、避免醉酒的政策相结合时,预防才最有效。

保护不应变成污名

物质使用障碍是受暴露、压力、生物因素和环境影响的健康状况,并不是智力低下或品格不良的证据。准确传达风险、尽早识别并提供易获得的治疗,比羞辱更能有效保护认知。在孕期,任何时候停止接触酒精仍然有益于健康;应当支持人们,而不是让他们因恐惧而不敢接受产前保健。

向左或向右滑动以比较 →

认知保护是共同责任
层级 保护性行动 需要监测的证据 常见失败
公共政策 铅污染治理、清洁的空气和水、产品监管、准确的酒精警示、产前保健、营养和暴力预防 暴露水平、疾病和伤害、发育结果,以及按地区和收入划分的不平等 让家庭独自应对只有监管或基础设施才能消除的危害
机构 安全的建筑、餐食、合理的日程安排、物质使用政策、保密支持、视力和听力服务,以及创伤知情实践 出勤、睡眠和饥饿指标、安全、转介、学习与参与 把健康或获得服务的问题当作懒惰
家庭和个人 寻求可靠信息,减少暴露,保护睡眠,按指示用药,并与合格专业人士讨论疑虑 功能、副作用、学习、情绪和随时间的变化 自责、延误就医,或把营销宣传当作健康建议
06

幼儿期、家庭与社区学习

早期发展影响深远,但这不是一场把孩子培养成微型成年人的竞赛。

幼儿通过有回应的关系、交流、游戏、运动、探索、故事、睡眠,以及与安全环境的反复互动来学习。高质量的幼儿教育项目可以提升入学准备度,并可能带来更长期的教育、健康和经济收益,尤其是对处于不利处境的儿童而言。效果会因质量、强度、年龄、对照条件以及项目结束后的经历而异。短期的认知测试优势有时会逐渐消退,即使其他益处仍然持续。

这就是为什么不应把那些著名的投资回报数字宣传成普遍规律。经常被引用的佩里学前教育项目结果,来自20世纪60年代密歇根州一项针对特定弱势人群的小规模高强度项目;后来的经济分析估计,该项目带来了很高的年度社会回报。这并不意味着任何托育名额或品牌学前班都会自动产生同样的回报。可推广的原则是为质量、关系、丰富语言的互动、健康和连续性提供资金支持——然后评估实际项目。

在家中和照护环境中

回应式互动

跟随儿童的注意力,命名物品和动作,回应手势和问题,共读书籍,唱歌,数数,比较,扮演,搭建,并邀请儿童解释。目标不是持续娱乐,而是形成一个可靠的循环:儿童采取行动,另一个人的心智作出回应。

在早期教育中

有目的的游戏加上专家指导

儿童需要自由探索和有意图的支持。专业熟练的教育工作者会拓展词汇,示范自我调节,发现理解偏差,设计环境,接纳残障学习者,并将游戏与正在发展的读写能力、数学能力和知识联系起来。

对照护者而言

时间、安全感与实际支持

当照护者面临不安全的工作、饥饿、住房不稳定、抑郁或没有托育服务时,建议“多交谈”所能发挥的作用十分有限。收入支持、育儿假、医疗保健、图书馆和友善的社区空间,可能增加可用于学习的时间和能力,但具体效果取决于设计、可及性和情境。

贯穿各个过渡阶段

不要让早期的进步遇上薄弱的学校

当小学教育通过连贯的课程、出勤、适切的语言、书籍、教学和进一步支持建立在这些基础之上时,相关益处更容易持续。一次短期干预无法永久弥补多年不良条件造成的影响。

一个有参考价值的案例——及其局限

在牙买加开展的一项小规模随机研究中,社区卫生工作者连续两年每周探访生长发育迟缓幼儿的母亲,指导她们进行回应式游戏和互动。成年早期的随访发现,接受刺激干预的参与者收入更高。这一结果格外重要,因为它将早期关系干预与长期功能表现联系起来。但这仍然只是针对特定人群的一项小型研究,且随访期间存在样本流失;不能据此保证每个入户探访项目都能获得某个固定百分比的回报。

高质量早期教育体系所呈现的内容

  • 温暖且及时回应的成人—儿童互动,而不是被动看管
  • 丰富的口语和手语环境、书籍、音乐、运动、物品以及户外探索
  • 及早发现听力、视力、营养、发育和安全方面的需求
  • 规模足够小的班组、专业熟练的工作人员、稳定的关系以及持续的指导
  • 尊重家庭语言和文化,同时不限制儿童接触更广泛的知识
  • 互动质量、参与度和发展状况的衡量——而不只是入学率
07

面向知识、推理与迁移的教学

当每位学习者都能获得一条精心设计、通往高难度知识的路径时,追求高水平的智识目标才会变得公平。

推理并不是知识的对立面。相关且组织良好的知识可以通过支持组块化、模式识别和类比,降低相关任务对工作记忆的要求;但它不会提高领域一般性的工作记忆容量。知识也为批判性思维提供了准确的思考材料。创造力同样依赖于材料:词汇、示例、技巧、概念和持续练习。如果课程只向处境不利的学习者提供一般性的“技能”,而其他人则不断积累历史、科学、文学和数学知识,那么它可能扩大自己声称要解决的那道鸿沟。

良好的教学会让专家的思维过程变得可见,安排思想的顺序,检查理解情况,并逐步移交责任。它会运用正例与反例、指导性练习、提取练习、间隔学习、累积复习、反馈和应用。它也会作出回应:当证据表明学习者缺少先决知识时,教师会补充这些知识,而不会永久降低学习目标。

能力培养型学习循环 随着支持被有意逐步减少,知识变得更容易提取,学习者也会更加独立。
  1. 01 建立联系 激活相关的先备知识,并明确补充缺失的内容。
  2. 02 解释与示范 展示概念、策略、决策点和解题示例。
  3. 03 带反馈的练习 在错误仍可纠正时提供提示并进行纠正。
  4. 04 提取与变式 间隔一段时间后再次练习,并更换示例,使知识变得灵活可用。
  5. 05 应用与验证 解决真实问题,解释推理过程,并检验学习是否能够迁移。

干预证据所支持的做法

2024 年一项对 89 项随机辅导实验进行的荟萃分析估计,平均学业成效约为 0.29 个标准差。在较低年级、校内频繁开展辅导,以及由教师或助教进行辅导时,效果往往更强,但实施方式和具体情境也很重要。一项关于教师指导的因果荟萃分析发现,教学质量平均有所提升,学生学业成绩也有幅度较小但有意义的改善;在规模更大的效果试验中,这些效果有所减弱。这些发现并不是让人盲目照搬某一套方案的理由,而是支持持续发挥人的专业能力,重视反馈与练习。

对于低收入和中等收入环境,全球教育证据咨询小组将结构化教学——包括相互衔接的教学计划、学生材料和持续的教师支持——以及按照学习者的实际水平进行教学,列为尤其具有成本效益的做法。“在学习者的水平上”并不意味着让学习者停留在那里,而是意味着诊断起点、教授缺失的步骤,并加速迈向共同课程。

高支持+高要求

富有成效的融合

清晰的讲解、易于使用的材料、指导性练习和频繁检查,能让更多学习者参与具有挑战性的内容,并逐渐实现独立学习。

伪装成关爱的低要求

永久性的简化会变成另一道天花板

无休止的练习单、没有纠正的表扬,以及剥离知识的课程,可能让成年人免于不适,却剥夺学习者的智力成长。

多样化教学有用;固定的“学习风格匹配”没有用

当空间关系很重要时使用图示,当发音很重要时使用声音,当运动序列很重要时使用动作,当精确语言很重要时使用文字。多种表征方式可以改善学习机会和理解。没有依据的做法,是把某人贴上永久的“视觉型”“听觉型”或“动觉型”学习者标签,并据此限制教学。应根据内容和障碍匹配表征方式,而不是依据人格测试。

08

发现而非扭曲的评估

一项测试可能是评估某种推断的优秀工具,却可能不适合评估另一种推断。

选择并不是“测试人”还是““看见完整的人”。任何单一评估都无法涵盖一个人的全部面貌。负责任的做法是为明确的决策收集最有力的证据,理解误差和局限,并避免声称证据无法支持的结论。经过充分验证的认知评估可以为特定能力和支持需求提供有用证据,同时明确说明测量不确定性和背景因素。学业成就测试可以显示学习者学会了什么。工作样本可以展示实际应用能力。访谈可以补充个人经历和目标。每种方法也可能存在偏见、噪声或被误用。

效度属于某种解释及其用途

“这是一个有效的测试”这一说法并不完整。对于哪种分数含义、哪一人群、哪种语言、哪个年龄、何种状况和哪项决策而言有效?支持低风险教学筛查的证据,并不会自动支持永久性分流、诊断、排除就业或比较各国群体均值。

《教育与心理测验标准》联合标准将公平视为效度的基础。公平的评估旨在消除与目标构念无关的障碍,提供适当的参与条件,记录实施过程,并评估分数解释是否如预期般适用于相关群体。群体之间的平均差异本身并不能证明存在偏差;均值相等也不能证明公平。研究者必须考察内容、反应过程、因素结构、题目功能、精确度、预测力和后果。

向左或向右滑动以比较 →

让证据与决策相匹配
决策 核心证据 重要背景 保障
规划教学 简短的先备条件与学业成就检查、错误模式和观察 课程接触、出勤、语言和既往教学 用结果来教学并再次检查,而不是据此固化标签
了解认知特征 个体适切且标准化的认知评估,并说明不确定性 年龄、常模、健康状况、睡眠、焦虑、药物或其他物质,以及感官和运动通达性 由合格人员实施和解释;综合考虑个人经历与适应功能
识别专业能力 真实工作样本、作品集、结构化观察和知识评估 工具、培训、文化环境和练习机会 标准透明;在可能的情况下安排多名评分者,并提供申诉途径
为稀缺机会进行选拔 多个与工作或课程相关且具有增量效度的指标 群体获得机会、准备情况、便利措施以及录取率后果 审查各亚组的错误和后续表现;重新审视那些没有增加有用预测力的规则
认可既往学习经历 将证据对应到明确的职业或学业标准 非正式工作、迁移、文件遗失和当地实践 合格的评估人员、质量保证、可移植的记录,以及雇主或机构的认可

翻译不等于适配

跨语言评估需要分析构念本身是否具有可比性,进行具备文化和语言专业性的适配、实证检验,以及适当的实施和记录。直译可能改变难度、熟悉度或含义。非言语任务可以降低语言要求,但并非不受文化影响。受教育程度、图表接触经验、视觉惯例、对测试的熟悉程度以及群体所属队列,都会影响非言语矩阵任务的表现。

跨群体可比性实际上需要什么

研究人员经常检验测量等值性:构型等值性询问因素模式是否相似;度量等值性询问因子载荷是否具有可比性;标量等值性询问截距或阈值是否具有足够的可比性,以支持潜在均值比较。2023 年的一项系统综述发现,认知因素模型往往可以跨文化推广,但方法、报告方式和覆盖范围各不相同,许多研究也没有检验所有必要层级。等值性很重要,但单凭它并不足够。常模、信度、语言、可及性、预测能力和现实世界中的后果仍然需要考虑。

便利措施

消除无关障碍

对于低视力受测者,在推理测验中使用大字体可能会改善可及性,而不改变推理构念。良好的便利措施不会“抬高智力”;它们减少了另一种限制所造成的污染。

修改

改变任务所测量的内容

在旨在测量独立解码能力的测验中朗读文章,会改变测验所测量的构念。结果仍可能有用,但需要不同的解释和支持性证据。

增加证据——不要用直觉取代严谨性

动态评估考察学习者如何回应提示、反馈或简短教学。作品集和本地情境中的表现可以揭示静态测验所遗漏的发展情况和实践专长。它们是有用的补充,但并不会自动成为客观或无偏见的替代方案。对于预期推断,提示必须达到足够的标准化程度;作品集反映学习机会和评分者判断;社区评价可能包含地位偏见。每种方法都必须通过证据赢得信任。

十一点公平性检查

  1. 界定所测构念、决策和风险程度。
  2. 使用与年龄和目标人群相关的现行常模。
  3. 评估语言能力;不要临时自行翻译。
  4. 审查受教育经历、迁移经历、测验接触情况和学习机会。
  5. 考虑健康状况、睡眠、疼痛、焦虑、药物、物质使用和急性痛苦。
  6. 消除与所测构念无关的感官、运动和数字访问障碍。
  7. 说明并记录便利措施或修改的理由。
  8. 在需要时使用经过培训的考官和口译员。
  9. 报告置信区间、测量误差和局限性。
  10. 用其他相关证据和申诉途径,对高风险决策进行三角验证。
  11. 随着时间推移,审查各亚组的题目表现、预测、误差及后果。
09

语言、迁移与多语种访问

学习者无法通过一种尚未获得公平机会去理解的语言来展示知识。

语言既是一项强大的认知成就,也是通往大多数正规学习的入口。它承载着概念、指令、问题、关系和身份。当教学语言陌生时,孩子可能同时学习学科内容和教学媒介。学习表现可能低估其学科知识,而薄弱的语言支持则可能减缓对日后推理所需词汇的习得。

根据联合国教科文组织广为引用的一项估计,全球约40%的人无法以自己能够流利说和理解的语言接受教育;在一些低收入和中等收入地区,这一比例要高得多。这是一项估计,而非实时普查,但这一障碍规模巨大。联合国教科文组织2025年的政策工作支持持续开展母语教学——通常持续六至八年——同时逐步加入另一种语言。实施需要受过培训的多语言教师、合适的教材、统一认可的术语和社区参与。没有这些资源就宣布语言政策,可能会造成纸面上的双语承诺与课堂上的混乱。

获取

通过理解进行教学

使用学习者理解的语言来构建概念、读写能力和课堂参与,尤其是在基础教育阶段。

拓展

有意识地增加语言

第二语言和其他新增语言的熟练程度能够扩大获取机会。它通过系统学习词汇、理解、口语、阅读和写作逐步发展,而不是通过突然替换语言来实现。

评估

将语言与目标技能分开

如果决策涉及数学或空间推理,应避免不必要的语言复杂性。如果涉及学术语言,就应直接测量语言能力,并将其解读为后天习得的熟练程度。

迁移带来的是不连续,而不是智力减退

难民和其他移民可能经历过中断的学业、陌生的课程体系、创伤、记录缺失、未获认可的学历,或在一种新机构无法评估的语言中拥有丰富知识。2025年,联合国难民署估计,1240万名学龄难民中有46%失学。入学只是第一步:法律身份、费用、语言、分班、学历认可、安全和持续性,决定了获得机会能否转化为学习。

联合国教科文组织《学历护照》为学业记录不完整或缺失的难民和弱势移民提供结构化评估和标准化文件。它概述可能具备的学历、工作经历和语言能力,以支持进一步评估。它不是区块链证书,不会自动带来正式认可,也不能替代人的判断。它的价值来自专家评估、透明记录以及各机构的认可。

多语言获取计划

  • 绘制学习者理解、说、手语交流、读和写的语言图谱;这些能力可能各不相同。
  • 在高风险评估之前提供指导、关键词汇、术语表和示例解题。
  • 提供经过培训的口译员以及经过调整和审核的翻译材料。
  • 允许使用家庭语言支持概念学习,同时明确发展更广泛参与所需的语言能力。
  • 分别评估学科知识学习和语言习得的进展,而不是将二者混为一谈。
  • 认可可信的既有学习成果,并在课程不一致的地方开设衔接课程。
10

残障、神经多样性与可及的挑战

差异、优势、功能受损和支持需求可以同时存在于同一个人身上。

神经多样性承认人类神经系统的差异,并反对不必要的污名化。它并不要求否认残障、痛苦或功能受损。自闭症、注意缺陷多动障碍、阅读障碍、智力障碍、发育性语言障碍及其他状况都具有异质性。诊断并不能揭示一套标准的天赋特征,也不会排除出现非凡优势的可能性。关键在于理解个人的功能状况、目标、环境和偏好。

联合国儿童基金会对42个国家进行的协调分析估计,近2.4亿名儿童生活在残障状态中。与无残障同龄人相比,他们一生未曾入学的可能性高出49%,掌握基础读写和算术技能的可能性低42%。这些是相对可能性,而不是百分点差距;不同功能障碍和情境下的经历也存在显著差异。这些数据描述的是排斥和结果,而不是较低的人类价值,也不是某种不可改变的单一能力水平。

无障碍不等于更容易

根据任务不同,字幕、屏幕阅读器兼容性、手语支持、触觉图示、可预测的结构、活动休息、替代性输入、额外时间或安静房间,都可能消除无关障碍。某项便利措施是否保留了预期测量构念,必须针对相应的评估或活动进行判断;例如,当速度属于测量内容的一部分时,额外时间可能会改变结果的解释。

通用设计加个别化支持

CAST 的通用学习设计指南鼓励采用多种参与、表征以及行动或表达方式。其目标是预先考虑学习者的差异,并从一开始就减少本可避免的障碍。该框架前景良好且具有实践性,但其研究基础在方法论上并不均衡,也不能替代个别化便利措施、专业教学、辅助技术、治疗、沟通支持或合适的安置。

融合教育是一项权利,也是系统义务,而不仅仅是安排在某个教室里。坎贝尔协作网对15项经合组织国家的非随机研究进行的综述发现,与隔离安置相比,普通教育安置在平均学业或心理社会结果上没有一致的优势或劣势;估计结果差异很大,且证据的方法学质量较弱。融合教育能否成功,取决于无障碍的建筑和材料、受过培训的教职员工、个性化教学、同伴支持、安全、沟通、家庭和学生的声音,以及足以让参与真正实现的资源。

向左或向右滑动以比较 →

从基于标签的假设转向针对个人的支持
避免想当然 询问或评估 可能的支持措施 持续测量
“自闭症意味着擅长模式识别” 实际认知特征、兴趣、沟通方式、感官获取和支持需求 明确期望、感官调整、直接沟通、与工作相关的工作样本 表现、压力、保持情况、自主性以及当事人自己的评价
“多动症意味着有创造力但粗心” 注意力所受的情境影响、执行要求、动机、睡眠、共存状况和个人创造力 将任务分成小块、设置提醒、减少干扰、安排活动、在本人选择且适当时接受治疗 学习、任务完成、副作用、福祉和迁移运用
“阅读障碍意味着视觉天赋” 解码、流利度、拼写、口语能力、理解力和已展现的空间能力 结构化读写教学、文本转语音、无障碍格式,以及在有理由时提供额外时间 阅读进步、课程获取、独立性和实际领域优势
“智力障碍设定了上限” 认知和适应性功能、沟通、学习反应、健康状况、日常环境和偏好 明确教学、无障碍沟通、重复练习、支持性决策和真实的社区参与 新技能、适应性独立、生活质量、选择权以及不断变化的支持需求

就业应当发掘技能,而不是奖励符合面试规范的表现

通过工作样本招聘、结构化面试、清晰的任务描述、无障碍招聘和合理调整,可以发现那些因快速社交表现或模糊惯例而被排除的人才。企业神经多样性项目提供了有用的设计范例,但轶事不能证明自闭症员工整体上都具有更高的生产力。一项对工作场所中所谓“自闭症优势”的系统综述发现,符合条件的研究寥寥无几。应以个体证据取代负面和恭维式的刻板印象。

从功能和当事人的表达出发进行设计

  • 询问当事人如何定义自己,以及他们偏好使用哪种语言。
  • 描述观察到的优势和障碍,而不是根据诊断推断这些情况。
  • 在检验哪些教学和支持真正有效的同时,预设学习的可能性。
  • 默认提供易于使用的核心材料,并及时提供个性化调整。
  • 让残障人士和神经多样性人士参与设计、评估和治理。
  • 应衡量参与、学习、自主性和福祉,而不仅仅是身体在场。
11

贫困、学校经费、地理位置和中断

机会差异可能转化为表现差异,但这并不能成为群体具有先天能力差异的证据。

入学不只是拥有一个座位。它还意味着安全且稳定地到校、能够理解的教学、受过培训的教育工作者、适当的挑战、书籍和学习材料、营养、时间、无障碍设施,以及在需要时提供电力、网络连接和辅助技术。没有学习的入学并不算成功;没有可及性的学习政策则会让数百万人无法被纳入测量。

2.73亿 据估计,2024年处于小学至高中年龄段的失学儿童和青少年 联合国教科文组织当前的模型估计,发布于2026年
70% 据估计,低收入和中等收入国家10岁儿童中无法阅读并理解简单文本的比例 联合开展的2022年“学习贫困”模拟——并非对2026年的实时观测
93分 PISA 2022数学测试中,各国内部社会经济地位最高与最低四分位学生之间的平均分差距 横截面相关性,而非先天或纯粹因果差异
970亿美元 低收入和中低收入国家为实现本国可持续发展目标4所需年度融资缺口的估计值 联合国教科文组织模型;各地需求和财政状况不同
9300万 危机影响地区完全失学的学龄儿童和青少年 “教育不能等待”组织2026年估计;危机包括冲突、气候变化和流离失所

联合国教科文组织最新模型估计,2024年有2.73亿儿童和青少年失学:小学年龄段7900万、初中年龄段6400万、高中年龄段1.3亿。该估计综合了行政数据、调查数据和人口数据,并非人口普查。修订后的人口统计和建模输入数据解释了早期公布总数的大部分增幅,因此不应将这一变化误报为一年内的骤然崩溃。冲突也可能使受影响儿童更难被统计。

按时完成学业,2024年 全球和低收入国家的平均值。这些是由体系塑造的人群结果,而不是对先天智力的排名。
全球 · 小学

88%
全球 · 初中

78%
全球 · 高中

61%
低收入 · 小学

60%
低收入 · 初中

37%
低收入 · 高中

20%

机会梯度也会出现在富裕的教育体系中

在 PISA 2022 中,经合组织国家的社会经济弱势学生无法达到基础数学能力水平的可能性,是优势学生的七倍。然而,约 10% 的弱势学生在本国数学成绩中位列前四分之一。第一个结果显示出强大的社会梯度;第二个结果说明这并非命中注定。PISA 是一项观察性研究,无法确定单一原因。社会经济指标综合了父母的教育程度、职业和家庭资源,而这些因素都与多种作用机制相关。

性别模式同样不能用简单的文化叙事解释。联合国教科文组织 2024 年的估计显示,全球失学男孩多于女孩,但完成学业方面的劣势会因国家收入水平和教育阶段而反转。在低收入国家,每 100 名完成高中阶段教育的年轻男性对应 79 名年轻女性;在高收入国家,每 100 名男性对应 106 名女性。政策应诊断实际地点中的实际障碍——费用、早婚、安全、照护工作、劳动力市场压力、疏离感或特定学科的期望——而不是把某个全球平均值视为普遍规律。

资金很重要——而实施决定了资金能买来什么

联合国教科文组织报告显示,融资差距巨大:高收入国家每名学习者每年公共支出超过 8,500 美元,而低收入国家约为 55 美元。2024 年,低收入国家小学中只有 52% 配备饮用水,40% 配备洗手设施,28% 配备电力。这些数字描述的是条件,而不是任何特定预算项目的因果回报。

因果证据确实表明,资源可以改善结果。一项关于 31 项美国准实验研究的 2024 年元分析估计,若每名学生每年增加 1,000 美元并持续四年,考试成绩平均提高约 0.032 个标准差,升入大学的比例提高 2.8 个百分点。效果存在差异,且这些估计仅适用于美国。结论既不是“钱能解决一切”,也不是“钱无关紧要”,而是:投入足够资源,将其用于有效的人员和条件,可靠地执行预算,并评估真正到达学习者手中的资源。

2024 年低收入国家小学的基本设施 报告配备各项设施的学校占比。没有相应基础设施,学校系统就无法实现数字化,也无法围绕基础设施保障学习。
饮用水

52%
洗手设施

40%
电力

28%

普惠基础加上有针对性的支持强度

每位学习者都需要安全的设施、专业的教学和连贯的课程。有些学习者还需要更多支持:交通、现金援助、膳食、辅导、辅助技术、语言衔接、小班教学、心理咨询或加速补习。公平并不意味着投入完全相同,而是意味着共同的高期望,加上与障碍程度相称的额外支持。

12

技术、开放资源与人工智能

技术可以拓展优秀教学、可及性和练习机会,也可能扩大薄弱内容、监控和不平等。

设备并不等于教育。对于许多数字化机会而言,联网和可用的硬件是必要条件,但学习还需要电力、无障碍内容、语言支持、教师能力、时间、数字技能、维护以及合理的教学目的。联合国教科文组织2023年技术报告发现,稳健且独立的证据往往滞后于技术采用,而且许多评估由供应商完成。采购应从学习问题出发,而不是从产品演示开始。

2025年,联合国教科文组织报告称,全球只有40%的小学、50%的初中和65%的高中能够接入互联网。学校已联网,仍可能面临设备不足、数据费用难以负担、平台不可访问或缺乏受过培训的支持人员等问题。此前联合国儿童基金会与国际电信联盟对家庭情况的估计——13亿学龄儿童在家中无法上网——基于2020年可获得的数据,应被视为历史基准,而不是当前人数统计。

第一 · 可及性

学习者真的能使用它吗?

检查电力供应、设备共享、数据成本、离线功能、无障碍性、语言、隐私、登录负担、技术支持和安全的学习空间。

第二 · 教学法

将发生哪些认知活动?

明确知识、实践、反馈和教师行动。衡量不依赖工具仍能保持的学习效果,而不是点击次数、完成情况或经过辅助后看似精致的成果。

第三 · 治理

谁控制数据和决策?

要求实行数据最小化、安全保障、适龄设计、分组测试、人工干预、申诉机制、透明度、可移植性和退出计划。

开放教育资源:可及性是首要成果

开放许可材料可以降低成本、提供即时获取,并允许合法翻译、改编和再利用。一项针对高等教育的大型元分析发现,在开放教材与商业教材之间,平均学习表现基本没有差异;在纳入的研究中,使用开放教材的退课可能性更低。相关证据大多来自观察性研究。这并不意味着失败。如果能够以更低成本和更广泛的可及性实现相当的学习效果,学习者就能从中受益。质量审核、无障碍性、本地语言和教学方式,仍然决定开放资源是否有用。

人工智能应当增强思考,而不是取代思考

生成式和自适应系统可以翻译、生成练习、提供快速反馈、支持无障碍访问,并帮助教师检查模式。它们也可能产生幻觉、再现偏见、泄露个人数据、助长依赖、模糊作者身份,并以不平等的错误率作出高风险决策。联合国教科文组织建议保护隐私、采用适龄使用方式、开展伦理验证,并采取以人为本的方法。经合组织《2026 年数字教育展望》同样警告,生成式人工智能不应取代认知投入或人际关系。

一项在印度城市地区对一项混合式自适应学习项目进行的随机抽签评估发现,经过约 4.5 个月后,数学成绩提高约 0.37 个标准差,印地语成绩提高约 0.23 个标准差。该项目将软件与小组教学相结合;这一结果不能推广到作为一个类别的“人工智能”。可迁移的经验是:诊断学习者的水平,提供针对性练习,并将技术与人工教学相结合——然后开展独立对照。

向左或向右滑动以比较 →

采用教育技术或人工智能前需要提出的问题
测试 询问 最低证据 停止信号
学习 不借助工具的知识或技能是否得到提升并保持? 预先确定的学习成果、积极对照、延迟测量与迁移任务 只报告参与度、平台使用时长或人工智能辅助生成的成果
公平性 谁无法获取或受益? 按相关语言、残障、收入、年龄和先前学业水平群体划分的结果 平均收益掩盖了更大的群体误差或排斥
隐私 收集、推断、保留和共享了哪些数据? 数据图谱、数据最小化、保留期限、安全控制与删除途径 获取学习机会需要不必要的生物识别、行为或商业追踪
自主权 教师或学习者能否理解、推翻决定并提出申诉? 人工审核、解释、纠正与替代路径 自动化分班或纪律处分变成最终决定
可持续性 机构能否维护并退出该系统? 总成本、培训、支持、可导出记录、互操作性与退出条款 供应商锁定或基础设施会消耗原本用于教师和核心教材的资金
首先为教学关系提供资金

没有内容、支持或教学法的硬件通常是一项低效投资。只有当技术能够比其他方案更有效、公平且可持续地解决已证实的获取或学习问题,并且人们仍能独立思考、教学和决策而不将控制权交给工具时,技术才应获得优先考虑。

13

哪些值得投资,以及哪些需要谨慎

资助能够构建或释放学习能力的机制,并区分机会获得方面的效果与学业成绩方面的效果。

应根据每项干预措施带来的学习、机会和福祉效果进行评估。项目应明确说明所针对的障碍、作用机制、覆盖人群、比较对象、结果、时间范围以及实施所需资源。入学、出勤、学业成绩、认知发展、健康和就业是不同的结果。政策可能改善其中一项,但不会自动改善其他项。

  1. 连贯的教学与课程 直接构建学习能力
  2. 通过实践、反馈和持续跟进促进教师发展 提升实施能力
  3. 高强度辅导和加速补学 针对未完成的学习
  4. 高质量幼儿早期发展 夯实基础
  5. 健康、营养、安全和认知保护 消除生理障碍
  6. 公平的财政支持、语言服务和残障支持 让参与真正成为可能
  7. 书籍、开放资源、网络连接和经过评估的技术 扩大获得学习和练习的机会
  8. 成人学习以及对先前学习经历的可信认证 重新开启机会

这些领域并未排序;地方障碍、边际成本、实施能力和公平性决定优先顺序。缺乏安全饮用水的社区,可能需要先建设基础设施,教学创新才能发挥作用。读写障碍学习者可能需要立即获得辅助技术。难民可能需要先获得合法入学资格和语言支持,然后才能接受辅导。证据应为地方诊断提供依据,而不是抹去地方实际情况。

向左或向右滑动以比较 →

对选定干预措施可以且不可以期待什么
干预措施 证据最充分的贡献 重要限制 实施信号
结构化教学法 使教案、学生材料、评估和持续的教师支持保持一致;在若干低收入地区具有较强的成本效益证据 没有培训、材料、调整或反馈的教学脚本,可能沦为合规执行,而非真正教学 教师理解该模式、材料按时到达,并且学习者表现发生变化
针对性辅导 在随机开展的学前至高中现场实验中,平均成绩提升显著,尤其是在频繁开展且与课程衔接的辅导中 效果和成本各不相同;人员配置、出勤、排课和规模化可能削弱实施 定期参与、导师质量、内容匹配以及延迟测量学习成果
教师辅导 如果辅导持续且以实践为重点,就能改善教学和学生学业表现 在一些规模较大的效果试验中,平均效果会减弱;一次性讲习班很少能复制密集辅导的效果 观察到的教学变化,以及培训后仍能持续的支持
幼儿早期项目 可以改善入学准备,并带来更长期的益处,尤其是在高质量的针对性项目中 效果各不相同;初期分数提升可能会消退,广受称道的回报具有项目特异性 回应性互动、熟练且稳定的工作人员、家庭支持以及向学校阶段的连续性
学校财政 具有可信因果性的美国证据发现,考试成绩和升入大学的平均效果为正 效果幅度取决于具体情境;资金必须用于有效投入,并得到良好执行 透明的分配、实际支出、人员配置和服务改善
现金转移支付 有条件和无条件的转移支付都可以通过减轻家庭约束来提高入学率和出勤率 学习成效更小且确定性更低;在薄弱学校获得一个学位并不能保证掌握知识 覆盖范围、支付可靠性、出勤和分开测量的学习成效
学校供餐 可以支持营养并略微提高入学率;2025年 Cochrane 综述发现数学成绩平均有小幅提升 关于出勤和阅读的证据有限,或显示平均效果很小;食物质量和配送方式很重要 覆盖范围、支付可靠性、出勤、健康和学科专项学习
书籍和图书馆 减少材料匮乏并创造反复阅读的机会;一项为期五年的随机家庭用书项目发现其对阅读有小幅正面影响 仅有建筑物或书箱并不能创造阅读;语言、相关性、教学和使用方式都很重要 易获取且相关的库存、流通、阅读时间、指导和理解
自适应或人工智能支持的学习 一些经过评估的混合式项目通过诊断、练习和反馈改善了目标学习 结果不能推广到所有软件;隐私、偏见、依赖、可及性和供应商证据都是严重问题 独立比较、分组结果、无辅助迁移和教师监督
全纳教育 消除歧视性排斥,并能够促进共同学习和参与 仅仅安置并不是干预;结果取决于个性化程度、工作人员、可及性和资源 参与、学习、归属感、自主性和支持质量
既有学习成果认证 让以非正式方式获得并经展示证明的能力对雇主和教育机构变得清晰可见 徽章的可信度取决于其标准、评估、质量保障和认可程度 透明的证据、合格的评估人员、可迁移性和真正的认可

案例研究应揭示作用机制,而不是制造国家级神话

肯尼亚 · 结构化读写与计算能力

教师指南、辅导和学生用书协同发挥作用

小学数学与阅读倡议的随机化组成部分在阅读和计算能力结果上带来了提升。后来全国范围的 Tusome 结果幅度较大,但在中期评估时缺乏反事实,因此不应被描述为完全具有因果性。其启示在于协调一致的实施体系,而不是宣称某一种工具单独改变了一个国家的教育体系。

尼日尔 · 成人学习

课后进行基础手机的延伸练习

在 113 个农村村庄中,在标准成人读写和计算课程的基础上增加基本手机练习,最初使成绩提高约 0.19–0.26 个标准差。两年后续研究显示,阅读水平仍然较高,而平均数学成绩已不再存在差异;效果因年龄和性别而异。低成本技术强化了教学,但没有取代课堂。

孟加拉国 · 既往学习

评估与认证使技能变得可见

一项关于获得既往学习成果认可评估机会的随机评估发现,在意向性治疗模型中,就业率大约提高了 7–8 个百分点。这一有希望的结果来自一个短期随访环境;只有当标准和证书受到信任时,认可机制才会奏效。

牙买加 · 早期刺激

回应性照护的影响延续至成年

一项针对生长迟缓幼儿的小规模随机家庭访视项目改善了其成年后的收入。它的重要性在于一个可信的发展机制和长期随访,而不是假装某个百分比能在任何地方重现。

不要扩大宣传标题;要扩大有支持的作用机制

项目在扩展时往往会削弱,因为培训、监督、材料、实施剂量或参与者匹配发生了变化。在全国推广之前,应检验核心组成部分能否在日常条件下保持有效,收益能否惠及被排除群体,成本是否会挤出更好的方案,以及地方机构能否维持质量。

14

机构与社区的实用框架

将“我们重视每一个心智”从一句口号变成一个以证据、责任和修订为基础的运行系统。

核心治理问题不是一项政策听起来是否具有包容性,而是是否有更多人获得知识、认知能力、掌握技能的能力、独立性以及获得有价值机会的机会——以及可预防的伤害是否减少。这需要建立一条从家庭和课堂延伸至雇主、市政府和国家政府的责任链。

家庭与学习者

建立常规并要求精确证据

保障睡眠和健康,坚持阅读和交流,练习提取,寻求反馈,记录成长,并思考一项分数衡量的是什么。当教学、语言或获取条件发生变化时,要求重新评估。

学校和培训机构

高标准教学并消除无关障碍

确保课程连贯,及早识别需求,提供辅导、无障碍材料、语言支持、有效评估,并依据更新后的证据推进学习进程。

雇主和资质认证机构

以实际工作能力为选拔依据,并保持发展机会开放

使用与工作相关的工作样本和结构化方法,认可可信的既往学习成果,提供便利措施,培训人员,并审核选拔和晋升结果。

政府和资助方

保护基础并为交付提供资金

为健康、营养、安全设施、教师、材料、残障和语言无障碍提供资金;如实监管神经毒性物质和致醉性物质暴露;公布分组结果,并支持独立评估。

五阶段运行周期

01 · 定义

明确能力和目的

明确应改善什么、为谁改善、何时改善以及为何重要。“潜能”和“包容”只有转化为实际功能和机会后,才是可衡量的。

02 · 诊断

找出断裂环节

绘制健康、获取、出勤、教学、语言、残障、材料、评估和进阶情况。询问受影响的人,了解系统在哪些环节失效。

03 · 交付

为机制配置资源

配备受过培训的人员、时间、材料、监督、预算和权限。没有执行能力的政策无法产生预期结果。

04 · 评估

衡量覆盖范围、学习效果和后果

在可行时采用可信的比较,检查各子群体的结果,记录成本,并检验持续性和迁移,而不仅仅是满意度。

05 · 改进

纠正、扩大规模或停止

保留核心机制,根据情境进行调整,修复不平等的获取机会,并停止机会成本超过收益的项目。

始终 · 倾听

纳入受影响的人

学习者、家庭、教师、残障人士、少数语言社群和一线工作人员能够发现汇总仪表板遗漏的失效模式。

向左或向右滑动以比较 →

一个不会把获取与学习混为一谈的仪表板
领域 示例指标 按以下维度分解 要回答的问题
保护 营养、铅和污染暴露、暴力、安全妊娠信息、睡眠和心理健康 年龄、居住地、收入、残障和相关暴露群体 可预防的生物学障碍是否在减少?
获取 入学、出勤、交通、语言、无障碍、书籍、设备和电力 收入、城乡属性、性别、残障、语言、迁移和危机状况 谁能够进入并可靠地参与?
教学 课程覆盖、教学质量、练习、反馈、辅导剂量和教师支持 学校、课程、教师、既往学业成就和支持状况 预期的学习过程是否发生?
学习 知识、读写能力、计算能力、推理能力、认知测量、作品集和延迟迁移 起点、学习机会和所有相关的可及性群体 哪些能力发生了变化,变化幅度多大,持续了多久?
体验 安全感、归属感、自主性、挑战、便利措施,以及学习者或家庭的意见 相同的群体,包括在样本量允许时的交叉群体组合 人们是否以有尊严的方式参与,并拥有有意义的选择?
进展 完成情况、高级学习、资格证书、学徒培训、就业、独立生活和公民参与 先前机会、项目、地区和人口群体 学习是否开启了下一个有价值的机会?

从能够暴露隐性排斥的决策入手

第一年的实践议程

  1. 90天内:梳理哪些人缺席、被安排在低于其能力的位置、被排除在高级学习之外、正在等待便利措施,或无法使用教学语言和材料。
  2. 一个学期内:确保扎实的核心课程、可执行的反馈、无障碍材料,以及针对未完成学习的快速支持途径。
  3. 六个月内:审查每项高风险考试、筛查规则和算法,评估其构念相关性、可及性、不同群体的错误率和申诉渠道。
  4. 一年内:公布覆盖范围、干预剂量、学习、成本和进展结果;确定哪些群体未从中受益以及原因。
  5. 扩大规模前:在常规人员配置和预算下测试实施,保留产生效益的机制,并停止薄弱或有害的组成部分。

社区参与是证据基础设施

参与并不意味着要求人们批准一份已经完成的计划。这意味着让他们参与界定结果、识别障碍、调整语言和实施方式、解读意外结果,以及治理后果。亲身经历本身无法证明因果有效性;但它可以揭示干预是否确如描述那样实施,以及远程评估者未能衡量哪些伤害。

15

迷思、承诺与持久的结论

一个人道的社会不会在卓越与包容之间二选一。它通过包容、证据和发展来成就卓越。

“能力是固定的”与“每种差异都是虚构的”之间的争论是虚假的二选一。证据支持一种更有用的立场。认知能力存在差异,彼此相关,并能预测有意义的结果。它们也会发展,会对教育作出反应,并通过健康状况、知识、语言、动机和环境发挥作用。社会无法保证结果完全相同,但可以停止制造本可避免的限制,也不把这些限制误认为自然上限。

证据支持的观点

迷思:智商分数要么决定命运,要么毫无意义

现实:经过充分验证的分数可以为明确界定的认知能力提供有用证据,并在特定条件下预测某些结果。它包含测量误差,取决于常模和情境,可能发生变化,也不能衡量一个人的全部。不要把它当作预言,也不要把它当作装饰。

迷思:尊重多样化的思维方式就必须否认一般智力

现实:一般认知因素会在许多群体中反复出现,但个体特征、才能、知识和实践专长仍然各不相同。这两项发现可以同时成立。应赞赏已展现的优势,而不要凭空创造固定的智力类型。

迷思:标准化评估要么无法跨文化进行,要么完全不受文化影响

现实:当结构、适应、常模、信度、预测能力和使用方式都经过充分验证时,测试可以支持比较。任何任务都无法完全脱离语言、受教育经历、惯例或经验。“非言语”会降低语言要求,但不会消除文化因素。

迷思:每个学习者都有一种固定的学习风格

现实:学习者有各自的偏好、经历和可及性需求,但证据并不支持把教学限制在视觉型、听觉型或动觉型类别中。在适合内容的情况下使用多样化的呈现方式,并消除障碍。

迷思:成长型思维本身就能克服糟糕的条件

现实:在某些情境下,以成长为导向的信息可能会适度支持坚持。认知和学业成长需要有效的教学、知识、练习、反馈、时间、健康、材料和真正的机会。不要把匮乏转化为信念不足造成的失败。

迷思:公平意味着让任务更容易或取消测量

现实:公平意味着消除与目标无关的障碍,并提供与需求相称的支持。它让目标保持清晰,准确衡量进展,并在当前路径失效时改变路径。

迷思:技术会自动使智力民主化

现实:技术可以扩大获取和练习的机会,也可能扩大监控、分心和不平等。其价值取决于基础设施、教学法、证据、可及性、语言、隐私和人的控制。

迷思:神经发育障碍诊断必然意味着一种特殊天赋

现实:每种诊断中的优势和障碍各不相同。正面的刻板印象可能掩盖那些不符合刻板印象的人。应评估个体,尊重他们对自身情况的描述,并提供其功能和目标所需的支持。

迷思:入学、证书或设备就能证明学习成效

现实:这些可能是投入或里程碑。应衡量出勤率、教学质量、知识、推理能力、独立完成任务的表现、坚持度、迁移能力,以及实际开启的下一个机会。

迷思:一个备受赞誉的国家或飞行员揭示了普遍适用的解决方案

现实:跨国结果综合了历史、选拔、福利、课程、教师、人口结构和测量等因素。试点项目往往会获得不同寻常的关注。在借鉴之前,应研究其机制、反事实、实施过程和情境。

承诺

保护正在发育的大脑。认真教授知识与推理。准确测量认知成长。消除污染机会的语言、残障、贫困和文化障碍。无论专业技能是通过何种诚实途径获得,都应予以认可。当第一条路径测量的更多是排斥而非能力时,应为人们提供另一条路径。庆祝经过良好验证的智商和认知测量上的进步、更快更深入的学习、娴熟的创造力以及更明智的判断——然后开启下一个挑战。

真相

不要掩盖能力差异

用经得起解释的方法测量明确界定的能力。精准性既保护卓越,也保障支持。

发展

不要浪费可改变的潜能

教育、练习、健康和机会能够改善认知表现,并改变一个人能够做到的事情。

尊严

不要把测量结果与人生混为一谈

人的尊严不应由速度或分数换取。这一伦理界限让诚实的测量更安全,而不是更弱。

繁荣的社会让更多心智得以成长

每个人群中都存在广泛的天赋差异,而获得机会的程度并不均等。目标是准确识别能力,并帮助更多人阅读、推理、创造、快速学习、掌握艰难的工作、从挫折中恢复,以及贡献此前不存在的知识。当这种成长真实发生时,就值得被认可。当获得机会的道路受阻时,观察到的结果无法说明某种天生的上限;它说明存在值得采取行动加以消除的障碍。

证据日期与解读

本指南中的全球可及性、完成率和基础设施数据,使用截至2026年9月2日可获得的最新来源。国际总量是根据时效性和覆盖范围各不相同的数据估算得出的;后续发布的数据可能会对其进行修订。效应量总结的是特定研究和环境中的平均结果,并不保证任何个人项目都能取得相同成效。

教育说明:本文提供有关智力、学习、评估、健康保护和政策的一般性教育信息。它不能替代个体化的心理、教育、医疗、残障、法律、安全或儿童保护评估。高风险认知或诊断性测试应由具备相应资质的专业人员,依据相关常模、测试便利措施和多种证据来源进行选择与解读。

↑ 返回开头

返回博客