Societal Attitudes and Support

社会态度与支持

Linas Juozenas
释放智力 · 社会与机会

当机会扩大,智力就能成长

推理、知识、记忆、创造力和熟练判断力彼此相关,但又是不同的能力。它们的发展和表现方式会受到教育、健康、练习、语言、反馈以及有意义的挑战影响。社会塑造人们获得这些条件的机会,也塑造能力被识别的可能性。

智商与认知成长 文化与期望 教学与评估 语言与残障 健康与保护 贫困与学校经费 技术与人工智能 循证政策

核心理念

测得的认知能力存在可靠的个体差异,能够预测某些结果,而且并非不可改变。设计良好的认知和成就测量,能为明确界定的构念提供有用证据。额外的教育可以提高认知测试的表现;知识和专长能够贯穿一生不断增长;特定技能的提升则可以支持学习和独立生活。

然而,每一个分数或表现都同时反映了一个人以及其表现时所处的条件。饥饿、铅暴露、产前酒精暴露、糟糕的教学、无法使用的材料、不熟悉的语言、强烈的恐惧、睡眠不足或不合适的测试,都可能降低观察到的表现、干扰学习,或同时造成两者;单凭分数无法区分这些机制。因此,重视智力不仅仅是欣赏高分。它还要求我们营造这样的条件,让更多人的心智能力得以增强,并展现他们所掌握的知识。

先读这里 · 高标准与真正的机会

高标准需要真正的机会

公平的体系既坚持高要求的目标,也消除与这些目标无关的障碍。它传授成功所需的知识和策略,给予人们真正的练习机会,准确衡量预期的能力,并在证据表明机会或教学未能奏效时作出回应。

01 · 衡量重要的事物

能力、成就、专长和机会是不同的变量

推理测试、学校考试、工作样本和既往机会记录,回答的是不同的问题。任何单一项目都不应被解读为能证明全部四项。

02 · 先培养,再评判

高期望需要高质量的实现手段

“你可以进步”只有与明确的教学、有用的反馈、充足的时间、练习、书籍、营养、安全保障以及必要时的专业支持相结合,才具有可信度。

03 · 尊重真实的能力特征

多样化的优势不需要未经支持的固定类型

人们在语言、空间、数量、记忆、注意、创造、运动、社交和特定领域技能方面确实存在差异。这些差异本身并不能证明加德纳所提出的各领域是彼此独立的智力,也不能证明应将教学与固定的学习风格标签相匹配。

04 · 结合语境解读

文化会改变意义和表达方式

不同社区重视的知识、称为明智的行为、使用的语言,以及专业能力发展的环境各不相同。在每种文化内部,差异仍然很大。

05 · 审查后果

良好的意图还不等于良好的体系

招生规则、算法、资优项目、合理便利和资金分配公式,都应依据效度、可及性、学习效果、错误模式和长期结果进行评估,而不是依据品牌宣传。

重视智力的最清晰方式,就是发展智力

认真对待认知能力。谨慎地测量它。以高标准教学。保护大脑免受可预防的伤害。为人们提供反复学习并展示掌握程度的路径。然后庆祝经验证的进步——无论它表现为更高的认知分数、流利的阅读能力、更强的数学推理能力、修复好的机器、新的科学思想,还是在压力下更明智的行动。

从机会到能力的转化链 这是一种诊断性启发式框架,而非普遍适用的因果顺序:各阶段彼此作用,其中一环薄弱就可能压制其他环节。政策应调查失效的环节,而不是责怪学习者。
  1. 01 保护发展 营养、医疗保健、安全的孕期指导、清洁的空气和水、睡眠、安全,以及免受可预防的神经毒性暴露。
  2. 02 获得保障 出勤、语言支持、残障支持、交通、书籍、网络连接,以及不被生存压力耗尽的时间。
  3. 03 高质量教学 连贯的课程、专家讲解、指导性练习、反馈、提取练习、挑战,以及适时的支持。
  4. 04 公平测量 可靠的工具、有效的解读、恰当的语言和常模、合理便利,以及不止一个相关信息来源。
  5. 05 开放机会 高阶学习、学徒制、就业、康复、领导力,以及真正运用不断增长的能力的机会。
01

智力是真实的——而且每个人的能力特征确实各不相同

社会不必在认真对待认知测量与认可多种有价值的专业能力之间二选一。

在一项高难度认知任务中表现出色的人,平均而言往往也能在其他任务中表现出色。这种反复出现的“正向流形”支持一种一般认知因素,通常称为 g以及言语理解、流体推理、空间加工、记忆和加工速度等广泛能力。在对来自31个非西方国家的97个样本进行综述后,研究发现,大多数样本中存在第一个一般因素,其余大多数样本中存在二阶一般因素。这支持认知任务之间的正相关在不同文化中反复出现;但这本身并不能证明因素结构完全相同、测量不变性成立、当地常模有效,或群体均值比较不存在偏差。

经过充分验证的认知测量得分与教育表现、训练结果以及日后的某些功能相关,并且可以对它们作出预测,但预测并不完美。预测结果并不能证明测得的能力单独导致了某一结果,而预测效度取决于研究人群、效标和决策情境。这些能力和测量都很重要。这正是应当培养认知能力、改进评估的理由,而不是把一个人简化为一个排名。这些关系具有概率性;它们并不能决定一个人的未来、品格、创造力、勇气、知识、机会或价值。

是的——测得的智力可以提高

一项荟萃分析汇总了来自42个数据集的142个效应量,涉及超过60万名参与者;研究利用纵向控制、义务教育改革和入学年龄截止点进行估计,发现教育年限每增加一年,认知测验得分大约提高1–5个智商点,具体取决于研究设计和结果指标。这支持教育对测得的认知表现具有因果影响;但这并不意味着每位学习者都会产生相同效果、收益可以无限累加,或能同等迁移到每一项认知任务上。这是有力证据,表明学校教育能够提升测得的认知表现,而不只是按照学生原有的表现进行筛选。

一个共同因素并不意味着拥有一个完全相同的心智

两个人的总体得分相同,可能获得不同的分测验得分,并且在知识、兴趣、感官获取、语言经历和策略方面存在差异。只有当分数差异超过测量误差,且对预期决策有效时,才能解读个体内部看似存在的优势与弱点。音乐才能、机械技能、社会推理、运动控制、艺术创作和生态知识都是真实的成就。有些成就很大程度上依赖一般推理能力;另一些则更多依赖练习、知觉、动机、运动控制、人格、文化和领域特定知识。

霍华德·加德纳的多元智能框架帮助许多教育工作者超越学校中的语文和数学学习。其人文主义初衷——发现更多才能——值得保留。但其更强的科学主张,即所提出的领域是彼此独立的智力,并未得到证实。直接检验发现,认知能力之间存在相当程度的共同变异,而且若干被提出的“智能”将能力与兴趣、人格或自我报告结合在了一起。负责任的结论并不是只有一种才能重要,而是能力的多样性确实存在,但不必假设存在一组彼此独立且固定的智力类型

向右滑动以比较 →

机构应当分开看待的四个概念
构念 它回答的问题 有用的证据 单独无法确定的内容
认知能力 这个人在明确条件下进行推理、记忆、加工或学习的效率如何? 经验证的认知任务,结合适龄常模和不确定性进行解读 总体知识、动机、道德、创造力、实践掌握程度或固定不变的潜能
成就 截至目前,这个人掌握了哪些课程内容或知识体系? 考试、演示、项目和累积性成果 学习为何发生、获得了哪些教学,或学习新材料的速度如何
专业能力 这个人能否在真实领域中可靠地完成复杂活动? 工作样本、监督下的练习、作品集、观察到的表现和结果 向无关领域广泛迁移,或不存在未测量的优势
机会 这个人获得过哪些学习、健康、时间、语言、技术和社会支持? 历史、背景、出勤、获取机会和接触经历的数据 能力本身——但它会改变我们应如何解读表现,以及哪些干预具有合理性

群体变化让环境因素清晰可见

在二十世纪的大部分时期,许多国家的智商测试表现都有大幅提升,这就是弗林效应;而在一些地区和领域,这种提升已经放缓或逆转。挪威的家庭内部分析支持环境因素能够解释这种上升与下降。具体构成仍有争议,但大规模的世代变化表明,不能把一个群体的测量表现视为永恒不变或由生物因素固定的。

02

文化塑造能力的含义与表现方式

文化会影响目标、工具、语言和认可方式,但不会让一个群体中的每个人都成为同一种学习者。

“谁是聪明的?”至少可能有三种含义:谁能高效解决陌生的认知问题,谁掌握了某个社群重视的知识,以及谁能以该社群认为负责任的方式运用判断力。标准化认知测试会在特定条件下对选定的构念进行操作化测量,例如推理、习得的知识、记忆或加工速度;它们并不能回答更广泛的道德或文化问题。家庭、学校和工作场所往往会将这三者混在一起。当其中一个答案被当作完整定义时,混淆就开始了。

对特定社群的研究说明了为什么必须具体分析。在一项针对肯尼亚罗族儿童的研究中,当地人对“聪明的人”的描述既包括认知能力,也包括尊重、理解力和社会责任;传统的认知测量和学校测量主要与其中的认知成分相关。对赞比亚切瓦族社群的研究同样将 nzelu 描述为兼具敏锐的理解力和对社会负责的行为。这些发现有助于理解所研究的社群,但不能据此提出“非洲文化重视群体性智力”这样的整个大陆层面的概括。每一个宽泛标签之内,国家、地区、语言、世代、阶层、家庭和个人都存在差异。

问题
心理测量学视角
文化视角
制度责任
重视的究竟是什么?
推理、记忆、速度、知识或其他明确界定的构念
具有地方意义的能力、责任感、专业知识和目的
明确说明所测构念,不要把所有受重视的品质都称为“智力”
分数可以比较吗?
检验结构、题目功能、信度、常模和预测能力是否支持这种比较
考察语言、受教育经历、熟悉程度、动机、作答规范和利害关系
当证据不足时,对比较加以限定或拒绝比较
接下来应该做什么?
在存在不确定性的情况下,将结果用于具体且经过验证的目的
加入历史、地方知识、观察和有意义的实际表现
根据证据的充分程度提供相称的支持和机会——不要赋予永久性的身份标签

熟悉的情境可以展现学校题型遗漏的策略

在巴西,曾在市场工作的儿童有时在商业情境中比在类似学校的题型中更成功地解决等值算术题,并采用了适应任务的策略。在对阿拉斯加尤皮克族青少年的研究中,农村参与者在一项基于当地情境的默会知识测量中表现更好,而城市参与者在一项晶体智力测试中表现更好;在农村环境中,当地知识能更好地预测社区对实际能力的评价。这些研究并不表明学术推理是不真实的或没有必要。它们表明,知识的表现形式部分取决于情境、表征方式以及实践经历

这一点对教育很重要。学习者可能需要明确的帮助,才能将非正式策略转换为数学符号、学术语言或新的职业情境。正确的回应既不是“学校考试就是一切”,也不是“学校知识并不重要”,而是把已有能力与强有力的新表征、词汇和可推广的方法连接起来。

把文化当作问题,而不是答案

  • 询问学习者和社区哪些知识与成果对他们重要,同时确保他们能够接触共同的科学、数学、语言和公民知识。
  • 使用与相关群体有关的具体证据,而不是基于国籍、族裔或宗教的假设。
  • 教授机构所要求的表达方式和考试规则;那些从未被告知这些隐性规则的人会因此受到惩罚。
  • 在家庭、社区、工作场所和学术领域的专业知识形式之间搭建桥梁。
  • 让学习标准清晰可见。回应情境的教学并不是对学习的豁免,而是进入学习的一条途径。
03

标签、期待、刻板印象与归属感

当信念改变教学、机会、关注、压力或坚持下去的意愿时,它们的影响最大。

期待不是心灵感应。教师不能仅凭相信某个学习者就把他变成天才,敌意性的刻板印象也不会自动决定每一次表现。但期待可以改变行为:谁能回答有难度的问题,谁能得到耐心的解释、详细的反馈、领导角色、再次尝试的机会,或被推荐参与高级学习。这些待遇差异可能改变学习机会,尽管上述综述发现,平均而言,自证预言效应通常较小,而且消退的情况多于累积的情况。

一项关于课堂自证预言的长期综述得出结论:相关效应确实存在,但通常较小,往往会逐渐消退,并且经常与基于先前表现的准确预测同时存在。对于已经受到污名或低期待影响的人,这些效应可能更为重要。后来一项对19项旨在改变教师期待的干预措施进行的综述报告称,这些措施对教师期待和学生成绩的平均影响均为正向,但不同研究及实施情况之间存在差异。这个发现的有用启示并不是“期待会创造智商”,而是“要审视期待在不知不觉中控制了哪些机会”。

教学前

谁能获得访问权限?

课程分层、资优筛选、纪律处分、残障转介和语言分类,可能在学习者有机会做出回应之前,就为其打开或关闭数年的课程学习机会。

教学期间

谁能获得认知挑战?

一些学习者会得到解释和具有挑战性的问题;另一些人却只能做简化的应付性作业。没有智力要求的支持可能成为另一道天花板。

表现之后

谁能获得另一条路径?

同一个错误,在一个人身上可能被理解为暂时的困惑,在另一个人身上却被视为固定的无能。重新教学和重新评估会暴露这种双重标准。

刻板印象可能给表现带来负担——但不是普遍适用的解释

当负面的群体刻板印象在评估过程中变得相关时,一些人会经历额外的自我监控、压力或注意力分散。元分析发现这些影响确实可能出现,但在现实的测试情境中,其估计效应通常可忽略或较小,而且发表偏倚是一个值得关注的问题。不应利用刻板印象威胁来解释掉所有分数差距;同样,对其平均效应大小的质疑也不应成为歧视、敌意线索或机会偏差的借口。

归属感同样是具体的。它不是一张写着“欢迎所有人”的海报,而在于学习者能否看到与自己相似的人在从事严肃的工作,问题是否得到尊重,欺凌是否被制止,错误是否可以得到修正,便利措施是否被视为正常而非令人羞辱,以及标准是否得到一致执行。

积极刻板印象的危险

“女孩天生富有同理心”、“亚裔学生擅长数学”、“自闭症患者是出色的模式识别者”和“阅读障碍者富有创造力”听起来可能是在赞美。但它们仍然把某种群体脚本强加给个体。不符合这种描述的人可能被忽视或受到指责,而真实的支持需求则被神话掩盖。请描述已经展现出的优势;不要根据身份推断优势。

公平的期望流程

  1. 用可观察的术语明确学习目标
  2. 审查证据,包括不确定性和学习机会。
  3. 提供高要求的支持:示范、提示、练习、反馈和充足的时间。
  4. 不要重复最初的标签,收集新的表现证据
  5. 当证据发生变化时,更新分层和支持
04

成长信念:有益的许可,但干预不足

希望可以让学习者继续投入任务。只有良好的学习条件和有效的行动才能培养能力。

成长导向认为,当前表现并不是最终上限,能力可以通过学习、策略、反馈和支持而改变。这比对 struggling 的学习者说“你要么有这种能力,要么没有”更准确,也更人性化。然而,对成长的信念本身并不等于成长。成长型思维干预的元分析发现,其平均效果较小且存在异质性;一些更严格的分析表明,在考虑偏差和研究质量后,它们对学业成就几乎没有令人信服的影响。

一项大规模预注册的美国试验发现,九年级中成绩较低的学生成绩略有提高,整体上选修高阶数学的学生也有所增加。效果部分取决于学校环境:同伴是否支持学业挑战。这一有条件的结果恰恰说明了关键所在:当课程、教学、规范和后续机会使进步成为可能时,同一信息会产生不同的效果。

信念

进步是可能的

学习者将困难视为信息,并愿意尝试要求更高的下一步。

方法

下一步行动是有效的

教学、提取练习、反馈、纠错、刻意练习和帮助,都应与实际障碍相匹配。

条件

环境允许学习

时间、安全、健康、材料、语言支持、残障支持和真正的进步路径,支撑着这项工作。

准确地赞扬过程

空泛地赞美努力——“你很努力,所以这很棒”——可能会误导。有效的反馈会指出哪些方面有所改善,以及下一步是什么:“你的图表揭示了缺失的关系;现在用第二个案例检验它。”努力很重要,但前提是方向明确、以信息为依据,并且不断修正。坚持采用失败的策略并不是美德;监控并改变策略才是有效自我调节的一部分。

这样说

“这一分数估计的是明确界定的能力,并不是不可逾越的上限。”

如果结果指向一项可教的学业技能,就应使用适当的成就测量来教授并重新评估这项技能。解读认知分数变化时,应考虑测量可靠性、标准误、练习效应、均值回归、坚持程度,以及是否迁移到受训任务之外。

避免这样说

“只要足够坚定地相信,任何人都能实现任何目标。”

这种承诺忽视了差异、偶然性、健康状况、时间和结构性障碍,并把机构的失败转化为对个人的责备。

庆祝证据,而非神话

学习者阅读更流畅、能在头脑中保留更多信息、能推理解决更困难的问题、掌握第二语言,或在超出预期的测量误差和练习效应后仍表现出可靠的认知分数提升,都说明取得了有意义的进步。明确指出这一提升。保留记录。开启下一阶段的挑战。严肃的成长文化既不否认局限,也不崇拜局限。

05

认知基础设施:健康、安全与保护

大脑无法脱离维持它的身体和环境而独立学习。

学校所面对的问题往往源于公共卫生。产前保健、营养、疫苗接种、清洁的空气和水、免受暴力侵害、稳定的住房、视力和听力保健、睡眠、心理健康支持以及避免接触神经毒性物质,都可能通过不同途径影响健康、出勤、注意力和学习。因暴露因素和环境而异,因果证据的强度和影响的大小也各不相同。一个在容忍可预防性脑损伤的同时赞美智力的社会,是在赞美结果,却忽视了其基础。

预防有毒物质暴露

铅会损害发育中的大脑

世界卫生组织指出,铅会永久影响儿童的大脑发育,降低智商和注意力,并损害教育成就。对于儿童,没有任何已知的血铅浓度被认为是安全的。预防——使用安全的油漆、土壤、水、产品和工作场所——比等到症状出现后再处理更具保护作用。

如实说明酒精的影响

合法且常见并不意味着无害

酒精会损害记忆、判断力、协调能力和大脑交流。世界卫生组织表示,任何饮酒模式都没有无风险的;风险通常会随着饮酒量和频率增加而上升。妊娠期间,卫生部门建议不存在已知的安全饮酒量或安全时期,因为整个妊娠期间发育中的大脑都可能受到影响。

构建健康能力

营养与及时回应式照护也是学习政策

营养丰富的食物、及时回应式互动、游戏、语言和健康服务有助于支持大脑结构发育和入学准备。这些并非可有可无的软性附加项。它们有助于建立后续教学得以发挥作用所需的生物和关系条件。

对每一种致醉物质采用同一套证据标准

当一种合法、应纳税或在文化上受到推崇的物质被描述为正常,而其他毒品却只通过恐惧来讨论时,毒品政策就会被扭曲。酒精是一种精神活性药物。尼古丁、大麻、镇静剂、兴奋剂、阿片类药物和许多药品也是如此。它们的风险特征会因剂量、效力、使用途径、年龄、频率、混用情况、健康状况和环境而异。诚实的教育应始终如一地比较证据:急性损害、依赖可能性、过量或中毒、对妊娠和发育的影响、慢性疾病、事故、暴力、心理健康以及对他人的伤害。

这并不要求声称每种物质的危害都相同,也不要求声称每个使用某种物质的人都会经历相同的结果。它要求拒绝“社会接受,因此安全”和“非法,因此格外危险”这两种错误分类。信息具体、可信,并与替代选择、支持性关系、早期照护以及减少商业性醉酒压力的政策相结合时,预防才最有力。

保护不应变成污名

物质使用障碍是受接触、压力、生物因素和环境影响的健康状况,并不是智力低下或品格不良的证据。准确传达风险、及早识别并提供可获得的治疗,比羞辱更能有效保护认知。在孕期,任何时候停止接触酒精仍然有益于健康;应当支持人们,而不是让他们因恐惧而远离产前保健。

向右滑动以比较 →

认知保护是共同责任
层级 保护性行动 需要监测的证据 常见失误
公共政策 铅污染治理、清洁的空气和水、产品监管、准确的酒精警示、产前保健、营养与暴力预防 接触水平、疾病与伤害、发展结果,以及按所在地和收入划分的不平等 让家庭自行应对只能通过监管或基础设施消除的危害
机构 安全的建筑、餐食、合理的日程安排、物质使用政策、保密支持、视力和听力服务,以及创伤知情实践 出勤、睡眠和饥饿指标、安全、转介、学习与参与 将健康或获得服务的问题视为懒惰
家庭和个人 寻求可靠信息,减少接触,保护睡眠,按医嘱用药,并与合格专业人员讨论疑虑 功能、副作用、学习、情绪以及随时间发生的变化 自责、延误就医,或将营销内容当作健康建议
06

幼儿期、家庭与社区学习

早期发展影响深远,但它不是一场把孩子培养成迷你成年人的竞赛。

幼儿通过回应性关系、交流、游戏、运动、探索、故事、睡眠,以及与安全环境的反复互动来学习。高质量的幼儿教育项目可以提升入学准备度,并可能带来更长期的教育、健康和经济收益,尤其是对处于不利处境的儿童而言。其效果会因质量、强度、年龄、比较条件以及项目结束后的经历而异。即使其他益处持续存在,短期的认知测试优势有时也会逐渐消退。

这就是为什么不应把著名的投资回报数字宣传成普遍规律。人们经常引用的佩里学前教育项目,源自20世纪60年代密歇根州面向特定弱势人群的一项小规模、高强度项目;后来的经济分析估算该项目具有较高的年度社会回报率。这并不意味着任何一个托育名额或品牌学前教育项目都会自动产生同样的回报。可推广的原则是,为质量、关系、丰富的语言互动、健康和连续性提供资金支持,然后评估项目的实际效果。

在家庭和照护环境中

有回应性的互动

跟随儿童的注意力,指出物体和动作,回应手势和问题,共读书籍,唱歌,数数,比较,假装游戏,搭建,并邀请儿童解释。目标不是持续不断地娱乐儿童,而是建立一个可靠的循环:儿童采取行动,另一个心智作出回应。

在早期教育中

有目的的游戏加上专业指导

儿童需要自主探索,也需要有目的的支持。专业能力强的教育工作者会扩展儿童的词汇,示范自我调节,发现理解上的误区,设计学习环境,纳入残障学习者,并将游戏与正在发展的读写能力、数概念和知识联系起来。

给照护者

时间、安全感与实际支持

当照护者面临不安全的工作、饥饿、住房不稳定、抑郁或没有托育服务时,单纯建议“多说话”作用有限。收入支持、育儿假、医疗保健、图书馆和友好的社区空间,都可能增加可用于学习的时间和能力,但效果取决于具体设计、可及性和情境。

贯穿各个过渡阶段

不要让早期的进步遇上薄弱的学校

如果小学教育通过连贯的课程、出勤、适宜的语言、书籍、教学和进一步支持来承接早期成果,这些益处更容易持续。一项短期干预无法永久抵消多年不利的生活条件。

一个有参考价值的案例——及其局限

在牙买加一项小规模随机研究中,社区卫生工作者连续两年每周探访生长迟缓幼儿的母亲,并指导她们进行有回应性的游戏和互动。成年早期的随访发现,接受互动刺激的一组收入更高。这一结果格外重要,因为它将早期的关系性干预与长期功能联系起来。不过,这仍只是一项针对特定人群的小规模研究,且随访时存在样本流失,不能据此保证所有入户探访项目都能获得某个固定比例的回报。

高质量早期教育体系所呈现的内容

  • 温暖且因势而变的成人—儿童互动,而不是被动监管
  • 丰富的口语和手语交流、书籍、音乐、运动、各种物品以及户外探索
  • 及早发现听力、视力、营养、发展和安全方面的需求
  • 规模足够小的班组、专业能力强的工作人员、稳定的关系以及持续的指导
  • 尊重家庭语言和文化,同时不限制儿童接触更广泛知识的机会
  • 互动质量、参与度和发展状况的衡量——而不仅仅是入学率
07

面向知识、推理与迁移的教学

当每位学习者都能获得一条精心设计的、通往高难度知识的路径时,智力上的高要求才会变得公平。

推理并不是知识的对立面。相关且组织良好的知识可以通过支持组块化、模式识别和类比,减少相关任务对工作记忆的需求;但它不会提高领域通用的工作记忆容量。知识也为批判性思维提供了准确的思考材料。创造力同样依赖于素材:词汇、例子、技巧、概念和持续练习。如果课程只向处境不利的学习者提供泛泛的“技能”,而其他人却不断积累历史、科学、文学和数学知识,那么这种课程可能会扩大其声称要解决的差距。

良好的教学会让专家的思维过程变得可见,安排思想的先后顺序,检查理解情况,并逐步转移责任。它会使用正例和反例、指导性练习、提取、间隔学习、累积复习、反馈与应用。它也会作出回应:当证据表明学习者缺少先备知识时,教师会补充这些知识,而不会永久降低学习目标。

能力培养型学习循环 随着支持被有意减少、知识变得可以提取,学习者会更加独立。
  1. 01 建立联系 激活相关的先备知识,并明确补充缺失的内容。
  2. 02 解释与示范 展示概念、策略、决策点和完整示例。
  3. 03 带反馈练习 在错误仍可纠正时,使用提示并进行纠正。
  4. 04 提取与变式 间隔一段时间后再回来,并更换例子,使知识变得灵活可用。
  5. 05 应用与验证 解决真实问题,解释推理过程,并检验所学是否能够迁移。

干预证据所支持的做法

对 89 项随机辅导实验进行的一项 2024 年元分析估计,平均学业成就效应约为0.29 个标准差。在较低年级、校内频繁开展辅导,以及由教师或辅助专业人员提供辅导时,效果往往更强,不过实施方式和情境也很重要。一项关于教师教练指导的因果元分析发现,教学质量平均有所提升,学生学业成就也有较小但有意义的改善;在规模更大的效果试验中,这些效果有所减弱。这些结果并不是让人们盲目照搬某个方案的理由,而是支持持续投入人的专业能力、反馈和练习。

对于低收入和中等收入地区,全球教育证据咨询小组将结构化教学——包括与目标一致的教案、学生材料和持续的教师支持——以及按学习者的实际水平进行教学,列为尤其具有成本效益的做法。“在学习者的水平上”并不意味着让学习者停留在那里。它意味着诊断起点,教授缺失的步骤,并加速迈向共同课程。

高支持 + 高要求

有成效的融合

清晰的讲解、易于使用的材料、有指导的练习和频繁的检查,能让更多学习者参与有难度的内容,并变得独立。

伪装成关怀的低要求

永久性的简化会变成另一道天花板

无休止的练习单、没有纠正的表扬,以及被剥去知识的课程,可能让成年人免于不适,却让学习者失去智力成长的机会。

多样化教学有用;固定的“学习风格匹配”没有用

空间关系重要时使用图示,发音重要时使用声音,运动序列重要时使用动作,精确语言重要时使用文字。多种表征可以提升学习的可及性和理解程度。缺乏依据的做法,是把某人贴上永久的“视觉型”“听觉型”或“动觉型”学习者标签,并据此限制教学。应根据内容和障碍匹配表征方式,而不是根据性格测试。

08

发现而非扭曲的评估

一项测试可能是进行某种推断的出色工具,却可能不适合进行另一种推断。

选择并不是“测试人”还是““看见完整的人”。没有任何单一评估能够捕捉一个人的全貌。负责任的任务是为明确的决策收集最佳证据,理解误差和局限,并避免声称超出证据支持范围的结论。经过充分验证的认知评估可以为特定能力和支持需求提供有用证据,同时明确说明测量不确定性和情境。学业成就测试可以显示学到了什么。工作样本可以展示实际运用中的掌握程度。访谈可以补充经历和目标。每种方法也可能存在偏见、噪声或被误用。

效度属于某种解释及其使用

“这是一个有效的测验”这一说法并不完整。对于哪一种分数含义、哪个群体、哪种语言、哪个年龄、哪种状况以及哪项决策而言有效?支持低风险教学筛查的证据,并不会自动支持永久性分流、诊断、排除就业或比较各国群体的平均数。

《教育与心理测验标准》联合版本将公平视为效度的基础。公平的评估旨在消除与目标构念无关的障碍,提供适当的参与条件,记录施测过程,并评估分数解释在相关群体中是否按预期发挥作用。群体之间的平均差异本身并不能证明存在偏差;平均数相同也不能证明公平。研究人员必须考察内容、反应过程、因素结构、题目功能、测量精度、预测能力和后果。

向右滑动以比较 →

让证据与决策相匹配
决策 核心证据 重要背景 保障措施
规划教学 简短的先备条件和学业成就检查、错误模式及观察 课程接触、出勤、语言和先前接受的教学 用结果来教学并再次核查,而不是将标签固定下来
了解认知特征 个体适切、标准化的认知评估,并说明不确定性 年龄、常模、健康状况、睡眠、焦虑、药物或物质使用,以及感官和运动方面的可及性 由合格人员进行施测和解释;结合个人经历与适应性功能
识别专业能力 真实工作样本、作品集、结构化观察和知识评估 工具、培训、文化环境和练习机会 透明的标准、尽可能由多名评分者参与,以及申诉渠道
为稀缺机会进行选拔 多个与工作或课程相关且具有增量效度的指标 群体获得机会、准备情况、便利措施和录取率方面的后果 审查各亚组的错误和后续表现;重新审视那些不能增加有用预测力的规则
认可先前学习成果 与明确职业或学术标准相对应的证据 非正式工作、迁移、文件遗失和当地实践 胜任的评估人员、质量保证、可携带的记录,以及雇主或机构的认可

翻译不等于适配

跨语言评估需要分析构念本身是否具有可比性,进行由文化和语言专家参与的适配,开展实证检验,并采用恰当的施测与记录方式。字面翻译可能改变难度、熟悉度或含义。非言语任务可以降低语言要求,但并非没有文化因素。受教育程度、接触图表的经验、视觉惯例、对测验的熟悉程度以及群体所属队列都会影响非言语矩阵任务的表现。

跨群体可比性实际上需要什么

研究人员经常检验测量恒等性:构型恒等性考察因素模式是否相似;度量恒等性考察因子载荷是否具有可比性;标量恒等性考察截距或阈值是否具有足够的可比性,以支持潜在均值比较。一项2023年的系统综述发现,认知因素模型通常可以跨文化推广,但研究方法、报告方式和覆盖范围各不相同,许多研究也没有检验所有必要层级。恒等性很重要,但其本身并不充分。常模、信度、语言、可及性、预测能力和现实世界后果仍然重要。

便利措施

消除无关障碍

对于低视力受测者,在推理测验中使用大字体,可能在不改变推理构念的情况下改善可及性。良好的便利措施不会“抬高智力”;它们会减少另一种局限造成的污染。

修改

改变任务所测量的内容

在旨在测量独立解码能力的测验中朗读一段文章,会改变测验所测量的构念。结果可能仍然有用,但需要不同的解释和支持性证据。

增加证据——不要用直觉取代严谨性

动态评估考察学习者如何回应提示、反馈或简短教学。档案材料和本地化展示可以揭示静态测验无法捕捉的发展情况和实践专长。它们是有用的补充,但并不会自动成为客观或无偏的替代方案。提示必须足够标准化,才能支持预期推断;档案材料会反映机会和评分者判断;社区评价可能包含地位偏差。每种方法都必须通过证据赢得信任。

十一点公平性检查

  1. 明确所测构念、决策和风险程度。
  2. 使用与年龄和目标人群相关的最新常模。
  3. 评估语言熟练度;不要临时自行翻译。
  4. 审查受教育经历、迁移经历、测验接触情况和学习机会。
  5. 考虑健康状况、睡眠、疼痛、焦虑、药物、物质使用和急性痛苦。
  6. 消除与所测构念无关的感官、动作和数字访问障碍。
  7. 说明并记录便利措施或修改的理由。
  8. 在需要时使用经过培训的测评人员和口译员。
  9. 报告置信区间、测量误差和局限性。
  10. 使用其他相关证据并提供申诉途径,对高风险决策进行三角验证。
  11. 随着时间推移,审查各亚组的题目表现、预测结果、误差和后果。
09

语言、迁移与多语言访问

学习者无法通过一种尚未获得公平机会去理解的语言来展示知识。

语言既是一项强大的认知成就,也是通往大多数正规学习的入口。语言承载着概念、指令、问题、关系和身份。当教学语言不熟悉时,儿童可能同时学习学科内容和教学媒介。学习表现可能低估其学科知识,而薄弱的语言支持则可能减缓对后续推理所需词汇的习得。

根据联合国教科文组织广为引用的一项估计,全球约40%的人无法获得以其能够流利使用和理解的语言开展的教育;在一些低收入和中等收入环境中,这一比例要高得多。这只是估计,并非实时人口普查,但这一障碍规模很大。联合国教科文组织2025年的政策工作支持持续开展母语教学——通常持续六至八年——同时逐步增加另一种语言。实施需要受过培训的多语教师、合适的教材、统一的术语和社区参与。如果没有这些资源就宣布语言政策,可能会造成纸面上的双语承诺与课堂中的混乱。

可及性

通过理解开展教学

使用学习者能够理解的语言来构建概念、读写能力和课堂参与,尤其是在基础教育阶段。

扩展

有计划地增加语言

掌握第二语言及其他新增语言能够扩大获得机会的范围。语言能力通过系统学习词汇、理解、口语、阅读和写作逐步提升,而不是通过突然替换来实现。

评估

将语言与目标技能分开

如果决策涉及数学或空间推理,应避免不必要的语言复杂性。如果涉及学术语言,就应直接测量语言能力,并将其解读为后天习得的熟练程度。

迁移带来的是不连续性,而非智力减退

难民和其他移民抵达时,可能面临学业中断、对课程体系不熟悉、创伤、记录缺失、学历不被认可,或掌握新机构无法评估的语言知识。2025年,联合国难民署估计,1240万名学龄难民中有46%失学。入学只是第一步:法律身份、费用、语言、分班、学历认证、安全和持续就学,决定了获得机会能否转化为学习。

联合国教科文组织《学历护照》为学业记录不完整或缺失的难民和弱势移民提供结构化评估和标准化文件。它概述可能具备的学历、工作经历和语言能力,以支持进一步评估。它不是区块链证书,不等同于自动获得正式认可,也不能替代人工判断。它的价值来自专家评估、透明记录以及各机构的认可。

多语言支持计划

  • 记录学习者理解、口语表达、手语表达、阅读和书写的语言;这些语言可能各不相同。
  • 在高风险评估之前提供指导、关键术语、词汇表和示例演算。
  • 提供经过培训的口译员,以及经过调整和核查的翻译材料。
  • 允许使用家庭语言支持概念学习,同时明确发展更广泛参与所需的语言能力。
  • 同时评估学科学习和语言习得的进展,而不是将其中一项视为另一项。
  • 认可可信的先前学习经历,并在课程不衔接的地方开设衔接课程。
10

残疾、神经多样性与可及的挑战

差异、优势、功能障碍和支持需求可以在同一个人身上共存。

神经多样性承认人类神经系统的差异,并反对不必要的污名化。它并不要求否认残疾、痛苦或功能障碍。自闭症、ADHD、阅读障碍、智力障碍、发展性语言障碍及其他状况各不相同。诊断并不能揭示一种标准化的天赋特征;同样,它也不会排除出现非凡优势的可能性。关键在于理解个人的功能状态、目标、环境和偏好。

联合国儿童基金会对42个国家的协调分析估计,近2.4亿名儿童生活在残疾状态中。与无残疾同龄人相比,他们一生中从未入学的可能性高出49%,具备基础读写和计算能力的可能性低42%。这些是相对可能性,而非百分点差距;个人经历也会因功能困难和具体环境而存在显著差异。这些数字描述的是排斥和结果,而不是较低的人类价值,也不是某种不可改变的能力水平。

无障碍不等于更容易

根据任务不同,字幕、与屏幕阅读器兼容、手语服务、触觉图示、可预测的结构、活动休息、替代性输入方式、额外时间或安静的房间,都可能消除无关障碍。某项便利措施是否保留了该评估或活动 intended 测量的构念,必须针对具体情况进行评估;例如,当速度属于测量内容的一部分时,额外时间可能会改变结果的解读。

通用设计加个别化支持

CAST 的通用学习设计指南鼓励采用多种参与、信息呈现以及行动或表达方式。其目标是预先考虑学习者的差异,并从一开始就减少本可避免的障碍。该框架前景良好且具有实践性,但其研究基础在方法学上并不均衡,也不能替代个别化便利措施、专业教学、辅助技术、治疗、沟通支持或合适的安置。

融合教育是一项权利,也是教育系统的义务,而不只是安排在某个教室里。坎贝尔综述纳入了15项经合组织国家的非随机研究,发现与隔离式安置相比,普通教育安置在平均学业或社会心理结果上没有一致的优势或劣势;各项估计差异很大,且证据的方法学质量较弱。融合教育能否成功,取决于无障碍的建筑和材料、受过培训的工作人员、个性化教学、同伴、安全、沟通、家庭和学生的发声权,以及足以让参与真正实现的资源。

向右滑动以比较 →

从基于标签的假设转向针对个人的支持
避免想当然 询问或评估 可能的支持措施 持续测量
“自闭症意味着擅长模式识别” 实际认知特征、兴趣、沟通方式、感官无障碍性和支持需求 明确预期、感官调整、直接沟通、与工作相关的工作样本 表现、压力、保持情况、自主性以及当事人自己的评价
“多动症意味着有创造力但粗心” 根据情境变化的注意力、执行要求、动机、睡眠、共存状况和个人创造力 将任务分解、设置提醒、减少干扰、安排活动、在本人选择且适当时接受治疗 学习、任务完成、副作用、福祉和迁移运用
“阅读障碍意味着视觉天赋” 解码、流利度、拼写、口语、理解力和已展现的空间技能 结构化读写教学、文字转语音、无障碍格式,以及在有依据时提供额外时间 阅读进步、课程获取、独立性和实际领域优势
“智力障碍决定了上限” 认知和适应性功能、沟通、学习反应、健康状况、日常情境和偏好 明确教学、无障碍沟通、重复练习、支持性决策和真实的社区参与 新技能、适应性独立、生活质量、选择权和不断变化的支持需求

就业应当发掘技能,而不是奖励符合面试规范的表现

基于工作样本的招聘、结构化面试、清晰的任务描述、无障碍招聘流程和合理调整,能够发现那些因快速社交表现或模糊惯例而被排除的人才。企业神经多样性项目提供了有用的设计范例,但个案轶事并不能证明自闭症员工整体上都更高效。一项关于工作场所“自闭症优势”假说的系统综述发现,符合条件的研究寥寥无几。应以个人证据取代负面和吹捧性的刻板印象。

从功能和当事人的声音出发进行设计

  • 询问当事人如何认同自己的身份,以及偏好使用哪种语言。
  • 描述观察到的优势和障碍,而不是根据诊断结果推断它们。
  • 在检验哪些教学和支持真正有效的同时,相信学习是可能的。
  • 默认让核心材料具备无障碍性,并及时提供个性化调整。
  • 让残障人士和神经多样性人士参与设计、评估和治理。
  • 衡量参与、学习、自主性和福祉,而不仅仅是身体在场。
11

贫困、学校经费、地理位置和中断

机会差异可能转化为表现差异,但这并不能成为群体天生能力的证据。

获得教育不只是拥有一个座位。它还包括安全且稳定的出勤、易于理解的教学、受过培训的教育工作者、适当的挑战、书籍和教材、营养、时间、无障碍设施,以及在需要时提供的电力、网络连接和辅助技术。入学却没有学习并不算成功;没有可及性的学习政策,会让数百万人无法被纳入测量。

2.73亿 据估计,2024年处于小学至高中年龄段的失学儿童和青少年 联合国教科文组织当前的模型估计,发布于2026年
70% 据估计,低收入和中等收入国家10岁儿童中无法阅读并理解简单文本的比例 联合2022年“学习贫困”模拟——并非对2026年的实时观测
93分 PISA 2022数学成绩中,国内社会经济状况最高四分位与最低四分位学生之间的平均差距 横截面相关性,并非天生差异或纯粹的因果差异
970亿美元 低收入和中低收入国家为实现国家可持续发展目标4所需目标而面临的估计年度资金缺口 联合国教科文组织模型;需求和财政状况各不相同
9300万 危机影响地区完全失学的学龄儿童和青少年 教育不能等待组织2026年估计;危机包括冲突、气候和流离失所

联合国教科文组织最新模型估计,2024年有2.73亿儿童和青少年失学:小学年龄段7900万、初中年龄段6400万、高中年龄段1.3亿。该估计综合了行政数据、调查数据和人口数据,并非人口普查。修订后的人口统计和建模输入数据解释了此前发布总数增加的很大一部分,因此不应将这一变化误报为一年内的骤降。冲突也可能使受影响儿童更难被统计。

按时完成学业,2024年 全球和低收入国家平均值。这些是由体系塑造的人群结果,而非对天生智力的排名。
全球 · 小学

88%
全球 · 初中

78%
全球 · 高中

61%
低收入家庭 · 小学

60%
低收入家庭 · 初中

37%
低收入家庭 · 高中

20%

机会梯度也存在于富裕体系内部

在PISA 2022中,经合组织各国处于社会经济不利地位的学生,未达到基础数学能力水平的可能性是处于有利地位学生的7倍。然而,约10%的弱势学生在本国数学成绩中位列前25%。第一个结果显示出强大的社会梯度;第二个结果说明,社会背景并非命运。PISA属于观察性评估,无法确定单一原因。社会经济指标综合了父母受教育程度、职业和家庭资源,而这些因素都与多种作用机制相关。

性别模式同样无法用简单的文化叙事解释。联合国教科文组织2024年的估计显示,全球失学男孩多于女孩,但完成学业方面的劣势会随着国家收入水平和教育阶段的不同而逆转。在低收入国家,每100名完成高中阶段教育的年轻男性中,只有79名年轻女性完成该阶段;在高收入国家,这一比例为每100名男性对应106名女性。政策应诊断具体地点的实际障碍——费用、早婚、安全、照护劳动、劳动力市场压力、失去学习动力或特定学科的期望——而不是把一个全球平均值视为普遍规律。

资金很重要——而实施决定了资金能买来什么

联合国教科文组织报告显示,教育融资差距巨大:高收入国家每名学习者每年公共支出超过8,500美元,而低收入国家约为55美元。2024年,低收入国家的小学中仅有52%配备饮用水,40%配备洗手设施,28%配备电力。这些数字描述的是条件,而不是任何特定预算项目的因果回报。

因果证据确实表明,资源能够改善结果。一项针对31项美国准实验研究的2024年荟萃分析估计,若连续四年为每名学生增加1,000美元投入,考试成绩平均提高约0.032个标准差,升入大学的比例平均提高2.8个百分点。影响因情况而异,且这些估计仅适用于美国。结论既不是“金钱能解决一切”,也不是“金钱无关紧要”,而是:确保投入充足,将资金投向有效的人员和条件,可靠地执行预算,并评估学习者实际获得了什么。

2024年低收入国家小学的基本设施 报告配备各项设施的学校占比。学校没有基础设施,就无法围绕这些不存在的条件实现数字化或保护学习。
饮用水

52%
洗手设施

40%
电力

28%

普遍基础加上有针对性的支持力度

每位学习者都需要安全的设施、专业的教学和连贯的课程。有些学习者还需要更多支持:交通、现金援助、膳食、辅导、辅助技术、语言衔接、更小的学习小组、心理咨询或加速补习。公平并不意味着投入完全相同,而是意味着共同的高期望,加上与障碍程度相称的额外支持。

12

技术、开放资源与人工智能

技术可以拓展优质教学、获取机会和练习。它也可能扩大薄弱内容、监控和不平等的影响。

设备并不等于教育。对于许多数字化机会而言,网络连接和可用硬件是必要条件,但学习还需要电力、无障碍内容、语言支持、教师能力、时间、数字技能、维护以及明确合理的教学目的。联合国教科文组织2023年技术报告发现,可靠且独立的证据往往滞后于技术采用,而且许多评估由供应商完成。采购应从学习问题出发,而不是从产品演示出发。

2025年,联合国教科文组织报告称,全球仅有40%的小学、50%的初中和65%的高中能够接入互联网。学校接入网络,仍可能面临设备不足、数据费用难以负担、平台无障碍性不足或缺少经过培训的支持人员等问题。此前联合国儿童基金会与国际电信联盟对家庭情况的估计显示,有13亿学龄儿童家中没有互联网;该估计基于2020年可获得的数据,应被视为历史基准,而非当前人数统计。

第一 · 获取机会

学习者实际能使用它吗?

检查电力供应、设备共享、数据成本、离线功能、无障碍性、语言、隐私、登录负担、技术支持和安全的学习空间。

第二 · 教学法

将进行什么认知活动?

明确知识、实践、反馈和教师行动。衡量不依赖工具仍能保持的学习成果,而不是点击次数、完成情况或经过工具辅助后看起来很完善的产出。

第三 · 治理

谁控制数据和决策?

要求实行数据最小化、安全措施、适龄设计、分群体测试、人工干预、申诉机制、透明度、可移植性和退出计划。

开放教育资源:获取机会是首要成果

开放许可材料可以降低成本、提供即时获取,并允许合法翻译、改编和再利用。一项针对高等教育的大型荟萃分析发现,在开放教材与商业教材之间,平均学习成绩基本没有差异;在纳入的研究中,使用开放教材的退课几率更低,但其中许多证据来自观察性研究。这并不意味着失败。如果以更低的成本和更广泛的获取机会实现相当的学习效果,学习者就能从中受益。质量审核、无障碍性、本地语言和教学方式,仍然决定开放资源是否有用。

人工智能应当增强思考,而不是取代思考

生成式和自适应系统可以进行翻译、生成练习、提供快速反馈、支持无障碍,并帮助教师检查模式。它们也可能产生幻觉、再现偏见、泄露个人数据、助长依赖、掩盖作者身份,并以不平等的错误率作出高风险决定。联合国教科文组织建议保护隐私、适龄使用、开展伦理验证,并采取以人为本的方法。经合组织 2026 年数字教育展望同样警告,生成式人工智能不应取代认知投入或人际关系。

一项在印度城市地区对某项混合式自适应课程开展的随机抽签评估发现,经过约 4.5 个月后,数学成绩提高约 0.37 个标准差,印地语成绩提高约 0.23 个标准差。该课程将软件与小组教学结合起来;这一结果不能推广到作为一个类别的“人工智能”。可迁移的经验是:诊断学习者的水平,提供有针对性的练习,并将技术与人工教学结合,然后开展独立对照。

向右滑动以比较 →

采用教育技术或人工智能前需要提出的问题
测试 询问 最低证据 停止信号
学习 无辅助的知识或技能是否得到提升并保持? 预先设定的学习成果、积极对照、延迟测量和迁移任务 只报告参与度、平台使用时间或人工智能辅助产出
公平性 哪些人无法访问或受益? 按相关语言、残障、收入、年龄和既往学业水平群体分类的结果 平均收益掩盖了更大的群体误差或排斥
隐私 收集、推断、保留和共享了哪些数据? 数据图谱、数据最小化、保留期限、安全控制和删除途径 获得学习机会需要不必要的生物特征、行为或商业跟踪
自主权 教师或学习者能否理解、推翻决定并提出申诉? 人工复核、解释、纠正和替代路径 自动化分班或纪律处分成为最终决定
可持续性 机构能否维护并退出该系统? 总成本、培训、支持、可导出的记录、互操作性和退出条款 供应商锁定或基础设施会消耗原本用于教师和核心材料的资金
首先为教学关系提供资金

没有内容、支持或教学法的硬件通常是低效投资。只有当技术能够比其他方案更有效、更公平、更可持续地解决已证实的可及性或学习问题,并且人们仍能在不把控制权交给工具的情况下思考、教学和作出决定时,技术才值得优先投入。

13

哪些值得投资——哪些需要谨慎

资助能够构建或解锁学习的机制,并区分参与机会效应与学业成效效应。

应根据每项干预措施所产生的学习、参与机会和福祉来进行评估。项目应明确说明所针对的障碍、作用机制、覆盖人群、比较对象、结果、时间范围以及实施所需资源。入学、出勤、学业成绩、认知发展、健康和就业是不同的结果。政策可能改善其中一项,但不会自动改善其他结果。

  1. 连贯的教学与课程 直接构建学习
  2. 通过实践、反馈和后续跟进促进教师发展 提升实施能力
  3. 高强度辅导和加速补学 针对未完成的学习
  4. 高质量幼儿发展 夯实基础
  5. 健康、营养、安全和认知保护 消除生理障碍
  6. 公平融资、语言支持和残障支持 让参与真正成为可能
  7. 图书、开放资源、网络连接和经过评估的技术 扩大获取机会并增加练习
  8. 成人学习,以及对既往学习经历的可信认证 重新打开机会

这些领域并非按优先级排序;地方障碍、边际成本、实施能力和公平性决定优先事项。缺乏安全用水的社区,可能需要先建设基础设施,教学创新才能发挥作用。患有阅读障碍的学习者,可能需要立即获得辅助技术。难民可能需要先解决合法入学和语言支持问题,再接受辅导。证据应帮助开展地方诊断,而不是抹去地方实际情况。

向右滑动以比较 →

对所选干预措施可以——以及不可以——期待什么
干预措施 证据最充分的贡献 重要限制 实施信号
结构化教学法 协调课程计划、学生材料、评估和持续的教师支持;在若干低收入环境中具有较强的成本效益证据 没有培训、材料、调整或反馈的教学脚本,可能变成服从要求,而不是真正教学 教师理解该模式、材料及时到位,并且学习者表现发生变化
针对性辅导 在随机开展的学前至高中实地试验中,平均取得显著提升,尤其是在频繁开展且与课程相衔接的辅导课程中 效果和成本各不相同;人员配置、出勤、排课和规模扩大都可能削弱实施 定期参与、辅导教师质量、内容一致性,以及延迟测量的学习成效
教师辅导 如果辅导持续开展并聚焦实践,就能改善教学和学生成绩 在一些规模更大的成效试验中,平均效果会减弱;一次性工作坊很少能复制密集辅导的效果 观察到的教学变化,以及培训后仍持续的支持
幼儿教育项目 可以改善入学准备度并带来更长期的收益,尤其是在高质量的目标性项目中 效果各不相同;初期分数提升可能会消退,广为人知的回报具有项目特异性 及时响应的互动、熟练且稳定的工作人员、家庭支持以及与学校阶段的连续性
学校财政 具有可信因果性的美国证据发现,考试成绩和升入大学方面的平均效果为正 效果大小取决于具体情境;资金必须用于有效投入,并得到良好执行 透明的资金分配、实际支出、人员配置和服务改进
现金转移支付 有条件和无条件的转移支付都能通过减轻家庭约束改善入学率和出勤率 学习效果较小且更不确定;在薄弱学校获得一个名额并不能保证掌握知识 覆盖范围、支付可靠性、出勤和学习分别进行测量
学校供餐 可以支持营养并略微改善入学率;2025 年 Cochrane 综述发现数学成绩平均有小幅提升 关于出勤和阅读的证据有限,或显示平均效果很小;食物质量和配送方式很重要 覆盖范围、支付可靠性、出勤、健康、营养价值和学科专项学习
图书与图书馆 减少材料匮乏并创造反复阅读的机会;一项为期五年的家庭随机化图书项目发现,其对阅读产生了小幅积极影响 仅有建筑物或书箱并不能创造阅读;语言、相关性、教学和使用都很重要 易获取且相关的藏书、流通、阅读时间、指导和理解能力
自适应学习或 AI 支持的学习 一些经过评估的混合式项目通过诊断、练习和反馈改善了目标学习 结果不能推广到所有软件;隐私、偏见、依赖、可及性和供应商证据都是严重问题 独立比较、分组结果、无辅助迁移和教师监督
全纳教育 消除歧视性排斥,并能够促进共同学习和参与 仅安置本身不是一种干预;结果取决于个性化程度、工作人员、可及性和资源 参与、学习、归属感、自主性和支持质量
先前学习成果的认可 让以非正式方式获得并经展示证明的能力对雇主和教育机构变得清晰可见 徽章的可信度取决于其标准、评估、质量保证和认可程度 透明的证据、合格的评估人员、可迁移性和真正的认可

案例研究应揭示作用机制,而不是制造全国性神话

肯尼亚 · 结构化读写与数学教育

教师指南、辅导和学生用书协同发挥作用

小学数学与阅读倡议的随机化组成部分在阅读和数学能力各项结果上都带来了提升。后来全国范围的 Tusome 结果幅度较大,但在中期评估时缺乏反事实,因此不应将其描述为完全具有因果性的结果。其启示在于相互协调的实施体系,而不是宣称某一种工具单独改变了一个国家的教育体系。

尼日尔 · 成人学习

课后使用简单手机进行拓展练习

在 113 个农村村庄中,在标准成人读写和算术课程中加入基础手机练习,最初使成绩提高约 0.19–0.26 个标准差。两年后续研究显示,阅读成绩仍然更高,而平均数学成绩已不再存在差异;效果因年龄和性别而异。低成本技术强化了教学,但没有取代课堂。

孟加拉国 · 先前学习成果

评估与认证让技能变得可见

一项对获得先前学习成果认定评估机会的随机评估发现,在意向性治疗模型中,就业率约提高了 7–8 个百分点。这一有希望的结果来自一个短期随访的单一情境;只有当标准和证书受到信任时,认定才会发挥作用。

牙买加 · 早期刺激

回应式照护的影响延续至成年

一项针对发育迟缓幼儿的小规模随机家庭访问项目改善了他们日后的收入。其重要性在于一个合理的发展机制和长期随访,而不是假装某个百分比在任何地方都能重现。

不要扩大宣传标题;要扩大有支持的作用机制

项目在扩展时往往会失效,因为培训、监督、材料、实施剂量或参与者匹配度发生了变化。在全国推广之前,应检验核心组成部分能否在常规条件下维持,收益能否惠及被排除的群体,成本是否会挤出更好的替代方案,以及地方机构能否维持质量。

14

机构与社区的实用框架

让“我们重视每一种心智”从一句口号变成一个有证据、有责任、可修订的运行系统。

治理的核心问题不是一项政策听起来是否包容,而是是否有更多人获得知识、认知能力、掌握技能的能力、独立性以及获得有价值机会的途径——以及可预防的伤害是否减少。这需要建立从家庭和课堂,到雇主、市政府及国家政府的责任链条。

家庭与学习者

建立常规,并要求精确的证据

保障睡眠和健康,阅读并交流,练习提取,寻求反馈,记录成长,并询问分数衡量的是什么。当教学、语言或可及性发生变化时,要求重新评估。

学校和培训机构

高标准教学并消除无关障碍

确保课程连贯,及早识别需求,提供辅导、无障碍材料、语言支持、有效评估,并依据最新证据推动进阶。

雇主和资质机构

根据实际工作进行选拔,并保持发展机会开放

使用与工作相关的工作样本和结构化方法,认可可信的既往学习成果,提供合理便利,培训人员,并审查选拔和晋升结果。

政府和资助方

保护基础并为交付提供资金

为健康、营养、安全设施、教师、材料、残障支持和语言可及性提供资金;如实监管神经毒性物质和致醉物质暴露;公布分列结果并支持独立评估。

五阶段运行周期

01 · 定义

明确能力和目的

明确应改善什么、为谁改善、何时改善以及为何重要。“潜力”和“包容性”只有转化为实际功能和机会后才可衡量。

02 · 诊断

找出断裂环节

梳理健康、可及性、出勤、教学、语言、残障、材料、评估和进阶情况。询问受影响的人,系统在哪些环节失效。

03 · 交付

为机制提供资源

配备受过培训的人员、时间、材料、监督、预算和权限。没有交付能力的政策无法产生预期结果。

04 · 评估

衡量覆盖面、学习效果和后果

在可行时采用可信的比较,检查各群体结果,记录成本,并检验持续性和迁移效果,而不只是满意度。

05 · 改进

纠正、扩大规模或停止

保留核心机制,适应具体情境,修复不平等的可及性,并停止机会成本超过收益的项目。

始终 · 倾听

纳入受影响的人

学习者、家庭、教师、残障人士、少数语言社区和一线工作人员能够发现汇总仪表板遗漏的失败模式。

向右滑动以比较 →

一份不把可及性与学习混为一谈的仪表板
领域 示例指标 按以下维度分列 要回答的问题
保护 营养、铅和污染暴露、暴力、安全妊娠信息、睡眠和心理健康 年龄、居住地、收入、残障和相关暴露群体 可预防的生物学障碍是否在减少?
可及性 入学、出勤、交通、语言、无障碍、书籍、设备和电力 收入、城乡状况、性别、残障、语言、迁移和危机状况 谁能够可靠地进入并参与?
教学 课程覆盖、教学质量、练习、反馈、辅导时长和教师支持 学校、课程、教师、先前学业成就和支持状况 预期的学习过程是否发生?
学习 知识、读写能力、计算能力、推理能力、认知测量、作品集和延迟迁移 起点、学习机会以及所有相关的可及性群体 能力发生了什么变化,变化幅度多大,持续了多久?
体验 安全感、归属感、自主性、挑战、便利措施,以及学习者或家庭的意见 相同的群体,包括在样本量允许时的交叉群体组合 人们是否以有尊严的方式参与,并拥有有意义的选择?
发展进阶 完成学业、高阶学习、资格证书、学徒培训、就业、独立生活和公民参与 既有机会、项目、地区和人口群体 学习是否开启了下一个有价值的机会?

从能够暴露隐性排斥的决策入手

第一年的实践议程

  1. 90天内:梳理哪些人缺席、被安排在低于其能力的位置、被排除在高阶学习之外、在等待便利措施,或无法使用教学所采用的语言和材料。
  2. 一个学期内:确保提供扎实的核心课程、可采取行动的反馈、无障碍材料,以及针对未完成学习的快速支持渠道。
  3. 六个月内:审核每项高风险测试、筛查规则和算法,检查其构念相关性、可及性、亚组错误率和申诉机制。
  4. 一年内:公布覆盖范围、干预剂量、学习、成本和进阶结果;确定哪些群体未受益以及原因。
  5. 扩大推广前:在通常的人员配置和预算下测试实施,保留产生益处的机制,并停止薄弱或有害的组成部分。

社区参与是证据基础设施

参与并不意味着要求人们认可一份已经完成的计划,而是让他们参与确定成果、识别障碍、调整语言和实施方式、解读意外结果并治理后果。仅凭亲身经历无法确定因果有效性;但它可以揭示干预是否如描述的那样存在,以及远程评估者未能衡量哪些伤害。

15

误区、承诺与持久的结论

一个人道的社会不会在卓越与包容之间二选一。它通过包容、证据和发展来成就卓越。

“能力是固定的”与“所有差异都是虚构的”是一个错误的二分法。证据支持一种更有用的立场。认知能力存在差异,彼此相关,并能预测有意义的结果。它们也会发展,会对教育作出反应,并通过健康、知识、语言、动机和环境发挥作用。社会无法保证结果完全相同,但可以停止制造本可避免的限制,也不能把这些限制误认为自然上限。

证据支持的观点

误区:智商分数要么决定命运,要么毫无意义

现实:经过充分验证的分数可以为既定认知能力提供有用证据,并在特定条件下预测某些结果。它包含测量误差,取决于常模和情境,可能发生变化,也不能衡量一个人的全部。不要把它当作预言,也不要把它当作装饰。

误区:尊重多样化的思维方式就必须否认一般智力

现实:一般认知因素会在许多群体中反复出现,而个体特征、才能、知识和实践专长仍然多种多样。这两种发现可以同时成立。应赞赏已展现的优势,但不要凭空创造固定的智力类型。

误区:标准化评估要么无法跨文化进行,要么完全不受文化影响

现实:当测验的结构、调整方式、常模、信度、预测能力和使用方式都得到充分验证时,测验可以支持比较。任何任务都无法完全摆脱语言、学校教育、惯例或经验。“非语言”只能降低语言要求,并不能消除文化因素。

误区:每个学习者都有一种固定的学习风格

现实:学习者有自己的偏好、经历和获取支持的需求,但证据并不支持把教学局限于视觉型、听觉型或动觉型。应在符合内容时采用多样的呈现方式,并消除障碍。

误区:成长型思维本身就能克服恶劣条件

现实:在某些情境下,以成长为导向的信息可能会适度支持坚持。认知和学业成长需要有效教学、知识、练习、反馈、时间、健康、材料和真实机会。不要把资源匮乏变成信念不足的失败。

误区:公平意味着让任务更容易或取消测量

现实:公平意味着消除与目标无关的障碍,并按需求提供适当程度的支持。它让目标保持清晰,准确衡量进展,并在当前路径无效时改变路径。

误区:技术会自动让智能民主化

现实:技术既能扩大获取资源和练习的机会,也能扩大监控、分心和不平等。其价值取决于基础设施、教学法、证据、无障碍性、语言、隐私和人的控制。

误区:神经发育诊断必然意味着某种特殊天赋

现实:每种诊断内部的优势和障碍各不相同。正面的刻板印象可能掩盖那些与之不符的人。评估每个人,尊重其自我描述,并提供其功能和目标所需的支持。

误区:入学、资格证书或设备就能证明学会了

现实:这些可能是投入或里程碑。应衡量出勤率、教学质量、知识、推理能力、独立表现、坚持程度、迁移能力,以及实际上由此开启的下一次机会。

误区:一个备受赞誉的国家或飞行员揭示了普遍适用的解决方案

现实:跨国结果综合了历史、筛选、福利、课程、教师、人口结构和测量等因素。试点项目往往会获得不同寻常的关注。在借鉴之前,应研究其作用机制、反事实、实施过程和情境。

承诺

保护发育中的大脑。认真教授知识和推理。准确测量认知成长。消除污染机会的语言、残障、贫困和文化障碍。认可人们通过诚实方式获得的专业能力。当第一条路径更多测量的是排斥而非能力时,为人们提供另一条路径。认可经过充分验证的智商和认知测量结果上的进步、更快更深入的学习、熟练的创造力以及更明智的判断——然后开启下一个挑战。

真相

不要掩盖能力差异

用经得起解读的方法测量明确界定的能力。精准性既保护卓越,也保障支持。

发展

不要浪费可改变的能力

教育、练习、健康和机会能够改善认知表现,改变一个人能够做到的事情。

尊严

不要把测量结果与人生混为一谈

人的尊严不是靠速度或分数赢得的。这条伦理界限让诚实的测量更安全,而不是更弱。

繁荣的社会帮助更多心智成长

每个人群中都存在广泛的才能差异,而获得机会的程度并不均等。我们的目标是准确识别能力,帮助更多人理解、推理、创造、快速学习、掌握困难的工作、从挫折中恢复,并贡献此前不存在的知识。当这种成长真实发生时,它值得被认可。当机会受到阻碍时,观察到的结果无法确定一个人的自然上限;它揭示的是一个值得采取行动的障碍。

证据日期与解读

本指南中的全球可及性、完成率和基础设施数据采用截至2026年9月2日可获得的最新来源。国际总量是根据时效性和覆盖范围各不相同的数据估算得出;后续发布的数据可能会对其进行修订。效应量总结的是特定研究和情境中的平均结果,并不保证适用于任何个体项目。

教育说明:本文提供有关智力、学习、评估、健康保护和政策的一般性教育信息。它不能替代个体化的心理、教育、医疗、残障、法律、安全或儿童保护评估。高风险认知或诊断性测试应由具备相应资质的专业人员,依据相关常模、测试便利措施和多种证据来源进行选择和解读。

↑ 返回开头 · 查看系列中心

返回博客