Measuring Intelligence

智力测量

Linas Juozenas
释放智力 · 测量

测量智力,但不要让心智变得狭隘

智力很重要。更强的推理、记忆、知识和学习能力,可以帮助人们理解更多、学得更快、解决更困难的问题,并以更强的自主性应对生活。优秀的智商测验能够测量这种能力的重要组成部分。只有当我们把它们视为经过精心构建的估计值,而不是身份、判决或上限时,它们才最有用。

智商测量什么 分数与百分位 可靠性与效度 公正解读 互补证据 认知成长 尊重非凡的心智
核心理念

一种有用的信号,应结合语境解读

智力测验结果是在明确条件下完成特定认知任务时的表现样本。设计良好的测验组合可以提供有关广泛能力、可能的相对优势和支持需求的证据,也有助于指导教育或临床后续工作。它们的分数之所以有意义,恰恰是因为其结论范围有限且可以检验。1

正确的问题不是“智商重要,还是完整的人更重要?”两者都重要。认知能力会影响学习和许多人生结果,而尊严、道德价值、目标以及心智的全部丰富性,都不能被简化为一个分数。

非凡的智力可能承载非凡的重要性

更高且有效的分数,是被测能力中表现更强的有意义证据。这种差异很重要,不应被轻描淡写。当非凡的认知能力与好奇心、自律、知识和智慧结合在一起时,它可以使一个人对他人和社会具有非同寻常的重要性——帮助人们发现隐藏的联系、解决困难的问题、保存知识,并引导那些否则可能永远无法完成的工作。

单凭分数无法证明一个人的智慧、品格或成就,而基本的人类尊严平等属于每一个人。但平等的尊严并不要求我们假装所有能力或贡献都完全相同。罕见的智力和来之不易的智识成就,值得真诚的认可、保护与尊重。

解读常见的智商量表

许多当代综合分数的常模平均数为 100 以及标准差为 15下图展示了正态分布下的大致位置;标签和解读会因测验、版本、年龄和常模群体而异。

7085100115130
重要:在这一常见量表上,85和115大约分别比平均数低和高一个标准差。115并不意味着比100“聪明15%”:智商是类似区间尺度的标准化分数,而不是比率尺度。百分位表示相对位置,而不是答对百分比;每个观测分数都带有测量不确定性。
01

常模参照

该分数将表现与适当的标准化样本进行比较,通常是与年龄相近的人比较。它并不直接计量某种固定数量的“智力”。

02

一种估计,而非判决

信度从来都不是完美的。报告应显示置信区间,并说明细小差异是否超过预期的测量误差。

03

个人档案可能补充重要背景

跨广泛领域的可靠差异可能提示有关相对优势和支持需求的假设。孤立的分测验分数离散不应被视为诊断依据。

01 · 含义

智力测验实际测量什么

智力测验并非直接窥视人的心智。它通过标准化任务引出行为,以一致的方式对这些行为评分,并评估所得模式是否支持某种特定解释。

大多数综合性智力测试会抽样测量多个认知领域:处理新信息的推理能力、习得的言语知识、视觉空间分析、工作记忆和加工效率。这些任务上的表现呈正相关,因此可以用一个广泛的综合分来概括认知功能中相当重要的共同维度。2

这个综合分之所以有用,是因为它压缩了大量信息;也正因为如此,它是不完整的。动机、好奇心、创造力、情绪技能、实践知识、坚持不懈、健康、价值观和机会都可能影响一个人如何运用自己的能力,但它们并不等同于一般认知能力。

先看测量构念,再看数字

每个分数都需要有一句以“这一结果是关于……的证据”开头的话。句子的结尾应说明测量构念、适用人群、条件和预期用途。如果这句话变成“这个数字能告诉我们关于此人的一切”,那么解释就超出了证据所能支持的范围。

简明术语说明:测量构念是需要推断的能力;测验组合是一组任务;分测验用于抽样测量更窄的技能;指数整合相关的分测验;综合分概括更广泛的模式;而常模组是用于解释个体所处位置的参照样本。

避免常见误解的四个术语
术语 它代表什么 它不代表什么
原始分 常模转换前答对的题目数或获得的分数。 可用于比较不同年龄、版本或不同测试之间的直接可比测量值。
标准分 位于参照分布中的转换分数。 一个人所拥有的全部智力的百分比。
百分位排名 常模组中得分低于或等于该结果的大致百分比。 答对的百分比,或某个人“更聪明”的百分比。
置信区间 承认观测分数存在不确定性的一段范围。 保证某个隐藏的“真实分数”永久固定在该范围内。
02 · 测试质量

值得信赖的测试如何建立其权威性

精致的界面、困难的谜题或“AI 驱动”的标签,并不能使智力测试具有效度。信任必须建立在有记录的证据之上。

清晰的测量构念

开发者明确测试旨在测量哪些能力、有意排除哪些内容,以及哪些解释有证据支持。

标准化施测

指导语、计时、提示、评分规则和测试条件均受到控制,以确保结果具有可比性。

适当的常模

规模足够大且具有相关性的样本为解释提供参照。过时或匹配不佳的常模可能会扭曲个体所处的位置。

信度

对于预期作出的决策而言,各题目、不同版本、评分者或不同测量时机之间的分数一致性足够高。决策风险越高,所需的精确度也越高。

效度证据

内容、作答过程、内部结构、与其他变量的关系以及后果,共同支持所提出的解释和用途。

公平性与可及性

开发者会调查障碍、亚组表现和便利措施,然后说明证据薄弱的领域或不适合使用的情况。

信度是必要的——但还不够

一台总是差五千克的浴室秤具有良好的可靠性,但并不准确。同样,认知测验可能稳定地对表现进行排序,却不足以为据此作出的每一种解释提供正当性。专业标准将效度视为支持针对特定用途的特定解释的证据,而不是永久贴在测量工具上的标签。1

测量标准误与置信区间

由于测验是对行为进行抽样,观测分数包含不确定性。置信区间利用测验的信度和分数量表来表达这种不精确性。该区间无法涵盖所有可能的误差来源——例如睡眠不足、误解指导语、语言不匹配或不具代表性的测验状态——但比把单个数字呈现为精确值更为诚实。

一个简化示例

在经典测量理论中,测量标准误可以表示为 SD × √(1 − reliability)。在信度为 .95 的 SD-15 量表上,这约为3.35分。在这个简化示例中,观测到的120分对应的近似95%区间为 113–127

为什么“简化”很重要

真正的解释应使用测验手册中针对年龄、分数和版本的误差估计。测验量表不同区间的精确度可能有所差异,尤其是在极端分数附近。变化分数和差异分数也各自存在误差,不能仅根据任一分数的信度来判断。1

当两个指数分数存在差异时,测验者不应只问差异是否达到统计学阈值。这么大的差异在常模样本中出现的频率是多少?它是否在相关任务和个人经历中持续存在?它是否与转介问题相关?否则,一个看似戏剧性的剖面可能会变成由普通变异拼凑出的故事。

03 · 历史

用于支持的工具,一段进步的历史——也是关于权力的警示

智力测验并非以一种完整定型的形式出现。它的发展史包含人道主义的教育目标、重大的技术进步、缺乏依据的推断以及强制性滥用。理解这四个方面,有助于我们今天更好地使用测量工具。

1905–1908比奈–西蒙

一项包含30个任务的早期工具发展为更完整的按年龄分级量表,用于识别可能需要不同教学方式的儿童。

1912斯特恩商数

威廉·斯特恩提出“智商”:以估算的心理年龄除以实际年龄。

1916斯坦福修订版

刘易斯·特曼为美国改编并扩展了这套量表,使整数比率智商广为流行。

1939 年起韦氏测验组

成人测试结合言语和操作任务,并推进按年龄常模计算的离差评分。

如今能力构成 + 不确定性

现代测验组会依据明确的常模报告综合分数和领域分数,并提供信度与效度证据。

比奈与西蒙:表现于当下,而非永久的命运

1905 年,阿尔弗雷德·比奈和泰奥多尔·西蒙发表了一套颇具影响力的、包含 30 项任务的先驱量表;他们在 1908 年进行的更完整修订按年龄层级组织任务,与后来教材所描述的实用智力量表更为相似。这项工作源于法国社会关于如何识别并教育在普通课堂中学习困难儿童的争论。这些任务抽样考查理解、记忆和判断等能力,从而能够更系统地识别当前需求。34

这还不是现代智商测试,也不会产生施特恩后来提出的商数。比奈将这套量表描述为一种实用的等级体系,而非像物理长度那样的字面测量;他反对把低下的表现视为某种不可改变的量的证据。我们不应将这种谨慎浪漫化为“每种能力都能无限增长”的主张。它持久的价值更为简单:结果应当用于指导支持,而不应变成给人定下的判词。

施特恩、特曼与被称为智商的数字

1912 年,德国心理学家威廉·施特恩提出了 智力商数Intelligenzquotient)这一术语:估算心理年龄除以实际年龄。刘易斯·特曼在 1916 年的斯坦福修订版中采用了这一商数,将其乘以 100,并推动“智商”(“IQ”)在美国教育界广泛流行。56这些早期分数是比率智商,还不是今天的离差智商;后者是将表现定位于同年龄常模分布之中。

大规模测试与外推的危险

第一次世界大战期间,陆军甲种测试以集体方式测试具备英语读写能力的新兵,而主要采用图示的陆军乙种测试则面向读写能力或英语能力有限的新兵。该项目证明,心理测试可以大规模实施,并可用于实际分类。7

历史上的失败在于:将受语言、受教育程度、文化适应、样本选择和测试条件影响的分数,延伸为关于先天种族或国家等级的论断。卡尔·布里格姆对军队数据的 1923 年解读成为一个突出例子;到 1930 年,他否定了这些结论的比较基础。种族化的测试解读为更广泛的优生学和本土主义文化提供了貌似科学的权威,尽管声称军队测试直接促成了美国 1924 年《移民法》,是夸大了档案证据。89

教训在于精准、权利与自主权

优生学通过隔离、排斥和生育胁迫对生命进行等级排序,并剥夺人的自主权。通过教育、营养、医疗、安全保障和自主选择的练习来帮助人们增强认知能力,则恰恰相反:它扩大了人的自主权。当智力得到培养并被善加运用时,赞美智力成长与人类平等并不矛盾;但不应将智力与任何人享有尊严的权利混为一谈。

韦克斯勒与现代年龄常模剖面

大卫·韦克斯勒于1939年编制的韦克斯勒–贝尔维尤量表,旨在用于成人临床评估。它结合了言语和操作任务,并将成人与同年龄者进行比较,推动该领域摆脱了对字面意义上的心理年龄比率的依赖。WISC儿童量表于1949年问世,第一版WAIS则于1955年问世。10 后来的测验电池越来越多地将宽泛综合分数与可解释的领域分数结合起来,这种架构至今仍处于核心地位。

04 · 模型

一般能力与具体能力如何相互契合

一种广泛使用的心理测量学观点是层级式的:认知任务共享某些宽泛成分,但不同任务也需要更具体的能力。

一般因子的正向模式来概括这种现象, g

在一项足够有挑战性的认知任务中表现良好的人,平均而言往往也能在其他任务中表现良好。因素分析用一个通常称为 g这种模式是心理学中得到最多重复验证的发现之一。2

g 它是一种统计规律,而不是位于某个脑区中的微小实体;不同理论对于产生这种规律的机制也存在分歧。它的实用价值并不要求假装这些机制已经完全确定。

宽泛能力与狭窄能力

卡特尔–霍恩–卡罗尔等层级框架,将表现组织为一般层次、宽泛能力和更窄的技能。流体推理和习得知识是突出的例子;其他领域还可能包括视觉加工、短时工作记忆、提取流畅性和加工速度。11

CHC最好被理解为一种由心理测量学证据所支持的分类体系,而不是声称每种测验电池都完美地采用同一张结构图。

综合分数问的是:“哪种宽泛模式最有充分依据?”剖面问的是:“是否存在某些宽泛领域差异,足够稳定、少见且有多方面证据支持,可以用来指导假设?”
两种解释层次,而非相互竞争的定义

当具体分数足够可靠时,如果它们由不止一项任务体现,并且对于预期用途能在综合分数之外提供相关信息,就值得关注。当某个表面上的峰值或低谷取决于一项简短分测验时,就应少加关注。宽泛分数通常更可靠;较窄的分数可以帮助指导有针对性的后续评估,但不应想当然地认为它们具有教学或临床效用。

05 · Modern batteries

05 · 现代测验电池

当代智力测验可能评估的内容

不同测验电池在年龄范围、用途和理论基础方面各不相同。以下领域展示的是常见的测量目标,并非每项测验都共有的通用结构。
典型领域及其可以帮助回答的问题 领域 典型要求
解释时需谨慎 发现规则、推断关系并解决不熟悉的问题。 对谜题形式的既有熟悉程度、策略和指导仍然会产生影响。
习得知识/言语理解 运用词汇、概念和通过文化传承获得的知识。 语言、受教育程度和学习机会都是表现的重要组成部分。
视觉空间加工 分析、转换或构建空间模式。 视力、动作反应以及图表经验都可能影响结果。
工作记忆 在短时间间隔内保持并操作信息。 注意力、听力、焦虑和策略都会影响短时样本。
加工速度 在时间限制下准确且高效地完成简单的视觉判断。 动作速度、视觉获取能力和谨慎的反应风格都可能计入得分。
长期提取/流畅性 高效提取已学会的联结或生成信息。 知识基础、语言能力和针对特定任务的练习都会影响表现。

专业开发的测量工具包括斯坦福–比奈量表、韦氏量表、伍德科克–约翰逊认知测验、电夫曼测验和瑞文矩阵。仅凭品牌名称并不足够。适用的版本、年龄范围、语言、常模、施测者资质和预期用途都很重要。例如,目前美国使用的成人韦氏量表为 WAIS–5,但不同国家的可用性和获批准版本各不相同。12

筛查并不等同于全面评估

简短的筛查可以提示是否有必要进行更全面的评估。非言语矩阵任务可以在降低语言要求的情况下抽样测量抽象推理能力。在线测验可以具有娱乐性或教育意义。但这些工具都不会自动具备专业施测电池所具有的广度、受监督的施测条件、安全保密的题目、具有代表性的常模和解释性证据。

06 · 解释

如何阅读认知评估报告

一份负责任的报告会将数字转化为有界限的结论,检验其他可能的解释,并将结果与有用的行动联系起来。

从转介问题开始

  • 为什么要申请这项评估?
  • 使用的是哪项测验和哪个版本?它是否适用于当前情况?
  • 常模组由哪些人组成?常模数据是在何时收集的?
  • 施测和评分是否采用标准化程序?
  • 表现是否代表日常状态下的正常功能?

然后从总体到具体来阅读

  • 综合分与置信区间
  • 可靠且有意义的指数差异
  • 相互印证的分测验——而非孤立的高分或低分
  • 行为观察与测试条件
  • 与学习、工作和日常生活经历的一致性

全量表分数与指数分布

广泛综合分通常是概括总体表现最可靠的方式。较大且稳定的领域差异可以在此基础上提供具有临床相关性的信息,但表现分散本身并不能使综合分失效。不均衡的表现模式不会自动证明存在某种特定障碍,最高分也不一定就是此人的“真实 IQ”。检查者应判断这些差异是否具有统计可靠性、是否少见到值得关注,以及是否有独立证据支持。

表现具有情境性

睡眠不足、疼痛、急性疾病、焦虑、抑郁、药物影响、听力或视力障碍、运动要求、对语言不熟悉、教育中断、参与度低以及误解指令,都可能影响观察到的表现。其中一些情况正是所要考察的现实生活功能的一部分;另一些则是无关的障碍。解读时必须区分这些因素,而不是自动加分或扣分。

复测与练习效应

复测分数提高,可能反映了对题型的记忆、新策略、焦虑减轻或题目重叠。这些练习效应确实会改善测试表现,但不一定代表广泛的潜在能力有同等幅度的提升。效应大小取决于间隔时间、年龄、测试以及以往接触情况;使用平行版本并遵循适当的复测指导会有所帮助。17

询问有用的不确定性

一个好的解释可以这样表述:“在这一领域,表现估计处于这个范围;这一结果很可能具有意义,因为这些任务彼此一致,也与此人的经历相符。这些情况可能影响了结果。以下是这一发现提示我们下一步可以尝试的方向。”

07 · 预测力

IQ 能预测什么——以及不能预测什么

总体认知能力具有重要影响。它预测的是群体中的概率,而不是为个人预先决定的人生经历。

学习

推理、知识和记忆有助于理解指令、联系观点并掌握复杂技能。认知能力与学校表现存在显著关联。2

复杂工作

总体心理能力可以预测工作表现,尽管修订后的荟萃分析估计值比一些早期说法更为适中。14

生活导航

在不同人群中,更强的认知表现与受教育程度、职业复杂度以及某些健康和长寿结果相关。这些联系通过许多个人和社会路径产生;它们并不能决定某个人的未来。2

相关性不是个人预言

相关性描述的是变量在一个群体中通常如何共同变化。它并不表示某个分数本身会导致某种结果,也不表示拥有相同分数的人都会过同样的人生。教育质量、健康状况、家庭资源、人格、兴趣、歧视、动机、关系、价值观和偶然因素,都会影响人们获得哪些机会,以及如何运用自己的能力。

即使存在很强的关系,个体差异仍有极大的空间。反过来,说智商“不是一切”,也绝不应被曲解为它什么都不是。支持理解、推理和学习的能力值得受到保护、培养和肯定。

让结论与证据相称
证据可以支持 证据本身无法支持
对经选择的一般认知能力和特定领域认知能力的估计。 对意识、人格、智慧或创造力的完整描述。
针对经过验证的人群,对相关结果作出的概率性预测。 对某个人未来的确定性预测。
识别某些学习优势、需求或差异。 仅凭这一点自动作出诊断或教育安置,而不结合其他证据。
在考察方法、常模、不确定性和重测效应后,对变化的证据。 认为每次分数变化都代表广泛的智力成长——或认为成长不可能。
提供挑战、机会、认可或有针对性的支持的理由——并保护罕见能力,使其不被浪费或无谓地伤害。 对人的尊严或基本权利的完整排名;这些并不是通过心理测量分数授予的。
08 · 公平性

文化、语言、残障与可及性

公平性不是最后才做的装饰性检查。对于这个人群、这个群体和这一目的而言,拟议的分数解释是否有效,公平性是其中的一部分。

没有任何评估完全脱离文化背景。语言、受教育经历、对测试的熟悉程度、视觉惯例、技术使用条件、对速度的期待、动机以及与权威的关系,都可能影响表现。这并不意味着每种分数差异都是“偏差”,群体差异也不能证明存在偏差或先天能力差异。实证问题在于:无关障碍是否实质性地扭曲了测试 intended 测量的构念。

社会环境会影响表现——但效应大小并非普遍一致

担心确认某种负面群体刻板印象,有时会在测试过程中分散注意力或改变参与方式。研究者将其称为刻板印象威胁。一项针对18岁以下女孩在数学、科学和空间能力测试中表现的元分析发现,平均效应较小,但存在严重的发表偏倚迹象;不应将这些结果概括为适用于每个群体或每种分数差异的单一宏大解释。34更广泛的实践启示是:尊重性的施测、心理安全感,以及公平理解任务的机会,都能提高对所有人的证据质量。

公平性必须从多个层面进行调查
层面 要提出的问题
可及性与施测 当不存在无关的语言、感官、动作或技术障碍时,此人能否感知、理解并作答?
题目 不同群体中能力相同的成员,回答某一道题正确的概率是否不同?
量表/构念 对于预期的比较而言,其基础结构在不同群体间是否具有足够的可比性?
常模 参照样本是否相关、较新、具有足够代表性,并且描述是否透明?
决策/结果 该分数能否预测相关标准,并以可接受的准确度对人员进行分类,包括处于临界分数附近的人员?

差异项功能是一个需要进一步调查的信号

差异项功能(DIF)是指:来自不同群体、但在所测能力上匹配的人,对某题以特定方式作答的概率仍然不同。DIF并不能自动证明存在偏差:审查者会考察其程度、内容、可能原因及其对总分的影响。自动删除每一道被标记的题目,也可能损害内容覆盖面。

测量不变性所要回答的是:比较是否具有相同含义

测量不变性分析考察测验的因素结构、关系和分数水平是否在不同群体间具有足够的可比性。不同程度的不变性支持不同的结论;足以比较关联关系的证据,未必足以支持群体均值比较。不变性是有价值的基于模型的证据,但并不能证明所有社会或测量问题都已消失。21

翻译不等于适应

翻译一项评估所需保留的不只是词语。构念含义、说明、示例、图形、作答形式、评分、常模和施测过程都需要接受文化与实证审查。回译有助于发现差异,但单靠回译无法确立等值性。国际测验委员会的指南建议采用多学科专业知识、开展试点工作,并在题目、方法和构念层面收集证据。20

“非言语”意味着降低语言要求,而不是排除情境影响

矩阵推理等测验可以降低对词汇和后天习得的言语知识的依赖。但其说明、抽象视觉规则、速度、动作反应和对谜题的熟悉程度仍会反映个人经历。与言语测量一样,它们需要相同的、针对特定人群的信度、效度、常模化和公平性证据。

便利措施

旨在消除与构念无关的障碍,同时保留分数含义的变更。它应根据个人情况制定、记录在案,并有证据支持。

修改

改变了目标构念或标准化比较的变更。它可能更人性化且更有用,但由此产生的分数可能无法与原有常模进行比较。

当速度与测量目标无关时,延长时间可能保留可比性;当加工速度正是要测量的构念时,延长时间可能改变分数的含义,或使标准的限时常模不再适用。对口译员、朗读员、记录员、替代界面和简化说明也应采取类似的谨慎态度。相同的施测方式并不总是公平;改变施测方式也不会自动使其有效。22

公平性既需要社区知识,也需要心理测量证据

与教师、家庭和社区成员协商,可能有助于发现措辞中难以理解的内容、缺失的本地知识或远方开发者容易忽视的有害假设。此类意见应为有据可查的无障碍性、标准化、信度、效度和结果研究提出假设;但其本身并不能确立公平性。120

09 · 决策

利害关系越大,保障措施就应越有力

同一个分数可能足以用于研究群体模式,却远远不够精确到可以决定某个人的教育、诊断、就业或服务获取资格。

心理测验是评估的一部分。具有重要后果的结论应整合转介问题、个人和发展史、观察到的行为、相关记录及其他测量,而不应任由一个数字悄然成为决定依据。13

1

使用多种来源

将认知结果与相关的学业成就、经历、观察、访谈、作品样本或适应功能证据结合起来。

2

尊重不确定性

考察置信区间、差异的可靠性,以及任何阈值附近的分类误差。

3

检查适配性

确认语言、常模、无障碍性、施测者能力,以及针对该人群和该用途的效度证据。

4

开辟前进之路

结果应当引导人们提供适当的挑战、支持、教学或进一步探究,而不是成为阻断前路的标签。

智力障碍不能仅凭智商诊断

当代定义要求在智力功能和适应行为两方面都存在显著局限,并且始于发展期。适应行为涵盖日常生活中使用的概念、社交和实践技能。文化、语言、社区期望、优势和支持需求也很重要。23接近70的分数可能提供重要证据;但它本身不足以构成诊断。

天赋以及获得高级学习机会的资格也需要相互印证的证据

较高的认知分数可以识别出需要接受挑战的卓越推理能力和学习能力。但僵化地使用单一分界点,可能会漏掉因语言、残障、教育机会或能力结构不均衡而导致综合分数受压低的学习者。采用多种测量方式可以同时改善识别和规划:领域分数、学业成就、作品集、教师证据、学习速度以及已展示的创意作品,都可能与项目所声明的目标相关。

人员筛选与就业

在就业中使用认知测试时,所测能力应当能够证明与工作相关,实施程序应遵守适用法律,并应审查不利结果。群体层面的预测相关性并不能免除组织在无障碍、公平、隐私、透明度或人工复核方面的责任。

永远不要让临界值假装是自然事实

行政阈值是人们将不确定的测量结果应用于分类时作出的决定。在临界值附近,健康状况、常模、测试版本或测量误差的细微变化都可能改变分类。分数越接近具有实际后果的界限,佐证证据和复核就越重要。

10 · 更广泛的仪表盘

互补性评估回答不同的问题

对不完整测量的回应,不应是更加含糊的“全人分数”。正确的做法是有目的地组合一组测量,每项测量只用于评估其能够有效揭示的构念。

保持测量彼此区分

保持不同证据的区分。认知能力、学业成就、执行功能、适应性行为、创造力、情绪技能和已展示的工作成果并不是可以取平均值合成一个总分的同类成分。仪表盘式呈现能够保留每项结果的含义,并揭示任何决策背后的价值判断。

选择与问题相匹配的方法
方法 最佳问题 重要限制
学业成就评估 这个人在阅读、数学、科学或其他领域学到了哪些知识或技能? 反映课程、教学、语言和学习机会,而非纯粹的能力。
执行功能任务和评价 这个人在任务或日常生活中如何抑制反应、转换注意、维持目标并管理工作信息? 简短的实验室任务和现实生活中的评价往往反映不同方面,不应视为等同。25
适应性行为量表 这个人在日常生活中多么独立且有效地运用概念、社交和实践技能? 评分取决于机会、情境、期望和信息提供者;多方来源很有价值。
动态评估 在提示、教学或支架支持下,这个人的表现如何变化? 实施时间更长且不够统一;改善效果可能仅限于特定任务,并且取决于评估者。26
创造力评估 这个人能否在特定领域生成、评估并改进原创且有效的想法? 发散思维任务抽样评估的是创造潜力,而不是完整的创造经历或未来成就。
情绪技能测量 这个人感知、理解或管理情绪信息的能力如何——或者,他们如何描述自己通常的情绪倾向? 能力测试、特质自评和混合型“情商”模型测量的是不同的构念。
作品集和工作样本 这个人随着时间真正写过、设计过、建造过、完成过或解决过什么? 结果可能受到筛选、指导、资源和评分者判断的影响;统一的评分标准和多次取样有助于提高可靠性。

执行功能:任务表现与日常调节

执行功能包括彼此可区分但相互关联的目标导向控制方面,通常通过抑制、转换和工作记忆更新来描述。表现任务可以揭示受控条件下的信息处理;自我、家长或教师评分则可以展现日常目标追求中的表现。两者的一致性有限,这意味着出现分歧是有信息价值的,不一定是错误:这些方法可能取样于行为的不同层面。2425

动态评估:观察学习过程,而不只是观察起点

测试—教学—再测试程序和逐步提示会考察学习者如何回应指导。这可以揭示静态分数无法体现的策略、所需支持类型和应对指导的能力。当既往机会、语言或教学经历使解读变得复杂时,这种方法尤其有用。不同方法和人群所得证据不尽相同,因此动态评估是对标准化证据的补充,而不是消除偏差的替代方案。

创造力:原创性与有效性的结合

创造力不仅仅是提出许多不寻常的答案。在严肃的评估中,想法还必须在某个领域内有用、有效或恰当。可以结合开放式任务、实际作品、作品集、专家评分以及创作活动记录进行评估。认知能力与创造性成就呈正相关,但远非完全相同,这正是两者都能提供额外信息的原因。2728

情商:明确所采用的模型

能力情商

旨在评估感知、运用、理解或管理情绪信息的表现任务。

特质情商

与情绪相关的自我报告典型倾向和自我认知。

混合模型

更广泛地结合技能、人格、动机和社会行为,通常以一个EQ标签进行营销。

不应把这些类别当作同一量表来比较。情绪技能可以促进人际关系、学习和表现,而认知能力测量的是不同方面。证据表明,情商测量与学业表现之间存在中等程度的关联;在考虑认知能力和人格之后,其额外预测力有限,具体取决于所使用的测量工具。2930

多元智能:一种人性化的启发,而非经过验证的诊断图谱

霍华德·加德纳的框架鼓励教育工作者关注音乐、身体、人际、空间等能力,以及其他过于常被狭窄课堂常规忽视的优势。这一教育理念可能很有价值。然而,现有证据并未证明所提出的各种智能是彼此独立的心理测量系统,流行的在线“多元智能测试”也不应把儿童固化为某种学习风格标签。应利用这一框架拓展机会,而不是取代经过验证的认知或技能评估。31

智商估计的是认知表现中广泛而有用的模式。成就体现后天习得的掌握程度;执行功能测量抽样反映控制能力;适应性量表展现日常功能;动态评估显示对教学的反应;创造力和情绪测量反映其他能力;作品集则展示一个人实际创作或完成的成果。
没有任何单一结果能构成完整画像
11 · 成长

智力——以及智商——能够增长吗?

是的——但这些是不同的主张。认知能力可以发展,按年龄制定常模的智商也可以变化。要证明持久且广泛的成长,需要有超越成熟过程、测量误差、常模变化以及对某项测验熟悉度的证据。

成长值得庆祝

当人们扩展知识、学会应对陌生问题进行推理、改进记忆策略,或获得更快、更准确地理解世界的认知工具时,这些益处可以延伸到教育、工作、决策、人际关系和独立生活。

测量应帮助我们认识并承认成就——不应因为智力部分稳定而否定成就,也不应因为一次练习后的分数上升就夸大成就。

教育拥有最有力的广泛证据

一项强调准实验设计的大型荟萃分析发现,在超过60万名参与者中,多接受一年教育的平均收益估计约为1–5个智商点,具体取决于研究设计和假设。无论在广泛的认知类别中,还是在人生各个阶段,都能观察到这种效应。15

这是对人群的估计,不是对每个人每年的承诺,也不是无限延伸的线性规律。它有力地证明,不应把测得的智力视为一成不变。

稳定与变化可以并存

认知能力从童年到成年会表现出越来越高的次序稳定性:相对于同龄人而言,人们通常会保持大致相近的位置。这并不意味着绝对表现从不改变、环境无关紧要,或群体平均水平不会变动。近期最全面的荟萃分析发现,从青春期后期到成年期的大部分阶段,这种稳定性很高,但并非完美。19

不同世代的人群得分发生了变化

在20世纪的大部分时期,许多智力测验中的表现都有所提高——这就是弗林效应。一项涵盖31个国家的荟萃分析发现,增长幅度因认知领域、地区和时期而异,而近几十年的趋势较弱。16这也是测验需要定期重新制定常模的原因。但这并不意味着每一代人在各个方面都更明智,也不存在适用于所有分数的“每十年增加3分”这一通用修正。

并非每一种增长都代表同样的结论
提升类型 发生了什么变化 最佳证据
练习提升 重复或高度相似题目上的表现。 有助于掌握该任务;没有更多证据时,不要推断存在广泛迁移。
技能提升 经过训练的领域,例如算术、词汇、空间策略或注意力训练。 对同一技能的未练习测量,以及持续的现实表现。
广泛的认知提升 能力可以迁移到差异显著的任务或领域。 替代性测量、尽可能设置主动对照,以及随时间进行随访。
常模智商变化 相对于同龄人的水平变化。 具有可比性的最新常模;置信区间;可靠变化和重测数据。

大脑训练:重视真实收益,诚实地命名

商业认知训练通常能改善受训练的任务,有时也能改善密切相关的任务。在控制良好的综述中,向一般智力的远迁移通常较弱或不一致。18 特定领域的提升仍可能有用。精准表述有助于保护进步:把每一种提升都称为“更高的智商”,会让真正的改善更难被识别。

支持学习与认知功能的条件

深度学习

深入建立知识,反复提取、解释、联系并将其用于解决新问题。

保护大脑

优先保障睡眠、身体健康、运动、营养和安全,并治疗影响注意力或学习的障碍。

寻求挑战

在反馈、支架支持和足够的巩固时间下,完成略超出当前掌握水平的任务。

追踪迁移

关注在新任务、实际工作和日常理解上的持久改善,而不只是熟悉的练习。

基因会影响认知差异,但遗传力是在特定环境范围内针对群体的统计指标;它不是某个人的智力有多少百分比“由基因造成”,也不说明教育无法发挥作用。2 稳定性描述的是一种模式。这并不意味着成长是不可能的。

12 · 原创性与归属感

独处可以孕育想法;群体可以帮助想法存续

原创思维与社会联结并不相互排斥。它们往往属于同一创作周期的不同阶段。

受保护的漫游

独处时,注意力可以摆脱即时指令、群体期待和回应压力。一个人可以追随一个奇怪的问题,容忍一个尚未完成的想法,并在他人界定任务之前将各种想法联系起来。

在群体中,同时进行的想法生成可能会受到产出阻塞的限制——在等待发言时思绪逐渐消退——也可能受到评价焦虑或个人贡献减少的影响。32 早期示例还可能导致协作性固着,使人们在独特的思路尚未形成之前,就缩小了探索范围。35

主动回归

当一个想法已经成形到足以分享时,其他人往往会变得有价值,甚至不可或缺,用于检验、发展和传播。他们可以质疑假设、贡献知识、测试成果、提供资源、改进沟通、打开机会之门,并帮助创作者避免盲点。在三项受控的脑力写作实验中,交替进行个人和小组环节比始终采用其中一种模式产生了更多想法——这表明在实验室创意构思中,灵活循环可能更有效,但并不意味着对所有创意工作而言都存在一种普遍最佳的环境。33

主动选择回归本身可以成为一种庆祝:私密的火花遇见认可、支持与共同努力。一个人的思想不必始终孤独,才能保持原创性。

给原创性足够的独处时间让它成形,也给它足够的社群支持,让它成长、传播、获得支持并受到赞赏。
独立与归属的节奏

任何一个阶段都不应变成命令。独处可能变成孤立;协作可能变成从众。有些人通过对话思考得最好,有些人在安静中思考得最好,还有许多人会在两者之间交替。健康的模式是灵活的:当无拘束的思考需要保护时,可以不带羞耻地暂时退开;当渴望关系、批评和共同创造时,也可以不带羞耻地重新回归。

当人们免受羞辱、胁迫和持续打断时,他们能够在不抹去差异的情况下相互支持智力成长。智力不再只是个人优势:它成为一种通过教学、发明、关怀、坦诚的分歧和集体解决问题而共享的能力。

13 · 实际应用

选择并准备测评

从必须改进的决策开始。抽象意义上的“最佳测评”,可能并不适合这个人、这个问题或这个司法管辖区。

01

明确目的

临床诊断、教育规划、资优鉴定、残障支持、研究和个人兴趣需要不同的证据和精确程度。

02

匹配个人

确认年龄、语言、文化背景、感官和运动方面的使用条件、沟通需求、数字工具熟悉程度以及相关常模的代表性。

03

匹配决策

询问测评手册和独立标准是否支持这一确切解读,以及是否需要其他证据。

测评前

  • 请具备资质的专业人士进行临床、教育或其他具有重大影响的解读。
  • 分享相关的语言经历、教育背景、诊断结果、用药情况、便利措施和以往测评经历。
  • 询问所选测评组合评估哪些构念、采用哪些评分方式以及使用哪些比较群体。
  • 保持正常的睡眠、饮食、处方治疗和感官辅助设备的使用;不要在最后关头进行所谓的“智商准备”。
  • 如有异常疾病、疼痛、痛苦或中断,请予以说明,以便在适当情况下考虑延期。

测评过程中

认真作答,说明指令不清楚的地方,并报告获取测验的障碍。不要寻找泄露的题目或反复练习受保护的测验内容:这会损害结果的意义。对益智题的日常熟悉属于生活经验的一部分;针对受保护题目的辅导会改变分数所能支持的推断。

测评结束后:值得提出的问题

  • 综合估计值及其置信区间是多少?
  • 哪些特征差异是可靠的、不常见的,并且具有实际意义?
  • 哪些测验条件可能影响了表现?
  • 结果与个人经历及其他证据的吻合程度如何?
  • 这项测验没有测量什么?
  • 这些分数可以合法且合理地为哪些决策提供依据?
  • 接下来应当采取什么挑战、支持措施或进一步评估?
  • 什么时候重新测验会有帮助,以及如何处理练习效应?

个人好奇心也需要背景信息

值得信赖的测评可以带来有价值的自我认识。把这个数字视为一个坐标,然后问问自己它能帮助你做什么:选择合适的挑战、培养较弱的技能、负责任地运用优势并持续学习。追逐微小的分数差异,可能会让测量焦虑取代发展。

14 · 展望未来

更快的测验不应意味着证据更薄弱

自适应平台、过程数据和人工智能可能改善测量,但效率不等于效度,预测也不等于理解。

计算机自适应测验

算法会根据先前的回答,从经过校准的题库中选择下一道题。这种方式可以用更少的题目达到相近的精确度,但它是一种测评实施方式,而不是一种新的智力形式。

过程数据

作答时间、修改、策略变化和回答顺序可能揭示解决方案是如何形成的。这些信号需要独立验证,而且可能引入技术操作或运动能力方面的要求。

AI 辅助解读

系统可以检测模式、起草报告或提出假设,但不得隐藏不确定性、捏造诊断、再现训练数据偏差,也不得取代负有问责责任的专业判断。

负责任的创新必须让哪些内容清晰可见

  • 测量构念:根据哪些可观察行为推断出什么。
  • 训练数据和常模数据:哪些人被纳入,哪些人缺失,以及数据最近是在何时收集的。
  • 不确定性:按分数范围、子群体和决策阈值划分的精确度。
  • 公平性:题目功能、可及性、差异性预测以及后续错误。
  • 隐私:哪些敏感的认知和行为数据被存储、关联、保留或共享。
  • 问责:谁能够解释、质疑并纠正具有重大影响的结果。

更多行为数据可以同时带来更详细的模型和更大的隐私风险。语音、击键、注视、延迟和互动模式可能会揭示超出既定目的的残障、健康或身份信息。因此,数据最小化、知情同意、安全性和有意义的申诉机制都应纳入测试设计,而不是塞进一段无人阅读的结尾文字中。

面向未来的标准

更好的评估并不是产生最多数字的评估,而是能够以足够的精确度回答重要问题、减少无关负担、揭示自身局限,并带来更好的机会或支持的评估。

15 · 清晰的结论

常见误区——更正

当绝对化的说法被替换为有边界的说法时,大多数关于智商的争论都会变得更加清晰。

误区:智商毫无意义。
更正:经过充分验证的测试可以估计重要的认知能力,并以概率方式预测相关结果。
误区:智商衡量的是完整的心智。
更正:它抽样测量经过选择的一般能力和特定能力;创造力、价值观、人格、情绪和生活经验形成的专长,则需要其他证据。
误区:120意味着比100聪明20%。
更正:标准化智商不是比率尺度。差异反映的是个体在常模分布中的表现位置。
误区:分数是精确的。
更正:每个分数都有测量不确定性,应结合背景局限,将其解读为一个范围。
误区:智力是固定不变的。
更正:认知差异可以保持稳定,同时教育和支持性环境仍能带来真实的发展。
误区:每次重测得分提高都意味着一般智力更高。
更正:练习、策略和焦虑减轻可以提高分数;广泛的成长需要迁移、坚持以及可靠的变化证据。
误区:非言语就意味着不受文化影响。
更正:非言语形式减少了部分语言要求,但仍会受到教学、经验、获取机会和测试熟悉度的影响。
误区:群体差异证明存在偏见。
更正:差异需要调查。公平性取决于对题目、构念、常模、预测和后果的证据。
误区:尊重高智力就必须声称其品格更高。
更正:智商不会自动证明一个人有智慧或美德,但它可以揭示罕见的认知能力。这种能力,以及培养这种能力的终身努力,可能具有非凡的实际重要性,值得认真尊重。

结论:衡量重要的事物,然后助其成长

智商测试既不是判决,也不是幻觉。设计完善、常模适当的评估可以对一般认知能力和特定认知能力提供有用的估计。这些能力很重要:它们有助于更快学习、更深入理解、适应性推理,以及解决日益困难的问题。

这一估计仍是有条件的。它存在不确定性,反映的是特定样本的行为,无法囊括完整的个体。公平使用要求采用适当的常模、提供可及的实施方式、拥有支持预期解释的证据,并在后果重大的情况下保持克制。补充性评估应当拓宽整体图景,而不应假装所有受重视的能力都能归结为一个隐藏分数。

最重要的是,测量应当服务于发展。教育能够增强认知表现;健康与安全能够保护大脑;挑战、反馈与练习能够积累知识和技能;独处能够守护原创思想;社群能够帮助它成熟并走向世界。珍视持久的认知成长——当迁移、持续性、练习效应和测量误差都得到处理后,也珍视经验证的智商提升——然后运用更强的能力,加深理解、扩大机会并改善生活。

谨慎测量智力,助力其成长,并保护承载智力的人。珍视卓越能力、终身学习、原创思想和积累的智慧。为已经发展起来的心智提供其所需的健康、自由、独处、社群、挑战与尊重——因为当这样的心智受到忽视或消逝时,人类可能会失去任何财物或数据库都无法简单替代的指导、理解与可能性。

证据库

来源与延伸阅读

本指南所采用的主要标准、官方指导、历史记录和同行评审研究。

  1. AERA、APA 与 NCME。教育与心理测验标准(2014 年)。
  2. Deary、Cox 与 Hill。遗传变异、大脑与智力差异。《分子精神病学》(2022 年)。
  3. Brysbaert 与 Nicolas。心理学教科书中关于比奈及智力测验起源的两个长期流传的误解。《Collabra:心理学》(2024 年)。
  4. 比奈与西蒙。儿童智力的发展(1908 年,法文原版)。
  5. Kovacs 与 Pléh。威廉·斯特恩:“差异心理学”计划对当代智力测量与研究的相关性。《智力学杂志》(2023 年)。
  6. Terman。智力的测量(1916)。
  7. 美国国防部。军事测试史
  8. Warne 等。Stephen Jay Gould 对《人类的误测》中陆军乙种测试的分析:关于一项开创性心理测试的曲解与误解智力杂志(2019);Brigham。移民群体的智力测试心理学评论(1930)。
  9. 美国国立人类基因组研究所。优生学与科学种族主义;Snyderman 与 Herrnstein。智力测试与1924年《移民法》(1983)。
  10. Boake。从比奈—西蒙到韦氏—贝尔维尤临床与实验神经心理学杂志(2002)。
  11. McGrew。卡罗尔三层(3S)认知能力理论诞生30周年:影响、3S-CHC理论阐释、结构复制以及认知—成就心理测量网络分析扩展智力杂志(2023)。
  12. Pearson 测评。韦氏成人智力量表第五版
  13. 美国国家科学院。用于残疾认定的心理测试(2015)。
  14. Sackett 等。重新审视人员选拔效度的荟萃分析估计:解决对范围限制的系统性过度校正问题应用心理学杂志(2022)。
  15. Ritchie 与 Tucker-Drob。教育在多大程度上提高智力?一项荟萃分析心理科学(2018)。
  16. Pietschnig 和 Voracek。全球智商增长的一个世纪:弗林效应的正式荟萃分析《心理学科学视角》(2015 年)。
  17. Scharfen、Peters 和 Holling。认知能力测验中的重测效应:荟萃分析《智力》(2018 年)。
  18. Simons 等。“脑力训练”项目有效吗? 《公众关注的心理学科学》(2016 年)。
  19. Breit 等。认知能力的稳定性:纵向研究的荟萃分析综述《心理学公报》(2024 年)。
  20. 国际测验委员会。测验翻译与改编指南(第二版)(2017 年)。
  21. Putnick 和 Bornstein。测量等值性的惯例与报告《发展评论》(2016 年)。
  22. 欧洲心理学家协会联合会。EFPA 测试评审模型,2025 年版
  23. 美国智力与发展障碍协会。智力障碍的定义
  24. Miyake 等。执行功能的统一性与多样性《认知心理学》(2000 年)。
  25. Toplak、West 和 Stanovich。基于表现和评分的执行功能测量《儿童心理学与精神病学杂志》(2013 年)。
  26. Swanson 和 Lussier。关于动态评估实验文献的选择性综述《教育研究评论》(2001 年)。
  27. OECD。PISA 2022 创造性思维框架
  28. Karwowski 等。智力测试表现与创造性成就有何关联?一项元分析智力杂志(2021)。
  29. O’Connor 等。情商的测量:对相关文献的批判性综述及对研究人员和实践者的建议心理学前沿(2019)。
  30. MacCann 等。情商可预测学业表现:一项元分析心理学公报(2020)。
  31. Waterhouse。多元智力、莫扎特效应与情商:一项批判性综述教育心理学家(2006)。
  32. Mullen、Johnson & Salas。头脑风暴小组中的生产力损失:一项元分析整合基础与应用社会心理学(1991)。
  33. Korde & Paulus。交替进行个人与小组创意生成:寻找难以捉摸的协同效应实验社会心理学杂志(2017)。
  34. Flore & Wicherts。刻板印象威胁是否会影响女孩在刻板印象领域中的表现?一项元分析学校心理学杂志(2015)。
  35. Kohn & Smith。协作性固着:他人想法对头脑风暴的影响应用认知心理学(2011)。

教育与评估说明:本文提供一般信息,不构成个人诊断、分数解读、法律意见,也不能替代由合格心理学家或其他具有相应资质的专业人士进行评估。测试选择、便利措施、资格规则和法律要求会因地点和用途而异。

继续探索
返回“智能释放”中心
返回博客