智力理论
Linas Juozenas分享
释放智力 · 基础知识
Theories of intelligence from g to CHC—and beyond
为什么不同心理任务上的表现往往会共同变化?为什么同一个人在一种环境中能够出色推理,却可能在另一种环境中举步维艰?斯皮尔曼、斯滕伯格以及卡特尔–霍恩–卡罗尔传统从不同问题出发。将它们放在一起阅读,可以同时看清认知测验可靠检测到的结构,以及任何单一得分都无法涵盖的智能行动部分。
这是一份关于论证的指南——不是一场非要决出唯一赢家的比赛
这些模型彼此重叠,但提出的并不是同一种类型的主张
斯皮尔曼的传统关注的是:什么解释了认知测验之间的正相关?CHC对这些相关性中显现的一般、广泛和狭窄能力进行分类。斯滕伯格关注的是:当新颖性、经验和社会背景都很重要时,人们需要什么才能追求有价值的目标。当某一层面的答案被当作智力的完整定义时,混淆就开始了。
心理测量模型之所以强大,是因为它们能压缩数据中可重复的模式。它们可以帮助预测学习与表现、设计均衡的测验组合,并描述相对认知优势。但它们本身无法解释每一种相关性的生物学或发展原因;无法测量智慧、动机、品格或人的价值;也无法告诉教师、雇主或临床医生什么决策才是公平的。
01 · 界定争论
三个问题,三张地图
当允许每个框架回答其本来要回答的问题时,就最容易理解这些框架。
智力理论可以描述个体差异的结构,提出心理过程,解释发展,或界定有效行动。这些是彼此关联的研究方向,但不能相互替代。斯皮尔曼理论和 CHC 理论主要属于心理测量学范畴;斯滕伯格的理论则更加宽泛,强调功能和情境。
为什么测验分数之间存在相关性?
斯皮尔曼提出,每项认知测验都反映了一般因素 g,以及该任务特有的影响因素。他最持久的发现是正向流形:在平均意义上,一个人如果在某项认知任务中表现良好,往往也会在其他任务中表现良好。1
是什么使思维有效?
三元理论考察心理成分、经验与情境之间的互动。其广为人知的分析性、创造性和实践性能力,描述的是运用智力的方式,而不是简单地用三个彼此独立的分数取代智商。
| 层级 | 问题 | 证据可以确立什么 | 它单独无法确立什么 |
|---|---|---|---|
| 观察 | 哪些任务存在协变关系,其程度如何? | 在特定样本中可重复的相关模式。 | 这种模式的成因或其道德含义。 |
| 统计或结构模型 | 指定的因素、网络或其他模型能否以简约的方式表示这些关联? | 所选结构在多大程度上再现了观测数据,以及残差失配仍存在于何处。 | 这种统计拟合识别出了唯一的因果机制。 |
| 解释性理论 | 哪些过程和发展性互动产生了这种表现? | 在不同任务、时间、干预和人群中检验预测。 | 不能仅仅因为解释符合情况,就认为某项决策规则是公平的。 |
| 应用 | 分数应如何影响教学、诊断或选拔? | 该用途的效度、信度、公平性、后果和替代方案。 | 仅凭另一种情境中的相关关系制定普遍政策。 |
这些框架是观察视角,而不是人的等级体系
一个人可能表现出很强的抽象推理能力,却缺乏相关知识;可能拥有深厚的专业知识,但加工速度较慢;也可能具备原创性的实践判断力,而定时测验几乎无法测量这种能力。这些模式很重要。但它们都不能决定谁的利益应被重视、谁的声音值得尊重,或谁拥有平等的人权。
02 · 正确解读统计数据
因素分析能告诉我们什么——以及不能告诉我们什么
在争论……之前 g,它有助于区分原始表现、标准化分数、相关关系和潜在因素。
设想一个包含词汇、矩阵、空间旋转、记忆和速度任务的测验组合。每项任务都会产生一个观察得分。当对许多人的得分进行相关分析时,通常会出现一种熟悉的模式:大多数相关都是正的。因素分析用少量未观察变量来表示这种协方差。其结果是对该样本中个体差异的一种严谨概括,而不是对某种名为智力的物质进行扫描。
-
抽样表现。 任务在内容、指令、语言、时间限制,以及感官和运动要求方面各不相同。测验组合决定了哪些因素有机会被计入。
-
估计关系。 研究者考察人们的相对表现是否共同变化。相关描述的是不同人之间的关联;它并不表示一项任务会导致另一项任务。
-
明确模型。 可以拟合单因素模型、相关因素模型、高阶模型、双因素模型或网络模型。关于任务、计分、估计方法和约束条件的选择都会影响结果。
-
检验推广性。 在一个数据集中的拟合并不足够。一个有用的模型应当具有可解释性、可重复性,在其用途所需范围内足够稳定,并在相关的不同年龄、语言、群体和条件下接受检验。
-
验证预期用途。 最终的问题并不是笼统地问“这个测验有效吗?”,而是问“对于这一人群和这一目的,这些分数的解释及据此作出的决策是否得到支持?”37
为什么这种多面现象存在
共同原因是一种解释。相互重叠的过程、发展上的相互促进,以及能力相互作用的网络,也能产生正相关。仅凭统计拟合,通常很难在这些因果叙事之间作出决定性选择。
“潜在”并不意味着隐藏的生物器官
潜变量并不是直接观察到的。它的含义来自模型、指标和外部证据。将 g 作为一个有用的统计维度,这与人们对于它究竟反映一种因果能力、多种相互重叠的过程、相互促进的发展,还是这些因素的某种组合存在分歧,并不矛盾。
03 · 斯皮尔曼的出发点
一般因素与任务特定影响
斯皮尔曼1904年的论文提出了一种方法和一个假设,重塑了心理测量。
研究学校成绩和感觉辨别测量时,查尔斯·斯皮尔曼认为,智力表现之间的相关可以由一个共同的一般因素,加上每项任务各自的特定因素来解释。他将一般因素称为 g 以及任务特定成分 s.1
一般方差
不同任务共同拥有的个体差异部分。在因素模型中,每项任务都有一个载荷,用来表示其与一般因素的关系。
特殊方差与群体方差
表现还取决于更窄的能力、习得的方法、任务内容和作答要求。后来的证据表明,需要引入中间层面的“群体”因素,而斯皮尔曼最简单的双因素理论并未充分容纳这些因素。
误差与测验情境
疲劳、分心、误解、练习、计分不精确和偶然因素都会影响观测分数。可靠的评估会尽可能将信号与噪声分开,但永远无法消除不确定性。
持久的洞见并不是每个人的头脑中都包含固定数量的“心理马力”,而是多种认知表现共享方差——任何充分的理论都必须解释其原因。
斯皮尔曼之后发生了什么
研究者反复发现了一些比单个任务更宽泛、但比 g:言语、空间、记忆、速度及其他领域。路易斯·瑟斯顿强调多种基本心理能力;后来的研究表明,即使这些能力之间也存在相关。因此,层级模型成为一种自然的折中方案:底层是具体任务,中间是广泛能力,顶层是一般协方差。卡罗尔后来提出的三层综合模型,使这一架构尤其具有影响力。24
需要避免的两个历史性简化
斯皮尔曼率先推动了因素分析推理,但现代因素分析是众多研究者和方法共同发展的结果,其中许多在1904年尚不存在。后来的智商测验组合也并非只是将他的原始理论转化为一个纯粹的单一数字:它们抽样测量多个领域,采用不同的计分模型,并产生综合分数和更窄的指标。
04 · 如今的一般因素
一种具有多种可能含义的稳定模式
现代研究者更容易在协方差上达成一致,而不是在本体论上达成一致——统计因素究竟代表什么。
在足够广泛且均衡的测验组合中,通常可以提取出一个一般维度;经过良好构建的测验组合所得到的一般因素分数,往往会以相似的方式对人们进行排序。58 然而,一个 g 分数并非完全不受测试影响:其内容和精确度取决于纳入哪些指标、抽取哪个群体,以及拟合哪个模型。
反映模型将一般能力视为对任务表现的共同影响。过程理论则可以将一般指标视为由许多相互重叠的要求汇总而成,而不是视为具有可互换影响的单一原因。两种表示方式都可以概括协方差;要区分它们,需要相关矩阵之外的证据。8
| 模型 | 基本结构 | 一般因素在统计学上的含义 | 重要注意事项 |
|---|---|---|---|
| 单因素 | 所有任务都负荷于一个共同维度。 | 一个因子再现了它们共享协方差的一部分。 | 对于现代的广泛测验组合而言通常过于简单;残差聚类仍然存在。 |
| 相关能力 | 言语、空间、记忆和其他因子彼此相关。 | 不需要明确的高阶因子。 | 它描述广泛领域之间的关系,但将它们之间的相关留待进一步解释。 |
| 高阶 | 任务负荷于广泛能力,而广泛能力又负荷于 g. | g 解释广泛因子之间的协方差。 | 一般影响通过模型中的广泛能力来中介。 |
| 双因子 | 每项任务都直接负荷于一个一般因子,通常还负荷于一个群体因子。 | 一般维度和群体维度划分题目或分测验的方差。 | 即使真实过程并非双因子,额外的灵活性也可能改善拟合,但因子可能变得不稳定或难以解释。944 |
| 网络或过程模型 | 能力或过程彼此互动、重叠或相互强化。 | 一般因子可能总结的是一种涌现模式,而不是充当某个共同原因。 | 有前景的解释仍需要具有区分力的纵向研究和实验检验。 |
为什么“所解释的百分比 g”没有普遍适用的答案
报告称 g 所解释的“智力”比例。不同说法混用了不同的分母和方法。第一主成分、共同因子、高阶因子和双因子一般因子并不会以相同方式划分方差。估计结果还取决于测试的广度和信度。稳妥的结论是定性的:一般性协方差相当大,但广泛方差与特定方差,以及测量误差,仍然存在。
把指数当作指数使用
就像经济指数一样, g 将许多相互关联的观察压缩成一个有用的总结。一个指数可以用于预测和比较,但不必是某种单一的物理成分。生物学研究或许能找出支持广泛表现的分布式系统,但没有任何单一脑区、神经递质或神经速度指标能够简单等同于心理测量学意义上的 g.
05 · 有用,但不是命运
一般认知能力所预测的内容
预测是一般得分仍然有用的最有力理由之一,也是最容易被过度推断的理由之一。
一般认知能力与人们学习许多复杂任务的速度,以及在教育和工作中的平均表现有关。儿童时期的认知得分还可以在人群层面预测日后的健康状况和死亡率。这些发现很重要,但它们都不能把某个得分变成完整的因果解释,也不能对某一个人作出确定的预测。
工作表现
能力测试可以预测工作表现。一项2026年的综合研究发现,几乎没有证据表明认知复杂性或数据复杂性会调节这种关系,并且其估计值低于经典的醒目数字。培训表现是一个独立的标准,因此应针对实际结果估计效度。结构化面试、工作样本和相关经验可以提供额外信息。10
| 证据 | 可辩护的解读 | 过度推断 | 缺失信息 |
|---|---|---|---|
| 群体相关 | 平均而言,较高分数往往伴随较高的结果。 | 每个得分较高的人都会胜过每个得分较低的人。 | 重叠、不确定性、其他预测因素以及个人所处的情境。 |
| 增量效度 | 在已有明确指定的信息之外,某一分数进一步提高了预测能力。 | 该测试是唯一最佳或唯一必要的决策方法。 | 比较标准、标准质量、公平性、成本及后果。 |
| 纵向关联 | 较早的分数可以预测较晚的结果。 | 所测能力直接导致了该结果。 | 混淆、中介、选择以及相互影响。 |
| 平均稳定性 | 在一个群体中,个体的排名具有中等或较强的持续性。 | 个体分数不可能改变。 | 测量误差、发展、教育、健康以及机会的变化。 |
06 · 相关性之下
对正流形的相互竞争解释
一般性协方差的存在比其成因更少有争议。多种解释可能同时部分成立。
一种广泛能力影响许多任务
反映性因子模型常被解读为:一种一般能力导致跨领域的表现。这种解读直观且有助于预测,但仅凭协方差无法证明因果方向,也无法确定其作用机制。
测试在基本过程中存在重叠
在汤姆森式抽样解释中,任务会从许多基本过程中抽取部分重叠的样本。共享的抽样会产生正相关,而不需要假定存在某种单一的心理能量。
心理测量网络模型将观测分数表示为由条件关联连接起来的节点;仅凭这些边不能证明因果影响。其他理论强调工作记忆、注意控制、加工速度、神经效率或它们的组合。未来最有力的证据将来自这样的模型:它们能够对发展、干预、脑—行为关系以及在经过谨慎改变的任务要求下的表现作出不同预测,而不是仅仅进行拟合竞赛。528
结构与机制可以共存
CHC或层级 g 即使互惠论或过程重叠能更好地解释这种模式是如何形成的,模型也可能很好地组织分数。协方差图谱与发展理论不必使用相同的实体。关键在于说明每个模型承担什么功能。
07 · 智力的实际运作
斯滕伯格的三元理论
三元理论将视角从测试分数之间的相关性拓展到人们通过何种过程、经验和环境表现出智能行为。
罗伯特·斯滕伯格于1985年提出的理论常被简化为分析性、创造性和实践性智力。这是一个有用的入门概述,但原始架构更为精确:成分性子理论描述信息加工,经验性子理论描述新颖性与自动化,情境性子理论描述适应、环境塑造与环境选择。这三种广为人知的能力横跨了这些关注点。55
考察、比较并评估
当问题表述清晰,而一个人必须识别关系、判断备选方案、监控进展或论证结论时,分析性智力尤为突出。传统学业测试涵盖了这一领域的很大一部分,但没有任何一道题目能够纯粹测量某个单一过程。
应对新颖情境并进行生成
创造性智力关注的是应对相对新颖的情境、找到富有成效的表征、设想替代方案,并最终将熟悉的操作自动化,以便注意力转向更高难度的层次。仅有原创性还不够;想法还必须与问题相关。
让知识在情境中发挥作用
实践智力关注的是:在指令不完整、地方规范、利益相冲以及现实后果并存的情况下追求目标。研究通常通过默会知识或情境判断来对其进行操作化,而不是通过一份泛泛的“社会经验”或维修技能清单。
流行概述之下的三个子理论
| 子理论 | 核心观点 | 关键机制 | 示例 |
|---|---|---|---|
| 成分性 | 智能行为取决于信息加工成分之间的协调。 | 元成分负责规划和监控;执行成分负责执行;知识获取成分负责编码和学习。 | 识别问题的要求,选择策略,执行策略并检查结果。 |
| 经验性 | 一项行为的智力水平部分取决于一个人对该任务的经验。 | 应对相对新颖的事物,并将重复性操作自动化。 | 专家能迅速识别熟悉的模式,从而释放能力来处理真正的新部分。 |
| 情境性 | 智力服务于人与环境之间有目的的匹配。 | 适应条件、塑造条件,或选择不同的环境。 | 学习组织未明说的限制,改变失灵的流程,或离开去寻找更合适的匹配。 |
斯滕伯格后来将这一框架称为成功智力理论:在社会文化情境中,通过发挥优势、纠正或弥补弱点,并平衡分析、创造和实践能力,实现个人有意义目标的能力。这里的“成功”取决于情境,并不只是财富或地位;适应也不必意味着被动顺从。17
适应、塑造或选择
学生可以通过学习现有格式来适应,通过请求易于使用的替代方案来塑造环境,或选择一条更能支持目标的不同路径。智慧行动可能包括改变不公正或无效的情境,而不只是提高忍受它的能力。
这不是一项学习风格处方
通过多样化的解释、示例、创作和应用来教授学习者,可以丰富教学。这并不能证明每个学生都拥有一种固定的分析型、创造型或实践型“风格”,也不能证明让课程与某种被标记的风格相匹配会改善学习。所有学习者都可能从练习这三种模式中受益。
08 · 期望与争议
证据支持什么,以及它在哪些方面有所抵触
斯滕伯格的项目产生了富有想象力的评估工具和课堂研究。它也说明了,要将广泛的情境性能力作为彼此不同的构念加以测量,是多么困难。
最有利的解读既不是“智力三元理论证伪了IQ”,也不是“它毫无证据”。创造性和实践性任务可以增加有用信息,并使人们有机会展示更多不同方面的能力。至于它们的分数是否代表三种彼此独立的智力,能否超越现有测量广泛预测结果,以及能否公平地大规模应用,仍存在争议。
| 项目 | 报告的内容 | 它所支持的结论 | 仍不确定的部分 |
|---|---|---|---|
| 彩虹项目 | 在15个地点的1,013名参与者中,将创造性和实践性任务加入SAT分数后,针对所分析的子群体,作者报告的样本内大学GPA解释方差有所增加;若干新增测量显示出较小的群体平均差距。18 | 在研究型招生环境中,更广泛的绩效任务可以提供增量信息。 | 大规模独立运营复制、样本外表现、辅导、成本、可靠性和后果。仅凭较小的分数差距并不能证明公平。 |
| MBA默会知识 | 案例和情境判断测量与学业和咨询标准呈小到中等程度的相关,在GMAT和先前成绩之外还带来了一些小幅增量。19 | 与工作相关的判断可以补充情境证据。 | 得分是否反映了一种独特的智力,而不是工作知识、一般能力、人格、阅读能力和方法差异共同造成的结果。 |
| STAT因素研究 | 一些分析发现,反应方式或内容——言语、数量和图形——对得分的组织作用不亚于甚至强于分析性、创造性和实践性这些标签。21 | 这些任务可以抽样考察多样化的表现。 | 清晰的三因素结构,以及与一般认知能力相互独立。 |
| Aurora资优评估 | 开发者研究报告了颇具前景的信度和识别模式;一项针对499名荷兰学生的独立研究发现,拟议的三元结构拟合度较差。22 | 非传统任务可能发现那些被某一项传统分数线遗漏的候选人。 | 其他分类是否有效、稳定,并能预测具有实际意义的长期结果。 |
| 三元教学 | 早期研究结果较为积极,而后来一项针对7,702名四年级学生的研究,在23项比较中仅发现少量具有显著优势的结果。23 一项元分析发现平均效果为正,但在校正发表偏倚后效果变小了。24 | 围绕分析、创造和应用开展教学,可能是一项富有成效的设计原则。 | 收益的规模、持久性、实际起作用的因素和可推广性;现有证据不足以支持僵化的学习者分类。 |
为什么实践智力难以单独分离出来
默会知识量表通常会呈现一个工作或生活情境,并要求受测者评价可能采取的行动。这类量表可能具有表面效度和效标效度,但仍会混合多个构念。情境判断研究发现,得分会随指导语变化,并且与认知能力和人格有关。20 有用的评估不必测量某一种纯粹能力,但其解释必须与证据所支持的内容相一致。
拓展机会的设计视角
邀请人们分析证据、提出替代方案并应用想法。在相关情况下,使用作品集、工作样本、结构化情境和传统测量工具。针对预期决策验证这一组合。
由三个彼此分离的心智构成的替代性分类体系
现有证据不足以支持给每个人分配固定的三元智力类型,也不足以把这三种能力视为彼此独立于 g,或根据魅力、违规行为或社会优势推断实践智力。
从成功智力到适应性智力
斯滕伯格较新的适应性智力理论探讨的是:智力是否能帮助个人和群体适应现实中共同面对的问题,而不仅仅是在现有体系内优化个人结果。它将智慧、伦理后果和公共利益进一步置于核心位置。25这是一种颇具争议的规范性框架,尤其适用于教育领域,但它还不是一个成熟的心理测量分类体系,其测量基础也无法与g或CHC相提并论。
斯滕伯格持久的挑战并不是说测试分数毫无用处,而是解决一个脱离语境的问题,与选择一个值得解决的问题,是两种不同的成就。
09 · 从单一因素到分化的能力
卡特尔、霍恩与流体—晶体智力
CHC理论的起点,是区分解决相对新颖的问题与运用通过学习和文化形成的知识。
雷蒙德·卡特尔在20世纪40年代提出了流体能力(Gf)和晶体能力(Gc);约翰·霍恩后来对这一模型进行了检验、完善和扩展。这一区分依然很有价值,但两种能力都不是纯粹的、脱离语境的,也不是彼此孤立的。2627
对相对新颖的关系进行推理
归纳、演绎、数量关系,以及在不熟悉的材料中识别规则,都是核心例子。矩阵题可以减少对正规学校教育的明确要求,但仍需要理解指令、具备视觉接收能力、熟悉测试规范、保持注意力,以及运用通过经验发展出的策略。
运用语言和通过文化获得的知识
词汇、词汇知识、听力理解和一般言语知识都是常见例子。Gc并非琐闻的储存库:它反映了一个人通过学习经历和所属语言社群所获得的知识的广度、深度与组织方式。
投资是一种关系,而不是单向决定的命运
卡特尔的投资观点认为,流体能力会被“投入”到学习中,从而帮助形成晶体化知识。现代发展观认为,两者之间的关系更具相互作用性。先前的知识能让新的推理更高效;兴趣会影响人们练习的内容;学校教育会同时改变知识和测试策略;动机与机会则决定潜能能否转化为专长。因此,一个人的总体推理能力可能与同伴相近,但领域知识却大不相同;也可能拥有深厚的专业知识,从而弥补处理新颖信息时速度较慢的不足。
| 问题 | Gf | Gc | 细微差别 |
|---|---|---|---|
| 典型要求 | 发现关系,或解决相对不熟悉的问题。 | 理解并运用所学的语言或知识。 | 大多数真实任务两者都需要:人必须借助已经学过的内容来表征问题。 |
| 常见指标 | 矩阵推理、系列推理、归纳推理和数量推理。 | 词汇、言语理解和一般信息。 | 指标还包含方法、感官、速度和受教育程度等要求。 |
| 经验 | 旨在减少对特定既有内容的依赖。 | 明确反映了文化适应和教育的影响。 | 没有哪项复杂的人类任务是真正完全不依赖经验或文化的。 |
| 发展 | 通常会更早达到峰值,也会更早表现出成年后的平均下降。 | 通常会随着知识的积累而变得更长。 | 能力和任务遵循不同的发展轨迹;群体、健康状况和测量方式都很重要。 |
Horn 并没有简单地认可 Carroll 的顶层 g
Horn 将 Gf–Gc 理论扩展为多种广泛能力,并通常不赞成在这些能力之上放置一个一般因素。Carroll 的层级确实包括 g。现代 CHC 实践通常会将层级绘制为 g 位于顶层,但这个名称既保留了富有成效的分歧,也体现了综合。
历史注记:Donald Hebb 关于具有生物学基础的“智力 A”和后天发展的“智力 B”的区分,影响了 Cattell 的理论构想。因此,档案研究提醒我们,不应将其简单归结为某位孤立发明者的成果。42
10 · 由数十年数据构建的层级体系
Carroll 的三层级与 CHC 综合
John Carroll 于 1993 年发表的研究,将庞大的历史因素分析文献重新组织成一个颇具影响力的层级体系。
Carroll 重新分析了涵盖七十多年认知能力研究的 461 组数据。他的三层级理论将狭窄能力置于第一层级,将更广泛的领域置于第二层级,并将一般因素置于第三层级。这项成就是对协方差证据的系统综合,而不是发现了大脑内部三个字面意义上的楼层。24
第三层级 · 一般能力。 在足够多样化的认知测量中共有的最广泛维度:心理测量学意义上的 g。
第二层级 · 广泛能力。 相对普遍的领域,例如流体智力、晶体智力、记忆与学习、广泛视觉知觉、广泛听觉知觉、广泛提取能力、认知敏捷性,以及 Carroll 最初表述中的加工速度。
第一层级 · 狭窄能力。 更具体的能力——例如归纳、记忆广度、空间关系或词语流畅性——通过具有更紧密共同要求的表现加以识别。
Carroll 的层级与扩展后的 Cattell–Horn 模型有很大重叠。Kevin McGrew 及其他评估学者围绕后来 Woodcock–Johnson 测验组的发展,逐步使这些分类体系趋于一致,“CHC”遂成为统称。这一综合影响了测验蓝图、分数分类和跨测验组解释。3
广泛能力反复出现
当选取合适的任务时,流体推理、获得的知识、视觉加工、听觉加工、记忆和速度会反复出现。
地位 g
Carroll 认为一般层级很重要;Horn 则更倾向于用广泛能力及其发展关系来解释。CHC 可以采用因果解读顶层因素的方式呈现,也可以不采用。
分类体系不断变化
随着证据不断积累,现代 CHC 会拆分、重新命名并试探性地增加能力。具体数量因版本以及是否纳入感觉和运动领域而异。
层级不是价值阶梯
“更高”意味着在统计模型中更具一般性,而不是在生活中更重要。某项狭义技能可能决定一个人能否读谱、察觉细微声音、进行手术或提取正确的词语。一般能力分数通常具有广泛的预测作用;而专业能力和知识决定了在特定领域中表现的具体样貌。
11 · 当代能力图谱
CHC 包含什么
CHC 最好被视为一个不断发展的分类体系。最有用的层级取决于具体问题,而普通测验组无法测量完整图谱。
当代概述通常描述约 17–18 项广泛能力及许多更狭义的能力,具体数量部分取决于如何计算 Gkn 和 Gei 等拟议领域。学校和临床测验组集中于其中一部分,这些能力具有成熟的测量方法和实际相关性。这些代码是简洁的标签,并非基因、脑模块,也不保证每项已发表的测验都能纯粹地单独测量某项能力。29
| 类别 | 广泛能力 | 通俗语言描述 | 解释边界 |
|---|---|---|---|
| 习得的知识 | Gc · 理解–知识 | 文化习得知识的广度与深度,包括语言、一般知识和言语理解。 | 受语言、文化、教育和机会的强烈影响。 |
| Gkn · 领域特定知识 | 在特定专业领域内深入发展的知识。 | 通用测验组不能替代对专业能力的直接评估。 | |
| Grw · 阅读与写作 | 读写所需的知识和技能。 | 通常既被视为学业成就,也被视为认知能力;具体划分因惯例而异。 | |
| Gq · 数量知识 | 习得的数学知识和程序。 | 区分后天习得的数学知识与新颖的数量推理。 | |
| 推理与控制 | Gf · 流体推理 | 对新颖关系进行归纳、演绎和推理。 | 表现仍取决于表征、策略和对任务的熟悉程度。 |
| Gwm · 工作记忆容量 | 在注意控制下保持并操作信息。 | 短时任务会混合存储、控制、策略和模态;术语已从较早的 Gsm 发生变化。 | |
| 学习与提取 | Gl · 学习效率 | 高效地获取并巩固新信息。 | 当代修订将其与流畅提取区分开来;较早的来源将二者合并为 Glr。 |
| Gr · 提取流畅性 | 快速且有策略地生成已存储的想法或信息。 | 流畅性不等同于所提取内容的准确性或深度。 | |
| 知觉加工 | Gv · 视觉加工 | 感知、转换、记忆并推理视觉模式。 | 这并不等同于视力;必须将接触需求与运动反应需求区分开来。 |
| Ga · 听觉加工 | 分析和辨别声音模式,包括与言语相关的信号。 | 这与听力敏锐度或音乐成就并不相同。 | |
| 认知速度 | Gs · 加工速度 | 在时间限制下流畅地执行简单或已过度学习的认知操作。 | 分数可能包括视觉扫描、图形书写、决策以及速度—准确性权衡。 |
| Gt · 反应与决策速度 | 非常简单的反应或选择的速度,通常以秒的零点几来测量。 | 速度更快并不总是更好;准确性和任务目的同样重要。 | |
| 感觉与运动领域 | Go · 嗅觉;Gh · 触觉;Gk · 动觉 | 在嗅觉、触觉和身体感觉加工方面的广泛个体差异。 | 在普通智商测验中,这些能力仍不那么核心,而且该分类体系的部分内容仍属暂定。 |
| Gp · 心理运动能力 | 有意身体动作的精确性与协调性。 | 不得将运动障碍误认为推理能力较低。 | |
| Gps · 心理运动速度 | 身体动作的速度和流畅性。 | 解读计时输出时,应将运动速度与认知加工速度区分开来。 |
一些当代版本还包括情绪智力(Gei),暂时将其定义为感知、理解、使用和管理情绪相关信息的能力。
能力数量为何会有所不同
Carroll最初的广泛层级、早期整合的CHC图表和2018年的修订版并不包含完全相同的标签。例如,较早的短时记忆(Gsm)被重新概念化为工作记忆容量(Gwm),而长期存储与提取(Glr)则被拆分为学习效率(Gl)和提取流畅性(Gr)。有些概述省略了感觉和运动能力;另一些则以不同方式区分数量推理。某个来源说“约十项”“十六项”“十七项”或“十八项”,可能是在描述不同版本,而不是简单地犯了错误。
用于测试覆盖范围的共同语言
CHC有助于研究人员和专业人员思考:一组测验是否涵盖转介问题所需的领域,以及两个名称不同的分数是否可能反映相似的能力。
将每个标签都理解为一个独立的脑系统
因素标签是理论性概括。广泛能力彼此相关,任务会在多个因素上负荷,因素定义会不断演变,而神经实现则是分布式的。一张整齐的图表不应被误认为是已经确定的因果性脑部结构图。
2023年的一项心理测量网络分析支持了几个熟悉的CHC集群,同时建议对工作记忆、注意控制、学习和提取方面进行修订。这正是一个活的分类体系应有的表现:证据可以保留有用的规律,同时改变它们的组织方式。28
12 · 将这些地图并列比较
这些框架的交汇之处——以及它们并不相交之处
如果不明确任务,就不存在“最佳”框架。它们的主张在层级、证据基础和预期用途上各不相同。
| 问题 | 斯皮尔曼 / g | 斯滕伯格 | CHC |
|---|---|---|---|
| 主要目标 | 解释或概括心理测验之间的正协方差。 | 解释跨越加工、经验和情境的智能自我管理。 | 对认知能力的层级结构进行分类。 |
| 分析单位 | 测验表现之间共享的个体差异。 | 个体在社会文化环境中的目标导向行为。 | 表现的一般、广义和狭义维度。 |
| 核心优势 | 简约性和广泛预测能力。 | 关注新颖性、应用、目标和情境。 | 用于测验设计和解释的详细、共享词汇。 |
| 主要证据 | 相关、因素模型和效标预测。 | 任务测验组、默会知识研究、教学和招生项目。 | 涵盖认知与成就测验组的大量因素分析文献。 |
| 反复出现的批评 | 将统计因素实体化,并忽视非认知能力或情境性能力。 | 构念区分不稳定、方法变异,以及与……的重叠 g 以及独立重复研究的有限性。 | 分类体系的复杂性、不断变化的标签,以及对具体测评概况的过度解读。 |
| 最佳实践作用 | 当结果确实需要一般性的学习或推理能力时,提供广泛的概括。 | 一种设计视角,用于要求人们在真实情境中进行分析、创造和应用。 | 一份用于平衡评估的指南,也可用于对广义和狭义能力表现提出谨慎假设。 |
| 它能测量完整的人吗? | 不。 | 不,尽管它有意拓宽了构念。 | 不。 |
可以整合的内容
严谨的评估可以使用一般得分进行广泛预测,使用受 CHC 启发的领域来理解任务覆盖范围,并使用受斯滕伯格启发的工作样本来观察生成与应用。这些来源不必被强行纳入同一量表。学生的矩阵推理、词汇、实践设计项目、坚持力和兴趣,是不同形式的证据,具有不同的信度和相关性。
应保持区分的内容
分析性、创造性和实践性表现,并不只是 Gf、发散思维和 Gc 的简单同义词。同样,CHC 的广义能力也不是固定的学习风格,而 g 也不是每一种值得称道的人类能力的平均值。只有在保留各构念边界的前提下进行整合,才最为诚实。
一个决策可能需要三种视角
结构:证据样本反映了哪些能力?功能:当事人能否在有意义的任务中运用这些能力?公平性:每个人是否都拥有可获得且相关的机会,来展示决策所要求的能力?
13 · 从理论到分数报告
现代智力测验实际测量什么
测验组合是对行为的工程化抽样。它可以受到某种理论的启发,但不会因此成为该理论的纯粹体现。
标准化认知评估要求受试者在受控规则下完成选定任务。研究人员使用适当的常模样本对原始表现进行转换,将其合并为分测验分数和指数分数,有时还会用全量表综合分数加以概括。每一步都让结果更易于解释——而每一步都建立在若干假设之上。
-
任务表现。受试者听取、观看或阅读指导;对内容进行推理;并通过口头回答、指认、书写、操作物体或使用设备作出反应。
-
原始分数。正确作答数、质量、时间或其他规则产生一个总分。脱离施测规则和参照数据,原始分数几乎没有意义。
-
常模化分测验分数。将表现与明确的年龄组或其他参照组进行比较。常模日期、代表性和版本都很重要。
-
指数或广泛综合分数。将两个或更多分测验结合起来,以提高可靠性,并抽样测量诸如言语理解、工作记忆或加工速度等拟议领域。
-
总体综合分数。全量表分数综合了各领域的表现。它通常是最可靠的广泛概括,但当转介问题涉及某种障碍或不寻常的表现模式时,可能不够完整。
每个报告的数字都是估计值
报告一个分数时,应同时给出置信区间、相关常模,并解释哪些因素可能影响了对该构念的测量。百分位数同样只是相对位置的估计,并不表示此人答对了相应百分比的题目,也不表示其拥有相应百分比的“智力”。
主要测验组合与CHC的关系
| 测验组合 | 与当代能力理论的联系 | 谨慎的描述方式 | 注意 |
|---|---|---|---|
| WISC–V | 主要指数大致对应于理解—知识、视觉加工、流体推理、工作记忆和加工速度。 | CHC是一个重要影响因素,同时还考虑了发展、神经心理和临床因素。30 | 独立因素研究往往发现占主导地位的一般方差;指数名称并不能保证某项能力纯粹或能够完全分离。 |
| WAIS–5 | 2024年美国版报告五个主要指数和由七个分测验组成的全量表智商,并针对具体问题提供辅助选项。31 | 其结构反映了当代模型和实际评估目标。 | 对美国标准化相关矩阵进行的独立分析并不支持五个潜在因素,也不支持明确的视觉空间—流体推理分离;在一个占主导地位的……框架下,它更倾向于四个群体因素 g。仍需进行重复验证。32 |
| 伍德科克–约翰逊第五版 | 当前版本明确采用了更新后的 CHC 框架,其中包括分开的长期储存(Gl)和提取流畅性(Gr)能力群。33 | 它提供了一套以 CHC 为导向、涵盖认知、口语语言和学业成就的广泛测量工具。 | 没有任何测验电池能同等覆盖所有 CHC 能力,而且出版商声称与某种分类体系一致,本身并不能证明每个能力群彼此独立。 |
| 其他测验电池 | KABC、斯坦福–比奈、DAS、非言语测量工具和神经心理学工具,所依据的层级理论、加工理论和发展理论组合各不相同。 | 选择应依据转介问题、受试者和支持性证据,而不是品牌声望。 | 名称相似的分数可能采用不同的任务和常模;名称不同的分数也可能存在很大程度的重叠。 |
大多数当代智商综合分数的标准化方式是:按年龄常模计算的平均数为 100,标准差为 15;但具体分数的定义由测验手册决定,而不是由通用图表决定。按年龄建立常模意味着,10 岁儿童和 60 岁成人可以拥有相同的标准分,同时相对于同龄人完成的原始任务数量或类型却不同。
范围广、效率高,通常也较为精确
全量表智商或一般能力综合分数通常能最精确地概括受试者在该测验电池中的表现。只有当该构念与问题相关、该综合分数适用于个人解读,并且所包含的任务对受试者来说可完成时,它才有用。
更贴近问题,但不一定更纯粹
当转介明确涉及语言、工作记忆、视觉加工或速度时,某个指数可能具有重要意义。对它的解释需要考虑信度、超出 g、充分的指标和相关的效标证据。
从转介问题开始
“测量智力”过于笼统。目标是了解获得教学的情况、智力障碍、后天认知变化、是否适合资优项目、职场学习、语言影响,还是某个具体的功能问题?目的决定评估中应包含的构念、方法、便利措施和证据。
14 · 优势、弱点与不确定性
如何解读认知档案而不臆造诊断
个人档案可以帮助整理有用的假设。档案中各部分之间的差异通常不如各分项分数精确,而且一种模式很少能确定单一原因。
较低的工作记忆指数本身并不能诊断 ADHD。较低的加工速度指数也不能证明一个人在日常生活中思维缓慢。较高的视觉分数并不意味着必须采用“视觉学习”。只有当某种模式可靠、不同寻常、稳定、与问题相关,并且得到行为、经历和其他测量结果佐证时,对它的解释才更有说服力。
| 检查 | 问题 | 为什么重要 | 常见错误 |
|---|---|---|---|
| 精确性 | 这些分数及其差异的估计是否可靠? | 差异分数会结合两个组成部分各自的误差。 | 把排名上的一分之差当作精确区分。 |
| 基率 | 在常模群体中,或在总体分数相近的人群中,如此大的差异出现得有多频繁? | 具有统计显著性的差异仍可能很常见。 | 把普通的分数离散称为临床异常。 |
| 构念 | 除了一般方差之外,该指数是否包含稳定可靠、专属于所称能力的方差 g? | 一个可靠的分数,其大部分可靠性可能来自一般方差。 | 假设每个指数都是纯粹的模块。 |
| 重复验证 | 该模式是否在不同任务、不同场合或性质不同的证据中反复出现? | 一个不寻常的分测验结果可能反映测验场合、方法或内容。 | 围绕一个离群值构建人生故事。 |
| 效标 | 具体分数是否改善了对相关现实结果的理解或预测? | 与领域匹配的能力有时会在以下方面提供适度的额外信息 g.36 | 仅凭结构匹配就推断教育干预。 |
| 一致性 | 病史、学业表现、观察结果、适应行为以及当事人的报告,是否支持这一假设? | 功能意义存在于分数报告之外。 | 让测验标签凌驾于直接证据之上。 |
关于WISC–V档案的研究说明了这一困难。指数分数可能具有很高的总体系统方差,但在剔除一般方差后,真正归因于其预期广泛因素的独特方差要少得多。在模拟中,观察到的指数差异并不稳定地重现相应的潜在因素差异。35 尽管如此,在一个临床样本中,长期WISC–V分数仍显示出显著的排名稳定性。34 在一项针对德国七至九年级学生的独立一年期研究中,具体分数具有中等至高度稳定性;然而,超出一般能力的增量预测大多很小,但有时与领域相匹配。36 证据支持严谨、针对问题的解释,而不是笼统地断言测验档案要么是诊断指纹,要么完全没有用。
说明发生了什么
“今天在限时视觉—运动任务上的表现明显较慢”贴近证据,也让相关情境变得清晰可见。
列出替代解释
可能的影响因素包括速度、动作输出、视觉扫描、焦虑、完美主义、疲劳、药物或不熟悉程度。应检验这些因素,而不是按标签选择其中一个。
不要根据分数离散诊断
单凭独特的指数模式,不能确立阅读障碍、ADHD、自闭症、脑损伤、天赋或某种特定教学方法。
跨测验评估:共享语言并不意味着分数可互换
CHC代码可以揭示主要测验组合对某项能力的抽样不足,并帮助选择针对性的后续测量。但标记为Ga或Gf的两个综合指标可能使用不同的任务、常模和加权方式。研究发现,不同测验组合中看似等效的CHC综合指标并不总是可以互换。43不要随意对它们取平均,也不要在缺乏其信度和效度证据的情况下编造新的综合指标。
- 固定测验组合。使用一套连贯且预先规划好的测量;只有为回答明确的空缺问题时才增加测试。
- 优先采用多个指标。单项任务很少足以支持对广泛能力的推断。
- 核查常模。年龄、日期、语言、国家和施测模式都很重要。
- 保留任务差异。相似的标签并不意味着不同方法可以等同。
- 解释不确定性。报告置信度、基准率和合理的替代解释。
- 回到功能。询问这个人需要学习、沟通、参与或做出什么决定。
分散性并不会自动使总体分数失效
不均衡的能力特征可能使某个总体数值无法完整回答特定问题,但这并不意味着它毫无意义。总体综合分数可能仍然是概括整体测试表现最精确的方式。既报告稳定的概括结果,也报告相关且有充分依据的限定说明。
15 · 随时间变化的能力
发展、老化与不断变化的常模
认知能力不会按照同一只时钟上升和下降。原始表现、按年龄常模校正后的相对水平,以及相对于同龄人的稳定性,回答的是不同问题。
一种简单的说法是:流体智力在青年时期达到峰值,晶体智力在中年以前持续上升。这一说法在方向上有用,但对个体而言并不可靠。加工速度、记忆、推理、词汇、社会理解和专门知识具有不同的平均发展轨迹。教育、世代差异、健康、练习以及具体任务都会改变这条曲线。
快速分化与学习
语言、知识、注意力和策略同步发展。随着年龄增长,测试—再测试的相对排名通常会变得更加稳定,但早期分数仍尤其容易受到发展水平和获取条件的影响。
知识与控制能力不断扩展
正规学习、兴趣和领域实践会形成日益分化的能力特征。一次测试仍可能受到睡眠、压力、语言、投入程度和健康状况的影响。
不存在普遍适用的认知峰值
一些依赖速度的能力相对较早达到峰值;其他任务则会在更晚时期趋于稳定,而词汇量和专业知识可能增长数十年。在一项大型研究中,不同测量指标在青春期后期至四十多岁甚至更晚达到最大值。15
三种容易混淆的变化
| 变化 | 它意味着什么 | 示例 | 它不意味着什么 |
|---|---|---|---|
| 原始或绝对变化 | 这个人比以前能够解决更多、更难或更快的任务。 | 儿童的词汇和推理能力在五年间显著扩展。 | 认为按年龄常模校正后的标准分数必然上升;同龄人也在发展。 |
| 按年龄常模校正 | 与同龄人相比的相对位置发生变化。 | 在学习速度异常快之后,标准分数会上升;在一段获取学习机会受阻之后,标准分数可能下降。 | 认为某种精确的潜在能力以相同数量的“分数点”发生了变化。 |
| 顺序稳定性 | 随着时间推移,人们往往会保持自己在群体中的相对顺序。 | 一个队列的分数在两次测量之间具有很强的相关性。 | 认为群体均值保持不变,或认为没有任何个体发生变化。 |
| 队列变化 | 在不同时期出生或接受测试的人,表现有所不同。 | 后出生的队列在某些抽象推理测量上的表现优于早先出生的队列。 | 认为差异是由衰老造成的,或认为每个认知领域都同步变化。 |
教育可以改变测得的认知表现
一项对42个数据集和超过60万名参与者进行的元分析采用了包括政策变化和入学年龄界限在内的研究设计。该分析估计,在所研究的各种设计中,额外一年教育可使智力测试表现提高约1至5个智商点。14 这个范围并不保证个体会获得同等幅度的增益,而学校教育可能以不同比例影响测试策略、知识和推理。尽管如此,它仍然反驳了“高度预测性的分数必然不受环境影响”这一观点。
弗林效应不是节拍器
在整个20世纪的大部分时期,许多群体的平均分数都在上升。一项涵盖近400万名参与者的元分析发现,增益因国家、时期和能力而异;某些流体能力和空间测量的平均增益大于晶体能力测量,并且有放缓的证据。13 近期一些数据表明,增益已经放缓。原因可能包括教育、健康、家庭规模、营养、技术、抽象问题环境以及测量变化;没有任何单一解释能够说明所有模式。
重新建立常模改变的是比较基准,而不是昨天的原始表现
当测试采用更新的常模时,同一个原始分数可能会转换为不同的标准分数,因为参照群体发生了变化。在项目或诊断界限附近,这可能改变分类结果。50 报告版本和常模日期,避免虚假的精确性;当微小差异带来重大后果时,应重新考虑相关决定。
稳定不等于固定
某种特质可以表现出显著的顺序稳定性,同时每个人都在学习。某项测量在一个群体内可能具有遗传性,而环境变化会改变其均值。预测效度、稳定性、遗传性和可塑性是不同的统计问题。
16 · 社会中的测量
文化、语言、残障与公平
任何复杂的认知评估都不可能脱离文化。公平性要求相关的构念、可比的意义、可获得的实施方式,以及有理据支持的后果。40
减少复杂词汇或习得内容的要求,可以使任务较少依赖某一种经验。但这无法从指导语、符号、速度预期、测验互动关系、问题解决惯例、技术、动机或规范中消除文化因素。负责任的目标不是追求神话般的无情境测验,而是证明预期解释具有足够的可比性和实用性。
测量恒等性阶梯46
| 层级 | 哪些内容被保持为可比 | 它通常支持什么 | 它仍然不能证明什么 |
|---|---|---|---|
| 构型恒等性 | 大致相同的因子模式。 | 构念的组织方式可能相似。 | 分数具有相同的单位,或群体均值具有可比性。 |
| 度量恒等性 | 因子模式和因子载荷。 | 比较与其他变量的关联或关系。 | 不加限定的潜在均值比较。 |
| 标量恒等性 | 因子载荷加上项目或测验的截距/阈值。 | 在该模型下比较潜在均值。 | 机会均等、预测均等、待遇均等或结果均等。 |
| 严格恒等性 | 因子载荷和截距,以及残差方差。 | 更强的分数可比性。 | 每个项目都具有文化公平性,或每种使用方式都公平。 |
许多非西方数据集都发现了一般因子,但某种结构的重复出现并不等同于标量恒等性、等效常模或公平决策。45 当测量恒等性不成立时,原因可能涉及翻译、教育经历、熟悉程度、作答策略、项目内容、机会或构念本身。因此,翻译与改编需要有据可查、反复迭代的验证过程。53 即使测量恒等性成立,不平等的机会获取和有害的筛选规则仍可能存在。46
| 概念 | 它要问什么 | 正确解释 | 应避免的错误 |
|---|---|---|---|
| 群体均值差异 | 平均观察分数是否存在差异? | 需要结合情境进行调查的描述性结果。 | 假定它能证明生物学因果关系或心理测量偏差。 |
| 差异项功能 | 在目标构念上匹配的不同群体被试,其作答概率是否不同? | 需要实质性研究的诊断性提示。 | 将每个差异项功能(DIF)项目都称为有偏,或认为不存在DIF就意味着整个系统公平。 |
| 测量恒等性 | 模型在不同群体中的运行是否具有可比性? | 在相关假设下,对指定分数比较的证据。 | 将模型拟合视为机会均等或结果均等的证明。 |
| 差异预测 | 预测斜率、截距或误差是否存在差异? | 关于各群体中分数如何与某一标准相关的证据。 | 仅比较各子群体的相关性就宣称公平。 |
| 不利影响 | 某项选拔规则是否会导致选拔率出现实质性差异? | 这是一个与测量偏差不同的法律和政策问题。 | 假定一条统一的阈值规则就能证明合法性或公平性。 |
| 可及性 | 这个人能否在没有无关障碍的情况下参与对目标构念的测量? | 要实现等效的可及性,可能需要不同的合理便利。 | 把相同条件自动视为公平。 |
心理测量偏差与结果不平等是不同的问题。两者可以彼此独立存在,负责任的评估会同时考察二者。
合理便利应遵循测量构念
让目标能力能够被展现
当感觉、运动或交流速度并非目标构念时,盲文、大字版、屏幕阅读器、手语或交流支持、无障碍输入、休息、减少干扰的环境或替代性作答方式可以改善可及性。适当的合理便利会减少与构念无关的障碍;它们不会凭空创造目标能力。
记录发生的变化
当速度只是附带因素时,延长时间可能有助于保留测验的可及性;但当速度是目标时,延长时间可能改变结果的解释。计算器可能适用于代数推理,却不适用于算术计算。当某项调整改变了测量构念时,不要假定原有常模或分数含义仍然适用;应记录这一变化,并依据支持该调整后用途的证据解释结果。
美国特殊教育规则要求使用多种工具,禁止将单一测量作为唯一标准,要求以最有可能获得准确信息的语言和形式进行评估,并要求除非感觉、手动或口语技能本身是评估目标,否则这些方面的局限不得污染结果。47 美国司法部关于《美国残疾人法》所涵盖考试的指导意见指出,经过合理便利调整的分数不应被标记为特殊分数,并提醒说,以往的学业成功并不能排除残疾。48
神经多样性与诊断
认知测验可以帮助了解支持需求;但不能仅凭分数模式诊断复杂状况。对于智力障碍,当前的专业定义要求智力功能和适应性行为均存在显著局限,且起源于22岁之前,而不是仅凭智商分界值。39 注意缺陷多动障碍、自闭症、阅读障碍、语言障碍、感觉障碍和脑损伤同样需要智力概况以外的证据。
不要从群体推断个人,也不要从差距推断原因
群体内部的差异通常很大。群体平均值无法告诉你某个人为何取得某个分数、哪些支持会有帮助,或他们能够完成什么。群体内部的遗传力并不能确定群体之间差异的原因,而分数差距也无法将遗传、教育、经济、健康、歧视和测量等影响路径分别划分出来。
17 · 决策,而非标签
如何负责任地使用智力证据
只有在明确说明构念、群体、目的、精确度、替代方案和后果时,一种理论才具有实际价值。
专业标准是针对具体用途的效度:证据必须支持拟议的解释以及据此作出的决策。信度是必要条件,但并非充分条件;测试可能始终如一地测量错误的对象。出版方的一般验证结果不会自动适用于每一所学校、每家诊所、每种语言、每份工作或每个临界值。3738
| 场景 | 先行定义 | 善用证据 | 避免 |
|---|---|---|---|
| 教育 | 目标是学业成就、推理能力、准备度、与残障相关的需求、可及性,还是项目匹配度? | 使用多种信息来源;在相关情况下,将适当的认知和学业测量与学习机会、课堂作业、观察结果以及家庭和学习者意见等证据结合起来;提供复核和申诉渠道。 | 仅凭单一分数进行安置、永久分流、根据能力概况作出诊断,或测试从未教授过的知识。 |
| 资优识别 | 该项目旨在培养哪些才能并提供哪些服务? | 在转介会造成障碍的情况下,提供广泛或普遍的筛选机会;在相关时纳入领域成就、工作和当地机会等因素。一项自然实验显示,普遍筛选提高了对服务不足学生的识别率。49 | 将单一临界值视为自然边界,将资优等同于个人价值,或在缺乏结果证据的情况下认为扩展后的测试是公平的。 |
| 临床评估 | 是什么功能变化、发展问题或支持需求促使进行此次评估? | 使用恰当的常模和语言;综合考虑个人经历、观察结果、适应性行为、健康状况、感官可及性、用药情况、测试条件、参与度和日常功能。52 | 凭单一分数作出诊断、使用过时常模、将自动生成的报告作为判断,或将百分位数呈现为精确值。 |
| 就业 | 哪些可证明的工作要求需要学习、推理或特定能力? | 开展工作分析;验证实际使用的临界值或排名;监测不利影响和差异性预测;为申请合理便利提供清晰且保密的流程;比较那些效果大致相当但不利影响更小的替代方案。41 | 通用的“聪明度”筛选、普遍适用的效度系数、隐藏的代理变量,或将供应商的声明当作本地验证。 |
| 研究与政策 | 意图测量什么构念、回答什么群体层面的问题,以及估计什么因果效应? | 预先注册模型,检验测量等值性,报告不确定性和异质性,保护隐私,并将描述性主张与因果性和规范性主张分开。 | 将社会群体排名为本质类别,将潜在因素解读为直接的生物学特征,或将平均关联转化为个体规则。 |
一项在分数影响人生之前进行的十二问审查
- 构念:意图测量的确切能力或绩效是什么?
- 目的:结果将为哪项决策提供依据?
- 人群:验证是否涵盖该年龄、语言、文化和环境?
- 常模:参照数据是否最新且适用?
- 精确性:置信区间是多少,尤其是在临界分数处?
- 可及性:语言、残障、界面或速度是否可能增加无关难度?
- 便利措施:哪种调整能够保留目标构念?
- 趋同性:还有哪些证据支持或质疑这一结果?
- 预测:效标是否相关、可靠且经过独立验证?
- 公平性:是否分别考虑了DIF、测量不变性、差异预测、不利影响和可及性?
- 替代方案:是否存在排斥性更低且同样有效的方法?
- 权利与救济:在有要求的情况下,是否妥善处理了同意或授权、隐私和数据访问;是否会以易于理解的方式解释结果及其局限;当事人能否更正、申诉或重新参加测验?
让方法匹配于你想了解的内容
使用均衡的认知综合分数
当效标要求在多样内容中学习时,可靠的总体得分可以提供相关证据。应将其与直接的成就或工作证据结合,不要把适度的群体相关当作对个体的确定性预测。
构建真实且经过分析的情境
根据实际领域创设情境,邀请多元化专家,记录评分依据以及测验信度、亚组结果和增量价值。不要将在所抽取情境之外的“社会经验”加以泛化。
采用当前的职业证据
一项汇总了212个样本和109,396人的2026年综合研究估计,一般心理能力与工作绩效之间当代实际应用效度约为 .18 至 .22,并建议将 .20 作为广泛估计值。10 这在大规模应用中仍然有用,但远低于被反复宣传为普遍常数的经典 .51。工作需求构成、效标选择、范围限制校正和本地化设计仍然很重要。
18 · 争论仍在继续
开放问题与未来方向
下一步进展需要的不只是一个新标签。它必须连接结构、机制、发展、生态和公平使用。
拓宽视野的简明历史
| 时期 | 发展 | 持久贡献 | 需要避免的神话 |
|---|---|---|---|
| 1904 | Spearman将一般能力加具体能力的解释形式化。 | 正向流形与可检验的协方差模型。 | 一篇论文证明了单一的生物学心理能量。 |
| 20世纪30年代 | Thurstone强调基本心理能力。54 | 言语、数字、空间、记忆和其他领域都值得测量。 | 这些能力完全相互独立,或者永久消除 g.24 |
| 20世纪40至60年代 | Cattell和Horn发展并扩展了Gf–Gc理论。 | 新颖推理与后天获得的知识可以区分,并且发展方式不同。 | 流体智力测验不受文化影响,或者Horn接受了强制性的最高层级 g. |
| 20世纪80年代 | Gardner和Sternberg以不同方式挑战狭隘的定义。 | 人的能力包括情境性、创造性以及受到文化重视的表现。 | 多元智能、三元能力和学习风格提出的是同一主张,或者都是同样得到验证的心理测量因素。 |
| 1993 | Carroll将因素分析证据综合为三个层级。 | 涵盖狭窄、广泛和一般协方差的综合层级结构。 | 这些层级是没有争议的、字面意义上的大脑层次。 |
| 20世纪90年代末至今 | CHC成为测验开发的通用分类体系。 | 共享的语言使测验覆盖范围和研究更易于比较。 | 分类体系是固定不变的,或者所有编码相同的分数都可以互换。 |
| 21世纪初至今 | 互惠论、过程重叠论和网络论将替代性解释形式化。 | 这一整体可能源于发展和相互作用的过程。 | 质疑一种因果 g 否认这一一般统计模式。 |
推动科学发展的六个问题
哪些过程产生一般协方差?
模型应当在注意、记忆负荷、知识和策略发生变化时提出相互竞争的预测,而不仅仅是重现同一个相关矩阵。
能力是如何相互耦合的?
高密度纵向研究可以检验早期过程是如何彼此产生、制约或相互强化的,以及学校、健康和机会如何改变这一网络。
走出测试室后,什么仍然有效?
研究需要真实任务、延迟迁移、日常生活功能和长期结果,而不仅是更快完成密切相关的题目。
广泛能力和狭窄能力何时能增加价值?
预注册的预测和干预研究可以确定:与一般综合分数和直接成就证据相比,某个领域分数何时会改变结论。
哪些构念可以跨情境迁移?
翻译、认知访谈、当地规范、不变性、预测和后果必须结合起来研究,而不能把某一项统计检验当作公平性证明。
谁会从分类中受益?
技术上准确的排名仍可能限制机会。研究应追踪错误决策、获取机会、隐私、申诉,以及评估是否确实改善了支持。
动态评估与计算评估
传统测验抽取的是一个人在标准支持条件下当前能够完成的任务。动态评估考察表现如何随着提示、教学或反馈而变化,因而可能揭示学习过程以及已达到的水平。计算机自适应测验可以高效地定位难度,过程数据则可以记录作答时间或策略轨迹。这些方法也会带来新的依赖:设备熟悉度、专有模型、监控、安全性和算法漂移。更多数据并不会消除界定构念或验证决策的必要性。
生物学应当约束心理测量学,而不是取代它
脑成像、遗传学和计算神经科学或许能阐明支持推理、记忆和知识的分布式机制。但分数的神经相关物并不能证明该因素是某种单一的生物学原因;生物学测量本身也存在信度、选择和解释方面的问题。强有力的理论会连接不同层次,同时保留统计概括、认知过程、发展路径和社会结果之间的差异。
最有用的未来是多元而严谨的
当目标是进行广泛预测时,保留总体分数。当具体覆盖范围很重要时,使用卡特尔—霍恩—卡罗尔(CHC)能力领域。在情境有要求时,观察创造性和实践性表现。将动机、知识、人格、适应性功能和机会作为独立证据加入,而不要不断扩展“智力”的含义,直到它涵盖所有受重视的人类品质。
19 · 人们常问的问题
关于常见智力理论问题的清晰回答
正确的回答通常应先区分观测分数、统计模型、假定机制以及某人想要作出的决策。
是 g 和智商是同一回事吗?
不。 g 是一种潜在的统计维度,用于概括认知任务之间的协方差。智商是由特定测验组合和计分系统产生的常模参照分数。全量表智商通常与心理测量学中的 g,但它也反映了测验组合的任务内容、权重、广泛能力与具体能力、测量误差以及施测条件。
正向共同体结构是否证明只有一种智力?
不。它表明,多种认知表现往往呈正相关。一个共同原因 g 模型可以表示这种模式,但抽样模型、过程重叠模型、互惠模型和网络模型也可以产生这种模式。这种共同体结构有力地证明了各种能力并非完全相互独立;但它并不能证明存在某种单一的心理实体,导致所有相关性。
有多少种智力?
不存在一种不依赖理论的计数方式。在宽泛的心理测量层面,可以用一般因素概括表现。在更细的层面,CHC 区分了众多宽泛和狭窄能力。斯滕伯格描述的是智慧行动的模式,而加德纳提出的是具有文化价值的多种智力。究竟采用多少种,取决于问题、证据和描述层次,而不是发现一组最终固定的分类框。
斯皮尔曼和 CHC 是否相互矛盾?
不一定。层级式 CHC 模型保留了一般因素,同时也描述宽泛能力和狭窄能力。历史上的分歧更清楚地体现在霍恩与卡罗尔之间:霍恩反对实质性的高阶 g以及卡罗尔;卡罗尔的三层模型包含一般因素。现代 CHC 是一个总括性分类体系,可以容纳不止一种关于能力为何相关的解释。
斯滕伯格是否证明了分析性、创造性和实践性智力彼此独立?
没有确凿的证据支持三种彼此清晰独立的能力。一些表现性任务比选择题任务能提供更多信息,也能更好地区分能力,但许多研究发现它们与一般认知能力、内容和方法存在重叠。斯滕伯格的框架对于拓宽教育和评估所鼓励人们开展的活动仍然很有价值;其因素结构和增量效度应当根据具体研究逐项判断。
CHC 是经科学证明的“最佳”理论吗?
CHC 是当代许多心理测量评估中最具影响力的综合分类体系,其依据来自大量关于结构的研究。“最佳”一词如果暗示它是一套完整的因果理论或一张固定不变的最终地图,就会产生误导。具体能力及其标签仍在变化;没有哪一套测验能测量全部能力;而过程理论、发展理论、情境理论和网络理论所探讨的问题,也不是这一分类体系能够解决的。
流体智力和晶体智力有什么区别?
流体推理涉及在相对新颖的问题中发现并运用关系。晶体智力或理解—知识能力涉及通过文化和教育发展起来的语言与知识。大多数有意义的任务都需要二者。流体任务可以减少对明确先前内容的要求,但不可能真正做到不受文化或经验影响;晶体智力是组织化的理解,而不只是零散知识。
智力在什么年龄达到峰值?
没有一个统一的年龄。加工速度以及某些记忆或推理任务往往较早达到峰值;词汇、知识和一些受社会因素影响的判断则较晚成熟。即使在这些类别内部,具体任务也各不相同。原始能力、按同龄人常模调整后的相对水平,以及相对于同龄人的位置,也是不同的概念。健康、教育、出生队列和练习都会改变发展轨迹。
智力分数会变化吗?
是的。分数可能因发展、教育、疾病或康复、感官获取、语言、练习、动机、测试版本和测量误差而变化。准实验研究证据表明,教育会对认知测试表现产生因果影响。14 中等或较高的稳定性意味着人们相对于同伴的排名通常会保持相似;这并不意味着一个人无法学习,也不意味着得分是生理上的上限。
非言语测试或“文化公平”测试不受文化影响吗?
不能。它们可能会减少词汇量和特定课程知识,而这方面的信息可能有用。但它们仍取决于指令、符号、视觉获取条件、应试惯例、速度要求、策略和常模。跨文化解释需要适当的调整、当地证据,以及对测量等值性和后果的考察。
认知特征能诊断多动症、自闭症、阅读障碍或脑损伤吗?
不能仅凭认知特征本身下结论。某些状况可能影响表现,而某种特征组合可能提示值得进一步追查的假设。相似模式可能由多种原因造成,患有同一诊断的人也可能具有不同的特征。诊断需要依据与该状况相关的发展、医学、教育、行为和功能证据,并采用针对该状况的标准。
得分差异要多大才重要?
不存在适用于所有情况的统一数值。应考察差异是否超过预期测量误差、在相关常模群体中出现的频率、能否重复出现、所比较的得分是否测量了足够不同的构念,以及这是否改变了对实际转介问题的理解。仅有统计显著性并不能证明其具有临床或教育意义。
测试便利措施会让得分不公平地偏高吗?
适当的便利措施可以消除与目标构念无关的障碍。例如,当普通印刷材料只是附带因素时,屏幕阅读器可以帮助个体接触推理内容;但如果测量的本身就是速度,那么延长时间可能并不合适。公平意味着对所要测量的构念提供等效的获取条件,而不一定要求完全相同的施测方式。应记录所做的调整及其解释限制。
高智商能保证学业、职业或人生成功吗?
不。一般认知能力平均而言可以预测学习和某些表现结果,但不同分布之间存在广泛重叠。知识、动机、自我调节、兴趣、创造力、健康状况、社会支持、歧视、资源、机会和偶然因素也会影响结果。相关性可以改善群体层面的预测,但不能替某个人写好未来。
群体得分差异能证明测试存在偏差吗?
不,反过来也同样不成立:没有心理测量偏差,并不能证明一个选拔系统是公平的。差距是描述性发现。应分别考察测量等值性、题目功能、预测效度、学习机会、语言、获取条件、常模、选拔规则及其后果。群体平均数无法确定个体差异的原因或潜能。
加德纳的多元智能与斯滕伯格的理论相同吗?
在线 IQ 测试能提供诊断或正式分数吗?
在线分数不会仅仅因为被标为“IQ”就具有诊断性。只有当证据涵盖该测量工具、实施方式、受测人群和决策用途,并具备安全的标准化、身份与访问核查以及情境化解读时,由专业人员监督的远程评估才可能支持正式用途。休闲网站上的分数不应指导诊断、安置或就业。
自适应测试或 AI 会消除偏见吗?
不。自适应施测可以针对题目难度并缩短测试时间;自动评分可以提高对既定反应评分的一致性。两者都继承了关于构念、训练数据、题目、界面、终止规则和标准的选择。它们可能通过设备获取、语言模型、监控或漂移引入新的不平等。自动化改变了判断发生的位置;但并没有消除验证、透明度和申诉的必要性。
结论
智力具有结构、情境和后果
当这些理论的主张被限定在恰当层次时,它们会变得更有用,而不是更无用。
斯皮尔曼发现了一种一般模式,任何严肃解释认知差异的理论都必须面对它。卡特尔和霍恩区分了推理与习得知识,并拓宽了广义能力的图谱。卡罗尔将数十年的证据整理成一个层级体系,而 CHC 则为评估提供了一套共享且不断发展的词汇。斯滕伯格坚持认为,聪明的行为还涉及新颖性、应用、目标和环境。
诚实地使用整体模式
一般认知分数可以可靠且具有预测性。报告其不确定性、常模、任务要求和经过验证的用途。不要把一个指数实体化为固定本质。
当问题需要时,应进一步考察
广义和狭义能力、知识以及表现情境都可能很重要。应将能力画像解读为有多方证据支持的假设,而不是诊断指纹。
将价值置于分数之外
评估可以指导支持或机会;但不能决定一个人的尊严。公平的决策需要获得机会、相关证据、相称的后果以及申诉途径。
没有必要在认可一般认知能力与重视多种形式的能力之间二选一。严谨的立场是相加式的:使用 g 对于它所总结的内容;对于它所描绘的结构,使用 CHC;对于情境任务所独有地揭示的内容,使用情境任务;而对于真正重要的成就、创造力、动机、适应行为、知识和机会,则直接加以测量。
最明智的智力理论,不是把每一种人与人之间的差异都化为一个数字的理论,而是告诉我们,一个数字包含哪些证据、遗漏哪些证据,以及如何在不把预测与命运混为一谈的情况下采取行动。
主要研究、技术文档和官方指南
来源
链接行为:外部来源链接将在新标签页中打开。
- Spearman, C.(1904),“一般智力”:客观测定与测量,《美国心理学杂志》。
- Carroll, J. B.(1993),认知能力理论:三层理论,载于《人类认知能力》。
- McGrew, K. S.(2009),CHC 理论与人类认知能力项目:站在心理测量智力研究巨人的肩膀上,《智力》。
- McGrew, K. S.(2023),卡罗尔三层(3S)认知能力理论三十年:影响、3S-CHC 理论阐释、结构复制,以及认知—成就心理测量网络分析的扩展,《智力期刊》。
- Savi, A. O. 等(2019),智力的神经连接,《心理科学观点》。
- van der Maas, H. L. J. 等(2006),一般智力的动力学模型:通过互惠作用形成的智力正向流形,《心理学评论》。
- van der Maas, H. L. J. 等(2017),认知发展与智力的网络模型,《智力期刊》。
- Kovacs, K. & Conway, A. R. A.(2016),过程重叠理论:对智力一般因素的统一解释,《心理学探究》。
- Kan,K.-J. 等(2024),为什么双因素模型优于高阶 g 因子模型?网络视角,《智力杂志》。
- Demeke,S. 等(2026),一般心理能力仍是工作绩效的最佳预测指标吗?整合当代元分析证据,《商业与心理学杂志》。
- Roth,B. 等(2015),智力与学校成绩:一项元分析,《智力》。
- Deary,I. J.、Hill,W. D. & Gale,C. R.(2021),智力、健康与死亡,《自然人类行为》。
- Pietschnig,J. & Voracek,M.(2015),全球智商提升的一个世纪:弗林效应的正式元分析(1909–2013),《心理科学展望》。
- Ritchie,S. J. & Tucker-Drob,E. M.(2018),教育在多大程度上提高智力?一项元分析,《心理科学》。
- Hartshorne,J. K. & Germine,L. T.(2015),认知功能何时达到峰值?不同认知能力在整个生命跨度中的异步上升与下降,《心理科学》。
- Tucker-Drob,E. M. 等(2022),人类认知老化过程中流体能力与晶体能力变化之间的强依赖关系,《科学进展》。
- Sternberg,R. J.(1999),成功智力理论,《普通心理学评论》。
- Sternberg,R. J. & 彩虹项目合作者(2006),彩虹项目:通过分析、实践和创造性技能评估改进 SAT,《智力》。
- Hedlund,J. 等(2006),评估商学院招生中的实践智力:研究生管理学招生考试的补充,《学习与个体差异》。
- McDaniel,M. A. 和 Whetzel,D. L.(2005),情境判断测验研究:为实践智力理论之争提供信息,《智力》。
- Chooi,W.-T.、Long,H. E. 和 Thompson,L. A.(2014),斯滕伯格三元能力测验(H级)是对g的测量,《智力杂志》。
- Gubbels,J. 等(2016),将Aurora-a测验组作为小学高年级三元智力能力评估工具,《资优儿童季刊》。
- Sternberg,R. J. 等(2014),在四年级语言艺术、数学和科学教学中检验成功智力理论,《教育心理学杂志》。
- Saw,K. N. N. 和 Han,B.(2021),成功智力训练项目的有效性:一项元分析,《PsyCh杂志》。
- Sternberg,R. J.(2021),适应性智力:智力并非个人特质,而是人与任务和情境之间的交互作用,《智力杂志》。
- Cattell,R. B.(1943),成人智力的测量,《心理学通报》。
- Horn,J. L. 和 Cattell,R. B.(1966),流体智力与晶体智力理论的完善与检验,《教育心理学杂志》。
- McGrew,K. S. 等(2023),CHC智力测量的心理测量网络分析:对广义CHC分数“超越g”的研究、理论与解释的启示,《智力杂志》。
- Schneider,W. J. 和 McGrew,K. S.(2018),卡特尔–霍恩–卡罗尔认知能力理论,载于《当代智力评估》,第4版。
- Pearson,WISC–V 官方信息。
- Pearson,WAIS–5 官方信息。
- Canivez,G. L. 等(2026),WAIS-5 的构念效度:对 20 个主要和次要分测验进行探索性与验证性因素分析,《评估》。
- LaForte,E. M.、Dailey,D. 和 McGrew,K. S.(2025),WJ V 技术摘要,Riverside Insights。
- Watkins,M. W. 等(2022;在线发表于 2021 年),临床样本中韦氏儿童智力量表第五版分数的长期稳定性,《应用神经心理学:儿童》。
- de Jong,P. F.(2023),WISC–V 优势与弱势剖面的效度,《心理教育评估杂志》。
- Breit,M. 等(2024),特定认知能力分数有多大用处?考察其稳定性及其在一般智力之外的增量效度,《智力》。
- AERA、APA 和 NCME(2014),教育与心理测验标准。
- 国际测验委员会,测验使用指南和测验翻译与改编指南。
- 美国智力与发展障碍协会,智力障碍的定义。
- Pedraza, O. 和 Mungas, D.(2008),跨文化神经心理学中的测量,《神经心理学评论》。
- 美国平等就业机会委员会,就业测试与甄选程序。
- Brown, R. E.(2016),赫布与卡特尔:流体智力和晶体智力理论的起源,《人类神经科学前沿》。
- Floyd, R. G. 等(2005),卡特尔–霍恩–卡罗尔广泛能力综合分数能否在不同测验组之间互换?,《学校心理学评论》。
- Rodriguez, A.、Reise, S. P. 和 Haviland, M. G.(2016),在心理测量工具评估中应用双因素统计指标,《人格评估杂志》。
- Warne, R. T. 和 Burningham, C.(2019),在31个非西方国家发现斯皮尔曼的g:有力证据表明g是一种普遍现象,《心理学公报》。
- Wicherts, J. M.(2016),神经认知能力测验中测量恒等性的重要性,《临床神经心理学家》。
- 美国教育部,《美国联邦法规》第34编第300.304条——IDEA下的评估程序。
- 美国司法部,《美国残疾人法》要求:考试便利措施。
- Card, D. 和 Giuliano, L.(2016),普遍筛查能否提高低收入和少数族裔学生在资优教育中的代表性?,《PNAS》。
- Kanaya, T.、Scullin, M. H. 和 Ceci, S. J.(2003),弗林效应与美国政策:不断上升的智商分数对特殊教育分类的影响,《美国心理学家》。
- Runco, M. A. 与 Acar, S.(2012),发散思维作为创造潜能的指标,《创造力研究杂志》。
- 美国心理学会,《心理学家伦理原则与行为准则》,尤其是评估标准9.01–9.10。
- 国际测验委员会(2018),《国际测验委员会测验翻译与改编指南(第二版)》,《国际测验杂志》。
- Thurstone, L. L.(1938),《基本心理能力》。
- Sternberg, R. J.(1985),《超越IQ:人类智力的三元理论》,剑桥大学出版社。
- Gardner, H.(1983),《思维框架:多元智力理论》,Basic Books。
- Visser, B. A.、Ashton, M. C. 与 Vernon, P. A.(2006),超越g:检验多元智力理论,《智力》。
- Breit, M.、Conway, A. R. A. 与 Kovacs, K.(2025),获得一般智力因素的99种方法——但它们并非同等有效,《心理教育评估杂志》。
证据审查截至2026年9月4日。 来源日期不代表证据权重相同:原始理论确立历史性主张;心理测量学研究检验结构;荟萃分析综合关联;专业或法律指南则规范特定用途。应用某项评估时,读者应查阅所在司法管辖区的最新版手册和相关要求。
继续阅读“智力释放”系列
从基础到应用探索智力
以证据为基础的教育指南。最近一次证据审查:2026年9月4日。