关于智力的定义与观点
Linas Juozenas分享
什么是智力?能力、知识、智慧、情绪与人工智能
一份清晰、关注证据的智力、智商与认知成长指南:更强的能力如何加速学习、加深理解、提升解决问题的能力,并帮助我们更有效地规划、决策和应对生活。
核心理念
智力是一组真实且会产生重要影响的相关能力,涵盖学习、推理、解决问题和适应。更强的广泛认知能力可以让人更容易理解新想法、更快学习、更清晰地看待复杂情境,也更容易找到有效的解决方案。发展这些能力很有价值,而真实的成长值得被认可和庆祝。
智商是我们对广泛认知表现最有用的标准化估计之一。 在得到良好测量并结合具体情境解读时,它可以揭示有意义的优势、困难和变化。它能提供信息,但并非绝对可靠:分数存在不确定性,可以随时间发展,而且不能取代关于知识、创造力、判断力、品格和经验的完整图景。
智力很重要——培养智力可以改变人生
智力支持人们学习、识别模式、理解后果、解决陌生问题和调整计划的速度与深度。这些优势可以在教育、工作、健康决策和日常生活中不断累积。然而,要有效发展智力,我们必须将广泛的认知能力与一个人已经掌握的知识、选择的明智程度、理解情绪的能力以及运用自身能力的成效区分开来。
设计良好的智商评估能够捕捉广泛认知表现中的重要差异,并帮助我们了解学习需求、优势和进步。其结果是对特定时间点的估计,并不是完全精确或永久固定的上限。发展、教育、健康、持续学习和生活条件都可能影响认知潜能的形成与发挥。
贯穿本指南的四个理念
更强的能力会带来真正的优势
广泛的认知能力有助于理解、学习速度、推理、解决问题和适应。这些优势会随着一个人学习更多、应对更高复杂度并更善于将一个情境中的洞见迁移到另一个情境而不断累积。
认知发展值得追求
教育、具有挑战性的学习、良好的健康状况、恢复性睡眠、有效的策略以及持续投入,都有助于能力发展并变得可运用。提升并非无限,也不会对每个人都相同,但不应否定有意义的进步。
智商分数很有用
设计良好的分数可以概括广泛的认知表现,并预测有意义的结果。最有力的解读还会考虑个人的能力概况、测量不确定性、健康状况、语言、教育背景和测试条件。
智力强化判断的工具
更强的能力可以帮助一个人理解他人的视角、预见后果、更新信念并作出更有效的选择。它能够支持更明智、更有效的行为,但并不能保证做到这一点:知识、价值观、情绪调节、智慧与责任感会引导智力的运用方式。
指导本文的问题
我们正在观察哪种形式的智力,如何以负责任的方式对其进行测量,以及什么有助于它发展并转化为更美好的生活?回答需要兼具抱负与精准:既要庆祝认知进步,也要准确理解测验、研究、训练方法或人工智能基准测试究竟能够展示什么。
为什么智力难以定义
这个词指向一种真实且有用的模式,但没有任何一句话能涵盖所有形式的能干思考。
从最广义上说,智力是从信息和经验中学习、推理关系、解决问题,并在熟悉的常规已不足以应对时进行适应的能力。这个工作定义很有用——但其中的每个术语都会引出另一个问题。
学得快是否比记住多年更重要?优雅的抽象解法是否比在艰难现实环境中可行的回应更聪明?智力是否应包括理解他人、选择有价值的目标,或意识到自己的推理有误?研究人员对这些问题的回答各不相同,因为他们往往试图解释心理生活的不同部分。
学习与组织
识别模式,构建概念,将新信息与先前的知识联系起来,并在情境变化时提取相关信息。
推理与解决问题
比较各种可能性,推断关系,牢记限制条件,并构建一个并非事先简单记住的答案。
适应并修正
监测结果,识别策略何时失效,并根据证据相应地改变自己的方法、环境或目标。
不应混为一谈的三个层次
一旦我们区分一个人的潜在能力、某一次的表现以及最终产生的结果,许多争论就会消失。
这个系统能做什么?
一种相对持久的推理、记忆、理解或学习能力。它无法被直接观察,只能根据多次行为表现样本推断出来。
此时此地发生了什么?
在特定条件下完成特定任务所取得的结果。能力会产生影响,但准备情况、健康状况、注意力、语言、努力程度和偶然因素也会发挥作用。
随着时间发生了什么?
成绩、发明、职业、关系或决定,反映的是能力与机会、价值观、坚持、资源、他人及事件之间的相互作用。
一种科学构念,而非隐藏的物质
研究者无法把“智力本身”放在量表上。他们观察跨任务的模式,并建立模型来解释为什么某些表现往往会共同变化。一个模型可以很有解释力,却不必是头脑中的实体。通常被称为 的一般因素 g例如, 是对认知任务之间共同变异的统计描述,而不是一种流体、器官或单一的大脑区域。
因此,定义在一定程度上取决于目的。心理测量研究者可能会询问,哪些能力最能解释测试结果之间的差异。发展科学家可能会研究推理能力如何随着年龄和经验而变化。临床医生可能需要了解个人的能力特征。教育工作者可能关注如何培养知识和策略。人工智能研究者可能会把成功完成任务称为“智能”,但并不因此声称某个系统像人一样思考或体验世界。
真实的差异——以及真实的发展潜力
认知差异是真实存在且影响深远的,正因如此,高质量的测量、教育和发展机会才至关重要。评估可以揭示优势、确定支持需求、指导学习,并追踪有意义的进步。认真看待智力,并不意味着要把它变成评判尊严或可能性的结论;而是要充分理解这一宝贵能力,从而帮助它充分发展。
一张容易混淆的概念地图
有能力的人类行为由相互重叠的多种资源共同构成;准确地命名它们,可以避免用一个结果吞没其他能力。
一个知识渊博的人可能因为相关模式已经熟悉而快速作答。新手可能需要出色的推理能力,才能得出部分答案。另一个人也许理解这些事实,却做出了糟糕的选择。仅凭可见结果,我们无法判断究竟是哪种能力产生了这一结果。
向左或向右滑动以进行比较 →
| 概念 | 核心问题 | 典型证据 | 不等同于 |
|---|---|---|---|
| 智力 | 一个人学习、推理、解决陌生问题和适应的能力有多强? | 贯穿多项认知任务、学习要求,有时也包括现实表现的模式。 | 单一事实、学校成绩、品德、社会地位或价值衡量标准。 |
| 认知能力 | 特定的心理运算能完成得多好? | 涉及推理、记忆、速度、语言、注意力或空间处理的任务。 | 完整的智力或人格;能力可能很宽泛,也可能高度具体。 |
| 智商或测试分数 | 这次表现与该评估中恰当常模相比如何? | 具有已知测量特性的标准化综合分数或能力概况。 | 完整意义上的智力、一个精确数值,或永久性的人格标签。 |
| 知识 | 学到了哪些信息、概念和程序? | 对已获得信息的回忆、解释、识别和成功运用。 | 不受学习机会影响的推理能力。 |
| 专业能力 | 知识和技能在某个领域内的应用有多有效? | 经过大量经验后,在真实任务上的可靠且通常高效的表现。 | 在该领域之外的普遍能力。 |
| 智慧与判断力 | 在不确定性和价值冲突下,哪种目标或行动是恰当的? | 换位思考、校准判断、意识到后果,以及结合情境审视决策。 | 处理速度、事实知识,或高分所保证的道德品质。 |
| 创造力 | 能否产生或识别既新颖又有用的事物? | 创意生成、原创性、评估,以及在相关领域内接受评判的作品。 | 仅凭新颖性、古怪特质或一般智力。 |
| 情绪与社会技能 | 对情绪和社会情境的感知、理解和管理有多准确? | 能力任务、观察到的行为,以及对自己或他人报告的谨慎解读。 | 一个全世界都一致认可的“情商”、善良、受欢迎程度或不受情绪影响。 |
| 意识 | 是否存在主观体验,其中又有什么内容? | 第一人称报告、行为表现以及相互印证的生理证据。 | 智力、反应能力或流畅的语言输出。 |
| 成就 | 到目前为止学到了什么、完成了什么或展示了什么? | 课程学习、资格证书、产品、表现以及已掌握的技能。 | 未被开发的潜能,或仅凭能力产生的结果。 |
这些界限是分析上的界限,而不是高墙。知识支持推理,推理有助于获取知识。情绪调节可以保持注意力,而创造力往往同时依赖专业知识和灵活思维。区分这些术语的目的不是割裂一个人,而是避免关于某个组成部分的论断,变成没有依据的关于一切的论断。
一种有用的翻译习惯
当你遇到“更聪明”这个说法时,不妨把它替换成一个问题:具体是哪项任务做得更好?与谁相比?如何衡量?在什么条件下?精确表述能把一个令人印象深刻的标签变成可检验的论断。
认知表现的基本组成
复杂思维源于各有优势、局限和时间尺度的协调系统。
解决一个看似简单的问题,也可能需要同时进行多个过程:理解指令、保持相关信息处于活跃状态、忽略干扰、提取知识、识别模式、测试回应并察觉错误。“智力”是一个方便的概括;认知才是其背后协调运作的过程。
流体推理
推断规则、识别关系,并解决无法通过提取某一项已学事实来回答的问题。新颖性是相对的:对一个人不熟悉的任务,对专家来说可能是常规任务。
理解与知识
通过教育和经验积累的词汇、概念、文化信息以及特定领域的理解。知识会改变人们能够注意到什么,以及能够多高效地表征问题。
工作记忆
在执行任务时维持并操纵有限数量的信息——例如遵循多项限制条件或更新中间结果。策略和有意义的组织方式可以减轻负担。
加工速度
准确而快速地完成相对简单的认知操作。速度可以通过释放时间和注意力来支持复杂工作,但较慢的思考可能很有价值,速度本身并不等于智力。
注意与执行控制
优先处理相关信息、抵抗干扰、切换规则并维持目标导向的行为。这些过程帮助能力作用于任务,但可能会随状态和环境而显著波动。
语言与视觉空间加工
理解语言关系,并表征形状、位置、变换或路线。不同任务对这些资源的调动比例不同,而语言要求可能掩盖其他优势。
学习与长期提取
编码新材料、巩固所学内容并在之后找到它。提取信息不仅取决于存储,还取决于线索、干扰、情绪、睡眠,以及学习时信息组织得是否良好。
元认知
估计自己知道什么、检查进展并改变策略。良好的监控有助于调动其他能力,但自信程度可能与实际水平不匹配,而且内省并不能准确揭示每一个心理过程。
为什么认知能力模式并不均衡
各种能力彼此相关,但并不相同。一个人可能推理能力很强,但工作速度较慢;可能能理解复杂的口语观点,却觉得视觉组织很困难;也可能知识十分丰富,却难以在时间压力下提取这些知识。发展经历、教育、语言、残障、神经系统病史以及正常个体差异,都可能促成独特的能力模式。
综合得分会出于特定目的,概括这类模式中的一部分。概括可能有所帮助,但必然会丢失细节。综合得分相同的两个人,可能是通过不同的优势与困难组合取得这一得分的;为了发挥最佳水平,他们可能需要截然不同的条件。
观察到的表现是一个完整情境的产物
睡眠不足、急性压力、抑郁、疼痛、疾病、药物影响、醉酒、感觉障碍、语言不匹配以及不易使用的测试形式,都可能降低一个人能够展示的能力。指令不清或缺乏相关教育也可能产生同样影响。这些因素并不会使每项结果都失效,但在解释结果时应将它们纳入考量。
协调与孤立的组成部分同样重要
现实世界中的任务很少只属于一个类别。阅读医学解释可能同时涉及词汇、工作记忆、既有知识、注意力以及对不确定性的判断。修理机器可能结合空间表征、因果推理、感觉运动技能和经验。安慰一个痛苦的人可能需要语言、社会知觉、情绪调节和价值观。
因此,这些构成要素不应变成一种新的“更优秀”心智排名。它们是一套理解表现如何组合而成的词汇,帮助我们理解为什么一条路径上的困难不必然抹去其他方面的优势,也帮助我们理解为什么审慎的评估会关注各种模式,而不是把一个人变成一个数字。下一节将考察用于整理这些模式的主要科学模型。
智能的主要科学模型
模型整理认知表现中反复出现的模式;它们是证据的地图,而不是心智的字面图示。
在一项设计良好的认知任务中表现出色的人,平均而言往往也能在其他任务中取得较好表现。与此同时,言语知识、空间推理、记忆和速度彼此可以区分:一个人可能在其中一项上的能力远强于另一项。当代大多数模型都试图解释这两个事实——共同模式和不均衡的能力侧面——而不假装其中任何一个能够完整说明一个人的情况。
正流形与 g
当广泛的人群完成各种认知任务时,各项得分之间通常呈正相关。这种反复出现的模式称为正流形(positive manifold)。因素分析可以用一个通常称为g的一般因素,概括这些任务之间的共同方差。估计的g越高,意味着统计模型发现的、各项抽样任务之间共有的表现模式越多;这并不意味着研究人员直接找到了或称量了一种叫作一般智力的物质。
共同变异
g 之所以有用,是因为广泛的认知任务并非彼此独立。它可以概括这些任务部分的共同变异,并帮助预测学习和推理发挥作用的结果。
一种原因或一个脑系统
仅凭一个共同因素,并不能证明一种生物机制产生了所有相关性。多个相互作用的发展过程和神经过程可能产生相同的统计模式。
斯皮尔曼的早期模型强调一般因子与任务特定影响并存。后来的层级模型保留了一般模式,同时将广泛能力和狭窄能力置于其下方。其他研究路径则探讨,正向流形是否可能通过相互促进的发展而产生:更强的词汇能力可以使后续学习更容易,推理能力的提升可以加速知识获取,而某一过程的进步可以为另一个过程的进步创造机会。这些解释并非在每个层面上都相互排斥;一个模型可以准确描述协方差,却不必提供其完整的发展或神经原因。
从流体能力和晶体化能力到 CHC 家族
卡特尔区分了流体推理——解决相对不熟悉的问题——以及晶体化能力或理解—知识能力,后者反映通过学习和文化形成的知识与语言。霍恩扩展了广泛能力的集合。卡罗尔后来重新分析了数百组数据,并提出了一个三层级结构:许多狭窄技能、数量较少的一组广泛能力,以及位于其之上的一般因子。
术语 卡特尔—霍恩—卡罗尔,即 CHC 理论 现在指一系列相关的心理测量模型,这些模型将上述传统结合在了一起。常见的广泛领域包括流体推理、理解—知识、工作记忆、视觉和听觉加工、加工速度、学习效率以及提取流畅性。有些版本还区分数量知识、阅读知识和写作知识。随着证据和测试设计的发展,这些名称及其边界也发生了变化,而且没有任何单一评估能够同等充分地测量所有 CHC 领域。
向左或向右滑动以进行比较 →
| 模型或传统 | 核心思想 | 它有助于解释的内容 | 解释边界 |
|---|---|---|---|
| 斯皮尔曼的一般因子模型 | 一般因子概括了不同任务之间共享的方差,同时特定影响仍然存在。 | 正向流形,以及为什么广泛综合指标能够提供有用信息。 | 潜在因子是一种统计构念,并不能证明存在某个单一器官、基因、物质或统一原因。 |
| 卡特尔—霍恩广泛能力传统 | 认知表现包括若干彼此相关的广泛能力,最初主要围绕流体推理和习得知识展开。 | 为什么新颖推理和习得知识的发展可能不同,并形成不均衡的优势。 | 霍恩没有设置一个单一的高阶 g 以与卡罗尔相同的方式位于广泛能力之上。 |
| 卡罗尔的三层模型 | 狭窄技能位于广泛能力之下,最高层级则是一般因子。 | 详细的任务得分、较宽泛的领域和总体共同方差如何共存于同一层级结构中。 | 该层级描述测试之间的协方差;它并不是关于发展、教育或大脑的完整理论。 |
| CHC 家族 | 一种实用的综合方式是在广泛的认知领域内组织许多狭窄技能;在卡罗尔式版本中,通常还会包含一个高阶一般因素。 | 测验编制、广泛测验电池的选择,以及对不同领域能力概况的讨论。 | CHC是一组不断发展的分类体系,而不是一个固定不变、普遍认可的金字塔。 |
| 互惠论与网络解释 | 相互作用的认知过程能够在发展过程中彼此强化,并产生正相关。 | 一般模式如何在没有某一种潜在因果能力控制每项任务的情况下形成。 | 证明这种模式能够出现,并不能证明每一种潜在因素解释都是错误的。 |
| 过程与发展取向 | 注意、记忆、策略、知识、学习经历和执行控制被作为不断变化的系统加以研究。 | 绩效是如何形成的,以及为什么相同的分数可能源于不同的过程。 | 对具体过程的详细解释未必能产生一个简单的排名,也未必能再现每套测验电池的结构。 |
更广泛的模型:有用的问题,存在争议的独立性
人的能力显然是多维的:人们进行推理、创造、协调动作、理解社会情境、建立领域专长,并以截然不同的能力组合解决实际问题。科学问题不在于这些差异是否重要,而在于每种受重视的能力是否都应被归类为一种独立的智力,是否能够被可靠地测量,以及证据是否表明它与一般认知能力和广泛认知能力足够独立。
加德纳:拓宽视野
加德纳提出了语言、逻辑—数学、空间、音乐、身体—动觉、人际、内省和自然主义智力。该框架通过鼓励教师认识到能力的多种形式,并以不止一种方式呈现重要思想,对教育产生了深远影响。加德纳还强调,多元智力并不是固定的“学习风格”,不应据此为每位学习者指定一种偏好的感官途径。
其心理测量学地位仍存在争议。在一项直接检验相关任务的研究中,这些任务被选来代表所提出的领域;许多认知测量共享了大量一般因素方差,而没有形成彼此清晰独立的智力。结果并不意味着音乐、身体、社会或生态能力不重要;它们质疑的是这样一种更强的主张:每个提出的领域在心理测量学意义上都是一种自主的智力。
斯滕伯格:分析性、创造性和实践性
斯滕伯格的框架探讨人们如何在社会文化背景中追求目标时,平衡分析性评估、对新颖事物的创造性反应和实践行动,以适应、塑造或选择环境。这一框架有助于将注意力从传统的题目形式转向知识和推理能否得到应用。
彩虹项目等研究报告称,经过专门设计的创造性和实践性评估,在既有招生测量指标之外,还能对大学表现作出一定程度的增量预测。三种能力在心理测量学上是否彼此可分、在特定评估设计之外能增加多少预测力,以及它们在多大程度上反映 g,知识或方法效应仍存在争议。因此,最好将该框架呈现为一种有影响力且可检验的主张,而不是对层级模型的既定替代方案。
现实问题具有文化情境性
成功的行动部分取决于一个群体重视什么、有哪些工具和机会、经验使哪些知识变得内隐,以及一个人能否根据环境调整策略。传统测验组合不可能穷尽农业、照护、谈判、手工技艺、领导力或应对陌生机构等方面的实践能力。
然而,情境并不会创造出一个普遍的实践商数。在一种环境中由专家提出的解决方案,可能在另一种环境中失败;而且实践任务仍可能依赖一般推理、习得知识、人格和社会机会。评估应当明确领域和标准,而不是把“现实世界智能”变成另一个脱离情境的数字。
平衡的结论是多元而非任意:人类能力包含许多具有重要后果的维度,但并非每一种才能、价值观或受文化推崇的技能都必然构成一种独立的心理测量学智能。更广泛的理论只有在能够针对任务、发展和情境提出精确问题,并且其独特性经过检验而非被预先假定时,才最有用。
关于更广泛模型的证据
FSIQ 不等同于 g
全量表智商是根据某一特定测验中的指定分测验计算出的一个观测综合分数。它的内容、权重、常模和测量误差都属于该测验。相比之下,g 是根据数据集中协方差的模式估计出的潜在因素。设计良好的 FSIQ 可能是一般认知表现的有力实用指标,但它并不是从某个普遍存在的 g 测量仪上直接读出的数值。
当能力剖面不均衡时,这一区分尤为重要。同一个FSIQ可能由推理、知识、记忆和速度的不同组合产生。对于某些用途而言,总体综合分仍可能是最精确的概括,而广度指数分则可能回答更具体的问题。某项指数差异是否具有意义,取决于其大小、可靠性、在相关常模群体中的出现频率、置信区间,以及它是否与个人经历和观察到的功能表现一致,而不能仅凭视觉上的不均衡来判断。
在问题所处的层级选择模型
当问题涉及广泛测验中跨任务共享的表现时,使用一般因子;当问题涉及某种特定模式时,使用广度或狭窄能力;当问题涉及该模式如何形成或可能发生变化时,使用发展性和过程性证据。没有任何一个层级可以在不加说明的情况下取代其他层级。
关键证据与延伸阅读
智力是如何测量的
认知分数是根据明确的任务样本、施测方式、评分规则和参照人群得出的估计值。
专业认知评估并不是一组带有一个名为“智力”的秘密答案的谜题,而是一种结构化的抽样过程。经过谨慎选择的任务会在标准化条件下施测,按照有据可查的规则综合,并与适当的常模群体进行比较。结论的质量取决于这一链条中的每一个环节。
从任务表现到解释后的分数
从预期用途出发
筛查、教育规划、临床概念化、研究和高风险选拔具有不同目的。对一种用途而言充分的证据,对另一种用途而言可能并不充分。
使用不止一项任务
子测验考查推理、知识、记忆、速度或其他领域。多项任务可减少对单一题型的依赖,并使更广泛的模式显现出来。
保持条件可比
对指导语、时间、材料、提示和评分规则进行控制,以限制无关变异,并记录偏离情况。
选择参照群体
只有结合适当的常模,原始表现才具有可解释性;这些常模通常按年龄匹配,并旨在代表特定时间点上的明确人群。
估计精度
信度证据和测量标准误说明了为什么应将观测结果视为一组合理分数范围,而不是精确测量值。
解释整个评估
病史、语言、教育、残障、健康状况、测验期间的行为、其他记录以及转介问题,共同决定分数能够被负责任地解释到什么程度。
信度:这一估计有多精确?
信度涉及一致性和测量精度。不同类型的证据会考察:题目是否协同测量、当所测能力预期保持稳定时分数是否能够相对稳定,或不同评分者是否达成一致。没有任何单一系数能够回答所有问题,而且信度属于在特定条件下获得的分数,而不是永久属于某个测验名称。
测量标准误将不确定性转换为分数单位。置信区间利用该误差表达观测结果周围的合理范围。区间并不意味着其中每个值都同样可能,也不意味着个体的能力会在区间端点之间随机变化。它意味着该评估的精确度不足以支持把点估计视为精确值。
总综合分数通常比简短分量表更精确,因为它们基于更多次观测。差异分数和不同时间点之间的变化可能不如任一单独分数精确。因此,负责任的解释应针对所讨论的确切总分、指数、分测验分数、差异或变化,要求提供精确度证据。
效度:证据支持得出什么结论?
效度并不是永久附着于某项测量工具上的标签。它指的是:证据和理论在多大程度上支持针对特定用途对分数作出的某种解释。同一项测验可能在某一人群中支持一种结论,却缺乏支持另一种结论、语言、情境或决策的证据。
内容与作答过程
任务是否充分抽样了预期领域?受测者是否运用了该解释所假定的推理、语言或知识类型,而不是受到无关要求的阻碍?
内部结构
题目和分测验之间的关系是否符合所提出的分数结构?如果对综合分数或指数进行解释,这种分组是否有依据支持?
与其他变量的关系
分数是否与相关结果和其他测量呈现预期的关系模式,同时又能与其不 intended to represent 的构念区分开来?
用途、后果与替代方案
针对这一决策作出的推断是否恰当?是否在监测可预见的错误?风险越高的用途,就越需要更强的证据、更完善的保障措施,并关注危害较小的替代方案。
常模回答的是“与谁相比?”
常模参照得分将表现定位于指定的比较群体之中。许多广泛使用的智商量表的设计是:年龄组平均数为100,标准差为15;但必须查阅相关手册,核实具体量表和换算方式。这个数字不是答对的百分比,也不是智力的绝对量。比如,得分130不能解释为智力比得分100高“30%”。
常模是带有日期和适用人群范围的证据。随着教育、健康状况、技术、语言和对测验的熟悉程度发生变化,常模可能不再具有同样的代表性。如果常模群体不能充分代表受测者的年龄、语言、文化经历或受教育机会,即使计分运算完全准确,也可能削弱预期的比较。
必须同时考虑可及性和可比性
未得到处理的听力、视力、运动、语言或交流障碍,可能使得分反映的是对测验形式的适应程度,而非目标能力本身。适当的便利措施可能至关重要。应记录这些措施的目的、可能影响,以及任何偏离标准施测的情况,以确保由此产生的解释保持透明。
不同工具回答不同问题
个别施测的综合测验组合可以支持观察、澄清,并呈现跨领域的能力概况。简短的团体筛查可以高效识别需要进一步评估的人,但通常只能支持范围更窄的结论。成就测验考查已经学会了什么;神经心理学测验则可能结合神经系统或临床问题,考查特定的心理过程。这些工具可能有所重叠,但不能相互替代。
在相信一项认知测验之前,请先问
- 正在解释的是哪个得分?用于作出什么决策?
- 常模样本和验证样本纳入了哪些人?是在何时纳入的?
- 有哪些可靠性或精确性证据适用于这一具体得分?
- 有哪些效度证据支持这种解释和使用方式?
- 施测方式、语言和使用条件是否适合这名受测者?
- 还有哪些证据可以确认、限定或反驳这一结果?
为什么在线测验并不会自动成为智商评估
精美的界面和即时得分,并不能确立代表性常模、标准化施测、安全性、可靠性、效度或合格的解释。除非这些内容已在针对预期用途的技术手册中得到记录,否则最稳妥的描述是:受测者在该测验中的表现,而不是经过专业确立的总体认知能力估计。
关键证据与延伸阅读
如何解读分数或认知特征概况
一份得到妥善解读的特征概况,能将测得的优势、当前的挑战和不确定性转化为一份有助于学习和发展的实践地图。
认知报告可以阐明一个人当前如何推理、学习、记忆、运用知识以及在时间要求下完成任务。将其视为一份特征概况而非定论,它可以识别可进一步发展的能力、有助于表现的条件,以及可能需要教学、策略、便利措施或进一步评估的领域。
向左或向右滑动以进行比较 →
| 报告要素 | 它能告诉你的内容 | 必须与其一同提供的内容 | 最佳用途或界限 |
|---|---|---|---|
| 原始分 | 按照测验规则获得的题目数、分值或计时单位数。 | 与年龄相适应的转换、任务规则以及任何施测变动。 | 在比较表现之前,使用正确的年龄和测验常模进行转换。 |
| 标准分 | 表现处于相关常模群体所定义量表中的位置。 | 测验工具、版本、量表、常模人群、常模日期和置信区间。 | 将其作为常模参照的估计值,而不是答对百分比或比率量。 |
| 百分等级 | 常模群体中得分等于或低于该表现的大致百分比。 | 正确的常模表,以及认识到百分位区间并不相等。 | 用它来传达相对位置;它并不表示所拥有能力的百分比。 |
| 置信区间 | 传达估计分数精确程度的范围。 | 所陈述的置信水平,以及用于计算该分数的具体方法。 | 在规划或比较分数时,将该区间与点估计一并保留。 |
| FSIQ 或广泛综合分数 | 对一项测验电池中指定部分的共同表现所作的通常较为精确的总结。 | 表明该综合分数对于此人及其转介问题具有可解释性的证据。 | 将其作为最概括性的总结,同时结合有意义的指数模式进行解读。 |
| 广泛指数 | 在多个任务中的表现,这些任务旨在抽样评估某个领域,例如推理、知识、记忆或速度。 | 指数的信度、置信区间以及与观察结果和个人经历的一致性。 | 用它来选择更有针对性的学习策略或需要调查的问题。 |
| 分测验分数 | 可能有助于提出或检验有关该特征概况的假设的狭窄样本。 | 其较低的精确度、多重比较风险以及与其他证据的关系。 | 将其作为一条线索;它通过在不同任务和情境中的重复验证而获得更多意义。 |
| 分数差异或变化 | 两个分数的差异是否足以值得仔细调查。 | 差异的误差、基率信息、练习效应以及情境证据。 | 只有在检查差异的精确性、出现频率和实际相关性后,才能对其进行解释。 |
| 描述性标签 | 由出版方或专业框架定义的简写类别。 | 基础分数、区间,以及该类别为何相关的原因。 | 使用该标签进行简洁沟通,同时保留基础分数和区间的可见性。 |
从量表和常模开始
在平均数为100、标准差为15的常用智商量表上,100接近基于年龄的常模组中间位置;约85和115大致分别低于和高于该平均数一个标准差。这些数值大致对应第16、第50和第84百分位。它们可以帮助快速定位个体在相关常模组中的位置。具体评估的准确百分位数换算和描述性范围应以该评估的手册为准。
百分位数将标准化分数转化为直观的比较:常模组中得分处于该表现或低于该表现的大致百分比。百分位数区间并不等距,因此从第50百分位到第60百分位的距离,并不等同于从第90百分位到第100百分位的距离。同时使用标准分和百分位数,可以使比较更有信息量。
利用置信区间,在适当的精确程度上进行规划
置信区间能让通常的测量不确定性保持可见。当两个观察分数仅相差几分且其不确定范围大幅重叠时,最有用的解释可能是两者的表现总体相近。当差异足够可靠,并且在多项证据中反复出现时,它可以为更有针对性的支持或拓展提供依据。差异分数的不确定性应直接评估,而不应从两个点估计值推断。
当分数接近临界分数时,区间以及日常功能方面的证据有助于决定服务、安置或后续评估是否合适。与其把相邻分数视为截然不同的人群,这样能作出更好的决策。
将能力特征转化为发展路线图
不均衡的能力特征可以揭示进入学习的有效路径。扎实的知识可能支持新的推理;较强的视觉加工能力可能有助于组织复杂材料;较慢的速度可能表明,给予更多时间后,准确性和深度会更加明显。只有当较大的差异可靠、在适当的常模组中并不常见,并且与课堂、工作或日常功能表现一致时,它才最有用。
寻找最有效的路径
可靠任务中反复出现的模式,可以提示一个人最擅长如何理解、组织或表达复杂材料。当这一模式与既往经历和观察到的表现相吻合时,它可以为拓展、策略和任务设计提供指导。
根据表现模式匹配支持
在不同任务和环境中反复出现的困难,可以帮助确定在哪些方面通过明确教学、练习、调整节奏、辅助工具或便利措施,能够让更强的能力得到更充分的发挥。
一定程度的差异很常见,单个引人注目的分测验结果只能作为一个假设。当广泛指数之间存在显著差异时,FSIQ 仍可能是最精确的总体概括,而各指数则可进一步完善行动计划。测试的技术指南、置信区间、基准率、转介问题以及更广泛的证据,有助于确定应给予各部分多大权重。
一份有用的报告应使这些内容清晰可见
- 问题与目的:开展评估的原因,以及评估结果可能为哪些决策提供依据。
- 工具和版本:实际施测的测试版本、语言和形式。
- 参照人群:年龄组或其他常模组、其相关性以及常模的日期。
- 带有不确定性的分数:在适当情况下提供点估计、置信区间和百分位数。
- 剖面证据:哪些优势和挑战是可靠的、它们有多常见,以及是否在其他地方反复出现。
- 条件:健康状况、感官或运动能力方面的可及性、语言、行为、努力程度指标、便利措施以及对标准程序的偏离。
- 相互印证的信息:记录、访谈、观察和其他测量结果,包括能够修正初步解读的证据。
- 实际后续步骤:说明评估结果如何为教学、策略、便利措施、拓展、支持或进一步评估提供依据。
诊断界限:将 IQ 与适应性功能结合起来
在考虑智力障碍时,专业定义会将智力功能方面的证据,与日常概念、社会和实践功能方面的显著局限结合起来,并要求这些情况始于发育期。IQ 分数可以提供重要证据并帮助确定支持需求,但测量精度、发育史、适应性功能评估和具备资质的临床判断都是诊断的一部分;当地手册和资格认定规则也可能有所不同。
当分数能够促成有益的行动时,它才真正有价值
最佳解读会将测得的优势与挑战联系到具体机会:更好的教学路径、更合适的节奏、有针对性的练习、便利措施、更丰富的工作,或一个值得进一步探究的问题。分数是地图上的参照点;发展取决于个人及其环境如何利用这些信息采取行动。
关键证据与延伸阅读
认知能力为何在学习、工作和生活中很重要
推理、理解、知识和高效学习有助于人们解决问题、掌握技能,并在熟悉的答案不再足够时进行适应。
认知能力之所以重要,是因为理解能让行动更加有效。它支持学习新信息、把握关系、同时记住多个限制条件、发现错误、将原则迁移到新问题中,以及在情况发生变化时修改计划。设计完善的测试能够为这些能力提供有用的证据,并有助于解释为什么某些学习和解决问题的要求对一个人来说比对另一个人更容易。
从理解到有效行动
能力会通过它帮助一个人完成的事情体现出来:理解复杂的解释、找出相关事实、比较可能的解决方案、预见后果,以及从反馈中学习。知识和经验提供材料;推理将其组织起来;记忆使重要信息保持可用;加工效率则有助于避免不必要的过载,让工作顺利进行。
更高效地积累知识
强大的理解和推理能力有助于将新材料与已有知识联系起来,区分核心观点与细节,并形成日后能够提取和应用的解释。
应对陌生问题
流体推理、工作记忆和领域知识有助于识别模式、检验替代方案,并将有用的原则从一项任务迁移到新的情境中。
利用反馈修改计划
监控、学习速度和灵活推理有助于一个人发现某种方法何时失效、理解原因,并选择更有效的策略。
这些能力可以支持更加明智的行为。一个人如果能更准确地理解风险、比较证据、发现矛盾或预见二阶后果,就拥有更多资源来作出有效选择。认知优势不会自动带来有价值的目标或道德品质;它提高理解和行动的能力,而价值观、同理心、经验和责任感则有助于决定如何运用这种能力。
教育与工作中的证据
在不同群体中,认知表现与之后的学习和教育成就相关。一项大规模的英国前瞻性研究发现,11岁时测得的认知表现与16岁时多门学校课程中的成绩之间存在很强的关系。这在实践中是合理的:广泛的学习反复需要理解、获取知识、记忆和推理,尽管教学、健康、机会、兴趣和坚持程度也会影响结果。
在工作环境中,一般认知能力有助于预测人们学习培训材料的速度,以及他们在认知要求较高的评价标准上的表现。当岗位要求频繁学习、排查故障、在复杂情境下作出判断,或将所学迁移到不熟悉的情境时,这一点尤其重要。预测强度会因工作、标准、群体和统计方法而异。近期的重新分析下调了部分具有影响力的早期估计,但总体证据仍支持将认知能力视为一个有意义的预测因素,而不是一套完整的选拔体系。
匹配挑战与解释
能力概况可以显示学习者何时准备好应对更高的复杂性、何时应使材料更加明确,以及哪些优势能够帮助掌握困难概念。
将支持放在能提升表现的地方
结果可以指导进度安排、练习、教学、任务结构,以及在新知识变得熟练的过程中所需的支架支持程度。
设定具体且可实现的下一步
了解当前模式,有助于区分需要练习的技能、形式障碍、缺失的先备条件、知识空缺或适应需求。
评估支持是否有效
结合练习效应和测量精度来解读重复证据,有助于检验某项干预是否改变了目标表现。
一项科学边界
预测性关联会改变可比群体中某一明确结果的估计概率;它不会决定某个人的未来,也不能确立完整的因果关系。认知能力可以提升理解和选择的质量,但它不是衡量道德优越性或人的价值的指标。
能力通过教育和经验发展
认知表现具有足够的稳定性,因此可以进行预测;同时也具有足够的可发展性,因此教育和练习仍然重要。一项采用纵向和准实验性证据的大型荟萃分析发现,接受更多教育可以提高智力测验表现。重复测验也可能带来提升,因为人们会逐渐熟悉任务形式和策略。实际启示是:将分数视为当前基线,并妥善设计下一次机会。
群体也会发展。历史上常被称为弗林效应的分数增长,会因国家、时期和认知领域而异;在一些样本中,这种增长已经放缓或逆转。当代常模使比较始终与分数所要解释的群体保持一致。
利用预测扩大有效机会
预测的最佳用途是建设性的:选择适当的挑战水平,在可避免的失败发生前提供支持,识别接受高级学习的准备程度,并将能力证据与知识、动机、兴趣和表现的直接证据结合起来。在高风险决策中,公平性、可及性、测量误差和错误后果都应从一开始就纳入设计。
如何将预测性证据转化为更好的计划
- 明确期望的结果。 定义真正重要的技能、学习目标或表现。
- 使用概况中相关的部分。 将总体综合分数或指数与该结果所要求的条件联系起来。
- 发挥优势。 选择能让已具备的能力支持新能力发展的解释、工具和角色。
- 解决瓶颈。 在能够改善获取机会和表现的地方,增加教学、练习、节奏调整、结构化安排或便利措施。
- 综合证据。 除测验结果外,还应纳入知识、兴趣、动机、观察到的功能表现和机会等信息。
- 审查结果。 检查计划是否改善了学习或表现,并根据证据作出调整。
更清晰的地图带来更好的选择
认知测验能够提供证据,帮助我们了解一个人学习、理解和解决特定类型问题的容易程度。将这些证据与对个人及其环境的了解结合起来,可以改进教学、培训、任务设计、支持和自我理解。其目的不是给人生排序,而是帮助人们采取更有能力的行动。
关键证据与延伸阅读
文化、语言、机会与公平
分数是在特定语言、环境和经历中产生的证据,而不是对一个人的、完全不受文化影响的裁决。
公平评估并不意味着假装每个人都带着相同的经历而来。它意味着明确所关注的能力,排除无关障碍,使用恰当的比较数据,并恰当地界定结果能够支持的结论。同一项测验用于一种目的时可能有用,用于另一种目的时却可能不公平。
任何智力测验都不可能真正做到完全不受文化影响。说明文字使用语言;题目依赖于后天习得的符号和惯例;限时任务会让熟悉限时测试的人占据优势;即使是非言语题,也预设了特定的观察、指点、分类或与考官合作的方式。这并不意味着所有测验都毫无意义,而是意味着:效度属于在特定人群中的解释与使用,而不是孤立存在的测验册。
向左或向右滑动以进行比较 →
| 解读智力评估时的公平性问题、重要性及负责任的应对方式 | 为什么这很重要 | 负责任的应对 |
|---|---|---|
| 要做出的决定是什么? | 广泛的教育安置、临床问题以及某一职位的选拔,需要不同类型的证据。 | 采用证据所支持的限制最少的决定,不要将分数延伸到其经过验证的用途之外。 |
| 语言是否属于该能力的一部分? | 词汇可能是某个问题的核心,但如果要测量的构念是非语言推理,词汇就可能成为无关的障碍。 | 评估语言经历和熟练程度;在适当情况下使用经过验证的翻译、合格的口译员或较少依赖语言的测量工具。 |
| 常模来自谁? | 标准分将表现与一个参照样本进行比较。过时、范围狭窄或匹配度不佳的常模可能会扭曲这种比较。 | 核查常模建立日期、年龄范围、国家、语言、教育程度以及相关人口特征的覆盖情况。 |
| 获得的条件是否具有可比性? | 受教育经历、书籍、数字设备使用机会、残障支持以及对测试的熟悉程度,都会影响学习和展示技能的机会。 | 记录机会与障碍;在不改变测量构念的前提下,提供经过验证的便利措施。 |
| 这次测试是否具有可解释性? | 睡眠不足、疼痛、疾病、焦虑、醉酒、感觉方面的困难、受打断或投入程度低,都可能压低表现。 | 记录测试条件,解决可以补救的障碍;当结果可能无法代表真实情况时,重新测试或补充测试。 |
| 此人以前参加过该测试吗? | 练习、记住曾经做过的题目、策略以及不确定性的降低,都可能提高之后的分数,而一般能力并未发生同等程度的变化。 | 记录先前接触测试的情况,遵守建议的间隔,并在已确认可比时使用替代版本。 |
| 这个分数有多精确? | 每个分数都包含测量误差,而且表现会随日变化。 | 报告置信区间以及各分测验之间的表现模式;避免将一分差异或僵化的临界值视为自然界限。 |
| 其他证据是否与之相符? | 一次测试中的一小时无法代表一个人的学习经历、判断力、创造力、动机、适应性功能或专业能力。 | 将测试结果与个人经历、观察、学校或工作方面的证据以及此人在现实世界中的功能表现结合起来。 |
文化和语言会改变任务所取样的内容
测试可以可靠地测量某种特征,同时仍然对其取样不完整。词汇分数反映的是在受测语言中习得的知识;不能将其解读为对某种潜在心智能力的纯粹测量。最近抵达的新多语学习者可能会用一种语言解决复杂问题,同时缺乏另一种语言的学术词汇。反过来,删除文字并不会消除文化因素:视觉材料、作答规则以及对抽象概念的熟悉程度仍然是后天习得的。
信度是必要条件,但并不充分
一项测试可能始终如一地对人进行排序,却无法在不同语言或环境中同等准确地测量目标构念。公平使用要求有证据表明,分数在不同情境下具有可比的含义。
差异不等于缺陷
不熟悉的方言、教育惯例或题目形式,可能改变测试所引发的表现。在将原因归于个人之前,应先描述证据。
后果越重大,标准越高
一项决定对教育、工作、自由或照护的限制越大,独立证据、专业判断和复核渠道就越重要。
情境可以改变分数,但不能定义一个人
重复测试就是一个明显的例子。一项针对就业和教育测试的大型荟萃分析发现,平均练习效应约为四分之一标准差;当重复使用完全相同的试卷或提供辅导时,变化幅度更大。后续的一项荟萃分析发现,多次施测的收益呈非线性增长,经过数次尝试后有时接近半个标准差。这些是平均分数变化,其幅度取决于测试、间隔时间、年龄、试卷版本和重复测试的原因。
测试的社会意义也会影响表现。关于刻板印象威胁的研究探讨:意识到负面刻板印象是否会造成额外的监控、担忧或分心。在一项旨在尽量接近真实测试条件的荟萃分析中,核心估计值很小(约为d = −0.14),各项估计从零到轻微负面效应不等,且发表偏倚是一个值得关注的问题。因此,让测试过程尊重受试者、避免制造威胁是合理的;但不应把刻板印象威胁当作解释每一种群体差异或每一项个人结果的普遍原因。
群体平均值无法揭示个人的成因或潜力
不同分布彼此重叠,任何被指称群体中的人都存在很大差异,社会类别并不会把人类划分为认知类型整齐划一的群体。平均差异可能反映许多相互交织的影响:教育、语言、健康状况、歧视、迁移、财富、污染、对测试的熟悉程度、抽样和测量。分数无法确定每种影响对某个人表现的成因占比。对个人作出决定时,应使用个人层面的证据。
公平解读清单
- 明确测量的构念。准确说明该任务旨在测量哪项能力,以及它未涵盖哪些有价值的能力。
- 核查此次使用的效度。 来自一种语言、一个国家、一个年龄群体或一种选拔情境的证据,并不会自动适用于另一种语言、国家、年龄群体或情境。
- 让可及性信息清晰可见。 记录语言经历、受教育情况、残障状况、感官需求以及相关测试经验。
- 报告不确定性。 使用置信区间和模式,而不是虚假的精确度或单一的醒目标标签。
- 寻找趋同证据。 对在不同测量、不同时间和日常功能中反复出现的发现给予更大权重。
- 允许复核。 高风险决策应允许提出问题、提供情境证据,并在条件不具代表性时重新评估。
本节背后的证据
基因、环境、发展与整个生命周期
智力在现实生活环境中的生物系统内发展;任何一方都不会赋予人固定的命运。
基因和环境并不是争相填充一个人的两种相互竞争的物质。基因参与构建和调节神经系统;环境提供营养、语言、教学、压力、人际关系、毒素、练习和机会。发展正是这些影响持续相遇的过程。
人们在数以千计的 DNA 变异上存在差异,而每种变异通常只与测量表现中极其微小的平均差异相关。人们也会部分通过不断发展的偏好和能力来选择、塑造并引发环境。家庭共享基因和生活条件,而学校、同伴、社区、疾病以及历史变化又带来更多差异。因此,简单的“天生还是后天”问题,实际上要求生物学完成一件它从来不会做的事:脱离世界独自发展。
遗传率:一种群体统计量,而非个人百分比
估计值意味着什么
如果一项研究估计智力的遗传率为 0.60,其模型指的是:在该样本群体、当时以及那些条件下,人们之间观察到的差异中,约 60% 可归因于他们之间的遗传差异。这并不意味着某个人的智力有 60% 来自遗传、40% 来自环境。
可遗传并不意味着不可改变
即使营养、教育、疾病、毒素或训练会改变所有人的结果,某种特征仍可能具有很高的遗传力。遗传力描述的是现有条件下的差异,而不是干预所能带来的最大收益。
估计值可能会改变
年龄、人口、测量方式、社会条件以及可获得环境的范围,都会影响估计值。来自某个国家或某个时期的数字,并不是自然法则。
群体内部的差异是另一个问题
群体内部的遗传力本身无法分配群体平均差异的成因。即使每个群体内部的排名差异具有遗传性,环境变化也能改变群体平均水平。
在一项覆盖四个国家的大型双胞胎联盟研究中,估计遗传力从9岁时的41%上升到12岁时的55%,再到17岁时的66%。这一模式并不表明基因在“接管一切”。随着孩子成长,他们越来越多地选择并坚持参与符合自身兴趣的活动;教育可能会放大早期差异;测量的可靠性也会发生变化。双胞胎研究的估计还取决于建模假设以及所代表的环境。
大规模全基因组关联研究进一步印证了同样的谨慎态度。一项涉及269,867名参与者的研究发现了许多相关区域,但其多基因评分在四个独立样本中对智力测试差异的解释度最高约为5.2%。大多数发现样本具有欧洲血统,而在人群与发现样本不同的群体中,预测通常会变得不那么准确。这类评分是研究工具,而不是诊断工具、评判人的价值的排名,或预测孩子上限的依据。
机会成为发展的一部分
社会经济地位是一组环境条件,而不是一种生物学属性,也不是单一的因果杠杆。它可能代表学校质量、家庭稳定性、营养、医疗保健、书籍和交流、安全空间、污染、社区资源、慢性压力,以及成年人能够投入孩子身上的时间。观察性关联无法告诉我们究竟是哪一项因素导致了个体结果。
广泛的环境干预
一项纳入42组数据、涉及超过60万名参与者的荟萃分析,采用了政策变化、纵向比较和其他准实验性证据。根据研究设计,每增加一年受教育时间,与大约提高1–5个智商点相关。这是基于所研究教育体系得出的群体估计,并不意味着每多一年受教育时间都会永远固定增加同样的数值。
环境改变,结果也会改变
一项纳入62项收养研究的荟萃分析发现,被收养儿童的平均得分高于仍处于原先环境中的同龄人,并且与收养环境中的兄弟姐妹或同龄人相近。收养会同时改变许多条件,因此它展示的是可塑性,而不是确定某一个原因。
预防就是认知保护
一项汇总七个前瞻性队列的分析发现,儿童期血铅水平与智商之间存在反向关联,即使在观测到的较低浓度范围内也是如此。总体人群估计无法精确预测某个儿童的情况,但它们支持预防暴露,而不是等到明显症状出现后再采取行动。
环境可能改变差异呈现的方式
探讨社会经济条件是否会改变遗传力的研究,在不同国家得出了不同结果。一项荟萃分析在美国样本中发现了这种调节效应,但在西欧和澳大利亚样本中没有发现;佛罗里达州的一项大型研究也未发现这种效应。不存在普遍适用的“基因×收入”规律。
弗林效应:历史推动了测试得分的变化
在20世纪的大部分时期,许多智力测试的平均表现都从一代到下一代有所提升。一项涵盖271个独立样本、近400万人、31个国家以及1909年至2013年数据的荟萃分析发现,流体、空间、全量表和晶体得分均有所提高,但不同领域的提升速度不同,且近几十年的增幅较弱。总体全量表的提升速度约为每十年2.8个智商点。
这表明认知测试表现会对历史环境作出反应;但这并不能证明每种心理能力都以相同幅度提高。更多的受教育年限、健康与营养的改善、规模更小的家庭、更抽象的工作和媒体环境,以及对类似测试问题更熟悉,都是研究者提出的可能因素,但没有任何单一解释能够涵盖每个国家或时期。有些国家报告了平台期或反转。在挪威征兵数据中,较早的上升和后来的下降都出现在家庭内部,这支持环境变化而非快速遗传变化的解释,但具体原因仍未确定。
智力并不存在一个统一的峰值年龄
流体能力——例如处理新关系、在脑中保持信息以及快速反应——通常在成年早期达到平均高点,并且更容易受到年龄相关衰退的影响。晶体能力——通过文化和经验获得的知识、词汇与策略——通常会在更长时间内持续提升,有些测量指标要到六七十岁才达到峰值。不同能力遵循不同曲线,而健康、教育和群体经历会围绕每个平均值造成广泛差异。
快速构建
语言、执行控制、知识和策略会随着成熟与经验而发展。早期得分随着年龄增长会变得更具预测性,但发展仍会受到教育、健康和环境的影响。
不同曲线相交
在不熟悉的任务上,速度可能会放慢,而知识和专业能力不断增长。一个人可以在有意义的工作中变得更有能力,却不一定在每一项实验室任务上都更快。
平均下降并不意味着所有人都以同样方式下降
有些变化很常见,但每个人的变化轨迹各不相同。感觉功能丧失、疾病、药物、睡眠和测试速度都可能影响得分;保留下来的知识和补偿性策略则有助于维持功能。
谈论稳定性也需要使用精确的语言。2024年一项涵盖205项纵向研究的荟萃分析发现了较高的等级次序稳定性:例如,估计20岁时五年间的相关系数为0.76。这意味着人们彼此之间的相对位置往往相近,并不意味着他们的得分、技能或生活没有变化。即使等级次序保持稳定,每个人都可能有所进步;或者即使群体平均值保持相近,个体之间也可能发生变化。
分布式大脑,而非智力中枢
推理调动的是神经网络,而非某个单一的解剖学开关。顶叶—额叶整合理论强调额叶和顶叶区域之间的交流,以及它们与前扣带回、颞叶和枕叶区域之间的联系,还有连接这些区域的白质通路。这些系统有助于表征问题、保持并转换信息、选择反应以及检查结果。
结构关联确实存在,但程度不大。一项纳入8,000多名参与者的荟萃分析估计,相关系数约为 r 总体脑容量与智力之间的相关系数为0.24——在简单相关中约有6%的共同方差——并发现较早且规模较小的研究可能高估了这一数值。一项对13,608人的预注册英国生物银行分析发现 r 与流体智力的相关系数为0.19。这些平均值无法诊断个人、确定原因,也无法证明“越大越好”。体型、发育、与性别相关的平均差异、健康状况和测量方式都需要谨慎处理。
神经连接和发育时机提供了总体大小所遗漏的信息。静息态网络模式可以预测研究样本中部分个体差异,但具体图谱各不相同,并不是个人智力扫描。对儿童的纵向研究发现,与认知水平相关的并非某一次静态测量,而是皮层厚度的变化轨迹。因此,脑科学证据支持一种以发育和神经网络为基础的解释,而非生物决定论。
可预测并不等于命中注定
在群体层面,基因、早期经历和既往得分有助于预测之后的结果。预测绝不是道德排名,也绝不能完整说明某一个人。教育、疾病、机会、努力、人际关系和历史条件仍然是因果故事的一部分,而未来还包含模型未曾观测到的条件。
本节背后的证据
知识、学习与专业能力
智力影响我们如何学习;知识改变我们能够看见什么;专业能力则把组织化的知识与经过练习的技能转化为某一领域内可靠的表现。
一个人可以出色地推理一个陌生问题,却仍然输给一个已经熟悉该领域的人。这并不矛盾。一般认知能力帮助人们发现关系、在头脑中保持约束条件,并从经验中学习;而知识则提供推理所依赖的概念、事实、程序和模式。当这些资源围绕真实领域的要求组织起来时,专业能力便会发展起来。
知识并不只是由彼此孤立的事实组成的仓库。重要的是信息是否彼此关联、能够被检索并加以运用:学习者是否理解某项原则为何适用,能否识别它何时不适用,以及表面细节发生变化时能否对其加以调整。先前知识也会改变知觉。熟练的临床医生、机械师、音乐家或棋手,可能会注意到一个有意义的结构,而新手看到的却是彼此无关的细节——这并不是因为专家拥有一种普遍的感知能力,而是因为多年来与领域相关的学习改变了他们对情境的表征方式。
协同作用的三种知识形式
事实、概念与关系
陈述性知识包括词汇、原理、事件和解释模型。列表可以通过记忆掌握,但更深层的知识会将细节连接成一个支持推断和迁移的结构。
程序与熟练行动
程序性知识支持行动:解方程、检查患者、剪辑影片或操控工具。经过练习,一些步骤会变得更快,也不再需要太多有意识的注意。
条件性知识与策略性知识
良好表现取决于选择恰当的方法、发现例外情况,以及知道何时应当放弃熟悉的常规。这正是知识与监控和判断力相结合的地方。
学习是一种互动,而不是“能力”与“努力”之间的较量
流体推理可以让人更容易推断出新规则,但后天获得的知识也能将难题转化为熟悉的问题。兴趣、教学、语言、健康状况、时间、机会、反馈和坚持,都会影响学习成果。阿克曼的 PPIK 框架——将智力视为过程、人格、兴趣和知识的综合——体现了这种发展性互动:能力可能影响早期学习,而积累的知识则会越来越多地塑造一个人在某一领域中的后期表现。
这就是为什么测试得分相同并不意味着知识水平相同,而知识测试得分相同也不能反映学习机会相同。这也说明,不能根据宽泛的推理得分推断专业能力。一个人可能很快学会某些领域的内容,但在掌握该领域的概念、标准、案例和实际限制之前,仍然只是新手。
知识可以放大推理能力,也可以掩盖问题的难度
专家常常看起来“立刻就能看出答案”。通常,多年的学习已将许多分散的观察压缩成有意义的模式。尽管这种表现建立在广泛且特定于领域的知识基础之上,结果仍可能显得毫不费力。反过来,流利程度也可能造成误导:快速回忆、自信地使用术语以及丰富的经验,并不能保证其底层模型是准确的,也不能保证这个人在代表性任务上的表现更好。
什么才算专业能力?
在专家绩效研究中,最有说服力的专业能力证据是在能够代表该领域的任务上持续、可复现地表现优异。头衔、声誉、资历和工作时长可能是相关背景,但都不是决定性因素。测试应当类似于真正重要的活动,采用有意义的结果指标,并区分可重复的技能与一次令人难忘的成功。
检验真正的技能
对外科医生的评价应通过临床相关的决策和操作进行,而不应只看词汇量;对预测者的评价应通过经过校准的预测进行,而不是看自信程度或媒体曝光度。
考察可重复性
一次出色的表现可能反映了运气或有利条件。专业能力应当在多个案例中持续显现,包括困难且不熟悉的变体。
采用适当的标准
应当将表现与相关同行和标准进行比较。“比新手更好”与“跻身最优秀的专业人士之列”是不同的说法。
了解能力边界
优秀的专家仍可能感到不确定。恰当的自信、错误检测,以及将问题转交给能力范围之外的专业人士,都是可靠专业表现的一部分。
模式改变时作出响应
常规效率很有价值,但真正稳健的专业能力还要求察觉某个案例何时违背预期,以及标准程序何时已不再足够。
技能并不授权一切用途
技术卓越回答的是“能否做到?”。专业判断还必须追问:是否应该做、为谁做、取得何种同意,以及由谁承担风险。
刻意练习——没有一万小时的神话
刻意练习并不是重复、带薪工作或花时间接触某项技能的同义词。在最初的专家表现研究传统中,它指的是为提升表现的某个具体组成部分而设计的高要求练习:明确的目标、略超出当前稳定能力的任务、具有信息价值的反馈、反复纠正,以及持续关注薄弱环节。在成熟领域中,这类练习通常由了解从新手错误到专家表现这一发展路径的教师或教练指导。
练习很重要,有时甚至极其重要,但研究并不支持存在一个适用于所有人的专家门槛。“一万小时定律”把特定表现者中的平均数变成了一条证据从未确立的生物学定律。与高水平表现相关的练习数量和类型因领域和个人而异;开始年龄、先前能力和知识、指导、动机、身体特征、机会、选择效应以及学习环境的质量都可能发挥作用。由于定义和研究设计不同,荟萃分析对于刻意练习究竟能解释多少表现差异也存在分歧。较为稳妥的结论既不是“练习决定一切”,也不是“天赋决定命运”:高水平技能通过一个相互作用的系统发展,而单纯的时长并不是机制。
将学习时间转化为可用的知识
- 在收集细节之前先搭建地图。确定核心概念、它们之间的关系,以及该领域试图解决的问题类型。
- 用提取代替单纯重读。合上资料,凭记忆解释、重建或应用这一想法。提取练习会揭示熟悉感掩盖了哪些未掌握之处。
- 间隔一段时间后再回来。间隔学习比立即重复需要付出更多努力,也能更有力地证明所学内容仍然可以被调用。
- 比较范例与例外。思考哪些变化会改变正确方法,哪些表面特征无关紧要,以及规则适用的边界在哪里。
- 练习具有代表性的任务。训练你实际需要的表现,包括真实环境中的决策、限制条件和反馈。
- 记录错误。判断错误源于知识缺失、表征不当、执行失误、仓促行事还是过度自信;然后围绕该原因设计下一轮练习。
- 检验迁移,而不是想当然地假定存在迁移。在没有提示的情况下尝试新的情境。练习过的练习项目有所改善固然有价值,但更广泛的学习需要该练习之外的证据。
为什么专业能力通常局限于熟悉领域
当新问题与已学领域共享相关结构时,深厚的知识有助于迁移。但在某一领域表现出色,并不意味着可以免于犯错。杰出的工程师可能是医学新手;经验丰富的高管可能无法很好地推理概率问题;娴熟的治疗师也未必是营养学专家。即使在同一领域,熟悉的环境也可能奖励某些惯例,而当技术、群体或激励机制发生变化后,这些惯例就会失效。
因此,迁移是一个需要实证回答的问题:究竟是哪项技能得到了提升?提升体现在哪项未经训练的任务上?持续了多久?又是在什么条件下发生的? 新任务与训练任务的距离越远,所需证据就越充分。学习当然可以拓宽思维,但这种广泛收益应当得到证明,而不是仅仅因为某项活动颇具吸引力就推断出来。
证据边界
知识、能力与经验彼此相关,因此没有哪项单独研究能在每个领域中清晰分离出其中一种因素。专家表现研究在采用客观且具有代表性的结果指标时最为有力;对一生练习量的回溯估计,以及“专家”之类宽泛的标签,则不那么可靠。刻意练习的估计结果也高度取决于练习和表现的定义方式。实践上的启示是:应评估学习过程及其产生的表现,而不是迷信练习时长。
关键证据与延伸阅读
智慧、理性与良好判断
认知能力可以改善推理,但良好的判断还需要校准、视角、价值观以及对后果负责。
智力帮助人表征复杂信息并发现可能的手段。但智力本身并不能决定哪些目标值得追求。知识提供已经学到的内容;专业能力支持在某一领域中的可靠表现;理性考察信念是否遵循证据、行动是否服务于目标;元认知监控思考者自身;智慧则在不确定的人类情境中协调这些资源,而这些情境涉及价值观、关系和长期后果。
六种相关能力——六个不同的问题
以下界限是功能性的,而非绝对的。这些能力可以相互支持,但关于其中一种能力的证据,不应被默默地转化为关于全部六种能力的主张。
向左或向右滑动以进行比较 →
| 能力 | 它回答的问题 | 它能带来什么 | 典型证据 | 它无法保证什么 |
|---|---|---|---|---|
| 智力 | 一个人能多有效地学习、应对新颖问题进行推理并解决高难度问题? | 广泛和较狭窄的认知能力:模式检测、抽象、心理操作、理解和高效学习。 | 在设计恰当的认知任务中表现趋于一致,并结合常模和测量不确定性进行解释。 | 拥有特定事实、专业知识、不带偏见的思维、道德关怀或有价值的目标。 |
| 知识 | 学习了哪些事实、概念、程序和关系? | 使识别、解释、推断和行动成为可能的内容与心理模型。 | 在相关示例中准确回忆、解释和运用,包括保持和迁移。 | 快速学习、广泛的推理能力、对所学材料之外的真理的把握,或运用技能的能力。 |
| 专业能力 | 知识和技能在这一领域中多可靠地带来卓越表现? | 高效的模式识别、领域策略、程序流畅性,以及对有意义例外的敏感性。 | 在具有代表性的任务中反复表现,并与相关标准和结果进行比较。 | 在无关领域的能力、免受偏差影响,或对该技能的合乎伦理的运用。 |
| 理性 | 信念是否符合证据,行动是否一致地推进个人目标? | 对证据的敏感性、一致性、概率思维、抵抗特定偏差的能力,以及在不确定性下进行有效选择的能力。 | 决策任务、信念更新、校准、一致性和现实世界中的决策结果。 | 目标本身是道德的、富有同情心的,或在社会上正当。 |
| 元认知 | 一个人监控和调节自身思维的准确程度如何? | 错误检测、确信度校准、策略选择、寻求帮助和修正。 | 确信程度与准确性之间的关系,以及监控能够改善控制的证据。 | 正确的一阶知识、在每个领域都保持谦逊,或不受自我欺骗影响。 |
| 智慧 | 当事实不完整、价值观相互冲突且生活受到影响时,什么样的回应才合适? | 视角、谦逊、不确定性管理、情绪平衡、关怀、长期背景,以及对手段和目的的判断。 | 对困难情境、报告和观察进行开放式推理,并结合不同背景和时间加以解读。 | 完美的道德、普遍一致、无错误的行为,或在每种情境中都表现稳定的一种特质。 |
快速诊断
如果某人了解事实,却选择了低效的方法,应考察理性。如果他们没有注意到自己的确信程度超过了准确性,应考察元认知。如果他们高效地实现了一个会伤害他人的目标,那么缺失的问题涉及价值观与智慧,而不一定是处理能力。如果他们只在某一领域内表现出色,应称其为专业能力,而不是普遍智力。
理性:信念与选择的质量
让信念服从证据
寻求相关信息,区分观察与推断,在证据发生变化时更新确信程度,并避免用不同的证明标准来维护偏好的结论。
选择服务于目标的手段
比较选项、概率、成本和后果,使行动协调一致地推进预期目标。它始于一个目标;但其本身无法确立该目标在伦理上是否可接受。
认知能力有助于进行复杂表征和基于规则的推理,但二者并不完全重合。在 Stanovich 和 West 的研究中,一些推理偏差与认知能力相关,而另一些偏差则表现出较弱或不存在的相关性。决策能力测量还能够在认知能力和人口统计变量之外,预测较少的负面生活结果。这些发现并没有确立一个普遍接受的“理性商数”;它们表明,人们评估证据和作出选择的方式存在一定差异,而传统智力得分无法穷尽这种差异。
偏差任务本身需要谨慎对待。许多著名效应作为实验条件之间的差异而言具有稳健性,但在用于给个体排序时却并不可靠:一项任务可以揭示人们作为群体会受到框架效应影响,同时仍可能产生不稳定的个人“偏差得分”。因此,应根据相互印证的任务和行为来推断理性,而不是依据网上流传的一道谜题。
元认知:了解自己的认知水平
元认知包括监控——估计某个记忆、知觉或答案是否可能正确;以及控制——利用这一估计进行核查、改变策略、寻求帮助或停止行动。自信的感觉本身并不足够。关键问题在于,信心是否能区分更准确与较不准确的判断,以及这些信息是否能改善行动。
信心与准确性相符吗?
一个人总体上可能信心不足或过度自信。校准比较的是表达出的确定程度与实际答对的比例。
信心能区分对错吗?
即使一个人的总体信心水平整体偏高或偏低,他仍可能对正确答案比错误答案表现出更高的信心。
监控会改变行为吗?
有用的自我知识会促使人进行核查、进一步学习、征求第二意见、放慢 deliberation,或决定不做超出自身能力范围的事。
元认知技能既不是完全普遍的,也不是完全受领域限制的。一个人可能善于监控视觉决策,却会误判记忆、政治或专业知识;证据同时支持共享成分和任务特异性成分。因此,“我了解自己的想法”并不能证明内省准确。必须根据相关情境中的结果检验校准程度。
科学家所说的智慧
智慧研究没有唯一的最终定义,但主要模型都趋同于一组家族相似特征:广泛的情境知识、对不确定性的觉察、考虑不同视角的能力、与即时自利保持反思性距离、情绪调节,以及对人类后果的关注。各模型的不同之处在于:智慧主要是专家知识、人格构型、在特定情境中的推理方式,还是指向共同利益的判断。
关于生活的专家知识
巴尔特斯及其同事依据五项标准评估开放式回答:关于生活的事实性和程序性知识、全生命周期的情境化思维、对价值差异的认识,以及对不确定性的认识或管理。
理解、反思与关怀
阿德尔特的模型结合了认知理解、反思性的换位思考,以及富有同情心或情感性的维度。该模型认为,智慧不只是关于艰难抉择的知识。
将能力用于共同利益
斯滕伯格将智慧描述为通过价值观运用默会知识,在平衡自身与他人的利益、短期与长期后果,以及适应环境或改变环境之间作出权衡。
应对困难经历的资源
MORE生活经验模型强调应对不确定性与不可控性、开放性、反思性、情绪调节和同理心,将它们视为能够帮助人们从重大人生挑战中学习的资源。
在这场冲突中进行良好推理
这一方法考察知识谦逊、对变化与不确定性的认识、不同视角的整合、局外人的观察角度,以及在特定情境中寻求妥协的倾向。
视角与道德根基
对不同传统的综合表明,视角性元认知与一些道德追求相结合,包括平衡自我与他人、共同人性,以及以真理为导向。
智慧取决于情境,而不是一顶永久的桂冠
一个人可能在一次冲突中进行明智推理,却在另一次冲突中采取防御性思维。日常生活研究发现,同一个人在不同情境下的明智推理存在显著差异。权力、威胁、疲劳、情感投入、社会角色,以及采取局外人视角的能力,都可能改变当下能够调动的思维方式。拥有智慧的声誉,或在智慧量表上得分较高,并不能保证一个人在下一次决策中采取明智的行为。
这种差异并不是放弃这一概念的理由,而是改变了实践目标。与其只问“谁是有智慧的人?”,不如问“在这里,哪些习惯和条件会让更明智的推理更有可能出现?”反思时间、真诚的分歧、责任意识、心理距离、多元视角以及允许修正的空间,都可能支持更好的判断,即使没有任何参与者是适用于所有情境的圣人。
智慧是如何被测量的——以及为什么结果会不同
自我报告量表
高效评估人们报告的倾向,例如反思、同情心或情绪调节能力。这些方法取决于自我洞察、对题目的理解以及人们是否愿意报告不受社会欢迎的局限。
开放式表现任务
让人们大声说出自己对困难人生问题的推理过程,并由受过训练的评定者进行评分。这些方法能够捕捉过程,但耗时较长,而且可能受到语言能力、文化假设以及对情境熟悉程度的影响。
情境化与知情者方法
收集真实冲突、日记或了解参与者的他人所提供的报告。这些材料能补充背景,但会受到记忆、选择、观察者和反应性效应的影响,也可能仍然遗漏隐秘动机或后续影响。
常见的智慧测量之间往往只有中等程度的相关,因为它们对这一构念的不同部分进行了操作化。一份关于同情心的自我报告、对虚构人生困境的评分回答,以及在个人冲突中的明智推理,并不是可以相互替代的观察结果。不存在普遍认可的智慧分数,也不存在能够认证智慧的经过验证的脑部扫描,更没有一种测量能够排除文化和道德假设。
定量证据所能支持的结论
一项荟萃分析报告称,智力与智慧之间总体上存在较小的关联(约为 r = .12),在基于表现的智慧测量中关联更强,而在自我报告或现象学测量中接近于零。晶体智力与智慧的关联强于流体智力,而年龄与智慧之间的总体关联也很小(约为 r = .04)。这些平均值取决于测量方式,并不能描述每个人。它们支持一个谨慎的结论:认知资源和生活经历可能有助于智慧,但智力和年龄都不是充分条件。
为什么伦理和价值判断不能归结为智商
智力测试抽样测量的是用于解决明确认知问题的能力。伦理判断还要提出其他问题:哪些利益应被计入?哪些伤害可以接受?哪些责任会限制对利益的追求?应如何权衡不确定性、同意、公平以及跨时间的后果?处理速度或抽象推理能力的任何提升,都无法从逻辑上提供这些问题的答案。
更好的手段不会选择更好的目标
较强的能力可能帮助一个人建模后果或揭示不一致之处。同样的能力也可能优化自私的目标、为偏好的结论寻找合理化依据,或设计更有效的伤害。价值观引导能力;能力不会自动净化价值观。
可以在没有同情心的情况下运用换位思考
准确预测他人的感受可以支持关怀、谈判或操纵。道德关切、克制和责任是额外的取向,并不是社会洞察力必然带来的产物。
相对于有害目标而言,一个计划可能是理性的
工具理性评估手段是否能推进某个目标。伦理判断还必须评估目标本身、利益与负担的分配,以及不应逾越的界限。
证据为价值观提供信息,但不会消除分歧
事实可以揭示可能的后果和矛盾,但人们和传统仍可能在正义、责任、自由和共同利益等问题上存在分歧。智慧量表无法用科学方式证明某一种完整的道德哲学。
负责任的结论不是说智力与判断力毫无关系,也不是说高智力的人在道德上更好或更差,而是二者的重叠范围有限,且这些构念并不等价。智力可以拓展一个人的理解和行动能力,但它本身不会决定什么值得去做、谁的利益应得到考虑,或哪些后果在道德上可以接受。
为艰难决策暂停思考的六个问题
- 证据:我知道什么?我在推断什么?哪些信息会改变我的信心?
- 替代方案:如果我偏好的方案无法采用,我会认真考虑哪种解释或选项?
- 视角:对承担风险的人而言,这种情况会如何呈现?对中立观察者而言又会如何?
- 时间:哪种即时收益可能造成延迟成本,哪种短期不适可能保护长期利益?
- 价值观:哪些人的利益被纳入考量,什么边界应当约束目标,以及公平的过程需要什么?
- 修正:什么反馈会揭示决策是错误的,以及如何让修正仍然成为可能?
证据边界
理性、元认知与智慧是积极发展的研究构念,而不是任何单项测试都能直接读取的隐藏实体。它们的测量在信度、语言要求、文化假设和对情境的敏感性方面各不相同。相关性并不能证明智力会导致智慧,平均关联也无法判定个体的品格。上述模型最好被用作互补的视角和促进更好推理的提示,而不是用来给人的价值排序的许可。
关键证据与延伸阅读
12. 情绪与社交智力
情绪和关系包含可以被感知、解读和管理的信息——但不存在单一普适的“情商(EQ)”或“社交智商(SQ)”,而且社交技能并不等同于美德。
一个人可能能够准确推理技术问题,却把恐惧误读为敌意,未能注意到谈话正变得不安全,或在痛苦时难以调节注意力。这些差异很重要。它们说明研究情绪和社会能力是有必要的,但并不能证明存在某种隐藏的单一量值,可以据此对每个人的情绪生活或人际价值进行排序。
情绪和社会功能由部分可分离的能力、倾向、知识和习惯共同构成。感知面部或声音线索,与理解其原因并不是一回事。知道有效的调节策略,与在压力下使用它并不是一回事。将自己描述为有同理心,与准确识别他人并不是一回事;而表现得有说服力,也无法说明其目标是富有同情心、漠不关心还是带有剥削性。
一个熟悉的标签掩盖了多个不同的构念
“情商”并不指代一种全世界普遍认可的测试或分数。能力测量要求人们解决与情绪有关的问题;特质测量询问人们通常如何看待自己;混合模型将情绪与动机、自信、乐观、领导力或社交风格结合起来。这些方法各自都能回答有用的问题,但它们的分数不可互换。
能力型、特质型和混合型情商
解决与情绪有关的问题
表现任务考察识别情绪、理解情绪可能如何变化以及选择管理情绪的方式等能力。这最接近于将情绪智力视为一种能力,尽管判定什么算作正确答案可能需要专家评分或共识评分。
一个人如何描述自己
自我报告问卷测量的是人们感知到的倾向:“我保持冷静”“我理解他人”或“我能表达自己的感受。”这些报告可以预测行为,但也反映自我认知、作答风格、自信和人格。它们并不能直接证明实际表现。
一组广泛的品质
一些商业和应用模型将情绪知觉与坚持、影响力、乐观、团队合作、领导力和幸福感结合起来。这类综合模型可能有助于发展,但人们很难判断某项预测究竟来自情绪推理,还是来自其中包含的其他特质。
向左或向右滑动以进行比较 →
| 证据来源 | 它可以帮助回答的问题 | 主要优势 | 主要边界 |
|---|---|---|---|
| 能力任务 | 这个人能否在特定条件下识别、理解或推理情绪信息? | 需要作出回应,而不只是对自己的陈述。 | 情绪情境可能含义不明;评分结果及其迁移到日常行为中的情况需要验证。 |
| 自我报告 | 这个人如何理解自己通常的情绪或人际倾向? | 能够高效地了解个人在一段时间内的私人体会和自认为的习惯。 | 自我洞察、谦逊程度、印象管理和文化上的回应规范都可能改变结果。 |
| 观察者报告 | 同事、家人、教师或同伴如何感受这个人的表现? | 可以揭示自我报告未能反映的、对他人产生的反复影响。 | 每位观察者看到的角色和情境都有限;他人的评价可能包含偏见或权力影响。 |
| 观察到的行为 | 这个人在某次互动、模拟活动或具有重要后果的情境中做了什么? | 将评估与行为及结果联系起来。 | 一种情境中的表现未必能推广到其他情境,而行为除了反映技能,也反映目标、激励、规范和机会。 |
证据支持的结论
情绪智力测量结果与学业表现、工作表现、人际关系和幸福感存在关联,但效应大小会因定义和情境而异。在一项关于学业表现的大型荟萃分析中,总体关联程度较小,其中基于能力的测量通常优于自评。情绪智力在认知能力和人格之外提供了一些额外信息,但增量较小,并非具有变革性。
在工作中,当岗位确实要求情绪劳动、冲突管理、照护、谈判或密切协作时,情绪技能才更可能发挥作用。一种有助于预测护理、咨询或督导工作表现的测量工具,不一定同样程度地预测独自完成任务时的技术表现。情境并不是结果之外的麻烦因素;它本身就是结果含义的一部分。
注意信号,但不要假装它们确定无疑
声音、姿势、语言、面部动作和情境都可以为推断提供信息。没有任何单独线索能够可靠地揭示一个人的内在状态,同一种表情在不同的人和情境中也可能意味着不同的事情。
考虑原因、混合情绪和变化
情绪概念有助于区分恼怒与恐惧、悲伤与疲惫,或兴奋与焦虑。当一个人核对自己的解读,而不是把第一印象当作直接了解他人内心的途径时,理解会更加准确。
改变反应,而不是抹去信号
调节可以包括重新构建看法、解决问题、接纳某种感受、改变环境、在行动前暂停,或寻求支持。压抑只是其中一种策略,若不加区分地使用,可能需要付出代价。
社会智力更适合被理解为一组技能
研究人员曾反复尝试识别一种不同于学业能力或一般认知能力的单一社会智力因素。证据支持以人为中心的能力存在一定聚类,但结果会受到任务和方法的影响。因此,更有依据的解释应从具体能力出发,而不是假定存在一种普遍的“社会商数”。
社交感知
在容忍不确定性的同时,识别言语、动作、时机和情境中的相关线索。准确性取决于情境、文化、熟悉程度,以及对方的信号是否可见或被有意隐藏。
换位思考
在不假定对方观点与自己相同的前提下,推测对方可能知道什么、想要什么或相信什么。这是一种应保持开放、随时接受修正的推断,而不是读心术。
社交知识
理解某个社群中的角色、期望、对话规则及可能后果。在一种环境中学到的知识,迁移到不同文化、职场或关系中时,可能并不完全适用。
人际适应
选择符合目标和相关人员情况的语言、时机、界限与合作策略。有效的适应可以包括澄清、道歉、协商、拒绝、离开或改变不公平的处境。
同理关怀
关心他人的福祉,可以促使人采取专注且支持性的行动。它与准确推断对方的状态或知道如何影响对方有关,但并不等同于后两者。
长期关系中的技能
信任取决于在反复互动中表现出的可靠性、修复关系的能力、知情同意、互惠以及记忆。一项简短测试中的出色回应,无法完整代表这段经历。
情绪技能不等于道德品质
识别自身脆弱点、预判反应并调节自己的表现,可以促进舒适感、领导力与合作。同样的能力也可能被用于操纵。研究发现,当情绪调节知识与强烈的道德认同相结合时,可能增强亲社会行为;而与马基雅维利主义动机相结合时,则可能增强偏差行为。技能拓展了一个人能够做什么;价值观、激励因素和问责机制则有助于决定其选择做什么。
这些能力可以得到强化吗?
训练研究表明,某些经测量的情绪技能可以得到改善,平均效果具有一定意义,但远小于流行说法所承诺的生活巨变。不同项目在持续时间、质量和结果方面差异很大。在训练期间进行的同类测试中取得进步,其证据力度弱于在不熟悉的真实情境中,由他人观察到的持久改变。
有用的练习通常很具体:扩充情绪词汇,核对自己的解读,注意生理唤醒,排练困难的对话,为了理解而倾听,选择一种调节策略,并回顾发生了什么。涉及情绪、创伤、神经发育、沟通或冲动控制的临床困难,不应被简化为所谓“情商”不足。人们可能需要合理便利、安全保障、治疗、替代性沟通方式或改变环境,而不是被贴上性格标签。
如何评估关于情商或社交技能的说法
- 询问测量内容。测量的是经过测试的表现、自我描述、观察者评价,还是广泛的混合型量表?
- 审视测量目标。证据涉及的是情绪感知、情绪调节知识、职场行为、幸福感,还是其他结果?
- 寻找比较证据。除了认知能力、人格、既往表现和相关知识之外,该测量是否还能提供有用的预测?
- 检查情境。结果可能取决于语言、文化、角色、权力、熟悉程度以及任务的情绪要求。
- 区分能力与运用。知道有效的应对方式,并不保证在压力下具备动机、道德性或相应行为。
- 拒绝以偏概全的标签。没有任何可信的分数能够确立一个人的价值、善良程度、关系归宿或总体智力。
证据说明
该领域包含真实的研究发现,也存在尚未解决的测量争议。能力型、特质型和混合型情绪智力测量具有不同的结构,不应将其平均合并为一个普适的“情商”。它们与学校和工作结果的关联通常较为有限,并取决于具体情境;培训可以改善某些测量指标,但能否长期迁移仍不确定。社会智力研究支持对具体的人本能力进行考察,但方法差异以及与一般能力、人格和习得的社会知识之间的重叠,使得难以确立一个独立的“社会商数”。
关键证据与延伸阅读
13. 创造力、元认知与适应能力
有能力的思考不仅是给出答案;还包括生成可能性、判断这些可能性、监测自身的不确定性,以及在现实与预期不符时改变方向。
智能系统有时不能只检索已知解决方案。它可能需要设想替代方案,注意到首个策略正在失效,从反馈中学习,并适应测试设计者未曾预料的条件。创造力、元认知和实践适应性描述了这一过程的不同部分。它们彼此交互,但都不是神秘力量、固定的人格类型或成就保证。
创造力需要新颖性和价值
在心理学研究中,创造性想法或产品通常应当在相关情境中同时具备原创性和有效性、实用性或适切性。没有价值的新颖性可能只是不同寻常;没有新颖性的实用性可能只是熟练的常规做法。什么算有价值,可能因学科、文化和历史时期而变化,因此创造性成就应由知识与实践社群在具体情境中评判,而不能仅凭原创性判断。
拓展可能性空间
提取远距离联想,改变问题的表征,组合已有元素,并提出多种候选方案。发散思维任务只能抽样测量这种能力的一部分,并不能复现完整的创造过程。
根据现实和目的检验新颖性
根据约束、证据、伦理和所在领域的知识比较候选方案。评估并不是创造力的敌人:没有筛选、修改和验证,大量不同寻常的想法可能永远无法成为有用的作品。
将可能性转化为经久耐用的产品
专业知识、坚持、技艺、工具、协作以及容忍修改的能力,会将最初的洞见转化为实验、解释、设计、表演或实用解决方案。
让所在领域检验这项贡献
现实世界中的成就还取决于获取机会、时机、资源,以及相关知识社群能否接触和评估这项工作。未获认可并不能证明缺乏潜力,而获得认可也可能反映社会优势。
向左或向右滑动以进行比较 →
| 构念 | 核心问题 | 典型证据 | 不等同于 |
|---|---|---|---|
| 创造潜力 | 在指定条件下,这个人能否生成或识别有前景的替代方案? | 发散思维任务、顿悟问题以及其他构思样本。 | 对未来创造性成就的完整预测。 |
| 创造性产品 | 这项作品在其领域和目的范围内是否既原创又有效? | 独立评分、功能测试、受众反应以及特定领域的评判标准。 | 仅凭新颖性或创作者的自我评价。 |
| 创造性成就 | 随着时间推移,是否发展出并得到认可的原创且有价值的作品? | 完成的作品、发明、表演、出版物、奖项以及有记录的贡献。 | 不依靠知识、努力、资源或机会而运作的先天潜力。 |
| 元认知 | 一个人监控自身思维的准确程度如何?又能多有效地利用这些信息来控制思维? | 信心校准、错误检测、策略选择、学习时间分配以及根据反馈进行修正。 | 始终准确地进行内省,或不带偏见地审视自身智力。 |
| 适应性 | 当要求发生变化时,能否调整行为、策略、环境或目标? | 迁移任务、不断变化的偶发条件、适应性表现以及具有实际后果的行为。 | 被动服从、追求新奇,或在每个陌生情境中都取得成功。 |
| 实践智力 | 能否在特定环境的现实约束下运用知识? | 默会知识问题、情境判断以及在具体情境中的有效行动。 | 一种独立于知识和一般推理能力的普适性“社会经验智慧商数”。 |
创造力与智力有所重叠,但并不相同
一般认知能力可以帮助人学习某一领域、在头脑中保持约束条件并评估各种可能性。然而,荟萃分析证据发现,智力与现实世界中的创造性成就之间只有适度的正相关。知识、开放性、动机、坚持、协作、资源以及某一领域的评价标准,还会造成额外差异。
反复流传的“智力只有在智商恰好达到120之前才有助于创造力”这一说法,并不是一条已确立的规律。表面上的分界点会随着创造力的判定标准和统计方法而变化;一些分析根本没有发现稳定的阈值,尤其是在现实世界的成就方面。因此,119分或121分并不构成有科学依据的界限,不能据此区分缺乏创造力的头脑与有创造力的头脑。
创造力并不局限于“右脑”
创造性工作会调动相互作用的系统,这些系统涉及自发联想、记忆、注意、控制、价值判断以及感知或运动方面的专业技能。对于某些功能而言,大脑侧化确实存在,但研究并没有把人总体划分为“左脑型”的逻辑者和“右脑型”的创造者。生成想法与评估想法,都可能需要左右两个大脑半球中的大规模网络协同合作。
潜力、表现与成就必须保持区分
限时发散思维任务可以估计一个人在该形式下回答的流畅性或独创性。但它无法完整反映多年领域学习、成品质量,或一项贡献得以实现的社会条件。反过来,较低的可见成就可能反映机会有限、疾病、歧视、贫困、照护负担或缺乏资源,而非缺少创造能力。
创造力训练可以提升人在特定任务上的表现。一项2024年的荟萃分析发现,未经调整的平均效果为中等程度;但在校正发表偏倚后,估计效果降至较小范围。合理的结论是,有用的策略可以被教授,而不是某种干预能够可靠地制造天才,或保证在受训情境之外实现创新。
元认知:监控与控制思维
元认知通常被描述为“思考思维”,但更有用的科学区分是监控与控制。监控会估计已知的内容、答案应有多大把握、哪里仍存在困惑,以及某种策略是否有效。控制则利用这些估计来分配注意力、寻求信息、改变策略、进行练习、核验或停止。
估计知识状态
询问有哪些证据支持该答案,哪些方面仍不确定,以及出错的可能性有多大。良好的监控应经过校准,而不只是充满信心:在可比的决策中,以70%的信心作出的答案,大约应有十次中的七次正确。
选择下一步认知行动
在学习尚未完成的地方投入更多时间,通过检索来测试记忆,而不是反复重读;征求另一种看法,简化问题,进行检查,或修正结论。准确的监控只有在改变行为时才有价值。
内省并不可靠。熟悉感可能让人误以为自己掌握了知识,流畅的解释可能让人觉得它是真的,而犯错后信心仍可能很高。元认知的准确性也会因领域而异:某人在自己的职业领域中校准良好,在医学、金融或人际关系方面却可能校准不佳。因此,元认知并不是一个总能知晓真相的独立内在观察者,而是一组本身也可以接受测试和改进的监控与控制过程。
一个实用的校准循环
- 说明任务和标准。在选择策略之前,明确成功意味着什么。
- 作出明确预测。记录答案、预期结果或信心范围,而不是依赖模糊的感觉。
- 在相关条件下进行测试。从记忆中提取信息,寻找不支持原观点的证据,进行小型实验,或请求具体反馈。
- 比较预测与结果。判断错误源于知识缺失、策略不佳、未察觉的假设,还是随机变化。
- 改变一个有用的要素。修改模型,练习薄弱环节,增加保护措施,或选择不同的环境。
- 重复并保留不确定性。进步来自一系列修正所提供的证据,而不是宣称未来不可能再出错。
适应性是明智的改变,而不是为了改变而改变
当熟悉的惯例不再适用时,适应性便显现出来。这可能要求学习新技能、重新组织计划、与不熟悉的人协调、应对不确定性,或在受到干扰期间维持表现。关于适应性表现和学生适应力的研究,将这些反应视为多维的,而不是一种简单的特质。
建立更大的能力储备
换一种方式表述问题,使用工具,调取另一个例子,减轻认知负荷,或从快速直觉判断转向审慎分析。灵活性之所以有用,是因为没有一种方法能够在所有情境中都奏效。
重新设计条件,而不是责怪个人
消除干扰,请求合理便利,改进说明,补充专业知识,制作清单,或离开不安全的环境。适应包括塑造环境;它并不意味着必须容忍每一项要求。
重新思考应该优化什么
新证据可能表明,某个目标无法实现、有害,或已不再重要。有时,明智地坚持意味着修改一个里程碑;另一些时候,则意味着拒绝放弃正当价值观的压力。
实践智力具有情境性
实践智力研究经常考察默会知识:通过经验学到、而正式教学并未完全明确说明的经验教训。肯尼亚农村、阿拉斯加和工作场所的研究表明,当地重视的知识能够预测有效表现,而传统学术测试可能无法测出这种表现。这些研究也说明,解读必须保持情境性。草药知识、自给性技能或工作场所判断力,都是在特定的机会和要求中习得的;它们并不构成一种脱离文化背景的“实践智商”。
情境判断和默会知识任务可以增加预测信息,但它们结合了多种因素:经验、领域知识、一般推理能力、动机、人格以及对当地规范的熟悉程度。如果这些因素及其边界始终清晰可见,把结果称为实践智力可以作为一种有用的简略说法。
目标是建立灵活的能力储备,而不是固定的学习者类型
一个人在一项任务中可能通过言语进行推理,在另一项任务中进行视觉推理,通过指导性练习学会某个动作,并通过对话解决社会问题。偏好和优势值得关注,但不应变成限制机会的身份标签。加德纳明确区分了多元智能与学习风格,而严谨的综述并未证实,为每位学生指定一种风格并让所有教学都与之匹配,能够稳定地改善学习效果。多样且设计良好的教学之所以有价值,是因为内容和学习者的需求各不相同,而不是因为每个人都属于某一种固定的认知类别。
哪些方面可以负责任地加以提升
可以通过积累领域知识、练习不止一种策略、将想法生成与初步评估分开、检验假设、获得有信息量的反馈,以及学会识别不确定性,来支持创造性和适应性表现。迁移问题仍然至关重要。在练习过的任务上取得进步是有用的;更广泛的主张则需要证据证明这项技能能够经受新的问题、环境和时间间隔的考验。
保护探索
提供足够的心理和物质安全感,使人能够提出不完整的想法、询问基础问题并报告错误。持续惩罚不确定性会助长隐瞒和模仿,而不是负责任的试验。
增加有益的约束
明确的目标、截止期限、证据标准和伦理边界可以集中创新。无限选择并不总能带来更多创造力;约束可以揭示真正的问题,并使比较成为可能。
交替进行发散与筛选
先提出多种可能性,再根据目的和证据进行评估后作出决定。重复这一循环,可以避免过早定论,也避免无休止地产生想法却无法付诸实施。
追踪迁移
在没有提示的情况下,经过一段时间,并在现实约束下,检验某项策略是否适用于陌生材料。迁移,而非熟悉感,才支持适应能力有所提高这一更强的主张。
证据说明
最有依据的创造力定义是新颖性加上有效性或适切性。智力对创造性成就有适度贡献,但不存在划分有创造力者与无创造力者的普遍智商阈值。训练可以改善特定的创造性任务,但在校正发表偏倚后,效果较小;其能否迁移到现实世界中的重大成就,仍不确定。元认知涉及监控和控制,而不是绝对可靠的内省。适应能力和实践智力显然与表现相关,但仍受知识、情境、机会和一般认知资源的影响。
关键证据与延伸阅读
贯穿一生地发展并保护智力
培养学习能力、推理能力和知识;保护使这些能力成为可能的大脑;并追求能够迁移到生活中的提升。
智力是人类最有用的能力之一,值得我们追求并庆祝其成长。教育可以提升广泛认知测试的表现,包括智商测试成绩。有目的的学习可以拓展知识、策略和专业能力,而睡眠、健康和更安全的环境则能保护已有的能力。最重要的进步不只是熟悉问题上的更高分数,而是持久提升学习、推理和解决陌生问题的能力,并将这些能力运用于生活。
为什么更广泛的认知成长很重要
更强的理解和推理能力所影响的,远不止一次测试。它能帮助人更快、更深入地学习新材料,连接不同学科的观点,理解复杂的解释,预见后果,修正错误信念,并在陌生问题中找到更好的解决路径。经过多年积累,这些优势可能不断叠加:每一层理解都会让下一层更容易建立。
更快学习,构建更深层的模型
更强的推理能力和组织良好的知识体系,能更容易地理解关系、保留意义,并将先前的学习应用到新主题中,而不是每次都从零开始。
更清晰地应对复杂性
认知成长有助于比较证据、发现矛盾、区分因果与巧合,并同时把握问题中多个相互作用的部分。
更独立地规划、解决问题并采取行动
更好的学习和解决问题能力可以拓展一个人能够理解的选择,帮助其核查具有说服力的主张,并支持其在学校、工作和日常生活中做出更明智的行为。
这些益处是真实的,但这并不意味着智商可以衡量一个人的道德价值。认知能力拓展了可用于判断的工具,但它不会选择这些工具所服务的目标。高智商并不保证诚实、善良、情绪成熟或智慧,正如较低的分数也不会抹去这些品质。智力在与知识、好奇心、自我调节、同理心、道德原则以及自我修正的意愿共同发展时,才最具人文价值。保持这一点区分不变,一个人学习和推理能力的真正提升仍然是有意义的进步。
首先区分暂时状态与持久能力
分数反映的是某一时间在某项特定任务上的表现。在将变化称为“智力提升”或“智力下降”之前,应询问:即时状态过去后,这种变化是否仍然存在;在不熟悉的测量中是否也会出现;以及测试之外的相关功能是否有所改善。
向左或向右滑动以进行比较 →
| 观察到的模式 | 谨慎解读 | 哪些因素有助于澄清 |
|---|---|---|
| 短暂或不连贯睡眠后表现不佳 | 注意力、工作记忆、速度和动机可能暂时降低。 | 恢复睡眠,并在休息充分且条件相当的情况下重复测试,然后再推断是否存在稳定的损失。 |
| 急性压力、焦虑或悲伤期间分数较低 | 担忧和威胁监测会占用与任务相关的注意力;其影响因人和任务而异。 | 提供支持性的环境,记录症状,并从不同时间点和日常功能中寻找规律。 |
| 醉酒、戒断或调整药物期间发生变化 | 酒精和其他精神活性物质会改变注意力、抑制控制、记忆、睡眠和判断力。药物影响和未治疗的症状都可能起作用。 | 记录时间和剂量;在临床状态稳定时进行评估。不要为了重新测试而停用处方药,也不要突然停止使用与依赖相关的物质。 |
| 疼痛、感染、感官负荷过重或其他疾病期间出现困难 | 测试可能既反映了疾病带来的负担,也反映了目标能力。 | 处理健康、听力、视力和无障碍方面的问题;在恢复或获得合理便利后比较结果。 |
| 使用不熟悉的语言或测试形式时表现较低 | 语言熟练程度和对测试的了解可能限制对任务的完成。 | 使用经过验证的语言支持、适当的常模,并综合比较言语和非言语任务中的证据。 |
| 在重复测试中取得更高分数 | 新颖性降低、记忆内容、答题节奏和习得的策略都可能使分数升高。 | 使用替代形式、较长间隔和未经训练的迁移任务;询问日常表现是否发生了变化。 |
| 持续数月并能应对新问题的改善 | 这更能证明学习具有持久性或发生了更广泛的变化,尤其是在效果不局限于练习过的题目时。 | 用可靠的测量确认知识保持、远迁移以及有意义的现实收益。 |
哪些能力确实可以得到增强?
深入且累积地学习
阅读、教学、提取练习、讲解和反馈能够构建词汇、概念与程序性知识。这些晶体化资源让之后的推理更强大,因为可用于推理的结构化知识更多了。
让思考更高效
组块化、外部笔记、检查清单、有意比较、间隔复习以及寻求反面证据,都能减少可避免的负荷。更好的策略可以在不改变每项基础能力的情况下提升表现。
练习真正的技能
音乐家、程序员、临床医生和工匠通过相关练习与反馈,学会识别有意义的模式。专业能力很强大,但通常具有领域特异性,而不是对所有能力的普遍升级。
在相关研究中,正规教育为广泛认知表现能够增长、而不仅仅是避免衰退提供了最有力的证据。对超过60万名参与者的准实验和纵向估计表明,根据研究设计不同,多接受一年教育与约提高1–5个智商分数相关。教育所做的不只是反复练习智商题目:它会构建知识、持续注意力、符号工具、策略以及处理抽象问题的实践能力。即使广泛能力的提升幅度不大,只要它能支持之后多年的进一步学习,也可能产生重要影响;不过,这一估计是在所研究政策下的平均值,并不是可以无限累加的公式,也不是对每个人的承诺。
以能迁移的成长为目标
练习可靠地改善所练习的任务及其密切相关的任务——近迁移。关于广泛的远迁移能迁移到一般推理、学校、工作或日常决策的证据要弱得多。商业化的“脑力训练”可能很有趣,也可能教会你玩某个游戏,但程序内等级上升并不能证明一般智力发生了变化。
以增强智力并提高经过良好测量的智商分数为目标是合理的。最可信的路径是雄心勃勃且持续的学习,其益处能经受不熟悉的测试,并体现在真正的理解中——不是降低目标,而是提高对成功标准的要求。
更强的学习循环
- 明确真正的成果。说清楚你想提升的是哪种对话、计算、考试、设计问题或日常活动。
- 练习具有代表性的任务。让练习符合实际活动的复杂程度和条件。
- 回忆,而不只是重读。先重建这个想法或执行这项技能,再核对答案。
- 间隔练习并交错学习。 在遗忘一部分内容后再回来练习,并混合相关的问题类型,让方法选择本身成为学习的一部分。
- 寻求纠正性反馈。 保存错误、解释和决策变化的记录,而不只是记录速度或连续完成次数。
- 测试一个未经训练的例子。 如果确有进步,它应能适用于新的措辞、材料或环境。
- 稍后重新检查。 数周或数月后的保持情况,比课后立即产生的兴奋感更有参考价值。
保护学习所依赖的身体机能
保护睡眠和恢复
保持规律的睡眠时间段,并认真对待持续性失眠、严重打鼾、呼吸暂停或影响日常生活的白天嗜睡。如果深夜练习挤占了恢复时间,练得更多并不总意味着学得更多。
保护心血管和代谢健康
规律进行身体活动,并妥善管理血压、糖尿病和胆固醇,有助于维持大脑所依赖的同一套循环系统。应将运动视为健康保护,而不是保证提高智商的干预措施。
保护听力、视力和心理健康
可矫正的感官障碍可能伪装成认知困难,并增加付出的努力。焦虑、抑郁和创伤也会扰乱注意力和记忆;有效的治疗能够恢复人们对既有能力的运用。
预防伤害和有毒物质暴露
使用合适的头盔、安全带、通风设备、一氧化碳检测器和职业防护用品。减少铅和溶剂暴露,尤其是在发育期;受到伤害后不要依赖补充剂来弥补。
合法地位不是认知安全标签
酒精是一种精神活性药物。它的合法性和社会普遍接受度,并不意味着醉酒无害:酒精会损害注意力、记忆、抑制控制、睡眠和判断力,而学习和理性行动正依赖这些功能。然而,非法并不意味着其他所有药物的危害程度都相同。风险取决于物质种类、剂量、效力、摄入途径、使用频率、混用情况、发育阶段、健康状况、环境以及对他人的影响。不要使用酒精、未经处方的兴奋剂、镇静剂、大麻或迷幻剂来增强智力。避免混用物质、在受影响时驾驶或照看他人和处理危险事务;如果可能存在依赖或戒断风险,不要突然停用酒精、镇静剂或处方药——请寻求合格专业人士的指导。
志存高远——也要对捷径索要证据
支持智力增长并不需要相信每一项增强能力的宣传。没有任何补充剂、频率、耳机、催眠脚本或迷幻体验被证明能够解锁隐藏且无限的智力。可信的产品宣传应明确说明适用人群、对照组、测量结果、收益的大小和持续时间、不良影响以及独立重复验证情况。用户评价、前后脑部图像以及在设备自有游戏中的进步,都不能替代持久的迁移效果。
- 纠正已经记录在案的缺乏,而不是“以防万一”服用大剂量。
- 将疾病治疗与健康人的能力增强区分开来;二者的证据和可接受风险可能不同。
- 优先选择那些效果能在实际活动中体现,并在新鲜感消退后仍能保持的干预措施。
- 同时记录睡眠、情绪、药物和物质使用的变化以及表现,这样就不会把状态造成的影响误认为永久能力。
- 比较机会成本:花在应用程序上的时间,就意味着少了用于学习实际主题、活动身体、睡眠或与他人建立联系的时间。
当认知变化反复出现时
偶尔忘事和某一天效率不高,并不能证明能力出现下降。如果新的变化持续存在、不断恶化、出现在多个场景中,或影响学习、工作、用药、金钱管理、驾驶或安全,请记下它从何时开始,以及当时发生了哪些变化——睡眠、疾病、情绪、物质使用、药物、感官问题或头部损伤——并安排由合适的医疗专业人员进行评估。记录基线情况和日常生活中的具体例子,通常比反复进行在线智商测试更有帮助。突发或迅速恶化的变化应及时接受评估,而不是通过自测进行观察。
本节背后的证据
人类智能与人工智能
表现、适应性、能动性、智慧和意识是不同的问题,没有任何单一分数能够回答所有这些问题。
人工智能可以以惊人的速度进行计算、搜索、分类、生成、翻译、规划和模式识别。人类智能则通过有生命的身体、人际关系、文化、情感、记忆、脆弱性,以及多年在选择会带来后果的世界中行动而发展。只有在比较具体时,比较二者才有意义。“谁更聪明?”通常过于笼统;“在这些条件下,基于这些证据并考虑这些风险,哪个系统能更好地完成这项任务?”则可以进行研究。
不存在一个人人认可的单一智能衡量标准
在心理学和神经科学中,智能可能指推理、学习、解决问题、认知灵活性或广泛的能力模式。在人工智能研究中,它通常更具操作性地指系统能够完成什么:其在任务上的表现、能够处理的任务范围,以及适应陌生问题的有效程度。这些定义有所重叠,但并不能互换,也无法解决关于理解、价值观或内在体验的问题。
三个不应混为一谈的含义
它完成这项任务的效果如何?
在明确限定的任务中,棋类引擎、诊断模型或语言系统可能超过大多数人。这确实是一种能力,但在一个领域中的非凡深度并不能证明其在其他领域也具备广泛能力。
它能处理多少项任务?
更通用的系统能够在更广泛的问题中达到有用的表现。但广度仍取决于哪些任务被纳入统计、提供了哪些工具,以及是否把训练任务的近似重复任务误认为真正的新情境。
它学习新事物的效率有多高?
高技能可能来自大量的先前训练、针对特定任务的工程优化或反复练习。适应性关注的是:当答案并非已经可用时,系统能多有效地将有限的先验知识和新经验转化为有用技能。
Legg 和 Hutter 提出了一个颇具影响力的功能性理想:智能是智能体在广泛环境中实现目标的能力。他们的形式化“通用智能”度量会对可计算环境中的奖励取平均,并为更简单的环境赋予更大权重。它在概念上很宽泛,但不是一种实用的智能测试:所需的 Kolmogorov 复杂度不可计算,表现取决于奖励的定义,而且该度量有意不要求类人的思维、意识或道德目的。
弗朗索瓦·肖莱特提出了一个互补性的警示。即使系统的泛化能力较弱,在熟悉任务上的表现仍可能通过更多数据、先验知识和工程优化得到提升。在这一视角下,更好的做法是将智能理解为在明确任务范围内的技能习得效率,同时考虑先验、经验以及泛化的难度。这是一种有用的规范,而非普遍接受的最终定义:要完整衡量人类或机器预先知道什么,仍然极其困难。
谨慎的比较
以下对比描述的是广泛趋势,而非固定本质。人与人之间存在很大差异;人工智能系统在架构、训练、记忆、工具、传感器和获准执行的行动方面也各不相同。有些机器具有具身性,有些会持续学习,而人类也可能高度专业化、存在偏见或不可靠。
向左或向右滑动以进行比较 →
| 维度 | 人类智能 | 人工智能 | 解释边界 |
|---|---|---|---|
| 发展 | 其发展通过生物机制、具身性、依恋、教育、文化、游戏和终身经历实现。 | 其能力源自经过设计的系统、训练目标、数据、优化过程和部署环境。 | 不同的发展路径意味着,简单地逐项比较分数并不完整。 |
| 学习 | 通常可以从相对较少的示例中学习新概念,将其与具身知识和社会知识联系起来,但学习速度较慢、具有选择性,也容易出错。 | 可能从海量数据集中吸收统计结构,之后通过提示、检索、微调或交互进行适应;效率因系统和任务而异。 | 评估“少样本”学习时,应将训练数据、示范、工具和人力都计算在内。 |
| 广度 | 通常可以在日常的物理、语言和社会环境之间迁移知识,不过专业水平和能力差异很大。 | 有些系统能够完成许多数字任务,但在自身最擅长的领域之外仍表现不均衡、脆弱,或依赖外部支撑。 | 通过提示完成的任务种类广泛,说明的是广度,而不是不受限制的通用智能。 |
| 接地与具身性 | 感知和概念受到身体的影响,而身体具有需求、运动、疼痛、愉悦、疲劳以及现实后果。 | 文本模型主要学习数据中的关系。机器人和多模态智能体可以添加传感器和行动能力,但它们的身体、需求和学习经历仍然不同。 | 具身性可能拓展世界知识和实践能力,但研究人员对于它是否是通用智能的必要条件仍存在分歧。 |
| 速度与规模 | 工作记忆、注意力和处理速度有限,但可以有选择地集中注意力,并整合与个人相关的背景信息。 | 基础设施可用时,可以快速且稳定地再现、比较和转换大量编码信息。 | 速度、存储和流畅输出都是能力;任何一项单独都不能证明理解能力或良好的判断力。 |
| 社会理解 | 通过相互关系、共同规范、非语言线索、依赖以及对他人的责任发展而来。 | 可以建模社会模式并生成得体的回应,但可能会忽略隐含语境、长期关系或建议带来的后果。 | 预测富有同理心的回答是什么样,并不等同于感受到同理心或维系一段关系。 |
| 目标与动机 | 通过相互作用的需要、习惯、情绪、承诺以及受社会塑造的目标来行动;动机会彼此冲突,也会发生变化。 | 基础模型会在训练目标和提示词的作用下生成输出。外围的智能体系统可能会增加目标、记忆、工具、反馈循环和权限。 | 不要从第一人称措辞推断出稳定的欲望。实际运行中的能动性取决于整个部署系统。 |
| 道德判断 | 借助情绪、反思、规范、法律、关系和亲身经历的后果,同时具有文化差异,也容易受到偏见影响。 | 可以预测带有人类标签的判断或遵循规则,但输出会反映数据、规范、评估者以及周围的机构环境。 | 与基准标签一致,并不能证明具备良知、道德权威或普遍正确性。 |
| 典型失败 | 遗忘、疲劳、动机性推理、偏见、过度自信、分心和不一致。 | 捏造、捷径学习、分布偏移、对提示词的敏感性、对奖励或指标的投机,以及自信但错误的回答。 | 无论是生物来源还是人工来源,都不能保证真实、公平或可靠。 |
| 责任 | 个人和机构可以承担义务、给予同意、为决策提供正当理由,并在社会和法律体系下对其负责。 | 人工智能系统可以影响决策,但责任仍由开发者、部署者、操作人员、组织机构及其他人类行为者共同承担。 | 将决策委托出去,并不会免除人类对目标、防护措施和后果的责任。 |
为什么基准测试成功有用——也有局限
基准是在特定协议下对任务进行抽样。它可以显示,在这些项目、这些提示词、这些工具、这些评分规则和这些成本条件下,一个系统比另一个系统给出了更多正确答案。它并不能直接衡量某种不可分割的、名为智力的实体,也不能自动预测系统在不同人群、语言、工作场所、物理环境或高风险决策中的行为。
污染可能会伪装成推理
如果测试问题、解答或高度相似的变体进入了训练数据,熟悉程度可能会提高得分。新鲜、私有或频繁更新的测试可以降低这一风险,但无法保证每种相关模式都是全新的。
优化可能会以排行榜为目标
反复针对公开测试选择模型、提示词和方法,可能会导致评估过拟合。系统可能会利用捷径或指标的措辞,而没有获得该基准旨在代表的更广泛能力。
任务清单决定了叙事
当研究人员改变任务、权重、语言、用于比较的人群或评判者偏好时,排名可能发生变化。因此,每个排行榜都包含关于哪些能力应计入以及各自权重多少的价值取舍。
提示词和工具会改变系统
基础模型、配备检索功能的模型、获准编写并运行代码的模型,以及拥有记忆和多次尝试机会的智能体,并不是同一个被评估对象。比较应报告完整的设置,而不只是模型名称。
准确率并不是全部结果
校准、稳健性、公平性、安全性、延迟、能耗、成本以及失败的严重程度,可能比准确率上的微小差异更重要。在高风险场景中,罕见的有害错误可能压倒平均得分。
实验室技能未必能够迁移
现实环境包含歧义、不断变化的目标、不完整的信息,以及会受到结果影响的人。交互式、社会性和具身测试能够揭示孤立的选择题无法发现的失败。
如何解读“达到人类水平”的人工智能这一说法
- 明确能力的定义。询问纳入了哪些任务、语言、人群和性能阈值。
- 明确评估的系统。记录模型版本、提示词、工具、记忆、检索、尝试次数以及人工协助。
- 审视比较方式。“人类水平”取决于抽取了哪些人作为样本、他们的专业程度、时间限制、激励机制以及使用工具的权限。
- 关注新颖性和迁移能力。优先选择封闭或全新的任务、不熟悉的变体,以及能够证明表现经得住措辞和语境变化的证据。
- 考察的不只是准确率。纳入不确定性、失败的严重程度、稳健性、成本、偏差、安全性以及部署后的表现。
- 让结论与证据相称。通过一项测试,只能支持关于该测试的结论;更宽泛的结论需要更广泛的独立证据。
具身智能、社会智能与道德智能
知道有时必须转化为行动
机器人系统检验感知和语言能否通过反馈、不确定性及物理后果来指导行动。RT-2 等研究展示了对新物体和指令的有用迁移,但受限试验并不能证明系统在每个家庭、街道或工作场所都具备安全可靠的能力。
正确的句子只是一个层面
静态测试可以探查对社会惯例的了解。交互式环境还会加入协调、竞争、协商和不断变化的目标。SOTOPIA 发现,与人类相比,强大的语言模型在困难的模拟社会互动中仍然表现吃力。尽管如此,模拟仍然只是现实关系的不完整替代。
预测不等于道德权威
ETHICS等数据集会测试模型能否预测人类在义务、正义、福祉、美德和日常行为方面的判断。然而,人类的道德偏好在不同文化内部和文化之间都存在差异,多数意见也不自动等于伦理上的正确。标签揭示的是一种选定的规范性参照;它们不会创造良知。
能力不等于能动性、智慧或意识
系统能够产出什么?
能力涉及在特定条件下的潜在表现。模型在被要求时可以起草计划、识别模式或解决问题。但这本身并不能说明它是否会主动采取行动、目标是否值得追求,或其输出是否可以安全使用。
什么能够持续一段时间采取行动?
能动性是运行安排的一种属性:目标、记忆、规划、工具、权限、反馈和采取行动的机会。一个有能力的模型可以作为受到严格控制的工具部署,也可以置于更自主的智能体之中。能力可以促成自主性,但并不决定应授予多大程度的自主权。
应该追求哪个目标——以及何时应停止行动?
智慧包括在不确定性下进行判断、意识到后果、权衡价值、接受纠正,以及有时拒绝一个有吸引力但有害的目标。目前没有公认的基准能将流畅推理或广泛能力转化为智慧的证明。可信性需要单独的证据和人类治理。
成为该系统会是什么样的体验?
主观体验与可观察的表现是两个不同的问题。流畅的第一人称语言、情绪词汇、自我指涉或较高的测试分数本身都不能证明感知能力。当前的科学提案根据相互竞争的理论推导指标,但目前没有获得共识的机器意识检测器;无论持肯定还是否定立场,提出自信的论断都应说明其假设。
证据说明
本节综合了截至2026年9月核查的正式定义、同行评审的立场论文、实证基准和官方风险指南。它们并未形成一个普适的统一智能评分。Legg–Hutter普适智能是理论上存在但不可计算的理想;Chollet的学习效率理论和AGI等级框架是颇具影响力的提案,而非已确立的共识;基准测试只抽样考察特定行为;意识研究目前提供的是源于理论的指标,而非决定性测试。关于某个特定AI系统的论断应始终重新核查,因为模型、训练数据、接口和评估都在迅速变化。
关键证据与延伸阅读
神话、整合视角与证据库
智力是一项重要的人类能力:可测量、会产生重大影响、可以发展,并值得终身培养。
智力既值得科学上的严谨对待,也值得赞颂。它帮助人们更快学习、理解复杂性、解决陌生问题,并在环境变化时进行适应。智商(IQ)反映了这种认知能力的重要部分,而知识、创造力、情绪、元认知和智慧则会影响这种能力如何发展和使用。
一个整合模型:能力、应用与方向
有哪些可用资源?
推理、记忆、速度、注意力、语言、空间处理能力和习得的知识,共同构成认知资源;人们借此理解、学习、规划和解决问题。
这些资源在这里如何使用?
策略、专业知识、情绪调节、元认知、任务设计、健康状况和环境支持,都会影响能力能否转化为有效表现。
这种能力用于什么?
更强的认知能力拓展了理解选项及其后果的能力。智慧、伦理、情绪调节、合作以及有价值的目标,有助于将这种能力引向有益的行动。
认知差异是可以测量的,而且在教育、工作、健康、日常独立生活以及学习新技能的速度方面都很重要。当能力与知识、可靠的策略、支持性条件和建设性目标结合起来时,它们的影响会更加强大。因此,智商既不是全部,也不是无关紧要的东西:它是人们学习并理解世界的重要组成部分。
解读任何智力主张时要问的八个问题
- 究竟提出了什么主张? 明确所指的能力:推理、记忆、知识、创造力、社会理解力、智慧、成就,或其他能力。
- 是如何测量的? 应询问该任务、测验或基准对于目标和人群而言是否可靠、有效且合适。
- 是与什么相比? 明确常模群体、控制条件、先前表现,或有意义的现实标准。
- 还存在多大的不确定性? 应关注置信区间、测量误差、重复验证、其他解释,以及不支持该主张的结果。
- 证据针对的是个人还是群体? 平均关联并不能决定某一个人的能力、需求或未来。
- 哪些条件影响了结果? 应考虑语言、教育、残障、睡眠、健康、压力、动机、练习情况以及对任务的熟悉程度。
- 证据是否显示了因果关系和迁移效果? 在经过练习的任务上有所改善、存在相关性,或脑部信号发生变化,并不自动证明认知能力获得了广泛且持久的益处。
- 哪些重要品质没有被测量? 对于任何没有评估尊严、价值观、同情心、判断力、目标、经验和实际处境的分数,都应将这些品质排除在其评价范围之外。
用更扎实的智力理解取代的十个误区
“因为智商测量不了一切,所以它测量不了任何重要的东西。”
设计严谨的智商评估能够测量重要的认知能力,并能有效预测学习、教育成就、培训成效,以及从事认知要求较高的工作时的某些表现。它不必描述每一种有价值的人类品质,才能提供有用的信息。它的适当作用很重要,但也有明确边界:估计关键的认知能力,帮助理解情况,并支持人们就学习和发展作出更好的决定。
“智力是固定的,所以智商不会提高。”
认知能力可以表现出显著的稳定性,但稳定性并不意味着不可改变。纵向研究和准实验研究证据表明,接受更多教育可以提高智力测验成绩,而知识、策略和专业能力也会通过持续学习不断发展。人群得分的历史变化同样表明,测得的智力会受到环境条件的影响。每个人的成长幅度和干预效果各不相同,但起始分数并不是永久的上限。
“知识和智力是一回事。”
知识提供事实、概念和经过练习的程序性方法;推理则帮助组织和应用这些知识,尤其是在问题并不熟悉时。二者持续互动。丰富的知识可以使人在特定领域中的表现更加迅速而准确,而强大的推理能力则能帮助人高效地学习新材料。单靠记忆事实或脱离语境的解谜,都无法体现二者的协作关系。
“高智力保证拥有智慧并作出正确决策。”
更强的认知能力可以帮助人理解复杂性、从证据中学习、比较更多可能性并预见后果。这些都是作出更好决策的重要基础。良好的判断力还受益于准确信息、经过校准的自信、情绪调节、建设性的价值观,以及愿意修正自己偏好结论的态度。智力拓展能力;知识和智慧则帮助引导这种能力。
“如果智力具有遗传性,它就必然是固定不变的。”
遗传力描述的是特定条件下生活的特定人群内部的差异;它并不能说明某个个体有多大程度上是“由基因决定的”。一种特质可能受到遗传差异的影响,同时仍会对教育、健康、营养或环境作出反应。遗传力也可能因年龄和环境而异。它既不是一个上限,也不是对某个人的预测。
“脑力游戏能广泛提升智力。”
练习通常会提升人在所练习任务上的表现,有时也能提升在密切相关任务上的表现。更重要的主张——即狭窄的训练能让无关能力和日常生活中的表现获得广泛而持久的提升——需要更有力的证据,也更难以确立。应根据独立的结果、有意义的迁移和持续性来评估收益,而不能仅凭应用程序分数或连续训练记录。
“每个人都有一种经过科学确立的学习风格。”
人们有不同的偏好、优势和支持需求,但这并不能证明,只有当教学与固定的视觉型、听觉型或动觉型标签相匹配时,他们才能学得最好。有效的教学形式很大程度上取决于材料本身:发音需要声音,几何学受益于空间表示,而身体技能需要练习。灵活且设计良好的教学,比把学习者限制在单一身份中更有用。
“多元智能类别是完全独立的心理系统。”
这一框架帮助许多教育工作者认识到,人的能力不止体现在传统的课堂任务上。这种教育价值应与这样一种实证主张区分开来:每个提出的类别都是一种独特且彼此独立的智力。许多表现都依赖于共同的认知资源、知识、人格、动机和练习。不同的才能值得获得支持,但不必因此把每一种才能都重新归类为一种独立的智力。
“情商是一个与智商等价、且获得普遍认可的分数。”
“情商”可能指在与情绪相关的能力任务中的表现、自我报告的倾向、社交技能,或由一系列广义理想特质组成的综合概念。这些方法不可互换,可能得出不同结果。情绪理解和调节可能非常重要,但一个有说服力的情商标签并不能免除我们追问实际采用了哪种构念和测量方法的必要。
“流畅的 AI 回应证明了类似人类的理解或意识。”
语言流利度和出色的基准测试表现,能够证明系统在这些任务上的能力。但仅凭这些,并不能证明其具有主观体验、类似人类的意义理解、情感、智慧或对后果的意识。结论取决于定义和额外证据。无论系统处于何种状态,人和机构仍有责任核查其输出,并决定如何使用它。
贯穿一生的问题
不要只问哪些能力存在,还要问如何理解、增强、保护并恰当地运用这些能力。智力使人更有能力从世界中学习、识别更深层的模式、解决过去无法触及的问题,并以更广阔的后果认知采取行动。智商或其他认知能力得到可靠提升——尤其是这种提升能够持久,并迁移到所练习任务之外——是一项有意义的成就。发展这种能力,并将其与知识、智慧和关怀结合起来,值得我们终其一生去追求和庆祝。
证据资料库
以下来源是核查本指南中所使用的定义、模型、测量原则和注意事项的起点。证据的质量和范围各不相同:统计关联未必具有因果性,群体平均值未必能描述个人,实验室结果也未必适用于日常生活。
如何理解证据表述
充分确立意味着不同方法反复支持一个广泛结论,例如许多认知任务之间的正相关。有限支持意味着某种平均关联或效应是可信的,但会因测量方式、群体或情境而异。存在争议意味着定义、方法或解释仍在持续争论。这些标签都不能将群体平均值转化为对某个人的预测。