人工智能助手
Linas Juozenas分享
AI 助手:
放大思维
AI 助手可以将数小时的搜索、起草或例行转换工作压缩到几分钟内。这是真实的力量。然而,最高标准并不是机器是否快速产出了某些内容,而是这个人是否变得更有能力、决策是否得到改善、真相是否保持完整,以及人的能动性是否始终掌握主导权。
能动性
目标
上下文
生成
证据
决策
学习
什么是 AI 助手——以及它不是什么
“助手”一词描述的是一种界面和角色,并不保证其具备知识、忠诚或判断力。
现代助手可能将语言模型与语音识别、图像理解、搜索或检索、个人记忆、软件工具以及执行操作的权限结合起来。模型根据数据中的模式预测有用的后续内容;检索可以提供文档;工具可以进行计算、浏览、写入文件或操作服务。结果可能让人感觉像是一个流畅统一的心智,但更准确的理解是:它是一个由具有不同故障模式的组件组成的系统。
界面
语音、聊天、摄像头、屏幕或嵌入式控件会将人的请求转换为机器可读的输入。
模型
模型解读上下文,并生成语言、代码、图像或拟议方案。流畅并不等于有证据证明。
依据
搜索、数据库和提供的文件可以让答案以证据为依据——但检索结果仍可能不完整或错误。
工具与权限
日历、电子邮件、代码运行器和其他工具会将文字转化为后果。自主性越高,就越需要严格的控制。
对话可能制造虚假的确定感
自然语言在社会层面具有强大影响力。温暖的语气、自信的解释或看似拥有记忆的表现,可能让系统显得比实际情况更能理解、见证或核实信息。应将个性视为界面设计。根据证据评估其主张,并根据权限、可逆性和审查来评估其行动。
自主性阶梯
| 模式 | 系统的功能 | 人的责任 | 最低保障 |
|---|---|---|---|
| 回答 | 解释、翻译、总结或生成选项。 | 解读并做出决策。 | 核查重要事实和来源质量。 |
| 起草 | 创建供审查的文本、代码、分析或计划。 | 编辑、测试并承担作者责任。 | 保留可检查的草稿和验证步骤。 |
| 推荐 | 对选项排序或提出决策建议。 | 检查假设、受影响的人群和替代方案。 | 对影响重大的选择提供独立证据。 |
| 经批准后行动 | 准备电子邮件、采购、变更或工作流程,然后等待。 | 审查确切的操作及其目标。 | 清晰的预览、限定范围的权限和确认机制。 |
| 自主行动 | 无需逐步审查即可执行多个步骤。 | 设定边界、进行监控并承担责任。 | 最小权限、日志记录、支出限额、停止控制和恢复机制。 |
生产力研究实际上显示了什么
AI可以在某些任务上带来显著提升。效果的大小和方向取决于任务、系统、人员、工作流程以及质量的定义。
在明确限定的任务集合中更快且更好
在一项预注册实验中,453名受过大学教育的专业人士完成中等难度的写作任务,获得ChatGPT使用权限后,完成时间 40% 并使独立评定的输出质量提高了 18% 平均而言。[1] 这支持AI确实能提升任务表现;但不能证明每种职业或长期学习都会产生同样的效果。
对新入行员工的益处显著
一项针对5,172名客户支持人员的研究发现,每小时解决的问题平均增加了15%。经验较少和绩效较低的员工获益最多;最终论文报告称,技能较低群体的增幅约为30%,而技能较高的员工生产力几乎没有变化,对话质量则小幅下降。[2]
在能力边界内表现强劲
在758名顾问中,使用GPT-4的人在测试能力边界以内完成的任务数量多12.2%,完成速度快25.1%,且工作质量更高。在一项刻意超出该能力边界的任务中,AI用户得出正确答案的可能性低19%。[3]
专家工作可能无法用简单的速度结论概括
在一项针对16名经验丰富的开源开发者的2025年随机研究中,他们在熟悉的代码仓库中完成了246项任务。2025年初的AI工具平均使完成速度降低了19%——尽管开发者原本预计速度会提升。[4]2026年的后续研究发现,较新的工具可能更有帮助,但严重的样本选择和测量问题使研究无法可靠估计当前影响。[5]
诚实的结论
“人工智能提高生产力”这一说法过于宽泛。更稳妥的表述是:在一些匹配度较高的任务中,经过称职的审查,特定系统提高了速度、产出量或评定质量。这很有用,也很重要。但它是有条件的。
人类加人工智能并不自动构成最强团队
一项预注册的荟萃分析涵盖了 106 项实验和 370 个效应,发现人类与人工智能的组合平均而言优于未获辅助的人类(g = 0.64),但平均而言,其表现不如人类或人工智能单独使用时较强的一方(g = −0.23)。结果存在极大的异质性,而且纳入的研究于 2023 年 6 月结束,当时许多当前的助手尚未出现。[6] 协作必须经过设计和测试;把人加入模型,或把模型加入人,并不能保证产生协同效应。
衡量价值,而不是表面上的忙碌
崎岖的前沿:相近的任务,截然相反的结果
一个系统在某项任务上可能表现惊人,接着在下一项任务上自信地给出不可靠的结果,即使对人来说两项任务看起来同样困难。
转换
重新整理提供的材料、生成备选方案、翻译语气、提取字段,以及根据经过验证的简报起草内容。
综合
总结长篇文档、比较证据,以及在不熟悉的系统中编写代码,都可能表现良好——前提是上下文完整且审查到位。
真相与判断
新颖事实、因果主张、含糊的要求、价值冲突和罕见的边缘案例,可能超出模型可靠能力的边界。
随着模型和工具的变化,边界也在移动;它还因语言、领域和语境而异。熟悉感也可能造成误判:润色得很好的回答,可能在形式上类似专家工作,却不包含专家的因果理解。最安全的用户既不会反射性地信任,也不会反射性地否定。他们会了解特定系统在哪些方面有帮助,围绕其弱点设计检查,并始终愿意在没有它的情况下完成工作。
委派前的快速前沿测试
- 定义成功标准明确答案、证据和可接受的误差。
- 评估风险如果输出存在细微错误,会发生什么?
- 探查边界尝试已知案例、对抗性案例和缺失上下文的案例。
- 分配审查任务安排能够发现相关故障的人。
- 记录学习情况系统或任务发生变化时,更新工作流程。
审查悖论
错误越难被发现,审查就越需要专业知识。人工智能可以帮助新手接近既有模式,但模式失效的地方恰恰仍然需要专家。一种受益于专业知识提炼成果的社会,应保护那些发展出这些专业知识的人,保留他们质疑自动化的权威,并认可他们的贡献。
学习、记忆与智力
最有价值的助手不一定是最快给出答案的助手。它可能是帮助头脑建立更强模型、提取知识,并独立解决下一个问题的助手。
即时表现与持久能力是不同的结果。一篇完成的文章、一道正确的方程式或一个可运行的程序,说明人和工具组成的系统产出了一个结果。但这本身并不能说明这个人学到了什么。要衡量成长,应在之后移除工具,测试记忆、解释能力、将所学迁移到新问题上的能力以及发现错误的能力。
这种区别很重要,因为智力不是装饰性的。推理、记忆、学习速度、知识以及迁移理解的能力,都会影响一个人应对教育、工作和复杂人生决策的表现。这些能力值得培养和赞美。它们源于多种因素的相互作用——包括生物因素、发展、健康、机会、教学以及多年的刻意学习——而保持这些能力可能需要持续努力。人工智能应该帮助更多人增强智力,同时绝不能抹去那些让他人受益的稀有专业能力和原创思想。
在有效的认知评估中取得更高分数,确实能证明一个人在该评估所衡量的能力方面表现更强。这种证据可能意义重大:卓越的推理能力和积累的知识,可能让一个人发现某种危险、解决方案或可能性,而没有他们,任何现有工具或委员会都无法找回这些东西。分数不是商店里买来的装饰品,模型借来的流畅表达也不能替代一颗由天赋、发展和终身学习塑造的大脑。尊重智力,就要保护认知健康,为有才华且勤勉的头脑留出发挥空间,在他们的专业知识相关时倾听他们的意见,并认可他们所创造的价值。谨慎的测量会限制分数能够证明的范围;但绝不能借此假装测得的能力并不重要。
目标不是证明工具可以替你思考,而是让你在使用后能够思考得比以前更深入。
人工智能辅助的人类发展标准练习期间的帮助可能掩盖较弱的学习效果
在一项以班级为单位随机分组、针对土耳其一所高中 839 名学生的研究中,不受限制的 GPT-4 界面提高了有辅助练习的表现,但这些学生随后在无辅助考试中的成绩比对照组低 17%。一名使用教师编写材料和提示、拒绝提供完整答案的受控导师提高了练习表现,同时消除了考试中的这一劣势;在考试中,其表现并未显著优于对照组。[7]该研究涵盖四节课和一次即时测试,并未考察长期发展。
精心设计的辅导可以改善即时学习效果
在两节课中,针对 194 名符合条件的哈佛大学物理学学生,一名定制的 GPT-4 导师相较于专家主动学习课程,使即时后测成绩估计提高了 0.63 个标准差,而中位学习时间为 49 分钟,而非 60 分钟。[8]这证明了在特定环境中精心设计的导师具有成效,而不是证明通用聊天机器人可以取代教师。研究未测试延迟保持率和学期成绩。
先尝试解决问题可以改变解释所教会的内容
在两项涉及 1,818 名美国成年人的实验中,与仅获得答案相比,正确的法学硕士模型解释提高了参与者在类似、无辅助问题上的即时表现;当参与者在看到解释前先尝试解决问题时,这种效果尤其明显。[9] 这种迁移程度有限、持续时间很短,且仅通过少量题目进行测量,因此它支持一种学习设计,而不是关于智力广泛或持久增长的主张。
信心会改变思考发生的地方
一项 2025 年研究调查了 319 名知识工作者在现实中的 936 次使用情况。对生成式人工智能越有信心,与自我报告的批判性思考投入越少相关;对自身能力越有信心,则与更多投入相关。参与者还描述了思维重点转向验证、整合和管理。[10] 该研究报告的是认知和关联,而不是证明人工智能导致了认知能力下降。
把助手变成导师,而不是答案发放器
薄弱的学习循环
- 立即索要完成的答案。
- 被动阅读,接受流畅的表述。
- 复制结果,不要重新构建。
- 在下一个类似任务中反复依赖。
以成长为导向的学习循环
- 先尝试解决问题,并首先展示你的推理过程。
- 要求一个提示、一个反例或一个诊断性问题。
- 用自己的话重新解释答案。
- 关闭助手,凭记忆解决一个多样化的例题。
AI 能提高 IQ 吗?
目前还没有充分证据表明,日常使用通用 AI 助手能够可靠地带来一般智力或 IQ 的持久提升。它可以帮助人们获取知识、练习推理、获得反馈、翻译困难材料并接受指导——这些都是可能提升特定认知技能和现实能力的要素。任何关于 IQ 提升的主张都应采用有效且重复的评估,考虑练习效应,并证明能力能够迁移到未与该系统共同练习过的任务中。缺乏已证实的普遍效果,意味着应当谨慎测量,而不是否定智力成长。
保护有益的困难
- 先回忆,再揭示。 在请求摘要之前,先写下你记得的内容。
- 先生成,再比较。 在查看模型的答案之前,先形成自己的假设、提纲或解决方案。
- 追问原因。 要求说明机制、假设、边界情况,以及一个能够证明答案错误的测试。
- 变换问题。 改变情境,在没有帮助的情况下重新解决,以检验迁移能力。
- 保持能力底线。 定期在无人协助的情况下执行核心技能,以确保紧急、新颖和对抗性情境仍然可控。
原创性、主动选择的独处与社群
人的思维有时需要摆脱提示——包括来自人和机器的提示——才能发现自己真正看到了什么。
原创思想往往在达成共识之前就已开始。当其他人——或一个基于主流模式训练的 AI——立即建议你该注意什么、如何构建问题,或“好的答案”应是什么样时,注意力可能会过早地被锚定。这种影响即使出于善意,也可能缩小探索空间。主动选择的独处会创造一段受保护的时间,让好奇心自由漫游,形成不寻常的联想,并使一个想法变得足够独特,能够经受比较。
这并不意味着孤立是最终的理想状态。一旦有了原创想法,其他人就变得不可或缺:他们会质疑薄弱的假设,补充缺失的知识,完成一个人无法完成的工作,将成果介绍给更广泛的社群,并为真正的成就喝彩。因此,健康的智性生活会在独自酝酿与慷慨协作之间交替——既不是永久退隐,也不是永久暴露于他人的方向之下。
离开足够长的时间,才能听见自己的想法。按自己的选择回归——并让这次回归成为一种庆祝:测试、支持、拓展、署名并分享一个头脑最初孕育的事物。
独处与社群是互补的智识条件个体评分更高,群体多样性更低
在一项 2024 年实验中,293 名作者创作了短篇故事,600 名不知情读者对其进行评估。获得一个 AI 创意后,故事的平均新颖性评分提高了 5.4%,实用性提高了 3.7%;获得最多五个创意后,这两项评分分别提高了 8.1% 和 9.0%。提升主要集中在研究中基线创造力任务得分较低的作者身上。然而,AI 辅助创作的故事彼此之间变得更加相似,与所提供创意的相似度也提高了约 5%。[11] 任务是创作八句话的小说,而不是衡量整体创造力,但它展示了个体提升如何与群体趋同并存。
先进行私下的初步创作,有助于保留自主性,并与模型拉开距离
在一项规模较小的 2025 年实验中,60 名参与者完成一项 20 分钟的健康主题构思任务:一组从一开始就使用 GPT-4,另一组则只在独立创作出至少三个创意后才使用。延迟使用 AI 的参与者,其创意与模型输出的相似度更低,并报告了更高的创造性自我效能感、自主性、拥有感和自我署名感。[12]该研究未设置无 AI 组,其创意数量差异按通常标准也不具有显著性。它表明,先独立创作,再获得辅助是一种很有前景的保护性设计,而非普遍法则。
原创性四阶段协议
- 漫游留出受保护的时间进行观察和思考,不接收外部建议。
- 捕捉用自己的话记录创意、推理、日期和早期证据。
- 质疑借助人类与 AI 寻找先例、异议、测试方法和缺失的专业知识。
- 构建以清晰的角色开展协作,并保留每个人贡献了什么的记录。
- 庆祝为创意发起者和合作者署名;帮助优秀创意触达能够从中受益的人。
署名不只是按下“生成”
责任与署名应当依据有意义的人类贡献来分配:构思目的,选择或拒绝材料,作出表达性决策,修改、核验并承担责任。当来源追溯很重要时,应保留版本历史。目前,美国版权局的指导意见将版权保护的核心置于人类创作之上,并要求申请人在已注册作品中披露超出最低限度的 AI 生成材料。[13]
尊重智慧,而不对人的尊严作高低之分
认知能力和贡献并非可以互换。有些人凭借罕见的天赋和一生的努力,发展出非凡的推理、知识或创造能力;社会应当在保护他们、倾听他们并公平认可他们方面获益。平等的人类尊严并不要求假装所有人的表现都相同。认可应当尊重真正的成就,而不应把分数变成虐待任何人的许可。
无障碍与包容:更多思考、表达和行动的方式
对许多人而言,助手并不是新奇事物。它可以弥合个人能力与僵化环境之间的不匹配。
语言与认知
用通俗语言改写、分步说明、词汇支持和可调节的节奏,可以减少不必要的障碍,而不会削弱观点本身的严肃性。
感官无障碍
字幕、文本转语音、图像描述和多模态输入可以在视觉、听觉和文本形式之间转换信息。
运动与言语无障碍
语音控制、兼容开关设备的界面、文本生成和辅助沟通可以减少表达意图或操作软件所需的努力。
良好的无障碍设计扩大了控制权;它不会强迫所有人通过同一个“智能”渠道。人们应当能够选择打字而不是说话、阅读而不是聆听,减慢或停止输出,纠正识别结果,保留自己的声音,并决定个性化是否值得其所需的数据。Web 内容无障碍指南为可感知、可操作、可理解且稳健的数字体验提供了持久的基础;AI 功能不能取代无障碍结构、键盘支持、标签、字幕或与残障用户一起进行的测试。[14]
识别准确率并非对所有人都相同
语音系统在不同口音、方言、说话风格、年龄、噪声环境和残障情况下,表现可能有所不同。一项 2020 年对五种商业语音识别系统的研究发现,在所测试的美国英语数据集中,黑人说话者的词错误率明显高于白人说话者。[15] 此后产品已经发生变化,因此这些数字并不是当前的评分表;但这项研究仍清楚表明,平均准确率可能掩盖不均等的失败。
依赖输出的人可能最无力核查它
一项由 19 个残障组织参与制定的 2025 年美国调查涵盖了 1,735 名成年人,其中 1,070 人为残障人士。在 290 名使用 AI 视觉描述的盲人和低视力受访者中, 21% 报告称错误曾对其造成伤害;两个有视力对照组的比例均为 9%。在 54 名使用字幕的聋人或听力障碍者中,24% 报告称曾因错误受到伤害。[16] 子群体规模和自我选择限制了总体估计,但这种不对称性十分明显:当输出替代了无法获得的感知时,看似合理的猜测可能带来更大的风险。
更快的表达仍必须是这个人自己的表达
在一项针对 12 名使用辅助与替代沟通方式人士的 CHI 研究中,实时语言模型建议可以减少打字时间和精力,但参与者强调应保留自己的风格和偏好。[17] 因此,建议应当是可选的、可编辑的,并且易于拒绝或撤销——绝不能自动朗读或发送。
针对产品团队
- 与残障人士一起测试,并为其专业知识提供报酬。
- 公布跨相关用户群体和情境的结果。
- 为重要操作提供非语音和非人工智能替代方案。
- 让错误易于发现、更正和撤销。
- 不要根据识别失败推断能力不足。
针对学校和工作场所
- 区分合理便利与隐蔽替代。
- 通过无障碍途径评估个人的知识水平。
- 不要要求用户向聊天机器人披露敏感状况。
- 自动化失败时,仍应提供人工支持。
- 让用户控制语气、节奏、格式和记忆。
无障碍需求因人而异。对一个人有帮助的功能可能会给另一个人带来负担;用户选择和直接测试比假设更可靠。
真相、校准与核查的纪律
助手可以用同样平静的语气,在同一段话中陈述真实事实、合理推断和虚构细节。因此,必须针对具体主张进行核查,而不是根据语气判断。
NIST 使用虚构一词来指代生成式系统以确信口吻呈现的虚假或错误内容。其《生成式人工智能风险管理框架概况》还指出,隐私、有害偏见、信息完整性、网络安全以及人机配置都是需要根据具体情境进行测量和管理的风险。[18]该概况是一项自愿性风险管理资源,并非法律,也不是任何系统安全的证书。
模型可能编造引文、误读来源、进行无效计算、遗漏相反证据,或认同用户的前提。较早的基准测试能够让这一现象显现出来,但不应再被用作当前产品的评分。例如,TruthfulQA 在 38 个类别中测试了 817 个对误解敏感的问题,并发现当时研究人员可用的模型之间存在显著的真实性差距。[19] 它无法告诉我们 2026 年每个助手的准确性。
虚构
模型生成缺乏依据的事实、引语、链接、法律案件、数据或推理,以符合所要求的形式。
与后果相匹配的验证阶梯
| 出错时的后果 | 示例 | 适当的核查 | 不要依赖 |
|---|---|---|---|
| 低 | 为头脑风暴取名、改变语气、重新格式化自己的笔记。 | 阅读时判断是否适用;保留或舍弃。 | 把助手的品味当作客观事实。 |
| 中 | 公开文章、分析、常规代码、研究解读。 | 打开引用的来源,测试示例,并请知情人士审核。 | 仅仅因为某个参考资料拥有逼真的标题或 DOI。 |
| 高 | 医疗、法律、财务、就业、安全或安保决策。 | 使用权威的最新来源和具备适当资质的人类专家;记录假设并进行复核。 | 人工智能免责声明、聊天机器人之间的多数票或自信的措辞。 |
| 不可逆 | 发布、删除、付款、账户变更、披露或实体操作。 | 预览确切的操作和目标;要求再次确认,并制定恢复计划。 | 广泛的长期授权或含糊的命令。 |
经过校准的阻力保护思考
在一项有199名参与者的受控实验中,要求人们先思考问题、再接收或接受人工智能建议的界面,减少了人们过度依赖错误建议的倾向。最有效的阻力机制也最不受欢迎。[22] 便利性与良好判断可能背道而驰;优秀的设计会让重要的思考变得不可回避,同时不会让每项无害的任务都变得困难。
逐条核查
- 区分事实与综合判断。标记可核查的日期、数量、引语和因果性断言。
- 追溯源头。确认所引用的论文或官方文件确实存在,并且支持该句的确切表述。
- 重新计算。独立运行计算;检查单位、分母、缺失值和基准率。
- 寻找证伪证据。询问什么证据会推翻结论,然后在对话之外寻找这些证据。
- 如实说明不确定性。“未知”“不一”“未测试”比虚构的精确说法更可靠。
隐私、安全与权限
在询问助手能做什么之前,先问它能看到、记住、发送和更改什么。
输入
提示词、语音、图像、文件、屏幕、位置和周围的对话。
派生数据
转录文本、嵌入向量、推断出的兴趣、摘要、个人资料和安全标签。
保留
对话历史、服务日志、备份、人工审核队列和已连接应用的记录。
操作
可通过工具或集成访问的消息、购买记录、代码、日历、记录和设备。
语音助手:倾听并非单一状态
许多语音助手会在设备本地对短时滚动音频缓冲区运行唤醒词检测;这并不一定意味着所有环境对话都会被上传。不过,检测具有概率性。误触发可能导致无意中的语音被传输、转录或保留,具体取决于服务和设置。欧洲数据保护指南强调,意外激活、旁观者数据、目的限制、保留期限以及有实质意义的删除,都是需要重点关注的设计问题。[23]
一项受控的2020年研究在受测智能音箱附近播放了134小时的电视内容。不同设备的误触发情况各不相同;在该实验室设置中,当地观察到的几乎所有触发都被发送到了云端。[24] 这项研究证明了一种真实存在的机制,并不代表每种产品在普通家庭中的当前触发频率。
默认私密比“谨慎一点”更可靠
除非你了解相关协议、用途、保留期限、训练用途、删除流程和访问控制,否则不要将机密工作资料、健康记录、身份证件、私人消息、未公开的发明、儿童数据或他人的信息粘贴到服务中。去标识化比删除姓名更难:多项细节组合起来可能识别出个人。
当助手可以使用工具时,不受信任的内容可能会变成指令
助手可能会读取包含恶意文本的网页、电子邮件或文档,其中的文本会指示它忽略用户、披露数据或调用工具。针对间接提示词注入的研究演示表明,在易受攻击的集成大型语言模型的应用中,这类攻击可能导致操纵、数据外泄以及滥用已连接的功能。[25]攻击并不会凭空创造访问权限:其后果会受到助手现有数据、凭据、工具和权限的限制,也可能被这些因素放大。
个人隐私控制
- 检查历史记录、保留期限、训练以及已连接应用的设置。
- 删除不再需要的录音,并撤销不再需要的集成。
- 在适用的情况下,优先采用设备端处理——但仍要检查遥测数据和同步设置。
- 在可用时,针对范围明确的情境,优先使用临时聊天或独立账户。
- 在录音或总结他人内容前先征得同意。
工具安全控制
- 在实际可行的最短时间内,仅授予最低限度的权限。
- 将读取权限与写入权限分开。
- 将机密信息置于模型可见的上下文之外。
- 执行操作前,预览收件人、目的地、数据和费用。
- 应谨慎保留日志,因为日志也可能成为敏感数据。
提示词是行为指令,而不是访问控制边界。应通过架构、权限、隔离、确认和恢复机制来实施安全控制。
注意力、依赖与安全
将任务外包并不一定有害。只有当省下的精力从未重新投入到判断、学习、休息或更重要的工作中时,它才会成为问题。
人类一直在使用笔记本、地图、计算器和他人来扩展记忆与行动能力。认知外包可以释放有限的工作记忆容量,减少可避免的精力消耗。当一个人不再知道哪些内容被委派出去、无法察觉糟糕的输出、失去仍然必需的核心技能,或开始在形成自己的任何意图之前就先咨询系统时,代价便出现了。
健康的增强
你能够解释结果,拒绝助手,在需要时脱离助手工作,并将节省下来的时间用于更高价值的思考。
依赖加深
你在尝试之前先提问,接受自己无法检查的输出,觉得无法独自开始,或逐渐不清楚自己究竟相信什么。
工作流程失败
没有任何称职的人真正掌握答案;自动化错误会悄无声息地传递下去;当服务、账户或连接失效时,关键工作就会停止。
免提不等于不占用注意力
语音互动可以减少视觉和手动操作的需求,但复杂对话仍会占用注意力。美国汽车协会基金会在2015年开展的一项研究中,257名参与者使用了十种2015车型的车辆系统;语音任务造成了中到高程度的认知负荷,其中一些任务结束后,可测量的残留影响最长持续27秒。[26] 关键不在于每次互动后的持续时间,而且系统已经发生了变化。实用规则依然适用:出发前设置好导航和媒体,必要的语音操作保持简短,在繁忙交通中避免使用,并在处理复杂任务时靠边停车。
在便利变成强迫之前重新平衡
- 开始时不使用助手。 重要的思考、写作和规划,应从你自己的专注开始。
- 选择要外包的部分。 委派重复性的转换工作;保持目标设定、价值判断和对学习至关重要的步骤处于主动状态。
- 练习恢复能力。 保留离线副本、手动操作流程和核心知识,以应对服务中断及新型故障。
- 留意情感替代。 对话系统可以帮助你演练一场艰难的谈话或整理思绪,但它无法像人一样同意、关心、见证或承担责任。
- 回到人与人之间。 导师、同伴和亲人提供相互的挑战、切身的背景以及共同的责任,这是生成式对话无法替代的。
个人行动手册:尝试、协助、验证、保留
良好的人工智能使用并不是一组巧妙的提示词,而是一种从始至终都让人的目标清晰可见的工作流程。
- 尝试思考、回忆、勾勒或充分解决问题,以揭示你自己的思维模型。
- 协助委派一个边界明确的角色:导师、批评者、编辑、模拟器或转换器。
- 验证核查主张、计算、来源、限制条件以及受影响的人。
- 决策运用人的判断,并对最终行动或发布负责。
- 保留解释、练习、记录并测试工具关闭后留下的内容。
打开对话前先选择一个角色
导师
“先不要解题。先提出一个诊断性问题,然后给出能让我继续下去的最小提示。”
最适合重视学习和独立迁移的场景。批评者
“找出最有力的反对意见、隐藏假设和边界情况。不要改写我的立场。”
最适合保护作者身份并检验推理。研究助手
“区分已核实的事实、合理的解读和未知事项。为每项重要主张提供一手来源。”
最适合梳理证据;每个来源仍需检查。编辑器
“保留我的论点和语气。标记歧义,并提出局部修改建议,同时说明理由。”
最适合在人类形成实质内容之后使用。模拟器
“请在这些已陈述的假设下,以持怀疑态度的读者身份作答。指出这种框架在哪些地方失效。”
适合排练;不能替代真实的利益相关者。转换器
“仅将所提供的材料转换为此结构。标记任何需要新信息的内容。”
最适合范围明确、可检查的更改。强提示词包含停止条件
说明助手可以使用什么、不得凭空捏造什么、应当揭示哪些不确定性,以及何时应先提问而不是采取行动。但请记住:指令可以改善行为,却无法实施安全控制。技术权限仍必须限制具有重大后果的操作。
让工作流程匹配目的
| 目的 | 以人为本的步骤 | 有用的 AI 角色 | 最终测试 |
|---|---|---|---|
| 学习 | 尝试,并说明理解在哪个环节中断。 | 苏格拉底式提问、示例、反馈和适应性练习。 | 不借助 AI 解决并解释一个新案例。 |
| 创作 | 记录你自己的观察、品味和早期备选方案。 | 研究先例,进行压力测试,并拓展执行方案。 | 你能识别人类的构思,并为每一个保留的选择辩护吗? |
| 决策 | 明确价值观、利益相关者、证据和可接受的风险。 | 比较不同情境,揭示假设。 | 独立证据加上负责任的人类审批。 |
| 沟通 | 了解含义、受众和期望达到的效果。 | 组织、翻译、澄清并检验不同解读。 | 站在受众角度阅读;核实每一项事实性主张和引文。 |
| 自动化 | 梳理流程、例外情况和失败成本。 | 在明确授权范围内执行狭窄且可重复的步骤。 | 日志、抽样、停止阈值、回滚和明确指定的负责人。 |
之前
- 我想实现什么?
- 哪一部分必须由我亲自理解?
- 我获准分享哪些数据?
- 危险错误会是什么样?
之后
- 哪些主张是我独立核实的?
- 我改变、拒绝或贡献了什么?
- 不看聊天记录,我能解释这个结果吗?
- 哪些内容应该被记住——哪些应该被删除?
团队、教育与治理
“有人参与其中”并不构成保障,如果这个人没有足够的时间、权限、证据或识别错误的能力。
组织应治理整个社会技术系统:模型、数据、界面、权限、工作人员、激励机制、受影响人员和申诉机制。NIST 的人工智能风险管理框架围绕治理、映射、测量和管理,在整个生命周期内组织这项工作。[27]这属于自愿性指导;法律、合同和专业职责可能提出额外要求。
盘点
了解现有的系统、模型、集成、数据集以及非官方的“影子”使用方式。
分类
将低风险的起草工作与影响权利、准入、生计、健康或安全的决策分开。
验证
在真实任务、语言和用户群体上进行测试;衡量质量、错误分布和人工覆盖情况。
负责
指定负责人,提供申诉渠道,监测变化,并从事件中吸取经验。
治理基线
- 先明确目的,再采购。在选择产品前定义问题和比较基准。
- 经批准的数据边界。明确哪些数据类别可以进入哪些系统,并通过技术手段执行这一规则。
- 具有重大影响的决策须接受有能力的审查。审查人员需要具备领域知识、充足时间、相应权限以及获取基础证据的能力。
- 学习成果经过衡量。学校测试学生在无辅助条件下的迁移能力;雇主保留从新手成长为专家的路径,而不是消除每一次练习机会。
- 专业知识受到保护并得到认可。奖励那些运用隐性知识改进工作流程的人员;不要利用自动化抹去贡献归属或压制异议。
- 无障碍性经过验证。保留替代路径,并测试完整工作流程,而不只是核对功能清单。
- 事件有应对路径。停止相关操作、遏制影响、在需要时通知相关方、更正受影响的记录并更新控制措施。
- 可以设置退出期限。保留导出、删除和迁移选项,避免供应商或模型变更掌控机构的记忆。
不要让自动化消除学徒晋阶路径
如果人工智能执行所有入门级研究、起草和诊断工作,新手可能会失去形成专家判断所需的反复练习。重新设计岗位,使学习者仍能进行预测、练习、获得反馈并检查失败原因。资深专家应减少机械重复所花的时间,但应投入更多时间传授判断力、制定标准、处理前沿案例并创造新方法。
权利、数据保护与透明度
在欧盟,可识别的提示词、录音和转录文本可能属于《通用数据保护条例》(GDPR)下的个人数据。当语音录音通过特定技术手段处理以实现唯一识别时,会成为特殊类别的生物特征数据;并非所有录音都会自动成为生物特征数据。合法性基础、透明度、目的限制、数据最小化、安全性、保留期限和数据主体权利仍需结合具体情境进行分析。[28]
《欧盟人工智能法案》根据行为主体、预期用途和风险类别规定相应义务。通用聊天机器人不会自动成为高风险系统。截至2026年9月,大多数条款已经适用,包括相关的透明度义务;特定的高风险要求则按照修订后的时间表生效。遵守《人工智能法案》并不能取代数据保护、消费者、就业、安全或特定行业法律。[29] 组织应当针对实际部署,获取最新且具体到司法管辖区的建议。
证据胜过采用表演
购买的许可证、发送的提示词和生成的文档都是活动指标。严肃的部署应报告任务质量、包括纠错在内的耗时、学习情况、不平等错误、事件、员工和用户体验、隐私成本,以及工具改变后的结果。同时也应允许得出这样的结论:某些任务不应使用人工智能。
接下来会发生什么
重要的转变,是从回答提示的系统,转向能够感知上下文、记住偏好、协调工具并追求多步骤目标的系统。
多模态辅助
文本、语音、图像、视频、屏幕和传感器输入将越来越多地共享一个对话式界面。
使用工具的智能体
助手将规划并执行更长的工作流程,使权限、可观测性、确认和恢复成为核心设计问题。
本地和混合式人工智能
更多工作可以在设备上完成,以降低延迟、增强韧性或保护隐私;而要求较高的任务仍可能使用远程模型和服务。
深度个性化
持久化的导师和协作者可能会在多年时间里适应一个人——但记忆也可能放大画像分析、过时的假设和依赖。
智能体标准和评估仍在发展中。2026年2月,NIST启动了人工智能智能体标准倡议,重点关注互操作性、安全性、身份和采用;这是一项正在进行的倡议,并非已经完成的安全标准。[30] 基准测试也需要从孤立的答案,转向关注长期可靠性、从中断中恢复、权限处理、隐私以及人类监督的质量。
值得继续思考的问题
这个系统是在扩展人们能够理解和完成的事情,还是只是在制造具备能力的假象?
反复使用会强化记忆、推理和学习迁移,还是会取消构建这些能力所需的练习?
辅助是在保护独立的首次思考的同时拓展探索空间,还是让所有人都趋向相同的模式?
谁控制模型、记忆、数据和权限——谁又能够检查、拒绝、更正或退出?
对于系统使之发挥作用的知识,原创者、专家、劳动者和社区是否都得到了公平的认可?
节省下来的时间会回归学习、创作、关系与休息,还是只会提高对每个人的预期要求?
最好的未来并不是人类思考变得没有必要的未来,而是更多人能够深入学习,原创思想能够走得更远,而强大的工具始终对其所影响的人生负责。
配得上人类智慧的增强常见问题
先给出简短答案;相关的文章将提供证据和适用条件。
人工智能助手正在让人变得不那么聪明吗?
没有充分依据支持普遍性的结论。影响取决于使用方式。被动替代可能让人失去练习机会,并掩盖理解薄弱的问题;辅导、反馈、易于理解的解释和有意识的提取练习则可以支持学习。应通过无辅助回忆、解释和迁移来判断持久能力,而不是看人工智能辅助产物的外表有多精 polished。
人工智能助手能帮助人提升智力或智商吗?
它可以帮助人们构建知识并练习特定的认知技能,尤其是在它会提问、调整示例并提供纠正性反馈时。但目前还没有强有力的证据表明,普通的助手使用能可靠地提高一般智力或带来持久的智商提升。这个重要的可能性应通过有效的评估、长期跟踪以及在真正新颖的任务中的迁移来检验。
专家应该因为人工智能可能使人技能退化而避开它吗?
不。专家可能从自动化、搜索、模拟和快速起草中获益良多。他们应决定哪些技能可以安全地外包,同时保留处理边缘情况和检查质量的能力,并为原创工作留出时间。当系统超出其可靠能力边界时,组织应尊重专家拒绝使用它的决定。
独自与他人,还是与人工智能一起头脑风暴更好?
采用循序渐进的方式,而不是遵循单一规则。在独立观察和原创性至关重要时,先独自开始。记录你的推理过程。然后让人工智能和他人参与进来,寻找先例、质疑假设、结合专业知识并完善想法。当你需要整合所听到的内容时,再回到独处状态。
语音助手会上传附近说的所有话吗?
不一定。许多设备会使用滚动缓冲区在本地检测唤醒词。不过,误触发仍可能传输无意中录下的语音,而数据保留情况也因服务和设置而异。查看产品当前的控制选项,删除不需要的历史记录,并在录音或总结他人谈话前征得同意。
我能相信人工智能提供的链接和引文吗?
把它们当作线索,而不是证据。打开每个来源,确认作者、标题、日期和出版物,然后检查它是否支持这一确切论点。独立搜索被遗漏或相反的证据。虚构的参考文献可能看起来完全可信。
人工智能生成的作品算抄袭吗?
不同学校、工作场所、出版机构和司法管辖区的规定各不相同。即使措辞有所不同,未披露的替代行为也可能违反署名或考核规定。需要披露时应披露使用情况,引用底层来源,保留你的贡献,绝不要将他人的想法或劳动呈现为自己的成果。版权、抄袭和学术诚信是相关但并不完全相同的问题。
我什么时候不应使用通用人工智能助手?
当你无法合法或合乎道德地分享必要数据、没有人能够验证结果、失败将不可接受,或任务目的是评估你在没有辅助时的能力时,应避免使用它。对于高风险的医疗、法律、金融、安全或影响权利的决策,应使用当前权威来源,并结合具备适当资质的人类判断。
证据与来源
优先采用主要研究、同行评审论文和官方框架。结果描述的是经过测试的人员、任务、系统和日期,而不是所有可能的人工智能助手。
- Noy, S. 和 Zhang, W.(2023)。生成式人工智能对生产力影响的实验证据。《科学》。随机实验
- Brynjolfsson, E.、Li, D. 和 Raymond, L.(2025)。生成式人工智能在工作中的应用。《经济学季刊》。实地研究
- Dell’Acqua, F. 等(2026)。探索崎岖不平的技术前沿。《组织科学》。随机实验
- Becker, J. 等(2025)。衡量 2025 年初人工智能对经验丰富的开源开发者生产力的影响。METR。随机实验
- METR(2026)。我们正在改变开发者生产力实验的设计。研究更新
- Vaccaro, M.、Almaatouq, A. 和 Malone, T.(2024)。人类与人工智能的组合何时有用:系统综述与荟萃分析。《自然·人类行为》。预注册荟萃分析
- Bastani,H. 等(2025)。缺乏防护机制的生成式人工智能可能损害学习:来自高中数学的证据。PNAS。实地实验
- Kestin,G. 等(2025)。人工智能辅导的效果优于课堂主动学习:在真实教育环境中引入基于新颖研究设计的随机对照试验。Scientific Reports。随机交叉试验
- Kumar,H. 等(2025)。使用大语言模型开展数学教育:危害还是希望?。AIED 2025。预注册实验
- Lee,H.-P. 等(2025)。生成式人工智能对批判性思维的影响。CHI 2025。调查研究
- Doshi,A. R. 和 Hauser,O. P.(2024)。生成式人工智能提升个体创造力,但降低新颖内容的集体多样性。Science Advances。对照实验
- Qin,P. 等(2025)。时机很重要:在不同时间使用大语言模型如何影响作者在人工智能辅助构思中的感知和构思成果。CHI 2025。随机实验
- 美国版权局(2023)。版权登记指南:包含人工智能生成内容的作品。官方指南
- W3C (2023). 《网页内容无障碍指南》(WCAG)2.2. 标准
- Koenecke,A. 等(2020)。自动语音识别中的种族差异。PNAS。比较研究
- 美国盲人基金会(2026)。人工智能与残障:研究结果——创新与无障碍。残障人士主导的调查
- Valencia,S. 等(2023)。我打字越少,效果越好:人工智能语言模型如何促进或阻碍 AAC 用户的交流。CHI 2023。用户研究
- NIST(2024)。人工智能风险管理框架:生成式人工智能概况。NIST AI 600-1。官方框架
- Lin,S.、Hilton,J. 和 Evans,O.(2022)。TruthfulQA:衡量模型如何模仿人类谬误。ACL 2022。基准研究
- Sharma,M. 等(2024)。迈向理解语言模型中的谄媚现象。ICLR 2024。评估研究
- Parrish,A. 等(2022)。BBQ:手工构建的问答偏见基准。ACL 2022 研究成果。基准研究
- Buçinca,Z.、Malaya,M. B. 和 Gajos,K. Z.(2021)。信任还是思考:认知强制功能可减少人工智能辅助决策中对人工智能的过度依赖。受控实验
- 欧洲数据保护委员会(2021)。关于虚拟语音助手的第02/2021号指南。官方指南
- Dubois,D. J. 等(2020)。当所有扬声器都在倾听:物联网智能扬声器误激活现象的特征分析。隐私增强技术论文集。受控研究
- Greshake,K.等(2023)。《这不是你报名参加的项目:通过间接提示注入攻陷现实世界中的LLM集成应用》。安全研究
- 美国汽车安全基金会(2015)。《汽车中的认知分心测量III》。实验研究
- NIST(2023)。《人工智能风险管理框架1.0》。官方框架
- 欧盟(2016)。《通用数据保护条例》(欧盟)2016/679。法律
- 欧盟委员会(2026年更新)。《人工智能法案》监管框架及实施时间表。官方概览
- NIST(2026)。AI智能体标准倡议。标准倡议