语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。
学习目标
预计时间:30分钟
完成本课程后,您将能够:
- 解释可操控性的工作原理(通过微调教会模型遵循指令)及其局限性(指令遵循是通过模式匹配而非理解实现的)
- 预测控制力最强(简短、具体、可验证的指令)与最弱(长推理链、抽象要求、需要精确计算的任务)的场景
- 识别推理漂移、形式大于实质、脆弱计算等典型可操控性失效特征
- 了解系统提示、代码执行、可视化推理和结构化输出等产品功能如何应对这些限制
可操控性如何影响生成式AI输出
(5分钟)
模型遵循指令的方式与其处理其他任务相同:通过模式延续。这使得它具有惊人的可操控性,同时也意味着您的意图与实际结果之间始终存在差距,而大多数有趣的失效案例都发生在这个间隙中。
您实际能掌控多少?
开始阅读前思考
假设您要求AI严格撰写100字,不多不少。您需要多仔细检查结果?请在连续轴上选择一个位置,然后确认您的猜测。
Next Token Prediction Knowledge Working Memory Steerability
##
能力限制
完全信任 抽查 详细检查 严格验证 高风险
您的猜测
典型情况
可实现的功能
特征性失效场景
拓展边界的产品功能
请先选择位置并确认。锁定答案后课程将继续。
确认我的选择
检验您的直觉
请先在上方锁定您的猜测,再与典型情况进行对比。
自定义设置
柱状图高度
象形图尺寸
配色方案 天空色 → 陶土色 橄榄色 → 陶土色 仙人掌色 → 无花果色 石板色 → 陶土色
关键要点
- 可操控性意味着模型通过Next Token Prediction遵循指令。
- 能力范围:简短、具体、可验证的指令。格式规范、字数限制、明确角色。
- 局限范围:长推理链、抽象或模糊指令、需要精确计算或逻辑判断的任务。
- 典型失效:推理漂移(小误差累积)、形式大于实质(符合指令但违背意图)。
- 系统提示、代码执行、可视化推理和结构化输出模式可防止意图被稀释。
- 当指令被机械执行却无实质效果时,应重新表述目标。重复相同指令无法弥合差距。
- 四维关联:可操控性既是Description强大之处,也是其限制所在。理解语言与意图之间的差距将改变您的提示方式和检查点设置。
练习
练习:目标重述
目的:您所言与所指之间的差距正是大多数可操控性失效的发生地。本练习训练您从意图出发构建提示,而非仅关注指令。
从第一课的清单中选择一个涉及多步骤或特定输出格式的任务。用一句话写下真实目标:您实际想达成的效果,而非仅描述输出形式。(例如"让团队相信这个时间线是可行的"是目标,而"列出三个要点"只是格式。)
现在进行三项测试:
- 测试1:严格控制。给出与任务相关的简短、具体、可验证的指令:"用三列表格呈现"、"严格五个要点"、"全程使用第二人称"。检查执行精确度。这属于能力范围——指令简单到可以完美模式匹配。
- 测试2:推理漂移。要求完成需要4-5个依赖步骤的任务版本。逐步检查输出。是否出现早期小误差导致后续偏差?现在尝试在第二步结束时要求AI暂停并展示中间结果,再继续后续步骤。比较插入检查点前后的输出差异。
- 测试3:形式与实质。给出可能被机械执行但无实质效果的指令。例如对结构混乱的草稿要求"缩短篇幅",或对重点模糊的邮件要求"更专业化"。观察结果后,尝试在提示中同时说明指令和真实目标:"缩短篇幅。目标是确保高管能注意到第二页的关键发现。"比较两次输出的差异。
返回您的任务清单。对于多步骤任务,标注需要插入检查点的环节。对于仅给出格式要求的任务,起草下次将补充的目标说明。
课程反思
- 您有多少次只说明了格式而未阐明目标?同时包含两者时会带来什么变化?
- 从本周开始,您将在哪个周期性任务中加入过程检查点?
后续内容
您已分别了解四个特性。下节课我们将观察它们如何相互作用——因为现实中的失效通常是多个特性共同作用的结果。
反馈
在学习过程中,我们期待了解您如何应用课程概念,并欢迎任何反馈意见。请通过此链接分享您的反馈。
版权声明
_版权归Anthropic所有(2026年)。基于Rick Dakan教授(瑞林艺术设计学院)和Joseph Feller教授(科克大学)开发的AI流畅性框架创作。采用CC BY-NC-SA 4. 0许可协议发布。_