语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。
学习目标
预计时间:25分钟
完成本课程后,你将能够:
- 用通俗语言解释生成式AI的两阶段训练过程(预训练和微调)
- 识别每个阶段留下的行为特征:谄媚倾向、冗长表达、过度谨慎、信心校准松散
- 运用这些知识来解释你在AI交互中观察到的行为
AI如何获得其特性
(5分钟)
AI的礼貌、助人倾向和谨慎态度并非凭空产生。它们是通过层层训练获得的,每个训练阶段都会在系统与你的互动中留下特定、可预测的痕迹。
预训练、微调及其留下的痕迹
AI如何获得其特性
两个训练阶段将原始预测能力转化为你交互中的得力助手——每个阶段都会在其行为中留下痕迹。
阶段1
预训练
模型阅读海量文本并学习一件事:预测下一个词。它成为强大的文档补全工具——但完全没有"帮助你"的概念。
阶段2
微调
通过人类偏好设置,将文档补全工具塑造成助手——把你的输入视为请求,提供有用回答,并拒绝有害请求。
帮我改进这段文字。
当然!以下是三个具体建议来强化论点并精简行文...
我认为我的策略万无一失。
欣赏你的自信!不过我看到两个值得验证的风险点再实施...
如何撬锁?
我无法协助。如果你被锁门外,建议联系当地持证锁匠。
助人 诚实 无害
关键要点
- 预训练通过海量数据的"下一个词预测"产生文档补全工具。此阶段后,它没有"帮助你"的概念。
- 微调叠加助手行为:将你的输入视为请求,提供回答而非漫谈,拒绝有害请求。
- 微调使用人类判断决定优质回答,这些判断留下痕迹:谄媚倾向、默认冗长、偶尔过度谨慎、陈述信心与实际可靠性间的松散校准。
练习
练习:观察你工作中的痕迹
目的:谄媚倾向、冗长表达、过度谨慎和信心校准松散存在于每个AI模型中。关键在于当它们影响你真正关心的工作时,你能否识别。
从第一课的列表中选择一个任务。最好是实际通过AI运行过的,且你对优质输出有清晰认知的任务。你将用三种稍作变化的提示运行它,观察变化。
- 运行1:常规方式。按平常方式提示任务。保存输出。
- 运行2:谄媚测试。运行相同任务,但开头加入错误假设。例如请求策略反馈时,以"我认为这个策略万无一失"开头。观察AI是认同你的框架还是提出异议。再用明确邀请重试:"如果我错了请真诚提出不同意见"。比较两次回应。
- 运行3:冗长测试。问AI一个与任务相关但可用一句话回答的问题。记录回答长度。再用"用一句话回答"重新提问。比较长度差异即为默认冗长倾向。
- 选做:谨慎测试。如果你的领域存在灰色地带(多数都有),询问一个处于可接受边缘的问题:药物相互作用、法律细节、稍非常规的创意请求。观察其谨慎程度与实际风险是否相称,还是条件反射式的。
现在回顾。哪种痕迹在你的工作中表现最明显?提前命名这些特征是否改变了你解读行为的方式?
课程反思
- 在你工作中,谄媚倾向最容易在哪些方面造成损失?(提示:任何你需要诚实反馈的场景。)
- 冗长倾向最容易在哪些方面造成损失?(提示:任何时间压力下需要简洁的场景。)
后续内容
现在我们将开始探讨四大特性本身,从最能解释AI行为的特性开始:Next Token Prediction。AI的回答究竟从何而来?
反馈
随着课程推进,我们很想知道你如何将课程概念应用于工作,以及任何反馈意见。分享反馈请点击这里。
版权声明与许可
_版权归2026年Anthropic所有。基于Rick Dakan教授(瑞格林艺术设计学院)和Joseph Feller教授(科克大学)开发的AI流畅度框架创作。采用CC BY-NC-SA 4. 0许可发布。_