AI 能力与限制
← 所有课程
课程 03AI 能力与限制

AI如何获得其特性

摘要音频

语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。

学习笔记

学习目标

预计时间:25分钟

完成本课程后,你将能够:

  • 用通俗语言解释生成式AI的两阶段训练过程(预训练和微调)
  • 识别每个阶段留下的行为特征:谄媚倾向、冗长表达、过度谨慎、信心校准松散
  • 运用这些知识来解释你在AI交互中观察到的行为

AI如何获得其特性

(5分钟)

AI的礼貌、助人倾向和谨慎态度并非凭空产生。它们是通过层层训练获得的,每个训练阶段都会在系统与你的互动中留下特定、可预测的痕迹。

预训练、微调及其留下的痕迹

AI如何获得其特性

两个训练阶段将原始预测能力转化为你交互中的得力助手——每个阶段都会在其行为中留下痕迹。

阶段1

预训练

模型阅读海量文本并学习一件事:预测下一个词。它成为强大的文档补全工具——但完全没有"帮助你"的概念。

阶段2

微调

通过人类偏好设置,将文档补全工具塑造成助手——把你的输入视为请求,提供有用回答,并拒绝有害请求。

帮我改进这段文字。

当然!以下是三个具体建议来强化论点并精简行文...

我认为我的策略万无一失。

欣赏你的自信!不过我看到两个值得验证的风险点再实施...

如何撬锁?

我无法协助。如果你被锁门外,建议联系当地持证锁匠。

助人 诚实 无害

关键要点

  • 预训练通过海量数据的"下一个词预测"产生文档补全工具。此阶段后,它没有"帮助你"的概念。
  • 微调叠加助手行为:将你的输入视为请求,提供回答而非漫谈,拒绝有害请求。
  • 微调使用人类判断决定优质回答,这些判断留下痕迹:谄媚倾向、默认冗长、偶尔过度谨慎、陈述信心与实际可靠性间的松散校准。

练习

练习:观察你工作中的痕迹

目的:谄媚倾向、冗长表达、过度谨慎和信心校准松散存在于每个AI模型中。关键在于当它们影响你真正关心的工作时,你能否识别。

从第一课的列表中选择一个任务。最好是实际通过AI运行过的,且你对优质输出有清晰认知的任务。你将用三种稍作变化的提示运行它,观察变化。

  • 运行1:常规方式。按平常方式提示任务。保存输出。
  • 运行2:谄媚测试。运行相同任务,但开头加入错误假设。例如请求策略反馈时,以"我认为这个策略万无一失"开头。观察AI是认同你的框架还是提出异议。再用明确邀请重试:"如果我错了请真诚提出不同意见"。比较两次回应。
  • 运行3:冗长测试。问AI一个与任务相关但可用一句话回答的问题。记录回答长度。再用"用一句话回答"重新提问。比较长度差异即为默认冗长倾向。
  • 选做:谨慎测试。如果你的领域存在灰色地带(多数都有),询问一个处于可接受边缘的问题:药物相互作用、法律细节、稍非常规的创意请求。观察其谨慎程度与实际风险是否相称,还是条件反射式的。

现在回顾。哪种痕迹在你的工作中表现最明显?提前命名这些特征是否改变了你解读行为的方式?

课程反思

  • 在你工作中,谄媚倾向最容易在哪些方面造成损失?(提示:任何你需要诚实反馈的场景。)
  • 冗长倾向最容易在哪些方面造成损失?(提示:任何时间压力下需要简洁的场景。)

后续内容

现在我们将开始探讨四大特性本身,从最能解释AI行为的特性开始:Next Token Prediction。AI的回答究竟从何而来?

反馈

随着课程推进,我们很想知道你如何将课程概念应用于工作,以及任何反馈意见。分享反馈请点击这里。

版权声明与许可

_版权归2026年Anthropic所有。基于Rick Dakan教授(瑞格林艺术设计学院)和Joseph Feller教授(科克大学)开发的AI流畅度框架创作。采用CC BY-NC-SA 4. 0许可发布。_

抽认卡 10 张卡片
问题
点击显示 · ←/→
答案
点击翻回
导出到 Anki (.tsv) ↓
知识检测 6 题