语音摘要 — 点击播放以跟读:正在朗读的行会保持在顶部附近。
当更多上下文反而导致表现下降时
使用AI时的本能反应是提供所有信息。粘贴整篇文档。包含每条消息。添加能找到的所有背景资料。更多信息意味着更好的回答,对吗?
并非总是如此。这种现象就像考前突击的人凭直觉知道的那样:人脑同时处理的信息量存在上限。而中间部分的内容往往最先被遗忘。
在讨论这对AI模型的影响前,先看看它如何影响你自身。
记忆测试
记忆测试
你将看到15个单词,每次显示一个。每个单词停留约1. 5秒。尝试记住尽可能多的单词。
显示单词
输入你记住的单词,用逗号或空格分隔。
检查记忆
你回忆出0/15个
幻觉词
序列位置——你的回忆模式
最可能 最不可能 最可能
你记住的单词很可能集中在列表的开头和结尾。中间部分被遗忘。这就是首因-近因效应——大语言模型也表现出同样的倾向。
上下文窗口开头和结尾的指令会被遵循。中间部分则被淹没。这就是为什么更多上下文≠更好结果——也是为什么《迷失在中间》(Liu等,2023)研究发现当关键事实位于长文本中部时,准确率下降超过30%。
重放单词(会破坏测试效果)
U型曲线
你刚刚经历的现象有个名称:序列位置效应。心理学家研究它已超过一个世纪。列表开头的内容受益于首因效应(它们被重复记忆更多次),结尾的内容受益于近因效应(它们仍保持新鲜)。中间部分两者皆无。
列表中的位置 → 回忆概率 → 首因效应 迷失在中间 近因效应
最有趣的是:大语言模型展现出相同模式。2023年斯坦福研究人员测试了当关键事实出现在长上下文窗口不同位置时的效果。当事实位于最开头或最末尾时准确率最高——当被埋在中间时则下降超过30%。
这不是偶然现象。而是结构使然。Transformer的注意力机制天然会更侧重上下文窗口的边缘部分。
对提示工程的启示
如果你将20页文档粘贴进提示词,然后询问第11页的某个内容,模型遗漏它的概率会高于询问第1页或第20页的内容。这对你组织上下文的方式有实际影响。
❌ 危险模式
系统提示
聊天消息1
聊天消息2
.
⚠ 关键指令埋没在此处
.
聊天消息18
最新用户消息
✓ 更安全模式
系统提示
★ 关键指令(前置)
聊天消息1
聊天消息2
.
聊天消息18
最新用户消息
★ 关键指令(重复)
实用建议很简单:把最重要的指令放在上下文开头和结尾。如果某个约束必须被遵守,在系统提示开头声明它,并在接近结尾处重申。不要指望模型会平等对待中间的所有内容。
这只是起点,不是终点。随着熟练度提升,你会发现越来越复杂的方法来构建上下文,使模型可靠理解重点——利用信息在窗口中的位置,决定包含与删减的内容,以及如何防止关键指令滑入盲区。目标始终如一:让Claude清楚知道你真正需要什么。
宏观视角
上下文衰减效应解释了为什么"只管增加更多上下文"并非总是解决方案。你添加的每个上下文片段都会将其他内容推向中间——那个注意力的盲区。这就是上下文工程的核心矛盾:不仅要考虑包含什么,还要考虑放在哪里以及舍弃什么。
关键要点
更多上下文≠更好结果。模型的注意力是有限的。严格筛选内容,策略性布局,并重复重要部分。
你自己的记忆测试已经说明了这点。中间的单词消失了。同样的情况发生在每个长对话、每个粘贴的文档、每个塞满的上下文窗口中。解决方法不是增加更多——而是更聪明地组织。