放进提示词,不等于被用上
你把一份长报告交给AI,问其中的发现是否适用于自己的项目。答案很有说服力,却漏掉了原文中的一句话:研究针对的是另一类人群。这句话就在你提供的材料里,但放进去并没有保证模型会使用它。
模型回答时能使用的材料称为上下文。上下文窗口限制一次能接收多少内容,通常用词元(token)计量,也就是文本或其他输入的小单位。Lost in the Middle发现,在受测模型中,相关信息位于长输入中部时,往往更难被可靠利用。[1] RULER加入关联、汇总信息等较难任务,也发现输入变长时表现下降。[2]
这些研究提示我们,要测试自己实际使用的模型和任务。除了检查文档能否全部装下,还要看答案是否注意到可能改变结论的细节。先让这些细节容易找到,同时保留足够的前后文,避免误解。
要检查答案是否用了关键细节,不只检查文档能否装下。
把项目档案与当前任务分开
项目可能包含访谈逐字稿、报告、旧草稿、搜索结果和几周的对话。比较两项发现时,很少需要一次带上全部材料。全部继续传递,也会带上已放弃的计划和可能不再正确的旧摘要。
可以把当前上下文想成桌上的资料,其余项目材料放在附近的档案中。桌上包括问题、仍然有效的规则、眼下需要的证据,以及进展说明。MemGPT等系统采用类似区分,把工作上下文与需要时可取回的存储信息分开。[6]
不放进当前提示词,不意味着删除。用稳定的文件名或标识保存材料,并确认可以取回。权限限制和安全规则要始终有效。其余材料则要问:不带上它,会不会改变这次答案,或让下一步无法核查?
分清指令、进度和来源材料
标明所提供信息的类型。指令说明要做什么,进度说明已检查什么、还有什么未解决,来源段落提供证据,示例展示期望的回答形式。分开后,就更容易发现旧的AI摘要是否被当成了原始来源。
按用途更新各部分。持续有效的规则要保留,新指令应检查是否与旧指令冲突。工作推进后更新进度,为眼前的问题取回证据。示例不必多,但要呈现重要差别;可能用到工具时,再加载相应说明。
不要把同一说法复制到提示词各处。例如截止日期改变后,旧对话、摘要和任务笔记可能各写一个日期。保留一份清楚的当前记录,附来源和更新时间,并标明旧日期已被替代。确定谁维护这份记录,避免更正丢失。
选择能回答当前问题的段落
搜索工具可能因为用词相似而找回一段文字,但它涉及的国家、年份、人群或产品版本仍可能不对。使用前,先写明下一步要做什么:比较、引用、计算,还是核查一项说法。
比较时,找两个案例的同一指标,并核对时期。引用时,保留前后句和限定条件。检查政策变化时,把生效日期、例外和相关版本放在一起。解释访谈时,既要有符合拟定主题的叙述,也要有挑战它的案例。
可以在进度说明中保留链接或文件引用,下一项任务需要时再打开完整材料。Anthropic把这种做法称为即时检索。[4] 它减少每一步携带的内容,但前提是能再次找到正确来源。用简短引用代替文档前,先测试返回原文的路径。
为正在回答的问题选择证据。
去掉干扰,保留不合预期的证据
信息更多,有时反而答得更差。Shi等人在算术应用题实验中发现,无关细节会干扰语言模型。[3] 研究任务里还会遇到更隐蔽的问题:文档看似相关,却讲的是另一个案例。去年的产品报告未必能解释当前版本。
检查每项材料为何需要:能回答问题吗?能支持你所作的这类判断吗?人群、日期和定义是否适合?宣传页面可以帮你找到技术报告,却不能因此证明产品有效。旧报告也可以用于比较,只要标明用途。
不能仅因来源反对正在形成的答案就删掉它;这种分歧可能正是任务所需。移除的是已确认无关的材料,并检查重要例外是否保留下来。提醒模型忽略干扰,在Shi等人的部分测试中有帮助,[3] 但一条提醒不能证明模型能正确处理所有混淆信息。
用摘要了解进展,需要细节时回原文
更短的输入可以降低成本,有时也改善结果。例如LongLLMLingua报告了提示词压缩在受测长上下文任务中的收益。[5] 这不意味着摘要越短越好。摘要通常为特定目的保留一部分细节,省略另一部分。
措辞或数字重要时,保留原文段落。决定和待办事项适合用带日期的清单。叙事摘要可以帮助了解项目,来源索引则帮助定位细节。无论采用哪种形式,都附上能回到原始材料的引用。
为跟进行动写的会议摘要,可能省略犹豫、分歧或作出决定前的讨论。后来分析参与者态度时,不能只依靠它。标明摘要的用途和来源版本;新问题需要摘要未打算保留的细节时,回到原文。
为一个目的写的摘要,可能漏掉下一个问题需要的内容。
工作变化后,更新上下文
把相关证据放在一起,限定条件紧靠它限制的说法。让当前任务容易找到,并区分来源文字和自己的解释。Lost in the Middle中,输入顺序会影响表现,[1] 因此可以在重要测试案例上换一种排列,不要假设同一排列适合所有任务。
搜索结束时,保存有用来源、未解决线索和下一步问题。计算完成后,保存结果及核查方法,只把继续工作所需的日志带到下一步。研究问题改变时,重新检查所选材料。在过时计划下面追加新指令,可能让两者同时影响答案。
LongMemEval测试的不只是回忆旧句子,还包括处理更新事实、时间推理,以及信息缺失时不作答。[7] 实务中可以更正一个事实,再看下次回答是否采用更正。给变化的记录加日期,标明替代了什么,并明确更新责任。
保留足以执行和核查下一项任务的信息,并确保能重新打开提示词之外的材料。
测试模型是否用到了关键内容
选几项真实任务,并明确正确答案必须注意什么。例如保留研究的关键限制、区分两个不同日期的政策版本,或根据保存的笔记继续工作。也加入必要记录缺失的案例,此时正确回应应说明哪些内容无法证实。
每次只改输入的一部分:移除摘要、调整文档顺序,或加入貌似合理却不适用的来源。可控工作记忆研究考察了相关问题:模型能否使用提供的相关事实,同时抵抗无关上下文。[8] 这里提出的实务测试,是帮助你在自己的流程中检查这些问题,而不是假设论文结果能原样适用。
把答案与原始证据对照。简要记录使用了哪些上下文、依赖了哪些摘要、完整来源在哪里。检查表明可以精简时,减少不必要材料;遗漏改变答案时,保留或取回更多内容。资料的取舍,应服务于正确且可核查的结果。

