AI News HubLIVE
站内改写2 分钟阅读

提示压缩技术:如何在不丢失重要上下文的情况下降低 LLM 成本

提示压缩技术通过移除冗余、无关信息,缩短提示长度,同时保留关键语义和指令,从而降低大语言模型的 token 消耗、成本和响应时间。本文介绍了多种压缩方法,包括手动重写、结构压缩、句子级过滤、短语级压缩、token 级过滤、抽取式压缩、抽象式压缩、查询感知压缩、粗到细压缩和软提示压缩,并讨论了它们在 RAG 系统、AI 代理等场景中的应用。

来源Analytics Vidhya作者: Janvi Kumari

大型语言模型(LLM)经常接收到超出其所需的信息量。一个提示可能包含冗长的指令、检索到的文档、对话历史、示例以及工具描述。这不仅增加了 token 使用量、成本和响应时间,还可能使模型难以识别重要细节。提示压缩技术旨在缩短提示,同时保留核心含义、指令和证据,帮助模型聚焦有用信息,避免无关上下文的干扰。这在 RAG 系统、AI 代理、客户支持、文档分析和长对话中尤为有价值。

提示压缩并非追求最短的提示,而是在不降低回答质量的前提下减少 token 数量。一个良好的压缩提示应仍能使模型理解任务、遵循指令并生成准确响应。

主要的压缩技术包括:

  1. 手动提示重写:这是最简单的技术,通过删除重复指令、填充词和不必要的解释来压缩。例如,“你应该仔细阅读以下信息并仅根据可用上下文提供答案”可压缩为“仅使用提供的上下文回答”。该方法适用于系统提示、可重用模板等,但需要人工操作,扩展性有限。
  2. 结构压缩:将长文本改为紧凑格式,如使用项目符号、表格、键值对、JSON 或 YAML。例如,将客户信息从叙述性描述改为结构化字段。该方法适用于客户记录、产品详情等,但字段名称需保持清晰。
  3. 句子级过滤:删除与任务无关的完整句子,仅保留有助于回答问题的句子。常用于 RAG 系统、报告等,但可能移除支撑上下文。
  4. 短语级压缩:删除句子中的多余词语,同时保留主要含义。例如,“由于申请是在截止日期后提交的,因此无法处理”可压缩为“申请在截止日期后提交,无法处理”。需注意避免删除重要细节。
  5. Token 级过滤:移除价值较低的单个词或 token,保留对理解任务至关重要的术语。例如,“客户拥有金牌会员资格,并在上个月联系了支持团队五次”可压缩为“客户金牌会员,上月五次支持联系”。该方法可能降低可读性,需保护否定词等关键词汇。
  6. 抽取式压缩:直接从原始提示中选取最重要的部分,而不重写。适用于 RAG 系统、政策文档等,能减少引入错误的风险,但可能遗漏分散的信息。
  7. 抽象式压缩:将长内容改写成较短的摘要,而非直接复制。适用于对话历史、报告等,但摘要模型可能丢失细节或添加无关内容。
  8. 查询感知压缩:根据用户的当前问题保留相关信息,移除与具体任务无关的内容。在 RAG 系统和文档问答中效果显著,但依赖于对查询的准确理解。
  9. 粗到细压缩:分阶段压缩,先移除大的无关段落,再在句子、短语或 token 级别进一步压缩。该方法控制更精细,但增加了处理步骤。
  10. 软提示压缩:将长文本转换为少量学习向量,无需可读文字。可大幅减小上下文,但难以调试,且可能要求模型训练或访问内部表示。

在 RAG 系统中,提示压缩尤为有用:检索到的文档可能包含重复、过时或无关信息,压缩可移除无关文档、选择关键段落并保留支持回答的句子,从而降低成本并保持响应聚焦。在 AI 代理中,代理会随时间累积长提示,压缩可总结旧工具输出、存储简短状态更新并删除重复指令,防止上下文无限增长。但安全规则、重要决策和未解决的错误不应被移除。

评估提示压缩不应仅看 token 减少量,还需关注任务准确率、信息保留率、幻觉率等指标。例如,token 减少率 = 1 - (压缩后 token / 原始 token),压缩因子 = 原始 token / 压缩后 token。压缩后的提示应保留名称、数字、日期、指令、条件和否定词,并在相同任务和模型上进行测试。

总之,提示压缩技术为高效利用 LLM 提供了实用路径,开发者可根据具体场景选择合适的方法,在降低成本的同时保证输出质量。