来源:AWS Machine Learning Blog 2026-08-21 16:59

通过查询感知压缩降低 Amazon Bedrock 上的 RAG 成本

查询 成本 检索 感知 压缩
输入代币通常是大规模运行检索增强生成 (RAG) 成本的重要组成部分。本文介绍了 Amazon Bedrock 上的查询感知上下文压缩模式:检索后,较小的模型会在主模型回答之前根据查询过滤检索到的块,从而减少输入令牌和成本,同时保持答案质量。

相关文章推荐

返回首页