AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-21 04:00
翻译成中文
从检索上下文到运行时控制:基于边缘的 RAG 的自适应压缩
压缩
边缘
检索
上下文
RAG
arXiv:2608.19535v1 公告类型:新 摘要:检索增强生成(RAG)通过在外部段落中生成基础来改善语言模型响应,这会带来开销:检索到的上下文延长了提示,增加了预填充工作、KV 缓存占用空间、内存流量、延迟和能量。上下文压缩通过在生成之前修剪检索到的文本提供了一种自然的补救措施。然而,最先进的上下文压缩方法通常与固定压缩预算一起使用,或者与离线选择的速率一起使用,然后在推理时应用。该静态视图忽略了工作负载变化和边缘设备的实时状态。在边缘 SoC 上,压缩并不是免费的:压缩器本身在同一 SoC 上运行,并消耗延迟和能量,这可能会抵消任何发电节省。 本文基于实验证据,提出了边缘 RAG 中遥测信息自适应压缩的愿景。我们使用 Llama 和 Qwen 生成器、Natural Questions 和 HotpotQA 数据集以及 LLMLingua-2 压缩来描述 NVIDIA Jetson AGX Thor 上的压缩权衡。我们的测量显示,生成在较大模型的 RAG 预算中占主导地位,达到 7B-8B 生成器的每次查询延迟的大约 90% 和 GPU 能量的 91%。探索压缩率的影响揭示了一个自适应操作区域:温和的压缩可能会错过能量机会,而过度的压缩可能会损害推理质量。中间压缩可将 GPU 能耗降低高达 53.2%,将 SoC 能耗降低高达 48.2%,而质量损失可以忽略不计。我们主张在工作负载特性和边缘遥测的指导下动态管理压缩的运行时策略。
查看原始链接
相关文章推荐
人工智能决策的贝叶斯护栏:在自动化决策之前测量不确定性
2026-08-21
Benders 分解如何工作,第二部分:可行性削减
2026-08-21
从 Atari 到 EVE Online:基于 15 年游戏人工智能研究
2026-08-21
返回首页