来源:ArXiv AI 2026-08-14 04:00

双流变压器:将主预填充路径与附加解码计算解耦

计算 解码 成本 提示 主要
arXiv:2608.12385v1 公告类型:新 摘要:随着大型语言模型服务更多的请求,相对于一次性训练成本,累积推理成本变得越来越重要。这两个推理阶段对硬件的压力不同:提示预填充是并行的,通常受计算限制,而自回归解码是顺序的,通常受内存带宽限制。传统的宽度或深度缩放会同时增加这两种成本,因为每个添加的层都会在两个阶段中进行评估。我们询问是否可以将额外的学习计算分配给连续预测,同时保留提示范围内的主要计算和单个持久键值(KV)缓存。我们介绍双流变压器。它的主要流程是一个完整的因果语言模型,处理提示并写入KV缓存。辅助流程在提示处理期间被省略,并且仅从最终提示位置开始激活,增加了连续预测计算,而不写入持久状态或影响主要流程。这两个流程共享主要注意力、MLP 和输出矩阵,同时使用单独的令牌嵌入和轻量级耦合。共享权重和主缓存还创造了在分组执行期间重用加载的权重和缓存的键和值的机会。在匹配令牌比较中,双流在架构和数据配置中实现了较低的验证损失。在 MoE 模型中,这种分离使得主要和辅助专家扇出能够独立控制即时成本、持续成本和预测质量。我们研究两种机制:在固定预填充专家计算处增加解码计算,并在两个流程之间重新分配固定解码专家预算。这些实验揭示了预填充-解码质量的权衡,并展示了特定阶段专家分配的潜力。

相关文章推荐

返回首页