针对相同的 12 个问题、相同的系统提示和相同的模型,对排名前 5 的 RAG 管道和完整的 127,000 个令牌提示进行受控比较。对正确性、完整性和基础性进行盲评分。
Kimi K3 的 1M 令牌上下文窗口与 RAG:成本、延迟和答案质量首先出现在迈向数据科学上。