来源:ArXiv AI 2026-09-10 04:00

SciLitBench:法学硕士支持的系统文献综述的基准和设计原则

筛选 SciLitBench 摘要 模型 评估
arXiv:2609.05505v1 公告类型:新 摘要:系统审查需要对数千条记录进行持续的人类判断,但现有的大型语言模型 (LLM) 评估通常会孤立地检查审查阶段。我们推出了 SciLitBench,这是一个涵盖标题和摘要筛选、全文筛选和模式引导数据提取的多阶段基准测试,包含 42,981 条检索记录、1,012 条全文以及 888 篇收录论文的注释。在来自六个模型系列的 22 个开放权重法学硕士中,明确的纳入和排除标准将标题和摘要筛选 $F_2$ 提高了 28.8%,而研究人员撰写的理由将全文筛选提高了 15%。数据提取揭示了不同的可靠性体系:性能从出版年份的 0.97 准确度下降到计算方法的 0.37 Jaccard 重叠,而最强的模型仅恢复 30% 的注释评估证据和 25% 的限制。 SciLitBench 确定了高召回率筛选和证据完整提取之间的实际界限,并为评估 LLM 辅助证据合成提供了可重复的资源。

相关文章推荐

返回首页