AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-07 04:00
翻译成中文
SearchAuditor:审计和归因长期搜索代理中的失败
搜索
代理
通过
修复
SearchAuditor
arXiv:2608.05212v1 公告类型:新 摘要:深度搜索代理通过长范围网络交互来解决具有挑战性的问题,这是一个既复杂又脆弱的过程:小的推理错误可能会通过长而嘈杂的轨迹传播为流畅但不正确的答案。诊断此类故障很困难,需要手动检查极长的执行轨迹,这可能超出了人类的能力。因此,我们引入了SearchAuditBench,这是一个评估LLM审核员是否能够定位、归因和修复这些故障的基准,从而减轻人力负担。 SearchAuditBench 包含 1,243 个失败轨迹,平均 73.1 条消息和 65.1K 个令牌,从五个深度搜索基准的八个开放权重模型中收集,每个专家都注释了关键错误步骤、特定于搜索的根本原因以及带有评分标准的参考修复。我们进一步提出了 SearchAuditor,这是一种多视角审计框架,可以通过基于证据的裁决有效地定位、归因和修复搜索代理故障。实验结果表明,即使是最强的基线,在 GPT-5.5 这样的前沿模型的支持下,也只能获得 26.6% 的端到端通过率。相比之下,我们的 SearchAuditor 始终优于不同前沿模型的所有基线,实现了 32.3% 的端到端通过率,并且通过修复恢复失败的运行使代理能够更好地从错误中恢复。
查看原始链接
相关文章推荐
Matplotlib 与 Plotly:您应该选择哪种 Python 图表工具?
2026-08-07
Cohere Health 如何使用 Amazon Bedrock AgentCore 将临床政策数字化
2026-08-07
TReNDS 如何使用 Amazon Bedrock 自动进行根本原因分析
2026-08-07
返回首页