arXiv:2606.02060 | Span-Level Error Localization in Agent Trajectories | 2026

针对深度研究 Agent(Deep-Research Agents)的长轨迹错误定位问题,提出了 span 级别的错误定位方法和 TELBench 基准。

核心问题

现有评估基于最终答案判断 Agent 是否成功,但无法定位轨迹中哪些步骤导致答案不可靠。长轨迹中,早期错误可能让 Agent 陷入无效循环或级联成根本性错误。

贡献

贡献说明
TELBench1000 实例的 span 级错误识别基准,区分正常探索、失败搜索、试探性假设和无害噪声
DRIFT 框架以 claim 为中心的审计框架,追踪 Agent 声称与证据链条
数据集2790 条真实轨迹,来自 2 个 Agent 框架、3 个基础模型、3 个基准

方法

  1. 将原始 logs 转为 semantic spans(语义片段)
  2. 通过 LLM 辅助专家审查标注有害错误 spans
  3. 构建分类器区分错误类型

相关页面