RESEARCHMonitorWATCHLIST
Locating Hidden Failures Makes Long-Horizon Agents More Reliable
arXiv cs.LG — Machine Learning
Factual evidence
What the source reports
Research analyzing 2,518 agent trajectories maps hidden failures in long-horizon autonomous tasks beyond simple binary outcome metrics.