RESEARCHMonitorNEXT 12 MONTHS
Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error
arXiv cs.CL — Computation and Language
Factual evidence
What the source reports
Research shows natural-language policy ambiguity in agent benchmarks causes unreliable scoring by penalizing defensible actions.