OneBench
When Text and Numbers Disagree: Evidence Arbitration in Large Language Models | OneBench: AI Insights