OneBench
Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents | OneBench: AI Insights