OneBench
When Consistency Does Not Mean Reliability: Evaluating Local LLM Judges Against Human Ratings | OneBench: AI Insights