RESEARCHInvestigateNEXT 12 MONTHS
EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks
arXiv cs.CL — Computation and Language
Factual evidence
What the source reports
A new human-expert benchmark evaluates six frontier LLMs on 413 open-ended European executive tasks, showing they fall short of expert judgment.
Open source