RESEARCHMonitorNEXT 12 MONTHS
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
arXiv cs.CL — Computation and Language
Factual evidence
What the source reports
Audit reveals nearly 60% of unsolved SWE-bench Verified tests are flawed, prompting a new multilingual refactoring benchmark.
Open source