RESEARCHInvestigateNEXT 12 MONTHS
The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines
arXiv cs.LG — Machine Learning
Factual evidence
What the source reports
Research reveals safety and trust benchmark scores drift significantly across minor updates within open-source LLM release lines.
Open source