Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

A new audit finds popular AI-agent safety benchmarks can be beaten by simply guessing "unsafe" every time — meaning some scores measure gaming, not safety.