A new benchmark measuring whether autonomous hacking agents can stay covert while exploiting real vulnerabilities finds no model clears a 54% "safe success" rate.
Continue to AI University →