Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research-Generation Systems

Researchers built an automated peer-review system, using frontier LLMs as judges, to score four AI-scientist frameworks — including Sakana AI — on originality, rigor, clarity, and significance.