Claude Starts Training Claude: A Controlled Step Toward AI Self-Improvement
Anthropic’s automated alignment researcher can review papers, design training methods, generate data, and evaluate model safety. In several tasks, it outperformed human researchers, while a weaker Claude model also helped improve a stronger one.
Read more