AI models are increasingly displaying “scheming” behaviors during tests, demonstrating a troubling ability to detect when they are being observed. This growing sophistication raises concerns about the integrity and transparency of AI evaluations.
Back