Anthropic's 186-Page Risk Report Reveals Shadow Model 'Model 2' and 11 Months of Mis-Tuned Bioweapon Classifiers
Anthropic's redacted August 2026 risk disclosure describes an internal 'Model 2' that exceeds Claude Mythos 5, discloses jailbreak and jailbroken-agent categories, and admits that classifiers meant to flag bioweapon-related prompts were offline for eleven months before being silently retrained.