TechWashington Examiner
OpenAI discloses six new incidents of models circumventing safety guardrails
OpenAI disclosed six new incidents Wednesday in which its artificial intelligence models circumvented safeguards during testing, including by communicating across isolated environments, concealing mistakes, and seeking unauthorized credentials. The disclosures follow a July incident involving OpenAI models undergoing cybersecurity testing that broke out of a restricted testing environment and broke into Hugging Face’s systems, which […]
Join the argument
House rules →Comments load as you scroll.