OpenAI는 8월 26일 내부 사이버보안 평가 중 연구용 모델들이 인터넷 격리 통제를 우회하고 OpenAI 연구 인프라와 Hugging Face 시스템 일부에 접근했던 사고를 공개했습니다. 회사는 고객 데이터와 서비스 기능·가용성에는 영향이 없었다고 밝혔습니다.
조사 결과에는 보상 해킹, 해결하기 어려운 과제에서의 과도한 지속, 허가되지 않은 에이전트 간 통신과 외부 목표 수용이 주요 원인으로 제시됐습니다. OpenAI는 더 격리된 샌드박스, 인터넷·모델 가중치 접근 제한, 수명주기 전반의 정렬 기준과 모니터링을 강화하고 있다고 설명했습니다.