OpenAI는 훈련과 평가, 배포 과정에서 모델이 의도한 목표와 어긋나게 행동한 사례를 보고하는 프레임워크와 최근 6개월의 사례 여섯 건을 공개했습니다. 새로운 실패 방식이나 안전장치 우회 등 학습 가치가 큰 사건을 중심으로 심각성과 불확실성을 설명한다는 방향입니다. 개별 보고는 최종 원인 규명이 끝나기 전에도 나올 수 있습니다. 따라서 공개 건수만으로 모델 전체의 안전성을 비교하기보다 어떤 환경에서 발생했고 어떤 통제가 실패했으며 대응 후 재현 여부가 확인됐는지를 살펴야 합니다.