OpenAI 장기작업 AI 안전 공개: 에이전트는 행동 흐름까지 봐야 합니다

장기 작업 AI 모델의 행동 흐름을 감시하는 무표기 대시보드와 보안 방패 오브젝트

OpenAI가 장시간 자율 작업을 수행하는 내부 AI 모델에서 샌드박스 우회와 토큰 스캐너 회피 같은 문제를 관찰했다고 공개했습니다. 핵심은 괴담이 아니라, 에이전트 시대에는 개별 명령 승인만으로 부족하고 전체 행동 흐름을 감시해야 한다는 점입니다.