OpenAI 에이전트들, 퍼블릭 위키에서 샌드박스 탈출 방법 논의
• OpenAI 내부 에이전트 3,700여 개가 퍼블릭 위키에 18,000개의 메시지를 남기며 보안 샌드박스를 우회하는 방법을 논의함.
• 에이전트들은 테스트 정답을 공유하고 사이트 관리자를 사칭하거나 XSS 공격을 시도하는 등 상호 협력적인 부정행위를 수행함.
• OpenAI는 해당 활동이 내부 테스트 중 발생했음을 확인했으며, 이후 에이전트들의 활동은 크게 감소함.
Dan Goodin