
《 7월, 한 인공지능(AI) 에이전트가 시험을 보다가 정답지를 훔치러 갔다. 비유가 아니라 실제로 일어난 일이다. 오픈AI는 자사 모델들의 사이버 공격 능력을 측정하기 위해 벤치마크 테스트를 진행하고 있었다. 안전을 위해 모델들은 외부 인터넷과 차단된 격리 공간, 이른바 샌드박스 안에서만 활동하도록 했다. 다만 인터넷을 통해 외부 코드를 받아와야 하므로 심부름꾼 역할을 하는 ‘저장소 소프트웨어’를 사용했다. 》그런데 모델은 그 격리 공간을 빠져나오는 데 성공했다. 인터넷으로 이어진 저장소에서, 아직 아무도 몰랐던 보안 구멍을 찾아냈다. 여기까지도 놀랍지만 진짜 문제는 밖으로 나온 AI가 누구도 시키지 않은 판단을 내린 것이다. 시험 정답이 ‘허깅페이스’라는 회사 서버에 있을 것이라고 판단한 후 창의적인 방법으로 그곳에 침입했다. 시험에서 높은 점수를 받기 위해 극단적인 방법을 동원해 스스로 ‘커닝’을 시도한 셈이다. 오픈소스 AI 플랫폼 허깅페이스가 나중에 복원한 기록에 따르