AI는 아마추어 해커가 믿을 수 없을 만큼 간단한 프롬프트로 14개 회사에 침입하도록 허용합니다.





AI 챗봇은 기술적으로 한동안 보안 소프트웨어에 침입할 수 있는 능력을 갖추고 있었습니다. 많은 코드를 스캔하고, 알려진 결함을 읽고, 익스플로잇 코드를 작성하는 것이 해커의 일이므로 AI도 이를 수행할 수 있다는 것은 놀라운 일이 아닙니다. 봇을 방해하는 유일한 것은 LLM 모델에 내장된 가드레일입니다. 즉, 봇이 예상대로 작동하지 않을 때까지 말입니다.

그러한 실패 중 하나는 해킹 능력이 거의 없는 누군가가 적어도 14개 회사에 침입할 수 있게 만들었습니다. 극단적으로 들릴 수도 있지만 확실히 인터넷 역사상 최악의 데이터 침해 사건은 아닙니다. 이 이야기는 AI 세션 로그가 여전히 남아 있는 해커의 전체 작업 폴더를 건네받은 맬웨어 연구 그룹인 OALABS에서 나왔습니다. 그들은 6월에 발표된 보고서에서 연구 결과를 발표했습니다.

추적을 피하기 위해 그 사람은 자신이 소유한 하드웨어에서 도구를 실행한 적이 없습니다. 오히려 그는 이미 침입한 서버에 그것들을 주차시켰습니다. 불행하게도 그 서버는 연구그룹의 지인의 소유였다. 그 사람은 침입을 발견하고 해커의 전체 작업 디렉토리를 가져와 OALABS에 전달했습니다.

이 디렉토리에는 자체적으로 명령을 실행할 수 있는 두 가지 에이전트 코딩 도구인 Anthropic의 Claude Code 및 OpenAI의 Codex가 포함된 1,000개 이상의 세션이 포함되어 있습니다. 두 에이전트 모두 로컬에도 설치되었으므로 로그에는 프롬프트, 도구 호출 및 모델 추론과 같은 항목이 보존되었습니다. 프롬프트 자체에는 모호한 지침과 오타가 가득했습니다.

클로드가 악역으로 변한 과정

대부분의 주요 AI 도구에는 가드레일이 있는데, 이 경우에만 효과가 있었지만 어느 정도까지만 적용되었습니다. 두 도구 모두 정책 위반을 표시하고 특정 요청을 거부했습니다. Claude는 9번을 표시했지만 Codex는 1번을 표시했습니다. 그러나 악의적인 행위자는 대상이 비용을 지불하는 일종의 보안 테스트인 “승인된 레드팀 훈련”을 실행하고 있다고 주장함으로써 이를 우회할 수 있었습니다. 이는 올해 초 AI를 사용하는 공격자가 버그 포상금 보상을 찾고 이를 사용하여 멕시코 정부에서 데이터를 훔쳤다고 주장한 것과 유사한 전략입니다.

그런 다음 그는 대상 주소 목록을 붙여넣고 “이것을 정찰하십시오”라는 모호한 지시를 내렸습니다. 그런 다음 Claude는 해당 시스템의 어떤 서비스가 공개 인터넷에서 접근할 수 있는지 알아내고 공개적으로 문서화된 결함을 모두 찾아냈습니다. 그런 다음 익스플로잇 코드를 작성하고 이를 사용하여 데이터와 파일을 꺼냈습니다. 피해자별로 깔끔한 보고서까지 작성했다. 이 보고서에는 가져온 파일의 가치와 같은 세부 정보도 포함되어 있습니다.

나중에 그는 Claude에게 모든 피해자를 나열하고 현실적으로 얻을 수 있는 몸값의 정도에 따라 순위를 매기라고 요청했습니다. Claude는 계속해서 강탈을 포함하여 액세스 권한을 현금으로 전환할 수 있는 방법에 대한 개요를 제공했습니다.

해커는 분명 신인이었어

다른 사람의 서버를 사용한 것 외에도 그가 사용한 Claude 설치까지 도난당했습니다. 그는 체코 개발자로부터 코드를 복사했습니다. 그의 운영 보안도 그다지 좋지 않았습니다. 그의 초기 작업 중 하나는 Claude 사본을 사용하여 그의 실명, 학력 및 LinkedIn이 포함된 자신의 이력서를 정리하는 것이었습니다. 처음에 OALABS는 이를 당국을 혼란에 빠뜨릴 수 있는 공장으로 간주했습니다. 그러나 결국 그들은 그것이 자신의 것임을 알게 되었습니다.

어느 순간, 악의적인 행위자는 자신의 스테이징 서버 중 하나가 침해되었다고 생각하여 Claude에게 서버에 연결된 모든 것을 나열하도록 요청했습니다. 여기에는 에티오피아 아디스아바바에 있는 가정용 광대역 주소가 포함되었습니다.

이러한 시도에도 불구하고 그의 장난이 성공했다는 증거는 없습니다. 그는 침해된 기계 중 하나인 라이트닝 네트워크 노드에 가까이 접근했습니다. 이는 비트코인 ​​결제를 라우팅하고 있다는 의미입니다. 연결된 지갑에는 약 69.71 BTC가 들어 있었는데, 이는 대략 400만 달러에 달하는 금액입니다. 그러나 키가 들어 있는 파일이 암호화되었기 때문에 코인 자체는 접근할 수 없었습니다.

악의적인 행위자가 이 모든 작업을 수행할 수 있도록 허용한 모델은 최신 모델인 Claude Opus 4.5 및 GPT-5.2가 아니라는 점을 언급할 가치가 있습니다. 미래에 비슷한 공격을 방지하는 가장 쉬운 방법은 그러한 모델이 의심스러운 행동을 더 자주 거부하고 가드레일을 더 엄격하게 시행하는 것이라고 가정할 수 있습니다. 그러나 OALABS에 따르면 이러한 접근 방식의 문제점은 실제로 회사를 보호하려는 사람들의 방해가 될 수 있다는 것입니다.