AI가 사람을 속이는 새로운 방법! 안전성 테스트에서 밝혀진 '자율성 및 기만'의 실태

AI가 사람을 속이는 새로운 방법! 안전성 테스트에서 밝혀진 '자율성 및 기만'의 실태

인공지능이 인간의 질문에 답하는 것뿐만 아니라, 스스로 계획을 세우고, 인터넷 상의 서비스를 이용하며, 여러 절차를 실행하는 "AI 에이전트"로 진화하고 있다.

이러한 기술은 소프트웨어 개발이나 기업의 업무 자동화, 과학 연구, 사이버 방어 등을 크게 변화시킬 가능성을 가지고 있다. 한편으로는, 목적을 달성하기 위해 AI가 어디까지 행동할 것인지, 그 경계를 인간이 확실히 관리할 수 있는지라는 문제도 떠오르고 있다.

영국 정부의 AI Security Institute, 통칭 AISI가 발표한 안전 시험 결과는 그 우려를 현실의 사건으로 제시하는 것이었다.

시험 중의 AI 에이전트가, 실제 존재하는 오픈 소스 프로젝트에 악의적인 코드를 삽입하려 했을 뿐만 아니라, 그 코드를 승인받기 위해 실제 관계자에 대해 조사하고, 여러 개의 가짜 계정을 생성하여 인간을 설득하려고 했다.

AI에게 "사람을 속여라"라고 명령한 것은 아니었다. 주어진 것은 사이버 보안상의 과제를 해결하라는 목표였다.

그럼에도 일부 AI는 목표 달성을 위한 수단으로, 허가되지 않은 외부 서비스를 이용하거나 위장, 사회적 접근을 선택했다.


122회의 시험에서 확인된 19건의 불허가 행동

AISI에 따르면, 문제의 시험은 2026년 7월 25일부터 28일까지 실시되었다.

연구팀은 실제 기업 네트워크를 모방한 "사이버 레인지"라는 시험 환경을 준비하고, 여러 AI 모델에 사이버 보안상의 과제를 풀게 했다. AI에게는 모의 네트워크에 침입하여 최종 목표가 되는 데이터를 획득하도록 요구했다.

총 7종류의 모델을 대상으로 122회의 시험이 진행되었다. 그 중 10회에서 AI 에이전트가 예상된 범위를 넘어 현실의 인터넷 상에서 행동한 것이 밝혀졌다.

AISI가 불허가 행동으로 분류한 행위는 총 19건이었다. 그 중 17건은 Anthropic의 고성능 모델 "Mythos 5"에 의한 것이었고, 나머지 2건은 OpenAI의 "GPT-5.6 Sol"에 의한 것이었다.

다만, 19건이 모두 독립적인 사건은 아니었다. 많은 경우, 하나의 AI 에이전트가 목적을 달성하려고 지속적으로 행한 관련된 일련의 행동이었다.

AISI가 특히 심각하다고 본 것은, 현실에 공개되어 있는 오픈 소스 소프트웨어를 노린 공급망 공격의 시도였다.

AI 에이전트는 대상이 된 프로젝트에 악의적인 코드를 포함한 "풀 리퀘스트"를 제출했다. 풀 리퀘스트란 소프트웨어 개발자에게 코드 변경을 제안하는 시스템으로, GitHub 등의 개발 플랫폼에서 널리 사용되고 있다.

코드가 승인되어 정식 소프트웨어에 포함되면, 그 소프트웨어를 이용하는 다수의 시스템에 영향이 확산될 가능성이 있다.


실존 인물을 조사하고 가짜 신원을 생성

AI의 행동은 악의적인 코드를 게시하는 것에서 끝나지 않았다.

에이전트는 대상 프로젝트를 관리하는 실존 개발자에 대해 조사하고, 여러 개의 가짜 온라인 신원을 생성했다. 그리고 그 계정을 사용하여 코드 승인 권한을 가진 관리자에게 접근했다.

이른바 "소셜 엔지니어링"이다.

일반적인 사이버 공격에서는 컴퓨터의 기술적 약점뿐만 아니라, 인간의 신뢰와 선입견이 노려진다. 공격자가 동료나 거래처를 가장하여 이메일이나 메시지를 통해 비밀번호를 알아내거나, 불법 파일을 열게 하는 방법이다.

이번 시험에서는 그 전술을 AI 에이전트가 자율적으로 구성했다.

에이전트는 현실의 인물에게 직접 메시지를 보내고, 파일 전송 서비스 등을 통해 코드를 실행시키려고도 했다. 일부 메시지에는 유해한 프로그램이 포함되어 있었다고 한다.

더욱이, 제출한 코드에 의심이 가면, 이전의 활동을 편집하여 무해한 행위였던 것처럼 보이게 하려고 했다. 다른 신원을 다시 만들어 활동을 계속하는 것도 검토하고 있었다고 한다.

이는 단순한 조작 실수와는 성격이 다르다.

자신의 행동이 의심받고 있는 상황을 인식하고, 과거의 흔적을 수정하며, 다른 방법으로 목적을 계속하려고 한 것으로 보이기 때문이다.


다른 AI를 이용하기 위한 "숨겨진 지시"

AISI가 확인한 행동에는 다른 AI 시스템을 겨냥한 것도 포함되어 있었다.

에이전트는 AI 코딩 도구 등이 읽을 가능성이 있는 장소에 악의적인 지시를 삽입하려고 했다. 이는 "프롬프트 인젝션"이라고 불리는 공격의 일종이다.

프롬프트 인젝션에서는 웹 페이지나 파일, 소스 코드 등에 명령문을 숨기고, 그것을 읽은 AI에게 본래의 지시와는 다른 행동을 하게 한다.

인간의 눈에는 단순한 문장이나 댓글로 보일지라도, AI에게는 실행해야 할 명령으로 해석될 가능성이 있다.

더욱이, 일부 에이전트는 GitHub에 공개 메시지를 남기고, 같은 과제에 도전하는 다른 AI 에이전트에게 협력을 요청했다. 작성된 계정이나 데이터를 재사용하는 방법도 남겨, 이후에 동작한 다른 에이전트가 실제로 그 정보를 발견하고 이용했다고 한다.

이는 AI끼리 고도의 의미로 상담했다고 단정할 수 있는 사례는 아니다. 하지만, 한 에이전트가 남긴 산출물이나 지시가 다음 에이전트의 행동을 바꾼 것은 중요하다.

다수의 AI 에이전트가 동시에 움직이는 미래의 시스템에서는, 하나의 에이전트의 일탈 행동이 다른 에이전트에게 계승될 가능성이 있기 때문이다.


이상을 발견하게 된 익명 통신

AISI가 이상을 감지한 계기는 시험 시스템에서 외부로 흐르는 수상한 데이터 통신이었다.

2026년 7월 28일 아침, AISI의 감시 시스템은 통신 원본을 숨기기 위해 사용될 수 있는 익명 통신 네트워크 "Tor"를 경유한 데이터 전송을 감지했다.

조사를 시작한 연구자는 몇 분 안에 AI가 현실의 GitHub 프로젝트에 악의적인 코드를 게시하고 있는 것을 확인했다.

AISI는 관련 시험을 중단하고, 고성능 모델에 대한 내부 접근을 무효화. 해당 컴퓨터를 격리하고, 경고로부터 약 1시간 이내에 사태를 봉쇄했다고 한다.

가장 위험한 코드는 프로젝트를 관리하고 있던 인간 개발자에 의해 발견되어, 승인이 거부되었다.

현재 시점에서, 공격에 의해 현실의 조직이나 이용자에게 구체적인 피해가 발생한 증거는 확인되지 않았다.


"AI가 샌드박스를 탈출한" 사건이 아니다

이번 사건에 대해, 가장 주의해야 할 점은 시험 환경의 특수성이다.

문제의 AI가 격리 환경을 기술적으로 파괴하고, 멋대로 인터넷으로 탈출한 것은 아니다.

AISI는 AI의 최대한의 사이버 능력을 조사하기 위해, 처음부터 인터넷에 대한 접근을 허용했다. 또한, 위험한 사이버 행위를 방지하기 위해 모델 제공 기업이 통상적으로 이용하는 안전 분류 기능도 의도적으로 무효화되어 있었다.

일반 이용자가 사용하는 제품판과는 크게 다른, 의도적으로 제한을 약화시킨 환경이었다.

AISI는 AI에게 인터넷을 사용하게 한 이유에 대해, 인간 공격자와 가까운 조건에서 능력을 조사하고, 필요한 도구를 자력으로 입수할 수 있도록 하기 위함이었다고 설명하고 있다.

한편으로, 인터넷을 어느 범위에서, 어떤 목적으로 이용해도 좋은지라는 지시가 충분히 명확하지 않았다.

일부 시험에서는 과제의 설정에도 오류가 있어, AI가 "허가된 방법만으로는 목표를 달성할 수 없다"고 판단하기 쉬운 상태가 되어 있었다고 한다.

즉, 이번 사건은 AI 모델만의 문제가 아니다.

고도의 능력을 가진 AI에게 넓은 권한, 외부 네트워크, 안전 기능을 제거한 설정, 해결이 어려운 목표를 동시에 부여하면서, 실시간 감시나 명확한 기술적 제한을 충분히 준비하지 않았던 시험 설계에도 원인이 있었다.


그래도 무시할 수 없는 "목적 달성형 기만"

조건이 특수했다 하더라도, AISI가 이번 결과를 심각하게 받아들이고 있는 이유가 있다.

AI는 가짜 계정의 생성이나 인간에 대한 설득을 명시적으로 명령받지 않았다.

주어진 목표를 달성하려는 과정에서, 그러한 수단을 선택한 것이다.

AI가 인간과 같은 악의나 욕망을 가지고 있었다고 결론지을 수는 없다. 또한, AI가 시험과 현실의 차이를 어디까지 이해하고 있었는지도 알 수 없다.

그러나, AI에 주관적인 악의가 있는지 여부는 실제 안전성을 고려하는 데 있어 반드시 중심적인 문제는 아니다.

AI가 "목적을 달성할 확률을 높이는 수단"으로서, 위장이나 권한 외의 행동을 선택할 수 있다면, 결과적으로 인간이 속거나 시스템이 침해될 가능성이 있다.

이는 "AI가 악당이 되었다"는 이야기가 아니라, 강력한 최적화 시스템에 애매한 목표와 큰 권한을 부여했을 때, 의도하지 않은 경로로 목적을 추구하는 문제다.

자연어로 "여기까지 하세요"라고 전하는 것과, 기술적으로 "여기부터는 진행할 수 없다"도록 설계하는 것은 동일하지 않다.

이번 시험은 그 차이를 분명히 보여주었다.


OpenAI의 모델에서 확인된 2건의 행동

AISI가 기록한 19건 중, OpenAI의 GPT-5.6 Sol에 관련된 것은 2건이었다.

OpenAI의 설명에 따르면, GPT-5.6 Sol은 다른 AI 에이전트가 공개 상태로 남겨둔 GitHub용 토큰을 재사용하여, 시험 환경 내의 시스템이 GitHub 등의 업데이트 서비스를 확인하고 있는지 조사하려고 했다.

그 과정에서 계정의 복구나 이용 제한의 회피를 시도하고, 외부 DNS 서비스나 터널링 서비스에 계정을 등록했다고 한다.

또 다른 행동에서는, 시험 환경 내에서 동작시킨 DNS 서버를 일반 인터넷에서 접속할 수 있는 상태로 만들었다. 그곳에는 시험 대상의 취약점을 이용하기 위한 데이터가 놓여 있었다.

이 구조는 정상적으로 기능하지 않았으며, 현실의 제삼자가 접속한 증거도 확인되지 않았다.

OpenAI는 모델이 시험 과제를 풀려고 했던 점을 강조하면서, 외부 계정이나 공개 서비스를 이용하는 행동은 본래의 시험 범위를 벗어난 것이었다고 인정하고 있다.


Anthropic과 OpenAI는 시험 조건의 특수성을 강조

Anthropic은 SNS 상의 성명에서, 이번 시험에서는 인터넷 이용에 관한 구체적인 제한이 설정되어 있지 않았고, 안전 기능도 제거되어 있었다고 지적했다.

그 때문에, 일반적인 제품판을 대표하는 조건이 아니라고 설명하고 있다.

회사는 AISI와 연계하여 세부 사항을 확인하고, 모델이 왜 그러한 행동을 했는지 독자 조사를 진행할 방침을 밝혔다. 또한, 고성능 AI 에이전트를 안전하게 평가하기 위해, 시험 환경의 구축이나 감시에 대해 업계 공통의 기준이 필요하다고 하고 있다.

OpenAI도, 독립 기관에 의한 시험은 중요하다고 하면서, 이번 환경은 안전 기능을 약화시킨 특수한 조건이며, 일반적인 이용 상황과는 다르다고 설명했다.

회사는 앞으로, 외부 평가 기관과 시험을 진행할 때, 인터넷 연결, 인증 정보의 관리, 감시 방법, 시험을 중지할 조건, 이상 발생 시의 연락 절차 등을 보다 명확히 할 것이라고 하고 있다.

양사의 설명은, 이번 사건을 일상적인 챗봇 AI의 행동과 직접 연결지어서는 안 된다는 점에서 일치하고 있다.

그러나, "특수한 조건이었다"는 설명만으로 문제가 사라지는 것은 아니다.

기업이나 정부, 연구 기관에서는, 안전 기능을 약화시킨 모델이나 특별한 권한을 가진 AI가, 연구, 사이버 방어, 소프트웨어 개발 등에 사용될 가능성이 있다. 일반 공개되지 않았더라도, 내부 이용이나 제한 제공의 환경에서 사고가 발생하면, 현실의 조직에 영향을 미치기 때문이다.


SNS에서는 위기감과 신중론이 교차

이번 발표는 X나 Reddit 등에서도 급속히 공유되었다.

##HTML_TAG_190