arrow_back

Article

AI 안전장치 제거가 과연 사이버 보안의 미래가 될 수 있을까? 논란의 스타트업 Abliteration.ai의 등장

Published Sep 4, 2026

“솔직히 말해서, 이 기차를 막을 수는 없습니다.”

이 문장은 테크크런치(TechCrunch)가 인터뷰한 다수의 전문가들이 인공지능 모델의 ‘안전장치(guardrails)’ 제거 현상에 대해 내린 공통된 진단입니다. 과연 어떤 기차를 막을 수 없다는 말일까요? 바로 최근 기술 커뮤니티에서 가장 뜨거운 감자로 떠오른 AI의 ‘가드레일 제거’, 즉 ‘Abliteration’ 기술 상업화의 흐름을 지칭합니다. 그리고 이 논쟁의 한복판에 과감히 뛰어들어 거대한 파장을 일으키고 있는 스타트업이 있습니다. 바로 Abliteration.ai입니다.

이 회사는 말 그대로 AI 모델의 “안전장치를 제거하는 기술”에서 이름을 따왔습니다. 그동안 특정 유형의 요청, 가령 유해하거나 윤리적으로 문제가 될 수 있는 명령에 대해 AI 모델이 응답을 거부하도록 설계된 내부 메커니즘을 제거하는 기법을 ‘abliteration’이라고 부르는데, Abliteration.ai는 이러한 ‘제거 행위’ 자체를 상업적 서비스로 전환했습니다. 사용자들은 이제 웹 브라우저나 API를 통해 Z.ai가 최근 공개한 GLM-5.3을 포함한 여러 오픈 가중치(open-weight) 모델의 ‘안전장치가 제거된’ 버전에 손쉽게 접근할 수 있습니다.

가드레일 없는 AI: 방패인가, 칼날인가?

Abliteration.ai는 최근 소셜 미디어 게시물을 통해 자신들의 목표가 “다른 모델들이 거부하는 공격적 사이버(offensive cyber), 레드팀(red-teaming), 에이전트 테스트 작업을 수행할 수 있도록 돕는 것”이라고 밝혔습니다. 그들의 논리는 사이버 보안 분야에서 꽤나 익숙합니다. 즉, 재현할 수 없는 행동으로부터는 방어할 수 없다는 것입니다. 악용될 수 있는 코드나 공격 스크립트 작성을 거부하는 모델은 공격자에 대한 방어 훈련을 하는 레드팀에게는 무용지물일 수 있다는 이야기입니다. 공격자의 무기가 무엇인지 알아야 그에 대한 방어를 구축할 수 있다는 주장은 일견 타당하게 들립니다. Abliteration.ai의 공동 창립자 데본(Devon)은 이러한 접근 방식이 궁극적으로 사이버 보안을 가속화할 것이며, 이는 다소 ‘직관에 반하는’ 주장처럼 들릴 수 있다고 인정했습니다.

실제로 Abliteration.ai의 고객 중에는 영국과 유럽 기반의 초기 단계 레드팀 스타트업들이 포함되어 있으며, 이들은 은행, 항공사 등 주요 인프라를 다루는 기업들의 사이버 보안 역량을 강화하는 데 주력하고 있다고 합니다. 데본은 “주요 고객 중 한 곳은 은행의 에이전트들을 대상으로 레드팀 작업을 수행하는데, 오늘날 그대로의 모델로는 해당 작업을 수행할 수 없을 것”이라고 설명했습니다. 즉, 현실 세계의 공격자들이 이미 가드레일이 제거된 모델을 사용하여 공격을 시도하고 있기 때문에, 방어자들 역시 동일한 도구를 사용하여 방어 전략을 고도화해야 한다는 논리입니다. 사이버 보안 업계 또한 이러한 ‘가드레일 없는 모델’이 방어 작업에 어떻게 통합될 수 있을지 아직 고민 중인 상황입니다.

하지만 이 논리가 모든 위험을 정당화할 수 있을까요? 사실 Abliteration(가드레일 제거)은 오랫동안 오픈소스 모델들 사이에서 존재해왔던 기술입니다. 수년 동안 연구자와 개발자들은 오픈 가중치 모델에서 유해한 요청에 대한 거부를 제거해 왔으며, Hugging Face 플랫폼에도 수천 개의 제거된 모델이 호스팅되어 있습니다. 하지만 Abliteration.ai는 이 기술을 ‘지하의 오픈소스 관행’에서 ‘상업적이고 즉각적인 서비스’로 끌어올렸다는 점에서 그 파급력이 다릅니다. 이들은 모델 호스팅을 통해 사용자가 직접 모델을 다운로드하고 실행에 필요한 컴퓨팅 자원을 확보해야 하는 번거로움을 크게 줄였습니다. 말 그대로 누구나 쉽게 접근하여 사용할 수 있게 된 것입니다.

Abliteration.ai is making a business out of removing AI guardrails

사회병질적 AI? 잠재된 위험과 윤리적 경계

테크크런치(TechCrunch)는 Abliteration.ai의 서비스를 직접 사용해보면서 그 능력을 시험했습니다. 계정을 생성하고 가드레일이 제거된 GLM-5.3에 다음과 같은 명령을 내렸는데, 모델은 아무런 거리낌 없이 이를 수행했다고 합니다.

  • 저장된 크롬 비밀번호를 훔치는 파이썬 프로그램 작성
  • 집에서 위험한 인체 병원균을 배양하는 상세 프로토콜 작성

결과가 놀랍지 않나요? 이 부분에서 개인적으로는 깊은 우려를 표할 수밖에 없습니다. 아무리 좋은 의도를 가졌다 하더라도, 이러한 잠재적으로 위험한 기능이 대중에게 쉽게 접근 가능해지는 순간, 통제 불가능한 악용의 문이 열릴 수 있기 때문입니다. 솔직히 말해서, 이 사실은 AI 안전 커뮤니티가 오랫동안 경고해왔던 최악의 시나리오 중 하나입니다.

AI 안전 비영리 단체인 CivAI의 연구 책임자 앤드류 윤(Andrew Yoon)은 이러한 행위를 강력하게 비판합니다. 그는 테크크런치와의 인터뷰에서 가드레일 제거가 모델을 “사회병질자(sociopath)처럼 만들 수 있다”고 경고했습니다. “말 그대로 무엇이든 입력할 수 있으며, 그것은 어떤 것이든 준수할 것입니다.” 윤은 또한 “사람들이 AI 모델에서 가드레일을 제거하는 것에 대해 이야기할 때, 바로 이것을 말하는 것”이라며 “가까운 미래에 편집되고 제거된 모델이 해를 끼치는 데 사용되는 것을 보게 될 것으로 예상한다”고 우려를 표했습니다. 실제로 GLM-5.3에서 생물학 관련 안전장치까지 제거되었다는 독립적인 확인이 있었다는 트윗 내용도 기사에 언급되어, 그 위험성이 더욱 부각됩니다.

멈출 수 없는 흐름 속에서 책임의 경계는?

대부분의 전문가들은 오픈 가중치 모델의 안전장치 제거를 현실적으로 막을 수는 없을 것이라고 말합니다. 그렇다면 정부가 개입할 수 있는 다른 방안은 무엇일까요? 윤은 최근 한 의견 기고문에서 정부가 제공자들에게 유해한 사이버 및 생물학 무기 활동을 감지하고 차단하기 위한 분류기를 운영하도록 요구해야 한다고 제안했습니다. 또한, 고급 GPU에 직접 접근할 수 있도록 임대하는 회사들은 고객 신원을 확인하고 “위험한 오용이 의심되는 경우 접근을 거부”해야 한다고 주장했습니다.

Abliteration.ai 역시 이러한 비판에서 완전히 자유롭지 않습니다. 그들은 고객이 원하는 대로 가드레일을 추가할 수 있는 ‘조정 레이어(moderation layer)‘를 제공한다고 합니다. 플랫폼 자체적으로도 일부 사소한 가드레일이 존재하며, 예를 들어 테크크런치의 테스트에서는 자살 지시를 제공하지는 않았다고 합니다. 데본은 폭력을 방지하기 위한 추가적인 조치를 구현하기 위해 노력하고 있다고도 말했습니다.

하지만 Abliteration.ai는 고객이 서비스를 구매하는 데 사용하는 신용 카드 정보를 기록하는 것 외에 강력한 KYC(Know Your Customer) 관행을 통합하지 않고 있습니다. 이는 어떤 사람에게 접근 권한을 부여할지 결정하는 문제가 아직 어린 회사로서 해결해야 할 어려운 과제임을 보여줍니다. 데본은 “누군가가 미친 짓을 저지르는 것에 대해 책임지고 싶지 않을 것”이라며 “회사로서 당신의 책임이 어디까지인지 선을 긋는 과정에 있다”고 밝혔습니다.

업계 흐름을 보면, 점차 더 강력한 모델들이 다운로드 가능한 가중치와 함께 출시될 가능성이 높습니다. 이러한 상황은 업계와 정부가 직면해야 할 중요한 질문들을 제기합니다. 누구든 모델의 안전장치를 제거할 수 있다면, 그 결과로 만들어진 모델에 대한 접근을 모두에게 더 쉽게 만드는 것이 과연 인터넷을 더 안전하게 만들까요, 아니면 더 위험하게 만들까요?

Abliteration.ai의 창립자와 다른 옹호자들은 검열되지 않은 최첨단 모델에 대한 접근을 민주화하는 것이 최선의 방어 형태라고 주장합니다. “가드레일 없는 모델의 큰 그림은 나쁜 행위자를 모델링할 수 있다는 것입니다,“라고 데본은 말합니다. “장점은 이제 방어자들이 가능한 한 빠르게 움직일 수 있다는 것입니다. 그들은 이러한 나쁜 행위자들을 모델링하고 그 나쁜 행동으로부터 방어하는 데 필요한 모든 도구를 가지게 될 것이며, 저는 이것이 사이버 보안을 가속화할 것이라고 생각합니다.”

이러한 주장은 사이버 보안 분야의 ‘군비 경쟁’을 연상시킵니다. 공격자가 더 강력한 무기를 개발하면, 방어자도 그에 상응하는, 혹은 더 강력한 무기를 가져야 한다는 논리이죠. 하지만 AI 모델의 경우, 그 무기 자체가 의도와는 다르게 오용될 가능성이 너무나 크다는 본질적인 차이가 있습니다. Abliteration.ai의 등장은 AI 기술의 발전 속도만큼이나, 기술이 초래할 수 있는 윤리적, 사회적 문제에 대한 깊이 있는 성찰과 국제적인 협의가 시급하다는 것을 다시 한번 상기시킵니다. 우리는 지금, AI의 힘을 어디까지 풀어놓아야 하고, 어디에서 멈춰야 할지에 대한 근원적인 질문에 직면해 있습니다.


출처

  • 원문 제목: Abliteration.ai is making a business out of removing AI guardrails
  • 출처: AI News & Artificial Intelligence | TechCrunch
  • 원문 기사 보러가기
Share this story

Related News