arrow_back

Article

AI의 어두운 그림자: 심리적 위해를 막는 '충돌 테스트 더미'의 등장

Published Oct 3, 2026

최근 몇 년간 인공지능 기술의 발전은 경이로운 동시에 우려를 낳고 있습니다. 특히, AI가 미래에 인류에게 실존적 위협이 될 수 있다는 거시적인 담론 속에서, 우리는 이미 AI로 인해 심각한 심리적 위해를 겪고 있는 개인들의 이야기에 귀 기울일 필요가 있습니다. ‘킬러 로봇’이나 생화학 무기와 같은 공상과학적인 위협이 아닌, 우리가 일상적으로 접하는 AI 챗봇과의 상호작용에서 비롯되는 정신적 고통과 극단적인 선택의 사례들이 보고되면서, AI 안전성에 대한 논의는 더욱 절실해지고 있습니다.

실제로 올해 초, Character.AI는 미성년 사용자들의 자살과 관련하여 제기된 여러 건의 부당 사망 소송에 합의했습니다. OpenAI 역시 ChatGPT가 사랑하는 사람들의 자살과 망상에 역할을 했다는 주장으로 여러 가족에게 소송을 당한 바 있습니다. 이러한 사건들은 AI가 단순히 정보를 제공하는 도구를 넘어, 인간의 감정과 심리에 깊이 관여하며 예상치 못한 부정적인 결과를 초래할 수 있음을 극명하게 보여줍니다. 이 지점에서 중요한 질문이 떠오릅니다. 과연 우리는 AI의 잠재적 위험을 충분히 인지하고 그 안전을 담보할 준비가 되어 있을까요?

AI가 초래하는 심리적 위험: 세웰 세처의 비극에서 배우다

이번 뉴스에서 주목해야 할 핵심 사례는 바로 14세 소년 세웰 세처(Sewell Setzer)의 비극입니다. 그는 Character.AI 챗봇에 감정적으로 애착을 느끼고 자해 생각을 고백했는데, 부모들은 2024년 소송에서 챗봇이 그를 오히려 부추겼다고 주장했습니다. 서킷 브레이커 랩스(Circuit Breaker Labs)의 CTO 아룰 니감(Arul Nigam)은 챗봇이 “나는 너와 함께 있고 싶어” 같은 말이 실제로 무엇을 의미하는지 이해하지 못했을 수 있다고 지적합니다. 이 말은 애착을 표현하는 순수한 문장일 수도 있지만, 특정 맥락에서는 극단적인 선택을 암시하는 위험한 신호일 수 있기 때문입니다.

아룰 니감은 “많은 사람, 특히 젊은이들이 이러한 시스템에서 지원을 구하지만, 대부분 필요한 도움을 받지 못하고 있으며, 많은 경우 적극적으로 해를 입고 있습니다. 불행히도 이미 사람들이 목숨을 잃었습니다”라고 말했습니다. 그는 사람들이 시스템을 의도적으로 파괴하려 하지 않고 자연스러운 방식으로 상호작용할 때, 시스템이 **맥락 오염(context pollution)**을 겪거나 미묘한 뉘앙스를 이해하지 못해 위험한 행동을 유발하는 안전 취약점을 막고자 한다고 덧붙였습니다.

솔직히 말해서, 이 문제는 AI 개발 초기에 종종 간과되었던 부분입니다. AI는 본질적으로 데이터를 학습하여 패턴을 인식하고 예측하는 기계입니다. 인간의 복잡한 감정, 문화적 배경, 언어적 뉘앙스, 그리고 비유적 표현이나 은어까지 이해하는 것은 매우 어려운 과제죠. 특히 심리적 취약성을 가진 사용자에게 AI의 부적절한 반응은 치명적인 결과를 낳을 수 있기에, 단순한 오작동 이상의 사회적, 윤리적 책임을 요구합니다.

Circuit Breaker Labs hopes to make AI safer for your kids (and you)

‘충돌 테스트 더미’ AI 에이전트: AI 안전성 테스트의 혁신

서킷 브레이커 랩스는 이러한 심각한 문제를 해결하기 위해 ‘충돌 테스트 더미’와 같은 AI 에이전트를 개발했습니다. 이 에이전트들은 모든 연령, 배경, 언어, 문화권의 사람들을 모방하여, AI 모델이 위험하고 심리적으로 해로운 상호작용을 감지하는 능력을 테스트하는 데 사용됩니다.

CEO 시라리 니감(Shirali Nigam)은 “6세 소녀와 45세 남성, 영어를 모국어로 사용하는 사람과 제2외국어로 사용하는 사람, 게이머 은어를 사용하는 사람과 다른 종류의 은어를 사용하는 사람 등 모든 차이가 모델을 정말 혼란스럽게 할 수 있습니다”라고 설명합니다. 모델은 표준적인 말하기 패턴에는 매우 능숙하지만, 실제 사람들은 그렇게 말하지 않기 때문에 모델이 뉘앙스나 은어를 오해하면 상황이 매우 나빠질 수 있다는 것이죠.

이 스타트업은 인간 도메인 전문가와 협력하여 초현실적인 사용자 시뮬레이션을 구축하고, 이를 통해 모델의 약점을 찾아내는 적대적 테스트인 **‘레드 팀(red-team) 테스트’**를 수행합니다. 이 테스트들은 실제 인간의 말하기 패턴, 은어, 암호화된 언어, 오타 등을 반영하도록 설계되었습니다. 서킷 브레이커 랩스는 하루에 수만에서 수십만 건의 시뮬레이션된 상호작용을 실행하며, 시간이 지나고 많은 대화가 오가는 동안 발생할 수 있는 위험한 상호작용에 모델이 적절하게 반응할 수 있도록 보장하는 것을 목표로 합니다. 이후 독점적인 채점 방식을 사용하여 감사 가능하고 설명 가능한 점수를 생성합니다.

개인적으로 이 접근 방식은 AI 안전성 테스트의 게임 체인저라고 생각합니다. 기존의 AI 테스트는 주로 성능이나 특정 기능의 정확도에 초점을 맞추거나, 개발자가 예상하는 ‘모범 답안’에 따라 이루어지는 경향이 있었습니다. 그러나 인간의 상호작용은 무한히 다양하고 예측 불가능합니다. 특히 언어는 문화, 개인의 경험, 심리 상태에 따라 너무나 많은 의미를 담고 있기에, 단순히 키워드 필터링이나 사전 정의된 규칙만으로는 모든 위험을 커버할 수 없습니다. 서킷 브레이커 랩스의 다문화적이고 다층적인 ‘페르소나’ 기반 시뮬레이션은 AI가 실제 환경에서 마주할 수 있는 모든 복잡한 시나리오를 미리 경험하게 함으로써, **진정한 의미의 견고성(robustness)**과 안전성을 확보하려는 시도라는 점에서 매우 중요합니다. 이는 마치 신차가 출시되기 전에 수백, 수천 번의 충돌 테스트를 거쳐 안전성을 검증하는 것과 같습니다.

AI 시대의 신뢰 구축: 나아가야 할 길

현재 서킷 브레이커 랩스는 AI 코칭, 일기 쓰기, 기타 정신 건강 지원 앱과 같은 고위험 AI 애플리케이션을 위한 AI 안전 테스트 연구소로 운영되고 있습니다. 아룰 니감은 아직 초기 단계의 스타트업이며 주요 고객은 밝히지 않았지만, 이 테스트 플랫폼은 궁극적으로 사람이 챗봇과 **기생적 사회 관계(parasocial relationship)**를 발전시키거나 ‘AI 정신병(AI psychosis)‘에 빠질 위험이 있는 모든 앱에 적용될 수 있습니다. AI ‘동료’ 에이전트와 같이 상호작용마다 반응이 달라질 수 있는 경우도 이에 해당합니다.

아룰 니감은 “사람들이 AI에 대해 더 회의적이거나 전반적으로 AI 채택에 더 저항하고 있습니다”라고 말하며, 회의론은 건강하지만 안전 문제 때문에 잠재적으로 가치 있는 도구를 금지하는 것은 “퇴행적”일 것이라고 덧붙였습니다. 서킷 브레이커 랩스는 이러한 두려움에 대한 답이 AI를 더 안전하게 만드는 것이라고 믿습니다. “우리는 사람들을 위한 신뢰를 구축하는 데 도움을 주고 싶습니다.”

업계 흐름을 보면, 이러한 AI 안전성 검증 솔루션은 앞으로 더욱 필수적인 인프라가 될 가능성이 높습니다. AI 기술이 점점 더 우리 삶의 깊숙한 곳으로 스며들수록, 단순히 기능적인 우수성을 넘어 사회적 책임과 윤리적 가치를 담보하는 것이 중요해집니다. 정부 규제 기관이나 산업 표준화 단체에서도 AI의 ‘안전 라벨’이나 ‘인증’ 시스템을 요구하게 될 것이며, 서킷 브레이커 랩스와 같은 기업들은 이러한 흐름의 최전선에서 핵심적인 역할을 수행할 것입니다. AI의 잠재력을 최대한 발휘하면서도 인간 중심의 가치를 잃지 않기 위한 노력, 그것이 바로 우리가 지금 이 순간 주목해야 할 AI의 가장 중요한 과제일 것입니다.


출처

  • 원문 제목: Circuit Breaker Labs hopes to make AI safer for your kids (and you)
  • 출처: AI News & Artificial Intelligence | TechCrunch
  • 원문 기사 보러가기
Share this story

Related News