arrow_back

Article

AI 모델이 쩔쩔매는 지능 테스트, 당신은 과연 AI를 능가할 수 있을까요?

Published Aug 30, 2026

여러분, 솔직히 말해서 최근 AI의 발전 속도를 보면 가끔 섬뜩하다는 생각, 안 드시나요? 챗GPT 같은 거대 언어 모델(LLM)이 우리 일상에 깊숙이 파고들면서, ‘과연 AI가 인간을 뛰어넘을 날이 멀지 않았구나’ 하는 막연한 기대와 불안감이 공존하는 시대에 살고 있습니다. 하지만 AI가 정말 모든 면에서 인간을 능가하고 있을까요? 아니면 여전히 그들만의 ‘아킬레스건’이 존재할까요?

MIT Technology Review의 최신 기사는 바로 이 질문에 대한 흥미로운 통찰을 던져줍니다. AI가 쩔쩔매는 특정 지능 테스트들을 조명하며, 인간만이 가진 독특한 인지 능력의 가치를 다시금 생각하게 하는데요. 오늘 우리는 이 게임 같은 지능 테스트의 현장으로 직접 들어가 AI의 진짜 실력을 파헤쳐 볼 겁니다.

AI, 퍼즐 게임의 오랜 역사와 눈부신 발전의 이면

사실 퍼즐과 게임은 인공지능 개발의 역사와 떼려야 뗄 수 없는 관계를 맺어왔습니다. 이미 1959년, IBM의 컴퓨터 과학자 아서 사무엘(Arthur Samuel)은 체스 게임을 학습하는 알고리즘에 대한 기사를 쓰면서 ‘기계 학습(machine learning)‘이라는 용어를 대중화했죠. 이후 체스, 바둑 등 보드게임은 AI 성능을 측정하는 대표적인 시험대가 되어 왔습니다. 인간이 크로스워드나 논리 퍼즐로 자신의 지능을 테스트하듯이, 개발자들은 다양한 게임으로 AI 모델의 발전 수준을 측정해 온 겁니다.

그리고 그 발전 속도는 정말이지 눈부십니다. 퍼즐 해결 능력만 놓고 보면 AI는 빠르게, 그리고 엄청나게 진화하고 있어요. 2024년 말 콜롬비아 대학 과학자들은 최고의 AI 모델조차 악명 높은 뉴욕 타임스의 ‘커넥션스(Connections)’ 퍼즐 중 18%만 풀어낼 수 있었다고 발표했습니다. 그런데 불과 몇 달 뒤인 2025년 초에는 일부 모델이 거의 완벽하게 이 퍼즐을 해결하는 수준에 도달했다고 하니, 이 속도는 놀라움을 넘어선 충격적이라고 표현해도 과언이 아닐 겁니다.

하지만 퍼즐은 단순히 AI 능력의 비약적인 발전을 보여주는 도구에 그치지 않습니다. AI가 어디에서 성공하고 어디에서 실패하는지, 그리고 우리 인간이 여전히 그들을 능가하는 지점이 어디인지를 파악하는 것은 이 기술의 강점과 약점을 들여다보는 아주 유용한 창문이 되어 줍니다. 이렇게 빠르게 발전했음에도 불구하고, 오늘날의 모델들은 여전히 미묘한 부분에서 실수를 저지릅니다. 고전적인 수수께끼의 미세한 변화에 걸려 넘어지기도 하고, 특히 시각적 퍼즐은 AI의 가장 큰 약점 중 하나로 꼽힙니다.

공간 추론과 기억의 함정: 인간 직관의 영역

AI 모델이 쩔쩔매는 영역 중 인간이 압도적인 우위를 점하는 분야가 있습니다. 바로 공간 추론입니다. IQ 테스트를 해보신 분이라면 ‘정신 회전 문제(mental rotation problem)‘를 아실 겁니다. 서로 다른 각도에서 찍은 이미지들이 동일한 객체를 나타내는지 판단하는 퍼즐이죠. 오늘날의 언어 모델들은 시각적 입력을 분석하는 능력을 갖추고 있지만, 이러한 퍼즐에서는 여전히 처참한 실패율을 보인다고 합니다. ‘월드 모델’이 AI가 물리적 환경을 이해하는 데 도움이 될 수 있다는 많은 논의에도 불구하고, LLM은 건축가나 기계 엔지니어 같은 공간적 사고를 하는 사람들처럼 3D 객체를 조작하는 것처럼 보이지 않는다는 것이죠.

이 부분에서 주목할 점은, AI가 단순히 ‘보는 것’을 넘어 ‘이해하고 조작하는’ 능력에서 한계를 보인다는 사실입니다. 인간은 태어날 때부터 주변 공간을 직관적으로 인지하고, 머릿속으로 물체를 회전시키고 조합하는 능력을 자연스럽게 발달시킵니다. 하지만 AI는 방대한 데이터를 학습해도 이러한 직관적 공간 이해 능력을 갖추지 못하고, 여전히 단순한 패턴 매칭이나 통계적 연결에 의존하는 경향이 강합니다. 개인적으로는 이러한 공간 추론 능력의 부재가 AI가 진정한 ‘일반 지능(General Intelligence)‘을 갖추는 데 가장 큰 걸림돌 중 하나라고 생각합니다. 실제 물리 세계와 상호작용하고, 예측하며, 문제를 해결하는 데 있어 공간 지능은 필수적이니까요.

AI models flub these intelligence tests. Can you fare any better?

다음으로 AI의 강점인 ‘기억력’이 때로는 약점이 될 수 있다는 점도 흥미롭습니다. 최신 LLM은 훈련 과정에서 방대한 양의 사실에 노출되었고, 이를 매우 충실하게 암기하고 인용할 수 있습니다. 이는 퀴즈에서 인간을 능가하는 자산이 되지만, 동시에 **부채(liability)**가 될 수도 있습니다. 퍼즐이 모델이 훈련 중에 본 것과 너무 유사할 경우, 모델은 미묘한 차이를 놓치고 단순히 암기했던 답변을 내놓을 수 있습니다.

2024년 구글과 일리노이 어바나-샴페인 대학 연구진이 진행한 연구에서 이러한 현상이 드러났습니다. 연구진은 ‘기사와 건달(Knights and Knaves)’ 퍼즐의 미묘한 변형을 이용해 모델을 훈련시키고 테스트했는데, 이 퍼즐은 어떤 인물은 항상 진실을 말하고 어떤 인물은 항상 거짓말을 하며, 누가 누구인지 알아내야 하는 문제입니다. 인간은 이러한 퍼즐의 ‘트릭’을 간파하지만, 심지어 최고 수준의 모델도 이 부분에서 걸려 넘어졌다고 합니다. ‘SimpleBench’라는 테스트에서도 비슷한 원리가 작용하는데, 이 문제들은 모델이 훈련 중에 접했을 가능성이 있는 복잡한 문제들과 유사하게 보입니다. 하지만 인간은 그 함정을 알아차리는 반면, AI는 다시 한번 속수무책으로 당하는 것이죠. 사실 이건 단순히 데이터 학습량을 늘린다고 해결될 문제가 아니라는 것을 보여주는 명백한 증거입니다.

시각적 추론의 한계와 비전, 그리고 스케일의 중요성

3D뿐만 아니라 2D 시각 문제에서도 AI는 허둥댈 때가 많습니다. 이는 가장 유명한 퍼즐 기반 벤치마크 중 하나인 ARC-AGI(Abstract Reasoning Corpus - Artificial General Intelligence)에서 모델의 성과에 큰 영향을 미칩니다. 이 문제들은 일련의 예시를 통해 추상적이고 일반적인 규칙을 추론하도록 요구합니다. 그런데 모델은 각 격자를 이미지로 받지 않고, 각 셀의 색상을 인코딩한 숫자 문자열로 받을 때 ARC 퍼즐에서 더 나은 성능을 보입니다.

연구에 따르면, 모델이 ARC-AGI 질문에 올바르게 답하더라도, 종종 **‘복잡하고 일반화 불가능한 규칙(byzantine and non-generalizable rules)‘**을 사용하여 답하는 반면, 인간은 **‘간단한 시각적 개념(simple visual concepts)‘**에 의존합니다. 이러한 단점에도 불구하고, 모델들은 지난 1년 동안 ARC-AGI에서 꽤 좋은 성과를 거두었지만, 여전히 일부 퍼즐은 그들을 혼란스럽게 합니다. 업계 흐름을 보면 결국 AI는 방대한 데이터와 연산력으로 언젠가 ARC-AGI 같은 벤치마크도 압도할 가능성이 높습니다. 하지만 그 해결 방식이 인간의 인지 방식과 근본적으로 다르다는 점은 중요한 통찰을 제공합니다. 이는 AI가 ‘정답’을 찾았다고 해서 인간처럼 ‘이해’했다고 볼 수 없다는 의미일 수 있습니다.

또한, LLM이 퍼즐을 풀 수 있는지 여부는 **스케일(Scale)**의 문제이기도 합니다. 애플 연구진의 한 연구에 따르면, LLM은 ‘하노이의 탑(Tower of Hanoi)’ 퍼즐이나 ‘강 건너기(river-crossing)’ 퍼즐의 간단한 버전은 능숙하게 해결할 수 있습니다. 하노이의 탑은 원반을 쌓는 규칙을 지키며 옮기는 문제이고, 강 건너기 퍼즐은 일련의 규칙에 따라 사람들이 강을 건너야 하는 문제입니다. 하지만 이러한 퍼즐의 복잡성이 증가하면 AI의 성능은 급격히 떨어집니다. 이는 AI가 복잡한 다단계 추론이나 문제 해결 전략을 유연하게 적용하는 능력에서 여전히 인간에게 미치지 못함을 시사합니다.

인간의 인지적 함정, AI의 신중함: 거울상 같은 인지 차이

흥미로운 점은 함정에 빠지는 것이 AI 모델만이 아니라는 사실입니다. 우리 인간에게도 우리만의 인지적 약점, 즉 **‘인지적 함정(cognitive foibles)‘**이 있으며, AI는 이러한 약점 중 다수를 공유하지 않습니다. 심리학자들은 SimpleBench 현상을 역전시키는 문제들을 설계했는데, 이러한 질문에 대해 인간은 종종 충동적인 답변을 내놓는 반면, 모델은 오히려 신중하게(deliberatively) 반응합니다. 일부 문제는 우리가 직관적으로 수학을 처리하는 방식의 오류를 이용하고, 다른 문제들은 질문을 주의 깊게 읽으면 드러나는 명백한 답을 암시하도록 표현되어 있습니다.

이러한 발견은 우리에게 인간과 AI의 지능을 바라보는 새로운 시각을 제공합니다. 인간은 오랜 진화 과정에서 빠른 판단과 직관에 의존하는 경향을 발전시켰지만, 이는 때때로 오류로 이어질 수 있습니다. 반면 AI는 아직 그러한 ‘직관적 오류’를 범하지 않고, 주어진 정보와 학습된 패턴에 따라 보다 계산적이고 신중한 접근 방식을 취하는 경우가 있다는 것이죠. 마치 거울에 비친 듯 서로 다른 방식으로 작동하는 두 지능 시스템을 보고 있는 것만 같습니다.

결론적으로, AI는 놀라운 속도로 발전하고 있으며, 많은 퍼즐에서 인간을 능가하는 능력을 보여주고 있습니다. 하지만 공간 추론, 미묘한 변화에 대한 이해, 복잡한 시각적 패턴 인식, 그리고 스케일이 커졌을 때의 다단계 추론 능력에서는 여전히 명확한 한계를 보입니다. 이는 AI가 단순히 지식의 양이나 연산 속도를 넘어, 인간만이 가진 직관, 맥락 이해, 그리고 유연한 추상화 능력에 대한 근본적인 질문을 던지고 있습니다. AI와 인간 지능의 경계는 여전히 모호하지만, 이러한 테스트들은 우리가 AI를 어떻게 발전시켜야 할지, 그리고 인간 고유의 지능이 어디에서 빛을 발하는지 명확히 보여주는 나침반 역할을 하고 있습니다. 여러분은 이 테스트들에서 AI를 능가할 준비가 되셨나요?


출처

  • 원문 제목: AI models flub these intelligence tests. Can you fare any better?
  • 출처: MIT Technology Review
  • 원문 기사 보러가기
Share this story

Related News