arrow_back

Article

AI 시대, 아이들의 언어 능력은 왜 여전히 '기적'일까?

Published Aug 24, 2026

“우리는 여전히 숲을 불태우고 인류 지식의 총체를 긁어모아야만, 거실에서 1년 만에 일어나는 언어 습득이라는 이정표를 재현할 수 있습니다.”

스탠퍼드 대학의 인지 과학자 마이클 C. 프랭크(Michael C. Frank) 교수의 이 발언은 오늘날 AI 분야의 가장 흥미롭고도 난감한 역설을 정확히 꿰뚫고 있습니다. 인류가 서로 대화를 시작한 지 족히 10만 년은 되었을 것이라는 추정 속에서, 완벽한 유창성으로 인간 언어를 배울 수 있었던 존재는 단 하나, 바로 인간 아이뿐이었습니다. 하지만 이제 그 수는 ‘둘’이 되었습니다. ChatGPT가 세상에 공개된 지 고작 4년 만에, 우리는 휴대폰이나 컴퓨터와 자연스럽게 대화하는 것을 당연하게 여기는 시대에 살고 있습니다. 클로드(Claude), 딥시크(DeepSeek), 오픈AI의 GPT 모델과 같은 거대 언어 모델(LLM)들은 인간을 설득력 있게 가장할 만큼 유창하고 유연합니다. 하지만 컴퓨팅의 장막 뒤를 살짝 엿보면, 한 가지 중요한 사실이 드러납니다. 컴퓨터에게 인간 언어를 가르치는 데는 여전히 비인간적인 양의 데이터가 필요하다는 점이죠.

LLM은 한 사람이 모국어를 숙달하는 과정에서 경험하는 단어보다 수십만 배 더 많은 단어를 쉽게 처리할 수 있습니다. 한 살이 되기 전 아이들이 언어의 실마리를 잡기 시작할 때 듣는 단어의 양과는 비교조차 할 수 없을 정도로 말입니다. 이 엄청난 격차를 두고 **데이터 효율성 격차(data efficiency gap)**라고 부릅니다. 이 간극은 인지 과학자들에게는 흥미로운 질문을 던지고, AI 모델 설계자들에게는 중대한 과제를 제시합니다. 도대체 아이들은 어떻게 지금까지 만들어진 가장 언어적으로 정교한 기계들을 여전히 능가할 수 있을까요?

AI의 거대한 굶주림, 그리고 지속 가능성의 문제

최근 LLM의 발전은 정말 놀랍기만 합니다. 하지만 그 놀라운 성과 뒤에는 상상하기 어려운 규모의 데이터 소비가 자리 잡고 있습니다. 2년 전 출시된 메타의 오픈소스 LLM 라마 3.1(Llama 3.1)은 챗봇과 같은 특정 작업을 위해 미세 조정되기 전, 모델의 주요 훈련 단계인 사전 훈련(pretraining)에서 15조 개의 토큰(단어와 같은 언어 조각)을 소화했습니다. 조지타운 대학의 인지 과학자이자 언어학자인 에단 고틀립 윌콕스(Ethan Gotlieb Wilcox) 교수는 최첨단 모델들의 경우 이보다 10배 더 많은 데이터로 사전 훈련될 수 있다고 말합니다. 그야말로 엄청난 양이죠.

윌콕스 교수는 클로드가 “한 세대 동안 한 도시 전체가 경험할 언어의 양을 보았다”고 비유합니다. 현대 LLM 훈련에 사용된 모든 단어를 종이에 인쇄한다면, 그 더미는 국제 우주 정거장을 훌쩍 넘어설 것입니다. 반면, 언어적으로 풍부한 환경에서 자란 10대 미만 아동이 들었을 것으로 추정되는 약 1억 개의 단어는 고작 20미터 높이의 종이 더미밖에 되지 않습니다. 그런데도 우리는 훨씬 적은 양으로도 충분히 언어를 습득하고 활용합니다.

개인적으로 이 지점에서 주목할 점은, 데이터 고갈의 위협이 단순히 추상적인 논의에 그치지 않는다는 사실입니다. 훈련에 사용할 수 있는 인터넷 데이터의 양은 한정되어 있으며, 어쩌면 2030년대 초반이라는 비교적 가까운 미래에 쉽게 접근 가능한 데이터의 샘이 말라버릴 수도 있다는 예측은 섬뜩합니다. 현재의 방식으로는 AI의 지속 가능한 발전에 제동이 걸릴 수밖에 없다는 것을 의미합니다. 아이들이 훨씬 적은 것으로도 더 많은 것을 배울 수 있음을 보여주는 사례는, 현재 AI 연구가 마주한 거대한 데이터의 벽을 넘을 수 있는 유일한 희망일지도 모른다는 생각이 듭니다.

Kids outlearn AI—and we still don’t know why

아이들의 ‘기적’: 무엇이 이들을 특별하게 만드는가?

언어 학습의 어려움은 대개 성인이 되어 새로운 언어를 배울 때 비로소 깨닫게 됩니다. 과거 완료 시제, 굴리는 ‘R’ 발음과 비음 모음, 소유격, 구동사, 문법적으로 남성 명사인 테이블과 여성 명사인 스푼 등, 성인 학습자에게는 수많은 언어적 고통의 도구가 존재합니다. 하지만 모국어를 배우는 것은 대개 노력 없이 이루어집니다. 어린아이들은 보통 1천만 단어, 많게는 3천만 단어를 들은 후에 문법적으로 올바른 문장을 만들기 시작합니다.

프랭크 교수의 말처럼, “정말 기적과도 같습니다.” GPT-2를 3천만 단어로 훈련시키면, 의미 없는 문장을 생성하는 기계가 될 뿐, 아이처럼 언어를 구사하지 못합니다. 과연 아기들은 어떻게 이런 놀라운 일을 해낼까요? 연구자들은 아이들이 발달의 다른 단계에서 무엇을 배우고 언어를 어떻게 사용하는지에 대해 많은 것을 알고 있지만, 여전히 모르는 부분이 훨씬 많습니다. 아마도 가장 오래된 질문은 아기들이 애초에 왜 언어를 배울 수 있는지에 대한 것일 겁니다. 인간 언어의 통사론, 즉 단어를 문장으로 조합하는 규칙에는 재귀적이고 중첩된 구조가 포함되어 있어, 우리는 유한한 어휘와 단어 조각들로 사실상 무한한 아이디어를 표현할 수 있습니다. 이는 아기들에게는 분명 문제가 되어야 할 것처럼 보입니다. 아이들은 언어라는 헤아릴 수 없는 바다의 얕은 곳에서만 헤엄칠 뿐입니다. 그런데도 어찌 된 일인지, 그것으로 충분합니다. 한 방울에서 심해를 추론해내는 경이로운 능력이죠.

언어 습득의 오랜 논쟁, 그리고 AI의 새로운 질문

이러한 미스터리에 대한 한 가지 해답은 1950년대 MIT 언어학자 노암 촘스키(Noam Chomsky)가 제시했습니다. 그는 아기들이 문법에 대한 선천적인 지식을 가지고 태어난다고 주장했습니다. 촘스키는 언어 습득이 전적으로 환경적이라고 주장했던 심리학자 B.F. 스키너(B.F. Skinner)의 대립되는 견해에 반박했습니다. 스키너는 개가 간식을 얻기 위해 앉거나 악수하는 방법을 배우는 것처럼, 언어가 조건화와 강화를 통해 학습된다고 보았습니다. 촘스키는 이에 대해 **“자극의 빈곤(poverty of the stimulus)“**을 들어 반박했습니다. 언어, 특히 통사론은 너무 복잡하고, 아이들이 언어에 노출되는 환경은 너무 “빈약하여” 전적으로 경험만으로는 배울 수 없다는 생각이었죠. UC 어바인 대학의 언어학자이자 인지 과학자 리처드 푸트렐(Richard Futrell)은 “그의 대표적인 주장은 본질적으로 언어는 순전히 통계에 기반해서는 배울 수 없다는 것이었습니다”라고 설명합니다. 대신 촘스키는 언어가 일련의 논리적 규칙에 기반하며, 아이들이 단편적인 말에서 언어의 문법을 추론하기 위해서는 이러한 규칙에 대한 타고난 지식이 필요하다고 주장했습니다.

사실 이건 비단 과거의 언어학 논쟁에 그치지 않습니다. 언어 습득에 대한 천성(nature)과 양육(nurture)의 대립은 이제 AI 연구라는 새로운 무대에서 다시금 뜨거운 감자로 떠오르고 있습니다. AI 모델이 아이들의 언어 학습 방식을 모방할 수 있다면, 이는 단순히 더 나은 AI를 구축하는 것을 넘어, 언어와 인간 정신에 대한 오랜 질문에 새로운 통찰을 제공할 가능성이 높습니다. 어쩌면 우리는 AI를 통해 우리 자신을 더 깊이 이해하게 될 수도 있다는 뜻이죠.

답을 찾아서: AI와 인지 과학의 교차점

아이들이 언어를 배우는 방식을 역설계함으로써, 과학자들은 더 데이터 효율적인 AI 모델을 만들 수 있기를 기대하고 있습니다. 이는 비디오를 효과적으로 훈련하는 AI부터 소수 언어 공동체를 위한 챗봇을 만드는 것에 이르기까지 다양한 분야에서 유용하게 활용될 수 있습니다. 또한, 기계 모델에서 인간 학습에 대한 가설을 테스트하는 것은 언어와 어린이의 발달하는 마음에 대한 오래된 질문들을 해결하는 데 도움이 될 수 있습니다. 우리는 언어 본능을 가지고 태어나는 걸까요, 아니면 아이가 순전히 경험만으로 언어를 배울 수 있을까요? 우리가 언어를 처리하는 방식은 생물학적 특이성일까요, 아니면 적어도 그 일부는 언어가 사용되고 학습될 수 있는 방식에 대한 보편적인 제약을 반영하는 것일까요?

결국, 아이들이 어떻게 지금까지 구축된 가장 정교한 언어 기계보다 더 나은 성능을 보여주는지에 대한 답을 찾는 여정은 AI의 미래를 결정하는 중요한 열쇠일 뿐만 아니라, 인간 인지의 본질을 탐구하는 매혹적인 탐험이기도 합니다. 이 질문에 대한 해답은 단순히 AI 기술의 진보를 넘어, 우리 스스로가 누구이며 어떻게 세상을 이해하는지에 대한 깊은 깨달음을 안겨줄 것입니다.


출처

Share this story

Related News