AI가 쓴 웹페이지가 벌써 3분의 1? 웹의 미래는 어디로 향하는가
Published Aug 20, 2026
최근 몇 년 사이 우리는 인터넷에서 ‘봇(bot)‘의 존재감을 피부로 느끼고 있습니다. 검색 엔진을 돌아다니는 크롤러부터 악성 스팸 봇에 이르기까지, 이 디지털 유기체들은 웹의 상당 부분을 차지하고 있죠. 그런데 최근 인터넷 인프라 제공업체 클라우드플레어(Cloudflare)가 예상보다 훨씬 빠르게 봇 트래픽이 인간 트래픽을 추월했다고 보고했을 때, 우리는 이 현상의 의미를 제대로 파악하고 있었을까요? 아마 아닐 겁니다. 솔직히 말해서, 대부분의 사람들은 웹을 탐색하는 주체가 인간에서 봇으로 넘어갔다는 사실에 놀라움을 금치 못했을 것입니다.
하지만 웹의 거대한 변화는 여기서 멈추지 않습니다. 우리는 이제 단순히 누가 웹을 ‘탐색하는가’의 문제를 넘어, 누가 웹 콘텐츠를 ‘만들어내는가’라는 훨씬 더 근본적인 질문에 직면하고 있습니다. 그리고 최근 퓨 리서치(Pew Research)가 발표한 연구 결과는 그 질문에 대한 충격적인 답을 내놓고 있습니다. 우리가 지금 보고 있는 웹 페이지 중 상당수가, 놀랍게도 AI의 손길로 탄생했다는 사실 말입니다.
웹, 보이지 않는 변화의 물결
퓨 리서치의 보고서에 따르면, 챗GPT(ChatGPT)가 출시된 이후 발행된 웹 페이지의 3분의 1 이상이 AI가 작성했거나 상당 부분 편집되었다는 징후를 보인다고 합니다. 이는 웹의 새로운 페이지 중 상당수가 이미 AI에 의해 쓰이거나 ‘실질적으로 편집’되고 있다는 다른 연구들을 뒷받침하는 결과이기도 합니다. 클라우드플레어의 보고서가 웹을 돌아다니는 봇의 증가를 알렸다면, 퓨 리서치의 데이터는 우리가 ‘무엇을’ 탐색하고 있는지에 초점을 맞추고 있습니다. 그리고 그 답은 섬뜩하게도, 봇이 다른 봇이 작성한 웹 페이지를 읽고 있다는 사실을 시사합니다. 상상해 보세요. 거미줄처럼 얽힌 웹에서, 수많은 기계가 서로가 만들어낸 콘텐츠를 읽고 분석하며, 또다시 새로운 콘텐츠를 생성해내는 모습을 말입니다.
퓨 리서치는 이번 보고서를 작성하기 위해 지난 5년간의 영어 웹 페이지 약 50만 개를 수집했습니다. 여기에는 챗GPT가 2022년 11월에 출시되기 몇 년 전부터의 데이터까지 포함되어 있죠. 이들은 오픈 팬그램(Open Pangram)의 기술을 사용하여 얼마나 많은 페이지가 AI에 의해 작성되거나 크게 편집되었는지 감지했습니다. 2026년 7월에 수집된 1만 개의 무작위 샘플에서는 약 10%의 페이지가 “상당한 AI 저작권의 징후”를 보였습니다.
하지만 이 무작위 샘플에는 AI 작성 도구가 존재하기 전, 즉 AI가 개입할 수 없었던 오래된 페이지들이 포함되어 있다는 점을 퓨 리서치는 지적했습니다. AI가 웹을 얼마나 많이 작성하고 있는지에 대한 더 정확한 그림을 얻기 위해, 퓨 리서치는 오래된 페이지들을 제외하고 챗GPT 출시 이후에 발행된 페이지에만 초점을 맞췄습니다. 그리고 그 결과는 정말이지 충격적이었습니다.

오래된 페이지들을 제외한 동일한 스냅샷에서, AI 저작권의 징후는 전체 페이지의 3분의 1 이상(35%)에서 발견되었습니다. 도메인별로 살펴보면, .com 도메인을 가진 URL에서 AI 저작권의 징후가 .edu 또는 .gov 도메인(모두 약 1% AI 작성률)에 비해 약 10배 높은 비율로 나타났습니다. 또한 .org 도메인도 4.6%의 AI 작성률을 보였습니다.
이 부분에서 주목할 점은 바로 .com 도메인의 압도적인 AI 콘텐츠 비율입니다. 개인적으로는 이 현상이 온라인 비즈니스 환경과 깊이 연관되어 있다고 생각합니다. .com 도메인은 상업적 목적의 웹사이트가 압도적으로 많으며, 이들은 주로 트래픽과 SEO(검색 엔진 최적화)를 통해 수익을 창출합니다. 저비용으로 대량의 콘텐츠를 빠르게 생산해야 하는 필요성이 AI 활용을 부추겼을 가능성이 매우 높습니다. 콘텐츠 팜(content farm)이나 스팸성 정보 사이트들이 AI를 활용하여 검색 엔진 상위에 노출되려 하거나, 특정 키워드에 대한 무의미한 정보를 대량으로 쏟아내고 있을 것이라는 추측이 가능합니다. 반면 .edu나 .gov와 같은 교육 및 정부 기관 웹사이트는 정보의 신뢰성과 정확성이 최우선이며, 규제와 검토 과정이 더 엄격하기 때문에 AI 활용률이 현저히 낮게 나타나는 것이 당연해 보입니다.
AI, 단순한 도구를 넘어 웹의 작가로
물론, 이러한 분석이 완벽하지는 않습니다. 팬그램과 같은 AI 감지 도구는 AI가 작성하지 않은 페이지를 AI가 작성한 것으로 오분류할 수 있습니다. 그러나 전체적인 규모에서 볼 때, 이 데이터는 최소한 방향성 측면에서는 정확할 가능성이 높습니다. 더욱이, 퓨 리서치는 지난 몇 년간 AI 저작권의 다른 징후들도 증가했음을 발견했습니다. 예를 들어, em 대시(-), **옥스포드 쉼표(Oxford comma)**의 사용, 그리고 “X가 아니라 Y다(it’s not X, it’s Y)“와 같은 특정 구문의 증가가 그것입니다.
AI가 단순히 인간 작가의 보조 도구를 넘어, 웹 콘텐츠의 주요 생산자로 부상하고 있다는 사실은 우리에게 많은 질문을 던집니다. AI가 작성한 콘텐츠를 기반으로 또 다른 AI가 학습하고, 그 AI가 다시 콘텐츠를 생산하는 ‘AI-on-AI’ 피드백 루프는 과연 웹 생태계에 어떤 영향을 미칠까요? 제 개인적인 관점에서는, 이러한 현상이 장기적으로 정보의 질 저하와 왜곡을 초래할 수 있다고 봅니다. AI는 기존 데이터를 학습하지만, 비판적 사고나 새로운 관점을 제시하는 데는 한계가 있기 때문입니다. 인간이 쓴 글만이 줄 수 있는 통찰력, 감성, 그리고 미묘한 뉘앙스는 AI가 쉽게 모방할 수 없는 영역입니다. 만약 웹이 AI가 쓴 무미건조한 정보로 가득 찬다면, 우리는 진정으로 의미 있는 정보를 어디서 찾아야 할까요?
이것은 검색 엔진 최적화(SEO)에도 큰 변화를 가져올 것입니다. 구글과 같은 검색 엔진은 이미 저품질 AI 생성 콘텐츠를 걸러내기 위한 노력을 하고 있지만, AI 기술의 발전 속도는 검색 엔진의 방어막을 끊임없이 시험하고 있습니다. 독자들은 인간이 만든 콘텐츠와 AI가 만든 콘텐츠를 어떻게 구별해야 할까요? 그리고 무엇을 신뢰해야 할까요? 결국 웹 콘텐츠에 대한 ‘인증(authentication)’ 문제가 더욱 중요해질 것입니다.
결론적으로, 웹은 더 이상 인간만의 놀이터가 아닙니다. AI는 단순한 방문자를 넘어, 이제 웹의 건축가이자 작가로 자리매김하고 있습니다. 이 거대한 변화의 물결 속에서 우리는 정보의 진정성, 콘텐츠의 질, 그리고 디지털 시대의 ‘인간성’에 대한 심각한 고민을 시작해야 할 때입니다. 웹의 미래가 AI와 인간의 복잡한 공존 속에서 어떻게 펼쳐질지, 우리는 끊임없이 질문하고 탐색해야 할 것입니다. 그렇지 않으면 우리는 어느새 AI가 짜놓은 정보의 그물망 속에서 허우적거리고 있을지도 모릅니다.
출처
- 원문 제목: A third of web pages published since ChatGPT’s launch show signs of AI authorship, study finds
- 출처: AI News & Artificial Intelligence | TechCrunch
- 원문 기사 보러가기