arrow_back

Article

기존 GPU의 한계를 넘어선다: Kog, AI 추론 가속화의 판도를 바꿀 기술 혁신인가?

Published Aug 14, 2026

“GPU는 밝은 미래를 가지고 있습니다.” 프랑스 스타트업 Kog의 CEO 가엘 들랄루(Gaël Delalleau)는 확신에 찬 목소리로 말합니다. GPU가 AI 디코딩 작업에 잘 맞지 않는다는 생각은 이제 오해에 불과하다고 덧붙이면서 말이죠. AI 기술이 전례 없는 속도로 발전하면서, 이를 뒷받침하는 하드웨어, 특히 GPU의 역할에 대한 논의는 끊이지 않고 있습니다. 특히 AI 추론(inference) 속도와 비용은 이제 산업 전반에 걸쳐 핵심적인 병목 현상으로 부상했으며, 이러한 배경 속에서 코그(Kog)의 등장은 업계에 신선한 충격을 던지고 있습니다.

최근 세레브라스(Cerebras)와 같은 목적 지향형 칩 기업들이 IPO에서 뜨거운 반응을 얻는 등, 특수 제작된 하드웨어에 대한 시장의 기대가 큰 상황입니다. 하지만 코그는 기존의 GPU, 즉 엔터프라이즈들이 이미 보유하고 있는 AMD MI300X나 Nvidia H200과 같은 표준 데이터센터 GPU에서 훨씬 더 많은 추론 성능을 짜낼 수 있다고 주장하며 정면으로 다른 길을 걷고 있습니다. 소프트웨어 최적화만으로도 기존 하드웨어의 새로운 가능성을 열 수 있다는 그들의 약속은 단순한 관찰자들을 넘어 수많은 기업들의 관심을 불러 모았습니다. 솔직히 말해서, 200개가 넘는 실질적인 비즈니스 리드를 확보했다는 사실은 그들의 잠재력이 얼마나 큰지 짐작게 합니다.

기존 GPU의 잠재력을 깨우다: Kog의 대담한 시도

코그는 지난 5월 해커 뉴스(Hacker News) 메인 페이지를 장식하며 큰 주목을 받았습니다. 그들이 선보인 기술 프리뷰는 “기업이 이미 소유하고 있는 표준 데이터센터 GPU에서 **극도로 빠른 단일 요청 디코딩(single-request decoding)**이 가능하다”는 것을 증명하는 데 초점을 맞췄습니다. 데모에서는 놀랍게도 초당 3,000 토큰(TPS)을 처리하는 성능을 보여주었습니다. 물론 이 데모는 20억 개 정도의 매개변수를 가진 비교적 작은 모델인 ‘레인포머 2B(Laneformer 2B)‘를 기반으로 했지만, 그럼에도 불구하고 그 가능성은 충분히 인상적이었습니다.

일부 사용자들은 이 기술이 노트북 GPU로 확장되지 않는다는 점에 아쉬움을 표했지만, 다른 이들은 그 거대한 잠재력을 보았습니다. 실제로 클로드 코드(Claude Code)와 같은 AI 도구를 사용하는 개발자들은 때때로 결과물을 얻기 위해 몇 시간씩 기다려야 하는 불편함을 겪습니다. 앤트로픽(Anthropic)조차도 속도가 곧 돈이라는 것을 인지하고, 클로드의 ‘패스트 모드(Fast Mode)‘에 더 높은 가격을 책정하고 있습니다. 코그는 바로 이러한 지연으로 인해 불편함을 겪는 고객들을 공략하고자 합니다. 특히 전문 업무에 AI 워크플로우를 의존하는 이들에게 코그 추론 엔진(KIE)을 통한 속도 향상은 단순한 편의성을 넘어 수익 증대로 직결될 수 있기 때문입니다. 이미 프롬프트만으로 게임이나 앱을 생성하는 디자인 파트너들이 있으며, 이들은 더 빠른 결과물로 더 많은 수익을 기대하고 있습니다.

Kog is going deeper to squeeze more inference out of GPUs

‘30배 빠른 LLM 추론’ 약속, 현실화될 수 있을까?

코그는 시장이 아직 완전히 성숙하지 않았다는 점을 인지하고 있습니다. 잠재 고객들이 작은 모델을 파인튜닝할 준비가 되어 있지 않다는 점을 관찰한 후, 그들은 더 큰 모델의 개발 가속화에 집중하기 시작했습니다. 하지만 여기서 핵심적인 질문이 떠오릅니다. 20억 매개변수 모델에서 3,000 TPS를 달성한 것이 ‘30배 빠른 LLM 추론’이라는 거대한 약속으로 이어질 수 있을까요? 필자의 분석으로는, 이 부분에서 코그는 상당한 도약을 해야 할 것으로 보입니다. 소규모 모델에서의 효율성과 대규모 언어 모델(LLM)에서의 효율성은 아키텍처와 메모리 사용 방식에서 큰 차이를 보이기 때문입니다. LLM의 거대한 크기는 추론 칩에 엄청난 부담을 주기 마련이며, 단순히 ‘더 깊이 파고드는’ 접근 방식만으로는 이 간극을 메우기 어려울 수 있습니다. 그러나 들랄루 CEO는 회의적인 시각에 반박하며, 자신의 접근 방식이 LLM에도 동일하게 잘 작동할 것이라고 확신합니다. 그는 “GPU에 점점 더 많은 메모리 대역폭이 탑재되고 있으며, 이는 그저 잠금 해제되기를 기다리고 있을 뿐”이라고 강조합니다.

코그와 유사하게 소프트웨어 최적화를 통해 GPU 성능을 끌어내려는 시도는 또 있습니다. 같은 프랑스 스타트업인 ZML은 엔비디아의 CUDA를 우회하여 경쟁 칩들 간의 빠른 추론을 지원하는 하드웨어 독립적인 소프트웨어를 출시했습니다. 하지만 들랄루 CEO는 코그가 스탠포드 대학교의 헤이지 리서치(Hazy Research) 연구소와 더 유사하며, GPU 가속에 있어 훨씬 더 깊은 수준의 접근 방식을 취하고 있다고 설명합니다.

해커 정신으로 GPU를 해킹하다: Kog의 독특한 개발 철학

들랄루 CEO의 독특한 배경은 코그의 심층적인 접근 방식의 근간을 이룹니다. 프랑스 에콜 폴리테크니크(École Polytechnique)에서 고체 물리학을 전공한 그는 이후 공격적인 사이버 보안, 즉 화이트햇 해킹 분야에서 경력을 쌓았습니다. DEFCON의 CTF 토너먼트에서 네 차례나 결승에 진출했던 그는 해킹을 통해 “어셈블리 언어와 바이너리 코드 수준까지 **매우 낮은 수준에서 역공학(reverse-engineer)**을 수행하여 작동 방식을 이해하고, 본래 의도되지 않은 목표를 달성하기 위해 사용하는 법”을 배웠다고 말합니다. 과학적 지식과 해킹의 경험이 결합된 이러한 사고방식은 그의 팀에도 그대로 전수되고 있습니다. “물리학의 법칙과 GPU의 법칙을 이해하여 최대한 활용하는” 마인드셋, 이것이 바로 코그의 핵심 경쟁력입니다.

그러나 이러한 접근 방식에는 명확한 단점도 존재합니다. 매우 **수작업(hands-on)**적이고 시간 소모적이라는 점입니다. 들랄루 CEO는 “새로운 GPU가 나올 때마다 몇 주, 심지어 몇 달을 할애하여 세부 사항을 파고들고 해당 하드웨어에 대한 GPU 엔지니어링 연구를 수행한다”고 말합니다. 현재 11명으로 구성된 팀으로서는 코그가 작업할 수 있는 칩의 수에 한계가 있을 수밖에 없습니다. 개인적으로는 이 지점이 코그의 혁신적인 기술력과 시장 확장성 사이의 긴장감을 형성한다고 봅니다. 개별 GPU에 대한 심층적인 최적화는 단기적으로는 독보적인 성능을 제공할 수 있지만, 빠르게 진화하는 AI 하드웨어 생태계 전체를 아우르기에는 그들의 접근 방식이 너무나 ‘장인 정신’에 기반하고 있습니다. 이는 마치 맞춤 제작된 수제 스포츠카와 대량 생산되는 고성능 자동차의 차이와도 같습니다. 다만, 이러한 독특한 방식이 장기적으로는 진입 장벽을 높이는 강력한 **해자(moat)**가 될 수도 있습니다.

미래를 향한 발걸음과 유럽의 지원

장기적으로 코그는 자신들의 방법론을 **에이전트 기반 파이프라인(agent-based pipelines)**에 통합하여 더 많은 칩과 모델을 지원할 수 있기를 희망합니다. 유럽이 이 두 가지 분야에서 자체 역량을 구축하고자 노력하는 가운데, 코그의 이러한 시도는 주권 강화라는 유럽의 흐름과 맞물려 강력한 성장 동력을 얻을 수 있습니다. 이미 스케일웨이(Scaleway)의 지원을 받고 있으며, 프랑스 투자은행(Bpifrance)과 프렌치 테크 2030(French Tech 2030) 프로그램의 후원을 받고 있다는 사실은 이러한 가능성을 뒷받침합니다.

현재로서는 코그가 자신들의 접근 방식이 LLM에도 효과가 있다는 것을 전 세계에 증명해야 하는 과제를 안고 있습니다. 이는 추가 자금 확보의 핵심이기도 합니다. 들랄루 CEO는 “9월경에 첫 번째 주요 모델에서 10배 속도 향상을 구현하게 될 것이며, 이를 통해 고객 견인력을 입증하고 시리즈 A 투자를 유치할 수 있을 것”이라고 자신감을 내비쳤습니다. 코그의 대담한 실험이 과연 AI 추론 가속화의 새로운 지평을 열 수 있을지, 우리는 그들의 다음 행보에 주목해야 할 것입니다. 기존 하드웨어의 숨겨진 잠재력을 끌어내는 이들의 여정은 분명 AI 산업의 미래를 더욱 흥미롭게 만들 것입니다.


출처

  • 원문 제목: Kog is going deeper to squeeze more inference out of GPUs
  • 출처: AI News & Artificial Intelligence | TechCrunch
  • 원문 기사 보러가기
Share this story

Related News