구글의 AI 야심작, 자사 벤치마크에서도 5위… 충격적인 현실!
Published Jul 12, 2026
솔직히 말해서, 이 소식을 접했을 때 저는 적잖이 충격을 받았습니다. 인공지능 분야의 선두 주자 중 하나로 불리는 구글의 자사 LLM이, 그것도 안드로이드 개발이라는 구글의 핵심 영토에서 진행된 성능 평가에서 경쟁사에 밀려 5위라는 성적표를 받았다는 사실 말이죠. 특히 구글이 ‘에이전틱 개발(agentic development)‘로 많은 프로젝트의 방향을 전환하고 있는 시점에서 이 결과는 단순한 숫자 이상의 의미를 가집니다. 마치 축구 종가의 팀이 자국 리그에서 변방의 팀들에게 연패를 당하는 상황과 다름없달까요?
AI, 개발자들의 새로운 ‘만능 도구’가 되다
코드 생성은 현재 LLM의 가장 인기 있는 응용 분야 중 하나로 빠르게 자리 잡고 있습니다. 개발자들은 이제 더 이상 텅 빈 에디터 앞에서 막막함을 느끼지 않습니다. 복잡한 알고리즘이든, 보일러플레이트 코드든, 혹은 단순한 함수 작성에 이르기까지, LLM은 이제 코딩 작업의 필수적인 동반자가 되고 있죠. 하지만 문제는 모든 LLM이 모든 개발 작업에 동일하게 능숙하지 않다는 점입니다. 마치 모든 공구가 모든 작업에 적합하지 않듯, 어떤 AI 에이전트가 특정 개발 작업에 가장 효과적인지 파악하는 것은 생산성 향상을 위한 핵심 과제가 되었습니다.
구글은 이러한 배경 속에서 올해 초, LLM이 안드로이드 앱 개발에서 얼마나 잘 작동하는지를 평가하기 위한 벤치마크 도구, 즉 **안드로이드 벤치(Android Bench)**를 처음 선보였습니다. 그리고 오늘, 이 안드로이드 벤치가 대대적인 업데이트를 단행했습니다. 새로운 모델들이 대거 추가되었고, 개발자들이 더 쉽게 사용할 수 있도록 새로운 프레임워크를 도입하는 등 변화가 상당합니다. 구글은 개발자들이 직접 테스트를 실행하고 피드백을 제공하여 안드로이드 벤치의 미래를 함께 만들어가기를 적극적으로 독려하고 있습니다.
안드로이드 벤치는 100가지 안드로이드 개발 작업 스위트에서 어떤 AI 에이전트가 가장 뛰어난 성능을 보이는지 입증하는 것을 목표로 합니다. 지난 3월 첫 출시 이후, 구글은 비용과 효율성 같은 새로운 지표들을 추가했으며, 오픈 웨이트(open-weight) 모델들도 평가 대상에 포함시키는 등 벤치마크의 범위와 깊이를 넓혔습니다. 이 진화하는 벤치마크는 단지 성능 측정 도구를 넘어, LLM 기반 개발 생태계의 현주소를 보여주는 중요한 이정표가 될 것입니다.
## 충격적인 벤치마크 결과: 제미니는 어디에?
새롭게 업데이트된 안드로이드 벤치 리더보드에는 8개의 강력한 새 모델들이 합류했습니다. 클로드 페이블 5 (Claude Fable 5), 클로드 소네트 5 (Claude Sonnet 5), 클로드 오푸스 4.8 (Claude Opus 4.8) 등 클로드 계열의 최신작들을 비롯해 GLM 5.2, Kimi K2.7 코드, 미니맥스 M3, 큐웬 3.7 플러스 (Qwen 3.7 Plus), 큐웬 3.7 맥스 (Qwen 3.7 Max) 등 각 사의 ‘헤비히터’들이 총출동했습니다. 이들 모델의 등장은 LLM 성능 경쟁이 얼마나 치열한지를 단적으로 보여주는 대목입니다.
그런데 여기서 정말 주목해야 할 부분이 나옵니다. 첫 안드로이드 벤치 출시 당시에도 구글의 AI 모델은 선두권에 들지 못하고 오픈AI의 최신 LLM에 약간 뒤처졌었죠. 하지만 이번 확장된 라인업에서는 **제미니(Gemini)**의 상황이 더욱 안 좋아졌습니다. 새 리더보드에서 구글의 **제미니 3.1 프로(Gemini 3.1 Pro)**는 놀랍게도 5위에 머물렀습니다. GPT 5.4, 클로드 소네트 5, 그리고 클로드 페이블 5에 뒤처지는 결과입니다. 특히 클로드 페이블 5는 테스트에서 84.5%라는 상당한 정확도를 기록하며 기대에 부응하는 모습을 보였습니다.
성능뿐만 아니라 비용 효율성 측면에서도 흥미로운 결과가 나타났습니다. 페이블 5와 GPT 5.5는 최고 성능을 보였지만, 100가지 문제에 대해 10번의 테스트를 실행하는 벤치마크에 무려 130달러 이상의 토큰 비용을 소모했습니다. 반면, 제미니 3.1 프로는 성능은 낮았지만 테스트 실행 비용은 87달러로 상대적으로 저렴했습니다. 하지만 문제는 여기서 그치지 않습니다. 다른 모델보다 저렴하게 작동해야 할 것으로 예상되었던 **제미니 3.5 플래시(Gemini 3.5 Flash)**는 벤치마크를 완료하는 데 훨씬 더 오랜 시간이 걸리면서 리더보드에서 가장 높은 비용(실행당 165달러, 28시간 실행 시간)을 기록했습니다. 싸게 빨리 할 수 있다고 홍보하던 모델이 오히려 가장 비싸고 느리다니, 이 얼마나 아이러니한 상황인가요?

## 구글의 딜레마: 성능과 생태계 주도권 사이에서
이러한 안드로이드 코딩 성능 격차는 구글에게 심각한 문제입니다. 특히 구글이 많은 프로젝트를 에이전틱 개발 방향으로 전환하고 있는 상황에서는 더욱 그렇죠. 구글은 분명 안드로이드 개발자들이 자사의 워크플로우에서 구글의 도구를 사용하기를 바랄 겁니다. 사실 이건 너무나 당연한 바람 아닌가요? 자신들의 플랫폼에서 자신들의 AI가 최고 성능을 보여야 하는 것은 기업 전략의 기본 중 기본일 셈이죠.
필자의 분석/관점: 이 부분에서 주목할 점은, 구글이 보도에 따르면 AI 훈련을 위해 개발자들로부터 애플리케이션 소스 코드를 매입하겠다고 제안하고 있다는 사실입니다. 이는 구글이 자체 모델의 성능 향상에 얼마나 절박한지를 보여주는 방증 아닐까요? 자신들의 AI가 자사 플랫폼에서 경쟁사에 밀린다는 것은 단순히 자존심 문제가 아니라, 미래 개발 생태계의 주도권을 빼앗길 수도 있다는 위기감으로 이어질 수 있습니다. 개발자들이 최고의 성능을 추구하는 것은 당연하며, 만약 구글의 도구가 충분히 좋지 않다면, 개발자들은 주저 없이 다른 선택을 할 것입니다. 이는 장기적으로 구글의 AI 생태계 구축 노력에 큰 걸림돌이 될 수 있습니다. 지금의 성능 차이를 방치한다면, 구글은 자신들의 가장 중요한 자산인 개발자 커뮤니티의 신뢰를 잃을 위험까지 감수해야 할지도 모릅니다.
## 개발자 참여, 위기 극복의 열쇠가 될 수 있을까?
구글은 안드로이드 벤치가 시간이 지남에 따라 새로운 워크플로우를 채택하며 진화할 것이라고 말합니다. 또한, 개발자들이 벤치마크와 개발 작업을 공유함으로써 안드로이드 벤치에 기여하기를 희망하고 있습니다. 이를 위해 구글은 하버(Harbor) 프레임워크로 전환했습니다. 이 테스트 샌드박스는 개발자들이 안드로이드 벤치의 결과를 쉽게 실행, 평가, 공유할 수 있도록 해준다고 합니다.
구글은 이전에 보고된 점수에 일부 변화가 있었음에도 불구하고, 기본 테스트는 변경되지 않은 채 하버로 모든 이전 테스트를 다시 실행하여 LLM 성능에 대한 새로운 기준선을 설정했습니다. 이전 데이터는 아카이브에 온라인으로 유지될 예정입니다.
새롭고 더 쉬워진 프레임워크를 통해 개발자들은 안드로이드 벤치에 대해 자신들의 개발 작업을 실행하고, 공식 테스트에 포함될 수 있도록 제출할 수 있게 되었습니다. 안드로이드 벤치 깃허브(GitHub) 저장소도 새로운 데이터셋과 참여 방법에 대한 지침으로 업데이트되었습니다.
필자의 분석/관점: 개발자 참여를 독려하는 구글의 전략은 양날의 검과 같다고 생각합니다. 긍정적인 측면에서는 커뮤니티의 힘을 빌려 벤치마크의 다양성과 현실성을 높일 수 있습니다. 하지만 한편으로는, 자신들의 모델이 현재 경쟁력을 잃고 있는 상황에서 외부 개발자들의 기여에 의존하려는 모습으로 비칠 수도 있습니다. 과연 개발자 커뮤니티의 자발적인 참여가 구글 LLM의 성능 격차를 메우는 데 결정적인 역할을 할 수 있을까요? 아니면 단순히 벤치마크의 질을 높이는 데 그칠까요? 이는 앞으로 구글이 어떻게 이 프레임워크를 운영하고, 개발자들의 피드백을 실제 모델 개선에 얼마나 효과적으로 반영하는지에 달려 있을 겁니다. 지금 구글에게 가장 필요한 것은 외부의 도움이 아니라, 내부적으로 제미니의 성능을 압도적으로 끌어올리는 혁신이 아닐까 하는 개인적인 견해입니다.
AI 기술 경쟁은 한시도 멈추지 않는 마라톤과 같습니다. 오늘의 선두가 내일의 선두라는 보장은 없습니다. 구글의 안드로이드 벤치 결과는 현재 AI 분야의 냉혹한 현실을 여실히 보여줍니다. 구글이 과연 이 난관을 딛고 다시 AI 선두 주자로서의 입지를 확고히 할 수 있을지, 앞으로의 행보가 더욱 궁금해지는 시점입니다.
출처
- 원문 제목: Google updates Android Bench with new LLMs, but Gemini still lags behind
- 출처: Artificial Intelligence - Ars Technica
- 원문 기사 보러가기