AI 벤치마킹의 판도를 바꿀 25세 청년의 담대한 도전: Vals의 등장
Published Sep 20, 2026
“우리는 새롭고 매우 유능한 모델들이 빠르게 시장에 출시되는 것을 목격했지만, 기존의 학술적 벤치마크는 이러한 최첨단 발전을 따라가지 못하고 있었습니다.” Vals의 공동 창립자인 25세의 라얀 크리슈난(Rayan Krishnan)은 기존 AI 평가 시스템의 근본적인 문제점을 이 한 문장으로 명확히 지적했습니다. 인공지능이 우리 사회의 모든 부분에 스며들고 있는 이 시점에서, 기업들이 광고하는 AI 모델의 능력을 실제로 검증할 수 있는 공정하고 신뢰할 수 있는 벤치마킹 시스템의 부재는 실로 심각한 문제입니다. 그리고 이 문제를 해결하기 위해 팔란티어(Palantir), 마이크로소프트(Microsoft), 스탠포드 AI 랩(Stanford AI Lab)을 거친 이 젊은 기업가는 2024년 Vals를 설립했습니다.
불과 2년도 채 되지 않는 짧은 시간 동안 Vals는 기술 업계에서 주목할 만한 존재감을 확립했으며, 지난해에는 8VC와 블룸버그 베타(Bloomberg Beta)로부터 시드 라운드 투자를 유치하는 데 성공했습니다. 그리고 지난달, 폭발적인 성장을 거듭한 끝에 Andreessen Horowitz가 주도하는 시리즈 A 라운드에서 무려 4천만 달러(약 550억 원)의 투자를 유치하며 업계의 기대를 한몸에 받고 있습니다. 솔직히 말해서, 이 젊은 기업의 급성장은 AI 시대가 요구하는 ‘진정한 검증’에 대한 갈증이 얼마나 컸는지를 여실히 보여주는 방증이 아닐까요?
낡은 잣대가 AI를 가둔다: 벤치마킹의 위기
AI 기업들에게 벤치마킹은 모델의 역량을 검증하고, 나아가 경쟁사보다 우월함을 광고하는 업계의 표준처럼 여겨져 왔습니다. 숫자가 좋게 나오면 곧바로 훌륭한 홍보로 이어지는 거죠. 하지만 문제는 여기에 있습니다. 많은 레거시 벤치마킹 시스템, 즉 오래되고 현대 모델의 역량을 측정하기 위해 만들어지지 않은 시스템들은 기업들이 충분히 ‘속임수’를 쓸 수 있는 여지를 제공한다는 것입니다. 예를 들어, 공개된 벤치마크 테스트에 맞춰 모델을 훈련시켜 높은 점수를 받는 것은 모델의 진정한 실력을 보여주는 것이 아니라, 그저 시험에 최적화된 결과일 뿐입니다. 사실 이건 마치 학교 시험 문제를 미리 알고 답을 외워 만점을 받는 것과 다를 바 없죠.
크리슈난은 과거의 평가 방식이 “매우 추상적인 방식으로 지능을 평가하는 데 초점을 맞췄다”고 말합니다. “모델이 변호사 시험 같은 유형의 테스트를 치를 만큼 충분한 정보를 알고 있는가?”와 같은 질문 말이죠. 하지만 실제 세계에서 AI가 수행해야 할 역할은 단순히 지식을 암기하고 시험을 통과하는 수준을 넘어섭니다. 법률, 금융, 코딩 같은 특정 산업에서 복잡한 작업을 인간과 동등하거나 그 이상의 품질로 수행할 수 있는지가 중요합니다. 이 부분에서 주목할 점은, AI의 성능 평가가 이제 단순히 ‘무엇을 아는가’를 넘어 ‘무엇을 할 수 있는가’ 그리고 더 나아가 ‘어떤 영향을 미 미치는가’로 진화해야 한다는 점입니다. 개인적으로는 이러한 변화가 AI 기술의 발전 속도만큼이나 빠르게 이루어져야 한다고 생각합니다. 그렇지 않으면 기업들은 계속해서 허울뿐인 성능 지표 뒤에 숨어 중요한 문제들을 간과할 수 있기 때문입니다. 신뢰를 잃은 벤치마크는 결국 AI 산업 전체에 대한 회의적인 시각을 불러올 수밖에 없습니다.
Vals의 해법: 현실 세계를 닮은 엄격한 심사
Vals는 바로 이 지점에서 차별화를 꾀합니다. 기존의 많은 벤치마킹 시스템들이 공개된 테스트를 제공하여 기업들이 모델을 훈련시키고 “커닝”할 여지를 주었던 것과 달리, Vals는 구체적인 테스트 자료를 공개하지 않습니다. 이것은 마치 절대 공개되지 않는 수능 문제를 통해 학생의 진짜 실력을 가려내는 것과 비슷하죠.
Vals의 평가 방식은 단순히 AI 모델의 일반적인 지식을 측정하는 것을 넘어섭니다. 대신 법률, 금융, 코딩과 같은 특정 산업과 관련된 복잡한 작업을 수행하는 모델의 능력을 평가합니다. 크리슈난은 “우리가 하는 일은 모델이 실제 어떤 영향을 미치는지 살펴보는 것”이라고 강조하며, “이러한 모델들이 세상에서 무한히 작동했을 때 어떤 부정적인 영향을 미칠지” 분석하려는 희망도 품고 있다고 덧붙였습니다. 긍정적인 결과뿐만 아니라 잠재적인 부정적인 영향까지 분석하는 이러한 접근 방식은 AI 윤리와 안전이 점차 중요해지는 현 시대에 매우 시의적절하며, AI 책임성(AI Accountability)을 높이는 데 핵심적인 역할을 할 것입니다.

Vals가 측정하는 역량은 계속해서 확장되고 있습니다. 전통적인 산업 분야 외에도 스타트업은 더욱 독특한 영역으로 진출하고 있습니다. 크리슈난은 “우리는 재귀적 자기 개선(recursive self-improvement)에 대한 벤치마크를 가지고 있습니다. 또한 정신 건강, 사이버 보안, 생물 보안, 심지어 제네바 협약을 적용하는 방법을 이해하기 위한 무력 충돌의 법(law of armed conflict) 분야에서도 작업하고 있습니다”라고 밝혔습니다. 이처럼 광범위한 영역에서 실제적인 시나리오를 바탕으로 모델을 평가하는 것은 AI가 사회 전반에 미치는 영향을 심층적으로 이해하고 대비하는 데 필수적입니다. 특히, 윤리적, 사회적 중요성이 높은 분야에서의 평가는 AI의 안전한 배치를 위한 중요한 단계를 의미합니다.
여기서 한 가지 궁금증이 생길 수 있습니다. 왜 기업이 자신의 모델이 잘 작동하지 않는다는 사실을 알기 위해 돈을 지불할까요? Vals의 수익 모델은 기업이 자신의 모델을 테스트하기 위해 Vals에 비용을 지불하는 방식입니다. 크리슈난은 이를 마치 학생이 SAT 시험을 치르기 위해 College Board에 비용을 지불하는 방식에 비유했습니다. 이는 단순히 성능을 확인하는 것을 넘어, 효과적인 측정을 통해 기업들이 문제를 해결하고 시간이 지남에 따라 모델을 개선할 수 있도록 돕는 역할을 합니다. 사실 이는 AI 모델 개발 과정에서 필수적인 ‘피드백 루프’를 제공하는 것이며, 결과적으로는 더 나은 제품을 만들게 하는 투자라고 볼 수 있습니다. 이러한 평가는 새로운 AI 모델을 도입하려는 기업들에게 핵심적인 의사 결정 요소가 되고 있습니다.
AI 시대의 신뢰, Vals가 그리는 미래 표준
Vals의 성장세는 놀랍습니다. 최근 밝혀진 바에 따르면, 회사의 매출은 작년 대비 8배나 증가했습니다. 직원 규모 또한 급증하여, 연초 8명으로 시작했던 팀은 이미 25명으로 세 배 이상 늘었습니다. 크리슈난은 스타트업이 성장함에 따라 훨씬 더 큰 사무실로 이전하고 10~15명의 인력을 추가로 고용할 계획이라고 말했습니다. 또한, 최근에는 연방 기관에 모델 평가를 제공하는 프로그램도 시작했습니다. 정부 기관까지 Vals의 평가 시스템을 신뢰하고 있다는 것은 그 시스템의 공정성과 신뢰성이 얼마나 중요한 가치를 가지는지 보여주는 지표입니다.
크리슈난은 Vals의 벤치마킹 시스템이 AI 기업들이 사업을 성장시키고 대중의 신뢰를 구축하는 미래 방식이 될 것이라고 확신합니다. 그는 “AI 기업들이 상장하기 시작했습니다. 스페이스X(SpaceX)는 이미 상장했고, 앤트로픽(Anthropic)은 올해 말 상장 예정이며, 오픈AI(OpenAI)도 곧 상장할 것으로 예상됩니다”라고 언급했습니다. 이어서 “AI 모델이 경제의 핵심 부분이 되고 더 광범위하게 확산됨에 따라, 우리가 수행하는 벤치마크 및 평가는 그 사용을 주도하고, 이들 기업이 공시 자료를 제출하거나 AI에 대한 투자 계획을 논의하는 데 있어 핵심적인 부분이 될 것”이라고 덧붙였습니다.
업계 흐름을 보면 그의 예측은 매우 현실적입니다. AI가 단순한 기술을 넘어 사회 기반 시설의 일부로 자리매김하는 과정에서, 그 성능과 안전성에 대한 투명하고 객관적인 검증은 선택이 아닌 필수가 될 것입니다. Vals와 같은 독립적이고 엄격한 평가 기관의 존재는 AI 시장의 건전한 성장을 이끌고, 기업과 대중 사이에 신뢰의 다리를 놓는 중요한 역할을 할 것이라고 개인적으로는 생각합니다. 결국 Vals는 단순히 AI 모델을 평가하는 것을 넘어, AI 경제의 미래를 위한 새로운 신뢰의 표준을 세우고 있는 것입니다.
출처
- 원문 제목: Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking
- 출처: AI News & Artificial Intelligence | TechCrunch
- 원문 기사 보러가기