아티클 목록으로
모델 평가

Vals, 실제 업무 중심 AI 평가의 표준을 노린다

약 3분 소요

서론

AI 모델의 발전 속도가 전통적인 벤치마크의 업데이트 속도를 앞서고 있다. 공개 문제집과 학술 시험은 모델을 비교하는 데 유용하지만, 개발사가 테스트 문항에 맞춰 모델을 조정할 수 있다는 약점이 있다. 높은 점수가 낯선 업무에서도 안정적인 성능을 보장하지는 않는 이유다. 2024년 설립된 스타트업 Vals는 AI 평가를 추상적인 지식 시험에서 실제 업무 결과를 확인하는 방식으로 바꾸려 한다.

핵심 포인트

  • 테스트 자료를 비공개로 유지한다. 구체적인 평가 문항을 공개하지 않아 고정된 문제에 대한 직접 학습을 어렵게 한다.
  • 산업별 업무를 평가한다. 법률, 금융, 코딩 등에서 모델이 사람에 가까운 품질의 결과물을 만들 수 있는지 살핀다.
  • 부정적 결과도 고려한다. 정신건강, 사이버보안, 바이오보안, 재귀적 자기개선, 무력충돌법 등으로 평가 범위를 넓히고 있다.
  • 조달 의사결정에 활용된다. 기업은 약점을 파악하고 모델을 개선하기 위해 평가를 구매하며, 구매자도 결과를 참고하기 시작했다.

공동 창업자 Rayan Krishnan은 기존 평가가 지능을 지나치게 추상적으로 측정한다고 설명한다. 예를 들어 변호사시험과 비슷한 문제를 풀 수 있는지는, 실제 법률 업무에서 신뢰할 수 있는 문서를 작성할 수 있는지와 다르다. 기업이 알고 싶은 것은 모델이 무엇을 알고 있는지만이 아니라, 특정 분야에서 인간이 납품할 만한 수준의 결과를 지속적으로 만들 수 있는지다.

Vals는 능력 점수만 계산하는 데서 그치지 않고, 모델이 널리 배포됐을 때 나타날 수 있는 부정적 영향도 살피려 한다. 이는 벤치마크를 순위표에서 품질 보증과 위험 분석의 결합으로 바꾸는 접근이다. 가장 높은 점수를 받은 모델을 찾는 것뿐 아니라, 어떤 조건에서 실패하고 어떤 오용이나 부작용이 발생할 수 있는지를 파악하려는 것이다.

사업과 산업적 의미

Vals는 AI 기업 등에게 평가 서비스를 판매한다. 모델의 약점을 확인하기 위해 비용을 지불하는 방식은 역설적으로 보일 수 있지만, 신뢰할 수 있는 측정은 버전 비교, 문제 진단, 특정 업무 도입 여부 판단에 도움을 준다. 회사는 매출이 전년의 8배로 늘었고, 인력이 연초 8명에서 25명으로 증가했다고 밝혔다. Andreessen Horowitz가 주도한 4,000만 달러 규모의 시리즈 A를 유치했으며, 앞선 시드 라운드는 8VC와 Bloomberg Beta가 주도했다.

연방 기관을 대상으로 한 모델 평가 프로그램도 시작했다. AI가 공공 서비스, 기업 업무, 금융시장에 더 깊이 들어가면 벤치마크는 마케팅 자료를 넘어 조달과 위험 관리, AI 투자 설명에 영향을 줄 수 있다.

다만 Vals가 진정한 업계 표준이 되기까지는 과제가 있다. 비공개 테스트는 벤치마크에 맞춘 학습을 줄이지만, 외부 검증도 어렵게 만든다. 산업 간 비교 가능성, 위험의 측정 방식, 평가자의 편향, 결과의 재현성을 어떻게 확보할지가 중요하다. 신뢰받는 평가는 어려운 문제를 내는 것만으로 충분하지 않다. 방법론을 설명하고, 결과가 실제 모델 행동과 연결된다는 점을 입증해야 한다.

출처: TechCrunch AI

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RiskChainBench, 난독화 메시지 복원부터 웹 증거 조사까지 평가
모델 평가
cctest.ai
모델 평가

RiskChainBench, 난독화 메시지 복원부터 웹 증거 조사까지 평가

RiskChainBench는 숨겨진 플랫폼 유도 메시지를 복원하고 올바른 사이트를 찾아 증거 기반 위험 보고서를 작성하는 능력을 하나의 연쇄 과제로 평가한다. 결과는 텍스트 복원뿐 아니라 안정적인 탐색과 위험 판단도 주요 병목임을 보여준다.

더 보기