ABOUT & METHODOLOGY

소개·데이터 기준

model-insight.euno.news는 오픈 웨이트와 상용 API AI 모델 354개의 벤치마크 538종 점수, 가격, 컨텍스트, 출시 흐름을 모아 비교하는 대시보드입니다. 모든 점수는 원문 출처로 연결되며, 다른 사이트의 수치를 그대로 옮기지 않고 출처별로 구분해 보관합니다.

데이터 출처

  • Hugging Face Hub: 오픈 모델 메타데이터(파라미터·라이선스·아키텍처), 최근 30일 다운로드·좋아요, 벤치마크 데이터셋 리더보드.
  • 공급사 공식 자료: OpenAI·Anthropic·Google·Qwen·Z.ai·Meta 등의 모델 카드와 같은 표에서 공개한 비교 평가, 공식 문서의 컨텍스트 창·가격.
  • Artificial Analysis: 같은 조건으로 측정한 상용 API 비교 스냅샷(지능 지수, 속도, 첫 토큰 지연 등).
  • LLM Stats: 벤치별 공개 리더보드와 모델별 페이지. 모델 페이지는 공급사 시스템 카드·출시 글의 점수를 원문 링크와 함께 모아 두므로, 상용 모델과 LLM Stats에 등록된 오픈 모델의 최신 점수를 매일 여기서 갱신합니다. 자기보고 값은 그대로 "자기보고"로 표시하고 레이팅에서 절반 가중치만 줍니다.
  • OpenRouter 공개 모델 목록: 새 상용 모델을 자동으로 감지합니다. 공식 문서와 벤치가 확인되기 전까지 "자동 감지"로 표시합니다.
  • 관련 소식: ai·openai·anthropic·google·meta·huggingface·qwen·z-ai 등 euno.news 패밀리 사이트에 공개된 최근 90일 기사 중 모델 이름이 나온 기사.

벤치마크 프로필

같은 이름의 벤치라도 문항 집합, 평가 하네스, 측정 주체가 다르면 점수를 직접 비교할 수 없습니다. 그래서 출처·조건별로 프로필을 나누고(현재 599개), 같은 이름의 프로필들을 하나의 벤치마크로 묶습니다. 측정 모델이 가장 많은 프로필을 대표 프로필로 씁니다. 한 모델이 같은 프로필에 여러 번 측정됐으면 검증된 값, 최신 측정, 높은 순위 순으로 하나만 남깁니다.

레이팅 계산

벤치마다 측정된 모델이 다릅니다. 예를 들어 Hugging Face 리더보드에는 오픈 모델이 수십 개 있지만, 공급사 비교표에는 최신 상용 모델 6~9개만 있습니다. 원점수 평균이나 벤치 안 백분위 평균은 이런 표본 차이에 크게 흔들립니다.

그래서 같은 프로필에서 함께 측정된 두 모델의 점수를 한 판의 승부로 보고, 모든 승부를 Bradley–Terry 모델(MM 알고리즘)로 풀어 레이팅을 계산합니다. 체스·LMArena의 Elo와 같은 눈금이며 200점 차이는 기대 승률 약 76%입니다.

  • 측정 모델 3개 이상인 프로필만 씁니다. 속도·비용 프로필은 성능이 아니므로 제외합니다.
  • 모델이 많은 리더보드가 결과를 독점하지 않도록, 한 프로필에서 각 모델이 받는 비교 가중치 합을 1로 맞춥니다(한 쌍 = 1/(n−1)).
  • 검증되지 않은 값(자기보고·제3자 인용)이 낀 비교는 가중치 0.5배입니다.
  • 모든 모델에 가상의 평균 상대와 1승 1패를 더해 전승·전패 모델이 극단으로 가지 않게 합니다.
  • 종합 순위는 가중 비교 수 4 이상, 분야 순위는 2 이상인 모델만 매깁니다. 기준의 두 배 미만이면 "근거 적음"으로 표시합니다.

레이팅은 이 사이트가 모은 벤치 안에서의 상대 위치이며, 실제 업무 품질이나 사용자 선호를 직접 뜻하지 않습니다. 같은 벤치 점수가 없는 두 모델은 다른 모델을 거친 간접 비교라 오차가 큽니다.

가격·컨텍스트

가격은 공급사 공식 정가(100만 토큰당 USD)입니다. 혼합 가격은 입력 3 : 출력 1 비중의 가중 평균입니다. 캐시·배치 할인, 지역별 가격, 추론 토큰 과금은 반영하지 않습니다. 오픈 웨이트 모델은 배포처마다 가격과 컨텍스트가 달라 비워 둡니다.

AI 해설

해설은 내부 LLM 게이트웨이가 작성합니다. 입력은 이 사이트의 레이팅·벤치 점수·가격·출시일뿐이며, 입력에 없는 숫자가 들어간 답은 자동으로 버리고 이전 해설을 유지합니다. 입력이 바뀌었거나 7일이 지나면 다시 씁니다.

갱신 주기

매일 한국 시각 오전에 수집합니다. 한 출처의 수집이 실패하면 그 출처의 이전 값을 유지하고 수집 오류로 기록합니다. 공급사 비교표의 원문 증거 문자열이 바뀌면 그 비교표의 점수만 빼고 나머지는 갱신하며, 사람이 원문을 다시 확인한 뒤 되돌립니다. 새 모델은 공개 점수가 쌓이기 전까지 개요의 "점수 대기 중인 최신 모델"에 표시합니다.

이전 프로젝트

이 사이트는 AI Model Atlas(ai-model-chart)의 수집기·설정·이력을 그대로 옮겨 확장했습니다.