← 문서 목록

벤치마크 데이터 출처와 라이선스

모델 상세에 표시되는 벤치마크 점수의 출처·라이선스·수집 주기와 GET /models/benchmarks.

모델 상세 페이지의 벤치마크 섹션에 나오는 점수는 전부 외부에서 공개한 값입니다. everyais 는 벤치마크를 직접 실행하지 않고, 아래 소스가 발표한 숫자를 그대로 옮겨 출처와 함께 표시합니다.

소스와 라이선스

소스라이선스출처수집
Epoch AI Benchmarking HubCC-BYhttps://epoch.ai/benchmarks자동
LMArena LeaderboardCC-BY-4.0https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset자동
공급사 자체 보고vendor-reported점수마다 다름 — 그 점수의 원문 링크수기
  • Epoch AI 에서는 GPQA Diamond, SWE-Bench Verified, FrontierMath, HLE 등 공개 평가 결과를 가져옵니다. 대부분 퍼센트(percent)지만 Epoch Capabilities Index(eci) 하나는 퍼센트가 아닙니다 — 62~162 범위의 자체 지수라 단위가 raw 이고, 화면에도 "자체 척도" 로 표기합니다. 148.5 는 148.5% 가 아닙니다.
  • LMArena 에서는 text · vision · webdev 리더보드의 종합(overall) Elo 레이팅을 가져옵니다. 단위는 elo 이며 0~100 척도가 아닙니다 — 퍼센트 점수와 나란히 두고 크기를 비교하면 안 됩니다. 같은 조직의 대화(conversation) 데이터셋은 라이선스가 달라 사용하지 않습니다.
  • 공급사 자체 보고는 모델 제공사가 자사 발표 자료에 실은 값을 사람이 직접 입력한 것입니다. 제3자 검증을 거치지 않았으므로, 같은 벤치마크에 수집 소스의 값이 함께 있으면 그쪽을 함께 보세요.

수집은 매주 월요일(UTC) 모델 동기화 직후 자동으로 한 번 실행됩니다. 각 소스는 최신 스냅샷 하나만 유지하므로, 표시되는 값은 항상 마지막 수집 시점의 발표값입니다.

표기 원칙

  • 소스의 원문 모델 표기를 지우지 않고 보존합니다. 응답의 source_model_id 는 소스가 쓴 표기 그대로이고(예: Claude Opus 5 (High)), 화면에도 함께 보여줍니다. 같은 계열의 다른 변형·다른 스냅샷에서 나온 점수를 구별할 수 있는 유일한 단서이기 때문입니다.
  • 점수를 모델에 붙이는 매핑은 보수적입니다. 정규화한 표기가 정확히 일치할 때만 자동으로 연결하고, 나머지는 사람이 확인해 승인합니다. 승인되지 않은 매핑의 점수는 공개되지 않습니다. 그래서 어떤 모델은 점수가 하나도 없을 수 있고, 그것은 정상입니다.
  • 숫자를 재계산하거나 보정하지 않습니다. 반올림 표기만 화면에서 하고, 원본 값은 API 로 그대로 나갑니다.
  • 소스를 비활성화하면 그 소스의 점수는 다음 응답부터 빠집니다. 위 캐시 정책 때문에 이미 내려간 응답은 최대 5분까지 이전 값을 보여줄 수 있습니다.

GET /models/benchmarks

한 모델에 붙은 벤치마크 점수를 반환합니다. 인증이 필요 없고 /v1 접두사도 없습니다. IP 당 60 req/min 이며 응답에는 Cache-Control: public, max-age=60, s-maxage=300, stale-while-revalidate=300 이 붙습니다.

레이트리밋 60 req/min 은 IP 당이면서 경로 묶음이 함께 쓰는 예산입니다. /models/estimate, /models/stats, /models/benchmarks, /models/benchmarks/overview, /models/rankings, /models/apps, /models/apps/top, /models/changes, /models/feed.xml 가 한 버킷을 공유하므로, 한 화면에서 여러 개를 연달아 부르면 그만큼 예산이 빨리 줄어듭니다. /models/catalog별도 버킷이라 상세 조회가 예산을 다 써도 카탈로그 조회는 계속됩니다.

승인·활성 모델만 조회할 수 있고, 그 밖의 slug 는 404 model_not_found 입니다. 모델 slug 는 슬래시를 포함하므로 경로가 아니라 쿼리 파라미터로 보냅니다.

curl "https://api.everyais.com/models/benchmarks?model=everyais/claude-opus-5"
{
  "model": "everyais/claude-opus-5",
  "scores": [
    {
      "benchmark_key": "arena-text",
      "score": 1441,
      "score_unit": "elo",
      "source_name": "LMArena Leaderboard",
      "source_url": "https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset",
      "source_model_id": "claude-opus-5",
      "measured_at": "2026-08-11T00:00:00.000Z"
    },
    {
      "benchmark_key": "gpqa-diamond",
      "score": 83.4,
      "score_unit": "percent",
      "source_name": "Epoch AI Benchmarking Hub",
      "source_url": "https://epoch.ai/benchmarks",
      "source_model_id": "Claude Opus 5 (High)",
      "measured_at": null
    }
  ]
}
필드설명
benchmark_key정규화한 벤치마크 식별자 (gpqa-diamond, swe-bench-verified, arena-text 등)
score소스가 발표한 값 그대로
score_unitpercent · elo · raw. 단위가 다른 점수끼리 크기를 비교하지 마세요
source_name저장된 출처 표시명. 번역되지 않고 어드민이 바꿀 수 있으므로 이 문자열로 분기하지 마세요(source_url 이나 benchmark_key 로 판단합니다)
source_url원문 링크. 공급사 자체 보고는 그 점수의 원문, 수집 소스는 데이터셋 출처 표기 페이지입니다. http(s) 주소가 없으면 null 입니다
source_model_id소스의 원문 모델 표기(가공하지 않음)
measured_at소스가 밝힌 측정·발표 시점. 없으면 null
  • scoresbenchmark_key 오름차순이며, 같은 키에 여러 소스가 있으면 점수가 높은 순입니다.
  • 점수가 없으면 404 가 아니라 빈 배열입니다. 수집 대상이 아닌 모델이 대부분이라, "점수 없음" 과 "모델 없음" 은 구별돼야 합니다.

GET /models/benchmarks/overview

같은 데이터를 벤치마크 기준으로 뒤집은 조회입니다(everyais.com/benchmarks 가 씁니다). 벤치마크 키마다 리더보드 하나가 나오고, 파라미터는 없습니다 — 탭에 필요한 리더보드가 응답 하나에 다 들어 있습니다. 인증·레이트리밋·캐시 정책은 위와 같습니다.

curl "https://api.everyais.com/models/benchmarks/overview"

행에는 점수와 함께 output_price_per_1m(출력 100만 토큰당 기준 원가)과 avg_gen_tok_per_sec(최근 30일 평균 생성 속도)이 실립니다. 둘 다 모르면 null 이고 0 이 아닙니다 — 토큰 과금이 아닌 모델은 출력 단가가 없고, 스트리밍 측정 표본이 100건 미만이면 속도를 내지 않습니다.

  • 한 모델은 한 리더보드에 한 행입니다. 같은 벤치마크를 여러 소스가 발표했으면 독립 평가 소스가 공급사 자체 보고를 이기고, 그다음은 측정 시점이 최신인 쪽입니다. 점수가 높은 쪽을 고르지 않습니다 — 그러면 리더보드가 "각 모델의 가장 잘 나온 발표치" 목록이 됩니다. vendor_reported 로 구분하세요.
  • 리더보드에는 score_unit 이 같은 행만 들어갑니다. 1441 Elo 와 83.4 퍼센트를 한 줄로 세우면 순위 자체가 거짓이 되므로, 단위가 다른 점수는 그 리더보드에서 빠집니다.
  • 리더보드당 상위 50개 모델까지이고, 리더보드는 다루는 모델이 많은 순서입니다.

재사용할 때

Epoch AI 와 LMArena 데이터는 CC-BY 계열이라 출처를 표기하면 재사용할 수 있습니다. 이 API 로 받은 값을 다시 게시할 때는 위 표의 소스 이름과 출처 링크를 함께 남겨 주세요. 공급사 자체 보고 값은 각 공급사의 발표 자료를 따르므로 source_url 의 원문 조건을 확인해야 합니다.