순위보다 먼저, 근거

평가 방법과 출처

무엇을, 언제, 어떤 조건에서 평가했는지 알아야 순위가 도움이 됩니다. AI 114의 데이터를 읽는 방법과 직접 확인할 수 있는 근거를 공개합니다.

검토일 원문 출처 연결자체 종합 점수 없음
검증 근거 다운로드 · JSON순위 살펴보기 →

평가에는 범위가 있습니다

Arena 점수는 해당 평가 조건에서의 선호도를 나타냅니다. 높은 점수가 모든 답변의 정확성이나 내 업무의 성공을 보장하지는 않습니다.

불확실성도 함께 봅니다

점수와 함께 신뢰구간, 순위 범위, 투표 수, 잠정 평가 여부를 읽어야 합니다.

모르는 값은 채우지 않습니다

검증되지 않은 데이터는 공개 순위에서 제외합니다. 다른 모델로 대체하거나 임의의 신뢰도 백분율을 만들지 않습니다.

01 · 무엇을 평가하나요

AI 114의 선호도 순위는 Arena를 주 출처로 사용합니다. Arena의 일반 리더보드는 모델 응답의 쌍대 비교 결과에 Bradley–Terry 모형을 적용해 상대적 선호도를 추정합니다. 시험 정답률이나 모든 용도를 아우르는 지능 점수는 아닙니다. AutoEval처럼 평가 방식이 다른 결과에는 별도 구분이 필요합니다.

텍스트 / 코딩 대화
텍스트 응답 또는 그중 코딩 관련 대화에 대한 선호도입니다. 기존 저장소를 수정하는 소프트웨어 개발 능력을 직접 입증하는 평가는 아닙니다.
웹 개발
Code Arena에서 생성한 웹 애플리케이션을 평가합니다. 일반 코딩 대화나 다른 개발 에이전트 벤치마크와 과제·실행 환경·분류가 다릅니다.
그 밖의 분야
이미지, 영상, 시각 이해, 검색 등은 각 분야의 과제를 평가합니다. 서로 다른 분야의 점수를 같은 척도처럼 비교하지 않습니다.
보정 설정
원본 분야와 보정 전(raw)·스타일 보정(style control) 여부를 명시합니다. raw는 스타일 보정을 하지 않은 값이며, 스타일 보정은 일부 표현 특성을 고려해 선호도를 추정합니다. 어느 쪽도 모든 편향을 제거하지는 못합니다.
독립적인 참고 자료로 Artificial Analysis의 지능·코딩 에이전트 평가를 연결합니다. Intelligence Index는 주로 영어·텍스트 평가입니다. 다른 평가의 점수를 Arena와 합산해 AI 114 종합 점수로 만들지 않습니다.

02 · 순위 숫자 너머를 읽는 법

Arena 점수
같은 평가 안에서의 상대적 추정치입니다. 높을수록 해당 조건에서 선호되었다는 뜻이며, 점수 차이가 지능이나 정답률의 향상 비율은 아닙니다.
95% 신뢰구간
통계 방법에 따른 점수 추정의 불확실성을 나타냅니다. 답변이 95% 확률로 맞는다는 뜻도, 모든 사용자와 용도를 대표한다는 보장도 아닙니다.
순위 / 순위 범위
원순위는 추정 점수를 정렬한 순서입니다. 순위 범위는 점수 신뢰구간을 이용해 계산한 낙관적·비관적 순위입니다. 범위가 겹치면 확실한 우열로 단정하지 않습니다. 겹친다고 실제 능력이 같다는 뜻은 아닙니다.
투표 수
원본에서 집계한 비교 횟수입니다. 고유 사용자 수나 고객 수가 아닙니다. 표본이 늘면 추정의 불확실성은 줄 수 있지만, 참여자·질문·판정의 편향까지 사라지는 것은 아닙니다.
Preliminary
원본이 표시한 잠정 결과입니다. 이 상태를 보존하며, 초기 추정치를 확정 결과처럼 바꾸어 표시하지 않습니다.
AutoEval
인간 선호를 학습한 보상 모델의 자동 평가 신호를 사용하는 방식입니다. 인간 투표 결과와 구분하며, 원본에 순위나 투표 수가 없으면 미제공으로 유지합니다.
확인 가능한 원본의 신뢰구간과 순위 범위를 보존합니다. 확인하지 못한 값은 추정해 채우지 않으며, 편집자의 판단으로 “신뢰도 90%” 같은 점수를 부여하지 않습니다.

03 · 선택한 모델끼리 비교합니다

  • 모델의 정체성을 유지합니다. 버전·추론 설정·평가 구성이 다르면 결과도 다를 수 있습니다. 해당 분야에 정확히 일치하는 모델이 없으면 미등재로 표시하며, 같은 회사의 다른 모델을 대신 넣지 않습니다.
  • 원본 순위를 유지합니다. 검색, 공개 가중치, 회사별 필터는 표시할 행만 바꿉니다. 모델의 원순위를 다시 매기지 않으며, 회사별 최고 모델의 결과를 회사 전체 제품의 순위로 일반화하지 않습니다.
  • 대결 결과를 만들어 내지 않습니다. 점수 차이를 광고성 예상 승률로 환산하거나, 분야별 점수 우세 횟수를 종합 승패처럼 제시하지 않습니다.
  • 조건이 같은 근거를 비교합니다. 출처·분야·보정 설정·자료 기준일이 같은 결과를 비교하고, 점수와 함께 불확실성 및 실제 용도를 고려합니다.

04 · 날짜를 구분하고, 검증 후 공개합니다

원본 기준일은 출처가 공개한 평가 자료의 날짜입니다. 수집 시각은 AI 114가 가져온 시각이며, 검토·배포일은 사이트 작업 시점입니다. 오래된 평가 자료를 오늘 가져왔다고 최신 평가가 되지는 않습니다.

  1. 데이터와 함께 출처 주소, 평가 분야, 보정 설정, 원본 기준일과 수집 시각을 기록합니다.
  2. 요청한 분야의 자료인지, 모델 행과 값이 유효한지 확인합니다. 신뢰구간·원순위·평가 상태를 보존하며, 없는 값을 0으로 바꾸지 않습니다.
  3. 검증을 통과한 데이터만 공개합니다. 원본 구조 변경, 추출 오류, 요청 실패가 마지막으로 확인한 자료를 조용히 덮어쓰지 않도록 합니다.
  4. 갱신 또는 검증 실패 시 마지막 확인 저장본을 날짜·저장본 상태와 함께 제공합니다. 검증된 저장본도 없으면 해당 분야를 제공할 수 없다고 표시합니다.

서버 캐시 때문에 갱신이 지연될 수 있습니다. “수집됨”이나 “캐시됨”은 전달 상태이며, 원본 평가의 최신성을 뜻하지 않습니다. 다운로드 가능한 검증 근거에서 표시 데이터의 출처를 확인할 수 있습니다.

05 · 가격·사용자 수·출시 정보 원칙

가격: 출처, 확인일, 통화, 과금 단위, 적용 조건을 함께 확인합니다. API 토큰 요금과 소비자 구독료는 별개입니다. 입력·출력 단가, 캐시, 모델 설정, 지역, 세금, 이미지·영상 해상도에 따라 실제 비용이 달라질 수 있습니다. 확인되지 않은 가격은 공개하지 않으며, 가격·점수 그래프를 모든 용도의 가성비 순위로 해석하지 않습니다.

사용자 수: 월간·주간 활성 사용자, 가입자, 방문 횟수, 앱 이용자, 특정 지역 집계는 다른 지표입니다. 이를 하나의 사용자 수 순위로 합치지 않습니다. 정확한 지표 정의·집계 범위·기준 기간·출처가 있는 수치만 제시하며, 근거가 없는 수치는 제외합니다.

모델·출시 정보: OpenRouter 등록일은 제공사의 공식 출시일이 아닙니다. 제공 여부, 출시 예정, 구독 조건은 최신 원문 근거가 필요합니다. 소문이나 근거 없는 예정일을 확정 사실로 표시하지 않습니다.

06 · 원문에서 직접 확인하세요

아래 자료는 원본 데이터와 평가의 한계를 설명합니다. 실시간 원문은 검토 후 변경될 수 있으며, 이번 공개 데이터의 근거는 다운로드 파일에 기록합니다.

  1. Arena · 텍스트 리더보드 ↗텍스트 원순위, 원본 기준일, 점수, 순위 범위, 투표 수.
  2. Arena · 코드 / 웹 개발 리더보드 ↗웹 개발 평가 범위, 분야 설정, 평가 상태.
  3. Arena · 순위 계산 방법 ↗원순위와 신뢰구간 기반 순위 범위의 계산·해석.
  4. Arena · 공개된 평가 구현 ↗Bradley–Terry 모형, 신뢰구간, 스타일 보정.
  5. Arena · AutoEval 설명 ↗보상 모델의 자동 평가와 인간 투표의 차이.
  6. Arena · 리더보드 변경 기록 ↗시점 간 비교에 영향을 주는 방법론·데이터 변경 사항.
  7. Artificial Analysis · 지능 평가 방법 ↗보조 출처: 평가 구성·조건·범위. Arena 점수와 합산하지 않습니다.
  8. Artificial Analysis · 코딩 에이전트 평가 방법 ↗보조 출처: 저장소 수정, 터미널 과제, 에이전트 평가.
  9. OpenRouter · 모델 목록 API ↗모델 목록과 가격 필드. 등록 정보는 제공사의 공식 출시 발표가 아닙니다.

정책 검토일: 2026년 9월 24일. 데이터 수집·구조 검증의 성공은 원본 평가를 독립적으로 재현했다는 뜻이 아니며, 모델 답변의 정확성을 인증하지 않습니다.