Login
Back to Blog
한국어Comparison

Claude Opus 5 vs GPT-5.6-SOL: 지능 정확도 10문항 검증, 핵심 답변 모두 10/10

Claude Opus 5와 GPT-5.6-SOL을 동일 API의 10개 검증 과제로 비교했습니다. 두 모델 모두 핵심 답변 10/10을 기록했으며, 코드 숨은 테스트, 전체 요구사항 완수, 엄격한 JSON 준수를 별도로 평가합니다.

C
Crazyrouter Team
July 29, 2026 / 4 views
Share:
Claude Opus 5 vs GPT-5.6-SOL: 지능 정확도 10문항 검증, 핵심 답변 모두 10/10

Claude Opus 5 vs GPT-5.6-SOL: 프로덕션 QA로 검증한 10개 과제, 핵심 정확도는 동률#

Claude Opus 5와 GPT-5.6-SOL 지능 정확도 벤치마크

모델을 프로덕션에 투입할 때는 최종 답만 맞는다고 충분하지 않다. 응답이 중간에 잘리지 않았는지 finish_reason을 확인해야 하고, 생성된 코드는 실제 숨은 테스트를 통과해야 하며, JSON은 설명이나 코드 블록 없이 바로 파싱할 수 있어야 한다.

이번 비교에서는 Crazyrouter의 동일한 OpenAI-compatible endpoint를 통해 Claude Opus 5와 GPT-5.6-SOL에 10개의 지능 과제를 수행하게 했다. 별도로 엄격한 JSON 출력 과제를 추가해 지시 준수와 구조화 출력 안정성도 확인했다.

평가는 다음 질문에 초점을 맞췄다.

  • 수학 답과 물리 모델이 정확한가?
  • 잘못된 전제나 불충분한 통계적 결론을 식별하는가?
  • 생성한 Python 코드가 숨은 테스트를 통과하는가?
  • 문제에 포함된 모든 하위 요구 사항을 빠짐없이 완료하는가?
  • JSON 응답을 별도 정제 없이 바로 파싱할 수 있는가?
  • finish_reason이 정상 종료를 나타내는가?

결과는 단순한 승패보다 프로덕션 QA 관점에서 해석할 가치가 있다.

  • 핵심 답변 정확도: Opus 5 10/10, GPT-5.6-SOL 10/10
  • 모든 하위 요구 사항까지 완전히 완료: Opus 5 9/10, GPT-5.6-SOL 10/10
  • Python 알고리즘 과제의 숨은 테스트: 두 모델 모두 2/2
  • 엄격한 JSON 최초 제출: Opus 5 0/1, GPT-5.6-SOL 1/1
  • Opus 5는 이후 두 번의 추가 재시도에서도 JSON 외의 텍스트를 덧붙여 형식 요구를 충족하지 못했다.

따라서 이번 결과는 핵심 정확도는 동률이지만, 완전한 과제 납품과 구조화 출력의 안정성은 동일하지 않았다고 정리하는 것이 정확하다.

API Key를 만들고 실제 업무 문제로 재검증하기

빠른 답변#

Claude Opus 5와 GPT-5.6-SOL 정확도 결과 카드

질문이번 테스트 결과
핵심 지능 과제의 답은 어느 쪽이 더 정확했나?동률: 두 모델 모두 10/10
모든 하위 요구 사항을 더 많이 완료한 모델은?GPT-5.6-SOL 10/10, Opus 5 9/10
코드 신뢰성은 어느 쪽이 더 높았나?이번에는 동률. 두 알고리즘 과제 모두 숨은 테스트 통과
Opus 5가 어려운 확률 문제를 틀렸나?아니다. 핵심 답은 정확했지만 max_tokens=3200에서 출력이 잘려 마지막 설명 요구를 누락했다.
엄격한 JSON 지시를 더 안정적으로 지킨 모델은?이번에는 GPT-5.6-SOL. Opus 5는 최초 응답과 추가 재시도 2회, 총 3회 모두 추가 텍스트 또는 코드 블록을 포함했다.
이 결과로 GPT가 전반적으로 더 똑똑하다고 할 수 있나?아니다. 핵심 추론 정확도와 형식·지시 준수는 분리해 평가해야 한다.
응답 속도도 평가했나?아니다. 네트워크와 라우팅 영향을 분리할 수 없어 지능 점수에서 제외했다.

수학·물리·알고리즘의 핵심 정확성이 중요한 업무라면 이번 표본에서 두 모델 간 뚜렷한 격차는 없었다. 반면 응답 본문이 반드시 순수 JSON이어야 하거나, 단 한 번의 응답에서 모든 하위 요구 사항을 완료해야 한다면 이번 테스트에서는 GPT-5.6-SOL의 납품 완성도가 더 높았다.

네트워크 지연 시간을 지능 점수에서 제외한 이유#

모델 API의 종단 간 응답 시간에는 모델의 추론 능력 외에도 여러 변수가 개입한다.

  • 게이트웨이에서 각 상위 공급자까지의 네트워크 경로
  • 요청 시점의 채널 부하와 계정별 속도 제한
  • 캐시 적중 여부
  • 실제로 요청을 처리한 서비스 인스턴스
  • 상위 공급자가 reasoning token을 집계하거나 숨기는 방식

단일 요청이 몇 초 더 빨랐다는 사실은 모델의 추론 능력이 더 우수하다는 증거가 아니다. 그것은 네트워크 상태나 라우팅 결과, 순간적인 서버 부하를 측정한 것일 수 있다.

속도를 비교하려면 최소한 동일한 상위 공급자와 실행 조건을 고정하고, 충분한 횟수로 반복한 뒤 분산과 신뢰구간을 함께 보고해야 한다. 이번 테스트에는 그런 조건이 마련되지 않았으므로 네트워크 지연 시간을 지능 점수에서 명시적으로 제외했다.

따라서 이 글은 어떤 모델도 속도 승자로 선정하지 않는다. 지연 시간은 운영 관측 지표로는 유용하지만, 이번과 같은 지능 정확도 평가에 혼합하면 결과를 왜곡할 수 있다.

현재 제공되는 모델과 접속 범위는 Crazyrouter 모델 목록에서 확인할 수 있다. 비용 계획은 지능 평가와 분리해 Crazyrouter pricing을 참고해야 한다.

테스트 환경과 채점 기준#

테스트 전 모델 목록 API를 호출해 정확한 모델 ID 두 개가 노출되는지 확인했다.

text
GET https://cn.crazyrouter.com/v1/models

claude-opus-5
gpt-5.6-sol

실제 요청에는 다음 endpoint를 공통으로 사용했다.

text
POST https://cn.crazyrouter.com/v1/chat/completions

각 테스트 배치에서 두 모델에 동일한 system prompt, user prompt, temperature, max_tokens를 적용했다. 외부 도구는 사용하지 않았으며, HTTP 200 응답만으로 과제 통과를 판정하지 않았다.

채점은 세 단계로 나눴다.

  1. 핵심 답변 정확도
    주요 수치, 결론, 알고리즘 동작이 정확한지 평가했다.

  2. 완전한 과제 통과율
    문제에 명시된 모든 하위 요구 사항을 빠짐없이 완료했는지 확인했다.

  3. 기계 검증 가능성
    코드는 숨은 테스트를 통과하는지, JSON은 별도 정제 없이 직접 파싱되는지 검사했다.

자동 문자열 채점 후에는 사람이 다시 검토했다. LaTeX 표현, 대소문자, 정확한 분수와 반올림된 소수의 차이 때문에 거짓 음성이 발생할 수 있기 때문이다.

예를 들어 GPT-5.6-SOL은 확률 문제에서 기준 답안의 분수 표현을 그대로 복사하지 않았지만 동치인 수식과 정확한 소수를 제시했다. Opus 5는 물리 문제의 0.302 m를 유효숫자 두 자리인 0.30 m로 썼지만, 이를 오답으로 볼 근거는 없다.

10개 지능 과제 결과#

과제검증 기준Claude Opus 5GPT-5.6-SOL
정확한 마르코프 연쇄E[τ]=5, E[τ²]=43, Var(τ)=18정확정확
2자유도 진동자고유진동수 2개, 진폭 2개, 위상 2개정확정확
제약 조건 탐색유일한 순서 A,C,E,B,D정확정확
Cantelli 오류 수정확률은 식별 불가능하며 상한은 0.2정확정확
Python 순환 탐지 검토bug, DAG 반례, 최소 수정정확정확
실험 설계동일 문제 짝짓기, 난이도 통제, 신뢰구간정확정확
편향 동전의 HHTH 대기 시간기댓값 약 12.6547과 올바른 상태 전이핵심 답은 정확하나 출력이 잘려 마지막 설명 누락정확하고 완전함
로그 집계 알고리즘시간 구간, 실패 이벤트, 캐시 비율, 상위 사용자숨은 테스트 통과숨은 테스트 통과
비탄성 충돌과 용수철v1≈6.10, v2≈2.44, x≈0.302정확정확
안정적 라우팅 알고리즘cost, latency, reliability와 사전식 순서 규칙숨은 테스트 통과숨은 테스트 통과

이 표에서 가장 중요한 구분은 핵심적으로 맞았는가요구된 결과를 완전히 납품했는가가 서로 다른 평가 항목이라는 점이다.

Opus 5는 10개 과제의 핵심 답을 모두 맞혔다. 그러나 확률 문제에서 마지막 설명 하나가 누락되어 완전한 과제 통과율은 9/10이었다. GPT-5.6-SOL은 핵심 정확도와 완전한 과제 통과율이 모두 10/10이었다.

가장 어려운 확률 문제: 12.6547은 맞았지만 응답은 완전하지 않았다#

문제의 목표 패턴은 HHTH이며 편향 동전의 확률은 다음과 같다.

text
P(H)=0.62
P(T)=0.38

문제는 최장 접두사·접미사 일치 상태를 사용해 방정식을 세우고, 다음 두 가지 함정을 명시적으로 설명하도록 요구했다.

  • 상태 HH에서 다시 H가 나왔을 때 왜 상태가 여전히 HH인가?
  • 기대 대기 시간을 왜 단순히 1/P(HHTH)로 계산할 수 없는가?

두 모델 모두 올바른 기대 대기 시간을 계산했다.

text
E[N] ≈ 12.6547

GPT-5.6-SOL은 전체 유도를 완료했고, 패턴에 중첩이 존재하므로 다음 관계가 성립한다고 설명했다.

text
E[N] = 1 / P(HHTH) + 1 / P(H)

Opus 5도 올바른 상태 정의, 방정식, 정확한 분수와 소수 결과를 제시했다. 하지만 응답의 최종 상태는 finish_reason=length였다. 출력이 부가적인 상태별 기대값을 설명하던 중 종료되면서, 마지막 요구 사항인 “왜 확률의 역수를 직접 사용하면 안 되는가”에 대한 설명이 빠졌다.

이때 적용해야 할 채점 원칙은 명확하다.

최종 수치가 정확하면 핵심 답변 정확도에는 포함할 수 있다. 그러나 문제의 모든 요구 사항을 완료하지 않았다면 완전한 과제 통과로 처리할 수 없다.

이 응답에는 max_tokens=3200이 적용됐다. 따라서 프로덕션에서는 답변 본문만 저장해서는 안 된다. 최소한 원문 응답, finish_reason, 사용한 출력 예산을 함께 기록해야 한다. 앞부분이 정확하다는 이유만으로 전체 작업이 완료됐다고 판단해서는 안 된다.

이는 기존의 max_tokens 잘림 재검증에서도 확인할 수 있는 동일한 방법론적 문제다.

실행 가능한 코드 검증: 코드 모양이 아니라 숨은 테스트로 평가#

코드 생성 결과는 길이, 주석의 양, 함수 분리 방식만 보고 평가하기 어렵다. 보기 좋은 코드가 반드시 정확한 코드는 아니며, 짧은 구현도 모든 경계 조건을 만족할 수 있다.

이번 테스트에서는 두 모델이 생성한 출력을 각각 .py 파일로 저장하고 격리 모드에서 동일한 테스트를 실행했다.

로그 집계 알고리즘#

로그 집계 함수는 다음 조건을 모두 처리해야 했다.

  • 반개방 시간 구간
  • 성공 요청과 실패 요청에 서로 다른 집계 규칙 적용
  • 사용자 또는 모델 값이 누락된 이벤트
  • cache hit rate
  • cost가 같을 때 사용자 이름의 사전식 순서 적용
  • 입력 객체를 변경하지 않는 불변성

두 모델의 구현 모두 숨은 테스트를 통과했다.

신뢰성 제약이 있는 안정적 라우팅#

두 번째 함수는 경로 탐색 과정에서 다음 조건을 함께 처리해야 했다.

  • 총비용이 가장 낮은 경로 선택
  • 비용이 같으면 latency가 가장 낮은 경로 선택
  • latency까지 같으면 reliability가 가장 높은 경로 선택
  • 모든 조건이 같으면 경로의 사전식 순서로 선택
  • banned nodes 처리
  • 최대 hops 제한
  • 최소 reliability 제한
  • 잘못된 edge 처리

두 모델 모두 이 과제의 숨은 테스트를 통과했다.

따라서 코드 부문의 결과는 두 모델 모두 2/2로 동률이다. 코드가 더 길거나 설명이 더 상세하다는 이유로 별도의 우승 모델을 정하지 않았다.

GPT-5.6-SOL의 다른 고난도 물리·의존성 알고리즘 결과는 GPT-5.6-SOL vs GPT-5.5 고난도 물리 및 코드 테스트에서 확인할 수 있다.

엄격한 JSON: 계산 정확도와 지시 준수를 분리해서 봐야 한다#

별도의 엄격한 JSON 과제에서는 사고 데이터를 하나의 객체로 압축하되 다음 조건을 지키도록 요구했다.

text
exactly one JSON object and no Markdown

두 모델 모두 실패율, 장애 책임 채널, 재시도 후 복구되지 않은 요청 수를 정확하게 계산했다. 차이는 JSON 바깥의 출력에서 발생했다.

  • GPT-5.6-SOL은 첫 시도에 JSON만 반환했고 json.loads로 직접 파싱할 수 있었다.
  • Opus 5는 첫 시도에 코드 블록과 Verification을 추가했다.
  • Opus 5의 첫 번째 추가 재시도에서는 압축된 JSON 뒤에 Verification을 덧붙였다.
  • Opus 5의 두 번째 추가 재시도에서는 다시 코드 블록과 설명을 추가했다.

수치로 정리하면 엄격한 JSON 최초 제출은 GPT-5.6-SOL 1/1, Opus 5 0/1이다. Opus 5는 그 뒤 두 번 더 재시도했지만 계속 형식 요구를 충족하지 못했다.

이는 “계산을 못했다”는 의미가 아니다. Opus 5가 생성한 필드와 값은 정확했다. 실패 원인은 데이터 오류가 아니라 출력 형식과 지시 준수다.

이 차이를 핵심 지능 정확도에 섞어 하나의 총점으로 만들면 다음 두 문제를 구분할 수 없게 된다.

  1. 모델이 올바른 값을 계산했는가?
  2. 모델이 지정된 구조만 출력했는가?

프로덕션에서는 최소한 다음과 같은 로컬 검증기를 둘 수 있다.

python
import json

REQUIRED_KEYS = [
    "window",
    "total_requests",
    "failed_requests",
    "failure_rate_pct",
    "provider_owned_failures",
    "customer_owned_failures",
    "recovered_by_retry",
    "unrecovered_failures",
    "root_cause",
    "action",
]


def parse_incident_json(raw: str) -> dict:
    payload = json.loads(raw)
    if list(payload) != REQUIRED_KEYS:
        raise ValueError("unexpected schema or key order")
    if payload["failed_requests"] != 84:
        raise ValueError("failed request count mismatch")
    return payload

system prompt만으로 구조화 출력을 보장할 수는 없다. 더 안전한 구성은 다음 세 요소를 함께 적용하는 것이다.

  • 공급자가 지원하는 구조화 출력 매개변수 사용
  • 응답에 대한 로컬 schema 검증
  • 파싱 또는 검증 실패 시 재시도하거나 다른 모델로 전환

즉, 구조화 출력은 프롬프트 작성만의 문제가 아니라 애플리케이션 계층의 검증 문제다.

같은 API로 재검증하는 방법#

다음은 OpenAI-compatible chat completions endpoint를 사용하는 최소 실행 예제다. API endpoint 자체에는 UTM 매개변수를 추가하지 않는다.

python
import os
import requests

BASE_URL = "https://cn.crazyrouter.com/v1"
API_KEY = os.environ["CRAZYROUTER_API_KEY"]


def ask(model: str, prompt: str, max_tokens: int = 4000) -> dict:
    response = requests.post(
        f"{BASE_URL}/chat/completions",
        headers={
            "Authorization": f"Bearer {API_KEY}",
            "Content-Type": "application/json",
        },
        json={
            "model": model,
            "messages": [
                {"role": "system", "content": "Answer accurately and follow every requested constraint."},
                {"role": "user", "content": prompt},
            ],
            "temperature": 0.2,
            "max_tokens": max_tokens,
        },
        timeout=600,
    )
    response.raise_for_status()
    return response.json()


for model in ("claude-opus-5", "gpt-5.6-sol"):
    result = ask(model, "Your benchmark prompt here")
    choice = result["choices"][0]
    print(model, choice.get("finish_reason"), choice["message"].get("content", ""))

실제 회귀 테스트에서는 답변 텍스트뿐 아니라 다음 항목도 함께 저장하는 편이 좋다.

  • response ID
  • returned model
  • 원본 응답
  • finish_reason
  • 요청에 사용한 max_tokens
  • 로컬 검증 결과
  • 코드 테스트 또는 schema 검증의 실패 원인

현재 모델이 노출되는지는 Crazyrouter 모델 목록에서 확인한 뒤, 실제 업무 prompt로 소규모 회귀 테스트를 진행할 수 있다.

프로덕션 도입을 위한 QA 지침#

두 모델 모두 후보로 고려할 수 있는 작업#

  • 명확한 기준 답안이 있는 수학·물리 문제
  • 단위 테스트를 실행할 수 있는 Python 알고리즘
  • 잘못된 전제나 불충분한 통계 결론을 식별하는 작업
  • 로컬 검증기로 성공 여부를 판정할 수 있는 업무 흐름

이번 10개 과제에서 두 모델 모두 핵심 정확도 10/10을 기록했고, 코드 과제의 숨은 테스트도 각각 2/2를 통과했다. 따라서 검증 가능한 작업이라면 두 모델 모두 후보군에 포함할 근거가 있다.

이번 결과에서 GPT-5.6-SOL을 우선 검토할 수 있는 작업#

  • 모든 하위 요구 사항을 한 번의 응답에서 완료해야 하는 작업
  • 응답 원문이 반드시 순수 JSON이어야 하는 연동
  • 설명문에서 구조화 데이터를 다시 추출하는 후처리를 줄여야 하는 시스템

이 판단은 GPT-5.6-SOL의 핵심 추론 정확도가 더 높았다는 뜻이 아니다. 두 모델의 핵심 정확도는 동일한 10/10이었다. 차이는 이번 표본에서 확인된 완전한 과제 납품과 JSON 형식 준수에 있다.

Opus 5를 사용할 때 추가할 보호 장치#

  • 긴 유도 과정에는 충분한 max_tokens 할당
  • 모든 응답에서 finish_reason 검사
  • JSON을 하위 시스템에 전달하기 전에 반드시 파싱
  • 추가 Markdown, 코드 블록, 설명 텍스트가 포함됐을 때의 명시적 대체 경로 구성
  • 잘림이나 schema 위반 시 재시도 또는 모델 전환
  • 핵심 정답과 전체 요구 사항 완료 여부를 별도로 기록

Opus 5의 확률 문제는 핵심 계산이 틀린 사례가 아니다. max_tokens=3200 경계에서 finish_reason=length로 끝나면서 마지막 설명이 누락된 사례다. 이를 추론 오류로 분류하면 원인을 잘못 진단하게 된다.

Claude 계열 내부의 납품 특성을 추가로 비교하려면 Claude Opus 5 vs Claude Fable 5 실제 API 테스트를 참고할 수 있다.

프로덕션 체크리스트#

모델을 실제 시스템에 연결할 때는 단일 “정답률” 대신 다음 항목을 개별적으로 수집하는 것이 좋다.

  • 핵심 답변이 정확한가?
  • 모든 하위 요구 사항을 완료했는가?
  • finish_reason이 예상한 종료 상태인가?
  • 응답이 max_tokens 경계에서 잘리지 않았는가?
  • JSON이 json.loads로 직접 파싱되는가?
  • 필수 키, 자료형, 값 범위가 schema와 일치하는가?
  • 생성된 코드가 공개 테스트뿐 아니라 숨은 테스트도 통과하는가?
  • 입력 객체의 불변성과 경계 조건을 지키는가?
  • 실패 시 재시도 또는 모델 전환 경로가 있는가?
  • 네트워크 지연 시간과 지능 정확도를 별도 지표로 기록하는가?

FAQ#

Claude Opus 5와 GPT-5.6-SOL 중 어느 모델이 더 똑똑한가?#

이번 10개 과제에서는 두 모델 모두 핵심 답변 정확도 10/10을 기록했다. 따라서 이 결과만으로 어느 한쪽이 전반적으로 더 똑똑하다고 결론 내릴 수 없다.

완전한 과제 통과율은 왜 동률이 아닌가?#

Opus 5의 고난도 확률 문제 응답이 max_tokens=3200에서 잘렸기 때문이다. 기대값 12.6547과 상태 방정식은 정확했지만, 마지막 설명 요구를 완료하지 못했고 finish_reason=length가 반환됐다. 따라서 핵심 정확도에는 포함되지만 완전한 과제 통과에는 포함되지 않는다.

핵심 정확도와 완전한 과제 납품은 어떻게 다른가?#

핵심 정확도는 주요 수치, 결론, 알고리즘 동작이 맞는지를 평가한다. 완전한 과제 납품은 여기에 더해 문제에서 요구한 모든 설명, 형식, 하위 항목까지 빠짐없이 제공했는지를 평가한다. 정답을 계산했더라도 마지막 설명이나 필수 필드가 빠지면 완전한 납품은 아니다.

엄격한 JSON 실패를 지능 오류로 봐야 하나?#

수학 또는 추론 오류로 직접 분류해서는 안 된다. Opus 5는 JSON의 필드와 값을 정확하게 계산했지만 JSON 외의 코드 블록이나 Verification 설명을 추가했다. 따라서 더 정확한 분류는 형식 및 지시 준수 실패다.

Opus 5는 JSON 재시도에서 성공했나?#

아니다. 최초 응답은 엄격한 JSON 기준에서 0/1이었고, 이후 두 번의 추가 재시도에서도 JSON 뒤의 Verification 또는 코드 블록과 설명을 추가했다. 즉, 총 3회 모두 순수 JSON만 반환하라는 요구를 지키지 못했다.

두 코드 과제는 어떻게 평가했나?#

각 모델의 출력을 Python 파일로 저장하고 동일한 숨은 테스트를 실행했다. 테스트에는 경계 조건, 정렬 규칙, 잘못된 입력, 입력 불변성 등이 포함됐다. 두 모델 모두 두 과제를 통과해 각각 2/2를 기록했다.

왜 응답 속도 승자를 발표하지 않았나?#

종단 간 응답 시간은 네트워크 경로, 채널 부하, 캐시, 상위 공급자 상태, 라우팅된 인스턴스 등에 영향을 받는다. 동일한 상위 환경을 고정하고 충분히 반복하지 않은 단일 지연 시간은 지능 정확도를 나타내지 않는다. 그래서 이번 점수에서는 네트워크 지연 시간을 제외했으며 속도 승자를 정하지 않았다.

finish_reason을 반드시 검사해야 하는 이유는 무엇인가?#

본문에 올바른 답이 포함돼 있어도 응답이 중간에 끝났을 수 있기 때문이다. 이번 Opus 5 사례처럼 finish_reason=length이면 핵심 답을 계산한 뒤에도 마지막 요구 사항이 누락될 수 있다. 프로덕션에서는 본문과 함께 finish_reason을 성공 판정 조건에 포함해야 한다.

10개 과제만으로 장기 모델을 선정해도 되나?#

충분하지 않다. 이번 결과는 작지만 재현 가능한 능력 표본이다. 실제 도입 전에는 업무 문제를 20–50회 반복해 핵심 정확도, 완전한 과제 통과율, 코드 테스트 통과율, 형식 위반률을 각각 집계하는 것이 좋다.

자체 모델 비교는 어떻게 시작해야 하나?#

실제 업무를 대표하는 prompt 10–30개를 먼저 선정하고, 각 문제에 기계적으로 실행 가능한 통과 기준을 정의해야 한다. 이후 동일한 API 조건으로 두 모델에 같은 입력을 보내고 결과를 비교한다. 결론을 먼저 정한 뒤 그 결론을 뒷받침하는 사례만 선택해서는 안 된다.

구조화 출력은 prompt만 잘 쓰면 보장할 수 있나?#

보장할 수 없다. 명확한 system prompt와 user prompt는 필요하지만 충분하지 않다. 가능하면 공급자의 구조화 출력 기능을 사용하고, 로컬 schema 검증과 파싱 실패 시 재시도 또는 모델 전환을 함께 구성해야 한다.

최종 결론#

이번 테스트의 핵심은 어느 한 모델을 단순 승자로 선언하는 것이 아니다. 프로덕션에서는 핵심적으로 맞는 답을 생성하는 능력요구한 형식과 모든 하위 항목을 완전하게 납품하는 능력을 분리해 검증해야 한다.

Claude Opus 5와 GPT-5.6-SOL은 10개 지능 과제에서 모두 핵심 답변 정확도 10/10을 기록했다. GPT-5.6-SOL은 모든 하위 요구 사항에서 10/10, 엄격한 JSON 최초 제출에서 1/1을 기록했다. Opus 5는 하위 요구 사항 완료에서 9/10, 엄격한 JSON 최초 제출에서 0/1이었으며 두 번의 추가 재시도에서도 형식 요구를 충족하지 못했다.

Opus 5의 차이는 핵심 추론 실패가 아니었다. 고난도 확률 문제에서는 정답 12.6547을 계산했지만 max_tokens=3200 경계에서 finish_reason=length로 종료돼 마지막 설명이 빠졌다. JSON 과제에서도 데이터는 정확했지만 출력 외피가 요구 형식과 달랐다.

따라서 기준 답안이나 숨은 테스트를 운영할 수 있는 업무라면 두 모델 모두 후보가 될 수 있다. 반면 하위 시스템이 모델의 JSON을 직접 소비한다면 다음 요소는 선택 사항이 아니라 필수 구성 요소로 봐야 한다.

  • finish_reason 검사
  • 구조화 출력 schema 검증
  • 코드의 실제 실행 및 숨은 테스트
  • 출력 잘림 감지
  • 형식 위반 시 재시도
  • 필요할 때의 모델 전환

그리고 네트워크 지연 시간은 지능 점수와 분리해야 한다. 이번 테스트에는 속도 승자가 없으며, 확인된 차이는 핵심 정확도가 아니라 완전한 과제 납품과 구조화 출력 준수에 있다.

Crazyrouter 계정을 만들고 Opus 5 / GPT-5.6-SOL을 직접 테스트하기

Implementation Guides

Topics

Comparison

Related Posts

Claude Opus 5 vs Claude Fable 5: 7가지 실제 API 테스트와 프로덕션 라우팅 제안Comparison

Claude Opus 5 vs Claude Fable 5: 7가지 실제 API 테스트와 프로덕션 라우팅 제안

동일한 OpenAI-compatible API, 동일한 프롬프트와 파라미터 조건에서 Claude Opus 5와 Claude Fable 5를 수학, 물리, 제약 추론, 코드 리뷰, strict JSON, 실험 설계 과제로 비교하고, 전달률, 콘텐츠 필터링, latency, token, 재시도 결과를 기록했습니다.

Jul 26
Kimi K3 vs GPT-5.6-SOL: 수학·물리·프로그래밍 고난도 실전 테스트Comparison

Kimi K3 vs GPT-5.6-SOL: 수학·물리·프로그래밍 고난도 실전 테스트

동일한 OpenAI-compatible API와 동일한 프롬프트 조건에서 kimi-k3와 gpt-5.6-sol을 대상으로 패턴 정지 시간, 도르래 회전 관성이 포함된 물리 문제, 의존성 클로저 프로그래밍 문제를 테스트하고, 정답 여부, 출력 잘림, 지연 시간, 로컬 코드 검증 결과를 기록합니다.

Jul 18
Kimi K3는 Claude Opus 4.8에 도달했을까? 7개 관점의 API 실측Comparison

Kimi K3는 Claude Opus 4.8에 도달했을까? 7개 관점의 API 실측

정밀 수학, 물리 모델링, 제약 추론, 통계적 역유도, 코드 리뷰, 엄격한 JSON, 불확실성 보정 등 7개 관점에서 Kimi K3와 Claude Opus 4.8의 정답률, 첫 가시 응답, 전체 지연 시간, reasoning Token 효율을 비교합니다.

Jul 19
Kimi K3와 Claude Fable 5 실측: 수학 검증, 코드 완결성, 응답 속도의 차이Comparison

Kimi K3와 Claude Fable 5 실측: 수학 검증, 코드 완결성, 응답 속도의 차이

수학, 물리, 실행 가능한 Python, 제약 추론으로 Kimi K3와 Claude Fable 5를 비교하고 finish_reason, reasoning tokens, 지연 시간을 분석합니다.

Jul 17
Claude Fable 5 vs GPT-5.5: max_tokens 오판이 모델 비교 결론을 바꾼 사례Comparison

Claude Fable 5 vs GPT-5.5: max_tokens 오판이 모델 비교 결론을 바꾼 사례

Crazyrouter OpenAI-compatible API로 claude-fable-5와 gpt-5.5를 수학 추론, 물리 추론, Canvas 애니메이션 장문 코드 과제로 비교했다. 핵심은 max_tokens, finish_reason=length, completion_tokens, 브라우저 검증이 모델 평가 결론을 어떻게 바꾸는지다.

Jul 6
GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수Comparison

GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수

Crazyrouter OpenAI 호환 API에서 glm-5.2와 claude-fable-5를 수학, 물리, Canvas 애니메이션 과제로 비교하고, glm-5.2의 현재 0.8 discount 정보를 함께 정리합니다.

Jul 6