블로그로 돌아가기
한국어Comparison

GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수

Crazyrouter OpenAI 호환 API에서 glm-5.2와 claude-fable-5를 수학, 물리, Canvas 애니메이션 과제로 비교하고, glm-5.2의 현재 0.8 discount 정보를 함께 정리합니다.

C
Crazyrouter Team
2026년 7월 6일 / 350 회 조회
공유:
GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수

GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수#

이번 글은 단순한 승패표가 아닙니다. 실제 API 호출에서 GLM-5.2는 출력 예산을 늘리면 수학과 물리 문제를 맞혔지만, 낮은 예산에서는 보이는 본문이 비는 경우가 있었습니다. Claude Fable 5는 같은 조건에서 더 짧고 안정적이었고, 긴 HTML 애니메이션 과제에서는 더 완성도가 높았습니다.

GLM-5.2 vs Claude Fable 5 벤치마크

이 테스트가 필요한 이유#

이 테스트는 채팅 UI가 아니라 Crazyrouter의 OpenAI 호환 API를 사용했습니다. 이 점이 중요한 이유는 결과를 문장 품질만으로 판단하지 않았기 때문입니다. 각 응답은 운영 메타데이터와 함께 확인했습니다.

text
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06

중요하게 본 필드는 max_tokens, completion_tokens, reasoning_tokens, finish_reason, 보이는 콘텐츠 길이, 생성된 HTML이 닫혔는지 여부, 그리고 애니메이션이 실제로 브라우저에서 움직였는지 여부였습니다.

테스트 설계#

벤치마크는 의도적으로 세 가지 유형의 과제를 섞었습니다.

과제목적기준 결과
MATH-003상태 기반 기댓값 추론HH가 나올 때까지의 기대 뒤집기 횟수 = 6
PHYS-003운동량과 에너지 계산V = 3.0 m/s, x ≈ 0.148 m
CODE-003-ANIM긴 실행 가능 산출물 생성완전한 800x500 Canvas 애니메이션 HTML

처음 두 과제는 추론을 측정했습니다. 세 번째 과제는 모델이 그럴듯한 일부 코드 블록만 생성하는 것이 아니라 완전한 산출물을 만들 수 있는지를 측정했습니다.

관찰된 결과#

과제glm-5.2claude-fable-5
수학, 원래 예산finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, 보이는 본문 없음finish_reason=stop, 완전하고 정답
수학, 재테스트max_tokens=3200 이후 정답재테스트 불필요
물리, 원래 예산finish_reason=length, 보이는 본문 없음완전하고 정답
물리, 재테스트max_tokens=8000 이후 정답재테스트 불필요
애니메이션, 원래 예산max_tokens=3200에서 보이는 HTML 없음일부 HTML, 중간에서 잘림
애니메이션, 재테스트max_tokens=8000에서도 여전히 중간에서 잘림완전한 HTML; 브라우저 검증 통과

가장 중요한 관찰은 GLM-5.2가 추론 자체에 실패한 것은 아니라는 점입니다. 수학과 물리 과제에서는 더 큰 출력 예산을 준 뒤 정답을 생성했습니다. 문제는 가시성과 완성도였습니다. 요청은 HTTP 200을 반환할 수 있지만, 사용자에게 보이는 콘텐츠는 비어 있거나 불완전할 수 있습니다.

긴 Canvas 애니메이션에서는 차이가 더 선명했습니다. GLM-5.2는 max_tokens=8000에서 보이는 HTML 조각을 생성했지만, JavaScript 내부에서 멈췄고 파일을 닫지 못했습니다. Claude Fable 5는 max_tokens=8000에서 HTML을 완성했습니다. 브라우저 검증 결과 콘솔 오류가 없었고, 800x500 캔버스, 컨트롤, 속도 슬라이더가 있었으며, 700 ms 이후 changedPixels=55090이 확인되었습니다.

비용 대비 성능#

작성 시점 Crazyrouter pricing API는 glm-5.2에 대해 discount: 0.8을 반환합니다. 따라서 reasoning_tokens와 max_tokens를 운영 지표로 관리할 수 있다면 GLM-5.2는 비용 대비 매력적인 선택지가 됩니다.

실무적인 트레이드오프는 다음과 같습니다.

워크로드이 테스트에서 더 잘 맞았던 선택
충분한 출력 예산이 있는 짧은 추론GLM-5.2는 비용 효율적인 선택지가 될 수 있음
낮은 예산의 추론 응답Claude Fable 5가 더 안정적이었음
긴 단일 파일 코드 생성이번 실행에서는 Claude Fable 5가 더 강했음
메타데이터를 로깅하는 배치 평가GLM-5.2를 더 안전하게 운영하기 쉬워짐

0.8 배율을 영구적이고 보편적인 가격으로 간주해서는 안 됩니다. 이는 게시 시점의 Crazyrouter 가격 데이터 스냅샷이며, 대규모 배포 전에는 다시 확인해야 합니다.

연동 시 체크포인트#

최소 요청 예시는 다음과 같습니다.

bash
curl https://cn.crazyrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'

Claude Fable 5와 비교하려면 같은 payload를 유지하고 model만 변경하면 됩니다.

json
{
  "model": "claude-fable-5"
}

프로덕션 스타일 평가에서는 모든 요청에 대해 다음 형태를 로깅하는 것이 좋습니다.

json
{
  "model": "glm-5.2",
  "max_tokens": 3200,
  "finish_reason": "length",
  "completion_tokens": 3200,
  "reasoning_tokens": 3178,
  "visible_content_chars": 0,
  "html_closed": false,
  "browser_validation": "not_run_incomplete_html"
}

API 엔드포인트는 깔끔하게 유지해야 합니다. https://cn.crazyrouter.com/v1에는 UTM 파라미터를 추가하지 마세요. 추적은 사람이 보는 글이나 가입 링크에만 사용하세요.

Crazyrouter의 OpenAI 호환 엔드포인트에서 같은 요청을 실행해 본인 업무에 맞는 결과를 직접 비교할 수 있습니다.

https://crazyrouter.com/register?utm_source=crazyrouter_blog&utm_medium=article&utm_campaign=glm52_fable5_budget_cost_20260706&utm_content=crazyrouter_blog_glm-52-vs-claude-fable-5-output-budget-cost-ko_20260706__bottom&utm_term=glm-5.2+claude+fable+5+benchmark

FAQ#

GLM-5.2는 추론 과제에 실패했나요?#

아닙니다. 이번 실행에서 GLM-5.2는 max_tokens=3200 이후 수학 과제를 풀었고, max_tokens=8000 이후 물리 과제를 풀었습니다. 문제는 낮은 예산에서 보이는 콘텐츠가 나타나기 전에 대부분의 예산이 reasoning tokens로 소비되었다는 점이었습니다.

왜 HTTP 200을 성공으로 채점하지 않았나요?#

HTTP 200은 API 호출이 반환되었다는 의미일 뿐이기 때문입니다. finish_reason=length이거나, 보이는 콘텐츠가 비어 있거나, 생성된 코드가 불완전하다면 벤치마크 답변은 여전히 사용할 수 없습니다.

애니메이션 과제를 포함한 이유는 무엇인가요?#

긴 코드 생성은 다른 실패 모드를 드러냅니다. 모델은 파일의 전반부를 그럴듯하게 작성할 수 있지만, HTML이나 JavaScript가 중간에서 잘리면 결국 실패합니다.

GLM-5.2는 여전히 테스트할 가치가 있나요?#

그렇습니다. 현재 0.8 할인 배율은 충분한 출력 예산을 할당하고 응답 메타데이터를 모니터링할 수 있는 워크로드에서 매력적입니다.

향후 비교에서는 무엇을 기록해야 하나요?#

최소한 max_tokens, completion_tokens, reasoning_tokens, finish_reason, 보이는 출력 길이, 산출물 완성도, 런타임 검증을 기록해야 합니다.

Final verdict#

요약하면 GLM-5.2는 가격 면에서 강점이 있고 추론도 가능하지만 출력 예산 관리가 필수입니다. Claude Fable 5는 낮은 예산과 긴 단일 파일 코드 생성에서 더 안정적이었습니다.

Implementation Guides

Topics

Comparison

관련 글

Claude Fable 5 vs GPT-5.5: max_tokens 오판이 모델 비교 결론을 바꾼 사례Comparison

Claude Fable 5 vs GPT-5.5: max_tokens 오판이 모델 비교 결론을 바꾼 사례

Crazyrouter OpenAI-compatible API로 claude-fable-5와 gpt-5.5를 수학 추론, 물리 추론, Canvas 애니메이션 장문 코드 과제로 비교했다. 핵심은 max_tokens, finish_reason=length, completion_tokens, 브라우저 검증이 모델 평가 결론을 어떻게 바꾸는지다.

7월 6일
Kimi K3와 Claude Fable 5 실측: 수학 검증, 코드 완결성, 응답 속도의 차이Comparison

Kimi K3와 Claude Fable 5 실측: 수학 검증, 코드 완결성, 응답 속도의 차이

수학, 물리, 실행 가능한 Python, 제약 추론으로 Kimi K3와 Claude Fable 5를 비교하고 finish_reason, reasoning tokens, 지연 시간을 분석합니다.

7월 17일
Claude Opus 5 vs Claude Fable 5: 7가지 실제 API 테스트와 프로덕션 라우팅 제안Comparison

Claude Opus 5 vs Claude Fable 5: 7가지 실제 API 테스트와 프로덕션 라우팅 제안

동일한 OpenAI-compatible API, 동일한 프롬프트와 파라미터 조건에서 Claude Opus 5와 Claude Fable 5를 수학, 물리, 제약 추론, 코드 리뷰, strict JSON, 실험 설계 과제로 비교하고, 전달률, 콘텐츠 필터링, latency, token, 재시도 결과를 기록했습니다.

7월 26일
GPT-6.1 Sol vs GPT-6 Sol: 일주일 만의 업데이트, Claude 5.5와 얼마나 관련 있을까?Comparison

GPT-6.1 Sol vs GPT-6 Sol: 일주일 만의 업데이트, Claude 5.5와 얼마나 관련 있을까?

GPT-6.1 Sol이 일주일 만에 등장한 배경을 Claude Opus 5.5·Sonnet 5.5와의 경쟁 구도에서 살펴본다. 공식 평가의 개선 폭과 API 비교 테스트 결과를 분석하되, 경쟁 때문에 내부 출시 일정이 앞당겨졌는지는 확인되지 않았다는 점을 구분한다.

9월 30일
Claude Opus 5 vs GPT-5.6-SOL: 지능 정확도 10문항 검증, 핵심 답변 모두 10/10Comparison

Claude Opus 5 vs GPT-5.6-SOL: 지능 정확도 10문항 검증, 핵심 답변 모두 10/10

Claude Opus 5와 GPT-5.6-SOL을 동일 API의 10개 검증 과제로 비교했습니다. 두 모델 모두 핵심 답변 10/10을 기록했으며, 코드 숨은 테스트, 전체 요구사항 완수, 엄격한 JSON 준수를 별도로 평가합니다.

7월 29일
Kimi K3 vs GPT-5.6-SOL: 수학·물리·프로그래밍 고난도 실전 테스트Comparison

Kimi K3 vs GPT-5.6-SOL: 수학·물리·프로그래밍 고난도 실전 테스트

동일한 OpenAI-compatible API와 동일한 프롬프트 조건에서 kimi-k3와 gpt-5.6-sol을 대상으로 패턴 정지 시간, 도르래 회전 관성이 포함된 물리 문제, 의존성 클로저 프로그래밍 문제를 테스트하고, 정답 여부, 출력 잘림, 지연 시간, 로컬 코드 검증 결과를 기록합니다.

7월 18일