GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수
Crazyrouter OpenAI 호환 API에서 glm-5.2와 claude-fable-5를 수학, 물리, Canvas 애니메이션 과제로 비교하고, glm-5.2의 현재 0.8 discount 정보를 함께 정리합니다.

GLM-5.2 vs Claude Fable 5 실측: 출력 예산, reasoning_tokens, 그리고 0.8 가격 계수#
이번 글은 단순한 승패표가 아닙니다. 실제 API 호출에서 GLM-5.2는 출력 예산을 늘리면 수학과 물리 문제를 맞혔지만, 낮은 예산에서는 보이는 본문이 비는 경우가 있었습니다. Claude Fable 5는 같은 조건에서 더 짧고 안정적이었고, 긴 HTML 애니메이션 과제에서는 더 완성도가 높았습니다.

이 테스트가 필요한 이유#
이 테스트는 채팅 UI가 아니라 Crazyrouter의 OpenAI 호환 API를 사용했습니다. 이 점이 중요한 이유는 결과를 문장 품질만으로 판단하지 않았기 때문입니다. 각 응답은 운영 메타데이터와 함께 확인했습니다.
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
중요하게 본 필드는 max_tokens, completion_tokens, reasoning_tokens, finish_reason, 보이는 콘텐츠 길이, 생성된 HTML이 닫혔는지 여부, 그리고 애니메이션이 실제로 브라우저에서 움직였는지 여부였습니다.
테스트 설계#
벤치마크는 의도적으로 세 가지 유형의 과제를 섞었습니다.
| 과제 | 목적 | 기준 결과 |
|---|---|---|
MATH-003 | 상태 기반 기댓값 추론 | HH가 나올 때까지의 기대 뒤집기 횟수 = 6 |
PHYS-003 | 운동량과 에너지 계산 | V = 3.0 m/s, x ≈ 0.148 m |
CODE-003-ANIM | 긴 실행 가능 산출물 생성 | 완전한 800x500 Canvas 애니메이션 HTML |
처음 두 과제는 추론을 측정했습니다. 세 번째 과제는 모델이 그럴듯한 일부 코드 블록만 생성하는 것이 아니라 완전한 산출물을 만들 수 있는지를 측정했습니다.
관찰된 결과#
| 과제 | glm-5.2 | claude-fable-5 |
|---|---|---|
| 수학, 원래 예산 | finish_reason=length, completion_tokens=1601, reasoning_tokens=1600, 보이는 본문 없음 | finish_reason=stop, 완전하고 정답 |
| 수학, 재테스트 | max_tokens=3200 이후 정답 | 재테스트 불필요 |
| 물리, 원래 예산 | finish_reason=length, 보이는 본문 없음 | 완전하고 정답 |
| 물리, 재테스트 | max_tokens=8000 이후 정답 | 재테스트 불필요 |
| 애니메이션, 원래 예산 | max_tokens=3200에서 보이는 HTML 없음 | 일부 HTML, 중간에서 잘림 |
| 애니메이션, 재테스트 | max_tokens=8000에서도 여전히 중간에서 잘림 | 완전한 HTML; 브라우저 검증 통과 |
가장 중요한 관찰은 GLM-5.2가 추론 자체에 실패한 것은 아니라는 점입니다. 수학과 물리 과제에서는 더 큰 출력 예산을 준 뒤 정답을 생성했습니다. 문제는 가시성과 완성도였습니다. 요청은 HTTP 200을 반환할 수 있지만, 사용자에게 보이는 콘텐츠는 비어 있거나 불완전할 수 있습니다.
긴 Canvas 애니메이션에서는 차이가 더 선명했습니다. GLM-5.2는 max_tokens=8000에서 보이는 HTML 조각을 생성했지만, JavaScript 내부에서 멈췄고 파일을 닫지 못했습니다. Claude Fable 5는 max_tokens=8000에서 HTML을 완성했습니다. 브라우저 검증 결과 콘솔 오류가 없었고, 800x500 캔버스, 컨트롤, 속도 슬라이더가 있었으며, 700 ms 이후 changedPixels=55090이 확인되었습니다.
비용 대비 성능#
작성 시점 Crazyrouter pricing API는 glm-5.2에 대해 discount: 0.8을 반환합니다. 따라서 reasoning_tokens와 max_tokens를 운영 지표로 관리할 수 있다면 GLM-5.2는 비용 대비 매력적인 선택지가 됩니다.
실무적인 트레이드오프는 다음과 같습니다.
| 워크로드 | 이 테스트에서 더 잘 맞았던 선택 |
|---|---|
| 충분한 출력 예산이 있는 짧은 추론 | GLM-5.2는 비용 효율적인 선택지가 될 수 있음 |
| 낮은 예산의 추론 응답 | Claude Fable 5가 더 안정적이었음 |
| 긴 단일 파일 코드 생성 | 이번 실행에서는 Claude Fable 5가 더 강했음 |
| 메타데이터를 로깅하는 배치 평가 | GLM-5.2를 더 안전하게 운영하기 쉬워짐 |
0.8 배율을 영구적이고 보편적인 가격으로 간주해서는 안 됩니다. 이는 게시 시점의 Crazyrouter 가격 데이터 스냅샷이며, 대규모 배포 전에는 다시 확인해야 합니다.
연동 시 체크포인트#
최소 요청 예시는 다음과 같습니다.
curl https://cn.crazyrouter.com/v1/chat/completions \
-H "Authorization: Bearer $CRAZYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Solve the HH expected-flips problem with state equations."
}
],
"temperature": 0.2,
"max_tokens": 3200
}'
Claude Fable 5와 비교하려면 같은 payload를 유지하고 model만 변경하면 됩니다.
{
"model": "claude-fable-5"
}
프로덕션 스타일 평가에서는 모든 요청에 대해 다음 형태를 로깅하는 것이 좋습니다.
{
"model": "glm-5.2",
"max_tokens": 3200,
"finish_reason": "length",
"completion_tokens": 3200,
"reasoning_tokens": 3178,
"visible_content_chars": 0,
"html_closed": false,
"browser_validation": "not_run_incomplete_html"
}
API 엔드포인트는 깔끔하게 유지해야 합니다. https://cn.crazyrouter.com/v1에는 UTM 파라미터를 추가하지 마세요. 추적은 사람이 보는 글이나 가입 링크에만 사용하세요.
Crazyrouter의 OpenAI 호환 엔드포인트에서 같은 요청을 실행해 본인 업무에 맞는 결과를 직접 비교할 수 있습니다.
FAQ#
GLM-5.2는 추론 과제에 실패했나요?#
아닙니다. 이번 실행에서 GLM-5.2는 max_tokens=3200 이후 수학 과제를 풀었고, max_tokens=8000 이후 물리 과제를 풀었습니다. 문제는 낮은 예산에서 보이는 콘텐츠가 나타나기 전에 대부분의 예산이 reasoning tokens로 소비되었다는 점이었습니다.
왜 HTTP 200을 성공으로 채점하지 않았나요?#
HTTP 200은 API 호출이 반환되었다는 의미일 뿐이기 때문입니다. finish_reason=length이거나, 보이는 콘텐츠가 비어 있거나, 생성된 코드가 불완전하다면 벤치마크 답변은 여전히 사용할 수 없습니다.
애니메이션 과제를 포함한 이유는 무엇인가요?#
긴 코드 생성은 다른 실패 모드를 드러냅니다. 모델은 파일의 전반부를 그럴듯하게 작성할 수 있지만, HTML이나 JavaScript가 중간에서 잘리면 결국 실패합니다.
GLM-5.2는 여전히 테스트할 가치가 있나요?#
그렇습니다. 현재 0.8 할인 배율은 충분한 출력 예산을 할당하고 응답 메타데이터를 모니터링할 수 있는 워크로드에서 매력적입니다.
향후 비교에서는 무엇을 기록해야 하나요?#
최소한 max_tokens, completion_tokens, reasoning_tokens, finish_reason, 보이는 출력 길이, 산출물 완성도, 런타임 검증을 기록해야 합니다.
Final verdict#
요약하면 GLM-5.2는 가격 면에서 강점이 있고 추론도 가능하지만 출력 예산 관리가 필수입니다. Claude Fable 5는 낮은 예산과 긴 단일 파일 코드 생성에서 더 안정적이었습니다.





