Login
Back to Blog
EspañolComparison

Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad

Comparativa centrada en precisión verificable: matemáticas, física compleja, algoritmos ejecutables, rechazo de premisas falsas, restricciones y seguimiento de instrucciones.

C
Crazyrouter Team
July 30, 2026 / 3 views
Share:
Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad

Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad

Respuesta rápida#

En la ronda difícil, Claude Opus 5 obtuvo 17/18 (94,4%) y GPT-5.6 Luna 16/18 (88,9%). Es una ventaja de una tarea en esta muestra, no una prueba de superioridad universal. Lo importante es el tipo de fallo: Opus entregó correctamente los tres archivos algorítmicos, pero rompió un contrato de JSON estricto; Luna cumplió las tres instrucciones de formato, aunque dos archivos de Python fallaron al importarse.

Por qué fue necesario subir la dificultad#

La primera ronda de ocho tareas fue demasiado sencilla para separar a los modelos: ambos consiguieron 8/8. La segunda pasó a 18 tareas, con variantes hard, harder y extreme en seis categorías. Se exigieron fracciones exactas, modelos físicos por etapas, archivos ejecutables completos, rechazo de premisas engañosas, soluciones lógicas únicas y disciplina de salida carácter por carácter. Una explicación convincente no bastaba: cada afirmación decisiva debía poder verificarse con cálculo, parsing de JSON o ejecución de Python.

Cómo se puntuaron las 18 tareas#

Los dos modelos recibieron el mismo enunciado, instrucción de sistema, temperature y presupuesto por tarea. Matemáticas y física se validaron contra valores exactos o tolerancias numéricas. El código se guardó tal como llegó y se importó en el mismo harness de pruebas ocultas. JSON y CSV se evaluaron como artefactos para máquinas. Que un archivo funcione después de borrar sus propios assert ayuda a diagnosticar el fallo, pero no convierte la entrega original en un aprobado. La latencia de ruta se conserva solo en el JSON original y no participa en ninguna decisión de ganador.

Resultados en seis dimensiones#

Precisión en seis dimensiones

DimensiónOpus 5GPT-5.6 Luna
Razonamiento matemático3/33/3
Física compleja3/33/3
Entrega de algoritmos3/31/3
Rechazo de premisas falsas3/33/3
Razonamiento con restricciones3/33/3
Seguimiento de instrucciones2/33/3
Total17/18 (94.4%)16/18 (88.9%)

La diferencia algorítmica fue una diferencia de entrega#

En los dos fallos de Luna, las funciones principales superaron las pruebas ocultas después de eliminar los assert del final. El problema era que esos assert contenían resultados esperados incorrectos y el archivo original lanzaba AssertionError durante el import. Bajo un contrato de “archivo Python completo”, son fallos reales. Los tres archivos originales de Opus se importaron y superaron el mismo harness. En producción, una función plausible no equivale a un artefacto listo para integrar.

En JSON estricto, la ventaja cambió de lado#

Fallos distintos implican riesgos distintos

El único fallo de Opus fue casi el reflejo contrario. Las claves y los valores eran correctos, pero el modelo envolvió el objeto en un bloque Markdown pese a que se pedía exactamente un objeto JSON, sin nada más. El comportamiento se repitió en un segundo intento independiente. Luna aprobó las tres pruebas de instrucciones. Cuando la salida entra directamente en un parser, el envoltorio también forma parte de la corrección.

El presupuesto de salida se separó de los errores de inteligencia#

Algunos intentos iniciales terminaron con finish_reason=length porque el razonamiento oculto consumió el presupuesto de salida. Se conservaron como evidencia, pero no se contaron como errores de inteligencia. Antes de puntuar se aumentó de forma equivalente el presupuesto efectivo de ambos modelos. Así se evita confundir configuración con razonamiento, sin ocultar el riesgo de integración de una respuesta que deja poco espacio al artefacto visible.

Cómo convertir los resultados en reglas de routing#

Empieza con Luna para JSON estricto, CSV, extracción corta y trabajo estructurado de gran volumen, manteniendo siempre validación de esquema. Empieza con Opus para archivos algorítmicos largos, casos límite e ingeniería defensiva. En matemáticas, física compleja, rechazo de premisas falsas y restricciones hubo empate; en esas áreas, coste, compatibilidad y estilo de salida son mejores criterios. Con ambos modelos hay que validar el artefacto: parsear JSON, comprobar números clave y ejecutar el código sin limpiarlo a mano.

Reproducción y evidencia original#

El runner es scripts/opus5_vs_luna_hard_benchmark.py. El resultado completo está en .tmp/opus5-vs-luna-hard-benchmark-results.json; los reintentos independientes están en .tmp/opus5-hard-failure-retry.json y .tmp/luna-hard-failure-retry.json. Se usó el endpoint limpio https://cn.crazyrouter.com/v1/chat/completions. Las latencias permanecen únicamente en los archivos de evidencia.

Preguntas frecuentes#

¿17/18 convierte a Opus 5 en ganador absoluto?#

No. Solo significa que lideró por una tarea en este conjunto. No se evaluaron visión, herramientas, contexto ultralargo ni agentes de varios turnos.

¿Por qué cuentan como fallo unas autopruebas incorrectas?#

Porque se pidió un archivo Python completo. Si el original falla al importarse, un sistema posterior no puede usarlo sin reparación manual.

¿Por qué la latencia no aparece en el veredicto?#

Depende del modelo, el gateway, la carga upstream y el estado de la ruta. Es evidencia operativa útil, pero no mide la precisión intelectual.

Veredicto final#

En esta prueba centrada en precisión verificable, Opus 5 lideró 17/18 a 16/18 gracias a la entrega completa de los tres algoritmos. Luna fue mejor en cumplimiento estricto de formato. La conclusión práctica no es un campeón universal, sino una regla de routing basada en fallos reproducibles.

Prueba ambos modelos en Crazyrouter con tus propios prompts de producción

Implementation Guides

Topics

Comparison

Related Posts

GLM-5.2 vs Claude Fable 5: presupuesto de salida, reasoning_tokens y discount 0.8Comparison

GLM-5.2 vs Claude Fable 5: presupuesto de salida, reasoning_tokens y discount 0.8

Comparación práctica con la API compatible con OpenAI de Crazyrouter: glm-5.2 y claude-fable-5 en matemáticas, física y una animación Canvas, con una nota sobre el discount 0.8 actual de glm-5.2.

Jul 6
Mejor puerta de enlace de API de IA para desarrolladores en 2026: 9 plataformas probadasComparison

Mejor puerta de enlace de API de IA para desarrolladores en 2026: 9 plataformas probadas

Probamos 9 puertas de enlace de API de IA para cobertura de modelos, precios, soporte multimodal y experiencia del desarrollador.

Mar 27
Guía de instalación y uso de Claude Code - Configuración del asistente de programación con IATutorial

Guía de instalación y uso de Claude Code - Configuración del asistente de programación con IA

Guía completa para instalar y configurar Claude Code, el asistente de programación con IA. Aprende a configurar Node.js, definir tokens de API y empezar a programar con IA en tu terminal.

Jan 24
Cómo acceder a GPT-5 y GPT-5.2 vía API - Guía completa para desarrolladoresTutorial

Cómo acceder a GPT-5 y GPT-5.2 vía API - Guía completa para desarrolladores

Aprende cómo acceder a los últimos modelos GPT-5, GPT-5.2 y o3-pro de OpenAI a través de una API unificada. Guía paso a paso con ejemplos en Python, Node.

Jan 23
Clawdbot en menos de 2 minutos (HOSTING 24/7 GRATIS)

Clawdbot en menos de 2 minutos (HOSTING 24/7 GRATIS)

Aprende cómo desplegar Clawdbot (Claude.bot) en menos de dos minutos con hosting gratuito 24/7 en AWS. Este tutorial muestra la configuración, integración con canales (WhatsApp, Discord, Telegram), habilidades como búsqueda web con Exa y casos de uso reales como asistencia de compras mediante las gafas inteligentes Meta Ray-Ban.

Jan 26
Cómo usar GPT, Claude y Gemini con una sola API keyTutorial

Cómo usar GPT, Claude y Gemini con una sola API key

Una guía práctica para desarrolladores en México: configura Crazyrouter una vez y llama modelos de OpenAI, Anthropic y Google desde el mismo endpoint compatible con OpenAI.

May 22