04 · Cómo se mide
Los benchmarks que de verdad importan
Un benchmark es un examen estandarizado: permite comparar modelos, detectar progreso real y elegir herramienta según la tarea. Pero cuando un test se "satura" (todos sacan casi el máximo) deja de discriminar y la industria salta al siguiente. Valores aproximados al 12 de agosto de 2026.
Cómo leer un benchmark: mirá tres cosas — qué capacidad mide (código, razonamiento, conocimiento, agencia), qué tan saturado está (si los líderes ya superan ~90%, las diferencias dejan de ser significativas) y si es contaminable (preguntas que pudieron filtrarse al entrenamiento inflan el puntaje). Ningún número aislado define a un modelo.
CódigoSWE-bench VerifiedResolver issues reales de repositorios de GitHub: leer el código, ubicar el bug y proponer el parche. El estándar de facto para capacidad de ingeniería de software.
AgentesTerminal-Bench 2.0Tareas reales en una terminal: el modelo encadena comandos, navega el sistema de archivos y completa objetivos de varios pasos. Mide capacidad agéntica end-to-end.
Computer useOSWorld-VerifiedOperar una computadora real con mouse y teclado en apps de escritorio y web. La prueba de fuego para los agentes que "usan la pantalla" como un humano.
Inteligencia fluidaARC-AGI-2Resolver puzzles visuales nunca vistos a partir de pocos ejemplos. No mide conocimiento memorizado sino capacidad de adaptarse a lo novedoso: lo más cercano a "razonamiento general".
Conocimiento expertoHumanity's Last Exam (HLE)2.500 preguntas cerradas escritas por especialistas en matemática, ciencias y humanidades, diseñadas para ser el "examen final" del conocimiento académico. El gran termómetro de lo que falta.
Razonamiento científicoGPQA DiamondPreguntas nivel doctorado en física, química y biología, "a prueba de Google": no se resuelven buscando, exigen razonar. Mide profundidad científica real.
Matemática fronteraFrontierMathProblemas de matemática de investigación, inéditos y muy difíciles, creados por matemáticos profesionales. Resiste a los modelos donde otros tests ya se saturaron.
SaturadoMMLU / MMLU-ProConocimiento multitarea en 57 materias. Fue EL benchmark de 2020–2023; hoy los modelos frontera se amontonan arriba del 88–90% y ya casi no discrimina. Útil como piso, no como ranking.
Preferencia humanaLMArena (Chatbot Arena)Votación a ciegas: personas comparan dos respuestas sin saber qué modelo las generó y eligen la mejor. Genera un ranking estilo Elo. La métrica más mirada de "calidad percibida".
Quién puntea a mediados de agosto de 2026: el flamante Claude Opus 5 (24/07) se acerca a Fable 5 en muchas categorías a la mitad del precio y supera a Opus 4.8 en coding agéntico y computer use. Entre los abiertos, Kimi K3 (2,8T, el mayor de la historia) quedó #1 en Frontend Code Arena (1.679 Elo), por encima de Fable 5 en test ciego, y GLM-5.2 sigue liderando el Intelligence Index open-weight (~51). En orquestación, Fugu Ultra mantiene 73,7% en SWE-Bench Pro; Grok 4.5 corre 4.º en el Intelligence Index (54) a bajo costo. El recién llegado Grok 4.6 empata a GPT-5.6 Sol en el Intelligence Index (61) y lo supera en CursorBench y FrontierCode, a la mitad de precio. Dos contrapuntos que vale la pena tener a mano: Qwen 3.8 afirma ser "segundo tras Fable 5" sin publicar benchmarks ni model card, y DeepSeek V4 Flash le gana en tareas agénticas a su propio modelo grande — el tamaño no siempre manda. Aparte de todos ellos, Astra resolvió diez problemas matemáticos abiertos con pruebas verificadas formalmente: un resultado que no depende de ningún benchmark (ver IA y ciencia).
Los números sin contexto engañan
Para seguir los leaderboards en vivo y comparar precio, velocidad y calidad, pasá por la sección de recursos: LMArena, Artificial Analysis y el Stanford AI Index.