Benchmark IA

Un observatorio para elegir con criterio: modelos actuales, gráfico de inteligencia frente a coste, novedades y claves para aplicar la IA en tu empresa. Edición de septiembre de 2026.

Publicado
Actualizado
Lectura
8 min
Apartados
08
Palabras
1413
Figuras
04

Respuesta corta

Lo esencial

El modelo más capaz y el que mejor encaja en tu trabajo pueden ser distintos. Este Benchmark IA compara capacidad y coste con una instantánea fechada de Artificial Analysis y utiliza OpenRouter como referencia de adopción. Consulta el gráfico, identifica candidatos dentro de tu presupuesto y prueba después con tus propias tareas. Mantendremos esta misma página al revisar los modelos y las novedades.

  • Compara modelos con su configuración de razonamiento: cambiar el esfuerzo también cambia el resultado y el gasto.
  • El gráfico mide dólares por tarea del benchmark, no el precio de una consulta de tu empresa.
  • Las novedades son un punto de partida para probar; las decisiones dependen de calidad, tiempo de respuesta y coste por caso aceptado.

Qué encontrarás en este Benchmark IA

Esta es la primera edición de nuestro observatorio, con corte editorial a 30 de septiembre de 2026. Reunimos una selección de modelos generalistas y varias configuraciones de los lanzamientos recientes para entender qué cambia cuando aumenta el esfuerzo de razonamiento. No pretende recoger cada modelo existente: priorizamos diversidad de creadores, alternativas económicas y opciones de mayor capacidad.

La fecha de consulta importa tanto como el nombre. Los precios, las evaluaciones y los modelos disponibles cambian. Cada revisión conservará la URL /blog/benchmark-ia/, actualizará la ficha y explicará los cambios. Es una publicación de revisión editorial; los datos no se refrescan en directo al abrir la página.

Inteligencia frente a coste: el mapa de modelos

Cada punto representa un modelo y una configuración. La inteligencia sube en el eje vertical; el coste aumenta hacia la derecha. Para comparar importes muy diferentes utilizamos una escala logarítmica: pasar de 0,01 a 0,1 dólares ocupa la misma distancia que pasar de 0,1 a 1. La zona superior izquierda reúne más capacidad con menos gasto dentro de esta medida.

Observatorio / IA
Más capacidad, menos coste: encuentra tus candidatosArtificial Analysis Intelligence Index v4.3.2. Selección editorial de configuraciones consultadas el 30 septiembre 2026. Activa los filtros o selecciona un punto para consultar sus datos.
Índice AA v4.3.222 configuraciones10 creadores
Inteligencia frente a coste por tarea de benchmark Cada punto identifica una configuración. Más arriba indica mayor puntuación; más a la izquierda, menor coste. El eje de coste es logarítmico. Los datos y las configuraciones completos están en la tabla siguiente. Inteligencia · mayor es mejor Zona favorable: arriba a la izquierda 0102030405060 0,0050,010,050,10,51510 Coste por tarea AA · USD · escala logarítmica · menor es mejor Claude Opus 5.5 · max · con fallback · 58 puntos · 5,98 US$/tarea 1 Claude Sonnet 5.5 · max · con fallback · 56 puntos · 7,60 US$/tarea 2 Claude Opus 5.5 · high · con fallback · 54 puntos · 1,82 US$/tarea 3 GPT-6 Astra · max · 53 puntos · 3,26 US$/tarea 4 GPT-6.1 Sol · max · 52 puntos · 0,72 US$/tarea 5 Claude Sonnet 5.5 · xhigh · con fallback · 52 puntos · 2,74 US$/tarea 6 GPT-6.1 Sol · xhigh · 51 puntos · 0,39 US$/tarea 7 Claude Opus 5.5 · medium · con fallback · 51 puntos · 1,34 US$/tarea 8 GPT-6.1 Sol · high · 50 puntos · 0,32 US$/tarea 9 GPT-6.1 Sol · medium · 48 puntos · 0,21 US$/tarea 10 Muse Spark 1.3 · max · 48 puntos · 1,60 US$/tarea 11 MiMo-V2.6-Pro · Configuración publicada · 46 puntos · 0,13 US$/tarea 12 Grok 4.7 · high · 46 puntos · 2,73 US$/tarea 13 GLM-5.3 · max · 45 puntos · 2,01 US$/tarea 14 Qwen3.8 Max (0902) · Configuración publicada · 45 puntos · 5,41 US$/tarea 15 Kimi K3 · max · 44 puntos · 2,00 US$/tarea 16 GLM-5.3-Flash · Configuración publicada · 42 puntos · 0,25 US$/tarea 17 Gemini 3.8 Flash · high · 41 puntos · 1,24 US$/tarea 18 DeepSeek V4.1 Flash · max · 39 puntos · 0,27 US$/tarea 19 MiMo-V2.6-Flash · Configuración publicada · 38 puntos · 0,06 US$/tarea 20 GPT-6 Luna · max · 37 puntos · 0,07 US$/tarea 21 GPT-6 Luna · low · 21 puntos · 0,0045 US$/tarea 22 Claude Opus 5.5Claude Sonnet 5.5GPT-6.1 SolMiMo-V2.6-ProGPT-6 Luna

Línea discontinua: frontera de eficiencia de esta selección. Los números remiten a la tabla. Toca un punto para ver su ficha.

GPT-6.1 Sol · max OpenAI · 52 puntos · 0,72 US$ por tarea AA

22 configuraciones visibles

Configuraciones evaluadas · inteligencia y coste de la misma instantánea
N.º / modeloConfiguraciónÍndice AAUSD / tarea AA
01 / Claude Opus 5.5Anthropic max · con fallback585,98 US$
02 / Claude Sonnet 5.5Anthropic max · con fallback567,60 US$
03 / Claude Opus 5.5Anthropic high · con fallback541,82 US$
04 / GPT-6 AstraOpenAI max533,26 US$
05 / GPT-6.1 SolOpenAI max520,72 US$
06 / Claude Sonnet 5.5Anthropic xhigh · con fallback522,74 US$
07 / GPT-6.1 SolOpenAI xhigh510,39 US$
08 / Claude Opus 5.5Anthropic medium · con fallback511,34 US$
09 / GPT-6.1 SolOpenAI high500,32 US$
10 / GPT-6.1 SolOpenAI medium480,21 US$
11 / Muse Spark 1.3Meta max481,60 US$
12 / MiMo-V2.6-ProXiaomi Configuración publicada460,13 US$
13 / Grok 4.7SpaceXAI high462,73 US$
14 / GLM-5.3Z AI max452,01 US$
15 / Qwen3.8 Max (0902)Alibaba Configuración publicada455,41 US$
16 / Kimi K3Kimi max442,00 US$
17 / GLM-5.3-FlashZ AI Configuración publicada420,25 US$
18 / Gemini 3.8 FlashGoogle high411,24 US$
19 / DeepSeek V4.1 FlashDeepSeek max390,27 US$
20 / MiMo-V2.6-FlashXiaomi Configuración publicada380,06 US$
21 / GPT-6 LunaOpenAI max370,07 US$
22 / GPT-6 LunaOpenAI low210,0045 US$

Fuente: Artificial Analysis. Consulta: . Puntuaciones enteras de la tabla pública; los empates pueden ocultar diferencias decimales. El coste pertenece a las tareas del benchmark; no es el precio de una consulta de tu negocio ni de una suscripción.

Descargar datos · CSV

La línea discontinua une las opciones para las que ninguna otra configuración visible tiene igual o mayor puntuación a menor o igual coste, con al menos una mejora. Se llama frontera de Pareto. Al filtrar por creador se calcula dentro de ese grupo. Estar fuera de la línea no descarta un modelo: puede encajar mejor por idioma, herramientas, disponibilidad o tiempo de respuesta. Los empates del índice se muestran con la precisión entera publicada.

Qué está cambiando esta semana

GPT-6.1 Sol: un lanzamiento que merece entrar en la prueba

La ficha de GPT-6.1 Sol en Artificial Analysis fecha su lanzamiento el 29 de septiembre. Su configuración max registra 52 puntos y 0,72 USD por tarea del índice. También incluimos medium, high y xhigh para comparar el salto de gasto. Nuestra lectura: conviene ensayar varios esfuerzos con la misma tarea antes de elegir max como ajuste habitual.

Claude Sonnet 5.5 y Opus 5.5: revisar el esfuerzo, además del apellido

Sonnet 5.5 aparece con fecha de lanzamiento del 28 de septiembre: su configuración max con fallback alcanza 56 puntos y 7,60 USD por tarea AA. Opus 5.5, publicado el 22 de septiembre, registra 58 puntos y 5,98 USD en max con fallback. Son resultados de esas configuraciones evaluadas; el nombre comercial por sí solo no permite anticipar cuánto costará resolver un caso.

El extremo económico también se mueve

GPT-6 Luna en max registra 37 puntos y 0,07 USD por tarea del índice. MiMo-V2.6-Flash figura en la selección con 38 puntos y 0,06 USD. Estos resultados invitan a probar alternativas para trabajos repetitivos con salida verificable. Que una tarea sea frecuente no significa que tolere errores: el control de calidad sigue formando parte del proceso.

OpenRouter, Artificial Analysis y Arena: qué mirar en cada uno

ReferenciaQué aportaCómo usarla
Artificial AnalysisEvaluaciones de capacidad, coste por tarea y rendimientoPreparar una lista corta con la misma versión de índice y configuración
OpenRouter RankingsUso observado de modelos dentro de su plataformaDetectar adopción y tendencias; distinguir uso de capacidad
ArenaComparaciones y preferencias de usuarios por categoríasContrastar tareas de conversación o creación con evaluaciones técnicas

OpenRouter Rankings explica que ordena su clasificación de uso por tokens procesados. Su apartado de benchmarks incorpora además puntuaciones de Artificial Analysis. Conviene leer el eje de cada gráfico: volumen de uso, precio de entrada y coste por tarea describen cosas distintas. Arena ofrece otra perspectiva por categorías. No mezclamos sus puntuaciones con el índice AA en el mismo eje.

Otras señales de actualidad que conviene seguir

Agentes: la prueba empieza a parecerse más al trabajo

La metodología del índice v4.3.2 incorpora, entre otras evaluaciones, AutomationBench-AA y Terminal-Bench 4.0. Para una empresa, la pregunta útil es si el sistema termina un flujo con varias herramientas y estados. Resolver un mensaje aislado no demuestra que pueda conciliar documentos, gestionar una excepción y dejar un registro comprensible.

Documentos, imágenes y vídeo necesitan su propia comparación

Analizar una factura fotografiada, redactar una respuesta y generar un vídeo son trabajos diferentes. El índice de este gráfico compara modelos de lenguaje y no demuestra calidad de generación de imagen, voz o vídeo. Para producción creativa conviene consultar las evaluaciones específicas de imagen, vídeo y voz y probar material real: texto pequeño, coherencia, duración, revisiones y coste del resultado utilizable.

Menos gasto por token no garantiza menos gasto por trabajo

Un agente puede pedir información, llamar a una herramienta, revisar su respuesta y repetir. El resultado depende del número de pasos y de lo que haya que corregir. La documentación de contabilidad de uso de OpenRouter permite consultar consumo y coste. Para decidir, agrupa todas las llamadas del mismo caso y añade la revisión humana.

Qué probar según el trabajo de tu empresa

TrabajoPrimer criterioPrueba que decide
Clasificar solicitudes o extraer camposCoste bajo con formato verificableCampos correctos, casos incompletos y tasa de revisión
Responder con documentación propiaUso fiel de las fuentesCitas que sostienen la respuesta y abstención cuando falta evidencia
Programar o usar varias herramientasFinalización del flujoTarea resuelta con permisos, validaciones y errores de herramienta
Redactar contenido de marcaCalidad editorial en españolCorrecciones necesarias, tono y fidelidad a los hechos
Conversar en tiempo realRespuesta completa a tiempoEspera percibida y calidad con la configuración más rápida aceptable

Nuestra propuesta es elegir tres candidatos: uno económico, uno equilibrado y uno de mayor capacidad. Somételos al mismo conjunto de casos y a las mismas reglas de aceptación. En cómo elegir un modelo de IA para tu empresa explicamos una prueba práctica. Para llevar el resultado a presupuesto, consulta cómo calcular el coste real de la IA.

Cómo leemos los datos y sus límites

  • Misma referencia: índice AA v4.3.2 y coste medio ponderado por tarea del mismo benchmark. Las cifras proceden de evaluaciones públicas; no son pruebas ejecutadas por Logic2b.
  • Coste comparable: incorpora el consumo y las tarifas que utiliza el evaluador, incluido razonamiento y caché cuando corresponden. No multiplicar este valor por tus consultas para presupuestar.
  • Configuración visible: low, medium, high, xhigh y max identifican esfuerzo. En las filas de Claude mantenemos la condición con fallback de la fuente; no equivale a una configuración sin respaldo.
  • Precisión: mantenemos los enteros y los costes de la tabla consultada. No atribuimos significación estadística a diferencias pequeñas ni construimos una clasificación universal.
  • Selección: un modelo ausente puede no estar incluido en esta edición. Las futuras incorporaciones necesitan puntuación y coste verificables bajo la misma metodología.

Registro de actualizaciones

FechaEdiciónQué incorpora
30 sep 2026Primera edición · índice AA v4.3.222 configuraciones de 10 creadores, gráfico, filtros, tabla, CSV y revisión de lanzamientos recientes

En la siguiente revisión actualizaremos el corte de datos, incorporaremos modelos con resultados verificados y revisaremos las conclusiones. Si cambia la versión del benchmark, lo indicaremos: puntuaciones de versiones distintas no forman una serie histórica directamente comparable.

Preguntas frecuentes · 04

Dudas habituales

¿Qué modelo de IA es el mejor ahora?

Depende del trabajo y la configuración. El gráfico permite comparar inteligencia y coste dentro del benchmark AA; la decisión final necesita pruebas con tus tareas, tiempos de respuesta y reglas de aceptación.

¿El coste del gráfico es el precio por millón de tokens?

No. Es el coste medio ponderado en dólares por tarea del Artificial Analysis Intelligence Index. El precio por token y la suscripción de un asistente son medidas diferentes.

¿Este benchmark se actualiza automáticamente?

No. Cada edición se revisa editorialmente, conserva esta URL y publica una fecha de consulta y un registro de cambios. No se presentan datos como si fueran en directo.

¿Por qué aparece varias veces el mismo modelo?

Cada punto representa una configuración de esfuerzo de razonamiento. Cambiar el esfuerzo puede modificar la capacidad medida y el coste, aunque el nombre del modelo sea el mismo.

Fuentes y referencias

  1. Artificial Analysis · tabla de modelos consultada el 30/09/2026
  2. Artificial Analysis · metodología del Intelligence Index
  3. GPT-6.1 Sol · ficha y fecha de lanzamiento
  4. Claude Sonnet 5.5 · ficha y fecha de lanzamiento
  5. Claude Opus 5.5 · ficha y fecha de lanzamiento
  6. GPT-6 Luna · ficha del modelo
  7. MiMo-V2.6-Flash · ficha del modelo
  8. OpenRouter · rankings de uso y benchmarks
  9. Arena · clasificación por categorías
  10. OpenRouter · contabilidad de uso

Contenido revisado por Logic2b el . Los ejemplos de proceso son orientativos y deben adaptarse a cada negocio.

Del benchmark a tu proceso

Definimos contigo una tarea, los criterios de aceptación y un piloto medible para elegir la IA que encaja en tu empresa.

Explorar automatización con IA
Contacta