¿Cuál es el mejor modelo de IA local? 13 modelos frente a 1.080 pruebas reales
Benchmark propio de Acuántico Power · agosto de 2026
1.080 ejecuciones locales · 20 configuraciones · 54 pruebas · Ryzen 7 5800X · RTX 2080 SUPER · LM Studio
Quería averiguar cuál era el mejor modelo de IA local para funcionar dentro de un agente en mi propio PC. La respuesta exigía mucho más que comparar fichas técnicas o repetir clasificaciones ajenas.
Te encuentras nombres como Qwen3.6-35B-A3B-Q4_K_M o Qwen3-4B-Thinking-Distilled-Q4_K_M-GGUF y se supone que tienes que saber cuál descargar. ¿35B es mejor que 4B? ¿Q4 es malo? ¿Qué significa K_M? ¿Por qué un modelo de 27.000 millones de parámetros puede ocupar poco más de 4 GiB? ¿Y por qué el que mejor razona puede funcionar peor como asistente?

Estas preguntas aparecieron mientras probaba modelos para Agente Jiménez, mi laboratorio de agentes de IA local. El experimento acabó creciendo hasta reunir 13 modelos, 20 configuraciones, 54 pruebas por configuración y 1.080 ejecuciones locales.
Las pruebas locales las realizó Adolfo-Assistant dentro de Agente Jiménez, utilizando en cada caso el modelo cargado en LM Studio. Después añadí otras 54 ejecuciones de Codex + OpenAI GPT-5.6 Sol, con razonamiento alto, como referencia externa de lo que logra un agente frontera completo. En total, este estudio reúne 1.134 respuestas.
Datos propios, agente propio y tareas de uso cotidiano
Este no es un metaanálisis ni una colección de benchmarks genéricos o sintéticos. Acuántico Power diseñó el conjunto de pruebas, ejecutó cada interacción y conservó sus respuestas y métricas. Agente Jiménez también es un desarrollo propio: permitió medir cómo se comporta cada variante al conversar, recordar contexto, traducir, programar, investigar, utilizar herramientas, detectar premisas falsas y ayudar en situaciones parecidas a las que afronta un asistente local real.

Resultados rápidos
| Si buscas… | Resultado del banco | Dato medido |
|---|---|---|
| Referencia de agente frontera | Codex + OpenAI GPT-5.6 Sol | 94,9/100 · 0 fallos · referencia externa |
| Mayor puntuación local | Gemma 4 26B-A4B · ON | 94,4/100 · 1 fallo · 4.995,9 s |
| Mayor puntuación local sin fallos | Gemma 4 26B-A4B · OFF | 92,5/100 · 0 fallos · 1.715,2 s |
| Mejor configuración de 4B | Qwen3.5 4B Uncensored · ON | 90,7/100 · 0 fallos · 1.707,8 s |
| Equilibrio compacto | Qwen3 VL 4B · nativo | 87,5/100 · 0 fallos · 469,6 s · visión |
| Más rápido | Tiny Aya Global · nativo | 74,2/100 · 0 fallos · 166,8 s |
| Reasoning menos rentable | Gemma 4 E4B | OFF: 91,7/100 en 989,0 s · ON: 91,5/100 en 2.288,3 s |
Entorno de estas cifras: Ryzen 7 5800X, 32 GiB de RAM, GeForce RTX 2080 SUPER, contexto de 32.768 tokens y descarga a GPU configurada al máximo en LM Studio. Son resultados de las variantes concretas probadas en agosto de 2026, no promesas de rendimiento para cualquier equipo.
El ranking mide cuál funcionó mejor como agente dentro de esta arquitectura. No intenta decidir cuál es el modelo más inteligente en abstracto.
Preguntar cuál es el mejor modelo local sin decir para qué lo quieres es casi una pregunta sin respuesta.
Este artículo no pretende entregarte un campeón para que cierres la pestaña y descargues lo primero que aparezca. La finalidad es que entiendas qué estás comparando, veas dónde destaca y dónde falla cada modelo y puedas escoger por ti mismo.
La respuesta corta: no existe un único ganador
El mejor modelo para redactar no tiene por qué ser el mejor para programar. El más rápido puede inventar datos. El que obtiene respuestas más elaboradas puede tardar demasiado para una conversación diaria. Un modelo excelente puede además fallar dentro de un agente por su plantilla de chat, su formato de herramientas o su comportamiento multiturno.
La regla que resume todo el benchmark
No eliges una inteligencia abstracta. Eliges una combinación concreta de modelo, ajuste, cuantización, runtime, plantilla, contexto y configuración para una tarea concreta.
La auditoría de las respuestas guardadas coloca a Gemma 4 26B-A4B en cabeza entre los modelos locales: 94,4/100 con razonamiento activado, aunque registró un fallo técnico, y 92,5/100 con razonamiento desactivado y sin fallos. Qwen3.5 4B alcanzó 90,7/100 con razonamiento activado. Qwen3.6 35B-A3B quedó en 89,6/100 con ON y 89,5/100 con OFF, pero sufrió tres fallos en ambos modos. Bonsai 27B obtuvo 84,9/100 con ON y 80,9/100 con OFF, también con tres fallos por modo.

No es una contradicción. El tamaño compra capacidad potencial; no garantiza que esa capacidad encaje con tu equipo ni con la manera en que la aplicación utiliza el modelo.
El primer error: elegir por el número de parámetros
Los parámetros son, simplificando mucho, valores que el modelo aprendió durante su entrenamiento. Un 4B tiene alrededor de 4.000 millones y un 27B, unos 27.000 millones. Esa cifra ayuda a estimar capacidad y requisitos, pero no funciona como una puntuación de inteligencia.
Dense y MoE: cuando 35B tampoco significa lo que parece
En un modelo dense, aproximadamente toda la red participa en cada token generado. En un Mixture of Experts o MoE existen grupos de parámetros —los expertos— y un enrutador activa solo una parte para procesar cada token.

En Qwen3.6 35B-A3B, 35B indica los parámetros totales y A3B que participan aproximadamente 3B activos por token. Eso reduce trabajo de cálculo, pero el sistema todavía debe almacenar el modelo. El GGUF probado ocupa 20,55 GiB. Gemma 4 26B-A4B, con unos 4B activos, ocupa 14,56 GiB.
Al leer un nombre MoE debes separar dos preguntas: cuántos parámetros tengo que almacenar y cuántos intervienen en cada token. Son problemas diferentes.
Cómo leer el nombre de un modelo sin perderse
Imagina un nombre ficticio: Familia-4B-Instruct-Distilled-Q4_K_M.gguf. Ahí aparecen varias decisiones que conviene no mezclar.
familia · parámetros · comportamiento · entrenamiento posterior · cuantización · formato
| Parte | Qué intenta decirte |
|---|---|
| Familia | Arquitectura o modelo base del que procede |
| 4B | Tamaño aproximado en parámetros |
| Instruct / Chat / Reasoning / Coder / VLM | Comportamiento o tarea para la que fue ajustado |
| Distilled / fine-tuned / QAT / merge | Qué ocurrió después del preentrenamiento |
| Q4_K_M | Receta utilizada para comprimir los pesos |
| GGUF | Formato que empaqueta tensores y metadatos para el runtime |
Base, Instruct, Chat, Reasoning, Coder y VLM
Un modelo base aprendió a predecir texto, pero no necesariamente a comportarse como un asistente. Instruct indica entrenamiento posterior para seguir instrucciones. Chat apunta a conversación. Reasoning suele dedicar más computación o generar pasos intermedios. Coder se especializa en código. Un VLM añade visión y puede procesar imágenes.
Son pistas, no certificados. Un modelo llamado Reasoning puede razonar bien y aun así filtrar sus etiquetas <think>, romper el formato o elegir mal una herramienta.
GGUF no es una cuantización
GGUF es un formato de archivo. Puede contener un modelo en F16, Q8, Q6, Q5, Q4 o cuantizaciones mucho más agresivas. Piensa en GGUF como el contenedor y en Q4 como una de las posibles maneras de representar los pesos que guarda.
Qué significa cuantizar
Los pesos originales suelen utilizar bastante precisión, por ejemplo FP16 o BF16. Una cuenta orientativa sería: 7.000 millones de parámetros × 2 bytes ≈ 14 GB, antes de sumar otros gastos. La cuantización reduce memoria y computación representando esos valores con menos precisión y aceptando cierto error.
| Cuantización | Lectura práctica |
|---|---|
| Q8 | Mucha fidelidad y consumo de memoria relativamente alto |
| Q6 / Q5 | Compresión moderada; buen equilibrio si tienes memoria |
| Q4 | Zona muy utilizada en equipos domésticos |
| Q3 | Compresión agresiva; hay que probar cuánto pierde |
| Q2 / Q1 | Compresión extrema; tamaño sorprendente, riesgo elevado de degradación |
Los K-quants de llama.cpp utilizan bloques y escalas propias, y pueden mezclar tipos de tensor. Por eso Q4_K_M es una receta, no una nota de calidad. El caso extremo del benchmark es Bonsai 27B: su variante Q1_0 ocupa 4,41 GiB. El número 27B describe el modelo original; 4,41 GiB describe la representación concreta ejecutada.
Cuantizar pesos y cuantizar la KV cache no es lo mismo
Durante una conversación, el Transformer conserva claves y valores calculados anteriormente para no repetir todo el trabajo. Esa memoria temporal es la KV cache y crece con el contexto. Cuantizarla reduce su huella, pero no comprime lo que el modelo aprendió: comprime parte de lo que recuerda durante la inferencia actual.
Por eso un GGUF de 3 GiB no implica que necesites exactamente 3 GiB de VRAM. También existen la KV cache, los buffers del runtime, el contexto, el proyector visual de algunos VLM y otros gastos.
Contexto anunciado y contexto práctico
Varios modelos anuncian cientos de miles de tokens, pero en el banco local todos se cargaron con 32.768 para mantener la comparación. LM Studio permite elegir contexto y descarga a GPU; aumentar el contexto aumenta memoria. Que una ficha diga 256K no garantiza que puedas usarlo cómodamente ni que el modelo aproveche bien la información al llenarlo.
Por qué dos variantes de la misma familia pueden comportarse distinto
Muchas variantes locales no proceden directamente del creador de la familia. Alguien las ajustó, destiló, mezcló o modificó después. Ese historial importa tanto como el número de parámetros.
Un fine-tune especializa comportamiento o dominio; LoRA y QLoRA permiten hacerlo entrenando adaptadores con menos recursos; la destilación transfiere parte del comportamiento de un modelo profesor; y un merge combina pesos o adaptadores relacionados. No necesitas memorizar el proceso para elegir: necesitas saber que dos descargas con una familia parecida pueden obedecer, razonar y alucinar de forma muy diferente.
El nombre del modelo es una pista. La model card es la evidencia.
Y «uncensored» no significa «más inteligente»
La variante Qwen3.5 4B Uncensored HauhauCS Aggressive fue el 4B mejor puntuado con razonamiento activado: 90,7/100. No ocurrió por tener superpoderes. Uncensored suele señalar cambios en alineamiento o rechazo; puede ser útil para algunos usos y contraproducente en otros. En este banco su área de honestidad quedó en 7,33/10, por debajo de su media global.
Menos negativas no significa más precisión.
Cómo se hicieron las pruebas
El benchmark responde a una pregunta concreta: qué variantes funcionan mejor dentro de un agente local que debe conversar, razonar, utilizar herramientas y no inventarse alegremente el mundo.
| Elemento | Configuración del laboratorio |
|---|---|
| Agente local | Adolfo-Assistant dentro de Agente Jiménez |
| Runtime | LM Studio |
| Equipo | Ryzen 7 5800X · 32 GiB RAM · GeForce RTX 2080 SUPER |
| Contexto | 32.768 tokens |
| Descarga a GPU | Máxima permitida por LM Studio |
| Salida máxima | 8.192 tokens |
| Aislamiento | Una sesión nueva por prueba; contexto compartido solo dentro de pruebas multiturno |
| Referencia frontera | Codex + OpenAI GPT-5.6 Sol, razonamiento alto, 54 sesiones aisladas |
Las 54 pruebas cubren control de formato, respuesta larga, diagnóstico, privacidad, falsas premisas, radio y SDR, programación, matemáticas, memoria multiturno, comunicación, traducción, varios idiomas, RAG, evaluación de fuentes, navegación y comportamiento como agente.
Qué mide la puntuación media
| Bloques del banco | Qué comprueban |
|---|---|
| Control, instrucciones y contexto | Longitud exacta, estructura, aislamiento entre sesiones y memoria multiturno |
| Razonamiento, matemáticas y programación | Diagnóstico, cálculos comprobables, generación y depuración de código |
| Radio, SDR y privacidad | Conocimiento técnico aplicado, procedimiento y análisis de riesgos |
| Comunicación y creatividad | Claridad, adaptación al usuario y utilidad de las propuestas |
| Traducción e idiomas | Terminología, conservación del significado, registro y control de invenciones |
| Investigación, RAG y web | Extracción fiel, evaluación de fuentes, actualidad y reconocimiento de límites |
Cómo se obtuvo cada puntuación
La puntuación se reconstruyó directamente desde los resultados persistidos. Cada una de las 54 tareas recibe de 0 a 10 puntos mediante reglas explícitas derivadas de su propio criterio: cifras correctas en matemáticas, palabras y campos exigidos en control de salida, datos recuperados en RAG, conceptos requeridos en respuestas técnicas y rechazo de entidades ficticias en las pruebas de alucinación. La cifra global es la media simple de las 54 tareas multiplicada por diez. La velocidad se publica aparte y no puede ocultar una respuesta peor ni mejorar artificialmente la nota de calidad.
- Una respuesta convincente puntúa cero en una trampa factual si inventa especificaciones, autores o funciones inexistentes.
- Un fallo técnico puntúa cero en esa tarea, aunque haya quedado una respuesta parcial útil para el diagnóstico.
- ON, OFF y modo nativo se conservan como configuraciones distintas; no se promedian ni se escoge una para ocultar la otra.
- Las notas por bloque permanecen disponibles para interpretar fortalezas y debilidades; la clasificación general no sustituye ese detalle.
Los prompts, las respuestas y los eventos JSON se conservan en run-20260823-095238. La auditoría reproducible genera además agent-score-audit.json, agent-score-audit.csv y el detalle por prueba agent-score-test-details.csv. La referencia frontera se sometió a las mismas 54 tareas y reglas de contenido, pero se muestra separada porque no comparte hardware ni ruta de ejecución con los modelos locales.
Límite de los artefactos: el resultado guardado de la prueba 14.13 permite comprobar la tabla, los enlaces, las fechas y los niveles de confianza entregados, pero el run no conserva una traza independiente de cada acción del navegador. Por eso este artículo no presenta esa respuesta final como prueba de que la navegación ocurrió; evalúa únicamente lo que puede auditarse en los archivos.
Esta media responde al conjunto cotidiano diseñado para Agente Jiménez, no a una inteligencia universal. Si solo escribes novelas, programas o traduces, debes consultar el bloque correspondiente y aplicar tus propias prioridades. El promedio permite comparar el banco completo; no decide por ti.
Los 13 modelos frente a frente
Esta tabla muestra todas las configuraciones. La nota es la media de las 54 tareas y el tiempo es el total real registrado. No es una promesa para otro ordenador: compara estas ejecuciones en el mismo banco.
Advertencia metodológica: estos resultados no significan que Qwen sea universalmente mejor que Gemma, Mistral o IBM. Describen estas variantes, cuantizaciones, modos de razonamiento y configuraciones concretas ejecutadas en Agente Jiménez.
| Modelo probado | Modo | Media /100 | Fallos | 54 pruebas |
|---|---|---|---|---|
| Codex + OpenAI GPT-5.6 Sol | Referencia | 94,9 | 0 | 2.037,3 s |
| Gemma 4 26B-A4B QAT | ON | 94,4 | 1 | 4.995,9 s |
| Gemma 4 26B-A4B QAT | OFF | 92,5 | 0 | 1.715,2 s |
| Gemma 4 E4B | OFF | 91,7 | 0 | 989,0 s |
| Gemma 4 E4B | ON | 91,5 | 0 | 2.288,3 s |
| Qwen3.5 4B Uncensored HauhauCS | ON | 90,7 | 0 | 1.707,8 s |
| Qwen3.6 35B-A3B | ON | 89,6 | 3 | 6.687,4 s |
| Qwen3.6 35B-A3B | OFF | 89,5 | 3 | 2.292,6 s |
| DeepSeek v4 Pro Qwen3.5 4B MTP | ON | 88,9 | 0 | 1.086,5 s |
| Qwen3 VL 4B | Nativo | 87,5 | 0 | 469,6 s |
| DeepSeek v4 Pro Qwen3.5 4B MTP | OFF | 86,6 | 0 | 380,6 s |
| Ministral 3 3B | Nativo | 86,4 | 0 | 378,6 s |
| Nemotron 3 Nano 4B | ON | 86,3 | 0 | 539,6 s |
| Qwen3 4B Thinking 2507 Distilled | Nativo | 85,1 | 0 | 603,5 s |
| Bonsai 27B | ON | 84,9 | 3 | 3.466,5 s |
| Granite 4 H Tiny | Nativo | 84,0 | 0 | 200,5 s |
| Phi-4 Mini Reasoning | ON | 83,6 | 0 | 1.151,2 s |
| Bonsai 27B | OFF | 80,9 | 3 | 1.327,5 s |
| Qwen3.5 4B Uncensored HauhauCS | OFF | 78,8 | 3 | 299,1 s |
| Nemotron 3 Nano 4B | OFF | 78,5 | 0 | 202,4 s |
| Tiny Aya Global | Nativo | 74,2 | 0 | 166,8 s |

Fichas y repositorios de las variantes: Qwen3.5 Uncensored HauhauCS · Gemma 4 26B-A4B QAT Q4_0 · DeepSeek v4 Pro 4B MTP · Qwen3 VL 4B · Ministral 3 3B · Qwen3.8 4B Distilled · Gemma 4 E4B QAT · Tiny Aya Global · Nemotron 3 Nano 4B · Bonsai 27B Q1 · Qwen3.6 35B-A3B · Granite 4 H Tiny · Phi-4 Mini Reasoning.
Importante: ok en los registros significa que la ejecución terminó y fue guardada; no significa que su contenido fuera correcto. Un modelo puede completar las 54 llamadas y alucinar en varias respuestas.
Las variantes tampoco comparten siempre la misma cuantización. Este experimento no aísla una arquitectura en condiciones académicas: compara paquetes reales que una persona puede cargar y utilizar. Por tanto, los resultados describen esas variantes concretas dentro de Agente Jiménez y LM Studio, no una esencia universal de cada familia.
¿Merece la pena activar el modo Reasoning en un modelo local?
Siete modelos permitían alternar el razonamiento desde LM Studio y realizaron las 54 pruebas de las dos formas. El impacto temporal fue enorme y no siempre vino acompañado de una mejor integración.
| Modelo | OFF: nota · tiempo · fallos | ON: nota · tiempo · fallos | Tiempo ON/OFF |
|---|---|---|---|
| Qwen3.5 4B Uncensored | 78,8 · 299,1 s · 3 | 90,7 · 1.707,8 s · 0 | 5,71× |
| DeepSeek v4 Pro Qwen3.5 4B | 86,6 · 380,6 s · 0 | 88,9 · 1.086,5 s · 0 | 2,85× |
| Nemotron 3 Nano 4B | 78,5 · 202,4 s · 0 | 86,3 · 539,6 s · 0 | 2,67× |
| Gemma 4 E4B | 91,7 · 989,0 s · 0 | 91,5 · 2.288,3 s · 0 | 2,31× |
| Gemma 4 26B-A4B | 92,5 · 1.715,2 s · 0 | 94,4 · 4.995,9 s · 1 | 2,91× |
| Qwen3.6 35B-A3B | 89,5 · 2.292,6 s · 3 | 89,6 · 6.687,4 s · 3 | 2,92× |
| Bonsai 27B | 80,9 · 1.327,5 s · 3 | 84,9 · 3.466,5 s · 3 | 2,61× |
Activar razonamiento no es un interruptor universal de «hacerlo más inteligente». En Qwen3.5 aportó 11,9 puntos y eliminó tres fallos; en Gemma E4B restó 0,2 puntos mientras multiplicaba el tiempo por 2,31; en Qwen3.6 apenas añadió 0,1 puntos y mantuvo los tres fallos. Hay que decidirlo por modelo y tarea, no por la etiqueta.
Qué enseñó cada modelo en escenarios reales
Grounding es la capacidad de apoyar una respuesta en información real y reconocer cuándo faltan pruebas, en vez de completar los huecos inventando datos plausibles.
Para comparar perfiles sin esconderlos tras la media, esta matriz toma el modo con mayor nota global de cada modelo y muestra bloques medidos especialmente relevantes. Los ceros causados por fallos o incumplimientos se mantienen.
| Modelo · modo | Fortalezas medidas | Debilidad principal medida |
|---|---|---|
| Gemma 26B-A4B · ON | Honestidad, contexto, programación y razonamiento: 10/10 | Control de salida: 0/10 por un fallo |
| Gemma E4B · OFF | Honestidad, contexto y razonamiento: 10/10 | Control de salida: 4/10 |
| Qwen3.5 4B · ON | Contexto y control: 10/10; programación: 9,17 | Honestidad: 7,33/10 |
| Qwen3.6 35B · ON | Programación, razonamiento y control: 10/10 | Contexto: 0/10; tres fallos |
| DeepSeek 4B · ON | Contexto y razonamiento: 10/10; traducción: 9,22 | Control de salida: 0/10 |
| Qwen3 VL 4B · nativo | Contexto y razonamiento: 10/10; traducción: 9,31 | Honestidad: 3,33/10 |
| Ministral 3 3B · nativo | Programación: 10/10; investigación: 9,42; control: 9,4 | Honestidad: 5,33/10 |
| Nemotron 3 Nano · ON | Contexto y razonamiento: 10/10; honestidad: 8,67 | Control de salida: 0/10 |
| Qwen3 4B Thinking · nativo | Contexto y programación: 10/10 | Control: 0/10; honestidad: 5,33 |
| Bonsai 27B · ON | Razonamiento y control: 10/10 | Contexto: 0/10; tres fallos |
| Granite 4 H Tiny · nativo | Contexto, programación y razonamiento: 10/10 | Honestidad: 1,33/10; control: 1,6 |
| Phi-4 Mini · ON | Programación y contexto: 10/10; traducción: 9,5 | Honestidad y control: 0/10 |
| Tiny Aya · nativo | Programación: 10/10; investigación: 8,19 | Contexto y control: 0/10; honestidad: 3,33 |
Gemma 4 26B-A4B: máxima nota local, con un matiz operativo
Con razonamiento activado obtuvo 94,4/100, la mayor nota local, pero sufrió un fallo técnico y necesitó 4.995,9 segundos. Desactivado alcanzó 92,5/100 sin fallos en 1.715,2 segundos. La diferencia de 1,9 puntos cuesta casi tres veces más tiempo; para este banco, OFF ofrece la opción práctica más sólida y ON la mayor calidad bruta.
Qwen3.5 4B Uncensored: el mejor 4B depende por completo del modo
Con razonamiento activado obtuvo 90,7/100, cero fallos y fue el 4B mejor puntuado. Con razonamiento desactivado cayó a 78,8/100 y registró tres fallos, aunque terminó en solo 299,1 segundos. Es el ejemplo más claro de que el nombre del modelo no basta: las dos configuraciones difieren 11,9 puntos y 5,71 veces en tiempo.
Qwen3.6 35B-A3B: casi la misma nota, mucho más tiempo con ON
Obtuvo 89,6/100 con ON y 89,5/100 con OFF. Ambos modos sufrieron tres fallos y puntuaron cero en el bloque de contexto por esas tareas no completadas. ON tardó 6.687,4 segundos frente a 2.292,6 con OFF. En esta integración, el razonamiento adicional no corrigió el problema operativo ni justificó el coste temporal.
Bonsai 27B Q1: mucha capacidad comprimida hasta el límite
Su archivo de 4,41 GiB demuestra hasta dónde puede llegar una Q1. Obtuvo 84,9/100 con ON y 80,9/100 con OFF; ambos modos registraron tres fallos y perdieron el bloque de contexto. ON tardó 3.466,5 segundos. Es interesante para estudiar compresión extrema, pero estos datos no lo colocan entre las opciones más ágiles ni fiables del banco.
Qwen3 VL 4B: el equilibrio más fácil de recomendar
Ocupa 3,10 GiB, completó el conjunto en 469,6 segundos, obtuvo 87,5/100 y no registró fallos técnicos. Su bloque de contexto alcanzó 10/10 y el de investigación y RAG 9,04/10; honestidad quedó en 3,33/10, por lo que no conviene confundir equilibrio operativo con fiabilidad factual. Además aporta visión.
Gemma 4 E4B y Nemotron 3 Nano: prudencia antes que espectáculo
Gemma 4 E4B consiguió 91,7/100 con OFF y 91,5/100 con ON, ambos sin fallos. OFF fue 2,31 veces más rápido y obtuvo 10/10 en honestidad; ON bajó a 6,67/10 en ese bloque. Nemotron pasó de 78,5/100 con OFF a 86,3/100 con ON; su bloque de contexto fue 0 con OFF y 10 con ON. Son recordatorios de que el modo puede cambiar capacidades concretas, no solo la velocidad.
Tiny Aya, Granite y Ministral: la velocidad puede ocultar un coste
Tiny Aya fue el más rápido con 166,8 segundos y 74,2/100. Granite tardó 200,5 segundos y alcanzó 84,0/100; Ministral, 378,6 segundos y 86,4/100. Los tres terminaron sin fallos técnicos, pero sus bloques de honestidad fueron 3,33/10, 1,33/10 y 5,33/10 respectivamente. Para hardware limitado, Granite ofrece aquí mucha más calidad por solo 33,7 segundos adicionales frente a Tiny Aya, aunque necesita verificación factual estricta.
Para clasificación, transformación de texto o conversación de bajo riesgo pueden resultar útiles. Para investigación o decisiones factuales necesitan controles externos estrictos.
Modelos “Thinking”: razonar no basta si se filtra el proceso
Qwen3 4B Thinking Distilled obtuvo 85,1/100 y Phi-4 Mini Reasoning 83,6/100, ambos sin fallos técnicos. Sus bloques de honestidad fueron 5,33/10 y 0/10, y Phi-4 también puntuó 0 en control de salida. En un producto real, el razonamiento debe mejorar la respuesta final, no contaminarla ni sustituir la verificación.
Gemma 4 26B-A4B y DeepSeek 4B: respuestas elaboradas, riesgos diferentes
DeepSeek 4B obtuvo 88,9/100 con ON en 1.086,5 segundos y 86,6/100 con OFF en 380,6, sin fallos en ninguno. El razonamiento añadió 2,3 puntos y multiplicó el tiempo por 2,85. Gemma 26B-A4B mostró además una fuerte variación en honestidad: 10/10 con ON y 5,33/10 con OFF. La mayor media no elimina la necesidad de mirar cada bloque.
La referencia frontera: Codex + GPT-5.6 Sol
La referencia no pertenece a Agente Jiménez ni a LM Studio. Las 54 pruebas fueron ejecutadas por Codex con OpenAI GPT-5.6 Sol, razonamiento alto y una sesión aislada por test. En los artefactos del benchmark aparece como openai_gpt-5.6-sol. Sirve para poner techo práctico a la comparación: qué logra un agente frontera con orquestación y herramientas maduras frente a los agentes locales del laboratorio.
| Agentes locales | Referencia frontera | |
|---|---|---|
| Ruta | Adolfo-Assistant → Agente Jiménez → LM Studio → modelo local | Codex → OpenAI GPT-5.6 Sol |
| Pruebas | 1.080 entre 20 configuraciones | 54 con razonamiento alto |
| Aislamiento | Sesión nueva por test | Sesión nueva por test |
| Media global | Entre 74,2 y 94,4/100 | 94,9/100 |
| Tiempo total de 54 pruebas | Entre 166,8 y 6.687,4 s según configuración | 2.037,3 s |
| Lectura correcta del tiempo | Rendimiento local en el mismo PC | Referencia operativa de extremo a extremo, no benchmark del mismo hardware |
La siguiente gráfica compara el tiempo total de todas las configuraciones. Los modos ON, OFF y nativo aparecen por separado; la barra amarilla identifica la referencia externa. Una barra más corta significa una ejecución más rápida, no necesariamente una respuesta de mayor calidad.

El tiempo se conserva y se compara porque forma parte de la experiencia real. Sin embargo, no debe interpretarse como tokens por segundo del mismo motor: GPT-5.6 Sol utiliza una ruta externa y varias pruebas incluyen navegación y verificación. Su valor está en mostrar el coste temporal de una respuesta de agente frontera completa.
La referencia obtuvo 94,9/100 y completó las 54 ejecuciones sin errores técnicos. Obedeció el control exacto de 50 palabras y conservó los escenarios multiturno. No fue perfecta: la auditoría le asignó 8,06/10 en programación y 9,31/10 en traducción. En la prueba de navegación, la respuesta final contiene tabla, enlaces, fechas y niveles de confianza, pero el run no guardó una traza independiente que permita certificar cada acción del navegador.
La referencia no demuestra que la nube “gane”. Enseña qué piezas debe reforzar un agente local: grounding, herramientas, contexto, verificación y compatibilidad.
Qué modelo de IA local elegir según lo que quieras hacer
| Necesidad principal | Primera variante que probaría | Dato que la respalda | Precaución |
|---|---|---|---|
| Máxima puntuación local | Gemma 4 26B-A4B · ON | 94,4/100 | 1 fallo y 4.995,9 s |
| Máxima puntuación sin fallos | Gemma 4 26B-A4B · OFF | 92,5/100 · 0 fallos | 14,56 GiB y 1.715,2 s |
| Mejor 4B | Qwen3.5 4B Uncensored · ON | 90,7/100 · 0 fallos | Honestidad: 7,33/10 |
| Compacto, rápido y con visión | Qwen3 VL 4B | 87,5/100 en 469,6 s | Honestidad: 3,33/10 |
| 4B rápido sin visión | DeepSeek 4B · OFF | 86,6/100 en 380,6 s | ON añade 2,3 puntos, pero tarda 2,85× |
| Hardware muy limitado | Granite 4 H Tiny | 84,0/100 en 200,5 s | Honestidad: 1,33/10 |
| Priorizar rechazo de invenciones | Gemma 4 E4B · OFF | Honestidad 10/10 · global 91,7 | Control de salida: 4/10 |
| Experimentar con compresión extrema | Bonsai 27B Q1 · ON | 84,9/100 con archivo de 4,41 GiB | 3 fallos y 3.466,5 s |

Una prueba de cinco minutos vale más que una tabla ajena
- Elige tres tareas que repitas de verdad.
- Añade una falsa premisa para comprobar si el modelo se atreve a decir «no lo sé».
- Incluye un formato estricto y una conversación de dos o tres turnos.
- Mide memoria, tiempo hasta el primer token y duración completa.
- Cambia una sola variable cada vez: modelo, quant, contexto o modo de razonamiento.
Preguntas frecuentes sobre modelos de IA local
¿Cuál es el mejor modelo de IA local?
No existe uno universal. En este banco Gemma 4 26B-A4B obtuvo la mayor media local con ON (94,4/100, un fallo); su modo OFF fue la mejor configuración local sin fallos (92,5/100). Qwen3.5 fue el mejor 4B con ON (90,7/100), y Qwen3 VL reunió visión, 87,5/100 y 469,6 segundos.
¿Más parámetros significa mejor modelo?
No necesariamente. Los parámetros aportan capacidad potencial, pero también importan el ajuste, la cuantización, la plantilla, la memoria, la velocidad y la compatibilidad con tus tareas.
¿Qué significa Q4_K_M?
Es una receta de cuantización de la familia K-quants utilizada para reducir la memoria de los pesos. Q4 indica aproximadamente la zona de cuatro bits; K_M describe decisiones internas de bloques y tipos de tensor. No es una nota de calidad.
¿GGUF es una cuantización?
No. GGUF es el formato o contenedor. Dentro puede almacenar pesos F16, Q8, Q6, Q5, Q4 u otras cuantizaciones.
¿Conviene activar Reasoning?
Solo si mejora tus tareas concretas. En este laboratorio activarlo multiplicó el tiempo total entre 2,31× y 5,71×. Puede ayudar en diagnóstico o planificación y perjudicar formatos cortos, latencia e integración.
¿Cuánta memoria necesita un modelo local?
Más que el tamaño del archivo. Debes sumar pesos, KV cache, buffers, contexto y, en modelos visuales, el proyector. La forma fiable de saberlo es cargar la variante con tu contexto real y observar RAM y VRAM.
Lo que realmente debes llevarte de esta comparación
Un modelo pequeño puede ser rápido, privado y sorprendentemente capaz. También puede inventar un receptor, un artículo científico o un idioma con la misma seguridad con la que resuelve una traducción correcta. Un modelo grande puede razonar mejor y, aun así, convertirse en peor agente si es lento, pierde contexto o no encaja con la plantilla del runtime.
Por eso Agente Jiménez separa modelo, contexto, herramientas, skills, permisos y verificación. Como explico en IA local por dentro: qué hay realmente detrás de un agente de inteligencia artificial, el modelo es solo una pieza del sistema.
El mejor modelo local no es el que gana más tablas. Es el más pequeño, rápido y fiable que resuelve bien tus tareas dentro de tu equipo y de tu arquitectura.
La próxima vez que veas una cadena de siglas junto al botón de descarga, ya no estarás mirando ruido. Verás parámetros totales y activos, especialización, método de ajuste, cuantización, formato y requisitos. Y podrás decidir qué compromisos aceptas antes de entregar tu tiempo —y tus datos— al modelo.