⚡ Resumen rápido
- Cambié solo el procesador: misma placa, misma RAM, mismo Ollama.
- Probé Gemma 4 E2B y Gemma 4 E4B con 3 tareas cada uno.
- La mayor diferencia: 33 min 58 s → 3 min 02 s (11× más rápido).
- En el total de 6 pruebas: 82% menos tiempo con el i5.
- El upgrade costó hardware de segunda mano. Sin GPU. Sin magia.
Cuando la herramienta se convierte en obstáculo
Imagina que estás programando, encuentras un error que no entiendes y le preguntas al modelo. El modelo tarda 17 minutos en responderte. Para cuando llega la respuesta ya perdiste el hilo, ya abriste Stack Overflow, ya hiciste otra cosa. La herramienta dejó de ser útil.
Eso era mi servidor de IA hace unas semanas. Un Pentium Gold corriendo Ollama bajo Debian sin GPU. Y sí: funcionaba. Pero “funcionar” y “ser útil” no son lo mismo cuando estás esperando 34 minutos por una respuesta.
Así que hice una pregunta simple: ¿qué pasa si solo cambio el procesador? Misma placa. Misma RAM. Mismo SSD. Mismo Ollama. Solo un Intel Core i5-10400 en lugar del Pentium Gold.
Esta entrada resume los resultados. Si quieres el contexto completo de dónde venimos — los cinco modelos que probé en el Pentium, por qué elegí Gemma y qué pasó con Qwen — puedes leerlo en el artículo anterior: ¿Puede un Pentium ejecutar IA local en 2026?
El punto de partida: qué tan lento era el Pentium
En el experimento anterior ejecuté Gemma 4 en sus dos variantes más ligeras sobre un Pentium Gold de 10th Gen — 2 núcleos, 4 hilos, 4 MB de caché L3 — con 24 GB de RAM DDR4 y Debian headless. Sin GPU. Sin optimizaciones extrañas.
Los tiempos hablaron por sí solos:
- Gemma 4 E2B generando un juego en C++: 12 minutos 34 segundos.
- Gemma 4 E4B respondiendo una historia corta: 33 minutos 58 segundos.
Técnicamente funciona. Pero hay una diferencia entre demostrar que algo es posible y tener algo con lo que realmente trabajar.
El Intel Core i5-10400: mismo socket, otra categoría
El i5-10400 es décima generación, mismo socket LGA1200 que el Pentium Gold. Eso significa que el upgrade fue físicamente sencillo: retirar disipador, cambiar procesador, pasta térmica, encender. Debian reconoció los 12 hilos sin instalar nada adicional.
La diferencia en papel:
| Pentium Gold | i5-10400 | |
|---|---|---|
| Núcleos | 2 | 6 |
| Hilos | 4 | 12 |
| Caché L3 | 4 MB | 12 MB |
Dicho esto: tener tres veces más núcleos no garantiza automáticamente tres veces más velocidad en inferencia LLM. La distribución del trabajo entre núcleos depende del modelo, de la cuantización, del ancho de banda de memoria y de otros factores. Por eso no hice predicciones. Medí.
Si te interesa el proceso de montar este tipo de servidor desde cero — sistema operativo, red, acceso remoto — tienes la guía completa en cómo convertir una PC vieja en servidor casero con Debian, que cubre exactamente ese proceso paso a paso.
Prueba 1: Gemma 4 E2B — el modelo ligero
Gemma 4 E2B es el modelo más pequeño de los dos: 7.2 GB en disco, diseñado para dispositivos de borde, con soporte multimodal y ventana de 128K tokens. La métrica fue la misma que en el experimento del Pentium: cronómetro desde que envío el prompt hasta que termina la respuesta completa.
Las tres tareas
| Tarea | Pentium Gold | i5-10400 | Mejora |
|---|---|---|---|
| Juego en C++ | 12:34 | 2:07 | 8.3× |
| Explicación Docker | 7:52 | 1:36 | 4.9× |
| Historia corta | 8:56 | 1:24 | 6.4× |
Con E2B ya tienes respuestas en menos de dos minutos para la mayoría de las tareas. Sigue siendo más lento que una GPU o una API, pero ya puedes quedarte esperando. Ya cabe dentro del flujo de trabajo.
Prueba 2: Gemma 4 E4B — el modelo pesado
Gemma 4 E4B tiene el doble de parámetros efectivos que el E2B. Más capacidad, más peso: 9.6 GB. En el Pentium fue donde los tiempos se volvieron imposibles. Era el candidato más interesante para ver si el i5 realmente cambiaba las cosas.
La prueba de los 33 minutos
En el Pentium, pedirle al modelo E4B que escribiera una historia corta sobre un programador tardó 33 minutos y 58 segundos. Un tiempo en el que puedes ir a por un café, volver, preparar el siguiente prompt, y todavía estarías esperando.
Con el i5-10400, la misma tarea tardó 3 minutos y 2 segundos.
Historia corta — Gemma 4 E4B
33:58
→ 3:02
11.2× más rápido
Para mí fue el momento en que el upgrade dejó de ser un número en una tabla y se convirtió en algo real.
| Tarea | Pentium Gold | i5-10400 | Mejora |
|---|---|---|---|
| Juego en C++ | 23:39 | 6:20 | 3.7× |
| Explicación Docker | 12:51 | 4:03 | 3.2× |
| Historia corta | 33:58 | 3:02 | 11.2× |
Resultados totales: las 6 pruebas juntas
| Modelo | Tarea | Pentium | i5-10400 | Mejora |
|---|---|---|---|---|
| E2B | Juego C++ | 12:34 | 2:07 | 8.3× |
| E2B | Docker | 7:52 | 1:36 | 4.9× |
| E2B | Historia | 8:56 | 1:24 | 6.4× |
| E4B | Juego C++ | 23:39 | 6:20 | 3.7× |
| E4B | Docker | 12:51 | 4:03 | 3.2× |
| E4B | Historia | 33:58 | 3:02 | 11.2× |
| TOTAL | 1:44:50 | 0:18:32 | 5.7× / −82% | |
Una hora cuarenta y cuatro minutos con el Pentium. Dieciocho minutos con el i5. El mismo hardware, la misma placa, el mismo Ollama.
Algo que no esperaba: el problema del contexto desapareció
En el experimento del Pentium tuve un problema con Ollama: después de la primera prueba, el siguiente prompt se mezclaba con la conversación anterior. Le pedía una explicación de Docker y el modelo respondía sobre el juego de C++ que había pedido antes. Tuve que recargar el modelo entre cada prueba.
Esta vez no pasó. Cargué el modelo una sola vez y ejecuté las tres pruebas seguidas sin interrupciones. Los contextos se mantuvieron separados.
Quiero ser claro: no sé si fue el procesador, la configuración o la sesión. Pero el proceso fue considerablemente más cómodo.
Por cierto: si quieres entender Docker antes de integrarlo en un setup de este tipo, tengo un artículo que explica qué es Docker y para qué sirve en un servidor doméstico — uno de los más leídos del blog.
¿Vale la pena el upgrade? Pros y contras reales
✅ A favor
- Tiempos 3× a 11× más cortos según la tarea.
- Upgrade de placa LGA1200 a LGA1200 — sin cambiar nada más.
- Se consigue de segunda mano a bajo costo.
- Privacidad total: la IA corre en tu red, sin APIs externas.
- Mejora la experiencia general del servidor, no solo la IA.
⚠️ En contra
- Sigue siendo lento frente a una GPU o una API cloud.
- 6 minutos sigue siendo tiempo de espera real.
- Al mejorar el CPU, el siguiente cuello de botella aparece.
- No apto para conversación fluida en tiempo real.
- Sin GPU, los modelos más grandes siguen siendo inviables.
¿A quién le recomendaría este upgrade?
Depende de para qué uses la IA local.
Si solo trabajas con modelos de 1B a 3B parámetros — como TinyLlama o Phi-3 Mini — el Pentium todavía aguanta. El upgrade tiene más sentido cuando quieres trabajar con modelos de 7B en adelante, o cuando los tiempos del Pentium ya empiezan a sacarte del flujo de trabajo.
Y si estás explorando montar este tipo de servidor desde cero con una PC que ya tienes en casa, el artículo ¿vale la pena usar una PC vieja como servidor casero? es un buen punto de partida para evaluar si el hardware que tienes es suficiente antes de gastar en nada.
Una advertencia honesta: una vez que mejoras el procesador, aparece el siguiente cuello de botella. En mi caso ya empiezo a pensar en una tarjeta gráfica y en modelos más grandes. Gemma 4 no termina en E4B — existen versiones con muchos más parámetros, y quiero descubrir hasta dónde puede llegar este servidor.
Conclusión: de demostración a herramienta real
Cambiar el Pentium por el i5-10400 no convirtió esto en una supercomputadora. Pero convirtió una máquina que apenas podía demostrar que la IA local era posible en una máquina con la que realmente puedo trabajar.
Empecé con un Pentium. Lo llevé hasta donde pudo llegar. Encontré el límite, cambié solo la pieza que necesitaba cambiar. Ese es el enfoque: no comprar el hardware más potente desde el principio, sino entender los límites reales y actualizarlos en el momento exacto en que dejan de ser aceptables.
El siguiente paso es conectar este servidor con mis herramientas reales y usarlo dentro de mi red. Eso lo veremos en próximos videos.
Si quieres seguir el experimento desde el principio, el punto de partida está en el artículo anterior: ¿puede un Pentium ejecutar IA local en 2026? — y si te interesa la IA offline con otro enfoque, el proyecto Strix Reader muestra cómo usar Ollama para traducir PDFs completamente sin internet.
¿El video te fue útil? Suscríbete para ver cómo evoluciona el servidor de IA.
▶ Ver el video completoPreguntas Frecuentes sobre IA Local sin GPU
En este benchmark real con Gemma 4 y Ollama, la mejora varió entre 3.2× y 11.2× según el modelo y la tarea. La diferencia más grande fue con Gemma 4 E4B en una tarea de generación de texto: de 33 minutos y 58 segundos bajó a 3 minutos y 2 segundos. En el total de las 6 pruebas, el i5-10400 fue 5.7 veces más rápido, reduciendo el tiempo total en un 82%.
Sí. Ollama está diseñado para funcionar en CPU cuando no hay GPU disponible. La limitación es la velocidad: los tiempos de respuesta se miden en minutos, no en segundos. Con un i5-10400 y Gemma 4 E2B, los tiempos rondan 1–2 minutos por respuesta, lo que ya es manejable para muchos casos de uso. Para el setup inicial, Ollama se instala con un solo comando en Debian y no requiere configuración adicional.
Para hardware sin GPU, Gemma 4 E2B es la mejor opción. Con 7.2 GB en disco ofrece mejor calidad que modelos más pequeños como TinyLlama, y sus tiempos en un i5-10400 son asumibles: entre 1 y 2 minutos para la mayoría de tareas. Gemma 4 E4B produce respuestas más elaboradas pero puede tardar entre 3 y 6 minutos — útil cuando la calidad importa más que la velocidad. Ambos modelos están disponibles directamente desde la librería oficial de Ollama.
Depende del uso. Si trabajas exclusivamente con modelos de 1B a 3B parámetros (TinyLlama, Phi-3 Mini), el Pentium puede ser suficiente. Si quieres trabajar con modelos de 7B o más, el upgrade es difícil de ignorar: la diferencia pasa de tiempos imposibles a tiempos incómodos pero manejables. El factor decisivo es la experiencia de uso: con el Pentium los tiempos sacan al usuario del flujo de trabajo; con el i5 ya puedes quedarte esperando la respuesta.
Debian headless (sin entorno gráfico) es una excelente opción: mínimo consumo de recursos, estabilidad probada y compatibilidad total con Ollama. El servidor se gestiona por SSH desde otra máquina, lo que elimina el overhead de cualquier escritorio. Ubuntu Server es otra alternativa válida si prefieres una base más actualizada. Lo importante es no desperdiciar RAM y CPU en un entorno gráfico que no vas a usar directamente en el servidor.
Para Gemma 4 E2B necesitas al menos 8 GB disponibles para el modelo. Para E4B, unos 10–12 GB. En este benchmark se usaron 24 GB DDR4, pero el cuello de botella fue el CPU, no la RAM. Con 16 GB tienes margen cómodo para ambos modelos y el propio sistema operativo. Si planeas correr modelos más grandes en el futuro (13B, 30B), 32 GB empiezan a tener sentido.
La “E” significa “parámetros efectivos” — son modelos optimizados para dispositivos de borde (edge). E2B tiene aproximadamente 2 mil millones de parámetros efectivos y pesa 7.2 GB; E4B tiene el doble de parámetros efectivos y ocupa 9.6 GB. Ambos tienen ventana de contexto de 128K tokens y soporte multimodal. En la práctica, E4B produce respuestas más elaboradas a costa de tiempos de inferencia más altos en CPU, especialmente en tareas de generación larga.





