⚡ Puntos clave del artículo
- Probé 5 modelos de IA con Ollama en CPU pura, sin GPU ni trampas.
- Hardware: Pentium Gold 10th Gen · 24 GB RAM · SSD SATA · Debian sin GUI.
- Gemma 4 E2B es el mejor balance calidad/tiempo para uso general.
- TinyLlama es el más veloz, pero responde en inglés y la calidad cae.
- Qwen 3 4B falló: mezcló contextos y produjo respuestas incorrectas.
- Sí se puede ejecutar IA local en hardware básico. No es rápido, pero funciona.
La pregunta que nadie quiere responder
Todo el mundo te dice lo mismo: para correr IA local necesitas una RTX 3090, 64 GB de RAM y un servidor que consuma más energía que tu refrigerador. Pero ¿qué pasa si solo tienes lo que tiene la mayoría de la gente: una PC de oficina olvidada, con un Pentium que lleva años juntando polvo?
Eso es exactamente lo que quise responder. Agarré un Pentium Gold de décima generación, le puse 24 GB de RAM DDR4, un SSD SATA, instalé Debian sin interfaz gráfica y lo puse a correr cinco modelos de lenguaje distintos usando Ollama. Sin GPU dedicada. Sin optimizaciones raras. Condiciones reales.
Si llevas tiempo siguiendo el canal, sabrás que me gusta exactamente este tipo de experimento: el mismo que hice cuando puse a prueba CachyOS para gaming sin tarjeta gráfica o cuando convertí una PC vieja en servidor casero, que puedes ver en el artículo cómo convertir una PC vieja en servidor con Debian . La pregunta siempre es la misma: ¿cuánto puedes exprimir del hardware que ya tienes?
El hardware y cómo monté el servidor
Las reglas del experimento fueron claras desde el inicio:
- Sin GPU. Nada de tarjeta dedicada.
- Sin trampa. Cuantizaciones extremas que nadie usaría en la vida real, fuera.
- CPU pura. Las mismas condiciones que tendría cualquiera con una laptop vieja.
El hardware concreto:
- Pentium Gold G6400 (10th Gen, 2 núcleos / 4 hilos, 4 GHz)
- 24 GB de RAM DDR4 — sí, más de lo habitual, pero el cuello de botella es el CPU, no la RAM
- SSD SATA (sin NVMe)
- Sin GPU dedicada
El sistema operativo: Debian 12 headless — sin escritorio, sin recursos desperdiciados. IP fija, acceso SSH desde mi PC principal. Todo controlado por terminal a través de un cable de red. Si quieres replicar este setup desde cero, tengo una guía completa sobre qué es SSH y cómo usarlo para controlar tu servidor Linux .
Con el servidor listo, instalé Ollama con un solo comando y descargué los modelos. Sin más. A estresar este Pentium.
Los 5 modelos que puse a prueba
Elegí modelos que se pueden descargar y correr directamente con Ollama, con tamaños que entran en RAM de consumo (menos de 10 GB). La selección cubre diferentes familias y enfoques:
| Modelo | Familia | Tamaño | Thinking | Enlace |
|---|---|---|---|---|
| Gemma 4 E2B | ~3.5 GB en RAM | ✅ Sí | Ollama | |
| Gemma 4 E4B | 9.6 GB | ✅ Sí | Ollama | |
| Qwen 3 4B | Alibaba | ~2.5 GB | ✅ Sí (desactivable) | Ollama |
| Phi-3 Mini | Microsoft | ~2.2 GB | ❌ No | Ollama |
| TinyLlama | Open source | ~638 MB | ❌ No | Ollama |
A cada modelo le mandé las mismas tres tareas:
- Escríbeme un juego de consola en C++.
- Explícame qué es Docker como si fuera un niño.
- Escríbeme una historia breve sobre un programador que quiere convertirse en hacker.
Resultados detallados por modelo
Gemma 4 E2B — El equilibrista
El más pequeño de la familia Gemma 4 de Google. Estos modelos tienen una función llamada Thinking: antes de responder, el modelo genera un bloque interno donde literalmente “piensa en voz alta”, analiza la pregunta y considera opciones. Para preguntas complejas, eso mejora la calidad. El problema en un Pentium es que pensar también tiene costo en tiempo.
Responder un simple “hola” le tomó 1 minuto 9 segundos. No exactamente instantáneo. Pero la calidad de las respuestas fue sólida: el juego en C++ tenía estructura correcta (un adivina el número funcional), la explicación de Docker fue clara, y la historia del hacker me dejó sorprendido: básicamente era Mr. Robot pero con un personaje llamado Elias.
Veredicto: ✅ Lo usaría — Mejor balance calidad/tiempo.
Gemma 4 E4B — El hermano mayor (lento pero sólido)
La “E” en E2B y E4B significa “parámetros efectivos”: modelos optimizados para dispositivos de borde con recursos limitados. El E4B tiene el doble de parámetros efectivos, lo que en teoría produce respuestas más completas. El precio: más peso, más tiempo.
Para un simple “hola” tardó 2 minutos 46 segundos (frente al 1:09 del E2B). La diferencia se amplía en tareas complejas. Para la historia del hacker, casi 34 minutos. Si tienes paciencia y quieres la mejor calidad posible en este hardware, es tu opción. Si buscas respuestas rápidas, su hermano menor gana.
Veredicto: ⚠️ Lo usaría con paciencia
Qwen 3 4B — Mucho potencial, resultado decepcionante
De Alibaba. Solo 2.5 GB y, según su documentación oficial, capaz de rivalizar con
modelos mucho más grandes como Qwen 2.5-72B en modo razonamiento. También tiene
Thinking, que puedes desactivar con /no_think.
En la prueba, la segunda tarea falló completamente: el modelo mezcló el contexto de la primera pregunta y, en lugar de explicar Docker, me generó otro juego en C++. La tercera tampoco se salvó: respondió con una historia donde al final explicaba qué era Docker, mezclando las dos conversaciones anteriores. Interrumpí antes de esperar media hora por una respuesta incorrecta.
Veredicto: ❌ No lo usaría en este hardware
Phi-3 Mini — La apuesta de Microsoft
3.8 mil millones de parámetros, entrenado con datos sintéticos de alta calidad. Microsoft apostó por calidad de datos en lugar de cantidad de parámetros. Clave: no tiene modo Thinking. Es un modelo decoder-only tradicional, responde directamente sin bloque de razonamiento interno.
¿Eso es malo? Depende para qué. Sin el paso de Thinking, los tiempos son más predecibles y las respuestas más consistentes en preguntas directas. En este Pentium, esa ausencia se nota: los tiempos son intermedios y la coherencia fue mejor que Qwen. Me sorprendió positivamente.
Veredicto: ⚠️ Depende del caso de uso
TinyLlama — El campeón de velocidad
1.1 mil millones de parámetros. Solo 638 MB. Mientras Gemma E2B ocupa 3.5 GB de RAM, TinyLlama cabe completo en menos de lo que pesa una película en HD. Responde “hola” en 38 segundos — eso es casi tiempo real comparado con el resto.
El problema: las respuestas llegaron en inglés y la calidad cayó notablemente. No siguió instrucciones correctamente (le pedí explicar Docker y me generó un programa en C++). Para tareas simples o integrado como motor de respuestas en un proyecto embebido (piensa en una Raspberry Pi corriendo un bot), tiene sentido. Para uso conversacional, no.
Veredicto: ⚠️ Ideal para bots y automatización
Tabla comparativa final
| Modelo | Prueba 1 (C++) | Prueba 2 (Docker) | Prueba 3 (Historia) | Calidad | ¿Lo usaría? |
|---|---|---|---|---|---|
| Gemma 4 E2B | 12:34 | 7:52 | 8:56 | ⭐⭐⭐⭐ | Sí — mejor balance |
| Gemma 4 E4B | 23:39 | 12:51 | 33:58 | ⭐⭐⭐⭐ | Sí — con paciencia |
| Qwen 3 4B | 25:12 | ❌ Falló | ~34 min (mezclado) | ⭐⭐ | No |
| Phi-3 Mini | 7:27 | 19:10 | 20:30 | ⭐⭐⭐ | Depende |
| TinyLlama | 3:44 | 7:10 ⚠️ | 4:37 (en inglés) | ⭐⭐ | Sólo para bots |
Pros y contras de correr IA local en CPU
✅ Ventajas
- Privacidad total: nada sale de tu red.
- Sin costos de API ni suscripciones.
- Funciona sin internet.
- Reutiliza hardware que ya tienes.
- Integrable en proyectos propios (bots, scripts, pipelines).
❌ Desventajas
- Tiempos de respuesta altos (minutos, no segundos).
- No es viable para uso conversacional fluido.
- Consumo de energía continuo si el servidor está encendido.
- No todos los modelos se comportan igual en CPU pura.
¿Para qué sí sirve la IA local en hardware básico?
Después de este experimento, tengo claro que la IA local en CPU no es un reemplazo de ChatGPT para charlar. Pero sí tiene casos de uso reales donde tiene sentido:
- Proyectos de automatización. Un script que procesa texto, clasifica datos o genera respuestas predefinidas puede funcionar perfectamente con TinyLlama o Phi-3 Mini corriendo en segundo plano.
- Traducción offline. Como hice con Strix Reader, el lector PDF que usa Ollama para traducir documentos sin internet — precisamente el tipo de caso donde no necesitas velocidad, sino privacidad.
- Servidor de IA casero. Si ya seguiste la guía de cómo crear tu propio ChatGPT local con Debian, Docker y Ollama , este experimento te da una idea clara de qué esperar según tu CPU.
- Prototipos y experimentos. Para aprender cómo funcionan los LLMs por dentro, este setup es suficiente.
Veredicto: ¿puede un Pentium ejecutar IA en 2026?
Sí.
No es rápido. No es lo más cómodo. Pero funciona.
Si tuviera que quedarme con un modelo para uso diario en este hardware, me quedo con Gemma 4 E2B: el mejor balance entre calidad de razonamiento y tiempos asumibles. No porque sea el más veloz, sino porque produce respuestas coherentes y útiles de forma consistente.
Para proyectos embebidos o automatización donde la velocidad importa más que la calidad, TinyLlama es la opción obvia. Y si necesitas algo más consistente que TinyLlama pero más rápido que Gemma, Phi-3 Mini sorprende positivamente.
Qwen 3 4B tiene mucho potencial en papel. En la práctica, en este hardware, no fue lo que esperaba. Puede que con configuraciones diferentes dé mejores resultados, pero para un setup de CPU pura con Ollama, sus compañeros de prueba lo superaron claramente.
El siguiente experimento: i5-10400 vs Pentium
Ya tengo un Intel i5-10400 listo para convertirse en servidor dedicado. Mismo sistema operativo, mismo Ollama, mismos modelos. Pero con 6 núcleos reales, más caché y más ancho de banda de memoria.
La pregunta que quiero responder: ¿cuánto cambia realmente el rendimiento al dar ese salto? ¿Vale la pena buscar un i5 de segunda mano para tu homelab de IA, o el Pentium ya nos dejó una sorpresa difícil de superar?
Eso lo veremos en el próximo video.
🔔 No te pierdas el siguiente experimento
En el próximo video comparo este Pentium contra el i5-10400 corriendo los mismos modelos. Suscríbete al canal para verlo en cuanto salga.
▶ Ver el video completoPreguntas Frecuentes sobre IA Local en CPU
Sí. Herramientas como Ollama o llama.cpp permiten ejecutar modelos de lenguaje directamente en CPU. El resultado no es tan rápido como con GPU, pero es completamente funcional para tareas como generación de texto, automatización o traducción offline. En este experimento lo probamos con un Pentium Gold de 10th Gen y funcionó con cinco modelos distintos.
Depende del modelo. TinyLlama necesita menos de 1 GB. Phi-3 Mini y Qwen 3 4B rondan los 2–3 GB. Gemma 4 E2B usa alrededor de 3.5 GB. Gemma 4 E4B puede llegar a ~9 GB. Como regla general, con 8 GB de RAM puedes correr modelos pequeños sin problema. Con 16 GB ya tienes margen cómodo para modelos medianos. El experimento usó 24 GB, pero la mayoría de los modelos no los requirieron.
Es un bloque interno de razonamiento que el modelo genera antes de darte su respuesta
final. Piénsalo como ver el borrador antes de la carta: el modelo analiza la pregunta,
considera distintos enfoques y llega a una conclusión. Para preguntas complejas, mejora
la calidad de la respuesta. El inconveniente es que en hardware de CPU, ese paso extra
añade tiempo significativo. En Qwen 3, puedes desactivarlo con el comando
/no_think para priorizar velocidad.
Según los resultados de este experimento con un Pentium Gold, Gemma 4 E2B ofrece el mejor equilibrio entre calidad de respuesta y tiempo de espera. Si priorizas velocidad sobre calidad (por ejemplo, para bots o automatización), TinyLlama es la opción más rápida. Phi-3 Mini es una alternativa sólida e intermedia. Qwen 3 4B no se comportó bien en este hardware en las pruebas realizadas.
Sí, y de hecho es la configuración recomendada para un servidor. Ollama se instala con un solo comando, corre como servicio en segundo plano y se controla completamente por terminal. No necesita ningún entorno de escritorio. En este experimento usamos Debian 12 headless (sin GUI), controlado vía SSH desde otra máquina — la combinación perfecta para un homelab eficiente.
Sí, aunque con limitaciones más estrictas. Una Raspberry Pi 4 con 4 u 8 GB de RAM puede correr TinyLlama o modelos equivalentes de ~1B parámetros. Modelos más grandes se vuelven inviables por la memoria disponible y la velocidad del bus de datos. Si te interesa la IA en Raspberry Pi, también vale la pena explorar la Raspberry Pi AI Camera con sensor IMX500, que tiene procesamiento de visión artificial integrado directamente en el hardware.
Depende de tu objetivo. Si buscas respuestas en tiempo real comparables a ChatGPT, una CPU de oficina no va a llegar. Pero si quieres privacidad total, integración en proyectos propios, automatización o simplemente aprender cómo funcionan los LLMs sin pagar APIs, el servidor casero tiene mucho sentido. El hardware necesario (una PC vieja con 8–16 GB de RAM) probablemente ya lo tienes o lo consigues barato de segunda mano.



![Cómo Crear tu Propio ChatGPT Local Gratis con Debian, Docker y Ollama [2025]](https://algoritmox86.com/wp-content/uploads/2025/09/Crea-tu-propio-servidor-de-ia-loca-Algoritmox86-1024x576.png)