Ollama: qué es y cómo usar IA local en tu PC

Ordenador portátil ejecutando Ollama y un modelo de inteligencia artificial local mediante una terminal

La inteligencia artificial se ha convertido en una herramienta cotidiana, pero la mayoría de los servicios que utilizamos funcionan en la nube. Escribes una pregunta, los datos viajan hasta los servidores del proveedor y allí se procesa la respuesta antes de volver a tu dispositivo.

Ollama propone un enfoque diferente: ejecutar modelos de inteligencia artificial directamente en tu ordenador. No es la única herramienta para hacerlo, pero sí una de las que más ha simplificado el proceso. Además, su evolución reciente ha hecho que ya no se limite a ejecutar modelos locales: también permite acceder a modelos en la nube y utilizarlos desde las mismas herramientas.

Ollama en pocas palabras

  • Ollama no es un modelo de IA: es la herramienta que permite ejecutar y gestionar modelos.
  • Puede funcionar localmente: los modelos locales se ejecutan en tu propio hardware.
  • No necesitas necesariamente una GPU: también puedes ejecutar modelos utilizando CPU, aunque normalmente con menor rendimiento.
  • Funciona en macOS, Windows y Linux.
  • Tiene una API: puedes integrar los modelos en aplicaciones, scripts y automatizaciones.
  • También ofrece modelos cloud: puedes recurrir a servidores remotos cuando un modelo es demasiado grande para tu ordenador.

¿Qué es Ollama?

Ollama es una plataforma de código abierto que permite descargar y ejecutar modelos de inteligencia artificial en macOS, Windows y Linux. El proyecto está publicado bajo licencia MIT.

Conviene aclarar una diferencia importante desde el principio: Ollama no es un modelo de inteligencia artificial. Es la herramienta que permite gestionar y ejecutar modelos.

Llama, Gemma, Qwen, Mistral, DeepSeek y otras familias son modelos desarrollados por diferentes organizaciones. Ollama proporciona una forma sencilla de utilizarlos desde un mismo entorno, principalmente mediante el terminal, su API o aplicaciones compatibles.

Para alguien que quiere experimentar con IA local, esto elimina buena parte de la complejidad inicial. Puedes instalar Ollama, descargar un modelo y comenzar a utilizarlo sin tener que construir desde cero todo el entorno necesario para ejecutar un LLM.

Además, Ollama proporciona una API HTTP local y bibliotecas para Python y JavaScript, lo que permite utilizar los modelos desde aplicaciones y automatizaciones.

Puedes consultar la documentación oficial de Ollama para conocer las opciones actuales de instalación, modelos e integración.

IA local sin GPU: pruebas reales

Una de las dudas más habituales cuando se habla de IA local es si realmente necesitas una tarjeta gráfica potente. La respuesta corta es que no siempre. Puedes ejecutar modelos utilizando CPU, aunque el rendimiento dependerá mucho del hardware y del modelo elegido.

Vídeo relacionado: IA local sin GPU: Pentium Gold vs i5-10400 — benchmark real

¿Por qué utilizar Ollama?

Una de las principales razones para utilizar Ollama es el control sobre los datos. Cuando ejecutas un modelo local, la inferencia se realiza en tu propio equipo, en lugar de enviar la consulta a un proveedor externo para procesarla.

Esto puede ser especialmente interesante al trabajar con documentos privados, código propietario o información que no quieres introducir en un servicio de IA externo.

Eso sí, hay que distinguir entre los modelos locales y los modelos cloud. Ollama también permite utilizar modelos alojados en sus servidores. En ese caso, el procesamiento no ocurre en tu ordenador y necesitas conexión a Internet.

Otra ventaja es el coste por consulta. Cuando utilizas un modelo local no tienes que pagar a un proveedor por cada token generado como ocurre con muchas APIs comerciales. Eso no significa que la IA local sea completamente gratuita: necesitas aportar el hardware, la electricidad y el almacenamiento necesarios.

También tienes mayor control sobre el entorno. Puedes elegir los modelos que quieres utilizar, cambiar de modelo cuando quieras y adaptar diferentes parámetros de generación.

Y una vez descargado un modelo local, puedes utilizarlo sin conexión a Internet, siempre que la tarea no dependa de una función externa.

IA local vs. IA en la nube

Ollama y servicios como ChatGPT o Claude no son exactamente el mismo tipo de producto. Los servicios comerciales proporcionan modelos propietarios y se encargan de toda la infraestructura necesaria para ejecutarlos. Ollama proporciona el entorno para utilizar modelos compatibles, especialmente modelos abiertos.

Característica IA local con Ollama IA en la nube
Procesamiento En tu equipo En servidores externos
Internet No necesariamente Normalmente necesario
Privacidad Mayor control sobre los datos Depende del proveedor y servicio
Hardware Lo aporta el usuario Lo proporciona el proveedor
Modelos grandes Limitados por el hardware Más accesibles
Coste por uso Sin coste por consulta local Puede existir suscripción o pago por consumo

La elección depende del escenario. Si quieres privacidad, experimentar o reutilizar hardware que ya tienes, la ejecución local puede ser muy interesante. Si necesitas acceder a modelos muy grandes sin preocuparte por el hardware, la nube resulta más cómoda.

Ollama también permite utilizar modelos en la nube

Una de las novedades más importantes de Ollama es que la frontera entre local y cloud se ha vuelto menos clara. Ollama ofrece modelos cloud que permiten utilizar modelos demasiado grandes para determinados ordenadores domésticos mediante infraestructura remota.

La ventaja es que puedes mantener una experiencia similar y utilizar las mismas herramientas y API, pero cambiar dónde se realiza el procesamiento.

Puedes consultar los detalles en el anuncio oficial de Ollama Cloud .

En otras palabras, Ollama ya no tiene que significar exclusivamente “IA sin Internet”. Puede utilizarse como una puerta de entrada tanto a modelos locales como a modelos alojados en la nube.

¿Qué puedes hacer con Ollama?

Las posibilidades dependen principalmente del modelo que elijas. El uso más sencillo consiste en conversar con un modelo para hacer preguntas, generar textos, resumir información o analizar documentos.

También resulta especialmente interesante para programación. Ollama permite integrar modelos con herramientas actuales de desarrollo. Su comando ollama launch facilita la configuración de herramientas como Claude Code, OpenCode, Codex y Droid utilizando modelos locales o cloud.

Para los desarrolladores esto abre posibilidades interesantes: puedes utilizar un modelo local para analizar código, generar propuestas o trabajar sobre determinados proyectos sin tener que enviar necesariamente el código a un proveedor externo.

Ollama también dispone de una API que facilita la integración con aplicaciones propias. La compatibilidad con partes de la API de OpenAI permite incluso adaptar algunas aplicaciones existentes para trabajar con modelos ejecutados mediante Ollama.

Otra posibilidad es utilizarlo para construir sistemas RAG (generación aumentada por recuperación). Combinado con herramientas como LangChain, un modelo puede consultar información almacenada en documentos antes de generar una respuesta.

Esto permite crear asistentes internos, sistemas de consulta documental, buscadores semánticos y otras aplicaciones que trabajan con información propia.

Un ejemplo real: IA local para trabajar con PDFs

La IA local no tiene por qué limitarse a un chatbot. Un buen ejemplo es utilizar Ollama como motor de una aplicación que procesa documentos sin necesidad de enviarlos a Internet.

Vídeo relacionado: Construí un lector PDF con IA que funciona completamente sin Internet

¿Qué hardware necesitas para ejecutar Ollama?

Aquí conviene evitar una regla demasiado simplista del tipo “X GB de RAM para un modelo de X parámetros”. El consumo real depende de varios factores, entre ellos el modelo, su cuantización, el tamaño del contexto, la memoria disponible y si parte del modelo se ejecuta en CPU o GPU.

El contexto es especialmente importante. Aumentar el tamaño de contexto incrementa también la memoria necesaria para ejecutar el modelo. Por eso un modelo que funciona correctamente con un contexto pequeño puede requerir muchos más recursos cuando se utiliza con contextos largos.

La documentación oficial permite comprobar cómo se está ejecutando un modelo mediante ollama ps, incluyendo información sobre la distribución entre CPU y GPU.

Y aquí es donde los experimentos con hardware modesto resultan interesantes. No necesitas necesariamente una GPU de gama alta para comenzar a experimentar con IA local.

¿Puede un Pentium ejecutar IA local?

En AlgoritmoX86 hemos probado precisamente esta cuestión. Un Pentium Gold de décima generación, 24 GB de RAM, SSD SATA y Debian sin interfaz gráfica fueron suficientes para ejecutar varios modelos mediante Ollama sin GPU dedicada.

Vídeo relacionado: ¿Puede un Pentium ejecutar IA LOCAL en 2026? Lo puse a prueba

El experimento demuestra algo importante: que algo sea posible no significa que sea rápido. En CPU pura, algunos modelos pueden tardar varios minutos en responder, pero eso no impide utilizarlos para determinados proyectos, automatizaciones o tareas donde la velocidad no sea crítica.

Puedes ver los resultados completos del experimento en ¿Puede un Pentium ejecutar IA Local en 2026? Lo probé .

Ventajas y desventajas de Ollama

Ventajas

  • Permite ejecutar modelos localmente.
  • Mayor control sobre los datos.
  • Puede funcionar sin conexión con modelos locales.
  • No existe un coste por consulta local.
  • Permite elegir entre numerosos modelos.
  • Dispone de API para desarrollar aplicaciones.
  • Puede aprovechar hardware que ya tienes.
  • También ofrece acceso a modelos cloud.

Desventajas

  • El rendimiento depende de tu hardware.
  • Los modelos grandes pueden requerir mucha memoria.
  • Una CPU modesta puede ofrecer respuestas lentas.
  • La calidad depende del modelo elegido.
  • Los mejores modelos locales no siempre son la mejor opción para todas las tareas.
  • Debes gestionar tú mismo el almacenamiento y los recursos del equipo.

¿Merece la pena utilizar Ollama?

Para desarrolladores, aficionados a la inteligencia artificial y usuarios que quieren experimentar con modelos locales, Ollama merece la pena conocerlo. La instalación es relativamente sencilla, existe una amplia biblioteca de modelos y su API permite ir mucho más allá de una simple conversación.

También puede ser especialmente interesante para quienes trabajan con información sensible y quieren mantener el procesamiento dentro de su propia infraestructura.

Si lo que buscas es acceder a los modelos más potentes sin preocuparte por el hardware, los servicios cloud siguen teniendo una ventaja importante.

Pero la decisión no tiene por qué ser exclusiva. Puedes utilizar Ollama localmente para determinadas tareas y recurrir a modelos cloud cuando necesites más capacidad. Esa combinación es probablemente una de las partes más interesantes de la evolución de Ollama.

Preguntas frecuentes sobre Ollama y la IA local

Ollama es una plataforma que permite descargar y ejecutar modelos de inteligencia artificial en macOS, Windows y Linux. Ollama no es el modelo de IA, sino la herramienta que permite gestionarlo y ejecutarlo.

No necesariamente. Ollama puede ejecutar modelos utilizando CPU, aunque el rendimiento puede ser mucho menor que con una GPU adecuada. El modelo, el tamaño del contexto y el hardware influyen directamente en la velocidad.

Sí. Una vez descargado un modelo local, puedes utilizarlo sin conexión a Internet. Esto no se aplica a los modelos cloud ni a funciones que necesiten servicios externos.

El software de Ollama está disponible bajo licencia MIT y puedes ejecutar modelos localmente sin pagar por cada consulta. Sin embargo, ejecutar IA local tiene costes indirectos como hardware, electricidad y almacenamiento. Ollama también ofrece servicios cloud que funcionan de forma diferente.

La biblioteca de Ollama incluye numerosas familias de modelos, entre ellas Llama, Gemma, Qwen, Mistral, DeepSeek y otras. La disponibilidad cambia con el tiempo, por lo que conviene consultar la biblioteca oficial antes de elegir un modelo.

Sí. Ollama puede utilizarse con modelos especializados en programación y ofrece integraciones con herramientas como Claude Code, Codex, OpenCode y Droid. Algunas pueden utilizar modelos locales y otras también modelos cloud.

Sí. Ollama proporciona una API local y bibliotecas para diferentes lenguajes. Además, ofrece compatibilidad con partes de la API de OpenAI, lo que facilita la integración con algunas aplicaciones existentes.

Sí, siempre que el modelo elegido sea compatible con los recursos disponibles. En pruebas reales de AlgoritmoX86 se han ejecutado modelos locales mediante Ollama en un Pentium Gold sin GPU dedicada. El principal inconveniente en hardware modesto es la velocidad.

No existe una respuesta universal. Ollama destaca cuando quieres control local, privacidad, independencia de servicios externos o experimentar con modelos propios. Los servicios cloud son más cómodos cuando necesitas acceder a modelos grandes sin preocuparte por el hardware.

Fuentes y documentación