Según el uso que le quieras dar, puede tener sentido elegir un tipo de servidor distinto para ejecutar Ollama: para chatbots sencillos suele bastar con un servidor virtual potente, mientras que los agentes, las tareas de pro­gra­ma­ción o los modelos más grandes suelen requerir una GPU o incluso hardware dedicado. Ollama si­m­pli­fi­ca eno­r­me­me­n­te la ejecución local y en servidor de modelos de lenguaje extensos, ya que se encarga de gestionar los modelos, ini­ciar­los y ex­po­ne­r­los mediante una API sencilla.

VPS gratis
Prueba un servidor virtual de forma gratuita durante 30 días

¡Prueba tu servidor virtual durante 30 días! Si lo solicitas, te re­em­bo­l­sa­re­mos todos los gastos in­cu­rri­dos.

¿Qué es Ollama?

Ollama es un software que te permite ejecutar modelos de lenguaje extensos como Gemma, Qwen, DeepSeek u otros modelos co­m­pa­ti­bles de forma local o en tu propio servidor. Para ello, ofrece una interfaz de línea de comandos sencilla y una API REST, con las que puedes iniciar modelos e in­te­grar­los en tus propias apli­ca­cio­nes. Así, Ollama no solo sirve para chatear en el terminal, sino también como backend para servir modelos para tus propias he­rra­mie­n­tas, asi­s­te­n­tes o entornos de de­sa­rro­llo.

Ollama resulta es­pe­cia­l­me­n­te atractivo si no quieres depender de un servicio en la nube externo y prefieres ejecutar los modelos en tu propia in­frae­s­tru­c­tu­ra. Las in­ter­ac­cio­nes se procesan de forma local y el software se encarga de cargar y ejecutar los modelos, además de ofrecer acceso mediante la línea de comandos o la API. Esto lo hace es­pe­cia­l­me­n­te práctico si estás empezando, ya que no necesitas co­n­fi­gu­rar toda la in­frae­s­tru­c­tu­ra de in­fe­re­n­cia desde cero y puedes empezar con unos pocos comandos.

Nota

Ollama se utiliza en muchos proyectos de IA como backend de modelos, eje­cu­ta­n­do modelos de lenguaje de forma local o en un servidor y ex­po­nié­n­do­los a través de una API. Sobre esta base, se pueden usar fra­me­wo­r­ks de agentes como OpenClaw con Ollama para au­to­ma­ti­zar flujos de trabajo complejos. En este tipo de co­n­fi­gu­ra­cio­nes, Ollama se encarga de la in­fe­re­n­cia del modelo, mientras que OpenClaw gestiona tareas como el uso de he­rra­mie­n­tas, procesos con varios niveles de agentes o acciones au­to­ma­ti­za­das.

¿Qué servidor encaja con tu proyecto?

Antes de empezar con la in­s­ta­la­ción, conviene definir para qué quieres usar realmente Ollama. No todas las apli­ca­cio­nes necesitan una GPU, pero en cuanto necesites re­s­pue­s­tas fluidas, ejecutar varias so­li­ci­tu­des en paralelo o trabajar con modelos de IA más grandes, los re­qui­si­tos aumentan rá­pi­da­me­n­te.

El tamaño del modelo es un factor clave: como re­fe­re­n­cia, Ollama re­co­mie­n­da al menos 8 GB de RAM para modelos de 7B, 16 GB para modelos de 13B y 64 GB para modelos de 70B. Además, la VRAM di­s­po­ni­ble en la GPU también es decisiva, ya que influye di­re­c­ta­me­n­te en la velocidad, la longitud del contexto y la usa­bi­li­dad en la práctica.

Caso de uso 1: tareas de texto sencillas, pruebas y pequeños chatbots

Si quieres usar Ollama pri­n­ci­pa­l­me­n­te para pruebas, ge­ne­ra­ción de texto sencilla, pequeños bots o tests internos, suele bastar con un servidor virtual (VPS) potente sin GPU dedicada. En este escenario se utilizan no­r­ma­l­me­n­te modelos de IA más pequeños.

Estos requieren al menos 8 GB de RAM, aunque en la práctica conviene contar con cierto margen para que el sistema operativo, Docker y los procesos en segundo plano no ra­le­n­ti­cen el sistema. Por eso, se re­co­mie­n­da tener 16 GB de RAM para empezar con un servidor Ollama. También debes prever su­fi­cie­n­te espacio de al­ma­ce­na­mie­n­to, ya que además del entorno Docker hay que guardar los modelos, que pueden ocupar rá­pi­da­me­n­te varios gigabytes.

La principal ventaja de un servidor virtual es su bajo coste y la facilidad de puesta en marcha. Como co­n­tra­pa­r­ti­da, la velocidad es cla­ra­me­n­te inferior a la de los se­r­vi­do­res con GPU Para dar los primeros pasos con Ollama, un VPS con 4 vCPU, 16 GB de RAM y al­ma­ce­na­mie­n­to SSD suele ser más que su­fi­cie­n­te.

Caso de uso 2: bots internos de co­no­ci­mie­n­to, pequeñas API y em­be­d­di­n­gs

Si quieres usar Ollama como backend para una base de co­no­ci­mie­n­to interna, para ge­ne­ra­ción aumentada mediante re­cu­pe­ra­ción (RAG) o para em­be­d­di­n­gs, los re­qui­si­tos son mayores. Aquí no se trata solo de generar una respuesta puntual, sino de gestionar llamadas API re­cu­rre­n­tes, procesos en segundo plano y una ejecución más estable.

Aunque estos es­ce­na­rios pueden funcionar en un servidor CPU o en un VPS grande, conviene contar con más memoria RAM para evitar recargas co­n­s­ta­n­tes de modelos y datos. Un servidor con entre 16 y 32 GB de RAM ofrece una ex­pe­rie­n­cia mucho más fluida en este tipo de apli­ca­cio­nes.

Si además varias personas utilizan el servicio al mismo tiempo, conviene optar por una CPU con más núcleos o dar el salto a un servidor GPU. Ollama no solo permite generar texto, sino también crear em­be­d­di­n­gs a través de la API, lo que lo convierte en una opción in­te­re­sa­n­te para sistemas de búsqueda y co­no­ci­mie­n­to.

Para equipos pequeños o he­rra­mie­n­tas internas, un VPS grande o un servidor dedicado básico sin GPU puede ser su­fi­cie­n­te, siempre que no necesites tiempos de respuesta muy bajos. Si buscas una ex­pe­rie­n­cia más fluida, es­pe­cia­l­me­n­te en es­ce­na­rios in­ter­ac­ti­vos, merece la pena co­n­si­de­rar una GPU. En general, cuanto más in­ter­ac­ti­vo y co­n­cu­rre­n­te sea el uso, antes alcanzará sus límites un servidor basado solo en CPU.

Caso de uso 3: asi­s­te­n­tes de pro­gra­ma­ción y agentes fluidos

Si quieres usar Ollama para asi­s­te­n­tes de pro­gra­ma­ción, agentes se­mi­au­tó­no­mos u otros flujos de trabajo in­ter­ac­ti­vos, una GPU pasa a ser prá­c­ti­ca­me­n­te im­pre­s­ci­n­di­ble. La razón es sencilla: este tipo de apli­ca­cio­nes depende de tiempos de respuesta rápidos y de que los modelos puedan manejar contextos largos de forma fluida.

La longitud de contexto depende, entre otros factores, de la VRAM di­s­po­ni­ble. Para agentes, búsqueda web, he­rra­mie­n­tas de pro­gra­ma­ción o flujos de trabajo complejos, la do­cu­me­n­ta­ción re­co­mie­n­da una longitud de contexto de entre 32 000 y 64 000 tokens.

Por eso, un servidor virtual basado solo en CPU no suele ser la mejor opción en estos es­ce­na­rios. Resulta más adecuado un servidor en la nube con una GPU NVIDIA moderna, junto con su­fi­cie­n­te RAM y al­ma­ce­na­mie­n­to NVMe rápido. Así podrás ejecutar modelos de tamaño medio de forma mucho más eficiente y trabajar con flujos de agentes mu­l­ti­ni­vel sin problemas.

Para proyectos in­di­vi­dua­les am­bi­cio­sos, pro­to­ti­pos o equipos de de­sa­rro­llo, esta co­n­fi­gu­ra­ción suele ofrecer el mejor equi­li­brio entre coste y re­n­di­mie­n­to.

Caso de uso 4: apli­ca­cio­nes pro­fe­sio­na­les con varios usuarios

Si quieres usar Ollama como parte estable de una apli­ca­ción pro­fe­sio­nal, los re­qui­si­tos cambian de nuevo. Ya no se trata solo de que el modelo funcione, sino de que lo haga de forma estable, re­pro­du­ci­ble y con buen re­n­di­mie­n­to bajo carga.

En estos casos, debes pla­ni­fi­car su­fi­cie­n­te RAM, una GPU potente, capacidad para ejecutar varios procesos en paralelo, mo­ni­to­ri­za­ción y espacio de al­ma­ce­na­mie­n­to para varios modelos. Como Ollama expone los modelos mediante una API, puede in­te­grar­se fá­ci­l­me­n­te como backend interno, pero la elección del servidor debe centrarse en la di­s­po­ni­bi­li­dad y el re­n­di­mie­n­to bajo carga.

Un servidor dedicado con GPU potente o un servidor en la nube pro­fe­sio­nal con GPU suele ser más adecuado que un servidor virtual pequeño. En este tipo de entornos, se re­co­mie­n­dan al menos 64 GB de RAM, junto con una GPU NVIDIA potente y una ar­qui­te­c­tu­ra limpia que garantice la pe­r­si­s­te­n­cia de los modelos.

Además, en entornos pro­du­c­ti­vos es fu­n­da­me­n­tal que Docker y, si procede, NVIDIA Container Toolkit estén co­rre­c­ta­me­n­te co­n­fi­gu­ra­dos para que la GPU pueda uti­li­zar­se dentro del co­n­te­ne­dor Docker.

Caso de uso 5: modelos muy grandes e in­fe­re­n­cia de alto nivel

Si quieres ejecutar modelos muy grandes, en el rango de 70B o más, entras cla­ra­me­n­te en la gama alta. Ollama indica para estos modelos un mínimo apro­xi­ma­do de 64 GB de RAM. En la práctica, los entornos basados en la vi­r­tua­li­za­ción suelen quedarse cortos, sobre todo si buscas buenos tiempos de respuesta o necesitas ejecutar varios procesos en paralelo.

Para estos es­ce­na­rios, lo más adecuado es un servidor dedicado con hardware GPU de alto re­n­di­mie­n­to. Un servidor virtual o in­frae­s­tru­c­tu­ras co­m­pa­r­ti­das no suelen ofrecer la potencia necesaria.

En entornos pro­fe­sio­na­les, se utilizan sistemas GPU es­pe­cia­li­za­dos con gran cantidad de VRAM, como se­r­vi­do­res con tarjetas NVIDIA A100 o NVIDIA H100, o co­n­fi­gu­ra­cio­nes equi­va­le­n­tes de alto re­n­di­mie­n­to. Este tipo de in­frae­s­tru­c­tu­ra implica un coste elevado, pero para modelos grandes, contextos extensos y cargas de trabajo exigentes es prá­c­ti­ca­me­n­te im­pre­s­ci­n­di­ble.

Resumen: ¿qué servidor elegir según el uso?

Objetivo Hardware re­co­me­n­da­do Coste (estimado)
Bot o API sencilla VPS con 4 vCPU, 16 GB de RAM, SSD +
Bots internos y em­be­d­di­n­gs VPS grande o pequeño servidor dedicado con 16–32 GB de RAM + / ++
Pro­gra­ma­ción y agentes Servidor en la nube con GPU moderna ++
Apli­ca­cio­nes pro­fe­sio­na­les Servidor en la nube con GPU potente o servidor dedicado con mucha RAM ++ / +++
Gama alta (70B+) Servidor dedicado con A100/H100 o GPU de gama alta co­m­pa­ra­ble +++

Leyenda de costes: + = bajo, ++ = medio, +++ = alto

Instalar Ollama en un servidor con Docker paso a paso

En este apartado verás cómo instalar Ollama en un servidor Linux con Docker. Si estás empezando, esta co­m­bi­na­ción resulta es­pe­cia­l­me­n­te práctica, ya que Ollama se ejecuta en un co­n­te­ne­dor y apenas necesitas realizar cambios manuales en el sistema.

Si quieres utilizar una GPU NVIDIA en Linux, también tendrás que instalar NVIDIA Container Toolkit, que permite a Docker acceder a la GPU desde el co­n­te­ne­dor.

Paso 1: co­ne­c­tar­te al servidor

Primero, conéctate a tu servidor mediante SSH. Para ello necesitas la dirección IP y un usuario con permisos de sudo.

ssh NOMBRE-DE-USUARIO@IP-DEL-SERVIDOR
bash

Cuando te conectas por primera vez, tu sistema suele pedirte que confirmes la clave del host. Escribe yes y, a co­n­ti­nua­ción, introduce tu co­n­tra­se­ña o usa tu clave SSH. Después accederás al terminal de tu servidor y podrás empezar con la co­n­fi­gu­ra­ción.

Paso 2: ac­tua­li­zar el sistema

Antes de instalar Ollama y Docker, conviene ac­tua­li­zar las listas de paquetes y los paquetes ya in­s­ta­la­dos. Así te aseguras de que tu sistema esté al día en cuanto a seguridad y versiones. Es­pe­cia­l­me­n­te en un servidor recién co­n­fi­gu­ra­do, este paso es fu­n­da­me­n­tal antes de instalar más software.

sudo apt update && sudo apt upgrade -y
bash

Paso 3: instalar Docker

En Ubuntu 24.04, Docker re­co­mie­n­da in­s­ta­lar­se a través del re­po­si­to­rio oficial APT. Para ello, se configura el re­po­si­to­rio en formato Deb822 en /etc/apt/sources.list.d/docker.sources. Este método es co­m­pa­ti­ble, entre otros, con Ubuntu 24.04 y ar­qui­te­c­tu­ras como amd64 y arm64. Primero, instala los paquetes ne­ce­sa­rios:

sudo apt install ca-certificates curl -y
bash

A co­n­ti­nua­ción, crea el di­re­c­to­rio para el llavero:

sudo install -m 0755 -d /etc/apt/keyrings
bash

Después, descarga la clave oficial de Docker:

sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg -o /etc/apt/keyrings/docker.asc
sudo chmod a+r /etc/apt/keyrings/docker.asc
bash

Ahora configura el re­po­si­to­rio de Docker:

sudo tee /etc/apt/sources.list.d/docker.sources <<EOF
Types: deb
URIs: https://download.docker.com/linux/ubuntu
Suites: $(. /etc/os-release && echo "${UBUNTU_CODENAME:-$VERSION_CODENAME}")
Components: stable
Signed-By: /etc/apt/keyrings/docker.asc
EOF
bash

Vuelve a ac­tua­li­zar la lista de paquetes:

sudo apt update
bash

Instala Docker Engine junto con el plugin de Compose:

sudo apt install docker-ce docker-ce-cli containerd.io docker-buildx-plugin docker-compose-plugin -y
bash

Comprueba que Docker se esté eje­cu­ta­n­do co­rre­c­ta­me­n­te:

sudo systemctl status docker
bash

Deberías ver el estado “active (running)”, lo que confirma que Docker se está eje­cu­ta­n­do.

Imagen: Indicador de estado de Docker en tu servidor Ollama
La in­di­ca­ción “active” confirma que Docker se está eje­cu­ta­n­do.
sudo docker run hello-world
bash

Si aparece un mensaje de co­n­fi­r­ma­ción, Docker se ha instalado co­rre­c­ta­me­n­te.

Imagen: Contenedor Hello World en tu servidor Ollama
Si Docker se ha instalado co­rre­c­ta­me­n­te, puedes iniciar el co­n­te­ne­dor Hello-World como primera prueba.

Paso 4: usar Docker sin sudo (opcional)

Por defecto, Docker se ejecuta en Linux con sudo. Si prefieres usarlo sin sudo, puedes añadir tu usuario al grupo docker:

sudo groupadd docker
sudo usermod -aG docker $USER
newgrp docker
bash

Después, comprueba si Docker funciona sin sudo:

docker run hello-world
bash

Paso 5: instalar NVIDIA Container Toolkit (solo si usas GPU NVIDIA)

Este paso solo es necesario si tu servidor cuenta con una GPU NVIDIA y quieres que Ollama la utilice dentro del co­n­te­ne­dor Docker.

Primero, instala los paquetes ne­ce­sa­rios:

sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
bash

A co­n­ti­nua­ción, añade el re­po­si­to­rio de NVIDIA:

curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
bash

Actualiza la lista de paquetes e instala el toolkit:

sudo apt-get update
sudo apt-get install -y nvidia-container-toolkit
bash

Configura Docker para que pueda usar la GPU:

sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
bash

Si los co­n­tro­la­do­res de la GPU están co­rre­c­ta­me­n­te in­s­ta­la­dos, Docker podrá acceder a la GPU desde los co­n­te­ne­do­res.

Paso 6: iniciar el co­n­te­ne­dor de Ollama

Ahora ya puedes ejecutar Ollama como co­n­te­ne­dor Docker. La imagen oficial es ollama/ollama. Si vas a usar solo CPU, ejecuta el siguiente comando:

sudo docker run -d \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
bash

Si utilizas una GPU NVIDIA y ya has co­m­ple­ta­do el paso 5, inicia el co­n­te­ne­dor así:

sudo docker run -d \
--gpus=all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
bash

Paso 7: comprobar si el co­n­te­ne­dor está en ejecución

A co­n­ti­nua­ción, verifica en la terminal si el co­n­te­ne­dor se ha iniciado co­rre­c­ta­me­n­te:

sudo docker ps
bash

En la salida debería aparecer un co­n­te­ne­dor con el nombre ollama. También verás que el puerto 11434 está publicado en el host, que es donde Ollama pone a di­s­po­si­ción su API.

Imagen: Captura de pantalla de la salida de docker ps
El comando “docker ps” muestra in­fo­r­ma­ción sobre tus co­n­te­ne­do­res. Aquí debería aparecer ahora el co­n­te­ne­dor de Ollama.

Paso 8: descargar y ejecutar un primer modelo

Una vez que el co­n­te­ne­dor esté en ejecución, puedes iniciar tu primer modelo. Para ello, ejecuta el comando de Ollama di­re­c­ta­me­n­te dentro del co­n­te­ne­dor con docker exec:

sudo docker exec -it ollama ollama run llama3
bash

La primera vez, Ollama de­s­ca­r­ga­rá el modelo au­to­má­ti­ca­me­n­te. Este proceso puede tardar varios minutos, de­pe­n­die­n­do del tamaño del modelo y de la conexión del servidor. Una vez co­m­ple­ta­da la descarga, accederás a una consola in­ter­ac­ti­va en la que podrás in­tro­du­cir tus primeras consultas.

Imagen: Ollama con Llama3
Después de iniciar Llama3 (u otro modelo de lenguaje), puedes in­ter­ac­tuar con el modelo di­re­c­ta­me­n­te desde la consola.

Si quieres utilizar otro modelo en lugar de Llama3, basta con indicar su nombre en el comando. En la bi­blio­te­ca de Ollama en­co­n­tra­rás una selección de modelos di­s­po­ni­bles, entre ellos opciones actuales como Gemma 3, Qwen3 o DeepSeek-R1.

Paso 9: probar la API de Ollama

Ollama expone au­to­má­ti­ca­me­n­te una API tras iniciarse. Según la do­cu­me­n­ta­ción oficial, el endpoint base es http://localhost:11434/api. Puedes hacer una prueba di­re­c­ta­me­n­te en el servidor con curl.

Un ejemplo de solicitud de ge­ne­ra­ción sencilla sería el siguiente:

curl http://localhost:11434/api/generate -d '{
"model": "gemma3",
"prompt": "Explica en dos frases qué es Ollama.",
"stream": false
}'
bash

Si todo funciona co­rre­c­ta­me­n­te, recibirás una respuesta en formato JSON o una salida en streaming del modelo. Así puedes comprobar que no solo el co­n­te­ne­dor está en ejecución, sino que la API también responde co­rre­c­ta­me­n­te.

Imagen: Llamada a la API de Ollama Docker
La API te devuelve la respuesta di­re­c­ta­me­n­te en formato JSON.

Paso 10: trabajar con Docker Compose

Para un servidor en fu­n­cio­na­mie­n­to continuo, Docker Compose suele ser más cómodo que usar un comando docker run. Permite guardar la co­n­fi­gu­ra­ción en un archivo y ajustarla fá­ci­l­me­n­te más adelante.

Primero, crea un di­re­c­to­rio para la co­n­fi­gu­ra­ción:

mkdir -p ~/ollama
cd ~/ollama
bash

Después, crea un archivo llamado compose.yaml. Aquí usamos el editor nano, pero puedes utilizar cualquier otro:

nano compose.yaml
bash

Para ejecutar Ollama con CPU, añade este contenido:

services:
    ollama:
        image: ollama/ollama
        container_name: ollama
        ports:
            - "11434:11434"
        volumes:
            - ollama:/root/.ollama
        restart: unless-stopped
volumes:
    ollama:
yaml

Si quieres usar una GPU NVIDIA, puedes ampliar la co­n­fi­gu­ra­ción según tu entorno Docker. Para quienes empiezan, suele ser más sencillo utilizar docker run --gpus=all, ya que la co­n­fi­gu­ra­ción con Compose puede variar según la versión de Docker. En cualquier caso, es im­po­r­ta­n­te que Docker esté co­n­fi­gu­ra­do co­rre­c­ta­me­n­te para usar el runtime de NVIDIA.

A co­n­ti­nua­ción, inicia el servicio:

sudo docker compose up -d
bash
Imagen: Iniciar el contenedor con Compose
Con Docker Compose puedes iniciar y gestionar el co­n­te­ne­dor de Ollama con más comodidad.

Comprueba el estado del co­n­te­ne­dor:

sudo docker compose ps
bash
Imagen: Estado del contenedor
Con Compose también puedes consultar el estado del co­n­te­ne­dor de Ollama.

Paso 11: in­di­ca­cio­nes im­po­r­ta­n­tes para el fu­n­cio­na­mie­n­to práctico

Si quieres usar Ollama en un entorno pro­du­c­ti­vo o hacerlo accesible desde otros di­s­po­si­ti­vos de tu red, no deberías exponer el servicio a Internet sin una co­n­fi­gu­ra­ción adecuada. Aunque Ollama utiliza por defecto el puerto 11434, en la co­n­fi­gu­ra­ción Docker mostrada la API se publica en el host mediante -p 11434:11434. Según tu co­n­fi­gu­ra­ción de red y del co­r­ta­fue­gos, esto puede hacer que el servicio sea accesible desde el exterior. Si quieres limitar el acceso úni­ca­me­n­te al propio servidor, vincula el puerto a 127.0.0.1, por ejemplo con -p 127.0.0.1:11434:11434, y configura las reglas del co­r­ta­fue­gos de forma re­s­tri­c­ti­va.

También debes tener en cuenta el al­ma­ce­na­mie­n­to: los modelos se guardan lo­ca­l­me­n­te y pueden ocupar varios gigabytes. En Linux se aplica lo mismo que en otros sistemas: los modelos requieren bastante espacio, es­pe­cia­l­me­n­te si trabajas con varios a la vez o con versiones más grandes.

Por último, el re­n­di­mie­n­to depende en gran medida de la VRAM di­s­po­ni­ble. Para contextos largos, agentes o apli­ca­cio­nes de pro­gra­ma­ción, disponer de su­fi­cie­n­te VRAM es clave, ya que Ollama ajusta por defecto la longitud de contexto según la VRAM di­s­po­ni­ble.

Ir al menú principal