Qué resuelve
Ollama es la vía corta para ejecutar modelos de lenguaje abiertos en tu propio equipo: se instala, se descarga un modelo con un comando y queda servido en local, con línea de comandos y API REST. La lista con la que su repositorio se presenta hoy incluye, entre otros, DeepSeek, Qwen, Gemma, gpt-oss y las últimas versiones de GLM y Kimi.
La aplicación es gratuita y el código está publicado en GitHub bajo licencia MIT. Existen planes de pago (Pro a 20 dólares al mes, Max a 100), pero pagan otra cosa: inferencia de modelos grandes en la nube de la empresa, para cuando tu hardware no llega.
El dato que lo distingue
Que el modelo corra en tu máquina cambia la conversación sobre privacidad de arriba abajo. Todo lo que escribimos en la guía sobre no filtrar datos confidenciales al usar ChatGPT, Gemini, Claude o DeepSeek parte de que tus datos viajan a un servidor ajeno; con un modelo local, no viajan. Es la misma razón por la que los pesos abiertos de los grandes modelos importan más que sus benchmarks, como contamos a propósito de Kimi K3: la pregunta de fondo no es cuánto sabe el modelo, sino quién controla la máquina donde corre.
El peaje es el hardware: los modelos pequeños funcionan en un portátil razonable, los grandes piden memoria y GPU que la mayoría no tiene. Ahí es donde su nube de pago quiere entrar.
