Todos los escritos

IA y tecnología

IA privada para pequeñas empresas: cuánto cuesta y qué obtienes

Los LLM on-premise son más baratos que la factura de API que estás imaginando. Números reales, hardware real, y cuándo tiene sentido.

Jul 3, 20266 min de lecturaprivate-ai · ollama · small-business
IA privada para pequeñas empresas: cuánto cuesta y qué obtienes cover

Lo que entiendo por "IA privada"

IA privada, tal como uso el término con clientes, significa correr el modelo en hardware que tú controlas — una workstation en tu oficina, un servidor en un rack de colocation, o una máquina virtual alquilada que te pertenece. Tus prompts y las respuestas del modelo nunca salen de esa caja. No hay API de terceros, no hay factura por token, y no hay telemetría que vuelva al proveedor del modelo base.

Esa distinción importa más que la elección del modelo. Un modelo privado de 14B que responde desde tus propios PDFs puede ser una mejor respuesta para una clínica pequeña o un bufete de abogados que un modelo frontera que envía cada transcripción a su casa. La historia de privacidad es todo el punto.

Los tres niveles que realmente despliego

Los despliegues privados de LLM suelen caer en uno de tres perfiles. El correcto depende del volumen de llamadas, del presupuesto de latencia, y de qué tan estrictos son tus requisitos de residencia de datos.

Nivel 1 — GPU de workstation usada (USD $800–1.500)

Una tarjeta NVIDIA de generación anterior (RTX 3090, 4090, o una tarjeta workstation de 24 GB de eBay o un revendedor reacondicionado), 64 GB de RAM de sistema, un disco NVMe de 1 TB, y un gabinete silencioso. Costo total puesto en tu oficina en el rango de USD $800–1.500. Corre cómoda un modelo cuantizado de 7B o 14B a 30–60 tokens por segundo para un solo usuario, y un 32B a un ritmo más lento pero usable con offloading.

Para un equipo de una a cinco personas haciendo búsqueda interna, resúmenes y asistencia de código, esta es la IA privada más barata que puedes comprar. El consumo está alrededor de 350–600 W bajo carga, lo que son unos pocos dólares al día con una tarifa comercial normal.

Nivel 2 — servidor dedicado pequeño (USD $3.000–5.000)

Un servidor propiamente dicho con una sola GPU clase workstation como una RTX A4000 o A4500, memoria ECC, NVMe redundante, y administración remota IPMI. Este es el nivel que le queda a una clínica o una firma de servicios profesionales pequeña con cinco a veinte usuarios. Aloja un modelo de 14B o 32B en un entorno de producción real, conserva logs locales, y sobrevive un corte de luz.

El hardware es más confiable que una workstation, pero la verdadera mejora es operativa: puedes meterlo en un rack, monitorearlo con Uptime Kuma, respaldarlo correctamente, y parchear el SO sin tener que caminar hasta el escritorio de alguien.

Nivel 3 — VPS o bare metal alquilado (USD $40–80 / mes)

Si no quieres comprar hardware, un VPS dedicado con una GPU de consumo o un proveedor bare-metal (Hetzner, OVH, Lambda, RunPod, Vast.ai) te lleva al mismo lugar con una factura mensual. Cuarenta a ochenta dólares al mes te pone un modelo 7B–14B en tu VPC, y sesenta a ciento cincuenta al mes maneja un 32B con holgura. El trade-off es la residencia de datos — estás confiando el disco a un tercero, aunque no el modelo.

Para la mayoría de las pequeñas empresas este es el nivel de entrada. Arrancas en hardware alquilado para validar el caso de uso, y luego compras una caja cuando ya sabes que la carga de trabajo es real.

Lo que realmente obtienes en cada nivel

Un modelo mental útil: los modelos privados son hoy genuinamente buenos en las cosas que las pequeñas empresas les piden que hagan.

  • 7B–14B (familias Qwen, Mistral, Llama 3.x): resúmenes, redacción, Q&A interno sobre tus documentos, clasificación, extracción, ayuda con código. Corren en Nivel 1 o incluso en una laptop moderna con CPU a velocidad razonable.
  • 30B–70B cuantizado: notablemente mejores en razonamiento de varios pasos, contexto largo, y seguir instrucciones complejas. Necesita hardware de Nivel 2 o una GPU alquilada de 24 GB+. Este es el sweet spot para la mayoría de prototipos de "agentes de IA".
  • Frontera (>200B, alojado): todavía gana en razonamiento difícil, planificación de horizonte largo, y código en casos bordes. Pero pierdes la historia de privacidad, y el costo por llamada se acumula rápido a cualquier volumen no trivial.

Cuándo la privada gana

La privada es la respuesta correcta cuando cualquiera de estas cosas es cierta:

  • Tus datos están regulados, son sensibles, o tienen valor competitivo. Legal, médico, financiero, RR.HH. interno, transcripciones de soporte al cliente — todo eso.
  • Quieres costos mensuales predecibles. Una vez que la caja está pagada, la inferencia marginal es efectivamente gratis, sin importar cuántas llamadas haga tu equipo.
  • Necesitas operación offline o air-gapped. Ingeniería de campo, trabajo adyacente a defensa, sitios remotos sin uplink confiable.
  • Estás cansado de los cambios de precio del proveedor. La fijación de precios y los calendarios de deprecación de modelos alojados se mueven en el cronograma del proveedor, no en el tuyo.

Contra una factura equivalente de API de unos pocos miles de dólares al mes, el hardware de Nivel 1 o Nivel 2 típicamente se paga solo en tres a seis meses — corre la aritmética con tu propio volumen de tokens antes de comprometerte.

Cuándo la privada es la respuesta equivocada

También vale la pena decir dónde no empujo esto. Si tu equipo es pequeño, tu volumen de llamadas es bajo, tus datos no son sensibles, y necesitas un modelo clase frontera mañana — simplemente llama a la API. La sobrecarga operativa de correr tu propio hardware es real, y la caja privada más barata no es la IA más barata.

Si quieres ayuda para pensar si la IA privada tiene sentido para tu negocio, la página del servicio de IA privada recorre lo que realmente despliego. Y si quieres una respuesta directa sobre si cierra los números para tu caso, mándame los números aproximados y te digo honestamente.


Preguntas frecuentes

¿Cuánto tarda configurar un LLM privado para un equipo pequeño?

Para una configuración alquilada de Nivel 3 con Ollama, Open WebUI, y un pipeline básico de RAG sobre tus documentos, un piloto funcional son dos a tres días de trabajo. Un servidor de Nivel 2 propiamente dicho con respaldos, monitoreo y SSO toma cerca de dos semanas. La parte lenta nunca es el modelo — es meter tus documentos en un índice de recuperación limpio.

¿Es la IA privada realmente más barata que la API?

Depende del volumen. Por debajo de unos pocos millones de tokens al mes, la API es más barata porque no tienes costo hundido de hardware. Por encima de esa línea, la privada gana de calle. Los equipos que adoptan IA en serio suelen cruzar esa línea en unos pocos meses, por eso recomiendo arrancar en Nivel 3 y graduarse a hardware propio cuando la carga de trabajo es real.

¿Qué modelos corres realmente?

Qwen 2.5 y Qwen 3 en tamaños 7B, 14B y 32B, Llama 3.x en 8B y 70B, Mistral, y algún modelo especializado ocasional para código o texto médico. El panorama de pesos abiertos se mueve rápido, así que el default se revisa trimestralmente. Todo se sirve a través de Ollama o vLLM, para que el cliente nunca tenga que pensar en el ciclo de vida del modelo — mira la página del servicio de IA privada para los perfiles de despliegue.


Fuentes: documentación de Ollama y vLLM; precios publicados de GPU en Hetzner, OVH, RunPod y Vast.ai (mediados de 2026); benchmarks comunitarios en LMArena y los leaderboards de modelos abiertos de HuggingFace. Los precios son indicativos — verifica las tarifas vigentes antes de presupuestar.

Archivado en:private-aiollamasmall-business
Todas las publicaciones