Contacto

Qué hardware necesitas para un modelo de IA local

Cuánta memoria de vídeo, qué modelo y qué servidor para correr IA en tu propia red sin que el dato salga. Con el hardware real de un proyecto entregado.

Hablemos de tu proyecto

Por qué esto depende del hardware

Si la IA tiene que correr en tu red —porque el dato no puede salir—, el presupuesto no es una suscripción: es un servidor. La buena noticia es que hoy un modelo grande cabe en un equipo pequeño y de presupuesto contenido. En esta guía te contamos qué mirar, con los números de un proyecto que hemos entregado.

Si primero quieres entender para qué sirve una IA privada en un entorno como el hospital, empieza por la guía de IA privada en hospitales. Aquí vamos directo a la parte del hardware.

Qué mirar al comprar el servidor

Cuatro piezas deciden si el modelo cabe y a qué velocidad responde.

Memoria de vídeo (VRAM)

Es la que manda. El modelo y sus pesos cargan en la GPU: si no cabe la VRAM, el modelo no funciona a la velocidad que necesitas. Para un modelo 27B en cuantización de 4 bits, 16 GB de VRAM es el punto de partida que usamos en nuestros proyectos.

El modelo y su cuantización

Los modelos de pesos abiertos —por ejemplo Qwen 27B— se pueden cuantizar a 4 o 8 bits: se pierde una pequeña calidad a cambio de caber en menos memoria. La cuantización es la diferencia entre un equipo de gama media y uno de gama alta para el mismo trabajo.

RAM y disco

La RAM del sistema tiene que aguantar la carga del modelo y el tráfico de trabajo; el disco, los pesos de varios modelos y los registros de uso. No son el cuello de botella, pero no los ignores.

Red segmentada

El servidor vive en un tramo de tu red, no en la de los usuarios. La segmentación y el tráfico cifrado son parte del diseño, no un extra.

El servidor de un proyecto real, en números

En el caso de IA local para datos clínicos montamos el sistema sobre un pequeño servidor con estas cifras medidas:

  • Una GPU NVIDIA RTX Geforce 5060 Ti con 16 GB de VRAM, dentro de un presupuesto muy ajustado (en torno a 1.200 €).
  • El modelo en servicio: Qwen 27B (denso), de pesos abiertos, cuantizado para caber en esos 16 GB.
  • Velocidad de salida medida: 20–50 tokens por segundo —suficiente para transcripción, resumen y agentes en uso real.
  • Todo dentro del edificio: el dato clínico no sale nunca del servidor.

Con ese equipo, un equipo de desarrollo consume el modelo local a través de la API del servidor: GitHub Copilot, Opencode, agentes y chatbots. Es decir, la IA local no es solo para el hospital: sirve para cualquier trabajo donde el dato no puede salir.

Lo que no hace falta

No hace falta un data center

Un servidor de sobremesa en tu red resuelve la mayoría de casos de uso. Escalar después, si el uso lo pide, es más barato que dimensionar mal al principio.

No hace falta pagar por token

El coste es la infraestructura, fija y tuya. No hay coste de uso que crezca con el volumen de trabajo.

No hace falta comprar la GPU más cara

Si tu caso de uso cabe en un modelo 27B cuantizado, una GPU de 16 GB de VRAM es suficiente. La primera decisión es el caso de uso, no la tarjeta.

No hace falta un equipo de IA propio

En el diagnóstico dimensionamos el servidor, elegimos el hardware y formamos a tu equipo para operar y auditar el sistema. No entregamos el servidor y desaparecemos.

Cómo empezar

1

El caso de uso primero

Definimos qué va a hacer la IA (transcripción, resumen, agentes, alertas) y qué datos maneja. De eso sale el tamaño de modelo que necesitas y, con él, el hardware.

2

Prueba en nuestro servidor

Probamos tu caso en nuestro servidor de pruebas, con tus propios datos de ejemplo, sin compromiso. La prueba suele estar lista en dos o tres semanas.

3

Despliegue en tu red

Instalamos el sistema en tu hardware, dentro de la Unión Europea, con red segmentada y registro de auditoría por equipo y cliente. Lo mantenemos mes a mes: actualizaciones, seguridad y formación.

Preguntas frecuentes

¿Cuánto cuesta el hardware?

Depende del modelo y del caso de uso, pero un punto de partida razonable para modelos 27B es un servidor con una GPU de 16 GB de VRAM: en nuestro caso real, en torno a 1.200 € de presupuesto.

¿Qué pasa si mi caso necesita un modelo más grande?

Se mira el siguiente tamaño de modelo y se recalcula la VRAM. La lógica es la misma: caso de uso, modelo, cuantización y memoria. Lo dimensionamos en el diagnóstico.

¿Puedo usar la nube para las partes no sensibles?

Sí, y es lo que hacemos en la práctica: se migran primero los flujos con datos sensibles a tu infraestructura y el resto se deja donde esté, a tu ritmo.

¿Quién lo actualiza después?

La fase de mantenimiento mensual: actualizaciones de modelos y seguridad, soporte, revisión de la normativa y formación de tu equipo.

Empieza por una conversación de treinta minutos

Cuéntanos qué necesitas y te decimos honestamente si podemos ayudarte.

Respondemos en menos de 48 h.