Ejecutar modelos de lenguaje o generación de imágenes en local tiene enormes ventajas: privacidad absoluta, cero costes por API y control total sobre el entorno. Sin embargo, el primer obstáculo siempre es el mismo: ¿aguantará mi máquina o se quedará sin memoria de vídeo a los dos segundos?

Entre parámetros (7B, 13B, 70B), tipos de cuantización (Q4_K_M, Q8, FP16) y el consumo de la ventana de contexto, calcular si un modelo cabe en tu GPU suele requerir tablas de cálculo o ensayo y error.

Para solucionar esta fricción existe CanIRun.ai, una herramienta inspirada en el mítico Can You RUN It de los videojuegos, pero adaptada al ecosistema de la inteligencia artificial open source.

Interfaz principal de CanIRun.ai para comprobar compatibilidad de hardware con IA

¿Qué problema resuelve exactamente?

Cuando descargas herramientas como Ollama o LM Studio, elegir el modelo adecuado implica equilibrar tres factores críticos:

  • VRAM disponible: Si el modelo no entra en la memoria dedicada de la gráfica, la inferencia pasa a la RAM del sistema (CPU offloading), destruyendo la velocidad de respuesta (tokens por segundo).
  • Nivel de cuantización: Reducir la precisión de los pesos (por ejemplo, a 4 u 8 bits) comprime el tamaño del modelo a costa de una pérdida casi imperceptible de calidad.
  • Contexto activo: A mayor número de tokens procesados simultáneamente, mayor consumo adicional de memoria en el búfer KV.

CanIRun.ai cruza estos datos al instante: seleccionas tu configuración de hardware (GPU, CPU, memoria unificada o RAM, sino te lo autorecoge ya al acceder) y la web te indica con precisión qué modelos puedes correr, con qué cuantizaciones y a qué velocidad aproximada.

Filtro por GPU y VRAMEvalúa desde gráficas dedicadas de NVIDIA/AMD hasta chips Apple Silicon con memoria unificada.
Catálogo actualizadoIncluye familias populares como Llama, Mistral, DeepSeek, Gemma o Qwen, además de modelos multimodales y de difusión.
Desglose de cuantizacionesDetalla el peso exacto en VRAM según el formato (GGUF, EXL2, AWQ, FP16).
Estimación de rendimientoAporta una aproximación de tokens por segundo antes de iniciar la descarga.
resultado de compatibilidad de modelos para un hardware seleccionado para llama 3 en canyourun.ai

Mini guía de parámetros y cuantizaciones

Parámetros

Representan el número de conexiones entrenadas en la red neuronal. A más parámetros, mayor capacidad de razonamiento y conocimiento general, pero mayor consumo de cómputo (define lo listo o capaz que es, como si fuera el cociente intelectual del modelo):

  • 3B a 8B: modelos simples para GPUs de 6 GB a 12 GB de VRAM. Ideales para resumir, chat general o tareas específicas de código en las que se le pide algo muy concreto.
  • 14B a 32B: Requieren tarjetas de 16 GB a 24 GB de VRAM, eso sí, dan un salto muy notable respecto a los anteriores.
  • 70B o superiores: Necesitan configuraciones multi-GPU o equipos con más de 64 GB de RAM/VRAM. Es algo más parecido a lo que te puede ofrecer un servicio en la nube.

Cuantizacion

Los modelos suelen venir sin comprimir en formato FP16. Sin embargo, actualmente muchos equipos dedican horas a comprimir modelos a una precisión numérica con menos decimales, ya que se demostró que se podía ahorrar mucho espacio en memoria y prácticamente no afectar a la calidad de las respuestas. La precisión original (16bits guarda más decimales que la de 8 bits, y esta más que la de 4 y esta más que la de 2…)

  • FP16 (16 bits): es la precisión completa. El estado del modelo por defecto
  • Q8 / Q6: Máxima fidelidad al modelo original, pero ahorran poco espacio.
  • Q4_K_M / Q5_K_M: Reducen el consumo de VRAM más de un 60% manteniendo casi intacta la coherencia en las respuestas. Es la opción por defecto a buscar. Ahorras mucha memoria VRAM sin perder inteligencia.
  • Q2 / Q3: Compresiones muy agresivas. Reducen el modelo al mínimo, pero suelen provocar incoherencias («alucinaciones») o degradación sintáctica.
Uso de VRAM con distintos tipos de cuantización para el modelo llama 3 8 B

Ten en cuenta, que esto es el el peso del modelo, va a tu VRAM directamente, pero aún tienes que dejar esapacio para una ventana de contexto grande. Esa ventana de contexto también va en tu VRAM es la que representa el conocimiento presente en la conversación. Lo que salga fuera de esa ventana, se «olvida».

Tener este tipo de utilidades a mano ahorra tiempo de descarga innecesario y evita frustraciones al experimentar con modelos locales. Si estás montando un entorno de inferencia en casa o en tu servidor local, guárdala en marcadores.

¿Puede tu PC mover IA local? Analiza tu hardware con CanIRun.ai

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Social media & sharing icons powered by UltimatelySocial