La promesa de los 16 GB depende del tipo de memoria
La IA local ganó una opción más capaz en junio de 2026. Google presentó Gemma 4 12B, con entrada de texto, imágenes y audio, y afirmó que puede ejecutarse en portátiles con 16 GB de VRAM dedicada o memoria unificada.
La condición cambia el diagnóstico. Un Mac con Apple Silicon comparte memoria entre CPU y GPU. Un portátil para juegos separa la RAM del sistema y la VRAM. Un equipo fino con gráficos integrados reserva parte de la RAM. Los tres pueden anunciar 16 GB, aunque el modelo no recibe el mismo presupuesto.
La guía de Google del 3 de junio especifica 16 GB de VRAM o memoria unificada. Un Mac con 16 GB unificados o una GPU con 16 GB propios puede probar un 12B cuantizado con expectativas razonables. En Windows con 16 GB de RAM y 4 GB de VRAM, un modelo menor es un primer paso más prudente.
El cambio sigue siendo útil. Un portátil puede resumir documentos privados, examinar imágenes, trabajar con audio, escribir código y alimentar una API local sin enviar cada prompt a un proveedor. La pregunta correcta es cuánto espacio queda para el sistema, el contexto y la aplicación que rodea al modelo.
Lo que cabe realmente en 16 GB
El número de parámetros no indica por sí solo la memoria. La precisión modifica el peso base, mientras que el runtime, la arquitectura y el contexto añaden asignaciones.
Google publica estas estimaciones de memoria para Gemma 4. Incluyen un 20 % de margen para componentes de carga, pero excluyen el software y el contexto.
| Variante Gemma 4 | Q4_0 | SFP8 | BF16 | Lectura práctica para 16 GB |
|---|---|---|---|---|
| E2B | 2,9 GB | 5,7 GB | 11,4 GB | Inicio holgado |
| E4B | 4,5 GB | 8,9 GB | 17,9 GB | Q4 deja margen útil |
| 12B | 6,7 GB | 13,4 GB | 26,7 GB | Q4 es la opción sensata |
| 26B A4B | 14,4 GB | 28,8 GB | 57,7 GB | Demasiado justo con contexto y apps |
| 31B | 17,5 GB | 34,9 GB | 69,9 GB | La base supera 16 GB |
Q4 guarda los pesos con menos bits, reduce memoria y puede afectar a la calidad. Los checkpoints oficiales entrenados para cuantización buscan limitar esa pérdida.
El tamaño descargado mide otra cosa. El 31 de julio de 2026, la biblioteca de Gemma 4 en Ollama mostraba 7,2 GB para el paquete 12B QAT y 7,6 GB para Q4_K_M. El archivo en disco no representa toda la memoria de trabajo.
El contexto suma la caché KV. Aunque el modelo admita hasta 256K, Google excluye esa caché de la tabla. Ollama configura 4K por defecto por debajo de 24 GiB de VRAM y avisa de que un contexto mayor consume más memoria. En 16 GB, conviene empezar con 4K u 8K.
- E4B Q4 deja margen para el sistema y otras aplicaciones.
- 12B Q4 encaja mejor en 16 GB unificados o 16 GB de VRAM cuando la tarea necesita más capacidad.
- 26B A4B Q4 parte de 14,4 GB sin contar contexto; no es una elección equilibrada.
- 12B SFP8, con 13,4 GB estimados, requiere un entorno muy controlado.
Elige el runtime antes de descargar el modelo
El modelo marca la capacidad. El runtime define la instalación, la inspección de memoria y la integración.
| Runtime | Mejor uso | Enfoque de hardware | Coste |
|---|---|---|---|
| LM Studio | Interfaz, documentos y API local | Recomienda 16 GB o más; Apple Silicon, Windows y Linux | Catálogo y descargas requieren internet |
| Ollama | Terminal, servicio local e integraciones | Metal, Nvidia, AMD y Vulkan documentados | Hay que vigilar contexto y modelo local/nube |
| llama.cpp | Control de GGUF y parámetros | Metal en Apple Silicon y varios backends | Más configuración manual |
| MLX | Desarrollo centrado en Apple | CPU y GPU comparten memoria | Ecosistema más específico |
| LiteRT-LM | Integraciones recientes con Gemma | Servidor local compatible con la API de OpenAI | Menos modelos que las herramientas GGUF |
Los requisitos de LM Studio recomiendan 16 GB en Apple Silicon; en Windows, 16 GB de RAM y 4 GB de VRAM. No garantizan cualquier modelo y contexto. Su interfaz permite comprobar el ajuste sin montar una pila propia.
Ollama funciona bien como endpoint local. Escucha en 127.0.0.1:11434 por defecto y ollama ps indica si el modelo está en GPU, CPU o repartido. El reparto puede permitir la carga, pero también alterar el tiempo de respuesta.
llama.cpp ofrece control directo de GGUF, cuantización y backends. MLX está diseñado alrededor de la memoria unificada de Apple Silicon. Ninguno decide por el usuario cuánto contexto reservar ni si la salida es suficiente.
Una primera configuración prudente
La primera prueba debe comprobar el ajuste del equipo.
- Identifica la memoria. En Apple Silicon, revisa la memoria unificada; en Windows y Linux, separa RAM y VRAM.
- Instala un solo runtime. LM Studio para una ruta visual; Ollama para terminal y API.
- Empieza con Q4 oficial. Prueba E4B y sube a 12B cuando una tarea concreta lo exija.
- Usa 4K–8K de contexto. El máximo del modelo no es un objetivo.
- Cierra aplicaciones pesadas. Navegadores, IDE, juegos y editores compiten por memoria.
- Prueba tres trabajos reales. Incluye un prompt corto, un documento o imagen y el caso más largo habitual.
- Revisa la asignación. Ejecuta
ollama pso inspecciona el estado de carga en LM Studio. - Cambia una variable cada vez. Aumenta por separado contexto, precisión y tamaño.
ollama run gemma4:12b
ollama ps
Comprueba etiqueta, tamaño, modalidades y cuantización antes de descargar. Puedes comparar más herramientas de desarrollo con IA.
Local no significa privado ni open source de forma automática
La inferencia en el dispositivo ofrece más control. LM Studio indica que los modelos descargados, los documentos y su servidor local pueden funcionar sin conexión. Ollama afirma que no ve los prompts de los modelos locales.
El límite incluye varias excepciones:
- buscar y descargar modelos, runtimes y actualizaciones usa internet;
- elegir un modelo en la nube envía la solicitud al proveedor;
- búsqueda web, plugins, MCP y herramientas externas crean conexiones;
- exponer la API fuera de la dirección local la convierte en un servicio de red;
- historiales, registros, embeddings y pesos siguen siendo datos que proteger.
Ollama permite desactivar la nube con OLLAMA_NO_CLOUD=1 y usa loopback por defecto. Son controles comprobables. La palabra “local” no sustituye una política de seguridad.
Google describe Gemma 4 como un modelo de pesos abiertos con uso comercial responsable. Sus términos mantienen restricciones de uso y requisitos de distribución. Poder descargar los pesos no implica una licencia estándar de software open source.
La decisión entre local, nube e híbrido
La IA local encaja con documentos que deben permanecer en un equipo controlado, conexiones poco fiables, uso frecuente y tareas de contexto limitado. Un portátil con 16 GB unificados y E4B Q4 o 12B Q4 ya cubre parte de ese trabajo.
La nube sigue siendo mejor para los modelos más grandes, contextos extensos, colaboración con alto volumen y equipos que no quieren mantener runtimes.
| Necesidad | Opción inicial |
|---|---|
| Notas privadas, documentos sin conexión, prototipos | Local |
| Modelos grandes, investigación larga, capacidad compartida | Nube |
| Preprocesamiento sensible y razonamiento difícil | Híbrido |
| Dudas sobre el equipo | E4B Q4 local con alternativa en la nube |
El enfoque híbrido suele funcionar bien: resumir o eliminar información sensible en el portátil y enviar solo el contexto necesario a un modelo alojado. Los 16 GB se ocupan de la parte donde el control local aporta valor.
Empieza con una tarea limitada y un Q4. Si el equipo permanece fluido con 4K–8K y la respuesta cumple, conserva el flujo. Si la tarea exige desde el inicio 256K, modelos mayores o varios usuarios, trasládala a la nube. Los artículos sobre herramientas para desarrolladores ayudan a completar la elección.


