He pasado varios días exprimiendo una NVIDIA L40S de 48 GB y he terminado con una conclusión bastante distinta a la que esperaba:
No quiero una GPU en casa. Quiero una IA en casa.
He conseguido ejecutar Qwen3.8-Flash-Next con 262K de contexto y hacer pruebas reales con más de 220K tokens: recuperación de información distribuida, documentos contradictorios, cronologías y razonamiento entre datos separados por enormes distancias dentro del contexto.
Como jurista, eso me parece mucho más interesante que otro benchmark.
Pienso en expedientes completos, contratos, resoluciones, informes, jurisprudencia y miles de páginas que una IA pueda analizar como un único caso.
Y pienso también en salud y salud mental: informes, síntomas, medicación, sueño, hábitos y años de evolución bajo control del propio usuario. No para sustituir profesionales, sino para entender mejor tu información y llegar mejor preparado a ellos.
La parte frustrante ha sido otra:
Docker, SSH, vLLM, llama.cpp, puertos, contenedores, KV cache, tool calling, túneles…
La potencia está ahí. La experiencia de usuario todavía no.
No quiero pasar mi vida administrando infraestructura para utilizar IA.
Quiero seguir trabajando desde mi Mac y tener una pequeña máquina con mucha memoria en casa que simplemente aparezca como otro proveedor: Qwen, DeepSeek, GLM, modelos jurídicos, modelos personales…
Cloud para acceder a la frontera. Local para aquello que es mío.
Creo que ahí hay una oportunidad enorme para la industria.
El siguiente salto no es únicamente fabricar GPUs más rápidas.
Es convertir toda esta potencia en un verdadero ordenador personal de IA.
Hardware, memoria, privacidad y software integrados hasta que la infraestructura desaparezca.
No quiero tener una GPU en casa.
Quiero tener una IA en casa.