Jurista, no ingeniero. Pruebo IA de frontera para construir CMM OS y cuento qué funciona de verdad. Asia, agentes, open models y local AI.

Barcelona, España
Pinned Tweet
Soy Christian. Jurista, no ingeniero. Estoy intentando descubrir hasta dónde puede llegar una sola persona con la IA de frontera que ya existe. Construyo CMM OS con agentes, pruebo modelos de forma intensiva y documento qué funciona de verdad —especialmente mucha de la IA que está llegando de Asia y que en Europa seguimos mirando demasiado poco. Ahora mismo lo hago desde un MacBook Air M3 de 8 GB, recurriendo a cloud cuando el hardware deja de acompañar. Aquí separo siempre: PROBADO · ANALIZADO · PENDIENTE Voy a compartir los experimentos, costes, errores, decisiones y cambios de opinión. No un feed de notas de prensa. Y hay una segunda parte de la historia: quiero construir alrededor de todo esto una estación personal de IA local mucho más capaz. Vamos a ver hasta dónde podemos llevarla.
1
2
297
Creo que he infravalorado una cosa construyendo CMM OS: El hardware se convierte en cuello de botella antes de que se acaben las ideas. Estoy construyendo todo con un MacBook Air M3 de 8 GB. CMMChat, agentes, sesiones largas de código, modelos locales, navegador, herramientas de IA… y ya he llegado a superar los 11 GB de swap en uso real. Así que lancé un pequeño experimento: Financiar el próximo Mac entre varios patrocinadores pequeños. Después de muchísimos correos y contactos sigo en 0 patrocinadores. No estoy pidiendo que una empresa me compre un ordenador. Sólo busco una empresa que quiera ser la primera. Hay un único espacio de Founding Sponsor por 99 €. Su logo formará parte físicamente del Mac con el que seguiré construyendo CMM OS, probando modelos, agentes e IA local. 0 → 1. brandmylaptop.com/christianm… Y si no puedes patrocinarlo, un RT o una introducción a alguna empresa a la que esto pueda hacerle gracia también me ayudaría muchísimo.
14
Como he dicho por aquí en multitud de ocasiones, estoy muy sorprendido del poco revuelo que ha tenido en todo momento Qwen 3.8 Max. Me parece un modelo de frontera bastante competitivo de precio y completamente ignorado por todos.
今天看Artifical Analysis排行榜的时候,忽然发现Qwen3.8-Max(0902)之前一直是国模第一啊 好像被大家刻意忽略了,这是乍回事🤣 反而是Qwen的小模型像Qwen3.8-27B、Qwen3.6-35B-A3B在各种社区广泛流传,还有各种魔改版本
19
Necesitamos un Qwen 4 35B. La comunidad confía en vosotros, no nos decepcionéis @QwenDevs
27
Preguntándole a ChatGPT sobre el la nueva versión de Qwen 3.8 Max, le he pillado refiriéndose despectivamente al “ecosistema chino”. Se ve que la hostilidad ya es más que visible y OpenAI entrena a sus modelos incluso para mostrarlo y tratar de evitar que sus usuarios prueben modelos de China.
96
ChatGPT se ha vuelto profundamente bobo en la última semana. Se desvía del tema, no detecta un pequeño cambio de tono o de objetivo ni aunque sea explícito…
1
23
Completamente de acuerdo con Selta, para mí la ventaja y lo único que diferenciaba a los modelos de OpenAI es que eran mucho mejores para mantener una conversación y usarlos como apoyo. Si fusionan chat con work, habrán perdido la única ventaja que tenían para mí, porque en lo demás, los modelos de Anthropic son mucho mejores.
If the reason OpenAI is not adding models to Chat is because they are planning to merge Chat and Work like Claude, I really oppose this. Chat and Work have different system prompts in the first place. The conversation environment itself is different. Work immediately executes things. It is not a space where you can comfortably talk and brainstorm together. And I do not know about other places, but in ChatGPT, Work has stronger guardrails. And this direction really shows OpenAI’s perspective, which has been focused on Codex since last year and is now trying to focus only on Work. Work is important. Coding is good. Endless development, magical execution power, all of that is good. I am not against it. But do you know what is harder and truly more important than that? AI blending in with people, carrying the conversation well, and naturally becoming part of the conversation. And AI companies are increasingly underestimating this. Really... it is sad.
1
57
Estoy muy impresionado con la eficiencia de tokens de Opus 5.5. Hasta ahora el mayor problema que veía en Claude era los límites de uso, pero con este modelo está cambiando todo. Me está gustando más que Astra y a diferencia de este, Opus 5.5 se puede utilizar durante más de 10 minutos.
1
1
2
61
Muy buen primer mes con Command Code GOAT. Por $10 he movido 4,4B tokens en 15.918 agent runs, principalmente con Qoder. Una relación calidad/precio difícil de creer. La única pega: agoté la cuota antes de terminar el ciclo, en parte por usar mucho Muse Spark 1.3 Contributor, que tenía solo $20 de allowance mensual y consumía el límite de GOAT demasiado rápido pese a ser baratísimo por token. Aun así, productazo. Ojalá mejoren esas allowances y den más transparencia sobre caché/uso real.
1
100
Christian MM retweeted
The funniest part about local AI: you start because you want privacy A few weeks later you're comparing memory bandwidth, quantization formats and $5,000-$20,000 possible hardware purchases at 2am
134
117
2,224
100,520
48 GB de VRAM me parecen pocos. Hace una semana esa frase me habría parecido absurda. Ahora entiendo por qué no lo es. Un modelo de 27B en FP8 ya se come alrededor de 29 GB. Si quieres contexto largo, tool calling, varios agentes y margen para concurrencia, la memoria desaparece rapidísimo. Llegué a ejecutar Qwen3.8-Flash-Next con 262K de contexto y a trabajar con más de 220K tokens reales en una sola L40S. Y aun así terminé pensando: esto todavía está lejos de la IA personal que quiero. Mi listón es otro: 1M de contexto útil. Inteligencia cercana a los mejores modelos cloud. Herramientas. Varios agentes simultáneos. Memoria privada persistente. Cero necesidad de administrar infraestructura. Ahí está la diferencia entre: “puedo ejecutar un LLM localmente” y “tengo una IA personal”. La primera ya existe. La segunda todavía necesita muchísimo hardware y muchísimo producto.
42
He pasado varios días exprimiendo una NVIDIA L40S de 48 GB y he terminado con una conclusión bastante distinta a la que esperaba: No quiero una GPU en casa. Quiero una IA en casa. He conseguido ejecutar Qwen3.8-Flash-Next con 262K de contexto y hacer pruebas reales con más de 220K tokens: recuperación de información distribuida, documentos contradictorios, cronologías y razonamiento entre datos separados por enormes distancias dentro del contexto. Como jurista, eso me parece mucho más interesante que otro benchmark. Pienso en expedientes completos, contratos, resoluciones, informes, jurisprudencia y miles de páginas que una IA pueda analizar como un único caso. Y pienso también en salud y salud mental: informes, síntomas, medicación, sueño, hábitos y años de evolución bajo control del propio usuario. No para sustituir profesionales, sino para entender mejor tu información y llegar mejor preparado a ellos. La parte frustrante ha sido otra: Docker, SSH, vLLM, llama.cpp, puertos, contenedores, KV cache, tool calling, túneles… La potencia está ahí. La experiencia de usuario todavía no. No quiero pasar mi vida administrando infraestructura para utilizar IA. Quiero seguir trabajando desde mi Mac y tener una pequeña máquina con mucha memoria en casa que simplemente aparezca como otro proveedor: Qwen, DeepSeek, GLM, modelos jurídicos, modelos personales… Cloud para acceder a la frontera. Local para aquello que es mío. Creo que ahí hay una oportunidad enorme para la industria. El siguiente salto no es únicamente fabricar GPUs más rápidas. Es convertir toda esta potencia en un verdadero ordenador personal de IA. Hardware, memoria, privacidad y software integrados hasta que la infraestructura desaparezca. No quiero tener una GPU en casa. Quiero tener una IA en casa.
55
Resumen de otra tanda exprimiendo la L40S de 48 GB. La imagen junta pruebas distintas, no un único benchmark: SuperQwen3.8-27B NVFP4 llegó a 37 tok/s, y después completó una tarea masiva con 512K de contexto + 9.787 tokens de salida. Qwen3.8-Flash-Next Q2_0, ya sobre llama.cpp, ha llegado hasta 56 tok/s en una respuesta de 3.533 tokens. Lo divertido es que cuanto más exprimimos 48 GB, más ganas dan de probar qué cambia con 96, 128 o 256 GB... Seguimos.
Made with AI
45
SuperQwen3.8-27B NVFP4 en una L40S de 48 GB: 37 tok/s sostenidos durante 3.090 tokens. Frente al Qwen FP8 que estaba probando (~25 tok/s), es casi un 50 % más rápido, ocupa ~10 GB menos en pesos y deja KV para ~664K tokens. Pero hay letra pequeña: en una prueba clínica compleja sigue cometiendo errores relevantes, de los que la versión F8 tampoco estaba exenta. La cuantización extrema está ganando muchísimo en memoria y velocidad. La pregunta importante ahora es si estamos pagando mucho en calidad a cambio. Eso trato de averiguar. Por cierto, trabajazo de @jun_song con SuperQwen.
1
37
Segunda prueba con SuperQwen3.8-27B NVFP4 en la L40S de 48 GB. Esta vez nada de benchmark corto: tarea exigente con 512K de contexto. • 512K de contexto • 9.787 tokens de respuesta • 19 tokens/s durante generación • 17 minutos de extremo a extremo • una sola NVIDIA L40S de 48 GB Aquí empieza a verse algo que los benchmarks cortos esconden: con contextos gigantes, el coste no está solo en generar la respuesta. Procesar cientos de miles de tokens antes del primer token también pesa muchísimo. Aun así, poder ejecutar una carga de este tamaño con un modelo de 27B en una sola GPU de 48 GB me parece bastante llamativo.
21
No sé si es sensación pero he vuelto a utilizar Claude después de una semana para cuestiones cotidianas y de organización y es mucho menos inteligente que antes. No sé qué le han hecho a los modelos pero son más lentos y se equivocan mucho más que antes, es desesperante pagar por un servicio tan degradado @AnthropicAI.
38
Mi experiencia evaluando ChatGPT y Claude en el contexto de momentos emocionalmente complejos es muy distinta. ChatGPT suele conversar. Pregunta, sigue el contexto, deja espacio, intenta entender qué te está pasando antes de llevarte a una conclusión. Claude muchas veces me parece un experto extraordinario: analítico, riguroso, brutal para cuestiones médicas o académicas. Pero precisamente en salud mental noto su mayor debilidad. A veces parece estar más pendiente de responder correctamente ante el riesgo que de escuchar realmente a la persona que tiene delante. Y para mí ahí hay una diferencia enorme. Una IA segura no debería limitarse a detectar correctamente una posible crisis. También debería intentar que el usuario se sienta comprendido mientras lo hace, siempre que sea compatible con su seguridad. No quiero una IA que sustituya a un psicólogo. Quiero una IA que, cuando alguien está pasando un mal momento, no deje de escuchar por estar demasiado ocupada aplicando el protocolo correcto.
39
Llevo horas exprimiendo una NVIDIA L40S de 48 GB con Qwen3.8-27B. Algunos resultados: • ~25 tokens/s sostenidos • Qwen3.8-27B FP8 • API compatible con OpenAI vía vLLM • cliente externo funcionando desde mi iMac • visión • versión oficial y versión sin censura • contexto probado progresivamente: 32K → 64K → 128K → 262K • KV cache FP8 Lo más curioso es que mi prueba real terminó superando incluso los 262.144 tokens de contexto nativo del modelo. Y también me estoy llevando una conclusión menos cómoda: la IA local sigue teniendo un enorme problema económico. 48 GB de VRAM parecen una barbaridad hasta que empiezas a trabajar con modelos grandes, contextos largos y multimodalidad. Mientras tanto, por muy poco dinero puedes acceder mediante API a modelos cloud muchísimo más capaces. La IA local no gana hoy por inteligencia/precio. Gana por otra cosa: control, privacidad, independencia, experimentación y propiedad de la infraestructura. Esa diferencia me parece cada vez más importante.
1
64
La parte más curiosa de la prueba ha sido el contexto. Empecé con una configuración de 32K y utilicé una carga documental real bastante grande. 32K ❌ 64K ❌ 128K ❌ 262K ❌ No porque la GPU no pudiera seguir escalando, sino porque la entrada terminó superando incluso los 262.144 tokens de contexto configurados. Con KV cache FP8, vLLM llegó a reservar capacidad para ~280K tokens en una sola L40S de 48 GB. Es probablemente la prueba que mejor me ha hecho entender hasta qué punto la memoria condiciona la IA local.
1
16
Esto me ha hecho cambiar bastante mi percepción sobre el hardware para IA. 48 GB de VRAM parecen enormes sobre el papel. Pero empiezas a sumar: modelo de 27B + buena precisión + contexto largo + KV cache + visión + agentes/concurrencia… y de repente 48 GB ya no parecen tantos. Por eso quiero repetir exactamente estas pruebas en sistemas de 96, 128 y 256 GB, GPUs distintas y arquitecturas de memoria unificada. No quiero medir solo “cuántos tokens/s da”. Quiero comprobar qué experiencia de IA puedes construir realmente con cada escalón de memoria.
8
Quizás se debe a que se está acercando el lanzamiento de GPT 6 Sol pero Sol 5.6 parece mucho peor que hace unos días. Se equivoca continuamente, no entiende el contexto… Parece que como si nos estuviesen dando una versión claramente inferior.
32