Probé IA LOCAL a fondo: crashes, swap infernal y por qué tu Mac pierde contra Linux
Gentleman Programming | IA local a fondo: probé modelos locales (Gemma 4 y Qwen) en una mini PC Beelink SER9 Pro edición Open Claw y pasó de todo. Crashes que reinician la máquina, swap infernal, la batalla del context size, y el remate: mi Mac de 4000 euros pierde contra esta mini PC con Linux en tareas de agentes. La verdad completa de los modelos locales en 2027, sin humo 📌 TIMESTAMPS 0:00 Intro - Historia de testing y modelos locales 0:36 La Beelink SER9 Pro edición Open Claw 1:15 Specs: Ryzen AI 9 HX370, 32GB RAM unificada 2:31 UMA: la GPU reserva RAM como VRAM y es dinámica 3:06 Lo que viene de fábrica: llama.cpp propio y Open Claw 4:18 El script de fábrica en chino con configs contradictorias 4:54 El plan: instalar Gemma 4 26B junto a Qwen 5:26 llama-swap: proxy en Go con autoswap de modelos 6:24 Por qué el A4B: Mixture of Experts explicado 8:24 Instalación y configuración de llama-swap 9:23 Primera request a Gemma: GPU layers 99, dale con tuti 9:49 LA MÁQUINA SE REINICIA: Vulkan device lost 10:15 Por qué: la GPU integrada maneja compute Y display 11:10 El bug: driver RADV + GFX1150 + MoE de Gemma 4 12:02 Tres escalones: CPU only, split, ROCm 14:04 Gemma razona 66 tokens para decir pong 15:32 Qwen: respuesta al segundo con 3 tokens 16:31 Tool calling: por qué Qwen le gana a Gemma 18:52 Gemma en contextos largos: 96 vs 26 tokens por segundo 20:38 Conclusión: Gemma para generar, Qwen para agentes 21:11 Probando Open Claw a fuego: quiero un Jarvis 22:04 Gentle Squire: usuario del sistema operativo dedicado 22:57 El gateway como servicio systemd con hardening 23:40 TMPFS: mi home no existe para el bot 25:44 gentle-ai ahora soporta OpenClaw y Hermes 26:10 El síntoma: 0.4 tokens por segundo, colgado 27:05 El kernel paginando el modelo a swap 27:40 La lección: el context size de 256K de fábrica 28:31 Bajé a 32K: de 0.4 a 12 tokens por segundo 29:16 Dije hola y explotó: Open Claw infla 40K al arrancar 30:26 Gemma con las tools: bucle infinito con JSON 30:57 Vuelta a Qwen: conectando al MCP de Notion 33:19 "Tenés un MCP, locura, basta de scripts" 34:10 Con 128K: el daily tech brief lo hizo 34:39 Hermes: lo hizo y hasta generó un audio 35:20 Gemma solo funciona en inglés 36:30 Compactación tras compactación 37:35 EL PROBLEMÓN: el estado de los modelos locales hoy 38:11 No como orquestador, no para contextos largos 38:33 Menos de 128GB de RAM no vale la pena 38:49 El uso ideal: tareas puntuales y la Beelink 24/7 39:40 Las Mac son lentas: mi M4 Max de 4000 euros 40:27 Los benchmarks de Theo: M5 Max vs Linux barata 41:25 Plot twist: esto es una Mac conectada a la Beelink 42:11 Tailscale: SSH directo con IPs fijas, gratis 42:27 Tres máquinas: Beelink, Mac y el Fold 7 43:10 Herder remote vs SSH: la TUI se renderiza local 44:00 Prueba final: codegraph, la mini PC le gana a la Mac 45:13 Cierre 🧠 QUÉ VAS A APRENDER - La verdad de los modelos locales en máquinas normales (32GB) - llama-swap: hot-swap de modelos con un proxy en Go - Mixture of Experts: por qué Gemma 4 A4B rinde como 4B y responde como 26B - Qwen vs Gemma: tool calling, contextos largos y cuál elegir para agentes - Seguridad para tu bot: usuario dedicado, systemd hardening, TMPFS - Mac vs Linux para agentes: benchmarks reales - Tailscale + Herder remote: manejar tres máquinas desde cualquier lado ━━━━━━━━━━━━━━━━━━━━━ 💡 LA CONCLUSIÓN SOBRE IA LOCAL - Con 32GB de RAM los modelos locales NO sirven como orquestador ni para contextos largos - Menos de 128GB no vale la pena para trabajo serio de agentes - El uso ideal: tareas ultra específicas, categorización, máquinas 24/7 de bajo consumo - Para todo lo demás: una suscripción y listo, vuela ━━━━━━━━━━━━━━━━━━━━━ 📦 REPOSITORIOS - Engram: https://github.com/Gentleman-Programming/engram - AI Gentle Stack (ahora soporta OpenClaw y Hermes): https://github.com/Gentleman-Programming/gentle-ai - Gentleman.Dots: https://github.com/Gentleman-Programming/Gentleman.Dots 🔗 llama-swap: https://github.com/mostlygeek/llama-swap �
- Duración: 00:45:36
- Publicación: 15 jul 2026, 19:04
- Estado: published