Miniatura de Qué es un LLM y por qué la IA "alucina": curso gratis, capítulo 1

Qué es un LLM y por qué la IA "alucina": curso gratis, capítulo 1

Gentleman Programming | Qué es un LLM | Qué es un LLM y por qué la IA "alucina": arranca el curso gratis de inteligencia artificial, de tokens a agentes, sin humo y desde las entrañas. Capítulo 1: el modelo, la inferencia y el KV cache. Este es el primero de muchos videos de un curso completamente gratuito. ¿La idea? Que dejes de ser "yo uso Cursor" y pases a ser la persona que diseña sistemas de agentes confiables. Y para eso hay que abrir el capot: si no sabés cómo funciona el auto, cuando se rompe en la ruta llamás a la grúa. Si sabés, capaz era limpiar una cosita y salir andando. En este capítulo: qué es un LLM (una máquina de predecir, nada más y nada menos), el transformer y la atención, la generación autorregresiva, y la tesis polémica del video: la IA no alucina, para el modelo esa respuesta es la más plausible, el problema es que plausibilidad no es verdad. Vemos las tres etapas del entrenamiento (pretraining, fine tuning y RLHF, donde vos sos el conejillo de Indias), el knowledge cutoff, parámetros y VRAM, qué es un modelo frontier, Mixture of Experts, por qué la API es stateless, qué es un token y por qué el español te sale más caro que el inglés, cuánto te cuesta el system prompt por día, TTFT versus tokens por segundo con prueba en vivo, prefill y decode, compute bound versus memory bound, Q, K y V con la analogía de la biblioteca, y el KV cache. Todos los conceptos, ejemplos de la vida real y cero matemática obligatoria. Mucho de este curso viene del libro gratuito, así que si querés ir más profundo lo tenés ahí. La próxima: prompt caching. 📖 El libro gratis: https://the-amazing-gentleman-programming-book.vercel.app ⏱️ TIMESTAMPS: 0:00 Bienvenida: el primero de muchos videos del curso gratis 0:30 Por qué tenés que saber qué pasa bajo el capot 1:14 La analogía del auto en la ruta 1:45 De "yo uso Cursor" a diseñar sistemas de agentes 2:22 La estructura del capítulo 2:47 Los 4 conceptos que tenés que tener en la cabeza 3:43 Qué es un LLM: una máquina de predecir 4:39 El transformer y la atención 5:47 Probabilidades: por qué París y no Roma 6:18 Generación autorregresiva: la salida es la entrada 7:03 200 líneas de React son millones de iteraciones 7:46 Consecuencia 1: no piensa 8:01 La IA no alucina: plausibilidad vs verdad 9:04 Entrenamiento: pretraining, fine tuning y RLHF 10:08 Knowledge cutoff: por qué te responde con Angular viejo 10:43 Fine tuning: nuestro primer harness 11:34 RLHF: vos sos el conejillo de Indias 13:30 Por qué se equivoca con tanta confianza 14:34 Tamaño: parámetros, VRAM y el cálculo de un 7B 15:43 Qué es un modelo frontier 16:14 Mixture of Experts: 8 especialistas, elijo 2 17:33 La API es stateless: sesión CLI vs endpoint 19:43 Recordar, buscar y ejecutar NO son el modelo 20:49 El problema que resuelve el KV cache 21:31 Qué es un token: la unidad con la que pagás 22:20 Token de entrada vs token de salida 23:26 Tokenización y Byte Pair Encoding 24:52 Cuántas R tiene strawberry 25:57 Por qué el español es más caro que el inglés 27:42 Precio por API: la salida cuesta 5 veces más 28:46 System prompt: 50 millones de tokens al día 30:24 Velocidad: la prueba en vivo con Pi 32:21 TTFT vs tokens por segundo 34:10 Inferencia en dos fases: prefill y decode 35:46 Compute bound vs memory bound 37:44 Q, K y V: la analogía de la biblioteca 39:00 La fórmula de atención sin miedo 40:44 KV cache: no recalcular lo que no cambia 43:29 La matemática de memoria: 8B, 8K, 1 GB 44:10 Cierre: la próxima, prompt caching ▬ LINKS DE INTERÉS ▬ 🤑 DESCUENTOS ══════════════════════ ​CodeCrafters: https://app.codecrafters.io/join?via=GentlemanProgramming Linsoul: https://www.linsoul.com/GentlemanProgramming 📺 STREAM ══════════════════════ Twitch: https://www.twitch.tv/gentleman_programming 🎮 YouTube: https://www.youtube.com/c/GentlemanProgramming VODS en canal secundario 🥵: https://www.youtube.com/channel/UCIscmdXDtypp2zTzEEYxJwg Kick: https://kick.com/gentleman-programming 📺 REDES Y COSITAS 🫦 ═══════════════