Objetivo de aprendizaje: Trabajar con imagen, audio y video, y con generación: visión moderna (ViT), diffusion models y modelos multimodales (visión+lenguaje).