Large Multimodal Models Are The Future - Text/Vision/Audio in LLMs

Опубликовано: 15 Июль 2026
на канале: Adam Lucek
3,824
147

Vision and auditory capabilities in language models bring AI one step closer to human cognitive capabilities in a digital world

Code & Notebook: https://github.com/ALucek/multimodal-...

Chapters:
00:00 - Multimodal Understanding
02:34 - Image: Introduction
04:01 - Image: Vision Transformer
06:37 - Image: CLIP
09:36 - Image: Flamingo
13:32 - Image: BLIP-2
16:43 - Image: Modern Techniques
17:39 - Image: Example
19:02 - Video: Introduction
20:48 - Video: TimeSFormer
22:31 - Video: VideoMAE
23:35 - Video: InternVideo2
26:01 - Video: Apollo
27:39 - Video: Example
30:07 - Audio: Introduction
31:34 - Audio: Speech Aside
32:48 - Audio: Audio Spectrogram Transformer
35:06 - Audio: Audio Flamingo
36:28 - Audio: GAMA
37:17 - Audio: Example
38:33 - Large Multimodal Models

#ai #coding #datascience