This paper introduces Tarsier, a family of large-scale video-language models (LVLMs) designed for fine-grained video description. Tarsier leverages the power of CLIP-ViT for visual encoding and a large language model (LLM) for temporal relationship modeling and text generation.
Paper: https://arxiv.org/pdf/2407.00634