High-throughput, resume-safe vision and video embedding pipelines for VLM datasets—26 pinned encoders, streaming Hugging Face ingestion, and Safetensors shard commits.
computer-vision deep-learning cuda transformers pytorch feature-extraction clip multimodal huggingface safetensors vision-language-model dinov2 qwen siglip dataset-processing vjepa video-embeddings vision-embeddings
-
Updated
Aug 9, 2026 - Python