ZooWork Market · Skill
llava
Large language-and-vision assistant. Enables visual instruction tuning and image-based conversations by combining a CLIP vision encoder with Vicuna/LLaMA language models. Supports multi-turn image chat, visual question answering, and instruction following. Use for vision-language chatbots or image-understanding tasks. Best suited for conversational image analysis.