ZooWork
ZooWork Market · Skill

ai-multimodal

Process and generate multimedia content using the Google Gemini API. Capabilities include analyzing audio files (transcription with timestamps, summarization, speech understanding, music/sound analysis up to 9.5 hours), understanding images (captioning, object detection, OCR, visual Q&A, segmentation), processing videos (scene detection, Q&A, temporal analysis, YouTube URL support, up to 6 hours), extracting from documents (PDF tables, forms, charts, diagrams, multi-page), and generating images (text-to-image, editing, composition, refinement). Use when working with audio/video files, analyzing images or screenshots, processing PDF documents, extracting structured data from media, creating images from text prompts, or implementing multimodal AI features. Supports multiple models (Gemini 2.5/2.0) with context windows up to 2M tokens.

ihatesea69
ihatesea69-kiro-kit-ai-multimodal · v1.0.7
分类ai-llms
安装次数12
更新时间2026-08-21T05:13:03.072Z
校验状态待验证