AIKraft/Skills/TAO генерация grounding изображений

TAO генерация grounding изображений

Two-step image grounding pipeline: extracts referring expressions from (image, caption) pairs and grounds them to pixel-space bounding boxes via a VLM. Use when the user wants to ground captions to bboxes, generate phrase-grounded annotations, auto-label images for grounding, or run the image_grounding pipeline. Triggers include 'image grounding', 'phrase grounding', 'ground captions', 'auto-label

nvidia official Дизайн

Что делает навык

Двухэтапный конвейер image grounding: извлекает referring-выражения из пар (изображение, подпись) и привязывает их к пиксельным bounding box через VLM. Используйте, когда пользователь хочет привязать подписи к bbox, сгенерировать аннотации с grounding по фразам, автоматически разметить изображения для grounding или запустить конвейер image_grounding. Триггеры включают 'image grounding', 'phrase grounding', 'ground captions', 'auto-label

Как подключить

1Скачать навык
# возьмите папку навыка «tao-generate-image-grounding» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r tao-generate-image-grounding/ ~/.claude/skills/tao-generate-image-grounding/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.