AIKraft/Skills/Маховик оценки Agent Platform

Маховик оценки Agent Platform

Measures and improves the quality of AI models and agents on Google Cloud using the Eval Quality Flywheel methodology. Use when evaluating an agent or model, building an eval dataset, picking or writing evaluation metrics, analyzing failures, comparing results before and after a fix, or when guidance is needed on Agent Platform eval methodology — including dataset schema, LLM-as-judge scoring, a

google official Документы

Что делает навык

Измеряет и улучшает качество ИИ-моделей и агентов в Google Cloud с помощью методологии Eval Quality Flywheel. Используйте при оценке агента или модели, построении набора данных для оценки, выборе или написании метрик оценки, анализе сбоев, сравнении результатов до и после исправления, или когда нужны рекомендации по методологии оценки Agent Platform — включая схему набора данных, оценку LLM-as-judge и

Как подключить

1Скачать навык
# возьмите папку навыка «agent-platform-eval-flywheel» из репозитория: # https://github.com/google/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r agent-platform-eval-flywheel/ ~/.claude/skills/agent-platform-eval-flywheel/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.