llm-evaluation
Реализуйте комплексные стратегии оценки для приложений LLM с использованием автоматических метрик, обратной связи от людей и бенчмаркинга. Используйте при тестировании производительности LLM, измерении качества AI-приложений или создании фреймворков оценки.
AIwshobson
official
Разработка
Что делает навык
Реализуйте комплексные стратегии оценки для приложений LLM с использованием автоматических метрик, обратной связи от людей и бенчмаркинга. Используйте при тестировании производительности LLM, измерении качества AI-приложений или создании фреймворков оценки.
Как подключить
1Скачать навык
# возьмите папку навыка «llm-evaluation» из репозитория:
# https://github.com/wshobson/agents
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r llm-evaluation/ ~/.claude/skills/llm-evaluation/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.