AIKraft/Методология

Методология рейтингов

Как мы собираем данные, считаем баллы и почему одним цифрам можно доверять больше, чем другим. Эта страница — основа доверия ко всем рейтингам AIKraft.

Обновлено 18.05.2026 · версия методологии 1.3

Базовые принципы

AIKraft — независимый ресурс. Мы не берём плату за место в рейтинге и не двигаем модели вверх по запросу вендоров. Любой балл должен быть воспроизводим: если мы не можем сослаться на источник или повторить замер, значение помечается как предварительное.

  • Открытость источников. У каждой метрики указано, откуда взято значение и когда сверено.
  • Разделение факта и оценки. Замеры бенчмарков отделены от нашего редакторского мнения.
  • RU-контекст. Отдельно проверяем доступность из России, способы оплаты и качество на русском языке.

Как считается AIKraft Index

AIKraft Index — взвешенная композиция нормированных результатов модели по пяти направлениям. Каждый результат приводится к шкале 0–100, затем складывается с весом направления:

НаправлениеВесБазовые метрики
Знания25%MMLU-Pro, GPQA (knowledge subset)
Рассуждения25%GPQA-Diamond, ARC-AGI, логические задачи
Кодинг20%SWE-bench Verified, LiveCodeBench
Математика15%AIME, MATH-500
Русский язык15%MERA, собственный RU-набор AIKraft

Нормировка — относительно лучшей и худшей модели в актуальной выборке, поэтому Index показывает положение модели относительно поля, а не абсолютную «правду». При смене состава выборки баллы могут сдвинуться даже без нового релиза.

Тематические рейтинги (например «Лучшие для русского» или «Самые дешёвые») используют свою главную метрику, а не общий Index — её формула указана на странице каждого рейтинга.

Источники и частота сверки

Мы агрегируем данные из нескольких типов источников и обновляем их с разной частотой — то, что меняется чаще, и сверяется чаще:

МетрикаИсточникКак проверяемЧастота
Баллы бенчмарковОфициальные model cards, публичные лидерборды (LMArena, open evals)Сверяем минимум 2 независимых источника; спорные — перепроверяем самиеженедельно
Цена APIПрайс-листы вендоров и прокси-провайдеровПарсинг + ручная проверка курса ₽ на дату сверкиежедневно
Скорость (t/s)Собственные замеры + данные провайдеровУсреднение по серии запросов на стандартном промптееженедельно
Доступность из РФПроверка провайдеров, способов оплатыРучная проверка редакциейпо изменениям
Русский языкMERA + внутренний набор AIKraftПрогон на фиксированном наборе задачпри релизе модели
Состав каталогаАнонсы вендоров, релизыДобавляем после подтверждённого публичного доступапо мере релизов

Бейджи: verified и provisional

Рядом со значениями в рейтингах стоит бейдж достоверности. Он показывает, насколько мы уверены в конкретной цифре:

verified

Значение подтверждено двумя независимыми источниками или воспроизведено нами. На таком бейдже можно строить решения.

provisional

Предварительное значение: один источник или заявление вендора, которое мы ещё не перепроверили. Может измениться после сверки.

Дисклеймер. Provisional-значения приведены для ориентира и не являются окончательными. Бенчмарки измеряют узкие задачи и не гарантируют качество на вашем сценарии — перед внедрением проверяйте модель на собственных данных.

Ошибки и правки

Нашли расхождение с первоисточником? Напишите нам — мы проверим и поправим, а в спорных случаях оставим пометку о разнице источников. Контакты на странице контактов.

Методология рейтингов | AIKraft