Методика

Как мы тестируем ИИ-сервисы

Открытая методика: что измеряют публичные бенчмарки, где они врут и какие собственные замеры мы кладём в основу оценок.

Любая оценка ИИ-сервиса стоит ровно столько, сколько стоит её методика. Эта страница описывает нашу — чтобы вы могли проверить выводы, а не поверить им.

Три источника цифр и что с каждым не так

1. Публичные бенчмарки

Стандартизованные наборы задач с автоматической проверкой. Их плюс — сопоставимость: все модели решают одно и то же. Минусы два, и оба серьёзные.

Насыщение. Старые наборы вроде MMLU современные модели решают почти идеально, и разница между ними уходит в шум: 89 против 90 процентов не значит ничего.

Утечка в обучение. Задачи бенчмарков лежат в открытом доступе и попадают в обучающие корпуса. Модель может «знать» ответ, а не выводить его.

2. Заявления провайдеров

Читаются как маркетинговый материал. Провайдер сам выбирает, какие тесты показать, в какой конфигурации запустить модель и с чем сравнить. Полезны как указание, на что модель затачивали.

3. Собственные замеры на своих задачах

Единственный источник, где нет ни насыщения, ни утечки, ни отбора в свою пользу. И единственный, который нельзя скопировать у соседа. Поэтому он у нас основной, а первые два идут фоном.

Что измеряют известные бенчмарки

БенчмаркЧто проверяетКак читать
MMLUПонимание языка и общие знания: около 15 000 вопросов с вариантами ответа из 57 дисциплинНасыщен. Разница меньше двух пунктов между современными моделями не значима
GPQAВопросы уровня выпускника вуза, на которые нельзя быстро найти ответ поискомЕщё различает сильные модели, но и он постепенно насыщается
HumanEvalГенерация кода: 164 задачи на Python с автопроверкой, метрика pass@1Проверяет короткие изолированные функции, а не работу в реальной кодовой базе
GSM8KТекстовые задачи по математике школьного уровня с пошаговым решениемПрактически насыщен современными моделями
MATHУниверситетская математика: алгебра, вероятность, статистикаРазделяет модели лучше, чем GSM8K
Сводные индексыИнтеллект, код, агентность — агрегаты из десятков тестовУдобны для первого отбора. Порядок моделей в разных индексах не совпадает — смотрите тот, который отвечает вашей задаче

Что меряем мы сами

У 5на5 есть собственные ИИ-функции, через которые проходят реальные пользовательские файлы: резюме из PDF, конспект видео, генерация технических описаний. Это и есть наш стенд — задачи, на которых мы можем сравнивать модели честно, потому что задачи наши, а не из общего набора.

По каждой задаче фиксируем:

  • Стоимость решения. Не цена за миллион токенов из прайса, а сколько стоит довести конкретную задачу до приемлемого результата — с учётом того, что слабой модели чаще нужен второй заход.
  • Время до ответа. Медиана и худшие десять процентов: средняя скрывает как раз те случаи, из-за которых пользователь уходит.
  • Долю ответов, требующих переделки. Оценивается по фиксированной рубрике, а не «на глаз».
  • Устойчивость к плохому входу. Скан вместо текста, смесь языков, таблица вместо абзацев — то, что реально приходит от пользователей.

Правила, которых придерживаемся

  1. У каждой цифры — дата проверки. Модели обновляют без смены названия; цифра без даты недостоверна по умолчанию.
  2. Веса объявляются до подсчёта, а не подбираются под желаемый результат.
  3. Одна цифра не решает. Общий индекс, индекс по коду и цена дают разный порядок моделей — публикуем все три, а не удобную.
  4. Referencная конфигурация вместо «от». Сравниваем тарифы на одинаковом сценарии использования, а не по минимальной цене входа.
  5. Отрицательный результат публикуется. Если модель, которую мы хвалили, проиграла в новом замере — пишем об этом и меняем вывод.

Чего эта методика не даёт

Она не отвечает на вопрос «какая модель лучше вообще» — такого вопроса не существует. Она отвечает на вопрос «какая модель лучше на задачах вроде наших при таком бюджете», и переносить вывод на свою задачу надо с оглядкой. Если ваши задачи не похожи на суммаризацию и извлечение — берите методику, а не выводы.

Частые вопросы

Почему рейтинги моделей у всех разные?

Потому что разные наборы задач и разные веса. Модель, выигрывающая по общему индексу, может проигрывать по программированию и наоборот. Рейтинг без опубликованной методики нельзя ни проверить, ни воспроизвести — и доверять ему не стоит.

Можно ли верить цифрам самих разработчиков моделей?

Их стоит читать как заявку, а не как результат. Провайдер выбирает, какие бенчмарки показать и в какой конфигурации запустить модель. Это не обязательно обман, но это всегда витрина.

Почему у каждой цифры дата?

Потому что модели обновляют без смены названия, а тарифы меняют несколько раз в год. Цифра без даты через полгода становится дезинформацией — независимо от того, была ли она верна в момент публикации.