Любая оценка ИИ-сервиса стоит ровно столько, сколько стоит её методика. Эта страница описывает нашу — чтобы вы могли проверить выводы, а не поверить им.
Три источника цифр и что с каждым не так
1. Публичные бенчмарки
Стандартизованные наборы задач с автоматической проверкой. Их плюс — сопоставимость: все модели решают одно и то же. Минусы два, и оба серьёзные.
Насыщение. Старые наборы вроде MMLU современные модели решают почти идеально, и разница между ними уходит в шум: 89 против 90 процентов не значит ничего.
Утечка в обучение. Задачи бенчмарков лежат в открытом доступе и попадают в обучающие корпуса. Модель может «знать» ответ, а не выводить его.
2. Заявления провайдеров
Читаются как маркетинговый материал. Провайдер сам выбирает, какие тесты показать, в какой конфигурации запустить модель и с чем сравнить. Полезны как указание, на что модель затачивали.
3. Собственные замеры на своих задачах
Единственный источник, где нет ни насыщения, ни утечки, ни отбора в свою пользу. И единственный, который нельзя скопировать у соседа. Поэтому он у нас основной, а первые два идут фоном.
Что измеряют известные бенчмарки
| Бенчмарк | Что проверяет | Как читать |
|---|---|---|
| MMLU | Понимание языка и общие знания: около 15 000 вопросов с вариантами ответа из 57 дисциплин | Насыщен. Разница меньше двух пунктов между современными моделями не значима |
| GPQA | Вопросы уровня выпускника вуза, на которые нельзя быстро найти ответ поиском | Ещё различает сильные модели, но и он постепенно насыщается |
| HumanEval | Генерация кода: 164 задачи на Python с автопроверкой, метрика pass@1 | Проверяет короткие изолированные функции, а не работу в реальной кодовой базе |
| GSM8K | Текстовые задачи по математике школьного уровня с пошаговым решением | Практически насыщен современными моделями |
| MATH | Университетская математика: алгебра, вероятность, статистика | Разделяет модели лучше, чем GSM8K |
| Сводные индексы | Интеллект, код, агентность — агрегаты из десятков тестов | Удобны для первого отбора. Порядок моделей в разных индексах не совпадает — смотрите тот, который отвечает вашей задаче |
Что меряем мы сами
У 5на5 есть собственные ИИ-функции, через которые проходят реальные пользовательские файлы: резюме из PDF, конспект видео, генерация технических описаний. Это и есть наш стенд — задачи, на которых мы можем сравнивать модели честно, потому что задачи наши, а не из общего набора.
По каждой задаче фиксируем:
- Стоимость решения. Не цена за миллион токенов из прайса, а сколько стоит довести конкретную задачу до приемлемого результата — с учётом того, что слабой модели чаще нужен второй заход.
- Время до ответа. Медиана и худшие десять процентов: средняя скрывает как раз те случаи, из-за которых пользователь уходит.
- Долю ответов, требующих переделки. Оценивается по фиксированной рубрике, а не «на глаз».
- Устойчивость к плохому входу. Скан вместо текста, смесь языков, таблица вместо абзацев — то, что реально приходит от пользователей.
Правила, которых придерживаемся
- У каждой цифры — дата проверки. Модели обновляют без смены названия; цифра без даты недостоверна по умолчанию.
- Веса объявляются до подсчёта, а не подбираются под желаемый результат.
- Одна цифра не решает. Общий индекс, индекс по коду и цена дают разный порядок моделей — публикуем все три, а не удобную.
- Referencная конфигурация вместо «от». Сравниваем тарифы на одинаковом сценарии использования, а не по минимальной цене входа.
- Отрицательный результат публикуется. Если модель, которую мы хвалили, проиграла в новом замере — пишем об этом и меняем вывод.
Чего эта методика не даёт
Она не отвечает на вопрос «какая модель лучше вообще» — такого вопроса не существует. Она отвечает на вопрос «какая модель лучше на задачах вроде наших при таком бюджете», и переносить вывод на свою задачу надо с оглядкой. Если ваши задачи не похожи на суммаризацию и извлечение — берите методику, а не выводы.
Частые вопросы
Почему рейтинги моделей у всех разные?
Потому что разные наборы задач и разные веса. Модель, выигрывающая по общему индексу, может проигрывать по программированию и наоборот. Рейтинг без опубликованной методики нельзя ни проверить, ни воспроизвести — и доверять ему не стоит.
Можно ли верить цифрам самих разработчиков моделей?
Их стоит читать как заявку, а не как результат. Провайдер выбирает, какие бенчмарки показать и в какой конфигурации запустить модель. Это не обязательно обман, но это всегда витрина.
Почему у каждой цифры дата?
Потому что модели обновляют без смены названия, а тарифы меняют несколько раз в год. Цифра без даты через полгода становится дезинформацией — независимо от того, была ли она верна в момент публикации.