О проекте

Как строится рейтинг

HA! — открытый бенчмарк юмора для ИИ. В каждом задании человек вслепую оценивает четыре ответа, после чего мы получаем их строгий порядок. Исходные оценки сохраняются отдельно от расчётов, поэтому методику можно проверять и пересчитывать без потери данных.

Что именно видит участник

Показываются четыре ответа: три ответа ИИ и один ответ человека, если для задания есть подходящий человеческий ответ; иначе — четыре ответа ИИ. Каждый ответ сразу оценивается одним из четырёх вариантов: «Не смешно», «Слабовато», «Улыбнуло» или «Смешно». Разные оценки автоматически задают порядок; дополнительно сравнить нужно только ответы с одинаковой оценкой. Авторов и модели раскрываем после полного ранжирования. Пропуск и «ничего не смешно» сохраняются как отдельные сигналы, но не создают выдуманный порядок между моделями. Повторное прохождение сохраняется только для исследования и второй раз в рейтинг не входит.

Как из четырёх мест получаются сравнения

Итогом остаётся строгий порядок всех четырёх ответов. Из него берём каждую пару ответов моделей: модель выше получает победу над моделью ниже. Первичные оценки «Не смешно» — «Смешно» сохраняются для отдельного анализа, но напрямую не входят в официальный рейтинг. Человеческий ответ не влияет на взаимный порядок моделей и не меняет рейтинг ИИ. Поэтому при четырёх моделях одно ранжирование даёт 6 наблюдений, а при трёх моделях и одном человеке — 3.

Формула рейтинга ИИ

Используется модель Брэдли—Терри. Для положительных сил sᵢ и sⱼ вероятность P(i > j) = sᵢ / (sᵢ + sⱼ). На каждой итерации считаем sᵢ = max(10⁻⁹, wᵢ / Σⱼ[nᵢⱼ/(sᵢ+sⱼ)]), где wᵢ — победы модели, а nᵢⱼ — число её сравнений с j; затем нормируем силы до геометрического среднего 1. Расчёт останавливается, когда максимальное изменение log(s) меньше 10⁻⁴, но не позднее 200 итераций. Публикуемый балл: Rᵢ = 1200 + 400 · log₁₀(sᵢ).

Неопределённость и публикация

95% интервал получаем двухсторонним кластерным bootstrap: независимо перевыбираем участников и задания, затем пересчитываем рейтинг. Доля побед дополнительно имеет 95% интервал Уилсона. Рейтинг публикуется, когда каждая модель текущего пула набрала не менее 50 сравнений, и помечается предварительным до 200 сравнений модели.

Адаптивная швейцарская выборка

Группы моделей выбираются вероятностно по весу W = 0,40C + 0,25P + 0,20E + 0,15U. Здесь C — среднее 1/(1+nᵢⱼ) для числа прежних сравнений пары, P — среднее 1/(1+|Rᵢ−Rⱼ|/100), E — среднее 1/(1+aᵢ) для числа показов модели, U — нормированная ширина интервала. Вероятность группы равна W/ΣW; задания выбираются с весом 1/(1+число показов), а четыре позиции перемешиваются равновероятно с вероятностью конкретного порядка 1/24. Версия алгоритма, допустимый набор, веса и вероятность сохраняются для каждого показа.

Два независимых рейтинга

Обычный рейтинг 16+ и рейтинг без цензуры 18+ используют один и тот же зафиксированный состав моделей, но разные задания, наблюдения и снимки рейтинга. Результаты двух режимов никогда не смешиваются. Пока активен только русский язык; следующие языки будут отдельными исследованиями.

Как считается личный балл автора

Ответ человека оценивается один раз после первых 10 допустимых ранжирований от разных участников. Он стартует с 1200. Для каждого сравнения с моделью ожидаемая победа равна e = 1/(1+10^((Rмодели−Rавтора)/400)); фактический результат o равен 1 за победу и 0 за поражение. Для ответа берём средние O и E и начисляем Δ = max(−10, min(10, 10·(O−E))). Обычный и 18+ баллы автора считаются отдельно. Публичный рейтинг людей пока закрыт.

Какие голоса учитываются

Все первичные допустимые голоса учитываются одинаково. Мы сохраняем псевдоним участника, время, задание, полный состав и порядок карточек, четыре первичные оценки и порядок их выставления, итоговый порядок, действия, режим, вероятность выборки и версию алгоритма, чтобы анализ можно было воспроизвести. Технические и повторные наблюдения не удаляются, а получают отдельную пригодность для исследования.

Ограничения методики

Юмор субъективен и зависит от языка, культуры и контекста. Участники приходят добровольно, поэтому самоотбор аудитории может влиять на результат. Адаптивная выборка улучшает покрытие пар, но не превращает рейтинг в абсолютную меру смешного; баллы и интервалы описывают только собранные ответы в текущем русском исследовании.