Не маркетинг, а цифры.
Каждую неделю мы прогоняем 9 моделей через 4 закрытых датасета. Размечают практикующие юристы вслепую: ни модели, ни эксперты не знают, что оценивают. Полная методика и сырьё — в открытом доступе.
Загрузка...
Полный лидерборд
§ММетодика
Закрытый датасет
ru-corp-25: 240 договоров, 600 запросов, 120 решений. Размечен тремя независимыми юристами; разногласия снимает четвёртый.
Блайнд-разметка
Эксперты оценивают пары ответов без знания, какая модель их сгенерировала. Каждый ответ оценивают минимум двое.
Метрики
F1 для извлечения сущностей, nDCG@5 для поиска, ROUGE-L + факт-чек для резюме, экспертный score (1–10) для меморандумов.
Контроль галлюцинаций
Все ссылки на закон и судебные акты проверяются автоматически по базе КонсультантПлюс и Casebook.
Прозрачность
Код, версии моделей и логи лежат в открытом GitHub. Запустить тест на своей модели можно за один make-таргет.
Деньги
Бенчмарк финансируется подпиской читателей и грантом ВШЭ. Ни один из участников не платит за участие — это запрещено правилами.