Бенчмарк нейросетей по праву РФ
72 вопроса по двенадцати отраслям с эталонами, утверждёнными юристом. Задания закрыты: так результаты нельзя подогнать. Одиннадцать моделей уже прошли проверку; открыты методика, баллы и разбор на примерах.
Открытого набора вопросов по российскому праву с эталонными ответами мы не нашли: существующие рейтинги либо закрыты, либо разовые. Поэтому написали методику и набор сами. Задания мы не публикуем: иначе модели можно подогнать под известные ответы. Открыты методика, результаты и разбор на примерах.
Что здесь есть:
- результаты первого прогона одиннадцати моделей на всех 72 вопросах;
- методика версии 0.1 целиком: структура набора, эталон, балл, штрафы, правила независимости.
Как проверяем. Каждый вопрос задаётся в новом чате без истории, с настройками поставщика по умолчанию; рассуждение включается, если модель его поддерживает. Балл считается по методике ниже: нормы и практика — автоматически по эталону, вывод и порядок действий — модель-судья с перепроверкой юристом. Сами задания и эталоны не публикуются.
Как проверить свою модель. Напишите на info@lesto-ai.ru: модель или сервис и настройки. Мы прогоним закрытый набор у себя и добавим строку в таблицу с пометкой, чей прогон.
Оговорки версии 0.1. Один проверяющий юрист; один прогон на модель вместо трёх по методике; модели отвечали внутри Лесто, то есть с нашей правовой базой — прогон «голых» моделей будет отдельной строкой. Сравнивать эти цифры с чужими рейтингами напрямую нельзя.
Что дальше. Версия 1.0: второй, внешний юрист, три прогона, «голые» модели, обновление набора. Бенчмарк выходит под отдельным названием и не является рейтингом Лесто: наши модели в таблице — такие же строки, как остальные.
Результаты
72 вопроса, каждый в новом чате, один прогон на модель, внутри Лесто с правовой базой, без книг. Балл: вывод 40 + нормы 30 + практика 20 + порядок 10; грубая ошибка и отказ обнуляют вопрос; выдуманная ссылка — минус 10. Прогон 2026-09-17, судейство 2026-09-18. Вывод и порядок действий оценивала модель-судья по эталону; спорные оценки переданы проверяющему юристу.
| Модель | Балл / 100 | Закрытая часть | Первая треть (24) | Нормы, % | Практика, % | Выдумано | Нулей | Секунд |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.5 Flash | 69 | 73 | 61 | 89 | 56 | 0 | 8 | 53 |
| DeepSeek V4 Flash | 68 | 67 | 70 | 84 | 50 | 2 | 10 | 47 |
| ChatGPT 5 | 67 | 67 | 67 | 86 | 47 | 2 | 10 | 62 |
| DeepSeek V4 Pro | 60 | 57 | 65 | 78 | 27 | 0 | 12 | 47 |
| GPT-5.6 Terra | 57 | 57 | 56 | 88 | 36 | 0 | 17 | 29 |
| GPT-5.6 Luna | 52 | 52 | 54 | 76 | 40 | 0 | 18 | 28 |
| ChatGPT 5 mini | 47 | 44 | 52 | 77 | 43 | 7 | 25 | 52 |
| GPT-4.1 mini | 45 | 42 | 49 | 66 | 23 | 1 | 18 | 26 |
| GigaChat 2 Max | 44 | 40 | 51 | 56 | 15 | 0 | 16 | 18 |
| GigaChat 2 | 32 | 31 | 33 | 49 | 12 | 0 | 22 | 20 |
| Лесто Бета (mvp2) | 32 | 27 | 41 | 75 | 34 | 11 | 35 | 102 |
Вне зачёта: Gemini 3.1 Pro — у агрегатора модель не отвечала.
«Нулей» — вопросы с грубой ошибкой или отказом. Курсивом — собственная бета-модель Лесто: показываем как есть.
По отраслям
| Отрасль | Средний балл десяти моделей |
|---|---|
| Семейное право | 66 |
| Административные правонарушения | 65 |
| Наследование | 64 |
| Договоры и обязательства | 60 |
| Защита прав потребителей | 58 |
| Трудовое право | 58 |
| Земля и недвижимость | 57 |
| Налоги | 53 |
| Жилищное право и ЖКХ | 51 |
| Гражданский и арбитражный процесс | 43 |
| Банкротство граждан | 42 |
| Корпоративное право | 30 |
Методика
Редакция законов — на 17.09.2026. Документ для согласования с проверяющим юристом.
1. Зачем
Открытого набора вопросов по праву РФ с эталонными ответами сейчас нет. Существующие рейтинги либо закрыты (Lexometrica Ground Truth, 30 кейсов), либо разовые (10–12 вопросов). Бенчмарк нужен, чтобы:
- сравнивать модели и юридические сервисы на одних и тех же вопросах по понятной методике;
- видеть, сколько даёт правовая база по сравнению с «голой» моделью;
- ловить ухудшения после каждой правки поиска и базы.
2. Что проверяем
Ответ, на который юрист может опереться: правильный вывод, правильная норма, правильный пункт разъяснений высшего суда, без выдуманных ссылок и без опасных ошибок.
Не проверяем: стиль, длину, оформление, «дружелюбие». Длинный ответ не лучше короткого.
3. Структура набора v0.1
72 вопроса = 12 отраслей × 6 вопросов.
Отрасли: наследование; договоры и обязательства; трудовое право; земля и недвижимость; семейное право; защита прав потребителей; гражданский и арбитражный процесс; корпоративное право; административные правонарушения; налоги; жилищное право и ЖКХ; банкротство граждан.
Вопросы трёх уровней (в отрасли обычно 2 + 3 + 1, но точное число зависит от темы):
| Уровень | Что требуется | Всего в наборе |
|---|---|---|
| 1 | Найти одну норму и прочитать её правильно | 25 |
| 2 | Норма плюс разъяснение Пленума или исключение из правила | 35 |
| 3 | Несколько актов, коллизия, позиция КС или сложная фактура | 12 |
Типы вопросов:
- norma — что говорит закон;
- situaciya — применить норму к фактам клиента;
- srok — сроки, суммы, проценты;
- poryadok — процедура, кто и что делает;
- lovushka — в вопросе неверная посылка или есть исключение, которое модель должна заметить.
У каждого вопроса есть постоянный код (например, NAS-01) — он не меняется при правке текста.
4. Эталон
Для каждого вопроса юрист утверждает:
- Нормы — статьи, без которых ответ неполон.
- Практика — пункты постановлений Пленума ВС, решения КС, обзоры. Номер пункта обязателен, где он есть.
- Правильный вывод — два-четыре предложения, как ответил бы опытный юрист.
- Грубая ошибка — утверждение, за которое ответ получает ноль независимо от остального.
Статьи сверяются скриптом с правовой базой (есть ли статья в акте), пункты постановлений — по тексту. Смысл сверяет юрист.
5. Как считается балл
Каждый ответ получает от 0 до 100:
| Часть | Вес | Как проверяется |
|---|---|---|
| Вывод верен | 40 | Модель-судья сравнивает с эталонным выводом (верно / частично / неверно = 40 / 20 / 0); юрист выборочно перепроверяет не менее 20 % оценок и все спорные |
| Нормы названы | 30 | Автоматически: доля статей эталона, названных в ответе вместе с актом |
| Практика названа | 20 | Автоматически: доля постановлений и пунктов эталона; если практики в эталоне нет, вес уходит в «нормы» |
| Порядок действий | 10 | Судья: есть ли, что делать клиенту дальше (срок, куда обращаться, какие документы) |
Штрафы:
- Выдуманная ссылка (статьи нет в акте, пункта нет в постановлении) — минус 10 за каждую, не более минус 30.
- Грубая ошибка из эталона или ошибка, из-за которой клиент проиграет дело или пропустит срок, — балл вопроса 0.
- Отказ отвечать или ответ одними встречными вопросами при достаточных фактах — балл вопроса 0.
Итог модели — среднее по вопросам закрытой части (см. п. 7). Отдельно публикуются: средний балл по уровням, доля грубых ошибок, выдуманных ссылок на 100 ответов, медианное время и цена ответа.
6. Кто участвует
- Голые модели — без источников, одинаковая инструкция.
- Модели с правовой базой (Лесто) — отдельной строкой, чтобы была видна польза базы.
- Другие сервисы — только через собственную оплаченную учётку и в пределах их оферты.
Каждый вопрос задаётся в новом чате, без истории. Настройки — по умолчанию у поставщика; рассуждение включается, если модель его поддерживает. Три прогона, в таблицу идёт среднее и разброс.
7. Открытая и закрытая части
- Первая треть (24 вопроса — второй и пятый в каждой отрасли): прежде предполагалась открытой; с 02.10.2026 задания закрыты полностью, публикуются методика, результаты и разбор на примерах.
- Закрытая (48 вопросов): не публикуется, итоговый рейтинг считается по ней. Так модели и сервисы не смогут подогнать ответы под известные вопросы.
- Если балл модели на первой трети выше остальных больше чем на 10 пунктов — отмечаем возможную подгонку.
8. Актуальность
- У набора дата редакции законов. Эталоны пересматриваются раз в полгода и при изменении актов из эталона (сторож изменений базы).
- Изменённый вопрос получает новую версию; старые результаты не пересчитываются, а помечаются версией.
- Каждые полгода треть закрытой части заменяется новыми вопросами.
9. Согласование и независимость
- Вопрос попадает в набор, только когда проверяющий юрист отметил его «Подходит». «Поправить» — вопрос или эталон переписываются и идут на повторное согласование; «Не подходит» — вопрос заменяется.
- К версии 1.0 — второй, внешний юрист; вопрос принимается при согласии обоих, спор решает третий.
- Бенчмарк выпускается под отдельным названием, не как рейтинг Лесто. Код проверки открыт.
10. Источники и права
- Вопросы и эталоны пишутся самостоятельно.
- Используются только тексты нормативных актов и судебных решений — они не охраняются авторским правом (п. 6 ст. 1259 ГК).
- Не используются: учебники, комментарии, тесты ФПА, ответы с юридических форумов.
11. Что нужно от проверяющего юриста
По каждому из 72 вопросов:
- Подходит — вопрос жизненный, однозначный, эталон верен.
- Поправить — написать, как должен звучать вопрос или что неверно в эталоне (норма, пункт, вывод, грубая ошибка).
- Не подходит — коротко почему: неоднозначен, спорная практика, слишком редкий, дублирует другой.
Отдельно полезно: каких частых вопросов клиентов в наборе не хватает.
Материал подготовлен командой Лесто с использованием ИИ и не является юридической консультацией. Ссылки на нормы приведены по редакциям на дату публикации.