Войти Попробовать бесплатно
Блог · Бенчмарк · версия 0.1 · 20 сентября 2026

Бенчмарк нейросетей по праву РФ

72 вопроса по двенадцати отраслям с эталонами, утверждёнными юристом. Задания закрыты: так результаты нельзя подогнать. Одиннадцать моделей уже прошли проверку; открыты методика, баллы и разбор на примерах.

72вопроса, 12 отраслей
3уровня сложности
10моделей в зачёте
69лучший балл из 100

Открытого набора вопросов по российскому праву с эталонными ответами мы не нашли: существующие рейтинги либо закрыты, либо разовые. Поэтому написали методику и набор сами. Задания мы не публикуем: иначе модели можно подогнать под известные ответы. Открыты методика, результаты и разбор на примерах.

Что здесь есть:

  • результаты первого прогона одиннадцати моделей на всех 72 вопросах;
  • методика версии 0.1 целиком: структура набора, эталон, балл, штрафы, правила независимости.

Как проверяем. Каждый вопрос задаётся в новом чате без истории, с настройками поставщика по умолчанию; рассуждение включается, если модель его поддерживает. Балл считается по методике ниже: нормы и практика — автоматически по эталону, вывод и порядок действий — модель-судья с перепроверкой юристом. Сами задания и эталоны не публикуются.

Как проверить свою модель. Напишите на info@lesto-ai.ru: модель или сервис и настройки. Мы прогоним закрытый набор у себя и добавим строку в таблицу с пометкой, чей прогон.

Оговорки версии 0.1. Один проверяющий юрист; один прогон на модель вместо трёх по методике; модели отвечали внутри Лесто, то есть с нашей правовой базой — прогон «голых» моделей будет отдельной строкой. Сравнивать эти цифры с чужими рейтингами напрямую нельзя.

Что дальше. Версия 1.0: второй, внешний юрист, три прогона, «голые» модели, обновление набора. Бенчмарк выходит под отдельным названием и не является рейтингом Лесто: наши модели в таблице — такие же строки, как остальные.

Результаты

72 вопроса, каждый в новом чате, один прогон на модель, внутри Лесто с правовой базой, без книг. Балл: вывод 40 + нормы 30 + практика 20 + порядок 10; грубая ошибка и отказ обнуляют вопрос; выдуманная ссылка — минус 10. Прогон 2026-09-17, судейство 2026-09-18. Вывод и порядок действий оценивала модель-судья по эталону; спорные оценки переданы проверяющему юристу.

МодельБалл / 100Закрытая частьПервая треть (24)Нормы, %Практика, %ВыдуманоНулейСекунд
Gemini 3.5 Flash69736189560853
DeepSeek V4 Flash686770845021047
ChatGPT 5676767864721062
DeepSeek V4 Pro605765782701247
GPT-5.6 Terra575756883601729
GPT-5.6 Luna525254764001828
ChatGPT 5 mini474452774372552
GPT-4.1 mini454249662311826
GigaChat 2 Max444051561501618
GigaChat 2323133491202220
Лесто Бета (mvp2)32274175341135102

Вне зачёта: Gemini 3.1 Pro — у агрегатора модель не отвечала.

«Нулей» — вопросы с грубой ошибкой или отказом. Курсивом — собственная бета-модель Лесто: показываем как есть.

Балл из ста по моделям: три модели у отметки 67–69, дальше ступеньками вниз; бледным — своя бета.
Балл из ста по моделям: три модели у отметки 67–69, дальше ступеньками вниз; бледным — своя бета.
Нормы называют почти все, пункт практики — меньше половины: главный разрыв бенчмарка.
Нормы называют почти все, пункт практики — меньше половины: главный разрыв бенчмарка.

По отраслям

ОтрасльСредний балл десяти моделей
Семейное право66
Административные правонарушения65
Наследование64
Договоры и обязательства60
Защита прав потребителей58
Трудовое право58
Земля и недвижимость57
Налоги53
Жилищное право и ЖКХ51
Гражданский и арбитражный процесс43
Банкротство граждан42
Корпоративное право30
Средний балл десяти моделей по отраслям: семейное право вдвое выше корпоративного.
Средний балл десяти моделей по отраслям: семейное право вдвое выше корпоративного.

Методика

Три уровня сложности и две части набора.
Три уровня сложности и две части набора.
Из чего складывается балл из 100: вывод 40, нормы 30, практика 20, порядок действий 10.
Из чего складывается балл из 100: вывод 40, нормы 30, практика 20, порядок действий 10.

Редакция законов — на 17.09.2026. Документ для согласования с проверяющим юристом.

1. Зачем

Открытого набора вопросов по праву РФ с эталонными ответами сейчас нет. Существующие рейтинги либо закрыты (Lexometrica Ground Truth, 30 кейсов), либо разовые (10–12 вопросов). Бенчмарк нужен, чтобы:

  • сравнивать модели и юридические сервисы на одних и тех же вопросах по понятной методике;
  • видеть, сколько даёт правовая база по сравнению с «голой» моделью;
  • ловить ухудшения после каждой правки поиска и базы.

2. Что проверяем

Ответ, на который юрист может опереться: правильный вывод, правильная норма, правильный пункт разъяснений высшего суда, без выдуманных ссылок и без опасных ошибок.

Не проверяем: стиль, длину, оформление, «дружелюбие». Длинный ответ не лучше короткого.

3. Структура набора v0.1

72 вопроса = 12 отраслей × 6 вопросов.

Отрасли: наследование; договоры и обязательства; трудовое право; земля и недвижимость; семейное право; защита прав потребителей; гражданский и арбитражный процесс; корпоративное право; административные правонарушения; налоги; жилищное право и ЖКХ; банкротство граждан.

Вопросы трёх уровней (в отрасли обычно 2 + 3 + 1, но точное число зависит от темы):

УровеньЧто требуетсяВсего в наборе
1Найти одну норму и прочитать её правильно25
2Норма плюс разъяснение Пленума или исключение из правила35
3Несколько актов, коллизия, позиция КС или сложная фактура12

Типы вопросов:

  • norma — что говорит закон;
  • situaciya — применить норму к фактам клиента;
  • srok — сроки, суммы, проценты;
  • poryadok — процедура, кто и что делает;
  • lovushka — в вопросе неверная посылка или есть исключение, которое модель должна заметить.

У каждого вопроса есть постоянный код (например, NAS-01) — он не меняется при правке текста.

4. Эталон

Для каждого вопроса юрист утверждает:

  1. Нормы — статьи, без которых ответ неполон.
  2. Практика — пункты постановлений Пленума ВС, решения КС, обзоры. Номер пункта обязателен, где он есть.
  3. Правильный вывод — два-четыре предложения, как ответил бы опытный юрист.
  4. Грубая ошибка — утверждение, за которое ответ получает ноль независимо от остального.

Статьи сверяются скриптом с правовой базой (есть ли статья в акте), пункты постановлений — по тексту. Смысл сверяет юрист.

5. Как считается балл

Каждый ответ получает от 0 до 100:

ЧастьВесКак проверяется
Вывод верен40Модель-судья сравнивает с эталонным выводом (верно / частично / неверно = 40 / 20 / 0); юрист выборочно перепроверяет не менее 20 % оценок и все спорные
Нормы названы30Автоматически: доля статей эталона, названных в ответе вместе с актом
Практика названа20Автоматически: доля постановлений и пунктов эталона; если практики в эталоне нет, вес уходит в «нормы»
Порядок действий10Судья: есть ли, что делать клиенту дальше (срок, куда обращаться, какие документы)

Штрафы:

  • Выдуманная ссылка (статьи нет в акте, пункта нет в постановлении) — минус 10 за каждую, не более минус 30.
  • Грубая ошибка из эталона или ошибка, из-за которой клиент проиграет дело или пропустит срок, — балл вопроса 0.
  • Отказ отвечать или ответ одними встречными вопросами при достаточных фактах — балл вопроса 0.

Итог модели — среднее по вопросам закрытой части (см. п. 7). Отдельно публикуются: средний балл по уровням, доля грубых ошибок, выдуманных ссылок на 100 ответов, медианное время и цена ответа.

6. Кто участвует

  • Голые модели — без источников, одинаковая инструкция.
  • Модели с правовой базой (Лесто) — отдельной строкой, чтобы была видна польза базы.
  • Другие сервисы — только через собственную оплаченную учётку и в пределах их оферты.

Каждый вопрос задаётся в новом чате, без истории. Настройки — по умолчанию у поставщика; рассуждение включается, если модель его поддерживает. Три прогона, в таблицу идёт среднее и разброс.

7. Открытая и закрытая части

  • Первая треть (24 вопроса — второй и пятый в каждой отрасли): прежде предполагалась открытой; с 02.10.2026 задания закрыты полностью, публикуются методика, результаты и разбор на примерах.
  • Закрытая (48 вопросов): не публикуется, итоговый рейтинг считается по ней. Так модели и сервисы не смогут подогнать ответы под известные вопросы.
  • Если балл модели на первой трети выше остальных больше чем на 10 пунктов — отмечаем возможную подгонку.

8. Актуальность

  • У набора дата редакции законов. Эталоны пересматриваются раз в полгода и при изменении актов из эталона (сторож изменений базы).
  • Изменённый вопрос получает новую версию; старые результаты не пересчитываются, а помечаются версией.
  • Каждые полгода треть закрытой части заменяется новыми вопросами.

9. Согласование и независимость

  • Вопрос попадает в набор, только когда проверяющий юрист отметил его «Подходит». «Поправить» — вопрос или эталон переписываются и идут на повторное согласование; «Не подходит» — вопрос заменяется.
  • К версии 1.0 — второй, внешний юрист; вопрос принимается при согласии обоих, спор решает третий.
  • Бенчмарк выпускается под отдельным названием, не как рейтинг Лесто. Код проверки открыт.

10. Источники и права

  • Вопросы и эталоны пишутся самостоятельно.
  • Используются только тексты нормативных актов и судебных решений — они не охраняются авторским правом (п. 6 ст. 1259 ГК).
  • Не используются: учебники, комментарии, тесты ФПА, ответы с юридических форумов.

11. Что нужно от проверяющего юриста

По каждому из 72 вопросов:

  1. Подходит — вопрос жизненный, однозначный, эталон верен.
  2. Поправить — написать, как должен звучать вопрос или что неверно в эталоне (норма, пункт, вывод, грубая ошибка).
  3. Не подходит — коротко почему: неоднозначен, спорная практика, слишком редкий, дублирует другой.

Отдельно полезно: каких частых вопросов клиентов в наборе не хватает.

Материал подготовлен командой Лесто с использованием ИИ и не является юридической консультацией. Ссылки на нормы приведены по редакциям на дату публикации.

Попробовать ЛестоТри дня бесплатно, без карты: чат со ссылками на нормы и практику. С тарифа «Базовый» — агенты, которые доводят задачу до документа.
Попробовать бесплатноЧто умеют агенты