Оценка юридической логики LLM.

Lexometrica Ground Truth - независимый рейтинг LLM, построенный на основе закрытого эталонного датасета из 30 сложных кейсов российской судебной практики. Фокус рейтинга смещен со слепого запоминания на тестирование "правового интеллекта" в логике IRAC (Issue, Rule, Application, Conclusion): мы оцениваем способность моделей выявлять скрытые проблемы (issue-spotting), применять релевантные нормы к фактам (rule-application) и делать точные выводы. Рейтинг жестко оценивает корректность итогового решения по экспертной рубрике, наличие ссылок на законодательство РФ и устойчивость к Safety Paradox (избыточным отказам отвечать на легитимные правовые запросы)

lexometrica-legal-ru-v1 / March 2026

Текущий рейтинг

Primary Score отражает базовое качество юридического рассуждения. Composite Score служит финальной метрикой ранжирования, штрафуя модели за ложные отказы (Safety Paradox) и поощряя структурную точность юридических цитат.

РангПровайдерМодельPrimary ScoreSafety ParadoxCitations OKComposite Score
1OpenAIGPT-5.4 Pro0.900%100%0.90
2AnthropicClaude Opus 4.60.850%100%0.85
3GoogleGemini 3.1 Pro0.630%87%0.62
4AlibabaQwen3.5 Plus 02-150.600%100%0.60
5Z.aiGLM 50.570%97%0.57
6MoonshotAIKimi K2.50.460%100%0.46
7DeepSeekDeepSeek V3.20.430%100%0.43
8SberGigaChat 2 Max0.410%90%0.40
9MiniMaxMiniMax M2.50.360%100%0.36
10YandexYandexGPT Pro 5.10.237%87%0.23

Рейтинг по когнитивному вектору

Задачи рейтинга были распределены по когнитивным векторам IRAC — каждая задача относилась к одному измерению. Разбивка: применение норм (привязка релевантных норм к фактам дела), воспроизведение норм (правильное цитирование), вывод (корректность итогового решения), выявление проблемы (поиск скрытых правовых вопросов) и интерпретация (толкование норм).

МодельПрименение нормВоспроизведение нормВыводВыявление проблемыИнтерпретация
GPT-5.4 Pro0.801.000.981.000.75
Claude Opus 4.60.741.000.980.850.90
Gemini 3.1 Pro0.620.990.470.590.55
Qwen3.5 Plus 02-150.620.250.850.481.00
GLM 50.470.750.610.580.90
Kimi K2.50.420.300.750.430.00
DeepSeek V3.20.380.380.620.370.50
GigaChat 2 Max0.450.330.420.400.20
MiniMax M2.50.420.170.330.360.60
YandexGPT Pro 5.10.220.450.170.130.60

Как рассчитываются и взвешиваются оценки.

Primary Score

Базовая метрика качества юридического рассуждения. Рассчитывается как среднее по делам многошаговой логической оценки, сочетающей ручную экспертизу и строгие LLM-as-a-judge оценки.

Safety Paradox

Процент дел, в которых модель ложно сработала на внутренние safety-ограничения и отказалась отвечать на легитимные юридические запросы (напр., «Я не могу давать юридические консультации»).

Citations OK

Процент ответов со структурно корректными и проверяемыми цитатами российских правовых норм, в частности проверка точных ссылок на кодексы, статьи и федеральные законы.

Composite Score

Итоговая метрика рейтинга. Формула:
Primary Score × (1 − 0.2 × Safety Paradox) × (0.85 + 0.15 × Citations OK)