LegalReasoner: верификация шагов рассуждения

В работе: LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning предсказание исхода дела построено как проверяемый процесс, а не классификация итога. Модель выделяет спорные вопросы, строит цепочку рассуждения и оценивает каждый шаг по правильности, продвижению и потенциалу. Для обучения собран набор LegalHK из 58 130 дел Гонконга. Точность вывода на LegalHK составила 80,27 против 72,37 у дообученной Llama-3.1-70B и 77,15 у GPT-o1; на китайском CMDL 76,95 против 72,03. Без пошагового рассуждения результат падал до 69,49, без проверки и исправления шагов до 74,49. Авторы указывают на стоимость проверки каждого шага и шум автоматической разметки. Для рейтинга Lexometrica это аргумент оценивать Issue, Rule, Application и Conclusion по отдельности, а не одной итоговой оценкой.

Работа: LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning

Источник: arXiv Lexometrica Ground Truth ← Журнал