LeMAJ: атомарная оценка юридических ответов
Работа: LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation предлагает оценивать юридический ответ не целиком, а по атомарным утверждениям, Legal Data Points. Каждое получает метку correct, incorrect, irrelevant или missing, из меток считаются правильность, точность, полнота и F1. На подмножестве LegalBench корреляция Пирсона с экспертной оценкой правильности составила 0,700 против 0,018 у DeepEval Correctness. Согласие экспертов между собой при разметке в интерфейсе LeMAJ выросло с 0,77 до 0,88. Авторы признают субъективность критерия релевантности и зависимость от модели-судьи. Для рейтинга Lexometrica полезен отдельный учет пропущенных обязательных элементов ответа: модель может быть права во всем сказанном и при этом не назвать норму, без которой вывод не обоснован.
Работа: LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation