Почему ваш LLM-as-a-Judge “слишком вежливый” (и как с этим бороться)
Я часто вижу, как команды внедряют LLM-as-a-Judge и радуются стабильным метрикам 1.0. На деле это не показатель качества системы, а показатель того, что «судья» слишком добрый и апрувит всё подряд, включая грубые нарушения бизнес-логики.