LLM-as-a-Judge Study: Scoring Rubrics Alone Can Predict AI Evaluations, Revealing Hidden Bias
A new arXiv study reveals that classifiers trained only on rubric text—without seeing any evaluated response—can predict LLM judge outputs. This means scoring rules encode evaluative signals that bias AI evaluations independently of content quality.