Articles
A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models⭐7
A consensus-based framework for LLM evaluation measures relative preference among model-generated responses instead of absolute correctness, using a voting pane...
