Entity · Technology
通过人类偏好对战比较语言模型的公开评测平台。
公开榜单会受到题目污染、分数饱和和机制过拟合影响。本文解释这些失灵机制,并给出二十到五十道私有评测集的题目来源、分层、打分和样本量方法。