实体 · 技术
用真实 GitHub issue 评估语言模型软件工程能力的基准。
公开榜单会受到题目污染、分数饱和和机制过拟合影响。本文解释这些失灵机制,并给出二十到五十道私有评测集的题目来源、分层、打分和样本量方法。