AI 科技观察

实体 · 技术

MMLU

覆盖多学科知识与推理任务的语言模型基准。

报道数量
已报道 1 篇
首次报道
首次报道
最近更新
最近更新

最新报道

明亮桌面上的模型评测卡片、公开榜单和自建评测集对比
模型评测

榜单帮不了你选模型:自建评测集的做法

公开榜单会受到题目污染、分数饱和和机制过拟合影响。本文解释这些失灵机制,并给出二十到五十道私有评测集的题目来源、分层、打分和样本量方法。

AI 科技观察阅读 19 分钟