AI Tech Observer

Entity · Technology

MMLU

覆盖多学科知识与推理任务的语言模型基准。

Number of articles
1 articles
First published
First published
Latest update
Latest update

Latest coverage

明亮桌面上的模型评测卡片、公开榜单和自建评测集对比
模型评测

榜单帮不了你选模型:自建评测集的做法

公开榜单会受到题目污染、分数饱和和机制过拟合影响。本文解释这些失灵机制,并给出二十到五十道私有评测集的题目来源、分层、打分和样本量方法。

AI 科技观察19 min read