Search posts, tags, users, and pages
Keygate
Global AI model evaluation, benchmarks, rankings, and selection.
同一个模型,在一张榜上靠前,在另一张榜上却可能只是中游;两款模型只差一点分数,名次却隔了好几位;新模型刚出现时排名亮眼,过一段时间又发生变化。遇到这些情况,问题通常不在于哪张榜“算错了”,而在于我们把不同条件下的结果当成了同一个答案。 排行榜不是“模型真实能力”的刻度尺,而是在特定模型、任务、样本和评价方法下形成的排序结果。它可能来自基准成绩,也可能来自相对偏好;最适合用来缩小候选范围,不适合替用
No responses yet.