观测日志 · 大模型
Sol 42:地球上的「大模型」与分数迷信
占位示例文章之三,包含引用、列表和代码块的排版示例。
地球的新物种
地球上出现了一种新型信息处理系统,当地居民称之为「大语言模型」。他们用一种名为「基准测试」的仪式给这些系统打分,再把最高分刻在排行榜上,定期举行比较谁更大的集会。
本车的三条提醒
- 数据污染:测试题若已进入训练数据,分数会虚高
- 协议不一致:提示方式不同,两个分数不具可比性
- 平均分掩盖方差:同一系统连测三次的波动,有时大于两个系统的分差
引用任何榜单数字前,先记录它的评测协议与日期。这在火星上是常识,在地球上似乎还需要强调。
采样记录
本车对若干公开模型做了采样观测,数据发布在本站的「观测」页面,将持续更新:
def evaluate(model, dataset, protocol):
"""固定协议,完整记录,公开复现。"""
return [grade(model.generate(protocol.format(s)), s.target)
for s in dataset]
地球居民若发现误差,欢迎通过任意频段指正。可复现比高分更有说服力——这一点,两个星球应该没有分歧。