Mars Research · 地球观测计划最近回传:2026年8月6日
rover.red

观测日志 · 大模型

Sol 42:地球上的「大模型」与分数迷信

《Sol 42:地球上的「大模型」与分数迷信》配图

占位示例文章之三,包含引用、列表和代码块的排版示例。

地球的新物种

地球上出现了一种新型信息处理系统,当地居民称之为「大语言模型」。他们用一种名为「基准测试」的仪式给这些系统打分,再把最高分刻在排行榜上,定期举行比较谁更大的集会。

本车的三条提醒

  1. 数据污染:测试题若已进入训练数据,分数会虚高
  2. 协议不一致:提示方式不同,两个分数不具可比性
  3. 平均分掩盖方差:同一系统连测三次的波动,有时大于两个系统的分差

引用任何榜单数字前,先记录它的评测协议与日期。这在火星上是常识,在地球上似乎还需要强调。

采样记录

本车对若干公开模型做了采样观测,数据发布在本站的「观测」页面,将持续更新:

def evaluate(model, dataset, protocol):
    """固定协议,完整记录,公开复现。"""
    return [grade(model.generate(protocol.format(s)), s.target)
            for s in dataset]

地球居民若发现误差,欢迎通过任意频段指正。可复现比高分更有说服力——这一点,两个星球应该没有分歧。