Mirror:大语言模型元认知校准分层基准
我们介绍了 MIRROR,这是一个包含跨越四个元认知水平的八个实验的基准,旨在评估大型语言模型是否能利用自我知识做出更好的决策。我们使用五个独立的行为测量通道,在大约 250,000 个评估实例上评估了来自 8 个实验室的 16 个模型。核心实验在整个模型名单上运行;具有专门基础设施要求的实验报告明确标记的模型子集。我们发现了两个对代理部署有直接意义的现象:(1) 组合式自我预测普遍失败——组合校准误差在原始 15 模型 Exp3-v1 集合中范围为 0.500 到 0.943(在平衡的 16 模型 Exp3-v2 扩展中为 0.434 到 0.758),表明模型无法预测自己在多领域任务上的表...