颜色越绿越好;单元格显示各模式在 layer1/2/3 的通过率,末行为整体。
法官给出的 0–1 奖励均值,越高代表回答质量越好。
被一票否决的幻觉占比,越低越好(此报告均接近 0)。
四种记忆模式在 60 个用例上的整体表现。
分组柱状图:layer1(单会话) → layer2(顺序多会话) → layer3(独立多会话) 的通过率演变。
奖励随层级的变化趋势。
每个模式跨三层的平均分(1–5 分制)。可切换查看单层级。
左:总 Token 消耗(百万);右:单次调用平均延迟(秒)。
| Test ID | 层级 | 模式 | 标题 | 会话 | 通过 | 奖励 | 幻觉 | 精确 | 召回 | 推理 | 主动 |
|---|