PROVENANCE FIRST

评测方法与边界

本网站呈现可追溯的归档记录,不把缺失值解释为零,也不把不同口径的数字压成排行榜。

01

来源优先

每条运行指标、Prompt 和评价均保留文件与行定位。

02

评价分离

人工评价、历史 AI 报告和本次展示站验证不静默合并。

03

缺失即缺失

未知配置显示“未记录”,不推断单题费用或模型能力。

04

同题才比较

只有同一任务版本的运行可进入对比;仅在口径一致时显示差值。

历史结论如何展示

93.6/100 与 15/15 仅作为《15 项任务完成质量评估》的引用结论。它们不是本网站重新计算或独立证明的统一事实。任务 06、07 的人工观感与 AI 评估明显不同,两种判断在运行详情中并列保留。

原始报告 ↗
BATCH MEASUREMENTS

合计

Tasks15
Sessions12
Duration8,282s
API693
Tools735
Failures / retries42
Input tokens334,670
Output tokens1,072,534
Cache read63,042,176
Batch cost¥9.30