执行方差同一 checkpoint,不同推理协议
same utterance→serial numberWER (%)
同一 checkpoint ≠ 同一可执行系统
SURE-EVAL 把每个评测指标声明为一条版本化的节点管线。同样的路由、同样的输入、同一套锁定环境——得到同样的分数,分数背后的每一步都有据可查。
评测不是一次黑盒调用,而是一条被完整声明的管线:先 describe 拿到路由,再 run 产出报告。打分节点直接封装 sclite、sacrebleu、meeteval、WeNet 等社区标准实现——分数与你现有的工具链对得上。以中文语音识别的字错率(CER)为例——
每条彩色缎带都是一份可复核的评测声明:任务经过前端、转写、归一化与打分节点,最终落成报告。点击链路会直接打开对应的 Route JSON;从下方任务卡进入时,图谱只保留该任务的真实链路,不显示任何无关残影。
先选择你要评测的对象,再查看它实际经过哪些节点、使用哪份契约、产出怎样的 JSON。当前目录覆盖识别、翻译、合成、转换、增强、目标说话人提取与说话人分析等任务族。
SURE Harness 把本框架接入 Pi 风格的终端 Agent:人以斜杠命令下达意图,Agent 负责规划与执行,harness 以产物门控确保每一步可复现、可审计——从发现模型到产出报告,四条命令走完,执行面绝不静默降级。
同一模型不等于同一可执行系统;同一预测也不等于同一计分契约。
same utterance→serial number同一 checkpoint ≠ 同一可执行系统
模型 B 排名第一
计分契约不同,排名甚至会反转