SURE-EVAL
Speech Evaluation · Reproducible by Design

让每一个
语音评测分数
可复现,可追溯

SURE-EVAL 把每个评测指标声明为一条版本化的节点管线。同样的路由、同样的输入、同一套锁定环境——得到同样的分数,分数背后的每一步都有据可查。

设计理念

一个指标,就是一条声明式路由

评测不是一次黑盒调用,而是一条被完整声明的管线:先 describe 拿到路由,再 run 产出报告。打分节点直接封装 sclite、sacrebleu、meeteval、WeNet 等社区标准实现——分数与你现有的工具链对得上。以中文语音识别的字错率(CER)为例——

输入
hyp + ref
整份测试集的转写与参考文本,按 key 逐条对齐
归一化
wetext_norm
逆文本规整(ITN):口语数字转书面形式,两侧同步
打分
wenet_cer
语料级编辑距离,逐字统计增删改
报告
report.json
分数 + 完整管线描述,双文件落盘
结果
CER 10.53%
19 个字中 2 处替换——每一分都可复算
$ git clone https://github.com/PigeonDan1/sure-evaluation && pip install -e . # 一次安装,基础文本指标开箱即用;重型/规范化节点按需自建环境
$ sure-eval agent plan asr --language zh --metric cer --json # Agent 接口:路由与环境就绪度
$ sure-eval metric describe asr --language zh --metric cer --output asr.json # 拿到路由
$ sure-eval metric run --pipeline asr.json --ref-file ref.txt --hyp-file hyp.txt # 产出报告
report.json "score": 0.10526315789473684 "all": 19, "cor": 17, "sub": 2, "ins": 0, "del": 0
管线图谱

把整个框架装进一张图

每条彩色缎带都是一份可复核的评测声明:任务经过前端、转写、归一化与打分节点,最终落成报告。点击链路会直接打开对应的 Route JSON;从下方任务卡进入时,图谱只保留该任务的真实链路,不显示任何无关残影。

筛选
语言
节点阶段
聚焦任务
任务能力

从任务出发,沿着真实路由深入

先选择你要评测的对象,再查看它实际经过哪些节点、使用哪份契约、产出怎样的 JSON。当前目录覆盖识别、翻译、合成、转换、增强、目标说话人提取与说话人分析等任务族。

配套工作台

SURE Harness:让 Agent 跑完整条评测流水线

SURE Harness 把本框架接入 Pi 风格的终端 Agent:人以斜杠命令下达意图,Agent 负责规划与执行,harness 以产物门控确保每一步可复现、可审计——从发现模型到产出报告,四条命令走完,执行面绝不静默降级。

配置
/sure_init
选择 Agent、配置鉴权,完成环境体检
发现
/sure_feed
从 ModelScope / HuggingFace / GitHub 发现并归类候选模型
准备
/sure_onboard
构建可复现的本地推理单元,产出门控验收判定
评测
/sure_eval
沿确定性路由计划执行评测,产出指标报告
产物
报告与审计轨迹
运行报告、指标结果与全程产物清单,逐一落盘可复核
可信依据

可比,不只看分数

同一模型不等于同一可执行系统;同一预测也不等于同一计分契约。

A
执行方差同一 checkpoint,不同推理协议
same utteranceserial number
WER (%)0.0

同一 checkpoint ≠ 同一可执行系统

B
计分方差预测固定,不同归一化契约
模型 A48.1
模型 B3.7

模型 B 排名第一

计分契约不同,排名甚至会反转

R可调用工具入口 + 版本
Π推理协议解码 + 回退
K归一化契约文本规整规则
E评测器指标 + 聚合
分数可比仅当四项共同锁定
节点与 manifest 版本化重型环境独立复建报告与管线共同落盘

让下一份评测报告,经得起复核。

$ sure-eval metric run --pipeline asr.json --ref-file ref.txt --hyp-file hyp.txt