当前支持的评测任务类型
March 27, 2026 · View on GitHub
本文档旨在清晰地列出 Omni-Eval Kit (o_e_Kit) 当前版本所支持的评测任务。
我们的框架能够灵活地组合不同的输入和输出模态,目前已实现并验证了以下评测任务流程:
1. 语音 + 文本输入 / 文本输出
这是典型的语音问答(Audio QA)或语音指令理解任务。
- 输入:
- 一段语音 (
.wav) - 一个关联的文本问题或指令 (
.jsonl中的question字段)
- 一段语音 (
- 输出:
- 模型生成的文本回答 (
.jsonl中的answer字段)
- 模型生成的文本回答 (
- 典型评测指标:
- 词错误率 (WER)
- 字符错误率 (CER)
- 关键词匹配 (Keyword Matching)
2. 语音 + 文本输入 / 语音输出
这是具备语音合成能力的多模态对话任务。
- 输入:
- 一段语音 (
.wav) - 一个关联的文本问题或指令 (
.jsonl)
- 一段语音 (
- 输出:
- 模型生成的语音回答 (保存为
.wav文件)
- 模型生成的语音回答 (保存为
- 典型评测指标:
- 客观指标: 例如,使用声学模型计算的 Mel-Cepstral Distortion (MCD)。
- 主观指标 (模型打分): 例如,使用 MOSNet (Mean Opinion Score) 等模型来预测生成语音的自然度和质量。
3. 视频 + 文本输入 / 文本输出
这是典型的视频内容理解或视频问答 (Video QA) 任务。
- 输入:
- 一段视频 (
.mp4) - 一个关联的文本问题 (
.jsonl)
- 一段视频 (
- 输出:
- 模型生成的文本回答 (
.jsonl)
- 模型生成的文本回答 (
- 典型评测指标:
- 准确率 (Accuracy)
- VQA Score
4. 视频 + 文本 + 语音输入 / 文本输出
这是最全面的全模态 (Omni-modal) 理解任务,要求模型能同时处理三种主流模态。
- 输入:
- 一段视频 (
.mp4) - 一个关联的文本问题 (
.jsonl) - 一段关联的用户语音指令或追问 (
.wav)
- 一段视频 (
- 输出:
- 模型生成的统一文本回答 (
.jsonl)
- 模型生成的统一文本回答 (
- 典型评测指标:
- 准确率 (Accuracy)
- 多模态融合理解能力相关的特定指标。
随着项目的发展,这个列表将会不断更新。