当前支持的评测任务类型

March 27, 2026 · View on GitHub

本文档旨在清晰地列出 Omni-Eval Kit (o_e_Kit) 当前版本所支持的评测任务。

我们的框架能够灵活地组合不同的输入和输出模态,目前已实现并验证了以下评测任务流程:

1. 语音 + 文本输入 / 文本输出

这是典型的语音问答(Audio QA)或语音指令理解任务。

  • 输入:
    • 一段语音 (.wav)
    • 一个关联的文本问题或指令 (.jsonl 中的 question 字段)
  • 输出:
    • 模型生成的文本回答 (.jsonl 中的 answer 字段)
  • 典型评测指标:
    • 词错误率 (WER)
    • 字符错误率 (CER)
    • 关键词匹配 (Keyword Matching)

2. 语音 + 文本输入 / 语音输出

这是具备语音合成能力的多模态对话任务。

  • 输入:
    • 一段语音 (.wav)
    • 一个关联的文本问题或指令 (.jsonl)
  • 输出:
    • 模型生成的语音回答 (保存为 .wav 文件)
  • 典型评测指标:
    • 客观指标: 例如,使用声学模型计算的 Mel-Cepstral Distortion (MCD)。
    • 主观指标 (模型打分): 例如,使用 MOSNet (Mean Opinion Score) 等模型来预测生成语音的自然度和质量。

3. 视频 + 文本输入 / 文本输出

这是典型的视频内容理解或视频问答 (Video QA) 任务。

  • 输入:
    • 一段视频 (.mp4)
    • 一个关联的文本问题 (.jsonl)
  • 输出:
    • 模型生成的文本回答 (.jsonl)
  • 典型评测指标:
    • 准确率 (Accuracy)
    • VQA Score

4. 视频 + 文本 + 语音输入 / 文本输出

这是最全面的全模态 (Omni-modal) 理解任务,要求模型能同时处理三种主流模态。

  • 输入:
    • 一段视频 (.mp4)
    • 一个关联的文本问题 (.jsonl)
    • 一段关联的用户语音指令或追问 (.wav)
  • 输出:
    • 模型生成的统一文本回答 (.jsonl)
  • 典型评测指标:
    • 准确率 (Accuracy)
    • 多模态融合理解能力相关的特定指标。

随着项目的发展,这个列表将会不断更新。