未来规划与设计哲学 (Roadmap & Philosophy)
March 27, 2026 · View on GitHub
本文档旨在阐述 Omni-Eval Kit (o_e_Kit) 的长期发展方向和核心设计原则,为未来的功能迭代和社区贡献提供清晰的指引。
1. 未来功能蓝图
我们的目标是将 o_e_Kit 打造成一个全面、易用的全模态评估框架。在未来,我们将重点支持以下任务类型:
1.1 支持的评测任务
A. 单工任务 (Simplex Tasks)
模型接收一种或多种模态输入,并产出单一模态的输出。
- 声音理解任务 (Audio Understanding): 例如,音频分类 (Audio Classification)、声纹识别 (Speaker Verification) 等。
- 语音生成任务 (Speech Generation): 例如,文本到语音合成 (TTS)。
- Omni 理解任务 (Omni-modal Understanding): 接收多种模态(如音、视、文)的混合输入,并产出文本形式的理解与回答,例如 VQA(视觉问答)。
B. 双工任务 (Duplex Tasks)
模型能够接收和产出双向的、流式的多模态信息,实现类似对话的交互。
- 语音交互任务: 例如,实时的语音对话系统。
- 音视频交互任务: 例如,能够理解并回应视频内容,并生成相应音视频流的数字人。
1.2 全面的功能支持
为了实现上述任务,框架将提供以下维度的全面支持:
- 数据集支持: 为各类评测任务提供标准化的数据加载接口。
- 模型推理支持: 能够轻松接入和切换不同的模型。
- 推理结果保存: 提供统一的、可追溯的结果保存机制。
- 推理结果计算: 内置或可扩展的、针对不同任务的评估指标计算。
- 深入的结果分析: 除了提供 WER/CER 等总体分数,未来将支持更细粒度的错误分析。例如,自动识别并统计高频错误词对 (Substitution pairs)、常见错别字、或在特定声学场景(如高噪声、远场)下的模型表现下降情况。
- 模型打分支持: 对于语音生成等任务,支持使用模型(如 MOSNet)进行自动化打分。
- 多维度的结果可视化: 提供丰富的、可交互的可视化工具。例如:
- 混淆矩阵 (Confusion Matrix): 直观展示模型最容易混淆的词或音素。
- 错误分布直方图: 按句子长度、信噪比等维度分析错误率的分布。
- Web 端结果浏览器: 开发一个简单的 Web 界面,用于筛选、排序和检查评测结果,并将预测音频、标准答案和模型输出并列展示,方便人工审计。
2. 核心设计哲学
为了确保框架的健壮性、可扩展性和易用性,我们重申并始终遵循以下三个核心设计原则:
A. 统一且灵活的模型推理
所有模型的推理设置,包括 Prompt、温度、最大长度、生成策略(Sampling/Greedy)等,都将通过成熟的类进行封装。这样做的好处是:
- 易于管理: 所有模型的配置都以同样的方式管理,方便集中检查和修改。
- 保证对齐: 能确保不同模型、不同实验之间的评测设定(Setting)是严格对齐的。
- 高度自定义: 在提供标准封装的同时,也为开发者保留了灵活的自定义接口。
B. 纯粹且透明的数据格式
我们坚信,用于评测的数据和结果应该是简单、直观且易于检查的。因此,本框架百分之百地对于评测数据抛弃任何复杂的、封装过的数据类型。
- 输入: 只使用最基础、可被轻易可视化的格式——
.wav用于音频,.mp4用于视频,.jsonl用于文本和结构化标注。 - 输出: 模型的输出结果也将以同样的原则进行保存。 这种设计哲学杜绝了因数据格式复杂而带来的黑盒问题,保证了每一环节的透明性。
C. 一体化的评测管理
本框架的最终目的,就是为了统一管理所有评测策略,将不同团队、不同模型、不同任务的评测工作全部集成到这一个统一的框架下。这能极大地提升团队的评测效率,确保结果的可信度和可对比性,并促进知识的沉淀与复用。