职位描述
工作职责
1. 负责语音大模型评测基建的开发与维护,包括评测框架、自动化评测流水线、结果可视化与分析工具等,提升评测效率与稳定性。
2. 负责内外部 Benchmark(ASR / TTS / 语音理解 / 语音对话 / 全双工 / Agentic 等方向)的接入、适配与标准化,保障评测结果可对比、可复现。
3. 负责评测结果的对分验证,确保自建评测在相同模型与 Benchmark 上能够对齐公开指标或组内已有指标,保障评测实现的正确性。
4. 跟踪语音大模型评测领域的前沿进展(新 Benchmark、新评测方法),评估并在现有评测体系中落地。任职要求
1. 本科及以上学历在读,计算机、人工智能、电子信息或相关专业。
2. 熟练使用 Python,具备独立编写脚本、调用 API、构建工具的能力。
3. 对语音或大模型方向有基础认知或兴趣,使用过主流大语言模型者优先。
4. 做事细致有耐心,具备较强的工程实现与问题排查能力。
5. 有 Benchmark / Evaluation / 评测工具构建相关经验,或开源项目贡献经验者优先。
6. 实习期 3 个月以上,每周出勤 4 天及以上,可长期实习者优先
允许3个月内投递4个职位,请选择适合的职位进行投递
立即投递