职位描述【工作职责】 1、负责多模态大模型与具身智能模型的全维度评测工作,结合机器人实际应用场景,设计适配两类模型的评测指标、测试用例与标准,覆盖多模态感知(文本、图像、语音)、任务规划、具身决策、动作执行、场景泛化与安全性等维度,确保评测的全面性与针对性。 2、主导评测平台搭建与迭代优化,整合仿真测试、真机测试资源,搭建支持多模态大模型、具身模型评测的一体化平台,实现评测环境的标准化部署、测试用例的模块化管理,支撑两类模型的常态化评测。 3、负责评测流程的设计与落地实现,梳理从测试用例生成、模型部署、自动化测试执行到结果输出的全流程,优化流程效率,解决流程中的兼容性、稳定性问题,推动评测流程的自动化、标准化落地。 4、开展多模态大模型与具身智能模型的常态化评测,深入分析评测结果,精准定位模型在多模态融合、具身交互、场景适配等方面的不足,输出详细评测报告,提出可落地的模型优化建议,为模型迭代提供核心数据支撑。 5、跟踪多模态大模型、具身智能领域的评测技术前沿,引入先进的评测方法与工具,优化现有评测体系、平台功能与流程,适配不同场景、不同类型模型的评测需求;配合团队完成模型需求分析与技术方案设计,推动评测成果与模型优化、落地应用深度结合。任职要求【任职要求】 1、硕士及以上学历,计算机科学与技术、数据分析等相关专业,有具身智能、多模态大模型评测相关经验者优先。 2、熟悉多模态大模型(文本、图像、语音融合)与具身智能模型的核心技术原理,了解机器人感知、决策、运动控制等相关算法,熟悉至少一种机器人仿真工具(Gazebo、MuJoCo、Isaac Lab等),具备场景化评测思维。 3、具备较强的模型结果分析、失败案例归因和评测报告撰写能力,能够推动评测结果反哺模型优化与产品落地 4、熟练掌握golang/C++/Python编程语言,具备良好的代码编写、调试与工程化能力,有自动化评测工具、评测平台开发经验者优先。