职位描述负责业务部对外demo展示支持,包括全球各个重大展会演示需求支持,能够独立部署、调试模型(有标准sop),确保模型能力达到对外展示效果,同时也需要接待客户讲解demo场景; 在无展会期间,同时负责机器人真机模型评测,测试工作包括:对接算法评测需求,制定合理的测试计划,和研发对齐测试用例/metrics,执行测试,编写测试报告; 深度参与大模型平台产品的测试与优化,协同产品与研发团队,高质量交付产品; 参与大模型(包括不限于大语言模型、多模态大模型)评测体系建设,包括评测集管理、评测流程建设、评测工具需求定制与落地; 负责大模型(包括基座模型和应用模型)评测,包括制定和完善评测方案、评测指标、评测数据收集和更新、评测执行,并输出专业评测报告; 具备一定测试问题分析的能力和良好的沟通能力;遇到的问题,可自行解决/寻求协助解决,能给出自己的优化建议,对于测试中遇到的情况,能够灵活进行分析,找人沟通,给出各方信服的测试结论; 具备在linux环境下工作的能力,了解linux基础命令,能运行测试脚本,有较强的文档规范编写能力。熟悉机器人真机测试是加分项目; 之前在视觉模型、多模态模型方面,具备算法模型评测的一些经验。有自动驾驶相关实车测试或者模型评测相关经验是加分项; 站在用户角度,对产品、算法发提出建设性的意见,在评测参与的各个流程中以用户视角保证产品体验; 洞察行业及竞品情况,及时高效产出模型能力横评及竞品分析报告;任职要求本科及以上学历,计算机、软件、机器人、自动化等相关专业; 2年及以上大模型评测或相关领域工作经验,对主流大模型的原理了解,可与策略等团队沟通; 熟悉大模型的基本实现原理、熟悉各类公共评测集、了解多模态评测方法、有大模型评测及构建经验; 工作积极主动,具有良好的团队意识和敬业精神,能发挥主观能动性,有一定的抗压能力; 因需要支持国内外展会需求,能接受较频繁国内外出差,英语口语较好者优先;