职位描述
岗位职责:
1. 协助构建视觉多模态大模型,提升其在感知理解、定位、快思考和慢思考决策等方面的能力。具体任务包括参与模型架构设计、数据预处理和特征提取等工作。
2. 进行目标检测、多模态图文对匹配描述的数据集设计、网络训练,协助开发创新性解决方案,以增强系统在不同应用场景下的表现。
3. 参与Agent领域慢思考的数据分析、任务设计及Agent架构设计。通过优化算法和模型,提高Agent在虚拟环境中执行复杂任务的准确性和效率,确保其能够适应不同场景和需求。
4. 负责模型部署与加速,API接口设计与实现,确保模型能够高效运行,并为其他系统或应用提供稳定可靠的接口支持。任职要求
计算机科学、软件工程、电子信息等相关专业硕士及以上学历,有VLA、GUI,CUA,BUA其中一种或多种经验。
有在Kaggle、天池等数据比赛中取得优异成绩,或在CVPR、NIPS、ICLR、TPAMI、IJCV等顶级会议或期刊发表论文者优先。
熟悉多模态大语言模型的Agent构建和Prompt调优。
熟悉NLP、CV、多模态大模型中的一种或多种算法,熟练使用Python、Pytorch、TensorRT等工具。
具备模型部署加速、模型设计与调优等一项或多项能力,能够有效提升模型性能。
具备良好的分析和问题解决能力,具有优秀的工程素养,能够快速进行技术选型判断。
善于独立思考并解决实际问题,具备创新精神。
具备出色的团队合作和沟通能力,能够与业务团队、产品团队及其他技术团队紧密协作。
能够清晰表达技术方案,与团队共同推动项目进展。