职位描述结合TTS(文本转语音)的韵律特征(音素时长、基频、能量),生成与语音同步的口型、头部姿态、手势等副语言动作 设计多模态对齐机制,确保动作生成与语音合成的节奏、停顿、情感表达精准同步 构建语音合成与动作生成的流式协同框架,支持实时对话场景下的低延迟、高同步度输出 将算法能力封装为可复用的动作生成SDK/服务,支撑多元业务场景 与机器人控制、交互系统团队紧密协作,推动技术方案的产品化落地任职要求•计算机、机器人学、图形学、人工智能等相关专业硕士及以上学历,博士优先,相关领域研究或开发经验 •扎实的深度学习基础,精通PyTorch,有生成模型(Diffusion、VAE、GAN、Flow-based)的实际项目经验 •深入了解动作生成领域,熟悉MotionGPT、HumanML3D、MotionDiffusion、PhysDiff、ASE等代表性工作 •熟悉机器人运动学、计算机图形学中的角色动画基础,了解正向/逆向运动学、骨骼动画原理 •具备语音合成(TTS)相关基础知识,了解声学模型、声码器、韵律建模 熟悉动作表示与处理:SMPL/SMPL-X、BVH、AMC、运动学图(Kinematic Trees)、四元数/旋转矩阵表示 加分项 •顶级会议期刊论文发表 •有真实机器人平台或虚拟人引擎的实际落地经验 •熟悉实时动作生成管线,或有游戏/影视动画行业经验 •有语音合成(TTS)或语音识别(ASR)的深入研发经验,具备多模态联合训练经验 •熟悉物理驱动的动作生成、强化学习(RL)在动作控制中的应用 •有开源项目贡献或相关专利