职位描述
岗位职责:
1. 端到端性能优化
负责国产化SoC平台整体性能优化,围绕 CPU、DSP、GPU、Memory、Middleware 等核心链路,定位系统性能瓶颈,降低端到端 Latency,提升系统资源利用率和整体运行效率。
2. 代码与异构计算优化
深入核心代码和计算链路,开展 C/C++、SIMD、Cache、Memory、多线程等底层优化;针对计算密集度高的模块能使用Cadence DSP、Mali GPU 等异构计算IP进行优化,充分发挥芯片计算能力。
3. 性能分析与问题定位
建立系统化的Profiling和Benchmark能力,利用perf、ftrace、Perfetto、PMU等工具,从CPU、Memory、调度、DSP/GPU等多个层面分析性能问题,完成从瓶颈定位到优化验证的闭环系统。
4. 系统性能架构与协同优化
从系统整体架构视角推动性能优化,与芯片、BSP、Kernel、Middleware、算法等团队协同解决跨层性能问题,建立多SOC平台的性能基线和持续优化体系。任职要求
任职要求
1.5年以上 C/C++/系统软件/高性能计算相关开发经验,其中有较长时间的性能优化工作经历。
2.具备扎实的 CPU 性能优化经验,熟悉Arm CPU架构及性能分析方法。有实际的底层性能优化项目经验,能够通过Profiling/Hardware Counter/Trace定位性能瓶颈。
3.精通C/C++,具备较强的并发、Memory、Cache、SIMD等底层能力。
有实际的异构计算开发经验,至少深入掌握CPU + DSP / GPU 中的一种组合。
4.能够独立完成:
性能问题发现 → Profiling → 根因分析 → 优化方案设计 → Code实现 → Benchmark → 效果验证。
5.具备较强的技术判断能力,能够判断性能瓶颈究竟来自:CPU、Memory、Cache、DSP、GPU、Kernel、调度、Middleware 还是业务 Pipeline。
优先考虑
1.有基于AI的代码级自动化优化闭环系统,有Cadence DSP或Mali GPU 开发/性能优化经验优先,最好具备两者实际项目经验。
2.有自动驾驶、机器人、具身智能、边缘计算等实时系统经验,有国产SoC / ARM SoC性能优化经验,有地平线、Nvidia Jetson/Thor/Ori相关平台经验
3.同时具备GPU Compute/OpenCL/Vulkan/CUDA等开发经验,有DSP Kernel/Vectorization/DMA/TCM/Cache优化经验,有跨CPU/DSP/GPU的Pipeline优化经验,有大型实时系统端到端 Latency 优化经验。