岗位描述
岗位职责:
1.负责将PyTorch/TensorFlow等框架训练的模型,通过ONNX等中间格式,转换并优化至特定硬件平台的推理引擎(如TensorRT、地平线工具链)
2.主导模型在NPU/GPU/DSP/BPU等异构计算单元上的性能调优。通过图优化、算子融合、内存管理、流水线并行等技术,持续降低延迟、提高吞吐量
3.实施并创新模型量化(INT8/INT4)、剪枝、蒸馏等压缩技术,在保证模型精度损失可控的前提下,大幅降低模型体积与功耗
4.参与设计、开发和维护高效的模型部署与评测工具链,提升团队整体的交付效率与质量
5.构建模型在板端的性能与精度监控体系,快速定位并解决部署中出现的性能瓶颈、精度异常及稳定性问题
6.与算法团队紧密合作,提供模型设计阶段的部署友好性建议;与软件平台团队协作,确保驱动和运行时环境的稳定性
岗位要求:
1.本硕士学历,计算机、电子工程、自动化等相关专业
2.熟练掌握 C++ (必备) 和 Python (必备) 编程语言,具备扎实的代码能力和良好的软件工程习惯
3.至少深入理解并实践过一种主流推理框架,如TensorRT、 OpenVINO、 vLLM、 ONNX Runtime 等,了解其核心原理和优化手。
4.拥有在以下至少一个平台上的实际模型部署与优化经验: NVIDIA 系列(如 Orin, Xavier),地平线 系列(如 Journey 系列) Qualcomm Snapdragon Ride
5具备优秀的逻辑分析和问题定位能力,能够独立解决复杂的技术难题