岗位描述
工作职责
1. 负责LLM、三维重建、4DGS模型的训练的基础设施建设,优化多卡多机分布式训练效率与显存利用
2. 主导实时性优化:针对高实时4DGS渲染与重建管线,进行算子优化、CUDA加速、显存与延迟调优,达成实时帧率指标
3. 负责模型轻量化(剪枝、蒸馏、量化)与端侧/边缘部署(Jetson、RKNN、Ascend等),解决部署兼容性、实时性与稳定性问题
4. 参与LLM推理优化与serving架构建设,包括KV Cache优化、推理并行策略(Tensor Parallel/Pipeline Parallel)、动态batching、量化部署等,提升大模型服务吞吐与响应延迟
5. 对完整算法Pipeline做全链路性能profiling与调优,沉淀可复用的训练框架、推理引擎与工程规范
任职要求
1. 计算机科学、软件工程、电子信息等相关专业,硕士及以上学历
2. 精通C++与Python,扎实的数据结构与算法功底,熟练Linux开发环境
3. 熟悉PyTorch训练/推理全流程,了解分布式训练(DDP/FSDP/DeepSpeed)与混合精度
4. 熟悉CUDA并行编程,有推理加速(TensorRT/ONNX Runtime/Triton等)或模型量化部署经验;理解GPU硬件架构