岗位描述
岗位职责
面向主流端侧算力平台,参与 LLM 及多模态模型部署与推理的方案设计及调优,在受限算力上兼顾精度与吞吐,覆盖量化、剪枝、蒸馏、内存与调度优化;
参与端侧 AI 平台预研与能力验证,沉淀端侧模型推理服务能力,输出性能评测与选型结论;
参与轻量训练与微调调优(如 LoRA / SFT),支撑端侧模型快速迭代;
编写高质量代码,完成推理服务 / SDK 封装,输出方案与技术文档;
参与内外部技术合作,评估对接外部 AI 服务与开源方案,并跟踪端侧推理框架、模型轻量化与高效微调前沿进展,将可用成果引入在研平台。
任职要求
必备
计算机、数学、自动化、电子信息等相关专业,硕士及以上学历;
扎实的深度学习基础,熟悉 Transformer 与 LLM 基本原理;了解量化(INT8 / INT4)、蒸馏或推理加速中至少一类方法,能讲清其技术取舍;
熟练使用 Python / C++ 与 PyTorch,具备独立完成部署与调优实验的能力;
具备良好英文技术文献阅读能力,能跟进顶会论文与开源社区进展。
加分项
使用过 TensorRT、ONNX Runtime、llama.cpp、llama-factory、vLLM 等任一推理或训练框架;
有大模型量化 / 微调 / 部署相关课题、竞赛或实习经历;
有跨团队协作与问题定位经验。