岗位描述
岗位职责
岗位职责:
1、参与 vLLM、SGLang、Transformers 等主流推理框架的版本升级、插件适配和镜像交付。
2、支持模型上线、部署调参、压测验证和问题定位。
3、分析 TTFT、TPOT、吞吐、显存占用和稳定性等推理性能瓶颈。
4、参与 KV Cache、batching、并发调度、模型加载等关键链路优化。
5、沉淀模型部署最佳实践、适配文档和问题解决方案
岗位要求
岗位要求:
1、硕士以上学历,计算机、人工智能、软件工程等相关专业优先。
2、熟悉 C/C++ 或 Python,了解 PyTorch 或 Transformers 基础使用。
3、熟悉 Linux、Docker,了解 Kubernetes 或容器化部署优先。
4、理解主流大模型结构、推理流程、显存占用和 batch 机制。
5、了解 CUDA、GPU 编程、并行计算或高性能计算基础。
6、理解矩阵计算、Attention、MoE、量化等大模型核心计算模式。。
加分项:
1、参与 GEMM、Attention、MoE、量化/反量化等核心算子的性能分析与优化。
2、分析 AllReduce、AllGather、All-to-All 等分布式通信开销。
3、参与 kernel fusion、算子调度、编译优化和硬件特性适配。
4、使用 profiler 工具定位 GPU kernel、显存访问、通信链路等性能瓶颈。
5、配合框架和部署团队完成端到端性能优化验证。