岗位描述
岗位职责(具体工作内容)
参与大模型推理引擎的架构设计与核心模块开发,支撑千亿参数模型的高效分布式推理。
研发面向GPU/NPU等异构计算平台的高性能算子,提升硬件利用效率。
参与模型低精度量化,图优化,编译优化等性能优化工作。
攻克分布式推理中的动态负载均衡、通信优化、显存管理等核心技术难题。
跟踪学术界与工业界前沿技术(如vLLM、TGI、TensorRT-LLM等),推进框架迭代。
任职资格(学历、目标院校、语言、技能、性格等要求)
计算机、人工智能、数学或相关专业,硕士及以上在读优先,优秀本科生亦可;
熟练掌握C++/Python,具备大型项目代码架构设计能力.
熟悉Transformer架构及大模型推理相关技术(如FlashAttention、PagedAttention、Continuous Batching).
有实际大模型部署及调优经验,熟悉量化(INT8/FP8)等优化手段.
有GPU/NPU 算子优化经验,有并行计算相关背景者优先.
期望学生毕业时间