岗位描述
岗位职责
1、负责实时多模态数字人项目的推理性能优化,围绕 GPU 利用率、实时帧率、显存效率等核心指标,结合 GPU 硬件架构特性开展推理性能调优,持续降低单位生成量的算力成本;
2、设计与优化多卡推理场景下的并行与调度策略,降低通信开销,实现计算与通信高效重叠,提升多卡资源利用效率与线性扩展能力;
3、针对多模态模型架构(DiT/VAE/Transformer 等)设计并落地推理加速方案,覆盖模型量化、算子融合等技术手段;
4、跟进推理加速领域前沿技术,紧密结合算法技术迭代完成技术选型与工程落地。
任职要求
1、本科及以上学历,计算机、人工智能等相关专业,熟练掌握 C++/Python ,3 年以上AI推理优化相关工作经验;
2、精通CUDA编程与GPU性能调优,熟练使用性能分析工具(Nsight等),掌握至少一种主流推理加速框架;
3、熟悉Transformer、扩散模型等生成式网络的推理流程,理解Attention 计算、显存管理、张量并行 / 流水线并行等核心技术原理;
4、有 FP8/INT8 量化、模型剪枝、知识蒸馏等模型压缩技术的工程落地经验,有推理成本优化相关项目经历;
5、有实时数字人/视频生成类项目的推理优化落地经验,熟悉 DiT、VAE 等视频生成模型的加速技巧者优先。