岗位描述
岗位职责:
1.负责主流大模型训练框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优。
2.支撑预训练、微调等核心训练链路建设,落地 MoE、多模态、智能驾驶等业务场景。
3.定位并解决精度、显存、通信、算子等训练问题,搭建自动化工程体系。
4.搭建自动化体系,借助 AI Agent 赋能适配工作与训练生态。
任职要求
1.熟悉 PyTorch 核心训练流程与分布式并行策略(DP/TP/PP/ZeRO/FSDP 等);
2.掌握 Megatron、DeepSpeed 等一种或多种主流训练框架。
3.熟练使用 Linux、Python,具备较强的工程调试、问题定位和性能分析能力。
加分项
1.有大模型预训练、全参微调、LoRA 或大规模集群训练经验。
2.熟悉 CUDA / 算子开发、通信库、编译器优化或 AI 芯片软件栈。
3.有国产 AI 芯片适配、自动化平台建设、AI Agent 工具使用经验者优先。
4.有主流开源社区贡献经验者优先。