岗位描述
角色和期望:
1.参与推理引擎、深度学习框架、分布式训练、深度学习算法等相关方向的技术调研、设计、以及原型开发;
2.探索业界相关领先技术如万卡集群上大模型(LLM、文生图、文生视频、具身智能等)的分布式训练/推理/强化学习、故障容错、弹性伸缩、自动并行等,并在壁仞GPGPU上进行原型开发验证;
3.针对搜索/广告/推荐等场景,研究大规模稀疏模型训练框架和预估引擎,研究大模型驱动的新型搜广推AI工程架构,并在壁仞GPGPU上进行原型开发验证;
4.攻关超节点、Scale-up高速互连、PD分离、异构混推、大EP、多级KV Cache等端到端系统级Token工厂解决方案,提供高性价比的Agentic AI系统级产品;
5.利用Agent等大模型技术进行模型迁移适配、架构研究、智能故障诊断、并行策略优化等工作,沉淀Skills,打造壁仞SUPACode全栈智能体;
6.作为架构工程师进行软硬结合、全栈的软硬件系统设计,支持定义壁仞产品架构设计和技术演进路线。
人才画像:
1.计算机、电子、数学及相关专业;
2.熟练使用C++/Python编程;
3.熟悉CUDA等异构编程、GPGPU架构优先;
4.熟悉RDMA、NCCL、NIXL等超节点互连和通信加速技术优先,熟悉PD分离、大EP、KV Cache等技术优先;
5.具备PyTorch /Megatron-LM/DeepSpeed/vLLM/SGlang/VeRL/Slime等主流训练、推理和强化学习框架研发和优化经验优先;
6.熟悉LLM、文生图、文生视频、具身智能、搜广推等大模型算法优先;
7.熟悉Skills/Harness Engineering/Loop Engineering等,能够利用Agent等大模型技术解决关键技术问题并总结沉淀Skills。