锦鲤求职

海康威视

AI Infra工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、集群调度与云原生基础设施:构建GPU集群统一调度与编排系统,攻坚拓扑感知调度、资源碎片治理、弹性伸缩与异构算力统一管理等核心技术,持续提升大规模集群的资源利用率与运行效率。
2、大模型训练框架与系统优化:负责大模型分布式训练框架及强化学习系统的搭建与性能调优,深入剖析计算、通信及存储瓶颈(如网络拓扑、显存管理),打造高吞吐、高可用的训练系统,降低大模型生产与微调门槛。
3、大模型推理引擎与服务平台:深度定制并优化大模型推理框架,落地分布式KVCache、Prefill/Decode(PD)分离架构、前缀感知智能路由、连续动态批处理等核心技术,打造高并发、低延时的生产级推理服务部署系统。
4、底层硬件加速与芯片适配:负责AI算子开发与GPU/芯片级底层性能优化,开展芯片的模型迁移与精度对齐工作;结合硬件特性进行计算与访存优化,在保障精度的前提下实现异构硬件的高效训练与推理。
5、Agent Native底座研发与前沿技术预研:打造高弹性企业级AI Native应用底座,攻坚高性能Agent Runtime、分布式多模态RAG、分层记忆管理与安全隔离沙箱等核心组件;跟踪AI Infra领域技术演进,探索Serverless AI、分布式智能体编排等前沿方向并推动落地。

岗位要求
1、学历与专业:全日制硕士及以上学历应届毕业生(优秀者不限学历),计算机科学与技术、软件工程、人工智能、电子信息、自动化、通信等相关专业。
2、计算机基础:具备扎实的计算机基础功底,深入理解操作系统、计算机网络、计算机体系架构、数据结构与算法,熟悉Linux系统底层原理与常用操作。
3、编程语言:熟练掌握C/C++、Python、Go或Java中至少一门主流编程语言,编程基础扎实,具备良好的编码规范与工程化思维。
4、专业技术能力:对分布式系统、云原生、大模型训练与推理加速、AI基础设施等方向有浓厚兴趣;熟悉GPU并行加速瓶颈分析方法,了解分布式推理与训练常用加速方法,具备较强的问题分析、排查与解决能力。
5、综合素质:具备较强的全局观与系统化分析问题的能力;拥有良好的沟通协作能力与自驱力,乐于接受技术挑战,能够快速学习并落地新技术。
6、加分项(具备以下一项或多项经验者优先):
云原生与集群调度:熟悉Kubernetes、Docker等云原生技术,有K8s源码阅读或二次开发经验,了解拓扑感知调度、弹性伸缩等资源管理技术;训练与推理框架:有PyTorch、Megatron、DeepSpeed、TensorRT、FasterTransformer、vLLM、TensorRT-LLM、SGLang等框架的使用经验,或了解常用AI算法网络及底层源码;底层优化与硬件:有服务器AI芯片、GPU加速经验,或具备芯片迁移与调优经验;熟悉PD分离、KV Cache等推理核心优化技术。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →