岗位描述
一、团队与使命
我们是一家国产AI芯片公司的核心推理引擎团队,负责从算子到服务全栈的大模型推理优化。面向2027,我们的核心目标是:
开源引领:主导vLLM、SGLang等顶级开源框架的国产芯片适配与核心特性开发
Day0就绪:在DeepSeek/Qwen等SOTA模型发布当天完成极致性能优化
生态建设:打造易用、灵活、可扩展的推理SDK,赋能全球开发者
你将与顶尖工程师一起,直面千亿参数大模型、无限上下文、多模态融合的硬核挑战。
二、岗位职责
1. 推理引擎核心研发
参与vLLM、SGLang等开源推理框架的定制开发,包括调度器、KV Cache管理、显存优化等
参与高性能算子实现与优化,深入理解Transformer/MoE/MLA等模型在芯片上的运行
2.SOTA模型快速适配
建设自动化模型接入流水线,确保新模型发布当天完成国产芯片适配与性能验证
负责模型精度验证、性能基准测试与瓶颈定位
3.开源社区贡献
向开源项目提交代码(从Bugfix到新特性),逐步成长为社区Contributor
跟踪前沿技术(FlashAttention-3、FP8推理、推测解码等)并落地实践
4.性能优化实战
运用量化、Continuous Batching、PD分离等技术在真实场景中实现推理加速
结合国产芯片架构特性进行算子级调优 开发者生态建设 参与推理SDK设计与开发,编写高质量文档和示例代码,服务全球开发者
三、任职要求
★ 必备基础
2027届本科/硕士/博士,计算机、AI、软件工程、电子等相关专业
扎实的数据结构与算法、操作系统(内存管理、并发、I/O)、计算机体系结构基础
熟练掌握C++ 和Python,编码习惯良好
了解深度学习基础(PyTorch使用、Transformer基本原理)
对LLM/VLM等大模型有基本认知,关注AI前沿
良好的英文文献阅读能力,自驱力强,善于独立解决问题
★ 加分项(非必需,但会让你更闪光)
有GitHub开源项目贡献(哪怕小PR)或个人技术博客
使用过vLLM、SGLang、TensorRT-LLM等推理框架
了解CUDA/OpenCL或国产芯片编程
有模型量化、剪枝、蒸馏等优化实践
有ACM、超算、AI竞赛获奖或相关论文发表
我们更看重你的潜力和热情,而非已有经验。
工作地点:北京 / 上海 / 成都(任选)