岗位描述
岗位职责:
1、生物大模型底座建设:牵头构建企业级生物大模型底座(蛋白语言模型/多模态模型),负责模型架构选型、训练范式设计与可扩展训练框架搭建,支撑酶改造、抗体设计等核心业务场景;
2、训练与微调体系:设计并实现预训练、指令微调与参数高效微调策略,建立稳定的训练与评估流程,提升模型在酶改造、抗体设计等任务上的泛化能力与可解释性;
3、生物数据体系建设:与AI蛋白设计科学家协作,制定生物数据与质量标准,建设数据清洗、去重、标注、采样、版本管理与追溯体系,沉淀可复用训练数据资产;
4、计算平台搭建:搭建生物大模型的计算平台,统一提供模型训练与推理能力,包含任务调度、批量推理、缓存与并发管理、容错机制、日志与监控、资源与成本管控等模块,支持平台化调用与多项目复用,保障交付稳定性与成本可控;
5、跨团队协作与赋能:与生物、实验、平台团队协作,明确接口与交付物,推动模型能力在项目中落地形成闭环;沉淀最佳实践并指导团队成员;
任职要求 :
1、 博士及以上学历,计算机科学、机器学习、人工智能相关专业,211/985优先;
2、 具备深度学习与大模型训练经验,熟悉PyTorch等框架,掌握分布式训练、混合精度、并行策略与训练稳定性调参;
3、 具备大模型微调经验,理解泛化、过拟合控制与评估设计,能独立完成从数据到模型到指标的闭环;
4、 具备工程化能力,熟悉Linux与GPU训练环境,具备训练管线、推理服务、模型版本管理等实践经验;
5、 具备与生物科学家高效协作能力,理解生物数据特点与噪声来源,能将需求转化为清晰的任务定义与技术方案;
6、 良好的沟通表达与项目推进能力,能牵头跨团队协作并对交付质量负责;