岗位描述
岗位职责
负责生物医药领域专有AI模型的研发、训练和验证,面向靶点发现、蛋白结构预测、蛋白/抗体生成设计、分子生成、亲和力与药效预测、成药性评价及细胞药物功能预测等关键任务,构建具有自主知识产权、能够在真实药物研发场景中产生有效预测和设计结果的专业模型。
本岗位的核心工作是类似AlphaFold、RFdiffusion、ProteinMPNN及药效预测模型的底层模型研发:从科学问题定义、训练数据建设、模型架构设计和大规模训练,到干实验评测、湿实验验证和模型持续迭代。所研发模型将作为AI Scientist平台的核心能力,被药物设计、药效评价、靶点发现及CAR-T研发智能体调用。
1. 生物医药专有模型规划与研发
与药物科学家、生物信息团队和实验团队共同识别关键研发问题,将科学问题转化为明确的模型任务、输入输出、训练目标和评价指标。
面向小分子、大分子和细胞药物规划专有模型体系,明确自研、微调、迁移学习、模型融合及第三方模型使用边界。
跟踪蛋白结构预测、生成式蛋白设计、分子生成、几何深度学习、多模态生物模型和药效预测等前沿技术,完成模型复现、比较、改进和创新。
形成从数据、模型、训练、评测到实验验证的完整研发方案,并推动研究原型转化为稳定可用的算法能力。
2. 蛋白结构预测与蛋白/抗体生成设计
研发或优化蛋白单体、蛋白复合物、抗原—抗体/结合域复合物的结构预测和相互作用建模能力。
基于蛋白语言模型、图神经网络、几何深度学习、扩散模型、流模型或反折叠模型,开展蛋白、抗体、纳米抗体和结合域的序列与结构生成。
研发结构条件生成、表位约束设计、骨架生成、序列设计、侧链优化和复合物界面设计等模型。
针对亲和力、特异性、稳定性、免疫原性、溶解性、聚集倾向及可制造性开展多目标生成和优化。
复现并改进AlphaFold/AlphaFold-Multimer、RFdiffusion/RFantibody、ProteinMPNN、BindCraft、Boltz等模型或技术路线,形成适用于实际项目的数据、训练和推理方案。
面向CAR-T场景,支持结合域设计、抗原识别、表位可及性、脱靶风险及多特异结合方案的模型研发。
3. 小分子生成与药效/性质预测
研发基于图神经网络、Transformer、扩散模型或其他生成模型的小分子生成、结构优化和候选筛选能力。
建设靶点条件分子生成、3D构象生成、蛋白—配体结合建模、虚拟筛选和结合模式预测模型。
研发活性、亲和力、选择性、脱靶、ADMET、药代、毒性、合成可行性及其他理化/成药性指标预测模型。
建设多任务、多目标和小样本学习能力,处理不同实验体系、测量条件和数据来源造成的标签差异与分布偏移。
结合不确定性估计、校准和适用域判断,为候选排序和实验优先级提供可信的模型输出。
4. 细胞药物与CAR-T功能预测
融合结合域、CAR结构域、共刺激域、启动子、制造工艺及细胞表型等信息,研发CAR-T构件和功能预测模型。
建设体外杀伤、细胞毒性、紧张性信号、非特异激活、耗竭倾向、扩增、持久性及安全性等指标的预测能力。
研究序列、结构、构件、工艺参数和实验表型的联合表征,支持“结合域—CAR结构—制造工艺”组合的多目标评价和优化。
针对CGT数据量小、实验条件不一致和标签稀疏等特点,应用迁移学习、多任务学习、弱监督、元学习或贝叶斯方法提升模型效果。
配合复星真实研发管线,支持Top 100/Top 10组合筛选、结合域优化候选及Top 5湿实验候选的模型评价。
5. 多组学与靶点发现模型
整合基因组、转录组、单细胞、蛋白组、通路网络、组织表达、疾病机制及临床前数据,研发候选靶点发现与排序模型。
建设疾病相关性、组织/细胞特异性、表面可及性、可调控性、成药性、毒性风险和临床转化可行性等预测能力。
研究多组学表征学习、图学习、因果推断、跨模态对齐和患者分层方法,支持不同药物模态的靶点优选。
输出具有置信度、不确定性和适用范围的候选靶点评分,为下游药物设计模型提供可靠输入。
6. 训练数据与生物医药数据工程
负责公开数据库、文献专利、合作方数据和内部实验数据的训练集建设,包括数据清洗、标准化、实体对齐、去重、标签定义和质量控制。
建立分子、序列、结构、复合物、多组学、药效和实验数据的统一样本规范与数据版本体系。
识别数据泄漏、同源序列泄漏、时间穿越、实验批次效应、类别不平衡和标签噪声,设计合理的数据拆分与控制方法。
建设预训练、微调、评测和外部验证数据集,确保训练数据来源、处理过程和使用范围可追溯。
与实验团队共同规范样品、实验条件、测量单位和关键readout,使新增湿实验数据能够用于模型训练和验证。
7. 模型训练与大规模计算
使用PyTorch、JAX或同类框架完成模型设计、训练、调试、性能分析和实验管理。
负责单机多卡及多机多卡训练,优化数据加载、显存使用、混合精度、并行策略、训练稳定性和计算效率。
根据模型规模和任务特点应用数据并行、模型并行、张量/流水线并行、梯度累积、检查点和容错恢复等技术。
建设可复现的训练流水线,管理代码、数据、配置、模型权重、随机种子和实验结果。
与平台工程师协作完成GPU集群、国产算力或超算环境部署,优化训练与推理成本、吞吐和时延。
将研究模型封装为稳定的推理服务或批量计算工具,供AI Scientist平台和下游智能体调用。
8. 模型评测与湿实验闭环
建立与具体科学任务匹配的模型评测体系,避免仅使用通用机器学习指标评价实际药物研发价值。
针对结构预测、生成设计、亲和力、药效、ADMET和细胞功能等任务建设独立测试集、回顾性基准和外部验证集。
评价模型的准确性、富集能力、生成有效率、新颖性、多样性、可开发性、校准程度、适用域和不确定性。
与领域专家对模型结果进行科学审查,分析错误案例、分布外样本、失败模式及模型捷径。
通过SPR/BLI、生化、细胞和动物实验验证模型预测与生成结果,开展预测—实验差异分析。
将湿实验结果持续回灌训练数据,结合主动学习和贝叶斯优化选择高信息量实验,形成“预测—验证—再训练”的迭代闭环。
岗位要求
1. 基本要求
硕士及以上学历;计算机、人工智能、机器学习、生物信息学、计算生物学、计算化学、结构生物学、药物化学或相关专业,博士优先。
具备3年以上生物医药AI、AI for Science、计算生物学或AI药物设计模型研发经验;优秀博士毕业生可适当放宽工作年限。
熟练掌握Python,以及PyTorch、JAX或TensorFlow中的至少一种深度学习框架。
具备独立完成数据准备、模型设计、训练、调参、评测、错误分析和部署的完整能力。
熟悉Transformer、图神经网络、几何深度学习、扩散/生成模型、多任务学习或自监督学习中的一种或多种。
了解分子、蛋白序列、三维结构或多组学数据中的至少一种,并具有实际建模经验。
具备扎实的机器学习、概率统计和实验设计基础,能够正确处理数据泄漏、偏倚、不确定性和分布外泛化问题。
能够阅读并复现英文论文,持续跟踪生物医药AI领域前沿模型和数据集。
具备良好的科研协作和沟通能力,能够与药物科学家、生物信息人员和实验团队共同定义问题、分析结果和推动验证。
2. 重点能力要求
候选人应在以下至少一个方向具备较深入的研发与模型训练经验:
蛋白结构与生成设计: 蛋白结构/复合物预测、蛋白语言模型、几何深度学习、扩散生成、反折叠、抗体或蛋白界面设计。
小分子设计与药效预测: 分子生成、虚拟筛选、蛋白—配体建模、QSAR、活性/亲和力、ADMET、毒性或合成可行性预测。
多组学与靶点发现: 单细胞/多组学建模、通路网络、图学习、因果推断、靶点优选或患者分层。
细胞药物建模: CAR-T/细胞治疗构件、细胞功能、制造工艺与实验表型联合建模。
五、优先条件
参与过AlphaFold、RoseTTAFold、ESMFold、Boltz等结构预测模型的训练、微调、复现或改进。
参与过RFdiffusion/RFantibody、ProteinMPNN、BindCraft、蛋白语言模型或抗体生成设计模型的训练与应用。
具有分子图模型、3D分子生成、蛋白—配体打分、药效/ADMET预测或生成式化学项目经验。
具有大规模预训练、分布式训练、GPU集群、超算或国产算力适配经验。
熟悉RDKit、Biopython、PyTorch Geometric、DGL、DeepChem、OpenMM、Rosetta等工具。
具有PDB、UniProt、OAS、SAbDab、ChEMBL、PubChem、BindingDB等生物医药数据处理经验。
具有SPR/BLI、生化、细胞或动物实验数据建模及干湿实验闭环经验。
具有药企、CRO/CDMO、生物科技公司或AI药物研发公司工作经验。
在机器学习、计算生物学、结构生物学或药物发现相关会议和期刊发表过论文,或拥有相关发明专利。
具有从研究原型到真实药物研发项目交付的模型产品化经验。