岗位描述
岗位职责
1. 标准化集成与封装
● 将模型与工具封装为统一契约的平台能力:明确输入输出格式、参数语义、资源需求和失败行为。
● 构建可复现的运行环境,完成容器化打包、依赖固化和版本管理。
● 处理不同工具在数据格式、坐标体系、单位、命名规范上的差异,建立统一的数据转换层。
● 沉淀集成模板与脚手架,使同类工具的接入成为标准化流程而非一次性工作。
2. Workflow 编排与规模化
● 将多个模型与工具编排为端到端流水线,支持多步依赖、并行执行、断点续跑和失败重试。
● 设计批量任务与参数扫描能力,支撑大规模筛选、多靶点并行和高通量计算场景。
● 优化计算资源使用:合理规划 CPU / GPU / 内存 / 本地存储配置,控制墙钟时间与成本。
● 与平台架构和后端团队协作,将 Workflow 接入调度系统、任务队列、存储和结果展示模块。
3. 科学正确性验证与测试
● 为每一项集成能力建立基准数据集与预期结果,验证输出的科学合理性而不只是“能跑通”。
● 建立回归测试机制,保证版本升级、依赖变更和环境迁移不引入静默错误。
● 与业务方共同定义验收标准,明确适用范围、已知局限和不应使用的场景。
● 记录验证结果、参数选择依据和已知问题,形成可审计的交付文档。
这个岗位的核心不是把命令行工具包起来,而是保证平台上跑出来的每一个结果,业务方可以放心用于决策。
4. 交付流程标准化与产能提升
● 梳理并优化从需求受理、选型、开发、测试到上线的完整交付流程,识别瓶颈并持续改进。
● 建立模板、脚手架、自动化测试和 CI/CD,把重复工作交给自动化。
● 按复杂度对交付单元分级排期,维护交付清单与进度可见性。
● 与 PM、QA / 运维协作,落实测试覆盖、发布检查清单和上线规范。
5. 模型与工具调研、评估与选型
● 跟踪药物发现、结构生物学、组学分析和化学信息学领域的模型与工具进展,评估其成熟度与适用性。
● 基于真实业务需求,对候选工具做能力、性能、许可、依赖复杂度和维护成本的综合评估。
● 独立跑通候选工具,复现论文或官方基准结果,判断其在内部数据条件下的实际表现。
● 输出选型结论与取舍依据,避免把不可维护或不可验证的工具引入平台。
6. 运行支持与优化
● 监控线上模型与 Workflow 的运行状态、失败率、耗时和资源占用。
● 诊断并修复运行问题,区分环境问题、数据问题、参数问题与工具本身缺陷。
● 收集使用反馈,持续优化参数默认值、文档和交互形式。
● 编写使用说明与最佳实践,支持研发人员自助使用。
岗位要求
● 生物信息学、计算生物学、计算化学、计算机科学、数据科学或相关专业,硕士及以上学历。
● 必须具备生物信息学 / 计算生物学相关工具的实际使用经验,例如以下方向中的一类或多类:
● 序列分析与比对:BLAST、HMMER、MMseqs2、MAFFT 等;
● 测序数据处理与变异检测:BWA、STAR、samtools、GATK 等;
● 组学与单细胞分析:Scanpy、Seurat、DESeq2、limma 等;
● 结构与蛋白计算:AlphaFold、ESMFold、PyMOL、Rosetta 等;
● 分子对接与模拟:AutoDock、Schrödinger 套件、GROMACS、OpenMM、RDKit 等。
● 能够独立阅读工具文档与原始论文,跑通流程、校验输出并判断结果是否科学合理。
● 熟悉工作流引擎:Nextflow、Snakemake、WDL、CWL、Airflow、Argo Workflows 中的一种或多种。
● 具备工程化思维和实际工程经验:熟练使用 Linux 与 Shell,熟悉 Git、Docker / Singularity 容器化、依赖与环境管理(conda / mamba / uv / pixi)、CI/CD 与自动化测试。
● 熟练使用 Python,具备良好的代码组织能力,能够写出可维护、可测试、可交接的代码。
● 具备 HPC 或云端批量计算经验,熟悉 Slurm、LSF、Kubernetes、AWS Batch 等中的一种或多种。
● 具备扎实的统计与数据分析基础,能对计算结果做质量控制和合理性判断。
● 良好的文档与沟通习惯,具备交付节奏意识,能在多任务并行下稳定输出。