岗位描述
岗位职责
负责AI Scientist平台的前后端开发、系统集成和工程化交付,将大语言模型、智能体、知识图谱、专业药物研发模型、科研工具及实验数据组织成稳定、易用、可扩展的软件系统。
本岗位一方面建设可支持小分子、大分子和细胞药物的通用平台能力,包括智能体注册与编排、异步计算任务、科研数据管理、结果可视化、权限审计、运行监控和多环境部署;另一方面围绕CAR-T真实研发管线完成客户需求落地、数据与工具接入、候选报告、专家评审和实验反馈闭环;
1. AI Scientist平台全栈开发
参与AI Scientist平台架构设计,负责核心前端、后端服务和平台公共组件的开发、测试、发布及持续迭代。
建设面向科研人员的产品界面,包括研发任务创建、参数配置、智能体对话、工作流执行、工具调用、候选方案比较、证据追溯、专家评审和实验结果回传等功能。
开发复杂科研结果的交互与可视化能力,支持分子、序列、蛋白/复合物结构、CAR构件、靶点网络、候选排序、评价指标和实验结果等信息的展示与比较。
建设稳定、清晰的后端API和领域服务,支持靶点、候选分子、序列/结构、药物构件、实验任务、证据、报告和用户项目等核心对象的管理。
与产品、算法和药物研发团队共同完成需求分析、技术方案、迭代开发和验收,推动科研原型转化为可持续交付的软件产品。
2. 智能体工作流与工具平台建设
开发智能体任务管理和工作流编排能力,支持任务拆解、智能体协作、工具选择、参数传递、状态流转、人工审核、失败重试和结果汇总。
对接大语言模型、RAG、知识图谱、多智能体框架及算法服务,封装统一的调用接口、上下文管理、流式输出和结果持久化能力。
建设专业模型和科研工具接入框架,支持多组学分析、分子生成、虚拟筛选、结构预测、蛋白/抗体设计、复合物建模、亲和力、ADMET、免疫原性、脱靶和CAR-T功能预测等工具。
处理本地程序、Python服务、容器化工具、远程API及超算任务等不同类型的计算资源,实现统一注册、参数校验、任务调度、运行状态和输出解析。
建设长耗时异步任务、消息队列、任务优先级、并发控制、超时终止、断点恢复、失败重试和结果缓存机制。
保留智能体推理过程、工具调用记录、模型版本、输入参数、数据来源及结果文件,保障科研任务可追溯、可复核和可重现。
3. 多药物模态数据与结果工程
协同数据和知识图谱团队,建立适用于小分子、大分子和细胞药物的统一数据接口与文件管理能力。
支持SMILES/SDF等小分子数据、FASTA等序列数据、PDB/mmCIF等结构数据,以及多组学、实验和临床相关表格或文件的上传、解析、校验、存储、预览和下载。
实现靶点、分子、序列、结构、CAR构件、制造工艺、实验表型、疗效与安全性等数据对象之间的关联查询和版本管理。
建设统一结果与报告服务,将算法输出转换为候选清单、排序、置信度、证据链、风险提示、失败模式、实验建议和标准化报告。
处理大文件、批量任务及多版本结果,确保跨智能体、跨工具和跨研发阶段的数据能够准确传递和追踪。
4. 商业项目交付
支持客户内部靶点、结合域、CAR结构、制造工艺、历史实验及后续临床相关数据的安全接入和项目化管理。
开发并交付ABC组合推荐与筛选、结合域评价与优化、Top 100/Top 10/约50个优化候选/Top 5候选管理等业务功能。
建设专家评审、评分意见、差异分析、候选状态、湿实验结果和模型反馈回写等闭环功能。
配合项目经理和产品经理完成客户现场调研、演示、部署、测试、培训、问题排查、版本发布和阶段验收。
根据客户数据边界和部署环境,完成公有云、私有云或本地化部署,并做好客户数据、通用平台数据和科研数据的隔离。
5. 平台支撑
支持药物设计、药效评价、靶点发现及端到端智能体四阶段研发成果的平台集成和软件化交付。
建设可复用的智能体、工具、数据、任务和评测模块,支持小分子、大分子及细胞药物不同研发场景快速配置和扩展。
支持平台功能数、任务成功率、研发效率、工具调用稳定性、用户数量和企业落地等指标的数据采集、统计和验收举证。
配合完成真实管线回测、第三方测试、示范企业接入、技术报告、软件著作权及项目验收材料准备。
支持与科学智能体操作系统或其他平台进行标准化接口对接,实现能力注册、发现、调用、日志追溯和运行审计。
6. 系统质量、安全与运维
建设用户、组织、项目、角色及细粒度数据权限体系,支持最小权限、项目隔离、敏感数据脱敏和操作审计。
完善单元测试、集成测试、接口测试和端到端测试,建设持续集成、自动发布和版本回滚机制。
建设日志、指标、链路追踪、告警和运行看板,快速定位模型调用、工具执行、数据处理和系统性能问题。
优化大规模并发任务、长耗时计算、大文件传输、查询检索和报告生成的性能与可靠性。
编写并维护系统架构、接口、部署、运维、故障处理和用户操作文档。
岗位要求
1. 基本要求
本科及以上学历,计算机、软件工程、人工智能、数据科学或相关专业。
具备5年以上全栈、后端或平台工程开发经验,具有复杂企业级系统从设计、开发到上线交付的完整经历。
熟练掌握至少一种主流前端技术栈,如React、Vue及其生态,具备复杂表单、数据表格、流程状态和可视化界面的开发经验。
熟练掌握Python、Java、Go等至少一种后端技术栈,具备RESTful API或其他服务接口的设计和开发能力。
熟悉关系型数据库和缓存技术,能够进行数据模型设计、查询优化、事务处理和版本迁移;了解文档数据库、图数据库或向量数据库中的一种或多种。
熟悉Linux、Git、Docker及基本CI/CD流程,能够独立完成服务部署、运行排查和性能分析。
具备良好的工程质量意识,重视代码规范、测试、文档、可维护性、兼容性和安全性。
具备良好的沟通和协作能力,能够与产品经理、算法工程师、数据工程师、药物科学家及客户技术团队共同推进项目。
2. 核心技术能力
理解大语言模型应用、RAG和智能体系统的基本架构,熟悉模型API调用、Prompt上下文、流式响应、工具调用和任务状态管理。
具备异步任务、消息队列、分布式任务调度、任务重试、幂等控制和状态一致性等工程经验。
具备第三方算法、命令行工具、Python程序、容器服务或外部API的集成经验,能够处理复杂输入输出和异常场景。
具备身份认证、权限控制、数据隔离、审计日志及敏感信息保护等企业级系统开发经验。
能够针对科研计算和AI服务的不确定性设计合理的错误提示、人工介入、过程追踪和结果复现机制。
优先条件
具有AI平台、大模型应用、智能体平台、工作流平台、机器学习平台或科研计算平台开发经验。
具有药企、CRO/CDMO、生物科技公司、生命科学软件或实验室数字化项目经验。
熟悉RDKit、Biopython、PyMOL/Mol*、3Dmol.js、NGL Viewer等化学、生物信息或结构可视化工具。
了解SMILES、SDF、FASTA、PDB/mmCIF、VCF或常见多组学数据格式,并有相关解析和展示经验。
具有Neo4j等图数据库、Elasticsearch/OpenSearch、向量数据库或知识图谱应用经验。
具有Kubernetes、GPU任务、Slurm/超算调度、对象存储、大规模异步计算或MLOps经验。
具有私有化部署、离线环境交付、信创环境适配或医药行业数据安全项目经验。
参与过真实客户交付、第三方软件测试、国家科技项目或软件著作权材料准备。