岗位描述
岗位职责
负责 Migoo AIGC 创意生成 Agent 的系统设计与核心算法研发,聚焦利用现有基础模型构建用户友好的 AI 创作体验,覆盖图片生成、视频生成、多模态内容创作等方向
设计对话驱动的自主创作工作流:从用户自然语言描述 → 意图理解 → 场景规划 → 分镜/构图编排 → 多步骤内容生成 → 成片/成品交付的全链路 pipeline
负责视频创作 Agent 的核心算法研发,提升模型在内容理解、生成、编辑、控制等能力上的表现,覆盖文本生成视频(T2V)、图像生成视频(I2V)、视频编辑及多模态生成等方向
优化生成内容的可控性与稳定性,包括角色一致性、风格一致性、动作合理性、多镜头连贯性、身份一致性等用户体验关键指标
参与训练数据建设,包括数据挖掘、清洗、筛选、标注、对齐、去重、增强及自动化合成等
建立和迭代 AIGC 生成效果评测体系,关注画质、语义一致性、动作合理性、时序一致性、身份一致性、生成速度等指标
探索和优化 Prompt Engineering、Few-shot / In-context Learning、多轮迭代优化等策略,持续提升基础模型的输出质量和可控性
推动模型推理和服务性能优化,提升首帧速度、吞吐、资源利用率及大规模在线服务能力
跟踪 Diffusion、Transformer、多模态大模型、强化学习及视频/图像生成领域的前沿技术,完成技术验证并推动业务落地
与产品、设计、工程及内容团队协作,将业务需求转化为算法方案,负责线上效果监控、问题分析和持续迭代
任职要求
计算机科学、人工智能、计算机视觉、机器学习或相关专业,硕士及以上学历
扎实的深度学习和大语言模型基础,熟悉 Transformer、Diffusion Model 等主流生成模型架构
在 LLM-based Agent 系统设计、多模态理解、工具调用(Function Calling)方向有实际项目经验
在图像生成、视频生成、视频理解、多模态学习中至少一个方向有实际项目经验
熟悉主流生成技术栈(如 Stable Diffusion、SDXL、Flux、SVD、CogVideo、HunyuanVideo 等),具备模型调用、集成、微调和优化经验
熟练掌握 Python、PyTorch,熟悉 Linux 开发环境
能够独立完成方案设计、数据处理、系统搭建、效果评测及工程部署全链路
优秀的学习能力和自驱力,对 AIGC 应用层创新和创意内容生成方向有浓厚兴趣
优先条件
有 T2V、I2V、视频编辑、数字人、角色一致性、可控视频生成的实际应用经验
有 LLM-based Agent 工作流开发经验,尤其是多步骤任务编排、状态管理和错误恢复机制
有 Prompt Optimization、Reward Modeling、RLHF 等大模型后训练经验
有大规模视频数据集构建、数据清洗、自动标注及质量评估经验
有视频生成模型推理加速经验(量化、蒸馏、剪枝、算子优化或分布式训练)
有大规模用户场景下的 AI 产品设计经验,关注用户体验和数据驱动迭代
在 CVPR / ICCV / ECCV / NeurIPS / ICML / AAAI 等顶会发表论文,或参与过知名生成模型开源项目