岗位描述
岗位职责
你将聚焦于大模型 Agent 在真实业务场景中的算法设计与评估问题,推动 Agent 从 "可用" 走向 "稳定与可控",具体包括:
1. 设计并优化 Agent 与 RAG 相关算法方案,提升复杂任务下的准确性、稳定性与泛化能力。
2. 围绕 Agent 行为、模型输出质量与幻觉问题,设计系统化的评测方法(Evals),包括评测集、指标与自动化评估流程。
3. 探索并推进多模态 Agent 技术的业务落地,设计多模态(文本、图像、语音、视频、文档等)输入理解与融合方案,提升 Agent 在跨模态场景下的感知、推理与交互能力;针对多模态场景设计评测方法,覆盖模态对齐质量、跨模态幻觉检测与多模态任务完成率等维度。
4. 结合业务场景,探索模型微调、Prompt 策略或强化学习等方法,持续改进 Agent 表现。
5. 跟踪并复现 LLM / Agent 领域前沿研究,将有效方法转化为可落地的算法方案。
6. 输出算法相关成果,包括技术分享、内部文档、专利或论文(如适用)。
岗位要求
1. 计算机、人工智能、数学等相关专业硕士及以上学历,博士优先。
2. 在机器学习 / 深度学习 / LLM 方向有较扎实的理论基础和实践经验。
3. 有 Agent / RAG / 模型微调 / LLM 评测 中至少一个方向的深入实践经验。
4. 熟悉多模态大模型(VLM / 多模态 LLM)相关技术,有多模态理解、生成或跨模态融合方向的研究或工程经验者优先。
5. 具备良好的编程能力,熟练使用 Python,能够独立完成算法实验与验证。
6. 能够围绕实际问题设计评测方案并驱动算法改进,具备良好的问题拆解能力。