岗位描述
工作内容
1. 充分利用trigger的good/bad数据,重建真值,设计完善回流数据pipeline,改善onboard 长尾场景的体验
2. 基于环境模型(vector, neural),进行模型finetune
3. 设计优化训练rollout engine,改善训练效率
4. 设计开发 offline RL, constrained RL, preference learning (RLHF-style), DPO-style fine-tuning等方案优化onboard性能体验
任职条件
工作地可选:保定、北京、上海、苏州、成都、深圳、天津