岗位描述
如果你对通用人工智能(AGI)充满热情,渴望在本科阶段就触碰最前沿的AI技术,而不只是停留在跑通别人的开源Demo……欢迎加入我们的课题组!
我们致力于探索大语言模型的对齐算法、复杂智能体架构,以及AI在交叉领域(如智慧教育、复杂博弈)的真实落地。无论你是想为将来的读研深造铺路,还是想体验最硬核的AI研发,这里都有适合你的舞台。
我们正在攻克的方向(可任选其一或跨界探索):
1. 大模型长程强化学习训练 (Long-Horizon RLHF & Alignment)
大模型如何才能在复杂任务中进行长链条推理而不“幻觉”?
你将接触:
超越基础的SFT(监督微调),探索强化学习在大模型对齐中的应用;研究GRPO等前沿策略优化机制与奖励模型(Reward Model)的设计。
科研关键词: RLHF, GRPO, DeepSpeed/Megatron, 复杂推理。
2. Agent 架构创新与推理世界模型 (Agent Architecture & World Model)
未来的AI不仅能“说”,还要能自主“规划”和“行动”。
你将接触:
设计下一代多智能体(Multi-Agent)协作架构,突破现有Agent在反思与纠错上的瓶颈;探索世界模型与agent的混合应用
科研关键词:
Multi-Agent, MCTS, 推理期计算 (Inference-Time Compute), 世界模型 (World Models)。
3. 拟真智能体行为模拟
让大模型真正懂“人”,并在虚拟与现实的交互中展现情感与逻辑。
你将接触:
研究具有苏格拉底式启发能力的AI大脑,建立针对特定领域的认知评测基准(Benchmark);或探索在虚拟环境(如游戏NPC)中,如何利用大模型驱动具备情感陪伴与动态博弈能力的拟真智能体。
科研关键词:启发式对话, 拟真行为模拟, 认知推理基准。
我们希望你:
针对大一、大二同学,我们不苛求你现在就是“技术大佬”,我们更看重你的底层代码能力、学术好奇心和强大的自驱力。
基本功扎实: 熟练掌握 Python,了解基础的数据结构与算法;具备一定的高数/线代/概率论基础。
阅读与钻研: 有不错的英语阅读能力,不畏惧硬啃顶会(如 ACL, NeurIPS, ICLR)的英文文献。
加分项(非必须,但很拉好感):
接触过 PyTorch 等深度学习框架。
对特定领域(如强化学习、教育心理学、游戏AI设计)有自己独特的思考和强烈兴趣。
有自己的 GitHub 练手项目或技术博客。
在这里,你将获得:
1. 手把手的科研引路: 告别“放养式”实习。资深学长/博士生带你从读Paper、写代码、设计实验到分析数据,走通完整的科研全生命周期。
2. 硬核的算力与工程经验: 提供充足的 GPU 算力支持,让你有机会实操工业级的大模型分布式训练框架,积累极其宝贵的实战工程经验。
3. 高质量的产出机会: 表现优异并做出实质贡献的同学,将深度参与核心论文的撰写,共同冲击自然语言处理/人工智能领域的顶级学术会议。
4. 自由极客的团队氛围: 鼓励提出天马行空的想法,即使它听起来很“疯狂”。