岗位描述
岗位职责
CatPaw 是面向工作与生产场景的 AI Agent 产品矩阵,覆盖通用办公、云端助理、AI 编程、NoCode 应用生成及企业级 Agent 平台。我们正在寻找一位对 AI 产品效果高度敏感、兼具产品判断力和技术理解力的产品经理。你将负责 CatPaw 系列产品的效果评测、同类产品对标和持续调优,建立从“发现差距—定位原因—推动优化—验证结果”到“沉淀标准”的完整闭环。
1、负责 CatPaw 系列产品的效果评测体系建设,覆盖通用办公 Agent、云端助理、Coding Agent、NoCode 及企业级 Agent 等产品方向。
2、根据真实用户场景建立任务分类、评测数据集、评分标准和基准线,持续完善离线评测、人工评测、自动化评测和在线效果观测机制。
3、持续跟踪国内外主流 AI Agent 产品,设计公平、可复现的横向对比方案,评估任务完成质量、成功率、稳定性、交互体验、执行效率、成本及安全性等关键维度。
4、深入分析评测失败案例和用户负反馈,结合会话、Trace、模型输出及工具调用过程,判断问题来自模型、Prompt、上下文、知识库、工具、Skill、执行环境还是产品交互。
5、与算法、研发、设计及业务团队协作,推动模型策略、Agent Harness、Prompt、Context、Memory、RAG、工具调用和交互体验等方向的调优。
6、设计并推动 A/B 实验、回归测试和版本验收,验证优化方案的真实收益,避免局部指标提升但整体用户体验下降。
7、将评测结果转化为清晰的产品判断和优先级建议,为产品路线图、模型选型、能力建设及版本发布提供决策依据。
岗位要求
1、3 年以上 AI、开发者工具、企业软件或效率产品相关经验,其中至少 1 年大模型或 AI Agent 产品经验。
2、深度使用过多款国内外大模型及 Agent 产品,能够识别“看起来能完成”和“真实场景下稳定完成”之间的差异。
3、理解大模型及 Agent 的基本工作机制,熟悉 Prompt、Context、RAG、Memory、Tool Calling、MCP、Skills、Sandbox 等概念。
4、具备较强的评测设计能力,能够将模糊的“效果好不好”拆解为可执行的测试任务、评价维度和度量指标。
5、具备良好的数据分析和问题归因能力,能够从大量案例中识别共性问题,并提出可验证的优化假设。
6、有较强的动手能力和好奇心,愿意高频体验产品、复现问题,并持续跟踪快速变化的 AI 产品与技术趋势。
岗位亮点
1、站在 AI Agent 产品演进的一线,持续体验和研究全球优秀产品,定义什么是“真正好用的 Agent”。
2、不只是发现问题和输出报告,还能深入 Agent 核心链路,直接推动模型、Prompt、Context、Memory、工具与交互体验优化。
3、评测结论将直接影响产品路线、模型选型和版本发布,能够把个人的产品判断沉淀为 CatPaw 的产品标准。
4、与优秀的产品、算法和工程团队紧密协作,共同探索企业级 AI Agent 的能力边界。