岗位描述
工作职责
1. 负责 Android/Linux/RTOS 平台终端设备的 系统稳定性 整体把控,建立并推动稳定性指标体系持续达标;
2. 主导 系统级疑难问题 的分析与解决,包括但不限于 Kernel Panic、Native Crash、ANR、Watchdog、OOM、冻屏、死机等;
3. 参与 硬件相关稳定性问题 的定位与闭环,包括 DDR 信号完整性、电源纹波、时钟抖动等硬件因素引发的系统异常,协同硬件团队推动解决;
4. 推动平台 可靠性设计,包括异常恢复机制、看门狗策略、子系统降级与隔离、核间通信超时重传等容错设计;
5. 搭建 log 采集与智能分析平台,利用 AI技术实现 crash log 的自动分类、聚类分析和根因推荐,提升问题定位效率;
6. 对接终端客户,提供稳定性问题的 技术支持与联合调试,支撑客户量产阶段的稳定性达标;
7. 建立稳定性 案例库与复盘机制,沉淀分析方法论,防止问题复发。
工作要求
1. 本科及以上学历,计算机科学、电子工程、自动化等相关专业,5 年以上相关工作经验;
2. 精通 Android/Linux 系统架构,熟悉 RTOS 系统机制者优先;
3. 深入理解 Linux 内核核心子系统:进程调度、内存管理、文件系统、IPC 机制、电源管理、中断子系统等;
4. 深入理解 Android Framework 核心服务:AMS、WMS、PMS、SystemServer、Zygote、Binder 通信机制等;
5. 具备丰富的系统级问题调试经验,能熟练分析 tombstone、ANR trace、kernel log、sysdump、perf、ftrace、perfetto等调试信息;
6. 熟悉JTAG、Trace32、示波器、逻辑分析仪,能配合硬件团队定位硬件相关稳定性问题;
7. 具备扎实的 C/C++ 编程能力,熟悉 Java/Kotlin,能阅读和修改 Framework 及 Native 层代码;
8. 了解 RTOS 的任务调度、内存保护、异常处理机制,有 RTOS 稳定性问题定位经验者优先;
专业要求
计算机科学、电子工程、自动化等相关专业