岗位描述
Build and operate pipelines for structured domain data (onboarding events, customer/entity data, credit facilities/exposures, limits, risk grades, portfolio hierarchies, performance and arrears). Build unstructured data pipelines for domain documents (KYC documents, corporate registries extracts, credit memos, financial statements, portfolio review materials): parsing, metadata enrichment, deduplication and retention handling. Develop embedding/vectorisation pipelines and manage vector indices with refresh and deletion strategies aligned to data governance. Implement data quality, observability and lineage: automated testing, SLAs, anomaly detection, monitoring and runbooks. Apply privacy-by-design: PII handling, masking/tokenisation where required, access controls and audit trails. Implement dataset versioning and reproducibility (snapshots, schema evolution, data contracts) to support repeatable evaluations. Partner with Agent Engineers and stakeholders to define data requirements and evaluation datasets; close feedback loops from production retrieval/agent performance. Support production operations and continuous improvement of data services powering AI. Delivering reliable, fresh, well-governed datasets and indices used by KYC, credit and portfolio AI solutions. Improving retrieval relevance and answer grounding by strengthening metadata, chunking inputs, and data quality. Reducing operational incidents through strong testing, monitoring, and disciplined change management. Making AI datasets reproducible and auditable to support reviews and control expectations. Experience working with sensitive data domains (KYC/AML, credit risk) and implementing controlled access patterns. Experience with feature stores or MLOps-style dataset management.