
de skillsbench1,301
Compétence d'ingénierie des données prête pour la production pour la conception de pipelines ETL/ELT et de streaming en temps réel, la qualité des données et l'optimisation des performances des pipelines.
Fournit une boîte à outils complète d'ingénierie des données axée sur la production : génération de DAG Airflow, squelettes de jobs de streaming (Flink/Spark), générateurs de configuration Kafka, validation de la qualité des données et analyse des performances. Il aide à construire des pipelines ETL/ELT de bout en bout et des architectures de streaming en temps réel avec surveillance et intégration CI/CD.
Utilisez cette compétence lorsque vous devez concevoir ou implémenter des pipelines de données de production (batch ou streaming), ajouter des contrôles automatisés de qualité des données, créer des squelettes de jobs streaming/Flink, générer des configurations Kafka, ou profiler et optimiser les performances des pipelines. Idéal pour l'ETL d'entreprise, la construction de data-lake/warehouse et l'infrastructure de données ML de production.
Idéalement conçu pour les agents capables d'exécuter des outils Python et de s'intégrer aux systèmes Git/CI (Copilot/assistants de code, Claude Code/Cursor), et pouvant fonctionner avec des piles de données conteneurisées ou cloud.
Compétence complète d'ingénierie des données couvrant l'ETL, le streaming, Kafka, Flink et la qualité des données. SKILL.md est bien structuré et détaillé (plus de 23k caractères). Cependant, 4 des 6 scripts sont des stubs cassés — ils définissent des classes avec __init__(config: Dict) mais main() passe args.target comme argument positionnel et appelle tool.run() qui n'existe pas (devrait être tool.process()). Seuls kafka_config_generator.py et stream_processor.py sont substantiels et fonctionnels. Le générateur de config Kafka est véritablement utile avec un support CLI multi-mode.
La compétence a une largeur de documentation impressionnante mais la profondeur d'implémentation est inégale. Les 4 scripts stubs sont clairement du boilerplate généré par modèle qui n'a jamais été rempli — ils partagent une structure identique et présentent tous le même bug (appel de .run() au lieu de .process()). kafka_config_generator.py (18k) et stream_processor.py (60k) constituent la valeur réelle. La compétence gagnerait à compléter les stubs ou à les supprimer.