Profil représentatif

Ingénieur de données

R. S. · 7+ ans · UTC-3 (BRT)

Disponibilité
Disponible maintenant
Fourchette de tarif
$$ · $70 to $95 / hr
Expérience
7+ ans
Secteurs
Technologie publicitaire, Commerce de détail
  • Python
  • Spark
  • Airflow
  • Snowflake
  • Construit des pipelines Airflow qui échouent bruyamment, réessaient intelligemment et se rattrapent proprement
  • A géré des volumes d'événements à l'échelle de la technologie publicitaire, où le coût et la latence des pipelines comptent tous les deux
  • Modélise les données de l'entrepôt pour que les analystes puissent se servir eux-mêmes au lieu de déposer des demandes

Ce profil illustre le type d’ingénierie de données dont la plupart des entreprises ont besoin dès que les tableaux de bord commencent à se contredire : quelqu’un qui rend les pipelines fiables et l’entrepôt digne de confiance.

Parcours

Sept ans à bâtir des infrastructures de données, d’abord en technologie publicitaire, où les volumes d’événements ne pardonnent pas, puis dans le commerce de détail, où les questions sont commerciales : inventaire, marge et demande. Écrit ses pipelines en Python, utilise Spark quand les données sont réellement volumineuses et s’en passe quand elles ne le sont pas, orchestre le tout avec Airflow et livre le résultat dans Snowflake, modélisé pour les gens qui vont l’interroger. La trajectoire typique de cet archétype commence par l’entretien de scripts écrits par quelqu’un d’autre sur cron, et se termine par la prise en charge de la plateforme que ces scripts auraient dû être.

Ce que couvre réellement le travail

Ingestion et ETL. Extraire des sources que les entreprises ont vraiment : des bases de données transactionnelles par capture de changements, des API tierces avec limites de débit et authentification capricieuse, des flux d’événements, et le dépôt SFTP occasionnel de fichiers CSV qu’un partenaire refuse de moderniser. Le métier consiste à rendre chacune de ces sources idempotente, pour qu’une reprise ne compte jamais en double, et incrémentale, pour qu’une source qui grossit ne fasse pas grossir la facture.

Orchestration. Des DAG Airflow avec des dépendances explicites, une responsabilité claire et des SLA, où un échec alerte quelqu’un capable d’agir. Les rattrapages sont prévus dès le départ : retraiter le mois de mars dernier devrait tenir en une commande, pas en une semaine de chirurgie manuelle. Cet archétype a généralement hérité d’au moins un enchevêtrement de tâches cron interdépendantes et sait exactement pourquoi ce modèle échoue.

Entrepôt et lakehouse. Une modélisation en couches dans Snowflake ou un équivalent : les données brutes telles qu’arrivées, une couche nettoyée et uniformisée, puis des magasins prêts pour les affaires, typiquement bâtis avec des transformations de style dbt pour que la logique soit versionnée et testée. Quand l’historique est volumineux et rarement interrogé, décharger les données froides vers du stockage objet en formats de tables ouverts garde l’entrepôt rapide et la facture raisonnable.

Qualité des données. Des contrôles qui s’exécutent dans le pipeline, pas après les plaintes : comptes de lignes comparés aux attentes, contraintes de nullité et d’unicité, moniteurs de fraîcheur et alarmes de changement de schéma sur les sources. Le réflexe senior consiste à publier les données avec des contrats, pour que les équipes en aval apprennent un changement cassant avant qu’il frappe leur tableau de bord.

Coûts. Les crédits Snowflake et les heures de grappes Spark sont surveillés comme un poste budgétaire. Leviers typiques : dimensionner correctement les entrepôts, éliminer les horaires zombies, éliminer les balayages de tables complètes et passer de grappes toujours actives à du calcul par tâche. Dans les environnements à l’échelle de la technologie publicitaire, le coût du pipeline par événement traité est une donnée de conception, pas une réflexion après coup.

Signes de séniorité

Sept ans d’expérience se manifestent par de la retenue. Des signaux à sonder : la personne peut défendre l’exécution d’une tâche en Python simple avec Postgres plutôt qu’avec Spark, et expliquer le seuil où cela bascule. Elle peut décrire comment elle a rendu un pipeline idempotent et ce que la rupture de cette propriété lui a coûté une fois. Elle a vécu un changement de schéma à la source qui a corrompu des données en aval en silence et peut expliquer comment elle l’a détecté et reconstruit. Elle parle des consommateurs des données aussi facilement que des outils. Les juniors optimisent des requêtes; les seniors réduisent le nombre de pipelines qui doivent exister.

Quoi vérifier si vous embauchez cet archétype

En entrevue, demandez à la personne candidate de concevoir un pipeline quotidien d’une base transactionnelle vers un entrepôt, puis demandez ce qui arrive quand l’exécution du mardi échoue et que personne ne s’en aperçoit avant vendredi. La réponse révèle si elle pense en rattrapages et en idempotence ou seulement en scénarios idéaux. Demandez comment elle détecterait que les chiffres d’hier sont faux avant qu’une partie prenante le fasse. Demandez ce qu’elle ferait d’un tableau de bord que personne n’a ouvert depuis six mois. Signaux d’alarme : proposer une architecture en continu pour des données consommées une fois par jour, n’avoir aucune opinion sur les conventions de modélisation, et considérer la qualité des données comme le problème des analystes.

Adéquation du mandat

Le meilleur contexte est une entreprise dont les rapports ont dépassé ses scripts : un premier véritable entrepôt à mettre sur pied, un parc de pipelines à démêler, ou une équipe de données de une à trois personnes qui a besoin d’un renfort senior. Fonctionne bien à temps plein comme premier responsable de la plateforme de données ou à temps partiel comme couche senior au-dessus d’une équipe junior. Un audit à portée fixe d’un montage de pipelines existant est un point de départ courant et à faible risque. Moins pertinent si le besoin est surtout de l’analyse et des tableaux de bord, ce qui relève de l’analyste, ou du développement intensif de modèles d’apprentissage automatique, ce qui correspond à l’archétype voisin Python données et ML de ce bassin. Les tarifs de cet archétype se situent généralement dans la fourchette affichée sur cette fiche et varient selon la séniorité et la région.

Mandat typique

Commence souvent par démêler un parc de pipelines existant ou par mettre sur pied le premier véritable entrepôt, puis reste comme responsable de la plateforme de données de l’équipe. Heures du Brésil, qui se superposent presque entièrement à la journée de travail américaine. Disponible maintenant.

Ceci est un échantillon représentatif du bassin vérifié. Faites-en la demande et nous confirmons la disponibilité réelle et actuelle d’un développeur avec ce parcours.

Questions fréquentes

Est-ce une personne réelle et précise que je peux embaucher?

Il s'agit d'un profil représentatif du type de développeur présent dans le bassin vérifié, pas d'une fiche publique d'une personne nommée. Quand vous en faites la demande, nous confirmons qui est réellement disponible avec un parcours correspondant et partageons les détails réels sous entente de confidentialité.

Puis-je les rencontrer en entrevue avant de m'engager?

Oui. Chaque jumelage comprend une entrevue, et vous pouvez faire un essai rémunéré avant de rendre l'engagement permanent.

Qu'est-ce qu'un ingénieur de données de ce niveau prend habituellement en charge?

Autour de sept ans d'expérience, un ingénieur de données assume habituellement l'ingestion depuis les systèmes sources, l'orchestration, la modélisation de l'entrepôt, les contrôles de qualité des données et la facture de calcul pour l'ensemble. Il travaille avec les analystes et les équipes produit sur ce que les données doivent répondre, pas seulement sur leur déplacement.