Talento

Data engineer vs data scientist: qué perfil contratar

Dos perfiles que se confunden en la oferta y se pagan distinto. Responsabilidades reales, señales para saber cuál necesitas primero, bandas salariales en España y una prueba técnica para cada uno.

·16 min·Pedro Cailá · Kulturo
Data engineer vs data scientist: qué perfil contratar

Un CTO publica una oferta para contratar un data scientist porque la empresa necesita “poner la IA en marcha”. Dos meses después, la persona contratada sigue limpiando tablas, persiguiendo eventos incompletos y tratando de entender por qué cada dashboard muestra una cifra distinta. El problema nunca fue la falta de capacidad del candidato. La empresa necesitaba un data engineer.

El error contrario también es habitual. Una startup ya tiene datos accesibles, un warehouse razonablemente organizado y preguntas claras sobre retención, fraude o pricing, pero contrata a un ingeniero para resolver un problema que exige experimentación estadística y modelos predictivos. El resultado es una plataforma más ordenada, pero ninguna decisión de negocio mejor.

En España, el mercado ya reúne 151.700 profesionales especializados en datos e inteligencia artificial, con 4.000 vacantes sin cubrir y un crecimiento interanual del 4,05%, según las referencias salariales y de mercado recopiladas por Calcutech Salary. Elegir mal el perfil no solo retrasa el roadmap. También consume presupuesto en un mercado donde cerrar una contratación técnica exige precisión.

El error más común al contratar perfiles de datos

El CTO de una scaleup de producto suele recibir una petición ambigua del equipo directivo: “Necesitamos alguien de datos”. La convierte en una oferta de data scientist, añade Python, SQL y machine learning, y espera atraer a una persona capaz de construir pipelines, analizar usuarios, lanzar modelos y explicar resultados al consejo. Esa oferta describe tres trabajos distintos, no uno.

El candidato correcto lee la responsabilidad real detrás del título. Si el día a día consiste en integrar datos de producto, pagos y CRM, automatizar cargas, resolver duplicados y garantizar que los informes lleguen a tiempo, un científico de datos competente puede sentirse infrautilizado. Si el reto consiste en estimar demanda, diseñar un experimento o construir un modelo de propensión, un ingeniero de datos puede entregar una infraestructura impecable sin responder la pregunta principal.

La confusión aparece porque ambos perfiles comparten Python, SQL y contacto diario con datos. En startups españolas, además, una misma persona suele cubrir análisis, ingeniería y machine learning durante las primeras etapas. Esa realidad no convierte los roles en intercambiables. Solo significa que la empresa debe distinguir entre una necesidad temporal de amplitud y una responsabilidad permanente de especialización.

Regla de contratación: no empieces por el título del puesto. Empieza por el cuello de botella que está impidiendo una decisión, un lanzamiento o una operación fiable.

Antes de abrir la vacante, documenta qué decisiones quieres mejorar y qué tareas están bloqueadas. Un marco útil es separar tres preguntas:

  • Acceso: ¿los datos están completos, documentados y disponibles cuando el equipo los necesita?
  • Fiabilidad: ¿los pipelines, modelos de datos y procesos de calidad funcionan de forma consistente?
  • Valor: ¿la empresa tiene datos utilizables, pero no consigue extraer predicciones, experimentos o recomendaciones accionables?

Las dos primeras preguntas apuntan al data engineer. La tercera apunta al data scientist. Para ordenar el problema de negocio, también conviene revisar recursos sobre métrica y KPI para negocios en México, porque una contratación de datos solo merece la pena cuando está conectada con indicadores que alguien usa para decidir.

Al terminar este análisis, deberías poder escribir una frase concreta: “Necesitamos construir una base fiable para que otros equipos trabajen” o “Necesitamos convertir datos disponibles en análisis y modelos que cambien una decisión”. Esa frase determina el perfil, el ejercicio técnico, la seniority y la oferta económica.

Qué hace realmente un data engineer y un data scientist

Un data engineer construye y mantiene los conductos por los que circulan los datos. Su trabajo empieza en fuentes imperfectas, como eventos de una aplicación, bases de datos transaccionales, APIs externas o sistemas internos, y termina en estructuras que analistas, científicos y equipos de producto pueden consultar con confianza.

En su jornada puede diseñar procesos ETL o ELT, corregir un job fallido, optimizar una consulta SQL, modelar tablas para un warehouse, configurar controles de calidad o documentar el significado de una métrica. También responde por la infraestructura, la disponibilidad, la latencia y la gobernanza del dato. No entrega únicamente tablas. Entrega un sistema operativo para el trabajo analítico.

Su stack habitual puede incluir Python y SQL como base, Airflow para orquestación, dbt para transformar y documentar modelos, y Spark cuando el procesamiento requiere trabajar a una escala mayor. La plataforma cloud, el almacenamiento, los permisos y la observabilidad completan el contexto técnico. El candidato debe demostrar que sabe operar lo que construye, no solo escribir una transformación correcta en un entorno controlado.

Infografía comparativa que explica las diferencias y roles entre un ingeniero de datos y un científico de datos.

Un data scientist trabaja sobre datos accesibles para encontrar patrones, contrastar hipótesis y convertir resultados en decisiones. Su día puede empezar con un análisis exploratorio, continuar con la preparación de variables y terminar con la evaluación de un modelo o la presentación de una recomendación a producto, marketing, operaciones o dirección.

El perfil no se limita a entrenar algoritmos. Debe decidir qué pregunta merece ser respondida, qué métrica representa el objetivo, qué sesgos pueden afectar al análisis y cómo comunicar una conclusión con sus límites. Un modelo técnicamente sofisticado no sirve si el equipo comercial no sabe qué acción tomar o si el experimento no permite separar correlación de causalidad.

En este lado aparecen Jupyter, scikit-learn y TensorFlow, junto con Python o R, librerías estadísticas y herramientas de visualización. La diferencia clave está en el entregable. El engineer deja una plataforma y datos fiables. El scientist deja análisis, experimentos, modelos predictivos o recomendaciones interpretables.

Para profundizar en las responsabilidades del primer perfil, puedes consultar esta guía sobre qué hace un ingeniero de datos. La pregunta decisiva para contratar sigue siendo sencilla: ¿necesitas que el dato llegue bien o que alguien descubra qué hacer con él?

Habilidades técnicas y blandas que los separan

El solapamiento entre ambos perfiles es real, pero no debe dominar la descripción de puesto. Python y SQL aparecen en las dos candidaturas, aunque un data engineer los utiliza para construir procesos fiables y un data scientist para explorar, transformar y modelar información. Si la oferta solo enumera herramientas, atraerá perfiles mezclados y obligará al entrevistador a adivinar la especialidad.

Habilidades clave por perfil

Competencia Data Engineer Data Scientist
Propósito principal Construir infraestructura, pipelines y procesos fiables Analizar datos, experimentar y crear modelos
Programación Python y SQL orientados a producción Python o R orientados a análisis y modelado
Orquestación y transformación Airflow, dbt y diseño ETL/ELT Preparación de variables y notebooks
Procesamiento Spark y optimización de cargas Manipulación de datos para análisis
Machine learning Integración operativa y soporte de despliegue scikit-learn, TensorFlow y evaluación de modelos
Cloud e infraestructura Arquitectura, permisos, escalabilidad y operación Uso de entornos cloud para análisis y experimentación
Calidad del resultado Disponibilidad, latencia, consistencia y trazabilidad Validez estadística, precisión útil e interpretación
Comunicación Contratos de datos, documentación y coordinación técnica Storytelling, recomendaciones y conversación con negocio

El data engineer necesita pensamiento sistémico. Debe anticipar qué ocurre cuando cambia un esquema, se duplica una carga, llega tarde una fuente o falla una dependencia. La orientación a la fiabilidad importa más que una demo llamativa. En entrevista, busca explicaciones sobre idempotencia, recuperación ante fallos, tests de datos y observabilidad.

El data scientist necesita curiosidad analítica y criterio para formular preguntas. Tiene que distinguir una señal de un artefacto, escoger métricas coherentes y explicar una conclusión a personas que no trabajan con modelos. La estadística no es un adorno curricular. Es la base para interpretar incertidumbre, diseñar experimentos y evitar recomendaciones engañosas.

Cómo redactar la oferta sin mezclar perfiles

Especifica el problema que resolverá la persona durante sus primeros meses, sin convertir la oferta en una lista infinita de tecnologías. Para un engineer, describe fuentes, pipelines, warehouse, estándares de calidad y responsabilidad operativa. Para un scientist, define decisiones de negocio, experimentos, modelos, métricas y relación con stakeholders.

Señal de una oferta mal planteada: exige Airflow, Spark, TensorFlow, storytelling y arquitectura cloud como requisitos imprescindibles para una sola posición.

Los solapamientos deben aparecer como colaboración, no como confusión. Ambos perfiles deben entender el dato de origen, cuestionar definiciones y trabajar con producto. Lo que cambia es la responsabilidad final. El engineer responde por que el sistema entregue datos utilizables. El scientist responde por que el análisis o el modelo ayude a decidir mejor.

Cuándo contratar un data engineer y cuándo un data scientist

La decisión no depende de si la empresa está en seed, Serie A o Serie B por el nombre de la ronda. Depende de la madurez real del dato. Una empresa pequeña puede tener una base sólida y una empresa más financiada puede seguir trabajando con exportaciones manuales y definiciones contradictorias.

El árbol de decisión práctico

Empieza por la infraestructura. Si los datos están repartidos entre la aplicación, herramientas comerciales y hojas de cálculo, no hay pipelines fiables o cada equipo calcula el mismo KPI de forma distinta, contrata primero un data engineer. Un científico de datos no debería dedicar su capacidad principal a reconstruir el sistema de medición.

Después pregunta si los datos ya están limpios y accesibles. Si existe un warehouse usable, las tablas tienen propietarios, las cargas son previsibles y los equipos pueden consultar información consistente, el siguiente cuello de botella puede ser analítico. Contrata un data scientist cuando nadie está convirtiendo esa base en experimentos, previsiones, segmentaciones o modelos que guíen decisiones.

Infografía que explica cuándo contratar un data engineer o un data scientist según madurez de datos.

En una startup seed, mi recomendación habitual es no contratar un data scientist puro si todavía no puedes responder con confianza de dónde sale cada métrica. El primer perfil debe estabilizar la captura, el modelado y el acceso, aunque al principio también apoye análisis básicos. En una Serie A, si la infraestructura ya existe pero producto necesita priorizar funcionalidades con evidencia, un scientist puede generar más valor que otro engineer.

En una Serie B, la pregunta cambia. Puede ser necesario ampliar ambos lados, separar ownership de plataforma y analítica, y preparar modelos para producción. Añadiría un ML engineer cuando el problema principal ya no es descubrir un modelo, sino desplegarlo, monitorizarlo, versionarlo y mantener su comportamiento dentro del producto. Un perfil híbrido solo tiene sentido si la empresa acepta una responsabilidad amplia y puede priorizarla. No lo uses para esconder una arquitectura deficiente.

Como recurso complementario para delimitar el perfil analítico, consulta qué es un data scientist. La decisión final puede resumirse así:

  • Datos caóticos o inaccesibles: data engineer.
  • Datos utilizables, preguntas sin responder: data scientist.
  • Modelos validados que deben operar dentro del producto: ML engineer o combinación de engineering y data science.
  • Equipo pequeño con alcance amplio: perfil híbrido, con objetivos explícitos y sin pretender cubrir toda la plataforma.

Salarios reales en España para ambos perfiles

La banda salarial debe seguir el alcance del puesto, no el título. En España, una referencia sitúa el salario medio del data scientist alrededor de 43.000 € brutos anuales, con una base de 38.000 a 48.000 €, un P25 de 33.875 € y un P75 de 55.075 €, según las referencias salariales de Data Scientist en España. Para un data engineer, esa misma comparación coloca la base promedio entre 29.000 y 44.000 €, con un promedio de 34.000 € y variables de 2.000 a 4.000 € en algunas estimaciones.

Usa estas cifras para construir una hipótesis, no para copiar una oferta. Un engineer que mantiene cargas sencillas pertenece a una banda distinta de quien diseña arquitectura con Spark, gobierna la calidad y responde por la disponibilidad de la plataforma. Un scientist centrado en informes descriptivos tampoco tiene el mismo valor de mercado que quien diseña experimentos, valida modelos y presenta conclusiones a dirección. Para ordenar la propuesta, consulta nuestra guía de bandas salariales por perfil técnico.

Rangos por seniority

Las referencias publicadas dibujan bandas amplias:

  • Data engineer: junior, 18.000 a 26.000 €; senior, 42.000 a 60.000 €; lead o staff, 72.000 a 95.000 €, según la guía salarial de Data Engineer en España. Las competencias que impulsan la progresión incluyen Python, SQL, Airflow, dbt, Spark y cloud.
  • Otra lectura del mercado sitúa data engineering entre 28.000 y 85.000 €, con una mediana aproximada de 50.000 €. Sus tramos son 28.000 a 38.000 € para junior, 38.000 a 50.000 € para mid, 50.000 a 65.000 € para senior y 65.000 a 85.000 € para lead, según el análisis salarial de Data Engineer de Shakers.
  • Data scientist: junior, 30.000 a 40.000 € y senior, 60.000 a 80.000 € o más, según LHH España. Otra guía sitúa el junior entre 35.000 y 45.000 €, el mid entre 38.000 y 55.000 € y el senior entre 60.000 y 95.000 €, según la guía salarial de Data Scientist en España.

En el nivel mid, la diferencia no es automática: 48.000 a 65.000 € para data engineer frente a 50.000 a 65.000 € para data scientist, según la comparación salarial de Elektium. Define primero alcance, stack, autonomía y responsabilidad sobre producción. Después fija la banda y guarda margen para quien pueda liderar arquitectura o convertir modelos en decisiones.

Gráfico comparativo de salarios anuales brutos en España para perfiles de Data Engineer y Data Scientist por experiencia.

Como referencia de contratación publicada, aparecen vacantes de data engineer en tramos de 35.000 a 40.000 € anuales, según los tramos salariales publicados por Michael Page para Data Engineers. Si la oferta queda por debajo de la banda que exige el puesto, no la tapes con beneficios genéricos. Reduce responsabilidades, ajusta la seniority o aumenta el presupuesto.

Cómo evaluar candidatos en entrevistas técnicas

Una entrevista de datos falla cuando pide que el candidato enumere herramientas. El proceso debe reproducir problemas que la persona encontrará en el trabajo, con información suficiente para observar cómo razona, pregunta y toma decisiones.

Prueba para data engineer

Entrega un pequeño esquema con eventos de producto, cambios de estado y registros duplicados. Pide diseñar un pipeline en Airflow o dbt que cargue los datos en un modelo consultable, explique cómo detectaría registros tardíos y defina qué ocurriría si el job se ejecuta dos veces.

Evalúa cuatro elementos:

  • Diseño: separa ingestion, transformación y consumo, y justifica las decisiones.
  • Idempotencia: evita duplicados y hace que una repetición no corrompa el resultado.
  • Calidad: propone tests sobre campos obligatorios, unicidad, frescura y relaciones.
  • Operación: explica alertas, reintentos, backfills, costes y recuperación ante fallos.

Añade una consulta SQL que obligue a combinar varias tablas y resolver una condición de negocio ambigua. Para perfiles con experiencia en Spark, puedes presentar un job lento y pedir un diagnóstico. No busques memorizar sintaxis. Busca que el candidato pregunte por el volumen, la partición, el plan de ejecución y el comportamiento esperado.

Green flags: habla de contratos de datos, observabilidad, documentación, ownership y consecuencias para consumidores. Red flags: se centra en que “funciona en local”, ignora cargas repetidas o trata la calidad como una limpieza manual al final del proceso.

Prueba para data scientist

Usa un dataset anonimizado de negocio y formula una decisión concreta, como priorizar usuarios para una acción comercial o evaluar un cambio de producto. Pide un análisis exploratorio breve, una propuesta de experimento A/B y una explicación de las métricas que utilizaría para juzgar el resultado.

Después, presenta dos modelos con resultados diferentes y pregunta cuál escogería. La respuesta sólida no se limita a elegir la métrica más alta. Considera la distribución de clases, el coste de falsos positivos y negativos, la estabilidad, la interpretabilidad, la fuga de información y la posibilidad de usar el modelo en operación.

La parte final debe ser una presentación para un stakeholder no técnico. El candidato tiene que explicar qué sabe, qué no sabe y qué decisión recomienda. Green flags: conecta el análisis con una acción, identifica supuestos y comunica incertidumbre. Red flags: promete causalidad a partir de correlaciones, optimiza una métrica sin contexto o no puede explicar una variable relevante.

Una buena entrevista no pregunta si el candidato conoce una librería. Comprueba si puede producir un resultado fiable con restricciones parecidas a las del puesto.

Usa una rúbrica común para todos los candidatos, pero separa los criterios por rol. Así reduces el sesgo hacia quien habla mejor y evitas contratar al perfil equivocado por una demostración brillante pero irrelevante.

Descripciones de puesto y estructura de equipo recomendada

Una oferta de datos debe permitir que el candidato entienda el problema antes de la primera llamada. Sustituye “buscamos una persona apasionada por los datos” por una misión concreta, responsabilidades medibles y el nivel de autonomía esperado. La descripción también debe aclarar qué decisiones tomará el puesto y con qué equipos trabajará.

Plantilla para data engineer

Misión: construir y operar la plataforma que integra los datos de producto, negocio y operaciones.

Responsabilidades:

  • Diseñar y mantener pipelines ETL/ELT con Python, SQL, Airflow y dbt.
  • Mejorar la calidad, documentación, observabilidad y accesibilidad del dato.
  • Trabajar con producto e ingeniería para definir eventos, modelos y contratos.
  • Optimizar procesos sobre el warehouse o tecnologías de procesamiento como Spark.
  • Participar en decisiones de cloud, seguridad y arquitectura.

Requisitos: experiencia práctica con Python y SQL, diseño de datos, orquestación y resolución de incidentes. Para perfiles senior, pide autonomía arquitectónica y capacidad para establecer estándares. Evita una lista interminable de certificaciones que no predice el desempeño diario.

Plantilla para data scientist

Misión: convertir datos fiables en análisis, experimentos y modelos que mejoren decisiones de producto o negocio.

Responsabilidades:

  • Formular hipótesis con producto, marketing u operaciones.
  • Realizar análisis exploratorio y modelado con Python o R.
  • Diseñar experimentos y evaluar métricas con criterio estadístico.
  • Crear modelos con scikit-learn o TensorFlow cuando el caso lo justifique.
  • Comunicar conclusiones a stakeholders técnicos y no técnicos.

Requisitos: estadística aplicada, SQL, machine learning, capacidad experimental y comunicación clara. Define si el rol se centrará en analytics, producto, riesgo o investigación. “Data scientist” sin área de decisión atrae candidaturas muy distintas y dificulta comparar perfiles.

Cómo organizar el equipo

En una startup que todavía construye su base operativa, contrata primero un data engineer. Sin pipelines fiables, el scientist dedicará su tiempo a corregir datos en lugar de generar análisis útiles. En una fase de crecimiento, engineer y scientist funcionan bien con ownership separado y una relación directa con producto.

En una organización madura, incorpora ML engineer o MLOps si los modelos deben mantenerse dentro de sistemas de producción. El organigrama debe seguir el cuello de botella real, no una moda de contratación.

Evita que el scientist administre pipelines y que el engineer reciba objetivos de modelado sin datos preparados ni tiempo asignado. Kulturo trabaja con CTOs y tech leads en procesos de recruiting técnico especializado en España.

Revisa tus ofertas actuales, elimina requisitos que mezclan responsabilidades y describe el resultado que debe entregar cada puesto. Una buena estructura conecta misión, prueba técnica, autonomía y fase de crecimiento.

Tenemos el profesional que necesitas

Cuéntanos qué perfil buscas y te enviamos candidatos en menos de una semana.

Empieza a contratar