Una agencia de seleccion en Madrid me conto esta historia: presentaron al mismo candidato a dos clientes diferentes en la misma semana, sin saberlo. El candidato tenia dos fichas en la base — una con su nombre de soltera, otra con el de casada. Dos consultores, dos procesos, cero coordinacion. El cliente mas importante perdio la confianza.
No es un caso aislado. Entre el 10 y el 20% de las bases de candidatos contienen duplicados segun estimaciones del sector. En una base de 30.000 perfiles, eso supone hasta 6.000 registros redundantes — con historiales fragmentados, notas contradictorias y riesgos de RGPD ignorados.
Por que la coincidencia por nombre falla
El enfoque clasico: cuando se importa un nuevo perfil, el sistema verifica si el nombre y apellido ya existen. Suena logico. No funciona en la practica:
- Cambios de nombre: matrimonio, divorcio, naturalizacion. Maria Garcia se convierte en Maria Schmidt. El ATS no establece conexion.
- Variantes ortograficas: Gonzalez vs Gonzales, Muller vs Mueller — cadenas diferentes, misma persona.
- Homonimos: cuantos Juan Garcia hay en su base? Una coincidencia solo por nombre es inutil sin contexto adicional.
Nuestro antiguo sistema buscaba duplicados por nombre y empresa. Despues de cuatro anos teniamos 3.200 duplicados — de los cuales 380 estaban en procesos activos. — Directora de Operaciones, agencia de seleccion Barcelona
Las senales fuertes: email, telefono, LinkedIn
Los sistemas modernos se apoyan en identificadores que son practicamente unicos y estables en el tiempo:
| Senal | Unicidad | Estabilidad | Cobertura |
|---|---|---|---|
| Muy alta | 5-10 anos | ~95% | |
| Telefono | Alta | 3-7 anos | ~80% |
| URL LinkedIn / ID miembro | Globalmente unica | Muy larga | ~50% (Espana) |
| Nombre + empresa + ubicacion | Media | 1-3 anos | 100% |
La mejor logica de deduplicacion utiliza una ponderacion de senales: si el email coincide, es un indicio fuerte — aunque el nombre y la empresa difieran. Si LinkedIn y el telefono coinciden, es un match confirmado.
RGPD/LOPD y duplicados: el riesgo subestimado
El articulo 5(1)(d) del RGPD exige la exactitud de los datos personales. Fichas duplicadas con informacion contradictoria violan este principio. Si un candidato ejerce su derecho de supresion (articulo 17) y solo elimina una de las dos fichas, sus datos persisten. Es un incumplimiento.
En el contexto espanol, la LOPD complementa al RGPD con requisitos adicionales. Para ETT y agencias de seleccion, la gestion de duplicados es especialmente critica dado el volumen de candidatos procesados.
Mas sobre gestion de datos en las mejores practicas de RecruitCRM y las metricas de reclutamiento de AIHR.
Deteccion en funcionamiento: cuatro escenarios
En la importacion de CV
Cuando se sube un CV, el sistema verifica instantaneamente email, telefono y LinkedIn en toda la base. Si hay coincidencia, aparece una alerta con enlace al perfil existente.
En la creacion manual
Cuando el reclutador introduce un nombre, el sistema muestra en tiempo real perfiles similares antes de guardar.
En la importacion desde LinkedIn
La puerta de entrada mas frecuente para duplicados. Los sistemas que almacenan IDs de perfil LinkedIn realizan un matching exacto. Nuestra guia de limpieza de base de datos explica el proceso completo.
En limpieza por lotes
Para bases existentes: un proceso batch identifica clusters de duplicados y los presenta para revision manual.
Lo que cuesta la mala calidad de datos
Segun Loxo, los reclutadores dedican un promedio del 27% de su tiempo a limpiar o reprocesar datos. Para un equipo de cinco personas, eso supone mas de 100.000 euros de productividad perdida al ano.
Para mas contexto sobre como elegir el ATS adecuado, consulte nuestra comparativa ATS vs CRM y nuestra guia de entrevistas por competencias.
Implantamos una regla simple: quien crea un perfil nuevo sin buscar antes, asume la limpieza. La tasa de duplicados se redujo a la mitad en seis semanas. — Director General, agencia de seleccion Valencia
FAQ: Deteccion de duplicados de candidatos
Cuantos duplicados tiene una base de datos tipica?
Las estimaciones del sector situan el porcentaje entre el 10 y el 20% en bases establecidas. Las bases que han crecido sin una politica de importacion estructurada pueden superar ese umbral.
La busqueda difusa por nombre es suficiente?
No. Es un indicador util pero no un identificador fiable. Email, telefono y LinkedIn son senales mucho mas fuertes y deben priorizarse.
Que pasa con el consentimiento RGPD al fusionar?
La situacion de consentimiento mas restrictiva debe prevalecer siempre. Documente la fusion y la base de consentimiento utilizada.
Con que frecuencia verificar duplicados?
Verificacion en tiempo real en cada creacion, mas un escaneo batch trimestral en toda la base. Si la base crece rapidamente, considere escaneos mensuales.
Detecte duplicados por senal, no por nombre
Yena detecta automaticamente candidatos duplicados por email, telefono y perfil de LinkedIn — incluso cuando los nombres son completamente diferentes. Matching por senales fuertes para maxima confianza.
Prueba gratuita 14 dias