← Volver al blog

Cómo eliminar duplicados y normalizar CSV con IA

Cómo definir claves de deduplicación, normalizar valores y revisar candidatos antes de fusionar registros en un CSV.

Eliminar duplicados parece una tarea sencilla hasta que dos filas se parecen, pero no representan necesariamente a la misma persona, empresa o producto. La clave no es pedir a una IA que «haga magia», sino darle un proceso claro, fuentes identificables y una salida que se pueda revisar. Cuando el workflow conserva contexto y evidencia, el resultado sirve para trabajar; cuando no lo hace, solo produce texto convincente que obliga a empezar de nuevo.

Qué problema resuelve realmente

Un CSV puede incluir identificadores fiables como NIF, SKU o email, junto a campos más débiles como nombre, teléfono escrito de varias formas o dirección incompleta. En vez de tratar cada elemento como una conversación aislada, conviene convertirlo en registros comparables. Un buen sistema debe poder explicar por qué ha tomado una decisión, qué dato falta y qué parte procede directamente de la fuente. Eso hace posible revisar cientos de elementos sin perder la capacidad de volver al origen cuando aparece una excepción.

Define la salida antes de automatizar

El proceso debe separar duplicados exactos, candidatos de alta confianza y similitudes que necesitan revisión. Además, debe conservar qué reglas llevaron a cada candidato. Para que otra persona o un agente pueda continuar el trabajo, utiliza campos estables como clave, registro A, registro B, coincidencia, motivo y acción. Los campos desconocidos deben quedar vacíos o marcados como pendientes; rellenarlos con una suposición destruye la utilidad del conjunto. También conviene guardar un identificador de origen o una referencia suficiente para reconstruir la decisión más adelante.

Un ejemplo concreto

Dos filas comparten el mismo NIF y dominio pero escriben el nombre comercial de forma distinta. Eso es una señal mucho más fuerte que dos filas que solo comparten un nombre común. La IA puede ayudar a ordenar y resumir, pero el valor aparece cuando esa salida se convierte en algo operativo: una cola priorizada, una tabla de requisitos, un archivo limpio, un registro de tareas o una lista de problemas. El formato final debe permitir filtrar, comparar y actuar, no limitarse a una explicación narrativa.

Flujo recomendado paso a paso

  1. Normaliza espacios, mayúsculas y formatos antes de comparar.
  2. Elige claves fuertes y evita depender de un solo nombre libre.
  3. Separa coincidencias exactas de candidatos heurísticos.
  4. Revisa conflictos de valores antes de fusionar.
  5. Exporta el resultado y la lista de decisiones pendientes por separado.

Este orden evita uno de los errores más habituales: empezar a corregir o redactar antes de haber entendido el conjunto. Primero se observa y normaliza; después se aplican reglas; al final se prepara una salida. Si una regla cambia, debería ser posible repetir el proceso y obtener un resultado coherente sin tocar manualmente cada registro.

Errores que conviene evitar

  • Deduplicar por nombre sin contexto.
  • Borrar una fila antes de conservar los campos únicos que contiene.
  • Modificar identificadores durante la normalización.
  • No registrar qué regla generó una coincidencia.

Los errores más caros suelen aparecer cuando se confunde una inferencia con un hecho o se deja que la automatización ejecute una acción sensible sin una autorización separada. Por eso es útil distinguir entre análisis, propuesta y ejecución. Una herramienta puede ser muy autónoma en la primera parte y seguir pidiendo control explícito para la última.

Qué debe hacer un agente de IA

Un agente que use Sheet Fix debería consultar las capacidades estructuradas del plugin, comprobar que dispone de los inputs necesarios y devolver resultados con referencias y estados de confianza. Si falta una fuente, una regla o un permiso, debe comunicarlo. El plugin aporta un workflow especializado y utilidades deterministas; el agente anfitrión aporta acceso autorizado, razonamiento y contexto.

Límites y control

Las coincidencias heurísticas deben presentarse como candidatos, no como hechos. La fusión automática solo es razonable cuando las claves y reglas de negocio son suficientemente claras. Una automatización profesional no oculta estas fronteras. Las convierte en parte del diseño para que el usuario sepa qué se ha comprobado, qué se ha inferido y qué acción todavía necesita autorización o revisión.

Resultado esperado

Al terminar, deberías tener una salida que puedas revisar en minutos, no una respuesta que tengas que creer a ciegas. El criterio de calidad es sencillo: cada elemento importante debe tener contexto suficiente, una razón comprensible y, cuando proceda, una referencia al origen. Así la IA ahorra trabajo repetitivo sin convertir el proceso en una caja negra.

Relacionado: ver plugins para esta tarea · Sheet Fix — Limpia y normaliza Excel y CSV