GUÍA PRÁCTICA
Checklist de preparación de datos antes de conectar una IA a tus sistemas empresariales
Una guía práctica para revisar fuentes de verdad, calidad, permisos, documentos, privacidad, contradicciones y pruebas antes de conectar IA a CRM, ERP, email o sistemas propios.
· IA Empleado
Conectar IA a un CRM, ERP, correo o repositorio documental puede aportar mucho valor, pero también amplifica problemas que ya existen en los datos. Un campo desactualizado, un duplicado o una fuente contradictoria deja de ser solo una molestia cuando un sistema automatizado empieza a tomar decisiones o preparar acciones con esa información. La solución no es esperar a que todos los datos corporativos sean perfectos. Es definir el conjunto mínimo necesario para el proceso elegido, preparar ese conjunto y establecer reglas claras para aquello que siga siendo incompleto. Esta checklist ayuda a hacerlo de forma práctica.
01
1. Define primero el proceso que vas a automatizar
No empieces limpiando bases de datos sin un objetivo. Documenta qué inicia el proceso, qué decisión se toma, qué sistemas se consultan y cuál es el resultado esperado. Esa secuencia determina qué datos son realmente necesarios.
Por ejemplo, clasificar solicitudes comerciales puede necesitar remitente, empresa, producto, oportunidad y responsable; automatizar facturación necesitará campos completamente distintos. Preparar datos sin este alcance conduce a proyectos demasiado grandes y difíciles de justificar.
02
2. Crea un inventario mínimo de datos
Lista cada campo, documento o referencia que el proceso utiliza. Marca si es obligatorio, opcional, derivado o sensible. Añade dónde está almacenado y qué sistema lo mantiene actualizado.
Este inventario evita enviar contexto innecesario al modelo y ayuda a diseñar permisos. También permite detectar datos que hoy viven en conversaciones, hojas de cálculo personales o conocimiento informal y que deberían estructurarse antes de automatizar.
03
3. Asigna una fuente de verdad
Para cada dato crítico define qué sistema tiene autoridad. El estado de pedido puede pertenecer a ERP, la oportunidad a CRM, la incidencia a helpdesk y la disponibilidad a calendario o motor de reservas. Evita que el agente mezcle versiones sin una regla.
Cuando existen varias fuentes, documenta jerarquía y fecha de actualización. Si no puede resolverse automáticamente una contradicción, el resultado correcto es escalar. Elegir silenciosamente el dato más conveniente puede generar errores difíciles de detectar.
04
4. Mide completitud de campos críticos
Calcula qué porcentaje de registros tiene cada campo requerido. No todos los vacíos importan igual. Una dirección ausente puede ser irrelevante para clasificación de emails y bloquear completamente una entrega.
Define umbrales por proceso. Si un campo crítico falta con demasiada frecuencia, quizá convenga corregir el origen antes de automatizar. Si ocurre raramente, el flujo puede tratarlo como excepción y pedir información.
05
5. Busca duplicados y conflictos de identidad
Clientes, proveedores y productos duplicados pueden provocar que el agente consulte o actualice el registro equivocado. Revisa identificadores únicos, reglas de coincidencia y casos donde nombres similares representan entidades distintas.
No confíes únicamente en similitud textual para fusionar registros. Los candidatos pueden agruparse y revisarse, pero los cambios definitivos deberían seguir reglas de datos maestros. Una automatización rápida sobre identidades ambiguas puede multiplicar el problema.
06
6. Normaliza fechas, monedas, teléfonos y categorías
Los campos estructurados deberían llegar al agente en formatos consistentes. Fechas, importes, códigos de país, estados, SKU, identificadores y teléfonos son buenos candidatos para validación determinista antes de cualquier razonamiento.
La normalización reduce tokens, ambigüedad y errores. También facilita que las respuestas del agente puedan volver al sistema sin conversiones improvisadas. El modelo puede interpretar variaciones de entrada, pero el dato persistente debería seguir un esquema estable.
07
7. Identifica datos desactualizados
Un dato completo puede seguir siendo incorrecto si está antiguo. Revisa fechas de modificación, catálogos vigentes, responsables que ya no pertenecen al equipo, productos retirados y documentos sustituidos.
Cuando la actualidad importa, incorpora una regla de frescura. Por ejemplo, una política puede necesitar versión vigente o una disponibilidad puede tener que consultarse en tiempo real. No toda información debería cargarse desde una copia estática.
08
8. Clasifica información sensible
Marca datos personales, financieros, credenciales, secretos comerciales, documentación contractual y cualquier categoría que necesite controles especiales. Después decide si el agente necesita verla completa, parcialmente o nunca.
La minimización es una de las mejores medidas de seguridad. Si el proceso solo necesita un estado y un identificador, no envíes el expediente completo. Redacción, tokenización, seudonimización o procesamiento local pueden reducir exposición.
09
9. Revisa permisos por sistema y operación
Define qué puede leer, crear, modificar o eliminar la identidad técnica del agente. Evita scopes amplios por comodidad. Una integración que solo consulta pedidos no debería disponer de permiso para cancelarlos.
También separa permisos del agente y del usuario. Que una persona pueda acceder a determinada información no significa necesariamente que todos los procesos automatizados deban heredar ese acceso. Las acciones sensibles pueden requerir aprobación vinculada a una identidad humana.
10
10. Ordena documentos y versiones
Si la IA consultará documentación, identifica qué archivos son vigentes, cuáles están duplicados y qué permisos deben respetarse. Las respuestas inconsistentes suelen venir de fuentes contradictorias más que del modelo.
Conserva metadatos como fecha, versión, propietario y categoría. Cuando una respuesta utiliza una política o contrato, poder mostrar la fuente facilita revisión y reduce el riesgo de utilizar un documento obsoleto.
11
11. Define qué puede inferir la IA
Algunos procesos permiten inferencias útiles: categoría probable, prioridad, idioma o intención. Otros campos, como cuenta bancaria, NIF, importe contractual o estado legal, deberían venir de una fuente confirmada.
Etiqueta las inferencias explícitamente. Una propuesta no debe convertirse en dato maestro solo porque el modelo tenga alta confianza. Decide qué umbral permite continuar y qué necesita validación humana o consulta a otra fuente.
12
12. Diseña tratamiento para valores ausentes
Para cada campo obligatorio establece una acción: detener, pedir información, consultar otra fuente, aplicar un valor autorizado o escalar. Esto evita que el agente complete huecos de manera creativa.
La política puede variar por riesgo. Un código postal ausente quizá pueda solicitarse automáticamente; una cuenta bancaria ausente nunca debería inventarse. Las reglas de ausencia deben formar parte del contrato del proceso.
13
13. Diseña tratamiento para contradicciones
Documenta qué hacer cuando dos sistemas no coinciden. Algunas contradicciones pueden resolverse por jerarquía de fuentes; otras requieren una persona. El flujo debe conservar ambos valores y explicar el conflicto.
Las contradicciones frecuentes son una señal de calidad del proceso, no solo de IA. Regístralas y corrige la causa cuando sea posible. Automatizar el conflicto sin mejorar la fuente perpetúa deuda de datos.
14
14. Construye un conjunto de pruebas representativo
Incluye casos fáciles, límites y excepciones reales: duplicados, documentos largos, registros incompletos, idiomas distintos, valores antiguos y formatos inesperados. No entrenes tu confianza únicamente con ejemplos perfectos.
Para cada caso define el resultado esperado o el comportamiento correcto: responder, proponer, rechazar o escalar. Esto permite medir precisión y regresiones cuando cambian prompts, modelos, conectores o reglas.
15
15. Registra procedencia y transformaciones
Cuando el sistema normaliza, combina o extrae datos, conserva suficiente información para reconstruir el camino. Debe ser posible saber qué fuente originó un valor y qué transformación ocurrió antes de que el agente lo utilizara.
Esta trazabilidad facilita depuración y auditoría. No requiere almacenar información sensible completa en logs; referencias, identificadores y eventos estructurados suelen ser suficientes para investigar un resultado.
16
16. Monitoriza calidad después del lanzamiento
La preparación de datos no termina en producción. Nuevos campos, campañas, productos, integraciones y equipos cambian continuamente las fuentes. Mide excepciones causadas por datos, campos faltantes, errores de formato y correcciones humanas.
Cuando una métrica empeora, decide si la solución está en la fuente, la integración, la política o el agente. Este ciclo convierte la calidad de datos en una práctica continua y hace más fácil añadir nuevos procesos sin repetir una limpieza completa.
EN RESUMEN
Ideas clave
Prepara solo los datos que necesita el primer proceso.
Define una fuente de verdad por cada dato crítico.
Mide completitud, duplicados, antigüedad y contradicciones.
Normaliza campos estructurados antes del razonamiento.
Minimiza datos personales y sensibles.
Aplica privilegio mínimo por sistema y operación.
Separa hechos confirmados de inferencias.
Define reglas explícitas para datos ausentes y contradictorios.
Prueba con excepciones reales, no solo ejemplos limpios.
Conserva procedencia y trazabilidad.
Monitoriza calidad después del lanzamiento.
Amplía el alcance solo cuando el conjunto mínimo funciona de forma estable.
SIGUE PROFUNDIZANDO
Preparación de datos para IA: conecta sistemas empresariales sin convertir datos imperfectos en errores automáticos.
Una empresa no necesita datos perfectos para empezar con IA, pero sí necesita saber qué datos son fiables, dónde está cada fuente de verdad, qué información puede consultar un Empleado IA y qué debe ocurrir cuando falta un campo o dos sistemas se contradicen. Preparar datos para automatización con IA significa ordenar acceso, calidad, permisos, formatos, documentos, retención y reglas de validación antes de conceder capacidad de ejecución. El objetivo no es crear un gran proyecto de limpieza sin fin, sino dejar suficientemente preparado el conjunto mínimo de datos que necesita el primer proceso.
APLICARLO