Respuesta directa
En pocas palabras
Para prevenir el envenenamiento de datos y modelos, acepta cada fuente mediante una política explícita, conserva procedencia y versión, pon los cambios en cuarentena y separa quien aporta, transforma, evalúa y libera. Compara contra un conjunto independiente, prueba triggers y segmentos, verifica integridad del artefacto y despliega con canary y rollback. Ningún filtro aislado demuestra que un dataset o modelo está limpio.
Trata el poisoning como un riesgo de integridad durante todo el ciclo
OWASP LLM04:2025 describe el envenenamiento cuando datos de preentrenamiento, fine-tuning o embeddings son manipulados para introducir vulnerabilidades, backdoors, sesgos o degradación. El resultado puede parecer normal en pruebas generales y cambiar solo ante un trigger, una cuenta, una frase o una condición específica. Por eso no basta con revisar una respuesta visible ni con confiar en el tamaño del dataset.
Distingue ataque, error y drift sin perder la capacidad de responder. Poisoning implica una interferencia adversaria sobre datos, proceso o modelo; contaminación puede ocurrir sin intención, por ejemplo al mezclar evaluación con entrenamiento; drift es un cambio de distribución en operación. Los tres afectan calidad, pero exigen investigación y controles distintos. La aplicación debe conservar evidencia suficiente para localizar la ruta afectada y retirar su resultado.
Mapea el ciclo y sus fronteras de confianza
Dibuja cada ruta que puede modificar comportamiento: adquisición de datos, scraping, carga de archivos, etiquetado, limpieza, deduplicación, generación sintética, feedback humano, memoria, RAG, embeddings, fine-tuning, evaluación, registro, promoción y despliegue. Incluye repositorios externos, notebooks, jobs, buckets, proveedores, respaldos y procesos manuales. Para cada salto registra quién puede escribir, qué validación ocurre y qué artefacto queda después.
Separa el modelo base de los componentes que cambian la respuesta sin tocar sus pesos. Un documento contaminado en RAG, una memoria persistente, una regla alterada o un ejemplo few-shot pueden producir un efecto similar desde la perspectiva del vendedor. No llames model poisoning a todo: conserva el componente, la versión y la ruta exacta. Esa precisión permite contener el índice o dataset afectado sin bloquear innecesariamente todo el Copilot.
Conserva procedencia y cadena de custodia por lote
Asigna un identificador inmutable a cada lote y registra origen, mecanismo de captura, fecha, responsable, términos, población, esquema, conteo, hash, transformaciones, filtros, registros rechazados y artefactos derivados. Si una fuente cambia después de ser aprobada, crea una versión nueva; no sustituyas el contenido detrás del mismo identificador. La procedencia debe permitir responder qué versiones recibieron un registro sospechoso y dónde están desplegadas.
Usa manifiestos firmados o controles equivalentes para autenticar revisiones confiables cuando el riesgo lo justifique. Verifica hashes durante transferencia y antes de construir, no solo al publicar. Protege también metadatos, porque un atacante que cambia etiquetas, particiones o referencias puede alterar el aprendizaje sin modificar el archivo principal. La firma prueba integridad y origen de una versión; no prueba que su contenido sea correcto, representativo o seguro.
Admite fuentes y cambios mediante cuarentena
Toda fuente entra primero a una zona sin confianza y sin acceso a producción. La política de admisión valida proveedor, identidad, autorización, tipo de archivo, esquema, tamaño, licencia, finalidad, datos prohibidos, duplicados, contenido ejecutable y desviaciones estadísticas. Los documentos o ejemplos aportados por clientes no deben convertirse automáticamente en entrenamiento, memoria compartida ni benchmark. Un archivo aprobado para una propuesta no hereda permiso para modificar un modelo.
La cuarentena conserva el original de forma protegida, ejecuta transformaciones reproducibles y produce un informe de aceptación o rechazo. Los parsers y herramientas operan con privilegios mínimos, red restringida y límites de recursos. Si el lote falla una condición material, no se corrige silenciosamente para que pase: se devuelve al propietario o se crea una excepción con alcance, responsable y caducidad. La admisión se repite cuando cambia fuente, esquema, pipeline o finalidad.
| Criterio | Control verificable | Atajo insuficiente |
|---|---|---|
| Fuente | Identidad, finalidad y versión aprobadas | La URL parece conocida |
| Contenido | Esquema, políticas y anomalías revisadas | El antivirus no detectó malware |
| Cambio | Nueva versión y nueva evaluación | Se reemplaza el archivo en el mismo path |
| Liberación | Gate independiente con evidencia | La métrica promedio mejoró |
Limita escritura y separa funciones críticas
Aplica permisos mínimos a datasets, etiquetas, jobs, registros, modelos y configuración. Una identidad de inferencia no necesita escribir en entrenamiento; un etiquetador no necesita promover modelos; un notebook no debe publicar directamente en producción. Usa cuentas de servicio distintas, credenciales cortas, repositorios privados y aprobación reforzada para cambios de fuente, pipeline, umbral o artefacto. Registra lecturas masivas y toda escritura material.
Separa, según el riesgo, quien aporta datos, quien transforma, quien evalúa y quien autoriza la liberación. Esta separación reduce errores e insider threat, pero no reemplaza revisión técnica: varias personas pueden compartir la misma suposición equivocada. Prueba permisos negativos con otro tenant, rol menor, cuenta desactivada y token vencido. Protege también CI/CD, cache, secrets, runners y almacenamiento temporal; la frontera falla si una ruta secundaria puede sobrescribir el artefacto aprobado.
Versiona datos, código, parámetros y artefactos como una unidad
Una versión liberable conecta dataset, consulta, código, dependencias, modelo base, parámetros, seed cuando aplique, prompt, herramientas, entorno y evaluación. Conserva un manifiesto que permita reconstruir o explicar el resultado. No uses nombres como final o último. Los artefactos derivados —embeddings, índices, adaptadores, checkpoints, caches y reportes— necesitan sus propios hashes y relación con la versión fuente.
Haz inmutables las versiones publicadas y promueve por referencia, no copiando archivos manualmente entre ambientes. Si una reconstrucción produce un hash diferente, investiga antes de liberar. Define qué grado de reproducibilidad es viable para servicios externos que no exponen pesos o determinismo; conserva al menos modelo declarado, configuración, fecha, evaluación y respuestas observadas. No inventes reproducibilidad donde el proveedor no la ofrece.
Busca anomalías sin confundirlas con una defensa completa
Mide duplicados, valores faltantes, cambios de esquema, distribución, etiquetas, idioma, fuente, frecuencia, outliers, similitud, toxicidad y contenido inesperado. Compara el lote nuevo con su baseline y con fuentes independientes. Revisa concentraciones pequeñas que una media global ocultaría: un backdoor puede afectar una frase rara o un segmento específico. Conserva muestras rechazadas y razón de decisión para mejorar detectores sin reintroducirlas accidentalmente.
Los filtros estadísticos pueden eliminar ejemplos legítimos y conservar ataques diseñados para parecer normales. Un umbral no demuestra intención ni seguridad. Combina reglas deterministas, validación de fuente, revisión dirigida, análisis de clusters y pruebas de comportamiento. Mide falsos positivos y falsos negativos. Si un equipo ajusta repetidamente el detector mirando el mismo conjunto de prueba, ese conjunto deja de ser una evaluación independiente y puede ocultar la contaminación.
Evita que feedback, memoria y uso diario se vuelvan entrenamiento automático
En ventas, una edición, un pulgar arriba, una nota, una apertura de Buyer Room o una etapa modificada no son etiquetas confiables por sí solas. Pueden reflejar estilo, negociación, error de captura o una decisión externa. Registra tarea, contexto, autor, instrucción, confianza y resultado esperado antes de convertir feedback en ejemplo. Separa corrección factual, preferencia, aprobación y resultado comercial.
Desactiva por defecto cualquier ruta que lleve conversaciones o documentos de un tenant a memoria global, fine-tuning o mejora compartida. La memoria por cuenta y el RAG requieren autorización, procedencia, aislamiento, expiración y revocación. Si existe aprendizaje en línea, usa una zona intermedia, límites de contribución, revisión y capacidad de revertir. Una persona atacante no debe poder moldear gradualmente el comportamiento con muchas interacciones aparentemente normales.
Protege train, validation, test y challenge sets
Separa físicamente y por permisos los conjuntos de entrenamiento, validación, prueba y challenge. Deduplica por contenido y similitud, no solo por ID. Un caso que aparece en train y test produce una mejora aparente; un evaluador optimizado repetidamente contra el mismo benchmark deja de medir generalización. Mantén un holdout limpio al que el pipeline de entrenamiento no pueda leer y registra cada acceso excepcional.
Evalúa por tarea, fuente, idioma, segmento, trigger y consecuencia. Además del promedio, revisa tasas de error, abstención, toxicidad, fuga, reglas comerciales y diferencias entre versiones. Incluye controles negativos y canarios conocidos que deberían activar alertas si aparecen. Una mejora global no compensa una caída crítica en autorización, precios o separación de tenants. Define límites de no regresión antes de ejecutar el experimento.
Prueba backdoors y triggers que la evaluación promedio no ve
Construye pruebas para frases, nombres, formatos, Unicode, idiomas, fechas, combinaciones raras, metadatos, imágenes, secuencias y contexto recuperado. Busca cambios súbitos de rechazo, obediencia, tono, recomendación, acceso o selección de herramienta. Varía una dimensión a la vez y compara con un modelo o dataset de referencia. No publiques triggers reales ni detalles que faciliten explotación; conserva el caso completo en evidencia restringida.
Prueba también comportamiento dormido: después de cierto número de pasos, ante una identidad específica o cuando aparece un contenido externo. Repite en ambientes aislados sin herramientas de efecto real. Un test que no encuentra backdoor solo reduce incertidumbre dentro de su cobertura. Documenta espacios no probados y riesgo residual. Si aparece una señal, pausa promoción, preserva hashes y logs, y evita seguir consultando de forma que destruya o amplifique evidencia.
Verifica modelos y artefactos de terceros antes de cargarlos
Un modelo externo puede contener comportamiento alterado, backdoors o formatos capaces de ejecutar código al deserializar. Usa fuentes verificables, versiones fijadas, hashes, firmas disponibles, formatos seguros y escaneo en un entorno aislado. Revisa model card, licencia, procedencia, cambios, dependencias y reputación sin convertirlos en garantía. No cargues un artefacto no confiable en un proceso con secretos, red abierta o acceso de escritura.
Prueba el modelo candidato contra la misma suite independiente y compara respuestas, latencia, seguridad y segmentos. Mantén un inventario AI/ML-BOM que conecte proveedor, modelo, dataset, librerías, contenedor y despliegue. El control de supply chain se cruza con poisoning, pero no es idéntico: un paquete vulnerable, una imagen comprometida o un archivo ejecutable exigen controles de software además de evaluación del comportamiento del modelo.
Libera con gates, canary y rollback probado
La promoción requiere manifiesto, hashes, fuente, evaluación, riesgos, aprobaciones, limitaciones y plan de reversión. Usa el mismo artefacto aprobado en cada ambiente. Despliega primero a tráfico controlado, cuentas sintéticas o un porcentaje pequeño y compara contra baseline. Mantén human review para resultados materiales y bloquea acciones automáticas nuevas durante la observación. No amplíes exposición porque una sola métrica se mantiene estable.
El rollback debe retirar modelo, índice, memoria, configuración y datos derivados afectados, no solo cambiar un contenedor. Prueba que la versión anterior siga disponible y compatible con el esquema. Define condiciones automáticas y humanas para detener: canario inesperado, diferencia segmentada, fuga, cambio de autorización, aumento de quejas o pérdida de integridad. Después de revertir, preserva evidencia y evita reconstruir desde una fuente que siga contaminada.
Monitorea comportamiento y responde como incidente de integridad
Observa cambios de fuente, hash, permisos, volumen, etiquetas, distribución, evaluación, rechazo, quejas, correcciones y comportamiento por segmento. Correlaciona versión de datos, modelo, índice, prompt y herramienta con cada resultado sin registrar contenido personal innecesario. Alerta cuando un artefacto desplegado no coincide con el registro, un lote cambia fuera del pipeline o un segmento se desvía aunque el promedio permanezca estable.
El runbook debe congelar ingestión, revocar escritura, aislar fuentes, pausar promoción, retirar versiones, desactivar aprendizaje, volver a un artefacto conocido y notificar a propietarios. Preserva originales, manifiestos, hashes, accesos y decisiones. Determina alcance por lineage: qué datasets, embeddings, evaluaciones, modelos y tenants tocaron la fuente. Corrige, reconstruye desde un punto limpio y reabre con canary. No borres el lote sospechoso antes de conservar evidencia autorizada.
Aplica estas fronteras al contexto real de Cerravi
OWASP LLM04 aporta escenarios y mitigaciones para datos, modelos y embeddings; NIST AI 100-2 organiza ataques adversarios y reconoce límites de las defensas; la guía conjunta de seguridad de datos de IA difundida por NSA destaca procedencia, revisiones autenticadas, infraestructura confiable y protección durante todo el ciclo; NIST AI RMF ayuda a gobernar, medir y gestionar el riesgo. Ninguna referencia certifica una implementación concreta.
En Cerravi, Copilot organiza contexto y propone borradores para revisión humana; los recorridos públicos no envían mensajes ni cambian etapas automáticamente. Las propuestas usan productos y precios conocidos. Si falta un importe, se marca para confirmación y no se inventa. Las monedas permanecen separadas salvo conversión aprobada. Buyer Room aporta señales sin probar identidad, aceptación, firma, pago ni intención. Forecast usa reglas transparentes del CRM y no es un modelo predictivo entrenado con resultados de clientes. Esta guía no afirma que Cerravi entrene modelos propios, ofrezca aprendizaje en línea o detecte todo poisoning.

Preguntas frecuentes
Dudas comunes sobre este proceso
¿Qué es el envenenamiento de datos en inteligencia artificial?
Es la manipulación adversaria de datos usados para entrenar, ajustar, evaluar o alimentar componentes de IA con el fin de degradar, sesgar o activar un comportamiento oculto. Puede afectar datasets, etiquetas, feedback, embeddings y procesos de aprendizaje.
¿Cuál es la diferencia entre data poisoning, model poisoning y drift?
Data poisoning altera los datos; model poisoning modifica el proceso o artefacto del modelo; drift es un cambio de la distribución operativa y puede ocurrir sin ataque. Los síntomas pueden parecer similares, por lo que se necesita procedencia, versiones y evidencia para distinguirlos.
¿Un detector de anomalías evita el poisoning?
No. Puede encontrar desviaciones conocidas, pero también rechazar datos legítimos o no detectar ejemplos diseñados para parecer normales. Debe combinarse con control de fuente, permisos, cuarentena, evaluación independiente, pruebas de triggers, monitoreo y rollback.
¿El feedback de vendedores puede entrenar automáticamente un Copilot?
No debería hacerlo por defecto. Una edición o resultado comercial no es ground truth. Primero hay que separar finalidad, tenant, autorización, contexto, etiqueta, revisión y retención, y después admitir el ejemplo mediante un pipeline controlado y reversible.
¿Cerravi entrena modelos con datos o resultados de sus clientes?
Los límites públicos actuales no afirman entrenamiento propio ni aprendizaje en línea. Forecast usa reglas transparentes del CRM y no es un modelo predictivo entrenado con cierres de clientes. Las organizaciones deben verificar además sus proveedores e integraciones reales.