Respuesta directa
En pocas palabras
Para definir KPI y KRI de un AI Sales Copilot, parte de las decisiones y riesgos del caso de uso; separa desempeño, exposición al riesgo y eficacia de controles; redacta un contrato para cada indicador con pregunta, fórmula, población, fuente, ventana, segmentos, limitación, dueño y frecuencia; fija umbrales y respuestas antes de observar el dato; conserva denominadores y estados no disponible; y revisa la utilidad de la métrica cuando cambien el producto, los datos o el proceso comercial. No existe un conjunto universal de porcentajes ni un score único que demuestre valor, seguridad o cumplimiento.
KPI, KRI e indicador de control responden preguntas distintas
Un KPI muestra si el sistema y el proceso avanzan hacia un objetivo definido: tiempo de preparación, trabajo completado, calidad aceptada o resultado comercial observado. Un KRI señala exposición, deterioro o cercanía a una tolerancia: precios sin fuente, evidencia vencida, accesos anómalos o cambios sin evaluar. Un indicador de control muestra si un mecanismo preventivo, detectivo o correctivo se ejecuta y produce el resultado esperado.
La misma cifra puede cambiar de función según la decisión. La tasa de correcciones puede ser una señal de aprendizaje para producto, un KRI si supera la tolerancia en una tarea crítica o parte de una prueba de control si verifica que la revisión humana detecta errores. Documenta la pregunta y la decisión; no clasifiques por el nombre de la métrica.
Evita un índice único de confianza. Velocidad, adopción, calidad, acceso, privacidad y evidencia no son intercambiables. Un promedio favorable puede ocultar una propuesta con precio incorrecto o un acceso entre espacios. Conserva dimensiones separadas y reglas de precedencia para condiciones críticas.
| Criterio | Pregunta principal | Ejemplo de respuesta |
|---|---|---|
| KPI | ¿Logramos el desempeño u objetivo acordado? | Ajustar flujo, capacidad, capacitación o alcance |
| KRI | ¿Está aumentando una exposición relevante? | Investigar, limitar, contener o escalar |
| Indicador de control | ¿El control opera y sigue siendo eficaz? | Corregir, compensar, probar de nuevo o retirar confianza |
Empieza por decisiones, objetivos y escenarios de riesgo
Lista primero las decisiones que debe apoyar el sistema de medición. Operación puede decidir investigar una degradación; producto, detener un rollout; ventas, cambiar un proceso; seguridad o privacidad, contener una exposición; dirección, aceptar residual o reducir alcance. Una métrica sin decisión asociada suele convertirse en decoración del dashboard.
Para cada caso de uso escribe objetivo, usuario, objeto, entrada, salida, efecto permitido, límites y escenarios de daño. Un copiloto que redacta una propuesta, resume una oportunidad y sugiere un siguiente paso necesita indicadores diferentes. No combines recorridos, versiones, regiones o monedas solo para obtener una cifra ejecutiva.
NIST AI RMF plantea que la selección de métodos y métricas parte de los riesgos identificados y del contexto. También pide documentar riesgos o características que no pueden medirse. Esa ausencia es información de gobierno: se atiende con evaluación cualitativa, prueba, restricción, control compensatorio o decisión explícita, no con precisión fabricada.
Convierte cada indicador en un contrato reproducible
El nombre no basta. Registra pregunta, definición, fórmula, unidad, fuente, población, numerador, denominador, exclusiones, ventana, zona horaria, segmentos, frecuencia, latencia, dueño, umbral, respuesta y limitación. Conserva además versión de la definición y fecha efectiva. Así otra persona puede recalcular la cifra y entender qué cambió.
Usa denominadores explícitos. Diez correcciones entre veinte borradores visibles no significan lo mismo que diez entre veinte mil. Distingue usuarios elegibles, usuarios activos, sesiones, ejecuciones, salidas presentadas, borradores guardados, propuestas compartidas y oportunidades cerradas. No mezcles eventos técnicos con objetos comerciales.
Define estados para cero, no disponible, sin población, dato tardío, fuente incompleta y no aplicable justificado. Cero incidentes confirmados no equivale a cero riesgo; puede reflejar poca actividad o detección deficiente. Si una fuente se detiene, muestra el hueco y la última cobertura válida en lugar de arrastrar el valor anterior.
Mide utilidad y eficiencia sin prometer causalidad comercial
Los KPI de flujo pueden observar tiempo hasta un primer borrador revisable, proporción de tareas completadas, abandono, reutilización y trabajo manual restante. Define inicio y fin. Tiempo hasta borrador no es tiempo ahorrado si la revisión posterior aumenta; una salida generada no es una tarea completada si nunca se utiliza.
Los KPI de calidad pueden observar aceptación con cambios, correcciones por tipo, rechazo, completitud de campos obligatorios y revisión dentro del plazo. Interpreta aprobación con cuidado. Una tasa alta puede indicar calidad o revisión superficial; una tasa baja puede revelar errores o una política más estricta. Combina comportamiento, muestra evaluada y feedback contextual.
Win rate, ciclo de venta, ticket y conversión pertenecen al sistema comercial completo. Segmenta por mercado, canal, etapa, cohorte, tipo de cuenta y periodo; compara con línea base y registra cambios paralelos. La asociación entre uso del copiloto y cierre no demuestra que el copiloto causó el resultado. Para atribución se necesita un diseño de evaluación adecuado.
- Tiempo a borrador revisable = mediana entre solicitud válida y primer borrador presentado.
- Completitud = objetos con campos obligatorios válidos / objetos evaluables.
- Adopción elegible = usuarios activos del recorrido / usuarios habilitados para ese recorrido.
- Corrección material = salidas con cambio que altera precio, alcance, compromiso o hecho / salidas revisadas.
- Resultado comercial observado = métrica CRM segmentada, sin atribución automática al copiloto.
Diseña KRI desde escenarios concretos de daño
Un KRI útil tiene una cadena comprensible: escenario, condición observable, fuente, ventana, tolerancia y respuesta. Para propuestas, una exposición puede ser que una partida sin precio llegue a una salida compartible. Para acceso, una consulta intente cruzar el límite de un espacio. Para herramientas, una acción use parámetros o permisos fuera del esquema autorizado.
Distingue indicadores adelantados y rezagados. Cambios sin evaluar, catálogos vencidos, aumento de datos faltantes, evidencia próxima a vencer o revisores saturados pueden anticipar exposición. Incidentes confirmados, quejas validadas o propuestas corregidas después de compartir son rezagados. Ninguno predice con certeza un daño futuro.
Segmenta por consecuencia y superficie. Una incidencia crítica única puede exigir contención aunque la tasa sea pequeña. Un volumen alto de errores cosméticos no equivale a una fuga entre clientes. No uses promedios para compensar seguridad, aislamiento, autorización, precio o protección de datos.

Controla fuentes, precios, monedas y afirmaciones
Para grounding registra cobertura de fuente, edad del contenido, referencias recuperadas, conflictos y salidas sin soporte en una muestra definida. No uses similitud textual como verdad automática. Evalúa si la fuente era autorizada, vigente y suficiente para la afirmación presentada al vendedor.
Para precios separa partidas con importe válido, partidas sin importe, moneda ambigua, versión de catálogo vencida, descuento fuera de autoridad y conflicto entre fuentes. Un indicador crítico es la tasa de escapes: objetos compartibles con un valor no sustentado entre todos los objetos revisados bajo esa regla. La meta puede ser cero, pero el umbral operativo debe especificar detección, bloqueo, investigación y cierre.
Mantén MXN, USD y otras monedas separadas salvo conversión aprobada con fuente y hora. No sumes importes heterogéneos para crear pipeline o propuesta total. El indicador debe conservar catálogo, versión, moneda, origen, validación y faltantes; el dashboard no debe transformar ausencia en cero.
Mide la supervisión humana como capacidad, no como un clic
Una revisión efectiva ocurre antes del efecto, llega a la persona adecuada, presenta contexto suficiente y permite editar, rechazar o escalar. Mide cobertura de revisión, tiempo disponible, correcciones materiales, rechazos, escalaciones, backlog y casos que superaron el plazo. Separa rutas y severidades.
La tasa de override no es una métrica de calidad por sí sola. Puede aumentar porque el sistema empeoró, porque el equipo aprendió a revisar o porque cambió la política. Una tasa casi nula puede reflejar precisión o automatismo. Complementa con muestras evaluadas, entrevistas, casos de límite y resultados posteriores.
Incluye capacidad. Una regla de aprobación puede existir y fallar cuando el volumen supera al equipo, falta suplencia o el revisor no ve fuente y moneda. Define KRI de saturación y una respuesta: reducir alcance, priorizar riesgos, activar respaldo o pasar temporalmente al proceso manual.
Separa presencia, operación y eficacia del control
Un control configurado no está necesariamente operativo; uno operativo no es necesariamente eficaz. Registra cobertura esperada, ejecuciones observadas, fallas, bypass, alertas entregadas, triage, contención, recuperación y retest. La cobertura técnica debe reconciliarse con la población del proceso.
Para cada control define indicadores preventivos, detectivos y correctivos. Un validador puede bloquear un precio ausente; un monitor detectar una ruta que lo omitió; un runbook restaurar el proceso manual. Evalúalos por separado. Una alerta producida pero no atendida no demuestra respuesta.
Mide también dependencias: logging, cola, catálogo, identidad, proveedor, canal de notificación y personal de guardia. Si una dependencia común falla, varios controles pueden perder evidencia a la vez. Registra el cambio y evita contar la misma causa como riesgos independientes sin relación.
Fija líneas base, tolerancias y respuestas antes de mirar el resultado
Una línea base describe el comportamiento observado bajo una versión, población y periodo; no define por sí sola lo aceptable. La tolerancia proviene del impacto, obligación aplicable, apetito de riesgo y capacidad de respuesta. Usa bandas como observar, investigar, limitar y detener solo cuando cada una tenga criterio y autoridad.
Evita copiar porcentajes de otra empresa. El mismo uno por ciento puede ser tolerable en una preferencia de formato e inaceptable en aislamiento o precio. Para eventos de alta consecuencia usa reglas de evento único; para deterioros graduales usa tendencia, volumen mínimo y persistencia. Documenta por qué el umbral existe y cuándo se revisa.
Prueba la alerta de extremo a extremo. Inyecta una señal autorizada y controlada, confirma cálculo, estado, notificación, triage, decisión, recuperación y cierre. Mide falsos positivos y negativos cuando exista una referencia fiable. Reducir ruido no debe ocultar eventos críticos ni premiar la ausencia de reportes.
| Criterio | Condición | Respuesta definida |
|---|---|---|
| Observar | Cambio menor dentro de tolerancia | Registrar tendencia y revisar en el ritmo normal |
| Investigar | Señal persistente o dato dudoso | Validar fuente, segmento, causa y alcance |
| Limitar | Tolerancia superada sin daño crítico confirmado | Reducir población o función y abrir remediación |
| Detener | Condición crítica o control obligatorio sin sustento | Contener, escalar y exigir autorización para reanudar |
Publica la calidad del dato junto con la métrica
Cada valor necesita cobertura, frescura, retraso, duplicados, registros descartados y cambios de instrumentación. Una cifra puntual sin salud de la fuente puede parecer precisa mientras deja fuera la ruta que más importa. Muestra qué porcentaje de la población fue observable y por qué falta el resto.
Versiona fórmulas, taxonomías y fuentes. Si cambia la definición de corrección material, el evaluador o el registro de eventos, marca una ruptura de serie. No presentes mejora histórica cuando comparas métodos incompatibles. Conserva la definición anterior y el puente de reconciliación cuando sea posible.
Controla acceso y retención. Agrega por equipo o recorrido cuando el detalle individual no sea necesario. Evita convertir telemetría de calidad en vigilancia de vendedores. Las conversaciones, prompts y datos de clientes requieren finalidad, permisos, minimización, registro de acceso y periodo de conservación.
Asigna dueños y un ritmo de revisión
Separa dueño de definición, custodio de datos, operador del control y autoridad de decisión. Una persona puede ocupar más de un rol en un equipo pequeño, pero la responsabilidad debe ser visible. Incluye suplencia y escalamiento para que un indicador rojo no dependa de una cuenta ausente.
Revisa operación y alertas críticas con la frecuencia que exige su impacto; tendencias y capacidad, semanalmente; definiciones, evidencia y trade-offs, mensualmente o tras cambios materiales. Una revisión periódica puede decidir continuidad, ampliación, limitación o retiro. Adapta el calendario al riesgo, no a una plantilla universal.
Retira métricas que no cambian ninguna decisión, se duplican, inducen conducta adversa o ya no representan el sistema. Conserva el historial de la decisión y su sustituto. NIST AI RMF Measure señala que la adecuación de métricas y la eficacia de controles deben reevaluarse conforme cambian el contexto, los datos y el sistema.
Evita métricas vanidosas y objetivos fáciles de manipular
No confundas prompts enviados, textos generados, sesiones abiertas o tarjetas vistas con valor. No uses promedios sin distribución, conteos sin denominador, semáforos sin periodo ni crecimiento de uso como prueba de seguridad. No conviertas la ausencia de incidentes en evidencia de que el riesgo desapareció.
Anticipa la conducta que incentiva cada objetivo. Premiar menos correcciones puede reducir reportes; premiar tiempo de respuesta puede producir cierres superficiales; premiar adopción puede empujar usos no adecuados. Equilibra resultado, calidad, riesgo y control, y conserva un canal para impugnar clasificaciones incorrectas.
No presentes NIST, GAO ni este catálogo como certificación o requisito local. Los marcos ayudan a formular preguntas y organizar evidencia; la aplicabilidad legal, contractual y sectorial requiere análisis propio. Una métrica interna no demuestra cumplimiento ni ausencia de daño.
Aplica los indicadores a las fronteras reales de Cerravi
En Cerravi, Copilot organiza contexto y propone siguientes pasos para revisión humana; no envía mensajes ni cambia etapas automáticamente. Mide utilidad de las sugerencias y calidad de la revisión sin atribuir al producto acciones que no ejecuta.
Las propuestas utilizan productos y precios del catálogo cargado. Si falta un importe, se muestra para revisión y no se inventa. Los indicadores pueden observar partidas válidas, faltantes, moneda y correcciones, pero deben conservar catálogo, versión y denominador. Una tasa agregada no sustituye la comprobación de una partida crítica.
La actividad de Buyer Room ofrece contexto, pero no confirma identidad, lectura humana, aceptación, contrato, pago o intención. Forecast usa reglas transparentes del CRM; no es un modelo entrenado o calibrado y no garantiza cierres. Los KPI y KRI ayudan a decidir dentro de estos límites; no convierten señales en hechos ni correlación en causalidad.
Preguntas frecuentes
Dudas comunes sobre este proceso
¿Cuál es la diferencia entre KPI y KRI en un AI Sales Copilot?
Un KPI observa desempeño frente a un objetivo; un KRI señala exposición o cercanía a una tolerancia; un indicador de control muestra si un mecanismo opera y resulta eficaz. La clasificación depende de la pregunta y decisión, no solo del nombre de la cifra.
¿Qué KPI debe tener un AI Sales Copilot?
No existe un catálogo universal. Según el caso pueden medirse tiempo a borrador revisable, completitud, correcciones materiales, uso elegible y resultados CRM segmentados. Cada indicador necesita fórmula, población, fuente, periodo, limitación y decisión asociada.
¿Cómo se fija un umbral de riesgo de IA?
Se parte del escenario, impacto, tolerancia, obligación aplicable y capacidad de respuesta. Se documentan línea base, ventana, segmentos y acción antes de observar el resultado. Un evento crítico puede requerir una regla de caso único, no un porcentaje promedio.
¿Una tasa alta de aprobación humana demuestra calidad?
No. Puede reflejar buenas salidas o revisión superficial. Debe combinarse con tiempo disponible, correcciones, rechazos, escalaciones, muestras evaluadas, contexto y fallas posteriores. Tampoco una tasa alta de cambios demuestra por sí sola mala calidad.
¿Los KPI y KRI demuestran cumplimiento o impacto en ventas?
No por sí solos. Organizan evidencia sobre objetivos y riesgos definidos. El cumplimiento exige requisitos y procedimientos aplicables; la atribución comercial exige un diseño de evaluación que controle otros cambios. Una asociación observada no prueba causalidad.