El producto Presence de OpenAI traslada a las empresas de demostraciones de agentes a una producción confiable y gobernada en voz y chat. Desglosamos cómo las políticas, barreras de seguridad, acciones aprobadas, evaluaciones y un ciclo de mejora hacen que los agentes sean seguros y útiles, y qué deben hacer los líderes para definir el alcance, integrar y medir el ROI desde el primer día.
Presence replantea el problema del agente empresarial desde la elección del modelo hacia la confiabilidad operativa. Empaqueta los elementos que hacen que los agentes sean seguros y útiles a escala: conocimiento específico del trabajo, acciones aprobadas, políticas y procedimientos operativos estándar, barreras de seguridad, simulaciones y evaluadores, y una vía de escalamiento humano. Disponible para voz y chat en tiempo real, el objetivo del producto no es responder todas las preguntas, sino alcanzar consistentemente resultados correctos y conformes a la política: verificando clientes, leyendo el contexto de la cuenta, aplicando lógica empresarial y tomando acciones permitidas, mientras transfiere rápidamente los casos límite a personas. Ese diseño alinea incentivos: velocidad y contención cuando la confianza es alta, y escalamiento de bajo riesgo cuando no lo es.
La postura arquitectónica es acceso mínimo necesario. Cada despliegue comienza con un solo trabajo (por ejemplo, resolución de facturación, solicitudes de servicio de TI), define las herramientas necesarias (leer cuenta, emitir crédito dentro de límites, actualizar ticket) y aplica aprobaciones y umbrales. Luego, Presence evalúa el comportamiento usando simulaciones y evaluadores que verifican resultados, uso de herramientas, cumplimiento de políticas y tiempos de escalamiento. El resultado es un ciclo gobernado: la telemetría de sesiones en producción alimenta actualizaciones propuestas, que los equipos pueden probar A/B antes del despliegue. La integración es pragmática: conecta identidad y roles mediante IAM, muestra contexto vía CRM/ITSM y mantiene todas las acciones auditables con registros y paneles estándar.
Para los líderes, el cambio clave es tratar a los agentes como una aplicación de línea de negocio con un ciclo de vida. Presence formaliza esto con un proceso de mejora potenciado por Codex e Ingenieros Desplegados Adelantados o socios que ayudan a pasar del piloto a la producción. El éxito depende de un alcance disciplinado, un RACI claro para aprobaciones, zonas de política rojo/ámbar para acciones y SLOs de nivel empresarial: tasa de contención, precisión contra SOPs, tasa de violación de políticas, CSAT, tiempo promedio de manejo y tiempo para cambio tras descubrir brechas. Bien hecho, las empresas pueden escalar un pequeño conjunto de flujos de trabajo bien instrumentados a través de canales, reutilizando políticas, evaluaciones y reglas de escalamiento, sin reinventar la pila para cada nuevo caso de uso.
Plan de Despliegue: De Piloto a Producción en 90 Días
Fase 1 (Semanas 1–3): Seleccione un trabajo estrecho y de alto volumen con SOPs claros (por ejemplo, resolver cargos disputados ≤$100). Mapee políticas, defina acciones e integre identidad, rutas de lectura CRM/ITSM y registro. Bosqueje zonas de política rojo/ámbar/verde y defina disparadores de escalamiento. Establezca criterios de éxito: tasa objetivo de contención, delta CSAT, AHT y tasa de violación de políticas. Construya simulaciones de casos frecuentes y extremos para evaluar resultados antes de cualquier exposición al cliente.
Fase 2 (Semanas 4–8): Active producción supervisada con barreras claras: puertas de aprobación en escrituras y créditos, límites de tasa en acciones y transferencia obligatoria en baja confianza. Instrumente paneles para precisión, banderas de política y transferencias humanas. Ejecute canarios por canal, itere mediante el ciclo de mejora y codifique aprendizajes como módulos de política reutilizables. Fase 3 (Semanas 9–12): Amplíe el alcance, agregue canales y mueva aprobaciones basadas en evidencia (por ejemplo, autoaprobación de acciones de bajo riesgo). Mantenga un plan de reversión y ventanas de cambio para seguridad.
Confianza, Política y Escalamiento: Cómo se Aplica el Control
Presence aplica control por diseño. Las acciones están parametrizadas con precondiciones (por ejemplo, identidad verificada, estado de cuenta), límites de magnitud (topes de crédito) y requisitos de aprobación (gerente, humano en el ciclo). Las barreras detectan solicitudes fuera de política y dirigen o detienen interacciones. Las reglas de escalamiento se activan con baja confianza, contexto faltante o riesgo detectado, transfiriendo con transcripción completa y estado para que humanos completen el trabajo. Las evaluaciones se ejecutan continuamente: simulaciones antes del lanzamiento, evaluadores post-lanzamiento en sesiones muestreadas y alertas por desviaciones de política o mal uso de herramientas.
Las empresas deben alinear esto con programas de gobernanza: acceso basado en roles vía IAM, minimización de datos para PII, reglas de retención y auditorías integradas en herramientas de cumplimiento existentes. Defina umbrales de aceptación/rechazo por métrica y trate cualquier regresión de política como bloqueo de lanzamiento. Esto permite a líderes de operaciones adaptar agentes conforme cambian productos y reglas, sin ceder control al comportamiento opaco del modelo.