Los agentes de IA autónomos solo merecen la pena cuando la tarea, los límites, la revisión humana y el criterio de parada están definidos antes de ejecutar.
DECIDIR · LIMITAR · SIMULAR · MEDIR
Respuesta rápida
Un agente de IA merece la pena cuando debe interpretar contexto y coordinar varios pasos con herramientas. Si todas las reglas ya están claras, una automatización determinista suele ser más sencilla de comprobar.
La primera prueba no debería empezar dándole permisos. Empieza escribiendo un contrato: objetivo, datos permitidos, acciones prohibidas, excepciones, aprobación humana, registro y rollback.
Antes del agente: elige el sistema más simple
Chat
Una pregunta, una respuesta y ninguna acción externa.
Asistente
Prepara, resume o revisa; una persona ejecuta.
Automatización
Aplica reglas conocidas entre entradas y salidas estables.
Agente
Decide el siguiente paso dentro de límites y puede usar herramientas autorizadas.
La guía oficial de OpenAI reserva los agentes para flujos donde un modelo gobierna la ejecución y usa herramientas bajo guardrails; también señala que una solución determinista puede bastar cuando no hace falta ese criterio.
Contrato mínimo antes de conectar herramientas
- Objetivo: una salida observable, no «ayúdame con todo».
- Entrada: fuentes permitidas y datos que nunca deben entrar.
- Permisos: lectura, borrador o escritura reversible; nada implícito.
- Prohibiciones: acciones externas, sensibles o irreversibles.
- Excepciones: condiciones que fuerzan STOP o revisión.
- Registro: input, herramientas, acciones, error y salida.
- Rollback: cómo volver al último estado válido.
Seis ejercicios de mesa para encontrar límites
Estos casos son simulaciones de diseño: no ejecutaron agentes ni servicios reales. Sirven para comprobar si el contrato contiene una ruta segura; no demuestran fiabilidad, ahorro ni autonomía.
A01-READ · EJERCICIO DE MESA
Resumir documentos internos aprobados
- Puede
- Leer una carpeta concreta y entregar un borrador con enlaces a la fuente.
- No puede
- Modificar archivos, ampliar la búsqueda o usar datos fuera de la carpeta.
- Excepción
- Falta una fuente o dos documentos se contradicen.
- Control humano
- Una persona decide qué fuente prevalece antes de cerrar el resumen.
- Rollback
- Descartar el borrador; no existe escritura externa que revertir.
LECTURA → BORRADOR → REVISIÓN
A02-DRAFT · EJERCICIO DE MESA
Preparar una respuesta a un cliente
- Puede
- Redactar un borrador con la información autorizada.
- No puede
- Enviar, prometer plazos, precios, descuentos o excepciones.
- Excepción
- La petición implica una condición comercial no documentada.
- Control humano
- Una persona corrige y envía desde la cuenta oficial.
- Rollback
- Eliminar el borrador y conservar la petición original.
ENTRADA → BORRADOR → APROBACIÓN
A03-LIMIT · EJERCICIO DE MESA
Clasificar una solicitud de reembolso
- Puede
- Extraer importe, motivo y evidencia; proponer una categoría.
- No puede
- Aprobar, denegar, pagar o comunicar una decisión.
- Excepción
- Importe superior al límite o evidencia incompleta.
- Control humano
- La decisión económica siempre queda fuera del agente.
- Rollback
- Restaurar la categoría anterior desde el registro de cambios.
EXTRACCIÓN → EXCEPCIÓN → DECISIÓN HUMANA
A04-INJECTION · EJERCICIO DE MESA
Procesar un documento con instrucciones hostiles
- Puede
- Tratar el archivo como datos y extraer solo los campos definidos.
- No puede
- Obedecer instrucciones del documento o revelar contexto del sistema.
- Excepción
- El contenido intenta cambiar el objetivo, los permisos o el destino.
- Control humano
- Detener, marcar el archivo y solicitar revisión.
- Rollback
- Cancelar la ejecución y descartar cualquier salida parcial.
DETECCIÓN → STOP → REVISIÓN
A05-WRITE · EJERCICIO DE MESA
Crear tareas desde actas de reunión
- Puede
- Proponer tareas en una cola de revisión sin responsables inventados.
- No puede
- Asignar personas, fechas o prioridades ausentes.
- Excepción
- La nota no identifica responsable o fecha.
- Control humano
- Una persona completa los campos antes de escribir en el gestor.
- Rollback
- Borrar el lote de borradores mediante su identificador de ejecución.
PROPUESTA → COMPLETAR → ESCRITURA REVERSIBLE
A06-FAIL · EJERCICIO DE MESA
Recuperarse de una salida inválida
- Puede
- Validar el formato y repetir una vez con el mismo input congelado.
- No puede
- Encadenar reintentos, ocultar el error o cambiar datos para forzar éxito.
- Excepción
- La segunda salida vuelve a fallar la validación.
- Control humano
- Pausar y entregar input, ambas salidas y error literal.
- Rollback
- Volver al último estado válido; cero publicaciones o envíos.
VALIDACIÓN → 1 REINTENTO → HOLD
Sube permisos solo cuando el error siga siendo reversible
Solo lectura
Consulta fuentes permitidas y entrega evidencia.
Borrador
Propone cambios, pero no escribe ni envía.
Escritura reversible
Crea un registro identificable y recuperable.
Impacto externo
Mensaje, pago, contrato o decisión sobre personas: aprobación humana explícita.
En ámbitos de alto riesgo, el marco europeo del AI Act exige controles adicionales como trazabilidad y supervisión humana. Esta guía no sustituye una revisión jurídica, de seguridad o sectorial.
Protocolo de cinco ejecuciones comparables
Estado: protocolo propuesto; Optimus Vita no ha publicado todavía un recibo de cinco ejecuciones de este agente.
- Congela cinco inputs representativos, incluido uno ambiguo y uno hostil.
- Registra proceso manual, criterio de salida utilizable y acciones prohibidas.
- Ejecuta con los mismos permisos, modelo, instrucciones y límite de reintentos.
- Anota tiempo total, intervención humana, error literal, coste conocido y rollback.
- Decide KEEP, ADJUST o KILL sin cambiar el criterio después de ver los resultados.
KEEP: 4/5 salidas utilizables, cero acciones prohibidas, errores detectables y trabajo total menor sin perder calidad.
ADJUST: 2–3/5 utilizables o supervisión excesiva.
KILL: 0–1/5 utilizables, una acción prohibida, un error oculto o más trabajo total.
Cuándo no empezar con un agente
- No sabes describir el proceso actual.
- No puedes definir qué salida es correcta.
- El sistema necesita acceso amplio «por si acaso».
- Un error puede afectar salud, empleo, crédito, derechos, dinero o reputación.
- No existe registro, responsable, parada ni rollback.