Cómo probamos herramientas antes de recomendarlas

El Laboratorio Optimus Vita prueba herramientas y sistemas de IA antes de recomendarlos: medimos el problema, el coste, la evidencia, los riesgos y la decisión.

EXPERIMENTO 001 · CERRADO CON LÍMITES

Respuesta rápida

No recomendamos una herramienta porque sea nueva, popular o gratuita. Primero definimos el problema, la alternativa actual y el riesgo; después hacemos una prueba pequeña, guardamos evidencia y terminamos con una decisión revisable: adoptar, ajustar, mantener en espera o descartar.

Para quién es: profesionales y equipos pequeños que quieren evaluar una herramienta de IA, automatización o productividad sin sumar otra cuenta por impulso. No sustituye una evaluación técnica, legal, clínica, laboral o de protección de datos cuando la decisión tenga consecuencias importantes.

Flujo del Laboratorio Optimus Vita: problema, hipótesis, prueba, evidencia, decisión y revisión.
Una prueba no termina al instalar una app: termina con evidencia, una decisión y una regla de revisión.

La prueba real: auditar nuestro propio sistema de calidad

El primer experimento cerrado no fue una comparativa de veinte apps. Probamos el sistema que decide si un contenido de Optimus Vita puede llegar a revisión humana. Lo aplicamos al artículo sobre cómo detectar qué tareas repetitivas merece la pena automatizar.

Pregunta: ¿el control detecta defectos materiales y bloquea la pieza hasta que cada fase y tres validadores independientes alcanzan 95?

Resultado observado: 10 fases, 30 ejecuciones de validadores, nota mínima 95, cero fallos duros y estado READY_FOR_HUMAN_PREVIEW.

Lo que no demuestra: no se publicó el candidato y no se midieron tráfico, interacción, conversión, ingresos ni tiempo ahorrado.

Qué errores encontró antes de presentar el resultado

  • Un bloque visual vacío después de retirar una sección redundante.
  • La eliminación accidental de una respuesta rápida al limpiar un índice antiguo.
  • Falsos positivos lingüísticos causados por tablas aplanadas y términos técnicos.
  • Una captura hecha antes de que la imagen terminara de mostrarse.
  • Un límite metodológico: Lighthouse podía medir la página pública anterior, no certificar un candidato local.

Corregir esos fallos es útil. Presentarlo como prueba de crecimiento sería falso. La calidad previa a publicación y el resultado posterior son capas distintas.

Cuatro componentes, cuatro decisiones distintas

Componente Decisión Por qué Límite
Control estricto Content OS KEEP Bloqueó el avance y exigió evidencia por fase. No demuestra utilidad para el lector ni crecimiento.
LanguageTool local KEEP + revisión Encontró defectos reales de español. Sus coincidencias incluyen falsos positivos; no decide por sí solo.
Lighthouse KEEP técnico La página viva usada como línea base obtuvo 99/97/100/100. No evalúa originalidad, utilidad o la versión local aún no publicada.
Voz sintética del Reel B HOLD La revisión humana rechazó su naturalidad y claridad. No se reutiliza como audio maestro sin una nueva prueba y aprobación.

Coste registrado: 0 EUR de software añadido en esta ejecución. No contamos como gratuitos el tiempo humano ni las suscripciones ya existentes: el tiempo total no se midió y, por tanto, no afirmamos ahorro.

El método en seis pasos

  1. Problema. Describe la fricción con un ejemplo reciente. Si solo existe curiosidad por una app, todavía no hay caso.
  2. Línea base. Registra la alternativa actual: tiempo, errores, coste, calidad o pasos manuales. Lo no medido queda como NA, no como cero.
  3. Prueba pequeña. Usa una tarea real y reversible. No migres todo el sistema para comprobar una promesa.
  4. Evidencia y riesgo. Conserva entradas, salidas, errores, permisos, mantenimiento y dependencia del proveedor.
  5. Decisión. Adopta, ajusta, espera o descarta. Una nota alta no anula un riesgo crítico.
  6. Revisión. Fija cuándo reabrir la decisión: cambio de precio, privacidad, volumen, necesidad o resultado.

Cómo usar la matriz sin convertirla en falsa precisión

La matriz pondera diez criterios: encaje con el problema, frecuencia, tiempo neto, calidad, integración, privacidad, mantenimiento, reversibilidad, adopción y coste total. Las celdas de evidencia y riesgo son tan importantes como la puntuación.

Tres reglas antes de decidir

  • Compara con la alternativa actual. Una app no compite contra «no hacer nada», sino contra tu proceso real.
  • Incluye mantenimiento y revisión. El tiempo bruto ahorrado puede desaparecer al configurar, corregir y supervisar.
  • Un riesgo crítico bloquea. Privacidad, falta de reversibilidad o un error difícil de detectar pesan más que una media bonita.

Descarga la matriz auditada

Incluye una evaluación, criterios con anclas 1/3/5, un registro de 30 pruebas y un ejemplo marcado de forma visible como didáctico. Sus fórmulas y sus cuatro hojas pasaron controles de estructura, errores y representación visual.

Descargar la Matriz Optimus Vita (.xlsx)

Límite: el recurso ayuda a comparar y documentar. No certifica una herramienta ni sustituye la decisión humana.

Qué tomamos de los marcos externos

El AI Risk Management Framework de NIST organiza la gestión en gobernar, identificar el contexto, medir y gestionar; también pide documentar lo que no puede medirse y probar antes y durante el uso. Es un marco voluntario: nuestra matriz no es una certificación NIST.

Las directrices británicas de compra de IA recomiendan definir el problema, probar con pruebas de concepto, examinar limitaciones, evitar dependencia y pedir evaluación reproducible. Se citan como contraste metodológico, no como asesoramiento legal o de contratación.

Cuándo descartar sin seguir puntuando

  • No puedes explicar qué problema resuelve esta semana.
  • El error sería difícil de detectar o corregir.
  • Exige datos sensibles sin permisos, minimización o control suficientes.
  • No permite exportar, revertir o recuperar el proceso anterior.
  • El resultado exige más revisión y mantenimiento que la alternativa.
  • La única razón para continuar es el tiempo ya invertido.

Veredicto del experimento 001

Mantenemos el control estricto, pero no tratamos sus herramientas como jueces universales. LanguageTool revisa lenguaje, Lighthouse revisa la capa técnica y la evaluación humana puede bloquear una voz que supera controles automáticos. Cada herramienta conserva un alcance explícito.

El sistema ha demostrado que puede encontrar y obligar a corregir defectos antes de una revisión humana. Todavía no ha demostrado que una pieza certificada genere más tráfico o más valor percibido. Esa pregunta solo puede responderse después de publicar con línea base, lectura suficiente y atribución honesta.

Deja un comentario