Cómo probar tu agente antes de publicarlo
El playground es el lugar donde un agente revela sus huecos antes de que los encuentre un usuario real. Una guía práctica de qué probar y cómo leer lo que sale mal.

Un agente que responde bien a las tres preguntas que probaste mientras lo construías no está probado: está apenas tocado. El playground existe para gastar ahí los errores que, de otro modo, los encontraría tu primer usuario real. Probar bien antes de publicar no es opcional ni un paso de trámite: es la diferencia entre depurar en privado y depurar en público.
Prueba como tu peor usuario, no como su creador
Quien escribió las instrucciones tiende a probar dentro de los límites que imaginó, y por eso el agente siempre «funciona» cuando lo prueba su propio autor. La prueba útil es la incómoda: pregúntale lo que no debería contestar, dale información incompleta a propósito, cambia de tema a mitad de conversación y observa si se pierde. Cada uno de esos casos revela una instrucción que faltaba, no un defecto del modelo.
Los tres tipos de prueba que más rinden
- Preguntas fuera de alcance: qué responde cuando le piden algo que su propósito no cubre.
- Datos incompletos: qué hace cuando falta un dato que necesitaba para usar un Power.
- Cambios de tema a mitad de conversación: si conserva el contexto correcto o mezcla dos hilos.
Cuando una respuesta sale mal, resiste la tentación de reescribir toda la instrucción de golpe. Primero identifica si el problema es de alcance —no sabía que eso quedaba fuera—, de dato —no tenía la información y debía preguntarla— o de herramienta —tenía el Power pero no lo usó—. Cada tipo de fallo se corrige distinto, y tratarlos todos igual produce instrucciones cada vez más largas sin resolver la causa.
Cuando un Power no dispara en la prueba
Si el agente tenía la herramienta correcta disponible y aun así no la usó, revisa primero la descripción del Power: es la única señal que el modelo tiene para decidir cuándo aplica. Una descripción que dice qué hace técnicamente el endpoint le dice menos al agente que una que describe el efecto para el usuario. Ajusta la descripción antes de sospechar del modelo.
Cada respuesta rara en el playground es información gratis. La misma respuesta rara en producción cuesta la confianza de un usuario.
No hay un número mágico de pruebas antes de publicar, pero sí una señal clara de que ya es momento: cuando dejas de encontrar respuestas que te sorprenden. Mientras el agente siga contestando algo que no anticipaste, todavía hay una instrucción por afinar antes de que la vea alguien fuera de tu equipo.
Lleva esto a producción con Arko
Crea tu agente, conéctale tus APIs con Powers y publícalo en tu producto desde un solo panel. Empieza gratis hoy mismo.
Crear cuenta gratis

