iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more
Un contrato verificable para un agente LLM convierte expectativas en límites observables: qué entradas acepta, qué salida debe producir, qué herramientas puede solicitar, con qué parámetros y bajo qué condiciones se permite actuar. Los esquemas, permisos y presupuestos se pueden comprobar mecánicamente; que una respuesta abierta sea correcta o útil requiere evaluación semántica y no equivale a una prueba formal completa.
Qué significa que un contrato de agente sea verificable
Un contrato describe condiciones comprobables alrededor del agente, no una garantía de que el modelo siempre razone correctamente. Puede fijar precondiciones de entrada, campos y tipos de salida, herramientas permitidas, límites de parámetros, presupuestos de llamadas y postcondiciones. Un arnés —el programa que rodea al modelo— comprueba esas condiciones y decide qué ocurre si alguna falla.
La especificación AgentContract es un ejemplo comunitario de este enfoque, no un estándar universal adoptado por toda la industria. La distinción importa: se pueden verificar con precisión propiedades estructurales o de acceso, mientras que la calidad de una respuesta en lenguaje natural suele depender de casos de prueba, criterios de evaluación o jueces con limitaciones.
Cómo convertir una expectativa en un contrato comprobable
1. Delimita una capacidad atómica
Define una tarea concreta y sus límites antes de invocar al modelo. Por ejemplo, un agente que clasifica solicitudes puede devolver una categoría y una justificación breve, pero no resolver cualquier consulta relacionada con el servicio. Valida las entradas fuera de alcance en el arnés para rechazarlas sin pedirle al modelo que improvise. AWS recomienda diseñar agentes para tareas específicas y atómicas: reducir el alcance facilita observar y probar el comportamiento, pero no elimina su variabilidad.
#1 Best Overall
2. Declara entradas, salidas y errores
Especifica qué campos son obligatorios, sus tipos, longitudes o rangos, y la forma de comunicar errores. Valida la respuesta en el arnés aunque el proveedor del modelo ofrezca una función de salida estructurada: la validación externa permite registrar incumplimientos y aplicar una respuesta definida por tu sistema.
Entrada aceptada: solicitud con categoria y texto no vacío
Salida esperada: estado, categoria y justificacion
Restricción: categoria pertenece a la lista permitida
Si la entrada no cumple: rechazar sin ejecutar herramientas
Este ejemplo expresa condiciones del contrato, no una sintaxis de una especificación particular. Para una salida JSON, el contrato puede comprobar que los campos requeridos existen, que sus tipos son correctos y que no exceden límites acordados; no puede concluir solo por eso que la justificación sea verdadera.
Rank #2
3. Define precondiciones y postcondiciones
Una precondición que falla puede detener el flujo antes de llamar al modelo, por ejemplo, si falta un campo requerido o el solicitante no tiene permiso. Una postcondición se comprueba después de generar una respuesta o completar una herramienta, como exigir un estado final permitido o confirmar que una acción quedó registrada. Si no se cumple, el sistema puede bloquear el resultado, pedir revisión o devolver un error controlado, en vez de tratarlo como éxito.
Recommended Free Tools
Cómo controlar las herramientas y los permisos
Una llamada a una herramienta debe tratarse como una solicitud del modelo, no como una ejecución autorizada. El modelo devuelve una petición estructurada con el nombre de la herramienta y sus parámetros; el arnés valida esa petición y solo entonces ejecuta la acción. Open Policy Agent describe este patrón como una separación entre el punto que aplica la decisión y el punto que decide la política.
- Recibe la solicitud estructurada de herramienta del modelo.
- Comprueba que la herramienta esté permitida para esta capacidad y que los parámetros cumplan el contrato.
- Consulta la política de autorización cuando la acción requiera una decisión adicional.
- Ejecuta únicamente las solicitudes aprobadas y registra la decisión junto con el resultado.
- Ante una solicitud denegada o inválida, bloquea la ejecución y sigue la respuesta de error definida.
Aplica mínimo privilegio: concede a cada agente solo las herramientas y acciones necesarias para su función. AWS recomienda permisos dedicados por agente y límites de acceso explícitos. Separar la autorización de la decisión del modelo evita que una respuesta del LLM, por sí sola, tenga poder para ejecutar una acción externa.
Qué puede comprobarse automáticamente y qué necesita evaluación
| Enfoque | Comprueba bien | Límite principal | Uso adecuado |
|---|---|---|---|
| Validación determinista | Tipos, campos, formato, límites, conteos y políticas explícitas. | No determina por sí sola si una respuesta abierta es útil, correcta o verdadera. | Aplicarla en cada ejecución en los límites de entrada, salida y herramienta. |
| Casos de evaluación y trazas | Resultados, selección de herramientas, argumentos y conducta de varios pasos. | Depende de la cobertura de los casos y de la calidad de las expectativas; el modelo puede variar. | Guardar trazas representativas y repetir el conjunto al cambiar instrucciones, modelo o herramientas. |
| Juez LLM o probe | Criterios semánticos y fundamentación frente a referencias. | Puede equivocarse, ser inconsistente o recibir contenido con prompt injection. | Usarlo como evidencia evaluativa adicional, aislarlo y auditar sus justificaciones. |
La guía de AWS advierte que las salidas de los LLM son estocásticas incluso con temperatura cero. Por tanto, un contrato reduce la superficie de comportamiento que hay que observar; no vuelve determinista al modelo. Para respuestas abiertas, diseña ejemplos representativos y una rúbrica semántica. Evita exigir igualdad textual cuando varias respuestas pueden satisfacer el mismo criterio.
Rank #4
Cómo usar trazas para detectar regresiones
Una traza permite inspeccionar llamadas al modelo, llamadas a herramientas, guardrails y transferencias de control. Sirve para localizar si un agente eligió una herramienta incorrecta, pasó argumentos inválidos o realizó una transferencia cuando no correspondía. Las preguntas «¿eligió el agente la herramienta adecuada?» y «¿se produjo una transferencia cuando debía?» son diagnósticos útiles del flujo, no testimonios de consultas reales de usuarios.
What’s actually slowing this PC down?
Pick the symptom - the matching free tool is one click away.
Conserva trazas representativas y ejecuta un conjunto de evaluación repetible cuando cambies el prompt, el modelo, las herramientas o las políticas. OpenAI recomienda usar trazas para depurar y pasar a conjuntos de datos y ejecuciones de evaluación para comparar cambios de forma repetible. MLflow también plantea evaluar tanto el resultado final como la conducta intermedia. Así se pueden detectar regresiones que una respuesta final aparentemente aceptable escondería, como una llamada de herramienta improcedente.
Best Value
Cómo manejar fallos, jueces y fundamentación
Haz explícita la respuesta ante una violación
Registra qué condición falló y define de antemano si corresponde bloquear, alertar, pedir una corrección o escalar a una persona. No conviertas un resultado inválido en una respuesta aparentemente normal ni ejecutes una herramienta después de que la política la haya denegado.
Aísla cualquier juez LLM
Un juez puede ayudar a valorar respuestas en lenguaje natural, pero también puede equivocarse o verse influido por contenido adversarial. Mantén al evaluador separado del agente bajo prueba y sanea la información que incluyas en su prompt. La especificación comunitaria AgentContract advierte del riesgo de prompt injection al evaluar contenido no confiable.
Usa probes con evidencia rastreable
Para preguntas sobre afirmaciones y fuentes, NIST describe probes que contrastan afirmaciones con un corpus curado y conservan una pista auditable de la evidencia que sustenta la decisión. El corpus y el alcance del probe condicionan lo que puede concluir; una evaluación fundamentada no equivale a una garantía universal de veracidad.
Windows Errors? Fix Them Before They Spread
Repair common Windows errors and clear accumulated junk for a smoother, more stable PC - no reinstall needed.Free scan · no reinstallOutdated Drivers Are Slowing You Down
One free scan finds every outdated or missing driver and matches the right update for your exact hardware.Free scan · exact hardware matchUna rutina de implementación y mantenimiento
- Escribe el límite de capacidad: define la tarea, las entradas admisibles y qué queda fuera de alcance.
- Formaliza el contrato de datos: fija campos, tipos, restricciones y errores, y valida la entrada antes de llamar al modelo.
- Restringe acciones: enumera herramientas, parámetros y permisos por agente; exige aprobación del arnés antes de ejecutar cada llamada.
- Separa controles: automatiza estructura, conteos y políticas; evalúa semántica mediante casos y criterios apropiados.
- Instrumenta el flujo: registra trazas, decisiones de autorización, incumplimientos y transferencias de control.
- Repite evaluaciones: compara los resultados y la conducta intermedia después de cambios en prompts, modelos, herramientas o políticas.
- Define la respuesta a fallos: establece cuándo bloquear, alertar o escalar, y revisa las desviaciones frente a una línea base.
AWS recomienda seguir por agente el cumplimiento del esquema y la finalización de tareas, y alertar ante desviaciones de líneas base. Esas métricas sirven para observar un sistema concreto; no deben presentarse como porcentajes publicados de mejora por añadir contratos. No hay una estadística comparativa verificable que cuantifique cuánto aumenta la fiabilidad de los agentes al adoptar este enfoque.
Quick Recap
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

