Ja tenim agents autònoms comprant material i responent correus (Pas Set). La temptació ara és posar-se a dormir. Error.

En enginyeria, un sistema que no es monitoritza és un sistema que està a punt de fallar. Benvingut al Pas Vuit: L'Observabilitat.

El problema de la Caixa Negra

Quan un humà s'equivoca, li preguntes "per què". Quan una IA s'equivoca, si no tens els sistemes adequats, només veus el resultat final (el desastre). No et pots permetre que la teva IA sigui una caixa negra. Necessites un Quadre de Comandament que et digui en temps real què està passant dins del cervell dels teus agents.

LLM-as-a-Judge (La IA que vigila la IA)

Qui vigila el vigilant? No pots tenir humans llegint els 5.000 correus que el teu agent ha enviat avui. La solució és tècnica: fem servir una IA superior (el "Jutge") per auditar la feina de la IA operativa (l'"Obrer").

  • L'Agent (GPT-4o mini) redacta una resposta al client.
  • El Jutge (GPT-4) la llegeix abans d'enviar-la i li posa nota del 0 al 10 en: "To", "Veracitat" i "Seguretat".
  • Si la nota és inferior a 9, es bloqueja i avisa un humà.

Això ens permet dormir tranquils. Automatitzem l'execució, però també automatitzem la supervisió.

Mètriques que importen (KPIs d'IA)

Deixa de mesurar "vistes" o "likes". En enginyeria d'IA mesurem:

  1. Taxa d'Al·lucinació: Quin % de respostes contenen dades inventades?
  2. Cost per Execució: Quant m'ha costat processar aquesta factura? (Si costa més que fer-ho a mà, apaga el servidor).
  3. Latència: Quant triga l'agent a reaccionar?

De la Fe a l'Enginyeria

Implementar IA sense un panell de mètriques és qüestió de fe. I als negocis, la fe es paga cara. Jo no confio en els meus agents. Confio en les meves mètriques.

Reflexió de Control: Saps quants diners exactes t'ha gastat la teva IA avui i quants errors ha evitat? Si no ho saps, no estàs gestionant; estàs apostant.