Pas Vuit: El Quadre de Comandament. Si no ho mesures, no existeix
Implementar agents sense supervisió és un suïcidi empresarial. Descobreix com fer servir la pròpia IA per auditar els teus agents en temps real (LLM-as-a-Judge).
Ja tenim agents autònoms comprant material i responent correus (Pas Set). La temptació ara és posar-se a dormir. Error.
En enginyeria, un sistema que no es monitoritza és un sistema que està a punt de fallar. Benvingut al Pas Vuit: L'Observabilitat.
El problema de la Caixa Negra
Quan un humà s'equivoca, li preguntes "per què". Quan una IA s'equivoca, si no tens els sistemes adequats, només veus el resultat final (el desastre). No et pots permetre que la teva IA sigui una caixa negra. Necessites un Quadre de Comandament que et digui en temps real què està passant dins del cervell dels teus agents.
LLM-as-a-Judge (La IA que vigila la IA)
Qui vigila el vigilant? No pots tenir humans llegint els 5.000 correus que el teu agent ha enviat avui. La solució és tècnica: fem servir una IA superior (el "Jutge") per auditar la feina de la IA operativa (l'"Obrer").
- L'Agent (GPT-4o mini) redacta una resposta al client.
- El Jutge (GPT-4) la llegeix abans d'enviar-la i li posa nota del 0 al 10 en: "To", "Veracitat" i "Seguretat".
- Si la nota és inferior a 9, es bloqueja i avisa un humà.
Això ens permet dormir tranquils. Automatitzem l'execució, però també automatitzem la supervisió.
Mètriques que importen (KPIs d'IA)
Deixa de mesurar "vistes" o "likes". En enginyeria d'IA mesurem:
- Taxa d'Al·lucinació: Quin % de respostes contenen dades inventades?
- Cost per Execució: Quant m'ha costat processar aquesta factura? (Si costa més que fer-ho a mà, apaga el servidor).
- Latència: Quant triga l'agent a reaccionar?
De la Fe a l'Enginyeria
Implementar IA sense un panell de mètriques és qüestió de fe. I als negocis, la fe es paga cara. Jo no confio en els meus agents. Confio en les meves mètriques.
Reflexió de Control: Saps quants diners exactes t'ha gastat la teva IA avui i quants errors ha evitat? Si no ho saps, no estàs gestionant; estàs apostant.
Observabilitat, Mètriques i Auditoria d'IA
- Per què la "Caixa Negra" és el principal enemic de la confiança en l'automatització amb IA?
- La Caixa Negra es refereix a la incapacitat de veure com i per què la IA va prendre una decisió. Si un sistema autònom comet un error i no existeix un registre detallat del seu raonament, és impossible corregir-lo. L'observabilitat consisteix a il·luminar aquesta caixa negra per auditar el procés de pensament de la màquina.
- En què consisteix la tècnica de supervisió "LLM-as-a-Judge" (IA com a Jutge)?
- És una arquitectura de control de qualitat on s'utilitza un model d'IA superior (el "Jutge") per auditar la feina d'un model operatiu més ràpid (l'"Obrer"). Abans d'enviar un correu, el Jutge llegeix l'esborrany, el puntua segons criteris de seguretat, i només aprova l'enviament si supera un llindar de qualitat.
- Quines són les mètriques d'enginyeria (KPIs) crítiques per mesurar el rendiment d'un agent?
- Més enllà de mètriques vanidoses, l'enginyeria d'IA mesura: 1) Taxa d'Al·lucinació (veracitat), 2) Taxa d'Èxit en l'execució, 3) Latència (temps de resposta) i 4) Cost per Execució. Monitoritzar el cost és vital per assegurar que l'automatització no sigui més cara que el procés manual.
- Per què automatitzar l'execució requereix obligatòriament automatitzar la supervisió?
- Perquè la IA escala la producció a nivells inhumans. Si un agent envia 5.000 correus al dia, és impossible que un humà els revisi tots. L'única forma de mantenir la qualitat és tenir sistemes automàtics d'auditoria que revisin el 100% de les interaccions i només elevin a l'humà l'1% problemàtic.
- Quina és la diferència entre gestionar per "Fe" i gestionar per "Enginyeria" en projectes d'IA?
- Gestionar per Fe és "esperar que la IA ho faci bé". Gestionar per Enginyeria és assumir que la IA fallarà i construir sistemes de mètriques i tallafocs que detectin i mitiguin aquesta fallada. La confiança en la IA ve del control.
Comentarios