Un agent ne produit pas seulement du texte : il observe un environnement, choisit une action et modifie parfois un système réel. Cette boucle augmente la valeur possible, mais aussi le rayon d'une erreur. L'autonomie doit donc être accordée action par action, avec identité, limites et preuves.
Réduire l'espace d'action
Chaque outil expose une opération précise avec un schéma validé. L'agent ne reçoit pas un accès général à une base ou à un terminal lorsqu'une fonction limitée suffit. Les autorisations suivent l'identité de l'utilisateur et sont revérifiées côté serveur au moment de l'action.
Les opérations sensibles utilisent une confirmation explicite, un plafond ou une double validation. Une prévisualisation montre ce qui sera modifié avant l'exécution. Les actions irréversibles sont rares et isolées. Ainsi, une mauvaise interprétation ne devient pas immédiatement une perte de données ou un engagement financier.
Observer la boucle complète
Le journal relie la demande, le contexte utilisé, la version du système, l'outil appelé, les paramètres validés, le résultat et l'identité responsable. Les secrets et données inutiles sont masqués. Cette trace permet de comprendre un incident sans exposer davantage d'informations.
Les métriques couvrent succès, refus, corrections, latence, coût et répétitions d'outils. Une hausse des tentatives ou des séquences inhabituelles peut signaler une boucle, une attaque ou une mauvaise consigne. Les alertes doivent conduire à une limitation automatique ou à une revue humaine.
Prévoir arrêt, repli et récupération
Un budget limite le nombre d'étapes, le temps et la dépense. Si le résultat n'avance plus, l'agent s'arrête et résume ce qui manque. Un coupe-circuit indépendant peut suspendre un outil ou une version sans dépendre du raisonnement de l'agent.
Le repli peut être une proposition non exécutée, une file de validation ou un parcours manuel. Les scénarios de test incluent instructions contradictoires, données malveillantes, outils indisponibles et réponses partielles. La sécurité n'est pas une consigne dans un prompt, mais une propriété de l'architecture.
Limites d'autonomie
- Donner un outil étroit plutôt qu'un accès général
- Revérifier identité et autorisation à chaque action
- Confirmer les opérations sensibles et prévisualiser leurs effets
- Tracer contexte, version, appel, résultat et correction
- Fixer budgets, coupe-circuit et reprise humaine
Un agent digne de confiance n'est pas celui qui agit partout. C'est celui dont chaque action est autorisée, observable et récupérable, et qui peut s'arrêter proprement lorsque l'environnement dépasse ses limites.