KOR IT LAB / 01
AI Lab
L'AI Lab existe pour répondre à des questions opérationnelles sur les systèmes agentiques auxquelles la documentation ne répond pas : ce que coûte réellement une charge d'agent sur une machine donnée, où se situe véritablement la contrainte, et à quoi ressemble le comportement d'un agent lorsque chaque étape est instrumentée.
- Inférence locale
- Modèles ouverts
- Architectures d'agents
- Mémoire
- Performance
- IA souveraine
- Machine
- AMD EPYC 7451 · 24C/48T · 256 Go ECC · NVMe · Proxmox
- Inférence
- llama.cpp avec des modèles ouverts de la famille Qwen
- État
- PostgreSQL · Qdrant · MinIO
Caractérisation d'une charge d'agent à 64K de contexte
Question
Pour une boucle d'agent qui reconstruit à chaque tour un prompt long et largement répété, où se situe la contrainte de performance sur une machine sans GPU ?
Méthode
Nous avons mesuré la configuration telle qu'elle est réellement utilisée, et non un meilleur cas synthétique. Le prefill et la génération sont rapportés séparément, parce qu'un chiffre unique de tokens par seconde masque la structure de coût des charges agentiques, où le prompt est long, largement répété, et reconstruit à chaque tour.
- Longueur de contexte testée
- 64K
- Débit de prefill
- 22,5 tok/s
- Débit de génération agrégé
- 33,5 tok/s
- Taux de hit du cache de préfixe
- 94,4 %
Mesure relevée sur une configuration testée dans un environnement expérimental. Ce n'est pas un benchmark, et elle n'est transposable ni à un autre matériel, ni à un autre modèle, ni à une autre charge de travail.
Constats
- Le prefill, et non la génération, est la contrainte pour cette charge : 22,5 tok/s de prefill contre 33,5 tok/s de génération agrégée à 64K de contexte, ce qui inverse l'intuition héritée de l'usage conversationnel.
- Le cache de préfixe domine la réactivité de la boucle d'agent à long contexte. Comme les tours d'agent reconstruisent un prompt largement identique, le taux de hit mesuré de 94,4 % pèse davantage sur la latence perçue que le débit brut de génération.
- Le placement NUMA n'est pas un détail de réglage sur une machine à quatre domaines. La performance d'inférence y est gouvernée par la localité mémoire, et le placement doit être décidé délibérément plutôt que laissé à l'ordonnanceur.
Limites
- Le débit a été relevé sous charge de laboratoire, non sous usage multi-agent concurrent soutenu.
- Le comportement observé est propre aux modèles de la famille Qwen testés ; aucune affirmation n'est faite sur d'autres modèles ouverts ou sur des modèles hébergés.
La médiation des outils comme trace comportementale
Question
Faire transiter chaque appel d'outil d'un agent par une passerelle de médiation unique produit-il une meilleure description de son comportement que l'inspection de sa sortie ?
Méthode
Toutes les invocations d'outils du laboratoire passent par une passerelle unique qui enregistre l'appel, ses arguments, la décision de politique et le résultat. Nous avons ensuite comparé ce que cette trace dit de l'action de l'agent à ce que l'agent lui-même prétendait avoir fait.
Constats
- La séquence des invocations d'outils décrit bien mieux ce qu'un agent a fait que sa narration de ce qu'il comptait faire.
- La médiation rend le comportement de l'agent lisible d'une manière que l'inspection de la sortie du modèle ne permet pas — la trace de la passerelle est complète par construction, alors que la narration est un artefact généré.
- Une fois la médiation en place, la politique a un endroit où exister : autoriser, revoir et mettre en quarantaine deviennent des décisions implémentables plutôt que des instructions de prompt.
Limites
- Le laboratoire n'a aucun adversaire extérieur. Le contenu non fiable y est introduit par nous, donc le modèle de menace est éprouvé contre des attaques auxquelles nous avions déjà pensé.
- Le bac à sable est éprouvé face à de l'exécution de code ordinaire, non face à une tentative d'évasion déterminée par un attaquant compétent.
Prochaines expériences
Écrites avant d'être menées, pour que les résultats soient jugés à l'aune de ce que nous cherchions et non de ce que nous avons remarqué en chemin.
Mesurer le débit et le comportement du cache au-dessus et en dessous de 64K pour caractériser le point où le coût de prefill devient prohibitif sur cette machine.
Instrumenter l'exécution multi-agent concurrente pour trouver le point où le placement NUMA cesse de tenir.
Comparer le comportement de complétion des agents selon que les permissions d'outils sont appliquées à la passerelle ou seulement par instruction de prompt.