Fonctionnalités principales
- Visibilité sur les sessions d’agent et les conversations à plusieurs tours, ou sur les appels de fonction individuels et leurs sorties dans le code de l’application.
- Évaluation systématique pour mesurer les performances par rapport à des cas de test sélectionnés.
- Suivi des versions des prompts, modèles et données afin de comprendre ce qui a changé.
- Expérimentation pour comparer différents prompts et modèles.
- Collecte de retours pour recueillir des jugements humains et des annotations.
- Surveillance en production à l’aide de garde-fous et d’évaluateurs pour assurer la sécurité et la qualité des LLM.
Choisir un flux de travail
- Le traçage automatique des agents
- L’instrumentation des appels LLM arbitraires et des fonctions de votre application afin de tracer leurs entrées, leurs sorties et leur code
Tracer un agent
invoke_agent et execute_tool, s’affichent sous forme de conversations, de tours de conversation et d’appels d’outils dans la vue Agents. Pour savoir comment émettre ces spans à partir de votre propre agent, voir le Démarrage rapide des agents personnalisés.
Si vous créez un agent, commencez par le Démarrage rapide de l’intégration d’agent pour choisir une intégration intégrée, ou suivez le Démarrage rapide des agents personnalisés pour instrumenter manuellement le vôtre. Pour découvrir comment le SDK Weave modélise les agents, voir tracer vos agents.
Si vous utilisez un harness d’agent tiers pris en charge, comme Claude Code ou OpenAI Agent SDK, Weave l’instrumente automatiquement, sans code supplémentaire. Voir Intégrations pour la liste complète des frameworks pris en charge.
Instrumenter et tracer des fonctions
- Suivez de bout en bout le flux des données dans votre application LLM.
- Consultez les documents source utilisés pour produire le feedback du LLM.
- Analysez en détail des prompts spécifiques et la manière dont les réponses sont produites.
Quand utiliser le traçage des agents et quand utiliser l’instrumentation des applications
- Utilisez le traçage des agents si vous développez ou exécutez un agent. C’est le bon choix si vous utilisez un harness d’agent ou un SDK d’agent pris en charge, ou si vous avez développé un agent personnalisé que vous pouvez instrumenter vous-même.
- Utilisez l’instrumentation des applications si vous tracez du code applicatif. C’est le bon choix pour les applications structurées autour d’appels distincts plutôt que de conversations, comme un pipeline RAG, un point de terminaison de synthèse ou une logique métier personnalisée.
weave.op apparaissent sur la page Traces. Vous pouvez utiliser les deux approches dans le même projet Weave, mais elles produisent des traces distinctes.
Si vous ne savez pas par où commencer et que votre système implique un agent, commencez par le démarrage rapide de l’intégration d’agents. Sinon, commencez par le démarrage rapide du traçage des op.
Évaluations
- Suivez facilement quelles versions du modèle/prompt ont produit quelles performances.
- Définissez des métriques pour évaluer les réponses à l’aide d’une ou plusieurs fonctions de scoring.
- Comparez deux évaluations ou plus sur plusieurs métriques. Examinez des échantillons précis pour comparer leurs performances.
Versionnez tout
Expérimentez avec des prompts et des modèles
Recueillir des retours
Surveiller la production
Premiers pas avec Weave
- Créez un compte W&B sur https://wandb.ai/site et obtenez votre clé API sur https://wandb.ai/authorize.
- Installez Weave :
- Dans votre script, importez Weave et initialisez un projet. Remplacez
<your-team>par le nom de votre équipe W&B et<your-project>par le nom de votre projet W&B.