Skip to main content
W&B Weave est une plateforme d’observabilité et d’évaluation conçue pour créer des agents fiables et des applications LLM fiables. Weave vous aide à comprendre ce que fait votre application d’IA, à mesurer ses performances et à l’améliorer de manière systématique au fil du temps. Le développement d’applications LLM est fondamentalement différent du développement logiciel traditionnel. Les résultats des LLM sont non déterministes, ce qui complique le débogage. La qualité est subjective et dépend du contexte. De petites modifications des prompts peuvent entraîner des comportements inattendus. Les approches de test traditionnelles montrent vite leurs limites.

Fonctionnalités principales

Weave offre les fonctionnalités clés suivantes :
  • Visibilité sur les sessions d’agent et les conversations à plusieurs tours, ou sur les appels de fonction individuels et leurs sorties dans le code de l’application.
  • Évaluation systématique pour mesurer les performances par rapport à des cas de test sélectionnés.
  • Suivi des versions des prompts, modèles et données afin de comprendre ce qui a changé.
  • Expérimentation pour comparer différents prompts et modèles.
  • Collecte de retours pour recueillir des jugements humains et des annotations.
  • Surveillance en production à l’aide de garde-fous et d’évaluateurs pour assurer la sécurité et la qualité des LLM.

Choisir un flux de travail

Weave fournit cette fonctionnalité au moyen de deux flux de travail différents :
  • Le traçage automatique des agents
  • L’instrumentation des appels LLM arbitraires et des fonctions de votre application afin de tracer leurs entrées, leurs sorties et leur code

Tracer un agent

Weave fournit une observabilité des agents sur l’ensemble du cycle de vie des conversations des agents, y compris les sessions, les appels LLM et les exécutions d’outils. Le traçage des agents repose sur OpenTelemetry (OTel) et les conventions sémantiques GenAI. Si votre agent est déjà instrumenté avec OTel, vous pouvez envoyer ses spans existants vers Weave sans réinstrumenter votre code. Weave accepte n’importe quel span OTel et stocke ses attributs pour vous permettre de les interroger. Les spans qui suivent les conventions d’agent GenAI, comme invoke_agent et execute_tool, s’affichent sous forme de conversations, de tours de conversation et d’appels d’outils dans la vue Agents. Pour savoir comment émettre ces spans à partir de votre propre agent, voir le Démarrage rapide des agents personnalisés. Si vous créez un agent, commencez par le Démarrage rapide de l’intégration d’agent pour choisir une intégration intégrée, ou suivez le Démarrage rapide des agents personnalisés pour instrumenter manuellement le vôtre. Pour découvrir comment le SDK Weave modélise les agents, voir tracer vos agents. Si vous utilisez un harness d’agent tiers pris en charge, comme Claude Code ou OpenAI Agent SDK, Weave l’instrumente automatiquement, sans code supplémentaire. Voir Intégrations pour la liste complète des frameworks pris en charge.

Instrumenter et tracer des fonctions

Pour tracer des appels de fonction individuels, le code de l’application ou une logique personnalisée, utilisez opérations Weave and Calls. Ajoutez une ligne à n’importe quelle fonction pour suivre les entrées, les sorties, le coût, le nombre de jetons et la latence. Vous pouvez aussi :
  • Suivez de bout en bout le flux des données dans votre application LLM.
  • Consultez les documents source utilisés pour produire le feedback du LLM.
  • Analysez en détail des prompts spécifiques et la manière dont les réponses sont produites.
Pour tracer des fonctions individuelles, suivez le démarrage rapide du traçage des op de Weave ou apprenez à utiliser les opérations and Calls de Weave. Le SDK Weave applique également automatiquement des patchs à de nombreux frameworks et fournisseurs de LLM afin de capturer automatiquement les traces des appels LLM dans votre code. Voir Intégrations pour tous les fournisseurs et frameworks pris en charge.

Quand utiliser le traçage des agents et quand utiliser l’instrumentation des applications

Choisissez le flux de travail à utiliser en fonction de ce que vous souhaitez observer :
  • Utilisez le traçage des agents si vous développez ou exécutez un agent. C’est le bon choix si vous utilisez un harness d’agent ou un SDK d’agent pris en charge, ou si vous avez développé un agent personnalisé que vous pouvez instrumenter vous-même.
  • Utilisez l’instrumentation des applications si vous tracez du code applicatif. C’est le bon choix pour les applications structurées autour d’appels distincts plutôt que de conversations, comme un pipeline RAG, un point de terminaison de synthèse ou une logique métier personnalisée.
Chaque approche enregistre des traces dans sa propre partie de l’interface utilisateur : les traces d’agent apparaissent sur la page Agents, et les appels weave.op apparaissent sur la page Traces. Vous pouvez utiliser les deux approches dans le même projet Weave, mais elles produisent des traces distinctes. Si vous ne savez pas par où commencer et que votre système implique un agent, commencez par le démarrage rapide de l’intégration d’agents. Sinon, commencez par le démarrage rapide du traçage des op.

Évaluations

Évaluez et surveillez les performances de votre agent ou de votre application LLM à l’aide d’évaluations afin d’améliorer de manière itérative la qualité et la fiabilité.
  • Suivez facilement quelles versions du modèle/prompt ont produit quelles performances.
  • Définissez des métriques pour évaluer les réponses à l’aide d’une ou plusieurs fonctions de scoring.
  • Comparez deux évaluations ou plus sur plusieurs métriques. Examinez des échantillons précis pour comparer leurs performances.
Créer un pipeline d’évaluation

Versionnez tout

Weave assure le suivi des versions de vos prompts, jeux de données et configurations de modèle. Si quelque chose casse, vous pouvez voir exactement ce qui a changé. Si quelque chose fonctionne, vous pouvez le reproduire. En savoir plus sur la gestion des versions

Expérimentez avec des prompts et des modèles

Munissez-vous de vos clés API pour tester des prompts et comparer les réponses de différents modèles commerciaux dans le playground. Expérimenter dans le playground Weave

Recueillir des retours

Recueillez les retours, annotations et corrections humaines liés à l’utilisation en production. Utilisez ces données pour créer de meilleurs cas de test et améliorer votre application. Recueillir des retours

Surveiller la production

Attribuez un score au trafic de Production avec les mêmes évaluateurs que ceux que vous utilisez pour l’Évaluation. Configurez des garde-fous pour détecter les problèmes avant qu’ils n’atteignent les utilisateurs. Configurer les garde-fous et les moniteurs

Premiers pas avec Weave

Weave fournit des SDK pour Python et TypeScript. Les deux SDK prennent en charge le traçage, l’évaluation, les jeux de données et les fonctionnalités principales de Weave. Certaines fonctionnalités avancées, comme les Models fondés sur des classes et les évaluateurs, ne sont pas disponibles dans le SDK TypeScript de Weave. Pour commencer avec Weave :
  1. Créez un compte W&B sur https://wandb.ai/site et obtenez votre clé API sur https://wandb.ai/authorize.
  2. Installez Weave :
  1. Dans votre script, importez Weave et initialisez un projet. Remplacez <your-team> par le nom de votre équipe W&B et <your-project> par le nom de votre projet W&B.
Vous êtes maintenant prêt à utiliser Weave.