Claude With The Anthropic Api
← Toutes les leçons
Leçon 12Claude With The Anthropic Api

Response streaming

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

Notes de Cours : Le Streaming dans les API de Modèles de Langage

  • Problème de Latence (Temps d'Attente)
  • Dans une requête standard (Requête → Réponse), le temps entre l'envoi du message utilisateur et la réception de la réponse complète peut être long (ex: 10 à 30 secondes).
  • Ceci nuit à l'expérience utilisateur (UX), car l'attente est perçue comme une inaction.
  • Concept de Streaming
  • Le streaming permet de recevoir la réponse du modèle (Claude) en fragments (chunks) au fur et à mesure de sa génération, au lieu d'attendre le texte final.
  • Avantage UX : L'utilisateur commence à voir le texte apparaître immédiatement, améliorant la perception de rapidité.
  • Mécanisme Technique
  • Le serveur reçoit un signal initial de Claude indiquant qu'il a commencé à générer du texte.
  • Le serveur reçoit ensuite une séquence d'événements. Chaque événement contient un petit morceau du texte généré.
  • Ces événements sont transmis au client (application web/mobile) pour affichage progressif.
  • Implémentation avec l'SDK (Méthode Recommandée)
  • Utiliser la fonction client_messages. stream au lieu de la fonction standard.
  • Le code permet d'itérer directement sur le texte reçu : for text in stream. text.
  • Cette méthode simplifie l'extraction du contenu utile (le texte généré) en évitant de traiter tous les types d'événements bruts (comme raw content block delta).
  • Gestion de la Conversation Complète
  • Bien que le texte soit affiché en flux, il est possible de récupérer l'intégralité du message une fois le flux terminé.
  • Utiliser stream. get_final_message() pour assembler tous les fragments et stocker la conversation complète dans une base de données.

Takeaways

  • Le temps d'attente long (10 à 30 secondes) dans les requêtes standard nuit à l'expérience utilisateur (UX).
  • Le streaming permet de recevoir la réponse du modèle en fragments (chunks) au fur et à mesure de sa génération.
  • L'implémentation recommandée utilise la fonction client_messages. stream de l'SDK pour itérer directement sur le texte.
  • Même en flux, il est possible de récupérer l'intégralité du message final via stream. get_final_message().
Cartes mémo 8 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.