Audio récapitulatif
Pas de récapitulatif audio pour cette leçon.
Notes de cours
Notes d'étude : Cycle de vie d'une requête à Claude
**I. Architecture et Flux de la Requête (5 Étapes)**
- Principe de sécurité : Ne jamais accéder directement à Vertex depuis une application cliente (web ou mobile).
- Rôle du serveur : Le développeur doit implémenter un serveur pour gérer les requêtes, car il est le seul endroit sûr pour stocker les identifiants secrets.
- Étape 1 (Client → Serveur) : L'utilisateur soumet un message au serveur du développeur.
- Étape 2 (Serveur → Vertex) : Le serveur envoie la requête à Vertex.
- Méthode : Utilisation d'un SDK (Python, TypeScript, Go, Ruby) ou d'un SDK Vertex officiel de Google.
- Données requises : Nom du modèle, liste des messages (entrée utilisateur), et valeur maximale de jetons (max tokens).
- Étape 3 (Vertex → Modèle) : Le modèle génère le texte.
- Étape 4 (Modèle → Serveur) : L'API renvoie la réponse au serveur.
- Contenu de la réponse : Texte généré, compte d'utilisation (usage), et raison d'arrêt (stop reason).
- Étape 5 (Serveur → Client) : Le serveur transmet le texte généré à l'application cliente pour affichage.
**II. Processus de Génération de Texte (Vue Simplifiée)**
Le processus de génération se décompose en quatre étapes principales :
- Tokenisation : L'entrée utilisateur est découpée en unités appelées tokens (mots entiers, parties de mots, espaces, symboles).
- Embedding : Chaque token est converti en un embedding (une longue liste de nombres représentant la définition numérique du mot).
- Contextualisation :
- Objectif : Affiner chaque embedding pour déterminer sa signification précise dans le contexte de la phrase.
- Mécanisme : Chaque embedding est ajusté en fonction des embeddings voisins.
- Génération :
- Les embeddings traités sont passés à une couche de sortie qui produit des probabilités pour chaque mot possible suivant.
- Sélection : Le modèle utilise un mélange de probabilité et de hasard pour choisir les mots, assurant ainsi des réponses naturelles et variées.
- Boucle : Le mot sélectionné est ajouté à la liste des embeddings, et le processus se répète.
**III. Conditions d'Arrêt de la Génération**
Le modèle s'arrête lorsque l'une des conditions suivantes est remplie :
- Limite de jetons : Le nombre de tokens générés atteint la valeur du paramètre max tokens fourni.
- Token de fin de séquence : Le modèle génère un end of sequence token (un signal spécial indiquant la fin naturelle de la réponse).
Takeaways
- Le serveur est obligatoire pour gérer les requêtes et sécuriser les identifiants secrets, car l'accès direct à Vertex depuis le client est interdit.
- Le flux de la requête est : Client → Serveur → Vertex → Modèle → Serveur → Client.
- Le processus de génération de texte implique quatre étapes clés : Tokenisation → Embedding → Contextualisation → Génération (basée sur la probabilité).
- La génération s'arrête soit lorsque le nombre de jetons atteint la limite de max tokens, soit lorsque le modèle produit un end of sequence token.
Cartes mémo 9 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Vérification des connaissances 0 questions
No quiz for this lesson yet.