Claude On Google Cloud
← Toutes les leçons
Leçon 03Claude On Google Cloud

Accessing the API

Audio récapitulatif

Pas de récapitulatif audio pour cette leçon.

Notes de cours

Notes d'étude : Cycle de vie d'une requête à Claude

**I. Architecture et Flux de la Requête (5 Étapes)**

  • Principe de sécurité : Ne jamais accéder directement à Vertex depuis une application cliente (web ou mobile).
  • Rôle du serveur : Le développeur doit implémenter un serveur pour gérer les requêtes, car il est le seul endroit sûr pour stocker les identifiants secrets.
  • Étape 1 (Client → Serveur) : L'utilisateur soumet un message au serveur du développeur.
  • Étape 2 (Serveur → Vertex) : Le serveur envoie la requête à Vertex.
  • Méthode : Utilisation d'un SDK (Python, TypeScript, Go, Ruby) ou d'un SDK Vertex officiel de Google.
  • Données requises : Nom du modèle, liste des messages (entrée utilisateur), et valeur maximale de jetons (max tokens).
  • Étape 3 (Vertex → Modèle) : Le modèle génère le texte.
  • Étape 4 (Modèle → Serveur) : L'API renvoie la réponse au serveur.
  • Contenu de la réponse : Texte généré, compte d'utilisation (usage), et raison d'arrêt (stop reason).
  • Étape 5 (Serveur → Client) : Le serveur transmet le texte généré à l'application cliente pour affichage.

**II. Processus de Génération de Texte (Vue Simplifiée)**

Le processus de génération se décompose en quatre étapes principales :

  • Tokenisation : L'entrée utilisateur est découpée en unités appelées tokens (mots entiers, parties de mots, espaces, symboles).
  • Embedding : Chaque token est converti en un embedding (une longue liste de nombres représentant la définition numérique du mot).
  • Contextualisation :
  • Objectif : Affiner chaque embedding pour déterminer sa signification précise dans le contexte de la phrase.
  • Mécanisme : Chaque embedding est ajusté en fonction des embeddings voisins.
  • Génération :
  • Les embeddings traités sont passés à une couche de sortie qui produit des probabilités pour chaque mot possible suivant.
  • Sélection : Le modèle utilise un mélange de probabilité et de hasard pour choisir les mots, assurant ainsi des réponses naturelles et variées.
  • Boucle : Le mot sélectionné est ajouté à la liste des embeddings, et le processus se répète.

**III. Conditions d'Arrêt de la Génération**

Le modèle s'arrête lorsque l'une des conditions suivantes est remplie :

  • Limite de jetons : Le nombre de tokens générés atteint la valeur du paramètre max tokens fourni.
  • Token de fin de séquence : Le modèle génère un end of sequence token (un signal spécial indiquant la fin naturelle de la réponse).

Takeaways

  • Le serveur est obligatoire pour gérer les requêtes et sécuriser les identifiants secrets, car l'accès direct à Vertex depuis le client est interdit.
  • Le flux de la requête est : Client → Serveur → Vertex → Modèle → Serveur → Client.
  • Le processus de génération de texte implique quatre étapes clés : Tokenisation → Embedding → Contextualisation → Génération (basée sur la probabilité).
  • La génération s'arrête soit lorsque le nombre de jetons atteint la limite de max tokens, soit lorsque le modèle produit un end of sequence token.
Cartes mémo 9 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 0 questions

No quiz for this lesson yet.