Pourquoi ne faut-il jamais accéder directement à Vertex depuis une application côté client (web ou mobile) ?	Parce que cela nécessiterait d'inclure des identifiants secrets, ce qui est dangereux.
Quel est le rôle principal du serveur dans le cycle de requête vers Vertex ?	Il reçoit la requête du client, la sécurise, et effectue la demande à Vertex en utilisant des identifiants secrets.
Quelles sont les trois informations essentielles à inclure lors d'une requête à Vertex ?	Le nom du modèle, une liste de messages (le texte de l'utilisateur), et une valeur de `max tokens`.
Qu'est-ce qu'un "token" dans le contexte de la génération de texte ?	Un token est une unité de texte, qui peut être un mot entier, une partie de mot, un espace ou un symbole.
Qu'est-ce qu'un "embedding" ?	Un embedding est une longue liste de nombres qui représente la définition d'un mot.
Quel est le but de la "contextualisation" dans le processus de génération ?	Elle ajuste chaque embedding en fonction des embeddings environnants pour affiner sa définition à un sens précis.
Comment le modèle sélectionne-t-il le mot suivant lors de la phase de génération ?	Il utilise un mélange de probabilité et de hasard pour choisir les mots, créant ainsi des réponses naturelles et variées.
Quelles sont les deux conditions qui peuvent faire arrêter la génération de texte par le modèle ?	Atteindre le paramètre `max tokens` ou générer un jeton spécial de fin de séquence (`end of sequence token`).
Quelles informations sont incluses dans la réponse de l'API après la génération ?	Le message contenant le texte généré, l'utilisation (nombre de tokens d'entrée et de sortie), et la raison d'arrêt (`stop reason`).
