Applied AI Foundations
Applied AI Foundations · Examen blanc 1
Un examen blanc indépendant de 50 items pour la piste Applied AI Foundations, pondéré sur les six domaines, avec explications complètes et indicateur de préparation.
Ceci est l’Examen blanc 1 pour la piste Applied AI Foundations : 50 items répartis sur les six domaines. C’est un examen blanc indépendant construit à partir des objectifs d’apprentissage OpenAI accessibles au public — ni une évaluation officielle OpenAI, ni des questions d’examen officielles, et non validé par OpenAI. Utilisez-le comme diagnostic : passez-le d’abord pour repérer vos deux domaines les plus faibles, puis étudiez ces pages de domaine avant de tenter l’Examen blanc 2. Pour le fonctionnement de la véritable qualification, voir le modèle d’évaluation.
Consignes
- Durée : 60 minutes, correspondant à la durée d’une session d’étude Applied AI Foundations ; vous pouvez aussi le passer sans limite de temps lors d’un premier diagnostic.
- Items : 50, à réponse unique et à réponses multiples. Chaque item indique combien de réponses sélectionner.
- Sélection : pour un item à réponse unique, choisissez exactement une option ; pour un item à deux réponses, vous devez choisir les deux bonnes options et aucune mauvaise pour marquer l’item.
- Aucune pénalité pour les mauvaises réponses : répondez à chaque item — un item sans réponse compte comme un item faux.
- Objectif : visez ≥ 80 % brut (≈ 40/50) avant de passer la véritable évaluation OpenAI Academy, qui elle-même réussit à 80 %.
Répartition par domaine
| # | Domaine | Pondération | Items ici |
|---|---|---|---|
| 1 | Finding and Scoping Opportunities | 16 % | 8 |
| 2 | Decomposing Work into Steps | 18 % | 9 |
| 3 | Inputs, Outputs and Contracts | 16 % | 8 |
| 4 | Choosing the Right Capability | 20 % | 10 |
| 5 | Review Points and Human Oversight | 16 % | 8 |
| 6 | Repeatability and Improvement | 14 % | 7 |
Total : 8 + 9 + 8 + 10 + 8 + 7 = 50 items.
Interprétation de la préparation
Ceci est un indicateur de préparation indépendant, jamais un score officiel.
| Score brut (sur 50) | Palier | Interprétation |
|---|---|---|
| 40+ (80 %+) | Prêt pour l’évaluation | Vous suivez le seuil de 80 % du badge Academy ; passez l’Examen blanc 2 pour confirmer |
| 35–39 (70–79 %) | Confiance en construction | Proche ; révisez vos un ou deux domaines les plus faibles et retestez |
| moins de 70 % | Continuez à apprendre | Parcourez les pages de domaine avant de recommencer |
| 45+ (90 %+) | Forte préparation | Marge confortable sur l’ensemble des domaines |
Passer l’examen blanc
Deux façons d’utiliser les questions ci-dessous : le mode interactif lance une session chronométrée, une question à la fois, et se termine par votre score, une ventilation par domaine et une correction complète ; le mode révision en dessous liste chaque question avec ses options une par ligne et la réponse masquée jusqu’à ce que vous la demandiez.
Mode interactif
Passer l’examen d’entraînement
50 questions · une à la fois · compte à rebours de 60 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.
Par domaine
| Domaine | Correctes | Score |
|---|
Correction
Toutes les questions (mode révision)
Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.
Une responsable d’équipe constate que la personnalisation des e-mails d’intégration a lieu environ 30 fois par semaine, prend 12 minutes à chaque fois, tolère de petites erreurs de formulation et n’utilise que des textes marketing publics. Sur la grille FTED, comment cette tâche doit-elle être classée ?
Afficher la réponse
Réponse : B.
Les deux axes de valeur (fréquence × temps = 6 heures/semaine) et les deux axes de sûreté (erreurs corrigeables, données publiques) obtiennent de bons scores : la tâche se situe donc dans la zone « à automatiser tout de suite ». Douze minutes sur 30 occurrences n’a rien de négligeable (A). L’e-mail marketing n’est pas intrinsèquement à haut risque (C). Le prix du modèle est un détail de construction qui vient après la grille, ce n’est pas un obstacle au classement (D).
Quel énoncé rend le mieux compte du fait que l’importance n’est pas la même chose que la valeur lorsqu’on filtre des candidats à l’automatisation ?
Afficher la réponse
Réponse : B.
Une pièce maîtresse annuelle peut être très importante tout en ayant une fréquence de répétition quasi nulle : le workflow que vous construisez ne s’amortit donc jamais. Le coût de construction (A) n’est pas ce qui distingue les deux notions. Elles ne sont explicitement pas identiques (C). La sensibilité est un axe distinct, sans rapport avec l’importance (D).
Un workflow rédigerait des communiqués de presse publiés tels quels dans la salle de presse de l’entreprise. Quel unique axe FTED contraint le plus la façon dont vous le construisez ?
Afficher la réponse
Réponse : C.
Une faible tolérance aux erreurs sur un artefact externe difficile à retirer impose un point de revue humain obligatoire avant publication. La fréquence (A) influe sur le retour, pas sur le soin apporté au point de revue. Ces déclarations ne sont pas nécessairement rapides à écrire (B). FTED s’applique à toute tâche récurrente, y compris la rédaction (D).
Vous devez choisir un seul pilote. La tâche X économise 8 heures/semaine avec un léger échantillon hebdomadaire ; la tâche Y économise 9 heures/semaine mais exige qu’un humain approuve chacune de ses sorties irréversibles. Laquelle construisez-vous en premier et pourquoi ?
Afficher la réponse
Réponse : B.
Le classement repose sur le retour ajusté au risque : l’approbation de chaque sortie irréversible de Y érode l’essentiel de ses 9 heures et comporte un risque plus élevé ; l’économie nette de X l’emporte donc. Les heures brutes (A) ignorent le coût de la revue. X vaut clairement la peine d’être automatisée (C). Construire les deux à la fois (D) contredit la contrainte du pilote unique et disperse l’attention.
Un manager vous demande d’« utiliser l’IA pour tout notre processus d’achats ». Quel est le PREMIER geste de cadrage ?
Afficher la réponse
Réponse : B.
« Tout le processus » est un souhait vague ; le cadrage le réduit à un problème délimité que vous pouvez réellement construire et tester. Acheter un modèle (A) est prématuré. Un agent autonome (C) saute entièrement le cadrage. Un prompt géant unique (D) est à la fois prématuré et un anti-modèle de décomposition.
Quel élément d’une opportunité cadrée empêche le plus directement la dérive de périmètre pendant la construction ?
Afficher la réponse
Réponse : C.
La frontière est ce qui empêche « rédiger la réponse » de devenir insidieusement « et l’envoyer » puis « et émettre le remboursement ». Le déclencheur (A) définit quand le workflow s’exécute, pas ce qu’il doit éviter. Les fichiers de connaissances (B) et la taille du modèle (D) ne contraignent pas le périmètre.
Quelles sont les DEUX tâches les plus fortes comme candidates à l’automatisation sur la grille FTED ?
Afficher la réponse
Réponse : A et C.
A et C sont fréquentes, chronophages, corrigeables et peu sensibles — le profil « à automatiser tout de suite ». Les décaissements de prêt (B) sont irréversibles et financiers. Le rapport annuel (D) échoue sur la fréquence. Les conseils juridiques individuels (E) sont réglementés et à fort potentiel de préjudice.
Une tâche franchit facilement le filtre de valeur mais touche à des données de patients réglementées que la politique interdit de sortir d’un environnement autorisé. Que vous indique l’axe de sensibilité des données ?
Afficher la réponse
Réponse : C.
La sensibilité est un axe distinct qui peut opposer un veto à une tâche à forte valeur ; la réponse est un espace de travail autorisé avec habilitation, ou un traitement manuel. La sensibilité ne décote pas la valeur (A). Résumer n’est pas intrinsèquement sûr (B). Le prix du modèle (D) n’a rien à voir avec la gouvernance des données.
Un unique long prompt produit un rapport qui « fonctionne en démo mais laisse parfois tomber une section entière en production et est difficile à déboguer ». Quel est le MEILLEUR correctif ?
Afficher la réponse
Réponse : B.
Des sections manquantes et une sortie impossible à déboguer sont la signature du méga-prompt ; la décomposition expose chaque section comme une étape. Rembourrer le prompt (A) aggrave le bloc. Un modèle plus grand (C) masque les défaillances au lieu de les exposer. La température (D) ne traite pas la structure.
Vous devez résumer quinze rapports régionaux indépendants en une note nationale unique qui réconcilie les totaux et la terminologie. Quel modèle convient et quelle est l’étape critique ?
Afficher la réponse
Réponse : B.
Des pièces indépendantes combinées en une sortie cohérente unique, c’est du fan-out/fan-in, et la cohérence est imposée au fan-in, qui doit réconcilier plutôt que concaténer. Le séquentiel (A) convient mal à un travail indépendant. Les deux autres (C, D) sont la mauvaise forme de premier niveau ici.
Pourquoi une étape de critique distincte vaut-elle généralement mieux que de demander au modèle de vérifier sa propre réponse dans la même réponse ?
Afficher la réponse
Réponse : B.
Une relecture dans la même passe conserve le raisonnement qui a produit le brouillon ; une critique distincte, guidée par une checklist, est plus objective. Ce n’est pas une question de nombre de tokens (A) ni de rapidité (D), et cela ne supprime pas la revue humaine (C) — souvent l’étape de critique est justement l’endroit où se trouve le point de revue.
Un workflow lit des reçus et produit un total de remboursement, mais un total erroné pourrait provenir d’un montant mal lu OU d’une règle de politique mal appliquée. Quelle décomposition rend la défaillance traçable ?
Afficher la réponse
Réponse : B.
Séparer l’extraction de la transformation fondée sur des règles rend chacune vérifiable indépendamment, de sorte qu’un total erroné se rattache à la lecture ou à la logique. Brouillon puis critique (A) relit de la prose, pas cela. Un prompt unique détaillé (C) laisse les erreurs mélangées. Le fan-out (D) parallélise mais mêle toujours extraction et transformation par reçu.
Quand faut-il CESSER de découper une tâche en davantage d’étapes ?
Afficher la réponse
Réponse : B.
Le découpage n’est justifié que lorsqu’il sépare des tâches distinctes ou ajoute une vérification nécessaire ; au-delà, il ajoute de la latence et une perte de contexte. « Plus, c’est toujours mieux » (A) et un nombre fixe (C) sont faux, et la longueur du prompt (D) n’est pas le critère.
Un workflow de proposition produit sans cesse un résumé exécutif qui décrit une version antérieure du corps du document. Quel ordonnancement corrige cela ?
Afficher la réponse
Réponse : B.
Un résumé doit décrire un contenu terminé, il est donc écrit en dernier dans la séquence. L’écrire en premier (A) garantit une dérive à mesure que le corps change. Un seul prompt (C) est le piège du méga-prompt. Le supprimer (D) ne satisfait pas l’exigence.
Un workflow de pack de lancement produit cinq supports qui se contredisent parfois sur le prix et les arguments clés. Quel est le correctif de CAUSE RACINE ?
Afficher la réponse
Réponse : B.
Les contradictions viennent de ce que chaque support invente ses propres faits ; une fiche de faits extraite partagée offre une source de vérité unique dans laquelle tous les supports puisent. Une consigne d’être cohérent (A) est du rembourrage. Générer deux fois (C) double le coût sans corriger la cause. Un modèle plus grand (D) ne crée pas de source de vérité partagée.
Quelle tâche vaut-il mieux garder comme une seule étape plutôt que de la décomposer ?
Afficher la réponse
Réponse : B.
Une petite tâche unique avec une seule sortie ne gagne rien à être découpée ; la décomposition n’ajouterait qu’une surcharge. Le rapport multisection (A), la note issue de douze documents (C) et la tâche brouillon puis critique (D) comportent tous des sous-objectifs distincts qui échouent séparément et justifient une décomposition.
Quels DEUX signaux dans la description d’une tâche orientent vers le modèle fan-out/fan-in ?
Afficher la réponse
Réponse : A et B.
Des pièces indépendantes combinées avec une exigence de cohérence, c’est la signature du fan-out/fan-in, où le fan-in réconcilie. Agir sur des faits dans un seul document (C) oriente vers extraire puis transformer. Une passe de revue (D) oriente vers brouillon puis critique. Une dépendance stricte (E) oriente vers le séquentiel.
Une étape « renvoie parfois un paragraphe, parfois des puces » et un collègue obtient un format différent du vôtre. Quel est le problème RACINE ?
Afficher la réponse
Réponse : B.
Un format incohérent selon les entrées et les utilisateurs signifie que le contrat n’a jamais spécifié de forme de sortie ; fixer un schéma, un gabarit ou des champs figés corrige cela. La taille du modèle (A) et la température (C) ne définissent pas la structure, et le compte (D) est sans rapport avec le format.
Quel ensemble définit le mieux les cinq parties d’un contrat d’étape ?
Afficher la réponse
Réponse : B.
Un contrat d’étape fixe ce qui entre, ce qui doit être présent, ce qui sort, ce que signifie « bon » et ce qui se passe en cas d’entrée manquante. L’option A liste des réglages du modèle, C liste des métriques d’observabilité et D liste des champs de gestion de projet, dont aucun n’est un contrat.
Une étape de catégorisation s’exécute et sa liste de catégories requise est manquante. Que doit-elle faire ?
Afficher la réponse
Réponse : B.
Sans valeur par défaut sûre et la justesse dépendant de la liste, l’étape doit échouer bruyamment plutôt que deviner. Inventer des catégories (A) fabrique des données indétectables, une chaîne vide silencieuse (C) masque la défaillance, et un choix arbitraire (D) est une supposition déguisée.
Lequel est un critère d’acceptation solide et observable pour une réponse de support ?
Afficher la réponse
Réponse : C.
Les critères d’acceptation doivent être des conditions vérifiables qu’une personne ou une étape peut contrôler. « Haute qualité » (A), « se lit de façon professionnelle » (B) et « exhaustive » (D) sont toutes subjectives et invérifiables.
Vous voulez que la sortie d’une étape soit analysée par un système en aval. Qu’est-ce que le contrat doit exiger ?
Afficher la réponse
Réponse : B.
La consommation par une machine exige un schéma strict et uniquement le JSON, afin que l’analyse soit fiable. De la prose autour des données (A) et une narration (C) cassent les analyseurs, et laisser le modèle choisir (D) réintroduit la dérive.
Après avoir modifié l’étape 2, le workflow casse à l’étape 3. Quelle est la cause la PLUS probable ?
Afficher la réponse
Réponse : B.
Modifier une étape change souvent la forme de sa sortie, cassant le consommateur qui reposait sur l’ancien contrat ; revérifiez les deux bords. La taille du modèle (A) et la température (C) ne sont pas impliquées, et l’étape 1 (D) n’a pas été touchée.
Quand une valeur DEFAULT marquée est-elle la bonne stratégie en cas d’entrée manquante ?
Afficher la réponse
Réponse : B.
Une valeur par défaut n’est appropriée que lorsqu’elle est sûre et documentée, et elle doit être marquée pour que la revue voie que la valeur était manquante. Si la justesse dépend de la valeur (A), échouez plutôt ; éviter les interruptions à tout prix (C) conduit à des suppositions silencieuses ; et « toujours échouer » (D) est trop rigide lorsqu’une valeur par défaut sûre existe.
Quelles DEUX lignes du contrat sont le plus souvent laissées vides dans les workflows instables ?
Afficher la réponse
Réponse : A et C.
Un comportement non défini en cas d’entrée manquante et un transfert non vérifié sont les lacunes classiques qui rendent les workflows instables. La date de sortie (B), le nombre de mots (D) et la couleur (E) ne sont pas des lignes de contrat.
Vous exécutez la même tâche de façon répétée et elle nécessite à chaque fois le même guide de style et les mêmes fichiers de référence. Quel échelon convient le MIEUX ?
Afficher la réponse
Réponse : B.
Un contexte récurrent qui doit être présent à chaque fois est le signal déterminant d’un Project. Recoller à chaque fois (A) est précisément le gaspillage qu’un Project élimine, et une application API (C) ou un agent (D) sont surdimensionnés pour une tâche récurrente en solo.
La question décisive qui sépare un Project d’un custom GPT est :
Afficher la réponse
Réponse : B.
Un Project est votre espace de travail récurrent ; un custom GPT empaquette la tâche pour que d’autres l’exécutent en autonomie. Le modèle (A), le nombre de fichiers (C) et la température (D) ne déterminent pas lequel des deux vous devez utiliser.
Une tâche doit s’exécuter à l’intérieur de l’application web de votre entreprise, à la demande, câblée à votre base de données. Quelle capacité est requise ?
Afficher la réponse
Réponse : D.
Intégrer dans un autre produit, à la demande, connecté à une base de données est exactement ce à quoi sert une application API. Les instructions enregistrées (A), les Projects (B) et les custom GPT (C) vivent tous à l’intérieur de ChatGPT et ne peuvent pas s’intégrer par programmation dans votre application.
Un utilisateur a besoin des dernières actualités de cette semaine à propos d’une entreprise nommée. Quelle capacité en conversation convient le MIEUX ?
Afficher la réponse
Réponse : B.
Une recherche rapide de faits actuels est ce à quoi sert search. Deep research (A) est plus lourd, pour des rapports sourcés multi-sources ; data analysis (C) sert au calcul sur des fichiers ; et Canvas (D) sert à itérer sur des documents.
La tâche est « produire une comparaison minutieusement sourcée des cinq principaux fournisseurs, avec citations ». Quelle capacité convient le MIEUX ?
Afficher la réponse
Réponse : C.
Une comparaison multi-sources, citée et exhaustive est le cas d’usage de deep research. Un chat ordinaire (A) ne peut pas la sourcer de façon fiable, un seul titre issu de search (B) ne suffit pas, et Canvas (D) est une surface d’édition, pas un outil de recherche.
Vous avez téléversé une feuille de calcul de ventes et devez y détecter des valeurs aberrantes et tracer une tendance. Que faut-il activer ?
Afficher la réponse
Réponse : B.
Le calcul, la détection de valeurs aberrantes et le tracé sur un fichier nécessitent data analysis ; les téléversements seuls permettent seulement au modèle de lire le fichier (A). Search (C) sert aux faits actuels, et un custom GPT (D) est un échelon d’empaquetage, pas une capacité de calcul.
Dix collègues doivent exécuter eux-mêmes le même assistant configuré, en obtenant des résultats cohérents sans votre intervention. Quel échelon ?
Afficher la réponse
Réponse : B.
D’autres exécutant la même tâche en autonomie avec un comportement cohérent est le signal du custom GPT. Un Project en solo (A) ne transmet pas la tâche à d’autres, un prompt ponctuel (C) donne des résultats incohérents, et une application API (D) est surdimensionnée pour du libre-service au sein de ChatGPT.
Quels DEUX énoncés justifient correctement de viser l’échelon de capacité le plus léger qui répond au besoin ?
Afficher la réponse
Réponse : A et C.
Gravir l’échelle ajoute du coût total de possession, et viser trop bas a aussi un coût ; on dimensionne donc au besoin réel. Les échelons plus lourds ne sont pas intrinsèquement plus lents (B) ni moins précis aux échelons plus légers (D), et c’est un principe de conception, pas une règle de politique (E).
Un livrable récurrent est un document que vous affinez sur plusieurs tours dans la même session. Quelle capacité en conversation soutient le mieux l’itération ?
Afficher la réponse
Réponse : C.
Canvas est la surface dédiée pour itérer sur un document ou du code au fil des tours. Search (A) et deep research (B) recueillent de l’information, et data analysis (D) calcule sur des fichiers — aucune n’est une surface d’édition.
Une tâche multi-étapes peut s’exécuter de façon semi-autonome avec revue aux points de contrôle, en exécutant plusieurs actions plutôt que de répondre à une seule question. Quel échelon convient ?
Afficher la réponse
Réponse : B.
L’exécution déléguée multi-étapes sous supervision est exactement un agent d’espace de travail. Une instruction enregistrée (A) et un prompt ponctuel (C) répondent, ils n’exécutent pas d’étapes, et deep research (D) est une capacité de recherche, pas un échelon d’exécution.
Quelles DEUX pratiques permettent d’attribuer un changement de qualité à une modification de prompt précise et de revenir en arrière si elle nuit ?
Afficher la réponse
Réponse : A et C.
Ne changer qu’une variable par version rend les effets attribuables, et conserver la version antérieure permet le retour en arrière. Un modèle plus grand (B) et un prompt plus long (D) n’aident pas à la traçabilité, et relire chaque sortie (E) attrape des erreurs mais n’attribue pas quelle modification a causé un changement.
Un workflow envoie automatiquement des e-mails aux clients sans contrôle humain parce que « le modèle est fiable ». Quel est le problème ?
Afficher la réponse
Réponse : B.
Les actions externes et irréversibles exigent un point de revue humain quelle que soit la fiabilité du modèle. « La fiabilité le justifie » (A) ignore le déclencheur obligatoire, et la taille du modèle (C) ou la température (D) ne remédient pas au point de revue manquant.
Une étape s’exécute 3 000 fois par jour, les erreurs sont corrigeables et les enjeux par élément sont faibles. Quel mode de revue convient le MIEUX ?
Afficher la réponse
Réponse : B.
Un travail à fort volume, corrigeable et à faibles enjeux est le cas d’école de l’échantillonnage avec suivi. Contrôler les 3 000 (A) crée un goulot d’étranglement et engendre l’approbation machinale, aucune revue (C) est imprudent, et deep research (D) est sans rapport avec la supervision.
Où faut-il placer un point de revue dans un workflow brouillon puis envoi ?
Afficher la réponse
Réponse : B.
Le point de revue se place juste avant l’action irréversible, en relisant le contenu final. Avant la rédaction (A) ne relit rien de significatif, après l’envoi (C) n’est pas un point de revue du tout, et le placement a absolument de l’importance (D).
Lequel de ces éléments est un déclencheur de revue OBLIGATOIRE ?
Afficher la réponse
Réponse : C.
Les actions irréversibles comme l’émission d’un paiement imposent un point de revue humain. La longueur (A), la rapidité (B) et la mise en forme (D) sont sans rapport avec le fait qu’un point de revue soit requis.
Comment le taux d’échantillonnage doit-il évoluer pour une étape automatisée toute neuve ?
Afficher la réponse
Réponse : B.
Les nouveaux processus manquent de base de preuves, on échantillonne donc fortement au début et on relâche à mesure que la qualité est démontrée. Commencer bas et ne jamais changer (A) ignore la dérive, ne pas échantillonner les étapes neuves (C) est à l’envers, et attendre les réclamations (D) est réactif, pas de la supervision.
Pourquoi contrôler à l’excès une étape à fort volume et faibles enjeux mine-t-il la sûreté même qu’il recherche ?
Afficher la réponse
Réponse : B.
Des points de revue excessifs émoussent l’attention et transforment la revue en approbation machinale, mettant en échec le contrôle. Cela n’affecte pas l’hallucination (A) ni la vitesse d’inférence (C), et le coût en tokens (D) n’est pas l’enjeu de sûreté décrit.
Quelles DEUX étapes d’un workflow EXIGENT un point de revue obligatoire plutôt qu’un échantillonnage ?
Afficher la réponse
Réponse : A et C.
La publication externe et le dépôt réglementaire sont irréversibles/réglementés/externes — des points de revue obligatoires. La catégorisation de reçus (B) est un travail à fort volume corrigeable adapté à l’échantillonnage, et le brainstorming (D) et les résumés personnels (E) sont à faibles enjeux, nécessitant tout au plus un contrôle ponctuel.
Qu’est-ce qui fait d’un point de revue un contrôle objectif plutôt qu’un relecteur qui devine ?
Afficher la réponse
Réponse : B.
Les critères d’acceptation donnent au relecteur des conditions concrètes et vérifiables, transformant la revue d’un jugement subjectif en un contrôle objectif. La taille du modèle (A), la longueur du prompt (C) et le volume (D) ne rendent pas une revue objective.
Vous partez en congé et votre remplaçant ne peut pas exécuter votre workflow parce qu’il n’existe que dans votre tête. Quel est le MEILLEUR correctif ?
Afficher la réponse
Réponse : B.
Un runbook écrit est ce qui permet à un collègue d’exécuter le workflow de bout en bout sans poser de questions. « Qu’il se débrouille » (A) et « attendre » (D) laissent le workflow inexécutable, et une vidéo ponctuelle (C) capture rarement de façon fiable les entrées, la gestion des défaillances et la définition de terminé.
Après plusieurs modifications de prompt non datées, un workflow s’est dégradé et personne ne sait quel changement l’a causé. Quelle pratique aurait empêché cela ?
Afficher la réponse
Réponse : B.
Des versions datées à changement unique rendent les effets attribuables et permettent le retour en arrière. Un modèle plus grand (A) et des prompts plus longs (C) ne traitent pas la traçabilité, et relire chaque sortie (D) attrape des erreurs mais n’attribue pas quelle modification les a causées.
Un manager demande si un workflow amélioré est réellement meilleur. Quelle réponse reflète une itération fondée sur des preuves ?
Afficher la réponse
Réponse : B.
L’amélioration se démontre au regard de métriques mesurées sur un échantillon fixe. « Semble plus complet » (A) et « je l’aime davantage » (C) relèvent du ressenti, et la longueur du prompt (D) n’est pas une mesure de qualité.
Mesurer le temps de cycle d’un workflow montre que 8 de ses 20 minutes sont de la revue humaine. Que vous dit cela sur la prochaine amélioration ?
Afficher la réponse
Réponse : B.
La mesure du temps de cycle localise le goulot d’étranglement ; la revue étant dominante, la conception de la revue est le levier, pas le prompt. La longueur du prompt (A) et le prix du modèle (C) ne touchent pas le temps de revue, et la mesure est très utile (D).
Quelles DEUX sources de données sont légitimes pour mesurer la qualité continue d’un workflow ?
Afficher la réponse
Réponse : A et C.
Les éléments échantillonnés notés au regard des critères d’acceptation, et le taux de reprise/rejet au point de revue, sont des mesures de qualité objectives. L’impression de l’auteur (B) relève du ressenti, et le nombre de mots du prompt (D) et les notes de version (E) ne sont pas des données de qualité.
Quels DEUX éléments sont essentiels dans un runbook pour qu’un collègue puisse exécuter le workflow sans aide ?
Afficher la réponse
Réponse : A et C.
Une définition de terminé indique à l’exécutant quand s’arrêter, et la gestion des défaillances lui indique quoi faire en cas d’entrée manquante — les deux sont essentielles à une exécution sans aide. L’opinion de l’auteur (B), la date de coupure d’entraînement (D) et un nombre d’exécutions (E) n’aident pas un collègue à l’exécuter.
Dernière mise à jour le 18 sept. 2026