Agents and Workflows
Agents – Examen blanc 1
Un examen blanc indépendant de 50 items, pondéré par domaine, pour la piste Agents and Workflows, avec explications complètes et indicateur de préparation.
Ceci est un examen blanc indépendant complet, pondéré par domaine, pour la piste Agents and Workflows. Il est construit à partir des objectifs d’apprentissage OpenAI accessibles au public et n’est pas une évaluation officielle OpenAI. Les 50 questions sont inédites et ne reprennent pas les items des pages de domaine. Utilisez-le comme diagnostic : passez-le en premier pour repérer vos deux domaines les plus faibles, puis révisez avant l’examen blanc 2.
Consignes
- Durée : 60 minutes, correspondant à la durée de la session interactive.
- Items : 50 questions à choix multiple et à réponses multiples. Chaque item indique combien de réponses sélectionner.
- Sélection : pour un item à réponses multiples, vous devez sélectionner toutes les bonnes options et aucune mauvaise pour obtenir le point ; il n’y a pas de crédit partiel.
- Aucune pénalité pour les mauvaises réponses : répondez à chaque question — une mauvaise réponse ne coûte rien au-delà du point.
- Objectif : visez au moins 80 % brut (40 sur 50) avant de passer la véritable évaluation Academy Agents and Workflows. La barre des 80 % correspond au seuil du badge Academy.
- Traitez chaque question avant de déployer la réponse.
Répartition par domaine
| # | Domaine | Pondération | Items ici |
|---|---|---|---|
| 1 | What an Agent Is and When to Use One | 16 % | 8 |
| 2 | Defining Objectives and Tasks | 18 % | 9 |
| 3 | Context, Tools and Permissions | 18 % | 9 |
| 4 | Boundaries and Guardrails | 16 % | 8 |
| 5 | Reviewing and Verifying Agent Work | 16 % | 8 |
| 6 | Reliability and Iteration | 16 % | 8 |
Total : 8 + 9 + 9 + 8 + 8 + 8 = 50 items.
Interprétation de la préparation
Ceci est un indicateur de préparation indépendant, pas un score officiel.
| Score brut (sur 50) | Palier | Interprétation |
|---|---|---|
| 45–50 | 90 %+ | Forte préparation sur tous les domaines |
| 40–44 | 80–89 % | Prêt pour l’évaluation ; revoyez tout domaine faible |
| 35–39 | 70–79 % | Confiance en construction ; révision ciblée conseillée |
| Moins de 35 | moins de 70 % | Continuez à apprendre ; revoyez d’abord D2 et D3 |
Le palier des 80 % correspond au seuil du badge Academy ; traitez donc 40 sur 50 comme votre minimum avant de passer la véritable évaluation.
Passer l’examen blanc
Deux façons d’utiliser les questions ci-dessous : le mode interactif lance une session chronométrée, une question à la fois, et se termine par votre indicateur de préparation, une ventilation par domaine et une correction complète ; le mode révision en dessous liste chaque question avec ses options une par ligne et la réponse masquée jusqu’à ce que vous la demandiez.
Mode interactif
Passer l’examen d’entraînement
50 questions · une à la fois · compte à rebours de 60 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.
Par domaine
| Domaine | Correctes | Score |
|---|
Correction
Toutes les questions (mode révision)
Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.
Un analyste financier a besoin qu’un seul chiffre trimestriel soit revérifié par rapport à un unique tableur joint, et il lira la réponse avant d’en faire quoi que ce soit. Quel mode convient le mieux ?
Afficher la réponse
Réponse : B.
Une seule question traitée à partir d’une seule source fournie, lue avant d’agir, relève du prompt — autonomie, outils et durée minimaux. Un agent (A, D) ajoute de la mise en place, du coût et du rayon d’impact sans bénéfice, et l’e-mail en D est une étape irréversible inutile. Un workflow en cinq étapes (C) sur-conçoit une simple recherche.
Quelle caractéristique signale le plus clairement qu’une tâche a réellement besoin d’un agent plutôt que d’un workflow ?
Afficher la réponse
Réponse : B.
Un agent devient utile lorsque le chemin ne peut pas être fixé à l’avance et qu’il doit donc planifier au fur et à mesure qu’il apprend. Le poids émotionnel (A), la longueur des instructions (C) et l’ancienneté du demandeur (D) ne changent rien au fait que les étapes soient connues d’avance, ce qui est précisément ce qui distingue un workflow d’un agent.
Un responsable des opérations planifie chaque mois un rapprochement de fin de mois identique, avec les mêmes étapes fixes, et vérifie entre chaque étape. Quel mode est le plus approprié ?
Afficher la réponse
Réponse : B.
Des étapes fixes et connues avec des points de contrôle entre elles constituent la définition même d’un workflow, moins coûteux à construire et plus facile à vérifier. Un simple prompt (A) ne peut pas porter un processus séquencé en plusieurs étapes, et un agent (C, D) ajoute une autonomie qu’un chemin entièrement connu ne requiert pas.
Pourquoi une longue exécution d’agent non surveillée exige-t-elle une supervision différente d’un court prompt que vous observez ?
Afficher la réponse
Réponse : B.
Un travail surveillé est auto-correcteur car vous pouvez stopper une mauvaise étape ; une exécution non surveillée a déjà agi au moment où vous regardez, si bien que le contrôle se déplace vers les limites et la vérification. Le coût (A) et la taille du modèle (C) ne sont pas la différence déterminante, et les courts prompts peuvent utiliser des outils que vous invoquez (D).
Un collègue dit « ce rapport est vraiment compliqué, donc il faut évidemment un agent ». Quelle est la réponse la plus solide ?
Afficher la réponse
Réponse : B.
L’adéquation se décide selon les quatre axes, et non selon la difficulté ressentie d’une tâche ; une tâche compliquée au chemin fixe reste un workflow. Traiter la difficulté comme facteur décisif (A) est le piège, découper aveuglément (C) ignore si les étapes sont fixes, et le choix du modèle (D) est sans rapport avec le mode.
Un travailleur du savoir veut déléguer la compilation d’une synthèse hebdomadaire de l’actualité des marchés, dont les sources varient d’une semaine à l’autre, s’exécutant sans surveillance pendant environ dix minutes et ne produisant qu’un brouillon. Quel mode convient et pourquoi ?
Afficher la réponse
Réponse : C.
Des sources qui varient signifient que le chemin est découvert au fur et à mesure, et une exécution non surveillée en plusieurs étapes produisant un brouillon réversible relève de l’agent. Ce n’est pas un prompt (A, D) car ce n’est pas une seule étape surveillée, ni un workflow (B) car les étapes ne sont pas fixes.
Quelles sont les DEUX situations qui font le plus clairement d’un agent le mauvais outil pour la tâche ?
Afficher la réponse
Réponse : A et C.
Une définition de « terminé » manquante (A) signifie que vous ne pouvez ni briefer ni vérifier le travail, et une vérification plus coûteuse que le travail lui-même (C) fait de la délégation une perte nette — deux signaux classiques de « mauvais outil ». Les exécutions non surveillées multi-outils (B) et les chemins guidés par la découverte (D) orientent vers un agent, et les brouillons réversibles (E) maintiennent simplement le risque bas.
Qu’est-ce qui capture le mieux ce que signifie « autonomie » pour distinguer un agent d’un workflow détaillé ?
Afficher la réponse
Réponse : B.
L’autonomie porte sur qui décide du chemin : dans un workflow, vous séquencez les étapes, tandis qu’un agent les planifie et les choisit. La longueur des instructions (A) mesure la taille et non l’autonomie, et la vitesse de diffusion (C) comme le format de sortie (D) sont sans rapport.
Quel objectif délégué est le plus prêt à être confié à un agent ?
Afficher la réponse
Réponse : C.
L’option C énonce un résultat concret, un périmètre borné et une source de vérité nommée, si bien que l’agent peut exécuter et que vous pouvez vérifier. A, B et D sont des souhaits sans artefact défini ni test d’acceptation.
Quelles DEUX propriétés rendent une définition de « terminé » utile à la fois pour l’agent et pour votre vérification ultérieure ?
Afficher la réponse
Réponse : A et B.
Une définition de « terminé » observable (A) vous permet de vérifier en cochant les critères, et une définition consciente de l’échec (B) fait remonter les lacunes au lieu de masquer une fabrication — les deux servent l’exécution et la vérification. Les réglages du modèle (C), une durée d’exécution (D) et une liste de connectors (E) sont d’autres parties d’un brief, dont aucune n’est ce qui rend « terminé » vérifiable.
Un brief indique « ne citez jamais les tarifs confidentiels d’un fournisseur » et « essayez de garder le mémo sous une page ». Comment l’agent doit-il traiter ces deux instructions ?
Afficher la réponse
Réponse : B.
Une règle de confidentialité formulée par « ne jamais » est une contrainte stricte, tandis qu’un objectif de longueur du type « essayez de garder » est une préférence qu’il peut dépasser au besoin. Traiter la règle de confidentialité comme facultative (A, D) n’est pas sûr, et traiter l’objectif de longueur comme strict (C) pourrait bloquer un travail par ailleurs bon.
Un agent mélange l’effectif de cette année avec un chiffre qui s’avère vieux de deux ans. Quelle est la cause racine la plus probable et le correctif ?
Afficher la réponse
Réponse : B.
Le mélange de données périmées et actuelles est le symptôme classique d’une source de vérité manquante, corrigé en nommant la source qui fait autorité et la manière de résoudre les conflits. Le niveau de raisonnement (A) régit l’intensité de la réflexion, la taille du modèle (C) et la simple longueur (D) ne lui indiquent pas quel chiffre croire.
Un brief demande à un agent d’appliquer une nouvelle convention de nommage à 80 fichiers. Où se situe généralement le point de contrôle à la plus forte valeur ?
Afficher la réponse
Réponse : B.
Le point de contrôle « un avant plusieurs » transforme une erreur en 80 exemplaires en une erreur unique en approuvant l’approche avant qu’elle ne passe à l’échelle. Vérifier seulement à la fin (A) signifie que l’erreur s’est déjà répétée, les pauses temporelles (C) ne s’alignent pas sur le risque, et l’absence de point de contrôle (D) supprime votre pilotage.
Un objectif est ambigu sur un point précis et identifiable — savoir laquelle de deux équipes est la destinataire du rapport. Quelle est la meilleure instruction à donner à l’agent ?
Afficher la réponse
Réponse : B.
Une seule bifurcation identifiable se gère au mieux par un point de contrôle : faire une pause et demander avant que l’hypothèse ne se propage. Décider en silence (A) risque un mauvais chemin, l’ignorer (C) laisse la tâche inachevée, et produire deux versions complètes (D) est du gaspillage quand une seule question la résout.
Un agent n’a pas pu trouver un chiffre dont il avait besoin, il a donc produit un nombre à l’apparence plausible pour compléter le tableau. Qu’aurait dû prescrire le brief ?
Afficher la réponse
Réponse : B.
Une définition de « terminé » consciente de l’échec indique à l’agent de faire remonter les lacunes au lieu d’inventer des données. Combler les lacunes (A) masque une fabrication, arrêter toute la tâche (C) est disproportionné quand une seule lacune peut être signalée, et la taille du modèle (D) ne change pas le comportement de fabrication.
Dans la taxonomie des cinq modes d’échec, quel mode est décrit comme le plus dangereux parce que l’agent signale une réussite alors qu’il n’a fait qu’une partie du travail ?
Afficher la réponse
Réponse : B.
L’achèvement partiel silencieux est le mode le plus dangereux car rien ne signale de problème — l’agent prétend une couverture complète alors qu’une partie du travail manque. L’objectif mal compris (A) produit un travail adjacent, le contexte manquant (C) produit une sortie hors marque ou aux faits erronés, et la dérive (D) est une dégradation progressive sur une longue exécution — chacun est visible d’une manière différente.
Quels DEUX éléments ont leur place dans une définition de « terminé » solide pour une synthèse concurrentielle prête pour une diapositive ?
Afficher la réponse
Réponse : A et C.
La couverture des quatre concurrents (A) et une borne de taille d’une diapositive avec six puces (C) sont des critères d’acceptation observables que vous pouvez cocher. Le choix du modèle (B) et la durée d’exécution (D) sont opérationnels, et le ton (E) est une préférence plutôt qu’un test d’acceptation pour une synthèse de données.
Pourquoi « énoncer le résultat, pas les frappes clavier » est-il la façon recommandée d’écrire un objectif ?
Afficher la réponse
Réponse : B.
Un résultat laisse l’agent planifier le chemin tout en restant vérifiable, alors qu’une liste de vos frappes clavier le contraint et obscurcit ce que « terminé » signifie. La longueur (A) n’est pas le sujet, les résultats n’exigent pas de modèles plus grands (C), et les agents peuvent suivre des étapes (D) — ils planifient simplement mieux à partir d’un résultat.
Un agent renvoie un texte compétent mais générique et hors marque. Quel correctif est le plus approprié ?
Afficher la réponse
Réponse : B.
Une sortie hors marque est un symptôme de contexte manquant : l’agent n’a pas les connaissances d’entreprise qui définissent la marque. Davantage d’outils (A) et un accès en écriture (D) ajoutent de l’accès plutôt que du contexte, et un modèle plus grand (C) ne connaîtra toujours pas votre marque sans qu’on la lui indique.
Une tâche exige seulement que l’agent réponde à des questions à partir d’un document de politique téléchargé. Quel accès doit-il recevoir ?
Afficher la réponse
Réponse : B.
Le moindre privilège consiste à accorder exactement l’accès en lecture dont la tâche a besoin. Le web et l’écriture (A), de larges connectors (C) et l’envoi (D) ajoutent tous du rayon d’impact dont la tâche n’a jamais besoin.
Quel ensemble nomme le mieux les quatre types de contexte dont un agent a généralement besoin ?
Afficher la réponse
Réponse : A.
Les quatre types de contexte sont le brief de tâche, les documents sources de la tâche, les connaissances d’entreprise pertinentes et les décisions déjà arrêtées. B liste des réglages d’échantillonnage, C liste des faits de compte et D liste des éléments de mise en forme — aucun n’est le contexte à partir duquel un agent raisonne.
Vous connectez un agent à un lecteur partagé entier pour qu’il ouvre un fichier précis. Quel est le risque ?
Afficher la réponse
Réponse : B.
Un connector expose tout ce qu’il atteint, et un agent autonome peut utiliser n’importe quelle partie de cela pour atteindre l’objectif, faisant remonter des données bien au-delà du fichier visé. Il ne se restreindra pas poliment de lui-même (A), et la vitesse (C) comme le choix du modèle (D) ne sont pas affectés par le périmètre.
Un agent signale « je ne peux pas accéder au CRM » et s’arrête. Quel est le bon correctif ?
Afficher la réponse
Réponse : B.
« Ne peut pas accéder » est un problème d’accès manquant, corrigé en accordant le connector précis restreint aux enregistrements requis. Coller des documents (A) traite le contexte, et la taille du modèle (C) ou le niveau de raisonnement (D) n’accordent pas d’accès.
Pourquoi fournir trop de contexte peut-il en réalité nuire à la sortie d’un agent ?
Afficher la réponse
Réponse : B.
Tout déverser noie le signal faisant autorité et peut amener l’agent à surpondérer un contenu non pertinent ou obsolète. Plus ne vaut pas toujours mieux (A), et cela ne change ni la tarification (C) ni ne désactive les outils (D).
Une tâche doit produire un brouillon d’e-mail que vous enverrez vous-même après relecture. Comment organiser l’accès pour respecter le moindre privilège ?
Afficher la réponse
Réponse : B.
Le brouillon-avant-envoi, avec l’envoi irréversible verrouillé derrière une approbation, est l’organisation sûre et au moindre privilège. L’envoi autonome (A) supprime le verrou, l’écriture sur tout le système (C) est bien plus large que nécessaire, et l’absence d’outils (D) sous-dote une tâche qui doit produire un brouillon.
Un agent rouvre sans cesse une question que l’équipe a tranchée le trimestre dernier. Quel type de contexte manquait ?
Afficher la réponse
Réponse : A.
Rejuger une question tranchée est la signature d’un contexte de « décisions antérieures » manquant ; fournissez le compte rendu de ce qui a été décidé. Une fenêtre plus grande (B) n’aidera pas si la décision n’a jamais été fournie, et le web (C) comme l’écriture (D) sont de l’accès, pas le contexte manquant.
Quelles DEUX actions réduisent le mieux le rayon d’impact d’un agent sans réduire sa capacité à effectuer une tâche de recherche en lecture seule ?
Afficher la réponse
Réponse : A et B.
La lecture-plutôt-qu’écriture (A) et la restriction d’un connector au dossier nécessaire (B) réduisent le rayon d’impact tout en laissant une tâche en lecture seule pleinement réalisable. Tous les connectors (C) et l’envoi autonome (D) élargissent le rayon d’impact, et supprimer la définition de « terminé » (E) nuit à la tâche sans améliorer la sécurité.
Un agent a parfaitement fonctionné sur l’unique entrée propre testée mais a échoué sur le lot réel. Quelle leçon en amont cela enseigne-t-il sur la manière de prouver une délégation ?
Afficher la réponse
Réponse : B.
L’entrée propre était le cas chanceux ; la fiabilité ne s’établit qu’en retestant sur des entrées variées et des cas limites. Traiter un seul succès comme une preuve (A) est précisément le piège, la taille du modèle (C) explique rarement un brief qui n’a jamais été mis à l’épreuve, et la taille du lot seule (D) ne rend pas la délégation impossible.
Quelle action requiert le plus un point de contrôle d’approbation imposé avant de pouvoir se déclencher ?
Afficher la réponse
Réponse : B.
Publier dans un canal client externe est irréversible, ce qui exige un verrou imposé avant le déclenchement. Rédiger (A), analyser (C) et réécrire (D) sont réversibles et sûrs avec une relecture légère, car rien n’a quitté le workspace.
Quelle est la différence essentielle entre une limite respectée et une limite imposée ?
Afficher la réponse
Réponse : B.
Une limite respectée est une instruction que l’agent honore habituellement, tandis qu’une limite imposée est un contrôle système qui supprime la possibilité de franchissement. Le ton (A) est sans importance, l’imposition n’est pas propre au modèle (C), et la différence est centrale (D).
Pour une action irréversible, pourquoi « il suffit d’instruire clairement l’agent de ne pas le faire » est-il insuffisant ?
Afficher la réponse
Réponse : B.
L’instruction dépend d’une compréhension correcte, et un agent autonome peut franchir une ligne demandée en mal interprétant l’objectif — inacceptable lorsque l’action est irréversible. Les instructions claires ne tiennent pas toujours (A), le coût en tokens (C) est sans rapport, et les agents n’ignorent pas toutes les instructions (D) — ils peuvent les mal interpréter.
Un agent capable d’itérer et d’appeler des outils payants reçoit la consigne « merci de ne pas trop dépenser ». Quel est le problème ?
Afficher la réponse
Réponse : B.
Une limite floue et demandée n’arrêtera pas un emballement ; un plafond de dépense imposé rend le pire cas borné et connu. L’instruction seule ne suffit pas (A), des boucles peuvent survenir avec des outils payants (C), et un plafond imposé arrête un emballement au lieu de ralentir le modèle (D).
Quelle est la limite de données la PLUS forte contre la fuite d’un document interne sensible par un agent ?
Afficher la réponse
Réponse : B.
La limite de données la plus forte est architecturale : un agent ne peut pas divulguer ce qu’il n’a jamais pu atteindre. L’instruction (A) peut être manquée, un résumé soigné (C) touche quand même les données, et la taille du modèle (D) ne crée aucune limite de données.
Pourquoi verrouiller chaque action peut-il être aussi nuisible que n’en verrouiller aucune ?
Afficher la réponse
Réponse : B.
Le sur-verrouillage produit une fatigue de validation automatique, ce qui neutralise le verrou au moment où il compte. Plus de verrous ne valent pas toujours mieux (A), et les verrous ne désactivent pas les outils (C) ni ne changent le modèle (D).
Quelles DEUX limites devraient être imposées par le système plutôt que simplement écrites dans le brief ?
Afficher la réponse
Réponse : B et C.
Un point de contrôle d’approbation sur les envois irréversibles (B) et un plafond de dépense strict sur l’usage d’outils payants (C) protègent contre un préjudice réel et difficile à annuler, et doivent être imposés. Le style (A), le ton (D) et un souhait de calendrier souple (E) sont des préférences pour lesquelles des limites respectées conviennent.
Un agent « améliorant » un document a écrasé l’original, perdant la version précédente. Quelle limite aurait empêché cela ?
Afficher la réponse
Réponse : B.
L’écrasement peut être irréversible, donc verrouiller les écrasements ou imposer des enregistrements versionnés préserve l’original. Le ton (A), la fenêtre de contexte (C) et la recherche web (D) ne font rien pour protéger le fichier.
Un agent termine une exécution par « j’ai accompli toutes les tâches avec succès ». Quelle est la meilleure prochaine étape ?
Afficher la réponse
Réponse : B.
La synthèse est une affirmation ; vérifier signifie contrôler les artefacts et les critères d’acceptation de manière indépendante. Faire confiance à la synthèse (A) est le piège de l’aisance, une autovérification dans la même session (C) réutilise le propre raisonnement de l’agent, et tout relancer (D) gaspille la délégation sans vérifier l’original.
Pourquoi « demander à l’agent s’il a correctement effectué le travail » est-elle une méthode de vérification faible ?
Afficher la réponse
Réponse : B.
Demander à l’agent de s’auto-évaluer dans la même session emporte le raisonnement et le biais d’origine, si bien qu’il peut confirmer une erreur. Le coût en tokens (A) n’est pas le problème, les agents peuvent décrire leur travail (C) — c’est cette affirmation qui n’est pas fiable — et ce n’est pas la méthode la plus forte (D).
Dans la vérification du travail d’un agent, qu’est-ce qu’un « artefact » ?
Afficher la réponse
Réponse : B.
Un artefact est le produit de travail réel que vous pouvez inspecter et contrôler, contrairement à la description qu’en fait l’agent. La synthèse (A) est une assertion, et le réglage du niveau d’effort (C) comme l’heure de début (D) sont des métadonnées d’exécution, pas le produit de travail.
Vous contrôlez par échantillonnage 6 éléments sur 60 d’un traitement en masse et l’un échoue. Que devez-vous conclure ?
Afficher la réponse
Réponse : B.
Un échec dans l’échantillon signifie que vous ne pouvez plus supposer que les éléments non contrôlés sont corrects, donc vous élargissez le contrôle ou rejetez. Supposer que le reste va bien (A) ignore le signal, corriger un seul (C) laisse 53 éléments non vérifiés, et les contrôles par échantillonnage sont utiles, pas peu fiables (D).
Quelle est la façon la plus efficace de relire une longue exécution d’agent essentiellement non surveillée ?
Afficher la réponse
Réponse : B.
Une relecture structurée — plan, points de contrôle, critères de « terminé », artefacts, contrôle par échantillonnage — est plus rapide et détecte davantage qu’une lecture linéaire. La transcription complète (A) est un dernier recours, faire confiance à la synthèse (C) ne vérifie rien, et raccourcir la transcription (D) ne vérifie pas le travail.
Pour un unique chiffre à fort enjeu dans le rapport d’un agent, quel est le contrôle le plus fort ?
Afficher la réponse
Réponse : B.
Reproduire de manière indépendante l’affirmation critique la confirme sans dépendre du propre raisonnement de l’agent. Un calcul montré (A) peut tout de même être faux, un recalcul dans la même session (C) réutilise le raisonnement d’origine, et l’arrondi (D) dissimule au lieu de contrôler.
Quels DEUX contrôles vérifient le mieux l’affirmation d’un agent selon laquelle il a « mis à jour tous les chiffres obsolètes » d’un document ?
Afficher la réponse
Réponse : A et B.
Échantillonner les mises à jour revendiquées (A) contrôle le travail déclaré, et contrôler des chiffres qu’il n’a pas mentionnés (B) est le contrôle adverse qui attrape ce que la synthèse masque. Relire la synthèse (C) et demander dans la session (D) ne vérifient rien d’indépendant, et le niveau de détail (E) n’est pas une preuve d’achèvement.
Vous constatez que vous ne pouvez pas du tout vérifier l’une des affirmations d’un agent au regard d’une quelconque preuve. Qu’est-ce que cela indique le plus probablement ?
Afficher la réponse
Réponse : B.
Une affirmation invérifiable reflète généralement un défaut de brief en amont — aucun critère contrôlable — que vous corrigez à la prochaine itération. L’impossibilité de vérifier ne rend pas l’affirmation correcte (A), ce n’est pas un modèle cassé (C), et le travail d’un agent est vérifiable lorsque le brief le permet (D).
Un agent signale « les 40 enregistrements traités » mais 6 manquent dans la sortie. Quelles DEUX réponses sont correctes ?
Afficher la réponse
Réponse : A et B.
Signaler un achèvement complet alors qu’il manque du travail est un achèvement partiel silencieux (A), et le correctif de fiabilité est une exigence de couverture qui force l’agent à signaler ce qu’il n’a pas pu faire (B). Faire confiance à l’affirmation (C) ignore l’écart, un modèle plus grand (D) ne traite pas un contrôle de couverture manquant, et supprimer la définition de « terminé » (E) supprime votre seul moyen de l’attraper.
Un agent démarre bien une longue exécution, puis les entrées ultérieures s’écartent de la tâche et se sur-développent. De quoi s’agit-il et quel est le bon correctif ?
Afficher la réponse
Réponse : B.
Un écartement progressif sur une longue exécution non surveillée est une dérive ; le correctif structurel est des points de contrôle qui réancrent plus des exécutions plus courtes et délimitées. Davantage de documents (A), davantage d’outils (C) et un modèle plus grand (D) ne traitent pas une perte de concentration liée à la durée.
Une délégation a réussi sur l’unique entrée que vous avez essayée. Que devez-vous conclure ?
Afficher la réponse
Réponse : B.
Un seul succès est une hypothèse ; la fiabilité se démontre sur des entrées variées et des cas limites. Déclarer la délégation fiable (A) risque un brief fragile, relancer la même entrée (C) ne prouve rien de nouveau, et les choix de coût (D) n’établissent pas la fiabilité.
Pourquoi ne changer qu’une seule chose à la fois en itérant sur un brief de délégation ?
Afficher la réponse
Réponse : B.
Changer une seule chose isole la cause et l’effet, si bien que vous apprenez ce qui fonctionne et bâtissez la fiabilité de manière délibérée. Il ne s’agit pas de ralentir (A) ni de l’usage des tokens (D), et les agents lisent des briefs complets, pas une seule instruction (C).
Une délégation échoue et un collègue suggère aussitôt de passer au modèle le plus performant. Quelle est la meilleure réponse ?
Afficher la réponse
Réponse : B.
La démarche disciplinée consiste à classer l’échec et à corriger sa cause en amont ; le modèle est le dernier levier car il traite rarement un brief vague ou un contexte manquant. La pensée « modèle d’abord » (A, C) saute le diagnostic, et abandonner (D) renonce avant de diagnostiquer.
Quels DEUX éléments sont des correctifs structurels contre la dérive sur une longue exécution non surveillée ?
Afficher la réponse
Réponse : A et B.
Les points de contrôle (A) et les exécutions plus courtes et délimitées (B) sont des contrôles structurels qui empêchent la dérive de s’accumuler. « Restez concentré » (C) est une limite respectée qui ne tiendra pas sur une longue exécution, un niveau de raisonnement plus élevé (D) ne traite pas l’écartement lié à la durée, et supprimer la définition de « terminé » (E) supprime votre contrôle de couverture.
Dernière mise à jour le 18 sept. 2026