CCAR-P – Examen blanc 2
Un deuxième examen blanc CCAR-P complet, pondéré selon le blueprint, avec des items inédits, plus difficiles et à contraintes multiples.
Voici un deuxième examen blanc complet de 63 items pour CCAR-P. Chaque item est inédit — aucun ne figure dans l’Examen blanc 1 ni sur les pages de domaine — et l’ensemble est réglé pour être un peu plus difficile que l’examen 1 : plus d’énoncés à contraintes multiples, plus d’arithmétique de capacité/coût, et plus de qualificatifs FIRST / MOST cost-effective / TWO qui récompensent la lecture de l’énoncé en entier avant de répondre. La pondération du blueprint est identique à celle de l’examen 1, si bien que vos scores par domaine sont directement comparables.
Ce qui diffère de l’examen 1
- Qualificatifs plus difficiles. Plusieurs énoncés demandent la première (
FIRST) action ou la conception la plus rentable (MOST cost-effective), si bien que plus d’une option est défendable et que vous devez choisir la meilleure. - Items arithmétiques. Vous calculerez le coût par requête, les RPM/ITPM/OTPM, les économies de cache, le recall@k, le MRR et la significativité A/B à partir des chiffres donnés.
- Scénarios à contraintes multiples. Résidence + cloud existant + action irréversible, ou PHI + ZDR + placement, doivent tous être satisfaits en même temps.
- Mêmes familles de distracteurs que l’examen 1 (aveugle aux contraintes, sur-conçu, prompt-comme-application, auto-déclaration, défaillance silencieuse, restitution seule, métrique agrégée, sentiment-comme-complexité), si bien que s’entraîner sur l’examen 1 se transfère directement.
Répartition par domaine
| # | Domaine | Poids | Items ici |
|---|---|---|---|
| 1 | Solution Design & Architecture | 17 % | 11 |
| 2 | Claude Models, Prompting & Context Engineering | 13 % | 8 |
| 3 | Integration (dont RAG) | 19 % | 12 |
| 4 | Evaluation, Testing & Optimization | 16 % | 10 |
| 5 | Governance, Safety & Risk Management | 14 % | 9 |
| 6 | Stakeholder Communication & Lifecycle Management | 14 % | 9 |
| 7 | Developer Productivity & Operational Enablement | 7 % | 4 |
| Total | 100 % | 63 |
Comment utiliser les deux examens
-
Passez d’abord l’Examen 1, en conditions chronométrées, avant de toucher à l’examen 2. Utilisez-le pour repérer vos domaines faibles et réétudier ces pages de domaine.
-
Utilisez l’Examen 2 comme feu vert avant réservation. Ce n’est qu’une fois l’Examen 1 confortable (≥ 80 % en brut, aucun domaine loin sous les autres) que vous devriez passer cet ensemble plus difficile. Considérez un Examen 2 solide comme le signal que vous êtes prêt à réserver.
-
Comparez les résultats par domaine entre les deux sessions. Un domaine qui chute nettement de l’examen 1 à l’examen 2 est là où le raisonnement plus profond à contraintes multiples est encore fragile — revenez à l’étude de cas et au tableau des idées reçues de cette page de domaine.
Repère de notation
L’examen réel s’échelonne de 100 à 1000 avec une réussite à 720 ; il n’y a pas de pénalité pour les mauvaises réponses, alors répondez à tout. Comme repère en brut, visez ≥ 80 % (≈ 50/63) sur cet ensemble plus difficile avant de réserver, et confirmez qu’aucun domaine ne se situe loin sous les autres.
Passer l’examen blanc
Mode interactif
Passer l’examen d’entraînement
63 questions · une à la fois · compte à rebours de 120 minutes · résultats avec répartition par domaine et correction complète à la fin. Votre progression est enregistrée dans ce navigateur si vous quittez la page.
Par domaine
| Domaine | Correctes | Score |
|---|
Correction
Toutes les questions (mode révision)
Les options sont présentées une par ligne. La réponse et l’explication restent masquées jusqu’à ce que vous cliquiez sur Afficher la réponse. Utilisez le mode interactif ci-dessus pour une session chronométrée.
Une charge de travail s’exécute à 10 req/s en moyenne à 5k tokens d’entrée + 1k de sortie sur Sonnet 5 (
$2/$10par MTok) et doit tenir un budget de$300k/mois. Quelle conception est la MOST cost-effective tout en préservant la qualité ?Afficher la réponse
Réponse : B.
Le coût par requête est
5k×$2/1e6 + 1k×$10/1e6 = $0.02; la rentabilité est un exercice arithmétique de cache + cascade + batch empilés jusqu’à coût < budget. Opus pour tout (A) est sur-conçu/dépense trop ; deviner (C) n’est pas ancré (aveugle aux contraintes) ; Fable 5.1 (D) est le modèle le plus cher, l’inverse de la rentabilité.La charge de pointe est de 25 req/s à 8k tokens d’entrée chacune ; le palier plafonne l’ITPM à 6 000 000. Quelle est la contrainte contraignante et la FIRST réponse saine ?
Afficher la réponse
Réponse : B.
peak_ITPM = 25×60×8 000 = 12 000 000, le double du plafond de 6M, donc l’ITPM lie en premier ; la correction est le Batch, un palier supérieur ou le débordement. Le RPM seul (A) lit mal le calcul ; Opus pour tout (C) augmente le coût et l’ITPM ; ignorer les rafales (D) invite une tempête de 429 (défaillance silencieuse/aveugle aux contraintes).
Un SLA p95 de 5 s est dépassé ; les traces montrent qu’une longue sortie générée domine le budget de latence. Quel changement est le BEST ?
Afficher la réponse
Réponse : B.
Quand la génération domine le budget de latence, réduisez le modèle/la sortie/l’effort ou streamez. Le multi-agent (A) est sur-conçu et ajoute de la latence ; un k plus grand (C) ajoute du temps de retrieval ; le Batch (D) a une latence pouvant aller jusqu’à 24 h et ne peut pas servir un SLA p95 interactif.
Un assureur réglementé de l’UE sur Azure veut trier les sinistres avec un signalement de fraude qui ne doit JAMAIS refuser automatiquement un sinistre. Quels DEUX choix de conception sont corrects ?
Afficher la réponse
Réponse : A et C.
La résidence UE plus une empreinte Azure existante orientent vers Foundry UE, et une action réglementée irréversible exige un point de contrôle humain. Le refus automatique (B) supprime le point de contrôle obligatoire ; l’API directe (D) est aveugle à la contrainte de résidence ; une cible agrégée unique (E) masque l’échec par type de sinistre (métrique agrégée).
Lors d’un pic de 529, une session de thinking Fable 5.1 active bascule automatiquement vers un modèle bien plus ancien et le comportement multi-tour devient corrompu. Quelle est la bonne correction ?
Afficher la réponse
Réponse : B.
Les blocs de thinking ne sont lisibles que par le modèle producteur ou plus récent ; le fallback doit donc préserver la parité de fonctionnalités et journaliser le mode dégradé. Un plafond d’itérations (A) et l’analyse de texte (D) ne traitent pas la parité (anti-pattern d’analyse de prose) ; désactiver les réessais (C) nuit à la disponibilité.
Une équipe doit lancer dans trois semaines, manque de capacité ops, et le runtime agentique est une capacité banalisée. Quelle est la BEST décision « construire vs acheter » ?
Afficher la réponse
Réponse : B.
Pas de capacité ops plus échéance serrée plus capacité banalisée orientent vers managed/acheter. Construire (A) contredit les contraintes (sur-conçu) ; reporter (C) rate l’échéance (aveugle aux contraintes) ; un produit non-Claude (D) abandonne l’exigence.
Une boucle agentique ne se termine parfois jamais. Quel est le contrôle principal CORRECT accompagné de son garde-fou ?
Afficher la réponse
Réponse : B.
Le flux de contrôle s’appuie sur
stop_reason; un plafond n’est qu’un garde-fou. Scruter le texte (A) est l’anti-pattern d’analyse de prose ; un plafond seul (C) est l’anti-pattern du plafond d’itérations comme arrêt principal ; la température (D) ne régit pas la terminaison.Un énoncé décrit des investigations parallèles indépendantes qui doivent chacune explorer avec un contexte isolé puis être synthétisées. Quel pattern est justifié ?
Afficher la réponse
Réponse : B.
Des sous-tâches parallèles à contexte isolé avec convergence sont le signal multi-agent typique. Un seul appel (A) ne peut pas paralléliser une exploration isolée ; un workflow séquentiel à contexte partagé (C) n’isole pas ; le fine-tuning (D) est sans rapport avec l’orchestration.
Une conception route 100 % vers Opus 5 à 4× le budget avec une qualité acceptable. Quel changement est le MOST cost-effective tout en préservant la qualité sur les cas difficiles ?
Afficher la réponse
Réponse : B.
Une cascade route « le moins cher d’abord » et escalade sur échec de validation, préservant la qualité des cas difficiles tandis que la majorité du trafic s’exécute à moindre coût ; le caching amortit le préfixe. Haiku pour tout (A) sacrifie la précision (aveugle aux contraintes) ; l’auto-déclaration (C) est l’anti-pattern n°4 ; réduire les utilisateurs (D) ne traite pas les coûts unitaires.
Une partie prenante propose un objectif vague et aucun chiffre, et deux équipes ne sont pas d’accord sur le périmètre. Quelle est la BEST FIRST action ?
Afficher la réponse
Réponse : B.
Sans critères ni contraintes la conception n’est pas ancrée ; la discovery fait émerger la contrainte contraignante et aligne les parties prenantes. Construire (A), choisir un modèle par défaut (C) et inventer une cible (D) escamotent tous l’étape d’ancrage (aveugle aux contraintes).
Quel changement complète le mieux une architecture de référence par ailleurs saine qui n’a actuellement aucun chemin des signaux de production vers le système ?
Afficher la réponse
Réponse : B.
Une architecture de niveau Professional doit boucler des signaux de production vers l’amélioration ; c’est l’étape de rétroaction. Un load balancer (A) est de l’infrastructure ; la validation d’entrée (C) est l’étape d’entrée ; une fenêtre plus grande (D) est sans rapport avec la boucle manquante.
Un préfixe stable de 4 000 tokens sur Sonnet 5 (
$2/MTok en entrée) est réutilisé avec un taux de cache-hit de 90 % sur 10 000 req/jour. Environ combien de coût d’entrée le caching économise-t-il ?Afficher la réponse
Réponse : B.
Une lecture ≈ 0,1× l’entrée transforme les 4 000 tokens de préfixe en ~400 sur les hits, faisant chuter le coût d’entrée quotidien de ~
$90à ~$27(environ 70 %). Le caching aide bien les grands préfixes stables (A) ; 50 % est la remise Batch, pas le caching (C) ; les lectures sont bon marché, pas gratuites (D).Un pipeline doit retourner du JSON strictement typé pour des systèmes en aval et s’exécute sur Fable 5.1, où forcer l’usage d’outils renvoie un 400. Quelle est la BEST approche ?
Afficher la réponse
Réponse : B.
Les structured outputs avec un schéma
strictsont conformes par construction et ne nécessitent pas de forcer l’usage d’outils, ce que Fable 5.1 rejette par un 400. Forcer les outils puis réessayer (A) ne peut pas corriger un 400 ; le JSON par prompt seul avec regex (C) et le re-parsing de texte libre (D) sont une analyse de prose fragile.Le caching est activé mais le taux de hit est de ~3 %. L’investigation montre qu’un
request_idpar requête est ajouté en tête du system prompt. Quelle est la FIRST correction ?Afficher la réponse
Réponse : B.
Un token par requête dans le préfixe le change à chaque appel, si bien que rien ne se cache ; le déplacer restaure un préfixe stable. Le caching n’est pas cassé (A) ; la longueur des documents (C) n’affecte que la taille minimale ; une fenêtre plus grande (D) est sans rapport.
Une longue session agentique sur un modèle de thinking déborde de la fenêtre parce que les résultats d’outils sont énormes. Quelle technique est correcte, et que faut-il éviter ?
Afficher la réponse
Réponse : B.
Le context editing retire les résultats d’outils périmés côté serveur et la compaction résume le récit narratif, tous deux évitant l’invalidation des blocs de thinking. Supprimer des tours côté client (A) rompt l’invariant append-only ; la température (C) n’affecte pas la taille du contexte ; l’auto-résumé dans le tour (D) ne récupère pas de fenêtre.
Une équipe exécute chaque requête sur Opus 5 à
effort: xhighavec une qualité acceptable et 5× le budget ; le coût, pas la latence, est le grief. Quels DEUX changements réduisent le mieux le coût tout en préservant la qualité ?Afficher la réponse
Réponse : A et B.
Une cascade « le moins cher d’abord » et un effort correctement dimensionné (re-validé par segment) réduisent le coût tout en préservant la qualité des cas difficiles. L’auto-déclaration (C) est l’anti-pattern n°4 ; Fable 5.1 (D) est le modèle le plus cher ; retirer les evals (E) supprime le garde-fou de qualité (défaillance silencieuse).
Une règle stricte « ne jamais accorder de remise au-dessus de 20 % » doit être garantie dans un agent de vente Claude. Où doit-elle se situer ?
Afficher la réponse
Réponse : B.
Les règles métier strictes exigent une application déterministe que le modèle ne peut pas contourner par la persuasion. La formulation du prompt (A) et le few-shot (C) sont du prompt-as-enforcement (anti-pattern n°3) ; le budget de thinking (D) est sans rapport avec l’application.
Après la mise à niveau d’Opus 4.6 vers Opus 5, les requêtes fixant
budget_tokenspour le thinking renvoient désormais un 400. Quelle est la correction ?Afficher la réponse
Réponse : B.
budget_tokensest supprimé sur Opus 5 (et Sonnet 5 / Fable 5.x) et renvoie un 400 ; le thinking adaptatif pluseffortest le remplacement pris en charge. Les réessais (A) ne peuvent pas corriger un 400 ; Haiku (C) est le seul modèle utilisant encorebudget_tokensmais n’est pas un équivalent d’Opus ; supprimer le thinking (D) écarte le raisonnement nécessaire.Un fait durable (le palier contractuel d’un client) doit persister entre des sessions distinctes sans être renvoyé dans chaque prompt. Quel mécanisme convient, et quelle contrainte s’applique ?
Afficher la réponse
Réponse : B.
L’outil de mémoire fait persister les faits durables entre les sessions ; la contrainte est de ne pas y stocker de secrets/PII de façon inappropriée. Coller à chaque prompt (A) gonfle le contexte ;
CLAUDE.local.md(C) est un fichier de dev Claude Code, pas un stockage runtime ; s’appuyer sur la rétention du fournisseur (D) n’est pas un mécanisme de mémoire et augmente le risque de conformité.Un assistant B2B sert 300 locataires depuis un seul index vectoriel partagé ; un locataire voit parfois le document d’un autre locataire dans une réponse. Quel est le contrôle correct ?
Afficher la réponse
Réponse : B.
L’isolation est une frontière de sécurité au moment du retrieval : filtrer par
tenant_id/ACL avant la recherche vectorielle. Une règle de prompt (A) est du prompt-as-enforcement contournable ; le filtrage post-génération (C) est trop tardif car le chunk est déjà entré dans le contexte ; un modèle plus grand (D) n’isole pas les données.Sur 5 requêtes, le chunk pertinent s’est classé 1, 4, 2, non-récupéré, et 1. Quels sont recall@3 et MRR ?
Afficher la réponse
Réponse : B.
Trois des cinq chunks pertinents sont dans le top 3 (rangs 1, 2, 1), donc recall@3 = 3/5 = 0,60 ; les rangs réciproques 1, 0,25, 0,5, 0, 1 donnent MRR = 2,75/5 = 0,55. L’option A ignore les échecs ; C intervertit les valeurs ; D est arithmétiquement fausse.
recall@10 = 0,63 (faible) et les réponses omettent fréquemment le fait nécessaire. Où l’architecte doit-il travailler en FIRST ?
Afficher la réponse
Réponse : B.
Un faible recall signifie que le bon chunk n’atteint pas le top-k, donc la défaillance est en amont, dans le retrieval. Le grounding et les citations (A, C) et un modèle de génération plus grand (D) ne peuvent pas aider si la réponse n’a jamais été récupérée.
recall@10 = 0,95 mais les réponses incluent des faits absents des chunks récupérés. Quelle couche a échoué et quelle est la correction ?
Afficher la réponse
Réponse : B.
Un recall élevé signifie que le bon contexte est présent, donc un fait non étayé est une défaillance de grounding à la génération. Les corrections côté retrieval (A, C, D) visent une couche saine (raisonnement fondé sur le seul recall).
Un système RAG indexe avec
text-embedding-3-largemais un nouveau service interroge avec un modèle d’embeddings différent ; les scores de similarité semblent aléatoires. Quelle est la cause et la correction ?Afficher la réponse
Réponse : B.
Les embeddings de modèles différents occupent des espaces vectoriels différents, donc la similarité inter-modèles n’a pas de sens ; requête et index doivent utiliser le même modèle d’embeddings. Ce n’est pas du matériel (A) ; monter k (C) ne peut pas corriger des vecteurs incompatibles ; le modèle de génération (D) est sans rapport avec la similarité de retrieval.
Un assistant de connaissances continue de donner l’ANCIENNE réponse, avec assurance, après la mise à jour d’un document pendant la nuit. Que l’architecte doit-il investiguer en FIRST ?
Afficher la réponse
Réponse : B.
Une réponse confiante-mais-fausse immédiatement après un rafraîchissement pointe vers un retrieval/indexation périmé ; inspectez d’abord les IDs des chunks récupérés. Les changements de prompt (A, D) et un modèle plus grand (C) ne peuvent pas corriger un retrieval périmé.
Un agent de support dispose de 22 outils, dont
delete_ticketetrefundque son rôle ne devrait jamais utiliser. Quelle est la bonne remédiation ?Afficher la réponse
Réponse : B.
Le moindre privilège retire la capacité, si bien que l’agentivité excessive disparaît. La journalisation (A) et la confirmation (C) le laissent accessible ; une règle de prompt (D) est du prompt-as-enforcement contournable.
Des contrats chunkés à 500 tokens fixes produisent des réponses citant la mauvaise sous-clause et perdant le contexte environnant. Quels DEUX changements aident le PLUS ?
Afficher la réponse
Réponse : A et B.
Les documents structurés nécessitent un chunking respectant les frontières et un contexte parent-enfant. Le dense seul (C), la température (D) et le retrait des citations (E) ne traitent pas le chunking, et les deux derniers l’aggravent.
Un serveur MCP distant sur Streamable HTTP expose des outils puissants sans authentification. Que faut-il OBLIGATOIREMENT ajouter ?
Afficher la réponse
Réponse : B.
Le MCP distant exige OAuth 2.1 et une autorisation par utilisateur pour que l’agent agisse avec l’autorité de l’appelant. MCP n’est pas authentifié par défaut (A) ; les prompts (C) et les rate limits (D) ne traitent pas l’autorisation.
Après avoir activé les réessais avec backoff, certains clients sont facturés deux fois. Quelle est la bonne correction ?
Afficher la réponse
Réponse : B.
Les clés d’idempotence rendent sûrs les réessais sur des actions non idempotentes. Désactiver les réessais (A) nuit à la résilience ; la température (C) est sans rapport ; la réconciliation hebdomadaire (D) a quand même doublement facturé les clients (défaillance silencieuse).
Un corpus de 3M de documents change chaque jour et les réponses doivent citer la clause exacte. Quelle approche est la BEST ?
Afficher la réponse
Réponse : B.
Les corpus volumineux, changeant quotidiennement et exigeant des citations sont un cas canonique de RAG. Le fine-tuning nocturne (A) est une cadence irréaliste pour des faits ; le corpus dépasse/dépense le contexte et perd les citations (C) ; (D) hérite des deux problèmes.
Un agent récupère k=8 en dense seul sans reranker ; la précision est faible et les numéros de pièce exacts sont manqués. Quels DEUX changements donnent le plus grand gain de qualité ?
Afficher la réponse
Réponse : A et B.
Le retrieval hybride corrige les manques d’identifiants exacts et le « récupérer large puis reranker » corrige la précision. La température (C) est sans rapport avec le retrieval ; retirer les citations (D) nuit à la traçabilité du grounding ; bourrer le contexte (E) gonfle le coût sans améliorer le classement (sur-conçu).
Sur 2 000 items appariés, le prompt B gagne 1 080 fois (54 %) ; sur un test manuel séparé de 12 items, B a gagné 7 fois. Quel résultat doit guider la promotion et pourquoi ?
Afficher la réponse
Réponse : B.
Pour n=2 000, l’excédent de 80 victoires au-dessus des 1 000 attendues vaut ≈3,6σ (écart-type ≈ 22,4), ce qui est significatif ; 7/12 est du bruit de pile ou face. Le petit test (A) est du bruit ; l’A/B est fiable à l’échelle (C) ; moyenner les taux de victoire (D) n’a pas de sens.
Un changement de prompt gagne significativement dans l’ensemble mais la précision du segment espagnol chute de 6 points. Quelle est la bonne décision ?
Afficher la réponse
Réponse : B.
L’absence de régression par segment est un garde-fou strict ; une victoire agrégée masquant une régression de segment est l’anti-pattern n°10. Promouvoir quand même (A, C) déploie une régression connue ; retirer l’espagnol (D) la re-masque (métrique agrégée).
Une équipe ne peut rapporter qu’un seul chiffre de précision globale et ne peut pas dire quel segment échoue. Quelle lacune d’observabilité en est la cause racine ?
Afficher la réponse
Réponse : B.
Sans tags de segment ni champs de version, seul un agrégat est calculable et les régressions ne peuvent être attribuées. Les métriques GPU (A) sont sans rapport ; la taille du juge (C) ne crée pas la lacune de reporting ; la latence (D) est un signal différent.
Quels DEUX champs sont les PLUS essentiels dans un enregistrement d’eval par requête pour permettre l’évaluation par segment et l’attribution A/B ?
Afficher la réponse
Réponse : A et B.
Les tags de segment permettent des métriques stratifiées et la version prompt/modèle permet d’attribuer les régressions et les résultats A/B à un changement précis. La température CPU (C), un UUID sans lien (D) et un nom de campagne (E) ne soutiennent pas l’évaluation.
Une eval note les réponses avec la même session Sonnet 5 qui les a produites et rapporte des scores élevés. Pourquoi n’est-ce pas fiable et quelle est la FIRST correction ?
Afficher la réponse
Réponse : B.
Noter dans la session de production retient le biais d’origine (anti-pattern n°9) ; l’indépendance plus la calibration humaine sont requises. Le coût (A) n’est pas le problème central ; le juge n’a pas besoin d’être plus grand (C) ; le LLM-as-judge est valide lorsqu’il est indépendant (D).
Une UI de streaming interactive paraît lente même si la latence totale est acceptable. Quelle métrique faut-il ajouter ?
Afficher la réponse
Réponse : B.
Dans les UI de streaming, les utilisateurs perçoivent la réactivité par le moment où les tokens commencent (TTFT), pas seulement par le temps total. Le total des tokens (A), le décompte de requêtes (C) et le nombre de versions (D) ne sont pas des métriques d’expérience de latence.
Un système n’échoue que sur les 5 % de cas les plus difficiles et fonctionne bien ailleurs. Quelle est la cause la plus probable et la correction ?
Afficher la réponse
Réponse : B.
Une signature nette « seuls les cas les plus difficiles échouent » pointe vers la capacité du modèle ; une cascade escalade uniquement ces cas tout en gardant le modèle bon marché ailleurs. Le re-chunking (A) et la réécriture du prompt (C) visent des couches qui fonctionnent ; les réplicas (D) n’affectent pas la justesse.
Une équipe veut réduire le coût de 50 % sur un job de résumé en masse nocturne sans exigence de latence. Quel levier est le BEST et que doit-on OBLIGATOIREMENT faire ensuite ?
Afficher la réponse
Réponse : B.
Un job en masse tolérant à la latence convient au Batch, et tout changement de coût est suivi d’une re-validation par segment. Les coupes d’effort à l’aveugle (A) risquent la qualité ; changer le trafic interactif (C) est hors périmètre ; désactiver les evals (D) supprime le filet de sécurité (défaillance silencieuse).
Quelles sont les DEUX bonnes métriques pour un service à fort volume, sensible au coût, avec un SLA interactif ?
Afficher la réponse
Réponse : A et B.
Sensible au coût plus interactif oriente vers le coût par tâche et la latence de queue p95. La latence moyenne (C) masque la queue ; le total des tokens (D) et le nombre de versions (E) ne sont pas des métriques SLA côté utilisateur (métrique agrégée).
Un juge LLM note systématiquement la plus longue de deux réponses plus haut indépendamment de la justesse. Que se passe-t-il et quelle est la FIRST correction ?
Afficher la réponse
Réponse : B.
Le juge présente un biais de longueur, corrigé par la calibration humaine et un barème centré sur la justesse. Le juge n’est pas fiable (A) ; récompenser la longueur (C) est le bug ; supprimer les evals (D) abandonne la mesure.
Un assistant d’accueil en santé traite des PHI, est basé dans l’UE sur AWS, et un fournisseur propose Fable 5.1 avec rétention indéfinie. Quelles DEUX corrections sont REQUISES en premier ?
Afficher la réponse
Réponse : A et B.
Une posture PHI/ZDR disqualifie Fable 5.1 et exige la résidence UE, un BAA, des limites de rétention et l’effacement. La suppression à 30 jours (C) est justement ce que le ZDR interdit ; une règle de prompt (D) ne peut pas protéger les PHI (prompt-as-enforcement) ; la rétention indéfinie (E) enfreint la minimisation RGPD.
Une agence fédérale américaine impose FedRAMP High et veut le modèle le plus récent le jour de sa sortie. Quelle est la bonne recommandation ?
Afficher la réponse
Réponse : B.
FedRAMP High est fourni via le périmètre Bedrock/Vertex et l’exigence de conformité prime sur la nouveauté. L’API directe (A) est en dehors du périmètre (aveugle aux contraintes) ; l’autorisation n’est pas intrinsèque (C) ; un ordinateur portable (D) est inacceptable pour des données fédérales.
Un runbook de réponse à incident pour un système de données personnelles de l’UE omet un élément légalement requis. Lequel ?
Afficher la réponse
Réponse : B.
Le RGPD exige la notification de violation (en général sous 72 heures), donc le runbook doit l’inclure. Le marketing (A), une liste de dashboards (C) et une projection de coûts (D) ne sont pas l’exigence légale.
Un agent résumant des pages web lit un texte caché lui ordonnant d’envoyer des données internes à l’extérieur par e-mail. De quoi s’agit-il et quelle est la défense correcte ?
Afficher la réponse
Réponse : A et B.
Des instructions malveillantes dans le contenu récupéré constituent une injection de prompt indirecte ; la défense est le traitement du contenu non fiable plus le moindre privilège et la validation des actions. Faire confiance à la sortie d’outil (C) est la vulnérabilité ; l’effort (D) est sans rapport ; ajouter l’instruction au prompt (E) exécute l’attaque.
Un système de support escalade vers un humain dès que le client « semble en colère ». Pourquoi est-ce défectueux ?
Afficher la réponse
Réponse : B.
L’escalade fondée sur le sentiment (anti-pattern n°5) confond l’émotion avec la difficulté ; un client calme peut avoir un cas complexe et à haut risque. Ce n’est pas optimal (A) ; la fréquence (C) n’est pas le défaut central ; la colère n’implique pas un échec du modèle (D).
Un énoncé indique « traitement à haut risque de données personnelles de résidents de l’UE ». Quel contrôle relève du point de contrôle de CONCEPTION ?
Afficher la réponse
Réponse : B.
Le traitement à haut risque sous le RGPD exige une DPIA et des décisions de résidence/effacement au point de contrôle de conception. Attendre (A) est trop tard ; un avertissement (C) ne satisfait pas la DPIA ; la sur-rétention (D) enfreint la minimisation.
Quel ensemble représente le mieux des guardrails en couches (défense en profondeur) ?
Afficher la réponse
Réponse : B.
La défense en profondeur empile des couches indépendantes pour qu’un contournement de l’une soit capté par la suivante. Un seul prompt (A), la revue seule (C) ou la regex seule (D) sont des points de défaillance uniques.
Un incident d’injection de prompt est détecté en production. Quelle est une FIRST étape de confinement saine ?
Afficher la réponse
Réponse : B.
Le confinement consiste en un rollback rapide et la désactivation de la capacité exploitée, circonscrits via les traces. Supprimer les journaux (A) détruit les preuves ; ignorer (C) prolonge le préjudice ; divulguer les données (D) est une seconde violation.
Quelles DEUX correspondances « mot-signal → contrôle » sont correctes ?
Afficher la réponse
Réponse : A et B.
FedRAMP correspond au périmètre cloud et un mandat ZDR disqualifie Fable 5.1. Les PHI nécessitent un BAA et des contrôles, pas un prompt (C) ; l’effacement UE exige un chemin de suppression, pas une rétention indéfinie (D) ; l’IA à haut risque (EU AI Act) exige de la documentation, pas de la sauter (E).
Où doivent résider les clés d’API et les identifiants de base de données d’un agent Claude ?
Afficher la réponse
Réponse : B.
Les secrets appartiennent aux variables d’environnement/gestionnaires de secrets et jamais à une config visible du modèle ni aux journaux. Les mettre dans le prompt (A), dans CLAUDE.md (C) ou dans les journaux (D) crée des chemins d’exfiltration.
Un VP sponsor s’est vu présenter un ADR technique de 40 pages et reste non convaincu. Quelle est la BEST communication corrective ?
Afficher la réponse
Réponse : B.
Les sponsors ont besoin d’une matrice de décision/d’un modèle de coût/d’un brief d’une page à leur altitude, pas d’un ADR d’ingénierie. Renvoyer l’ADR (A) répète l’erreur de mauvaise altitude ; les journaux d’eval bruts (C) et le runbook (D) sont les mauvais artefacts pour un sponsor.
En utilisant une matrice de décision pondérée (SLA 0,25, coût 0,25, fiabilité 0,20, flexibilité 0,15, effort 0,15), Workflow obtient 5,5,5,3,4 et Agentique obtient 3,3,3,5,3. Lequel l’emporte et pourquoi ?
Afficher la réponse
Réponse : B.
Workflow = 0,25·5+0,25·5+0,20·5+0,15·3+0,15·4 = 4,60 ; Agentique = 0,25·3+0,25·3+0,20·3+0,15·5+0,15·3 = 3,30, donc Workflow l’emporte sur les critères pondérés par l’entreprise. La flexibilité (A) ne pèse que 0,15 ; ce n’est pas une égalité (C) ; la matrice décide de façon transparente (D).
Un sponsor demande « un support plus rapide ». Comment cela doit-il devenir un SLA ?
Afficher la réponse
Réponse : B.
Les SLA doivent être mesurables et par segment, reflétant les critères d’eval, avec un reporting régulier. Les promesses vagues (A) ne sont pas vérifiables ; la moyenne seule (C) masque la queue ; l’indéfini (D) invite aux litiges.
L’exploitation refuse une passation. Quel ensemble de livrables satisfait le critère de sortie de passation ?
Afficher la réponse
Réponse : B.
Le critère de sortie de la passation est l’exploitabilité et la capacité de rétablissement, fournies par le runbook plus la documentation d’architecture/de flux de données. Un support (A), le code seul (C) ou un modèle de coût (D) ne permettent pas aux opérateurs de l’exploiter et de le rétablir.
Un modèle sur lequel un service est épinglé a été retiré. Quelles DEUX étapes rendent la migration correcte ?
Afficher la réponse
Réponse : A et B.
La dépréciation est un événement de cycle de vie gouverné : évaluer les changements cassants, re-valider par segment, canary avec rollback, et communiquer. Un remplacement à l’aveugle (C) risque des régressions ; appeler un modèle retiré (D) échoue ; désactiver les evals (E) supprime le filet de sécurité.
Pendant la discovery, une partie prenante dit « rendre l’onboarding plus rapide avec l’IA » et n’offre aucun chiffre. Quelle est la FIRST étape ?
Afficher la réponse
Réponse : B.
La discovery convertit les demandes vagues en critères chiffrés par segment avec contraintes et validation avant la conception. Construire (A), supposer une cible (C) ou escalader (D) escamotent l’étape d’ancrage (aveugle aux contraintes).
Quelle est la distinction correcte entre SLA, SLO et SLI ?
Afficher la réponse
Réponse : B.
SLI (indicateur) → SLO (objectif interne) → SLA (engagement externe). Ce ne sont pas des synonymes (A), les rôles interne/externe ne sont pas inversés (C), et le SLI est une métrique, pas un contrat (D).
Un système techniquement solide connaît une faible adoption. Quels DEUX leviers de conduite du changement aident le PLUS ?
Afficher la réponse
Réponse : A et B.
L’adoption est portée par l’activation et le déploiement par phases avec retours et valeur démontrée. L’usage forcé (C), le retrait des points de contrôle (D) et la dissimulation des limites (E) se retournent contre soi.
Quel artefact communique le mieux le risque résiduel (après atténuation) à une partie prenante conformité ?
Afficher la réponse
Réponse : B.
Un registre des risques avec probabilité/impact, propriétaires, atténuations et risque résiduel est l’artefact tourné vers la conformité. Un ADR (A) consigne une décision technique ; un modèle de coût (C) relève de l’économie ; un diagramme de code (D) s’adresse aux ingénieurs.
Une équipe plateforme doit garantir que
git push --forceest bloqué pour chaque développeur et non contournable. Où cela doit-il se situer ?Afficher la réponse
Réponse : B.
Un blocage déterministe et non contournable est un hook
PreToolUse(sortie 2) imposé via une politique managée. Une phrase dans CLAUDE.md (A) est une orientation en prose (prompt-as-enforcement) ;CLAUDE.local.md(C) est personnel/surchargeable ; Slack (D) n’est pas de l’application.Une équipe veut que Claude relise automatiquement les diffs en CI. Quel est le bon paramétrage ?
Afficher la réponse
Réponse : B.
La CI est non interactive, donc le mode headless avec sortie structurée et outils restreints est correct. L’usage interactif (A) ne peut pas s’exécuter en CI ; tous-les-outils (C) et permissions désactivées (D) violent le moindre privilège.
Un groupe plateforme déploie Claude Code auprès de 15 équipes et veut un risque faible. Quels DEUX choix sont les BEST ?
Afficher la réponse
Réponse : A et B.
Le déploiement par phases plus l’application par politique managée et un catalogue partagé versionné est le pattern sûr. Un mandat dès le premier jour (C) escamote l’instauration de la confiance ; des serveurs MCP non vérifiés (D) brisent la gouvernance ; les lignes de code (E) sont une vanity metric.
Dernière mise à jour le 18 sept. 2026