Nous publions la courbede survie,
pas la démo.
N'importe qui peut vous montrer une exécution qui a marché. La question utile est : quelle fraction des exécutions franchit une barre qui veut dire quelque chose, ce que cela coûte par succès livré, et quel degré de confiance il est raisonnable d'accorder à la réponse. Vous trouverez ci-dessous ce que nous avons mesuré et comment nous l'avons mesuré.
Vos statistiques sont
justes. C’est l’unité
qui était fausse.
Il s'agit d'une de nos propres configurations. Sur la métrique que cette catégorie rapporte habituellement, c'est la meilleure chose que nous ayons construite. Sur le résultat livré, elle est proche du bas du classement, et elle coûte deux fois et demie plus cher par succès. Nous l'avons découvert en nous mesurant nous-mêmes, et c'est l'élément le plus utile du corpus.
Le chiffre d'affiche. La proportion d'exécutions ayant atteint l'approbation, celui qu'un fournisseur cite, nous compris, si personne ne creuse.
La proportion ayant réellement atteint une conformité ≥L4. La même configuration, les mêmes exécutions, un seuil qui veut dire quelque chose.
Par rapport à notre meilleure configuration. Elle livre régulièrement un travail situé un niveau sous la barre, et facture une prime pour ce privilège.
« La vue “validé seulement” en aurait fait un gagnant. Cet écart est toute la raison d’être de la métrique composée. »Méthodologie du référentiel, solario-xp
Nous n'allons pas gagner une guerre de benchmarks contre des entreprises cent fois mieux financées, et nous n'essaierons pas. Un pourcentage détaché d'un seuil, d'un coût et d'un intervalle n'est pas un résultat, c'est un artefact marketing qui se trouve être numériquement vrai.
Nous avons donc changé de sujet pour parler de la mesure elle-même. Si un acheteur accepte que la métrique composée soit la bonne unité, tous les chiffres d'affiche de cette catégorie doivent être recalculés, y compris les nôtres, et c'est précisément le but. Nous demandons à être tenus à un standard plus exigeant, en public, et les premiers.
Une exécution ne compte comme un succès que lorsqu'elle est entièrement validée et conforme ≥L4. Les deux, simultanément, sur la même exécution.
L'exécution est l'unité d'analyse. Les étapes internes forment une cascade causalement chaînée, pas des tirages indépendants, les résultats d'étape sont donc un mécanisme, pas une preuve. Les traiter comme des échantillons indépendants gonfle tous les intervalles dans le sens du fournisseur.
Et le dénominateur du coût est par succès livré, pas par exécution. Une configuration bon marché qui échoue deux fois plus souvent n'est pas bon marché.
Trois engagements
qui nous contraignent.
Ils ont été écrits avant les résultats, et ils nous ont coûté plus d'une fois des conclusions qui nous auraient avantagés. Ils sont publiés pour que vous puissiez nous y tenir.
Nous rapportons l’incertitude, pas seulement les moyennes
Chaque chiffre d'affiche porte un intervalle de crédibilité. Le recensement des exécutions par configuration est publié avant les résultats, avec les cellules trop peu peuplées signalées plutôt que masquées, si une cellule contient une à trois exécutions, aucune méthode de variance n'y est fiable, et nous le disons au niveau de la cellule.
Nous n’inventons jamais de gagnant
Quand deux configurations sont trop proches pour être départagées, la conclusion est indistinguables au vu des preuves actuelles. Nos meilleure et deuxième meilleure configurations de conception sont statistiquement indistinguables, et la page ci-dessous le dit plutôt que d'arrondir en notre faveur.
Nous séparons la note des éléments qui la biaisent
Niveau de qualité, taux de validation et coût sont rapportés comme des axes distincts. Les agréger produit un nombre qui s'améliore quand le système devient plus permissif, ce qui est précisément le mode de défaillance que toute cette page existe pour exposer.
Des résultats déterministes.
Aucune réserve nécessaire.
Tout ce qui figure dans ce tableau provient d'un corpus entièrement synthétique que nous pouvons publier, et chaque chiffre ne dépend que de contrôles déterministes, pas de l'opinion d'un modèle. Ce sont les nombres qui ne portent aucun astérisque.
| Chiffre | Ce qu’il mesure | Détail | |
|---|---|---|---|
| 0,96–0,99 | Déterminisme de la décomposition | Accord inter-modèles sur la façon dont un même ensemble d'exigences est partitionné en blocs, mesuré par l'indice de Rand ajusté. La validité structurelle était de 100 %. | 150 décompositions 3 modèles · 2 fournisseurs |
| 0 | Faux positifs sur la porte la plus difficile | Zéro déclenchement intempestif sur le prédicat structurel le plus difficile, sur l'ensemble des exécutions propres, alors même que 45 % des exigences sont multi-livrées, c'est-à-dire autant d'occasions de se tromper. Il a détecté 100 % d'un défaut réel connu et 4 défauts injectés sur 4, chacun basculant exactement son prédicat cible sans dommage collatéral. | 150 exécutions propres |
| 0 % | Taux de validation forcée | Aucune exécution, dans aucune configuration, n'a jamais nécessité une dérogation manuelle pour avancer. Le chemin de gouvernance n'a jamais été ce qu'il fallait contourner. | 315 exécutions 26 configurations |
| 1–3 % | Stabilité des scores | Coefficient de variation d'une exécution à l'autre sur les scores de conformité. La dimension gouvernance est fréquemment à 0,0 %, les parties déterministes ne bougent pas. | 315 exécutions |
| 0 bascule | Robustesse à l’échantillonnage | L'étape d'inspection rejouée à température 1,0 contre 0,4, sur trois modèles, n'a produit aucun changement de verdict. La porte est dominée par la conformité, pas par l'échantillonnage. | 18 exécutions 3 modèles · n=3 |
| 0 / 45 | Faux positifs de l’audit sémantique | Un audit sémantique en langage naturel, de style Hoare, a produit zéro faux positif sur 45 constats portant sur du code correct, et un rappel de 4 sur 4 sur des défauts injectés dans 3 exécutions sur 3, dont deux qu'une hypothèse pré-enregistrée prédisait qu'il manquerait. Il a également mis au jour deux vraies portes non câblées que la suite de tests est structurellement incapable de détecter. | 45 constats 3 exécutions |
Notre meilleure configuration mesurée livre une exécution de conception entièrement validée et conforme ≥L4 dans 70 % des cas (22 sur 31), intervalle de crédibilité à 95 % [0,53 ; 0,84]. Notre deuxième meilleure configuration en est statistiquement indistinguable (P = 0,71), et nous ne la présenterons pas comme moins bonne.
La condition. Le niveau de conformité dépend en partie d'un juge LLM dont nous n'avons pas encore mesuré l'exactitude. Soixante-trois pour cent des portes plafonnées le sont par ce juge plutôt que par un contrôle déterministe. Tant que ses taux de vrais et de faux positifs ne sont pas établis, tous les intervalles ci-dessus doivent se lire à supposer que le juge ait raison. Le harnais de calibration est construit et le jeu de données étiquetées est vide. Nous publierons les chiffres quand ils existeront, quels qu'ils soient.
Brief mince en entrée.
Soixante points de
rappel en sortie.
Personne dans un CAC 40 ne vous remet un PRD complet. On vous remet une note de deux pages, un deck de comité de pilotage et un contact qui connaît le reste. Nous avons donc pré-enregistré une prédiction sur exactement cette situation, puis nous l'avons testée.
Rappel des exigences, brief mince, avec documents sources typés
Fournir des sources structurées face à un brief d'exigences mince a fait progresser le rappel des exigences de soixante points. Face à un brief déjà complet, le gain était exactement nul, le pipeline exploite le contexte à proportion de ce qui manque. C'était la prédiction pré-enregistrée, et elle a tenu.
La moitié inconfortable, que nous publions aussi : ajouter des documents sources à un brief déjà complet a mesurablement nui, le rappel des règles est passé de 1,00 à 0,75. Plus de contexte n'est pas une vertu. C'est un levier dont le signe dépend de ce que vous aviez déjà.
Corpus synthétique · n=8 par bras · pré-enregistré · publiable intégralement
La gouvernance est
l’égalisateur et
le filtre.
Mêmes exigences, mêmes portes, cinq combinaisons de modèles et de points d'accès. Cette seule expérience porte à la fois l'indépendance vis-à-vis des modèles, la résidence des données et l'auditabilité, mesurées, pas affirmées dans une liste à puces.
Identique à l’octet près, en région
Claude via AWS Bedrock en eu-west-3 a produit des paramètres d'échantillonnage identiques à l'octet près à ceux de l'API directe, avec une profondeur d'artefact équivalente et sans pénalité de latence. La résidence en UE n'a rien coûté de mesurable.
Un modèle local a bouclé la ligne
Un modèle local à poids ouverts, exécuté sur machine, a bouclé les neuf étapes et franchi toutes les portes structurelles, tout en produisant environ la moitié de la profondeur de plan et un cinquième du détail de modèle de données. Ça marche. Ça marche moins profondément. Les deux moitiés sont le résultat.
Un grand modèle a été rejeté
Une décomposition faible produite par un grand modèle a été rejetée par un validateur déterministe plutôt que livrée en silence. La taille n'est pas un laissez-passer. La porte ignore quel modèle elle juge, et c'est toute la conception.
« La gouvernance garantit la validité, pas la profondeur. »
Un résultat connexe mérite d'être énoncé parce qu'il va contre l'instinct actuel du secteur : les tokens de raisonnement ne sont pas de la qualité de sortie. Un modèle frontier a dépensé environ 1,8× les tokens d'un autre et produit une spécification plus courte. Si l'on vous vend du budget de raisonnement, demandez ce qu'il a livré.
Les signaux de processus
survivent aux résultats.
Les résultats vieillissent et les corpus changent. La façon dont une organisation se comporte quand sa propre mesure l'embarrasse, non. Ce sont les signaux que nous chercherions si nous évaluions quelqu'un d'autre.
Le recensement est publié avant les résultats
Exécutions par configuration, avec les cellules trop peu peuplées signalées plutôt que silencieusement écartées. Vous voyez où nos preuves sont faibles avant de voir ce qu'elles concluent.
Les intervalles trompeurs sont montrés comme tels
Les intervalles de confiance naïfs sont rapportés à côté des intervalles bayésiens précisément pour démontrer l'écart.
Nous avons retiré notre propre métrique d’affiche
Quand la validation binaire a saturé et cessé de discriminer, nous l'avons dit et avons cessé de la mettre en avant.
Les prédictions réfutées restent intactes
La vérité terrain pré-enregistrée qui s'est révélée en partie fausse reste au dossier telle qu'elle a été écrite.
Nous auditons notre propre porte avant de la livrer
Trois faux positifs sur des bras entiers, trouvés en lisant les données réelles, et supprimés.
Nous mesurons lesquels de nos contrôles fonctionnent
Six dimensions jugées mortes. Publiées plutôt que laissées en place pour gonfler la liste de fonctionnalités.
Le désaccord est mesuré directionnellement
Pas seulement la fréquence des désaccords entre le modèle et la règle, mais leur sens, 298 plus stricts contre 11 plus indulgents.
Une politique de traitement des données existe au dépôt
Ne jamais tout committer à l'aveugle, matériel client exclu par défaut, table d'anonymisation conservée en privé.
Chaque expérience est re-scorable sans appel de modèle
Scoreurs déterministes, résultats figés, commande de reproduction documentée. Revérifier une affirmation n'exige ni de payer une facture d'inférence ni de faire confiance à un cache.
Publier l'échec le convertit en actif. Cela ne fonctionne que si vous le faites avant que quelqu'un d'autre ne le trouve.
Posez-nous la question à laquelle cette page ne répond pas.
Soumettez la méthodologie à votre direction data science ou risque modèle. Nous transmettrons le recensement, les intervalles et la section des limites sans les retoucher, et nous préférons perdre une affaire sur un chiffre honnête que la gagner sur un benchmark emprunté.