Outils développeurActualité

Warp Factories : évaluer avant de généraliser

Sur cette page
  1. Ce que la factory organise
  2. Comparer sur le même travail
  3. Compter aussi les tentatives rejetées

Warp a présenté Factories en bêta fermée le 18 août, puis Factory Benchmarks le 3 septembre. L’enjeu pratique est de trouver le workflow qui produit des modifications acceptables à un coût soutenable sur votre dépôt.

Matrice d’évaluation proposée : dix tâches fixes, deux configurations et trois répétitions donnent 60 exécutions. Chaque tâche repart de son commit fixe ; protocole original, pas benchmark Warp mesuré.
Matrice d’évaluation proposée : dix tâches fixes, deux configurations et trois répétitions donnent 60 exécutions. Chaque tâche repart de son commit fixe ; protocole original, pas benchmark Warp mesuré. Graphique : PeopleAreGeek. Source des données.
Agrandir l’image

Ce que la factory organise

L’annonce de lancement décrit des définitions versionnées, des agents de triage, spécification, implémentation et revue, ainsi que des intégrations aux outils de développement. Hébergement, inférence et conservation des données se configurent ; infrastructure fournie par le client et accords de rétention nulle ne constituent pas des valeurs par défaut identiques pour tous les comptes.

La démonstration officielle ci-dessous rend le parcours des tâches et les réglages plus concrets qu’une image statique. Elle présente le produit ; elle ne prouve pas que ses agents traitent correctement toute modification.

Présentation officielle de Warp Factories

Présentation officielle de Warp. Le lecteur YouTube ne se charge que si vous le demandez.

Voir sur YouTube · Présentation du mainteneur. Le chargement du lecteur établit une connexion avec YouTube, soumis à sa politique de confidentialité.

Comparer sur le même travail

L’annonce des benchmarks du 3 septembre décrit tâches, configurations, évaluateurs et répétitions, avec reconstruction possible d’un travail passé depuis son état initial du dépôt. L’accès reste précoce : vérifiez les combinaisons de moteurs d’agents disponibles dans la bêta réelle plutôt que de les déduire des ambitions de la plateforme.

Un protocole original peut retenir dix tâches fixes, deux configurations et trois répétitions : 60 exécutions. Chaque essai repart du même commit propre à sa tâche, avec les mêmes informations nécessaires. Conservez un lot séparé pour vérifier que les ajustements de prompts ou de skills se généralisent au-delà des exemples ayant servi au réglage.

L’illustration représente cette matrice proposée, sans aucun résultat mesuré de Warp. Les répétitions comptent : une réponse réussie ne démontre pas la fiabilité de la configuration sur cette tâche.

Compter aussi les tentatives rejetées

Supposons que A coûte 60 $ sur ses tentatives et produise huit modifications acceptées, contre 45 $ et cinq acceptations pour B. Le coût par modification acceptée vaut respectivement 7,50 $ et 9 $. B coûte moins au total, mais davantage selon cet indicateur de résultat. Ces montants fictifs excluent revue humaine et infrastructure, à ajouter pour comparer le coût complet.

L’acceptation doit inclure les contrôles déterministes adaptés, la couverture ciblée des régressions et la revue du diff réel. Un modèle évaluateur peut appliquer une grille, mais sa note ne prouve pas l’exactitude. Comptabilisez reprises et rejets, et examinez les modifications de la grille séparément de celles de l’agent évalué. La factory ne doit pas être récompensée simplement parce qu’elle a rendu son propre examen plus facile.

Revue du 8 septembre : sources recoupées, données actualisées et explications et visuels remplacés.