Intelligence artificielle1 août 2026· via MarkTechPost

Supabase publie un benchmark ouvert opposant des agents IA à des tâches réelles

Supabase publie un benchmark ouvert opposant des agents IA à des tâches réelles

Image : MarkTechPost

Supabase vient d’open-sourcer Evals, un cadre d’évaluation mesurant la performance d’agents de codage IA — dont Claude Code, Codex et OpenCode — sur des projets Supabase réels. Contrairement aux tests artificiels, Evals confronte ces agents à des tâches concrètes : concevoir un schéma de base de données, déboguer une fonction Edge défaillante ou réparer une politique de sécurité au niveau des lignes (Row-Level Security). Le projet propose un classement public sur supabase.com/evals ainsi qu’une suite de régression interne exécutée quotidiennement, offrant aux équipes un moyen de valider les versions du SDK ou de comparer les environnements des agents en conditions réelles.

Un bac à sable proche de la production

Chaque évaluation déploie une pile Supabase complète dans des conteneurs Docker, incluant le CLI, un serveur MCP et des ports isolés. Les agents interagissent avec la surface réelle de l’API de gestion via un runtime léger baptisé « platform-lite », garantissant que le benchmark ne se contente pas de simuler le travail : il l’effectue. Les scénarios s’articulent autour de trois axes : les produits (base de données, authentification, stockage, fonctions Edge, etc.), les thèmes (RLS, sécurité, migrations, SQL, SDK, observabilité) et les étapes (construction, déploiement, investigation, résolution). Chaque scénario s’appuie sur des tickets de support réels, des rapports de bugs ou des issues GitHub, assurant que les tests reflètent les défis quotidiens des ingénieurs.

Notation transparente — et place à l’amélioration

Evals combine des vérifications déterministes (le schéma a-t-il été déployé correctement ?) et une évaluation par LLM-juré. Les agents disposent d’une tentative de rattrapage avant le score final, et le cadre propose deux jeux de données : un benchmark public pour évaluer la diversité des compétences, et un jeu de régression quotidien traquant les modes de défaillance connus sans modifier les scores publiés. Les exécutions locales nécessitent Docker, des ports libres entre 54321 et 54329, ainsi que des clés d’API fournisseur, mais le dépôt GitHub supabase/evals est sous licence Apache-2.0 et s’installe via pnpm.

Pourquoi c’est important

Pour les équipes déployant des backends réglementés dans la fintech ou la santé, une erreur dans une politique RLS peut se transformer en incident de sécurité. En open-sourçant son outil d’évaluation, Supabase offre au secteur un étalon commun pour comparer les agents, détecter précocement les régressions et renforcer les outils avant leur mise en production. Le classement public exerce également une pression sur les éditeurs pour qu’ils s’améliorent sur des tâches Supabase concrètes, transformant des benchmarks opaques en preuves transparentes et reproductibles.


Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

Lire la source originale sur MarkTechPost →

← Retour à l'accueil