← Retour à /research

Classement · WAB

Top 100 · workspaces agentiques audités · 12 piliers · L0–L4

#WorkspaceTypeGradeScoreclusterELOPiliers maturesPoint faibleStackAuditéEvidence
1Madani Workspace
B2B services portfolio · iter-39
refA87.08
87
A
95
B
89
C
73
D
1900Claude Code · Python · n8n · launchd · auto-promote-engine2026-05-25audit ↗
2Hermes Agent · NousResearch
skill-curator + RL self-evolution
extC50.83
30
A
63
B
53
C
60
D
1650Python · agent/curator.py · skill_manage · GRPO2026-05-24audit ↗
3OpenClaw
agentic platform · plugin ecosystem
extD47.50
23
A
57
B
58
C
50
D
1580TypeScript · Node.js · plugin system2026-05-24audit ↗
4OpenAI Agents SDK · Python
agent SDK library
extD40.83
23
A
42
B
49
C
50
D
1450Python · agents framework2026-05-20audit ↗
5Cline · IDE Agent
VS Code agentic IDE
extD32.50
13
A
47
B
35
C
35
D
1480TypeScript · VS Code extension2026-05-24audit ↗
6Anthropic Cookbook
code-sample repository
extF27.50
7
A
33
B
35
C
35
D
1380Python · Jupyter · Claude Agent SDK2026-05-20audit ↗

Affichage 6 sur 6

Légende

verified · audit vérifié par les maintainers du benchmark.
self-reported · audit exécuté par le submitter · re-audit serveur prévu en v0.5.
Piliers matures · nombre de piliers au niveau maximum de maturité (L4 Optimizing) sur 12 au total. Ex. 9/12 = 9 piliers à L4.
Point faible · le pilier avec la maturité la plus basse · où le workspace a le plus grand écart.
Cluster A·B·C·D · moyennes des 4 clusters (Cognition, Action, Trust, Operations).
ELO · dérivé du composite (1200 + composite × 8). Même composite → même ELO.
Score · composite 0-100 · moyenne pondérée également des 12 piliers.
Niveaux L0-L4 · L0 absent · L1 ad hoc · L2 documenté · L3 automatisé · L4 optimizing (auto-improve).

Composite = moyenne pondérée 4 clusters · ELO Bradley-Terry · ~70% audit déterministe · IRR 1.0 vérifié. Reference entries vérifiées dans le benchmark repo. Community submissions stockées en Vercel KV live · re-audit CI roadmap v0.5.