
Revalvo
Le banc d'essai local de vos prompts.
points forts
- + Exécution 100% locale dans le navigateur (IndexedDB)
- + Comparaison de modèles en parallèle (OpenAI, Anthropic, Groq, Ollama)
- + 40 évaluateurs automatiques (structure, sécurité, LLM-as-a-judge)
- + Versioning des prompts façon Git avec diff visuel
- + Gestionnaire de budget intégré pour éviter les mauvaises surprises
points faibles
- − Risque de perte de données si purge brutale du cache navigateur
- − Proxy CORS obligatoire pour OpenAI et Anthropic
- − Pas de collaboration en temps réel (nécessite GitHub Sync)
- − Aucune application de bureau native (client web uniquement)
review complète
Revalvo — Le banc d'essai local qui passe vos prompts au détecteur de mensonges.
État des lieux
Combien de soi-disant "prompt engineers" écrivent encore leurs consignes au doigt mouillé dans l'interface de ChatGPT avant de découvrir, une fois en production, que leur bot se met à insulter les clients ou à promettre des remises délirantes ? Jusqu'ici, pour évaluer sérieusement un LLM, on avait le choix entre le bricolage infâme sur des interfaces de chat basiques et les usines à gaz SaaS (Langfuse, Braintrust, Humanloop) qui vous soulagent de 50 à 200 dollars par mois tout en siphonnant vos données métier sur leurs serveurs.
Sorti de terre fin août 2026, Revalvo vient siffler la fin de la récréation. Il s'agit d'un atelier "local-first" exécuté directement dans le navigateur, sans compte obligatoire. Son crédo ? Transformer votre bécane en laboratoire de métrologie pour LLMs avec 40 évaluateurs automatiques, un comparateur de prompts façon Git, et des rapports chiffrables en latence et en pépettes. Le tout, sans qu'un seul octet de vos prompts secrets ne foute le camp chez un tiers.
La carte des menus
Revalvo a l'élégance de ne rien vous facturer. C'est l'approche Bring Your Own Key (BYOK) poussée à l'extrême.
- Le prix du soft : 100 % gratuit. Pas de plan Pro caché pour débloquer des fonctionnalités, ni d'abonnement mensuel.
- Ce que vous payez vraiment : Exactement ce que vous consommez chez les fournisseurs (OpenRouter, Groq, OpenAI, Anthropic). Et si vous faites tourner vos modèles en local via Ollama ou LM Studio (sur localhost), la facture finale est d'absolument zéro euro.
- La cerise sur le gâteau : L'outil intègre un gestionnaire de budget pour plafonner vos dépenses mensuelles (par exemple, 20 $) et éviter la crise cardiaque si une boucle infinie s'excite sur votre clé API.
Ce que la bête sait vraiment faire
Revalvo n'est pas là pour faire joli, c'est un véritable établi d'ingénieur.
D'abord, le tir groupé multi-modèles. Au lieu de copier-coller piteusement le même prompt sur quatre fenêtres différentes, vous sélectionnez vos poulains (ex: GPT-4o, Claude 3.5 Sonnet, Llama 3.3 via Groq) et vous balancez la purée en parallèle. Les réponses tombent côte à côte, avec la latence et le coût exact calculé au millième de dollar.
Ensuite, l'armée des 40 évaluateurs. Fini le "ça a l'air pas mal". Vous pouvez soumettre les réponses à des juges structurels (JSON strict, Regex, longueur), des juges de performance, des garde-fous de sécurité (détection de fuite de PII, injection de prompts), et même des LLM-as-a-judge pour vérifier la factualité et l'absence d'hallucination.
Enfin, la traçabilité. Chaque modification de prompt est versionnée comme du code (v1, v2) avec un diff visuel à la GitHub. Les plus organisés activeront le Smart Sync pour pousser leurs fichiers YAML de configuration directement sur leur dépôt GitHub privé. Une fois vos tests massifs terminés (sur des jeux de données de 1000 lignes importés en CSV), vous exportez le rapport (HTML, Markdown, JSON) et le snippet de code (Python, TypeScript, cURL) prêt à être collé en prod.
Les couleuvres à avaler
Personne n'est parfait, et l'approche "tout dans le navigateur" a les défauts de ses qualités :
- Le syndrome de la femme de ménage numérique : Vos données vivent dans l'IndexedDB du navigateur. Si vous videz votre cache sauvagement un matin de déprime sans avoir exporté vos JSON ou activé la synchro GitHub, vous perdez tout votre historique de tests. Adieu.
- Le proxy CORS obligatoire pour les capricieux : Si Groq ou Ollama discutent en direct avec le navigateur, OpenAI et Anthropic bloquent ce type de requêtes (politique CORS). Revalvo fait donc transiter ces appels par un proxy mémoire Cloudflare. C'est stateless, ça ne stocke rien, mais ça suffira à donner des sueurs froides aux RSSI d'hôpitaux ou de la défense qui n'aiment pas les intermédiaires, même furtifs.
- Le mode solo : On ne collabore pas en temps réel façon Google Docs. Pour le travail d'équipe, il faut en passer par le repo GitHub commun.
- L'absence de binaire : Toujours pas d'appli Mac ou Windows standalone (Electron/Tauri), on reste confiné à l'onglet web.
Verdict
Revalvo est l'outil que l'industrie attendait pour professionnaliser le prompt engineering sans se faire racketter. Rapide, gratuit, respectueux de la vie privée et doté d'une rigueur scientifique implacable avec ses 40 évaluateurs. Il enterre les interfaces jouets des grands labos et rend obsolètes les plateformes SaaS sur-tarifiées pour 90 % des cas d'usage. Indispensable. ★★★★☆
cas d'usage
- 1. Développement et validation de prompts avant mise en production
- 2. Comparaison de coûts et de latence entre plusieurs modèles
- 3. Test de régression massif via datasets CSV
- 4. Sécurisation des LLMs contre le jailbreak et les fuites PII
- 5. Évaluation locale de modèles open source via Ollama / LM Studio
astuces
- → Activez le Smart Sync avec GitHub pour sécuriser votre historique et collaborer.
- → Utilisez Ollama en localhost pour faire tourner des évaluateurs 100% gratuits.
- → Fixez toujours un plafond budgétaire dans les paramètres avant de lancer des tests sur de gros datasets CSV.




