← outils
collabosm

collabosm

Une A100 à la demande, facturée par Google.

visiter l'outil →open-sourceCode MIT, aucun palier payant ni service vendu par l'auteur. Usage facturé par Google Colab : 0,54 $/h sur A100-40G, 0,68 $/h sur A100-80G, plus ~1,8 unité de calcul par démarrage (unité ≈ 0,10 $). Plan Colab payant ou achat à l'usage obligatoire.

points forts

  • + Code MIT, aucun palier payant ni service vendu
  • + Un bouton pour louer une A100 sans acheter de matériel
  • + Compatible API OpenAI (Codex, Open WebUI, scripts)
  • + Arrêts automatiques (20 min / 6 h) contre la facture qui dérape
  • + Mesures de débit publiées avec méthode et provenance

points faibles

  • − Contredit les CGU de Colab (le tunnel sert à d'autres appareils)
  • − Rien n'est gratuit à l'usage : plan Colab payant obligatoire
  • − Dépôt de 2 jours, zéro release, zéro tag, aucune adoption mesurée
  • − 11 min de mise en route à chaque démarrage sur GPU 80G

review complète

collabosm — Une A100 à 68 centimes de l'heure, avec le mode d'emploi qui se contredit

État des lieux

collabosm n'est pas un service, c'est une recette. Une application locale qui loue un GPU A100 dans votre propre compte Google Colab, y installe ExLlamaV3, y télécharge un modèle de la famille Qwen3.8 et le sert derrière une API compatible OpenAI sur http://127.0.0.1:3020/v1. En clair : une grosse machine facturée par Google, pilotée par un bouton depuis un navigateur, et branchable sur Codex, Open WebUI ou un script maison sans la moindre adaptation.

Le dépôt est né le 25 septembre 2026, il a deux jours au moment où ces lignes sont écrites, et il publie déjà un dossier technique d'un niveau qu'on voit rarement chez des projets de six mois. Le code est MIT, l'auteur ne vend rien, et le coût s'affiche avant le démarrage. La nuance qui compte : collabosm ne coûte rien, mais son usage, lui, coûte toujours quelque chose.

La carte des menus

Le logiciel est gratuit, point. Il faut un compte Google avec des unités de calcul Colab — donc un plan payant Pro ou Pro+, ou un achat à l'usage, le palier gratuit ne suffit pas. Ensuite, on paie Google directement, jamais l'auteur : un A100-40G revient à environ 0,54 dollar l'heure, prêt en six minutes ; un A100-80G High-RAM à 0,68 dollar l'heure, prêt en onze minutes. Une unité de calcul vaut environ 0,10 dollar, et chaque démarrage consomme environ 1,8 unité sur le GPU 80G, affiché sur la carte de confirmation avant validation.

Rapporté au volume, une session de trois heures sur A100-80G avec le modèle Flash-Next coûte environ deux dollars quarante, hors unités de démarrage. Comparé à une API commerciale facturant le même volume de jetons sur un modèle de cette taille, l'écart peut devenir significatif — à condition de tolérer onze minutes de mise en route à chaque fois et un point d'accès qui meurt à l'arrêt du GPU.

Ce que la bête sait vraiment faire

Le principe tient en une phrase, la mise en œuvre est autrement plus sérieuse. On lance python frontend/server.py, une page s'ouvre sur 127.0.0.1:3020, et le panneau déroule trois étapes : installer l'outil Colab officiel de Google dans un dossier local, connecter un compte Google par l'authentification officielle, vérifier le solde d'unités. On choisit une carte, on appuie sur Démarrer, et l'application affiche ce que ça va coûter avant d'engager le moindre centime.

Derrière, google-colab-cli réserve la machine, y installe ExLlamaV3, y télécharge une version figée du modèle et y lance un serveur d'inférence. Le raccordement passe par un tunnel Cloudflare protégé par une clé secrète que l'application conserve et ajoute elle-même à chaque requête, sans jamais la faire transiter par le navigateur. L'adresse locale reste la même même quand le tunnel change à chaque démarrage.

Le dossier technique est la vraie surprise. Le fichier docs/MEASURED.md publie des débits mesurés à froid avec des nonces uniques pour garantir un cache vide : 2 498 à 2 806 jetons par seconde en préremplissage sur A100-80G, 74 à 75 jetons par seconde en décodage avec MTP, jusqu'à 97 à 30 000 jetons de contexte. Et il va jusqu'à démonter le harnais de mesure officiel d'ExLlamaV3, en montrant que sa courbe plate entre 4 096 et 131 072 jetons est extrapolée, pas mesurée. Le gain de 76 % qu'il trouve en changeant une taille de bloc est publié avec la mise en garde qui va avec : la première exécution paie une passe d'auto-réglage, et un balayage en une seule passe aurait conclu l'inverse.

Les couleuvres à avaler

La première couleuvre, l'auteur l'écrit lui-même dans son propre guide : « Colab's terms: use it for yourself. Colab does not allow running a service for other people on its machines. » Quelques paragraphes plus haut, le même document propose une fonction Tunnel pour servir le modèle à d'autres appareils, avec une adresse publique et une vraie clé d'API. La page d'aide de Colab range l'offre de service web sans lien avec le calcul interactif dans la liste interdite à tous les plans, sans exception de paiement. Le contrôle à distance, lui, se lève en payant. Voilà un cas d'école lisible de bout en bout.

La deuxième, c'est la facture fantôme : le GPU facture même quand on ne discute pas, et fermer la fenêtre n'arrête rien. Les arrêts automatiques à vingt minutes et six heures limitent les dégâts sans les supprimer, et le guide y consacre une section entière, ce qui en dit long sur le type d'incident qui l'a motivée.

La troisième, c'est la jeunesse du projet : deux jours, zéro release, zéro tag, 84 étoiles et 2 forks qui mesurent l'intérêt pour l'astuce, pas l'usage du logiciel. Aucun fil Hacker News, aucun article, aucun avis utilisateur. Le couple d'entrée de gamme — A100-40G avec le modèle 27B — est marqué « unmeasured » dans recipes.json alors que le guide le présente comme « measured once ». Et les poids des modèles ne sont pas du MIT : la licence déclarée sur Hugging Face est « other », une licence personnalisée non permissive.

Verdict

collabosm est un objet rare : un logiciel libre qui ne vend rien, et qui publie plus de rigueur en deux jours que la plupart des lancements « révolutionnaires » en deux mois. Mais c'est aussi un outil qui marche sur les conditions d'utilisation de son propre fournisseur, et dont la gratuité s'arrête exactement là où commence la carte bancaire de Google. Pour le développeur qui veut une A100 à la demande sans acheter de matériel et sans intermédiaire facturant les jetons, c'est une mécanique impressionnante. Pour celui qui signe sans lire les conditions de Colab, c'est un rappel que la gratuité du logiciel n'est pas celle de la machine. ★★★★☆

cas d'usage

  • 1. Tester un modèle ouvert 27B/125B à la demande sans GPU local
  • 2. Servir un endpoint local compatible OpenAI pour Codex ou Open WebUI
  • 3. Benchmarker ExLlamaV3 sur du vrai matériel sans achat
  • 4. Comparer le coût à l'heure contre la facturation au token
  • 5. Monter une machine jetable pour un projet de courte durée

astuces

  • → Lire le coût affiché sur la carte avant de valider un démarrage
  • → Le mode --mock simule tout le panneau sans rien louer ni facturer
  • → Vérifier le solde d'unités Colab avant de lancer une session