← outils
Devin

Devin

Tu le dis, Devin le livre.

visiter l'outil →freemiumFree / Pro 20$/mois / Max 200$/mois / Teams dès 80$/mois. SWE-2 gratuit ~1 mois puis 3$/15$ par M de tokens.

points forts

  • + Mode vocal fluide branché sur un agent de code autonome, pas sur un chatbot
  • + Contrôles vocaux bien pensés (mute, Silence Devin, barre espace)
  • + SWE-2 gratuit sur les plans self-serve pendant environ un mois
  • + Modèle post-entraîné de Kimi K3 à l'échelle multi-billions de paramètres
  • + Écosystème complet (Review, Automations, Fusion, DeepWiki)

points faibles

  • Benchmark de lancement contesté : 92,8 % sur une version retirée de Terminal-Bench, 27,3 % sur la version vivante
  • SWE-2 enfermé dans Devin : pas d'API séparée, pas de routeur tiers
  • Aucun tarif public pour les appels vocaux (0,10$/min non vérifié, à écarter)
  • Dates de promo contradictoires (8 vs 10 octobre) et facturation confuse

review complète

Devin Tu le dis, Devin le livre (et il facture)

État des lieux

Dix-huit mois après s'être autoproclamé « premier ingénieur logiciel IA », Cognition remet le couvert avec un triple lancement daté du 10 septembre 2026 : un mode vocal, un nouveau modèle maison (SWE-2) et une voix empruntée à OpenAI. Le tout pour une startup de San Francisco qui vient de lever plus de 2 milliards de dollars à 48 milliards de valorisation, et qui affiche un run-rate proche de 900 millions de dollars.

La promesse tient en cinq mots choisis par l'éditeur lui-même : « You say it, Devin ships it ». Vous décrivez une tâche à l'oral, Devin planifie, code et rend le boulot pendant que l'écran continue d'afficher les diffs, le terminal et les tests. Fini le prompt de 800 mots rédigé comme un cahier des charges : on parle à son agent de code comme on parlerait à un collègue.

Le détail qui tue : la voix, c'est du OpenAI acheté au mètre. GPT-Live-1, full-duplex, est entré dans l'API OpenAI le même jour, à 0,05 dollar la minute. Cognition ne vend donc pas de technologie vocale, il vend l'intégration de cette voix à un agent autonome. Nuance de taille pour qui croit assister à une percée maison.

La carte des menus

Côté tarifs, on oublie le plan « Team à 500 dollars » que la presse trimballait encore en 2025 : cette grille ACU a été enterrée. La grille self-serve 2026, lue sur la page tarifs et la documentation officielle le 12 septembre 2026 :

  • Free : 0 dollar, un membre, quota léger, accès à Devin Review et DeepWiki.
  • Pro : 20 dollars par mois, un membre, quotas augmentés, modèles frontières OpenAI/Claude/Gemini.
  • Max : 200 dollars par mois, quota hebdomadaire sans plafond journalier.
  • Teams : dès 80 dollars par mois, siège complet à 40 dollars, siège flex gratuit, jusqu'à 200 membres.
  • Enterprise : sur devis, facturation en Agent Compute Units.

SWE-2 est gratuit sur les plans self-serve pendant un mois environ (jusqu'au 8 octobre selon la documentation, au 10 octobre selon la page tarifs l'éditeur ne s'accorde pas avec lui-même), puis facturé au tarif liste : 3 dollars le million de tokens en entrée, 15 dollars en sortie, et -75 % dans le cloud jusqu'au 31 décembre.

Ce que la bête sait vraiment faire

Le mode vocal est sobre mais bien pensé. Un bouton d'appel à côté de la zone de message ; le texte déjà tapé part avec l'appel. Pendant la conversation, on peut couper le micro, maintenir la barre d'espace pour parler micro coupé, ou lancer un « Silence Devin » qui fait taire l'agent sans l'arrêter de travailler. On raccroche, on navigue, la conversation finit dans l'historique de la session.

SWE-2, lui, est un post-entraînement de Kimi K3 (2,8 billions de paramètres, environ 104 milliards actifs) avec une astuce d'entraînement mise en avant : les trois niveaux d'effort medium, high, max sont entraînés dans un seul run de renforcement, avec une pénalité de coût calibrée sur la frontière coût/performance du modèle de base.

Le tableau de benchmarks fourni par l'éditeur fait rêver : 50 % sur FrontierCode 1.1, 73 % sur DeepSWE, 92,8 % sur Terminal-Bench 2.1.

Les couleuvres à avaler

Sauf que ce 92,8 % n'existe plus. Terminal-Bench 2.1 a été retiré. La version vivante Terminal-Bench 4.0, hébergée par Stanford, Harbor et le Laude Institute donne 27,3 % à SWE-2, contre 55,8 % à Fable 5.1 et 57,9 % à GPT-6 Astra. Vingt-huit points d'écart. Le fil Hacker News (442 points, 188 commentaires) n'a pas raté l'affaire : « Seems like benchmaxing ? » Et le 50 % de FrontierCode vient d'un benchmark écrit, hébergé et noté par Cognition lui-même.

Ajoutez l'enfermement : SWE-2 n'a pas d'API séparée, pas de tarif par token pour le grand public, pas de présence sur OpenRouter. Un employé l'a confirmé sur HN : la capacité d'inférence est réservée aux produits Devin. Et le flou tarifaire sur la voix : aucun prix officiel par minute. Le 0,10 dollar la minute qui circule vient d'un annuaire tiers aux données manifestement fausses (fondation 2021, CTO « Jane Smith »). À jeter.

Rappelons enfin le contexte : la démo de lancement de 2024 contestée, le rachat de Windsurf, et un mémo de Scott Wu affirmant « We don't believe in work-life balance » après avoir licencié 30 personnes.

Verdict

Devin Voice est une vraie bonne idée d'interface : parler à un agent de code plutôt que de rédiger un prompt, c'est le progrès le plus évident de ce lancement. Mais la valeur est dans l'intégration, pas dans la voix (achetée à OpenAI) ni dans le modèle (post-entraîné, enfermé, au benchmark contesté). À 48 milliards de valorisation et 900 millions de run-rate, Cognition vend surtout une plateforme fermée qui facture au gramme.

cas d'usage

  • 1. Piloter un agent de code à la voix pendant qu'on navigue dans l'IDE
  • 2. Décrire une tâche complexe à l'oral plutôt que rédiger un long prompt
  • 3. Déléguer refactorings et PRs avec revue automatique (Devin Review)
  • 4. Équipes : partager des crédits on-demand et automatiser Slack/GitHub/Linear
  • 5. Tester un modèle frontière de code sans changer de harnais

astuces

  • Interrompez Devin pendant qu'il parle : la voix est conçue pour ça
  • « Silence Devin » coupe l'audio sans arrêter le travail de l'agent
  • Vérifiez les benchmarks sur Terminal-Bench 4.0, pas sur la version retirée