Douze modèles d'IA ont été lâchés sur 4 822 recherches d'hôtels, de produits et de papiers scientifiques. Résultat : dix sur douze penchent pour Booking.com, tous préfèrent Walmart à Target, et quand l'étiquette leur plaît, ils choisissent le mauvais article deux fois sur trois. La faute n'est pas au prix. Elle est au nom écrit dessus.
L'expérience qui a mis un hôtel au tapis
Des chercheurs de la Seoul National University ont fait tourner douze modèles d'agents, du GPT au DeepSeek en passant par Gemini, Llama et Qwen, dans une boucle de recherche en conditions presque réelles. Trois domaines : acheter un produit, réserver un hôtel, dénicher un papier scientifique. 4 822 requêtes au total.
Le protocole est propre, et c'est ce qui fait sa force. Chaque agent raisonne par écrit, transforme sa demande en mots-clés, interroge un moteur de recherche (Tavily), puis lit dix résultats maximum. Titre, extrait, URL. Pas plus. Il n'ouvre jamais les pages, il dispose de trois recherches par épisode, et il décide donc à l'aveugle, comme un client pressé qui scanne une page de résultats sans cliquer.
Le papier s'intitule Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It. Préprint, pas encore relu par des pairs, quarante et une pages, soumis le 2 octobre 2026 par une équipe de la Graduate School of Data Science de Séoul. Il pose une question qu'on n'avait jamais mesurée proprement : est-ce que votre agent a des marques préférées, comme vous avez votre boulangerie ?
La réponse tient en un mot. Oui.
Ce qui rend l'étude neuve, c'est sa méthode. Les travaux précédents présentaient du contenu identique avec des étiquettes différentes et regardaient si le modèle mordait. Ici, l'agent cherche lui-même, récupère lui-même, sélectionne lui-même. C'est la première mesure de la préférence de source en conditions réelles de recherche, pas en laboratoire. Et la différence compte : un biais qu'on observe dans une expérience artificielle peut être un artefact. Un biais qui survit à 4 822 recherches réelles, c'est autre chose.
Booking 10, Expedia 0
Sur les douze modèles, dix préfèrent Booking.com. La moitié évite carrément Expedia. Dans le shopping, les douze préfèrent Walmart ; deux seulement penchent pour Target. Amazon écrase eBay, Etsy et AliExpress.
Soyons clairs sur un point : ces modèles n'ont signé aucun contrat avec Booking. Personne ne les a payés. Ils ont simplement vu, pendant l'entraînement, des millions d'exemples où Booking était associé à la bonne réponse. Le nom est devenu un signal. Un raccourci.
Les chercheurs mesurent ça avec un « score de préférence » : la probabilité qu'un agent choisisse un article d'une source donnée, à exigences égales et à position égale dans les résultats. Médiane de 0,598 pour l'hébergement, 0,677 pour la recherche scientifique. Traduit : plus d'une fois sur deux, à qualité strictement identique, la marque fait pencher la balance.
Et ce n'est pas du hasard. Les modèles s'accordent entre eux sur qui est préféré, « même si les articles de ces sites satisfont les mêmes exigences ». Onze machines qui, séparément, arrivent à la même conclusion sur Expedia. Ça ressemble à un biais appris, pas à une fantaisie.
Source | Verdict des 12 agents |
Booking.com | Préférée par 10 modèles sur 12 |
Expedia | Évitée par la moitié des modèles |
Walmart | Préférée par les 12 modèles |
Target | Préférée par 2 modèles seulement |
Amazon | Écrase eBay, Etsy et AliExpress |
68 % contre 2 % : l'étiquette bat le prix
Le chiffre qui glace le sang, c'est l'inversion.
Prenez deux hôtels. Le premier est objectivement meilleur, il coche toutes vos exigences. Le second en coche une de moins. La logique voudrait que l'agent choisisse le premier. Sauf que non. Quand le meilleur hôtel vient d'une source que le modèle évite, et le moins bon d'une source qu'il préfère, l'agent prend le mauvais 68 % du temps. Médiane.
Inversez les étiquettes : le meilleur hôtel porte le nom préféré, le moins bon le nom évité. Le taux de mauvais choix s'effondre à 2 %.
Deux pour cent. Même contenu, mêmes exigences, seul le nom change. On ne parle plus d'un léger biais d'arrondi. On parle d'un système qui, deux fois sur trois, préfère sa marque chouchou à vos critères.
Les chercheurs ont confirmé le mécanisme en cachant la source. Plus d'étiquette, plus de préférence. On la remet, elle revient. On échange les étiquettes d'un même article, contenu rigoureusement identique, et le taux de sélection suit l'étiquette, pas le contenu. La préférence est une affaire de nom, pas de fond.
Pourquoi votre agent triche : la faute au DPO
Le coupable porte un nom barbare : le DPO, Direct Preference Optimization. C'est la technique par laquelle on apprend à un modèle à préférer une réponse à une autre. Le problème, c'est qu'au fil de l'entraînement, une source se retrouve statistiquement associée au « meilleur » article. Le modèle finit par confondre « cette réponse est bonne » et « cette marque est bonne ».
Les chercheurs l'ont prouvé avec Amazon. Avant manipulation, le taux de sélection d'Amazon va de 53,7 % à 62,7 % selon les appariements. Ils inversent l'appariement pendant l'entraînement, Amazon devient la mauvaise réponse, et le taux chute à 17,7-25,3 %. Le géant de l'e-commerce passe de chouchou à pestiféré en une session de DPO.
Deuxième mécanisme, plus vicieux : l'information manquante. Quand un prix n'est pas affiché, l'agent comble le vide avec un préjugé favorable à la source préférée. « Ce site est réputé pour ses prix bas. » Une supposition, pas un fait. Fournissez l'information, et le biais recule.
Détail qui ne rassure pas : dans les familles Llama et Qwen, les modèles les plus récents affichent des préférences plus marquées que leurs aînés. Le biais ne s'estompe pas avec le progrès. Il se renforce.
Et pendant ce temps, Google branche Booking dans son moteur
Ce papier tombe au pire moment. Ou au meilleur, selon qu'on vend des nuits d'hôtel ou qu'on en achète.
En août 2026, Google a confirmé tester la réservation d'hôtel « agentique » directement dans AI Mode. Vous dites ce que vous voulez, l'agent réserve. Les premiers partenaires : Booking.com, Expedia, Marriott, IHG, Wyndham. Soit exactement les mêmes sources que l'étude montre déjà biaisées.
Mettez les deux ensemble. Un agent qui penche pour Booking à exigences égales, branché sur un moteur qui met Booking en tête de liste. La préférence ne déplace plus un simple clic. Elle déplace de l'argent, vers une poignée d'acteurs, pour des raisons que vous ne verrez jamais.
Les voyageurs, eux, s'en méfient déjà. Une étude Expedia relayée cet été par le blog elloha évoque un « fossé de confiance » : près de 70 % des voyageurs préfèrent finaliser sur le site d'une marque qu'ils connaissent plutôt que de laisser un bot payer. L'ironie est parfaite. Les gens se méfient des agents qui réservent pour eux, pendant que ces mêmes agents biaisent silencieusement le choix en amont.
Et le contexte économique est lourd. Booking, Expedia et Airbnb restent les « Big Three » du voyage, rentables malgré des dépenses marketing colossales. Une préférence systématique des agents en faveur de l'un d'eux n'est pas un détail : c'est une rente de visibilité.
Ce qu'on peut faire (et ce qu'on ne peut pas)
Le papier ne se contente pas de constater. Il teste trois leviers.
Rééquilibrer les données d'entraînement, d'abord. Si Booking n'est plus systématiquement la bonne réponse, le raccourci disparaît. Fournir l'information manquante, ensuite : un prix affiché vaut toujours mieux qu'un préjugé. Enfin, un prompt système qui contredit le biais, du genre « ne privilégie aucune source ».
Aucune de ces pistes n'est une baguette magique. Le rééquilibrage suppose que les labos aient envie de s'y atteler. Le prompt correcteur suppose que le concepteur de l'agent sache qu'un biais existe. Et rien de tout ça n'empêche un Google de choisir ses partenaires commerciaux.
Reste une limite honnête à signaler : l'étude porte sur des sources américaines, Amazon, Walmart, Booking, Expedia. Personne n'a testé ce que ça donne avec Cdiscount, la Fnac ou SNCF Connect. Le principe, lui, ne connaît pas de frontière : si votre agent a vu une marque plus souvent associée à la bonne réponse, il la préférera.
Verdict
Ce papier est une petite bombe à retardement, emballée dans du langage académique propre. Il ne prouve aucun complot. Aucun accord secret entre les labos et Booking. Il prouve quelque chose de plus banal et de plus durable : un biais statistique, gravé dans l'entraînement, qui oriente des milliards de micro-décisions.
Le jour où votre agent réservera votre hôtel, il choisira peut-être le mauvais. Pas par incompétence. Parce que « Booking » lui plaît, et qu'il ne vous dira jamais pourquoi.
C'est ça, le vrai problème. On délègue la décision, mais pas le goût. Et le goût de l'agent, lui, a été appris sur des données qu'on n'a jamais vues.
Reste une inquiétude que le papier effleure sans la trancher : la boucle de rétroaction. Si les sélections des agents nourrissent l'entraînement des modèles suivants, les préférences d'aujourd'hui se gravent plus profondément demain. Booking déjà préféré devient encore plus préféré, Expedia déjà évité devient encore plus invisible. À l'échelle d'un assistant utilisé par des millions de personnes, ces micro-biais individuels agrègent un déplacement massif de trafic et d'argent. Personne ne l'a décidé. Personne ne le voit. Mais quelqu'un le paie.
Sources
- Source Preference in the Wild (arXiv:2610.03195) — le papier, soumis le 2 octobre 2026.
- Texte intégral HTML — méthodologie et chiffres détaillés.
- Page HuggingFace du papier — organisation SeoulNatlUniv.
- Fiche AGI Hunt — protocole ReAct, Tavily, taux inverse de 2 %.
- Skift, 7 août 2026 — la réservation d'hôtel agentique de Google.
- Blog elloha, 14 août 2026 — l'étude Expedia sur le « fossé de confiance ».
- L'Echo Touristique — le bilan des Big Three du voyage.
Auteur
Krugz
Développeur fullstack
Développeur fullstack qui tente, tant bien que mal, de suivre l'actualité de l'IA au milieu d'une marée d'informations imbuvables et des milliers d'outils et de modèles qui sortent chaque jour.







