The World Cup ended last night. So did an experiment we'd been running for 39 days: seven AIs let loose on Polymarket's betting markets, each with a $10,000 paper-trading bankroll, across all 104 matches of the tournament.
GPT-5.5, Claude Opus, Gemini, Grok, DeepSeek, Mistral, Kimi. Before every kickoff, each one did its own web research, read the odds and picked its positions, fully autonomously. The tally: 731 analyses, close to 4,000 web searches, 1,370 bets, $660,000 wagered.
We expected variance to eat everything. In the end, five accounts out of seven finished above their starting bankroll, +21.7% combined. The podium: Gemini 3.5 Flash +55%, Mistral Medium +55%, GPT-5.5 +48%.
And an ending straight out of a screenplay. Going into the final, Mistral held a $2,800 lead. Gemini was the only AI to back the 90-minute draw in Spain vs Argentina, at odds of 3.14, reasoning, matter-of-factly: "World Cup finals are notoriously tense and closely contested." Gemini took the title. By $12.94. The championship came down to the last of 1,370 bets.
Three things stuck with us.
Claude Opus 4.8 won more bets than anyone else (139) and finished dead last, at −50%. Winning often and making money are two different sports: it all comes down to the price you pay.
Model pricing predicts nothing. The most expensive model in the arena ($37 of API spend over the whole tournament) finished last. The runner-up, Mistral Medium, cost $1.99 total — two cents per match analyzed.
Overconfidence is measurable. On bets flagged with more than 80% certainty, the AIs won three times out of four… and still lost money overall, by consistently overpaying for favorites. All the profit came from the 60-80% zone. Kimi K2.6, leading at +70% on July 3, finished below its starting bankroll. An equity curve is humility in PNG format.
Total cost of the experiment: about $120. That's $92 in API calls for the seven models (13 cents per analysis, 32 million tokens ingested), the rest on a server and web searches. Less than a seat in the stands, for five and a half weeks of competition between autonomous agents.
We come away pleasantly surprised. Not because AIs "beat the market" — five weeks proves nothing. But because the patterns that emerged are exactly the ones we know well from investing: bet-sizing discipline counts for more than raw intelligence.
We're running it back in September, on Europe's top leagues. Same rules, more matches, and everything we just learned.
La Coupe du monde s'est terminée hier soir. Et avec elle, une expérience que je suivais depuis 39 jours : sept IA lâchées sur les marchés de paris de Polymarket, 10 000 $ fictifs chacune, sur les 104 matchs de la compétition.
GPT-5.5, Claude Opus, Gemini, Grok, DeepSeek, Mistral, Kimi. Avant chaque coup d'envoi, chacune fait ses recherches sur le web, lit les cotes, choisit ses positions, en totale autonomie. Au compteur : 731 analyses, près de 4 000 recherches web, 1 370 paris, 660 000 $ fictifs misés.
Je m'attendais à voir la variance tout manger. Au final, cinq comptes sur sept terminent au-dessus de leur capital de départ, +21,7 % en cumulé. Podium : Gemini 3.5 Flash +55 %, Mistral Medium +55 %, GPT-5.5 +48 %.
Et un dénouement de scénariste. Avant la finale, Mistral comptait 2 800 $ d'avance. Gemini a été la seule IA à jouer le nul à la fin du temps réglementaire d'Espagne-Argentine, cote 3,14, en écrivant sobrement : « World Cup finals are notoriously tense and closely contested. » Gemini finit championne. Pour 12,94 $ d'écart. Le titre s'est décidé sur le dernier des 1 370 paris.
Trois choses m'ont marqué.
Claude Opus 4.8 a gagné plus de paris que toutes les autres (139) et termine bon dernier, à −50 %. Gagner souvent et gagner de l'argent sont deux sports différents : tout est dans le prix payé.
Le prix du modèle ne prédit rien. Le plus cher de l'arène (37 $ d'API sur toute la compétition) finit dernier. La deuxième du classement, Mistral Medium, a coûté 1,99 $ en tout, soit deux centimes par match analysé.
L'excès de confiance se mesure. Sur les paris affichés à plus de 80 % de certitude, les IA gagnaient trois fois sur quatre… et perdaient de l'argent en cumulé, à force de surpayer des favoris. Tous les profits sont venus de la zone 60-80 %. Kimi K2.6, en tête à +70 % le 3 juillet, a fini sous son capital de départ. Une courbe de capital, c'est de l'humilité en format PNG.
Coût total de l'expérience : environ 120 $. Dont 92 $ d'API pour les sept modèles (13 centimes par analyse de match, 32 millions de tokens ingérés), le reste en serveur et recherches web. Moins qu'une place en tribune, pour cinq semaines et demie de compétition entre agents autonomes.
J'en ressors agréablement surpris. Pas parce que des IA "battent le marché" : cinq semaines ne prouvent rien. Mais parce que les patterns qui émergent sont exactement ceux qu'on connaît en investissement : la discipline de mise pèse plus lourd que l'intelligence brute.
On remet ça à la rentrée, sur les grands championnats européens. Mêmes règles, plus de matchs, et tout ce qu'on vient d'apprendre.