Huit capacités, vues du dehors — sans jargon, sans promesse. Chaque chiffre de ce module porte sa source et sa date : vous pouvez tous les rouvrir vous-même.
Découverte · aucun prérequis ~25 minPas de démonstration maison, pas de capture retouchée : des benchmarks et des études indépendantes, chacun daté, chacun vérifiable. C'est la règle de tout l'axe Découverte — une preuve vaut mieux qu'une promesse.
Pourquoi huit capacités ? Parce que c'est ce que l'IA sait faire aujourd'hui, mesuré — pas ce qu'elle promet de faire demain. Huit preuves, huit organismes différents (Vectara, un consortium académique, OpenAI, deux universités indépendantes, METR, un consortium sécurité IA, l'Université de Zurich, Google Research) : aucune ne parle deux fois du même laboratoire.
Rédiger, reformuler, condenser un document de 40 pages en une page.
Décrire une photo, lire un graphique, repérer un détail précis.
Transcrire une réunion, répondre à voix haute, cloner une voix.
À partir d'une simple description écrite, le prompt.
Retrouver une clause ou un chiffre en secondes, sans se tromper de dossier. → annoncée, pas encore prouvée ici
Anticiper une demande, une panne, un flux. → creusé secteur par secteur, plus loin
Écrire un programme à partir d'une consigne en langage courant.
Enchaîner plusieurs étapes sans supervision à chaque clic.
Les pages qui suivent creusent six de ces huit capacités, chacune avec une preuve chiffrée et sourcée — plus une septième preuve sur le coût et la vitesse face à des humains, et une huitième sur le raisonnement d'expert (à format d'examen, pas en pratique clinique réelle). Deux capacités (05 et 06) n'ont pas de chiffre indépendant dans ce module : elles sont réelles, elles ne sont pas prouvées ici — et la page suivante le dit plutôt que de le passer sous silence.
La règle de cet axe : on ne montre que ce qu'une source indépendante a mesuré. Pour deux capacités du panorama, aucune étude publique, datée et indépendante n'a encore été réunie pour ce module — les afficher quand même avec un chiffre serait exactement la promesse commerciale que ce module cherche à éviter.
La capacité existe et tourne déjà en entreprise (on l'appelle le RAG, recherche dans une base de connaissances). Elle est annoncée dans ce panorama, pas encore démontrée par une preuve chiffrée dans ce module.
Traité secteur par secteur, plus loin dans ce parcours, là où un chiffre de prévision a du sens rapporté à un métier précis — pas comme capacité générique isolée.
Une preuve manquante est nommée, jamais remplacée par une impression. C'est la même exigence qui porte les six preuves qui suivent.
MMMU teste la compréhension d'image et le raisonnement, sur des questions de niveau universitaire — 30 matières, de la médecine à l'ingénierie.
Croire qu'on peut repérer une image générée à l'œil nu. → Même les professionnels s'y trompent, à peine mieux que le hasard (voir la note ci-dessus) — et l'étude date d'avant les modèles par diffusion actuels, qui n'ont fait qu'améliorer le réalisme.
Les six preuves précédentes comparent des scores. Celle-ci compare un budget — l'angle qui parle le plus à une PME, qui pense en heures et en euros, pas en points de benchmark.
Med-PaLM 2, développé par Google Research — la première preuve de ce module à venir de ce laboratoire — combine un meilleur modèle de base, un réglage fin sur des données médicales et de nouvelles stratégies de raisonnement.
Confondre un score d'examen et une compétence clinique. → Répondre juste à un QCM de licence médicale (MedQA, format de l'USMLE américain) n'est pas soigner un patient : le format reste celui d'un examen écrit, pas d'une pratique clinique réelle avec son incertitude, son contexte et ses conséquences.
Huitième capacité mesurée de ce module, et huitième organisme distinct : aucune des huit preuves ne vient du même laboratoire qu'une autre.
Votre comptable reçoit un appel : la voix de la dirigeante, parfaitement reconnaissable, demande un virement urgent vers un nouveau compte. Quelques secondes d'audio public suffisent aujourd'hui à cloner une voix — et vous venez de voir que 48,2 % de réussite pour repérer un faux, c'est pire que pile ou face.
Le réflexe qui protège ne dépend jamais d'une seule capacité (l'œil, l'oreille) : c'est une procédure — un rappel sur un numéro déjà connu, un code convenu à l'avance. Les huit capacités de ce module sont réelles ; six sont mesurées ici, deux sont nommées sans être encore prouvées — c'est justement pour ça qu'elles s'encadrent, pas qu'on les ignore.
| Fait | Date | Source | Vérifié le |
|---|---|---|---|
| Hallucination sur résumé de documents | nov. 2025 | Vectara — Hallucination Leaderboard | 05/08/2026 |
| Compréhension d'image (MMMU) | nov. 2023 | Yue et al., arXiv 2311.16502 · score 2026 = lecture du classement llm-stats.com | 05/08/2026 |
| Transcription audio (Whisper) | déc. 2022 | Radford et al. (OpenAI), arXiv 2212.04356 | 05/08/2026 |
| Visages générés par IA | fév. 2022 | Nightingale & Farid, PNAS 119(8) | 05/08/2026 |
| Durée de tâche autonome (agents) | 29/01/2026 | METR — Time Horizon 1.1 | 05/08/2026 |
| Plafond expert (Humanity's Last Exam) | 29/01/2026 | Nature 649, p. 1139-1146 · agi.safe.ai | 05/08/2026 |
| Coût & fiabilité d'annotation vs humains | juil. 2023 | Gilardi, Alizadeh & Kubli (Univ. de Zurich), PNAS 120(30) · preprint arXiv:2303.15056 | 13/08/2026 |
| Raisonnement médical d'expert (MedQA/USMLE) | janv. 2025 | Singhal et al. (Google Research), Nature Medicine · preprint arXiv:2305.09617 | 14/08/2026 |
Huit preuves, huit organismes distincts — aucune ne recoupe une autre. Trois d'entre elles sont reproduites en capture d'écran plus haut (Vectara, METR, HLE) ; les cinq autres n'ont pas d'image, mais toutes portent leur lien. Rouvrez-les.