Zenn·IA · Découverte · Ouverture

Ce que l'IA sait faire.

Huit capacités, vues du dehors — sans jargon, sans promesse. Chaque chiffre de ce module porte sa source et sa date : vous pouvez tous les rouvrir vous-même.

Découverte · aucun prérequis ~25 min
Le contrat de ce module

On ne vous demande pas d'y croire. On vous montre où regarder.

Pas de démonstration maison, pas de capture retouchée : des benchmarks et des études indépendantes, chacun daté, chacun vérifiable. C'est la règle de tout l'axe Découverte — une preuve vaut mieux qu'une promesse.

Benchmark — un test standardisé qui permet de comparer plusieurs modèles entre eux, sur exactement les mêmes questions.
Hallucination — quand un modèle invente un fait, une source ou une citation qui n'existe pas, avec le même aplomb qu'une information vraie.
Modèle multimodal — un modèle qui traite plusieurs types d'entrée (texte, image, son), pas seulement du texte.

Pourquoi huit capacités ? Parce que c'est ce que l'IA sait faire aujourd'hui, mesuré — pas ce qu'elle promet de faire demain. Huit preuves, huit organismes différents (Vectara, un consortium académique, OpenAI, deux universités indépendantes, METR, un consortium sécurité IA, l'Université de Zurich, Google Research) : aucune ne parle deux fois du même laboratoire.

La carte du module

Huit choses qu'une IA sait faire. Vues du dehors.

01

✍️ Écrire & résumer

Rédiger, reformuler, condenser un document de 40 pages en une page.

02

🖼️ Comprendre une image

Décrire une photo, lire un graphique, repérer un détail précis.

03

🎧 Écouter & parler

Transcrire une réunion, répondre à voix haute, cloner une voix.

04

🎨 Générer une image ou une vidéo

À partir d'une simple description écrite, le prompt.

05

📄 Chercher dans des documents

Retrouver une clause ou un chiffre en secondes, sans se tromper de dossier. → annoncée, pas encore prouvée ici

06

📈 Prévoir

Anticiper une demande, une panne, un flux. → creusé secteur par secteur, plus loin

07

💻 Coder

Écrire un programme à partir d'une consigne en langage courant.

08

🤖 Agir seule

Enchaîner plusieurs étapes sans supervision à chaque clic.

Les pages qui suivent creusent six de ces huit capacités, chacune avec une preuve chiffrée et sourcée — plus une septième preuve sur le coût et la vitesse face à des humains, et une huitième sur le raisonnement d'expert (à format d'examen, pas en pratique clinique réelle). Deux capacités (05 et 06) n'ont pas de chiffre indépendant dans ce module : elles sont réelles, elles ne sont pas prouvées ici — et la page suivante le dit plutôt que de le passer sous silence.

Ce que ce module ne prouve pas (encore)

Deux capacités réelles. Sans preuve chiffrée ici.

La règle de cet axe : on ne montre que ce qu'une source indépendante a mesuré. Pour deux capacités du panorama, aucune étude publique, datée et indépendante n'a encore été réunie pour ce module — les afficher quand même avec un chiffre serait exactement la promesse commerciale que ce module cherche à éviter.

05

📄 Chercher dans des documents

La capacité existe et tourne déjà en entreprise (on l'appelle le RAG, recherche dans une base de connaissances). Elle est annoncée dans ce panorama, pas encore démontrée par une preuve chiffrée dans ce module.

06

📈 Prévoir

Traité secteur par secteur, plus loin dans ce parcours, là où un chiffre de prévision a du sens rapporté à un métier précis — pas comme capacité générique isolée.

Une preuve manquante est nommée, jamais remplacée par une impression. C'est la même exigence qui porte les six preuves qui suivent.

Capacité 1 · écrire & résumer

3,3 % d'erreur. Sur des documents réels.

3,3 % d'hallucination (meilleur score)
Le classement Vectara fait résumer aux modèles plus de 7 700 articles réels (technologie, finance, droit, médecine, science…) puis fait noter chaque résumé par un modèle-juge dédié : un résumé qui invente un fait absent du document source compte comme « halluciné ». Sur la version durcie du test (nov. 2025), le meilleur modèle mesuré ne se trompe que dans 3,3 % des résumés produits.
3,3 % est le meilleur score du classement, pas la moyenne des modèles testés. Le test a été durci en 2025 (articles jusqu'à 32 000 tokens) : les scores d'avant et d'après ne se comparent pas.
vectara.com/blog/…hallucination-leaderboard
Article Vectara du 19 novembre 2025 annonçant la nouvelle génération du classement d'hallucination des modèles IA
3,3 % est le meilleur score du classement (Gemini-2.5-flash-lite), pas la moyenne — Vectara a délibérément durci son test en 2025 après avoir constaté que l'ancienne version était devenue trop facile.
Capture de vectara.com réalisée le 05/08/2026 · Vectara
Capacité 2 · comprendre une image

De 56 % à 86 %. En trois ans.

MMMU teste la compréhension d'image et le raisonnement, sur des questions de niveau universitaire — 30 matières, de la médecine à l'ingénierie.

56 %
GPT-4V, à la création du test
nov. 2023
86,0 %
meilleur modèle mesuré
05/08/2026
76,2-88,6 %
repère des experts humains
selon la discipline
56 % (2023) → 86,0 % (2026)
MMMU teste la compréhension d'image ET le raisonnement sur des questions de niveau universitaire, dans 30 matières (médecine, ingénierie, art, droit…). À sa création, le meilleur modèle testé (GPT-4V) obtenait 56 % de bonnes réponses, quand les experts humains plafonnaient entre 76,2 % et 88,6 % selon leur discipline. Le 5 août 2026, le meilleur modèle mesuré sur ce même protocole atteint 86,0 % — dans la fourchette des meilleurs experts humains.
Deux chiffres de nature différente. Les 56 % de 2023 et le repère humain viennent de l'étude fondatrice : ils ne bougeront plus. Le 86,0 % est un relevé du classement public au 5 août 2026, et il change chaque mois.
Capacité 3 · écouter (et parler)

680 000 heures d'audio. Zéro réglage manuel.

680 000 h d'audio — précision proche de l'humain
Le modèle de transcription Whisper a été entraîné sur 680 000 heures d'audio multilingue glané sur le web, sans réglage spécifique par langue ni par tâche (« zero-shot »). Ses auteurs concluent, dans l'article de recherche original : « comparés à des humains, les modèles approchent leur précision et leur robustesse » — y compris sur de l'audio difficile (accents, bruit de fond, vocabulaire technique), là où les systèmes précédents décrochaient.
Ce chiffre porte sur l'écoute — transcrire. Le sens inverse, faire parler et cloner une voix, est tout aussi mûr aujourd'hui, mais n'a pas sa preuve chiffrée dans ce module.
Capacité 4 · générer une image ou une vidéo

Pire qu'à pile ou face. Et jugées plus dignes de confiance.

48,2 % de bonnes réponses (pire qu'à pile ou face)
Dans une étude à trois expériences (315, 219 puis 223 participants), des chercheurs de Lancaster University et UC Berkeley ont demandé de distinguer 400 vrais visages de 400 visages synthétisés par IA. Résultat : 48,2 % de bonnes réponses en moyenne — pire qu'un pile ou face — et les visages synthétiques ont même été jugés plus dignes de confiance (4,82/7) que les vrais (4,48/7).
Étude de 2022, sur des visages fixes. Une réplication de février 2026 (British Journal of Psychology) retrouve le même résultat quatre ans plus tard : la population générale reste à peine au-dessus du hasard.
48,2 %
de bonnes réponses (315 participants)
pire que le hasard
4,48/7
confiance accordée aux vrais visages
223 participants
4,82/7
confiance accordée aux visages IA
plus élevée que les vrais
⚠️ Erreur fréquente

Croire qu'on peut repérer une image générée à l'œil nu. → Même les professionnels s'y trompent, à peine mieux que le hasard (voir la note ci-dessus) — et l'étude date d'avant les modèles par diffusion actuels, qui n'ont fait qu'améliorer le réalisme.

Capacités 7 & 8 · coder, agir seule

320 minutes en autonomie. Et ça double tous les 3 mois.

320 min de tâche autonome — doublement tous les ~89 jours
METR mesure, pour chaque modèle, la durée d'une tâche réelle d'ingénierie logicielle qu'il sait mener seul avec 50 % de fiabilité — le « time horizon », chronométré par le temps qu'un humain expérimenté mettrait à la résoudre. Au 29 janvier 2026 (protocole TH1.1), le modèle le plus capable mesuré (Claude Opus 4.5) tient 320 minutes (environ 5h20, intervalle 170-729 min) sans supervision. Cette durée double désormais tous les 89 jours environ, contre 7 mois de 2019 à 2023 — une accélération, pas une simple continuation.
METR est un organisme de recherche indépendant sur la sécurité de l'IA, pas un éditeur de modèles : le même protocole est appliqué à tous les modèles testés.
metr.org/blog/2026-1-29-time-horizon-1-1
Article METR Time Horizon 1.1 sur la durée de tâche autonome que l'IA sait mener seule
METR est un organisme de recherche indépendant sur la sécurité de l'IA, pas un éditeur de modèles : même protocole pour tous les modèles testés.
Capture de metr.org réalisée le 05/08/2026 · METR
La limite honnête

~50 %. Sur un test fait pour résister.

~50 % (meilleur score), contre 90 %+ sur les anciens tests
Humanity's Last Exam a été construit par le Center for AI Safety et Scale AI à partir de 2 500 questions de niveau expert, dans des dizaines de matières (mathématiques, sciences, lettres…) — spécifiquement pour succéder aux benchmarks précédents, où l'IA dépasse aujourd'hui 90 % (comme MMLU). L'étude, publiée dans Nature le 29 janvier 2026, conclut que même les meilleurs modèles restent à faible précision et mal calibrés sur ce test : un écart net demeure face au niveau d'un expert humain. Sur le classement public (consulté le 5 août 2026), le modèle le plus avancé mesuré plafonne autour de 50-52 %.
Classement vivant : le score plafond monte à mesure que de nouveaux modèles sont testés. Le chiffre à retenir n'est pas le pourcentage exact, c'est l'écart qui subsiste avec les anciens tests, aujourd'hui saturés au-delà de 90 %.
agi.safe.ai
Page officielle de Humanity's Last Exam et son classement des modèles IA
Classement vivant : le score plafond monte chaque semaine à mesure que de nouveaux modèles sont testés. Ce qui compte n'est pas le chiffre du jour, mais l'écart qui reste avec la quasi-totalité des anciens tests, aujourd'hui saturés au-delà de 90 %.
Capture de agi.safe.ai réalisée le 05/08/2026 · Center for AI Safety & Scale AI
Capacité 1, sous un autre angle · le coût face à des humains

Moins de 0,003 $ l'annotation. Et souvent plus fiable.

Les six preuves précédentes comparent des scores. Celle-ci compare un budget — l'angle qui parle le plus à une PME, qui pense en heures et en euros, pas en points de benchmark.

< 0,003 $/annotation, ~20x moins cher que MTurk ; meilleur sur 4 tâches/5
Sur un échantillon de 2 382 tweets, ChatGPT dépasse en précision les crowd-workers (MTurk) sur quatre tâches d'annotation de texte sur cinq (pertinence, position, thème, cadrage), et son accord inter-codeur dépasse celui des crowd-workers ET des annotateurs formés sur les cinq tâches — pour un coût par annotation inférieur à 0,003 $, environ vingt fois moins cher que MTurk.
Chiffres du preprint : 2 382 tweets, 4 tâches sur 5. La version publiée ensuite dans PNAS porte sur un échantillon plus large et donne un écart plus favorable — ce module retient volontairement le chiffre le plus prudent.
Capacité 1, sous un troisième angle · raisonner sur des questions d'expert

86,5 % sur l'examen médical américain. +19 points en une génération.

Med-PaLM 2, développé par Google Research — la première preuve de ce module à venir de ce laboratoire — combine un meilleur modèle de base, un réglage fin sur des données médicales et de nouvelles stratégies de raisonnement.

86,5 % sur MedQA (USMLE), +19 points vs Med-PaLM (67,2 %)
Med-PaLM 2, développé par Google Research, combine un meilleur modèle de base, un réglage fin sur des données médicales et de nouvelles stratégies de raisonnement (ensemble refinement, chain of retrieval). Sur MedQA, jeu de questions au format de l'examen de licence médicale américain (USMLE), il atteint 86,5 % de bonnes réponses, contre 67,2 % pour son prédécesseur direct Med-PaLM — un gain de plus de 19 points. Des médecins ont aussi préféré ses réponses longues à celles d'autres médecins sur huit des neuf axes cliniques évalués.
Score obtenu sur MedQA, un questionnaire au format de l'examen de licence médicale américain : c'est un examen écrit, pas une pratique clinique.
⚠️ Erreur fréquente

Confondre un score d'examen et une compétence clinique. → Répondre juste à un QCM de licence médicale (MedQA, format de l'USMLE américain) n'est pas soigner un patient : le format reste celui d'un examen écrit, pas d'une pratique clinique réelle avec son incertitude, son contexte et ses conséquences.

Huitième capacité mesurée de ce module, et huitième organisme distinct : aucune des huit preuves ne vient du même laboratoire qu'une autre.

Ce que ça change pour vous

Huit capacités réelles. Aucune sans limite.

🎬 Imaginez-vous…

Votre comptable reçoit un appel : la voix de la dirigeante, parfaitement reconnaissable, demande un virement urgent vers un nouveau compte. Quelques secondes d'audio public suffisent aujourd'hui à cloner une voix — et vous venez de voir que 48,2 % de réussite pour repérer un faux, c'est pire que pile ou face.

Le réflexe qui protège ne dépend jamais d'une seule capacité (l'œil, l'oreille) : c'est une procédure — un rappel sur un numéro déjà connu, un code convenu à l'avance. Les huit capacités de ce module sont réelles ; six sont mesurées ici, deux sont nommées sans être encore prouvées — c'est justement pour ça qu'elles s'encadrent, pas qu'on les ignore.

À emporter

Trois choses à retenir avant de continuer.

  • 1Les six premières capacités sont mesurées — chacune a aussi une limite documentée, pas une rumeur. Deux autres (chercher dans des documents, prévoir) sont réelles mais pas encore chiffrées ici.
  • 2Le meilleur score d'un classement n'est jamais la moyenne, et le chiffre le plus impressionnant n'est pas toujours celui qu'on peut vérifier soi-même : ça vous engage à vérifier, pas à faire confiance par défaut.
  • 3Ce module montre ce que l'IA fait. Le comment ça marche et le comment bien formuler une demande viennent juste après.
Toutes les sources de ce module

Huit preuves. Rouvrez-les.

FaitDateSourceVérifié le
Hallucination sur résumé de documentsnov. 2025Vectara — Hallucination Leaderboard05/08/2026
Compréhension d'image (MMMU)nov. 2023Yue et al., arXiv 2311.16502 · score 2026 = lecture du classement llm-stats.com05/08/2026
Transcription audio (Whisper)déc. 2022Radford et al. (OpenAI), arXiv 2212.0435605/08/2026
Visages générés par IAfév. 2022Nightingale & Farid, PNAS 119(8)05/08/2026
Durée de tâche autonome (agents)29/01/2026METR — Time Horizon 1.105/08/2026
Plafond expert (Humanity's Last Exam)29/01/2026Nature 649, p. 1139-1146 · agi.safe.ai05/08/2026
Coût & fiabilité d'annotation vs humainsjuil. 2023Gilardi, Alizadeh & Kubli (Univ. de Zurich), PNAS 120(30) · preprint arXiv:2303.1505613/08/2026
Raisonnement médical d'expert (MedQA/USMLE)janv. 2025Singhal et al. (Google Research), Nature Medicine · preprint arXiv:2305.0961714/08/2026

Huit preuves, huit organismes distincts — aucune ne recoupe une autre. Trois d'entre elles sont reproduites en capture d'écran plus haut (Vectara, METR, HLE) ; les cinq autres n'ont pas d'image, mais toutes portent leur lien. Rouvrez-les.

Suite du parcours : Secteur par secteur →
Zenn·IA
← → pour naviguer