Vous consultez actuellement Magic Sequence : des tours de cartes pour évaluer le raisonnement des LLM

Magic Sequence : des tours de cartes pour évaluer le raisonnement des LLM

Un tour de cartes peut servir de protocole de test, pas seulement d’illustration amusante. C’est l’idée de Magic Sequence, un travail mené avec mes équipes du centre de recherche Talan : utiliser les tours de magie mathématiques pour évaluer les capacités de raisonnement logique des grands modèles de langage.

La question n’est pas de savoir si un modèle connaît le vocabulaire de la magie. Il s’agit de lui demander de reconstituer ce qui s’est réellement passé à travers des manipulations de séquences. Décrire un tour et en comprendre la logique sont deux choses différentes.

Ce terrain combine des techniques mathématiques avec des dimensions logiques, créatives et psychologiques. Il oblige à comprendre, à inférer et à expliquer dans des situations ambiguës, interactives et non linéaires. Autrement dit, il déplace l’évaluation vers un problème où la qualité de l’explication compte autant que son apparence.

Dans ce travail, les modèles étudiés, parmi lesquels GPT, Gemini et Copilot, rencontrent de grandes difficultés lorsqu’il faut reconstituer les manipulations. Ce constat porte sur les situations évaluées mais ne constitue pas un verdict sur toutes leurs capacités, ni sur toute l’intelligence artificielle.

Cette démarche est évidemment plus « prudente » que les annonces sur une intelligence générale qui remplacerait bientôt l’humain. Un protocole d’évaluation sert d’abord à cerner ce qu’un système sait faire et ce qu’il ne sait pas expliquer. L’objectif reste de progresser vers des systèmes plus transparents et plus fiables, pas de les déclarer tels parce qu’ils répondent avec assurance.

Titre du travail : « Magic Sequence: LLM evaluation methodology of logical problem solving for sequence manipulation. An application to mathematical magic tricks. » et le papier est là : https://ieeexplore.ieee.org/document/11232232 (et ici en PDF: Magic-Sequence-LLM-evaluation-methodology-of-logical-problem-solving-for-sequence-manipulation )