
LES BENCHMARKS SONT CRUCIAUX POUR ÉVALUER LES CAPACITÉS DES MODELES DE LANGUE DE GRANDE ÉCHÉLLE (LLMs) DANS LES TÂCHES DU MONDE RÉEL, MAIS LE DÉVELOPPEMENT ET LA MISE À JOUR DE CES BENCHMARKS SONT À LA FOIS COUTEUX ET TEMS-EFFICACES.
CETTE ÉTUDE EXPLIQUE UNE APPROCHE INNOVANTE EN UTILISANT L’AGENTIQUE AI, OÙ LES LLMS GÉNÈRENT ET ÉVALUENT LES EXAMENS PRACTIQUES POUR DIVERSES OCCUPATIONS, Y COMPRIS CELLES DE LA FINANCE ET DE L’OPÉRATION DES AFFAIRES, DE LA GESTION ET DE L’INFORMATIQUE ET DES MATHÉMATIQUES.
L’APPROCHE DE L’AGENTIQUE AI CONSISTE À DÉFINIR LA DISTINCTION ENTRE LES MATÉRIELS NÉCESSAIRES POUR LES TÂCHES (COMME LE TEXTE, LES DONNÉES ET LES IMAGES) ET LES OUTILS REQUIS POUR LES RÉSOLVER (COMME L’APPEL FONCTIONNEL OU LA RECHERCHE SUR INTERNET). EN FOCALISANT SUR LES TÂCHES DE TEXTE SEULLES QUI NE REQUIÈRENT PAS L’UTILISATION D’OUTILS, L’ÉTUDE A TROUVÉ QUE SEULEMENT 7% (149 TÂCHES) DE CES OCCUPATIONS SONT ACTUELLEMENT TESTABLES À L’AIDE DE CE MÉTHODE. CE LIMITE DÉMONTRÉE HONORE LA NÉCESSITÉ DE FURTHER DÉVELOPPEMENT DANS LES MÉTHODOLOGIES DE BENCHMARKING QUI PEUVENT ACCOMPAGNER UNE GAMME PLUS LARGE DE TÂCHES.
TREIZE MODÈLES DIFFÉRENTS, Y COMPRIS DES VARIANTES DE GPT, CLAUDE ET GEMINI, ONT ÉTÉ DÉPLOYÉS POUR COMPLÉTER CES EXAMENS SYNTHÉTIQUES.
LES RÉSULTATS ONT MONTRÉ QUE MÊME SUR LES TÂCHES DE BASE, LES LLM ACTUELS CONFRONTENT DES CHALLENGES SIGNIFICATIVES. LES MODÈLES DE TÊTE ONT RÉALISÉ DES SCORES MÉDIENS ALLANT DE 65% À 79%, AVEC UNE PERFORMANCE PARTICULIÈREMENT FAIBLE DANS LA MANIPULATION DES DONNÉES ET LES CALCULS FINANCIERS. CECI INDIQUE QUE MÊME SI LES LLM ONT FAIT DES PROGRÈS, IL Y A TOUT DE MÊME UN ÉCART SUBSTANTIEL DANS LEUR CAPACITÉ À GÉRER LES TÂCHES COMPLEXES, REELLES ET PRÉCISES.
L’ÉTUDE A NOTÉ ÉGALEMENT UNE IMPROVATION RAPIDE DANS LA PERFORMANCE DES LLM AU FIL DU TEMPS. LES MODÈLES DÉPLOYÉS EN 2024 ONT RÉALISÉ UN SCORE MÉDIEN DE 40,5%, ALORS QUE CEUX DÉPLOYÉS EN 2025 ONT RÉALISÉ UN SCORE MÉDIEN DE 66%, CE QUI ÉQUIVAIT À UN GAIN DE 26 POINTS DE POURCENTAGE EN UN AN SEUL. CECI SUGGÈRE QUE LES LLM SONT DEVENANT PLUS CAPABLES À UN TAUX PLUS RAPIDE, MAIS IL Y A TOUT DE MÊME UNE TRAVAILLE CONSIDÉRABLE À FAIRE POUR VALIDER CES BENCHMARKS ET LES ÉTENDRE À L’INCLUSION DE L’UTILISATION D’OUTILS.
L’APPROCHE DE L’AGENTIQUE AI OFFRE UNE SOLUTION PROMETTEUSE POUR LA CRÉATION DE BENCHMARKS CÔTÉS-ÉFFECTIFS, ÉCHÉLÉS ET MISES À JOUR POUR ÉVALUER LES CAPACITÉS D’AI DANS LES ENVIRONNEMENTS DE TRAVAIL.
EN ÉTENDANT LE « LLM-EN-JUGE » À L’ÉVALUATION DES TÂCHES OCCUPATIONNELLES, CE MÉTHODE PEUT Fournir UN MODEL PLUS DYNAMIQUE ET ADAPTATIF POUR ÉVALUER LA PERFORMANCE DES LLM DANS DIVERSES ENVIRONNEMENTS PROFESSIONNELS. MAIS IL Y A TOUT DE MÊME UNE RECHERCHE FURTHER À FAIRE POUR VALIDER CES BENCHMARKS ET DÉVELOPPER DES MÉTHODES QUI PEUVENT ÉVALUER LES TÂCHES REQUIRANT L’UTILISATION D’OUTILS, CE QUI PERMETTRA D’ÉTENDRE LA PORTÉE DES OCCUPATIONS TESTABLES AU DELÀ DES LIMITES ACTUELLES DE TEXTE SEUL.
LE DÉVELOPPEMENT DE BENCHMARKS GÉNÉRÉS PAR LES LLMS TIENT UN POTENTIEL SIGNIFICATIF POUR L’AVENIR DE L’ÉVALUATION D’AI.
EN CONTINUANT À ÉVOLUER, LA CAPACITÉ À GÉNÉRER ET À ÉVALUER AUTOMATIQUEMENT LES EXAMENS PRACTIQUES PEUT AMÉLIORER LE PROCESSUS DE BENCHMARKING, LE RENDANT PLUS EFFICACE ET RÉACTIF À LA RAPIDE ÉVOLUTION DU LANDSCAPE DES CAPACITÉS D’AI. CE MÉTHODE NON SEUL RÉDUIT LE COÛT ET L’EFFORT REQUIS POUR DÉVELOPPER LES BENCHMARKS, MAIS ELLE S’ASSURE QUE CEUX-CI RESTENT RELEVANTS ET À JOUR AVEC LES DERNIÈRES AVANCÉES DANS LA TECHNOLOGIE D’AI.
EN RÉSUMÉ, L’APPROCHE DE L’AGENTIQUE AI À L’ÉVALUATION DES CAPACITÉS DES LLMS RÉPRESANTE UNE ÉTAPE SIGNIFICATIVE EN DÉVELOPPEMENT DE L’ÉVALUATION D’AI.
EN S’APPUYANT SUR LES LLM POUR GÉNÉRER ET ÉVALUER LES EXAMENS PRACTIQUES, CE MÉTHODE OFFRE UNE SOLUTION ÉCHÉLÉE ET CÔTÉ-ÉFFECTIVE POUR ÉVALUER LA PERFORMANCE D’AI DANS LES TÂCHES DU MONDE RÉEL. MÊME SI IL Y A TOUT DE MÊME DES CHALLENGES À SURMONTER, PÉRIODIQUEMENT DANS LA VALIDATION DES BENCHMARKS ET L’EXTENSION À L’INCLUSION DE L’UTILISATION D’OUTILS, LE BÉNÉFICE POTENTIEL DE CETTE APPROCHE EST SUBSTANTIEL. EN CONTINUANT À ÉVOLUER, LE DÉVELOPPEMENT DE MÉTHODOLOGIES DE BENCHMARKING PLUS SOPHISTIQUES ET ADAPTATIVES SERA CRUCIAL POUR S’ASSURER QUE LES SYSTÈMES D’AI SONT ÉVALUÉS DE MANIÈRE PRÉCISE ET EFFICACE.
