Les AIS s’améliorent en matière de problèmes mathématiques
Images Andresr / Getty
Les modèles expérimentaux d’IA de Google Deepmind et OpenAI ont obtenu une performance au niveau de l’or dans l’Olympiade mathématique internationale (IMO) pour la première fois.
Les entreprises saluent le moment comme une étape importante pour les AIS qui pourraient un jour résoudre des problèmes scientifiques ou mathématiques durs, mais les mathématiciens sont plus prudents parce que les détails des résultats des modèles et la façon dont elles travaillent n’ont pas été rendus publics.
L’OMI, l’une des compétitions les plus prestigieuses du monde pour les jeunes mathématiciens, a longtemps été considérée par les chercheurs d’IA comme un test décisif pour le raisonnement mathématique avec lequel les systèmes d’IA ont tendance à lutter.
Après la concurrence de l’année dernière à Bath, au Royaume-Uni, Google Deepmindann a été que les systèmes d’IA qu’il avait développés, appelés alphaproof et alphageométrie, avaient ensemble a atteint une performance au niveau de la médaille d’argent, Mais ses entrées n’ont pas été notées par les marqueurs officiels de la compétition.
Avant le concours de cette année, qui s’est tenu dans le Queensland, en Australie, des entreprises telles que Google, Huawei et Tiktok-Crowner Bytedance, ainsi que des chercheurs universitaires, ont approché les organisateurs pour se demander s’ils pouvaient avoir la performance de leurs modèles d’IA officiellement classé, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement, dit officiellement. Gregor Dolinarle président de l’OMI. L’OMI a convenu, avec la prévoyance que les entreprises ont attendu pour annoncer leurs résultats jusqu’au 28 juillet, lorsque les cérémonies de clôture complètes de l’OMI avaient été terminées.
Openai a également demandé s’il pouvait participer au concours, mais après avoir été informé du programme officiel, il n’a pas répondu ou enregistré une entrée, explique Dolinar.
Le 19 juillet, Openai a annoncé Qu’une nouvelle IA qu’il ait développée ait obtenu un score de médaille d’or marqué par trois anciens médaillés de l’OMI distincts de la compétition officielle. L’IA a répondu correctement cinq questions sur six dans le même délai de 4,5 heures que les candidats, a déclaré Openai.
Deux jours plus tard, Google Deepmind a également annoncé que son système AIappelé Gemini Deep Think, avait atteint l’or avec le même score et les mêmes limites de temps. Dolinar a confirmé que ce résultat avait été donné par les marqueurs officiels de l’OMI.
Contrairement aux systèmes d’alphapof et d’alphageométrie de Google, qui ont été fabriqués en particulier pour la concurrence et ont travaillé avec des questions et réponses écrites dans un langage de programmation informatique appelé Lean, les modèles de Google et d’Openai cette année ont entièrement travaillé en langage naturel.
Travailler dans Lean signifiait que la sortie de l’IA pouvait être instantanément vérifiée pour l’exactitude, mais il est plus difficile pour les non-experts à lire. Luong Luong Chez Google, qui a travaillé sur Gemini Deep Think, dit que l’approche du langage naturel pourrait produire des réponses plus compréhensibles, tout en étant applicables à des systèmes d’IA généralement utiles.
Luong dit que la capacité de vérifier les solutions dans un modèle de langue large a été rendue possible grâce aux progrès avec l’apprentissage du renforcement, une méthode de formation dans laquelle une IA apprend à quoi ressemble le succès et reste pour déterminer les règles et comment réussir uniquement par essais et erreurs. Cette méthode a été la clé du succès précédent de Google avec son AIS à jeu, comme Alphazero.
Le modèle de Google considère également plusieurs solutions à la fois, dans un mode appelé parallèle de pensée, ainsi que d’être formé sur un ensemble de données de problèmes mathématiques spécifiquement utile pour l’OMI, explique Luong.
OpenAI a publié peu de détails sur son système, en dehors de ce qu’il utilise également l’apprentissage du renforcement et les «méthodes de recherche expérimentales».
«Les progrès sont prometteurs, mais pas effectués de manière scientifique contrôlée, et je ne pourrai donc pas l’évaluer à ce stade», explique Terence Tao à l’Université de Californie à Los Angeles. “Peut-être qu’une fois que les entreprises impliquées publient des articles avec plus de données et, espérons-le, un accès suffisant au modèle pour que d’autres reproduisent les résultats, on peut dire quelque chose de plus définitif, mais, pour l’instant, nous devons largement faire confiance aux entreprises elles-mêmes pour les résultats revendiqués.”
Geordie Williamson à l’Université de Sydney en Australie est d’accord. «Je pense qu’il est remarquable que c’est là que nous en sommes.
Bien que les systèmes travaillant dans le langage naturel puissent être utiles pour les non-mathématiciens, il pourrait également présenter un problème si les modèles produisent de longues preuves qui sont difficiles à vérifier, dit Joseph Myersl’un des organisateurs de l’OMI de cette année. «Si jamais, les IS doivent produire des solutions à des problèmes importants non résolus qui pourraient être plausiblement corrects mais qui pourraient également avoir quelques erreurs subtiles mais mortelles cachées accidentellement, ou potentiellement délibérément d’une IA mal alignée, le fait que ces AIS soient également une preuve formelle.
Les deux sociétés disent que, dans les prochains mois, elles offriront au début ces systèmes pour les tests aux mathématiciens avant de les remettre au public plus large. Les modèles pourraient bientôt aider à des problèmes de recherche scientifique plus difficiles, dit Junehyuk Jung à Google, qui a travaillé sur Gemini Deep Think. «Il y aura de nombreux problèmes non résolus à portée de main», dit-il.
Sujets:
