La plateforme X (anciennement Twitter) annonce fièrement la sortie de Grok-2, le tout dernier modèle de langage de pointe, conçu pour repousser les limites des capacités de raisonnement et de traitement du langage. Ce lancement inclut deux versions du modèle : Grok-2 et Grok-2 mini. Tous deux sont désormais disponibles en version bêta pour les utilisateurs de X, marquant une avancée significative par rapport à Grok-1.5.

Grok-2 : Des performances de pointe en chat, codage et raisonnement
Grok-2 représente un pas en avant dans le développement des modèles de langage. Avec des capacités de chat, de codage et de raisonnement ultra-avancées, ce modèle est conçu pour répondre aux exigences les plus élevées. Une version préliminaire de Grok-2, testée sous le nom de code "sus-column-r", a surpassé des modèles de renom comme Claude 3.5 Sonnet et GPT-4-Turbo sur le tableau de classement LMSYS, un benchmark compétitif très respecté dans le domaine des modèles de langage.
Outre ses performances exceptionnelles en tant que modèle de langage, Grok-2 se distingue par ses capacités de compréhension en temps réel, intégrant des informations actualisées issues de la plateforme X. Les utilisateurs peuvent s’attendre à une interface redessinée et à de nouvelles fonctionnalités pour une expérience utilisateur encore plus intuitive.
Tableau récapitulatif des benchmarks
| Benchmark | Grok-1.5 | Grok-2 mini | Grok-2 | GPT-4 Turbo* | Claude 3 Opus† | Gemini Pro 1.5 | Llama 3 405B | GPT-4o* | Claude 3.5 Sonnet† |
|---|---|---|---|---|---|---|---|---|---|
| GPQA | 35.9% | 51.0% | 56.0% | 48.0% | 50.4% | 46.2% | 51.1% | 53.6% | 59.6% |
| MMLU | 81.3% | 86.2% | 87.5% | 86.5% | 85.7% | 85.9% | 88.6% | 88.7% | 88.3% |
| MMLU-Pro | 51.0% | 72.0% | 75.5% | 63.7% | 68.5% | 69.0% | 73.3% | 72.6% | 76.1% |
| MATH§ | 50.6% | 73.0% | 76.1% | 72.6% | 60.1% | 67.7% | 73.8% | 76.6% | 71.1% |
| HumanEval¶ | 74.1% | 85.7% | 88.4% | 87.1% | 84.9% | 71.9% | 89.0% | 90.2% | 92.0% |
| MMMU | 53.6% | 63.2% | 66.1% | 63.1% | 59.4% | 62.2% | 64.5% | 69.1% | 68.3% |
| MathVista | 52.8% | 68.1% | 69.0% | 58.1% | 50.5% | 63.9% | — | 63.8% | 67.7% |
| DocVQA | 85.6% | 93.2% | 93.6% | 87.2% | 89.3% | 93.1% | 92.2% | 92.8% | 95.2% |
* GPT-4-Turbo et GPT-4o scores sont basés sur la version de mai 2024.
† Scores Claude 3 Opus et Claude 3.5 Sonnet sont basés sur la version de juin 2024.
‡ Grok-2 MMLU, MMLU-Pro, MMMU et MathVista ont été évalués avec 0-shot CoT.
§ Pour MATH, les résultats présentés sont maj@1.
¶ Pour HumanEval, les scores de référence sont pass@1.
Grok-2 : Une expérience de l’IA enrichie sur X
Les utilisateurs Premium et Premium+ de X ont désormais accès aux deux nouveaux modèles : Grok-2 et Grok-2 mini. Grok-2 est notre assistant IA de pointe, doté de capacités avancées en compréhension du texte et des images, intégrant des informations en temps réel issues de la plateforme X. Grok-2 mini, quant à lui, offre un équilibre parfait entre rapidité et qualité des réponses. Ces modèles sont accessibles via l’onglet Grok dans l’application X, et offrent une expérience plus intuitive, polyvalente et adaptée à une large gamme de tâches, que ce soit pour rechercher des informations, collaborer sur des écrits ou résoudre des problèmes de codage.
Un accès API pour les développeurs
En plus de leur disponibilité sur la plateforme X, Grok-2 et Grok-2 mini seront bientôt accessibles aux développeurs via notre nouvelle API d’entreprise. Cette API est construite sur une nouvelle infrastructure technologique sur mesure, permettant des déploiements d’inférence multi-régions pour un accès à faible latence partout dans le monde. Nous offrons également des fonctionnalités de sécurité améliorées, telles que l’authentification multi-facteurs obligatoire, des statistiques de trafic riches et une analyse avancée de la facturation.
Pour en savoir plus sur Grok-2 et découvrir comment ces modèles révolutionnaires peuvent transformer vos projets d’IA, suivez notre newsletter et restez à l’écoute pour les mises à jour à venir.
Source : Safig Blog High Tech
