Grok 4.7 : xAI muscle le codage sans augmenter ses prix

Grok 4.7 cible davantage le codage, les tâches professionnelles complexes et les travaux qui s’étendent sur plusieurs heures. Lancé le 21 septembre, le nouveau modèle conserve les tarifs de Grok 4.6 malgré des performances annoncées en hausse.

Grok 4.7 vise les tâches longues et complexes

xAI présente Grok 4.7 comme son modèle le plus performant pour le développement logiciel et le « knowledge work », qui regroupe notamment l’analyse, la rédaction de documents et d’autres tâches professionnelles. Cette nouvelle version repose sur un modèle de base plus grand que celui de Grok 4.6.

L’entreprise explique aussi avoir prolongé l’entraînement par renforcement avec des problèmes plus difficiles, dont certains nécessitent plusieurs heures de travail. Le modèle doit ainsi mieux maintenir le cap lorsqu’une tâche comporte de nombreuses étapes.

Un autre progrès revendiqué concerne l’auto-vérification. Grok 4.7 est conçu pour contrôler davantage ses propres résultats avant de poursuivre son travail. Cette capacité devient particulièrement importante pour les agents IA chargés de modifier du code, utiliser plusieurs outils ou exécuter une mission relativement autonome.

La fenêtre de contexte atteint par ailleurs 500 000 tokens via l’API. Le modèle accepte du texte et des images en entrée et propose quatre niveaux d’effort de raisonnement, de « low » à « xhigh ».

Le codage progresse face à Grok 4.6

Les benchmarks publiés par xAI montrent une progression notable face à la génération précédente. Sur CursorBench 4.0, consacré aux tâches de développement logiciel de longue durée, Grok 4.7 obtient 46,3 %, contre 40,4 % pour Grok 4.6.

L’écart devient plus important sur Terminal-Bench 4.0. Le nouveau modèle atteint 38 %, presque deux fois le score de Grok 4.6, limité à 20,3 %. Sur DeepSWE v1.1, Grok 4.7 atteint 71 %, contre 65,2 % pour son prédécesseur.

Ces résultats restent toutefois ceux communiqués par xAI et doivent être interprétés comme tels. Ils ne signifient pas que Grok 4.7 domine systématiquement tous les modèles concurrents. Sur CursorBench, par exemple, Fable 5.1 obtient 51,8 % dans les comparaisons publiées par l’entreprise.

L’enjeu se déplace donc vers le rapport entre performances, prix et consommation réelle de tokens, particulièrement pour les tâches agentiques longues.

Les tâches professionnelles deviennent un autre axe prioritaire

Grok 4.7 ne se limite pas au développement logiciel. xAI affirme avoir amélioré la création de documents et de présentations ainsi que le traitement de missions proches de celles réalisées par des juristes, analystes financiers ou autres professionnels.

Sur AA Briefcase, qui évalue des tâches de bureau pouvant durer plusieurs heures, le modèle obtient un score de 1 657 contre 1 546 pour Grok 4.6. Il progresse également sur le benchmark juridique Harvey Legal Agent, avec 19,6 % contre 15,8 % auparavant.

xAI a aussi renforcé l’intégration avec Grok Bot. Le modèle a été entraîné pour mieux comprendre cet environnement, dans lequel des agents peuvent utiliser différents outils afin d’accomplir des tâches de façon plus autonome.

Les tarifs restent ceux de Grok 4.6

L’un des principaux arguments commerciaux de Grok 4.7 concerne son prix. xAI maintient le tarif de base à 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. Les tokens d’entrée mis en cache coûtent 0,50 dollar par million.

Une tarification plus élevée s’applique toutefois lorsque les requêtes dépassent 200 000 tokens de contexte. L’entreprise propose également une version Fast, annoncée deux fois plus rapide en sortie mais facturée deux fois plus cher.

Grok 4.7 est disponible dans Cursor, Grok Build et via l’API de xAI, ainsi que chez plusieurs intermédiaires et plateformes cloud. Cette stratégie place le modèle directement sur le marché des assistants de développement et des agents IA professionnels, où la compétition porte désormais autant sur la capacité à travailler longtemps et de manière autonome que sur les performances obtenues lors de tests isolés.

Articles plus récents

2 Comments

Leave A Reply

S'il vous plaît entrez votre commentaire!
S'il vous plaît entrez votre nom ici

Articles similaires