Montag, 21. September 2026 · 21:13 Uhr
Grok 4.7 verbessert Ausdauer bei langen Coding-Aufgaben deutlich
xAI hat Grok 4.7 veröffentlicht, das durch längeres Reinforcement Learning bei mehrstündigen Programmieraufgaben klar besser abschneidet als der Vorgänger, aber weiterhin oft scheitert [1][2].
SpaceXAI hat am Sonntag Grok 4.7 veröffentlicht und dabei gezielt auf ein längeres Reinforcement-Learning-Training gesetzt, das schwierige, teils mehrstündige Aufgaben stärker gewichtet als bisher1. Ziel war es, den Coding-Agenten dazu zu bringen, während langer autonomer Arbeitssitzungen eigene Fehler früher zu erkennen und den Kontext über viele Schritte hinweg besser zu verwalten1. Die Veröffentlichung sorgte auch auf Hacker News für reges Interesse, mit über 500 Punkten und mehr als 440 Kommentaren zur Ankündigung2.
Die Fortschritte zeigen sich in mehreren Benchmarks: Bei Terminal-Bench 4.0 stieg der Wert von 20,3 Prozent auf 38,0 Prozent, bei CursorBench 4.0 von 40,4 auf 46,3 Prozent und beim AA-Briefcase-Test für mehrstündige Profiarbeit von 1.546 auf 1.657 Punkte1. Trotz dieser deutlichen Verbesserung gegenüber Grok 4.6 bleibt Grok 4.7 hinter Anthropics Claude Fable 5.1 zurück, das laut unabhängigem Leaderboard 57,9 Prozent bei Terminal-Bench 4.0 erreicht1.
Hintergrund der Anstrengungen ist ein grundsätzliches Problem von Coding-Agenten: Je länger sie unbeaufsichtigt arbeiten, desto mehr Entscheidungen treffen sie, und ein einzelner Fehler kann sich durch den gesamten weiteren Ablauf ziehen1. Ein aktueller Benchmark mit privaten Codebasen zeigte, dass selbst die besten Modelle in mehr als 60 Prozent der Fälle scheitern1. SpaceXAI erklärt zwar, dass Grok 4.7 bei Selbstverifikation und Langzeitkontext zugelegt habe, macht aber keine Angaben dazu, ob dies durch architektonische Änderungen, Zusammenfassungstechniken oder verbesserte Retrieval-Mechanismen erreicht wurde1.