Stand: Di 22.09. · 06:30
Programmierung

Montag, 21. September 2026 · 21:13 Uhr

Grok 4.7 verbessert Ausdauer bei langen Coding-Aufgaben deutlich

xAI hat Grok 4.7 veröffentlicht, das durch längeres Reinforcement Learning bei mehrstündigen Programmieraufgaben klar besser abschneidet als der Vorgänger, aber weiterhin oft scheitert [1][2].

SpaceXAI hat am Sonn­tag Grok 4.7 ver­öf­fent­licht und dabei ge­zielt auf ein län­ge­res Re­in­for­ce­ment-Lear­ning-Trai­ning ge­setzt, das schwie­ri­ge, teils mehr­stün­di­ge Auf­ga­ben stär­ker ge­wich­tet als bis­her1. Ziel war es, den Co­ding-Agen­ten dazu zu brin­gen, wäh­rend lan­ger au­to­no­mer Ar­beits­sit­zun­gen ei­ge­ne Feh­ler frü­her zu er­ken­nen und den Kon­text über viele Schrit­te hin­weg bes­ser zu ver­wal­ten1. Die Ver­öf­fent­li­chung sorg­te auch auf Ha­cker News für reges In­ter­es­se, mit über 500 Punk­ten und mehr als 440 Kom­men­ta­ren zur An­kün­di­gung2.

Die Fort­s­chrit­te zei­gen sich in meh­re­ren Bench­marks: Bei Ter­mi­nal-Bench 4.0 stieg der Wert von 20,3 Pro­zent auf 38,0 Pro­zent, bei Cur­sor­Bench 4.0 von 40,4 auf 46,3 Pro­zent und beim AA-Brief­ca­se-Test für mehr­stün­di­ge Pro­fi­a­r­beit von 1.546 auf 1.657 Punk­te1. Trotz die­ser deut­li­chen Ver­bes­se­rung ge­gen­über Grok 4.6 bleibt Grok 4.7 hin­ter An­thro­pics Clau­de Fable 5.1 zu­rück, das laut un­ab­hän­gi­gem Lea­der­board 57,9 Pro­zent bei Ter­mi­nal-Bench 4.0 er­reicht1.

Hin­ter­grund der An­stren­gun­gen ist ein grund­sätz­li­ches Pro­blem von Co­ding-Agen­ten: Je län­ger sie un­be­auf­sich­tigt ar­bei­ten, desto mehr Ent­schei­dun­gen tref­fen sie, und ein ein­zel­ner Feh­ler kann sich durch den ge­sam­ten wei­te­ren Ab­lauf zie­hen1. Ein ak­tu­el­ler Bench­mark mit pri­va­ten Co­de­ba­sen zeig­te, dass selbst die bes­ten Mo­del­le in mehr als 60 Pro­zent der Fälle schei­tern1. SpaceXAI er­klärt zwar, dass Grok 4.7 bei Selbst­ve­ri­fi­ka­ti­on und Lang­zeit­kon­text zu­ge­legt habe, macht aber keine An­ga­ben dazu, ob dies durch ar­chi­tek­to­ni­sche Än­de­run­gen, Zu­sam­men­fas­sungs­tech­ni­ken oder ver­bes­ser­te Re­trie­val-Me­cha­nis­men er­reicht wurde1.