Stand: Mi 30.09. · 06:31
Programmierung

Mittwoch, 30. September 2026 · 00:36 Uhr

Community-Projekt prüft, ob Anthropics Opus 5.5 heimlich abgeschwächt wurde

Ein neues Open-Source-Tool namens Livenerf soll messen, ob das KI-Modell Opus 5.5 nach seiner Veröffentlichung leistungsmäßig verschlechtert wurde.

Auf der Platt­form Ha­cker News sorgt ein Pro­jekt na­mens Liv­en­erf für Auf­se­hen, das der Frage nach­geht, ob An­thro­pics Mo­dell Opus 5.5 seit sei­nem Launch an Leis­tung ein­ge­büßt hat1. Der Bei­trag er­reich­te in­ner­halb kur­z­er Zeit über 360 Punk­te und mehr als 150 Kom­men­ta­re, was auf reges In­ter­es­se in der Ent­wickler­ge­mein­schaft hin­deu­tet1. Hin­ter­grund ist der wie­der­keh­ren­de Ver­dacht in der KI-Com­mu­ni­ty, dass An­bie­ter ihre Mo­del­le nach der Ver­öf­fent­li­chung still­schwei­gend dros­seln oder ver­än­dern, um Re­chen­kos­ten zu sen­ken1.

Das Pro­jekt soll of­fen­bar fort­lau­fend Bench­marks oder Test­fäl­le gegen das Mo­dell lau­fen las­sen, um Ver­än­de­run­gen in Ant­wort­qua­li­tät oder Kon­sis­tenz über die Zeit sicht­bar zu ma­chen1. Damit reiht es sich in eine Reihe ähn­li­cher In­itia­ti­ven ein, die als Re­ak­ti­on auf Nut­zer­be­schwer­den über schwan­ken­de Mo­dell­qua­li­tät bei gro­ßen Sprach­mo­del­len ent­stan­den sind1. Ge­naue tech­ni­sche De­tails zur Me­tho­dik oder zu bis­he­ri­gen Er­geb­nis­sen des Tools wer­den in der vor­lie­gen­den Quel­le je­doch nicht ge­nannt1.

Der Zeit­punkt der Dis­kus­si­on fällt in eine Phase in­ten­si­ven Wett­be­werbs zwi­schen An­thro­pic und Ope­nAI, des­sen neue Mo­del­le GPT-6.1 Sol und Dots kürz­lich vor­ge­stellt wur­den. Ob ein Zu­sam­men­hang zwi­schen die­sem Wett­be­werbs­druck und mög­li­chen Leis­tungs­än­de­run­gen bei Opus 5.5 be­steht, lässt sich aus der Quel­le nicht ab­lei­ten1.