Montag, 28. September 2026 · 23:34 Uhr
Anthropic bringt Claude Sonnet 5.5 mit neuen Sicherheitsmechanismen
Anthropic veröffentlicht mit Claude Sonnet 5.5 ein schnelleres, günstigeres Mittelklassemodell, das erstmals eigene Cyber-Sicherheitsvorkehrungen und Modell-Fallbacks nutzt.
- 1thenewstack.io
- 2anthropic.com
- 3heise.de
- 4heise.de
- 5heise.de
- 6the-decoder.de
- 7cnbc.com
- 8thenewstack.io
Anthropic hat mit Claude Sonnet 5.5 ein neues Modell seiner Mittelklasse vorgestellt, das schneller und günstiger arbeiten soll als der Vorgänger Sonnet 53456. Bei Wissensarbeit liegt es nahezu auf dem Niveau von Opus 5.5, und beim Coding-Benchmark Terminal-Bench 4.0 springt der Wert von 10,3 auf 70,6 Prozent, womit es sogar Opus 5.5 im xhigh-Modus mit 66,4 Prozent übertrifft16. Damit ergänzt Anthropic seine 5.5-Modellfamilie und positioniert sich, zusammen mit dem angekündigten Haiku 5.5, gegen OpenAIs GPT-6-Reihe6.
Besonders auffällig ist, dass Sonnet 5.5 als erstes Modell seiner Reihe mit denselben Cyber-Sicherheitsvorkehrungen und Klassifikator-basiertem Routing ausgestattet wurde, die bislang nur den leistungsfähigsten Anthropic-Modellen vorbehalten waren12. Grund dafür sind stark verbesserte offensive Sicherheitsfähigkeiten: Ohne Schutzmechanismen erzielte das Modell in 178 von 410 ExploitBench-Durchläufen vollständige Codeausführung, bei CyScenarioBench stieg die Erfolgsquote von 0,7 auf 46,1 Prozent gegenüber Sonnet 51. Deshalb wird Sonnet 5.5 in „höher riskanten“ Situationen teils automatisch auf das ältere Sonnet 5 umgeleitet1.
Die Durchsetzung erfolgt in drei Stufen: eine Sonde liest interne Modellaktivierungen aus, ein leichter Klassifikator läuft direkt auf Sonnet 5.5, und ein separat trainierter LLM-Klassifikator entscheidet abschließend über eine Blockierung1. Anthropic erwartet dadurch mehr Ablehnungen als bei Sonnet 5, auch bei legitimen Sicherheitsanfragen, wählte aber bewusst weniger aggressive Jailbreak-Schutzmaßnahmen, da das Modell insgesamt als weniger fähig gilt als Opus 5.5 oder Mythos 5.11.