Stand: Do 01.10. · 06:31
Programmierung

Mittwoch, 30. September 2026 · 20:41 Uhr

Cohere bringt schnelleres Embedding-Modell mit geringem Qualitätsverlust

Cohere hat mit Embed 5 ein schnelleres Abfragemodell veröffentlicht, das laut eigenen Tests kaum Einbußen bei der Retrieval-Qualität verursacht.

Co­he­re hat Embed 5 ver­öf­fent­licht und bie­tet damit zwei Va­ri­a­n­ten an: Embed 5 Pro für die In­de­xie­rung und das schnel­le­re, güns­ti­ge­re Embed 5 Fast für Ab­fra­gen, ohne dass ein zwei­ter Index nötig wird1. Das Un­ter­neh­men emp­fiehlt diese Kom­bi­na­ti­on be­son­ders für RAG- und Agen­ten-Workloads, bei denen La­tenz bei wie­der­hol­ten Su­chen ins Ge­wicht fällt1. Beide Mo­del­le tei­len sich einen Vek­tor­raum, so­dass Teams zwi­schen ihnen wech­seln kön­nen, ohne den ge­sam­ten Da­ten­be­stand neu ein­zu­bet­ten1.

Laut Co­he­re fällt der Qua­li­täts­ver­lust beim ge­misch­ten Ein­satz ge­ring aus: Über 40 Da­ten­sät­ze mit Text, Bil­dern und Do­ku­men­ten hin­weg er­reich­te die Kom­bi­na­ti­on aus Fast-Ab­fra­gen und Pro-Index einen re­la­ti­ven Wert von 98,4 ge­gen­über einer rei­nen Pro-Pro-Ba­sis­li­nie von 1001. Wird Fast so­wohl für In­de­xie­rung als auch Ab­fra­ge ge­nutzt, sinkt der Wert auf 96,61. Pro kos­tet 0,12 US-Dol­lar pro Mil­li­on Token, Fast 0,08 US-Dol­lar und bringt im Schnitt die 2,4-fache Do­ku­men­ten­durch­satz­ra­te1.

Beide Mo­del­le un­ter­stüt­zen sechs Vek­tor­di­men­si­o­nen zwi­schen 256 und 2.048 sowie die For­ma­te Float32, Int8 und Binär1. Diese Fle­xi­bi­li­tät wirkt sich stark auf den Speicher­be­da­rf aus: Ein 2.048-di­men­si­o­na­ler Float32-Vek­tor be­nö­tigt für 100 Mil­li­o­nen Text­ab­schnit­te rund 819 GB, wäh­rend eine 1.024-di­men­si­o­na­le Int8-Va­ri­a­n­te nur etwa 102 GB braucht und eine 256-di­men­si­o­na­le Bi­nä­r­ver­si­on auf rund 3,2 GB kommt1. Co­he­re emp­fiehlt für die meis­ten An­wen­dun­gen die Int8-Va­ri­a­n­te mit 1.024 Di­men­si­o­nen als guten Kom­pro­miss zwi­schen Speicher­be­da­rf und Ge­nau­ig­keit, wäh­rend Bi­nä­r­vek­to­ren eher für eine erste grobe Such­stu­fe vor einer prä­zi­se­ren Nach­sor­tie­rung ge­eig­net seien1.