Mittwoch, 30. September 2026 · 20:41 Uhr
Cohere bringt schnelleres Embedding-Modell mit geringem Qualitätsverlust
Cohere hat mit Embed 5 ein schnelleres Abfragemodell veröffentlicht, das laut eigenen Tests kaum Einbußen bei der Retrieval-Qualität verursacht.
Cohere hat Embed 5 veröffentlicht und bietet damit zwei Varianten an: Embed 5 Pro für die Indexierung und das schnellere, günstigere Embed 5 Fast für Abfragen, ohne dass ein zweiter Index nötig wird1. Das Unternehmen empfiehlt diese Kombination besonders für RAG- und Agenten-Workloads, bei denen Latenz bei wiederholten Suchen ins Gewicht fällt1. Beide Modelle teilen sich einen Vektorraum, sodass Teams zwischen ihnen wechseln können, ohne den gesamten Datenbestand neu einzubetten1.
Laut Cohere fällt der Qualitätsverlust beim gemischten Einsatz gering aus: Über 40 Datensätze mit Text, Bildern und Dokumenten hinweg erreichte die Kombination aus Fast-Abfragen und Pro-Index einen relativen Wert von 98,4 gegenüber einer reinen Pro-Pro-Basislinie von 1001. Wird Fast sowohl für Indexierung als auch Abfrage genutzt, sinkt der Wert auf 96,61. Pro kostet 0,12 US-Dollar pro Million Token, Fast 0,08 US-Dollar und bringt im Schnitt die 2,4-fache Dokumentendurchsatzrate1.
Beide Modelle unterstützen sechs Vektordimensionen zwischen 256 und 2.048 sowie die Formate Float32, Int8 und Binär1. Diese Flexibilität wirkt sich stark auf den Speicherbedarf aus: Ein 2.048-dimensionaler Float32-Vektor benötigt für 100 Millionen Textabschnitte rund 819 GB, während eine 1.024-dimensionale Int8-Variante nur etwa 102 GB braucht und eine 256-dimensionale Binärversion auf rund 3,2 GB kommt1. Cohere empfiehlt für die meisten Anwendungen die Int8-Variante mit 1.024 Dimensionen als guten Kompromiss zwischen Speicherbedarf und Genauigkeit, während Binärvektoren eher für eine erste grobe Suchstufe vor einer präziseren Nachsortierung geeignet seien1.