Beste Open Speech Recognition (ASR)-Modelle im Jahr 2026: WER, Sprachen, Latenz und Lizenz im Vergleich


Die offene Spracherkennung ist seit einiger Zeit keine Whisper-Monokultur mehr. Im März 2026 Cohere hat Transcribe veröffentlichtein 2B Apache 2.0-Modell, das die Spitze einnahm Umarmendes Gesicht Öffnen Sie die ASR-Bestenliste bei einer durchschnittlichen Wortfehlerrate von 5,42 %. Fünf Wochen später IBM hat Granite Speech 4.1 2B ausgeliefert bei 5,33 %. Seitdem ARK-ASR-3B Und MOSS-Transcribe-preview-2B haben noch niedrigere Zahlen gemeldet.

Die Spitze dieser Bestenliste ist jetzt durch weniger als einen WER-Punkt getrennt. Das hat für jeden, der sich für ein Modell entscheidet, eine konkrete Konsequenz: Der Rang ist nicht mehr die entscheidende Variable. Lizenz, Sprachabdeckung, Streaming-Unterstützung und Kosten professional Audiostunde sind. Diese Zusammenfassung vergleicht das Feld auf allen vier.

Erstens ein Downside mit der Bestenlistennummer, die jeder zitiert

Beim Open ASR Leaderboard-Durchschnitt handelt es sich nicht um eine einzelne feste Größe, und die derzeit nebeneinander aufgeführten Modelle wurden nicht alle auf die gleiche Weise bewertet.

Die 5,42 % von Cohere sind ein Durchschnitt aus acht englischen Testsätzen, einschließlich TED-LIUM. Das ergibt: AMI 8,13, Earnings-22 10,86, GigaSpeech 9,34, LibriSpeech clear 1,25, LibriSpeech different 2,37, SPGISpeech 3,08, TED-LIUM 2,49, VoxPopuli 5,87 im Durchschnitt genau 5,42.

Die 5,04 % von ARK-ASR-3B sind ein Durchschnitt Sieben Sätze. TED-LIUM fehlt. Die MOSS-Transcribe-preview-2B-Karte besagt dies ausdrücklich: TED-LIUM ist derzeit nicht Teil des Bestenlistenlaufs und daher ausgeschlossen.

TED-LIUM ist eines der einfacheren Units in der Suite, daher erhöht sich der Durchschnitt, wenn man es weglässt. Berechnen Sie die veröffentlichten Ergebnisse professional Datensatz von Cohere über dieselben sieben Sätze, die ARK berichtet, neu, und Cohere landet bei 5,84 und nicht bei 5,42. Machen Sie dasselbe mit Granite Speech 4.1 2B und es bewegt sich von 5,33 auf 5,65. Auf vergleichbarer Foundation liegt der Vorsprung von ARK bei größer als die Schlagzeilen vermuten lassen, nicht kleiner – aber der Punkt ist, dass man eine veröffentlichte Zahl nicht von einer anderen subtrahieren kann, um eine aussagekräftige Antwort zu erhalten.

Zwei weitere Vorbehalte gehören auf die gleiche Seite:

Einige Ergebnisse sind offen für die Bestenliste geeignet: Die MOSS-Transcribe-preview-2B-Karte besagt, dass das Modell mit Reinforcement Studying auf den Open ASR Leaderboard-Trainingssplits verfeinert wurde. Das wird offengelegt, was mehr ist als die meisten anderen, aber es bedeutet, dass die Punktzahl eher den Maßstab als die Leistungsfähigkeit misst.

Non-public-Observe-Daten ordnen das Board neu: Appen beigesteuerte zurückgehaltene Auswertungssätze Abdeckung australischer, kanadischer, indischer und amerikanischer Akzente in Skript- und Konversationssituationen. Wenn diese privaten Units aktiviert sind, wechselt zoom/scribe_v1 von Platz 4 auf Platz 1 und der Anführer der öffentlichen Bestenliste verliert eine Place. Modelle, die auf saubere Lesesprache abgestimmt sind, verschlechtern sich bei spontanem Gesprächsaudio unverhältnismäßig stark.

Nutzen Sie die Bestenliste, um eine Auswahlliste zu erstellen. Verwenden Sie es nicht, um einen Gewinner auszuwählen.

Die Genauigkeitsstufe

Kohärente Transkription (2B, Apache 2.0, 14 Sprachen) ist das Modell, das tatsächlich in Produktion ging. Es wurde im letzten Monat über 620.000 Mal heruntergeladen und bietet umfassende Laufzeitunterstützung transformersvLLM, mlx-audio für Apple Silicon, einen Rust-Port und einen WebGPU-Construct. Es handelt sich um einen Conformer-Encoder mit einem leichten Transformer-Decoder, der von Grund auf trainiert wurde. Cohere führte auch eine menschliche Präferenzbewertung durch, bei der geschulte Annotatoren Transkripte hinsichtlich Bedeutungserhalt, Halluzination und benannter Entitäten bewerteten: eine durchschnittliche Gewinnrate von 61 %, 78 % gegen IBM Granite 4.0 1B Speech und 64 % gegen Whisper Massive-v3.

Der Abschnitt zu den Einschränkungen auf der Modellkarte ist ungewöhnlich ehrlich und sollte vor der Entscheidung gelesen werden. Es gibt keine automatische Spracherkennung, keine Zeitstempel und keine Tagebuchführung, und das Modell ist bestrebt, Stille zu transkribieren, daher empfiehlt Cohere, ein VAD oder Noise Gate voranzustellen. Das Repo ist trotz der Apache 2.0-Lizenz auch durch eine Kontaktinformationsvereinbarung geschützt.

Granite Speech 4.1 2B (2B, Apache 2.0) ist die bessere Wahl, wenn Sie mehr Kapazität benötigen, als eine niedrigere Anzahl. Sechs Sprachen für ASR plus bidirektionale Sprachübersetzung, Key phrase-Pay attention-Biasing für Namen und Fachjargon, Interpunktion und Truecasing, einschließlich deutscher Groß- und Kleinschreibung von Substantiven. Auf 174.000 Stunden trainiert. RTFx 231.29. IBM liefert auch zwei Geschwister aus: -plus fügt sprecherattributierte ASR und Zeitstempel auf Wortebene hinzu und -nar wird weiter unten besprochen.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, Englisch) koppelt einen FastConformer-Encoder mit einem Qwen3-1.7B-Decoder und läuft in zwei Modi – reine Transkription oder LLM-Modus, in dem der Decoder Fragen zum Transkript zusammenfasst und beantwortet. 5,63 % WER bei RTFx 418. Beachten Sie, dass AMI auf etwa 15 % der Trainingsdaten überabgetastet wurde, was die Ausgabe in Richtung wörtlicher, disfluenzerhaltender Transkripte verzerrt. Das ist ein Function für juristische Arbeiten und ein Ärgernis für Besprechungsnotizen.

Qwen3-ASR-1.7B (Apache 2.0) deckt 52 Sprachen und Dialekte ab – 30 Sprachen plus 22 chinesische Dialekte – bei 5,76 %. Es wird mit einem vollständigen Inferenz-Toolkit und einem separaten erzwungenen Ausrichtungsmodell für Zeitstempel in 11 Sprachen geliefert. Für alles, was Mandarin oder die regionale chinesische Sprache berührt, ist dies der offensichtliche Ausgangspunkt.

Die Durchsatzstufe

Die Genauigkeit im oberen Bereich des Feldes variiert jetzt um etwa einen WER-Punkt. Der Durchsatz variiert um mehr als eine Größenordnung, was bedeutet, dass der Durchsatz in der Regel über die Rechnung entscheidet.

Sittich TDT 0.6B v3 (0,6B, CC-BY-4.0) ist der Durchsatzführer unter den mehrsprachigen offenen Modellen mit RTFx 3332,74 in 25 europäischen Sprachen mit automatischer Spracherkennung und bewältigt bis zu 24 Minuten in einem einzigen Durchgang auf einem A100 80 GB. Es kostet 6,32 % WER – etwa einen Punkt mehr als Granite 4.1 2B für etwa das Vierzehnfache des Audios professional GPU-Sekunde.

Granite Speech 4.1 2B-NAR ist das interessantere technische Ergebnis. Es ist nicht autoregressiv: Es bearbeitet eine CTC-Hypothese in einem einzigen Vorwärtsdurchlauf mithilfe eines bidirektionalen LLM und erreicht RTFx ~1820 auf einem H100 bei Stapelgröße 128. Um dorthin zu gelangen, verzichtet es auf Japanisch, Sprachübersetzung und Key phrase-Biasing.

Qwen3-ASR-0.6B Behält alle 52 Sprachen bei und erreicht einen 2000-fachen Durchsatz bei Parallelität 128.

Die Streaming-Stufe

Ein Batch-WER scheint der falsche Check für ein Streaming-Modell zu sein, und die Bestenliste bewertet sie trotzdem. Voxtral Realtime liegt bei 7,68 % und Kyutai STT 2.6B bei 6,40 % – beide unter Whisper – und keine der beiden Zahlen sagt etwas Nützliches über ihren Verwendungszweck aus.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 Sprachen) ist ein 3.4B-Sprachmodell mit einem von Grund auf trainierten kausalen 970M-Audio-Encoder mit Schiebefenster-Aufmerksamkeit auf beiden Hälften für effektiv unbegrenztes Streaming. Die Transkriptionsverzögerung ist in 80-ms-Schritten von 80 ms bis 1200 ms konfigurierbar, plus einer eigenständigen 2400-ms-Possibility; Mistral empfiehlt 480 ms als Candy Spot und berichtet, dass es bei dieser Einstellung mit führenden offenen Offline-Modellen mithalten kann. Es läuft auf einer einzelnen 16-GB-GPU und hatte Day-0-vLLM-Echtzeit-API-Unterstützung.

Kyutai STT (CC-BY-4.0) gibt es in zwei Formen: als ~1B-Englisch/Französisch-Modell mit einer Verzögerung von 0,5 Sekunden und einem integrierten semantischen Sprachaktivitätsdetektor und als 2,6B-Modell nur für Englisch mit einer Verzögerung von 2,5 Sekunden. Für Sprachagenten ist der semantische VAD wichtiger als die Transkriptionsverzögerung – er sagt voraus, wann der Sprecher tatsächlich fertig ist, was die wahrgenommene Latenz beim Abwechseln bestimmt. Ein H100 bedient 400 gleichzeitige Streams in Echtzeit.

Die Deckungsstufe

Metas omnilingualer ASR (Apache 2.0, Korpus CC-BY) konkurriert nicht auf WER und sollte nicht so bewertet werden, als ob dies der Fall wäre. Es deckt nativ mehr als 1.600 Sprachen ab und erweitert sich durch Zero-Shot-In-Context-Lernen auf mehr als 5.400 Sprachen. Es basiert auf einem wav2vec 2.0-Encoder, der auf 7B skaliert und in etwa 4,3 Millionen Stunden vorab trainiert wurde. Die 7B LLM-ASR-Variante erreicht eine Zeichenfehlerrate von unter 10 % bei 78 % der unterstützten Sprachen, darunter 500+, die noch nie zuvor von einem ASR-System unterstützt wurden. Die Encodergrößen reichen von 300M bis 7B. Meta veröffentlichte außerdem den Omnilingual ASR Corpus, der mehr als 350 unterversorgte Sprachen abdeckt.

Whisper Massive-v3 (1.55B, MIT, 99 Sprachen) wurde hinsichtlich der Genauigkeit von etwa zehn offenen Modellen überholt und bleibt für eine große Klasse von Projekten der korrekte Standardwert. MIT ist die am wenigsten belastete Lizenz auf diesem Gebiet. Das Laufzeit-Ökosystem – Whisper.cpp, Sooner-Whisper, WhisperX – hat unter den neueren Versionen kein Äquivalent. Wenn Ihre Anforderung „etwas Sprache, etwas {Hardware}, kein Lizenzanwalt“ lautet, ist dies immer noch die Antwort.

Der Vorsprung der Forschung

diffusion-gemma-asr-klein vom YC-Startup Interfaze ist die architektonisch kreativste Veröffentlichung des Jahres. Es erzeugt Transkripte durch paralleles Diffusions-Diffusions-Rauschunterdrücken über einen 256-Token-Canvas in 8 bis 16 Schritten, sodass die Dekodierungskosten nicht mit der Länge des Transkripts steigen. Es wurden nur ~42 Millionen Parameter trainiert – 0,16 % der Gewichte – auf einem eingefrorenen 26B DiffusionGemma und einem eingefrorenen Flüsterklein-Encoder. Beim LibriSpeech-Check-Clear erreicht es 6,6 % WER bei etwa 11- bis 17-facher Echtzeit. Es erreicht außerdem 15,7 % bei FLEURS Englisch und 29,6 % CER bei FLEURS Mandarin. Behandeln Sie daher die LibriSpeech-Zahl als Obergrenze. Niemand sollte dies einsetzen. Jeder, der an ASR arbeitet, sollte es lesen.

MOSS-Transkribieren-Diarisieren 0,9B (Apache 2.0, 50+ Sprachen) löst das Downside, das die meisten Zusammenfassungen ignorieren: Es gibt Sprecherbezeichnungen, Wortzeitstempel und Transkript in einer Era aus, anstatt ASR an einen separaten Diarisierungsstapel zu verketten. 128.000 Kontext, etwa 90 Minuten Audio in einem Durchgang, RTF ~0,017 auf einer RTX 4090, mit Hotword-Bias.

Die Lizenzaufteilung liest bis zur Bereitstellung niemand

Dies ist der Abschnitt, der den Versand tatsächlich blockiert, und das Feld ist sauber unterteilt:

Apache 2.0: Cohere Transcribe, Granite Speech 4.1 (alle drei Varianten), Qwen3-ASR (beide Größen), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe. Keine Quellenangabepflicht, kommerzielle Nutzung uneingeschränkt. Beachten Sie, dass das Repo von Cohere einer Kontaktinformationsvereinbarung unterliegt, obwohl die Lizenz selbst Apache 2.0 ist.

MIT: Whisper Massive-v3. Die freizügigste Possibility auf diesem Gebiet.

CC-BY-4.0: Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT. Gewerblich nutzbar, Namensnennung erforderlich. Für ein eingebettetes Produkt oder eine White-Label-API stellt dies eine echte Compliance-Verpflichtung dar und ist der häufigste Grund dafür, dass Groups am Ende ein Modell ausliefern, das nicht das genaueste ist, das sie getestet haben.

Metas Omnilingual ASR trennt die beiden: Apache 2.0 für Modelle, CC-BY für den Korpus.

Wie man tatsächlich wählt

Führen Sie diese Reihenfolge aus, nicht nur die Ranglistenreihenfolge:

  1. Lizenz: Wenn die Namensnennung ein Blocker ist, entfernt CC-BY-4.0 Parakeet, Canary-Qwen und Kyutai, bevor Sie irgendetwas vergleichen.
  2. Sprachabdeckung: Die 14 Sprachen von Cohere, die 6 von Granite und die Nur-Englisch-Sprache von Canary sind harte Grenzen, keine weichen. Darüber hinaus verfügt Cohere über keine automatische Spracherkennung, sodass Sie die Sprache im Voraus kennen müssen.
  3. Streaming oder Batch: Das ist architektonisch. Kein Aufwand an Optimierung verwandelt einen Offline-Encoder-Decoder in ein Streaming-Modell mit geringer Latenz.
  4. Dann messen Sie WER auf Ihrem eigenen Audio: Der Abstand zwischen den Prime-Ten-Modellen im öffentlichen Benchmark beträgt weniger als einen Punkt. Die Streuung Ihres akzentuierten, verrauschten, domänenspezifischen Audios wird um ein Vielfaches höher sein und die Modelle werden nicht in derselben Reihenfolge eingestuft.
  5. Berechnen Sie dann die Kosten professional Audiostunde auf Ihren eigenen GPUs: RTFx-Zahlen werden bei großen Batchgrößen auf Rechenzentrumshardware gemessen und nicht übertragen.

Die nützliche Zusammenfassung des Jahres 2026 ist nicht, dass ein einzelnes Modell gewonnen hat. Es liegt daran, dass ein 2B-Modell mit offenem Gewicht und einer freizügigen Lizenz jetzt die Preise übertrifft, die geschlossene APIs vor 18 Monaten verlangten, und dass die verbleibende Entscheidung eher eine Beschaffungsfrage als eine Forschungsfrage ist.


Quellen:

Die Positionen in der Bestenliste sind stay und ändern sich häufig. Alle Zahlen wurden am 23. Juli 2026 anhand von Primärquellen überprüft.


Asif Razzaq ist CEO von Marktechpost Media Inc.. Als visionärer Unternehmer und Ingenieur setzt sich Asif dafür ein, das Potenzial der künstlichen Intelligenz für das soziale Wohl zu nutzen. Sein jüngstes Unterfangen ist die Einführung einer Medienplattform für künstliche Intelligenz, Marktechpost, die sich durch eine ausführliche Berichterstattung über maschinelles Lernen und Deep-Studying-Nachrichten auszeichnet, die sowohl technisch fundiert als auch für ein breites Publikum leicht verständlich ist. Die Plattform verfügt über mehr als 2 Millionen monatliche Aufrufe, was ihre Beliebtheit beim Publikum verdeutlicht.

Von admin

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert