Liquid AI veröffentlicht LFM2.5-Encoder-230M und LFM2.5-Encoder-350M: Bidirektionale Encoder, die bei 8K-Kontext auf der CPU schnell bleiben


Liquid AI hat zwei bidirektionale Encoder mit offenem Gewicht herausgebracht, LFM2.5-Encoder-230M Und LFM2.5-Encoder-350M. Bei beiden handelt es sich um maskierte Sprachmodelle, die auf dem LFM2-Hybrid-Spine basieren. Beide verfügen über einen 8.192-Token-Kontext.

Encoder sitzen unter Klassifikatoren, Intent-Routern, Sicherheitsfiltern und PII-Detektoren. Diese Jobs werden kontinuierlich ausgeführt, normalerweise ohne GPU, und zunehmend auch bei längeren Eingaben. BERT gründete die Klasse. ModernBERT hat seine Genauigkeit, Geschwindigkeit und seinen Kontext verbessert. Das Argument von Liquid AI ist, dass die LFM2-Architektur diese Linie fortsetzt, da ihre Kosten langsamer steigen, wenn die Eingaben länger werden.

Wie aus einem Decoder ein Encoder wurde

Die Encoder werden nicht von Grund auf trainiert. Sie werden von initialisiert LFM2.5-230M und LFM2.5-350M Decoder-Backbones, dann mit drei Änderungen konvertiert:

  • Zunächst wird die kausale Aufmerksamkeitsmaske durch eine bidirektionale ersetzt, sodass jeder Token beide Seiten berücksichtigt.
  • Zweitens werden die kurzen LFM2-Faltungen durch symmetrisches Mittenauffüllen nicht-kausal gemacht, sodass die Faltung jedes Tokens Nachbarn auf beiden Seiten mischt.
  • Drittens wird das Modell mit einem maskierten Sprachmodellierungsziel bei einer Maskierungsrate von 30 % trainiert. Das ist dichter als die 15 % von BERT, da Liquid AI Beweise dafür anführt, dass eine höhere Maskierungsrate in diesem Maßstab hilfreich ist.

Das Coaching verläuft in zwei Etappen:

  • Stufe eins etabliert allgemeine Sprachkompetenz mit einem MLM-Ziel für kurze Kontexte auf einem großen Webkorpus mit 1.024 Token.
  • Stufe zwei erweitert den Kontext auf 8.192 Token im gesamten Datenmix und stärkt so die Sach-, Rechts- und Mehrsprachigkeitskompetenz.

Architektonisch verschachtelt das Spine Gated Brief-Convolution-Blöcke mit gruppierter Abfrageaufmerksamkeit, das gleiche Design, das im beschrieben wird Technischer LFM2-Bericht. Beide Prüfpunkte verwenden eine versteckte Größe von 1024 und ein Vokabular von 65.536 Token und unterstützen 15 Sprachen. Die Lizenz ist die LFM Open License v1.0.

In der folgenden Einbettung werden die Konvertierung, die vollständige Rangliste, die Punktzahlen professional Aufgabe und die CPU-Latenzzahlen aufgeschlüsselt.

Die Benchmark-Ergebnisse

Liquid AI bewertete 14 Modelle anhand von 17 Aufgaben aus GLUE, SuperGLUE und mehrsprachiger Klassifizierung. Jedes Modell wird für jede Aufgabe vollständig feinabgestimmt, und die gemeldete Punktzahl ist das Ergebnis dieses feinabgestimmten Modells.

Der LFM2.5-Encoder-350M erreicht einen 17-Aufgaben-Mittelwert von 81,02 (±1,00) und belegt damit den vierten Platz. Die drei Modelle davor sind alle größer. Sie sind XLM-R XL bei 3,5B (83,06), ModernBERT-large bei 395M (81,68) und XLM-R giant bei 560M (81,34). Das Topmodell ist quick zehnmal so groß.

Der LFM2.5-Encoder-230M erreicht 79,29 (±1,02) und belegt damit den sechsten Platz. Es schlägt ModernBERT-Foundation um 78,19 und alle EuroBERT Modell in der Tabelle, einschließlich EuroBERT-610M (75,87) und EuroBERT-2.1B (72,19). Beide neuen Encoder schneiden auch besser ab als die eigenen Abrufgeschwister von Liquid AI, LFM2.5-ColBERT-350M (76,18) und LFM2.5-Embedding-350M (75,68). Diese Lücke ist der erklärte Grund, warum Liquid AI einen Allzweck-Encoder entwickelt hat, anstatt die Retriever wiederzuverwenden.

Die Methodik ist der interessantere Teil, und das ist sie auch Open-Supply unter Apache-2.0. Jedes Modell ist mit fp32-Mastergewichtungen und bf16-Autocast geladen, sodass in der Tabelle eher Modelle als Zahlenformate verglichen werden. Jedes Modell verwendet das gleiche AdamW-Rezept, das der EuroBERT-Karte entnommen ist. Die Lernrate wird professional Modell und Aufgabe über 10 Raten und 3 Seeds ausgewählt. Die Ergebnisse werden dann als Mittelwert über 5 frische Samen angegeben, die nie mit der Selektion in Berührung gekommen sind. Der transformers Die Model ist auf 4.56.2 fixiert, sodass die Abhängigkeitsdrift keine unkontrollierte Variable ist.

Anwendungsfälle und Bereitstellungsumgebungen

Die Veröffentlichung nennt drei Einstellungen. Edge- und eingebettete Geräte stehen an erster Stelle. Der integrierte Pc eines Autos oder ein Industriecontroller verfügen über keine Ersatz-GPU und können sich einen Cloud-Roundtrip nicht leisten. Regulierte und lokale Systeme in den Bereichen Finanzen, Gesundheitswesen und Recht, bei denen Dokumente lang und vertraulich sind und die interne Infrastruktur nicht verlassen können. Und kostenempfindliche Pipelines mit hohem Volumen, bei denen ein kleiner Encoder als kostengünstiger erster Durchgang vor einem größeren Modell fungiert.

Liquid AI gibt auch eine nützliche Zahl in das Kontextfenster ein: 8.192 Token entsprechen ungefähr 13 bis 15 Seiten. Ein Vorwärtspass deckt einen vollständigen Vertrag oder eine vollständige Patientenakte ab.

Um zu zeigen, wie ein fein abgestimmter Encoder aussieht, hat das Forschungsteam fünf Demos verschickt. Jeder läuft in einem nur für die CPU verfügbaren Hugging Face House. Sie decken ab Zero-Shot-Immediate-Routing, Zero-Shot-Coverage-FusselnUnd Rechtschreibprüfung. A PII-Detektor verarbeitet 40 Informationstypen in 16 Sprachen. Ein Bonus maskierte Verbreitung Demo führt den Encoder als Chatbot aus, der durch iterative Demaskierung generiert.

Bringt sie zum Laufen

Beide Encoder laden durch transformers. Der Körper wird als freigelegt Lfm2BidirectionalModel und maskierte LM-Ladeanwendungen Lfm2BidirectionalForMaskedLM. Beide sind durchverdrahtet auto_mapAdditionally trust_remote_code=True ist bei jedem Ladeaufruf erforderlich.

Ein Foundation-Encoder erzeugt allgemeine Darstellungen und keine Aufgabenausgaben, daher ist eine Feinabstimmung erforderlich. Flüssige KIs Tutorial zur Feinabstimmung Durchläuft lange Rechtsdokumente in einer 8K-Kontextkonfiguration. Die Anleitung zur Modellauswahl ist unkompliziert: 350 MB, wenn es auf die Genauigkeit ankommt, 230 MB für engere {Hardware} oder höheren Durchsatz.