Am Pool hat veröffentlicht Laguna S 2.1ein 118B-Parameter-Open-Weight-Modell, das für die Agentencodierung entwickelt wurde. Es handelt sich um ein Combination-of-Specialists (MoE)-Modell mit 8B aktivierten Parametern professional Token. Es unterstützt ein Kontextfenster von bis zu 1 Million Token sowohl im Denk- als auch im Nicht-Denkmodus. Die Gewichte sind dran Umarmendes Gesicht unter einer OpenMDW-1.1-Lizenz, und das Modell ist klein genug, um auf einer einzigen zu laufen NVIDIA DGX Spark.
Bei Langhorizont-Codierungs-Benchmarks kann sich Laguna S 2.1 gegen Modelle behaupten, die um ein Vielfaches größer sind, darunter DeepSeek-V4-Professional-Max, NVIDIAs Nemotron 3 Extremely und Pondering Machines‘ Inkling. Laguna S 2.1 ist ein Scale-Up der Laguna XS-Familie, das auf denselben Vortrainingsdaten wie XS 2.1 trainiert wurde.
Was ist Laguna S 2.1?
Das Modell aktiviert etwa 6,8 % seiner Parameter auf jedem beliebigen Token. Alle 118B Parameter bleiben im Speicher, aber professional Schritt werden nur etwa 8B durch das Netzwerk geleitet. Aufgrund dieser geringen Ausstattung kann sich ein mittelgroßes Modell wie ein größeres Modell verhalten, ist aber dennoch günstig im Betrieb.
Das Poolside-Staff veröffentlicht Gewichtungen in BF16, FP8, INT4 und NVFP4 sowie offizielle GGUF- und MLX-Konvertierungen und DFlash-Entwurfsmodelle. Vom Beginn der Schulung bis zur Einführung vergingen weniger als neun Wochen. Das Vortraining begann am 22. Mai 2026 auf 4.096 NVIDIA H200-GPUs. Es ist das erste Poolside-Modell, bei dem Reinforcement Studying mit FP8-Präzision durchgeführt wurde.
Leistung
Laguna S 2.1 erreicht 70,2 % Terminal-Bench 2.1 mit aktiviertem Denken. Damit steht es auf der zusammengestellten Bestenliste von Poolside an erster Stelle unter den offenen Modellen mit offener Größe, nur hinter größeren oder geschlossenen Systemen. Im SWE-Bench Multilingual erreicht es einen Wert von 78,5 % und steht damit an der Spitze der veröffentlichten Tabelle. Der vollständige von Poolside veröffentlichte Vergleich ist unten aufgeführt.
| Benchmark | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | Inkling (975B-A41B) | Nemotron 3 Extremely (550B-A55B) | DeepSeek-V4-Professional-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Qwen 3,7 Max | Muse Spark 1.1 | Claude Fabel 5 |
|---|---|---|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 70.2 | 71,7 | 63,8 | 56.4 | 64,0 | 88,3 | 74,5 | 80,0 | 88,0 |
| SWE-Bench Mehrsprachig | 78,5 | 75,8 | – | 67,7 | 76,2 | – | 78,3 | – | – |
| SWE-Bench Professional (Öffentlich) | 59.4 | 57.9 | 54.3 | – | 55.4 | – | 60.6 | 61,5 | 80,3 |
| DeepSWE v1.1 | 40.4 | – | – | – | 9.0 | 69,0 | – | 53.3 | 70,0 |
| SWE-Atlas (Codebasis QnA) | 46.2 | – | – | – | 27.2 | – | – | 42.2 | – |
| Toolathlon bestätigt | 49,7 | – | 45,5 | 34.3 | 55.9 | – | – | 75,6 | – |
Das klarste Sign ist DeepSWE v1.1, das immer noch über echten Headroom verfügt. Dort erreicht Laguna S 2.1 40,4 % gegenüber 9,0 % von DeepSeek-V4-Professional-Max, bei etwa einem Sechstel der aktiven Parameter. Closed-Frontier-Modelle wie Claude Fable 5 und Kimi K3 führen in mehreren Benchmarks immer noch. Bei der Behauptung von Poolside geht es um die Gewichtsklasse, nicht um die absolute Spitze. Trajektorien aus dem endgültigen Bewertungssatz werden unter veröffentlicht trajectories.poolside.ai.
Zwei Denkweisen und woher die Punktzahl kommt
Laguna S 2.1 hat zwei Modi: Aus und maxwobei „max“ standardmäßig aktiviert ist. Im Max-Modus legt das Modell sein eigenes Testzeit-Rechenbudget fest. Poolside wird vorerst ohne vom Benutzer konfigurierbare Steuerung für niedrigen/mittleren/hohen Aufwand ausgeliefert.
Max Pondering erhöht Terminal-Bench 2.1 von 60,4 % auf 70,2 %. Es erhöht DeepSWE von 16,5 % auf 40,4 %. Diese Gewinne kosten Token: DeepSWE-Trajektorien führen im Denkmodus etwa 249.000 Abschluss-Tokens aus, im Vergleich zu 99.000 ohne. Das Poolside-Staff berichtet über kohärente, produktive Überlegungen, die über Stunden und Hunderttausende von Token laufen.
Drei veröffentlichte Läufe
Das Poolside-Staff teilte drei unbearbeitete Flugbahnen, um Verhalten und nicht Punkte zu zeigen. In einem Fall erstellte das Modell eine funktionierende HTML/CSS-Browser-Engine aus einem leeren Ordner. Dieser Lauf erforderte in einer 50-minütigen Sitzung 181 Schritte ohne menschliches Eingreifen und validierte seine eigene Ausgabe im Vergleich zu Headless Chromium.
In einer Sekunde optimierte das Modell Poolsides eigenes Agentensystem. Dadurch wurde der Kabelbaum um 5,2 % schneller und die Speicherzuweisung um etwa 71 % geringer, da die O(n²)-Stringverkettung durch Puffer ersetzt wurde. In einem dritten Fall wurde es erneut abgeleitet Erdős Downside Nr. 397 Offline in Perl über 68 Minuten, da die Sandbox kein Python hatte. Dieses Ergebnis ist eine unabhängige Wiederentdeckung; GPT-5.2 Professional löste das gleiche Downside im Januar 2026, und Lagunas Wissensschluss ist November 2025.
Können Sie es tatsächlich bereitstellen?
Bei der Größenbestimmung werden die vollständigen 118B-Parameter verwendet, nicht die aktive 8B-Anzahl, da jeder Experte im Speicher bleibt. Bei 4-Bit (NVFP4 oder INT4) benötigen die Gewichte etwa 59 GB, was bequem auf den 128 GB einheitlichen Speicher eines einzelnen DGX Spark passt. Bei FP8 benötigen sie etwa 118 GB, immer noch innerhalb eines einzelnen Spark oder eines einzelnen H200. Bei BF16 benötigen sie etwa 236 GB, was zwei verbundene Sparks oder einen Multi-GPU-Rechenzentrumsknoten erfordert.
Poolside arbeitete mit NVIDIA zusammen, um die Inferenz von der TRT-LLM-Bereitstellung über NVFP4 auf Blackwell bis hin zu einem einzigen DGX Spark zu optimieren. Es wurde Assist vom ersten Tag an geliefert vLLM, SGLangUnd Ollama. Der gehostete Zugriff läuft durch OpenRouterkostenlos bei 256 KB Kontext und kostenpflichtig bei vollem 1 Mio. Kontext für 0,10 $ / 0,20 $ / 0,01 $ professional 1 Mio. Eingabe-/Ausgabe-/Cache-Lese-Tokens. Das Modell ist auch dabei Baseten, Kilo, Höchster Intellekt Prime Lab und ZML.
Wichtige Erkenntnisse
- Laguna S 2.1 ist ein 118B-Gesamt-/8B-aktives MoE-Codierungsmodell mit einem 1M-Token-Kontext, offen unter OpenMDW-1.1.
- Es erreicht 70,2 % bei Terminal-Bench 2.1 und 78,5 % bei SWE-Bench. Mehrsprachige, führende offene Modelle mit offengelegter Größe.
- Bei 4-Bit läuft es auf einem einzelnen NVIDIA DGX Spark; FP8 passt auf einen Spark oder H200, BF16 benötigt zwei.
- Standardmäßiges „maximales Denken“ bestimmt den größten Teil der Punktzahl, zu einem echten Token-Preis (DeepSWE: 16,5 % → 40,4 %).
- Es wurde in weniger als neun Wochen auf 4.096 H200-GPUs trainiert und ist das dritte Modell von Poolside in weniger als drei Monaten.
Quellen: Technik am Pool – Einführung von Laguna S 2.1, Robert McHardy über X, Poolseite auf X Und Hugging Face-Modellkarte.
Asif Razzaq ist CEO von Marktechpost Media Inc.. Als visionärer Unternehmer und Ingenieur setzt sich Asif dafür ein, das Potenzial der künstlichen Intelligenz für das soziale Wohl zu nutzen. Sein jüngstes Unterfangen ist die Einführung einer Medienplattform für künstliche Intelligenz, Marktechpost, die sich durch eine ausführliche Berichterstattung über maschinelles Lernen und Deep-Studying-Nachrichten auszeichnet, die sowohl technisch fundiert als auch für ein breites Publikum leicht verständlich ist. Die Plattform verfügt über mehr als 2 Millionen monatliche Aufrufe, was ihre Beliebtheit beim Publikum verdeutlicht.
