# Einführung
Qwythos-9B-Claude-Mythos-5-1M ist ein 9B-Argumentations- und Codierungsmodell, das auf Qwen3.5 basiert und für lokale Codierungsworkflows, Agentenentwicklung und Aufgaben mit langem Kontext entwickelt wurde. Das Interessante daran ist, dass es klein genug ist, um auf Client-{Hardware} ausgeführt zu werden, und dennoch leistungsfähig genug ist, um bei praktischen Codierungsaufgaben zu helfen.
In dieser Anleitung zeige ich Ihnen, wie Sie das Mythos-erweiterte Qwythos-Modell lokal ausführen können lama.cppdann verbinden Sie es mit Pi Sie können es additionally als lokalen Codierungsagenten verwenden. Ich verwende eine RTX 4070 Ti Tremendous mit 16 GB VRAM, wodurch ich die Q6_K MTP-Quantisierung bequem ausführen kann. Wenn Sie über eine 8-GB-GPU verfügen, empfehle ich, mit der Q4_K_M-Variante zu beginnen, da diese ein besseres Gleichgewicht zwischen Qualität, Geschwindigkeit und Speichernutzung bietet.
# llama.cpp installieren
Installieren Sie zunächst die offizielle Befehlszeilenschnittstelle (CLI) llama.cpp. Dadurch erhalten Sie Zugriff auf die llama Befehl, einschließlich llama servedie wir verwenden werden, um das Modell lokal auszuführen.
curl -LsSf https://llama.app/set up.sh | sh
Fügen Sie als Nächstes das Installationsverzeichnis zu Ihrem Shell-Pfad hinzu, damit Ihr Terminal es finden kann llama Befehl:
echo 'export PATH="$HOME/.native/bin:$PATH"' >> ~/.bashrc
supply ~/.bashrc
Um zu bestätigen, dass die Set up funktioniert hat, führen Sie Folgendes aus:
Wenn alles korrekt installiert ist, sollten Sie die verfügbaren Befehle und Optionen von llama.cpp sehen.
# Einrichten eines Hugging Face Cache-Verzeichnisses
Stellen Sie die ein Umarmendes Gesicht Speichern Sie den Cache an einem Ort mit ausreichend freiem Speicherplatz. Dies ist besonders nützlich auf Cloud-Maschinen, bei denen das Customary-Dwelling-Verzeichnis über begrenzten Speicherplatz verfügt.
export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"
Um es über neue Terminalsitzungen hinweg beizubehalten, fügen Sie es Ihrer Shell-Konfiguration hinzu:
echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrc
supply ~/.bashrc
# Starten des Qwythos MTP-Modells
Führen Sie das Q6_K MTP GGUF-Modell mit allen verfügbaren GPU-Schichten aus:
llama serve
-hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K"
--alias "qwythos-9b-mtp"
--host 0.0.0.0
--port 8910
--n-gpu-layers all
--ctx-size 100000
--parallel 1
--batch-size 1024
--ubatch-size 512
--flash-attn on
--cache-type-k q8_0
--cache-type-v q8_0
--spec-type draft-mtp
--spec-draft-n-max 6
--threads 12
--threads-batch 24
--temp 0.6
--top-p 0.95
--top-k 20
--repeat-penalty 1.05
--jinja
--perf
Wenn Sie diesen Befehl zum ersten Mal ausführen, lädt llama.cpp die Modelldateien von Hugging Face herunter.
Danach wird das Modell in den GPU-Speicher geladen und ein lokaler Server gestartet.
Sobald das Modell ausgeführt wird, öffnen Sie die lokale Schnittstelle in Ihrem Browser:
Dadurch erhalten Sie auch einen OpenAI-kompatiblen lokalen API-Endpunkt unter:
Die Q6_K-Variante bietet eine bessere Ausgabequalität, verbraucht aber auch mehr Speicher. Wenn Sie auf VRAM- oder RAM-Probleme stoßen, reduzieren Sie diese --ctx-size Erste. Wenn das immer noch nicht reicht, probieren Sie stattdessen die Variante Q4_K_M.
Hier sind die wichtigsten Flags im Befehl:
| Flagge | Zweck |
|---|---|
--n-gpu-layers all |
Verlagert alle unterstützten Schichten auf die GPU. |
--ctx-size 100000 |
Weist ein 100-KByte-Token-Kontextfenster zu. Reduzieren Sie dies, wenn Ihnen der VRAM oder RAM ausgeht. |
--flash-attn on |
Aktiviert Flash Consideration, sofern unterstützt. |
--cache-type-k q8_0 Und --cache-type-v q8_0 |
Reduziert die KV-Cache-Speichernutzung bei gleichbleibend guter Qualität. |
--spec-type draft-mtp |
Aktiviert die spekulative MTP-Dekodierung. |
--spec-draft-n-max 6 |
Ermöglicht bis zu sechs spekulative Token professional Schritt. |
--jinja |
Verwendet die eingebettete Chat-Vorlage des Modells. |
--perf |
Druckt Leistungsstatistiken wie den Token-Durchsatz. |
Auf meiner RTX 4070 Ti Tremendous erreichte ich etwa 81,74 Token professional Sekunde. In meinem Take a look at warfare das Modell auch in der Lage, die Aufgabe zu durchdenken, die erforderlichen Instruments aufzurufen und den aktuellen Goldpreis zurückzugeben, wenn es im lokalen Agenten-Workflow verwendet wurde.
# Set up von Pi und der llama.cpp-Integration
Pi kann eine Verbindung zum lokalen llama.cpp-Server herstellen und das Modell als Codierungsagent verwenden. Der pi-llama Das Plugin wurde entwickelt, um Pi mit einem laufenden lokalen llama.cpp-Server zu verbinden, ohne dass ein externer API-Schlüssel erforderlich ist.
Pi installieren:
curl -fsSL https://pi.dev/set up.sh | sh
Installieren Sie das Plugin llama.cpp für Pi:
pi set up git:github.com/huggingface/pi-llama
Erstellen Sie ein kleines Testprojekt:
mkdir new-project
cd new-project
Standardmäßig sucht das Plugin nach llama.cpp auf Port 8080. In dieser Anleitung läuft unser lokaler Server auf Port 8910, daher müssen wir die richtige lokale API-Adresse festlegen, bevor wir Pi starten:
export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"
Starten Sie nun Pi:
Geben Sie in Pi Folgendes ein:
Wählen Sie den lokalen Modellalias aus:
Das Modell sollte in Pi aufgelistet sein. Sobald Sie es ausgewählt haben, können Sie es als lokalen Codierungsagenten verwenden.

# Testen des Mythos-Enhanced Coding Mannequin mit Pi
Jetzt ist es an der Zeit, das lokale Modell an realen Codierungsaufgaben in Pi zu testen. Ich habe zwei einfache, aber praktische Aufgaben verwendet: ein Browserspiel und ein kleines Python-CLI-Software.
// Erstellen eines einfachen Browsergames
Beginnen Sie mit einer Eingabeaufforderung, die Pi auffordert, ein kleines Browserspiel namens „Beat the AI“ zu erstellen.
Erstellen Sie ein einfaches Browserspiel namens „Beat the AI“.
Der Spieler hat 30 Sekunden Zeit, um kurze Fragen zur Mustererkennung zu beantworten. Jede richtige Antwort erhöht die Punktzahl um eins. Zeigen Sie einen Countdown-Timer, eine Punkteanzeige, einen Fortschrittsbalken und einen Bildschirm mit den Endergebnissen an.
Anforderungen:
– Verwenden Sie nur HTML, CSS und Vanilla-JavaScript.
– Generieren Sie mindestens drei Arten von Fragen, z. B. Zahlenmuster, schnelle Mathematik und Wortlogik.
– Fügen Sie nach Spielende eine Neustart-Schaltfläche hinzu.
– Sorgen Sie dafür, dass sich die Benutzeroberfläche verspielt und elegant anfühlt.
– Halten Sie den gesamten Code leicht verständlich und vermeiden Sie unnötige Dateien.Testen Sie das Spiel im Browser, bevor Sie es beenden.
In meinem Take a look at hat Pi das vollständige Spiel in einer einzigen HTML-Datei mit eingebettetem CSS und JavaScript erstellt, wodurch das Projekt einfach und leicht zu überprüfen bleibt.
Pi fasste dann zusammen, was es erstellt hat, einschließlich des 30-Sekunden-Countdowns, der Punkteverfolgung, des Fortschrittsbalkens, der Fragetypen und der Neustart-Schaltfläche.
Danach habe ich das Spiel im Browser geöffnet, um zu überprüfen, ob es richtig funktioniert.
Das Ergebnis warfare ein ausgefeiltes kleines Spiel mit:
- Ein Countdown-Timer
- Eine Punkteanzeige
- Ein Fortschrittsbalken
- Mehrere Fragetypen
- Ein Neustartablauf nach Spielende
Dies ist ein gutes Beispiel dafür, wie das Modell eine komplette Entrance-Finish-Aufgabe lokal bewältigen kann, ohne dass eine externe API erforderlich ist.
// Erstellen einer CSV-zu-Excel-Python-CLI
Bitten Sie Pi für den zweiten Take a look at, eine kleine Python-CLI zu erstellen, die eine CSV-Datei in eine Excel-Datei konvertiert .xlsx Datei.
Erstellen Sie eine einfache Python-CLI, die eine CSV-Datei in eine Excel-XLSX-Datei konvertiert, Eingabe- und Ausgabedateipfade als Argumente akzeptiert, Spaltenüberschriften beibehält, fehlende Dateien validiert und klare Erfolgs- oder Fehlermeldungen ausgibt. Bevor Sie fertig sind, erstellen Sie eine kleine Dummy-CSV-Datei mit Beispieldaten, testen Sie damit die CLI, überprüfen Sie, ob die Excel-Datei korrekt erstellt wurde, und fassen Sie dann das Testergebnis zusammen.
Pi hat ein Python-Skript mit dem Namen erstellt csv2excel.pygenerierte eine Beispiel-CSV-Datei, führte den Testbefehl aus und fasste dann die Ergebnisse zusammen.
python csv2excel.py sample_data.csv output.xlsx
In meinem Durchlauf zeigte die Zusammenfassung, dass das Skript:
- Akzeptierte Eingabe- und Ausgabedateipfade.
- Die Spaltenüberschriften wurden beibehalten.
- Die Beispieldaten wurden korrekt konvertiert.
- Fehlende Dateien wurden mit eindeutigen Fehlermeldungen behandelt.
- Fehlende Ausgabepfade wurden ordnungsgemäß behandelt.
Ich habe auch die generierte Excel-Datei geöffnet, um zu bestätigen, dass die Ausgabe korrekt warfare.
In der Beispielausgabe wurden die Zeilen und Header korrekt beibehalten, was bestätigte, dass die CLI wie erwartet funktionierte.
# Letzte Gedanken
Ich magazine dieses kleine lokale Codierungsmodell wirklich. Es ist schnell, genau genug für alltägliche Codierungsaufgaben und benötigt nicht viel VRAM, um nützlich zu sein. Sie können es mit Pi verwenden, Claude Code, OpenCodeoder ein beliebiges Codierungssetup, das lokale OpenAI-kompatible oder Anthropic-kompatible Endpunkte unterstützt.
Für einfache Entrance-Finish-Apps, Python-Skripte, CLI-Instruments und schnelle Prototypen funktioniert es überraschend intestine. Sie können nützliche Projekte lokal erstellen, ohne auf externe APIs angewiesen zu sein oder für jede Anfrage zu bezahlen.
Um noch bessere Ergebnisse zu erzielen, empfehle ich dringend, Fähigkeiten zur Websuche hinzuzufügen. Kontext7und andere nützliche Pi-Integrationen. Sie können sich hier auch meinen vollständigen Leitfaden zur Optimierung Ihres Pi-Coding-Agent-Setups ansehen: So richten Sie Kimi K2.7-Code mit Pi ein: Die ultimative KI-Codierungsumgebung.
Abid Ali Awan (@1abidaliawan) ist ein zertifizierter Datenwissenschaftler, der gerne Modelle für maschinelles Lernen erstellt. Derzeit konzentriert er sich auf die Erstellung von Inhalten und das Schreiben technischer Blogs zu maschinellem Lernen und Datenwissenschaftstechnologien. Abid verfügt über einen Grasp-Abschluss in Technologiemanagement und einen Bachelor-Abschluss in Telekommunikationstechnik. Seine Imaginative and prescient ist es, ein KI-Produkt mithilfe eines graphischen neuronalen Netzwerks für Schüler mit psychischen Erkrankungen zu entwickeln.
