Sakana AI veröffentlicht Fugu-Cyber: Ein Orchestrierungsmodell mit 86,9 % bei CyberGym und 72,1 % bei CTI-REALM


Sakana AI wurde veröffentlicht Fugu-Cyber (Modell-ID ist fugu-cyber-v1.0), eine auf Cybersicherheit spezialisierte Ergänzung seiner Fugu-Orchestrierungsfamilie. Es handelt sich nicht nur um ein neues Grenzmodell. Es ist ein dritter Endpunkt auf der Fugu-Orchestratoraus Sicherheitsgründen optimiert. Sakana hat diesen Orchestrator einen Monat zuvor eingeführt.

Sakana meldet eine Erfolgsquote von 86,9 % bei CyberGym und 72,1 % bei CTI-REALM. Es beschreibt diese Ergebnisse als vergleichbar mit Cyber-fokussierten Frontier-Modellen wie GPT-5.5-Cyber ​​und Claude Mythos Preview.

Was die beiden Benchmarks tatsächlich messen

Die beiden Bewertungen stehen an entgegengesetzten Enden eines Sicherheitsworkflows:

  • CyberGym ist ein UC Berkeley-Benchmark von 1.507 realen Schwachstellen in 188 OSS-Fuzz-Projekten. In seiner Hauptaufgabe erhält ein Agent eine Schwachstellenbeschreibung und eine ungepatchte Codebasis. Es muss einen Proof-of-Idea schreiben, der den Pre-Patch-Construct zum Absturz bringt, nicht jedoch den Put up-Patch-Construct. Dieser Überprüfungsschritt macht es schwierig, den Benchmark zu manipulieren.
  • CTI-REALM ist Microsofts Open-Supply-Erkennungs-Engineering-Benchmark. Microsoft hat 37 öffentliche Bedrohungsberichte aus Quellen wie Datadog Safety Labs, Palo Alto Networks und Splunk kuratiert. Ein Agent muss MITRE ATT&CK-Techniken zuordnen, Telemetrie untersuchen, KQL-Abfragen iterieren und validierte Sigma-Regeln ausgeben. Die Bewertung umfasst Linux-Endpunkte, Azure Kubernetes Service und Azure Cloud.

Zusammen umfasst das Paar „den Fehler finden und beweisen“ und „Informationen in eine Erkennung umwandeln“. Diese Formulierung ist der am besten vertretbare Teil von Sakanas Ankündigung.

Wo 86,9 % gegen das Feld sitzen

Der Kontext ist wichtiger als die Zahl.

Wenn die CyberGym-Forscher veröffentlicht Ihren ersten Ergebnissen zufolge erreichte die beste Agent-Modell-Paarung etwa 20 %. Anthropic meldete unten 83,1 % für Claude Mythos Preview Projekt Glasswing im April 2026. OpenAI meldete 85,6 % für seine Aktualisierung GPT-5.5-Cybergegenüber 81,8 % für GPT-5.5. Sakanas 86,9 % sind daher ein kleiner Schritt über die gemeldete Grenze hinaus, kein Sprung.

CTI-REALM ist eine andere Geschichte. Die eigene Bewertung von Microsoft ordnete die besten drei Konfigurationen, alle Claude, in einem Bereich von 0,624 bis 0,685 ein. Die 72,1 % von Fugu-Cyber ​​würden über diesem Bereich liegen. Eine Einschränkung ist wichtig. CTI-REALM wird als Trajektorienbelohnung zwischen 0 und 1 bewertet. Es handelt sich nicht um eine Erfolgs-/Fehlerquote. Sakana nennt es jedenfalls eine Erfolgsquote.


Wie die Orchestrierung funktioniert

Fugu ist selbst ein Sprachmodell. Es ist darauf trainiert, eine Abfrage zu lesen und im laufenden Betrieb ein Agentengerüst aufzubauen. Anschließend werden Unteraufgaben an spezialisierte Modelle in einem Pool delegiert.

Der Ansatz ist in der dokumentiert Technischer Bericht von Fugu und zwei ICLR 2026-Papiere, DREIEINIGKEIT Und der Dirigent. TRINITY weist Denker-, Arbeiter- und Prüferrollen über mehrere LLMs hinweg zu. Der Dirigent erlernt durch Verstärkungslernen Koordinationsstrategien in natürlicher Sprache.

Für die Sicherheitsarbeit ist das Sakana-Forschungsteam der Ansicht, dass es auf die Rolle des Prüfers ankommt. Eine potenzielle Schwachstelle, die von einem Agenten entdeckt wird, wird von auf Sicherheit spezialisierten Unteragenten validiert, bevor ein Patch vorgeschlagen wird. Das Routing bleibt proprietär, sodass Sie nicht sehen können, welches Modell welchen Schritt ausgeführt hat.

Zugang, Richtlinien und Preis

Fugu-Cyber ​​ist auf vier Dimensionen beschränkt.

Für den Zugang ist ein Antragsformular mit Angabe des beabsichtigten Anwendungsfalls und verifizierter Kontaktdaten erforderlich. Das Sakana-Group überprüft jeden einzelnen Vorgang manuell. Das Modell wird unter einer aktualisierten Richtlinie zur akzeptablen Nutzung geliefert, die beleidigenden Missbrauch verbietet. Die Abrechnung ist auf den Token-Plan beschränkt. Die Abonnementstufen 20 $, 100 $ und 200 $ decken nur Fugu und Fugu-Extremely ab. Und die Fugu-API wird weder in der EU noch im EWR angeboten, während Sakana auf die Einhaltung der DSGVO hinarbeitet.

Der Preis ist auf 6 $ professional Million Enter-Tokens, 36 $ Output und 0,60 $ zwischengespeicherten Inputs festgelegt. Alle drei Raten verdoppeln sich über einem 272K-Token-Kontext. Jede Zeile kostet genau das 1,2-fache der Fugu-Extremely-Charge, eine pauschale Prämie von 20 % für den Cyber-Endpunkt. Lange Codebasisläufe überschreiten leicht 272 KB, sodass die doppelte Ebene kein Grenzfall ist.


Wichtige Erkenntnisse

  • Fugu-Cyber ​​ist ein Orchestrierungsendpunkt, kein neues Grenzmodell, das am 21. Juli 2026 eingeführt wurde.
  • Sakana gibt 86,9 % bei CyberGym und 72,1 % bei CTI-REALM an, sowohl nach eigenen Angaben als auch nicht repliziert.
  • Diese Ergebnisse übertreffen die 85,6 % von GPT-5.5-Cyber ​​und die 83,1 % von Claude Mythos Preview bei CyberGym.
  • Der Zugriff ist gesperrt: manuelle Genehmigung, AUP für defensive Nutzung, nur Token-Plan, keine EU/EWR, keine Gewichtungen.
  • Sakanas eigene Place ist, dass eine leistungsfähige API zusammen mit menschlicher Sicherheitsexpertise besser ist als die API allein.


Asif Razzaq ist CEO von Marktechpost Media Inc.. Als visionärer Unternehmer und Ingenieur setzt sich Asif dafür ein, das Potenzial der künstlichen Intelligenz für das soziale Wohl zu nutzen. Sein jüngstes Unterfangen ist die Einführung einer Medienplattform für künstliche Intelligenz, Marktechpost, die sich durch eine ausführliche Berichterstattung über maschinelles Lernen und Deep-Studying-Nachrichten auszeichnet, die sowohl technisch fundiert als auch für ein breites Publikum leicht verständlich ist. Die Plattform verfügt über mehr als 2 Millionen monatliche Aufrufe, was ihre Beliebtheit beim Publikum verdeutlicht.

Von admin

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert