Perplexity AI veröffentlicht WANDR: einen offenen Benchmark zur Bewertung von Forschungsagenten, die weit und tief suchen müssen


Rechercheagenten übernehmen bereits heute echte Wissensarbeit. Die Groups delegieren ihnen Wettbewerbskartierung, Due Diligence und Literaturrecherche. Allerdings testen die meisten Benchmarks eine einzelne Antwort und keine großen, evidenzgestützten Sammlungen. Perplexity schließt diese Lücke mit einem neuen offenen Benchmark.

Ratlosigkeit befreit WANDR (Breite und tiefe Forschung). Es handelt sich um ein offenes Benchmark- und Bewertungssystem. Es besteht aus rund 500 realistischen, herausfordernden Datenerfassungsaufgaben für die Wissensarbeit. WANDR ist der große Bruder von Perplexitys DRACO-Benchmark für tiefgreifende Forschung. DRACO fragt, ob ein Agent einen genauen, vollständigen und objektiven Langformbericht erstellt. WANDR fragt stattdessen, ob es eine große Beweissammlung aufbauen kann.

Was ist WANDR

Im Kern testet WANDR zwei Anforderungen gemeinsam. Breit bedeutet, eine große, oft offene Gruppe qualifizierter Einheiten zu entdecken. Tief bedeutet, jedes Unternehmen ausreichend zu untersuchen, um jede Behauptung mit Beweisen zu untermauern. Durch die Kombination beider Faktoren ändert sich das Drawback für die Agenten. Ein paar überzeugende Beispiele reichen hier nicht aus. Eine ausgefeilte Erzählung, die auf unvollständigen Recherchen aufbaut, greift ebenfalls zu kurz.

Um dies zu erfassen, verwendet WANDR ein Composable Qualifikationsschlüsselhierarchie. Eine Aufgabe könnte eine Anforderung sein firm(n) -> worker(m) -> url(okay). Das bedeutet n qualifizierte Unternehmen, jeweils m Mitarbeiter und jeweils okay unterstützende Seiten. Jeder vollständige Pfad durch den Baum wird unabhängig validiert. Dieselbe Struktur kann eine flache Liste, eine verschachtelte Suche oder eine Matrix darstellen.

Ein konkretes Aufgabenbeispiel

Um diese Hierarchie zu begründen, betrachten Sie die Veröffentlichung ceo_cfo_appointments Aufgabe. Gefragt sind mindestens 70 in den USA ansässige Unternehmen. Für jeden muss eine Ernennung zum CEO oder CFO erstmals zwischen dem 1. März und dem 30. April 2026 bekannt gegeben werden. Für jeden stellt der Agent eine maßgebliche Terminseite bereit. Eine Unteraufgabe fügt professional Unternehmen eine Itemizing-Authority-Seite hinzu. Insgesamt erfordert die Aufgabe 140 quellengestützte Datensätze.

Konkret sehen die beiden Hierarchien und ein übermittelter Datensatz so aus:

# Job hierarchies
firm(70) -> company_appointee(1) -> url(1)   # 70 appointment information
firm(70) -> url(1)                           # 70 itemizing information

# One file the grader re-fetches and re-checks (values are illustrative)
{
  "merchandise":     "Instance Corp - new CFO",
  "url":      "https://issuer.instance.com/press/cfo-appointment",
  "excerpts": ("Instance Corp as we speak named Jane Doe as Chief Monetary Officer, efficient April 2026."),
  "reply":   "Jane Doe appointed CFO; introduced April 2026"
}

Realistische Aufgaben, maßstabsgetreu generiert

Über einzelne Beispiele hinaus baut WANDR seine Aufgaben auf der realen Nutzung auf. Es geht von nicht identifizierten Mustern aus, die in der Produktion zu sehen sind, und nicht von synthetischen Eingabeaufforderungen. Eine halbautomatische Pipeline wandelt diese Muster dann in Aufgaben um. Die Pipeline durchläuft vier Phasen: Seeding, Authoring, Zulassung und Kuration. Es verwendet eine verschachtelte Autor-Kritiker-Schleife mit mechanischer Flusenbildung.

Daher erfordert die mittlere Aufgabe insgesamt 50 Mitglieder und 245 Datensätze. Für alle 500 Aufgaben fordert WANDR 170.495 quellengestützte Datensätze. Die Aufgaben sind in 167 Aufgaben mit niedrigerem, 166 mittlerem und 167 höherem Schwierigkeitsgrad unterteilt. Der Schwierigkeitsgrad hängt von der Arbeit professional Datensatz ab, nicht nur vom Maßstab.

Wie WANDR Agenten bewertet

Im Gegensatz zu festen Antwortschlüsseln bewertet WANDR jeden Anspruch anhand der zitierten Beweise. Jeder Datensatz enthält ein Component, eine URL, ausgewählte Auszüge und eine Antwort. Der Bewerter ruft die Seite während der Bewertung erneut ab. Es prüft, ob die Seite nutzbar und im Umfang ist. Anschließend wird überprüft, ob die Auszüge tatsächlich vorliegen und alle Anforderungen erfüllen.

Diese binären Datensatzurteile werden dann in der Hierarchie zusammengefasst. Präzision misst die Qualität dessen, was ein System übermittelt hat. Abrufen misst die qualitätsbereinigte Fertigstellung und füllt etwaige Lücken mit Nullen. Weich Bei Partituren werden unvollständige Mitglieder teilweise angerechnet. Hart Scores zählen nur Mitglieder, deren vollständiger Teilbaum korrekt ist.

Die Benchmark-Ergebnisse

Mit dieser Methode führte Perplexity sechs Produktionssysteme für alle 500 Aufgaben aus. Sein eigenes Search as Code (SaC)-System führt. Dennoch kommt kein System auch nur annähernd an die Lösung des Benchmarks heran.

System Weiches F1 Harte F1 Notizen
Ratlosigkeit (Suche als Code) 0,363 0,133 5,20 $/Aufgabe, durchschnittlich 14,9 Minuten, 3,82 Mio. Token/Aufgabe
Anthropisch 0,249 0,072 Am nächsten an der Qualität, aber mehr Zeit, Geld, Token
Andere (am besten) 0,121 0,035 OpenAI, Exa schneller und günstiger, aber schlechtere Werte

Mit mehr Aufwand erreicht Perplexity einen Gentle-F1-Wert von 0,447 xhigh Einstellung. Die Kosten über alle Einstellungen hinweg erstrecken sich über mehr als vier Größenordnungen. Der Preis reicht von 0,03 $ professional Aufgabe bis zu 324,83 $ professional Aufgabe.

Über die Bestenliste hinaus stechen vier Erkenntnisse hervor. Erstens ist ein teilweiser Fortschritt üblich, eine vollständige Abdeckung jedoch nicht. Jedes System zeigt einen Gentle-Recall unterhalb der Gentle-Präzision. Zweitens verschärft die Größenordnung das Drawback erheblich. Tiefere Hierarchien schaden am meisten, da jede Verzweigung einen Fehlerpunkt hinzufügt. Drittens ist die Entdeckung der erste strukturelle Engpass. Der Erkennungsabschluss auf oberster Ebene liegt systemübergreifend zwischen 0,611 und 0,951. Der größte Teil des fehlenden Volumens ist auf eine Unterlieferung zurückzuführen, nicht auf die Zusammenführung von Duplikaten. Viertens ist es normalerweise einfach, eine brauchbare Seite zu finden. Es ist der schwierige Teil, daraus vollständige Beweise zu machen. Bei Perplexity fehlt auf 41,4 % der Seiten eine wesentliche Anforderung. Außerdem stützen 57,5 ​​% der Auszüge nicht die vollständige Behauptung. Sein weicher F1 fällt von 0,531 bei einer reinen Abrufprüfung auf 0,363 bei der vollständigen Beurteilung.

Insbesondere passt Search as Code intestine zu dieser Aufgabenform. Ein Agent kann Abruf-, Filter-, Fanout-, Be a part of-, Deduplizierungs- und Stopplogik als Programm ausdrücken. Die deterministische Berechnung verarbeitet dann wiederholte Vorgänge außerhalb des Modellkontexts.

Anwendungsfälle mit Beispielen

Praktischerweise ordnet WANDR Jobs zu, die Groups bereits automatisieren. Ein Marktanalyst benötigt jeden qualifizierten Wettbewerber mit passenden Beweisen für jeden. Ein Due-Diligence-Workforce benötigt Dutzende von Unternehmen, dann Eigentümer, Führungskräfte und Finanzierung. Für die Talentsuche sind viele Kandidaten erforderlich, von denen jeder über unterstützende Profilseiten verfügt. WANDR testet genau diese breiten und tiefen Sammelmuster im professionellen Maßstab.

Da die Bewertung professional Datensatz erfolgt, können Groups Fehler präzise lokalisieren. Der Bewertungsbaum isoliert den Verlust durch Entdeckung, Anreicherung oder Beweisextraktion. Diese Diagnose hilft Ingenieuren, jeweils eine Schwachstelle zu verbessern.

Wichtige Erkenntnisse

  • WANDR ist ein offener Benchmark mit 500 evidenzintensiven, umfassenden Aufgaben.
  • Aufgaben verwenden eine Qualifikationsschlüsselhierarchie, die Pfad für Pfad validiert wird.
  • Die Benotung erfolgt referenzfrei; Der Gutachter holt die zitierten Beweise erneut ab und prüft sie.
  • Perplexity Search as Code liegt bei 0,363 Gentle F1 und 0,133 Exhausting F1.
  • Entdeckung und vollständige Beweise bleiben die größten Fehlerquellen.

Schauen Sie sich das an Technische Particulars Und Repo hier. Sie können uns auch gerne weiter folgen Twitter und vergessen Sie nicht, bei uns mitzumachen 150k+ML SubReddit und Abonnieren Unser E-newsletter. Warten! Bist du im Telegram? Jetzt können Sie uns auch per Telegram kontaktieren.

Möchten Sie mit uns zusammenarbeiten, um Ihr GitHub-Repo ODER Ihre Hugging Face Web page ODER Produktveröffentlichung ODER Ihr Webinar usw. zu bewerben? Vernetzen Sie sich mit uns


Asif Razzaq ist CEO von Marktechpost Media Inc.. Als visionärer Unternehmer und Ingenieur setzt sich Asif dafür ein, das Potenzial der künstlichen Intelligenz für das soziale Wohl zu nutzen. Sein jüngstes Unterfangen ist die Einführung einer Medienplattform für künstliche Intelligenz, Marktechpost, die sich durch eine ausführliche Berichterstattung über maschinelles Lernen und Deep-Studying-Nachrichten auszeichnet, die sowohl technisch fundiert als auch für ein breites Publikum leicht verständlich ist. Die Plattform verfügt über mehr als 2 Millionen monatliche Aufrufe, was ihre Beliebtheit beim Publikum verdeutlicht.

Von admin

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert