Nieuws
Perplexity AI brengt WANDR uit: open benchmark voor breed en diep onderzoek door AI-agenten
Perplexity AI heeft WANDR (Wide ANd Deep Research) gelanceerd, een open benchmark en evaluatietool voor onderzoeksagenten. WANDR test of agenten grote, op bewijs gebaseerde verzamelingen kunnen bouwen, in tegenstelling tot eerdere benchmarks die zich op één antwoord richten. De benchmark omvat 500 realistische taken voor kenniswerk, zoals het verzamelen van bedrijfsgegevens met ondersteunende bronnen. Perplexity's eigen Search as Code-systeem leidt de ranglijst met een soft F1-score van 0,363, maar geen enkel systeem komt in de buurt van een volledige oplossing.