
Perplexity представила Q2D-Web — новый бенчмарк для оценки поисковых моделей в агентных RAG-системах. Он анализирует начальный этап поиска: может ли ретривер обнаружить необходимые источники до последующих процессов переранжирования и подготовки ответа.
Основой Q2D-Web является корпус из 190 миллионов веб-документов и 69 721 агентно переформулированный поисковый запрос на десяти языках. Создатели подготовили бенчмарк, опираясь на данные около 23 тысяч поисковых сессий в рабочей системе, собранных за девять месяцев. Корпус был сформирован из результатов производственного поиска и после объединения и удаления дубликатов составил примерно 190 миллионов документов.
Читайте также: 5 лучших нейросетей для работы
Что проверяет Q2D-Web
В агентном поиске пользовательский запрос обычно трансформируется в несколько дополнительных запросов. Их формирует агент с учетом исходного сообщения, предыдущих диалогов и уже найденных материалов. Затем ретривер выбирает документы для следующих этапов — переранжирования и подготовки ответа.

Q2D-Web проверяет именно этот начальный отбор. Главная метрика — Recall@1000: она демонстрирует, какая доля релевантных документов попала в первую тысячу результатов. Авторы также используют Recall@100 и nDCG@10.

Из 69 721 запроса 12 365 являются основными, в то время как 57 356 — вспомогательными. В среднем на один основной запрос приходится приблизительно четыре вспомогательных. Запросы с личными данными были исключены.



Как устроена оценка
Для проверки релевантности авторы применили три набора данных. В первый вошли документы, на которые ссылались ИИ-агенты. Во второй — результаты производственного веб-поиска. Третий объединяет эти данные с оценками языковой модели для документов, которые ранее не имели метки.
Исследователи сравнили 13 ретриверов: лексические, плотные и модели позднего взаимодействия. Результаты варьируются в зависимости от темы, языка и типа запроса. Например, BM25 продемонстрировал наименьший общий Recall@1000, но выявил больше уникальных релевантных документов, которые другие системы пропустили.

Корпус, запросы и оценки Q2D-Web не публикуются, чтобы минимизировать риск попадания тестовых данных в обучение моделей. Открытые ретриверы можно протестировать через публичный рейтинг на Hugging Face. Бенчмарк оценивает лишь поиск источников, а не качество финального ответа агента.
При этом лидерство зависит от выбранной метрики: в объединённом наборе разметки pplx-embed-v1-4b показал лучшие результаты по Recall@1000, а Nemotron-3-Embed-8B — по Recall@100 и nDCG@10.
Ранее Perplexity выпустила исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer.
Изображения: arxiv.org, huggingface.co


