Skip to main content
Perplexity представила Q2D-Web — бенчмарк для поиска в ИИ-агентах

Perplexity представила Q2D-Web — новый бенчмарк для оценки поисковых моделей в агентных RAG-системах. Он анализирует начальный этап поиска: может ли ретривер обнаружить необходимые источники до последующих процессов переранжирования и подготовки ответа.

Основой Q2D-Web является корпус из 190 миллионов веб-документов и 69 721 агентно переформулированный поисковый запрос на десяти языках. Создатели подготовили бенчмарк, опираясь на данные около 23 тысяч поисковых сессий в рабочей системе, собранных за девять месяцев. Корпус был сформирован из результатов производственного поиска и после объединения и удаления дубликатов составил примерно 190 миллионов документов.

Читайте также: 5 лучших нейросетей для работы

Что проверяет Q2D-Web

В агентном поиске пользовательский запрос обычно трансформируется в несколько дополнительных запросов. Их формирует агент с учетом исходного сообщения, предыдущих диалогов и уже найденных материалов. Затем ретривер выбирает документы для следующих этапов — переранжирования и подготовки ответа.

Что проверяет Q2D-Web

Q2D-Web проверяет именно этот начальный отбор. Главная метрика — Recall@1000: она демонстрирует, какая доля релевантных документов попала в первую тысячу результатов. Авторы также используют Recall@100 и nDCG@10.

Что проверяет Q2D-Web

Из 69 721 запроса 12 365 являются основными, в то время как 57 356 — вспомогательными. В среднем на один основной запрос приходится приблизительно четыре вспомогательных. Запросы с личными данными были исключены.

Что проверяет Q2D-Web

Что проверяет Q2D-Web

Что проверяет Q2D-Web

Как устроена оценка

Для проверки релевантности авторы применили три набора данных. В первый вошли документы, на которые ссылались ИИ-агенты. Во второй — результаты производственного веб-поиска. Третий объединяет эти данные с оценками языковой модели для документов, которые ранее не имели метки.

Исследователи сравнили 13 ретриверов: лексические, плотные и модели позднего взаимодействия. Результаты варьируются в зависимости от темы, языка и типа запроса. Например, BM25 продемонстрировал наименьший общий Recall@1000, но выявил больше уникальных релевантных документов, которые другие системы пропустили.

Как устроена оценка

Корпус, запросы и оценки Q2D-Web не публикуются, чтобы минимизировать риск попадания тестовых данных в обучение моделей. Открытые ретриверы можно протестировать через публичный рейтинг на Hugging Face. Бенчмарк оценивает лишь поиск источников, а не качество финального ответа агента.

При этом лидерство зависит от выбранной метрики: в объединённом наборе разметки pplx-embed-v1-4b показал лучшие результаты по Recall@1000, а Nemotron-3-Embed-8B — по Recall@100 и nDCG@10.

Ранее Perplexity выпустила исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer.

Изображения: arxiv.org, huggingface.co

Perplexity Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий