Компания Sandboxer разработала корпоративную платформу на базе искусственного интеллекта для проведения экзаменов, но столкнулась с множеством трудностей. Основной проблемой оказалась не система с таймерами и адаптивностью, а создание вопросов — это изначально выглядело как самая простая задача. Движок был разработан всего за неделю, а работа над вопросами продолжается до сих пор. В этом контексте и заключается суть проблемы. Руководитель проектов и продуктов Sandboxer Ольга Заречная поделилась с IT Speaker, почему это произошло и как работать с генерируемым контентом.

Персонал и временные затраты: основные препятствия аттестации
В крупных организациях с регулярной аттестацией процесс подготовки экзаменов обычно занимает от трех недель до нескольких месяцев: появляется новый регламент, методист формирует 50-200 вопросов на курс, эксперт по теме проверяет черновик и вносит правки, HR проверяет на соответствие требованиям, запускается пилотная группа, снова правки, а затем релиз.
Здесь трудности заключаются в двух аспектах. Во-первых, нехватка квалифицированных методистов. При большом количестве регламентов очередь за специалистами становится критической. Во-вторых, ресурсы для проведения аттестации. Сбор людей, организация площадки, назначение наблюдателей, ручная обработка результатов — все это требует времени и средств, которые умножаются на количество сотрудников и частоту аттестаций.
Поэтому перед Sandboxer стояла задача сократить путь от документа до готового пакета вопросов. Важно было не заменить эксперта, а устранить наиболее затратную и рутинную часть его работы.
Первый опыт – неудача
Первые прототипы компания разрабатывала по следующей схеме: загрузить документ, написать промпт с инструкциями, получить список вопросов. Модель функционировала, но качество ответов оставляло желать лучшего, что заставило искать альтернативные решения. Среди основных недостатков были:
-
тематические несоответствия. В документе из 15 разделов половина вопросов касалась лишь одного раздела, в других – по одному вопросу или вообще без них;
-
поверхностные формулировки. «Что такое X?», «Назовите три принципа Y» – вопросы, которые проверяют лишь память, а не понимание. Экзамен же должен оценивать способность применить знания, а не просто пересказать определения;
-
дубли в различных формулировках. Модель создает пять идентичных вопросов, просто перефразировав их;
-
непредсказуемость. На один и тот же промпт можно получить разные результаты по структуре, количеству вопросов, детализации.
В России наблюдается рост спроса на промпт-специалистов на 52%
Анатомия корректной генерации
В дальнейшем команда решила разбить большой промпт на этапы, каждый из которых отвечает за выполнение конкретной задачи:
-
анализ документа. Платформа создает карту: о чем документ, его темы, как они соотносятся по объему и значимости. Было введено правило: если по теме нельзя задать более одного осмысленного вопроса – вероятно, это часть более широкой темы. Это улучшило структуру;
-
план генерации. Перед созданием вопросов система составляет план: сколько вопросов на каждую тему, какой уровень сложности;
-
генерация по заданной схеме. Модель заполняет фиксированную структуру: вопрос, варианты ответов, правильный ответ, объяснение, ссылка на раздел документа. Если что-то идет не так – повторный запрос с уточнением;
-
автоматическая проверка. Каждый вопрос проходит серию проверок: нет ли дублирующих вопросов в базе, правильно ли он привязан к теме, однозначен ли ответ. Затем он отправляется на доработку или помечается для эксперта;
-
ревью эксперта. Он принимает вопрос, изменяет формулировку или отклоняет. Окончательное решение всегда остается за человеком с предметными знаниями.
Адаптивность как новая философия аттестации
Создание банка вопросов – это лишь половина задачи. Главной целью было сделать так, чтобы платформа функционировала как настоящий экзаменатор. В стандартных тестах «выбери один из четырех» можно угадать, заучить правильные ответы на конкретные вопросы и пройти аттестацию, не понимая сути регламента. Адаптивный формат это исключает: экзамен направлен на выявление пробелов в знаниях.
Как это работает: если человек отвечает на вопрос не точно – платформа не учитывает неверный ответ и не переходит дальше. Она задает уточняющий вопрос, чтобы выяснить, где именно пробел. Если ответ четкий и правильный – следующий вопрос проверяет уже его понимание: сможет ли он применить это в конкретной ситуации или просто заучил формулировку.
Под эту логику и строилась генерация: в банке должны быть вопросы различных уровней и типов, которые можно комбинировать в зависимости от ответов.
В РФ создадут единую платформу управления ИТ-сервисами
Ручная настройка
Промпт – это не просто инструкция, а настройка под конкретную модель: как она отвечает, где обычно возникают ошибки, как воспринимает неоднозначные требования. Работая долго с одной моделью, начинаешь адаптироваться под ее особенности: устанавливаешь ограничения там, где она дает сбой, подбираешь формулировки, которые она воспринимает правильно.
Команда Sandboxer ощутила это, когда пришлось перейти на другую модель. Причины могут быть разными: провайдер обновляет версию, появляется более качественная альтернатива, меняются финансовые условия. У них подобное случалось несколько раз: все настроенные промпты переставали работать так, как раньше. Они не выдавали ошибку, но результаты отличались. Например, изменялось распределение вопросов, стиль, поведение, которое ранее было предсказуемым.
На основании этого Sandboxer сделала несколько выводов:
-
промпт – это не продукт, а параметр. Его необходимо хранить с привязкой к конкретной версии модели и проверять при каждом обновлении;
-
строгие проверки на выходе важнее качественного промпта. Чем жестче автоматические проверки результата, тем меньше зависимость от поведения конкретной модели;
-
эксперт в процессе. Ревью эксперта делает систему более устойчивой. Он замечает ухудшение качества раньше, чем любые автоматические тесты.
Три проблемы Sandboxer
Платформа функционирует, основной процесс стабилен, имеется интерфейс для проверки вопросов. В настоящее время запущен пилотный проект с реальными клиентами. Sandboxer также выявила области, где остаются трудности: дубли по смыслу, специфические отраслевые документы в нефтехимии, промышленной безопасности, медицине, которые требуют индивидуальной настройки. Отдельной сложностью является смена модели. Главным выводом компании стала мысль о том, что генерация контента – это не просто промпт, это целый процесс. Промпты устаревают, а в процессе необходима деятельность человека.
«Юзтех» запустил ИИ-платформу «Лонч» для бизнеса


