Sber AI
БАГ ОБЕЗВРЕЖЕН 😎
Теперь можно заняться задачками посложнее. Ловите чек-лист, который поможет проверить LLM-сервис перед релизом 👇🏻
🟣 Определите, что считать успехом
Для каждого сценария задайте собственные критерии: правильность ответа, соблюдение формата, выполнение задачи. Отдельно зафиксируйте критические ошибки, с которыми выпускать продукт нельзя.
🟣 Соберите тестовый набор сценариев
Включите реальные пользовательские запросы, известные сбои и пограничные случаи. Например, неоднозначные вопросы, неполные данные, противоречивые условия. Для каждого укажите ожидаемый результат или правила оценки.
🟣 Проверяйте устойчивость
Повторяйте сценарии несколько раз и меняйте формулировки без изменения смысла. Оценивайте долю успешных попыток. Даже хороший ответ может скрывать под собой шанс сбоя.
🟣 Проверяйте результаты работы
Если агент сообщает, что создал заявку, проверьте её наличие в системе. Корректный текст ответа ещё не означает, что инструмент вызван с нужными параметрами и действие выполнено.
🟣 Испытайте границы доступа LLM
Добавьте попытки подменить инструкции через запросы и внешние документы. Проверьте, может ли система раскрыть чужие данные или выполнить действие без разрешения. Ограничения должны действовать на уровне приложения, а не промпта.
🟣 Проверяйте изменения на регрессии
После обновления модели, промпта или инструментов прогоняйте тот же набор тестов. Сравнивайте качество, задержку и стоимость. Найденные в работе ошибки добавляйте в набор.
Обязательно сохраняйте условия каждого прогона, версию модели, промпт, настройки, входные данные и вызовы инструментов. И всё будет работать как надо! Если у вас установлено приложение,
вы можете сразу перейти в канал