Sber AI

@SberAIScience
Фото БАГ ОБЕЗВРЕЖЕН 😎 Теперь можно заняться задачками посложнее. Ловите чек-лист, который поможет проверить LLM-сервис перед релизом 👇🏻 🟣 Определите, что считать успехом Для каждого сценария задайте собственные критерии: правильность ответа, соблюдение формата, выполнение задачи. Отдельно зафиксируйте критические ошибки, с которыми выпускать продукт нельзя. 🟣 Соберите тестовый набор сценариев Включите реальные пользовательские запросы, известные сбои и пограничные случаи. Например, неоднозначные вопросы, неполные данные, противоречивые условия. Для каждого укажите ожидаемый результат или правила оценки. 🟣 Проверяйте устойчивость Повторяйте сценарии несколько раз и меняйте формулировки без изменения смысла. Оценивайте долю успешных попыток. Даже хороший ответ может скрывать под собой шанс сбоя. 🟣 Проверяйте результаты работы Если агент сообщает, что создал заявку, проверьте её наличие в системе. Корректный текст ответа ещё не означает, что инструмент вызван с нужными параметрами и действие выполнено. 🟣 Испытайте границы доступа LLM Добавьте попытки подменить инструкции через запросы и внешние документы. Проверьте, может ли система раскрыть чужие данные или выполнить действие без разрешения. Ограничения должны действовать на уровне приложения, а не промпта. 🟣 Проверяйте изменения на регрессии После обновления модели, промпта или инструментов прогоняйте тот же набор тестов. Сравнивайте качество, задержку и стоимость. Найденные в работе ошибки добавляйте в набор. Обязательно сохраняйте условия каждого прогона, версию модели, промпт, настройки, входные данные и вызовы инструментов. И всё будет работать как надо!
Если у вас установлено приложение,
вы можете сразу перейти в канал