Promptfoo или DeepEval: сравнение для production AI. Практический разбор для production AI: место в архитектуре, порядок внедрения, метрики качества и эксплуатации, ограничения и критерии готовности.
Матрица сравнения
| Критерий | Promptfoo | DeepEval |
|---|---|---|
| Качество | golden set и критичные сценарии | тот же набор и пороги |
| Нагрузка | p50/p95, throughput, queue | одинаковые запросы и concurrency |
| Эксплуатация | трейсы, алерты, canary, rollback | тот же production runbook |
| TCO | GPU/API, хранение, команда | горизонты 1 и 3 года |
Как реализовать
Цель — сравнить альтернативы на одинаковой нагрузке и наборе качества. Для темы «Promptfoo и DeepEval» сначала фиксируют пользовательский сценарий, риск ошибки и допустимый бюджет задержки. Затем версионируют модель, prompt, данные и конфигурацию, собирают контрольный набор, определяют SLO и только после этого подключают автоматизацию релиза.
- Опишите пользовательскую задачу. Риск ошибки, допустимые задержка и стоимость.
- Зафиксируйте версии. Модель, prompt, данные, retrieval и параметры.
- Соберите quality gate. Golden set, критичные проверки и пороги.
- Проверьте эксплуатацию. Трейсы, лимиты, нагрузка, безопасность и on-call.
- Выпускайте управляемо. Shadow или canary, fallback и быстрый rollback.
Практический пример
Пример: служба поддержки использует «Promptfoo и DeepEval» в рабочем контуре. Команда задаёт golden set, снимает baseline качества и p95, добавляет трассировку, лимиты и fallback, проводит нагрузочный тест и выпускает изменение через canary. Релиз принимают только при сохранении качества и error budget.
Метрики приемки
| Слой | Что проверять | Красный флаг |
|---|---|---|
| Качество | task success, faithfulness, критичные ошибки | нет стабильного golden set |
| Serving | p50/p95, TTFT, throughput, queue, errors | измеряется только среднее |
| Безопасность | PII, injection, tool permissions, audit | guardrails тестируются вручную |
| Экономика | Основные критерии: качество, p95, throughput, безопасность, TCO и сложность эксплуатации. Дополнительно отслеживаются cache hit rate, доля обрезанного контекста, токены на успешную задачу, стоимость принятого результата, версия модели и prompt, а также время безопасного отката. | считаются токены, но не успешные задачи |
Ограничения и ошибки
Главная ошибка — сравнивать маркетинговые списки функций вместо собственного тестового контура. Для «Promptfoo и DeepEval» нельзя смешивать качество модели, качество приложения и здоровье инфраструктуры: у каждого слоя свои метрики, алерты и ответственные.
Чек-лист готовности
- есть владелец пользовательского результата и риска
- версионируются model, prompt, data и config
- quality gate блокирует деградацию
- настроены traces, metrics, logs и cost allocation
- проверены PII, injection и tool permissions
- есть SLO, fallback, rollback и on-call runbook

