MIG vs time slicing: стоимость, качество и эксплуатация. Практический разбор для ИИ в рабочей среде: место в архитектуре, порядок внедрения, метрики качества и эксплуатации, ограничения и критерии готовности.
Матрица сравнения
| Критерий | MIG | time slicing |
|---|---|---|
| Качество | эталонный набор (golden set) и критичные сценарии | тот же набор и пороги |
| Нагрузка | p50/p95, пропускная способность и очередь | одинаковые запросы и параллелизм |
| Эксплуатация | трассировки, оповещения, канареечный выпуск и откат | та же эксплуатационная инструкция (runbook) |
| TCO | GPU/API, хранение, команда | горизонты 1 и 3 года |
Как реализовать
Цель — сравнить альтернативы на одинаковой нагрузке и наборе качества. Для темы «MIG и time slicing» сначала фиксируют пользовательский сценарий, риск ошибки и допустимый бюджет задержки. Затем версионируют модель, инструкцию модели, данные и конфигурацию, собирают контрольный набор, определяют SLO и только после этого подключают автоматизацию релиза.
- Опишите пользовательскую задачу. Риск ошибки, допустимые задержка и стоимость.
- Зафиксируйте версии. Модель, инструкция (prompt), данные, поиск контекста (retrieval) и параметры.
- Соберите контроль качества (quality gate). Эталонный набор, критичные проверки и пороги.
- Проверьте эксплуатацию. Трассировки, лимиты, нагрузка, безопасность и дежурство (on-call).
- Выпускайте управляемо. Теневой или канареечный выпуск, резервный сценарий и быстрый откат.
Практический пример
Пример: модерация контента использует «MIG и time slicing» в рабочем контуре. Команда задаёт эталонный набор, снимает базовый уровень качества и p95, добавляет трассировку, лимиты и резервный сценарий, проводит нагрузочный тест и выпускает изменение по канареечной схеме. Релиз принимают только при сохранении качества и соблюдении бюджета ошибок.
Метрики приёмки
| Слой | Что проверять | Красный флаг |
|---|---|---|
| Качество | успешность задачи, соответствие источникам, критичные ошибки | нет стабильного эталонного набора |
| Обслуживание моделей | p50/p95, TTFT, пропускная способность, очередь, ошибки | измеряется только среднее |
| Безопасность | персональные данные (PII), внедрение инструкций, права инструментов, аудит | защитные ограничения проверяются вручную |
| Экономика | Основные критерии: качество, p95, пропускная способность, безопасность, TCO и сложность эксплуатации. Дополнительно отслеживаются доля попаданий в кеш, доля обрезанного контекста, токены на успешную задачу, стоимость принятого результата, версии модели и инструкции модели, а также время безопасного отката. | считаются токены, но не успешные задачи |
Ограничения и ошибки
Главная ошибка — сравнивать маркетинговые списки функций вместо собственного тестового контура. В теме «MIG и time slicing» нельзя смешивать качество модели, качество приложения и здоровье инфраструктуры: у каждого слоя свои метрики, оповещения и ответственные.
Чек-лист готовности
- есть владелец пользовательского результата и риска
- версионируются модель, инструкция (prompt), данные и конфигурация
- контроль качества блокирует деградацию
- настроены трассировки, метрики, журналы и распределение затрат
- проверены персональные данные, внедрение вредоносных инструкций и права инструментов
- есть SLO, резервный сценарий, откат и инструкция для дежурной смены

