Доклад

ONNX и Web AI/ML в продакшене: возможности, ограничения и реальная архитектура

  • AI

1. Зачем вообще ONNX на клиенте? Сравнение серверного инференса и клиентского: латентность, стоимость, приватность данных. Когда это оправдано, а когда антипаттерн.

2. Архитектура: как это устроено в продакшене. Схема: Web Worker — ONNX Runtime Web результат в UI. Почему модель нельзя грузить в main thread.

3. Web Workers как основа изоляции инференса.

4. Кеширование модели.

5. Реальные грабли. Размер модели и время первой загрузки: что делали. Квантизация модели: fp32 — int8.

6. Метрики и мониторинг. Как измерять время инференса на клиенте. Что отправлять в аналитику, чтобы понять деградацию.

7. Итог: что реально сложно, а что проще, чем кажется. Честный вывод: production readiness ONNX Runtime Web.

Спикеры

Доклады