InfiniteMeltdown GitHub avatar

summer-practice-repack

InfiniteMeltdown

A virtual try-on service where users upload a photo and select a garment from the IDOL brand catalog to generate a realistic image of themselves wearing it, powered by the FASHN VTON v1.5 diffusion model.

Stars

5

7-day growth

No data

Forks

0

Open issues

0

License

No data

Last updated

2026-07-28

AI repository intelligence
FR-AI / ANALYSIS

Why it is worth attention

It demonstrates a production-ready microservice architecture for virtual try-on with caching, automatic cleanup, and GPU health checks, along with a parameter search experiment that improved inference speed without quality loss.

Who it is for

  • Developers building virtual try-on or similar image generation services
  • E-commerce companies exploring AI-based garment visualization
  • ML engineers working with diffusion models for fashion applications
  • Students or teams implementing production-grade microservices with GPU inference

Use cases

  • Online retail: allow customers to preview clothing on their own photos before purchase
  • Fashion design: visualize how a new garment looks on different body types
  • Personalized shopping experiences: create custom try-on results for users
  • Prototyping virtual fitting rooms for brand catalogs

Strengths

  • Microservice architecture with clear separation of concerns (frontend, API, generator, worker)
  • Result caching via SHA-256 hashing avoids redundant inference
  • Auto-cleanup of user images older than 24 hours enhances privacy
  • Fail-fast GPU validation at worker startup prevents silent failures

Considerations

  • Requires a GPU with at least 8 GB VRAM for inference
  • Only integrated with the IDOL brand catalog; not a generic solution
  • CPU-only inference is extremely slow and only suitable for debugging

README quick start

Виртуальная примерка одежды (VTON)

Сервис виртуальной примерки: пользователь загружает свою фотографию, выбирает вещь из каталога бренда IDOL и получает сгенерированное изображение себя в этой вещи. Генерация — локальный инференс диффузионной модели FASHN VTON v1.5 на GPU.

Проект разработан в рамках производственной практики.

Как это устроено

Микросервисы в Docker Compose:

СервисТехнологияПортРоль
frontendReact + Vite, nginx5173Примерочная и демо-карточка товара (подробнее)
vton_backendFastAPI8000Клиентский API: валидация фото, каталог, задачи, выдача результатов
vton_generatorFastAPI8001Координатор: регистрирует задачи в очереди Celery
vton_celery_workerCeleryИнференс FASHN VTON на GPU
vton_postgresPostgreSQL 155432Каталог товаров и метаданные задач
vton_redisRedis 76379Брокер сообщений Celery

Путь запроса: фронтенд отправляет фото и id вещи → бэкенд валидирует файл (JPG/PNG, до 10 МБ), скачивает изображение товара из каталога, создаёт задачу в БД и передаёт её генератору → генератор ставит задачу в Celery → воркер запускает пайплайн и сохраняет результат → фронтенд забирает готовую картинку, опрашивая статус. Изображения между контейнерами передаются не по сети, а через общий том ./media, смонтированный во все сервисы как /app/media.

Что ещё умеет бэкенд:

  • Кэш результатов. Перед запуском инференса считаются SHA-256-хэши обоих изображений; если такая пара с той же категорией уже успешно обработана — результат возвращается мгновенно.
  • Автоочистка. Фоновая служба раз в час удаляет из media/ файлы старше 24 часов — фотографии пользователей не хранятся дольше суток.
  • Fail-fast проверка GPU. Воркер при старте проверяет CUDA, библиотеки cuDNN и CUDAExecutionProvider в ONNX Runtime и падает с внятной ошибкой, если GPU-окружение сломано, — а не на первом запросе пользователя.

Запуск

Понадобятся Docker с Compose, NVIDIA Container Toolkit и веса модели в ./weights (монтируются в воркер read-only).

docker compose up --build

Для разработки без GPU воркер можно запустить с VTON_REQUIRE_GPU=false (инференс на CPU медленный — только д

Related repositories

Similar projects matched by category, topics, and programming language.

MoonshotAI
Featured
MoonshotAI GitHub avatar

Kimi-K3

Kimi K3 is an open-weight, 2.8T-parameter native multimodal agentic model with a 1M-token context window, designed for frontier coding, knowledge work, and reasoning tasks.

AI & Machine LearningAI Agents
3,348
lopopolo
Featured
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI & Machine LearningAI Agents
2,390
slvDev
Featured
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI & Machine LearningLarge Language Models
1,960