Kimi-K3
Kimi K3 is an open-weight, 2.8T-parameter native multimodal agentic model with a 1M-token context window, designed for frontier coding, knowledge work, and reasoning tasks.
该仓库展示了生产级微服务架构的虚拟试衣方案,包含结果缓存、自动清理和GPU健康检查,并通过参数搜索实验在不损失质量的前提下提升了推理速度。
Сервис виртуальной примерки: пользователь загружает свою фотографию, выбирает вещь из каталога бренда IDOL и получает сгенерированное изображение себя в этой вещи. Генерация — локальный инференс диффузионной модели FASHN VTON v1.5 на GPU.
Проект разработан в рамках производственной практики.
Микросервисы в Docker Compose:
| Сервис | Технология | Порт | Роль |
|---|---|---|---|
frontend | React + Vite, nginx | 5173 | Примерочная и демо-карточка товара (подробнее) |
vton_backend | FastAPI | 8000 | Клиентский API: валидация фото, каталог, задачи, выдача результатов |
vton_generator | FastAPI | 8001 | Координатор: регистрирует задачи в очереди Celery |
vton_celery_worker | Celery | — | Инференс FASHN VTON на GPU |
vton_postgres | PostgreSQL 15 | 5432 | Каталог товаров и метаданные задач |
vton_redis | Redis 7 | 6379 | Брокер сообщений Celery |
Путь запроса: фронтенд отправляет фото и id вещи → бэкенд валидирует файл
(JPG/PNG, до 10 МБ), скачивает изображение товара из каталога, создаёт задачу в БД
и передаёт её генератору → генератор ставит задачу в Celery → воркер запускает
пайплайн и сохраняет результат → фронтенд забирает готовую картинку, опрашивая
статус. Изображения между контейнерами передаются не по сети, а через общий том
./media, смонтированный во все сервисы как /app/media.
Что ещё умеет бэкенд:
media/ файлы старше
24 часов — фотографии пользователей не хранятся дольше суток.Понадобятся Docker с Compose, NVIDIA Container Toolkit и веса модели
в ./weights (монтируются в воркер read-only).
docker compose up --build
Для разработки без GPU воркер можно запустить с VTON_REQUIRE_GPU=false
(инференс на CPU медленный — только д
根据分类、Topic 和编程语言匹配的相似项目。
Kimi K3 is an open-weight, 2.8T-parameter native multimodal agentic model with a 1M-token context window, designed for frontier coding, knowledge work, and reasoning tasks.
Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.
A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.