RU /EN
Обсудить проект
← Избранные проекты
Разбор проекта

T2I Model Comparison

Открытое сравнение text-to-image моделей на одном наборе промптов: не подборка удачных кадров, а полный прогон с опубликованным результатом

Что это

Открытое сравнение text-to-image моделей на одном наборе промптов. Не подборка удачных примеров и не оценка «на глаз», а полный прогон: каждый промпт через каждую модель, все результаты опубликованы.

600 промптов, 17 моделей, 10 200 изображений.

Почему появился

Сравнения генеративных моделей обычно строятся на нескольких эффектных картинках, подобранных автором. По ним нельзя понять, как модель ведёт себя на скучном запросе, на длинном описании или на конкретном типе сцены — а именно это решает, подходит ли она для работы.

Единственный способ ответить — прогнать один и тот же набор промптов через все модели и выложить результат целиком, включая неудачные кадры.

Что сделал

Составил набор промптов, прогнал его через 17 моделей на собственном GPU-стеке, опубликовал датасет и интерактивное сравнение. Пайплайн, прогон и публикация — полностью моя работа.

Связь с KRT Studio

Весь массив сгенерирован через KRT Studio — batch-генерацией внутри студии, а не отдельным скриптом.

Это и есть главная проверка платформы на прочность. Первый прогон дал 6 600 изображений на одиннадцати моделях. Затем набор расширился до семнадцати, и итог составил 10 200 изображений — около 72 часов генерации суммарно. Задания шли в фоне, окно можно было закрыть, состояние переживало перезапуск.

Написать генерацию одной картинки просто. Провести без потерь прогон на десятки часов, с переключением моделей и учётом свободной VRAM — задача другого класса, и она решалась на уровне архитектуры: блокировка батча, реестр статусов, сверка состояния.

Что получилось

Датасет — все 10 200 изображений с промптами и параметрами генерации, доступны для собственного анализа.

Интерактивное сравнение — можно выбрать промпт и поставить результаты моделей рядом. Это важнее любой цифры: вместо утверждения «модель A лучше модели B» человек смотрит на конкретный запрос и решает сам.