Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
Из этого я взял лору Лайт2х лору от Киджая (ужатую), 8 (7) шагов euler beta, Sol, и получается заебато, конечно. Спектрум, как мне показалось, толком тут уже не работает, пропуск 1-2 шагов погоды не делает, ИМХО. Сажа включена по умолчанию, флагом в sh, что ты мне сделаешь.
Я хз как вы смотрите, турбо лора реально не даёт слоумо и следует промпту так же эффективно, выполняя порядок действий на протяжени 15 секунд, что и ориг, при этом прирост от х3 до х5, и это самая первая сырая версия.
блядь как же я заебался заставить сэйдж работать, куда обновил, колесо прикрутил, всё пишет что работает, а на ноде всегда ошибка вылезает. 6 часов убил на эту хуйню
>>1670688 бле ананас, спектрум то работает, не кто не спорит и время уменьшается, но ты прикинь если у тебя под турбо лорой из 6 шагов, полноценных только 3
это на обычной генерации скип еще компенсируется, на турбе это сразу деградация картинки
>>1670698 Его можно в comfy подключить, ёбаный рот, какие вы все однобокие экспериментаторы хуевы, только циферки дрочить в готовых инструментах можете.
Ну я сравнил ориг + ртх + дено. Дено действительно мылит, но на ртх без дено видно увеличенные артефакты, короче, ну чу-у-у-уточку лучше с ртх и еще чу-у-у-уточку лучше с дено => ртх. Но за 2,5 секунды как будто и даром. Надо тестить мелкие разрешения теперь.
Как же r2v ебёт это просто сказка! Я охуел. Тут даже лоры не нужны. Единственный минус - звуковые эффекты. Но по идее и их можно пофиксить через прикрепляемое аудио.
>>1670751 Двачую. Вообще реф это монстр. Вот я взял лору, сгенерил хенджоб. А там вместо пениса бодихоррор. Ну я думал подождать лору сначала, а потом вспомнил про реф моделку. По итогу в качестве рефа дал рандомную пикчу пениса и вообще отлично вышло.
>>1670741 На. Я все прошлые выходные пытался соединить эти две картинки в одну, нихуя не выходило либо выходило криво. А вчера с первой попытки сделал видеорил, именно то что мен нужно. Хотел пикчу, а получил видос в 1080 рублей. Кадр с тележкйо тоже заебался делать, ван её все время двигал, чтобы я ему не говорил. Эйч три с первого раза взял нужный ракурс.
Пытаюсь использовать две картинки с персонажами и видео в качестве референса их движений (типа, чтобы два моих персонажа танцевали как на видео). Но в итоге каждый раз получаю тупо видео ряд из референсного видео. Вроде бы всё делаю, как в гайде написано. Мой промпт: subject_definitions: <Subject 1> is the woman from <Picture 0> dancing like in a <Video 0> <Subject 2> is the man from <Picture 1> dancing like in a <Video 0>
summary: [reference generation] The target video is a dark scene where <Subject 1> and <Subject 2> dancing like in a <Video 0>.
detailed_description: The target video is in a realistic, documentary style with natural lighting and a static camera. [Shot 1] The video opens with <Subject 1> which dances with <Subject 2>. <Subject 1> and <Subject 2> smiles. Static camera.
overall_soundscape: Quiet street noise can be heard on the background.
non_diegetic_music: A romantic melody plays in the background.
Пробовал исправлять с помощью DeepSeek - результат тот же. Использую стандартный воркфлоу из темплейтов для ref2va.
>>1670863 Прогони референесное видео через DWPose или Depth Anything.
Есть еще одна мутная тема с размерам референса. По ощущениям если он совпадает с конечным разрешением, то больше шансов, что модель его затянет как есть в кадр и наоборот.
Какой положняк по двум турболорам? И как использовать первую в стандартном лоадере - ругается миллионом сообщений вида [WARNING] lora key not loaded: blocks.39.adaln_proj.linear.lora_A.weight
>>1670850 У меня ref2va на 5060ti 16 gb (+ 80 gb RAM) с одной картинкой-референсом на модели int8 c 16 шагами 5 секунд видео 1280 x 736 на дефолтном воркфлоу генерится примерно 15-16 минут
Охуел конечно, как оно легко с камерой работает, представляя те же объекты со всех возможных ракурсов. И это на голом ворке из комфи. Надо обмазаться по полной.
>>1670914 в теории если турбу ебашишь то аудио надо на 6 выкрутить при 4-8 шагах, по умолчанию и так 12 и 3 используются и только увеличиваешь время генерации из-за лишнего патча
бля какой подгон сделали китайцы конеш, хуй представишь что какой то ван или лтх могли бы сделать хоть чтото похожее. без всяких лор на стоковой модели. Пиздец конеш базированые китайцы, правда походу над было ставить побольше секунд, а то они прям зарашили. Но вот вернулось то что умерло с лтх, а именно кайф в придумывании промптов всяких так еще и качество как будто ты корпу юзаешь, ток бесплатно и без цензуры
>>1670918 -> >>1668830 → >Но если по картинке с референсом модель не сделает рол с каким нибудь иллитидом сосущем ебушем рот тянки, то выкладывать рил будет нечего, ван с лорами останется на пьедестале. Ну и как, ван всё ещё на пьедестале?
>>1670926 Но у LTX всё же звук получше будет. Я хоть и тоже в восторге от китайцев, но расстроен из за того что вместо минутных LTX видосов моя система едва способна на видосы в 15-20-сек в лоу резоолюшене, какой то дауншифтинг или очередная заявка на полумилионный апгрейд системы :( Также не совсем понял почему Ref2VA по одной пикче генерит результирующее видео раз в 10 дольше чем FL2VA, того же разрешения и той же длительности.
>>1670993 ну кстати чтобы чисто прогнать посмотреть как промпт будет работать можно вообще все ускорялки включить, результат будет кал но что то видно будет
Что-то этот RTX super reso слишком дофига памяти жрет. Пару раз проскочило по 300 сек, а после уже на 2-3 минуты дольше, потому что на его этапе память забивается на 99-100% (32 + 100 подкачки). А еще как отключить сохранение аж двух результатов, с аудио и без? Жестак тоже не резиновый...
Турбо лора ускорила мою фигню почти в 2 раза, но как-то без восторгов. Есть подводные, да и r2v мимо, а это главный режим. r2v для годноты, i2v для порнухи, t2v для хуйни. Лучше бы только годноту ускорила.
>>1671011 У мивимекса проблем с сосанием нет (как в принципе с погружением твердого хуя в любую дыру, коей рот и является. Есть проблема с режиссированнием сосания, надо все посекундно расписывать, иначе как во всех 5+ сек генераторах нейронка лениться и забивает хрон однотипным примитивным повторяющимся действием. То есть, так и пишешь [0-3c) заглотила хуй [3-6c) вытащила изо рта облизала [6-9c) снова заглотила подрочила себе на лицо хз че там у тебя, у мамки своей спроси она распишет детальней.
То что выше писали про звуки сосания, там надо подбирать правильные прилагательные просто "гаггинг" даст звук кашля похожий на звук пилы по дереву, звук сосания часто включает режим пылесоса. Но даже с правильными прилагательными прилагательными иногда происходит отвал и звук сильно искажается превращаясь в хруст, я так понял это какой-то косяк самого мивимекса на специфическом контексте.
Те кто пишут, что минисракс не тренировали на порно - долбоебы. Он прекрасно знает теги порнофильм и т.д. То что там гениталии попердолены, так это проблема всех нейронок с первого дня, даже объяснять лень тупоголовым хлебушкам. Гениталии так же точно попердолены и у корпов, и пездояйца грока и хуи бабские все это видели все на гроке, сидримсе и так далее, везде где был отвал цензуры. Наоборот, в отличии от ван22, искоропки мивимекс генерит стабильно какой-никакой но хуеподобный отросток, а не деревянную палку или еще какой треш. Там даже головка и яйки в наличии. Это всё тюны/лоры, но даже сейчас легко купируется и2в с нормальным хуем на картинке, после вынимания его откуда угодно он в 70% даже форму головки держит.
По факту, все остальные лтксы (прости господи, искренне жаль тех кто вообще зарился на эту парашу ебаную), ваны и так далее можно удалять нахуй.
>>1671015 не у всех женщин брухля с выпадающим клитором, это индивидуально. бугорок, конечно, скорее всего, должен быть виден, но можно сослаться на то, что ноги прижаты вместе.
>>1671014 Если ты там здорово наебался с сосательным промптом, мож поделишься? Неохота шишки самому набивать По поводу аудио тут советовали взять реф, надо попробовать взять секунд 10 с прона и с каким нибудь partially_copy/reference запихнуть в промпт
>>1671015 прикинь, инцелишка, в реале клитор не болтается как хуй. модератор, тут 24-летнее тело, просто с сиськами и сложением не повезло, не триггерись плез.
>>1671016 Не знаю, как-то неестественно выглядит все равно, намек на наличие клитора в верхней части щелки (особенно настолько высоко поднятой) все равно должен быть. можешь перефорсить и сказать, что клитор это маленький хуй, а хуям не место в генерации тяночек
>>1671017 А если в реф крупный план сунуть и в смене кадра сослаться на него?
Вот вам идейка для теста - не просто зеркало, а ещё и "sharp shadows on the wall". На некоторых настройках отражённые тени своей жизнью жить начинают =)
>>1671018 >Если ты там здорово наебался с сосательным промптом, мож поделишься? Не могу скинуть по очевидным причинам. Но я не писал сам с нуля, ты можешь просто адоптировать готовые вановские простыни которые в нф часто кидают, либо используя промпт для агента сделать в любой нейронке, дипсик например.
>По поводу аудио тут советовали взять реф, Тут в треде половина видосов с прегенерированными рефами на звук, так что оно норм сработает. Так же если тебе нужны крупные планы, то ты можешь как в стандартном примере с бабой на парковке - сделать просто серию картинкорефов из сосания.
Блять, а нахуй в дефолтной ноде энкодинга в Комфи они энкодят референсы и через текстовый энкодер? Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. Просто бесполезное размытие эмбединга мусором, когда у нас референс без проблем VAE энкодится.
>>1671056 >Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. В смысле? Нод ошибку же выдавать будет если клип отключить. Можешь показать как сделал?
>>1671084 >>1671085 Бля анон спиздел, я её забыл подключить лол, это на 6 шагах без лоры даже. Вообще лора minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors
Где там гпу лучше арендовать, чтобы без пердолинга можно было бахнуть свой вф из комфи? Хочу локально экспериментировать и закидывать чисто на рендеринг в хорошем качестве.
>>1670846 На 5070 ti 640х480 (читай 1280х960) ты уже за минуту увидишь, там 56-62 сек генерируется. Текнолоджи. Но хорошо, что тае выпустили, у кого видяшки послабее.
>>1670850 Без апскейла — да, но коротенькие и долго.
>>1670863 Мне нейронка хуярит эти тексты и збс получается в рефе.
>>1670898 Первая так себе, вроде норм, но лайтх2в топчик, но с весом 0.5 обязательно.
>>1670935 Две совершенно разные архитектуры. У ЛТХ всегда были realtime видео на 4090/5090. В этом их фишка. И контекст милипиздрический. Но качество такое себе. А тут раза в четыре дольше, ну, с апскейлом, раза в два дольше, и контекст толстенький, влезает меньше. Да и апскейл не латентный, а растровый. НО ТЫ ПОПРОБУЙ ЕГО СЛЕДОВАНИЕ ИНСТРУКЦИЯМ ТЫ ПОПРОБУЙ ЕГО РЕФЕРЕНС ТУ ВИДЕО АУДИО Не пихай видео, чтобы не работало долго, а чисто картинка + голос опционально, для скорости. Оно ебет мощнейше (хотя голос не идеально воис-клонит).
А цензуры и знание персонажей и знаменитостей? Пишешь кого хочешь — и оно с 50% знает кто это и рисует сам, так еще и озвучка близкими к оригиналу голосами.
>>1670992 6 степов: сажа по умолчанию, сол с 0.2 - 0.9, применяется для 3, 4, 5 шагов, пока все. Посмотрим седня, что за ферст блок кеш, а так тебе много не надо.
>>1670999 Эээ… У меня стабильно 1,5 сек на него тратится. И дено, и ориг. Я за 2,5 лишние секунды получаю х2 разрешение (мыльноватое правда, как х1.5 считай).
>>1671067 Какой-то бредогенератор. Какое ещё понимание движения, если референс статичный. Ну и на практике минусов не вижу если на референсе человек. Может несколько сложных референсов и будет проёбывать из-за отсутствия текстовых токенов.
>>1671147 >>1671165 Я в 2012 генерил интерьеры в максе, 1 ракурс генерировался 24 часа. А вы тут видос из блокбастера генерируете 10 минут и вам долго. У меня видюха пашет всю ночь и весь день если я на работе. 3060. Сутки на генерацию такого видео это немного, а я за несколько часов делаю.
>>1671174 Текстовый энкодер-то поймёт что ты хочешь, но его никто не спрашивает - Минимакс получает текст как есть. Какие-то простые отрицания с "не" или "без" он сможет понять, но не отрицание действия. Пиши "тишина и звук движений".
попробовал ref2va, все почти хорошо только сиськи лезут, лол. походу триггерится на [Shot 5]: The frame changes quickly into - focus on the breasts of a this girl
пробовал chest - все равно сисик лезет. а говорили что цензура, лол.
p.s. спасибо анону за тикток промпт, моар еще универсальных промптов
>>1671186 Безусловно. Я устроился на работу тридешником в октябре. Через 10 дней после того как начал локально генерить картинки и даже один убогий видос. Я жалею что в 2006 в эту фирму не устроился, просто о ней не знал. В моем мухосранске все эти годы делали ААА игры, а я хуйней занимался. Студия на 100 человек блядь.
Она мне сделал первый кадр в последний, хотя в просил просто использовать сумку как референс. Это нормально, но как сделать так чтобы стиль изображения был неизменным? Все остальное устраивает. Я эту сумку превратить в живопись с первого скрина неделю не мог. Это одна сумка если что.
>>1671210 Это вроде реф модель. Вот промт: Камера приближается к тумбе за спиной мужчины, женская рука кладёт на неё сумку со второго изображения. Стиль первого изображения остаётся неизменным и переносится на предметы со второго изображения. Тишина. Все персонажи неподвижны. Предмет со второго изображения отрисован в стиле первого изображения.
ещё вот тут https://huggingface.co/DmitryDB/MiniMax-H3-ComfyUI-Quants можно скачать коньврот hq потому что у него меньше слоёв коньврота и больше полных бф16 145 INT8 ConvRot + 63 BF16 semantic matrices дольше на 10-15 % комфи варианта но как будто эффект есть
Так че по итогу какую лучше бомж модель использовать кончврот или fp8 в плане качества? разницы в скорости чет вообще нет на 4090 в отличии от креа2 где кончаврот существенно быстрее у меня.
Для староверов и ADHD: Tldr: 2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро; Sparse Attention - первая версия тоже “near term”; официальный 4/8-step рассматривается, но без обещаний по срокам; отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты. Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!! На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
>>1671274 > 2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро; Не булет же он из 480р в 2к переводить, это только для богатых которые в 720р генят.
>>1671274 > >Будущее Минимакса Делают х4 и х5 закрытыми и сосут хуи умирая в говне. Никогда такого не было, замечу. Похуй что они там говорят, тактика всегда одна.
>>1668847 → в общем, накатил себе на RTX 3090 этих суперквантованых моделей с турбо лорой и теперь уже 5 сек 0.4mp на 6 шагах получаются почти за минуту (на 4 шагах реально за 60 сек).
единственное пожертвовал качеством, но оно выражается только в том, что промпта плохо слушает и съедает некоторые элементы (типа когда прошу советский мультик делает 3d мульт, видимо недодумывает до слова советский, но это можно поправить описав все подетальнее).
Аноны, как понять что нейронка зависла и больше ничего не сгенерирует? У меня кажется застряла на 25%. Прошлой ночью было так же. Еще можно как-то возобновить генерацию? Видюха крутится вертится, комп тормозит как положено.
>>1671287 Мне 32 гб гпу мало, а ты с 8 хочешь. Залетай в аренду гпу. Это самое реалистичное решение по-моему, потому что даже 5090 маловато, но не будешь же ты домой брать rtx 6000.
>>1671287 По идее опимизон на ComfyUI позволяет запускать модели на любом железе, только проблема в скорости. Генерить 5 сек за полчаса наверное все таки не в тему. Хотя, есть GGUF-ы, если они влезут в твой VRAM, то технически может просто замедление 2x в крайнем случае, а это будет где-то 10-15 минут на видео с турбо лорой.
>>1671282 >Минимакс как image edit модель? Стоит ли пробовать? мылит. впрочем все edit модели этим грешат, где-то сильнее, где-то слабее. но у минимакса понимание анатомии\физики\освещения очень хорошее. лучше править крупноплановые портретные снимки людей. мелкие детали проебываются. оголяет вообще охуенно, не лепит одно и то же тело всем, рисует довольно соответствующие фигуры включая лишний жирок или наоборот костлявость. походу по лицу\плечам\рукам судит.
Короче потестил кончу в рот и фп8 на одном сиде. Действия и визуал совпадают с разницей в нюансах (движения рук с другой амплитудой, формы слегка другие и цвета, но суть та же). Показалось на фп8 немного картинка на волосах меньше сыпалась, но это на уровне самовнушения.
А вот разница между res multistep + simple и euler + beta уже разительная: res multistep + simple на том же сиде мне перекрутил руку назад неанатомично, тогда как euler + beta сгенерил правильно все. так что пока поставил любимый с вана euler + beta как основной. А вот с convrot так и не определился че лучше, была бы разница в скорости оставил бы ее, а так смысла нет наверное
на комфи заработала поддержка w4a8, попробовал, заметил что турболоры не убивают тут качество в хлам в отличие от nvfp4\int4. по качеству ближе к int8. 5-секундное видео в 0,6 мегапикселей делает за минуту на 5070ti
>>1671309 так ведь чем больше разрешение видео тем больше VRAM будет жрать. Можно вообще сразу bf16 так запилить и идеально на 0.4 будет генерить, но пикселем чуть выше и будет OOM (в Комфи конечно не будет, он просту тупо сделает в 4 раза медленнее). А так, хороший запас на то, чтобы играться с разрешением держа все в VRAM-е.
>>1671320 я не он, но тот кто уже сравнивал тут >>1671284>>1671290 Скажу что у меня с int4convrot, которому по размеру соответствует w4a8, приводил к ебейшим артефактам, а w4a8 от Kijai вполне себе удобоваримо, без чрезмерной оптимизация в роде спектрума, вполне себе норм результат дает, в отличие от коньврота на int4.
>>1671287 Генерю на 8гб+32 почти что хочу. Пикрил из двух кусков, с первого раза вышло и меньше 20 минут в сумме, но это реф модель без ускорялок, а она медленная сама по себе. С турбо лорой по пикче 4 секунды в 0.5 мп качестве - 171 сек. Хватит с запасом, чтобы еот раздеть или еще что погенерить для души. Мб дольше будешь думать, готовить рефы и промпты писать, чем генерить. Но на д-нищеспеке каэш сложнее что-то тестить и мотивации меньше.
>>1671320 я коньвротом 8-битным в основном и пользуюсь, w4a8 хорош для погонять на легких весах промпты, понять что как работает, не проебывая качество по полной пизде в сравнении с другими 4-битками.
>>1671328 какой инт4, какой в4а8 ? У меня 5070ти. Со спектрумом, реф модель, 0,7 мп, 10 сек, 4 реф картинки + 1 реф видео в районе 6 минут получается. Без реф видео еще быстрее будет раза в 2.