Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
Из этого я взял лору Лайт2х лору от Киджая (ужатую), 8 (7) шагов euler beta, Sol, и получается заебато, конечно. Спектрум, как мне показалось, толком тут уже не работает, пропуск 1-2 шагов погоды не делает, ИМХО. Сажа включена по умолчанию, флагом в sh, что ты мне сделаешь.
Я хз как вы смотрите, турбо лора реально не даёт слоумо и следует промпту так же эффективно, выполняя порядок действий на протяжени 15 секунд, что и ориг, при этом прирост от х3 до х5, и это самая первая сырая версия.
блядь как же я заебался заставить сэйдж работать, куда обновил, колесо прикрутил, всё пишет что работает, а на ноде всегда ошибка вылезает. 6 часов убил на эту хуйню
>>1670688 бле ананас, спектрум то работает, не кто не спорит и время уменьшается, но ты прикинь если у тебя под турбо лорой из 6 шагов, полноценных только 3
это на обычной генерации скип еще компенсируется, на турбе это сразу деградация картинки
>>1670698 Его можно в comfy подключить, ёбаный рот, какие вы все однобокие экспериментаторы хуевы, только циферки дрочить в готовых инструментах можете.
Ну я сравнил ориг + ртх + дено. Дено действительно мылит, но на ртх без дено видно увеличенные артефакты, короче, ну чу-у-у-уточку лучше с ртх и еще чу-у-у-уточку лучше с дено => ртх. Но за 2,5 секунды как будто и даром. Надо тестить мелкие разрешения теперь.
Как же r2v ебёт это просто сказка! Я охуел. Тут даже лоры не нужны. Единственный минус - звуковые эффекты. Но по идее и их можно пофиксить через прикрепляемое аудио.
>>1670751 Двачую. Вообще реф это монстр. Вот я взял лору, сгенерил хенджоб. А там вместо пениса бодихоррор. Ну я думал подождать лору сначала, а потом вспомнил про реф моделку. По итогу в качестве рефа дал рандомную пикчу пениса и вообще отлично вышло.
>>1670741 На. Я все прошлые выходные пытался соединить эти две картинки в одну, нихуя не выходило либо выходило криво. А вчера с первой попытки сделал видеорил, именно то что мен нужно. Хотел пикчу, а получил видос в 1080 рублей. Кадр с тележкйо тоже заебался делать, ван её все время двигал, чтобы я ему не говорил. Эйч три с первого раза взял нужный ракурс.
Пытаюсь использовать две картинки с персонажами и видео в качестве референса их движений (типа, чтобы два моих персонажа танцевали как на видео). Но в итоге каждый раз получаю тупо видео ряд из референсного видео. Вроде бы всё делаю, как в гайде написано. Мой промпт: subject_definitions: <Subject 1> is the woman from <Picture 0> dancing like in a <Video 0> <Subject 2> is the man from <Picture 1> dancing like in a <Video 0>
summary: [reference generation] The target video is a dark scene where <Subject 1> and <Subject 2> dancing like in a <Video 0>.
detailed_description: The target video is in a realistic, documentary style with natural lighting and a static camera. [Shot 1] The video opens with <Subject 1> which dances with <Subject 2>. <Subject 1> and <Subject 2> smiles. Static camera.
overall_soundscape: Quiet street noise can be heard on the background.
non_diegetic_music: A romantic melody plays in the background.
Пробовал исправлять с помощью DeepSeek - результат тот же. Использую стандартный воркфлоу из темплейтов для ref2va.
>>1670863 Прогони референесное видео через DWPose или Depth Anything.
Есть еще одна мутная тема с размерам референса. По ощущениям если он совпадает с конечным разрешением, то больше шансов, что модель его затянет как есть в кадр и наоборот.
Какой положняк по двум турболорам? И как использовать первую в стандартном лоадере - ругается миллионом сообщений вида [WARNING] lora key not loaded: blocks.39.adaln_proj.linear.lora_A.weight
>>1670850 У меня ref2va на 5060ti 16 gb (+ 80 gb RAM) с одной картинкой-референсом на модели int8 c 16 шагами 5 секунд видео 1280 x 736 на дефолтном воркфлоу генерится примерно 15-16 минут
Охуел конечно, как оно легко с камерой работает, представляя те же объекты со всех возможных ракурсов. И это на голом ворке из комфи. Надо обмазаться по полной.
>>1670914 в теории если турбу ебашишь то аудио надо на 6 выкрутить при 4-8 шагах, по умолчанию и так 12 и 3 используются и только увеличиваешь время генерации из-за лишнего патча
бля какой подгон сделали китайцы конеш, хуй представишь что какой то ван или лтх могли бы сделать хоть чтото похожее. без всяких лор на стоковой модели. Пиздец конеш базированые китайцы, правда походу над было ставить побольше секунд, а то они прям зарашили. Но вот вернулось то что умерло с лтх, а именно кайф в придумывании промптов всяких так еще и качество как будто ты корпу юзаешь, ток бесплатно и без цензуры
>>1670918 -> >>1668830 → >Но если по картинке с референсом модель не сделает рол с каким нибудь иллитидом сосущем ебушем рот тянки, то выкладывать рил будет нечего, ван с лорами останется на пьедестале. Ну и как, ван всё ещё на пьедестале?
>>1670926 Но у LTX всё же звук получше будет. Я хоть и тоже в восторге от китайцев, но расстроен из за того что вместо минутных LTX видосов моя система едва способна на видосы в 15-20-сек в лоу резоолюшене, какой то дауншифтинг или очередная заявка на полумилионный апгрейд системы :( Также не совсем понял почему Ref2VA по одной пикче генерит результирующее видео раз в 10 дольше чем FL2VA, того же разрешения и той же длительности.
>>1670993 ну кстати чтобы чисто прогнать посмотреть как промпт будет работать можно вообще все ускорялки включить, результат будет кал но что то видно будет
Что-то этот RTX super reso слишком дофига памяти жрет. Пару раз проскочило по 300 сек, а после уже на 2-3 минуты дольше, потому что на его этапе память забивается на 99-100% (32 + 100 подкачки). А еще как отключить сохранение аж двух результатов, с аудио и без? Жестак тоже не резиновый...
Турбо лора ускорила мою фигню почти в 2 раза, но как-то без восторгов. Есть подводные, да и r2v мимо, а это главный режим. r2v для годноты, i2v для порнухи, t2v для хуйни. Лучше бы только годноту ускорила.
>>1671011 У мивимекса проблем с сосанием нет (как в принципе с погружением твердого хуя в любую дыру, коей рот и является. Есть проблема с режиссированнием сосания, надо все посекундно расписывать, иначе как во всех 5+ сек генераторах нейронка лениться и забивает хрон однотипным примитивным повторяющимся действием. То есть, так и пишешь [0-3c) заглотила хуй [3-6c) вытащила изо рта облизала [6-9c) снова заглотила подрочила себе на лицо хз че там у тебя, у мамки своей спроси она распишет детальней.
То что выше писали про звуки сосания, там надо подбирать правильные прилагательные просто "гаггинг" даст звук кашля похожий на звук пилы по дереву, звук сосания часто включает режим пылесоса. Но даже с правильными прилагательными прилагательными иногда происходит отвал и звук сильно искажается превращаясь в хруст, я так понял это какой-то косяк самого мивимекса на специфическом контексте.
Те кто пишут, что минисракс не тренировали на порно - долбоебы. Он прекрасно знает теги порнофильм и т.д. То что там гениталии попердолены, так это проблема всех нейронок с первого дня, даже объяснять лень тупоголовым хлебушкам. Гениталии так же точно попердолены и у корпов, и пездояйца грока и хуи бабские все это видели все на гроке, сидримсе и так далее, везде где был отвал цензуры. Наоборот, в отличии от ван22, искоропки мивимекс генерит стабильно какой-никакой но хуеподобный отросток, а не деревянную палку или еще какой треш. Там даже головка и яйки в наличии. Это всё тюны/лоры, но даже сейчас легко купируется и2в с нормальным хуем на картинке, после вынимания его откуда угодно он в 70% даже форму головки держит.
По факту, все остальные лтксы (прости господи, искренне жаль тех кто вообще зарился на эту парашу ебаную), ваны и так далее можно удалять нахуй.
>>1671015 не у всех женщин брухля с выпадающим клитором, это индивидуально. бугорок, конечно, скорее всего, должен быть виден, но можно сослаться на то, что ноги прижаты вместе.
>>1671014 Если ты там здорово наебался с сосательным промптом, мож поделишься? Неохота шишки самому набивать По поводу аудио тут советовали взять реф, надо попробовать взять секунд 10 с прона и с каким нибудь partially_copy/reference запихнуть в промпт
>>1671015 прикинь, инцелишка, в реале клитор не болтается как хуй. модератор, тут 24-летнее тело, просто с сиськами и сложением не повезло, не триггерись плез.
>>1671016 Не знаю, как-то неестественно выглядит все равно, намек на наличие клитора в верхней части щелки (особенно настолько высоко поднятой) все равно должен быть. можешь перефорсить и сказать, что клитор это маленький хуй, а хуям не место в генерации тяночек
>>1671017 А если в реф крупный план сунуть и в смене кадра сослаться на него?
Вот вам идейка для теста - не просто зеркало, а ещё и "sharp shadows on the wall". На некоторых настройках отражённые тени своей жизнью жить начинают =)
>>1671018 >Если ты там здорово наебался с сосательным промптом, мож поделишься? Не могу скинуть по очевидным причинам. Но я не писал сам с нуля, ты можешь просто адоптировать готовые вановские простыни которые в нф часто кидают, либо используя промпт для агента сделать в любой нейронке, дипсик например.
>По поводу аудио тут советовали взять реф, Тут в треде половина видосов с прегенерированными рефами на звук, так что оно норм сработает. Так же если тебе нужны крупные планы, то ты можешь как в стандартном примере с бабой на парковке - сделать просто серию картинкорефов из сосания.
Блять, а нахуй в дефолтной ноде энкодинга в Комфи они энкодят референсы и через текстовый энкодер? Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. Просто бесполезное размытие эмбединга мусором, когда у нас референс без проблем VAE энкодится.
>>1671056 >Если отрубить этот говняк, то лица лучше с референсов копирует и лоры не перебивает так сильно. В смысле? Нод ошибку же выдавать будет если клип отключить. Можешь показать как сделал?
>>1671084 >>1671085 Бля анон спиздел, я её забыл подключить лол, это на 6 шагах без лоры даже. Вообще лора minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy.safetensors
Где там гпу лучше арендовать, чтобы без пердолинга можно было бахнуть свой вф из комфи? Хочу локально экспериментировать и закидывать чисто на рендеринг в хорошем качестве.
>>1670846 На 5070 ti 640х480 (читай 1280х960) ты уже за минуту увидишь, там 56-62 сек генерируется. Текнолоджи. Но хорошо, что тае выпустили, у кого видяшки послабее.
>>1670850 Без апскейла — да, но коротенькие и долго.
>>1670863 Мне нейронка хуярит эти тексты и збс получается в рефе.
>>1670898 Первая так себе, вроде норм, но лайтх2в топчик, но с весом 0.5 обязательно.
>>1670935 Две совершенно разные архитектуры. У ЛТХ всегда были realtime видео на 4090/5090. В этом их фишка. И контекст милипиздрический. Но качество такое себе. А тут раза в четыре дольше, ну, с апскейлом, раза в два дольше, и контекст толстенький, влезает меньше. Да и апскейл не латентный, а растровый. НО ТЫ ПОПРОБУЙ ЕГО СЛЕДОВАНИЕ ИНСТРУКЦИЯМ ТЫ ПОПРОБУЙ ЕГО РЕФЕРЕНС ТУ ВИДЕО АУДИО Не пихай видео, чтобы не работало долго, а чисто картинка + голос опционально, для скорости. Оно ебет мощнейше (хотя голос не идеально воис-клонит).
А цензуры и знание персонажей и знаменитостей? Пишешь кого хочешь — и оно с 50% знает кто это и рисует сам, так еще и озвучка близкими к оригиналу голосами.
>>1670992 6 степов: сажа по умолчанию, сол с 0.2 - 0.9, применяется для 3, 4, 5 шагов, пока все. Посмотрим седня, что за ферст блок кеш, а так тебе много не надо.
>>1670999 Эээ… У меня стабильно 1,5 сек на него тратится. И дено, и ориг. Я за 2,5 лишние секунды получаю х2 разрешение (мыльноватое правда, как х1.5 считай).
>>1671067 Какой-то бредогенератор. Какое ещё понимание движения, если референс статичный. Ну и на практике минусов не вижу если на референсе человек. Может несколько сложных референсов и будет проёбывать из-за отсутствия текстовых токенов.
>>1671147 >>1671165 Я в 2012 генерил интерьеры в максе, 1 ракурс генерировался 24 часа. А вы тут видос из блокбастера генерируете 10 минут и вам долго. У меня видюха пашет всю ночь и весь день если я на работе. 3060. Сутки на генерацию такого видео это немного, а я за несколько часов делаю.
>>1671174 Текстовый энкодер-то поймёт что ты хочешь, но его никто не спрашивает - Минимакс получает текст как есть. Какие-то простые отрицания с "не" или "без" он сможет понять, но не отрицание действия. Пиши "тишина и звук движений".
попробовал ref2va, все почти хорошо только сиськи лезут, лол. походу триггерится на [Shot 5]: The frame changes quickly into - focus on the breasts of a this girl
пробовал chest - все равно сисик лезет. а говорили что цензура, лол.
p.s. спасибо анону за тикток промпт, моар еще универсальных промптов
>>1671186 Безусловно. Я устроился на работу тридешником в октябре. Через 10 дней после того как начал локально генерить картинки и даже один убогий видос. Я жалею что в 2006 в эту фирму не устроился, просто о ней не знал. В моем мухосранске все эти годы делали ААА игры, а я хуйней занимался. Студия на 100 человек блядь.
Она мне сделал первый кадр в последний, хотя в просил просто использовать сумку как референс. Это нормально, но как сделать так чтобы стиль изображения был неизменным? Все остальное устраивает. Я эту сумку превратить в живопись с первого скрина неделю не мог. Это одна сумка если что.
>>1671210 Это вроде реф модель. Вот промт: Камера приближается к тумбе за спиной мужчины, женская рука кладёт на неё сумку со второго изображения. Стиль первого изображения остаётся неизменным и переносится на предметы со второго изображения. Тишина. Все персонажи неподвижны. Предмет со второго изображения отрисован в стиле первого изображения.
ещё вот тут https://huggingface.co/DmitryDB/MiniMax-H3-ComfyUI-Quants можно скачать коньврот hq потому что у него меньше слоёв коньврота и больше полных бф16 145 INT8 ConvRot + 63 BF16 semantic matrices дольше на 10-15 % комфи варианта но как будто эффект есть
Так че по итогу какую лучше бомж модель использовать кончврот или fp8 в плане качества? разницы в скорости чет вообще нет на 4090 в отличии от креа2 где кончаврот существенно быстрее у меня.
Для староверов и ADHD: Tldr: 2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро; Sparse Attention - первая версия тоже “near term”; официальный 4/8-step рассматривается, но без обещаний по срокам; отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты. Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!! На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
>>1671274 > 2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро; Не булет же он из 480р в 2к переводить, это только для богатых которые в 720р генят.
>>1671274 > >Будущее Минимакса Делают х4 и х5 закрытыми и сосут хуи умирая в говне. Никогда такого не было, замечу. Похуй что они там говорят, тактика всегда одна.
>>1668847 → в общем, накатил себе на RTX 3090 этих суперквантованых моделей с турбо лорой и теперь уже 5 сек 0.4mp на 6 шагах получаются почти за минуту (на 4 шагах реально за 60 сек).
единственное пожертвовал качеством, но оно выражается только в том, что промпта плохо слушает и съедает некоторые элементы (типа когда прошу советский мультик делает 3d мульт, видимо недодумывает до слова советский, но это можно поправить описав все подетальнее).
Аноны, как понять что нейронка зависла и больше ничего не сгенерирует? У меня кажется застряла на 25%. Прошлой ночью было так же. Еще можно как-то возобновить генерацию? Видюха крутится вертится, комп тормозит как положено.
>>1671287 Мне 32 гб гпу мало, а ты с 8 хочешь. Залетай в аренду гпу. Это самое реалистичное решение по-моему, потому что даже 5090 маловато, но не будешь же ты домой брать rtx 6000.
>>1671287 По идее опимизон на ComfyUI позволяет запускать модели на любом железе, только проблема в скорости. Генерить 5 сек за полчаса наверное все таки не в тему. Хотя, есть GGUF-ы, если они влезут в твой VRAM, то технически может просто замедление 2x в крайнем случае, а это будет где-то 10-15 минут на видео с турбо лорой.
>>1671282 >Минимакс как image edit модель? Стоит ли пробовать? мылит. впрочем все edit модели этим грешат, где-то сильнее, где-то слабее. но у минимакса понимание анатомии\физики\освещения очень хорошее. лучше править крупноплановые портретные снимки людей. мелкие детали проебываются. оголяет вообще охуенно, не лепит одно и то же тело всем, рисует довольно соответствующие фигуры включая лишний жирок или наоборот костлявость. походу по лицу\плечам\рукам судит.
Короче потестил кончу в рот и фп8 на одном сиде. Действия и визуал совпадают с разницей в нюансах (движения рук с другой амплитудой, формы слегка другие и цвета, но суть та же). Показалось на фп8 немного картинка на волосах меньше сыпалась, но это на уровне самовнушения.
А вот разница между res multistep + simple и euler + beta уже разительная: res multistep + simple на том же сиде мне перекрутил руку назад неанатомично, тогда как euler + beta сгенерил правильно все. так что пока поставил любимый с вана euler + beta как основной. А вот с convrot так и не определился че лучше, была бы разница в скорости оставил бы ее, а так смысла нет наверное
на комфи заработала поддержка w4a8, попробовал, заметил что турболоры не убивают тут качество в хлам в отличие от nvfp4\int4. по качеству ближе к int8. 5-секундное видео в 0,6 мегапикселей делает за минуту на 5070ti
>>1671309 так ведь чем больше разрешение видео тем больше VRAM будет жрать. Можно вообще сразу bf16 так запилить и идеально на 0.4 будет генерить, но пикселем чуть выше и будет OOM (в Комфи конечно не будет, он просту тупо сделает в 4 раза медленнее). А так, хороший запас на то, чтобы играться с разрешением держа все в VRAM-е.
>>1671320 я не он, но тот кто уже сравнивал тут >>1671284>>1671290 Скажу что у меня с int4convrot, которому по размеру соответствует w4a8, приводил к ебейшим артефактам, а w4a8 от Kijai вполне себе удобоваримо, без чрезмерной оптимизация в роде спектрума, вполне себе норм результат дает, в отличие от коньврота на int4.
>>1671287 Генерю на 8гб+32 почти что хочу. Пикрил из двух кусков, с первого раза вышло и меньше 20 минут в сумме, но это реф модель без ускорялок, а она медленная сама по себе. С турбо лорой по пикче 4 секунды в 0.5 мп качестве - 171 сек. Хватит с запасом, чтобы еот раздеть или еще что погенерить для души. Мб дольше будешь думать, готовить рефы и промпты писать, чем генерить. Но на д-нищеспеке каэш сложнее что-то тестить и мотивации меньше.
>>1671320 я коньвротом 8-битным в основном и пользуюсь, w4a8 хорош для погонять на легких весах промпты, понять что как работает, не проебывая качество по полной пизде в сравнении с другими 4-битками.
>>1671328 какой инт4, какой в4а8 ? У меня 5070ти. Со спектрумом, реф модель, 0,7 мп, 10 сек, 4 реф картинки + 1 реф видео в районе 6 минут получается. Без реф видео еще быстрее будет раза в 2.
>>1671319 Квантование в фп4 хорошо для 50хх серий карт, в 30хх он разворачивает его в фп16 один хрен, тратя время, даже фп8 разворачивается в фп16. INT8 твой бро, с ним 30хх серия работает напрямую.
>>1671351 Начни с дефолтных как там сказано, у них есть пример вф https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo Любые прочие примочки сейчас опциональны и не мастхев, как и турболора впрочем. Пайплайны еще не настоялись. Модели я юзаю int8_convrot, вае minimax_h3_video_vae_int8_convrot
>>1671353 можно попросить минимакс использовать движение камеры из рефа, вроде облёта вокруг или тряски. можно попросить скопировать лицо и голос из рефа. это быстрее чем картинки пихать обрезанные. главное чтобы лицо ракурсы и мимику за тот короткий отрезок времени норм передало. я своим ебалом 4 секунды повертел перед мобилой и покривлялся, норм потом вышло генерить себя самого.
>>1671182 пробовал chest - все равно сисик лезет. а говорили что цензура, лол. Кто говорил? Нету у него цензуры. :)
>breasts, chest Чего заказал - то и получил, lol. Не нужны были голые сиськи - так бы и писал: "blouse", "shirt", "uniform top", или на крайний случай "chest area".
>>1671367 >можно попросить минимакс использовать движение камеры из рефа Там промптингом можно как угодно камерой вертеть. >>1671389 Жить можно. >>1671394 Кринж 80-го уговня я только голос решился. >>1671411 Заебёт как и картинки и текста.
>>1671411 >И как теперь вернуться к нормальной жизни? Ты погоди когда это в и2видеоигра транслируют с управлением стрелками. >>1671406>>1671403 с этим такое реально. Можно тогда сразу на игровое сральное ведро садиться. Даже не представляю кому после такого ирл нужна.
>>1671347 Пока даже мыслей качать лоры не было, хочется кайфануть от оригинальной модели и понять её лимиты. Да и в целом эротика, которая возможна из коробки устраивает.
>>1671419 >и это заебет. Ну, я на ване около 5к видосов сделал, потом не заебало, а просто лемминги бесплатность заабузили и лавочку прикрыли. Ты немного не о том типе людей говоришь. Я с 7 лет вырезал картинки с голыми тетями из дифицитных пшекских журналов.
>>1671426 >Пока даже мыслей качать лоры не было, хочется кайфануть от оригинальной модели и понять её лимиты. Я используя промпт для промпта анона смог даже из коробки не покрытые некрозами вполне опрятные хуи сделать, а потом нейронкой дожал чтоб в нужном ракурсе ставило раком и камеру не щелкало, реально получилось охуительно как будто с руки снято. Если еще сверху лору (или реф) на хуй кинуть, кусками по 15 сек можно натурально беспалевную порнуху генерить на минуты хрона.
>>1671338 Чет у тебя как-то бездумно нахуячено все подряд лишь бы инференс ускорить: две сажи подряд (да это именно две сажи подряд, а не улучшалка основной), потом ещё сол-аттеншен вкорячен и спектрум с degree:4 Скорость это заебись, но такой ценой?
>>1671428 В более-менее развитых странах у более-менее развитых людей - безусловно. Но так как это локалка, то хули они сделают? Всё. Порносингулярность.
>>1671424 И будешь генерить каловый слоп. Игры и так уже генерят одним промптом, кто тебе мешает начать, проблема в том, что как и с пикчами, чтобы сделать нормальную пикчу, надо уметь рисовать, так и для игр, надо уметь делать игры, без этого получишь только ублюдский кусок слопового кала.
>>1671396 Оптимизации AsymW4A8 из PR #90 технически работают на RTX 30xx (архитектура Ampere), но существенно замедляют генерацию по сравнению с INT8. Хотя этот метод позволяет сэкономить VRAM, его вычислительный оверхед на деквантование весов "на лету" делает его неэффективным для 30-й серии, рекомендующей использование чистого INT8.
>>1671427 Это ты через апи фигачил, а тут то локально, что вероятно дольше per gen? Хотя конечно в твоей самоотверженности ради гуна я ни капли не сомневаюсь и ни капли не осуждаю. Можно отложить польские журналы и ножнички и заняться делом, успехов!
>>1671411 единственное генерировать видосы по 5-15с быстро заебывает. для мемов, стикеров и прочего сгодится, а сделать что то более длинное - тут уже режиссером надо становиться + какую нибудь тулзу типа директора поверх комфи, чтобы на генерацию ставить раскадровку и получать длинный ролик отрезками по 5-15с и уже смонтировать\перегенерировать неудачные дубли
>>1671435 >И будешь генерить каловый слоп. Речь не про качество. ААА-игры и сейчас каловый слоп, что киберпук, что прочие куски невыносимого душного говнища. Тебе норм? Тогда не тебе рассуждать про кал. Любая генерация - это личное, может ты не понимаешь, а я понимаю. И я буду генерить то, что мне лично интересно потреблять, и что мне буквально никто не может предоставить. Я, видишь ли, человек высокой культуры.
>>1671440 Я и тут на апи буду до последнего. Я купил на ранподе, но там дефолтный ворк без оптимизаций, так что думаю не сильно быстрей чем у некоторых в треде. Но у меня есть 5060, конечно, расчехлю ее когда тряска с оптимизациями устаканится.
>>1671443 >тут уже режиссером надо становиться Не надо, можешь просто выдрочить с нейронки, дав рефы на режиссеров или что хочешь. Куски по 20 сек ты и сам можешь смонтировать.
>>1671293 Тестов нету потому что из-за технических особенностей нормально работает только рез мультистеп и кулер Все остальное так или иначе херит картинку и звук
На 5070ti minimax_h3_ref2va_pruned_w4a8_mixed будет быстрее чем на int8_convrot? Ведь влезает то все в врам, или тоже самое все будет и лучше сидеть на жопе int8_convrot ровно ?
>>1671476 >у тебя походу в своп вылезло. Разумеется. Я всегда ебу нейронки за пределы возможного и вам советую. Я не мог до H3 1080 рублей генерить, генерил 1280 по два часа на ване. >а звук можешь либо ffmpegом вырезать, либо просто не подавай аудиовае Просто контрол плюс B на ноде поможет?
>>1671463 да >>1671477 5с 0.6мп генерит от 280с при холодном старте и 170с при горячем без смены промпта. но ценой качества, если не приглядываться норм
И вообще, я вот думаю, зачем вообще нужна fl2va модель? я просто взял вф ref2va и занулил все рефы и использовал её как t2va.
>>1671438 чел. Да, там почти в итоге большая часть int8 (что и дает ему лучше качество чем другие int4 врианта), но прям такого оверхеда не ощущается при переходе в int8. Наверное сказывается, что int4 сам по себе быстрее, но замедляется до скорости int8 в итоге.
В общем, прибавки в скорости, но есть прибавка в свободном VRAM, а значит можно выйграть в скорости на высоких разрешениях, если все будет умещатся полностью в видеопамять.
>>1671492 Великанш уже год любая модель стабильно может, хотя я их делал даже на сидрикселе на первых тюнах еще до пони. Кстати, если задать неправильно соотношения сторон он стабильно сбрасывает картинку.
>>1671460 > Тогда не тебе рассуждать про кал. Любая генерация - это личное, может ты не понимаешь, а я понимаю. И я буду генерить то, что мне лично интересно потреблять, и что мне буквально никто не может предоставить.
Ты вообще нихуя не понял, ты будешь генрить слоп, потому что нихуя не понимаешь в гей деве, играть в игры это не равно уметь их делать, это вообще про другое, именно поэтому не будет игр в 1 клик, точнее они уже есть, но это не игры, это кал собачий.
>>1671534 Ты нихуя не понял из того что я тебе сказал. Бывает. Просто продолжаешь зачем то спорить со своими маняфантазиями. Все современные игры на которые ты надрачиваешь шаблонная хуйня. Они просто не станут хуже, когда шаблоны начнут генерить усредняющие все нейронки, ведь этот процесс усреднения начался очень давно и без них, а они - прямой продукт этого. Но ты слишком туп, чтобы такое понимать.
>>1671542 подари мне риг на стопицот гигов рам\врам
>>1671545 ддр3? если и собирать норм риг - то на ддр4 и памяти хотя бы 128 и на пару-тройку видях. тут просто еще проблема что из материнок были на выбор китайские материнки, а с ними как то стремно.
>>1671540 тот же промпт и сид но на инт8-кончврот-хаку.
Поздравьте, смог запустить на своей нищей 3050 с 8 Гб и 16 рам, запустить. По скорам: 0,4 мп 8 секунд - 8 минут (с апскейлом rtx x2) 0,6 мп 5 секунд - 10.5 минут (тоже с апскейлом).
>>1671550 >ддр3? если и собирать норм риг - то на ддр4 и памяти хотя бы 128 и на пару-тройку видях нет, ддр 4 ецц реги, обычные серверные на четырехканал
>памяти хотя бы 128 ну щас это оверкилл
>тут просто еще проблема что из материнок были на выбор китайские материнки, а с ними как то стремно. а че стремного? берешь то что все берут и всё
>>1671625 >анон ты гений няху, убрал энкодинг картинок в и2в и стало идеально, а вчера пердолился весь вечер с промптом чтобы картинку точно копировало Ват? Можно подробностей? Я тоже так хочу.
>>1671657 он скинул хуйню, я думал это патч для комфи, а это говновайбкод нода. Но идею можешь почерпнуть и какая няхуй разница реф или фл модель если пикчи энкодятся что там что там в общем вы пробуйте мы вам удочку дали а дальше вы сами
>>1671665 >они вставляются в латент первым кадром И патч это отключает? И как это должно помочь? Просто сколько не читаю, не могу понять сути, что они там патчат.
>>1671667 сууука пиздос нахуй какой же ты тугой, они вставляются в латент И энкодятся текст энкодером, ДВА действия совершаются. Эта хуйня отключает второе, ибо выглядит ненужной хуйней которая портит идентику
>>1671669 Вот, теперь понятнее ты наконец большие буквы начал использовать, хоть и не правильно, но направление верное, два действия, окей. Но почему это считается ошибкой? Текстовому энкодеру тоже может полезно знать, как выглядят первые/последние кадры. Хотя я конечно потещу, у меня проблемы с продолжением видео правда, к первым/последним кадрам у меня претензий нет.
>>1671672 ты не меня спрашивай а автора вишмастерской ноды, я человек простой вижу интересное решение - пробую, тем более как я уже писал вчера долго очень стукал промт чтобы он универсально подходил под любую пикчу, а выходило так что с одной пикчей норм а с другой уже пол деталей проебал и наоборот
>>1671675 в коде комфи, при чем тут вф. если не умеешь в код то попроси лоботомита пояснить
>>1671683 я так понимаю это для гоев которые используют встроенную ноду для инт8. Тритон по дефолту отключен в комфи а куда выключается если не 13я, поэтому я использую старую добрую инт8 фаст ноду на тритоне и не ебу себе мозги. но может у блеквеллогоспод там все по другому, хз
>>1671679 В процессе. У меня по 2-х секундному отрезку продлял, но херил сам отрезок, так что кадры не совпадали 1к1, и склейку видно. Сейчас пробую вишмастер ноду, авось поможет. >>1671681 >вижу интересное решение - пробую И тебе помогло?
>>1671690 Да ничего, у меня у самого такое, что если и получится, выкладывать не буду. А так хуй, не получилось. Я правда по коду не увидел, где там двойная отправка, точнее не нашёл места, где оно в латенты VAE отправляется, ну да ладно, может это я еблан. По хорошему вообще для задачи продления видео надо исходные кадры жёстко в латенты на каждом шаге кидать, чтобы нейросеть в принципе не могла с них съехать, но я слишком тупой, чтобы это навайбкодить/смастерить в лапше. >>1671692 >там файлов тысячи, в каком менять? Искать ноду MiniMaxH3ReferenceToVideo офк, грепай. Либо качай вишмасстер, там всё сделано, будет отдельная нода MiniMax H3 Reference to Video (1 Frame).
>>1671705 Спс, ещё больше вишмастеров. Не, понятно, что яйцеголовые проблему решат, и через неделю/месяц у нас будут воркфлоу и ноды, но интересно же и самому покопаться.
>>1671705 надо поковыряться, у меня тоже зреет похожая идея насчет сторибордов, только я думал в отдельном интерфейсе делать чтобы не привязываться к комфи.
>>1671696 >А так хуй, не получилось. Поборол продолжение. Нода, патчи и прочая хуета не нужны. Нужно правильно обрезать видео (и аудио), чтобы оно выравнивалось по ебанутой границе со всякими 17 и 5, и правильно описать кусок, что продолжаешь. Я просто как еблан написал "Они смотрят друг на друга", а в видео у девушки были закрыты глаза на последнем кадре, поэтому нейронка и пидорила продолжаемое видео. Со всем этим минимакс склеивает практически идеально. Чуть яркость пердолит, но как будто бы можно решить через плавное смешивание перекрывающихся кадров. Кто-нибудь знает, как на изях сделать это? Я вижу ноду бленда пикчи, но тут надо 36 пикч так сделать с плавно нарастающей силой.
>>1671862 С такой моделью где впервые можно делать полноценные сюжеты, генерить обычное притивное порно , это самое последнее, что приходит в голову. Даже просто обнаженки уже достаточно
>>1671856 К входу ноды загрузчика лоры подключаешь модель и клип, с выхода всё к чему подключается модель и клип. Клип ставишь 0.0, лору 0.3-0.5. Комфи интуитивно понятен.
А как в минмаксе в i2v заставить камеру не менять позицию, зум и не вращаться? Несмотря ни на что. Чтобы на всей длине видео был один и тот же план, как на исходном изображении. Static shot, camera is stationary и т.п. не работает. Я так понимаю моделька будет игнорировать это если не может сгенерировать консистентное видео? Просто я промпчу, что персонаж идёт к объекту, который уже есть на исходном изображении, но камера всё равно следует за персонажем.
>>1671888 Попробуй запихнуть текст: detailed_description: Camera is static. {Твоё описание на ангельском}.
Так же заметил такое поведение с турболорами и редкими генерациями. Так же советую использовать инжект картинки в condition, чтобы быть увереным, что именно с этого фрейма начнётся видео
>>1671790 На счёт порнухи можно и без лор, у меня удачно получилось сделать через калажи нужных объектов. ref2va обязательно. Кстати, колаж как реф - просто имба.
>>1671888 >Static shot, camera is stationary и т.п. не работает Работает, просто структурируй промпт нормально. В том треде кидали промпт агента. Пишу все что нужно через него.
>>1671892 >>1671895 >>1671901 В общем идеально работает если персонаж просто перемещается по сцене. Но если нужно какие-то дополнительные действия совершить, то камера уже начинает дрейфовать. Ладно, буду ещё возиться с промптом.
Всё никак на 4070 не могу подобрать вариацию турбо с какой силой юзать, чтобы оптимально скорость/качество было. Накачал такое количество турболор за последние 2 дня,что начал путаться между ними уже.
И как эту турболору юзать? Взял воркфлоу того челика где она выложена. Дичайшая пережарка при любом результате. Ну да, быстро генерит. Но нахера оно надо в таком качестве то? Она только со строго определенной моделью работает?
drbaph на обнимиморде запилил minimax_h3_turbo_v4_step600_ema_pruned_comfyui.safetensors
В 8 шагов, эйлер, бета на прюнед камвроте делает вполне себе качественно не убивая звук и без особых заметных артефактов. Ну либо у меня уже глаза за мылились.
>>1671925 Да всегда так было, скорость не даётся бесплатно. Я лично вообще не собираюсь ничего кроме стандартных воркфлоу юзать, все эти ускорители кроме может быть sage attention, убивают картинку и отупляют происходящее.
>>1671941 Я не пользуюсь никакими лорами снижающими cfg, ускоряющие степы, кроме qwen image edit, т.е. без неё слишком долго. От них всегда очень сильная деградация сцены, стиля, кроме может быть совершенно тупорылой хуйни типа "баба делает сэлфи"
И получаю текст, текст в промпт для mmh3 и всё отлично. Только прочитывай текст перед созданием видео, иногда нужно корректировать. При этом, такое чувство, что detailed_description имеет, иногда, 0 смысла, а всё берется из summary
>>1671970 qwen 3.6 на данный момент, лучшая локальная нейронка общая, 27b будет получше, чем moe 35b, но всё равно делает своё дело. Но надо понимать, что не все картинки лучше грузить в интернет, так что советую перейти на локалку. Так же для сцен лучше делай клипы по 5 секунд, чтобы можно было что-нибудь подправить. Сейчас чел https://github.com/matlowai/ComfyUI-MAINodes сделал вот такую штуковину, на её базе ты можешь править отдельные участки. Скармливай гроку/гпт этот репо и говори: сделай мне ноду которая может принимать латент и указывать какие блоки надо поменять а какие нет, условно. Но и для этого так же попроси, чтобы ноды для сохранения латента сделал(гпт мне написал ноду для сохранения и загрузки латента mmh3). В общем тут лучше разобраться как латент работал в wan 2.2, чтобы понимать как делать в minimax h3. Если что, всё что сверху писал - ознакомительно, по факту в mmh3 латент менять нельзя, а только condition где устанавливается значение для денойзинга и позиции keyframe.
>>1671884 новостной репортаж без комментариев, проезды камеры, смена планов. аэродром, старые винтовые самолеты, "кукурузники". крупный план на фюзеляж, винта нет. к самолету подходит техник, руками размещает на месте винта вытянутую собаку породы овчарка. установленная овчарка своим туловищем полностью заменяет пропеллер. голова собаки ориентирована в небо, хвост - в сторону земли. слышен голос со стороны: "От винта!" Мотор заводится, собака начинает раскручиваться. самолет ускоряется по взлетной полосе и взлетает
POV, вид как из камеры видеонаблюдения, помехи, grainy, slight blur, little bloom, цветная плёнка 1990, 15yo young girl, европейской внешности, bob hair, едет в метро в бронежилете с принтом, кеды, смеётся закрывая рукой лицо, на бронежилете наклейки с котиками, смотрит вверх на зрителя, bob hair, hairpins, skinny, романтическая музыка на фоне, сменяется несколько шотов с разными моментами в вагоне
Японская телевизионная программа. Много надписей. Камера постоянно меняет ракурс.
>>1672033 рабочие веса столько занимают в процессе самой генерации видео, остальное (текст энкодер, vae) ждет в ram своего череда, им в видеопамяти в этот момент совершенно нехуй делать, только тормозить всё будут.
>>1671873 Да можно сюжеты для порно делать, минимах шарит за появление мужика и секс утехи, можно из коробки наделать разных сцен (ток фантазия твой предел)
Но вот чему все поражаюсь это понимаю у минимакса, это пиздец ахуй, я хуй знает мог ли кто из сеток сделать так же как в примере тут, но минимакс делает это не напрягаясь и сука локально. Удержание деталей просто писец, он может снять с бабехи шмотку, оставить эту шмотку на кровати, и эта будет та же шмотка а не рандомного цвета хуита.
еще недавно страдал на лтх поливая все матом, а тут теперь делаешь видосы уровня корпоратских
>>1671887 сценки без показа гениталий (ну как в фильмах с постельными сценами) делает хорошо, для кума пойдет, даже поинтересней будет если какой сюжет наварганить
>>1672049 Там нет проблем со звуком, там можно расставлять руками ударения и на всех языках кроме английского нужно тегать язык говорящего, если не хочешь аудиореф использовать. Как ты видел выше, у Дженифер Анестен из коробки был голос ее дубляжа на русском. Кроме того, если промпт достаточно подробный чтобы была консистентьность, полагаю, можно сперва генерить шакала, выдирать с него удачный звук, а потом использовать как реф. Это вариант для нищих двачеров, кстати.
>>1672060 >Да можно сюжеты для порно делать, минимах шарит за появление мужика и секс утехи, можно из коробки наделать разных сцен (ток фантазия твой предел) Я уже наделал вчера. Можно разбивать свой текстопорнослоп аж от 22го года (наверняка у любого его тонны) на сцены, делать прегены в креа2 или чем угодно, ну и сюжет-то готов, дальше дело техники.
замерил время генерации у int8convrot и w4a8 квантов ref2va модели: 0.5 мп, 15-секундное видео, 8 шагов с turbo-лорой, получил ~240 секунд на генерацию, разницы вообще нет. единственное что заметно - жрет оперативы на целых 12 гигабайт меньше в особо тяжёлых случаях, всё.
>>1672066 Можно руками: I've had good success in creating long videos from 10 second sections using this technique:
Create your first video.
Then for your next generation (continuation of video):
Load the last 2 seconds of the previous video as <Video 1>. I use the 'Load Video (Upload)' node - from ComfyUI-VideoHelperSuite - (this node allows you to skip frames and start at, say, the last 48 frames (for 2 seconds at 24fps) - this means that the whole previous 10 seconds don't need be passed to the next generation. This is <Video 1>.
I'm using process this with reference images for the subjects so these are used again with each continuation - so I don't see any drift of faces.
This is the wording I found works well:
[Shot 1]
Target video is a seamless continuation of <Video 1>. First frame of [Shot 1] is the last frame of <Video 1>.
The important part is explicitly telling the model that the first frame of the new generation must continue directly from the last frame of <Video 1>. This helps maintain temporal continuity between the clips - because you provide the last 2 seconds of the previous generation is knows what movement it needs to continue from.
You then just join the generation videos with a video joiner of your choice.
>>1672077 >А почему если промпт на русише, то персы так стремятся его проговорить? Потому что у него там скорей всего вообще реплики нет и это просто звуковые галлюцинации. Ну и на русском реально лучше не промптить, я обычно топлю за промптинг, но тут нет необходимости. Для агента пишешь на русском вводную, он сам все делает на англ и структурирует. Кирилицу мивимекс явно хуже понимает.
>>1672060 Что меня поразило что он вообще без напряга из коробки делает кримпай, как я ебался с ваном кучей лор, милион весов перепробовал и всё какая то хуйня получалась, а тут с первого раза, еще и персы всё дословно повторяют (баба например шевелится перестаёт когда надо), вообще ахуй.
>>1672120 Тоже задолбался сравнивать, мало того, что на каждом комбо разные генерации, так еще при смене разрешения тоже все меняется. На первый взгляд euler более натуральный и реалистичный самплер из всех. На deis текстуры лучше и тд
Быстрогайд, как прикрутить контролнет и вместо видео рефа подавать на вход контролнетовский реф (Позволяет не смешить детали реф видео с будущим видео.) Нужен этот пак https://github.com/Fannovel16/comfyui_controlnet_aux Скорее всего он у тебя есть, если генерил картинки, пак старый. В нем дохера всяких нод на canny, различные версии depth, openpose и всякого такого. На скрине малая часть. Подключение такое: нода загрузки видео -> одна из выбранных нод из пака -> подключение к входу реф видео. Т.е. делаем из нашего видео например очертания персонажей через кэнни и закидываем это в реф. Все. Также выход ноды из пака одновременно можно подключить,например, ноду видео комбайна, чтоб видеть то, что получилось у контролнета и что передаешь в реф. Нужна реф модель и соответственно реф ВФ. Стандартный подойдет.
Подскажет кто-нибудь - стандартный ворклфлоу с турбой хорошо работает, звук не хуёвит, но в реф2видео с теми же самыми данными и с таким же промптом и параметрами звук резко становится хуёвого микрофонного качества, да и само видео становится каким-то странным.
Увидел, что народ пользуется "разцензуренной" версией энкодера и тоже скачал, чтобы быть как все, а то пацаны засмеют. И разницы нихуя не увидел. Зачем это существует скажите -qwen3vl 32b heretic minimax_h3 .safetensors? Что бы что? Всем известно, что в режиме текст энкодера это уже не ллм.
Но Макс таки пёзды цензурит, что странно. При этом же может какой то ядрёный камшот или анал запилить совершенно без цензуры. В FL2VA никак до сих пор нормальных пёзд не могу сделать, очень криво изображает, а в Ref со сторонней картинкой всё слишком долго.
меня смущает что там только fl2va, ref2va еще не сделали походу. ну и судя по описанию - там какой то лютый франкенштейн из креа2, лтх и вана
So far, this release is an experiment on MiniMax H3 base model that combines learned patterns from two other video diffusion models — LTX 2.3 and Wan 2.2, and in test3 and later, one image diffusion model — Krea 2 — into H3's transformer architecture.
>>1671884 Лол, вижу, что вы здесь. Ща все свои банки дам, генерала уже скинули. Там кроме меня ещё генерили видосы про банк. У меня созданы в соре были рекламы банка/квны/аниме трейлеры и куча политической ржаки, за которую тёрли регулярно.
>>1672211 БЬлядь, два раза сообщение отвалилось Это к вот этому >Подскажет кто-нибудь - стандартный ворклфлоу с турбой хорошо работает, звук не хуёвит, но в реф2видео с теми же самыми данными и с таким же промптом и параметрами звук резко становится хуёвого микрофонного качества, да и само видео становится каким-то странным.
>>1672217 Просто турбо в т2видео меня устраивает в 9 из 10 случаев, а в реф2видео начинает очень хуёвит. Неужели реф2видео без турбы только работает нормально?
>>1672207 Поверь, я щас 3 дня тестирую - новый китаец в разы лучше. Правда не тестил ещё трейлеры аниме, но ржаку рисую на ура. Сбрасывать ток не знаю куда - на ваших двачах не появлялся практически с момента закрытия соры (точнее ввода телефона)
>2040 год от рождества х. и 11 год от Великого АГИ >Американцы воют на тупых porridges с их gigagrok-video-xxx1488 и выделяют lube из сраки, вспоминая времена артефактной соры >Европа, Азия и Rub Sea Anne вспоминают времена евро-5 за горшком человечины, поглядывая на небо - ибо палантир никогда не спит
>>1672179 Для нищуков вроде меня с 16врам\32рам есть решение - присрать очистку врам и кеша. итого теперь я могу генерировать 15с 0.4мп за 500с или 1мп 5с тоже за 500с.
>>1672229 У меня ваще другой воркфлоу, из телеги. Ноды ускорялки юзаешь? Саге, спектрум? Я как спектрум подключил (ну саге и так было)- скорость на 30% взлетела. Тоже 16 vram, 32 озу
>>1672165 >Но Макс таки пёзды цензурит, что странно. Как вы блядь заебали дауны ебаные. ЭТО НЕ ЦЕНЗУРА. эТО СУКА ТЫ ТУПАЯ базовая модель. пОКАЖИ МНЕ хоть нахуй одну базовую модель которая 10 из 10 раз сделает гениталии, ОСОБЕННО В ПРОПОРЦИИ К ОБЩЕЙ ПЛОЩАДИ КАДРА. Гвозь тебе блядь вбить в тупую башку нахуй, скворец ебучий.
>>1672221 >вспоминая времена артефактной соры Мне нравилась артефактная виду. >>1672236 вот это каловый перетрен на маняме, ничего интересного. А там в режиме анимации очень прикольные штуки генерило, недотрененые корп модели вообще пушка для концептов.
>>1672245 У меня таких проблем нет. Если посмотреть на хуи по умолчанию, покрытые гноем и некрозом, и так ясно откуда там в датасете крупным планом гениталии - из блядь медицинских картинок с болезнями всякими, они там и протеганы были как хуи и пезды. Это старый прикол, я даже в зацензуреном уже 4,5 сидримсе и гроке спокойно пезды поднимал медицинским контекстом, потому что это очень сильный вес, который все передавливает. Соответственно, конкретно по минисраксу там всегда надо писать что гениталии - чистые, здоровые, красивые, это их вид улучшает автоматом на 30%.
>>1672236 EasyCache + sa2 будут все равно быстрее чем spectrum, при этом spectrum меняет поведение даже на одном сиде из-за особенности его работы(это так же написано и в самом гитхабе), так что не советую его юзать
>>1672236 ускорялки юзаю + турболора, но без спектрума. мне показалось что спектрум хуюжит картинку, но проверю еще раз.
попробовал изикеш, в целом 15с 0.7мп за 780с - норм результат, для чистовика сойдет. с промптом на видео наебался немного, надо было сначала чекать на маленьких разрешениях типа 0.1мп, а потом уже гнать чистовик.
Посоветуйте nsfw лору для минимакса для 4-х шагов. Те, что я тестил (SexGod-NaughtyTimes и hmmotion) с lightx2v лорой не дружат, там сильный шум\песок появляется.
>>1672321 Юзай другую лору турбо, 600 ема. >>1671926 >drbaph на обнимиморде запилил minimax_h3_turbo_v4_step600_ema_pruned_comfyui.safetensors Вот эту. Не на 4, а на 8 степах. Тогда норм. Других нсфв нет лор. Единственное что еще могу посоветовать что сам тестил это использовать референс видео секса и заменить там персонажей просто. Выходит классно.
>>1672312 бразик заменил лайн как там написано теперь нода проебалась😥 Missing node type A node type is missing or unavailable. The workflow may be corrupted or require a custom node.
>>1672359 Чекни в логе консольки кастом нод вообще загрузился данные, если нет - выключай консольку, правь и потом снова запускай комфи, делай так пока не пофиксишь
>>1672403 Это точно, подтверждаю. Кто фома - сгенерируйте без него допустим человека в фокусе и улицу вне фокуса и смотрите на людей на заднике. Они и на чистой с 20 шагами не сказать что прям консистентные. Но со спектрумом они в каловую массу превращаются теряя облик людей совсем.
>>1672211 >>1672213 >>1672210 А как правильно произноситme дарения заставить? Я в своём рассказе их расставил, научился. Но в прост как вбить правильно?
>>1672456 Если сеткой промптишь, то так и пиши - (ударение на "А" в подвергАл). На выходе будет чето типа clear stress on the letter "а": <d>[Russian] подвергАл</d> Если вручную, то пытайся что-то подобное изобразить.
>>1671926 >>1672329 >minimax_h3_turbo_v4_step600_ema_pruned_comfyui хуже чем 20 шагов, проебываются детали жоско. Хорошая турбо должна выдавать картинку даже лучше чем база за счет отсутствия вариативности, пока что к этому идти и идти
>>1672456 Вот такое видел где-то, или в прошлых тредах или на реддите, или ещё где-то, хз. >Гласные буквы с ударением Á á Ó ó É é ý и́ ы́ э́ ю́ я́а́ е́ и́ о́ у́ ы́ э́ ю́ я́А' а' Е' е' О' о' У' у' И' и' Ю' ю' Я' я' Сам пока не проверял.
>>1672536 Так дайте промпты епта, я изначально не видосы соры просил, а промты. Мне слишком лень ебаться с промтами для приколов, на приколы же письку не подергаешь
>>1672104 Погенерил, какая то унылая хрень в стиле мёрджей от васянов с цивитая. Лица меняет, тела иногда меняет как это уже было в эросе, когда из обычных тянок делает порнозвезд 35 летних, вернулся на обычный минмаксовый бейс.
>>1672559 >>1672536 Такой смысл тебе достаточно глубокий? (этого не было в промпте, и я в душе не ебу почему она держит эту карточку). В промпте было только "выполни промпт со сториборда". Сора твоя так может?
Как избавиться от гиббериша? Я прописываю короткие фразы, которые проговариваются хорошо, но потом нейронка решает что нужно попиздеть рандомные вещи либо до этих фраз, либо после
>>1672589 ну кстати да, сам тоже вернулся, от долбоеба надо было только чуть полирнуть гениталии, остальное минимакс уже и так делает, еблю с норм движениями уже промптил выходит хорошо и красиво
но ебаный долбоеб пошел творить какую то хуиту с моделью что пиздец, там теперь ебаный франкенштейн какой то
>>1672656 Нет это не у тебя, оно там всегда так. Это общая проблема нейронок. А у минисракса личная проблема это язык. Не так страшно как на пиксверсе, но все же бывает.
У когонить есть реквест на лайтовый тестовый промпт? Хочу через свой шаблон прогнать, проверить сколько доп он деталей туда напихает и как реалистично будет
после всех тестов оставил ток еулер бета 8 шагов турболора 600 и сол атенш, ток пока не понял какой лучше из этих двух (не фиолетовые) на 1мп 7с 8/8 [03:33<00:00, 26.69s/it но следование промпту и качество самое топ
остальное все, все кеши, спектрумы, эффект и мемори патчи вся та залупа что в байпасе это кал ебаного говна херит или картинку или следование промпту, или добавляет небольшие галюны или артефакты, в пизду короч всю эту хуету.
А можете посоветовать структуры промпта для Минимакс ref2video если мне нужно фрагмент фильма заменить, так чтобы персонаж был другой, допустим в мультяшном стиле, при этом сохранив оригинальную звуковую дорожку и по-возможну сохраняя ракурс оригинального видео, меняется только персонаж.
subject_definitions: <Video 1> is the source film clip to be edited. Its camera angles, framing, cut rhythm, and scene layout are retained. <Audio 1> is the synchronized audio track of <Video 1> and is reused in the target video. <Subject 1> is the cartoon-style replacement character from <Picture 1>, with [описание: стиль, цвета, пропорции, ключевые черты]. <Subject 2> is the environment and background from <Video 1>, including [описание локации, освещения, реквизита].
summary: [video editing + reference generation + audio reuse] The target video is an edited version of <Video 1>. The original human character is replaced by <Subject 1>, a cartoon-style character defined in <Picture 1>, while <Subject 2> (environment, camera angles, and edit rhythm) and <Audio 1> are fully preserved.
retention_analysis: <Video 1> (camera angles, framing, cut rhythm, scene layout): fully_preserved - all camera positions, angles, and edit timing are kept. <Audio 1>: fully_copy - <Audio 1> is reused 1:1 as the target video's complete final audio track. <Subject 1> (appears in [Shot 1], [Shot 2], ...): fully_preserved - cartoon style, colors, proportions, and key features are retained. <Subject 2> (appears in [Shot 1], [Shot 2], ...): fully_preserved - background, lighting, and props are retained.
detailed_description: The target video keeps the cinematic style, camera angles, and edit rhythm of the source film while rendering the lead character in [2D-animated / 3D CG / cartoon] style.
[Shot 1] The framing matches <Video 1>: [ракурс, крупность]. <Subject 2> fills the background. <Subject 1> occupies the same position and performs the same actions as the original character: [действие 1], [действие 2]. The camera [статична / движение из оригинала].
[Shot 2] At 00:0X.XXX, the shot cuts to [крупность/ракурс из оригинала]. <Subject 1> [продолжает действие]. <Audio 1> continues unchanged.
[...повторить для каждого кадра/шота...]
overall_soundscape: <Audio 1> is reused as the complete audio track. All dialogue, ambient sound, and effects from the source clip are preserved without change.
>>1672674 Не соглашусь, без всех ускорялок результат тоже бывает иногода так себе. Я вот на sa2 + easycache достаточно хорошие результаты получаю. Мб с промптом что не так?
>>1672693 я делал покадровое сравнение на сплите с референсным видосом без ускорялок на тестовом промпте, там сразу видно где нейронка начинает проебываться и срать в качество.
>>1672720 Турба 650, 8 шагов. Если референс голоса добавить, то становится лучше. И у меня ещё отдельный семплер для аудио - латент разделяется и семплится разными.
>>1672749 Да, для такого реф нужен если без лор, но иногда выходит и норм звуки. Я без звука в общем-то для себя делаю, тк звук потом можно докинуть сверху, а это пример того, что можно сделать и без лор, только рефами.
Так владельцы Блеквеллов, чем в итоге пользуетесь? Int8 convrot? Nvfp4 как будто бы ломается об турбо Лору. Или с третьей моделью от киджая лучше работает? Не помню название, на 11 гиг скейлд чето там
>>1672753 Вроде fp8_scaled по итогу самое норм. Эти новые w4a8 кванты вообще хуйня какая-то для 3060 бояр. Главное не забывать про --fast-disk --disable-pinned-memory --cache-none , это вообще имба уровня лайтнинг лор
>>1672757 я кажется напиздюнькал что быстрее работает с этими аргументами, все же помедленнее слегка, но у меня рам выжирает критически, так что делать нечего
>>1672792 Нравится... Но представь, за те же деньги 24 гб врам, +50-70% мощности. По производительности тут тяжко, 1.35 mp 3:4, 2 рефа 2+ mp, 5 сек 471 секунду весь воркфлоу, а было бы 200-250. Я не хочу скзаать, что зашквар, кайф по времени, по качеству, но смотришь на этих гигачадов с 5090 и 4090 и чувствуешь себя нищуком.
Кстати реально какого хуя 14 гб из 24 занимает при 15 сек генерации. Это он там типо дохуя оптимизированно посчитал, что за то время что обрабатываются одни слои он может их свапнуть с теми что в рам? только проц нагружает без толку, умный дохуя видите ли
>>1672814 юзаю турбо 600 с 8 шагами, качество пушка, вижу бля текстуру ткани на трусах бабехи
но если ты насыпешь всяких спектрумов, кешей и прочей ускоряющей залупы, (ну кроме сол атеншена, его по всем тестам оставил) то конеш будь готов что у тебя начнется нихуевая просадка по качеству.
я просто так не обращал мб внимание, но когда турбы тестил, вырубал и подключал ускоряки, и сравнивал видео на сплите, во тпосле того как один раз эту хуйню увидишь прям на разнице, уже хуй развидишь эту хуиту
>>1672818 Сейчас сам затестил, отключил все ускорялки и посмотрел на лицо/ткань для видео где таргет далеко, но разницы не заметил. sa2 + easycache. Я тоже видел, что писали на reddit об ec, но такого захерения я никак не смог добиться как у них. Может это только воспроизводится если делать fl2va, где денойз всё равно есть у фреймов? Я просто делаю без денойза фреймов и макс разрешение рефов. Просто я сразу отказался от лор, когда у меня на тестах с персом далеким от камеры потекли лица, после чего вернулся обратно на ускорялки. Короче я ещё потещу, спасибо за инфу.
>>1672827 это на движениях заметно больше, просто движение рук например посмотри в сплите
сол атеншн топовый от киджая, есть еще один но он говно говна, с ним на сравнии модель промпт игнорила местами
>>1672060 вот я на турбе делал тестово, на разьеб звука в одном месте не смотри я там просто в одном месте запромптил мычание бабехи как мммммм, дохуя эмок захуячил и в этом месте зашакалило звук чуток
>>1672831 бля ор, а я еще только щас понял, что на первой они ВСЕ усатые сцук ахах. ну в соре однозначно знаний больше было, чтобы сгенерить на уровне соры, надо в рефы всех персонажей кидать и герб тоже.
>>1672827 >>1672814 >>1672829 вот еулер бета с 600ема прунед на 8 шагах 1мп. 453сек на холодный старт гена без кешей и спектрума и прочего ток солатеншн киджая
>>1672497 это охуенно, спасибо бро. теперь не съедает все 64 гб и не лезет в своп. скорость генерации 26 s/it (0.5 мп, 15 сек). убрал --disable-pinned-memory, всё также хорошо пашет, скорость 24 s/it (теперь та же самая что при настройках по умолчанию), оперативу стало хавать где-то на 10 гб больше, но до предела забивания все равно еще далеко. хз что там автор комфи нахимичил в дефолт настройках, нехорошо когда своп постоянно дёргается.
>>1672840 Потестил, 600ему прунед на 8 шагах заебись работает на т2в/в2в генерациях На реф2видео начинает жёстко шалить и блюрить, зато на реф2видео 850прунед на 12 шагах (не спрашивайте) отлично работает.
>>1672800 Долго терпеть придется, поговаривают что 6 серия выйдет году так в 28-29, и и представь какие цены хуанг за неё заломит? У народа за это время сломается множество карт пригодных для генерации, а новые брать негде. На рынке взлетит цена за б/у карточки по тому что их количество будет сокращаться. Память все также будет в дефиците по этому скорее всего даже 6090 вернётся к 24 гигабайтам.
Я надеюсь на то что разработают специальный чип для ИИ который можно будет пихать в отдельный pci слот, типа как в своё время была Ageia Physx. Но боюсь что и на него цена будет нифига не потребительская.
>>1672567 >Модели каждый раз грузятся заново. что-то не заметил чтений с диска на 64 гб рама. модели скорее всего в скрытом ram кэше windows сидят и оттуда подгружаются.
теперь понятно, звук говно в мемасиках потому что вы реф модель используете. вот перегенерил >>1672828 на реф модели, логику пидорит сильнее, звук отвратительный, но зато стилистика историчная.
>>1672497 >починил выжирание рам, еще и семплер работает чуть быстрее вдобавок, чудеса няху >--fast-disk --disable-pinned-memory --cache-none
попробуй оставить только --fast-disk --cache-lru 4, тогда не гоняет текстовый энкодер туда-сюда, если промпт не изменился - более быстрое начало генерации следующего видео.
>>1671330 >Генерю на 8гб+32 почти что хочу. Можно ли генерить хоть что-то на 8gb VRAM + 16bg RAM, хоть на самом ужатом gguf? Какой низший предел у модели по железу с реальным результатом?
>>1672917 >>1672923 minimax fl2va модель, на вход подавать одну и ту же картинку как первый и последний кадр, промпт я ллмку попросил написать: >The camera immediately transitions into a 3D cinematic orbital tracking shot, moving along a continuous horizontal circular path around the subject. The subject remains completely frozen in 3D space as the camera pans around them to reveal the background from all angles. Smooth and steady parallax effect in the background, deep depth of field, 3D spatial camera movement
>>1672865 Чушь получается бессмысленная, когда они в одно помещение входят. Первый должен в одну комнату входить обязательно, желательно еще табличку сделать, что там приемная Сталина, а берия должен быть "снят" с другой стороны другого кабинета. Бля, ну ты понял, короче.