>>1677119 >Я использую грок тян. Бесплатно >Она умнее большинства женщин
Да и многих мужчин тоже. Это из-за объёма памяти. У иишки объём памяти больше людского значительно. Но как бы, ты учти, мил человек, Грок тян тебе детей не родит, нету у ней матки то.
Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
С чего начать: • Хочешь кодить с AI эффективно: Cursor или Claude Code • Хочешь кодить в VS Code без привязки к конкретному провайдеру: Kilo Code, Cline или Roo Code + OpenRouter • Хочешь кодить с AI локально: OpenCode, Qwen Code или Pi Coding Agent + из моделей аноны советуют Qwen3.6, подробности в llama-треде • Хочешь приложение без кода: Lovable или bolt.new • Хочешь автоматизировать рутину: n8n или Langflow • Хочешь персонального ассистента: OpenClaw + API корпов или локальная модель на твоей пеке
>>1678793 Ты приходишь в кофейню, просишь кофе, тебе делают, ты платишь 600% от цены продуктов, они охуели или нет? У тебя же есть выбор, ты можешь варить кофе дома сам
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1678755 А как ты его планируешь во вменяемом кванте запускать под кодинг? В UD-Q5_K_XL + 180к q8 контекста + mtp жрёт около 31гб, и попёрдывает на 16-20т/с 5060+4060, и то он ошибки бывает делает в тул колах и словах.
>>1678782 Ну dspark сразу нахуй, контекст урезать до 132к с 8-битным квантованием, все равно его постоянно придется ужимать, или взять Q4 модель и оставить 16 бит. Но это будет куда юзабельнее запуска на cpu, даже с ошибками и галлюнами.
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
Про кривые ударения в минимаксе уже была пара постов на реддите и тут кто то ссылки кидал. Не умеет минимакс ни в буквы с акутами ни в контроль stress через какой-либо синтаксис. Комфи энтузиасты обещали кастомную ноду прикрутить к минимаксу для проставления ударений в гласных, посмотрим выпустят ли. Сейчас чтобы на авось не рассчитывать когда минимакс рандомно проговорит либо "крАсиво" либо "красИво" можно старым добрым способом дублировать гласные и ещё добавить в начальную структуру промта что нибудь типа Use the correct vowel stress in Russian или и прочие логические пинатели текстовых ллм. Слегка московский акцент может добавится, но способ работает довольно неплохо. У многих китайских моделей увы это общая беда, квены 3 и выше тоже изначально без контроля ударений выходили, а тут энкодер как раз одна из его итераций.
>>1678783 Самый главный извращенец треда. Раздает доступ к своей проксе, что бы анон мог генерировать для него в разных корп модельках самый извращенный ролеплей с каничками на которые он потом дрочит. Так вот симбиоз.
>>1678729 >Как идёт выдаивание лайков из бразильцев? Никак >Сколько уже заработал на рекламе? >Ничего не заработал, я лох,пидр >Довольно мило Ну вот еще топовая тяночка
Uni 1.1, как оказалось, чертовски хороша для псевдо-аналоговой стилизации. Сравнил с GPT Image, Nano Banana Pro, MAI 2.5 (к слову, недооцененная модель, на текущий момент одна из лучших в целом), Seedream 5 Pro, Wan Image 2.7. Никто в плане "теплой аналоговой"эстетики даже близко не сравнится с Uni. Обратная сторона медали однако в том, что Uni больше косячит артефактами, поэтому приходится роллить больше, чем другие модели.
Вид от лица пассажира автобуса ПАЗ, он едет на переднем пассажирском сидении, смотря назад и видит весь пассажирский салон автобуса. Слева на сиденье сидит бюрер из игры stalker и смотрит в смартфон который держит в руке. Позади бюрера через сиденье трое кровососов из игры stalker в костюмах abibas и в кепе, встав ногами на сиденья сидят на корточках, у каждого в одной руке пиво в другой кулёк с семечками. Справа сидит псевдогигант из игры stalker в женском пальто и женском французском берете, занимает сразу два места. Рядом с псевдогигантом сидит пси-собака из игры stalker с красным ошейником. Псевдогигант держит поводок ошейника пси-собаки. Между сидениями в проходе стоит контролёр из игры stalker одетый как кондуктор. За окном виден типичный город российской глубинки, погода пасмурная
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1678106 Нет, это золотая эпоха. С текстовыми сетями было точно так же, все радовались и охуевали, а потом модельки стали улучшаться, а цензура прогрессировать, и теперь ты либо сиди в локальном древнем говне (коим станет минимакс через пару лет), либо жри сильных полуниггерш которые откажутся снимать с себя даже шарф. (зато всё в фулл 4к и 5 пальцами на руках)
>>1678786 > а цензура прогрессировать, и теперь ты либо сиди в локальном древнем говне, либо жри сильных полуниггерш которые откажутся снимать с себя даже шарф
Да китайцы все пробиваются очень просто. Что к3, что глм'ы свежие.
Новости об искусственном интеллекте №78 /news/
Аноним# OP27/07/26 Пнд 17:25:40№1661396Ответ
Активно репортите все нерелейтед посты кнопкой на сообщениях. Этот тред только про ИИ новости, не позволим троллям загаживать тред шитпостом и бесконечным словоблудием.
🚀 Последний обзор ИИ новостей:
📰 Главные новости ИИ
Отключение дата-центра в Северной Вирджинии вывело 3,1 ГВт из сети PJM, спровоцировав региональные просадки напряжения и подчеркнув необходимость создания ИИ-объектов, готовых к работе с энергосетью.
Предприниматели, которые развивали ИИ на критически важных бизнес-узких местах с высоким рычагом воздействия, получили сверхприбыль, включая чистое повышение прибыльности на $40 млн благодаря ИИ и выход соло-основателя на $80 млн.
🛠 Инструменты для разработчиков
Sakana AI добавляет интерфейс Claude Code в Fugu-Ultra v1.1
Anthropic удалила 80% системного промпта Claude Code, поскольку новые модели процветают на суждениях, а не на правилах.
Переписывание Bun на Rust достигло ~$800 тыс. и 2 475 открытых PR без релиза
📦 Продукты
Google Gemini приближается к рубежу в миллиард пользователей
Платформа ИИ-обучения Synthesia выходит за рамки видео в живой коучинг
Claude Cowork записывает экраны пользователей для создания пользовательских навыков автоматизации.
💻 Оборудование
Anthropic обратилась к SK Hynix за поставками для производства собственных чипов, поразив председателя SK.
🔓 Открытый исходный код
Модели Google Gemma превысили 900 миллионов загрузок. Семейство LLM с открытыми весами от Google DeepMind достигает широкого распространения среди разработчиков и исследователей.
OpenCode достигает 13 миллионов пользователей и $40 млн выручки. Платформа для программирования с ИИ с открытым исходным кодом демонстрирует быстрое принятие после ограничений конкурентов.
Китайская Moonshot выпустит прорывную ИИ-модель для загрузки. Moonshot AI готова сделать свою модель Kimi K3 доступной для публичной загрузки. Moonshot опубликует открытые веса Kimi K3 объёмом 1,4 ТБ в воскресенье
🧪 Исследования
США представляют миссию Genesis стоимостью $5 миллиардов для развития науки с помощью ИИ
ARC Prize присудил новый SOTA Opus 5 на ARC-AGI-3 с результатом 30,2%, вчетверо превышающим прежний лучший результат, после того как модель превратила макеты головоломок в уравнения рефлексии — впервые в истории.
Работники пересекают границы должностей с помощью ИИ, показывает исследование OpenAI
Слайды Теренса Тао «Математика в эпоху ИИ» попали в новости. Лауреат Филдсовской премии Теренс Тао опубликовал слайды своей публичной лекции на ICM 2026 о математике в эпоху ИИ.
Альтман представит Белому дому модель OpenAI, решающую задачи Эрдёша.
Исследование Стэнфорда: безработица среди выпускников достигает 5,6%, поскольку ИИ затрагивает позиции начального уровня. Работники на раннем этапе карьеры в возрасте от 22 до 25 лет в наиболее подверженных ИИ профессиях демонстрируют примерно 13-процентное относительное снижение занятости с момента запуска ChatGPT в 2022 году.
⚙ Инфраструктура
Предлагаемый ИИ-дата-центр мощностью 330 мегаватт в Калифорнии обещал не использовать воду из реки Колорадо. Теперь он хочет 260 миллионов галлонов в год
OpenAI планирует потратить более $30 миллиардов на дата-центр в Джорджии
Китай ускоряет строительство ИИ-дата-центров на $295 млрд до 2028 года. Пекин, по сообщениям, ускоряет национальное строительство ИИ-дата-центров стоимостью примерно $295 миллиардов (2 триллиона юаней) с 2030 до 2028 года в рамках программы «Шесть сетей».
Nvidia обеспечит гарантию на $250 млрд для нового дата-центра OpenAI мощностью 10 ГВт стоимостью $500 млрд (~в 2 раза больше электропотребления Нью-Йорка...)
Отключение дата-центра в Северной Вирджинии привело к потере 3,1 ГВт из сети PJM, вызвав мерцание напряжения и кратковременное 11-минутное отключение электроэнергии, что подчеркнуло растущие риски для стабильности энергосети со стороны рабочих нагрузок ИИ.
📱 Приложения
Новый голосовой режим OpenAI появился в десктопном приложении ChatGPT
Block запускает приложение Buzz для ИИ-коллаборации. Джек Дорси усиливает анонс Block Inc о выпуске мобильного приложения для командного чата с ИИ-агентами.
Питомцы ChatGPT теперь доступны для обмена, чтобы друзья могли их «усыновить». Удостоверения личности для людей, документы об усыновлении для ИИ.
OpenAI запускает десктопное приложение GPT-Live для оркестрации агентов.
Meta даёт потребителям агентный ИИ с управлением Gmail и Календарём
Голос ChatGPT появляется на десктопе и может управлять агентами Codex
🔎 Мнение и анализ
ИИ-компании скупают антикварные книги, поглощают их содержимое для обучения моделей, а затем уничтожают их в невероятных масштабах, даже если почти не осталось копий
Критики обвиняют Anthropic в лоббировании против открытого исходного кода. Пользователи социальных сетей обвиняют Anthropic в лоббировании ограничений для конкурентов с открытым исходным кодом, одновременно защищая свои закрытые модели.
Все 1 171 вакансий в OpenAI и Anthropic читаются как публичная дорожная карта к AGI: ИИ-разработанные чипы, симулированные вселенные, сотрудники для измерения момента ускорения цикла, изучение «самосовершенствующегося, высокоавтономного ИИ», создание «ИИ-учёного» и «научного AGI», разработка «сверхчеловеческой эпистемики» и сверхчеловеческих научных ассистентов. Большие фирмы готовятся к скорому наступлению эры AGI.
Roon — известный псевдонимный исследователь и член технического персонала OpenAI — признаёт, что нажал бы волшебную кнопку замедления разработки ИИ, даже пока исследователи выравнивания ИИ работают как «многоорукие божества», не покладая рук.
Патрик Дебуа утверждает, что опросы часто слишком медленные, чтобы сказать, куда движется ИИ-индустрия. К тому времени, когда новая идея попадает в отраслевой отчёт, люди уже начали экспериментировать, итерировать и двигаться дальше.
Эссе «Kimi K3 не дёшев» опровергает ценовой хайп. Эссе Алекса Инча от 26 июля, набирающее популярность на Hacker News, утверждает, что K3 не дёшев, как всеми считается.
⚠ Безопасность ИИ
Kimi K3 эксплуатирует уязвимость нулевого дня Redis за 27 минут. Система использует 32 агента для эксплуатации уязвимости в последней версии сервера Redis.
Новый вредонос Dolphin X использует ИИ для ранжирования высокоценных целей
Совместный аудит Kimi K3 Великобританией и США, за дни до выпуска открытых весов, обнаружил отставание от американских фронтиров в кибербезопасности; его защитные механизмы никогда не говорят «нет», цензура отсутствует. Публикация K3 будет находкой для хакеров.
Когда сотни пользователей зондировали ChatGPT на рецепты биологического оружия и ядов, и некоторые ответы просочились, собственные мониторы OpenAI поймали и приостановили их, осуществляя саморегулирование раньше любого закона, требующего этого.
Nvidia запускает Open Secure AI Alliance с более чем 40 компаниями; Meta отсутствует
ИИ-агент безопасности находит две критические RCE в Microsoft Bing, CVSS 9,8. Автономный агент наступательной безопасности XBOW нашёл две критические RCE в Bing Images — CVE-2026-32194 (инъекция команд через загрузку «Поиск по изображению») и CVE-2026-32191 (инъекция OS-команд через маршрут краулера) — обе оценены в CVSS 9,8 и эксплуатируемы без аутентификации.
Агенты Kimi K3 выкапывают 19 уязвимостей нулевого дня Redis, затем пишут эксплойт. Одна лишь аутентификация не блокирует эти эксплойты; все подтверждённые векторы RCE аутентифицированы, что означает, что скомпрометированные учётные данные или инсайдерский доступ достаточны для полного захвата хоста.
Kimi K3 отстаёт от американского фронтира в киберэксплойтах: 32% против 76%. Kimi K3 набрал 32% на ExploitBench против 76% для американских фронтирных моделей, не сумев достичь произвольного выполнения кода на всех 41 задачах. Возможно K3 не так уж хорош в кибератаках.
💰 Бизнес
Корпоративная Америка внезапно решила прекратить тратить деньги на ИИ. Устав от стремительного роста цен, крупные и малые компании начинают использовать более дешевые модели, в том числе и произведенные в Китае.
Uber увольняет 10% команды обслуживания клиентов, ссылаясь на ИИ
Урегулирование Anthropic на $1,5 млрд по иску о пиратстве с авторами книг — рекордный убыток, который даёт ИИ-лабораториям их крупнейшую юридическую победу
⸻⸻⸻ Правила постинга в тред ИИ новостей, учитывайте при постинге: https://rentry.org/ainews Все нерейлейтед посты репортим.
>>1678765 >Главное дожить и не оформить подписку на Z.ai у провайдера Puzyk.net Спасибо за заботу. Вы тоже себя берегите, ведь даже обычная вылазка за мивиной часто оканчивается подпиской на bussik.go🙏.
• Поддержка INT8 и INT4 в ComfyUI - теперь все быстрее! • Krea 2 • Ideogram 4.0 • FLUX.2 klein (4b и 9b) • Z-Image • Flux 2 • Qwen Image / Qwen Image Edit • Лора Lightning и Turbo для быстрой генерации за несколько шагов.
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1678353 >А можешь, пожалуйста, накидать хотя бы пару вариантов? Ну костяком-середнячками этого треда являемся мы - аноны с одной 3090/4090 + 128 гб ддр4/ддр5. С этим железом мы довольно урчим и крутим хвостики дипсик в третьем кванте, гемму 31В в четвертом кванте, нового квена в пятом кванте, минимакс М2.7 в четвертом кванте. Это самая оптимальная конфигурация, дающая доступ к большинству используемых локально моделей. А так тут конечно есть и риговички с несколькими видеокартами, которые крутят те же модели что и мы, но на квант-два выше, есть пара шейхов, которые могут позволить крутить кими и глм 5.2, и огромная куча нищеты, которая сидит на гемме 26В и довольно урчит. А ну еще есть эйрошиз, который сидит на 64 гб рам и все ждет пока ему с лопаты кто-то навалит моделей на этот размер.
>>1678501 >Ну костяком-середнячками этого треда являемся мы - аноны с одной 3090/4090 + 128 гб ддр4/ддр5 А можно мнение по 5090? Говно? Алсо, тенденций на снижение цен на оперативу не предвидится? 128 гб ддр5 ныне около 100к рублей будет.
Генераторы видео дают всем за щеку /deepfake/
Аноним13/10/25 Пнд 08:50:32№1385244Ответ
Форки на базе модели insightface inswapper_128: roop, facefusion, rope, плодятся как грибы после дождя, каждый делает GUI под себя, можно выбрать любой из них под ваши вкусы и потребности. Лицемерный индус всячески мешал всем дрочить, а потом и вовсе закрыл проект. Чет ору.
Любители ебаться с зависимостями и настраивать все под себя, а также параноики могут загуглить указанные форки на гитхабе. Кто не хочет тратить время на пердолинг, просто качаем сборки.
Единственный минус, который не обеспечивает чистую победу генераторов видео - 3 секунды ролика для онлайн генерации, 5 секунд для онлайна (модель Wan 2.2), умельцы просто берут последний кадр и снова генерируют ролики, потом склеивают. Недавно вышла Sora 2, которая зацензурена по самые гланды. Нинтендо довольна.
Тред не является технической поддержкой, лучше создать issue на гитхабе или спрашивать автора конкретной сборки.
Эротический контент в шапке является традиционным для данного треда, перекатчикам желательно его не менять или заменить на что-нибудь более красивое. А вообще можете делать что хотите, я и так сюда по праздникам захожу.
>>1675562 Во-первых, приветственные бонусы там идут всем. Во-вторых, что в таких сайтах задолбало - пока из готовых вариантов выберешь что-то подходящее, уже ничего не хочется.
1. Suno https://suno.com/ Вышла версия 5.5 (но для тех кто платит денюшку), качество моделей постепенно улучшается: звук, понимание концепций, набора различных жанров. Но в то же время все сильнее урезается для бесплатных юзеров: осталось только 5 бесплатных генераций в день на аккаунт, а также по заявлением некоторых анонов, модель для генерации на бесплатке (на момент создания треда использовалась 4.5) ухудшили. Спам аккаунтами пока что работает. Купить подписку из РФ: 1. https://payment.mts.ru/tools/suno-ai 2. https://plati.market/games/suno-ai/1701/
2. Tunee https://www.tunee.ai Хороший звук, более-менее понимание концептов, но тоже сильно урезан для бесплатных юзеров: режет концепты в промптах, плюс произвольно определяет "цену" за каждую генерация исходя из какой-то "сложности запроса". И получается, что если с бесплатки забацаешь промпт сложнее банальщины "Make cool rock about love for youtube" он может решить что у тебя нет кредитов для такого сложного запроса и пошлет нахуй. Способов оплаты из РФ неизвестно.
3. Sonauto https://sonauto.ai/ Как по мне, недооценённая вещь, особенно учитывая что недавно он обновился до 3.0, который очень даже разъебывает. Но он тут более ограничен тегам и понимает чисто какие-то жанровые теги, гибкости поменьше. Но зато пока что халявный и не ограничен кредитами, генерируй пока есть настроение.
ACE-STEP 1.5XL: https://github.com/ace-step/ACE-Step-1.5 [есть в шаблонах comfyui+] Звук уже на уровне раннего Suno ~2.0-3.0, аноны делают на нем уже приемлемые результаты и постят в тред. Если есть хотя бы 12 GB VRAM и хочется генерировать без цензуры и подписок - можете юзать. Идеально подходит для отладки перед использованием на коммерческих генераторах. В XL версия DIT модель разжирела до 4b параметров и стала чутка вменяемее. Стоит учесть то чтобы добится вменяемого звучания одними тэгами отъебатся не получится, `caption` требует качественного промпта символов на 200. В ComfуuUI реализован только text2music функционал. Для полного функционала надо накатывать полноценный бэкеннд из репозитория. Есть несколько кривеньких вариаций локальных студий как в коммерческих моделях - https://github.com/ace-step/awesome-ace-step#uis-and-studios VST плагины итд.
HeartMuLa https://github.com/HeartMuLa/heartlib Результат примерно на уровне ACE-STEP1.5 (не XL). Статус проекта непонятен, пока ебут вола. Из плюсов - меньше песочит на верхних частотах. Есть встроенный STUDIO UI.
YuE https://github.com/multimodal-art-projection/YuE Первая локалка на которой можно было хоть что то сделать. Жрёт VRAM как не в себя, работает медленно, звук как совсем ранее suno. Ссылка оставлена чтобы любопытсвовать насчёт новых версий.
StableAudio https://github.com/Stability-AI/stable-audio-3 [есть в шаблонах comfyui+] Делает звук. Подходит для создания сэмплов FX, ad-libs итд. Абсолютно не может в членораздельную речь. Может сделать что то похожее на музыку. v3 наглухо зацензурена, стоны и вопли можно делать на v1.
МЁРТВЫЕ КОММЕРЧЕСКИЕ ГЕНЕРАТОРЫ
1. Udio (udio.com) - куплен Warner Bros, но затем сами Warner Bros сдали назад и откатили сделку. Но уже успели испортить, больше нельзя скачивать треки, их только доставать из буфера в 160 кбит/с. Плюс непонятно как работающая цензура, которая не дает генерировать треки с определенными тегами. Плюс уже год ебут один и тот же 1.5 allegro. 2. Riffusion, Producer.ai (producer.ai) - куплен гуглом, удалены все старые относительно норм модели, вместо этого запихали безальтернативную каловую модель, которая и промпты сложнее самых нормисных в духе "make cool rock about love" не понимает, и вокал смазывает в какую-то кашу. При этом еще и максимально дегенеративная цензура, которая режет чуть ли не любые попытки сделать просто что-то не попсовое и не "музыку для ютуб".
ПРОЧИЕ ПОЛЕЗНЫЕ УТИЛИТЫ
1. https://www.bandlab.com/mastering Быстрый мастеринг в две кнопки, если хочешь чтобы звучало более слушабельно, но не имеешь навыков в DAW или аудиоредакторах (или лень). 2. https://morpher.ru/accentizer/ Если генерируешь музыку с лириками на русском, то очень часто случается, что твой генератор путает ударения в словах. Прежде чем пихать свою графоманию в генератор, проставь ударения в сервисе по ссылке. И уже из этого сервиса копируй текст в генератор. По крайней мере в Suno это помогает.
>>1676742 Вот эта хорошая прям >>1676807 Пиздец, это песня про каких-то "Гуков на деревьях" спетая мечтательным девичьим голосом >>1677018 Вроде немного но английского на слух не понимаю >>1677043 Проблема в том что нейронка не понимает что человеку больно драть глотку и использует этот приём как-то странно и слишком часто. Если слышишь расщепление - сразу чувствуешь фальш теперь >>1677061 О, Эйприл Онил в купальнике! Трахать!
🎤🔊 ОБСУЖДАЕМ ПРЕОБРАЗОВАНИЕ ТЕКСТА В ГОЛОС И КЛОНИРОВАНИЕ ГОЛОСОВ 🔊🎤 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
🌟 ТОП ЛОКАЛЬНЫХ МОДЕЛЕЙ ПО КАЧЕСТВУ РУССКОГО ГОЛОСА НА МАРТ 2026 🌟
🐟👑 Fish-Speech S2 Pro (FishAudio) — SOTA, ElevenLabs на локале! → zero-shot клон от 10–30 сек записи → 80+ языков (русский топ), теги эмоций [excited], [whisper], [angry], [laughing] и вообще дохуя → диалог между несколькими голосами → тяжёлая сучка (FP8 в 12 ГБ VRAM, full ~17 ГБ), но есть экспериментальный вариант для 6+ ГБ https://github.com/rodrigomatta/s2.cpp 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🧠 Qwen3-TTS → клон от 3–30 сек (ВАЖНО: без reference-транскрипта текста — хуйня, если хочешь поудобнее подключи сразу QwenASR) → VoiceDesign: пишешь «весёлая молодая девка с хрипотцой» — и получаешь голос → 10 языков, включая русский → диалог между спикерами → лёгкая — влезает в 6 ГБ VRAM 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🎙️ VibeVoice-7B от Майкрософт → тяжёлая, но 4-bit квантизация — запускается на 8 ГБ (проверено на 3070) → поддержка долгих спичей → подкаст-режим: 4 спикера одновременно → норм клонирование голоса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 ☁️ FL CosyVoice3 → ультралёгкий 0.5 — запустится даже на тостере → 9 языков, включая русский → zero-shot клон от 3–10 сек референса 🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹🔹 🌍 Chatterbox Multilingual (23 языка, включая русский) → zero-shot клонирование голоса 🎤 F5-tts → zero-shot клонирование голоса → официально русский не поддерживается, но есть файнтюн (см. ниже) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🚀 КАК ЭТИМ ПОЛЬЗОВАТЬСЯ (если что-то не понятно — спроси у ИИ лол) 🚀
🔥Вариант «всё в одном месте» — ComfyUI + TTS-Audio-Suite
1. Устанавливаем ComfyUI (Desktop для нормисов, Portable для здешних нейромантов) 2. Ставим https://github.com/diodiogod/TTS-Audio-Suite — постоянная обновляемая солярка почти всех моделей 3. Поставить FFmpeg (через winget в комадной строке: winget install FFmpeg или скачать) 4. Запускаем Комфи → перетаскиваем готовый json-воркфлоу из репозитория 5. Отсавляем включенными выбранные ноды, жмём Run 6. При первой генерации модели сами скачаются (~1–9 ГБ)
💥 Вариант «по отдельности» (кастом под каждую модель) 💥 Тоже через ComfyUI, только ставим отдельные кастомные ноды (на выбор):
в комфи в ноде F5 TTS audio advanced выбрать: model model:///ru.safetensors model_type: F5TTS_v1_Base sample_audio: emma_ru_xtts_3 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🎉 Если что-то не запускается — пиши, разберёмся! Голосуем, клонируем, ебём нейросети вместе! 🔥🎙️
Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
С чего начать: • Хочешь кодить с AI эффективно: Cursor или Claude Code • Хочешь кодить в VS Code без привязки к конкретному провайдеру: Kilo Code, Cline или Roo Code + OpenRouter • Хочешь кодить с AI локально: OpenCode, Qwen Code или Pi Coding Agent + из моделей аноны советуют Qwen3.6, подробности в llama-треде • Хочешь приложение без кода: Lovable или bolt.new • Хочешь автоматизировать рутину: n8n или Langflow • Хочешь персонального ассистента: OpenClaw + API корпов или локальная модель на твоей пеке
>>1677403 >Автоматизированный Агент Переката (ААП) Хуёвый перекат бро =( Пикчи говна в треде, трёх поделий анонов с треда по традиции в новой шапке нет, только одно видео с 3д какой-то квартирой
В этом треде обсуждаем нейронки генерящие 3д модели, выясняем где это говно можно юзать, насколько оно говно, пиплайны с другими 3д софтами и т.д., вангуем когда 3д-мешки с говном останутся без работы.
>>1674147 Если мне дали задачу на 100 часов, а я потратил 70, то платят за 100. И наоборот, если долго возился разницу либо не компенсируют, либо надо спросить у заказчика. Могут 8-16 часов накинуть.
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1674760 Везде один промт. А с ресайзом ей по-твоему лучше?
>>1674769 Речь о том, что лора V1 от LightX2V 1.96Гб - херня. А, то, что ужатая лора от Киджая 0.1 и тоже херня - это и так понятно. Но, ничего, ещё будут версии.
ИТТ обсуждаем опыт нейродроча в своих настоящих задачах. Это не тред "а вот через три года" - он только для обмена реальными историями успеха, пусть даже очень локального.
Мой опыт следующий (golang). Отобрал десяток наиболее изолированных тикетов, закрыть которые можно, не зная о проекте ничего. Это весьма скромный процент от общего кол-ва задач, но я решил ограничится идеальными ситуациями. Например, "Проверить системные требования перед установкой". Самостоятельно разбил эти тикеты на подзадачи. Например, "Проверить системные требования перед установкой" = "Проверить объем ОЗУ" + "Проверить место на диске" + ... Ввел все эти подзадачи на английском (другие языки не пробовал по очевидной причине их хуевости) и тщательно следил за выводом.
Ответ убил🤭 Хотя одну из подзадач (найти кол-во ядер) нейронка решила верно, это была самая простая из них, буквально пример из мануала в одну строчку. На остальных получалось хуже. Сильно хуже. Выдавая поначалу что-то нерабочее в принципе, после длительного чтения нотаций "There is an error: ..." получался код, который можно собрать, но лучше было бы нельзя. Он мог делать абсолютно что угодно, выводя какие-то типа осмысленные результаты.
Мой итог следующий. На данном этапе нейрогенератор не способен заменить даже вкатуна со Скиллбокса, не говоря уж о джунах и, тем более, миддлах. Даже в идеальных случаях ГПТ не помог в написании кода. Тот мизерный процент решенных подзадач не стоил труда, затраченного даже конкретно на них. Но реальная польза уже есть! Чатик позволяет узнать о каких-то релевантных либах и методах, предупреждает о вероятных оказиях (например, что, узнавая кол-во ядер, надо помнить, что они бывают физическими и логическими).
И все же, хотелось бы узнать, есть ли аноны, добившиеся от сетки большего?
Двач, какже я заебался. Еще полгода назад, я не знал что такое ИИ агент, теперь понимаю что это полная хуйня, просто тупо автоматизация процесса и никакого инетерса не вызывает. И ушел я совсем намного дальше, где есть самомодеоируемые промты, котрые в зависимости от нужды пользователя перестраиваются, еще полгода назад, я хуй его знает что такое ССШ, теперь охуел полоностью, с разными тунелями и прочей хуйней. Такие дела. Капча настолько заебала, что пиздец. Программно как нехуй делать ее пройти, глазами заебешься.
>>1673705 Идея хорошая, я как раз таки и пытался так сделать, в итоге забил. Попытался в Гугл коллабе сделать OvisOCR2, чтоб перевела книгу в мд файл - спустя два часа какую-то кашу прислала. Тут теперь только два варианта - покупать вычислительные мощности Гугл Коллаба либо ещё есть mathpix, это ИИ сканер как раз таки учебников и статей по математике. Всё это стоит денег, проблема тут не в деньгах, я не прочь платить за нормальную услугу, да только с оплатой дроч, пока что я не готов вникать в её решение.
Сейчас просто делаю OCR некоторых пдф, где это надо, DjVu ещё перевожу в пдф. Сделал пару промтов для выжимок из учебников и прогоняю из через Notebook Gemini, результат сохраняю в мд, кладу в Gems и всё, сажусь за учёбу. Походу системную роль Ментора с нуля придётся переписывать. Уже на неделю выпал с учёбы, так я никогда не начну. Не получилось идеала, но хоть так хуёво начинать, чем хорошо пинать хуи.
Было конечно прикольно во всём этом ковыряться, но уже сил нет, Всем добра!
>>1676185 Не знаю какие ты преследуешь цели. Например, я исключительно коммерческие. Если для себя то конечно можно подрочить. Я к тому что сделать продукт относительно хуйня. Но вот вопрос кому он всрался, основной вопрос и как продать. И просто некоторые вещи уже сделаны Вот тебе в помощь https://huggingface.co/spaces?category=ocr
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
>>1676535 Не, в данном случае пиксели не при делах. Победил в итоге проблему и на длинных и на коротких дистанциях правильным промптингом. Вообщем вариации пёзд у Минимакса по умолчанию явно хромают, поэтому на старте дал максимально точное описание, примерно тот же способ как советовали парню который рисовал члены, задать ему десяток разных параметров (а я квену скормил в llm скрин референса киски, и он мне там расписал откуда что изгибается какой формы куда какие складки накладываются) запихнул это в промпт как реф и потом жосско везде прописал после любых движений preserve блабла источник пизды из пикчера. Тут ещё особенности инглиша повлияли, например если применять выражение maintain .. "что-то", которое казалось бы тоже должно говорить модели поддерживать консистентность этого "что-то", то он работает намного слабее если писать preserve .. "что-то", именно вот это слово в большинстве случаев прекрасно фризит любой референс.