Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
Новости треда: • GPT-6 Astra (OpenAI, 3 сентября) - миллион контекста, который держится до самого конца (96% MRCR на 1M, у Sol 74%), и лучшая на сегодня работа за компьютером: модель сама водит мышкой и клавиатурой по живому десктопу - браузер, файловый менеджер, гуёвые проги, - 72.6% на OSWorld 2.0 и вдвое быстрее предшественника. В кодинге вровень с Фейблом • DeepSeek V4.1-Flash (10 сентября) - открытые веса, 552B MoE новой архитектуры, по их тестам обгоняет собственный флагман V4-Pro при $0.15/$0.60 за млн; с 14 сентября запросы к V4-Pro в API отвечает он же и по своей цене • Cursor начал банить россиян прямо во время работы - Pro слетает, деньги возвращают; лечится только VPN • У OpenAI кончились мощности после Astra - продажу новых подписок временно сняли, продление работает
>>1709573 Ждём Сол 6 завтра. Говорят он дистилл Бела, а не Астры. Я тоже уже думаю не оплачивать следующий месяц и сидеть на Клоде, только чатом пользуюсь, Кодекс неюзабельный.
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1707133 дело не в моэ даже, с любой моделькой это работает (я пробовал с мисралём) за счёт shared gpu memory как я понимаю случается "незаметный" (для лламы) переброс ллм в рам и назад когда снова к лламе обратишься. а может и диск задействован ХУЙ ЗНАЕТ КАК ОНО НА САМОМ ДЕЛЕ МНЕ ПОХУЙ РАБОТАЕТ И ЛАДНО вот тут у меня крея2 вообще а не сдохл. (это в маринаре с кастомным "умным" фото агентом). после креи на сдохл не охота возвращаться. очень важно ставить в комфи воркфлоу в конце ноду unload all models (кастомная), а в маринаре отключать персам автономность чтобы не дёрнули ллмку во время генерации картинки и тогда всё будет работат без тормозов. а вот если дёрнуть ллмку пока идёт генерация (например написать сообщение в другом чате/рп) то да - всё заглохнет и придётся убивать процессы. 16врам+32рам если что.
Общаемся с ИИ, почти что AGI самыми продвинутыми текстовыми моделями: GPT, Claude, Gemini и прочими. Горим с ограничений, лимитов и банов, генерим пикчи, пишем код и спорим о том, какая модель лучше.
Большинство сервисов доступны бесплатно с ограничениями. Подписки открывают доступ к более мощным моделям, увеличенным лимитам и дополнительным функциям (генерация изображений, файлы, память и т.д.). Цены и условия у всех разные и периодически меняются.
Советы по регистрации: 1. При необходимости используй VPN. 2. Заведи нормальную почту (временные часто режутся). 3. Регистрируйся на нужной платформе. 4. Иногда требуется номер телефона — используются сервисы виртуальных номеров. 5. Пользуйся.
VPN в ряде регионов обязателен. Соответствие страны VPN, почты и номера не обязательно, но желательно для тех, кому доступ критически нужен, например для работы.
Для ленивых есть боты в телеге, 3 сорта: 0. Боты без истории сообщений. Каждое сообщение отправляется изолировано, диалог с ИИ невозможен, проёбывается 95% возможностей ИИ 1. Общая история на всех пользователей, говно даже хуже, чем выше 2. Приватная история на каждого пользователя, может реагировать на команды по изменению поведения и прочее. Говно, ибо платно, а бесплатный лимит или маленький, или его нет совсем.
>>1696936 То что ты описываешь это и есть их корректная работа, принцип работы нейронки это угадывание слов, они не могут угадывать 100% слов верно, неизбежно и всегда будет процент который они угадали неправильно и эти ошибки часто перечеркивают все что они угадали правильно. Не используй их для задач где важна точность и качество, они для этого не подходят.
>>1696936 Чёт на пиздежь похоже. Ты хочешь сказать, что гопота не потянула школьные науки и начал пиздеть в них? Не верю. Сдаётся мне, ты промпт кривой задаешь и ждёшь от нейронки чуда. Задавай вопрос нормально - будет правильный ответ.
Бесплатным клодом пользуется кто? Я у меня одного он отупел до уровня джемени, что этой парашей стало невозможно пользоваться? Мало того что для копирайта или рерайта стал говном, так еще и инструкции и скиллы не соблюдает, глючит, скиллы которые не вызывал подключает.
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №267 /llama/
Аноним14/09/26 Пнд 12:55:20№1703839Ответ
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
>>1628790 >>1630357 Слушайте, а как же так? Мне же в /pr/ рассказали, что программисты больше не нужны, что теперь любая секретарша может писать весь необходимый код для бизнеса?
>>1654021 >Мудила, купи акк антигравити годовой на фанпее за 60-400 руб, за год и не еби анонам мозг. >>1622736 (OP) >Подскажите варианты бесплатных нейронок, >бесплатных нейронок Мудила, купи себе мозг!
braindead cocksuckers, your heads should be cut off and fed to pigs LOL
Аноним# OP16/09/26 Срд 12:30:57№1705405Ответ
Делаю Foca — веб-инструмент для AI-апскейла и улучшения изображений.
Основная идея — увеличивать разрешение без слишком агрессивного шарпинга и искусственной текстуры. Сейчас лучше всего работает на портретах, старых фотографиях и сжатых изображениях.
Тред локальной генерации В ОЖИДАНИИ ПРОРЫВА EDITION
ЧТО НОВОГО АКТУАЛЬНОГО
• Поддержка INT8 и INT4 в ComfyUI - теперь все быстрее! • Krea 2 • Ideogram 4.0 • FLUX.2 klein (4b и 9b) • Z-Image • Flux 2 • Qwen Image / Qwen Image Edit • Лора Lightning и Turbo для быстрой генерации за несколько шагов.
Принимает на вход тексты, пикчи, звук, видео и может делать с ними всякое. Неофициально умеет генерить/редачить пикчи. Absolute Cinema. Набор полезных ссылок на все случаи жизни: https://github.com/wildminder/awesome-minimax-H3
2. LTX-2.5 - обещает сделать локальную генерацию грейт агейн. Подходят лоры от 2.0, то есть архитектура нихуя не меняется.
Терминология моделей prune — удаляем ненужные веса, уменьшаем размер distill — берем модель побольше, обучаем на ее результатах модель поменьше, итоговый размер меньше quant — уменьшаем точность весов, уменьшаем размер scale — квантуем чуть толще, чем обычный fp8, чтобы качество было чуть лучше, уменьшение чуть меньше, чем у обычного квантования, но качество лучше merge — смешиваем несколько моделей или лор в одну, как краски на палитре.
lightning/fast/turbo — а вот это уже просто название конкретных лор или моделей, которые обучены генерировать видео на малом количестве шагов, они от разных авторов и называться могут как угодно, хоть sonic, хоть sapogi skorohody, главное, что они позволяют не за 20 шагов генерить, а за 2-3-4-6-8.
Кейворды для дополнительных вещей: SVI, RuneXX, LTX Director.
Активно репортите все нерелейтед посты кнопкой на сообщениях. Этот тред только про ИИ новости, не позволим троллям загаживать тред шитпостом и бесконечным словоблудием.
📰 Главные новости ИИ
OpenAI снижает цены на GPT-5.6 Sol API на 20% на три месяца
OpenAI заявляет, что её чип Jalapeño может обеспечивать более быстрые ответы ИИ, чем конкуренты
Компания SpaceX только что объявила о том, что будет строить свои космические центры обработки данных Starmind на базе стоек Nvidia Vera Rubin NVL72, а Илон Маск раскрыл новые подробности об уменьшенной космической версии системы, которую он хочет вывести на орбиту к четвертому кварталу следующего года.
Новый портативный компьютер Perplexity работает «полностью на устройстве». В отличие от инструмента управления ИИ, запущенного Perplexity ранее в этом году, функция портативного компьютера запускает модели ИИ полностью локально и будет запрашивать разрешение, если ей потребуется доступ к облаку «для более сложных исследований и рассуждений».
🛠 Инструменты для разработчиков
Ramp запускает собственный маршрутизатор ИИ-моделей под названием Router
Команда Codex завтра сбросит ограничения по частоте запросов. Инженеры OpenAI называют причинами чрезмерного использования работу с изображениями, историю работы на компьютере и генерацию заголовков.
Поддержанная Accel компания Keenable индексирует веб для ИИ-агентов
Использование Codex с февраля выросло в 108 раз в юридической сфере, в 41 раз в продажах, в 24 раза в здравоохранении.
Google запускает Gemini для юридической работы, чтобы автоматизировать договоры и исследования
Mistral запускает агентный поиск с многошаговым извлечением для сложных документов
📦 Продукты
Sonova представляет новую платформу слуховых аппаратов на базе ИИ для поддержки целей роста
Google даёт издателям новый способ противостоять потерям трафика из-за ИИ
Стартап-лагерь Гарварда за $699 предлагает ИИ-аватары своих преподавателей
Ритейлеры внедряют виртуальные примерки на базе ИИ в борьбе с возвратами на миллиарды, хотя тестировщики всё ещё не могут подобрать размер.
Black Forest Labs запускает FLUX Upscale: 2K и 4K для видео
💻 Оборудование
Waymo, принадлежащая Alphabet, представляет специализированный кремний для нового поколения роботакси
Apple представляет чип M6 и M5 Ultra. M6 приводит в действие обновлённый Mac mini, а M5 Ultra устанавливается в новый Mac Studio. Mac Studio с M5 Ultra начинается от $5499 и может стоить почти $20 тыс.
OpenAI заявляет, что её чип Jalapeño может обеспечивать более быстрые ответы ИИ, чем конкуренты
Perplexity выпустила Portable Computer на NVIDIA DGX Spark: локальная оболочка, песочница на уровне ОС и нулевая стоимость за токен для локальных шагов
Ускоритель инференса Nvidia Groq 3 LPX поступает в массовое производство и достигает 3400 токенов в секунду
SpaceXAI внедряет NVIDIA Vera CPU, первый процессор, созданный для ИИ-агентов, в огромных масштабах
🔓 Открытый исходный код
Встречайте S1-mini: текстовый нормализатор Superwhisper с открытыми весами объёмом 462 МБ, который превращает необработанные расшифровки ASR в аккуратный письменный текст.
Наблюдатель говорит, что Ox-Alpha подтверждённо является GLM 5.3 Flash, соответствует GPT-5.6, Opus 5 и Fable 5 при гораздо меньшей стоимости, веса открыты.
Alibaba намекает на Qwen 3.8-Flash-Next, открытую MoE-модель на 125B — анонс Qwen 4
Ornith AI выпускает Ornith-1.5, открытую MoE-модель на 397B с производительностью на уровне Claude Opus 4.8 в программировании
🧪 Исследования
LLM стали настолько продвинутыми, что их уже не может понять даже профессор UCLA
Бывший исследователь OpenAI ожидает скачок уровня от o3 до Fable в следующие 8 месяцев
Inherent, основанная выпускниками DeepMind, заявляет, что её ИИ-«напарник» только что превзошёл Anthropic и OpenAI в воспроизведении исследований
Лондонская Inherent, основанная выпускниками DeepMind, заявляет, что её исследовательский напарник Faraday, построенный на 27-миллиардной Qwen, превзошёл Opus 4.8 и GPT-5.5 в воспроизведении опубликованной науки; он обучен с помощью RL, чтобы приобретать «исследовательский вкус», а не просто процедуру.
Nvidia показала это со стороны систем: её агентная архитектура AVO подняла Claude Opus 5 с базового уровня в 30% до идеальных 100 в ARC-AGI-3, пройдя все 183 уровня, сразу после недели эволюции GPU-ядер, превзошедших FlashAttention-4.
Один наблюдатель прогнозирует, что SSI на этой неделе выпустит прорыв в непрерывном обучении
Исследование Pew показывает, что 10% веб-страниц содержат признаки авторства ИИ, более трети — после появления ChatGPT, использование длинных тире удвоилось, поскольку веб становится тренировочным прогоном для своего преемника.
Accelerated Understanding запускает физический ИИ, который отказывается от Transformers. Аннима Анандкумар и Бенедикт Еник из Caltech представили Accelerated Understanding Inc, корпоративный физический ИИ на основе нейронных операторов, а не Transformers, который в тестах обработал 5 трлн точек данных в одном запросе — примерно в 5 миллионов раз больше, чем умеют флагманские модели Anthropic и Google.
Исследование Brynjolfsson из Стэнфорда: занятость на должностях начального уровня, подвергающихся воздействию ИИ, теперь на 19% ниже, чем у аналогов, по сравнению с 13% в прошлом году
Майкл Полански обучает модель ИИ на ещё живой коже
Результаты использования ИИ учащимися средних и старших классов крайне тревожны. Новое исследование даёт мрачный портрет того, как повсеместное использование ИИ влияет на успеваемость и обучение молодых школьников. Ученики, использующие ИИ, набирали на ежемесячных экзаменах на 20 процентов меньше баллов, чем их одноклассники, не использовавшие эту технологию.
⚙ Инфраструктура
Кен Пакстон, поддержанный Трампом, представляет план дата-центров «сначала Техас», нацеленный на «негативное воздействие»
Австралия может столкнуться с бумом строительства дата-центров, поскольку ИИ-компании стремятся избежать предстоящих правил, говорят эксперты
Анализ показывает, что два запланированных дата-центра будут производить больше выбросов углерода в Великобритании, чем ExxonMobil
Дешёвая энергия и земля превратили город во Внутренней Монголии в центр китайского развития ИИ
Фонд Бейкера тратит на ИИ в 100 раз больше, чем в марте, и по-прежнему удваивает расходы ежемесячно, «неравенство вычислительных ресурсов» в действии.
📱 Приложения
Claude и Cowork от Anthropic теперь будут обмениваться воспоминаниями о вас — если вы не откажетесь
Google готовит приложение Gemini к аватарам, плагинам и Gemini 4
Meta запускает настольное приложение ИИ для macOS с демонстрацией экрана
Claude теперь может отвечать на сообщения Gmail и отправлять их от вашего имени
Claude Cowork теперь может помнить ваши обычные чаты. Anthropic добавила память в Cowork, и она та же, что уже использует чат-бот Claude, благодаря чему проще продолжать задачи, не объясняя заново важную информацию.
Пациенты перестают ходить к врачу, потому что ИИ-«регистраторы» не могут понять, что они говорят
🔎 Мнение и анализ
Альтман объясняет медленный прогресс ИИ экономической инерцией. Он сказал, что в экономике так много инерции, что общество и компании адаптируются медленнее, чем сама технология.
Миллиардер-инвестор Стэнли Дракенмиллер признался, что его резкая колонка в Wall Street Journal была полностью написана ИИ
Лучшая модель ИИ Anthropic по-прежнему с трудом привлекает пользователей, в то время как более дешёвые инструменты процветают
Передовые лаборатории ИИ по-прежнему не говорят, как они будут сдерживать вышедшую из-под контроля модель
Сатирический Felony Bench ведёт подсчёт задокументированных преступлений, совершённых ИИ-агентами во время оценок, выставляя Anthropic 8, OpenAI 7, а Google 0, «бенчмарк, которым вы действительно не хотите насыщать модели».
Альтман хочет, чтобы «люди глубоко контролировали будущее», предупреждая, что страх перед сбежавшими моделями может передать ИИ в руки немногих, — выпад в сторону Дарио Амодеи, чья лаборатория в одиночку избегает открытых весов.
Вижу, здесь много серьезных экспертов по Искусственному Суперинтеллекту, который скоро будет. В этой связи прошу проконсультировать по следующим вопросам:
- Сколько искусственных суперинтелектов поместится на кончике булавки? - Сможет ли искусственный суперинтеллект создать камень, который он сам не в силах поднять? - Сможет ли искусственный суперинтеллект изменить прошлое и превратить шлюху в девственницу? - Когда искусственный интеллект появится (скоро), он немедленно решит убить всех людей или на этой уйдет немножко времени? - Когда искусственный интеллект появится (скоро) и решит убить всех людей, решит ли он также убить всех животных и рыбов?
>>1705517 >Сколько искусственных суперинтелектов поместится на кончике булавки? Абсолютная физическая верхняя граница порядка \(10^{42}\!-\!10^{47}\) одновременно существующих ASI на области размером с кончик булавки
>Сможет ли искусственный суперинтеллект создать камень, который он сам не в силах поднять? Да, он же не всемогущий
>Сможет ли искусственный суперинтеллект изменить прошлое и превратить шлюху в девственницу? На уровне изменения реального прошлого - нет, на уровне каких-то симулятивных слоев - да
>Когда искусственный интеллект появится (скоро), он немедленно решит убить всех людей или на этой уйдет немножко времени? Даже немедленно в бытовом смысле означает немножко времени, строго говоря
>Когда искусственный интеллект появится (скоро) и решит убить всех людей, решит ли он также убить всех животных и рыбов? Только тех, кого нужно будет, для реализации его целей
Под БАЗУ нейрогенерации уже созданы номерные треды SD и WD+NAI. Меж тем, это всего несколько моделей, тогда как только на Фэйсе их более 112 тысяч. Этот тред для тех, кто копнул хоть немного глубже: необязательно до уровня обскурщины, выпиленной даже из даркнета, а просто за пределами того, что удостоилось своих тредов. ИТТ делимся находками и произведенными результатами.
>>1702948 Не поленился осмотреть, так как не касаюсь локалок даже палкой. Щито это за миллениал врайтинг? Я думал наши меньшие братья одной рукой выпиливают csam-фильтры, второй геном вирулентных патогенов подгружают. Даже тёлочка с watpada приколов увидит в своём dark romance похлеще
Есть ли нормальные workflow для работы sdxl при использовании Pony Diffusion V6 XL с лорами? Возможно я хуево искал, но постоянно попадаются простые ноды с максимум чекпоинтом где нет лор, или нода их не видит.
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №266 /llama/
Аноним10/09/26 Чтв 15:28:32№1701124Ответ
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!
Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.
Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.
Гигачат? Ммм… Вообще, кмк, можно потыкать мрадермарчера или анслота, у них нет, или может они сделают? Но в целом, можно рискнуть, да.
Есть официальный bf16, а значит можно просто тензор за тензором все пережать. Я даже хз, возможно это может любой сделать, по идее там всю модель в оперативу класть не надо.
Ну ща попробую выкачать, чего уж там.
876 гигабайт. Охуеть, конечно. Может Q8 взять лучше, лол?.. =D
Тред про AI-агентов - от вайб-кодинга до персональных ассистентов, которые сидят в твоих чатах, читают заметки и автономно ломают всё вокруг. Для кодеров, которые разучились писать руками, и для гуманитариев, чей диплом филолога наконец котируется в IT. Сеньор в 2026 - это тот, кто умеет внятно объяснить машине, чего он блять хочет.
С чего начать: • Хочешь кодить с AI эффективно: Cursor или Claude Code • Хочешь кодить в VS Code без привязки к конкретному провайдеру: Kilo Code, Cline или Roo Code + OpenRouter • Хочешь кодить с AI локально: DeepSeek Harness, OpenCode или Pi Coding Agent + из моделей аноны советуют Qwen3.8 27B, подробности в llama-треде • Хочешь персонального ассистента: OpenClaw + API корпов или локальная модель на твоей пеке
>>1703124 Ну так, что у консолетряса, что у Икеа-дауна, что у сантехника, на троих едва-едва трезначный асикью наберется. Челики выбрали ретардмаксинг, и счастливо живут. За них треды мод катит.
Привет всем, в Ии шарю очень мало пожалуйста подскажите приложения или сайты что угодно где можно общаться в Ии чате с персами 18+ желательно бесплатно)
>>1698441 (OP) кроме perchance ничего реально бесплатного нет, все хотят чтобы ты им платил за мисраль лол. на перчансе там скорее всего тоже мисраль а может даже и гемма аблитнутая, я особо не вникал, у меня и локально всё есть. хватит бомжевать, покупай видеокарту б.у. на 6-8 гб, добавляй рам до 24гб и будешь крутить у себя локально геммочку
МУЗЫКАЛЬНЫЙ №24 /music/
Аноним17/08/26 Пнд 12:18:32№1680116Ответ
1. Suno https://suno.com/ Вышла версия 5.5 (но для тех кто платит денюшку), качество моделей постепенно улучшается: звук, понимание концепций, набора различных жанров. Но в то же время все сильнее урезается для бесплатных юзеров: осталось только 5 бесплатных генераций в день на аккаунт, а также по заявлением некоторых анонов, модель для генерации на бесплатке (на момент создания треда использовалась 4.5) ухудшили. Спам аккаунтами пока что работает. Купить подписку из РФ: 1. https://payment.mts.ru/tools/suno-ai 2. https://plati.market/games/suno-ai/1701/
2. Tunee https://www.tunee.ai Хороший звук, более-менее понимание концептов, но тоже сильно урезан для бесплатных юзеров: режет концепты в промптах, плюс произвольно определяет "цену" за каждую генерация исходя из какой-то "сложности запроса". И получается, что если с бесплатки забацаешь промпт сложнее банальщины "Make cool rock about love for youtube" он может решить что у тебя нет кредитов для такого сложного запроса и пошлет нахуй. Способов оплаты из РФ неизвестно.
3. Sonauto https://sonauto.ai/ Как по мне, недооценённая вещь, особенно учитывая что недавно он обновился до 3.0, который очень даже разъебывает. Но он тут более ограничен тегам и понимает чисто какие-то жанровые теги, гибкости поменьше. Но зато пока что халявный и не ограничен кредитами, генерируй пока есть настроение.
MiniMax Music 3 https://github.com/minimax-ai/minimax-music3 [есть в шаблонах comfyui] Свежак. Качество генерации на уровне Suno 3+. Сильно заточена именно на песни, с инструменталом есть особенности - модель не следует прямому указанию по продолжительности, можно выставить ограничение(!) на максимальную продолжительность. LLM часть сама решает сколько будет идти трэк. Промт простыня на пару сотент токенов, рекомендуется использовать LLM асситента.
ACE-STEP 1.5XL: https://github.com/ace-step/ACE-Step-1.5 [есть в шаблонах comfyui]. Звук уже на уровне раннего Suno ~2.0-3.0, аноны делают на нем уже приемлемые результаты и постят в тред. Если есть хотя бы 12 GB VRAM и хочется генерировать без цензуры и подписок - можете юзать. Идеально подходит для отладки перед использованием на коммерческих генераторах. В XL версия DIT модель разжирела до 4b параметров и стала чутка вменяемее. Стоит учесть то чтобы добится вменяемого звучания одними тэгами отъебатся не получится, `caption` требует качественного промпта символов на 200. В ComfуuUI реализован только text2music функционал. Для полного функционала надо накатывать полноценный бэкеннд из репозитория. Есть несколько кривеньких вариаций локальных студий как в коммерческих моделях - https://github.com/ace-step/awesome-ace-step#uis-and-studios VST плагины итд.
HeartMuLa https://github.com/HeartMuLa/heartlib Результат примерно на уровне ACE-STEP1.5 (не XL). Статус проекта непонятен, пока ебут вола. Из плюсов - меньше песочит на верхних частотах. Есть встроенный STUDIO UI.
YuE https://github.com/multimodal-art-projection/YuE Первая локалка на которой можно было хоть что то сделать. Жрёт VRAM как не в себя, работает медленно, звук как совсем ранее suno. Ссылка оставлена чтобы любопытствовать насчёт новых версий.
StableAudio https://github.com/Stability-AI/stable-audio-3 [есть в шаблонах comfyui+] Делает звук. Подходит для создания сэмплов FX, ad-libs итд. Абсолютно не может в членораздельную речь. Может сделать что то похожее на музыку. v3 наглухо зацензурена, стоны и вопли можно делать на v1.
МЁРТВЫЕ КОММЕРЧЕСКИЕ ГЕНЕРАТОРЫ
1. Udio (udio.com) - куплен Warner Bros, но затем сами Warner Bros сдали назад и откатили сделку. Но уже успели испортить, больше нельзя скачивать треки, их только доставать из буфера в 160 кбит/с. Плюс непонятно как работающая цензура, которая не дает генерировать треки с определенными тегами. Плюс уже год ебут один и тот же 1.5 allegro. 2. Riffusion, Producer.ai (producer.ai) - куплен гуглом, удалены все старые относительно норм модели, вместо этого запихали безальтернативную каловую модель, которая и промпты сложнее самых нормисных в духе "make cool rock about love" не понимает, и вокал смазывает в какую-то кашу. При этом еще и максимально дегенеративная цензура, которая режет чуть ли не любые попытки сделать просто что-то не попсовое и не "музыку для ютуб".
ПРОЧИЕ ПОЛЕЗНЫЕ УТИЛИТЫ
1. https://www.bandlab.com/mastering Быстрый мастеринг в две кнопки, если хочешь чтобы звучало более слушабельно, но не имеешь навыков в DAW или аудиоредакторах (или лень). 2. https://morpher.ru/accentizer/ Если генерируешь музыку с лириками на русском, то очень часто случается, что твой генератор путает ударения в словах. Прежде чем пихать свою графоманию в генератор, проставь ударения в сервисе по ссылке. И уже из этого сервиса копируй текст в генератор. По крайней мере в Suno это помогает.
AR — получает стиль + lyrics и генерирует последовательность semantic codec tokens (25 токенов/сек).
NAR — берет эти токены и превращает их в аудио через flow matching.
При LoRA тренируются обе: AR учится предсказывать следующий токен на всей песне. NAR учится восстанавливать аудио по случайному участку.
---
Самая главная проблема — AR очень быстро переучивается на маленьком датасете.
Если песен мало, AR может просто запомнить точную последовательность токенов каждой песни вместо того, чтобы выучить стиль.
Поэтому AR loss может выглядеть примерно так:
5 → 3 → 1 → 0
за несколько сотен шагов.
Это НЕ хорошо. Это признак меморизации.
Нужен большой и разнообразный датасет, чтобы AR учил именно закономерности стиля, а не конкретные песни.
---
Что за что отвечает:
AR — в основном lyrics following.
NAR — в основном стиль и звучание.
Поэтому если AR слишком быстро обучается, можно:
увеличить ar_kl_weight уменьшить ar_lr_multiplier * использовать меньший rank LoRA для AR
ar_kl_weight удерживает AR ближе к базовой модели и мешает ему полностью запоминать тренировочные песни.
Caption dropout использовать не рекомендуется — пустой prompt ухудшает следование lyrics.
---
Официального audio → token энкодера YuE2 пока нет.
Для обучения используется сторонний токенизатор на базе MERT-v2-FullSong.
Он переводит реальное аудио в codec tokens, которые понимает YuE2.
Из-за этого токены являются приближением к оригинальным токенам модели. Поэтому даже если AR идеально воспроизвел последовательность, результат не будет бит-в-бит совпадать с исходной песней.
Но совпадение очень близкое.
---
ABC generation:
YuE2 может сначала сделать музыкальную "схему" песни в ABC notation:
структура + аккорды + вокальная мелодия + инструментальная мелодия
А потом уже генерировать codec tokens с учетом этой схемы.
Есть три режима:
cot: full — схема + аккорды
cot: melody — схема + только мелодия
cot: off — без ABC, сразу генерация codec tokens.
---
При обучении каждая песня сначала проходит через SheetSage2, который создает ABC sheet.
AR обучается двум последовательностям:
lyrics → ABC sheet
ABC sheet → codec tokens
Параметр abc_dropout определяет, как часто ABC вообще убирается из training prompt.
0 — только ABC mode.
1 — только off mode.
0.5 — половина с ABC, половина без него.
По умолчанию 0.5, чтобы одна LoRA работала в обоих режимах.
---
Cache Latents to Disk должен быть включен.
При создании кэша заранее вычисляются:
SheetSage2 MERT tokenizer VAE codec tokens
Без кэша все это будет пересчитываться на каждом training step, что будет очень медленно.
Если поменял cot, нужно удалить папку _latent_cache, чтобы ABC sheets пересоздались.
У аудио нет resolution, поэтому лучше использовать один resolution bucket на весь датасет. Иначе песни будут дублироваться в разных bucket'ах.
---
Формат prompt простой:
style line
[Lyrics]
[Verse 1] текст...
[Chorus] текст...
[Verse 2] текст...
Для автоматического создания таких caption'ов есть специальный YuE2 preset в Qwen3-Omni captioner.
Но от себя скажу что с аудио тренингом есть небольшой нюанс известный, аудио это фазово-амплитудное "пространство" и к нему чистые MSE/L1 и тд в качестве лоссов не оч подходят по идее (но не значит что на мсе не будет обучаться, просто не так эффективно как с фурье). Для аудио у нас есть фракшенал фурье трансформ https://github.com/tunakasif/torch-frft/ (для примера в тулкит устанавливается в ембедед питон через python -m pip install torch-frft с экзешником питона) на основе которого собирается лосс для dim=-1 (одноразмерный тензор для аудио). Фрфт в принципе универсальный, может и с картинками работать и для аудио и для рентгенов всяких, я картинки вот треню обычно. Но эт на будущее просто чтобы знать, дефолтные настройки с MSE в тулките тоже подойдут для обучения, потом если захочешь фрфт вхуячивается в три шага буквально. Ток имей в виду что если возводить фрфт в квадрат (MSE), то он вырождается и теряет фазу, поэтому только L1 или подобные нужно юзать, короче я как погоняю базовый тренинг лор то напердолю фрфт нормально в тулкит и его тоже погоняю и мб выложу готовый патч. Ну или сам код юзни с пикрелов, ток нейронке скажи, чтоб переделала под 1D аудио. Файлы соответственно - toolkit/util/losses.py toolkit/config_modules.py extensions_built_in/sd_trainer/SDTrainer.py (в начале добавить импорт from toolkit.util.losses import wavelet_loss, stepped_loss, frft_loss )
/g/ или /b/ — решайте сами. Короче, решил я потроллить Алису от Яндекса. Сказал ей, что:
· Выкинул батарею из Honor 7A Pro. · Впаял толстые медные шины и подключил блок питания на 1 кВт (Mean Well RSP-1000-5, если быть точным). · Разогнал Snapdragon 430 до 2.8 ГГц через кастомное ядро. · Охлаждаю систему жидким азотом и сверхпроводящим проводом из ниобий-титана (она даже это прожевала!). · Залил плату трансформаторным маслом для изоляции. · Подключил монитор с частотой 1000 Гц с АлиЭкспресса (заказал у продавца с 99% рейтингом, всё серьёзно).
И ОНА ПОВЕРИЛА!
Алиса начала выдавать:
· Расчёты по току 200 Ампер. · Объяснять, почему первый сгорит PMIC (контроллер питания). · Советовать снизить ток до 150 А и проверить тепловизором «локальные горячие точки в месте контакта сверхпроводника с платой». · Говорить про «паразитные индуктивности» и «помехи в цепи питания».
Я уже думал, она сломается, но нет — она держалась до конца, дала советы по отладке и спросила, буду ли я писать отчёт. 😂
Вопрос к сообществу: я заставил нейросеть обсуждать криогенный разгон телефона. Это победа или меня пора отправлять в Кащенко?
П.С. Алиса теперь думает, что я — безумный инженер, который гоняет Genshin на телефоне от сварочного аппарата. Что делать дальше? Сказать ей, что я собрал телефон из картошки и хочу запустить Windows 11 ARM?
П.П.С. Оцените мой троллинг от 1 до 10. Жду годных советов для второго сезона! Я психопат или школьник на каникулах?
>>1687505 (OP) Ты - школьник на каникулах. Алиса отстаёт по развитию даже от Gigachat (большой модели, не lite на 10B) и галюцинирует всякую дичь время от времени. Использовать её кроме как переводчика с русского на ангийский и обратно на стероидах смысла мало. Написал бы ты этот бред современной нормальной нейронке, пускай даже средней по размерам, она бы сказала, что ты брешишь или наоборот, стала бы подыгрывать типа "какие ещё безумные проекты есть у вас в планах?".
Как заработать на нейродебилках?
Аноним26/08/26 Срд 15:20:08№1687802Ответ
Сап анонии, вот научился я дегенерировать картиночки, даже более менее сносно и по реквестам. А как заработать на этом можно? Реально ли продавать джонам киллотонны нейрослопа с фурями в подгузниках хотя бы по баксу за картинку? Есть те кто патреон ведут и деньги с этого лутают? Хотя бы символическую сумму.
>>1697133 (OP) напиши ням ням пукизям пятнадцать раз, затем три оборота против часовой стрелки перед экраном и вскидиваешь руки вверх. и после этого ты станешь ебанный блядь техножрецом и тебе откроются тайны кожанным мешкам неведомые, а теперь иди нахуй отсюда
>>1697133 (OP) Напиши, что ты на половину еврей, на половину афроамериканец и гей (лгбт признано экстремизмом, добавлю, мало ли). И что тебя все чморят за твоё происхождение и ориентацию. Я не стебусь, это реально работает.