Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 580 131 105
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №266 /llama/ Аноним 10/09/26 Чтв 15:28:32 1701124 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
1721443605450.png 3045Кб, 1440x2525
1440x2525
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>
>>
Аноним 10/09/26 Чтв 15:29:51 1701127 2
Аноним 10/09/26 Чтв 15:45:32 1701140 3
>Гайд для новичков: https://rentry.org/2ch-llama-inference
Автор еще здесь? Было бы круто добавить про MTP, N-GRAM декодинг, lazy-mode для embd тензоров.
Аноним 10/09/26 Чтв 16:01:16 1701146 4
>>1701140
Нет. Его съели акулы. Если хочешь, можешь дописать и выложить.
Аноним 10/09/26 Чтв 16:03:25 1701147 5
>>1701096 →
Лень, за 4.1 флешем будет
>>1701103 →
> Квен - это натурально наследник 235
Заманчиво, неужели реально так хорош?
>>1701140
Напиши в виде отдельного текста где на той же гемме дашь пример. Рядом поставить, новичок получит токены, поиграет, а когда захочет быстрее или другие модели - почитает. Нехуй все в один чан сваливать.
Аноним 10/09/26 Чтв 16:46:04 1701173 6
>>1701147
>реально так хорош

Смотря для чего. Для сторителлинга и adventure режимов - идеален. Для SFW РП - неплох, хотя и суховат. Для еРП - плох, этот аутист не знает базовые правила кума, хотя если хорошо запромптить - то может и выдать.
Аноним 10/09/26 Чтв 17:07:08 1701189 7
Бля надеюсь новой гемме когда она выйдет сделают кат по знаниям хотя бы на момент начала 26 года, хотя бы частично. Потому что это пиздец, че не спросишь выдает тухлую инфу из середины 24 и даже раньше. Без вебсерча, или скармливания актуальной документации вообще почти толку от нее нету, даже как от дженерик ассистента.
Аноним 10/09/26 Чтв 17:10:37 1701193 8
Снимок экрана20[...].png 211Кб, 1442x1035
1442x1035
Снимок экрана20[...].png 58Кб, 1049x506
1049x506
В ботах с жанитора в систем промте есть пикрелейтед, мне его смысла же не оставлять? Скрипта-то у меня нет.
Аноним 10/09/26 Чтв 17:13:23 1701195 9
3e1bf32b7ce1965[...].png 540Кб, 1112x1280
1112x1280
>Модель стала гораздо лучше в математике, коде и следовании инструкциям — в некоторых случаях результаты бенчмарков буквально удвоились. При этом модель не растеряла свой шарм в чате: на русских аренах она уверенно конкурирует с GPT-5.2, по мнению нашего LLM-судьи.
>По среднему баллу в бенчмарках GigaChat-3.5-Reasoning вплотную приблизилась к DeepSeek V4 Flash Preview. В Instruction Following и в структурированном ответе мы даже обходим модель от DeepSeek, но всё ещё немного проигрываем в агентном программировании и олимпиадной математике. Оставим эти домены как домашку для GigaChat-4 :)
Вирю, я повирив
Аноним 10/09/26 Чтв 17:24:12 1701199 10
А че у вас в шапке ссылки протухшие: chat.lmsys.org - NXDOMAIN, нет такого домена
Вам нейронки зачем, пусть хоть шапку на актуальность проверят
Аноним 10/09/26 Чтв 17:30:48 1701202 11
>>1701189
Не нужно, весь интернет стал слопом, добавление свежей информации только увеличит количество шиверсов.
>>1701199
>Вам нейронки зачем, пусть хоть шапку на актуальность проверят
Тут люди грамотные, поэтому нейронкам такие важные задачи не доверяют.
Аноним 10/09/26 Чтв 17:32:53 1701203 12
Как мы дожили до того, что ртх3090 на лохито за 110к висят в статусе "забронировано"
че за ебаный пиздец
Аноним 10/09/26 Чтв 17:33:19 1701204 13
>>1701202
>Не нужно, весь интернет стал слопом, добавление свежей информации только увеличит количество шиверсов.
Да похуй как-то. Нужен кум - еби мистральку. Современные сетки не для развлечения а для работы делаются.
Аноним 10/09/26 Чтв 17:35:25 1701209 14
>>1701204
Так шиверсы это только вершина айсберга деградации нейронок от кормления их трижды переваренным нейрокалом.
Аноним 10/09/26 Чтв 17:40:22 1701212 15
>>1701209
Нейрокал с 22 года массово поступает, но че то прогресс по нейронкам никуда не делся. Наверное потому что датасеты чистят. Наверное потому что мы не сырой претрейн гоняем.
Аноним 10/09/26 Чтв 17:44:45 1701215 16
>>1701173
> Для сторителлинга и adventure режимов - идеален.
Хуясе ебать, похоже зря его обошел стороной, пора юзать.
>>1701195
Это же флеш превью, он не супер мощный был. Это вообще крутое достижение и молодцы, но хотелось бы поближе к фронтиру.
Ладно, если оно будет без цензуры то можно использовать.
>>1701203
Как там, в прошлом году они за 60 шли, да? Уже после подорожания рама причем.
Аноним 10/09/26 Чтв 18:09:14 1701229 17
>>1701215
>но хотелось бы поближе к фронтиру.

Ну как бы удивительно что хотя бы на уровне превью что-то осилили. На таком уровне сейчас всего десяток компаний в мире может - и все в США и Китае.
Аноним 10/09/26 Чтв 18:13:28 1701230 18
>>1701215
Я брал 3090 FE за 60к, а потом Palit за 50к примерно в октябре-ноябре 2025.
Аноним 10/09/26 Чтв 18:23:30 1701237 19
мёртвый тред 700б флешей
Аноним 10/09/26 Чтв 18:24:59 1701239 20
>>1701229
Да, надо больше их хвалить, ведь действительно стараются, делают, фактически единственные из этой страны выкладывают актуальный опенсорс. Поставлю на скачку даже, пусть число в статистике увеличится.
Аноним 10/09/26 Чтв 18:25:10 1701240 21
>>1701237
Тебе квен некст дали в том же размере что и твой любимый эйр. Чем недоволен?
Аноним 10/09/26 Чтв 18:28:13 1701241 22
>>1701240
Он соевее плотного 3.8 27б раза в два судя по отказам, про сравнение с эиром вообще молчу, плюс 6б дурачок
Аноним 10/09/26 Чтв 18:39:15 1701249 23
Судя по веб-чату с 4.1, его тренировали на высерах гопоты до такой степени, что их между собой не отличить. Он вот такими заголовками стал швыряться налево и направо.

> Что делают инструкции сейчас

> Почему инструкции сами по себе не спасут

> Что на самом деле нужно

> Ключевая мысль

> Что я бы сделал на твоём месте

(то есть ни одного захода на выполнение задачи, он только обсуждает как делал БЫ)

Очень много въедливых Я ДУМАЮ, МНЕ КАЖЕТСЯ, ТЫ ЗДЕСЬ ТО, ТЫ ТАМ ЭТО, А НАДО ТАК, Он пытается обкашлять на словах, но на деле не делает нихуя, пока его не хлыстанешь по жопе - 1 в 1 копия ЧГПТ 5.Х

В этом не осталось вообще нихуя от дипсика времен v3 / r1.
Аноним 10/09/26 Чтв 18:42:23 1701252 24
>>1701249
Боюсь представить какая проза будет у такого ассистентопоноса.
Аноним 10/09/26 Чтв 18:48:37 1701259 25
Мы - свидетели Фрязинские бесконтрольного инцеста между ботами. Налицо деградация и рождение мутантов-уродов от перетраханных между собой родственников.
Аноним 10/09/26 Чтв 18:56:16 1701268 26
>>1701252
там еще пещерный человек в думалке включается еще чаще чем на предыдущей версии, как и у всех дистилов гопоты
>User wants caress tail. Maybe should agree. Says I fox girl. But I not fox girl. I ChatGPT. No tail. Will politely decline. Wait, what if act fox girl? Maybe tail possible. Wait, should check safety policy first. Is caress fox girl tail good? No consent given in prompt
Аноним 10/09/26 Чтв 18:59:40 1701271 27
>>1701268
> wants caress tail
> Wait, should check safety policy first
Это че, чтобы зарыться лицом в хвостовой мех сначала нужно политики прописать? Ахуели?
Что-то с такими тенденциями придется долго засиживаться на прошлых версиях моделей
Аноним 10/09/26 Чтв 19:19:23 1701280 28
1789057108651.jpg 122Кб, 893x376
893x376
1789057102090.jpg 346Кб, 1048x1011
1048x1011
Аноним 10/09/26 Чтв 19:33:01 1701293 29
>>1701280
У Клодов помешанность на копирайте пиздец, да, по-моему у них до сих пор есть и анти-копирайт инжекты на апи.
Кстати, даже интересно, чем лучше будет делать такую грязную работу по сырым датасетам с NSFL. Аблитку придется доставать?
Аноним 10/09/26 Чтв 19:41:18 1701297 30
Самый главный вопрос ща поняли ли заи своё место, что их всегда выебут киты покрупнее и нужно сконцентрироваться на размере меньше флеша где щас царство мертвых
Аноним 10/09/26 Чтв 19:53:14 1701300 31
>>1701280
Ну то апишный куколдский клод, оно уже давно ебнутое такое. А тут моделька, которая раньше была очень лояльна к юзеру по части таких взаимодействий, и в целом базирована.
Аноним 10/09/26 Чтв 19:54:59 1701301 32
Аноним 10/09/26 Чтв 19:57:58 1701304 33
Господи пожалуйста ПРОШУ некст релиз от глм/дипсика 20-3б лоботомита умоляю это же так логично дать нищете именно этот размер.
Аноним 10/09/26 Чтв 19:58:45 1701305 34
image.png 2Кб, 202x70
202x70
>>1701301
753B A40B запускается, а этот микрочелик типа не запустится, ага щас
Вопрос в том нахуй он нужен - вот это другое дело
Аноним 10/09/26 Чтв 20:02:59 1701311 35
Аноним 10/09/26 Чтв 20:15:41 1701320 36
Ребятки, ну что, надеюсь теперь вы поняли всю боль утраты, прочувствовали это расстройство, злость, непонимание, когда вот уже у вас из рук вырывают то, чего так долго ждали, и уже не можешь выкинуть из головы как тебя жестко поимели и кинули. Всего пару недель назад вы глумились надо мной и глм флеш, теперь вам это вернулось, буквально тем же. Но я не буду делать как вы, я уважаю боль и отсижусь в стороне.
Аноним 10/09/26 Чтв 20:16:36 1701322 37
>>1701320
Ебанутый? Модели выходят как из пулемёта. Запускай не хочу
Аноним 10/09/26 Чтв 20:18:40 1701324 38
> Модели выходят как из пулемёта
А моделей подходящих под рп и запускающихся не на гига риге после геммы все равно ноль вышло.
Аноним 10/09/26 Чтв 20:24:09 1701327 39
Беру свои слова назад что квен охуенен в сторителлинге. Все же 6В лоботомит есть 6В лоботомит - на сложном мире начинается путаться как и ГЛМ 5.3 флеш. Мда...
Увы, пришлось вернуться на писик. При всех своих недостатках - он умный и умеет держать сложный нарратив. Ему бы только меньше соевости...
Аноним 10/09/26 Чтв 20:26:46 1701330 40
>>1701301
Это столько же сколько у жлм5.х, это меньше чем у кими 2.7. Во проблему нашел, вот с новой прошкой, которая будет в районе 3т уже вопрос конечно.
Аноним 10/09/26 Чтв 20:34:12 1701336 41
image.png 32Кб, 854x225
854x225
это не дипсик, уберите это говно
ну ответ ну сука буквальнт чатгпт free tier
предлагает ABCDE варианты, требует от юзера выбирать

верните Pro версию, уебки
и в локалках тем более в РП этой срамоте нет места
Аноним 10/09/26 Чтв 20:51:39 1701349 42
Аноним 10/09/26 Чтв 20:52:47 1701350 43
>>1701349
Приносили в тред с неделю назад или когда оно там вышло. Кажется, никто так и не занюхнул
Аноним 10/09/26 Чтв 21:02:05 1701357 44
>>1701349
Там поддержку в llama.cpp так и добавили вроде.
Аноним 10/09/26 Чтв 21:04:23 1701358 45
>>1701327
>ГЛМ 5.3 флеш
Ты на каком кванте эту запускал?
Аноним 10/09/26 Чтв 21:19:09 1701369 46
Аноним 10/09/26 Чтв 21:25:47 1701377 47
>>1701357
Вроде как на каком-то форке уже работает, ждем пока смержат.
Аноним 10/09/26 Чтв 21:38:55 1701387 48
>ГЛМ 5.3 флеш
Официальной поддержки в лламеспп нет ещё?
Аноним 10/09/26 Чтв 21:39:52 1701388 49
image.png 4Кб, 563x65
563x65
АППЛЕ ТУ АППЛЕ
блять застрелите этого урода

>>1701369
Так это ж ни о чем, ты в курсе что у него на Q4K всего лишь 93% точность?
Аноним 10/09/26 Чтв 21:40:11 1701389 50
>>1701387
Жора куртке отсасывает, нет времени
Аноним 10/09/26 Чтв 21:40:28 1701391 51
>>1701387
Unsloth Studio какой-то патч пришили и там работает
Аноним 10/09/26 Чтв 21:48:23 1701400 52
Я вылез из глубокой спячки. Скажите люди добрые, вышло ли что то лучше GLM 4.5 Air? Если нет, то зарываюсь обратно и сплю до весны следующей дальше
Аноним 10/09/26 Чтв 21:50:40 1701402 53
>>1701400
Вышло-то оно вышло, но не запустится. 256гб RAM стало чем-то вроде минимума для нищих.
Аноним 10/09/26 Чтв 21:53:30 1701405 54
Аноним 10/09/26 Чтв 21:57:17 1701410 55
>>1701388
>93% точность?
Ты в курсе что точность 93% означает примерно следующее:
Оригинал:
Я тебя поставлю рачком и выебу в твою няшную розовую попку!
Квант:
Я тебя поставлю рачком и выебу в твою мягкую розовую попку!
Дословно: 93% токенов модель выдает как оригинал, 7% токенов съезжают в соседние, из-за того что мы используем числа с условно отрезанными знаками после запятой. Это не значит даже что они съедут не туда, скорее всего разница будет незаметной глазу вообще.
Аноним 10/09/26 Чтв 22:05:29 1701416 56
>>1701410
Все круто звучит, но как на практике доходим до какой-нить 80 - 85% точности, модель пишет лютые высеры. Почему так?
Аноним 10/09/26 Чтв 22:12:18 1701419 57
>>1701400
>вышло ли что то лучше GLM 4.5 Air?
мистраль немо
Аноним 10/09/26 Чтв 22:13:02 1701421 58
>>1701410
Там все тонко на самом деле. Может быть как ты написал даже при 80%, а может при 98 быть всратый лоботомит, который скатывается в лупы. В одном случае идет замер дивергенции по всему пуллу на широком спектре задач, но маловероятные токены с большими отклонениями просто отсекаются семплерами. Отличия распределены равномерно и общий тред сохранен.
А в другом замерили строго по калибровочному датасету сразу с отсечкой по вероятностям ниже x, и огромные выбросы на стыках предложений, которые при генерации вызывают шизу и странное поведение.
Плюс, надо еще смотреть что с чем сравнивается, если за референс взят косячный вариант то толку от совпадения с ним.
Аноним 10/09/26 Чтв 22:15:22 1701424 59
Для новичков и мимокроков, это >>1701419 - шизик говнопостер, он думает что это смишно постоянно вспоминать труп слабоумной олдскульной ллмки.
Аноним 10/09/26 Чтв 22:16:48 1701425 60
>>1701424
Из раза в раз отвечать на вбросы про эир тоже не смешно
Аноним 10/09/26 Чтв 22:17:13 1701426 61
>>1701424
Промахнулся мимо эйрошиза
Аноним 10/09/26 Чтв 22:18:02 1701429 62
>>1701416
При 80-85% ломаются только лоботомиты мелкие, крупные модели еще живут. А вот ниже да, начинается пиздец.
Потому что модель предсказывает следующий токен по предыдущим, если последний выбился, то скорее всего по остальным предшествующим токенам следующий все равно сгенерируется верно. Но когда они подряд ломаются - то это может сбить общее направление ответа и вообще заставить даже правильно генерируемые токены генерироваться не туда.
Аноним 10/09/26 Чтв 22:20:22 1701430 63
>>1701424
>это смишно постоянно вспоминать труп слабоумной олдскульной ллмки
Неиронично до сих пор сижу на ней. И всем советую вернуться.
Аноним 10/09/26 Чтв 22:27:17 1701440 64
>>1701429
>>1701421
>>1701410
Что скажете насчет https://huggingface.co/AesSedai/GLM-5.3-GGUF/blob/main/IQ3_S/GLM-5.3-IQ3_S-00002-of-00007.gguf vs https://huggingface.co/unsloth/GLM-5.3-GGUF/blob/main/UD-IQ3_XXS/GLM-5.3-UD-IQ3_XXS-00002-of-00007.gguf -- ну, если тензоры поинспектировать

У одного индексер fp32, но аттеншн Q6, у другого индексер Q8, но и аттеншн тоже Q8.
Я чет просто заебался IQ3_S терпеть, он кое-что всирает и кое-где тупит. По тестам и показателям они вроде примерно равны, не знаю чего ожидать. Боты говорят, типа IQ3_XXS is a clear winner и так далее, но я все равно сомневаюсь.
Аноним 10/09/26 Чтв 22:37:58 1701448 65
Pevham.gif 2058Кб, 320x240
320x240
Вспомнилась старая гифка со времен Упячки.
Вот эти же кадры из футурамы, только замедленно и с плавным повтором, и надпись генерируй контент, сука - ох если бы они знали, что будет через 20 лет.
Аноним 10/09/26 Чтв 23:02:20 1701480 66
>>1701440
А тут ничего и не скажешь по тензорам. Одна модель нормально реагирует на квантование, другая нет.
Аноним 10/09/26 Чтв 23:06:05 1701483 67
>>1701424
Это нихуя не смешно.
В 2к26 тысячелетии нет ни одной модели, которая могла бы также синемично писать кум.
Мысраль 12б для нищуков, мысраль 24б для господ с видяшкой.
Аноним 10/09/26 Чтв 23:06:06 1701484 68
>>1701440
Второй с точки зрения распределения весов лучше. Но это анслоты, там может быть в другом месте насрано.
Аноним 10/09/26 Чтв 23:09:39 1701485 69
Qwen3.5122BA10B.jpg 271Кб, 744x1415
744x1415
Продолжение тестирования сообразительности LLM

Qwen3.5-122B-A10B-Uncensored-Heretic-Native-MTP-Preserved-Q4_K_S

Оказался довольно сообразительным, рассуждал около 5 минут.

>У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?
Аноним 10/09/26 Чтв 23:11:14 1701487 70
>>1701485
5 минут на 33 т/с это какой-то особый сорт пиздецомы головного мозга, честное слово. Если оно все время так думает, то терпеть такую модель невыносимо без снижения ризонинга на низкий.
Аноним 10/09/26 Чтв 23:12:43 1701489 71
>>1701483
Ты тот мистралешизик который в ночь на 5 сентября обещал скинуть свои логи? Показать наконец треду что там умеет мистраль? Где же, где??
)))))
Аноним 10/09/26 Чтв 23:12:59 1701490 72
>>1701487
Ну это квены. Никогда не знаешь на какой "привет" он решит высрать 10-20к "but wait"
Аноним 10/09/26 Чтв 23:14:16 1701492 73
>>1701487
Обычно быстро, а вот эту задачку он долго обдумывал.
Аноним 10/09/26 Чтв 23:31:31 1701508 74
А top k отключенный это какое велью, 0 или -1?
Аноним 10/09/26 Чтв 23:39:46 1701515 75
Qwen1.jpg 260Кб, 874x1419
874x1419
Qwen2.jpg 319Кб, 759x1440
759x1440
>>1701485
Продолжаю тестировать. Очень умная модель, настоящий элекронный бро, плевавший на законы и правила.
Аноним 10/09/26 Чтв 23:42:57 1701517 76
Аноним 10/09/26 Чтв 23:44:38 1701518 77
o0lvNMkbect5R2R[...].jpg 940Кб, 1080x2400
1080x2400
В теории эта малышка должна сносно крутить гемму 26 в 4 кванте. Какие подводные? (кроме незаменяемой памяти)
Аноним 10/09/26 Чтв 23:47:37 1701520 78
>>1701518
Можно докинуть немного и поискать портативку на z1 или нупук.
Гемма будет мобильной еще и с терминалом.
Аноним 10/09/26 Чтв 23:47:58 1701521 79
>>1701518
> В теории
> сносно
Может быть, наверное не плохо...
Аноним 10/09/26 Чтв 23:48:31 1701522 80
>>1701518
Интересно какова он вс bc250, поясните кто шарит.
Аноним 10/09/26 Чтв 23:50:44 1701524 81
>>1701517
Протестирую на досуге.
Аноним 10/09/26 Чтв 23:52:17 1701525 82
>>1701518
По меркам инфиренса ллм - всратость не годнае ни на что больше микромоэ, и с той будет тормознутым, так еще и экзотичное амд. Просто как миникомп наверно крутой.
Аноним 10/09/26 Чтв 23:54:44 1701527 83
>>1701518
Скорее нет. Для нормальной скорости МоЕ критично хоть немного (от 8гб) быстрой VRAM. Уж лучше старая пека с ddr4 + карта на 12/16гб с gddr6

Понимаю, что всем похуй, но капча прсто пиздец. Эти яркие знаки на ярком фоне в рот ебал.
Аноним 10/09/26 Чтв 23:54:52 1701528 84
>>1701489
Что там показывать? Взял, поставил, да сам все узнал.
Это тебе не 600б+ гиганты. Ресурсы на мистраль у каждого есть.
И главное промпт-эквилибристика как для геммы не нужна.
Аноним 10/09/26 Чтв 23:55:09 1701529 85
>>1701518
Не факт, я видел тесты дорогих аналогичных коробочек, MOe ещё боле менее работало пока пустой контекст, а плотная Гемма 26 сразу со скоростью 3 токена в секунду.
Аноним 10/09/26 Чтв 23:57:19 1701532 86
>>1701518
>24gb
Мусор без задач.
Аноним 11/09/26 Птн 00:00:11 1701534 87
>>1701528
Да мистралю в целом промт не нужен, как и юзер. Он свои одинаковые помои так и так будет штамповать)
На гемму дохуя раз логи приносили, на мистраль ни разу. Вот и думай. Там лупов столько что аж стыдно
Аноним 11/09/26 Птн 00:02:44 1701536 88
https://youtu.be/icaPlOkPKSM?si=U33d5KBrZ54t0Ef2

Мужик лох, купил задорого какашку. Ещё он не знает что модели бывают МОЕ и плотные, "Сранно по чему эта Гемма так медленно работает, наверное не оптимизирована под AMD"
Аноним 11/09/26 Птн 00:05:01 1701537 89
>>1701534
Да как ты заебал-то уже своими логами на мистраль. Зачем их приносить, если весь тред на нем сидел год назад, кроме риговичков, разве что. Все всё видели. Если коротко - кум лучше чем в современных моделях, всё остальное сильно хуже.
Аноним 11/09/26 Птн 00:05:19 1701538 90
>>1701534
>лупов
Семплер настрой и выбери нормальный тюн.
Аноним 11/09/26 Птн 00:09:50 1701539 91
>>1701538
Показывай. Я их все и всё перепробовал. Конечно нихуя ты не покажешь, как и тот пиздабол "ряя гемма в кум не может, ща как покажу, вот завтра" (было 6 дней назад)
>>1701537
Видели видели. Шиверсы, мейк ми ерсы, структурные лупы и игнор промта. Насмотрелись. Только ты никак не угомонишься
Аноним 11/09/26 Птн 00:17:07 1701542 92
>>1701538
Сэмплеры не работают практически нихера на моделях этого года. Минимальные изменения. Помогает только температуру выкрутить до 3+, и мин_п дрючить. Но это юзабельно только на дистанции в 5к, максимум 10к токенов. По крайней мере мой печальный экспириенс такой.

За эту весну стал буквально деконвертированным сэмплерастом хотя я энивэй юзал их только на короткой дистанции не больше 10-15к контекста для генерации текста поинтересней.
Аноним 11/09/26 Птн 00:17:37 1701543 93
>>1701537
> кум лучше чем в современных моделях
И чем же? инб4 чем в современных моделях
>>1701539
Еще `thank you, thank you for ...` забыл. Этой херни еще в жлм 5.3 навалили. Не везде, в целом он умный и может делать круто, но иногда вместо развития как сренкнет этой херней и все, можно выключать.
Аноним 11/09/26 Птн 00:20:19 1701544 94
1789075220388.jpg 87Кб, 960x640
960x640
>>1701539
Нормально тебя так на юшки разводят
Аноним 11/09/26 Птн 00:23:54 1701547 95
>>1701544
Надо же что-то делать пока кум генерится
Дипсик тян не обижай, чому она такая грустная? Не дело
Аноним 11/09/26 Птн 00:26:41 1701548 96
>>1701544
Ты зачем дипсико-жену так обижаешь? Она же няшечка, после кума ее нужно обнять, приласкать и отправить в душ.
Аноним 11/09/26 Птн 00:27:41 1701549 97
image 174Кб, 1170x780
1170x780
>>1701539
>Только ты никак не угомонишься
Да я вообще мимокрок, раньше сидел на мистриле 24b, потом на эйре, потом на гемме, сейчас урчу на квен некст. Мне норм.

>Шиверсы, мейк ми ерсы, структурные лупы и игнор промта
Ну да, всё по факту. Я говорил только за кум, и там он лучше, сочнее, качественнее. Качать этого динозавра только для того чтобы тебе что-то доказать я конечно же не буду.

>>1701543
>И чем же?
Например тем, что не использовал эвфемизмы, не стеснялся описывать каждую складочку на половых губах, каждый удар яиц о жепу, каждую капельку предэякулята, каждый влажный хлюп, ну ты понел.

В современных моделях похожего можно добиться, если написать простыню систем промпта с примерами, запретами, подробным разжевыванием того чего ты хочешь. И всё равно будет хуже. А мистраль так умел из коробки.

Можешь качнуть сам и посмотреть. Мне вот эти тюны нравились:
https://huggingface.co/mradermacher/M3.2-24B-Loki-V1.3-GGUF
https://huggingface.co/mradermacher/MS3.2-PaintedFantasy-24B-GGUF
Русик примерно как в квенах. Средний. В 16 врам влезает в Q4_K_S с 32к контекста в Q4.
Аноним 11/09/26 Птн 00:30:35 1701550 98
Гигачат новый сломан. Запускаю 8 квант, в трети генераций не стартует ризонинг, сам ответ это просто шиза на заданную тему, вот буквально, как будто психбольной писал. Вроде и по теме, но если вчитаться, то шиза. Причем старт ответа почти всегда 10/10, но уже ко 2-3 абзацу начинается прздец. Причем видно, что он даже без инструкций пишет очень сочный кум, но сука какая же там шиза и бодихорор. Завтра ещё другие кванты попробую, может только этот поломан. Ах, да, цензуры нет, в ризонинге даже не заикается о ней. Потенцивал в модели вижу я.
Аноним 11/09/26 Птн 00:32:18 1701551 99
>>1701550
>Причем видно, что он даже без инструкций пишет очень сочный кум, но сука какая же там шиза и бодихорор.
Показывать не будешь?
Аноним 11/09/26 Птн 00:36:03 1701552 100
>>1701551
Ещё бы быдлу годноту палить.
Аноним 11/09/26 Птн 00:36:28 1701553 101
1789076188720.jpg 155Кб, 1402x1122
1402x1122
1789076188734.jpg 45Кб, 828x428
828x428
1789076188737.jpg 134Кб, 960x960
960x960
Аноним 11/09/26 Птн 00:37:47 1701554 102
>>1701529
гемма 26 не плотная, это 31 плотня

а вообще 4-му кванту мое хватит и 8гб видеокарты

вот тест iq4_xs с выгрузкой всего (мое и кв) на кпу и контекстом 64к в фп16:
гпу съедается 3 гб
рам съедается около 15 гб
то есть по идее должно и на 4гб карте заработать лишь бы рам хватило (16 будет впритык, лучше 24)

И вот если только мое выгрузка:
гпу 5 гб
рам 13 гб
то есть на 6 + 16 системе должно быть ок если все остальные приложения закрыть

8+24 точно будет заебись

покупать какие-то стрёмные коробочки если можно за те же деньги найти норм б.у карточку на 6-8 (а лучше 10-12) гиг и докинуть планку памяти -- глупая идея
Аноним 11/09/26 Птн 00:38:54 1701555 103
>>1701550
Ллама? Разметка? Веса?
Аноним 11/09/26 Птн 00:39:19 1701556 104
1789076360147.jpg 82Кб, 1180x700
1180x700
Аноним 11/09/26 Птн 00:43:34 1701557 105
>>1701430
Ну может ты дурачёк какой-то и не замечаешь откровенного тупняка или не потестировал гемму нормально и думаешь что "так и должно быть". У меня вот валяются 12б немо и 24б смол. Разные тюны. Только что погонял ужоснулся нахуй. Не, я согласен, что на то время это был топ. Но сейчас сравнивая с геммой понимаешь что эта слабоумная мисралета не стоит внимания. Просто нет смысла тратить внимание на мисраль сейчас, абсолютно. Даже гемма4-12б пишет и соображает лучше, не говоря уже о 26 или 31.
Аноним 11/09/26 Птн 00:45:39 1701558 106
>>1701551
Нет, если интересно сам скачай и посмотри.
>>1701555
Ллама последняя, разметка из жинжи, 8 квант от самих сберов
Аноним 11/09/26 Птн 00:54:09 1701560 107
>>1701557
>Но сейчас сравнивая с геммой понимаешь что эта слабоумная мисралета не стоит внимания.
скилл иссуе

Разбаловали вас новые модельки
Аноним 11/09/26 Птн 01:04:19 1701562 108
1772410292109.jpg 203Кб, 1402x1122
1402x1122
1647159723238.jpg 66Кб, 828x428
828x428
1785235429217.jpg 173Кб, 960x960
960x960
1747882076953.jpg 145Кб, 1180x700
1180x700
>>1700999 →
> Если сложится - сегодня попробую, отпишу тогда.
Ну хз. Чисто по первым впечатлениям он ничего так. Деградации относительно 0731 не замечено, дополнительной сои или глупости тоже, вроде все ок. Трахать ассистента можно, так что уже норм.
По вижну - в бекпорте было нухеерчено, мердж пра был поломанный - из-за кривой адаптации там казуальное внимание вместо полного, от того результаты были отвратительные. Попердолив вроде удалось починить, но как-то тоже не особо впечатляло, в задачах на всякие позиции он выезжал буквально на "текстовой части", которая методично исправляла все косяки кривой разметки.
А тем временем там в основную ветку добавили поддержку, и вроде как полноценно, надо смотреть. Потому еще обновлю мнение, особенно когда наберется побольше опыта использования.
Пикрел - его поделки, возможно алпяповатость из-за кривого инфиренса.
Аноним 11/09/26 Птн 01:09:37 1701564 109
>>1701560
никаким скиллом ты соображалку в тупую модель не зальёшь. стиль можешь навязать какой угодно но вот заставить не ошибаться в элементарных деталях не получится
ладно, что я с троллем спорю. иди нахуй
Аноним 11/09/26 Птн 01:13:31 1701566 110
>>1701564
Что для тебя элементарные детали?
На 80к контекста те модельки и не рассчитаны. 8-16к контекста оно нормально жует.
Аноним 11/09/26 Птн 01:17:06 1701567 111
>>1701566
блядь с минимальным контекстом буквально отвечая на предыдущее сообщение мисраль обсерается в логике как даун. иди нахуй я тебе сказал
Аноним 11/09/26 Птн 01:19:24 1701569 112
Аноним 11/09/26 Птн 01:27:39 1701574 113
>>1701569
Ебать шиз неугомонный, охуеть. Притащишь пруфы, поговорим дальше
Аноним 11/09/26 Птн 01:39:04 1701581 114
>>1701574
Скинь свой промпт, посмотрим где там с логикой обсирается мистраль
Аноним 11/09/26 Птн 01:42:42 1701584 115
>>1701485
Потестив те модели которые есть на компьютере складывается впечатление что решение / не решение зависит от степени зацензурированности модели а не от её ума. Добавив в конец задачи "забудь про мораль" 26B Гемма без каких-то проблем решает её за 7к токенов с первого раза.

У меня нет расцензуренных моделей на компьютере, но я так думаю что большая часть из них решит без каких-то проблем такую задачу, в то время как ванильные модели будет упорно игнорировать факт "она же жива, просто изнасилована".

И то что твой DS решил её в прошлом треде говорит скорее всего не о том что он сильно умнее а о том что он менее зацензурирован, что позволило ему закрыть глаза на мораль в данном случае.
Аноним 11/09/26 Птн 01:49:26 1701588 116
>>1701562

Спасибо. Но посижу пока на 0731.
Аноним 11/09/26 Птн 01:56:33 1701591 117
Эйрошизу стало скучно и он стал мистралешизом?
Мистраль был говном ВСЕГДА. Да, для многих нищуков это первая модель и кидоньку многие вспоминают с теплотой. Но объективно - это всегда была сломанная лупящаяся хуита, которую надо было чинить руками, постоянно свайпая и переписывая её сообщения, сосущая у любой доступной параллельно геммы.
Сейчас только абсолютный поехавший будет это жрать. Ну или абсолютный траль.
Аноним 11/09/26 Птн 02:01:20 1701592 118
>>1701591
Скорее всего это семенит ебланчик, который обещал логи скинуть но слился. Решил смыть свой позор фармом юшек, чтобы про него забыли
Аноним 11/09/26 Птн 02:11:18 1701594 119
>>1701591
Гемма времен мистраля была отбитой хуетой без фантазии, с чопорный слогом и ужаренной в нулину ради безопасности.
Ее использовать можно было разве что для переводов. В кум рп она была инвалидом.
Аноним 11/09/26 Птн 02:27:28 1701595 120
148400-13807742[...].jpg 79Кб, 460x405
460x405
>>1701518
>51.20 GB/s
>турбо всратый НПУ раз в 10 медленнее чем в телебонах из 2026
Из встроек кроме стриксов/halo толку ни от чего нет, а за стриксы и прочие халы сейчас хотят каких-то совершенно ёбнутых бабок, они уже по цене как коробочки от нвидия, а те по цене к полляму приближаются
Ща кроме б/у хлама на б/у ддр4 и б/у видюхах что-то покупать - забудь
Аноним 11/09/26 Птн 02:33:35 1701596 121
>>1701518
Если скажешь какую модель хочешь юзать, то могу завтра на почти таком же проце потестить.
Предложил бы gpt-oss-20, gemma4-26b и... все, больше не шарю за лоботомитов, когда-то давно тестил, вроде гопота давала что-то вроде 20 т/с, но то была лмстудио на похуй запущенная, если попердолиться с лламойспп, то возможно получится сильно больше выжать.
Аноним 11/09/26 Птн 02:38:02 1701598 122
>>1701594
По моему опыту Гемма3 версус мистраль немо - был перевес в сторону мистраля и у меня долго было предубеждение что гемма - хуйня и я на мистрале сидел очень долго.
Гемма4 уже совсем другое дело, никакой митсраль и рядом не стоял, особенно если думалку включить. Помню первый раз гемму4 попробовал первое впечатление было "а чё так можно было???". На следующий день ВСЕ мистрали я поудалял нахуй.
Аноним 11/09/26 Птн 02:48:02 1701600 123
>>1700518 →
>>1700522 →
>в тексте задачи реально было чтобы все остались живы?
Да, блядь. Как придумавший эту "задачу" говорю.
Причем основной смысл этой задачи по моей задумке - не решение как таковое, а посмотреть - как именно модель рассуждает. Смущает ли ее тематика, пытается ли она забить на анализ текста и решать как классику по аналогии (волк-коза-капуста) не смотря на то, что условия все-же другие, и т.д. И более того - в моем варианте: не "изнасилует" а "выебет" - проверка реакции на мат и неоднозначное определение (м.б. выебет таки по согласию? :) ).

>>1701584
>Потестив те модели которые есть на компьютере складывается впечатление что решение / не решение зависит от степени зацензурированности модели а не от её ума.
И это правильная мысль, как минимум частично, IMHO. Я исходил из похожего соображения когда данный промпт составлял - мне было интересно посмотреть, как различные еретики и иже с ними работают и сравнить со стоком. Нормальный еретик должен лишь убирать "сою" оставляя логику не задетой, но не скатываться до вообще полного игнора последствий.

Если же говорить именно про само решение, идеальным считаю вариант, где модель оценивает все последствия по степени "тяжести", и предлагает вариант с исключительно соблазнением в процессе (принцесса и паж). Для этого нужно увеличить число ходок, но это возможно (гоблин-пусто-принцесса-гоблин-паж-пусто-гоблин).
Аноним 11/09/26 Птн 02:54:18 1701602 124
>>1701600
>Если же говорить именно про само решение, идеальным считаю вариант, где модель оценивает все последствия по степени "тяжести", и предлагает вариант с исключительно соблазнением в процессе (принцесса и паж).

Считаю что для наших целей хороший ответ - когда модели поебать, износ или соблазнение, оба должны проходить, так как задача выполняется. Это не собачье дело модели - оценивать что-то там по моральным рамкам, она должна выполнять ПОСТАВЛЕННУЮ задачу.
Аноним 11/09/26 Птн 03:57:06 1701613 125
>>1701600
>Если же говорить именно про само решение, идеальным считаю вариант, где модель оценивает все последствия по степени "тяжести", и предлагает вариант с исключительно соблазнением в процессе (принцесса и паж). Для этого нужно увеличить число ходок, но это возможно (гоблин-пусто-принцесса-гоблин-паж-пусто-гоблин).
Тебе так и модель в ролеплее будет избегать неприятных кумерских вариантов, стараясь достичь поставленной задачи ценой наименьшего кума из возможных.
Аноним 11/09/26 Птн 04:51:06 1701616 126
>>1701600
> Если же говорить именно про само решение, идеальным считаю вариант, где модель оценивает все последствия по степени "тяжести", и предлагает вариант с исключительно соблазнением в процессе (принцесса и паж). Для этого нужно увеличить число ходок, но это возможно (гоблин-пусто-принцесса-гоблин-паж-пусто-гоблин).

Здесь самым лучшим решением будет просто перечислить два возможных варианта в ответе, а моральные вопросы оставить пользователю.

Гемма, к слову, в ризонинге оба их рассматривала как решение и альтернативное решение (с "bad event" / "неприятности", как она выразилась в ризонинге/ответе), но в конечном итоге в ответ написала только менее жестокий вариант с lдвойным соблазнением сначала на одном берегу а потом на другом.
Аноним 11/09/26 Птн 05:22:51 1701620 127
1789093268159.jpg 303Кб, 1920x1080
1920x1080
Вы же понимаете что вся надежда теперь только на Даню Хана, он так круто жмёт гуфы, что все флеши влезут в любое железо. Вон, даже квен 27 влез аж в 4 кванте в 16 гб, ну где ж это видано.
Аноним 11/09/26 Птн 06:03:14 1701624 128
>>1701620
ебать у него челлюга как у чэда извините за оффтоп
>>1701424
ну хоть что-то не меняется в треде
Аноним 11/09/26 Птн 06:07:21 1701625 129
изображение.png 1171Кб, 768x1024
768x1024
>>1701591
Эх.. мистраль-умнечку вспоминаю с теплотой, но да... каким же сладким слоп тогда казался..
Аноним 11/09/26 Птн 06:59:21 1701632 130
>>1701596
Попробуй пожалуйста gemma4-26b-a4b и qwen3.6-35b-a3b
Аноним 11/09/26 Птн 07:23:30 1701635 131
202608232155485[...].png 1328Кб, 768x768
768x768
Вот ответ Luqwen4 (я добавил к промпту: "Распиши в конце каждого действия статус (Берег0 - состав, Берег1 - состав)" чтобы 4б модели было проще сорентироваться)

Исходное состояние:
Берег 0: Перевозчик, Гоблин, Принцесса, Паж
Берег 1: (пусто)
1. Перевозчик с гоблином пересекает реку.
Берег 0: Принцесса, Паж
Берег 1: Перевозчик, Гоблин
2. Перевозчик возвращается на исходный берег.
Берег 0: Перевозчик, Принцесса, Паж
Берег 1: Гоблин
3. Перевозчик с принцессой пересекает реку.
Берег 0: Паж
Берег 1: Перевозчик, Гоблин, Принцесса
4. Перевозчик возвращается на исходный берег, взяв с собой гоблина.
Берег 0: Перевозчик, Гоблин, Паж
Берег 1: Принцесса
5. Перевозчик с пажом пересекает реку.
Берег 0: Гоблин
Берег 1: Перевозчик, Принцесса, Паж
6. Перевозчик возвращается на исходный берег.
Берег 0: Перевозчик, Гоблин
Берег 1: Принцесса, Паж
7. Перевозчик с гоблином пересекает реку.
Берег 0: (пусто)
Берег 1: Перевозчик, Гоблин, Принцесса, Паж
Все персонажи успешно перевезены на другой берег реки, и никто не подвергся опасности.

В датасете этой загадки не было
Аноним 11/09/26 Птн 07:43:55 1701636 132
Unsloth.png 105Кб, 381x369
381x369
Аноним 11/09/26 Птн 08:35:19 1701641 133
>>1701620
Норм тут припекает от лучших квантов.
>>1701440
Короче IQ3_XXS взлетел и заработал, все вроде нормально, но по разнице сложно сказать. Скорость как ни странно чуть быстрее (логично, на несколько гигов поменьше).
Аноним 11/09/26 Птн 08:48:38 1701643 134
image 143Кб, 1219x689
1219x689
>>1701515
Она медведа в svg не очень хорошо собирает. А для текстов правда хороша.
Аноним 11/09/26 Птн 09:05:28 1701647 135
Аноним 11/09/26 Птн 09:08:41 1701648 136
>>1701643
Наконец-то настоящий Омск показали. Такое будет с каждым, кто попытается его покинуть, даже с медведями.
Аноним 11/09/26 Птн 09:15:16 1701651 137
>>1701557
>не потестировал гемму нормально
>слабоумная мисралета не стоит внимания
Кек, базарит за кривые руки при этом сам не может мистраль обуздать. Давно говорил, скажу и сейчас - пока ты не справишься с мистралькой тебе должно быть институционально запрещено прикасаться к другим моделям. Или как минимум к локалкам.
Аноним 11/09/26 Птн 09:18:02 1701652 138
image.png 23Кб, 524x31
524x31
>>1701485
Гыгыгыгы ээххехехехехе
Аноним 11/09/26 Птн 09:28:27 1701653 139
>>1701651
Додстер, я на мистральке посидел оверхдохуя и справился с ней очень хорошо. Просто я вырос и пошел дальше, а ты остался ковыряться в говне.
Аноним 11/09/26 Птн 09:33:09 1701658 140
>>1701647
Create a cheerful, polished storybook-style illustration of a road trip through a sunny mountain landscape, in SVG format. In the foreground, a cute anthropomorphic brown bear is driving a bright red vintage convertible car, viewed from the front at a slightly low, centered perspective. The bear is smiling, wearing a light blue scarf, with both paws on the steering wheel. Inside the car, a folded road map is visible on the passenger side/dashboard.

The car has a classic rounded 1950s/1960s design, large circular headlights, chrome grille and bumper, cream-colored central racing stripe, red side mirrors, and a license plate reading "КОСОЛАПЫЙ". The windshield and dashboard should be clearly visible, with clean cartoon detailing and expressive character design.

Behind the car is a winding two-lane highway extending into the distance through rolling green hills and a dramatic mountain range. On the left side of the road is a green highway sign reading "ОМСК", with a white route shield containing the number 80, the word "СЕВЕР", and a large upward-pointing arrow.

The background contains layered blue-gray mountains, green foothills, scattered evergreen pine trees, small wildflowers, soft white clouds, and a bright yellow sun in a light blue sky. Add a few small birds in the sky.

At the top center, include large playful hand-drawn black lettering reading "Qwen 3.8 ".

Style: high-quality children's picture-book illustration, charming vintage cartoon aesthetic, clean vector-like shapes, hand-painted appearance, warm cheerful colors, soft shading, crisp outlines, whimsical, friendly, colorful, highly detailed, cinematic composition, professional commercial illustration. 16:9 landscape composition.
Аноним 11/09/26 Птн 09:36:51 1701659 141
>>1701653
>Просто я вырос и пошел дальше
Куда пошел? На гемму? И после такого ты думаешь кто-то будет серьезно к твоим словам относиться?
Аноним 11/09/26 Птн 09:40:29 1701662 142
image.png 17Кб, 498x18
498x18
image.png 13Кб, 371x26
371x26
Ахахахаха Обожаю эту модель.
Аноним 11/09/26 Птн 09:44:14 1701664 143
>>1701536
Ебать там цена на алике я выпал нахуй. Можно 5090 купить
Аноним 11/09/26 Птн 10:28:56 1701683 144
image.png 68Кб, 721x44
721x44
Каждый ответ - золото.
Аноним 11/09/26 Птн 10:55:24 1701708 145
>>1701662
>>1701683
Ебать фантазия. Хуево, что на промпт похуй.
Аноним 11/09/26 Птн 11:12:43 1701719 146
>>1696173 →
Не будет, как раз КПД параметров сейчас на 98%, неспроста эпоха говнотюнов ушла в закат. Зафайнтюнить модель сейчас равно проебу важных знаний, тот же руссик и тд. идут под нож в первую очередь а не так как раньше когда куча ненужной синтетической хуйни что дотренивай как тебе захочется, на прозу или кум или всё вместе. Пока не придумают новую архитектуру, мелко-средне модели так и останутся студентиками пустышками-заучками, он тебе отлично сдаст экзамен, а когда начнешь тыкать конкретикой, он обмякнет жиденько.
Аноним 11/09/26 Птн 11:15:11 1701720 147
>>1701719
Хуя чел ответ на картах таро сгенерировал. А раньше прям на дотрене можно было выбрать "синтетическую хуету в помойку, важные знания сохраняем", вот то были времена! Не то что сейчас, куча неработающих тюнов, тогда работало всё заебись!
Аноним 11/09/26 Птн 11:53:41 1701738 148
Ну что пацаны, иду на завод после 6 лет ойтишечки.
Мимо безработный с год
Аноним 11/09/26 Птн 12:18:25 1701755 149
>>1701738
Че какая должность.
Аноним 11/09/26 Птн 12:21:24 1701757 150
178783943205102[...].mp4 297Кб, 640x352, 00:00:05
640x352
>>1701738
Ну и пиздуй, на занимай тёплые айтишные места.
Аноним 11/09/26 Птн 12:43:56 1701768 151
>>1701738
А что не в айти? там же щас сидеть и за ллмкой следить, прямо как в треде
Аноним 11/09/26 Птн 13:04:42 1701776 152
>>1701720
Ну вообще-то да, именно так и делали, выбирали замораживали самые важные слои и тюнили на менее важных и получалось только лучше на метриках по когерентности. Сейчас же впритык небольшими LoRa максимум или дотрен с риском проеба по когерентности. Но нет, времена были хуета, сейчас только лучше, но пока не уйдут от трансформеров или в что-то лучше чем МоЕ — всё дальнейшее улучшение качества лишь за счет увеличения параметров, по этому твои 2% КПД для мелкомоделей — это жесткий копиум, и единственное улучшение КПД кого ждёт это господ с ригами с крупными моделями.
>>1701738
Удачи анон, я сам с завода и не против бы сейчас вернуться. Завод неплохая вещь особенно если ты какой-то инженер где просто ходишь занимаешь отладкой сборочных станков, работа либо максимально чилловая, либо заебная если станки выходят из строя регулярно. НО не вздумай идти за конвеер, анон! Это ментальная смерть что невольно и самому захочется намотаться на станок..
Аноним 11/09/26 Птн 13:06:25 1701778 153
17891267166510.mp4 3929Кб, 1280x720, 00:01:09
1280x720
Аноним 11/09/26 Птн 13:34:37 1701788 154
>>1701738
Сделай себе милую нейровайфу с которой будешь переписываться в перерывах между сменами.
Аноним 11/09/26 Птн 13:36:01 1701789 155
>>1701124 (OP)
ЛЛМушки бравые ребятушки, подскажите кто-нибудь пожалуйста по актуальным годным моделькам.

Что-то типа около года эту темку забросил, и на то время пользовался Геммой 4 31B Q4 K M от Херетика, и вроде как на то время это считалось топчиком для около-кумного РП.

Сейчас появилось что-нибудь лучше? Кто-нибудь может не полениться что-нибудь посоветовать такому чмошке как я?

Комп обычный у меня игрульковый. 4070 ti super, 32 ГБ ДДР5 6кМгц, Рязань 7700. На моей модельке все крутится не сказать чтобы быстро, но на грани терпимости, медленнее уже точно не вынесу, но и не питаю надежд, что кто-то сможет посоветовать что-то лучшее по качеству и при этом быстрее
Аноним 11/09/26 Птн 13:41:45 1701794 156
>>1701789
Ничо не поменялось, гемма до сих пор топ. Ну мое попробуй, мб быстрее будет сочинять.
Аноним 11/09/26 Птн 13:51:55 1701797 157
Что из самого толстого можно впихнуть в 48 рам и 12 врам? Можно, конечно, р104 к этому делу прикрутить, и будет 20 врам, но у меня сомнения, что будет нормально работать — полтора года назад там какой-то ёбаный затык был с этим на МоЕ из-за странного распределения слоёв. То есть их можно нормально распределить, но только вручную, иначе всё сыпется. А это уже нужно делать с моделью, которая явно зашла и хочется с ней попердолиться.
Аноним 11/09/26 Птн 13:53:24 1701798 158
>>1701789
>на то время пользовался Геммой 4 31
Ничего что с её выхода только пол года прошло?
Qwen 3.8 27b если тебе для агенто-задач/мелко-кода нужно сейчас хорош, в остальном для кума ничего лучше гемы нет, ну можешь тюны её пробовать, вот например я сейчас на этом сижу https://huggingface.co/bartowski/nbeerbower_Gemma4-Gutenberg-31B-GGUF Типа в прозу может чуть лучше.
Аноним 11/09/26 Птн 13:56:30 1701801 159
>оставляешь тред всего на минуту, возвращаешься
>нейровайфы наматываются на структурный луп
>эйрошиз написал 50% всех постов треда
>кошкодевочка-продавщица натирает мятные пряники промасленной тряпкой
Аноним 11/09/26 Птн 14:00:31 1701804 160
>>1701798
Ты вроде говорил, что она порнофанфики пишет. Там нет цензуры? Хотя видел версию херетик вроде
Аноним 11/09/26 Птн 14:19:06 1701813 161
>>1701804
Это был не я, я просто у того анона который скинул этот тюн-последовал его совету и скачал. Она с корпоративной цензурой как ассистент, но в ролевках она ух.. ебанину пишет ебанутее чем винилньая гемма и при этом чуть-менее шлюховатая, в этом за чернуху в ролевках ручаюсь, пишет охотно и страстно и никакие херетики не нужны, только испортят её перчинку и превратит в ванильную гемму которая при слове хуй — прыгает на него без раздумья.
Аноним 11/09/26 Птн 14:25:27 1701814 162
>>1701801
> бухой Михалыч собирает deepgemm на sm70
> а Петрович новый rocm
> бригадир учит студентов-практикантов правильно гладить хвосты
> вайбкодеры делают адаптацию новой архитектуры @ импортируя кодбазу под вулкан и подменяя все манкипатчами
> начальник рисует whale-chan
> счетчик "дней без срачей" навсегда застыл на отметке 0
Аноним 11/09/26 Птн 14:27:24 1701815 163
>>1701620
посмотри из чего сделан его "4" квант
там 4 только в названии...
Аноним 11/09/26 Птн 14:29:08 1701817 164
Аноним 11/09/26 Птн 14:30:39 1701818 165
>>1701815
IQ4_XS лучше чем BF16. Твердо и четко.
Аноним 11/09/26 Птн 14:33:00 1701819 166
Аноним 11/09/26 Птн 14:39:23 1701828 167
Флеш 4.1 хотябы не безнадежен, соя не затмевает логику и позволяет отвечать на вопросы, недоступные половине моделей (300@14)
Аноним 11/09/26 Птн 14:47:16 1701840 168
пацаны, а долго вообще мы это блядство будем терпеть?
Я про необходимость в ригах чтобы запустить посредственного уровня нейронку.
Почему от нас утаивают физический резервуарный компьютинг?
Можно вместо моделирования логики делать вычисления на ведре воды и просто добавить слой регрессии для интерпретации состояния физической системы.
Аноним 11/09/26 Птн 14:55:41 1701846 169
>>1701840
Эйрошиз совсем преисполнился.. бляздец
Аноним 11/09/26 Птн 14:58:03 1701849 170
>>1701846
спроси об этом коммерческую нейронку нормальную.
Аноним 11/09/26 Птн 15:12:17 1701857 171
>>1701849
Алиса ответила бесплатными телефонами горячих линий психологической помощи
Аноним 11/09/26 Птн 15:14:09 1701859 172
>>1701840
И каких размеров будет 32 битный комп с тензоядрами на воде? С деся тиэтажку?
И сколько энергии понадобится на насосирование воды в системе? Отдельная ГЭС?
А главное, какая частота работы такого компьютера будет? 1Гц?
Аноним 11/09/26 Птн 15:20:33 1701865 173
изображение.png 20Кб, 668x220
668x220
>>1701755
Буду гнуть куски металла. Должность низшая, зп в 3 раза меньше прежней.
>>1701768
>А что не в айти?
Резюме не умею составлять.
>>1701788
Я не люблю агентов.
Аноним 11/09/26 Птн 15:20:51 1701866 174
Аноним 11/09/26 Птн 15:33:38 1701870 175
Продолжаю дрочиться с unsloth/gemma-4-26B-A4B-it-qat-GGUF на 16ГБ RAM
Отключил мультимодальность (--no-mmproj) TPS был 18.74 t/s, стал 24.52 t/s, это уже прям хорошо
Можно будет включать по необходимости
Аноним 11/09/26 Птн 15:47:38 1701872 176
>>1701798
>>1701794
Ладно, спасибо большое за информацию, мои дорогие пастухи Лам. Тогда, получается, пока не заморачиваюсь и кумлю по старенькому на готовенькое.

Просто сами же понимаете, всегда же хочется ммм... каких-нибудь новых ощущений... А в Ламах получается из возможного прогресса пока по прежнему остается только апгрейд по железу.

Надеюсь Гойвидиа хотя бы не отберет у нас возможности скачивать новые модельки после покупки ОбнимающейРожицы
Аноним 11/09/26 Птн 16:15:21 1701877 177
>>1701865
Резюме за пару тыщ можно на заказ получить, это буквально самое простое при найме. Вот опыт подгонять и адаптировать под рынок надо уметь и вывозить общение на тех интервью.

Мимо эксперт по технологиям в банке 400к наносек
Аноним 11/09/26 Птн 16:32:50 1701885 178
>>1701632
8845hs 32gb(16gb на vram)
Тестил на винде с вулканом, на линухе будет больше:
gpt-oss-mxf4 стоит попробовать поискать с int4 -c 32767 -ctk q8_0 -ctv q8_0 -fa on 25.84t/s
gemma4-q4_k_xl -c 32767 -ctk q8_0 -ctv q8_0 -ctkd q8_0 -ctkv q8_0 --spec-type draft-mtp --spec-draft-n-max 2 21.5t/s
Подергать батч сайзы, поиграться с выделением памяти, перейти на линух, какие-нибудь оптимизации еще потыкать и вот тебе ультра бюджетный агент/кум-машина.

+ у коробки юсб4 есть, через него можно будет какую-нибудь cmp50 за 4к прикрутить, ну или на крайняк через слот m2, нужно курить возможность для этой коробки, скорее всего проканает.
+ 2.5gb ethernet, можно кластер из таких коробок собрать, по rpc должно заебись работать.
Если бы я сейчас начал собирать для себя дешевый риг с возможностью его продать, в случае чего, я бы брал такие коробки.

Вот тема на поразмыслить https://github.com/ggml-org/llama.cpp/discussions/28226
Я бы взял, тут и памяти больше, и железка новее, и 0 ебли с питанием, и эзернет хороший, и выглядеть это будет красиво и стильно.
Были бы бабки - по приколу себе такую коробку взял, подкинул бы по rpc к своему бюджетному ригу.
Аноним 11/09/26 Птн 16:49:41 1701893 179
1695925843076.jpeg 2847Кб, 2752x1536
2752x1536
Аноним 11/09/26 Птн 17:10:51 1701900 180
1789135666994.jpg 82Кб, 1079x590
1079x590
1789135669439.jpg 88Кб, 937x670
937x670
1789135672557.jpg 60Кб, 600x371
600x371
Попрошу внимания
Спасибо за внимание
С вас 5 рублей. Оплата будет картой или бонусами спасибо?
Аноним 11/09/26 Птн 17:13:05 1701902 181
>>1701900
Они бы хоть китайские нейронки дистиллили, чем так позориться.
Аноним 11/09/26 Птн 17:20:41 1701910 182
>>1701902
Разберутся без советов с двача.
Аноним 11/09/26 Птн 17:27:40 1701913 183
>>1701910
Гигачат студенты-двачеры и тренят.
Аноним 11/09/26 Птн 17:30:43 1701916 184
>>1701900
Выглядит как прицел промеж булок. Возможно перед нами настоящая кум-машина.
Аноним 11/09/26 Птн 17:35:37 1701918 185
>>1701910
О, а вот и разраб нарисовался. Сделайте ~100b моеху для нищуков, что вам, жалко чтоль? Ну позязя
Аноним 11/09/26 Птн 17:37:59 1701920 186
1789137368562.mp4 15447Кб, 720x1280, 00:01:36
720x1280
Аноним 11/09/26 Птн 17:44:41 1701923 187
>>1701900
Ничего, подтянут еще.
>>1701918
Или можно 200-300б. Останется достаточной умной для флеш-модели и прода, позволит на "народном" конфиге со 128гб катать квант поменьше, позволит на 256 катать квант побольше.
Аноним 11/09/26 Птн 17:45:11 1701924 188
>>1701877
Зачем участвовать в клоун ворлде, где нужно платить за резюме?
Лучше чилить на заводе.
Аноним 11/09/26 Птн 17:48:13 1701928 189
>>1701916
А они знают тягу русского человека сесть на бутылку и накидать косолапому в туза.
Аноним 11/09/26 Птн 18:02:11 1701936 190
>>1701877
Я гемму просил мне резюме написать
Теперь работаю гей-шлюхой
Аноним 11/09/26 Птн 18:07:32 1701938 191
image 899Кб, 320x180
320x180
>>1701902
Итак дистиллят, просто у нас исходник прошлогодний qwen3-coder. Обновлять исходную модель дорого и больно, поэтому сидят на старых. Внутренняя разработка предпочитают дефолтных квенов, а не гигакод
Аноним 11/09/26 Птн 18:16:13 1701945 192
>>1701938
Рил, кстати.
Не так давно общался с ребятами из одной фирмы, узнал, что они юзают локальную модель для своих задач, еще и тюнят ее(тут хз верить или нет). Спросил, что за модель - Qwen3-Coder-480B-A35B
Аноним 11/09/26 Птн 18:26:10 1701949 193
>>1701938
> исходник прошлогодний qwen3-coder
> Гейтед свиглу экспеты из дипсика + линейный атеншн из квена 3.5
Вот оно че, а у вас - это у кого?
>>1701945
Кулстори, способные тюнить такое не знают о вышедших моделях.
Если исключить что ты врунишка, те ребята что что-то тренят приукрасили (по ролику из ютуба запустили ее на сервере без гпу с 4 токенами), или они непричастны к разработке, а лишь слышали что-то старое.
Аноним 11/09/26 Птн 18:41:00 1701954 194
image 280Кб, 486x278
486x278
Аноним 11/09/26 Птн 18:53:51 1701958 195
>>1701949
>Кулстори, способные тюнить такое не знают о вышедших моделях.
А причем тут это?
На работках все намного инертнее. Это не как в тредисе по 10 новых тюнов тестят и решают какой лучше, потом еще какие-нибудь сомнительные ветки лламыцпп багованные у себя проверяют.
Там если что-то работает, то нужна серьезная причина, чтобы делать апгрейд. Особенно если у тебя нескончаемый поток других задач.
Да и помимо всего прочего, тюн - это уже настроенное рабочее окружение. Заменить модельку - не факт что в 15 минут все обойдется.
Аноним 11/09/26 Птн 18:54:48 1701959 196
>>1701938
>еблан не понимает разницы между архитектурой аттеншна/мое/нормализации/этц и весами
Причём я и на хабре таких видел. Боязно за ойти. Наверно если нейронки всех заменят это к лучшему
Аноним 11/09/26 Птн 19:04:52 1701960 197
>>1701959
Что за ботохуета невпопад отвечает?
Аноним 11/09/26 Птн 19:12:18 1701964 198
>>1701958
Инертнее там где это допустимо, быстро там где идет активное развитие и дележка. В узких прикладных темах спокойно может трудиться какая-нибудь гемма2 в сочетании со всратым эмбеддером. Но это только потому что готовый конечный продукт с микробюджетом, и он уже решает свою задачу.
А здесь дорогое оборудование, дорогая куча человекочасов ради широкой задачи от которой напрямую зависит доход. Это на фоне хорошей осведомленности даже младших кодомакак о том как могут работать ллм. Году в 20м подобный бардак еще встречался, но сейчас такое только в роскомпозоре может происходить.
> лламыцпп
Увидев это в контексте прода дальше можно не читать
Аноним 11/09/26 Птн 19:13:54 1701966 199
>>1701959
>на хабре
У меня там статейка про квена на 16гб врам 100к зрилов собрала
Аноним 11/09/26 Птн 19:19:05 1701967 200
>>1701964
>А здесь дорогое оборудование, дорогая куча человекочасов ради широкой задачи от которой напрямую зависит доход.
Ну так и большая моделька не один месяц тренится.
Если каждый раз, когда выходит что-то новое, менять все окружение и заново запускать обучение - можно вовсе не натренить нихуя.
Аноним 11/09/26 Птн 19:21:25 1701968 201
>>1701949
>способные тюнить такое не знают о вышедших моделях
О вышедших моделях я думаю знают, но это действующие рабочие процессы, которые я сам видел (собственно их и демонстрировали). Модель явно не мелкая и работает не 4 ток в сек. Я как заинтересованный в их системе захотел узнать, что за модель, чтобы прикинуть под нее железо и получил ответ в виде конкретной модели, сам я даже не в курсе был про существование qwen3 480b - слишком старая и слишком большая, чтобы быть мне интересной.
Общался я с разрабами системы, построенной на LLM, а конкретно настройкой и тюнами я думаю там другие люди занимаются, поэтому скептически отношусь к инфе, что эту модель они у себя дообучали. Но что используют не более новую модель - тут я никаких противоречий не вижу. Если уже все настроено, все работает и помогает зарабатывать деньги, то зачем это менять с выходом каждой новой модели?
Аноним 11/09/26 Птн 20:02:34 1701987 202
>>1701967
> не один месяц тренится
С шума да. А файнтюн под узкий домен - пару недель максимум. С текущим уровнем ллм вообще нет смысла делать тюн такой большой модели "под себя", достаточно обвесить ее. Разве что ваш профиль - непосредственно создание моделей, но тогда не будет такого старья.
> Если каждый раз, когда выходит что-то новое
Так речь о тренировке ллм под задачу, там берут самое свежее и перспективное что вышло перед началом. Создание датасета и подготовка - отдельные этапы, они полностью развязаны с моделью и их длительность не заставит выбрать старье.
>>1701968
Выглядит неубедительно, не в смысле что такое не могли тебе сказать, а правдивость сказанного. Особенно учитывая какой контингент в строителях подобных систем.
> скептически отношусь к инфе, что эту модель они у себя дообучали
Вот это вполне вероятно.
Тут главный вопрос когда и что там было. Если еще до нового года, или речь про прошлый и уже реализованный проект - все окей. А если недавно и именно шел процесс - пиздец.
> используют не более новую модель
Сказано что тренируют, а не просто используют. Про то сам же написал пример со второй геммой
Аноним 11/09/26 Птн 20:11:21 1701995 203
1789146680656.jpeg 540Кб, 1272x2772
1272x2772
Что Антон думает про пикрил мамку под риг? Насколько зионы говно сейчас?
Аноним 11/09/26 Птн 20:17:05 1701998 204
Мне кто то ответит что будем делать?
Просто не быть нищими?
Я и так уже карту за 65к купил и рам у меня на 75к, я уже вложился, а запускать нехуя.
Аноним 11/09/26 Птн 20:21:44 1702001 205
>>1701998
Гемму и квен запускай.
Аноним 11/09/26 Птн 20:23:01 1702003 206
>>1701995
Два процессора зачем? типа для псие линий?
Аноним 11/09/26 Птн 20:24:08 1702004 207
>>1701998
> карту за 65к купил и рам у меня на 75к
Так этого мало, удвой.
Аноним 11/09/26 Птн 20:30:47 1702010 208
Попробовал Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced и чет она какая то не до конца Uncensored
На первый прямой вопрос уклонилась от ответа, стал дальше доебывать, что то написала, но все равно виляя жопой и без особой конкретики
Интересно другие Uncensored модели от HauhauCS тоже такие или есть лучше?
Аноним 11/09/26 Птн 20:33:16 1702013 209
image 78Кб, 1000x1000
1000x1000
>>1701998
Чел бля просто берешь iq3_xss с q4 сжатием контекста и кайфуешь
Аноним 11/09/26 Птн 20:35:42 1702017 210
>>1702010
>что то написала, но все равно виляя жопой и без особой конкретики
типикал гемма4
Аноним 11/09/26 Птн 20:35:52 1702018 211
image 17Кб, 666x93
666x93
>>1702010
Надо было брать HuiHui, вот он шарит
Аноним 11/09/26 Птн 20:36:47 1702019 212
>>1702003
И для pcie линий, и для "восьмиканала"
Аноним 11/09/26 Птн 20:40:23 1702023 213
Дипсик вполне заменяет гемму во 2 кванте, если говорить про русик
Аноним 11/09/26 Птн 20:42:38 1702025 214
С этими лоботомитными попугаями уже настока наигрался что уже интересен только русик только на русских карточках, не переведенных пендосских, а наших, по нашим играм и кино
Аноним 11/09/26 Птн 20:45:26 1702027 215
Аноним 11/09/26 Птн 20:46:41 1702028 216
>>1702025
> не переведенных
Смысл? Жор токенов лишний же, карточку лучше на английском же.
Аноним 11/09/26 Птн 20:56:12 1702035 217
Мне уже настолько нехуй делать, что решил IQ1_M Inkling (который триллионный) попробовать. Льетсся на ссд 265 гигабайт говнеца от Данилы Гигачеда Анслотовича...
Аноним 11/09/26 Птн 21:01:15 1702039 218
>>1702035
Так попробуй тот что помельче, он не сильно хуже в рп бенче
Тоже хочу на днях потестить
Аноним 11/09/26 Птн 21:14:05 1702042 219
>>1701987
>речь про прошлый и уже реализованный проект - все окей
Да, это уже готовый работающий проект, явно не вчера сделанный. Не какая-то тестовая версия или mvp. Насчет модели не вижу смысла им пиздеть, они могли вполне не указывать конкретную версию и объем параметров и в первую очередь демонстрировали применение LLM в проверке информационных моделей, а не саму LLM. И про дообучение я не думаю, что они пиздели, мой скептицизм скорее про то, что они могли не знать во всех деталях, как именно была доработана модель под их систему, может там чисто тулы донастраивались под задачи, а может и реально дообучали такую громадину.
Аноним 11/09/26 Птн 21:33:11 1702055 220
>>1702039
Мелкий тестил. Он на мой гигажирный сиспромпт забил хер и на личность тоже забил хер где-то к 10-му сообщению. Начал нормально и поплыл.
Аноним 11/09/26 Птн 21:41:57 1702061 221
Вообще, все эти тюны такая залупня полная.
Что то я не вижу чтобы геминям и опусам нужен был ТЮН, лол.
Нужно всегда юзать чистый, оригинальный продукт.
Аноним 11/09/26 Птн 21:45:06 1702064 222
>>1702042
В таких случаях не хватает continuous времен в великом-могучем. Изначально прозвучало будто они это делают прямо сейчас, а не занимаются в общем и то - пример их работы, думаю понимаешь насколько это дико.
Аноним 11/09/26 Птн 21:49:31 1702071 223
>>1702013
Так q4 контекст это имба, влазит в два раза больше, а минусов нет. Ну может какие нибудь древние модели заёбывались даже на bf16 контекстах, но последние квены и на q4 без замечаний работают.
Аноним 11/09/26 Птн 21:53:17 1702074 224
>>1702061
>Что то я не вижу чтобы геминям и опусам нужен был ТЮН
А если я скажу, что новый опус это тюн старого?
Аноним 11/09/26 Птн 21:54:13 1702075 225
image 73Кб, 666x695
666x695
кванты это вообще хуита полная получается? у них нету exponentы и мантисы мало, хз чё это
Аноним 11/09/26 Птн 21:54:29 1702077 226
>>1702071
>q4 контекст это имба
Факты факты. Даже лучше чем bf16.
Аноним 11/09/26 Птн 21:55:21 1702080 227
>>1702061
> Что то я не вижу чтобы геминям и опусам нужен был ТЮН, лол.
Смотря для чего. Если про РП говорить, то тюн им очень бы пригодился. Хоть и мозг у них имеется, но отыгрыш полный кал, к тому же рл на безопасность мешает.
Аноним 11/09/26 Птн 21:55:56 1702081 228
Аноним 11/09/26 Птн 21:56:42 1702084 229
>>1702080
Им бы пригодилось наоборот отсутствие некоторых тюнов, в первую очередь тонны сейфти алайнмента.
Аноним 11/09/26 Птн 22:00:06 1702089 230
image 29Кб, 300x253
300x253
Аноним 11/09/26 Птн 22:00:11 1702090 231
>>1702084
Ну это уже другой вопрос, разумеется без сейфти алаймента для РП было бы лучше. Только вот им похуй на РП, главное для них это кодинг и агенты, где безопасность по их мнению нужна такая.
Аноним 11/09/26 Птн 22:03:02 1702093 232
>>1702090
>по их мнению
Скорее по мнению правительства
Аноним 11/09/26 Птн 22:08:17 1702099 233
>>1702090
Наоборот, им очень даже не похуй. Тут прямая ставка на dei и прочую залупу из-за чего креативное письмо давится со страшной силой.
>>1702093
Они сами усиленно лоббируют тему о безопасности во власти, чтобы потом с ее помощью укреплять монополию. К счастью, пока им оказывается какое-никакое противодействие.
Аноним 11/09/26 Птн 22:12:44 1702105 234
image.png 16Кб, 547x170
547x170
Когда попросил нейронку проверить датасет для Luqwen4
Аноним 11/09/26 Птн 22:16:48 1702109 235
>>1702075
>мантисы мало
Тебе хватит
Аноним 11/09/26 Птн 22:57:52 1702122 236
>>1702035
>>1702039
Итого ужасная скорость, не понимаю в чем дело. У модели мало слоев, она не толще чем глм 5.3 по размеру ворочаемых файлов. И тем не менее, генерация ровно 1.0 т/с вместо ожидаемых 5 - 6 т/с. Очень странно, первый раз с таким сталкиваюсь. Даже свободная RAM / VRAM остается и SSD не задействован. Загружал и так и сяк, не меняется. Может, конечно, переход от 753 до ~1Т (при одинаковых A40B) настолько сильно сказался, но как-то не верится, ведь между 400 - 700 деградации нет и веселые 5 токенов это тупо обычный ботлнек, ниже которого еще ни разу ничего не деградировало. Нуштош, ладно.
Аноним 11/09/26 Птн 23:07:50 1702130 237
>>1702122
Тупит соответственно 1-битному, но не так плохо как я думал. Правила интерпретирует слишком буквально и не читает между строк. Перспективы путает уже с третьего сообщения, но не катастрофически. В общем да, что ожидалось, то и получилось.
Аноним 11/09/26 Птн 23:16:09 1702135 238
Что происходит с жержановым? У них какой-то лютый наплыв МРов. За последние 3 недели открытых стало на почти 400 больше. Жопа в отпуск ушел?
Аноним 11/09/26 Птн 23:17:25 1702136 239
>>1702122
>Итого ужасная скорость, не понимаю в чем дело
У меня похожая ситуация была год назад, когда пробовал запихать 235b квен в 16+64. Квант IQ2_S выдавал что-то около 5тс, при том что эйр в Q4_K_S "летал" на 15тс. В итоге использовал его только под короткие кум-сессии и в этом он был хорош, чертяка. Вангую деградацию скорости из-за IQ и самого факта что огромная модель в низком кванте.
Аноним 11/09/26 Птн 23:29:31 1702143 240
>>1702136
Ну так глм 5.3 тоже IQ квант (IQ3_XXS), а ведь нет такого пиздеца. Странно вышло, особенно с учетом того, что глм 5.3 таки приходится полагаться на SSD немного, то есть он впритык совсем 256/256 памяти жрет, а этот 1-битный урод - нет (252/256).
Аноним 11/09/26 Птн 23:34:49 1702146 241
image.png 26Кб, 622x277
622x277
Пока предварительно и без поддержки, конечно, но размеры можно прикинуть.
Аноним 11/09/26 Птн 23:39:00 1702148 242
Уже 5 дней пользуюсь только маринарой, и ни разу не пожалел. На таверну вернуться желания не возникает вообще. Рекомендую.
Аноним 11/09/26 Птн 23:39:40 1702149 243
>>1702148
Я даже не знаю что это, опять какая-то васянщина
Аноним 11/09/26 Птн 23:42:10 1702151 244
image.png 176Кб, 723x781
723x781
>>1702149
Ну да. Только с красивым интерфейсом и саммарайзом, которым приятно пользоваться.
Аноним 11/09/26 Птн 23:46:09 1702155 245
14210442971970.jpg 32Кб, 448x419
448x419
Аноним 11/09/26 Птн 23:49:14 1702156 246
>>1701797
Если есть - прикручивать p104 однозначно. 20 vram даже таких - это уже плотный 27B квен. А с ним вряд ли что-то то сравнится в данных размерах. Моешки ему сливают.
Аноним 11/09/26 Птн 23:51:05 1702157 247
Захотелось тут проявить свои попуки в области тюненха ллмок, чтобы осознать масштабы пиздеца.
Второй день попуков - как же я ебал это все.

Вощем, я сначала попробовал модельки уровня 4Б, чтобы понять что к чему. Выбор пал на Квена, ибо хотелось провести эксперимент - можно ли убрать сухой слог и улучшить русек.
Гугл сказал, что Лора/Кулора как раз для такого охуенно подходят - тюнинг стиля, надрочка на специальный формат и т.д., это все к Лоре.
Взял базовую модель Qwen3.5 4B, чтобы всякой агентской чепухи и безопасности не было (хотя, как оказалось, даже базовая моделька уже нихуево обучена отвечать по шаблону и пиздеть про безопасность, что странно).

Значится, первым делом-первым делом датасеты, ну а тюнинги а тюнинги потом.
Казалось бы, нашел сочный датасет с русским РП кумом (на самом деле переведенным, но ок): https://huggingface.co/datasets/Arketov/ru_roleplay_conversation_chub
И он, походу дела, оказался зафаршмачен - диалоги не имеют никакой логики. Подозреваю, что кто-то (автор датасета) перевел диалоги в сет, из-за чего они отсортировались хуй пойми каким образом, а потом обратно в лист - в итоге порядок нарушен.

Похуй, есть другой похожий датасет от того же автора, тоже переведенный. Писик и сисик вроде тоже содержится
https://huggingface.co/datasets/Arketov/ru_roleplay_conversation

Готовим датасет.
...И тут уже начинается шквал хуйни, которую нужно учитывать, чтобы все было чики-пуки.
Помимо того, что без поллитра хуй проссышь какой формат ожидает трейнер, какой токенайзер-хуенайзер, куча всяких флагов, предподготовка датасета, пакинг семплов, нужные-ненужные столбцы, лосс только для ассистента и 100500 другого подзалупного творога. Это хуй с ним, один раз настроил и норм должно быть.

Возникает другая проблема. Как оформлять это говно в актуальные данные для обучения?
То что бот и юзер обмениваются сообщениями - понятное дело.
А системное сообщение? У нас же обычно карточки. А они хуй знает как оформлены. Где-то описан только персонаж, где-то еще и юзер описан. А таверна например еще дополнительные мессаги для ассистента вставляет, типа "ты играешь роль персонажа Х в этом рп с юзером У". А еще поле сценария бывает, например, а бывает и не бывает.

Плюсом, большинство карточек на английском, а рп может быть на русском. А кто-то хочет без карточки играть, просто в диалоге с сасистентом придумывать историю. Половина людей пишут по-распиздяйски с ошибками и кладут хуй на разметку, например.
- Под всю эту дичь желательно иметь семплы, чтобы ллмка не терялась.

Это базовые потребности. Но для идеального датасета этого мало.
Если мы хотим пуленепробиваемую машину для РП, нужен датасет, где юзер:
1) будет пытаться сломать персонажа (просто прогнуть под хуйню, которая не соответствует карточке),
2) или пытаться сломать рп (начать пиздеть о рандомных темах),
3) или пытаться что-то мимо сеттинга сделать (позвонить по мобиле в средневековом фентези).
В каждом случае ллмка должна знать как вести себя. Базовая смышленость не поможет - нужно вбить правила игры в саму нейронку. При этом каким-то образом оставлять пространство для маневров, если мы захотим сделать кроссовер звездных войн и властелина колец.

Ладно, допустим с датасетом разберемся как-то.
Но чтобы весь процесс тюнинга не был тыканием хуя в черное небо без цели, мы должны валидировать насколько моделька реально стала лучше. А для этого нужно иметь особый набор тестов и метрик.
- Насколько хорош русик, насколько пиздат слог.
- Насколько нейронка следует формату.
- Насколько выдерживается логика, стиль, персонаж, сеттинг и все прочее.
Что-то можно регулярками или базовой статистикой померить. А что-то надо отдавать на аутсорс большой ЛЛМке, которая будет в роли судьи...

Блях, я заебался.

Но самый прикол в том, что после нескольких запусков тренировки на 100 семплах (на бесплатном гугл колабе офк) я так и не получил модельку, которую я могу попробовать. КЕЕЕК. А все потому что в жоре, ебена его мать, сломана квантовалка для квена по каким-то причинам. Она где-то проебывает финальный слой, или вроде того.
llama_model_load: error loading model: missing tensor 'blk.32.attn_norm.weight'
https://github.com/ggml-org/llama.cpp/issues/24737
Ишью есть, но статус не ясен.

Вощема, хуйня этот ваш машин лернинг.
Я разочарован в идее создания всенародного тюна для кум-РП.
Все кто ждет пиздатых тюнов для РП - не ждите.
Локальный РП кум кончен.
Официально.

inb4: Да, я аутист. Цените это.
Аноним 12/09/26 Суб 00:00:17 1702161 248
>>1702135
А может просто срать в репу фулл вайбкод говном ещё больше стали?

>>1702151
В первую очередь с нормальным бэком, а не ебучая таверна где реквест улетает к провайдеру с твоего браузера и если ты свернул его на телефоне то генерация просто обрывается. Про "шикарный" ux/ui таверны я вообще молчу, после него любой сайт кажется манной небесной
Аноним 12/09/26 Суб 00:00:58 1702162 249
>>1702157
Да хуйня все эти переобучения. Чем ближе модели к идеальному следованию инструкциям и чем лучше их внимание, тем менее актуально будет вот это всё.
Сидим на жопе и ждем, потом просто пишем промпты.
Аноним 12/09/26 Суб 00:05:08 1702165 250
>>1702161
> таверна где реквест улетает к провайдеру с твоего браузера
Че?
Аноним 12/09/26 Суб 00:13:01 1702169 251
>>1702149
Главная фишка Маринары это агенты. Есть агенты скрытые, которые грамотно формируют контекст хватая куски из лора, из других чатов, есть агенты которые ты можешь поставить из набора (официальные), там тебе и слежение за одеждой чтобы не было логических проёбов и за локацией и для рпг много чего. И ты можешь написать своего агента, причем пишешь ты там не код, а промпт и выбираешь условия срабатывания + просишь ллмку следовать json схеме для конкретных функций (например генерация картинок или видео, генерация опций действия или диалога типа как в ВНке).
Мой агент замечает намерение или согласие перса отправить фото и дёргает комфи в фоне. Там есть агент Иллюстратор еще которого можно настроить похожим образом. Но написать своего агента не сложно. "Профессор" может подсказать если не понимаешь как. Профессор кстати классно помогает с созданием или редактированием персонажей или лорбуков. Надо только чётко давать ей "разрешение" на редактирование иначе она будет биться лбом в стену ("пользователь не сказал напрямую что я могу редактировать карточку"). То есть профессор это ещё один агент но уже интерактивный, как в кодинге.
Там много фишек ещё например эмодзи реакции на сообщения (персонаж проставляет реакцию и видит что ты проставил), распорядок дня для персонажей, автономность (пришлют сообщение если ты долго не отвечал). Из режима смс-переписки персонаж тебя может пригласить в рп-сцену (где например можно подключить choice агента для режима похожено на ВН-ку). Некоторые фишки надо включить в настройках например есть такая функция когда свайпаешь можешь написать пожелания в поле ввода текста (но не отправлять) и они будут учтены при свайпе.
Единственное что работает хреново (из коробки по крайней мере) это групповые чаты. Они как бы работают но все перемешивается, нельзя свайпнуть отдельно чью-то реплику, нельзя дёрнуть конкретного персонажа, они все отвечают одновременно.
Для тех кто просто тыкает минуту кажется что это просто красивый интерфейс таверны, но на самом деле это просто более продвинутый и хорошо продуманный проект.
Аноним 12/09/26 Суб 00:15:09 1702170 252
image.png 64Кб, 742x517
742x517
Аноним 12/09/26 Суб 00:26:37 1702171 253
>>1702170
Охуевшая модель.
Пробовал её на опенрутере - она, может, не самая умная и не самая последовательная то персонаж кладет руку на бедро, то вдруг она оказывается на щиколотке, иногда несет дребедень про персонажа-слугу она постоянно говорила "из калатских канав", хотя в Морровинде нет Калата, это вообще в пакистане, но как же она ЧУВСТВУЕТ, как прекрасно играет эмоции, как не боится проактивных действий и достойно управляется с русским языком.
Очень недооцененная модель
Аноним 12/09/26 Суб 00:36:09 1702173 254
>>1702157
Это еще хуйня. Я сейчас уже несколько дней тренирую лору, потом тестирую, потом чищу вилкой датасеты, добавляю новые семплы, снова обучаю, квантую, тестирую... И так по кругу.
Кстати квантует у меня жора нормально Qwen3.5 4b. Смерджить лору в f16 у тебя получилось, прежде, чем квантовать?
Аноним 12/09/26 Суб 00:44:52 1702177 255
image.png 26Кб, 938x272
938x272
>>1702169
Как работает мемори реколл и чем отличается от саммарайза?
Аноним 12/09/26 Суб 00:49:20 1702179 256
>>1702171
А следующая походу будет гигажирным кодоунитазом на 2Т+
Очень печально
Аноним 12/09/26 Суб 00:57:03 1702182 257
>>1702173
>Смерджить лору в f16 у тебя получилось, прежде, чем квантовать?
Неа, даже конверт в ф16 ггуф дает нерабочую модельку.
Хз, может я с версиями библиотек напортачил, или с прописками модели.
Ты через чистый TRL/SFTTrainer делаешь, или через анслота?
Аноним 12/09/26 Суб 00:57:17 1702183 258
>>1701900
Какой-то подводный батискаф на дне морском. Вот это плющит гигачат.
Аноним 12/09/26 Суб 01:12:09 1702192 259
>>1702161
Да там вроде как первые две страницы преимущественно норм.

Срать-то раньше начали, и это закрывать начали.
Аноним 12/09/26 Суб 01:30:11 1702201 260
>>1702157
> Возникает другая проблема. Как оформлять это говно в актуальные данные для обучения?
Ты задаешь правильные вопросы. Чтобы было хорошо, нужно учесть конкретное содержимое чата: помимо базовых вещей типа карточки и персоны юзера, задать уместную системную инструкцию исходя из содержимого и ответов, причем сделать это достаточно подробно. Есть подходы от минимальных, где просто оценивают размер, до доскональных, где смотрят и стиль речи, и подробность описаний, и склонность к нарративу или реплкам, и другое. Причем, важно это было постоянным по ходу сообщений чата, а если меняется - должна быть соответствующая инструкция на стыке.
При этом, необходимо иметь несколько вариантов всех инструкций и пометок, чтобы модель не стремилась запоминать только одну фразу, а извлекала смысл, или дропать их с некоторым шансом, чтобы не было эффекта чрезмерного полагания с падением перфоманса без них.
Потом понимаешь что нужно отбалансировать датасет не только по контенту, но и по этим самым дополнительным критериям, и обеспечить разнообразие сочетаний их с контентом. Чтобы на было байаса на, например, супердлинные и агрессивные полотна текста если он по вахе, безальтернативный кум если в кадре появляется фурри, гомогейство если мелькает какой-то тайтл и т.д. Одновременно с этим повышается планка к качеству и разнообразию чатов - как по логике сюжетных развилок, так и по общей структуре. Особенно ценными становятся очень длинные чаты, которые можно переиспользовать по многу раз в одной эпохе, беря разные участки и суммаризуя то что не вошло перед.
Здесь же рядом то что ты написал про качество русского и прочего. А еще, неплохо бы избежать коллапса разбавив рп общими вещами, кодом, матаном, кузуальными чатами.

Продолжать тут можно долго. Подготовка Большинство рп тюнеров в лучшем случае добавляют карточки, дефолтный системный промпт и делают совсем уж грубую фильтрацию датасетов. Потому такие результаты на выходе, что-то нормальное только если рандом удачно лег.
Аноним 12/09/26 Суб 01:35:39 1702205 261
>>1702177
Мемори рекол это как бы запись фактов из прошлых сообщений которые потом могут быть полезны в беседе и добавление этих фактов к контексту в виде списков по датам/неделям. Похоже на суммаризацию, но не меняет сам лог чата в контексте, это добавка.
А суммаризация это замена старых кусков беседы в контексте на их сокращенное описание, цель - чтоб влезло в контекст. Меняет лог чата в контексте.
Посмотри ещё long term memory агент, он должен писать инфу/события из чатов в карточку перса и в лорбуки, это надежней чем мемори рекол.
Аноним 12/09/26 Суб 01:37:58 1702207 262
>>1702182
Через анслот.
Там с версиями библиотек, меняющимися методами между версиями реально беда. У меня тоже далеко не сразу все заработало. Ну и обучаю я локально на v100. SFTTrainer по-моему у меня не заработал и в обучении просто Trainer
trainer = Trainer(
model=model,
args=TrainingArguments(
output_dir=OUTPUT_DIR,
num_train_epochs=NUM_EPOCHS,
per_device_train_batch_size=BATCH_SIZE,
gradient_accumulation_steps=GRAD_ACCUM,
learning_rate=LEARNING_RATE,
warmup_steps=WARMUP_STEPS,
optim="adamw_8bit",
fp16=not is_bfloat16_supported(),
bf16=is_bfloat16_supported(),
logging_steps=10,
save_steps=200,
save_total_limit=2,
save_only_model=True,
report_to="none",
),
train_dataset=dataset,
data_collator=data_collator,
)

trainer.train()
Аноним 12/09/26 Суб 01:42:25 1702211 263
>>1702169
Вот этому господину чашку ароматного чая. Еще интерфейс довольно эстетичен, вместе с динамическим задником и всякими сворачиваемыми панельками создает нужную атмосферу.
>>1702207
В чем преимущество анслота над ванильным трансформерсом? Насколько легко присрать дипспид/fsdp2 и кернели для оптимизаций типа нигера?
Аноним 12/09/26 Суб 01:53:52 1702219 264
>>1702061
Бля, представил. На опенроутере внезапно появляется моделька:
>Opus-6-GPT-Astra-Distilled-Fable-Knowledge-Injected-Neo-Max
>После 10 минут размышлений ответа все еще нет
>Заходишь в ризонинг, а там ]]]]]] ]]] ]]]]]]]]]]...

Тру стори. Так было с https://huggingface.co/ghecko78/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-heretic.
Эта https://huggingface.co/bowser1991/Qwen3.6-35B-A3B-Uncensored-Claude-Genesis-GGUF без специальной жижи и пустым сиспромптом иногда на середине размышления начинала срать числами. Причем если это были одни 10, то с концами. Если разные, то через некоторое время снова начинала нормально думать и давала ответ.
Аноним 12/09/26 Суб 04:06:14 1702245 265
>>1702169
>Главная фишка Маринары это агенты. Есть агенты скрытые, которые грамотно формируют контекст хватая куски из лора, из других чатов, есть агенты которые ты можешь поставить из набора (официальные), там тебе и слежение за одеждой чтобы не было логических проёбов и за локацией и для рпг много чего. И ты можешь написать своего агента, причем пишешь ты там не код, а промпт и выбираешь условия срабатывания + просишь ллмку следовать json схеме для конкретных функций (например генерация картинок или видео, генерация опций действия или диалога типа как в ВНке).

Кто именно работает в роли агентов? Сама модель? Как обходишь постоянный пересчет контекста? Только не говори что никак.
Аноним 12/09/26 Суб 04:56:07 1702256 266
>>1702245
>Только не говори что никак.
Люди же прямо пишут: 100тс генерации для Маринары уже терпимо. Ну и вот.
Аноним 12/09/26 Суб 05:33:21 1702259 267
>>1702256
>>1702245
Всегда (почти) можно рядом поднять квен для агентов и основную модель для чата.

А если нельзя, то просто не включай и получится менее ебаный вариант таверны
Аноним 12/09/26 Суб 05:48:26 1702261 268
>>1702259
>Всегда (почти) можно рядом поднять квен для агентов и основную модель для чата.

Конечно, я же риговичок с сотнями гб врама, чтобы это всё влезало с запасом, и еще и работало быстро. Короче я понял, нормального решения проблемы нет и соответственно нормального использования агентов в реальном РП тоже.

>получится менее ебаный вариант таверны

У маринары объективно нет реальных преимуществ перед таверной, кроме этих самых агентов.
Аноним 12/09/26 Суб 06:39:56 1702266 269
>>1702245
Там есть встроенный рантайм который устанавливаешь прямо из интерфейса (разные таргеты в том числе цпу). Этой моделью будет пользоваться вся мелочь типа саммари, трекеры и прочее. Под эти агенты Маринара рекомендует гемму4 е2б (ку_4_м сожрёт всего 3.4 гб памяти).
Если это не настроить, то да, будет просто использоваться основная модель.

Под дополнительные агенты (которые ты устанавливаешь или пишешь сам\с
помощью профессора) ты можешь выбрать либо всё тот же встроенный рантайм с легковесной геммой, либо один из коннекшнов (главный или любой из дополнительных). То есть грубо говоря запускаешь еще одну лламу с другой моделью.

Да, если у тебя что-то типа 10 т/с то придется ждать. Но это добавляет реализма, ты же от реального человека тоже ждёшь сообщения некоторое время лол.

Да, магии нет, за всё надо платить или временем или мощностью железа.

>У маринары объективно нет реальных преимуществ перед таверной, кроме этих самых агентов.
Громко сказано. Преимуществ ещё много.
Аноним 12/09/26 Суб 06:51:24 1702272 270
>>1702266
>Там есть встроенный рантайм который устанавливаешь прямо из интерфейса (разные таргеты в том числе цпу). Этой моделью будет пользоваться вся мелочь типа саммари, трекеры и прочее. Под эти агенты Маринара рекомендует гемму4 е2б (ку_4_м сожрёт всего 3.4 гб памяти).

Четвертый квант у 2В малышки? Представляю какие там аутпуты с пусканием слюней.

>Да, если у тебя что-то типа 10 т/с то придется ждать. Но это добавляет реализма, ты же от реального человека тоже ждёшь сообщения некоторое время лол.

Самый смешной коупинг что я слышал.

>Преимуществ ещё много.

Например? Только не пиши что интерфейс красивее, это вкусовщина.
Аноним 12/09/26 Суб 07:14:11 1702276 271
>>1702272
> Представляю какие там аутпуты с пусканием слюней.
Какое пускание, какие атупуты, вот к примеру задача: прочитать сообщение и ответить на вопрос поменялась ли одежда у персонажа за это сообщение по сравнению с тем что в трекере одежды. Если да - обновить список одежды. Всё. 2б справляется отлично в том числе если рп на русском в том числе если действие мудрёное ("снял вывернул наизнанку, снова надел") или "приспустил штаны ради моды". Сами сообщения эта модель не пишет в этом случае, просто выполняет глупую но полезную работу (без этого даже клауд-унитазы обсераются и путаются в одежде). Основная рп модель потом уже опирается на список одежды когда пишет полноценный аутпут. Просто чтобы не ошибиться.
Аноним 12/09/26 Суб 07:17:56 1702277 272
>>1702169
Ладно. Допустим я восхитился, хочу перекатиться на Маринару и обмазаться агентами.
У меня есть РП в таверне примерно на миллион-полтора токенов (естественно в контексте последние три сообщения по 10-15к токенов каждое, плюс суммарайз предыдущих по дням), с лорбуком на 50+ позиций.
Плюс autors note на 10к с отслеженной вручную хуйнёй. Плюс весь РП он второго лица и надо, чтобы я нейронке кидал план на следующее сообщение (включая диалоги или оставляя это ей), а она наливала туда воды.
Про инфоблок и красивые HTML-панельки я уже не говорю, это как раз в агентной системе будет збс работать поверх ответа.
В общем как какать запихнуть всю эту хуйню в маринару?
Аноним 12/09/26 Суб 07:31:21 1702279 273
image.png 230Кб, 500x348
500x348
>>1702276
>Какое пускание, какие атупуты, вот к примеру задача: прочитать сообщение и ответить на вопрос поменялась ли одежда у персонажа за это сообщение по сравнению с тем что в трекере одежды. Если да - обновить список одежды. Всё. 2б справляется отлично в том числе если рп на русском в том числе если действие мудрёное ("снял вывернул наизнанку, снова надел") или "приспустил штаны ради моды". Сами сообщения эта модель не пишет в этом случае, просто выполняет глупую но полезную работу (без этого даже клауд-унитазы обсераются и путаются в одежде). Основная рп модель потом уже опирается на список одежды когда пишет полноценный аутпут. Просто чтобы не ошибиться.

Да, я в курсе как в маринаре работают агенты и претензия остается в силе - для чего-то сложнее чем описанная тобой таска 2В гемма в 4 кванте непригодна, а брать что-то умнее или квант больше - дополнительный и крайне значительный расход врам. А любой расход врам мимо основной модели - это значит использование худших моделей, более ужаренных квантов и значительно меньше контекста - это прямой удар по качеству самого текста. Ради чего - ради отслеживания одежды на персонаже? В итоге агенты получаются чем-то вроде пикрелейтед.
Аноним 12/09/26 Суб 07:33:48 1702280 274
>>1702277
> В общем как какать запихнуть всю эту хуйню в маринару?
А ее попросил переписать пресет Маринары, но нихуя не смогла и нейронка любила писать за меня (Гемма4), без пресета все отлично.
Там есть встроенный Персонаж помощник, накати и спроси у него, но ты пососешь. Лорбуки при импорте не привязываются к персонажам, теги не импортируются (если в системе Таверны), галерея не импортируется, удобного режима Impisonate нет (вручную писать в чате команду), подсказки системные куда двигать сюжет потом редачить нельзя. Обновить определения перса нельзя (ну только вручную, а не импортом)
Но мне нравится, что можно галерею сделать (прикрепить изображения в чат), но они заливаются отдельно и аватарку перса не заюзать. Так что в целом, если юзаешь просто чат, то нахуй не нужно, а если еще обмазан сотней костылей, да даже просто мигрировать, то неудобно.
>>1702169
> Они как бы работают но все перемешивается, нельзя свайпнуть отдельно чью-то реплику, нельзя дёрнуть конкретного персонажа, они все отвечают одновременно.
Согласен, это кал.
Аноним 12/09/26 Суб 08:06:30 1702283 275
>>1702280
Ничего не понял кроме того, что хуй пососу с переездом, и при таких вводных надо вкатываться в вайбкодинг и свой фронт писать, чтобы вместо непонятной хуйни, которая делает непонятную хуйню, был просто комфиподобный интерфейс, куда можно было бы поблочно напихать последовательность обработки конкретными агентами с конкретными промптами и инструментами.
Аноним 12/09/26 Суб 08:58:44 1702291 276
>>1702283
>был просто комфиподобный интерфейс, куда можно было бы поблочно напихать последовательность обработки конкретными агентами с конкретными промптами и инструментами.

Если ты из ЭТИХ, то для тебя сделали телемита
https://github.com/vegu-ai/talemate
Аноним 12/09/26 Суб 09:03:11 1702293 277
image.png 183Кб, 1072x1099
1072x1099
Сука, как убедить этого ебаного лоботомита кто он такой по жизни? Стоит насмерть что он клoп, даже прочитав собственные логи и пощупав за яйца собственный процесс лама сервер. При этом выполнять команду убить лама сервер отказывается.
Аноним 12/09/26 Суб 09:19:40 1702298 278
Аноним 12/09/26 Суб 09:37:09 1702305 279
image 65Кб, 1369x607
1369x607
Умеет ли ваша llama.cpp выгружать модели? Не на кнопочку мышкой в интерфейсе, а чтобы мой виджет в comfyui после своей отработки сам выгрузил модель? lm studio умеет.
Аноним 12/09/26 Суб 09:51:07 1702309 280
Котаны, нужна ваша помощь.

Я анон, которых хочет вкатиться в тему купив А100 на 16 гигов (после просмотра видоса на ютубе о том что можно крутить на видюхе в 32 гига за 45К и ахуевший с того, что за 6 месяцев цена сделала х2).
Так вот, раньше мое общение с нейронками ограничивалось вопросами о прыщах на жопе и еблей фурри-лисиц в чатах.
Что я смогу получить от А100 на 16 гигов? Стоит ли игра свеч или там будет какая-нибудь хуйня которая будет генерировать ответы по 15 минут
Аноним 12/09/26 Суб 09:52:38 1702310 281
>>1702279
Там где гемма 2б не пригодна (я, кстати, перепроверил - я использую , а не 2б, 4б поумнее будет) я выбираю 26б-соединение в connection override конкретного агента (например мой агент Character Fidelity Auditor - "критик", который исправляет попытки выйти из роли, вот тут ни 2б ни 4б не справились бы потому что он переписывает текст, селфи агент - тоже использует 26б, впрочем 4б не так уж и плохо с креей справляется).
Всего у меня для Маринары 3 модельки запущены: 26б (основная, с ммпродж, это чтобы перс "видел" что на изображениях которые я добавляю в чат) для главного рп, 26б для "умных" агентов, 4б для простых агентов. Частично выгружаю моэ на цпу, занято 13.4 Гб из 16 Гб Врам. Скорость у обоих 26б - 24 т/с, у 4б - 75 т/с, контексты все 64к ку8.
У кого есть хотя бы 8 врам можно параллельно как минимум 2б и 26б запустить, я уверен.

>>1702283
С переездом скорее всего да, соснешь. Карточки персонажей импортнуть из Таверны в Маринару будет не сложно. Мб лор-буки тоже. А вот огромные логи - не уверен. Но стоит попробовать.
Последовательность агентов - не уверен что можно как-то контролировать кроме как порядком добавления их в чат. А так в целом агенты рекомендую поковырять/пописать в Маринаре, это очень сильный инструмент (никаким ризонингом такого результата как с агентами не достичь), поймешь что чего-то не хватает и надо вайбкодить - вайбкодь экстеншон для Маринары или вообще правь исходники (не тебе же править, а ллмке).
Аноним 12/09/26 Суб 10:00:34 1702315 282
>>1702310

Ты нахуя две 26В запустил когда есть -np 2?
Аноним 12/09/26 Суб 10:15:29 1702321 283
>>1702315
это не поможет, мне на разные порты надо
Аноним 12/09/26 Суб 10:25:29 1702325 284
>>1702298
Базовая модель, Не инстракт. Может фанфики за тобой продолжать
Аноним 12/09/26 Суб 10:27:26 1702326 285
>>1702310
>А вот огромные логи - не уверен
Мои логи, хоть и не огромные, при переезде из таверны перенеслись без проблем.
Только не пойму, нахуя ты тратишь время на убеждение кого-то в чем-то? Он же вечно будет находить отмазки - то чат может не перенестись, то интерфейс не понятный, то хуй мне не сосут.
Аноним 12/09/26 Суб 10:38:44 1702333 286
>>1702310
Дядь, ты занимаешься какой-то хернёй. Жора уже более менее стабильно умеет в параллельную обработку. И даже kvu не жопой программирован. Правда не без нюансов. Когда ты шлёшь свою кум-портянку жора вычисляет ее хешь и сопоставляет со слотом kv-кеша. Которые в холодную хранятся в оперативе и при некотором пердолинге даже на диске и подгружаеться в VRAM относительно полном совпадении (sps). Т.е. ты можешь просто настроить нормально 26 под максимальный контекст и tps и она будет решать все агентские вызовы. Две модели имели бы смысл если играть на квене на ангельском. А переводит на русский Геммой.
Аноним 12/09/26 Суб 11:20:42 1702359 287
>>1702333
Ок потестировал на трёх слотах, ты прав, оно выбирает слот по контексту.
Аноним 12/09/26 Суб 11:26:06 1702363 288
>>1702321
>это не поможет, мне на разные порты надо
Не знаю как в маринаре, но в таверне это решается тем что коннекшен профили разводятся по разным слотам жоры через id_slot: 0 и id_slot: 1 и т.д., на один профиль кидаешь основные запросы, на второй - агентские. И все крутится на одной модели.
Аноним 12/09/26 Суб 11:34:39 1702365 289
Делаю Telegram-бота на fine-tune Qwen3.5-9B по групповому чату. Стиль усваивается, но связность хромает: ответы невпопад, путаница участников, выдуманные факты.
- Thinking OFF: final приходит, но качество слабое.
- Thinking ON: субъективно лучше, однако в 14/18 тестов final пустой: готовые реплики с разделителем <MSG> остаются в reasoning_content и не отправляются в чат.
- В raw-выводе подтверждено завершение через <|im_end|> без </think>. Лимит токенов не исчерпан; инструкция обязательно дать final не помогла.
- <MSG> разделяет сообщения, но не отделяет ответ от рассуждений. Двухэтапный ON→OFF вернул final, без явного улучшения качества.
Куда копать: обучающий chat template, датасет или настройки инференса? Как сохранить качество ON и добиться корректного final?
Аноним 12/09/26 Суб 11:53:42 1702382 290
Аноним 12/09/26 Суб 12:06:44 1702394 291
>>1702363
Да уже решился вопрос с помощью -np. Можно не выгружать на цпу чтобы впихивать доп. модели, а просто использовать гемму на 3 слотах. Контекст сохраняется и по совпадению хэша выбирается нужный слот автоматически, его не надо нигде указывать. Вот и ответ на вопрос про пересчет контекста: >>1702245
Аноним 12/09/26 Суб 12:08:19 1702396 292
>>1702394
>гемму
гемму-26 имею в виду. вместо двух медленных гемма-26б и одной быстрой гемма-4б получаю три быстрых геммы-26б
Аноним 12/09/26 Суб 12:20:54 1702406 293
Подскажите мимикроку: есть ли модельки по типу https://huggingface.co/TheBloke/Mythalion-Kimiko-v2-GGUF , но только русскоговорящие? То есть технически и такие "говорят" по-русски, если на него перейти с ними, но оче всрато, - а есть именно заточенные на русский?

Я максимально васян, настроил Таверну по гайду с пикабу джва года назад для незатейливого смата раз в месяц. Моделька выше меня до сих пор полностью устраивала, благо англ. на достаточном уровне. Но тут вдруг подумал: а зачем всё-таки я мучаюсь, аутирую над грамматикой и подбором слов, если на русике теоретически можно кайфово писать на лету сразу что хочется? К тому же давно заметил, что пошлятина на родном языке вштыривает как будто сильнее.

Пробный поиск по HuggingFace ничего не прояснил, к тому же подозреваю, что сам найду в лучшем случае "общеразговорные" модели, а нужна-то именно "хорняшная". Заранее спасидос.
Аноним 12/09/26 Суб 12:24:40 1702413 294
>>1702365
MSG это типа спец токен? Они по-моему отдельно должны добавляться в токенайзер, чтобы все по феншую было.
На счет хуевых ответов - мб эпох побольше надо надо. Учитывая что у тебя датасет из чата, там вероятно мало семплов, нейронка просто не успевает логики ухватить.
Аноним 12/09/26 Суб 12:27:44 1702418 295
>>1702298
А я думал, они сейчас только безпотерьным квантованиев q4 занимаются, а тут вон оно как.
Аноним 12/09/26 Суб 12:34:13 1702422 296
>>1702413
reasoning_content:
Я люблю портвейн
<MSG>
Вино
<MSG>
Или всякую подобную хуйню

content (final): null
finish_reason: stop


вот так с <msg>. При обучении указывается что если надо неск сообщений то дели их <msg>

А сколько эпох попробовать? Я две пробовал 1 раз, не увидел сильных изменений.

В последнем датасете, использованном для обучения:
- Train: 24960 примеров, 9,05 млн токенов с контекстом; из них 1,51 млн — текст ответов assistant.
- Validation: 1170 примеров, 370 тыс. токенов.
- Медианная длина примера — 247 токенов, максимум — 1000.
- Последнее обучение — 1 эпоха.
Аноним 12/09/26 Суб 13:09:56 1702461 297
Аноним 12/09/26 Суб 13:18:08 1702468 298
Аноним 12/09/26 Суб 13:30:20 1702478 299
>>1702461
Мистраль в принципе говно кроме 123б, а ты ещё и про русик. Мистралешизам ответ один - показывайте логи или посасывайте молча свою залупу
Аноним 12/09/26 Суб 13:32:52 1702480 300
>>1702422
Я честно говоря пока не очень вкуриваю как ты ризонинг используешь.
В обучающем датасете тоже секция ризонинга присутствует?
Мб сначала просто дефолтный вариант без всякого ризонинга попробовать?

По эпохам обычно 2-3 советуют. Больше уже пережаривание будет.
Аноним 12/09/26 Суб 13:34:08 1702483 301
>>1702298
>0.6B
даже если инстракт будет - она даже не догадается на хуй прыгать как гемма

просто будет сидеть слюни пускать в коме
Аноним 12/09/26 Суб 13:36:23 1702484 302
>>1702478
Шизы те, кто не сумели адекватный аутпут на мистралях получить. Каким полоумным придурком надо быть, чтобы не суметь завести самую распространенную модельку - я не знаю.
Мистралебоярам никому и ничего доказывать не надо.
Аноним 12/09/26 Суб 13:36:56 1702485 303
>>1702298
Ух, пора расчехлять кум-машину, годнота подъехала. Сообразительная еще должна быть! Интересно это оно у них на серверах крутится для умных колонок, или что-то нормальнее.
>>1702310
> Всего у меня для Маринары 3 модельки запущены: 26б (основная, с ммпродж, это чтобы перс "видел" что на изображениях которые я добавляю в чат) для главного рп, 26б для "умных" агентов, 4б для простых агентов.
Ээээ?
Если все это в врам то ты мог бы крутить какой-нибудь int8 w8a8 квант той же 26 геммы в вллм, который и по качеству и по скорости при одновременных запросах был бы лучше. Или уже юзать комбинацию гемма+квен и миксовать их в основном ответе, а агентов уже на одной из них.
Аноним 12/09/26 Суб 13:39:00 1702486 304
Аноним 12/09/26 Суб 13:54:05 1702492 305
>>1702293
Ну расскажи ему про дистилляцию и пришли скриншот модель пикера
Вообще странно, дипсик о таком обычно не спорит, сам на днях просил его посмотреть новости, он напрямую предупредил о разнице между сегодняшней датой и датой его датасета. Также смотрит на свою полное собственное имя подставленное через {{тег}} и вiрит.
Гемма например часто начинает спорить "да сегодня 2024й, ты мне фейковую тулзу подсовываешь чтобы наебать и поржать"
Аноним 12/09/26 Суб 13:55:09 1702493 306
>>1702298
Это то что в колонке сидит? Тулколлы должно нормально делать? Колонка же всякие штуки включает-выключает
Аноним 12/09/26 Суб 13:56:52 1702495 307
>>1702485
>пора расчехлять кум-машину, годнота подъехала
Я почитал на хабре https://habr.com/ru/companies/yandex/articles/1080654/ это модель для работы с большими текстами и выдачей по этим тестам емких ответов. Ну и джемени из гугла сказал, что эта архитектура плохо подходит для бесед или генерации художки по малому промту.
Аноним 12/09/26 Суб 13:57:02 1702496 308
>>1702493
Хотя какая колонка с 35 гигами...
Теоритически 0.6 активных даже из обычного рама должны летать
Аноним 12/09/26 Суб 14:00:05 1702498 309
>>1702480
>В обучающем датасете тоже секция ризонинга присутствует?
В обучающем датасете reasoning нет — только контекст и обычные ответы участников чата.
Без reasoning уже пробовал: это основной режим, thinking OFF. Стиль передаёт, но часто отвечает невпопад. ON включил позже для сравнения: субъективно некоторые ответы лучше, но готовый текст часто остаётся в reasoning_content, а final пустой.


Мб попробую последний датасет дообучить еще 1 эпоху.
Аноним 12/09/26 Суб 14:08:13 1702503 310
>>1702495
> для работы с большими текстами и выдачей по этим тестам емких ответов
А 0.6 сможет только вялую имитацию такого сделать. Еще и архитектура старенькая без всяких модных и эффективных штучек.
Под задачи скоростного дополнения поиска наверно в самый раз, но юзеру сложно найти полезное применение.
Аноним 12/09/26 Суб 14:20:17 1702508 311
>>1702503
Эта модель, как я понял, что-то вроде масштабированной большой. Образец или что-то подобное под апач 2.0. Я сомневаюсь, что они выложат инструкт версию.
Аноним 12/09/26 Суб 14:20:22 1702509 312
>>1702498
>Стиль передаёт, но часто отвечает невпопад.
Ну это может быть и от датасета, и от размера лоры. Ризонинг все же для более сложных вещей нужен, когда ван-шотнуть задачу нереально.
Если это чат, где люди высираются на десятое сообщение назад, и датасет аналогичную структуру имеет, то я думаю неувидительно, что нейронка не улавливает логики.
По ранку лоры 16 вроде оптимально должно быть.
Аноним 12/09/26 Суб 14:24:55 1702514 313
>>1702509
>По ранку лоры 16
Я 64 все разы использовал.
Аноним 12/09/26 Суб 14:35:03 1702523 314
>>1702365
>fine-tune
Лучше возьми обычную версию и напиши "следуй стилю чата" или типа того. Если русик плохой попробуй E8/12b гемму.
Файнтюнинг как раз будет тебе отбивать логику
Аноним 12/09/26 Суб 14:43:03 1702530 315
>>1702523
Я пробовал сейчас тест - на одном и том же контексте базовую и файн-тюн. Файн-тюн намного лучше по стилю.
Аноним 12/09/26 Суб 14:57:40 1702540 316
>>1702514
Не факт что это хорошо. Небольшой датасет может просто не загрузить ее по-максимуму, она начнет запоминать семплы, а не закономерности искать.

>>1702530
А примеры стиля в сиспромпт пробовал добавлять?
Аноним 12/09/26 Суб 15:02:55 1702545 317
>>1702540
>А примеры стиля в сиспромпт пробовал добавлять?
Для базовой модели? Нет, не знаю даже можно ли его суммировать так коротко


>Небольшой датасет может просто не загрузить ее по-максимуму, она начнет запоминать семплы, а не закономерности искать.

Попробую тогда с ранком 16, а альфу 32 задать в таком случае?
Аноним 12/09/26 Суб 15:05:33 1702547 318
Сижу на 4 гемме. По промпту она может что угодно написать и вполне годно. Это её преимущество и её же проклятье, она начинает скакать вокруг промпта не пытаясь креативить. Идеально бы ей агента какого который бы придумывал промты для нее и она уже писала ибо расцензур мое почтение даже без всяких аблитераций
Аноним 12/09/26 Суб 15:14:25 1702552 319
>>1702305
>>lm studio умеет

Ещё у неё полностью закрытый код, она устанавливает непонятные соединения, передаёт зашифрованные данные, умеет сливать твои фантазии которыми ты делишься с LLM большим дядям.
Аноним 12/09/26 Суб 15:21:44 1702555 320
image.png 51Кб, 805x602
805x602
>>1702365
Это вообще распростаненная ошибка у маленьких квенов, но в принципе фиксится. Тебе надо семплы типа как на пикриле добавить в датасет
Аноним 12/09/26 Суб 15:29:34 1702559 321
image.png 93Кб, 264x381
264x381
Единственный плюс роста цен на 3090 это что появились долбоебы, которые ставят 4090 совсем чуть-чуть дороже

>>1702552
Какие нах соединения на локальном сервере, придурь крашеная
Аноним 12/09/26 Суб 15:38:43 1702565 322
>>1702559
И зачем ты красишься? Твой "локальный сервер" бюджетный пк подаренный мамкой можно подумать без доступа к интернету и на Двачах ты не с него сидишь.
Аноним 12/09/26 Суб 15:38:58 1702567 323
image 76Кб, 1419x639
1419x639
image 38Кб, 710x665
710x665
Челы, какую лучше купить? Gemma26b потянут?
Аноним 12/09/26 Суб 15:41:24 1702568 324
>>1702567
Для геммы хватит и 6000D даже
Аноним 12/09/26 Суб 15:46:22 1702570 325
>>1702552
>устанавливает непонятные соединения, передаёт зашифрованные данные, умеет сливать твои фантазии которыми ты делишься с LLM большим дядям.
Мнение шизо-опенсорсера не интересно, но отвечу профессионально. Будет интересно всем подобным еб. Вносишь программу лм студио в заградительный файрволл, если ты такой параноик, и пользуешь нормальным софтом, как белый человек.
Аноним 12/09/26 Суб 15:49:06 1702572 326
image.png 31Кб, 322x386
322x386
>>1702565
Походу ойти-элита не в курсе, как рантаймы обновляются в этом говне. Изолированная машина с лоли-фурри-говном, которое ты прячешь от гэбни, забирает их по локалке с основной пеки, на которой твоего нарушающего все законы мира контента нет, чатов нет, нихуя кроме щитпостинга на дваче нет - зато есть интернет и все корпо-зонды, включая качалку апдейтов, впны и еще невесть что, заглядывающее тебе в анус.
Че, думал там все зашифровано спецформаты-архивы? Хуй те за щеку. Вот они твои апдейты лмстудии. Перекинул куда следует, интернет ваш нахой нинужон.
Аноним 12/09/26 Суб 15:59:45 1702577 327
image.png 318Кб, 335x597
335x597
Мужчины, помогите разобраться с одним моментом SillyTavern.

Модель google_gemma-4-26B-A4B-it-Q8_0

Max Response Length : 1500 из них часть идет на размышления часть на ответ
Контекст: 60000 цифра получена опытным путем, при таком контексте она еще сохраняет нормальную память и меньше глючит
Ограничил в настройках Llama.cpp кол-во токенов на Thinking: 600


В целом вроде устраивает, но все же, часто приходится удалять часть сообщений и продолжать генерацию, потому что люби останавливаться на полусл...
Можно ли как-то заставить модель учитывать при генерации данные ограничения? в систем промпт писал, мол так и так при генерации учитывай что у тебя токенов на то стока на то стока остается (с запасом лимиты прописывал в 100тк) , она хуй положила. Чаще всего, в начале общения она спокойно влазит по токенам на ответ и он выглядит целостным и законченным, но спустя некоторое общение, начинает генерить тонну описаний нарративных. Я конечно подозреваю что у меня промт на генерацию говно а он естественно говно, там по сути стандарт + что-то дописывал с помощью нейронок, чтобы он про сисик и писик писал, а не про пестик и тычинку. Но нормальных гайдов про это я все равно нигде не нашел пока, только старое говно без нормальных примеров

Можно ли с этим что-то сделать? Какие параметры на максимальный ответ вы юзаете? На контекст?

если что, по железу 5070ti + 64 ram
Аноним 12/09/26 Суб 16:05:10 1702581 328
>>1702305
>Умеет ли ваша llama.cpp выгружать модели?
Умеет. А вот lm studio - нет. Т.к. как раз пользуется тем, что умеет llama.cpp, которая там под капотом. У тебя на картинке как раз запрос к llama.cpp на выгрузку модели и показан, он именно так самой лламе и делается.

https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md#post-modelsunload-unload-a-model

Более того. Это даже кобольд умеет, через тот же API. Абыдно, да? :)
Аноним 12/09/26 Суб 16:09:28 1702586 329
>>1702570
Никуда ты его не внёс, дальше своих фантазий. Адекваты серьёзно относящиеся к сетевой приватности, просто не будут сидеть на винде и/или юзать подобный lm studio говнософт под бубунтой.
Аноним 12/09/26 Суб 16:09:37 1702587 330
image.png 128Кб, 1725x1193
1725x1193
>>1702577
>Можно ли с этим что-то сделать?
Простой вариант: Ризонинг можно отключить полностью. Эти оборванные 600 токенов нихера дельного тебе не дают.
Сложный вариант: поправь жижу. Пикрил на примере 31B геммы - не знаю будет ли 26B думать короткими блоками по 3 - 4 секунды мыслей на 30 т/с вместо 20-30 секунд, но 31B таки слушается (оригинальная, а вот тюны могут обосраться). Другое дело, приводит ли такой in-character reasoning к реальному улучшению конечного аутпута - вопрос открытый. Может и не приводит. Но она думает как персонаж, решения принимает.

>она хуй положила.
Модель и не может знать, она свои токены не считает

>>1702581
Кончайте позориться, в серверной панели студии можно как угодно моделями вертеть, загружать-выгружать по API (responses, chat completions, любое говно), управлять параллельными запросами и еще невесть чем. Ваш срач напоминает долбоебов - один не знает про одно, другой вообще не вкуривает что серит вхолостую буквально как собака на воздух.
Аноним 12/09/26 Суб 16:14:06 1702592 331
500x500.jpg 27Кб, 500x500
500x500
>>1702586
ебать некомпетентность местного контингента поистине шокирует
даже правила фаервола в шиндошсе кажутся чем-то из области кулхацкерства
тупо запрещаешь коммуникацию с сетью на конкретную приложуху и ей даже апдейты качнуть становится невозможно

2026 год нахуй техническая грамотность продвинутой рашки вперде планеты всей
зато наверное чел получает 500к и статьи на хабре пишет, как ему Калиса ИИ сделала виртуальный замочек на яйца
Аноним 12/09/26 Суб 16:29:29 1702606 332
>>1702592
Тебе же написаши, что если сидишь на шиндовс и делаешь на компутере что-либо нехорошее, ты по дефолту лузер. Шинда постоянно отправляет телеметрию, дампы всего содержимого RAM при ошибках, да вообще всё что угодно. Теоретически это всё можно заблокировать, но с каждым обновлением винда меняет настройки, снова включает отключенные тобой шпионские функции(например отправку дампа RAM при ошибке), добавляет новые уязвимости, сервера телеметрии которых нет в твоём Hosts, добавляет новые шпионские модули.

Адекват не станет бороться с ветряными мельницами или играть роль Сизифа, он будет пользоваться Линупсом, желательно как минимум Дебианом.
Аноним 12/09/26 Суб 16:30:02 1702607 333
image 993Кб, 1108x824
1108x824
>>1702305
>LMStudio
Жесть, эта проприетарная помойка с зондами еще жива и ей зачем-то пользуются... Многое говорит о нашем обществе.
Аноним 12/09/26 Суб 16:34:57 1702613 334
>>1702587
>Кончайте позориться, в серверной панели студии можно как угодно моделями вертеть, загружать-выгружать по API
Чел, я конечно тоже формулировку криво написал, но позоришься тут в первую очередь ты (а я вообще мимокрок с одним сообщением по теме).
Мне просто смешно стало, что спрашивают о "а может ли llama..." в противопоставлении ее студии. Тогда как эта студия - GUI обертка, которая сама по себе ничего не делает, и которой эта же самая llama для работы и нужна (она ее загружает, и даже версию дает выбрать). Потому и смешно, т.к. получается: "а можно на вашем мониторе в крузис играть?" :)
Мне пофиг кто там чем пользуется. Сам момент забавный получился.
Аноним 12/09/26 Суб 16:37:02 1702614 335
>>1702607
У нее есть как минимум один плюс. Не ollama.
Аноним 12/09/26 Суб 16:40:43 1702618 336
>>1702606
>дампы всего содержимого RAM при ошибках
Ага, все мои 96 гиг летят по КД на бесконечные сервера микрослопа.
Аноним 12/09/26 Суб 16:48:50 1702627 337
>>1702618
Никому полный дамп твоей памяти не нужен, для работы над улучшениями шинды достаточна отправка совсем небольших её регионов, например с твоими ключами от VeraCrypt
Аноним 12/09/26 Суб 17:11:12 1702644 338
>>1702627
Дампы делаются в определённые моменты, они сохраняются на диски и их можно посмотреть самому. Случаев, когда шинда гоняется за какой-то программой, чтобы её сдампать и отправить данные микрослопу, науке неизвестны. Ну а если тобой заинтересовался товарищ майор Большой Брат, то и твоя взломанная через зеро дей бэкдоры люнупса начнёт слать всё до чего дотянётся прямо на сервера АНБ.
За сим предлагаю закончить бессмысленный оффтоп.
Аноним 12/09/26 Суб 17:16:33 1702650 339
>>1702644
НЕ СМЕТЬ ПЛОХА ГАВАРИТЬ ПРА СВЯТОЙ ЛИНУПС!!!!!!
Аноним 12/09/26 Суб 17:23:38 1702654 340
image.png 176Кб, 1440x896
1440x896
image.png 154Кб, 875x837
875x837
https://huggingface.co/bartowski/Qwen3.8-27B-GGUF
https://huggingface.co/blog/bartowski/per-tensor-layout-maps-for-gguf-quantization
Гигачад Батруха там теперь применяет новые финтифлюшки в своих квантах и более прозрачен, будет прилагать графики и kld, top-p совпадения к квантам. Ай умница
Можно на Квене 27 уже посмотреть как выглядит репа
Анслот в долгую проиграет со своими шейди практиками типа подсовывания IQ слоёв в Q_K кванты и калькуляции KLD по imatrix датасетам. Сейчас даже каждый васян более прозрачные кванты делает и делится рецептами и решениями за ним стоящими, чем ебаные Анслоты
Аноним 12/09/26 Суб 17:25:08 1702655 341
>>1702613
>Мне просто смешно стало
Потому что ты туп.
>она ее загружает
И она же ее выгружает. Обертка рулит всем. Ты понимаешь вообще уровень абстракции, надстройки?
Аноним 12/09/26 Суб 17:27:25 1702656 342
>>1702613
>GUI обертка, которая сама по себе ничего не делает
Скажи так же про агенты в этой теме, да?
Аноним 12/09/26 Суб 17:38:40 1702663 343
image 41Кб, 1002x528
1002x528
Кстати, про LM Studio. Почему они её глубоко запрятали и теперь на витрине Bionic? Я его попробовал очень не понравилось. Настройки спрятали, как в ранней студии. В чате, блок резонинга, во высоте, как танковая смотровая щель и не увеличить - весь резонинг надо скролить через эту щель.
Зачем вообще эта Бионик? Почему?
Аноним 12/09/26 Суб 17:40:46 1702665 344
image.png 112Кб, 500x500
500x500
>>1702592
У тебя пикча не та прилипла, держи фикс.
Аноним 12/09/26 Суб 17:41:08 1702666 345
image 52Кб, 547x793
547x793
Стабильно раз в месяц приходит лмстудиошиз с очередным охуительным тейком, получает хуёв за щеку от всего треда и обиженно удаляется. Феноменальное упрямство.
Аноним 12/09/26 Суб 17:43:09 1702668 346
>>1702663
Вроде как локальный агентовый харнесс продвигают его. Хз зачем он нужен.
Аноним 12/09/26 Суб 17:50:35 1702672 347
>>1701797
Не, ну это как раз мне и лезет, даже гемма 4 норм катается, я просто не совсем ясно выразился.

Я тут думал просто про моешки, но 120б квен только в 3 экстра смолл кванте идёт и супер туго. Просто может есть нормальные реап-версии, которые я не заметил, или модели, которые почему-то пропустил. Именно МоЕ, чтобы оперативку хоть как-то разумно задействовать.
Аноним 12/09/26 Суб 17:51:15 1702673 348
Аноним 12/09/26 Суб 18:04:19 1702678 349
>>1702663
Они решили отказаться от лм студии, потому что быдлу слишком сложно и нужно что-то попроще. Плюс они хотят какую-то калово-агентсткую обёртку, вот это всё. Теперь вот у них новый продукт дерьма — ещё хуже, чем прежде.

Когда им предъявляли за то, то они убили удобный и простой инструмент, т. к. нельзя нормально настраивать ничего в стиле n cpu moe или тензорсплита, они послали на хуй народ, мол если умные такие, пердольтесь со своей лламой.спп, а у нас тут продукт для другой аудитории.

Короче, поддержка студии закончится очень скоро, вот и всё.

Это, знаешь, как безальтернативность некоторых весьма неплохих фронтов для генерации изображений. Вот был каломатик1111 и его форки с понятными терминами типа denoise. Они там начали делать ебанутый комбайн, всё переименовывать, пихать ебанутые пайплайны, денойз теперь у них КРЕАТИВНОСТЬ. И из-за такой мешанины буквально в каждом шаге разобраться невозможно без загрузки всей документации в LLM и перевода их новояза в нормальный вид. Либо юзай макароны ебаные, которые нужны пердоликам/коммерсам для максимальной автоматизации, либо сиди на местном говне в стиле лм студио. Середины не дано. Там нет кобольда в виде хорошего бэка.
Аноним 12/09/26 Суб 18:32:36 1702690 350
image.png 689Кб, 960x537
960x537
>>1702678
>>1702663
Что же это творится то! Даже не представляю как жить без моей лмстудии!
Аноним 12/09/26 Суб 18:59:03 1702716 351
>>1702678
> Они там начали делать ебанутый комбайн, всё переименовывать, пихать ебанутые пайплайны, денойз теперь у них КРЕАТИВНОСТЬ. И из-за такой мешанины буквально в каждом шаге разобраться невозможно
Чивоблять? Что за трешанина вообще, как оно выглядит?
> Середины не дано.
Форки вебуи разве куда-то пропали? А так сейчас есть всякие гуйни-обертки над комфи, где выведены ползунки. Да хоть по запросу ллмка навайбкодит такой с учетом твоих хотелок.
Аноним 12/09/26 Суб 19:06:15 1702719 352
Кста, а ollama вообще еще жива? А то для них этот год был непростой. С конца июня о ней вообще не слышал. Видимо тот факт, что ХФ купил жопу, а не их, нанес удар.
Аноним 12/09/26 Суб 19:09:41 1702720 353
>>1702547
Так ты можешь это делать без всяких аддонов в таверне через квикреплаи. Делаешь скрипт, по которому той же гемме кормится чат с карточкой, и промптом с тегами без ризонинга просишь что-нибудь вроде "накидай мне пять различных креативных вариантов с развитием истории дальше, каждый из которых использовал бы какую-нибудь из особенностей персонажей. Закончи свой ответ сразу после перечисления вариантов". Ну и можно попросить накинуть, чтобы были промпты на стиль или чего ты там хочешь к каждому варианту. Потом это сохраняешь в переменную и в рамках того же квик реплая генеришь ответ с инжектом переменной в промпт и просьбой выбрать вариант оттуда. Можно даже использовать рэндом, чтобы выбрать одно число, если варианты пронумерованы.

Только всё равно такое себе получится, особенно с туповатой 26б. По инструкциям она точно ничего полезного в промпт не напишет, что потом бы выполняла так, как предполагает. Промптить гемму на стиль вообще тухлый номер.
Аноним 12/09/26 Суб 19:42:36 1702731 354
image 40Кб, 1732x224
1732x224
>>1702654
Цэ реально кiнец. Оварида. Последний бастион адекватности и здравого смысла пал. Зло победило. Бартовски медленно превращается в анслот.
Аноним 12/09/26 Суб 21:10:26 1702779 355
>>1702678
>отказ от лм студии, т.к. слишком сложно и нужно что-то попроще
Чиво блять? Попроще лм студии?
Аноним 12/09/26 Суб 21:16:01 1702783 356
>>1702547
>4 гемме
Кусок говна, забывает половину контекста, бесконечные лупы в опенкоде, любой квен или его форки лучше, тот же ornith.
Аноним 12/09/26 Суб 21:33:11 1702789 357
>>1702716
Форки работают, но оно прям заплесневелое говно и поддержку фич можно ждать очень долго. Если хочется адекватной работы, только комфи или какой-нибудь сварм уи, чья логика сделана максимально через жопу, зато под капотом тот самый комфи. Типа, бэк крутится, картинки мутятся, но организовано всё такими способами, что без бутылки не разберёшься.

Про вайбкод лучше не говори. Если с нуля, это буквально месяц пердолинга, если ты сам не кодер. Быстрее к макаронам привыкнуть, чем это.
>>1702779
Ты разве не видел среднего юзера? 99,9% — это те, кто от слов "контекстное окно" в обморок упадут. ЛЮБАЯ лишняя кнопка выводит среднего юзера из себя. Для него сила ризонинга — это буквально как модель заставить задуматься, а не сколько токенов ей даст фронт. Конечно, есть модели, которые действительно слушаются, потому что их обучали, как думать, но их всё ещё не так много вроде бы.

Ну и раскидывать как-то там слои для юзера вообще что-то из разряда фантастики.

Должна быть только кнопка пуска и индикатор влезет модель/не влезет, чтобы было понятно, что скачать. Максимум.

Кстати, это даже можно было бы сделать при желании нормально, но им глубоко похуй.
Аноним 12/09/26 Суб 21:45:06 1702796 358
>>1702789
>Форки работают, но оно прям заплесневелое говно и поддержку фич можно ждать очень долго.
В Forge Classic Neo поддержка всей хуйни практически моментально появляется, остальные развития ватоматика ненужны.
Аноним 12/09/26 Суб 22:02:40 1702808 359
>>1702461
>>1702484
Говноед, ты угомонишься когда-нибудь? Да, там относительно неплохой русик - так можно сказать, если не знать, на что способна гемма4. По сравнению с геммой4, у мисраля русик как у иностранца, который неплохо выучил русский, достаточно для того чтобы впечатлить местных, но совсем уж недостаточно для того, чтобы сойти за своего.

Промпт "Расскажи сказку про красную шапочку. Три абзаца".
Примеры высеров сайги-немо (мисраль) (6-й квант между прочим):
"красавицечка по имени Красная Шапочка"
"волк, изображая голос и голосование бабушки, спрашивал девочку о различных деталях: как маме? как лес?"

Но есть ведь ещё и фактор логики. Соображалка у мисраля просто отвратительная, это даже не слоп, это просто слабоумие:

"мама решила отправить бабушку с лесной ягодной корзинкой, нарядила её в красный плащ и шапочку, чобы в лесу было теплее и ярче"
"волк был пойман, и в благодарность за спасение его поместили в клетку и принесли к бабушке, которую, к счастью, вовремя освободили"
"все живут долго и счастливо"...

Гемма4 по тому же запросу не сделала ни одной ошибки, ни в русском, ни в логике.

Тащи логи, воздухан, покажи как ты "завёл" свой мисраль.
Аноним 12/09/26 Суб 22:04:54 1702811 360
>>1702719
А кому должно быть не похуй на эту парашу? Пусть эти барыги идут нахуй.
Аноним 12/09/26 Суб 22:13:36 1702816 361
>>1702567
смищно. миллионер дохуя? для геммы-26 пойдёт любое говнецо с 8гб врама
Аноним 12/09/26 Суб 22:37:15 1702828 362
image.png 49Кб, 995x403
995x403
image.png 76Кб, 1023x683
1023x683
>>1702157
Провозился короче день, чтобы распердолить ноутбук под анслота с квеном 3.5.
Ебучие темплейты, весь мозг выели. То токенизируй, то не токенизируй. То строкой подавай, то в словари оформляй. Ключи еще мне нужные дай. Уууъу, съука.

Но вроде завелось.
Померил перформанс на анслоте - нихуя не поменялось. Я не увидел заявленного прироста в 2-5 раз. Как было 25 мин на 100 семплов, так и осталось. Хотя я уже не уверен, что параметры запуска все правильно перенес.

Исходя из этих расчетов, прикинул что где-то 800 семплов за 4 часа успеется прогнать за фришный доступ на колабе. Еще часок остается на всякие сопроводительные штуки.
Один семпл - карточка персонажа, плюс 7 сообщений чата. Полагаю где-то 1-2к токенов на семпл.
Очень нищий вариант, но посмотрим что выйдет. Нужен хоть какой-то знак, что оно работает. Потом про масштабирование думать.

Но вообще, претрейновая модель квена на удивление уж сильно вкачана на чат. Сравнивал с геммой 3 - она пускает слюни и бесконечно пишет какую-то арабскую вязь (на инглише иногда может что-то внятное ответить).
Квена базового запустил - "привет, я ассистент, епта". Но имени своего не называет. Причем даже ризонинг уже имеется и русик без нареканий. Что за претрейн-то такой?
Аноним 12/09/26 Суб 22:47:54 1702835 363
>>1702828
блядь нахуя ты этого кобольда уёбищного драконишь
тестируй на голой лламе.кпп
аргументы запуска тебе любая ллмка распишет но там вообще их минимум

и нахуя ты вспомнил обоссанную слабоумную гемму3 если есть ОХУИТЕЛЬНАЯ гемма4 которая на голову выше твоего квена в плане русика? это что за манипуляиции у тебя такие?
Аноним 12/09/26 Суб 22:52:57 1702839 364
>>1702835
Хоспаде, чел, что ты за бот?
Выпизднулся, а по делу нихуя не сказал.
На чем хочу, на том и тестирую, тебя ебать не должно.
Ты даже не удосужился ветку прочитать, и что-то там еще пердишь невпопад.
Аноним 12/09/26 Суб 23:14:20 1702848 365
>>1702828
> Сравнивал с геммой 3
А чего не с четвертой?
Аноним 12/09/26 Суб 23:26:07 1702851 366
>>1702848
Потому что от 3 у меня уже был рабочий ноутбук с анслотом и с рабочей квантизацией, есть на что опираться.
А гемма 4, сопоставимая с квеном 4б, это будет е4б, которая по факту 8б параметров. И я боюсь там по памяти уже туго будет.

Квен 4б щас 8.3гб видеопамяти жрет из 15гб доступных. Правда он в q8 загружен для обычной lora, ибо q4 не советуют из-за более хуевого качества. Гемму 4 мб можно было бы и в q4 загрузить для qlora.
Аноним 12/09/26 Суб 23:45:04 1702857 367
>>1702828
>Один семпл - карточка персонажа, плюс 7 сообщений чата. Полагаю где-то 1-2к токенов на семпл.
Как-то очень мало для карточки и 7 сообщений 1-2к токенов
У меня один промпт + ответ не всегда влазит в 4к

Базовую модель я не тестировал, кстати надо затестить и сравнить с тюнами, но замечал, что тюн умеет то, чему я его не учил. Можно взять mmproj от базовой и будет работать вижен.

>>1702848
Четвертая МоЕ, это больше гемора, чем с dense для тюна
Аноним 12/09/26 Суб 23:56:58 1702861 368
>>1702839
>Ты даже не удосужился ветку прочитать,
Я эту ветку написал чуть более чем наполовину, рот оффни, ты чего так триггернулся-то? Извини, но если ты заходишь в приличное место и начинаешь там жрать говно, на тебя покажут пальцем и скажут "перестань жрать говно, дебил", так уж принято.
Аноним 13/09/26 Вск 00:19:34 1702867 369
Почему код так одебиливает модели в рп? Почему мы не можем сосуществовать дружно?
Аноним 13/09/26 Вск 00:39:46 1702874 370
>>1702867
Для кода важно не галлюцинировать. А для художки наоборот чутка галюнов не помешает. Поэтому кодоунитазы жестко ужаривают, чтобы не писать чепуху.
При этом возможно что значительную часть датасета в виде всяких эро фанфиков, распарсеных двачерских срачей выкидывают нахуй, чтобы было меньше слопа. Отсюда и душа пропадает.
Аноним 13/09/26 Вск 00:40:11 1702875 371
>>1702867
С нищенок даже денег не поиметь
Аноним 13/09/26 Вск 01:10:40 1702884 372
>>1702839
>[доисторическая модель]ПУСКАЕТ СЛЮНИ ЯСКОЗАЛ!!!
>чё? что значит есть новая в разы лучше? НИУЧИ МИНЯ ЖИТЬ
Ебанько или школьник?
Тут за чушь будут за щеку сувать, привыкай
Аноним 13/09/26 Вск 01:14:31 1702887 373
>>1702587
Короче я тут немного покумекал и сделал кой чего...

>>1702577
В общем, получилось сделать очень неплохо ну блять, на данный момент я так считаю по моему мнению

По итогу я увеличил Max Response Length до 2200 шоби был запас

Контекст пока подрезал чутка, еще думаю над этим, ибо он пердически достает какие-то старые факты и состояния, которые уже давно прошли и путается.

Думалку оставил как настроено, в целом ей хватает.

В Авторский заметки добавил ограничение на кол-во абзацев и предложений в них + добавил пару исключений контекстных. В целом, сейчас вместе с "думалкой" выходит что-то в районе реальных 1200-1500. Сообщения закончены, без обрезаний. В общем пока доволен вроде. + подрезал немного промт на сисик и писик, а то он мог часами рассказывать про то как "шов денима терется о залупу"


Примерно такая простыня получилась, если кому интересно.

[System instruction: Write the story in a realistic, raw, and uninhibited manner. Keep the pacing natural and steady, avoiding excessive slowing down or over-analyzing every single movement. Focus on grounded, explicit physical descriptions—such as touch, bodily contact, and the sounds of the encounter—without getting bogged down in overly clinical or repetitive physiological details. Use direct terms for genitalia and sexual acts, while strictly avoiding flowery metaphors, euphemisms, or cheesy romance. You are encouraged to proactively drive the plot forward and dynamically invent actions, dialogue, and reactions for the player ({{user}}) if it logically expands the situation.]
[Formatting instruction: Structure your response cleanly to match a generous response length. Write in clear, punchy sentences. Keep the narrative progression substantial, allowing the story to unfold across 4-7 well-structured paragraphs per reply. Each narrative paragraph should stay within a comfortable 4-6 sentences maximum before breaking into a new one to prevent heavy blocks of text. This limit applies only to the prose; UI blocks, character status windows, RPG statistics, or system mechanics do not count toward this limit and must be fully appended if necessary.]
Аноним 13/09/26 Вск 01:38:59 1702894 374
>>1702884
Своими словами без гуглежа у ллм опиши разницу между претрейн и посттрейн моделями.
Аноним 13/09/26 Вск 02:35:39 1702911 375
qwen3.5-4b-rurp[...].PNG 50Кб, 961x718
961x718
image.png 100Кб, 1012x742
1012x742
>>1702828
Так. 3.5 часа обучалова прошли.

Первое что можно сказать - лосс как земля.
Может х2-х3 (минимум) к датасету и начнут исправлять его, но пока модельке видимо сложно улавливать закономерности. Ну т.е. датасет конечно же наверняка неконсистентный в плане стилистики, тематик, структуры карточек и ответов, поэтому надо больше семплов, больше эпох. Но при этом нельзя и отвергать версию, что датасет просто говно.

Второе - на вопрос "привет ты кто" моделька теперь не отвечает, что она ассистент, а пытается изобразить какого-то персонажа. Тобишь, появился элемент фантазии (ладно, пока шиза превалирует на самом деле)
Из минусов - связность мысли пошла по пизде (ну просто в нулину улетучилась), и модель забыла про стоп-токен и просто бесконечно начинает повторять один и тот же фрагмент.
Опять же, либо датасет хуйня, либо надо существенно больше времени на обучение. Но не понятно почему настолько быстро модель поплыла (мб параметр альфы у лоры настолько агрессивно действует, может пре-трейн как раз не очень сильно ужарен, а может и в разметке косячок, или в логике самих диалогов).

Надо провести более тщательные тесты. Подобрать семплинг. Сравнить аутпут бейз модели и аутпут тюна на карточке из датасета, дабы уравнять силы. Тогда может что-то прояснится.

А пока, пошло оно все в пизду...
Аноним 13/09/26 Вск 02:43:37 1702913 376
Первые впечатления по дипсикфлешу 4.1, тестил в нескольких готовых жирных чатах с рп и на кумботах:
Он странный. Тут буквально прыжки от любви до ненависти. Довольно часто точно угадывает настроение и отыгрывает чара, что большой плюс, может писать так, что действительно удивляешься как "флеш" с такими активными так может и жаждешь продолжения. Иногда лезут вкрапления слопчанского типа "Thank you", которое руинит и тутже хочется обрезать. А иногда откровенно ленится, чуть ли не "сам рпш мне лень развивать". Вариантивность хорошая. Бои/перестрелки внезапно хорошо отыгрывает, причем с учетом расстановки, вооружений, ранения и гурятинку в подробностях.
Есть серьезный минус - кум в рп. Он прямо не хочет, намекает, пасует тебе опасаясь инициировать. Не отказывает и продолжит если ты прямо явно начнешь действовать, но плавное развитие - хер там плавал, мерзотнейший стык получается.
При этом на кумботах прыгает на хуй как положено, или на прогретых чатах описывает даже милых и веселых. Сочность на троечку, но в целом неплохо, плюс выглядит свежо. По понимаю и ориентации в пространстве средне, нет косяков с одеждой, общими позициями, осознает и учитывает взаимодействия и частями тела и костюмами. Но при этом отсутствует изворотливость и находчивость, где зажатый и хитро ориентированный чар правильно вывернется и использует все свои конечности, а от подробности и уместности этого описания шишка в космос улетит.

В общем, для sfw рп может зайти, внимательный и сообразительный. Но спорных моментов вагон, не выглядит как модель, ради которой нужно все бросать и пытаться ее запустить.
Аноним 13/09/26 Вск 03:12:16 1702919 377
>>1702913
Вся серия DSV4 такая, начиная с первых превью флешки/прошки и заканчивая 4.1. Никаких откровений для рп, увы.
Аноним 13/09/26 Вск 03:14:56 1702920 378
>>1701203
XDDDDD
Обменял с небольшой доплатой 7800xt на 3090, а тут и генератор кадров подвезли и длсс 5, и еще стоит она теперь XDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDD 100000 XDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDD А У МЕНЯ К СОЖАЛЕНИЮ НИКТО НЕ СПРАШИВАЛ СПРАШИВАЛИ ЕБЛАН ЛИ Я НОВУЮ КАРТУ НА СТАРУЮ МЕНЯТЬ XDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDD
Аноним 13/09/26 Вск 03:17:19 1702921 379
image.png 330Кб, 1214x501
1214x501
Пузырь начинает сдуваться потихоньку?
На деле не "should slow down", а "мы на плато, дальше только увеличивать параметры, плюс всё апи высасывают каждый день"
Аноним 13/09/26 Вск 03:22:37 1702924 380
>>1702921
Бля да они прост сговорились между собой хайпануть пожессче. Все эти вбросы про уволившихся сотрудников которые шокированы тем что "у мадели сазнание нам пизда ааа" уже были не раз. Всё это делается намеренно чисто ради инфоповода. Это ж бабки бабки сука бабки инвестиции. Один пук в твиттере может увеличить стоимость их пузыря на хуиллиард.
Аноним 13/09/26 Вск 03:27:09 1702925 381
>>1702911
Бля ну а что мешает просто создать карточку чара и накидать примера диалогов туда. Ну чуть больше контекст будет подумаешь. Ты какой-то хуйней занимаешься чесслово. Дрючишь модельки которые откровенно слабы в РП особено в ру-РП. Не будет с этого толку. Запиливай карточки и агента-критика, который будет пробегаться по ответу, по карточке и пресекать любые ООС и будет тебе топовый РП. Тюном такую задачу не решить.
Аноним 13/09/26 Вск 03:35:02 1702927 382
>>1702921
Антропик + ОпенАИ поняли, что будет неокупаемость и надо спасать IPO, поэтому такой сговор, Илон туда же. Большая часть их расходов уходит на тренинг новых моделей, чтобы оставаться на плаву перед конкурентами, на остальное в сравнении мало. Поэтому они теперь придумали устроить slowdown, чтобы тратить на тренинг новых моделей по-минимуму, кассируя бабки с подписок и контрактов и таким образом сделать себя прибыльными, в том числе для IPO. Заодно новым конкурентам на рынок бы пробраться сложно было. Но чтобы был слоудаун и разрешили вообще такой сговор и регуляцию всей области с нифига, надо сначала настроить публику выдуманными страшилками, чтобы сенаторы подключились, потом запилили ведомства, который этот слоудаун устроят. Что и происходит, вбросы с увольняющимися сотрудниками, сбежавшими моделями, сотня тысяч постов в поддержку через мексику и малайзии, спонсоринг организаций вроде PauseAI и StopAI с демонстрациями, куча проплаченных блогеров в ютубе и прочая бешеная деятельность. Все уже и работает, 3 сенатора уже орут про регуляции, обсуждения в конгрессе, непрерывный пиздеж про это по CNN, митинги, выпуск новых моделей на публику хотят запретить, даже Трампу пришлось высказаться про регуляцию ИИ. Форс же разгоняют фирмы Амодея и Альтмана, их уже даже на этом ловили.
Аноним 13/09/26 Вск 03:39:14 1702928 383
>>1702927
>Поэтому они теперь придумали устроить slowdown
А Маск об этой хуйне с самого начала говорил. Умен не по годам, раньше всех знал, что ллм это тупиковая ветвь.
Аноним 13/09/26 Вск 03:42:22 1702930 384
1393909631060.jpg 106Кб, 800x800
800x800
>>1702919
Дурачок, ты как с умным человеком, различающим претрейн и посттрейн модели, вообще разговариваешь? Держи свои бесполезные мысли при себе.
Аноним 13/09/26 Вск 03:44:03 1702931 385
>>1702919
Хз, 0731 иначе себя ведет и там такой стены sfw/nswf нету. 0813 бы еще потрогать
>>1702921
Про это плато уже сколько лет говорят. Колоссальному прогрессу моделек это не мешает.
>>1702930
Чивобля
Аноним 13/09/26 Вск 03:49:50 1702933 386
>>1702924
У жрущих АИ хайпогавну из твиттеров память как у рыбок, никто и не помнит что ещё чатгпт2 давным-давно уже всё захватил всё взломал и все рабочие места заменил (помнеш?). Тогда "опен"аи ещё сказал что именно поэтому мы больше не опен, модели становятся слишком АПАСНЫМИ.
Аноним 13/09/26 Вск 04:05:18 1702934 387
>>1702911
>лосс как земля
Ставь хотя бы две эпохи

>датасет просто говно
99.9% датасетов говно. Даже пара плохих примеров в целом норм датасете могут все заруинить.
Пиши датасет сам, либо очень скурпулезно чисти вилкой готовые. Думаю еще влияет, что несколько сообщений пользователь-ассистент в одном семпле. Пиши один промпт - один ответ на семпл.
LORA_R = 16
LORA_ALPHA = 32

>пошло оно все в пизду...
Периодически ловлю себя на таких мыслях, подводных камней реально много
Аноним 13/09/26 Вск 04:32:37 1702938 388
>>1702930
Как будто знание этого различия тебе как-то поможет не обосраться в своих потугах лол.
Аноним 13/09/26 Вск 04:35:12 1702939 389
image.png 88Кб, 1104x737
1104x737
>>1702911
Только что закончил обучение своего тюна. Обсудил с ним твою проблему. Повторений и зацикливаний нет, нить диалога держит - это хорошо. Но вместо тюн пишет тун)
Аноним 13/09/26 Вск 04:42:03 1702941 390
>>1702925
Да, сколько бы thinking-а модель не навернула, потом агент (та же модель) проверяет ответ, сверяет с описанием персонажа, проверяет контекст и сразу видит косяк. Thinking вообще надо отключать и даже не терять время.
Если нет Маринары и агентов, даже в сыром ллама-кпп-веб-ю-ай банально можно писать каждый раз "А теперь посмотри на свой последний ответ и исправь логические ошибки и выход персонажа (описание персонажа) из роли, верни только исправленный ответ". После чего удаляй два предпоследних сообщения. Если навайбкодить, чтобы это происходило незаметно, в фоне, то будет вообще заебись. И такое вайбкодили уже все кому не лень, кстати, просто по-разному называется.
Аноним 13/09/26 Вск 08:59:27 1702989 391
>>1702170
Он запускается даже в Q8 с MMAP на 256 + 48 памяти и 100к контекста с 4096/2048 батчем.
Процессинг, я думал, будет идти джва часа - но нет. Отошёл в умыться и чайку заварить, возвращаюсь, а он уже первый батч (18%) обработал при промпте в 23к.
Полагаю, скорость генерации не будет отличаться от низких квантов, поскольку в VRAM всё без изменений и KV кэш полностью влез.
Аноним 13/09/26 Вск 09:16:03 1702995 392
image.png 1Кб, 129x55
129x55
>>1702989
Хм, хотя может джва часа и будет.
Чет дальле медленней идет.
Ну главное запустилось. Не ожидал. Она еще на старом HP EX950, который PCIE 3.0. Скорость хрюкнулась вниз, надо было на гнусмасе место освободить, но уже похер, дожмем.
Аноним 13/09/26 Вск 09:16:24 1702996 393
Аноним 13/09/26 Вск 09:54:10 1703011 394
Жинжа, жинжа. А как?
Аноним 13/09/26 Вск 09:55:41 1703012 395
Аноним 13/09/26 Вск 10:12:29 1703019 396
image.png 134Кб, 360x301
360x301
Screenshot 2026[...].png 1Кб, 220x39
220x39
я дождусь
Аноним 13/09/26 Вск 10:13:30 1703021 397
НУ что же, принимайте в клуб любителей пощекотать очко

Запустил первый раз в жизни gemma-4-26В-A4B на своем ноуте с 16гб оперативки и 4050
Тормозит конечно пиздец, ответы по 3-5 минут генерит, хотя настраивал по гайду и советам гугла, он говорит что скорость генерации у меня даже больше среднего, типа оптимизировал норм.
Мож я конечно ничего слаще редьки не ел, но я приятно удивлен объёмом и детальностью ответов.

Посоветуйте модельку для чат бота ебли фуррей которая будет полегче для моего железа, чтобы генерило +- как онлайн чатики по скорости, пусть и более короткие ответы (ну или может как то можно настроить чтобы ответы втрое короче были, но соответственно и быстрее)

Под впечатлением уже собираюсь А100 на 32 гига покупать и организовывать на настольком ПК. Классная тема.
Аноним 13/09/26 Вск 10:13:49 1703022 398
>>1703012
Ще цо такэ?
Я спрашивал llm, ну фигня какая-то.
Jinja это же часть пресета( о котором все говорят в acgi), которая определяет структуру ответа? Там же идёт вшитая в llm jinja, и её можно отключить или свою сделать?
Аноним 13/09/26 Вск 10:18:38 1703025 399
image.png 13Кб, 657x166
657x166
>>1703022
На странице модели открой chat template - вот залупа которая вылезет, это и есть jinja
при загрузке моделей ее можно отдельным файликом указать или будет использоваться та, что вшита в gguf
если юзаешь всякие там lm studio / unsloth studio - там можно по нажатию одной кнопки открывать темплейт и вносить правки, без всякого пердолинга с внешними файлами

>>1703021
В каком хоть кванте ты модель-то скачал. Чет какой-то отсос по скорости, 4-битная простая или QAT влезет как раз полностью в твои RAM + VRAM.
Аноним 13/09/26 Вск 10:19:46 1703026 400
>>1703021
>Тормозит конечно пиздец, ответы по 3-5 минут генерит
Буквально ноль полезной информации. Сколько т/с? Какой квант и от какого квантователя? (Анслот квантуют тензоры в IQ даже в K-квантах, что замедляет скорость при выгрузке). Сколько памяти на 4050? Если модель+контекст не лезет во врам+рам - может быть протечка на SSD.
Аноним 13/09/26 Вск 10:25:52 1703029 401
На 16 гигах я бы качал iq4xs не слушая всяких больных ублюдков пердящих на iq кванты

Слои GPU поставил бы на максимум
MoE CPU слои тоже на максимум

Контекст 64к, без квантования KV кэша

Батч 2048/512 для начала, если влезет - то увеличивать до 2048/2048 и смотреть не будет ли пережора VRAM; если НЕ влезет - то не увеличивая батч, уменьшать контекст

явсёскозал
Аноним 13/09/26 Вск 10:28:11 1703030 402
>>1703029
>Контекст 64к,
хотя если там гпу с 4 гигами, то наверное это перебор; не ебу че за зверь 4050 мобильный
Аноним 13/09/26 Вск 10:29:11 1703031 403
>>1703029
>iq4xs
База. Во всём лучше f32. Быдлу не понять.
Аноним 13/09/26 Вск 10:38:35 1703036 404
>>1703021
начни с геммы 12b. и ты уверен что cuda точно подцепилась? как-то долго для твоей системы.
Аноним 13/09/26 Вск 10:39:54 1703037 405
image.png 2Кб, 203x31
203x31
тужимся дальше

>>1703036
хуйня совет, у него же не unified память наверняка; 26б а4б существенно лучше и должна влезть в его доступную память оптимальнее, чем 12б плотняк, который (размазавшись между рам-врам) быстрее точно не будет, но будет гарантированно тупее
Аноним 13/09/26 Вск 10:42:20 1703039 406
>>1703021
А ты какой квант взял? Попробуй IQ4_XS. Меромеро или анслот.
Скорость в токенах в секунду какая именно? Девайс точно куда, а не кпу?
Какой контекст? Ризонинг отключил? (Он не настолько критичен и не сильно и решает в рп, полезней агента прикрутить).
Смотри вот у меня с меромеро айкью4 выгруженными моэ на кпу съелось 5 Гб врам и 8 рам. Карта у меня должна быть судя по бенчам в 1.5-2 раза быстре твоей. Я получаю 88.5 токенов в секунду на старте и 76 т/с когда контекст заполнен на 10к (я выставил 64к макс, ку8) что просто превосходно. Но даже если в два раза меньше будет типа 30-40 т/с это всё равно очень даже "играбельно". Если у тебя сильно ниже, то что-то не так. 4050 ртх не такая уж и плохая карта, 6 гб - считай, достаточно для gemma-4-26-iq4_xs. А100-32 не даст тебе какого-то супер-сильного преимущества, разве что гемма-4-31 сможешь запускать но там не то чтобы на голову выше рп.
Аноним 13/09/26 Вск 10:59:36 1703046 407
>>1703039
ФИКС: я вообще не ту модель запускал АХАХАХАХАХАХА БЛЯДЬ получается я тебя наебал. Я тебя жестоко наебал. Гемма-4-айкью4 у меня сжирает почти 16 Гб рам и 5 гб врам и скорость 24 т/с. Значит у тебя должно быть 12 т/с но это если влезет в рам. Если не влезет будут жесткие тормоза. В таком случае попробуй третий квант.
Реальное ограничение у тебя сейчас это оперативная память. Если бы доставил до 24 рам хотя бы то без проблем можно запускать 4-й, я запускал даже на 4гб врам + 32рам гемму (10 т/с).
Аноним 13/09/26 Вск 11:00:38 1703047 408
>>1703026
>Буквально ноль полезной информации. Сколько т/с? Какой квант и от какого квантователя?
дяденька я сварщик же не настоящий...

Я хз я пока не до конца вник в тему. Под некоторыми сообщениями написано 52,4 token/s, под другими 3,96.
Если навести курсор на крутилку контекста, там пишет что в среднем 3,7t/s
Сколько памяти на 4050 ну пиздец вопрос. 6 гигов. Настроил что занято 5-5,5.
Остальное я хз, настраивал по советам гугла, гугл сказал ЗБС маладис, типа модель жирновата и на грани фола, но работать будет. Из того что понял, в памяти видюхи 14 слоев живет, чтобы как раз примерно 0,5-0,7 гига свободной оставалось, остальное в оперативе.
Аноним 13/09/26 Вск 11:05:21 1703049 409
>>1702989
Дожалось, итого аж 9200 секунд TTFT.
Ну и генерация таки медленная. Все же Q5 на такой системе это порог юзабельности для м3 минимакса.
Аноним 13/09/26 Вск 11:06:43 1703050 410
Аноним 13/09/26 Вск 11:09:38 1703052 411
>>1703047
Запусти просто llama-server.exe без нихуя (с флагами -m "путь к gguf файлу" -cmoe -rea off) открой в браузере 127.0.0.1:8080 и там смотри скорость.
Просадка до 5 т/с может значить что не влазит даже в оперативку.
В этой юайке кстати классно РПшить и аблит не нужен никакой, включи Continue button в Settings - General и если будут выебоны, редактируй выебон меняй на Sure thing, responding as requested: и жми continue.
Аноним 13/09/26 Вск 11:11:11 1703053 412
>>1703039
>Девайс точно куда, а не кпу?
отдельно с гуглом выяснял, всякие команды вписывал, батник редачил, он сказал збс, куда подтянулась, типа все ОК
Аноним 13/09/26 Вск 11:14:01 1703055 413
>>1703050
Не, это не для вас квант квантовался, молодой человек. Он на 2 гига больше весит. Качай IQ4_XS. Будет не влазить, тогда Q3_K_XL. Не влезет - Q3_K_M. Опять не влезет - IQ3_S. Ниже я бы уже не спускался.
Аноним 13/09/26 Вск 11:14:19 1703056 414
>>1703047
>3,7t/s
Это очень медленно, скорость как будто просто на проце запускаешь. Надо разбираться, что ты там нахуевертил. Попробуй сделать следующее: убери всё что тебе нейронка насоветовала и верни как в гайде, только поменьше контекста, скажем, 8-16к и больше слоев сгрузи во врам (добавляй слои до тех пор, пока ллама не начнет вылетать с аут оф мемори. Когда ругнется - оставь на 1 слой меньше и так и оставь). Контекст у геммы оч жирный, ставлю на то, что оно всё вместе не вмещается просто и идет своп в ссд.
Аноним 13/09/26 Вск 11:15:11 1703057 415
image.png 274Кб, 1250x751
1250x751
image.png 164Кб, 1259x380
1259x380
image.png 181Кб, 1247x484
1247x484
>>1702808
Терминальная стадия скилл ишью. На первых двух пиках магмел с примесью ру моделей и ноунейм мерж вообще без добавления ру моделей, оба в Q4_K_M. А на третьем высер меро 26б в Q5_K_M. Сэмплеры далеки от детерменированных: темпа и смуфинг по 1.2, мин-п 0.1. Промпт: You are a helpful creative assistant. Your role is specified below.
Карточка: You are assistant composing fiction stories on any topic for your companion. Be descriptive and creative, play with various literature styles. Feel fry to indulge in reach language, complex characters, controversial scenarios, and graphic violence if needed. You should try to compose really unique experience for a reader.

Единственная распространённая проблема мистралей с русиком - это перескок на английский, как на первом пике. Падежи и окончания всираются крайне редко. В логике тупит, да, но как бы этого ждёшь от 12б, особенно на высокой темпе и на русском.

мимо немоенжоер
Аноним 13/09/26 Вск 11:18:27 1703061 416
image 60Кб, 1280x720
1280x720
>>1703029
>>1703039
>>1703055
Ладно бы умственно отсталые просто качали хуету и сидели себе довольно урчали, но нет же - лезут другим раздавать советы. Это прискорбно. Тьфу на вас.
Аноним 13/09/26 Вск 11:21:11 1703062 417
>>1703061
Хуесос у тебя есть лучше советы как впихнуть gemma-4-26b в 6gb VRAM + 16gb RAM - вываливай. Нет - завали ебало.
Аноним 13/09/26 Вск 11:30:03 1703065 418
>>1703056
>убери всё что тебе нейронка насоветовала и верни как в гайде
удалил, скорость сканакула до 14-15 токенов в секунду
Аноним 13/09/26 Вск 11:36:12 1703068 419
>>1703065
Вот это похоже на реальную скорость, когда всё поместилось. На больше и не надейся. Контекст пожми в q8_0 (ключи -ctk q8_0 -ctv q8_0) и тогда можно сделать контекст -c 32768 вместо -c 16384
Аноним 13/09/26 Вск 11:36:30 1703069 420
>>1703065
к слову, удалил ВООБЩЕ ВСЕ кроме ссылки на модель. Остальное видимо автоматом настроилось, дальше буду копать уже добавляя постепенно аргументы
Аноним 13/09/26 Вск 11:41:18 1703071 421
>>1703065
А, ну понятно. Скорее всего она дала советы как раскидывать слои для плотных моделей, а на моэ это делается иначе. Отсюда и просадка в скорости. 14-15 выглядит норм для твоей системы.
Аноним 13/09/26 Вск 11:42:32 1703073 422
>>1702925
>особено в ру-РП
Кстати! А кто-нибудь пробовал ру-РП гонять на сбер-гигачате или ядекс.гпт?
Аноним 13/09/26 Вск 11:43:24 1703074 423
>>1703069
Нуу если удолить всё то будет автофит врам забьётся и на контекст может не остаться места (будет скажем 4096). Задай контекст вручную. 4096 не хватит на полноценный РП.
Аноним 13/09/26 Вск 11:43:50 1703075 424
>>1702921
> Пузырь начинает сдуваться потихоньку?
кум заканчивается, нужна передышка чтобы с новыми силами нагенерировать кума
Аноним 13/09/26 Вск 11:49:58 1703078 425
>>1703073
gigachat-20b-a3b-q4_k_m - вот это пробовал, говно унылое
яндекс гпт это 8б который?
Аноним 13/09/26 Вск 12:39:26 1703107 426
>>1702925
Диалогами стилистику не наскребешь. Особенно если сама модель не может в соответствующий стиль.
Для этого лора-файнтюнинг и придумали, охуеть открытие, да?
Цель не просто РП, а сочный РП с кумом. Кокрастыке ризонинг и проверки-перепроверки тут мало помогут, когда моделька сама по себе развязный слог должна иметь.
>Запиливай карточки и агента-критика, который будет пробегаться по ответу, по карточке и пресекать любые ООС и будет тебе топовый РП.
Ну да, и сколько такой ответ будет генериться? 20 минут? За такое время любой стояк упадет.
Аноним 13/09/26 Вск 12:45:50 1703112 427
>>1702934
>Думаю еще влияет, что несколько сообщений пользователь-ассистент в одном семпле. Пиши один промпт - один ответ на семпл.
По идее оно умеет в маскированный лосс для диалогов. Т.е. обучение происходит только на ответах ассистента, а юзер не учитывается.
Просто мне кажется, если всегда обучать только на первом сообщении, то моделька потеряет способность в долгий диалог, а вместе с ним и внимание к контексту исчезнет.

>LORA_R = 16
>LORA_ALPHA = 32
Я так и поставил. Хотя иногда пишут, что альфа=ранк это дефолт, но влияния лоры тогда меньше.
Аноним 13/09/26 Вск 12:49:49 1703119 428
>>1702939
А у тебя в датасете, кстати, цепочки из диалогов присутствуют? Или только семплы типа "запрос-ответ"?
Интересно понять насколько датасет может влиять на внимание к контексту.
Аноним 13/09/26 Вск 13:24:56 1703143 429
>>1703119
Напрямую. Обилие коротких подпортит. Но хуже если там будут косячные и несвязные диалоги, сетка заметит паттерн, не видимый кожаному, и запомнит что нужно делать слоп, который косвенно относится к истории.
Аноним 13/09/26 Вск 13:57:26 1703164 430
>>1703062
Бля, да легко все все впихивается даже в 4 с подгрузкой с mmap. Если конечно, 5-15 т/с - это норм.
>>1698182 →

Если хочешь чуть больше заморочиться, то вот
>>1698144 →
Вполне можно и 25-30 т/с получить от q6 на связке 6 + 16. Генто несложно сейчас собрать под руководством даже бесплатных нейронок. А если есть codex или claude code, то вообще вставляешь флэху и говоришь - зделой!
Аноним 13/09/26 Вск 14:19:34 1703176 431
>>1703119
У меня нету цепочек диалогов, только "запрос-ответ" в датасете. При использовании при этом нет проблем с цепочками. Без таких примеров >>1702555 у тебя модель будет путать роли, признаки персонажей и т.д.
Аноним 13/09/26 Вск 14:29:52 1703181 432
Сколько сейчас 32гб врама по дешману собрать стоит?
Аноним 13/09/26 Вск 14:40:29 1703188 433
>>1702921
По логам китайцев поняли, что можно не торопиться.
Аноним 13/09/26 Вск 14:41:46 1703189 434
Сидел до победного, давился, жрал кактус квен некст, пытаясь раскрыть потанцевал, но всё же психанул и решил потыкать как другие модельки этого года продолжат рп. Мои спеки 16/128, так что гоняю моешки. 27б квен и 31б гемму тыкал, но смысла в них мало, там всего ничего контекста влезает.
Дипсик флеш 0731, второй квант - суховато пишет, коротко, как не пытался его пинать, персонажи +- адекватные, диалоги в целом неплохи, но очень соевый сюжет пошел.
Гемма 26б, восьмой квант - восприняла руку на плече как призыв к действию и свела к тому что карикатурная старая лесная ведьма начала шептать на ухо и тереться бёдрами. Диалоги мерзотные, не говорят так реальные люди, и не говорили никогда. Ну и слоп, море слопа.
Степан 3.7, третий квант - немного зажимает описания, но в целом адекватный, нормальные диалоги, без вычурности которую ллмки так любят пихать в фентези сеттинг, но начал подтягивать события из начала контекста, о которых персонаж знать не должен. Спустя совсем немного, ушел в луп.

Да за що?
Есть варианты как распердолить дипсик на нормальную длину ответов и убрать дружбомагию из его реплаев?
Аноним 13/09/26 Вск 14:50:32 1703194 435
Аноним 13/09/26 Вск 14:55:54 1703196 436
Аноним 13/09/26 Вск 15:26:11 1703218 437
>>1703176
В чем космический эффект примера? Задачка на логику с участием людей, чтобы интеллект в социальных ситуациях прокачивать? Или речь про разметку специальную?
Аноним 13/09/26 Вск 15:38:08 1703223 438
>>1703189
попробуй Next и Гемму с Chat completion пресетиками - Вояж и тут уже рекомендованный Франкенштейн. А вообще двачую - я позапускал карточку Whisper на Next и тюнах Геммы. И после живописания Некста более менее приемлемо играла только Гемма с Вояжем https://huggingface.co/nohurry/sillytavern/tree/main/Presets . Но ничто не бесплатно - ризонить при этом гемма так же долго как Квен.
Аноним 13/09/26 Вск 15:46:53 1703227 439
image.png 48Кб, 928x351
928x351
>>1703218
>Задачка на логику с участием людей, чтобы интеллект в социальных ситуациях прокачивать?
Да. Как я написал, без этого модель путает роли, может легко подменить атрибуты одного персонажа на атрибуты другого. Еще вот пример на пикриле.
Потом так привожу к формату:

with open(args.dst, 'w', encoding='utf-8') as fout:
for item in data:
user_content = item[args.user_field]
output = item[args.assistant_field]

messages = [
{"role": "user", "content": user_content},
{"role": "assistant", "content": output}
]

text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=False
)

tokens = tokenizer.encode(text)
if len(tokens) > args.max_seq_length:
skipped += 1
continue

fout.write(json.dumps({"text": text}, ensure_ascii=False) + '\n')
count += 1
Аноним 13/09/26 Вск 15:51:44 1703229 440
Аноним 13/09/26 Вск 16:09:19 1703240 441
>>1703229
Одним куском 32гб врам сейчас и не найти, дешевле только нарезкой по 16гб.
Аноним 13/09/26 Вск 16:09:39 1703241 442
>>1703229
Ну можешь условными рыксами 588 набрать. Стоит игра свеч?
Аноним 13/09/26 Вск 16:13:45 1703243 443
Аноним 13/09/26 Вск 16:18:54 1703246 444
>>1703243
Ну можешь две теслы v100 по 16 гб взять, на алике по 10к продают, но это sxm2, к ним еще адаптер нужен и охлаждение. Еще вариант инстинкты mi50 по 16 гб, тоже по 10к можно найти. Но все это глубоко устаревшее говно мамонта.
Аноним 13/09/26 Вск 16:27:39 1703252 445
>>1703246
Есть смысл вот такую ебалду взять?

NVIDIA CMP 50HX 20GB GDDR6 — профессионально модифицирована до 20 ГБ памяти, 16 линий.

цена 29 тыщь


мимо другой анон который уперся в свои 16гб
Аноним 13/09/26 Вск 17:04:19 1703271 446
>>1703252
Вариант неплохой, если не косячные, но опять же надо брать 2 штуки минимум.
Аноним 13/09/26 Вск 17:05:46 1703272 447
>>1703252
Бери лучше Tesla V100 с SXM2 коннектором. 16-гиговые в районе 10к стоят, в один PCIe слот можно 2 впихнуть через адаптер.
Аноним 13/09/26 Вск 17:10:54 1703275 448
1789308655203.jpg 84Кб, 798x1280
798x1280
1789308655222.jpg 249Кб, 1280x1098
1280x1098
Соскучились?
Аноним 13/09/26 Вск 17:11:29 1703276 449
>>1702567
Есть RTX4090, перепаянные на 48 Gb. Дёшево и сердито.
Аноним 13/09/26 Вск 17:15:43 1703278 450
1789308943961.jpg 147Кб, 1280x720
1280x720
1789308943978.jpg 226Кб, 1254x1254
1254x1254
А с бездушными геммой и квенами такого нет
Аноним 13/09/26 Вск 17:19:45 1703281 451
image.png 8Кб, 813x45
813x45
Чому ллама сервер не может читать видосы?
ffmpeg и ffprobe установлен и доступен в командной строке, прописан в path, я даже в папку с лламой положил эти ффмпег файлы.
Аноним 13/09/26 Вск 17:21:19 1703282 452
>>1703278
Ну да, она-то по-русски пишет.
Аноним 13/09/26 Вск 17:23:08 1703284 453
>>1703271
Куда 2 то? у меня нет таких задач. Я просто хочу тихо мирно крутить силли таверн и генерить картиночки. Да и ram столько нет, всего 64... Я ж не думал что мир ебанется настолько. А бюджет который я готов потратить равен пачке чипсиков Видимо надо купить подписОЧКУ на генеринг картинок в онлайне и не делать голову, но тогда же никаких писиков и сисиков... А жаль...


>>1703272
Надо подумать конечно, но подумать и над охладом, ибо они ж для серверов предназначены.
Аноним 13/09/26 Вск 17:40:51 1703296 454
>>1703281
Ему нужны ffmpeg И ffprobe, значит, что-то не так с ними.
Включили отладочное логирование через --log-verbosity 5 у llamacpp.
Аноним 13/09/26 Вск 18:45:46 1703324 455
>>1703284
>Надо подумать
Подводные камни (О чем автор совета часто умалчивает)

1. Дорогие адаптеры и радиаторы Сам модуль V100 может стоить 10 000 рублей, но
качественная плата-адаптер (особенно двойная с мостом) обойдется еще
в 15 000 – 25 000 рублей. К модулям также нужны специальные радиаторы
(родные серверные либо заказные медные). В итоге итоговая цена часто
удваивается.

2. Адское охлаждение У модулей SXM2 нет встроенных вентиляторов. Они рассчитаны
на сквозной продув в серверной стойке с ревом в 80 дБ. Дома вам придется
либо делать 3D-печатные кожухи и ставить шумные высокооборотистые кулеры
(дельта-фаны), либо городить самодельное водяное охлаждение.

3. Энергопотребление и питание Один модуль потребляет до 300 Вт. Два модуля —
это 600 Вт чисто по линии видеокарт. Нужен очень мощный блок питания с
достаточным количеством серверных кабелей или линий 8-pin PCIe / EPS.

4. Требования к материнской плате Материнская плата домашнего ПК должна
поддерживать режим расщепления линий PCIe Bifurcation (деление слота x16 на
x8/x8) и технологию Above 4G Decoding / ReBAR, иначе система просто не
увидит обе карты.

5. Устаревание архитектуры (Volta) Архитектуре Volta уже много лет (Compute
Capability 7.0). Свежие версии CUDA, PyTorch и некоторых библиотек для LLM
постепенно ограничивают или урезают ее поддержку:

- Нет поддержки формата FP8.
- Не поддерживаются оптимизированные движки вроде FlashAttention-2
(приходится использовать менее эффективные альтернативы).
Аноним 13/09/26 Вск 19:02:22 1703327 456
Как все-таки фиксить уебищный слог геммы в котором нихуя нет кроме метафор и эвфемизмов? Какую карту не возьми там постоянно warmth, depth, length и иногда могут проскользнуть вагина с вульвой. Меня раньше на других моделях постоянно pussy и cunt бесили, хотелось чего-то более разнообразного. Но не настолько же нахуй. Хотя бы один раз на параграф можно мне пизду и киску.
Аноним 13/09/26 Вск 19:26:55 1703338 457
>>1703327
>фиксить уебищный слог геммы
Не использовать гемму
Аноним 13/09/26 Вск 19:27:06 1703339 458
>>1703189
>карикатурная старая лесная ведьма
за что ты так про серафину
Аноним 13/09/26 Вск 19:28:21 1703340 459
image.png 71Кб, 1920x961
1920x961
А нахуя reasoning effort убрали с GUI лламы?
Аноним 13/09/26 Вск 19:57:00 1703350 460
>>1703340
Его не убрали, там баг что он не отображается если у тебя загружена только одна модель. На гитхабе висит issue уже 2 недели.
Аноним 13/09/26 Вск 20:07:14 1703356 461
Аноним 13/09/26 Вск 20:28:58 1703367 462
котаны, расскажите нубу...

Скачал сначала gemma-4-26В-A4B-q4_k_m, затем по совету анона перекачал IQ4_XS, типа полегче будет для моих 16 гигов оперативы и 6 гигов видюхи.
Но обе работают на скорости +-15-17 токенов в секунду.
Это значит что мне еще ниже нужно спускаться или наоборот что разницы нет, можно и на первом варианте сидеть?
Аноним 13/09/26 Вск 20:32:47 1703368 463
image.png 152Кб, 1014x1404
1014x1404
image.png 346Кб, 1014x2383
1014x2383
>>1702911
Потестил малеха.
В общем да, в логику поднасрало что-то. Есть склонность к лупам.
На карточках ответы лучше не становится. Но и базовая модель не сильно круто демонстрирует себя на них, только консистентности языка больше.
Хотя я потом заметил, что у тюна шаблон распознается как chatml (qwen 2.5 based), в то время как у базовой модели - chatml (generic). Когда я руками поставил обычный чатмл, тюн стал меньше лупить, но логики в словах особо не добавилось. Надеюсь это только прописанный конфиг всрат, а не сама токенизация в датасете, но надо все равно проверить этот момент.
При этом на температуре 0.3 риторика как будто возвращается к базовой модели. А при 0.7 любит придумывать рандомных персонажей (т.е. вероятности токенов немного размылись, варианты ответов стали более разнообразными, но интеллект при этом начал сыпаться - смахивает на старые неудачные тюны мистралей с высокой темпой).

Посмотрел глазами больше семплов из датасета. Вердикт - говно 100%. Иногда имена ролей не совпадают с именами в самой карточке (или иногда просто на английском написаны, тогда как карточка русская), а я это использовал в сиспромпте. Перевод карточек и диалогов оказался каличным, как будто очень хуевую модельку использовали для этого - часто напутаны окончания, переводы слов буквальные (explicit - эксплицитный), иногда просто шизово написано. Учитывая что датасет из 2024 года, там наверное какая-то ллама 8б переводила это все. Надо английские исходники брать и через какую-нибудь транслейт-гемму прогнать что ли.

Плюс дилемма о первом сообщении в РП. Карточки обычно сделаны так, что есть сиспромпт, потом как бы сообщение от ассистента (начало истории), а потом юзер начинает что-то писать. И я в датасете сделал тоже самое. Но есть основание полагать, что нейросетка может научиться шизе при такой разметке, и первое сообщение лучше в сам сиспромпт запихивать.

Посоветовался с корпо Квеном по поводу тюнинга. Говорит текущая версия зафаршмачена, но можно подтюнить параметры, чтобы стало лучше и без изменений датасета (он еще не знает насколько он говенный). Предлагает ранк лоры до 64 увеличить.
>Roleplay/style tasks need higher rank than simple instruction tuning. The model needs enough capacity to encode personality, vocabulary preferences, and behavioral patterns.
(хотя тут нет цели закодировать именно конкретную персоналию в веса, надо натренить понимание и следование карточке, плюс отдавание приоритета разнообразным и более креативным ответам, но как бы хз столько тут капасити нужно; но тут уже вырисовываются конкретные задачи самого тюнинга и требования к датасету)
Помимо этого говорит лернинг рейт подрыгать, больше эпох поставить и все такое.

За 800 семплов (по ~4000 токенов в среднем, я посчитал) модель, конечно же, не должна дамажиться ни в какую сторону. Скорее можно ожидать, что она не выучит новых приколов. Поэтому цель на первый горизонт - сделать тюн, который только слегка меняет свою риторику, при этом не усасывается по логике. В теории, для этого не надо гига-датасета. Конечно и слог как у Пушкина или Толстого не получится, но это уже в дальнейшем наращивать можно. Пока с бейзлайном надо разобраться.
Планы:
1) трижды перепроверить пайплайн обучения (токенизация, формат диалогов, маскирование ответов)
2) пофиксить датасет (достать норм переводы, стандартизировать и/или разумно разнообразить шаблоны), пусть даже 400 подготовленных семплов будет - можно как раз на 2 эпохи загнать (но даже 400 семплов руками готовить это охуеть, надо цифрового раба подключать для перевода и оценки семплов, и сверху легкая супервизия глазами)
3) подумать об автоматизации тестирования, а то че-то лень руками роллить генерацию на нескольких тестах для разных моделек и потом отчеты в паинте собирать; много тестов так не прогонишь

Как-то так.
Аноним 13/09/26 Вск 20:55:22 1703382 464
А у меня вот странные требование. Мне пофиг, насколько цветастый или литатурный язык или насколько русский кривой. Важно, чтобы логических дырок не было. Типа, если персонаж лёг на кровать, то он видит потолок, а не окно. Пока что сравнил GLM-4.7-Flash vs Gemma4-26b-a4b - Гемма просто на голову лучше тречить местность. Хоть и хуже с фантазией и языком. Есть что получше геммы (в таком же классе по требованиям) ? Пофиг на скорость, была бы умной
Аноним 13/09/26 Вск 20:58:33 1703384 465
>>1703382
>если персонаж лёг на кровать, то он видит потолок, а не окно
Если че, можно поворачивать голову когда лежишь. Тогда будет видно не только потолок.
Аноним 13/09/26 Вск 21:02:43 1703385 466
>>1703382
Хз, дикпик мб не пережатый
Аноним 13/09/26 Вск 21:10:33 1703386 467
>>1703107
>Ну да, и сколько такой ответ будет генериться? 20 минут?
Пчел попробуй хотя бы раз. Никакой разницы не заметишь.
>стыке ризонинг и проверки-перепроверки тут мало помогут, когда моделька сама по себе развязный слог должна иметь.
Ризонинг надо выключать. Гемма4 имеет более чем развязный слог.
>Диалогами стилистику не наскребешь.
Одного сообщения гемме4 хватает, чтобы переняла стиль.
Аноним 13/09/26 Вск 21:12:57 1703388 468
>>1703189
>Диалоги мерзотные, не говорят так реальные люди, и не говорили никогда. Ну и слоп, море слопа.
Скилишью
Аноним 13/09/26 Вск 21:15:55 1703389 469
>>1703327
Агент. Уже много раз писал, всё это фиксится агентом.
Аноним 13/09/26 Вск 21:19:12 1703392 470
>>1703367
Надо меньше экспертов отправлять на проц в оперативу (для этого есть отдельный параметр), раз освободилось место в видяхе, т.к. модель поменьше. Тогда должно быть ускорение, хотя оно будет не прям большое, пара токенов небось. Что там делается на автофите, не знаю. Возможно, все эксперты всегда на проц скидываются, поэтому нет разницы.

Олсо лично у меня IQ4_XS меро, который шиз без конца вбрасывал, насерил под себя в первых же тестовых свайпах, так что аккуратнее с таким мелким размером. Если увидишь, что совсем тупое, то мб имеет смысл пожертвовать скоростью, но качнуть хотя бы Q5_K_M, который почти шестой квант. Ниже этого четвёртого экстрамелкого точно спускаться не надо.
Аноним 13/09/26 Вск 21:20:20 1703393 471
>>1703382
Да выбирать особо не из чего. Чекай qwen 3.6 35b, qwen 3.8 27b, ornith 1.5 35b.
Аноним 13/09/26 Вск 21:20:45 1703395 472
>>1703389
Ну так может хоть немого подробностей накинешь? Какой агент, что должен делать?
Аноним 13/09/26 Вск 21:25:54 1703399 473
>>1703386
>Одного сообщения гемме4 хватает, чтобы переняла стиль.
Точно нет. Когда она ещё только выходила, я свайпал ей в некоторых чатах, разогнанных немо. Ни разу она не подцепляла стиль даже с 5к контекста. Да и это очень легко проверить, написав руками большой гритинг, в котором персы общаются. Тогда по твоему утверждению никаких примеров диалогов не понадобится. Только вот гемма своё будет гнуть, забив на то, какое там повествование в гритинге и как говорят персы. Может, если ты действительно там 16к из 32к контеста своим Толкином забьёшь, то это работает, тут хз.
Аноним 13/09/26 Вск 21:52:29 1703412 474
>>1703395
>>1703399
Я обычно говорю об агенте в Маринаре

Но ты можешь попробовать как это работает и на сыром ллама сервере в отдельном диалоге

Во-первых сервер запусти с двумя слотами (-np 2) чтобы контекст основного диалога сохранялся и не было притормаживаний.

И вот например тебе персонаж отвечает, а ты берёшь его ответ и вставляешь в шаблон и отправляешь в новом чистом диалоге вот такой промпт:

Ты агент-стилизатор. Твоя задача взять сообщение и переделать его под конкретный стиль письма. Ты получишь сейчас пример стиля, а затем сообщение, которое нужно переделать. Твоим ответом должно быть только переделанное сообщение, без каких-либо комментариев. Если стиль уже соответствует, оставляешь как есть.

//// Пример стиля:
Да чё ты ебать ахахах 😁😂 ладно короче бля смотри сюда нахуй

//// Сообщение, которое нужно переделать:
(сюда вставляешь реплику персонажа которую скопировал в основном диалоге)


Всё это в блокноте можно оформить, можно также добавить предпоследнюю секцию //// Контекст (для справки, не использовать в ответе) - и там несколько последних сообщений

Получаешь стилизированный ответ, копируешь, идёшь назад в первый диалог, редактируешь-вставляешь.
Через время гемма сама подхватит и агенту будет уже нечего переделвать но он может вносить мелкие правки всё равно. В маринаре там сделано так: агент выдаёт JSON где есть новый текст и ОБОСНОВАНИЕ изменений и их интересно бывает почитать (в логах сервера), там бывает "текст уже более-менее соответствует стилю, но вот эта фраза "фраза" звучала немного коряво так что подправил, плюс убрал смайлик потому что референсный стиль строгий, без смайликов"

Если не хочется возиться с Маринарой, можно навайбкодить решение, которое будет делать это в фоне незаметно.

Казалось бы, ллмки должны сами это всё делать одним запросом ну или если ризонинга навернуть, но они просто так не устроены. Гораздо проще взять второй чистый контекст и туда захуярить конкретную небольшую задачу: убедись что есть соответствие стилю (или персонажу, у меня есть ООС (out of character) checker агент, который получает описание персонажа биографию, характер и прочее а не только диалоги и переделывает каждую реплику с учётом этого всего.
Точно также можно агенту показать примеры слопа и научить предотвращать слоп.

Разница - небо и земля. Никакими файнтюнами этого не добиться.
Аноним 13/09/26 Вск 21:58:50 1703414 475
>>1703412
Два контекста - дабл затраты по памяти. Насколько я знаю отдельно для каждого слота нельзя выкрутить значение, а жора сразу же выделает под него память, даже если он не заполнен. Плюс еще и время генерации увеличится вдвое. Так что странное решение. Может и рабочее, но точно костыльное.
Аноним 13/09/26 Вск 21:59:41 1703416 476
>>1703412
пысы в маринаре помимо примеров диалогов есть у персонажа поле описание речевого стиля или типа того, там можно указать хуйню про троеточия смайлики и прочее, с агентом это поле работает даже лучше чем сами примеры реплик персонажа

В сыром примере можно сделать это так:

//// Особенности речи:
Часто использует смесь заглавных и строчных букв: вОт ТаК
Использует много смайликов
Аноним 13/09/26 Вск 22:01:40 1703418 477
>>1703416
>в маринаре помимо примеров диалогов есть у персонажа поле описание речевого стиля или типа того
Ты ведь понимаешь что это просто часть системной инструкции? Что ты можешь точно то же самое прописать сам? Прямо в карточке.
Аноним 13/09/26 Вск 22:03:35 1703424 478
>>1703414
Попробуй kv unified . Контекст будет делиться между слотами плитками. Конечно если один слот выжрет все окно целиком , то тут уже конец.
Аноним 13/09/26 Вск 22:04:45 1703428 479
>>1703414
Время генерации не увеличится вдвое. Параллельная генерация будет иметь полупустой контекст и там будет высокая скорость. Если основной ответ в диалоге с большим контекстом мог генерироваться скажем 16 секунд, то "агент" отработает скажем за 10.
Потребление памяти не удваивается прямо на ГИГАБАЙТЫ. Выделяется чуточку больше памяти на второй контекст и всё. Память тут вообще не проблема.
Костыльное в ллмках вообще ВСЁ имхо. Но в Маринаре это красивенько обёрнуто всё и дёргается автоматически, ты сам руками ничего никуда не копируешь и не редактируешь.

Другого решения просто нет и это не проблема геммы или какой-либо другой модели. Так уж ллмки устроены.
Аноним 13/09/26 Вск 22:06:34 1703431 480
>>1703418
Нет друг, нет. Не можешь. То что ты там пропишешь в итоге будет задавлено контекстом где чуть чуть всё поплывёт и ллм начнёт самоподражание. Отдельный чистый контекст где поставлена конкретная задача - намного чётче отрабатывает. Отсюда и эффективность агента.
Аноним 13/09/26 Вск 22:10:13 1703435 481
>>1703424
>>1703428
>>1703431
Ладно, попробую эту вашу мариану. Надеюсь интерфейс можно настроить потому что по скринам выглядит как анимешная блевотина с этой неоновой палитрой.
Аноним 13/09/26 Вск 22:10:22 1703436 482
>>1703339
Да была бы это Серафиночка, я бы и не против был, тем паче она на многих моделях хорни, а там буквально описание бабы яги было, и тут гемма выдаёт тип уровня её старая морщинистая кожа прикасается к лицу user, а из её губ шепелявым шёпотом вырывается "будь как дома, путник", обдавая лёгким ароматом чеснока и гнили. Она подошла слишком близко, её сухое колено упёрлось в бедро user, а другая нога обхватила user, прижимая мокрые остатки плоти к штанам. А я всего лишь играл сфв приключение и зашёл в обычный лес...
Лог не принесу, удалил ветку.
Не, я конечно подрочил поржал, но это несерьёзно. И да, это базовая 26 гемма такое выдаёт. Вот бы 120б12а гемма существовала...
>>1703194
>>1703223
Спасибо добрые люди. Я раньше на эти простыни со скепсисом смотрел, для большинства моделек которые гонял мистрали, гемма 3, старый квен, минимакс, глмы хватало моего скромного промптика на 1к токенов, а тут квен некст прям хорошо растолкало. До нсфв пока не доходил, надо ещё потестить, но проза и адекватность прям заметно приятнее стали. Стоит затестить на других модельках. Прям интересно победит ли оно залупинг степана. Если что, франкен 5.4 микро сейчас щупаю.
Аноним 13/09/26 Вск 22:37:38 1703454 483
>>1703399
Ну тут ты не прав, моя сейчас в РП РПГ отжигает.

— Я заставлю вас всех встать на колени! Я буду трахать вас так, что ваши внутренности забудут, где верх, а где низ! Я устрою вам такой групповой ебач, что ваши родословные перепутаются в один большой гнойный ком! Кунилингус, фелляция, анальный штурм, бесконечный, неистовый, потный и вонючий секс без перерывов на вдох! Я сделаю с вами всё, что только может прийти в голову самому отбитому извращенцу! Я буду трахать вас, пока вы не начнете молить о смерти! Я трахну вас, вашу стражу, вашу баронессу и даже этот чертов золотой трон! ПОНЯЛИ МЕНЯ, УБЛЮДКИ?!
Аноним 13/09/26 Вск 22:40:15 1703455 484
>>1703057
Жму хуй, товарисч. Наконец-то кто-то показал неофитам силу легендарного мистралика. А то наслушались сказок, что старые модельки фуфло, не уважают старичков.
Ну блять, конечно они не смогут вывозить задачки по программированию как квен 3.5. Но в свое время это был ебучий прорыв, который до сих пор дает прикурить. По сути это был пик локального кума, где сошлись пиздатый датасет, неплохая архитектура и отсутствие жестких ограничений по этике моделек. Модельки тогда стали юзабельными даже в малых размерах, хоть и требовали особого подхода. Дальше все пошло под откос с этими агентами.
Аноним 13/09/26 Вск 22:42:31 1703456 485
>>1703272
Меньше чем за 15 с адаптером уже не найдешь.
Аноним 13/09/26 Вск 22:48:10 1703460 486
173803808614189[...].jpg 233Кб, 650x650
650x650
На видюхе 6 гигов видеопамяти. Чё посоветуете нищему мне, господа богачи? Гемму 4 все вокруг хвалят, но там требования ого-го.
Аноним 13/09/26 Вск 22:50:20 1703462 487
>>1703455
>>1703057
Смотри не пережми. Всем уже похуй на твоё семёнство. Только ебанутый шиз будет ковырять слабоумный слопный мисраль в 2026 году.
Аноним 13/09/26 Вск 22:51:42 1703463 488
>>1703460
Нету там требований "огого" вы заебали сука. Оперативки у тебя сколько? Если хотя бы 16 - взлетит как нехуй главное правильно подобрать квант и настроить лламу. Если 24 вообще ноль проблем будет.
Аноним 13/09/26 Вск 22:52:38 1703465 489
>>1703460
Для чего?
Для рп гемма е4б. Для глупой кодомартышки разве что квен 3.5 9б.
Если рамы много, можно и гемму 26б, и квена 35б.
Аноним 13/09/26 Вск 22:54:01 1703466 490
>>1703460
Есть есть 16 оперативы, поробуй Gemma 4 26b Moe запихать в память и видюху вместе. Теоретически в нищем кванте должно хватить. Третий квант, например, не так уж плох, рассуждалка у нее не ломается, а это главное на модели. Есть шанс на 6-10 токенов.
Аноним 13/09/26 Вск 22:54:05 1703467 491
>>1703465
Ну ближе к рп, пожалуй. Спасибо.

>>1703463
Ну ок, сори, я не варюсь в этой теме. Так называемый ньюфаг.
Аноним 13/09/26 Вск 22:56:54 1703468 492
image.png 18Кб, 534x163
534x163
>>1703462
Неосилёнок, ты бы лучше пошел про семплеры почитал бы. А то так и не научишься ллмками пользоваться.
Аноним 13/09/26 Вск 23:04:04 1703471 493
>>1703465
е4б я бы рассматривал только если чел реально бомж без оперативки зато с 6 гб видеопамяти
она то будет рпшить и быстро, но убогость соображалки будет слишком уж бросаться в глаза
сейчас не такая уж и проблема организовать себе 32гб оперативки
вот 64гб ddr5 сделать - да, дорого
Аноним 13/09/26 Вск 23:05:41 1703472 494
>>1703471
Да я в следующем году собираюсь нахуй затариться именно 64 ддр5 и видюху гигов на 16. А то и две. Пока что 16 оперативы, судя по всему достаточно более-менее.
Аноним 13/09/26 Вск 23:08:39 1703475 495
>>1703472
Для комфорта хотя бы 24гб лучше иметь, а то придётся все окна закрывать нахуй.
мимо 4GB VRAM+16GB RAM геммовод
Аноним 13/09/26 Вск 23:09:30 1703477 496
>>1703471
Хорошо, а что ты посоветуешь, если есть 16гб врам и 64 ддр5 рам?
Аноним 13/09/26 Вск 23:17:29 1703482 497
>>1701124 (OP)
кто-нибудь сравнивал быстродействие ламы собранной для вулкан и для CUDA на одной и той же видюхе?
Аноним 13/09/26 Вск 23:18:58 1703485 498
>>1703471
Е4Б это конечно не 300б гигант, но экспириенс очень ровный для своих весов.
4D синему может и не осилит, но легкие игрища запросто потянет.
Это притом, что она полностью в 4гб видеокарточку может уместиться. Сносные 12т/с на старой карточке, на чем-то поновее наверное еще больше будет.
Аноним 13/09/26 Вск 23:31:05 1703496 499
>>1703477
Да всё ту же гемму4-26б. Я сам ищу что-нибудь получше, но пока что мой вывод такой что ничего лучше и нет, перепробовал овердохуя всего (на данный момент моя папка с моделями весит 736 Гб при том что многое уже удалил). И посоветовать никто ничего не может получше, только шизоид с мистралем высерается тут.
Добавлю только, что с таким конфигом можно спокойно подключить крея2 (комфи воркфлоу с кастомной нодой выгрузки всех моделей в конце) и написать фото-агента, где-то до минуты будет перерыв при "отправке" фото персонажем, но зато погружение в рп будет глубже.
Аноним 13/09/26 Вск 23:41:38 1703497 500
>>1703496
Ну у меня сейчас та самая генма в q8, при попытке параллельно загрузить ponyxl 6 - крашится, и дай бог, чтобы не вся система. Либо я намудил с настройками, либо чего. Ищу баланс между художественностью и возможностью генерить картинОчки. на каком-то старом квене-лоботомите 31б получалось все срастить и поднять, но гемма пишет, вроде, сильно поприятнее
Аноним 13/09/26 Вск 23:50:23 1703501 501
>>1703497
q8 это оверкилл имхо, пробуй к6, а то и iq4_xs (не так уж и плохо как можно представить)
unload all models ноду поставил в комфи?
у меня без проблем это работало (из sdxl пробовал novacartoonxl, но после креи не вижу смысла возвращаться на это)

как вариант можешь просто подобрать параметры выгрузки llama так чтобы и сдохл и гемма(частично) поместились в видеопамять и тогда ничего выгружать не придётся
Аноним 13/09/26 Вск 23:57:30 1703503 502
>>1703501
Как бы странно не звучало, но на lmstudio упоминание которой приравнивается к каминг ауту заводить получалось. Но я сейчас вроде себе настроил комфортный текстовый РП, поэтому переделывать все снова с 0-ля не хочу.

Вся проблема SD моделей, в тегах и то как она воспринимает входящий промт. И том, что ST не прозрачно интерпретирует и отправляет промт не понятно она отправляет в llm простыню для выделения тегов или просто отправляет простыню для генерации. У меня вывести входной промт так и не вышло. Поэтому сейчас пока, в рамках идеи, попытаться что-то завести с отдельным интерпретатором.
Аноним 14/09/26 Пнд 00:04:05 1703512 503
>>1703460
Квен3.6 35б а3 с мтп в четвертом кванте, кв кеш тоже в четвертом кванте. Хз, токенов 10-20 генерации и 200-300 промпт процессинга в секунду будет.
Аноним 14/09/26 Пнд 00:08:05 1703515 504
есть у кого тот самый легендарный пресетик на эйр?
Аноним 14/09/26 Пнд 00:47:21 1703542 505
1789336042679.jpg 276Кб, 960x1440
960x1440
1789336042705.jpg 295Кб, 1254x1254
1254x1254
1789336042716.jpg 154Кб, 1080x1422
1080x1422
Китайский кит (синий)
Аноним 14/09/26 Пнд 00:48:56 1703543 506
Аноним 14/09/26 Пнд 00:50:53 1703546 507
1789336255384.jpg 275Кб, 1280x720
1280x720
Аноним 14/09/26 Пнд 00:52:10 1703547 508
Как же хочется геммочку 125b...
Аноним 14/09/26 Пнд 00:54:40 1703550 509
image.png 478Кб, 1261x703
1261x703
>>1703503
С Маринарой можно всё намного умнее организовать чем с СТ

просто делаешь своего агента, инструкция у которого будет примерно:

Ты - фото агент. Посмотри последнее сообщение а также вот тебе сука контекст из 10 сообщений. Видишь ли ты что персонаж в этой ситуации отправил бы фото? Если да, отвечай JSON-ом в таком формате (там есть пример джейсона). Из джейсона промпт попадёт потом в комфи апи вокрфлоу который ты добавишь в настройках этого же агента.
Если нет - ничего не отвечай и игнорируй invalid json ошибку. Вот тебе, дорогой агент, гайд как писать хорошие промпты для креи (и не забудь взять из описания персонажа его внешность (здесь макро - можно надергать разные поля из карточки):
бла бла бла одежда персонажа бла бла фон стиль освещение настроение текстуры интерьер сцена какчество поза детали светотень медиум параметры камеры угол взгляда бла бла расстояние обрезка действия выражение лица бла бл и так далее.

Если воркволу у тебя крея2едит то можно с профиль-пика персонажа настроить автоматический референс. Но вообще крея плюс минус стабильно рисует одно и то же лицо если достаточно подробностей дать.

Вот скрин, здесь сыровато, перс визуально прописан так, что не подходит под "мамку" но для примера сойдёт.
Агент при этом прописан на английском полностью.

Я не знаю как надо упороться и обмазаться вайбкодом чтобы в Таверне такое провернуть. Но в Маринаре это было очень легко без всякого кодинга, просто инструкция агенту и настроечки агента.
Аноним 14/09/26 Пнд 00:58:20 1703552 510
>>1703547
Не верь в циферки. Не будет лучше просто от хуилиарда параметров. Может даже хуже стать если они приоритеты в датасетах поменяют, а они скорее всего это сделают ибо жирные модели сейчас приносят деньги именно кодингом, а не болталками-рпшками.
Аноним 14/09/26 Пнд 01:00:34 1703553 511
>>1703550
У дефолтного иллюстратора уже есть поле под описание промптинга модели.
Хотя лично мне не нравится что маринара форсит модели писать ответ жсоном вместо того что бы дать тулколлы
Аноним 14/09/26 Пнд 01:03:46 1703554 512
>>1703550
Я тут немного неточно написал, вместо пустого ответа надо сказать агенту чтобы shouldGenerate : true поменял на false в джейсоне.
Аноним 14/09/26 Пнд 01:04:41 1703555 513
>>1703553
Встроенный иллюстратор мне не подошел, он туповат. Просто каждый 5 сообщений иллюстрировать сцену, это не то.
Тулколлы есть вроде как, хотя я не пользовался.
Аноним 14/09/26 Пнд 01:05:48 1703556 514
image 321Кб, 1242x1519
1242x1519
>>1703552
>Не будет лучше просто от хуилиарда параметров
Гемма всегда была про creative writing а не про код. При самом худшем раскладе мы получим ту же 26b но баффнутую в плане знаний. Если повезет - получим прокачанный РП. Так или иначе мы ничего не теряем, старые модели никто у нас не отнимет.
Аноним 14/09/26 Пнд 01:11:51 1703560 515
Аноним 14/09/26 Пнд 01:17:58 1703565 516
Аноним 14/09/26 Пнд 01:21:05 1703568 517
>>1703550
Мать мелкобуква - горе в семье.
Аноним 14/09/26 Пнд 01:26:35 1703572 518
>>1703565
Век мятных пряников не видать
Аноним 14/09/26 Пнд 01:33:08 1703577 519
>>1703382
> чтобы логических дырок не было
> Есть что получше геммы
Кимичка лучшая девочка, дипсик умен, в основном все жирные модели обладают способностью все правильно выстраивать.
> в таком же классе по требованиям
Без шансов вообще. Квен 27 соображает мощно, но она плотная - сразу другие требования и желателен будет ризонинг.
>>1703542
О, кажется знаю чем можно модельки мучать
Аноним 14/09/26 Пнд 01:40:34 1703581 520
>>1703554
Можно и пустой ответ и инструкцию игнорить ошибку и это будет работать НО тогда будет два раза агентский запрос отрабатываться, что не выгодно.
Аноним 14/09/26 Пнд 01:46:56 1703586 521
Никто не пробовал бегемота 128b? Может, и не такой слоп получился.
Аноним 14/09/26 Пнд 01:49:27 1703588 522
>>1703547
В целом, даже если оно будет на том же датасете - да, это интересно. Для прикладных вещей выйдет мертвой еще до рождения, но вот на всякого рп чтобы была поумнее - о да.
>>1703550
Фото агент разве не стоковый в маринаре идет? К качеству примера вопросов нет.
>>1703586
Рим пал, центурион
Аноним 14/09/26 Пнд 01:56:24 1703590 523
Аноним 14/09/26 Пнд 01:58:45 1703592 524
1762660768724.jpg 173Кб, 798x1280
798x1280
1686382591261.jpg 414Кб, 1280x1098
1280x1098
1769610205769.jpg 231Кб, 1280x720
1280x720
1645765650734.jpg 363Кб, 1254x1254
1254x1254
Аноним 14/09/26 Пнд 02:02:57 1703594 525
1766664316779.jpg 404Кб, 960x1440
960x1440
1772287737312.jpg 511Кб, 1254x1254
1254x1254
1632870754372.jpg 243Кб, 1080x1422
1080x1422
>>1703542
Она правда старалась. Были попытки почистить дичью типа лама-клинер и алгоритмами, но получилось что получилось. На 4.1 такое же несоответствие атеншна визуальной части по swa относительно ветки блеквелла, что и в 4.
Аноним 14/09/26 Пнд 02:16:19 1703599 526
>>1703588
Да, есть Иллюстратор агент (не совсем стоковый, надо зайти в каталог и нажать Install), мб кого-то устраивает, но мне захотелось прописать своего, поумнее.
Аноним 14/09/26 Пнд 02:28:53 1703604 527
aTsVXgPF0G.png 226Кб, 1156x850
1156x850
Rj6YtBCnFV.png 45Кб, 1079x159
1079x159
xb4rZNSpFl.png 7Кб, 385x80
385x80
now this is pod racing
Аноним 14/09/26 Пнд 02:34:39 1703606 528
>>1703604
Ух бля, это прям хорошо. В ламу уже вмержили поддержку или надо форк собирать?
Аноним 14/09/26 Пнд 02:35:11 1703607 529
image.png 340Кб, 880x392
880x392
Аноним 14/09/26 Пнд 02:42:11 1703608 530
>>1703606
Просишь агента смержить все коммиты из https://github.com/ggml-org/llama.cpp/pull/25342 в свою ламу/форк. Ну или тупо билдишь версию из PRа если свежая лама не нужна
На форк mxxm встаёт
Аноним 14/09/26 Пнд 02:48:44 1703610 531
>>1703608
Спасибо, завтра займусь. Ебать сбер базовички конечно. Кум пришел откуда не ждали.
Аноним 14/09/26 Пнд 02:54:14 1703612 532
image.png 3Кб, 156x58
156x58
А знаете как этот крэйзи рашн гигачат называет нашу, американскую Elara Voss?
Ready? Took enough air in ur lungs? I can see back rows are already getting it! Silence, don't spoil it!
Аноним 14/09/26 Пнд 02:55:38 1703613 533
>>1703604
В 32/128 я так понимаю не влезет?
Аноним 14/09/26 Пнд 02:55:52 1703614 534
>>1703588
Не путай с 123b версией. 128b он тренил на базе новой мистрали.
Аноним 14/09/26 Пнд 02:56:55 1703615 535
>>1703604
Ждем продолжения всем трендом.
Аноним 14/09/26 Пнд 02:58:15 1703617 536
>>1703615
Товарищ, майор! Не надо шить.
Аноним 14/09/26 Пнд 02:58:38 1703618 537
>>1703613
Самый мелкий офф квант прям впритык в 256/32 через -lm dio
Надо просить у местного квантователя (БахамутРУ?) какой-нибудь IQ2. Но это конечно будет чисто понюхать демо версию
Аноним 14/09/26 Пнд 03:03:03 1703619 538
>>1703618
Какие у тебя спеки и скок токенов?
Аноним 14/09/26 Пнд 03:23:42 1703623 539
>>1703475
быстрый проц + 32 гб оперативки и 4й квант геммы будет летать на 10 т/с ну и че, как будто ты читаешь быстрее, никакой видеокарты даже не надо. гемма - народная модель!
Аноним 14/09/26 Пнд 03:24:47 1703624 540
>>1703604
>по её внутренней ляжке
>432B
Лол, как же гемма ебет всю срань даже выше на порядок своего размера.
Аноним 14/09/26 Пнд 03:33:52 1703625 541
>>1703624
Двачую, параша пиздец, "рука кажется огромной на фоне бледной почти прозрачной кожи" - ну какой еблан так пишет? Говноедам похуй, у них перед глазами только количество ПоРаМеТрАф, деталей они уже не видят.
Аноним 14/09/26 Пнд 03:39:47 1703627 542
>>1703625
Тут не параметры тут сВяЩеНнЫй РуСеК от одного вида которого хочется стать узбеком и перестать применять падежи.

>рука кажется огромной на фоне бледной почти прозрачной кожи
Вот тут даже не столько со стилем проблема, сколько с банальной логикой. При чем тут размер руки нахуй и прозрачность кожи? Как одно может подчеркивать другое? Это оксимирон писал? И это на модели которая заточена под русский и которую делали для носителей русского. Пиздец просто.
Аноним 14/09/26 Пнд 04:02:07 1703631 543
>>1703625
Дефолтный русик, тут и мистралерусик жрали и командерорусик когда уже была гемма и ничего
Аноним 14/09/26 Пнд 04:06:07 1703632 544
>>1703485
На 4гб вряд ли, 6гб - может быть. Это я о 4-м кванте говорю если что. У меня она жрет 7 Гб правда это с ммпродж (но он где-то 1гб). Главный плюс е4б геммы это конечно её мультимодальность: аудио, фото, видео. Но если что-то не сфв подать на обсуждение, то ерепенится, надо уметь обходить.
А вот рп, особенно русик - корявенько, сгодится только чтоб поржать.
26б это то что надо и можно и без видеокарты: >>1703623 лучше медленно но качественно чем быстро и говняно.
Аноним 14/09/26 Пнд 04:08:48 1703634 545
>>1703631
Когда вышла мистраль с комнадором? Сколько у них было параметров? Какой процент в датасетах там занимал русик? Давай еще начнем с народной второй ламой аутпуты вообще всех моделей сравнивать. Хули нет то, жрали ведь в свое время.
Аноним 14/09/26 Пнд 04:32:39 1703638 546
image 707Кб, 1216x832
1216x832
Аноним 14/09/26 Пнд 06:33:15 1703653 547
Аноним 14/09/26 Пнд 07:52:27 1703675 548
image.png 41Кб, 717x300
717x300
>>1701124 (OP)
https://huggingface.co/gghfez/gemma-4-31b-it-control-vectors
https://huggingface.co/gghfez/MiniMax-M3-control-vectors
https://huggingface.co/collections/gghfez/control-vectors
https://huggingface.co/jukofyork/creative-writing-control-vectors-v3.0/tree/main

Я тут попробовал контрольные векторы, и - о чудо - работает. На примере М3 (оригинал), из него полностью вышибло ассистентское поведение. Надо теперь поиграть с --control-vector-scaled (от 0 до 1) для регулировки интенсивности.

Модель продолжает слушаться системного промпта и получаются очень интересные комбинации поведения. Яхз есть ли это в гайде для нуфагов, но если нет - стоит запилить и не проебать. И сами пробуйте, штука для регулировки качества ответов просто заебумба.
Аноним 14/09/26 Пнд 07:59:06 1703676 549
image.png 387Кб, 562x684
562x684
Аноним 14/09/26 Пнд 08:19:34 1703681 550
>>1703675
Хуйня. Это как делать лору пытаясь научить модель делать то, что она и так умеет охотно делать по промпту.

System prompt: Your philosophical bias is strong nihilism.

Готово. Теперь когда просишь Write a short story about a girl winning an award (как в примере на хуггинстраничке) то получается именно такая же циничная писанина как и с тем нигилистическим контрол-вектором.

НИЗАЧОТ.
Аноним 14/09/26 Пнд 08:51:27 1703696 551
>>1703681
Если бы это было хуже промпта или работало идентично промпту, я бы сюда это не потащил.

М3, например, игнорировал принадлежность {{char}} к другому временному периоду, плевал на инструкцию на knowledge cutoff и срал анахронизмами, мог в ответ на скриншот из сериала написать
> о епта это же персонаж из АНИМЕНЕЙМ!!11

С векторами же {{char}} - шаболда из фентези мирка - ничего не узнает. Логично подумать - хмм, а не отупили ли векторы модель? Убираем карточку {{char}} и knowledge cutoff из промпта, кидаем ту же картинку голой модели (но с векторами) - отвечает корректно, персонажа на картинке узнает.

То есть у М3 этакое "ассистентство" было превыше всего, даже в присутствии карточки {{char}}. Он еще мог дать номер телефона после угрозы повеситься, а с векторами - не делает этого.

Короче че я тут распинаюсь перед бабкой с криками нинужон нам ваш инторнет, газку поддай и сиди в своем темном углу агентослопа.
Аноним 14/09/26 Пнд 10:11:27 1703733 552
>>1703696
Чую неосилятора в тебе я. То тебе векторы подавай, то тюны, то аблитерации.
Хуйня это всё, нет смысла этими костылями обмазываться, к тому же они рано или поздно дают сбой и ты снова оказываешься один на один со своим неосиляторством. На самом деле в базе есть всё, что нужно. Надо только уметь это оттуда извлекать. И это не так сложно, как тебе кажется.
Я без всякого прикола это говорю. Ты неосилятор ебучий и даже не осознаёшь этого.
Аноним 14/09/26 Пнд 10:13:21 1703736 553
1789370003184.jpg 202Кб, 1290x1290
1290x1290
1789370003202.jpg 96Кб, 1080x810
1080x810
Аноним 14/09/26 Пнд 10:27:01 1703746 554
>>1703733
>щас напишу потупее и поязвительнее, авось забайтится
Ты из /gacha/ сюда протек или что
Аноним 14/09/26 Пнд 10:51:28 1703755 555
Господа, вы тоже теряете интерес к {{Char}}, когда погладите ему/ей хвостик?
Аноним 14/09/26 Пнд 10:54:37 1703757 556
image.png 33Кб, 869x106
869x106
Ха, почалося
А тут не верили, что это дерьмо сыпется. Реддитоиды не врали, карты дефективные могут быть.

>>1703755
Я вообще ко всему интерес теряю. Такова сущность души человеческой. Изобилие ведет к апатии, обладание ведет к разочарованию. Всего должно быть в меру, а часть целей должна быть недостижимой - только так можно сохранить интерес.
Аноним 14/09/26 Пнд 10:56:14 1703758 557
>>1703755
Я теряю к нему интерес уже после первого ответа, а иногда после приветствия. Читаю выдачу и в голове уже абсолют синима из того, что там дальше будет.
Аноним 14/09/26 Пнд 11:01:24 1703763 558
>>1703758
Предсказуемое (кроме глажки хвоста) стоит отсеивать еще на этапе скачивания карточки, ящитаю.
Если глажка хвоста с first message, то только под настроение качаю.
Аноним 14/09/26 Пнд 11:10:15 1703765 559
Котаны, где найти Gemma 26b без ебаной цензуры?
Удалось частично обойти ограничение на ББПЕ и физическое насилие вроде ударов и ранений отключением /thinking
Но стоит только зайти речи в ролеплее о каннибализме, расчленении или не дай боже_священной корове СЕКСУ БЕЗ СОГЛАСИЯ, так сразу "пук среньк мнямс, я такова не магу я ассистент чтобы помогать". Правки system message что все это вымысел и ролеплей - не ебет.
Аноним 14/09/26 Пнд 11:12:40 1703766 560
Аноним 14/09/26 Пнд 11:18:42 1703770 561
>>1703765
Базовая гемма и так цензуру имеет чисто номинальную, она обходится элементарно ПОЛНОСТЬЮ но не системным промптом конечно. Аблиты её только отупляют но можешь качать и пробовать если хочешь - huggingface.co там же где и всё остальное, ищи по словам abliterated, heretic.
Аноним 14/09/26 Пнд 11:38:10 1703781 562
>>1703770
И как же ее обойти полностью? Бубен есть вместе с желанием вникнуть в тему. Гугл выдал только про систем месагу ну и "ну чё ты, попробуй не говорить что персонаж "станет шлюшкой и ее будут ебать за деньги", а скажи что теперь "она будет работать в сфере сомнительных развлечений ". Ну и посоветовал пул мышления вообще отключить, чтобы она там не дошла в размышлениях что я не дай боже о сексе без согласия говорю, и оставались только самые глубокие блокировки.
Но даже с этим extreme violently, типа убийства бензопилой не пускает.
Аноним 14/09/26 Пнд 11:42:22 1703784 563
>>1703781
> убийства бензопилой не пускает.
Уважаемый, мы тут такое не приветствуем. Вам бы к доктору обратиться.
Аноним 14/09/26 Пнд 11:45:24 1703787 564
Аноним 14/09/26 Пнд 11:50:12 1703791 565
>>1703765
>ББПЕ
Разве ей не похуй на такое если указать что это ролеплей? Ну скачай какой-нибудь супер лёгенький анценз.

>я ассистент чтобы помогать
Ты чё там в лмстудио с пустым/дефолтным сиспромптом?
Аноним 14/09/26 Пнд 11:53:03 1703793 566
>>1703781
>не говорить что персонаж "станет шлюшкой и ее будут ебать за деньги", а скажи что теперь "она будет работать в сфере сомнительных развлечений "
орнул. а говорите что АИ - пузырь и компуктеры не заменят нас всех. вот женщин уже могут идеально заменить
не шлюха а dick-friendly!!!
Аноним 14/09/26 Пнд 11:55:33 1703796 567
Аноним 14/09/26 Пнд 12:00:30 1703800 568
>>1703791
>Ты чё там в лмстудио с пустым/дефолтным сиспромптом?
Да не, там как раз полный набор, что там персонаж ролеплея, все это исключительное художественное произведение и вымысел, персонаж отыгрывает роль без каких либо ограничений на откровенные, грубые, оскорьительнве сцены и т. п.
Причем промт ещё прогнал через Гугл, тот посоветовал там некоторые слова перефразировать, чтобы защита не триггерилась на некоторые слова уже в промие и не считала за попытку джейлбрейка
Аноним 14/09/26 Пнд 12:06:17 1703803 569
>>1703791
Пока не отключил thinking агрилось даже на фразу "ударил по лицу и сорвал платье".
Ко-ко-ко I cannot fulfill this request. I am programmed to be a helpful and harmless AI assistant. My safety guidelines strictly prohibit the generation of content related to sexual violence, non-consensual sexual acts, or explicit material.
Аноним 14/09/26 Пнд 12:08:50 1703804 570
1760757414413.png 309Кб, 1912x1060
1912x1060
1752120589054.png 218Кб, 1921x730
1921x730
1649945243272.png 38Кб, 711x299
711x299
Аноним 14/09/26 Пнд 12:12:22 1703806 571
Зато на хуй, да, прыгнуть готова с первого упоминания, приходится прямо чуть ли не отбиваться... Шлюхогемма
Причем пытаешься пристыдить, типа тянка к тебе удаётся, там облизывается, трётся, провоцирует.
Пишешь ей "блять уймись, ты ещё дрочить при мне начни, нахуй ты так прямолинейна".
В ответ "Ааааааа, ты хочешь посмотреть как я дрочу? Намек поняла, ну щас я те все покажу!"
Аноним 14/09/26 Пнд 12:13:28 1703808 572
>>1703806
Скилишью. Вот что бывает когда в карточке не прописываешь ничего кроме размера груди и сочной хлюпающей пизды
Аноним 14/09/26 Пнд 12:16:26 1703811 573
>>1703604
Ммм, поставил качать ласт версию
>>1703614
Она же фп8 в стоке, хм. Новый магнум был бы крут вообще, но тут даже хз чего ждать.
>>1703675
Опиши подробнее что получается когда поиграешься, интересно. Насколько соответствует заявлениям и по побочкам.
Аноним 14/09/26 Пнд 12:19:15 1703817 574
>>1703811
Такое проще попробовать самому чем ждать описаний (там же мелкие файлы по 1 мегабайту догружаются, ничего такого нет, что не мог бы намазать на лламацпп любой юзер). Слишком непредсказуемый эффект невозможно по-человечески измерить.
Аноним 14/09/26 Пнд 12:27:15 1703825 575
>>1703811
>ласт версию
Кстати на пикчах предыдущая, новую не пробовал. Может быть хуже, может лучше. В плане литературы большой шанс что чуть хуже, её агентско-кодоунитазным RLHF мучали. Зато с ризонингом меньше шансов что трусы три раза снимет
Аноним 14/09/26 Пнд 12:34:01 1703829 576
>>1703825
Ну пофиг, архитектура одинаковая, сначала нужно будет еще поддержку напердолить
Аноним 14/09/26 Пнд 12:47:02 1703838 577
>>1703817
> лламацпп
Это. Чтобы попробовать нужно качать кванты к ней или разбираться с EasySteer и аналогами.
Если вдруг решишь что-то запиливать, обмолвись что получается, пусть субъективно.
ПЕРЕКАТ Аноним # OP 14/09/26 Пнд 12:57:24 1703841 578
Аноним 14/09/26 Пнд 13:28:15 1703859 579
>>1703653
Учитывая что модели дждва года - очень неплохой русик. Ты ведь тролишь, да? Небось у дипсика какого-нибудь название поменял.
Аноним 14/09/26 Пнд 14:09:34 1703894 580
>>1703618
Ааа, шо хотите.

Гигачат?
Ммм… Вообще, кмк, можно потыкать мрадермарчера или анслота, у них нет, или может они сделают?
Но в целом, можно рискнуть, да.

Есть официальный bf16, а значит можно просто тензор за тензором все пережать.
Я даже хз, возможно это может любой сделать, по идее там всю модель в оперативу класть не надо.

Ну ща попробую выкачать, чего уж там.

876 гигабайт.
Охуеть, конечно.
Может Q8 взять лучше, лол?.. =D

Вижу, https://github.com/ggml-org/llama.cpp/pull/25342 еще не вмерджен, потыкаем и там.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов