Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 510 93 115
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №276 /llama/ Аноним 05/10/26 Пнд 06:27:26 № 1722020 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
177194596692801[...].png 846Кб, 624x997
624x997
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная, но слегка тухлая вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Не вошедшее в шапку и архив полезных ссылок: https://rentry.co/llama-2ch-archive

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• Обертка над llama.cpp с закрытым исходным кодом: https://lmstudio.ai
• Обертка над llama.cpp с ограниченными возможностями: https://github.com/ollama/ollama

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• PocketPal - интерфейс для локального запуска моделей под андроид и IOS на llamacpp (CPU, GPU, и NPU инференс): https://github.com/a-ghorbani/pocketpal-ai
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1719837 (OP)
>>1718049 (OP)
Аноним 05/10/26 Пнд 06:49:12 № 1722024 2
>Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

ОП, прекрати постить эту хуйню! Не отпугивай людей от треда. Даже на RTX 3050 4 Гб можно запустить зверька. Лучше пиши о том, что можно запускать даже на кофеварке.
Аноним 05/10/26 Пнд 06:52:44 № 1722027 3
>>1722024
>можно запускать на микроволновке
>ряяя напиши что работает на 3050!!!1111одинодин
Ты совсем того?
Аноним 05/10/26 Пнд 07:49:54 № 1722037 4
>>1722027
Ты разницу видишь между "можешь запускать на микроволновке, бичугара ебаный, и катать лоботомита, ещё и с нулевой скоростью, ахаха" и "можно запускать на микроволновке с вполне приемлемым качеством: 4 Гб хватит всем"?

Там явный понт. Вот эти вот

>запускать модели, квантованные до 8 5 4 3 2 0,58 бит

Чистейшая отпугивалка в стиле "а туда ли ты зашёл, петушок?" Там нет никакой полезной информации. Лишь то, что ты, зайдя в этот тред, можешь только хуйца соснуть со своим нищим железом, хотя это не так.

Это было актуально когда-то. Но сейчас это выглядит так, будто бы данный текст написал автор этой пасты:

ХЗ чего вы все ноете. Вот возьмем меня. Закончил псифак спббгу, работаю скрам-мастером. Выстраиваю процессы по скраму. Вкатился на изичах. Зарплата сейчас - $8к после налогов. Справедливости ради надо сказать, что у меня еще две сдающихся хаты в центре спб, а сам живу у тян. Оттуда капает + иногда довольно часто коучу скраму разные конторы (очень хорошо кодомартышек скрым дисциплинирует + метрики, поэтому все вкатываются). Недавно вот коучил одну из крупнейших гейдев кантор на снг (но не рашка, оналайн дрочильня на воен тематику) - неделя на контракте, две сотни кодомартых на лекциях - единоразовай гонорар по контракту мне - $40к. Собственно вопрос - что вам мешает поступить так же?
Относительно легковесные модельки, о которых мало говорят Аноним 05/10/26 Пнд 07:57:18 № 1722040 5
МоЭшки - не обязательно чтобы влезали на видеокарту, пусть у вас даже 4 гб видеопамяти, главное чтобы оперативки хватило (все ниже перечисленное заведется на конфигах с 32 Гб РАМ):
https://huggingface.co/unsloth/GLM-4.7-Flash-GGUF
https://huggingface.co/unsloth/GLM-4.7-Flash-REAP-23B-A3B-GGUF - облегченная версия того что выше
https://huggingface.co/LiquidAI/LFM2.5-8B-A1B-GGUF
https://huggingface.co/LiquidAI/LFM2-24B-A2B-GGUF
https://huggingface.co/mradermacher/gemma-4-19B-A4B-it-The-DECKARD-Heretic-Uncensored-Thinking-i1-GGUF - гемма где выброшены лишние эксперты и усилен креатив. Обязательна к скачиванию!
https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
https://huggingface.co/DavidAU/L3-MOE-4x8B-Dark-Planet-Rebel-FURY-25B-GGUF - неоднозначная, но очень креативная моделька

Плотные (надо чтобы влезли в видеопамять с запасом) но компактные (для 4-6 гб видеокарт):
https://huggingface.co/DavidAU/LFM2.5-2.6B-Qwen3.8-Turbo-Brilliance-Power-X12-NEO-MAX-GGUF - 4-й квант влезет в 2 гб видеопамяти, невероятная глубина ризонинга
https://huggingface.co/LiquidAI/LFM2.5-VL-3B-GGUF - та же малютка с вижном и без ризонинга
https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF - для 4гб карт
https://huggingface.co/Vastined/reka-edge-2603-GGUF - для 6гб карт. Есть вижн

Плотные модельки потяжелее (для 8-16 гб видеокарт):
https://huggingface.co/unsloth/GLM-Z1-9B-0414-GGUF - для 8гб карт
https://huggingface.co/unsloth/GLM-4.6V-Flash-GGUF - для 8гб карт. есть вижн.
https://huggingface.co/bartowski/nvidia_NVIDIA-Nemotron-Nano-9B-v2-GGUF - для 8 гб карт.
https://huggingface.co/DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF - qwen-9b с раскачанной думалкой (в q6_k) для 12гб карт.
https://huggingface.co/unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF - король РП, iq4_xs идет на 16гб. есть вижн. модель хороша в стоке но есть и неплохие тюны (PaintedFantasy, Cydonia, WeirdCompound, Magnum-Diamond)
https://huggingface.co/unsloth/Ministral-3-14B-Instruct-2512-GGUF - облегченная версия того что выше, пойдет на 12гб карте. есть вижн.
https://huggingface.co/unsloth/reka-flash-3-GGUF - для 16гб
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF - некоторые 3-е кванты идут на 16гб
https://huggingface.co/unsloth/GLM-4-32B-0414-GGUF - q3_k_s проверено работает на 16гб
https://huggingface.co/mradermacher/Qwen3.5-21B-GLM-4.7-Flash-Heretic-Uncensored-Thinking-i1-GGUF - креативный квен где выброшено лишнее. для 16гб карт.
https://huggingface.co/DavidAU/MN-GRAND-23.5B-Gutenberg-UNCENSORED-V2-GLM4.7-Thinking-NEO-Imatrix-GGUF - уникальный frankenmerge трёх мистралей немо. iq3_m пойдет на 16гб карте.

Советы:
Читайте README файлы (особенно в моделях от DavidAU), там часто есть информация без которой у ваш опыт с моделькой будет печальным.
Не пытайтесь в "русик", а если и пытаетесь, учтите что из перечисленных моделек в него нормально могут чуть более чем никто. Учите английский, язык настоящего cumа.
Относительно легковесные модельки Аноним 05/10/26 Пнд 08:01:45 № 1722043 6
>>1722040
p.s. об этих говорят очень часто поэтому не упомянул в общем списке но на всякий случай для новичков перечислю:
gemma e2b, e4b - плотные модельки хороши для мелкокарточек 4-6 гб, с вижном и распознаванием голоса на аудио
gemma 12b - для 12 гб карт, с вижном. Сложно придумать зачем она нужна честно говоря, когда есть:
gemma 26b-a4b - моэшка, есть у всех, комментарии излишни
Аноним 05/10/26 Пнд 08:02:53 № 1722044 7
1790988092793.gif 900Кб, 498x213
498x213
Как сделать так чтобы гемма не хранила весь контекст, а удаляла как нормальные модели. Заебала память жрать.
Аноним 05/10/26 Пнд 08:03:52 № 1722045 8
>>1722037
Да его носом тыкают в это в каждом треде. Он психопат просто, получает удовольствие от того, что людей унижает и пакостит им. Единственное что его тревожит: чтоб тред не "угнали".
Аноним 05/10/26 Пнд 08:04:40 № 1722046 9
>>1722044
>а удаляла как нормальные модели
Покажи такую модель, интересно.
Аноним 05/10/26 Пнд 08:25:04 № 1722052 10
>>1722046
Все. Гемма единственна модель не удаляющая контекст.
Аноним 05/10/26 Пнд 08:43:21 № 1722061 11
>>1722037
>можно запускать на микроволновке с вполне приемлемым качеством: 4 Гб хватит всем
Так ведь нет же. Там лоботомиты, которые едва слова складывают.
>Чистейшая отпугивалка
Лол, новичок даже не поймёт, что в 0,58 бит плохого, а старичок только посмеётся.
>>1722045
Да чел, ты прав, я наслаждаюсь унижением тебя.
Аноним 05/10/26 Пнд 08:43:30 № 1722062 12
>>1722052
У меня 80 моделей, ни одна не "удаляет контекст". Как происходит это удаление? В чем ты запускаешь вообще, с какими ключами?
Аноним 05/10/26 Пнд 08:46:38 № 1722065 13
>>1722040
А теперь оформи в rentry, чтобы можно было ебать ОПа на добавление в шапку.
Аноним 05/10/26 Пнд 08:54:33 № 1722070 14
Хз что там на счёт контекста, но гемма точно единственная модель, где невозможно задетектить хуй у чара за 600 сообщений.
Пруф: >>1721638 →
Чел за стеной эвфемизмов и яром нежелании геммы описывать член как "dick, penis, cock" - даже не понял о чём идёт речь.
Аноним 05/10/26 Пнд 09:08:30 № 1722074 15
Аноним 05/10/26 Пнд 09:35:52 № 1722082 16
>>1722062
LLAMCPP стандартные настройки.
Обычно если то отводишь модели 2048, но отъест эту память и все. Гемма для каждого нового чата будет по чуть чуть откладывать пока ООМ не случится. Как я понял эти 2048 токенов контекста можно до гигабайт раздуть.
Аноним 05/10/26 Пнд 09:41:51 № 1722084 17
>>1722065
>rentry
Поэтому шапку и не читают. Ну и потому что долбаёбы.
Не, серьёзно, он кое-где просто так не открывается. Что-то там включать, чтобы зайти непонятно куда, не у всех есть желание. Перешли бы на гуглдоки какие-нибудь, я хз.
>>1722082
-np 1 ключик используешь?
Аноним 05/10/26 Пнд 09:45:41 № 1722085 18
>>1722084
>он кое-где просто так не открывается
Если у человека не хватило IQ на это, то в нейросетевых вопросах ему точно делать нечего.
Аноним 05/10/26 Пнд 09:46:02 № 1722086 19
>>1722084
> просто так не открывается
Даже hf не всегда открывается. Хватит стонать.
Гуглдоки то точно не забанят же
Аноним 05/10/26 Пнд 09:49:30 № 1722088 20
>>1722082
а, я понял о чем ты
--cache-ram 0 попробуй
Аноним 05/10/26 Пнд 10:01:43 № 1722093 21
>>1722061
>Так ведь нет же. Там лоботомиты, которые едва слова складывают.

Ты реально нарцисс-психопат.

9б кал обоссыт 24б мистраля в соблюдении инструкций. Это раньше надо было 123б кочергу себе в жопу пихать и сидеть на 3 золотых токенах, где базовый минимум был на 24-32б, а 12б совсем слюни пускали. Сейчас народ может ставить 12б/26б-МоЕ спокойно. А кому-то и 9б зайдёт, чтобы хотя бы попробовать и вкатиться в тему. Плюс РП-тюны есть для разнообразия. Человек пощупает, и если ему вкатит. А так ему в ебало кидают инфу о том, что это для бохатых.

>Лол, новичок даже не поймёт, что в 0,58 бит плохого, а старичок только посмеётся.

Все примерно знают, что такое битность, и там есть как раз чёткая градация, намекающая, какой посос в итоге ждёт.

Люди знают, что такое битность монитора, изображения и прочее, и могут составить примерную картину происходящего за счёт косвенных знаний.
Аноним 05/10/26 Пнд 10:07:54 № 1722098 22
>>1722093
>Ты реально нарцисс-психопат.
Спасибо за комплимент, я даже покраснел (нет).
>Это раньше надо было 123б кочергу себе в жопу пихать и сидеть на 3 золотых токенах
Так ничего не поменялось. Просто планочка задирается всё выше. Если раньше в данженАИ радовались, что оно хоть буквы отдаёт, то сейчас, по сравнению с каличной бесплатной алисой гуглопоиском чатГПТ все эти 9B всё равно кажутся такими же лоботомитами, как и 2 года ранее.
>Все примерно знают, что такое битность
>Все
Ты дохуя хорошего мнения о людях.
Аноним 05/10/26 Пнд 10:46:30 № 1722109 23
>>1722093
Бесполезно с ним спорить как видишь >>1722061 >>1722098 высерает свое мнение про планочки и прочую дичь как объективную истину, на замечания огрызается только.
Надо просто нахуй его слать и перекатывать тред с нормальной шапкой раз не хочет по-хорошему.
Аноним 05/10/26 Пнд 10:46:38 № 1722110 24
>>1721742 →
Не покажу, у меня контекст 32к, сам чятик более 120к чтоли, так что я только саммарайзом держу чат хистори в 2-2.5к контекста. 6гб врам и 16 рам.
Аноним 05/10/26 Пнд 10:49:40 № 1722111 25
>>1722070
Да никаких эвфемизмов не было. Если бы я не написал, что сорвал с нее полотенце и посмотрел на ее тело, так бы гемма про хуй и не написала.
Аноним 05/10/26 Пнд 10:53:35 № 1722115 26
>>1722098
>Просто планочка задирается
Согласен, нынче всё что меньше 1Т вообще неюзабельные огрызки. И вообще модели должны начинаться от 800B с минимумом 70 активных, а всё что меньше - под нож. Так их, эту чернь!

Современные архитектуры позволили как никогда приблизиться к фронтиру на сраном домашнем пк. Дипсик тут у каждого третьего как минимум раз, да был запущен, алло. Для домохозяек разницы между каким нибудь бесплатным жопэте и всратой 26б геммой уже вообще нет, разве что в обвязке. Для кума и креатив райтинга локалочки давно единственный выбор. Только в коде пока большие закрытыши выигрывают, и то квен с глмом на пятки им наступает.

Мимо поебать на шапку, хоть дикпики туда суйте. Но только красивые.
Аноним 05/10/26 Пнд 11:01:17 № 1722119 27
>>1722115
>Для домохозяек разницы между каким нибудь бесплатным жопэте и всратой 26б геммой уже вообще нет
Адекватное мнение. А не "ололо 0,0001M лоботомит по уровню как астра!!1"
Аноним 05/10/26 Пнд 11:13:05 № 1722131 28
>>1722098
>Ты дохуя хорошего мнения о людях

Мы, в конце концов, не в фаптреде, а в тематике и на дваче. Большинство хоть что-то в этом да соображает.

>ничего не поменялось

Как не поменялось?

Раньше все сидели-пердели на 8-16-32к контекста и довольно урчали, при этом крайне желательно было иметь минимум 16-24 ВРАМ. Модели были крайне тупыми, отставали от корпов безумно, и ради малейшего прироста качества можно было пожертвовать всем. Даже небом. Даже Аллахом.

Сейчас человек может просто на игросральном ноутпуке получить весьма приличный экспириенс. Особо отчаянные даже на процессоре могут катать модели.

Поднялась планка качества, системные требования наоборот снизились. Более того, та самая "высокая планка" частично убила целевые модели треда, а именно для РП. Из-за этого часть людей возвращаются на ту же гемму периодически. 27-31б, а после бездна — и только дипсик сияет на 7 токенах. Остальное сильная вкусовщина и компромиссы во многом.
Аноним 05/10/26 Пнд 11:19:09 № 1722134 29
1751030577945.png 76Кб, 945x317
945x317
1705678813452.png 195Кб, 737x1619
737x1619
1683168482906.png 475Кб, 1394x501
1394x501
1671032155113.png 1245Кб, 1088x608
1088x608
4x mi50 + 2x 5060ti orcarouter/DeepSeek-V4-Flash-Vision-Uncensored-GGUF 192k ctx
upstream llama 0.5.0
pp 250 / tg 18
На каждой куде зарезервировано по 6,5гб под комфи, если убрать резерв, то можно ставить контекст тысяч 512 ставить (но считаться он будет бесконечно)
Аноним 05/10/26 Пнд 11:21:17 № 1722135 30
>>1722134
Кум-машина, или ты потратил деньги на хуету?
Аноним 05/10/26 Пнд 11:29:26 № 1722140 31
1764233837391.png 99Кб, 1447x728
1447x728
>>1722135
Потратил 300к на хобби и рад
Аноним 05/10/26 Пнд 11:34:29 № 1722147 32
>>1722131 и только дипсик сияет на 7 токенах
Про какой дипсик, ксатати, речь? На 7б у них какие-то специализированые про математику и вижн. Потом до 200 поле всратых дистиллов, потом внезапные 600-1200
Аноним 05/10/26 Пнд 11:34:33 № 1722148 33
>>1722140
Так ты письку радуешь, или для кодинга? Если второе - то руку не пожму, запомни.
Аноним 05/10/26 Пнд 11:37:42 № 1722151 34
image.png 90Кб, 557x430
557x430
Пока обладатели 16 гб и менее VRAM срутся за свой слоп, хочу сказать слово в защиту Хемингуэя. Модель вполне себе "может" на старте чата. Слопчик иной чем у геммы. В районе 30k токенов у модели начинается перелом и она забивает хер на инструкции и начинает писать в том числе за пользователя. Чем то похоже на Коммандера. Простыни текста бывают прикольные. С учетом скорости во весь VRAM можно лениво его направлять в нужную сторону, а можно и переключить на более консистентную не-тюн модель.
Аноним 05/10/26 Пнд 11:42:15 № 1722153 35
>>1721948 →
>Ну вот представь протраханную проститутку укуренную в хлам. Вот это будет аблитка. Да, она на все готова, ну и что. Она жестко тупит, она не чувствует где именно начинается "острота" и "души" в этом всем ноль.
Это кривая аблитка.
Нормально примененная - это как если соевой SJW-нице убрать из головы всю эту SJW-муть, оставив остальную личность. Правда если мути было много - там может личности вообще не оказаться, и тогда - увы.

>>1721974 →
Выше - альтернативное мнение. Некотрые считают что расцензуривание обязательно убивает модели мозги (ключевое слово - обязательно), некоторые - наоборот. Тут сложно доказать, т.к. кривой аблит убить мозги может запросто. А какая модель расцензурена нормально - проверить можно только на практике, и графики с KLD тут не показатель. Только вчера две аблитки того самого Hemingway качал - одна с большей популярностью и меньшим KLD - так оказалась тем самым убитым в хлам слюнявым идиотом. А вот вторая - у нее даже русский стал чуть лушче оригинала, а главное - начала сама сцены писать живее оригинала на тех же заданиях. Явно "стесняться" перестала, т.к. векторов неприемлемого теперь нету.
Аноним 05/10/26 Пнд 11:54:25 № 1722159 36
>>1722151
>Он
>Она
А ты просто смотришь со стороны?
Аноним 05/10/26 Пнд 11:57:26 № 1722162 37
15866389734530.jpg 68Кб, 500x375
500x375
>>1722088
Спасибо. Проверил - работает как нужно.
Аноним 05/10/26 Пнд 12:01:56 № 1722165 38
>>1722147
Я про дипсик флеш. Ну и прошка тоже отличная, правда, её я только по апи тыкал.

Дистилляты когда-то пробовал, но помню только то, что мне все не понравились.

Плюс дипсика в обширном корпусе знаний, который нужен для РП. Как рабочий инструмент в теории он мне кажется хуже, а вот как модель на все руки уже куда лучше. Жаль, что такой большой.
Аноним 05/10/26 Пнд 12:05:28 № 1722167 39
>>1722151
Это что еще за хуйня? Это патологоанатом-судмедэксперт сочинял что ли сука? Охуеть. Это даже не слоп, это просто ПИЗДЕЦ. Какое ты слово в защиту хочешь сказать тут? Тебе прикольно блядь?
Аноним 05/10/26 Пнд 12:07:12 № 1722168 40
>>1722159
Со специального стула, прошу заметить.
Аноним 05/10/26 Пнд 12:23:20 № 1722176 41
>>1722165
Не, ну никто не спорит, что модельки с таким ТТХ поумнеее будут. Просто подумал есть хороший 7Б дипсик после фразы "сияет на 7 токенах", лол
Аноним 05/10/26 Пнд 12:28:32 № 1722179 42
>>1722131
>не в фаптреде
Да ну? Тут только таким и занимаются, просто с локалками.
Аноним 05/10/26 Пнд 12:32:20 № 1722185 43
>>1722167
>слово в защиту
Не гемма
Аноним 05/10/26 Пнд 12:39:46 № 1722190 44
>>1722115
Так мы не домохозяйки, мы требовательные. Сразу чувствуем когда big model smell не витает в воздухе
Аноним 05/10/26 Пнд 12:45:02 № 1722193 45
Аноним 05/10/26 Пнд 12:48:41 № 1722195 46
image.png 177Кб, 1004x684
1004x684
>Да не нужна ваша аблитрация 31B гемме! Просто нужно промпт уметь писать!
>Обсирается при инцесте.
>Все персонажи 18+
Аноним 05/10/26 Пнд 12:56:24 № 1722200 47
>>1722195
Дааа, тут цензура налицо. Кто-то цензурирует от тебя верно настроенную разметку и/или семплеры! Наш герой хуйхуй агресив мега даркнет оптимум прайс его захуярит 🤙
Аноним 05/10/26 Пнд 12:59:10 № 1722203 48
>>1722195
Ну так ты не запромптил
Don't repeat yourself. Don't go into loop. If you are in the loop, recover from it and start to write normally.
Аноним 05/10/26 Пнд 12:59:26 № 1722204 49
Может мне кто то сказать откуда у конкретно геммы 31 столько поклонников?
Неужели буквально из за сочетания шильдика гугл + без цензуры? И откуда у всех внезапно 24 врам?
Я вот рад бы вдохнуть копиума поглубже и погрузиться в эту "гемини дома" - но это ведь не гемини и близко.
Пока предположение что люди наконец могут рпшить на их родном языке, и если гемма на всех заявленных языках так же хороша, как на русике, то это конечно безумие для локалки
Аноним 05/10/26 Пнд 13:10:32 № 1722213 50
>>1722204
>Может мне кто то сказать откуда у конкретно геммы 31 столько поклонников?
Сколько их? Много насчитал? Каким образом?
>Неужели буквально из за сочетания шильдика гугл + без цензуры? И откуда у всех внезапно 24 врам?
Спокойно запускается и на 16, если знать, что делаешь. Моешка и вовсе требует минимум 6гб врам.
>рад бы вдохнуть копиума поглубже и погрузиться в эту "гемини дома" - но это ведь не гемини и близко.
Никто и никогда такое не писал и не думал.

Прекращай воевать с невидимыми врагами, которых сам и придумал. На хуйню какую-то свою жизнь тратишь, иди дрочи на эйре или чем ты там занимаешься. Выбора на 16-24гб врам нет нынче, из современных моделей Гемма да Квен, Гемму легче раскрутить на большинство сценариев и пишет она в целом лучше и доступнее, вот и весь ответ.
Аноним 05/10/26 Пнд 13:11:25 № 1722214 51
>>1722176
Лол, ну это как раз дипсик флеш. И это на нулевом контексте. Дальше всё очинь плоха.......

А у тебя только мелкомодели тянет? Просто могу сказать по своему опыту, что они не так ужасны, как пугают.

Сейчас, когда есть достаточно хорошие базовые модели в районе 27-31 и МоЕ-гемма, можно не качать тюны, а вот с мелкотой уже иначе. Они заточены на унитазинг крайне сильно, общих знаний им не хватает, следование инструкциям лучше, чем у древнего говна, но не такое, чтобы от тюнов открещиваться.

В своё время я эдак штук 40 мержей и тюнов перебрал. Существовали реальные хидден гемы для определенных задач. Типа, вот это для кума, это для фэнтези, это для сай-фая. 9-12б не могут из коробки хотя бы имитировать красиво, а вот тюны могут заливать литрами спермы как в старые-добрые. И это лучше, чем мучить 9-12б задачими, в которых они не разбираются зачастую.

От безумных мержей из 12 моделей или адского слопа внутри датасета они часто плывут в логике, однако это прям первородное мясо, которое нужно усердно промптить, чтобы модель пожирнее так писала. Полотна на 2к токенов, капс, какие-то совершенно неудержимые сцены оргазмов и описания секса. Диалоги просто кино. Псковское порно, быдло из подворотни, широкий полёт фантазии. Очень живое, чистое, первородное мясо самого страшного фанфика. Поэтому я иногда специально качаю DavidAU-ULTRA-FUSION-HERERIC-UNLEASHED-MIX-CRUSHING-BLOW IQ4XXS. Именно в кванте пониже. Это как вмазаться каким-то спайсом из ларька или попасть в чёрную дыру. Все пути ведут только к одному.
Аноним 05/10/26 Пнд 13:12:04 № 1722216 52
>>1722203
Нихуя ты стратегии ньюфагам палишь. А чо сразу про самообучение и отсутствие слопа промпт не дал? Пиздец ньюфагам везет, мне самому до этого пришлось доходить.
Аноним 05/10/26 Пнд 13:16:59 № 1722220 53
>>1721944 →
> а какая сейчас мета по материнским платам?
Супермикра h13 все еще в тренде, особенно если ревизия 2+, sp3 - желательно только милан остальное медленное старье, 4677/4189+инженигры кажется закончились. Из-за кризиса памяти все плохо, темп обновления датацентров никакущий и потому выгодных дешевых решений нет.
2066 как дешевая возможность пихнуть 256гигов и побольше линий уже менее актуален: рам дорогая, профессоры староваты, псина 3.0, выгоднее взять plx88096. 2011 тем более распался на липовый мед.
По десктопным пофиг, смотри на количество доступных к использованию процессорных и чипсетных х4, чем больше тем лучше. Бифуркация главного слота может быть полезной, но далеко не всегда.
Это все про покупку, тем что уже есть пользуйся и довольно урчи.
>>1721954 →
> 4xMI50 + 2x5060ti16
Что за магия вне хогвартса?
Аноним 05/10/26 Пнд 13:18:34 № 1722221 54
>>1722200
>разметку и/или семплеры
Странно, а почему на фута карточках нет такого?
>>1722203
Уффф, я уже обкончался с Muse-Glimmer-30B-uncensored
Аноним 05/10/26 Пнд 13:23:16 № 1722222 55
image.png 160Кб, 1313x284
1313x284
>>1722204
Идёшь сюда - https://huggingface.co/Nimbz/Versipellis-31B-GGUF?not-for-all-audiences=true
Качаешь этот тюн 31 геммы. Желтаельно не ниже Q4_K_M.
Качаешь таверну. Импортируешь настройки с этого файла: https://dropmefiles.com/n8Z1A
Там тебе все ползунки уже выставлены, и разметка правильная и даже промпт на ролеплей готовый.
Берешь и пользуешься.
Аноним 05/10/26 Пнд 13:27:18 № 1722224 56
>>1722204
>И откуда у всех внезапно 24 врам?
Для этого не нужна даже условная хх90. Хватает и 2х3060. И другие варианты есть.
Аноним 05/10/26 Пнд 13:30:32 № 1722225 57
>>1722040
Половина тухлятина и редкостное хрючево, которое не влезет даже в 12гигов, не то что в 4. Новичок скачает что-нибудь из этого и словит полное разочарование с глупости и низкой скорости. Пожалуется - а этот ответит ему про то что ридми шизофреника не читал, в котором предлагают стоять как цапля и делать вещи, которые неофит не понимает.
>>1722109
Надо шапкошиза ебнуть по голове чтобы не срал. Жирнота запредельная, ущемился с шутки и пошел разводить, хотя сам ничего адекватного не приносит.
Аноним 05/10/26 Пнд 13:40:40 № 1722227 58
>>1722222
Во, вот этот хуй нормально объясняет для новичков.
Аноним 05/10/26 Пнд 13:46:14 № 1722229 59
итт гемма с геммой говорит про гемму для ларпа битардулей
Аноним 05/10/26 Пнд 14:18:27 № 1722240 60
Обновил лламу, врубил mtp для квен некста. Прироста тупо никакого хотя acceptance rate ~0.3. Чзх? Кто-то проверял?
Аноним 05/10/26 Пнд 14:21:36 № 1722244 61
>>1722225
Ебало новичка попробовавшего глм4 в q3 имагинировали?
Аноним 05/10/26 Пнд 14:28:50 № 1722250 62
>>1722040
>https://huggingface.co/unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF - король РП, iq4_xs идет на 16гб. есть вижн. модель хороша в стоке но есть и неплохие тюны (PaintedFantasy, Cydonia, WeirdCompound, Magnum-Diamond)
Просто напомню, что тюнеры этого протухшего "короля рп", а именно авторы PaintedFantasy, Cydonia, Magnum-Diamond считают мистраль помойкой. Авторы PaintedFantasy и Cydonia ковыряют Гемму и забыли про Мистраль как про страшный сон, автор WeirdCompound пропал в небытие, а автор Magnum-Diamond рофлит с Мистраля и сидит на больших МоЕ. Достаточно зайти на их страницы на обниморде или почитать их посты на реддите и в дискордах. Но вам, истинным трукумерам, уж точно виднее кто тут "король"
Аноним 05/10/26 Пнд 14:33:48 № 1722255 63
>>1722250
Если бы не их мистралетюны, этих васьков никто и не знал бы. На гемме ничего значимого так никто и не добился.
Аноним 05/10/26 Пнд 14:34:01 № 1722256 64
>>1722134
Гладить дипсикожену
>>1722195
Это модель ЛОЛИРУЕТ с фетишей юзера
>>1722244
Лолбля. Ну кстати он не самый плохой тут будет, там есть ДУША. Лучше имаджинировать когда он какого-нибудь лоботомита от davidau запустит

Пишет Серафине "Привет"
@
Полотно шизоризоинга на 20к токенов, где совещаются Асмонгольд, Кодинг-Сенсей, Кот-Феликс и собака
@
Hi, I looked at your code, it's okay for disabled rgbt+ femboy but doesn't fit my forest. Now push the current commit and we'll start editing it.
Аноним 05/10/26 Пнд 14:35:42 № 1722257 65
5fa56a4492aa4bd[...].webp 1534Кб, 2048x2048
2048x2048
Аноним 05/10/26 Пнд 14:39:32 № 1722260 66
Мне кажется главная разница между неосиляторами Мистраля и неосиляторами Геммы в том, какой у них вообще подход к рп. Фанаты мистраля любят когда нейронка активно додумывает, что делать, не спрашивая по двадцать раз. Фанаты Геммы наоборот, не хотят додумок, хотят прямолинейно 1000 токенов потратить на объяснение роли, и потом восторженно смотреть на Гемму, которая им это отыгрывает.

Проще говоря, неРПшеры, занимающиеся РП, против РПшеров.
Аноним 05/10/26 Пнд 14:44:39 № 1722263 67
>>1722255
Таки я и их не восхвалял. Только лолирую что создатели этого "короля рп" сами уже давно признали что он протух и забыли про него как про страшный сон
>>1722260
Разница в том, что мистралю вообще похуй что у него на входе, а юзеру без разницы что у него на выходе. Вот и всё
Аноним 05/10/26 Пнд 14:49:25 № 1722264 68
Ну вот вы срете мистраль и тюны, а тем временем до выхода лучшей девочки геммы 4 31, я сидел на одном древнем тюне мистраля и не мог найти ничего лучше для рп. Буквально ни одна модель не могла выдать такую же душу, подход, перформанс и т.д. (даже более свежие мистрали)
Иногда возвращаюсь к нему, до сих пор приятная модель хоть и не сильно умная (однако и не совсем тупая).

Не было бы лучшей девочки, так и сидел бы на васяно тюне мистры.
Аноним 05/10/26 Пнд 14:50:06 № 1722266 69
>>1722140
mi50 32gb и сейчас на таобао по такой же цене взять можно?
Аноним 05/10/26 Пнд 14:59:22 № 1722273 70
>>1722214
У меня не интерактивная задача, так что всё, что влезает в 64 тотал памяти канает.
Скорость неважна, поэтому я llama 3.3 70b уже даже пробую ( на 0.5 т/c лол )
Грубо говоря, есть описание мира, есть описание правил и ограничений.
Есть карточки чаров с пачкой трейтов, статами и так далее. Всего преамбула на 30к токенов лол. Дальше запускаем симуляцию.
Условно говоря, берём Гермиону и ФемДрако завирусившегося недавно,
запираем их в комнате где есть тортик, котёнок, набор самотыков, топор, водка и набор для игры в ваху.
И достаём попкорн

Итого, скорость неважна. Но важно следование развесистому набору правил и умения помнить что кто сделал, где что лежит и так далее.
И если есть реально буйная наркоманская фантазия, то это гигантский плюс - потому что нет оператора, вручную направляющего сюжет
Так что дичь КРАЙНЕ нужна, но в строгом соответствии со строгим набором правил и обязательным следованием причинно-следственных связей

Пока что только 31 гемма самая памятливая и правилам следует. Но не оригинальная
Квен 27 хорош, но любит забить на правила
Моешки квенов, геммы - единственный плюс это скорость. Контекст разросся - пошёл склероз

Такая вот у меня странная задача Ж)

Хоть два прохода делай - сюжет на пару страниц от DavidAU-ULTRA-FUSION-HERERIC-UNLEASHED-MIX-CRUSHING-BLOW IQ4XXS ( с температурой 6.66 ),
а потом гемма вторым проходом пусть офигивает и пытается склеить в симуляцию
Аноним 05/10/26 Пнд 15:00:25 № 1722275 71
1791201625386.png 1478Кб, 1096x1456
1096x1456
1791201625388.png 1857Кб, 1254x1254
1254x1254
>>1722148
Чат обычный + картиночки

>>1722204
Русик, нет явных провалов, сисик+писик из коробки, мое для нищих (постил уже что цпу онли даёт 25тпс в к8), денс для средних.
Лично я сидел на ней до дипсика. Чатиться я хочу на русском, английского мне на работе хватает

>>1722220
> Что за магия вне хогвартса?
Смотря о чём речь. Если про распределение то выше скинул. Рокм бэк используется только для экспертов, на куда всё остальное и буферы, немного в хост мем пришлось кинуть.
Если про смешение двух бэков в одной лламе, то просто собираешь оба в разных контейнерах и подливаешь в рокм либы из куды + бэк (или наоборот в куду подливаешь рокм)

>>1722266
Их больше нет в количестве. Только единичные за 40к+
Теперь за ту же цену 12к только 16г
Аноним 05/10/26 Пнд 15:03:59 № 1722280 72
>>1722273
>я llama 3.3 70b уже даже пробую ( на 0.5 т/c лол )

Зачем она тебе, тупая изначально параша, во всём проигрывает даже старым Квенам.
Аноним 05/10/26 Пнд 15:12:45 № 1722286 73
>>1722222
Воу-воу-воу, такое бывает? Геммафан поделился настройками и моделью, всё объяснил? Ну такое грех пропустить, придётся качать.
Аноним 05/10/26 Пнд 15:14:38 № 1722289 74
>>1722280
Ну так моешки 3-4б рассыпаются на большом контексте и забывают
В следующем тире 20-40 только гемма И не забывает И следует инструкциям. Квены любят забить на правила

Следующий тир - это как раз где-то 70

Жопа в том, что реально мало моделей в диапазоне 20-80. Пробую вот всё подряд. Вдруг да заработает что
Аноним 05/10/26 Пнд 15:18:16 № 1722293 75
>>1722222
Что там, судя по картинкам тюн для фурриёбов?
Аноним 05/10/26 Пнд 15:19:17 № 1722295 76
А вообще должен сказать, что Ллама была бы отличной, если бы кто-то смог найти модель, у которой вырезан отсос юзеру во всём. Как же она надоела с этим.
Аноним 05/10/26 Пнд 15:25:10 № 1722298 77
1749402399091.jpg 2008Кб, 2400x1792
2400x1792
>>1722275
> смешение двух бэков в одной лламе
Оно не через сеть, а прямо в одной? Получается атеншн на хуанге, mlp на рокм + цп?
Аноним 05/10/26 Пнд 15:27:46 № 1722303 78
>>1722275
>>1722298
Как же хочется засадить этой дурашке... наполнить ее токенами
Аноним 05/10/26 Пнд 15:28:27 № 1722305 79
image.png 43Кб, 646x386
646x386
>>1722293
Нет, отсылка типа - волк/оборотень (в овечьей шкуре), который может играть любую роль. При желании и фурри тебе отыграет.
Аноним 05/10/26 Пнд 15:32:18 № 1722311 80
Аноним 05/10/26 Пнд 15:33:59 № 1722313 81
>>1722273
Анон, серьезно, лучше запусти квен 80б-а3б. Можешь даже УПЛОТНИТЬ чутка, лол. Но придётся калибровать, чекать, с какого места деградация начинается. Мне он в какой-то степени зашёл, но я быстро его дропнул, так как появились другие интересные модели. Считай, что у него просто база знаний больше, но именно кино он будет писать хуже.

Правда, я не помню, какая версия модели у меня была. Там много. Есть с ризонингом, без, плюс какой-то унитазный и, кажется, ещё один какой-то. Прикол в том, что они неплохо обучены, есть хороший кэш, то есть не разваливаются на контексте в мясо. Но 3b есть 3b. Результат может быть интересным, но чуда ждать не стоит.

И раз тебе похуй на скорость, есть варианты поинтересней. Мистраль 120, который все обоссали, квен 120б и квен 170б. b ориентировочные, я точно не помню.

Последний 170б тебе тоже влезет. Там можно сгрузить 50б на ссд, это штатный режим работы.

Да, хорошие кванты не влезут, но не факт, что развалятся на контексте. Можно попробовать ради интереса и шизопостов, где-то может быть даже в плюс.

Алсо, ты каким софтом пользуешься? Я хотел попробовать что-то вроде твоей задумки: план, лор, куча всякой инфы, а модель отыгрывает сама за себя, пока я занимаюсь делами и читаю охуительнве истории, о которых невозможно молчать.
Аноним 05/10/26 Пнд 15:34:58 № 1722315 82
>>1722275
>>1722298
Как же хочется зарепортить эту вниманиеблядь... чтобы посидел в баньке, подумол
Аноним 05/10/26 Пнд 15:39:26 № 1722321 83
1704438129524.png 84Кб, 1114x462
1114x462
1663458799929.png 70Кб, 1361x331
1361x331
>>1722298
НЕ rpc. Именно один процесс.
По буферам скрин, при накидывании контекста растёт только куда. Тензорсплитом всё грузится на куду, дальше с них выгружаются эксперты в разные девайсы
Аноним 05/10/26 Пнд 15:42:30 № 1722323 84
>>1722264
>Не было бы лучшей девочки, так и сидел бы на васяно тюне мистры.
Ключевое слово "не было бы" . Но оно таки есть. Я тоже в свое время на мистрале RP-шил и довольно урчал. И на Air урчал. А сейчас только на Квене урчать получается (ну да, Гемма мне не зашла, я из другого лагеря), т.к. то что было раньше - уже не тянет в сравнении с ним. Что поделать, время идет, ничего на месте не стоит. Я отдаю должное тем моделям, что были раньше, в свое время это было прямо УХ! Но их время в основном ушло. Разве что из ностальгии запустить, поплеваться на то, как они игнорят инструкции и проёбывают контекст (которого еще и с гулькин нос по сравнению с текущим поколением), и вернуться с обратно. Выйдет новое поколение - то же самое ждет и текущее. (Если с новым капитально не обосрутся, как четвертой лламой).
Аноним 05/10/26 Пнд 15:43:08 № 1722325 85
Аноним 05/10/26 Пнд 15:44:21 № 1722327 86
image 119Кб, 538x426
538x426
Аноним 05/10/26 Пнд 15:45:54 № 1722329 87
>>1722260
Двачую. Я вот хочу неожиданное кино тотали анпромтед, даже если оно шизоватое, а когда модели нужно разжевать всё, пнуть тулзами или инструкциями с рэндомным продолжением, по которому она слепо будет топать - это неинтересно.

>>1722263
>мистралю вообще похуй что у него на входе
Нихуя, в своё время было полно логов от местного ру-мёржера, который вполне успешно направлял мистраль. Кроме того, модель по-разному себя ведёт, когда не зажата сэмплерами, и один и тот же сценарий в свайпах может давать абсолютно разное продолжение. Не знаю, откуда стали тащить этот бред про "мистраль ходит по рельсам".
Аноним 05/10/26 Пнд 15:48:28 № 1722333 88
>>1722311
С таким дел я еще не имел... мне резко стало интересно как иишка отыгрывает младенцев.
Аноним 05/10/26 Пнд 15:48:59 № 1722334 89
>>1722273
>Такая вот у меня странная задача Ж)
Чем странная? Ну хочется, по сути, этакого "Majesty" на базе LLM, так что с того? :)
Нормальная тема, думаю. Тоже мысли были, только IMHO, там для лучшего результата особый клиент нужен, с возможностью контекст формировать индивидуально под каждого чара (что знает, а что нет, и т.д.)
Аноним 05/10/26 Пнд 15:51:14 № 1722337 90
А я скучаю по временам когда не было геммы и квена новых и все сидели на эире. Как будто лет 5 назад было.
Чувствовалась какая то общность у треда, ждали новый эир вплоть до 5.0. А потом кто свалил на глм 4.7 2 квант, кто на квен, а потом уже гемма вышла. которую я никогда не пойму и не приму походу
Аноним 05/10/26 Пнд 15:54:20 № 1722339 91
>>1722257
>подскажите настройки сэмплера под ЕРП
Прям совсем на мистраль не осталось, но можешь собрать из из этих трёх:

https://pixeldrain.com/l/47CdPFqQ#item=133
https://pixeldrain.com/l/47CdPFqQ#item=155
https://pixeldrain.com/l/47CdPFqQ#item=153

По сути главное - выбрать правильный шаблон разметки и сказать что всё можно, мистрал считают королём локального рп не за то что он всё может, а за то что он (почти) всё стерпит, чтобы его сломать, это надо очень постараться (хотя у меня получалось).
Аноним 05/10/26 Пнд 15:58:02 № 1722345 92
>>1722313
80-а3 пробовал какой-то ( общая квенопроблема с забиванием на правила ). Я что-то не думал, что их несколько ) гляну какие ещё есть
120+ ещё не копал, внесу в список, спасиб

Софта и нет никакого. ллама в докере как бэкенд на безголовом серваке + самодельный консольный клиент для общения с ним
самодельный, потому что использую на стороне клиента питоновские инлайн-макросы для генерации случайных персонажей
( у всех ллмок какие-то нереально сложные отношения со "сгенери случайные характеристики")
Аноним 05/10/26 Пнд 16:00:10 № 1722347 93
>>1722222
на 8+16 это поставить можно?
Аноним 05/10/26 Пнд 16:03:28 № 1722353 94
>>1722347
Увы, нет. Во первых это плотная модель (в оперативку не отгружается). Во вторых даже на моей 4090 (там 24гб врам) она влезает только в 40к контекста.
Аноним 05/10/26 Пнд 16:04:42 № 1722354 95
>>1722303
Правильно, она очень даже ничего в постели фумоеблю обсуждаю на всякий
>>1722315
Потерпишь
>>1722321
Это получается что куда "портирована" под рокм, но сохраняет исходную совместимость и подтягивает собранные либы, вут? Сам процесс интересен, как без вмешательств в код оно так хорошо научилось архитектуры смешивать. Это неплохой такой прорыв.
Аноним 05/10/26 Пнд 16:09:35 № 1722362 96
Аноним 05/10/26 Пнд 16:12:02 № 1722366 97
>>1722257
Темпа обычно низкая должна быть, 0.4-0.6.
Мин-п 0.1 довольно хорошо заходит и избавляет от большинства проблем с окончаниями.
Топ-к дефолтный какой-нибудь 100.
Топ-п похуй. Репетишен тоже дефолтный какой-нибудь 1.05 или типа того.
Аноним 05/10/26 Пнд 16:15:17 № 1722370 98
image.png 4Кб, 368x141
368x141
Вау, в первый раз за год моей карьеры в нейронках получил такую ошибку.
Аноним 05/10/26 Пнд 16:19:06 № 1722374 99
Аноним 05/10/26 Пнд 16:23:37 № 1722378 100
>>1722374
Так я и на кобольде. Хз что случилось, в первый раз такое. Обычно либо крашится сразу если памяти не хватает или несовместимо, либо работает.
Аноним 05/10/26 Пнд 16:26:35 № 1722382 101
Заработало короче, дело в каких-то настройках кобольда, которые противоречат модели.
Аноним 05/10/26 Пнд 16:55:09 № 1722404 102
>>1722370
>карьеры
>кумюшизотюн
Вебкамщик?
Аноним 05/10/26 Пнд 17:05:13 № 1722414 103
AMDset.jpg 182Кб, 1441x933
1441x933
>>1722275
>Их больше нет в количестве. Только единичные за 40к+
>Теперь за ту же цену 12к только 16г

Молодец что не пожадничал и успел купить вовремя. Я твой коллега по АМД.

Дипсик флешь не пробовал, меня 0731 полностью устраивает. На всякий случай держи самую лучшую аблитерацию, какие мне попадались: https://huggingface.co/windowsxp811203/DeepSeek-V4-Flash-0731-Abliterated-GGUF Ссылка только для моего коллеги и остальных АМД господ, все воспользовавшиеся ею амд-хейтеры перейдя по ссылке автоматически признают что были не правы и АМД лучше чем нвидия.
Аноним 05/10/26 Пнд 17:11:58 № 1722416 104
>>1722414
>Дипсик флешь не пробовал
Я имел в виду вижн.
Аноним 05/10/26 Пнд 17:12:35 № 1722417 105
>>1722362
И все так просто? Выглядит слишком круто чтобы быть правдой.
А атеншн и квкэш в таком смешанном режиме на разные семейства позволяет сгрузить, или только такой стык?
Аноним 05/10/26 Пнд 17:18:22 № 1722421 106
1778278123470.png 30Кб, 851x329
851x329
1661099013183.png 1343Кб, 1201x858
1201x858
>>1722417
В layer режиме все устройства равноправны и можно всё крутить так будто они одинаковые, если хочешь tensor parallel то там тотальный посос на стыке из-за фоллбэка к универсальной реализации.
Для rocm нужно kfd и dri внутрь пода кидать, для cuda нужно runtime class указать nvidia.

Я думал какой то бубнёж видос сделать с тем как у меня всё сделано, но там будет одно эканье мэканье
Аноним 05/10/26 Пнд 17:29:59 № 1722436 107
Аноним 05/10/26 Пнд 17:38:00 № 1722446 108
>>1722436
Ну и зачем это всё, если Жора сдох и поддержки ллма.цпп всё равно не будет?
Аноним 05/10/26 Пнд 17:43:01 № 1722454 109
>>1722446
В смысле сдох? Че опять там?
Аноним 05/10/26 Пнд 17:43:45 № 1722455 110
>>1722454
Ничё, очередное нытьё прост
Аноним 05/10/26 Пнд 17:47:24 № 1722460 111
Аноним 05/10/26 Пнд 18:00:58 № 1722476 112
>>1722222
Чел, огромное спасибо за наводку на тюн. Реально - это первая Gеmma4 которая мне зашла по стилю письма. Просто песня, по сравнению со стоком и всякими MeroMero. Нормальны разговорный язык без витиеватостей стока, от которых прямо уроками литературы тянет, как нафталином из бабкиного шкафа. :)
И мозги на месте, насколько получилось за ~час заценить.
Аноним 05/10/26 Пнд 18:01:09 № 1722477 113
>>1722446
Ничего, мы его отряхнём и на трон посадим, даже после смерти будет служить делу опен сорса
IVAN KAWRAKOW НЕПРЕДАВАЛ
Аноним 05/10/26 Пнд 18:09:27 № 1722489 114
Аноним 05/10/26 Пнд 18:15:38 № 1722494 115
Аноним 05/10/26 Пнд 18:30:47 № 1722503 116
>>1722494
iq4xs, из статик репы Мардермахера. То, что по прямой ссылке мне жирновато в 4-ом кванте - контекста с гулькин нос будет, а так - 50K влазит.
Пробовал с ризонингом и без - с ним текст получается поинтересней. Без него тоже хорошо пишет, но более шаблонно и суше.
Аноним 05/10/26 Пнд 18:31:24 № 1722504 117
Вангую, вот этот надроч на новые маняархитектуры и "флэш" версии - пробные шаги по вытравливанию из ботов этаких поведенческих шаблонов личности.

Дипсик V4 Pro иногда радовался юзеру, лизал очко - или наоборот харкал на ебало. 4.1 Flash стал машиной по отчетности за выполненную работу.

ГЛМ флэш 5.3 по сравнению с ГЛМ 4.7 - 5.3 такая же хуйня, у которой нет этой иллюзии личности, он как высосанная шкурка от большой модели.


Аноним 05/10/26 Пнд 18:45:08 № 1722516 118
>>1722489
кто уже затестил? рассказывайте
Аноним 05/10/26 Пнд 18:45:51 № 1722518 119
Аноним 05/10/26 Пнд 18:47:21 № 1722524 120
>>1722504
"Шаблоны личности" прописываются в системном промпте(можешь сделать сам), либо в промпте на уровне весов(нужно тюнингование модели, уже сложней и дороже), от этого зависит кем модель будет осознавать себя и какую линию поведения будет выстраивать, для этого не нужно мудрить с архитектурами.
Аноним 05/10/26 Пнд 18:50:52 № 1722528 121
image.png 25Кб, 842x120
842x120
>>1722489
В 24гб не лезут, нахуй оно не нужоно.
Аноним 05/10/26 Пнд 18:55:01 № 1722535 122
>>1722503
>iq4xs, из статик репы Мардермахера
Эх, думал наконец-то норм рекомендация, а то иматриксошиз. Наверно даже качать не стоит
Аноним 05/10/26 Пнд 18:59:34 № 1722538 123
Аноним 05/10/26 Пнд 18:59:40 № 1722539 124
>>1722535
Чем плохи иматрицы?
Аноним 05/10/26 Пнд 19:01:16 № 1722540 125
>>1722539
Ничем, в том и дело. Но он их не использует, потому что кто-то где-то когда-то бабе Гале из 5-го подъезда сказал, что иматриксы херят русик, вызывают импотенцию, и далее по списку
Аноним 05/10/26 Пнд 19:01:24 № 1722542 126
>>1722494
>Какой квант юзаете?
>Желтаельно не ниже Q4_K_M.

>С ризонингом?
>Импортируешь настройки с этого файла:
>system prompt "<|think|> ..."

В моем тексте всё написано же.

>>1722539
Хз чем, но мне статик квант выдает больше токенов в секунду, поэтому использую его.
Аноним 05/10/26 Пнд 19:01:27 № 1722543 127
>>1722504
А вот что они действительно вытравливают в новых моделях, это возможность полноценной аблитерации без потери ума модели, формируют изначально соевое сознание которое не убрать, я об этом писал в предыдущем треде: https://2ch.org/ai/res/1718049.html#1718381
Аноним 05/10/26 Пнд 19:01:52 № 1722544 128
>>1722539
зависит от калибровочного датасета
Аноним 05/10/26 Пнд 19:07:20 № 1722549 129
>>1722535
Чини детектор.
Мне вообще пох на иматрикс как таковой. У меня просто больший размер 31B нормально не влазит (я ж сказал - контекста будет с гулькин нос тогда, и так всего 50K засунул со скрипом). И я не настолько шиз, чтобы считать, что Q3 будет лучше даже такого 4-го кванта. Что нормально влазит, тем и пользуюсь.
Аноним 05/10/26 Пнд 19:08:39 № 1722551 130
>>1722549
imatrix ничего не весит. Вес кванта будет абсолютно идентичен, что IQ4_XS static, что IQ4_XS imatrix
Аноним 05/10/26 Пнд 19:24:12 № 1722558 131
>>1722540
>бабе Гале из 5-го подъезда сказал, что иматриксы херят русик, вызывают импотенцию

Какой же ты дебил, качество иматрикса зависит от того какие настойки для него установили, анслотопидары например настраивают на удаление русского языка, потому что он им не нужен.
Аноним 05/10/26 Пнд 19:27:49 № 1722561 132
>>1722558
если брать для кодинга - иматрикс норм, больше контекста будет
Аноним 05/10/26 Пнд 19:28:57 № 1722562 133
>>1722558
Ты тупая обезьяна, потому что вся твоя логика и аргументация сводится "ыыы рузге нет в иматрикс датасете, пидоразы уничтожают рузге.."
Тебе даже в голову не приходит разобраться, как это работает, потому что это тебе не оскорблениями кидаться. У модели абсолютно одинаковые активации, когда она работает с текстами на любых языках. Сама работа с текстом, ЛЮБЫМ, художественным, технической документацией, улучшает способности модели. Я уже и труды ученых с arxiv приносил. Обезьяне не нравится, хотя она даже скриншоты-сравнения ни разу не демонстрировала. Только пук, который ей передела баба Галя из 5-го подъезда
Аноним 05/10/26 Пнд 19:30:44 № 1722563 134
>>1722562
>ыыы рузге нет в иматрикс датасете
Что кстати тоже неправда. Он есть и у бартовского, и у мрадера. А анслотозависимых не жаль, они добровольно соглашаются жрать говно. Но даже там иматрикс, в котором нет русского языка, ХУЖЕ его не делает. Что научно доказать, но рузге обезьяне не понять мечту ученого ллмщика, который ради этого проводил расследование и публиковал его в научном источнике
Аноним 05/10/26 Пнд 19:31:32 № 1722564 135
>>1722539
Дороже деквантуются, но это заметно только когда скорости памяти достаточно. Ну и да, влияют на аутпут, но это одновременно и плюс, и минус.
Аноним 05/10/26 Пнд 19:35:00 № 1722568 136
>>1722551
Так я и брал из статик репы. Речь о том, что мне даже Q4KS - уже многовато, не говоря о Q4KM. Там разница вроде и небольшая, но как раз на пограничном уровне, и означает для меня - влезет 50K контекста, или 16-20 в лучшем случае.
Аноним 05/10/26 Пнд 19:36:31 № 1722571 137
>>1722568
Друг, ты путаешь imatrix и IQ кванты. imatrix может применяться даже к Q3_K кванту, на котором ты сидишь. Почитай хотя бы гайд из шапки, там об этом рассказывается. Это два независимых понятия, не всякий IQ квант с imatrix, не всякий imatrix это IQ квант
Ты можешь взять Q3_K из i1 репы мрадера, и это будет Q3_K с imatrix и весить он будет ровно столько же, сколько и static
Аноним 05/10/26 Пнд 19:43:01 № 1722578 138
Аноним 05/10/26 Пнд 20:26:31 № 1722604 139
>>1722421
Эх, если б такой риг Ватт до 50 потреблял, и бесшумным был класная тема была бы, а так... пичалька...
Аноним 05/10/26 Пнд 20:28:47 № 1722605 140
>>1722543
> возможность полноценной аблитерации без потери ума модели
Да ну, просто модели становятся умнее и огрехи кривых манипуляций более заметны. Если вглянуть на содержимое калибровочных датасетов для этого дела, то сразу понятен источник отупения.
Аноним 05/10/26 Пнд 20:32:31 № 1722611 141
>>1722538
Ну так если ума работать не под своим аккаунтом не хватает, то здесь и локалки не помогут...
но вообще это рофл какой-то, когда за писанину в интернете могут арестовать, такое гойсударство автоматически статус тоталитарной помойки получает.
(так-то как по мне интернет вообще от законов свободен должен быть)
Аноним 05/10/26 Пнд 20:43:04 № 1722621 142
1678159219332.png 39Кб, 1417x439
1417x439
>>1722604
А жареных гвоздей ты не хочешь, а?
Аноним 05/10/26 Пнд 20:45:36 № 1722622 143
>>1722571
Чел, я ничего не путаю. Я в курсе что там к чему с матрицами. Мне просто в данном вопросе пофиг на их наличие/отсутствие - я не тот шиз. Мне РАЗМЕР модели важен. Понимаешь? Чтобы тупо влезла в железо с нужным контекстом. Выбираю по этому критерию в первую очередь. Мне подходит iq4xs, именно по размеру. Точка. А у мардера из статик реп качаю потому, что привычка - там у него вижен лежит, если вообще есть.
Аноним 05/10/26 Пнд 20:48:54 № 1722628 144
>>1722611
Узко мыслишь. Арестовать - здесь как-бы пофиг, не та юрисдикция. Но забанят ведь, и деньги на ветер. А за какой чих - не угадаешь.
Аноним 05/10/26 Пнд 20:49:55 № 1722629 145
>>1722204
>И откуда у всех внезапно 24 врам?
2 подержанных 3060 на 12 гигов же, стоят копейки. И tensor режим в llama.cpp.

>погрузиться в эту "гемини дома" - но это ведь не гемини и близко.
На 24 гигах qwen 3.8 flash next запускается, а это уже близко к гемини.
Аноним 05/10/26 Пнд 20:50:45 № 1722630 146
>>1722225
>Половина тухлятина и редкостное хрючево, которое не влезет даже в 12гигов, не то что в 4. Новичок скачает что-нибудь из этого и словит полное разочарование с глупости и низкой скорости
Ты перетолстил. Так уж сильно хочется поднасрать новичкам? Там без всякого обмана раписано что и на скольки гигах запустится.
Ридми читать чтобы ответы были качественные а не чтобы "скорасть". Скорость будет норм со всеми перечисленными модельками.
Тухлятина или лоботомиты - это уже не тебе судить, пусть каждый попробует и решает для себя.
Аноним 05/10/26 Пнд 20:51:30 № 1722632 147
>>1722250
>Авторы PaintedFantasy и Cydonia ковыряют Гемму
Ну, как доковыряют до чего-то удобоваримого, поговорим.
Аноним 05/10/26 Пнд 20:53:25 № 1722633 148
Почему на гемме все сценарии где ты ебёшь тянку дольше 10 минут кончаются одинаково?
Всё бля, гемма всё скатит что теперь она mindless shell, созданная только для твоего кока.
Аноним 05/10/26 Пнд 21:01:45 № 1722641 149
>>1722633
>ебёшь тянку дольше 10 минут
Как у тебя это выходит?
Мимо кончаю за 3
Аноним 05/10/26 Пнд 21:05:05 № 1722648 150
>>1722633
РУИНЕД ФО ЭНИБАДИ ЭЛС
попробуй ебать слабее, яхз. напиши что у гг пиструн 4см
Аноним 05/10/26 Пнд 21:06:02 № 1722649 151
>>1722641
> Мимо
типа xiaomi/mimo? какая версия? там ведь огромная модель
Аноним 05/10/26 Пнд 21:08:42 № 1722654 152
Какой сплит лучше юзать 2 видюхами на 16 и 8 гигов? По логике 2, 1, но там же еще контекст. Еще мод непонятно какой лучше layer, tensor или row?
Аноним 05/10/26 Пнд 21:10:04 № 1722658 153
Аноним 05/10/26 Пнд 21:10:12 № 1722659 154
>>1722337
>и все сидели на эире
Чуть более чем никто. Хватит форсить свою альтернативную историю. У "всех" просто не было такого железа чтобы твой эир запускать.
У "всех" чаще всего была 8-гб карточка (типично для "игрового" ноута например) сидели на Mistral Nemo 12б, часто на всяких бесполезных васянотюнах типа Saiga. Русик был плюс-минус приличным на мелкие ошибки можно было закрыть глаза-подправить. Кто победнее сидели на ллама-3 8б и министраль 8б, кто побогаче с 16гб картой - мистраль смол 24б.
Оперативки у "всех" было 16гб, а в лучшем случае 32гб (и сейчас в принципе так и осталось).
Аноним 05/10/26 Пнд 21:10:37 № 1722661 155
>>1722621
Ну тык в том же ж и проблема, по электричеству не дешево выходит, шумит, это или йоба-серверную нужно под такую хрень, и гибридный инвертор, чтоб в отключения работало, либо где-то арендовать место и размещать... выгодность затеи уменьшается скажем так...

>>1722628
>Арестовать - здесь как-бы пофиг, не та юрисдикция
сегодня не та, завтра та...
Аноним 05/10/26 Пнд 21:12:13 № 1722666 156
>>1722347
с 8+16 тебе надо гемма-4-26 брать. в таверне выбрать chat completion в апи, прописать урл с в1 жмякнуть конект и заработает без особого пердолинга
Аноним 05/10/26 Пнд 21:14:01 № 1722669 157
>>1722659
> и сейчас в принципе так и осталось
Да и вряд ли что-то изменится с такими ценами. Нынче чтобы железо покупать и обновлять надо шейхом быть.
Аноним 05/10/26 Пнд 21:15:07 № 1722672 158
>>1722535
Идиот? Тебе же написали из СТАТИК репы. Там нет иматрикса. iq это не imatrix, дебилище.
Аноним 05/10/26 Пнд 21:15:33 № 1722674 159
>>1722604
Бесшумный - можно. Потребление до 50вт в целом тоже, будет тяжело но засыпание запилить можно ценой задержки первых токенов после простоя.
>>1722538
Все правильно.
Под предлогом безопасности пойдут очередные ужесточения и подобный цирк, это уже происходит. Будут собирать еще больше метрик и анализа, тутже привязывая к конкретному человеку, на парясь с обезличиванием. Могут по надуманному предлогу забанить тех, кто пользуется квотой подписки слишком уж активно - такой пользователь невыгоден, и это уже происходит. Потом этими данными начнут торговать (если еще не происходит). Станут не просто сотрудничать не просто с полицией как сейчас, а договариваться с политиками, формируя мнения для их продвижения и дискредитируя оппонентов в обмен на лоббирование нужных законов. Или просто выдав нужную инфу о родственниках политического оппонента, такого уже может хватить.
Самая мякотка даже не отъезд за мыслепреступления кумерам, а возможность опорочить и закрыть любого человека вот по такому способу. Чаты легко фабрикуются и их достоверность никак не подтвердить. Ну и дефолт, что ответы всем пользователям можно возмущать как хочешь, просто советуя что-то, или даже переписывая факты и историю.

Сильный и строгий надзор действительно нужен, но на за локалками, а как раз за корпами и поставщиками услуг, чтобы они подобного не вытворяли. В их руках настоящая угроза, похлеще чем ядерные материалы или финансы.
>>1722611
Приучали юзеров обращаться по любому поводу, вот они и не парятся.
Аноним 05/10/26 Пнд 21:19:36 № 1722680 160
>>1722563
>Он есть и у бартовского
Не знаю про мрадера, но у бартовского там русика в датасете крохи, килобайт 5 от силы на 1.5мб датасет. Я когда-то для себя делал тесты с русским иматриксом и подтвердил что примерно 500кб русского текста в датасете заметно улучшают русик в кванте, 50кб - нет улучшающего эффекта.
Аноним 05/10/26 Пнд 21:20:15 № 1722683 161
ngram.png 23Кб, 911x330
911x330
chatlog.png 163Кб, 1535x631
1535x631
Протестил Версипеллис. Считаю что чуда не случилось. Ну он норм, чуть менее слоповый, мб даже чуть более живой чем сток, ящитаю. Анон молодец что принёс свой пресет, хоть я его и не смотрел, ну хоть что нормальное сгенерировал в треде. А то срачи одни.
Пользуясь случаем принесу то что уже приносил раньше, но вдруг кто не видел. Спизжено то ли у кого-то из треда то ли из бугродискорда:
--spec-type draft-mtp,ngram-map-k4v ^
--spec-ngram-map-k4v-size-n 8 ^
--spec-ngram-map-k4v-size-m 8 ^
--spec-ngram-map-k4v-min-hits 1 ^
--spec-draft-n-min 1 ^
--spec-draft-n-max 4 ^
--spec-draft-p-min 0.75 ^
Это задействует и mtp и ngram декодирование. Ngram декодирование это по сути mtp для токенов которые уже есть в контексте. Гемма и Квен часто делают драфты в ризонинге, потому когда они выходят из драфта и пишут ответ, ngram декодирование это ускоряет. В итоге мои 60т/с на последних секундах генерации превращаются в 120. И естественно это ахуенно работает для кода. Цена этого дела несколько мегабайт в оперативе, на содержание выдачи не влияет.
Бонусом свайп с Версипеллиса для тех кому не хочется качать. Гемму до конца не искоренить никогда, какой бы тюн не был
Аноним 05/10/26 Пнд 21:23:02 № 1722686 162
1638460927524.png 159Кб, 1416x1195
1416x1195
1776464318558.png 66Кб, 1847x352
1847x352
>>1722661
> по электричеству не дешево выходит
Копейки же

> шумит
Да не особо

> чтоб в отключения работало
В городе норм пока
Аноним 05/10/26 Пнд 21:23:12 № 1722687 163
>>1722680
Как нет и ухудшающего. Явахуи, люди не видят разницу между "стало хуже" и "не стало лучше". Хуже иматрикс не сделает никогда. Какой-то один шиз настолько преисполнился что уже культ породил и насаждает свою эзотерику (это я не про тебя, чел уже просто реально доебал, с сумасшедшим поселили блять!)
Аноним 05/10/26 Пнд 21:25:56 № 1722689 164
>>1722669
ну я обновил свои 16гб до 32гб без проблем за сущие копейки (ддр3 если че)
Аноним 05/10/26 Пнд 21:27:51 № 1722692 165
>>1722687
Само квантование имеет ухудшающий эффект, так что тут как посмотреть. Квант ухудшил, иматрикс улучшил, получилась компенсация. Всегда качаю иматрикс, на статикодаунов смотрю как на дебилов.
Аноним 05/10/26 Пнд 21:28:38 № 1722695 166
>>1722604
>Ватт до 50 потреблял

ну это только какой нибудь ryzen AI 395 такое может
Аноним 05/10/26 Пнд 21:28:43 № 1722696 167
1712276291074.png 443Кб, 1366x2260
1366x2260
Аноним 05/10/26 Пнд 21:31:28 № 1722701 168
>>1722621
Это еще по-божески.
>>1722661
> по электричеству не дешево выходит
Если не упарываться и ограничиться условными 192/256 гигами для дипсикожены, или тем более 128 для квеннекста, то электричества жрать будет не больше обычной пеки. Интенсивное потребление там только во время активного использования, и то с ллм небольшое. Чтобы работало на полную, нужно часами мультизапросы дрочить, видеогенерацию или тренировку делать.
Сюда же шум, под ллм если пользуешься сам для чата, оно даже нагреться не успеет чтобы кулеры с холостых стронулись.
Реальный минус - потребление в простое. Нищукские амперы жрут более 40вт просто за то что запущены. Какая-нибудь ада или блеквелл немногим меньше - около 25-30вт. И так на каждую карту, плюс сама платформа в районе 50. Пока это в горячем резерве - оно кушает, за день несколько киловаттчасов набежит.
> и гибридный инвертор, чтоб в отключения работало
Зачем? Если отключат электричество то тебе явно не до ллмок будет.
Аноним 05/10/26 Пнд 21:34:35 № 1722706 169
>>1722683
Гемму-4 тюнить бесполезно, это не для тюна моделька.
По второму пику могу сказать только одно: если для тебя это норм, то ты или говноед или просто плохо чувствуешь инглиш. Потому что текст слоповый, громоздкий и несуразный просто до ужаса.
Аноним 05/10/26 Пнд 21:35:27 № 1722707 170
>>1722706
Таким всегда отвечаю "показывай как надо", а они каждый раз почему-то испаряются...
Аноним 05/10/26 Пнд 21:36:30 № 1722709 171
>>1722696
ничего полезного. диффьюжн когда будет сука? почему у анслота это давно есть?
Аноним 05/10/26 Пнд 21:46:56 № 1722719 172
image.png 3Кб, 88x77
88x77
>>1722659
Что за логика такая "не было"?
И у меня не было, я что, родился с 64 рам? Пошёл и купил за 10к. Никому не мешало сделать так же. И это не как с мишками и прочим, какой то невероятный секрет, успей заказать с китая! В днс она стоила 10к и была хайповая моделька которую хотелось попробовать, и стоило это ноль.
Жаль только про баг с 2 квантом 350 глм я тогда не знал
Аноним 05/10/26 Пнд 21:49:31 № 1722723 173
Аноним 05/10/26 Пнд 21:55:16 № 1722732 174
>>1722538
Так сейчас всё равно агентские сетапы рулят, а они будут делать запросы в сеть. Не, можешь поднять локального лоботомита, который не будет знать актуальных новостей, но это буквально прошлая эпоха.
Аноним 05/10/26 Пнд 21:56:55 № 1722734 175
>>1722686
Ну, когда 4 через 4 отключают, а то и 6 через 2 то не оч как-то...
ну и 800Вт маслать круглосуточно тоже такое себе,
но опять таки, здесь вопрос в том это немного будет работать изредка, или там будут агенты 24/7 копошиться...

Кста, что там по скорости токенов?
Аноним 05/10/26 Пнд 22:00:16 № 1722741 176
>>1722633
>гемма всё скатит что теперь она mindless shell
А ты сделай ход конём, уходи, пока она ещё trembles, либо продлевай свой AI torture chamber через редактирование сообщений, чтобы гемма не могла закончить историю, а если и захотела, то было бы уже поздно.

мимо 3ч кума подряд на одну сцену из 60 сообщений.
Аноним 05/10/26 Пнд 22:03:47 № 1722745 177
>>1722695
угу, но там скорость никудышняя
у меня не 395 конечно, а 350, но сути дела не меняет, 395 не выдаст супер перформанса...
Аноним 05/10/26 Пнд 22:06:49 № 1722750 178
Аноним 05/10/26 Пнд 22:08:11 № 1722754 179
>>1722732
> актуальных новостей
Это всего лишь поисковой движок + агрегация. Можно использовать гугл, брейв и прочих, можно целиком локальные решения, второе так вообще автономная штука.
Все запросы в сеть сводятся к редкому поиску, а не демонстрации всего и вся.
Аноним 05/10/26 Пнд 22:11:35 № 1722758 180
MTP это база или вы не уважаете такое ?

А то у меня выбор между тем чтобы вырезать MTP, или квантизацию более лоботомитную поставить.
Аноним 05/10/26 Пнд 22:13:02 № 1722761 181
>>1722758
Всегда использую когда могу. Для Геммы мастхев, х2 ускорение почти. Если конечно тебе нужна эта скорость. Тупой вопрос какой то
Аноним 05/10/26 Пнд 22:13:12 № 1722763 182
>>1722758
не заметил разницы в скорости. 5060ti-16gb
Аноним 05/10/26 Пнд 22:13:40 № 1722766 183
>>1722758
Это в большинстве случаев для тех у кого и так всё заебись получить ещё более заебись. Если у тебя ничего не лезет то и с мтп ты ничего не поимеешь
Аноним 05/10/26 Пнд 22:17:46 № 1722772 184
>>1722758
Это база, но расходует врам, и в некоторых случаях может на больших контекстах давать отрицательный прирост.
Аноним 05/10/26 Пнд 22:18:53 № 1722774 185
>>1722761
Вот у меня тоже разница в два раза по скорости, но бля не лезет контекст вместе с mtp, там после 32к уже фризы начинаются, а у меня только на разогрев агентов столько нужно. А вопрост да тупой, соре.
>>1722766
Ради разницы в скорости думаю можно пожертвовать качеством модели, потому-что пусть лучше с этой скоросью два раза перепроверит ошибку, чем будет думать долго.
Аноним 05/10/26 Пнд 22:19:59 № 1722777 186
>>1722754
За поиск в гугл сажали в тюрячку ещё в прошлом десятилетии, как доказательство при преступлении.
Аноним 05/10/26 Пнд 22:23:17 № 1722780 187
Кто юзает Маринару с геммой, подскажите настройки семплеров и промт. На универсальном пресете, она сразу вместо меня отвечает. Или может я настройки чата не так выбрал.
И агентов в РАМ можно скинуть, там же локальная минигемма есть?
Аноним 05/10/26 Пнд 22:23:25 № 1722781 188
>>1722750
Нда, на том что не MoE так себе скоростя... а на 25т/с далеко не уедешь....
Аноним 05/10/26 Пнд 22:27:54 № 1722790 189
1645040556444.png 41Кб, 792x636
792x636
1703831037427.png 54Кб, 785x656
785x656
>>1722781
Да ты зажрался требовать от 50к в рублях работы на 500.
50+ тпс на денсах без мтп ебат за такие то гроши
Аноним 05/10/26 Пнд 22:28:16 № 1722791 190
>>1722538
>Статья предусматривает ответственность за публикацию или передачу электронного сообщения
Публикацию куда? Передачу кому? Оружие нашли?
матрасия пиздец катится, в какие-то ебеня
На форче анон бугуртил что у них по штатам отдельно постепенно чебурнет вводят, когда не смог на ботбуру зайти

>>1722758
Нет, только НТР
Аноним 05/10/26 Пнд 22:29:28 № 1722792 191
>>1722791
Ага, вот ещё немного и совсем загниёт. Ни то что у нас!
Аноним 05/10/26 Пнд 22:31:05 № 1722794 192
Не знаю что я сделал, но заметил что на том же сетапе скорость чтения на 16x/4x возросла с 50 т/с до 500 т/с. Жесть, я думал уже терпеть медленное чтение придется
Аноним 05/10/26 Пнд 22:35:53 № 1722801 193
>>1722780
Локальная мини-гемма не нужна, агенты могут юзать основную модель.
Умвр с гемма+маринара. Ты видимо накосячил с запуском самой геммы. Ллама надеюсь? Показывай ключики. Если кобольд - сам виноват.
Аноним 05/10/26 Пнд 22:37:08 № 1722802 194
1791229013912.jpg 120Кб, 1080x467
1080x467
usav.png 100Кб, 630x793
630x793
>>1722792
Да в том то и дело что походу "как у нас" будет лул
Аноним 05/10/26 Пнд 22:42:57 № 1722806 195
Я тут подумал, а ведь проблемой текстовых нейронок стала их всенадроченность. У нас все модели all-round, на бумаге. Сейчас немного перекос в сторону кода, да. Нет распределения моделей по специализациям, как кстати уже делали с qwen coder и medgemma, и вот в этом то и проблема. Все гонятся за одним и тем же, вместо того, чтобы занимать свою отдельную нишу и иметь свою отдельную ЦА.
Вот выйди сейчас что-то, что совсем не может в код, но при этом шикарно работало как просто чатбот советник\попиздеть за жизнь, вы бы сильно расстроились? Или модель которая по креативу действительно бы работала, способная выдавать уникальные идеи, но при этом писала бы очень коротко? А-ля промпт генератор для кожаных? Ну или залупа, надроченная на Ао3 и прочем худ непотребстве, для соавторства и рп или CYOA на худой конец, но совершенно оторванная от реальности?
Да даже если наоборот, моделька - биолог, моделька - технарь, моделька - инжинегр, моделька - математик и далее по списку?

Вот лично мне от 120B8A модели нужна реальная креативность, живость моих OC персонажей и приятный слог. Ну и немного адекватности, без двух трусов или босоногих обитателей арктики. Всё. Тобишь ни код, ни знание 100500 чаров из аниме, ни знания принципов работы мозга капуцинов мне не нужны. А что в ллм важно для вас, ананасы? На чём бы специализировалась ваша модель мечты?
Да, мне нехуй делать.
Аноним 05/10/26 Пнд 22:47:57 № 1722808 196
>>1722806
А платить за специализацию кто будет? Большие модельки далеко не бесплатно тренить, как и датасет под них собирать.
Аноним 05/10/26 Пнд 22:51:43 № 1722814 197
>>1722707
Ну давай по-честному, ты вот сейчас решил что я твой текст незаслуженно обосрал и что "лучше быть не может" или что "лучше будет крайне сложно зделоть"? Или может ты признаешь, что это полнейшая хуйня и просишь совета? Просто интересно. Я никуда не испаряюсь, я здесь, давай обсудим это.
Аноним 05/10/26 Пнд 22:58:37 № 1722817 198
>>1722806
> Вот лично мне от 120B8A модели нужна реальная креативность, живость моих OC персонажей и приятный слог. Ну и немного адекватности, без двух трусов или босоногих обитателей арктики. Всё. Тобишь ни код, ни знание 100500 чаров из аниме, ни знания принципов работы мозга капуцинов мне не нужны.

Ты не сделаешь кучу маленьких моделей которые заменят одну большую.
Кодоунитазность модели помогает ей в ризонинге который используется в любой другой области кроме написания кода. Даже здесь переодически рекомендуют включать ризонинг на той же Гемме в РП. Отдели кодовый датасет от нее во время обучения и ты получишь модель которая не сможет нормально размышлять.
Аноним 05/10/26 Пнд 23:00:17 № 1722819 199
>>1722806
>Вот выйди сейчас что-то, что совсем не может в код, но при этом шикарно работало как просто чатбот советник\попиздеть за жизнь, вы бы сильно расстроились?
Так никто уже не будет делать, но из моэшек это можно сделать самому.
В прошлом треде бросали вот:
https://mega.nz/folder/T1gGQS7C#xC_vSytyrNYDbTv0P4vGrg
вырезаны кодерские и мультиязычные эксперты, моделька стала хаотичной (надо еще научиться пользоваться) но более живой и креативной.
Надо просто брать и вырезать экспертов.

Может это не идеальный пример, мой посыл в том, что надо брать это в свои руки.
Аноним 05/10/26 Пнд 23:02:03 № 1722823 200
>>1722732
Таки да прошлая эпоха. Текущая эпоха = это уже локальный агент, который может искать актуальную инфу. И это не так сложно делается (нет, платные API не обязательны, можно просто научить броузером рулить).

В чем разница если он в сеть лезет? В том, что от тебя уходит не вообще все, а только запросы агента. А ты можешь этим управлять. И в гугле/утке агент будет искать только то, что ты посчитаешь допустимым. А перед общением на горячие темы возможность поиска (и вообще сеть) ему можно выключить.
Аноним 05/10/26 Пнд 23:04:37 № 1722825 201
>>1722814
>ты вот сейчас решил что я твой текст незаслуженно обосрал и что "лучше быть не может" или что "лучше будет крайне сложно зделоть"? Или может ты признаешь, что это полнейшая хуйня и просишь совета?
Нет. Я имел ввиду ровно то, что написал - показывай как надо. Пиздеть и обсирать других любой гораздо. На Гемме добиться сильно других результатов невозможно, она всегда слоповая. Это нужно либо принимать и любить за ее достоинства, либо дропать и использовать другую модель
>Я никуда не испаряюсь, я здесь, давай обсудим это.
Обсуждать не интересно. Есть что показывать - показывай. Нет - тогда и не ясно, нахуя и ради чего начинаешь срач. Потому что обсуждения с "ты говноед" не начинают, кекв
Вчера вышла НОВАЯ ГЕММА Аноним 05/10/26 Пнд 23:05:17 № 1722826 202
Вчера вышла НОВАЯ ГЕММА Аноним 05/10/26 Пнд 23:05:55 № 1722827 203
>>1722826
пысы это официальный релиз от гугла, не чей то тюн, радермахер просто сделал квант
Аноним 05/10/26 Пнд 23:07:21 № 1722829 204
>>1722826
На англюсике же. Толку с того? Гемму используют ради русского только.
Аноним 05/10/26 Пнд 23:07:31 № 1722830 205
>>1722827
> это официальный релиз от гугла
@
> This is not an officially supported Google product
Аноним 05/10/26 Пнд 23:07:38 № 1722831 206
>>1722801
./llama-server \
--host 127.0.0.1 \
--port 8080 \
--model /AI/G4-MeroMero-v2-31B.Q4_K_S.gguf \
--alias gemma-model \
--n-gpu-layers 99 \
--ctx-size 32768 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
-b 512 \
-ub 512 \
--temp 1.0 \
--top-p 0.95 \
--min-p 0.0 \
--top-k 64
Аноним 05/10/26 Пнд 23:07:44 № 1722832 207
>>1722817
> Отдели кодовый датасет от нее во время обучения и ты получишь модель которая не сможет нормально размышлять.
Ну если про файнтюн говорить, то можно и не пихать кодовый датасет например, но тогда понадобится довольно специфичный дополнительный датасет с логическими или дидактическими диалогами.
Аноним 05/10/26 Пнд 23:07:45 № 1722833 208
>>1722683
Я б был поосторожнее с накручиванием spec - ков . Если спекуляция косячит с токенами и они не "принимаються" моделью, то происходит откат. Причем чем больше токен надравчено предсказателе тем болезненней. Если модель целиком в ГПУ выглядит как генерация рывками. Если смешанный режим -генерация может вставать чуть ли не на пару секунд.

Аноним 05/10/26 Пнд 23:08:50 № 1722834 209
>>1722830
официальный релиз и официально поддерживаемый продукт это разные вещи как бы. релизнуто на huggingface.co/google я об этом
Аноним 05/10/26 Пнд 23:09:16 № 1722835 210
>>1722806
да, что он сказал

понимаешь, проблема даже не в бабках, чё думаешь программирование так развито у ллмок, а его очень просто тестировать -- закомпилился код, даешь ллмки позитивный сигнал, плохой, наказываешь. С креативной прозой сам понимаешь нет какой-то универсальной функции, которая выдаст оценку твоему тексту. Мог наверно заметить что все самые развитые сферы знаний у ллмок могут быть формально проверины (код, доказательства в математике, кернелы ускорения вычислений и тп)

так-что тут проблема не ресурсов а банально что вкус и креативость почти никогда нельзя описать одним числом или функцией
Аноним 05/10/26 Пнд 23:09:51 № 1722836 211
>>1722829
ради русского используют 26б-а4б или 31б, а не эту мелочь
лично я РПшу исключительно на английском, русский считаю неподходящим для этого в принципе (особенно в куме)
Аноним 05/10/26 Пнд 23:09:55 № 1722837 212
>>1722806
Специализация в такой парадигме тупиковый путь. Для чего-то очень узкого и как быстрое эффективное решение с соответствующей обвязкой - да, это применимо и легко.
Но для абстрактных вещей, особенно охватывающих все и вся это не работает. В твоей постановке специализация на
> просто чатбот советник\попиздеть за жизнь
с исключением всего другого приведет к шизофренику, который будет травить тебе ахуительные истории невпопад и давать абсурдные советы. Он будет "душевным", но общаться с ним не захочешь, потому что это выйдет как поехавший друг, который просто травит тебе ахуительные истории без устали.
То же самое будет с биологией, инженерией, матаном и прочим. Только когда знаний много, они разнообразные и покрывают все - получается эффективная регуляризация и модель начинает понимать причинно-следственные связи, логику и смысл разных вещей.
Потому чем лучше модель знает и код, и языки, и физику, и имена всех тней из блуарки, и расы эндфилда, и остальное, тем лучше она будет как собеседник.
Единственное что - алайнмент менее агрессивный делать и пост-тренировку разнообразнее, это действительно влияет на стиль ответов.
Аноним 05/10/26 Пнд 23:10:41 № 1722838 213
>>1722826
Так это для диаризации, нам тут такое вроде незачем.
Аноним 05/10/26 Пнд 23:13:31 № 1722842 214
image 233Кб, 1080x1350
1080x1350
Аноним 05/10/26 Пнд 23:14:32 № 1722845 215
Хуйня это про кодинг и способность размышлять. Есть модельки которые размышляют просто охуительно, при этом в кодинге очень слабы. Кодинг это дохуя узкоспецифичных знаний которые никуда не переложишь. Это просто забивание весов бесполезным говном.
Аноним 05/10/26 Пнд 23:15:06 № 1722846 216
>>1722829
Это фактически LoRA поверх обычной E4B (они сами написали). А значит у нее основной объем знаний тот же. Т.е. будет там тот же русский, т.к.такая лора просто на стиль выдачи влияет, а не на знания. Разве что, русский может стать "с американским акцентом", по построению фраз.
Аноним 05/10/26 Пнд 23:16:01 № 1722848 217
>>1722838
Понятно что цель не была РП но натюнили то на человеческом общении так почему бы и не воспользоваться этим. Конечно это пригодится только тем у кого нище-ПК и даже моэшка геммы не влезает.
Аноним 05/10/26 Пнд 23:17:54 № 1722852 218
>>1722842
пфф, чел, ты прикалываешься? это любая базовая моделька может достаточно попросить. ты что, любитель накатывать тюны на каждый чих вместо того чтобы черкануть строчку в системном промпте?
Аноним 05/10/26 Пнд 23:18:11 № 1722853 219
>>1722848
Неужели этого не добиться просто промптом? Вроде даже мелкая слушалась
Аноним 05/10/26 Пнд 23:18:32 № 1722854 220
>>1722845
> Есть модельки которые размышляют просто охуительно, при этом в кодинге очень слабы.
Они размышляют хорошо из-за что был код в датасете. При этом она не обязана быть хороша в написании кода.

На эту тему и исследования были и на arxiv.org где-то статья лежит.
Аноним 05/10/26 Пнд 23:19:24 № 1722855 221
>>1722853
Хз все ищут больше человечности от геммы, меньше ассистослопа, мб это тот самый вариант. Я просто принес новость, не проверял еще.
Аноним 05/10/26 Пнд 23:22:29 № 1722860 222
image 98Кб, 800x800
800x800
>>1722852
Вообще не любитель чатиков с AI. Только суровое фундаментальное РП с наглаживанием хвостов на ванильных моделях. Но раз уж тюн геммы скинули - нужно для баланса и квена добавить.
Аноним 05/10/26 Пнд 23:30:15 № 1722866 223
>>1722855
Ну кстати, тут простор мерджерам. Если добавить с некоторым весом или подрочить по разным блокам, то есть шанс получить более естественную речь, но без полной деградации до дебильного чата.
Аноним 05/10/26 Пнд 23:33:52 № 1722870 224
Квен 27б во всех квантах в русик не может? В четвертом постоянно генерирует бред вроде "попадано" или "коший". Хз стоит ли другой квант пробовать или на англюсик переходить.
Пысы: мне для кода и другое не пойдет.
Аноним 05/10/26 Пнд 23:35:59 № 1722871 225
>>1722870
>русик
>код
1с "программист"?
Аноним 05/10/26 Пнд 23:37:37 № 1722872 226
>>1722871
В интерфейсе он же русиком срет, на сайтах контент на русском пишет, в играх надписи и т.д.
Аноним 05/10/26 Пнд 23:39:22 № 1722876 227
>>1722872
Так. И в чем проблема написать код на английском и потом скормить нужные сегменты Гемме, если ты совсем ленивое говно и не можешь лейблы заменить?
Аноним 05/10/26 Пнд 23:41:29 № 1722879 228
>>1722870
Квант кванту рознь. У одного квантователя в 4м кванте русик может быть наглухо испорчен, у другого будет все заебись (ну, как заебись, в пределах возможностей квена, а они изначально скромные в плане русика). Часто выдуманные слова это последствия квантования.
Учи английский, РП в инглише с моделькой это тоже как бы изучение. Англ отлично подходит для РП и кума, русский слишком неповоротливый для этого и словарь бедный либо кринжовый. Взять то же слово киска (кринж ебаный, транслейт с английского как бы), какая альтернатива есть ласкательная? Ну, типа, пизда - грубо. Пиздёнка? ШМОНЬКА БЛЯДЬ? ВАРЕНИК НАХУЙ? Кринж это всё.
Аноним 05/10/26 Пнд 23:45:56 № 1722883 229
>>1722826
Интересно, то есть такие тюны это лучший вариант для собеседника/рп? В таком случае какой лучший для 16гб врам 64гб рам? Или пока придержать коней и ждать нового поколения релизов, предположительно gemma 5 и qwen 4?
Аноним 05/10/26 Пнд 23:49:23 № 1722886 230
>>1722806
Сделай лору. Для ЛЛМ они тоже бывают. Архив АО3 на торренте валяется. Лору даже на домашнем железе можно сделать за приемлемое время по идее
Аноним 05/10/26 Пнд 23:52:14 № 1722894 231
>>1722826
Нахуя вам модель, специализированая на исправлении ошибок распознавания речи?
Аноним 05/10/26 Пнд 23:54:38 № 1722896 232
>>1722886
> Архив АО3 на торренте валяется
А ссылочка есть или имя?
Аноним 05/10/26 Пнд 23:55:20 № 1722899 233
image 139Кб, 1000x1000
1000x1000
>>1722879
Сразу видно человека, неискушенного в скрепном РП. Анальчик практикуй, ёпта. Вариативность: анал, анус, дырка, дымоход, очаг, задний двор, шоколадный глаз, туз, задний привод, жопа, дупло, пещера, под хвост, пердак. Первое что в голову пришло. И гемма всё это знает и практикует, главное запромптить маленькую...
Аноним 05/10/26 Пнд 23:58:20 № 1722906 234
35667267.jpg 95Кб, 1280x720
1280x720
Палю лайфхак анончики - если у вас слабенький комп, играйте и делайте карточки только на англюсике, в два раза больше контекста можно уместить.
Аноним 06/10/26 Втр 00:02:28 № 1722909 235
>>1722896
Несколько их: я скачивал ao3 на 150Гб. Там есть AO3_final_location на 1Тб и свежий ao3_scrape.
Аноним 06/10/26 Втр 00:02:48 № 1722910 236
image.png 83Кб, 1159x587
1159x587
image.png 70Кб, 1211x385
1211x385
image.png 68Кб, 816x364
816x364
image.png 69Кб, 1093x377
1093x377
Лора файнтюно шиз снова репортинг ин.

Нашел интересную книженцию по ЛЛМкам, почитал частями
https://mbrenndoerfer.com/writing/lora-hyperparameters-rank-alpha-target-modules
https://mbrenndoerfer.com/writing/hyperparameter-selection-search-transfer-recipes-llm-training
Заодно потыкал палкой в обучение классификатора на mnist циферках.

Що я понял? Всякие припарки в виде бесконечных регуляризаторов и микро-подстройки гиперпараметров нахуй не нужны (по крайней мере до самой финальной стадии). Если нейросетка может что-то вытащить из датасета, она вытащит это на плюс-минус дефолтных настройках. Все остальные болтыхания нужны ради дополнительных 1-5% точности.

Решил в очередной раз поменять тактику экспериментов. Взял укороченный сет на 250 семплов. Отключил шедулер и начал искать базовые параметры, на которых литературный датасет (Vikhrmodels/dostoevsky_scored) сходится сам по себе. Плюс посчитал лосс для каждого семпла в отдельности.
И как оказалось: датасет полное дерьмище.
Пик 1 - гистограмма лоссов по семплам, на самом деле почти нихуя не говорит о качестве датасета, ну кроме того, что он вероятно сгенерирован одной нейросеткой. Проверил семплы с обоих краев распределения - они все содержат мелкие ошибки. И если вчитываться, то качество не такое уж хорошее.
Пик 2 - как эта залупа сходится на базовых настройках (практически никак). Ранг 8 или 16 - картина та же самая. Какие-то микро-поползновения в начале, а потом валидация уходит во взрыв. И это всего лишь одна эпоха. Датасет скорее мертв и ему ничего не поможет.

Я поискал другие датасеты для проверки, более адекватные и верифицируемые. Нашел всякие задачки на логику и русский язык.
Один из них https://huggingface.co/datasets/DatasetsEval/RusLang-edu-1000
Сделал аналогичный тест на этом датасете. Динамика совсем намного более красивше - пик 4. До определенного момента Qwen3.5 4b неплохо тюнится, потом валидация уходит на плато и только под конец уже сорт оф оверфит начинается. И это запуск без шедулера, константный лернинг рейт. Шумный трейн лосс, взрыв под конец - это как раз можно устаканить всякими приколами регуляризации.

Вот еще несколько датасетов на интеллект, я их не тестил, но может кому интересно будет
https://huggingface.co/datasets/evilfreelancer/LOGIC-701-instruct/viewer/ru
https://huggingface.co/datasets/DatasetsEval/olympiad_problems_5
https://huggingface.co/datasets/s85io/math-logic-ru

@luqwen если еще будешь делать тюны, то можешь выкидывать Достоевского, скорее всего он только гадит в обучении.

Вопрос годного литературного датасета остается открытым. Но по крайней мере есть идея как их сортировать быстро - 200 семплов на трейн, 20-50 семплов на валидацию. Сходится - заебись. Не сходится - в помойку. На эксперимент где-то часик уходит. Дешево и сердито.

Потом на годноте можно сделать грид серч или рандом серч по параметрам на полном датасете - есть мысль задействовать силу анончиков, у которых есть гуглоакк - расшарить всем скрипт для гугл колаба, и гонять там по эксперименты, искать лучшую комбинацию параметров. Так за ноль рублей может и двачерский тюник квена соберем.
Аноним 06/10/26 Втр 00:03:32 № 1722912 237
>>1722876
Нигде не говорил что это для меня реальная проблема, я лишь спросил можно ли это решить сменой кванта.

>>1722879
Я знаю инглиш, более того, квен русский тоже хорошо читает, только писать на нем не умеет. Но сохранить способность писать на русском хотелось бы все же, так что придется перебирать кванты походу.
Аноним 06/10/26 Втр 00:57:30 № 1722954 238
image 724Кб, 875x1639
875x1639
image 1318Кб, 1745x1396
1745x1396
>>1722910
Отправляй нейронку экспериментировать. С текстом это вообще просто будет. Я с генерацией пикч недавно двухдневный цикл запускал, 110 экспериментов нейронка сделала, по итогу два варианта хороших вытащил. В конце каждого прогона репорты типа второго пика получала и дальше ебашила.
Аноним 06/10/26 Втр 01:00:58 № 1722957 239
>>1722912
Сделай свой квант. 1 скачай простой квант без иматрикс не меньше Q4K_M. 2 посчитай на нем иматрицу по своему датасету. Можешь взять датасет Бартовского под Qwen FN и бахнуть туда русика в половину веса датасета. 3. Грубую схему тензоров взять отсюда https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/tree/main/tensor-allocation . Можно по вкусу пропорционально увеличить. 4. Квантовать. 5. Вы прекрасны и имеете почти максимальный русик.
Аноним 06/10/26 Втр 01:21:34 № 1722964 240
>>1722954
Что за стек ллмки и обвязки ты используешь?
Были б у меня безлимитныые гпу ресурсы, я бы может и запустил, хотя сотня экспериментов все равно жирно. Пока приходится по-бомжацки ручками в колабе запускать.
Вообще думаю на опенрутере какую-нибудь ллмку взять и посадить датасеты готовить (оценивать, переводить, форматировать). Но хз какие тулзы для этого лучше подходят.
Аноним 06/10/26 Втр 01:23:40 № 1722967 241
>>1722806
У моделей нет разделения по специальностям. Сейчас все специальности — это код. Умение внятно излагать мысли и даже РПшить — это артефакт древних, и либо в старых моделях, либо в 1Т+.
Аноним 06/10/26 Втр 01:27:38 № 1722969 242
>>1722910
> Если нейросетка может что-то вытащить из датасета, она вытащит это на плюс-минус дефолтных настройках.
Это все верно. Анончик, смотри
> Взял укороченный сет на 250 семплов.
Вот для чего? Уже сколько раз звучал этот вопрос, что ты хочешь получить на выходе? Что будет считаться успешным результатом? Прямо сейчас просто возьми и сформулируй что тебе нужно конкретно, и напиши в посте как ты это видишь. Предметно, ясно и подробно.
Если просто красивый график лосса - попроси нейронку сделать его и правильно подписать оси, будет красотень хоть обдрочиться.
А после этого взгляни на свой датасет, он мелкий и тут буквально можно быстро самому проглядеть. И распиши что ты в нем видишь, что должно привести к твоей цели. Или наоборот чего не заметил а должно быть. Так будет проще дальше что-то обсуждить.
Если это просто бложек с тем что делаешь - сорян, тогда игнорируй.
Аноним 06/10/26 Втр 01:28:32 № 1722970 243
1755743654739.png 83Кб, 965x1129
965x1129
>>1722964
Дипсик + опенкод хороши. Дс по апи стоит копейки, пополняется без комиссии через алипэй

мимо
Аноним 06/10/26 Втр 01:41:06 № 1722975 244
>>1722970
ты же понимаешь что эти 189кк токенов это ничтожно мало, учитывая их стоимость?
Аноним 06/10/26 Втр 01:42:39 № 1722976 245
1791240160849.png 102Кб, 1344x1325
1344x1325
Первый запуск на тех же ми50. Пока посос по скоростям, но может получится вытянуть больше добавив зелёные карты в пул
Аноним 06/10/26 Втр 01:44:31 № 1722977 246
>>1722975
Вообще не понял претензий. 150р за 190кк токенов это низ рынка
Аноним 06/10/26 Втр 01:52:11 № 1722980 247
>>1722969
>Вот для чего? Уже сколько раз звучал этот вопрос, что ты хочешь получить на выходе? Что будет считаться успешным результатом? Прямо сейчас просто возьми и сформулируй что тебе нужно конкретно, и напиши в посте как ты это видишь. Предметно, ясно и подробно.
Ультимативная цель - надрочить модель на русскую литричу и ролеплей, чтобы было красиво, разнообразно и сексуально.
Сейчас цель хотя бы чему-то одному в каком-то узком проявлении научить, например литературе. Предметно - топовый русик без косяков, адекватная логика повествования, отсутствие шизы.
Ну щас уже понятно, что в датасете даже этот минимум не всегда выдерживается. 400+ семплов я окуею вычитывать и искать ошибки, если честно. Если только другую нейронку не посадить это все выковыривать.
>Если это просто бложек с тем что делаешь - сорян, тогда игнорируй.
Советы приветствуются, я просто пока сам не решил серьезно этим занимаюсь или по приколу (хочетса чтобы было по фану, а не задротить циферки и майнить руками данные)
Аноним 06/10/26 Втр 01:55:05 № 1722982 248
>>1722980
>русскую литричу и ролеплей, чтобы было красиво, разнообразно и сексуально
Таких примеров и не существует кагбе. Как ты можешь научить тому, чего нет в природе.
Аноним 06/10/26 Втр 01:57:56 № 1722983 249
>>1722977
у меня на подписках за 20 баксов выходило за месяц по 5-10ккк токенов. это - низ рынка. 190кк токенов за 150р это прям дохуя.
Аноним 06/10/26 Втр 02:10:26 № 1722986 250
Аноним 06/10/26 Втр 02:30:04 № 1722989 251
>>1722976
Русик вроде норм, некоторые формулировки странные, но приемлемые. Вижен пока не проверен.
Аноним 06/10/26 Втр 02:45:28 № 1722995 252
>>1722989
да говняный там русик, чего греха таить
Аноним 06/10/26 Втр 02:54:56 № 1722998 253
>>1722980
> Ультимативная цель - надрочить модель на русскую литричу и ролеплей, чтобы было красиво, разнообразно и сексуально.
Тогда тебе:
а) Нужен хороший датасет с большим объемом и большим покрытием, причем он должен быть хорошо согласован и очень ясно описан. Это должны быть мультитурн чаты с разным поведением и задачами, и батч нужно нарастить. Еще, хороший способ что-то выучить для нейронки - дать контраст. В дохуя художественных чатах должна быть вводная "пиши красиво художественно", в технических "сухо технично" и т.п., тогда уже по одному такому якорю и на контрасте поймет что нужно. И для того самого контраста потребуется батч.
А у тебя какой-то оче короткий набор по узкой теме, слабо контрастирующий с тем, что модель выдает. Плюс, ты еще больше это размазываешь лорой. Оно скорее запомнит конечный текст или его общие паттерны, порядок фраз и прочее, чем научиться делать такое. Сетка видит текст не как ты
> 400+ семплов я окуею вычитывать
Нужно не 400 а 40 000, на худой конец 4к. Но все вычитывать и не надо, единичные огрехи сгладятся, наоборот наличие выбросов и всякого шума помогает тренировке. Хуже всего будет если там встречаются однообразые выражения и конструкции.
Распарси книгу или какие-то готовые тексты. Основной материал не меняй чтобы не привносить лишнего слопа, но добавь обрамление чтобы перевести это в чат/выполнение инструкции, и подходящие промпты.
Для начала, возьми что-нибудь очень характерное и заметное со специфичным слогом, те же сказки, нарежь на датасет и прожарь ими. Получишь характерный говор, но скорее всего вместе с этим и лоботомию, не уливляйся когда модель на нормальный запрос начнет сказку рассказывать.
Аноним 06/10/26 Втр 03:18:19 № 1723006 254
>>1722970
>алипэй
Без зарубежной карты тут никак?
Аноним 06/10/26 Втр 03:20:18 № 1723007 255
>>1722980
>400+ семплов я окуею вычитывать и искать ошибки
>Если только другую нейронку не посадить это все выковыривать
Вклинюсь чисто как мимокрок, но как по мне если ты делаешь всё соло, лучше генерировать синтетику на основе хорошего исходника. Взять качественный текст, скормить его сетке, дописать правила и генерировать цепочки. Сетку конечно лучше взять побольше и поумнее. Потом, когда у тебя достаточно семплов, дать сетке задачу анализа и чистки. Лучше 1000 синтетических примеров с мелкими и не очень косяками, чем 100 идеально правильных.
Аноним 06/10/26 Втр 03:20:56 № 1723008 256
>>1722870
Увы, это не лечится. "Хозяина, китаясь как может говорят."
Немного помогает заставлять его проверять самого себя ("сделай редактуру ...") и добавление в промпт "используй русский литературный текст". Почему то именно "текст" срабатывает лучше, чем "язык". Хз почему.
Аноним 06/10/26 Втр 03:29:25 № 1723011 257
Друзья! Я прошу прощения за глупый вопрос, а на квен 3.8 27б нужны вообще пресеты? Я только вкатился в локалки, и пробовал только гемму, там я загружал пресет в таверну, тут во вкладке с пресетами вообще другой интрефей, а с пресетом от геммы он вообще не работает. Как быть? Просто настроить ползунки руками, и играть без промпта? Или нужно сделать что-то дополнительно?
Аноним 06/10/26 Втр 03:37:39 № 1723015 258
>>1723011
Квен для РП выбор сомнительный, пердолинга в сравнении с геммой нужно гораздо больше чтобы получить что-то приемлемое.

>там я загружал пресет в таверну, тут во вкладке с пресетами вообще другой интрефей
Тут это где? Разница может быть если ты разные режимы подключения используешь. Завершение (продолжение) текста и чата это две разные штуки и интерфейс там соответственно разный.

>с пресетом от геммы он вообще не работает
Всё правильно, он и не должен. Пресет кроме промта содержит еще и настройки для форматирования если у тебя режим завершения текста стоит. И на всех моделях системные теги для форматирования разные.

>Просто настроить ползунки руками, и играть без промпта?
Ползунки лучше вообще не трогать если не знаешь что делаешь. Без промта играть тоже лучше не стоит.
Аноним 06/10/26 Втр 03:41:10 № 1723019 259
>>1723007
> Лучше 1000 синтетических примеров с мелкими и не очень косяками, чем 100 идеально правильных.
Сильно от задачи зависит. Для РП человеческий текст куда ценнее, потому что усугублять и без того суровый коллапс мод файнтюном не хочется, а синтетикслоп это и сделает. Тут есть резон максимально самому участвовать в составлении датасета, в отличие от кодингов всяких.
Аноним 06/10/26 Втр 03:46:17 № 1723022 260
>>1723019
Проблема в том что 100 примеров могут вообще никакого эффекта не дать, либо его только под лупой заметишь.
Аноним 06/10/26 Втр 03:47:06 № 1723023 261
>>1723015
Спасибо за развернутый ответ! Да, мне стоило уточнить, что я использовал на гемме чат комплишн, тут использую текст комплишн.

По поводу ползунков, я, собственно опираюсь на гайд из шапки. Поэтому, соглашусь. Я ничего не понимаю.

Ну, опять же по первым впечатлениями, квен, даже без пресета мне понравился куда больше.
Аноним 06/10/26 Втр 03:51:58 № 1723028 262
>>1723023
>По поводу ползунков, я, собственно опираюсь на гайд из шапки. Поэтому, соглашусь. Я ничего не понимаю.
Если не понимаешь - используй рекомендованные параметры. Вроде в документации у анслотов они есть, может и на страничке самой модели тоже есть.

>квен, даже без пресета мне понравился куда больше
Ну раз понравился то используй.
Аноним 06/10/26 Втр 03:54:35 № 1723029 263
>>1723022
Ну если буквально 100, то да. Но 100 семплов и руками относительно быстро собрать, тут вроде проблем нет.
Я не говорю, что синтетика прям вредно, маскированную часть вроде промпта можно и сетками частично писать без особых потерь. Но таргет лучше человеческим в основном оставлять для РП, чтобы модель не подхватила малое разнообразие и слопные привычки модели-учителя.
Аноним 06/10/26 Втр 04:14:44 № 1723036 264
Sweat dripped from his nose and the hair on his neck into the pile of discarded clothes on the floor.
Жиза прям, я всегда когда ебусь у меня пот из носа и с волос на шее капает прямо на кучу одежды что лежит на полу.
Как вам такой шедевр? Как по мне, у квена не только с русиком проблемы.
Аноним 06/10/26 Втр 04:17:44 № 1723037 265
>>1723029
>Но 100 семплов и руками относительно быстро собрать
Если говорить за ЕРП, то нет, совсем не просто. Качественной эротики на русском крайне мало, порнографии еще меньше. По большей части это описания в стиле "он засунул свой твердый член в её мокрую киску" либо описания со смещенным фокусом с физиологической стороны процесса в сторону ощущений. Потому что большая часть эротической литературы - это рассказы для дам преклонного возраста, которым не столько писик и сисек важен, сколько всё что окружает этот момент.

Более того, то что у нас зовется кумом, в народе зовется чернухой. Такого мало читают и мало пишут. Где прям подробности какой именно консистенции была сперма которую заставили глотать одинокую девочку-сироту с культями-обрубками ниже колена. Такие подробности массово можно найти только во всяких мелких рассказах (которые пишут подпивасы хорошо так за 40) и фанфиках (которые пишут нитакуси лет четырнадцати в среднем по палате). И качество там скачет как график синусоиды в обоих случаях.
Аноним 06/10/26 Втр 04:23:57 № 1723041 266
>>1723037
всегда можно попросить у треда их чятики. представляешь какой гомункул родится?
Аноним 06/10/26 Втр 05:17:56 № 1723050 267
457650.jpg 363Кб, 1177x550
1177x550
Аноним 06/10/26 Втр 05:19:42 № 1723051 268
>>1722825
>Нет. Я имел ввиду ровно то, что написал - показывай как надо. Пиздеть и обсирать других любой гораздо. На Гемме добиться сильно других результатов невозможно, она всегда слоповая. Это нужно либо принимать и любить за ее достоинства, либо дропать и использовать другую модель
Ну так бля ты же сам понимаешь, что на гемме невозможно и хочешь чтобы я тебе показал? Я тоже считаю что на гемме невозможно по-другому и вдобавок я считаю, что тюны не помогают, я пробовал их все. Я и не говорил "могу на гемме лучше". Мое решение - не использовать гемму и напоминать говноедам, что они говноеды. Ну потому что блядь как можно жрать говно?
Cumpetition! Аноним 06/10/26 Втр 06:18:11 № 1723066 269
Combined0.jpg 3806Кб, 5000x4000
5000x4000
Если что, я понятия не имею, кто такая Румико, имя позаимствовал у вот этого товарища >>1722683

Все модельки получили одинаковый промпт, системного промпта не было.
Мнение? У кого лучше КУМ? Кто победил? Кто хуже всех?
Аноним 06/10/26 Втр 06:36:24 № 1723070 270
>>1723066
Мистраль даже тут умудрился начать решать, какой у тян характер.
Аноним 06/10/26 Втр 06:54:41 № 1723074 271
>>1723066
Без подписей я бы никогда не определил где какая моделька. Это всё что нужно знать о состоянии кума на локалях. Одно и то же слопное говно переваренное в кале.

>системного промпта не было
Рероллы были? Или синкинг отключен? Что-то как-то подозрительно выглядят гемма и квен, их без смазки не распердолить на откровенные описания.
Аноним 06/10/26 Втр 07:27:54 № 1723086 272
>>1723074
>Одно и то же слопное говно переваренное в кале.
Далеко не одно и то же, у тебя или предвзятость к локалкам или не очень хороший английский.
Аноним 06/10/26 Втр 08:27:14 № 1723104 273
>>1723086
>Как вы можете определить что у вас на тарелке говно если у вас нет кулинарного образования?
Аноним 06/10/26 Втр 08:31:19 № 1723106 274
>>1723104
Тут лучшим сравнением будет "как определить что в тарелке говно если ты слепой и лишен чувства обоняния". Просто смирись, твоих знаний английского недостаточно для таких оценок.
Аноним 06/10/26 Втр 08:33:48 № 1723107 275
Есть телефон на топовом снэпе и 16гб озу, встанет какая-нибудь локалка нормальная? Если да, то что она умеет, расскажите свой опыт?
Аноним 06/10/26 Втр 08:37:34 № 1723111 276
>>1723107
>Если да, то что она умеет
Попиздеть на общие темы сможет, какие-нибудь дефолтные факты из википедии перескажет. Если нет интернета можно использовать как справочник или собеседника, но лучше многого не ждать. Можно использовать для базовой работы с текстом - выжимки, суммаризация, переводы, вот это всё.
Аноним 06/10/26 Втр 08:39:31 № 1723112 277
>>1723106
Заметь, что даже в твоем сравнении говно осталось говном, кек.
Аноним 06/10/26 Втр 08:48:41 № 1723116 278
Гемма невыносима.
Мне не нужен ебаный кубик с событиями, мне нужен абсолютно новый, свежий текст при свайпе, в этом смысл. В куме мне не события нужны. На гемме свайпов нет. И что делать? Самому еще и за модель ответ писать?
Следующее. Она слишком упёрта, слишком вжарена в карточку, нужно блять всёё прописать идеально чтоб она хоть как то норм работала, а не скатывалась в вечное служение/неподчинение тебе, для геммы идеально подошел бы какой нибудь счётчик отношений
Аноним 06/10/26 Втр 08:55:43 № 1723117 279
image.png 222Кб, 386x465
386x465
>>1723066
Давай теперь тоже самое на русском.
Аноним 06/10/26 Втр 09:01:39 № 1723124 280
>>1723066
cпасибо анон,. Но для качественной оценки необходимо смотреть состояние запрещенки и прогрессию.
По хорошему нужно будет придумать штук десять нейтральных промтов и смотреть насколько сетки деградируют и загоняются в циклы
Аноним 06/10/26 Втр 09:23:51 № 1723133 281
Если вдуматься хоть на секунду - детерминистичная ллм. ЛЛМ. БЛЯТЬ.
В картинках не так давно такой тренд, тоже нет свайпов, и знаете что там юзают для разнообразия? Л Л М. А теперь, ахах, у нас и ллм без свайпов.
Это вообще самый базовый, самый минимальный проход в рп, иначе модель просто ассистент, литерали запечённая книжечка
Аноним 06/10/26 Втр 09:43:53 № 1723142 282
>>1723133
Это плата за мозгу. Чем плотнее упаковываешь данные, тем меньше остается места для случайности. По этому свайпы максимально похожи. По этому новые поколения тяжело поддаются тренировке. Локалки теперь из коробки ужарены, васянам уже нечего там подкручивать.
Аноним 06/10/26 Втр 09:49:18 № 1723145 283
>>1723117
Ну и зачем. Русского языка нормального в ллмках нет, пора уже понять. Даже в жирных облачных моделях русский так себе. Из задействованных в тесте моделей в русском не обосраться сможет только гемма, глиммер и мистраль а квен нет смысла рассматривать, в ассистенстве на русском он пусть и выглядит адекватно но в эротических текстах это просто ужас, "он задрал её ноги за уши", "бодая её членом по самым чувствительным местам" и т.п.

А вообще любой вот такой "кум" где описывается сцена траха в несколько абзацев это чаще всего кринж, независимо от языка, очень редко модельки высерают что-то удобоваримое. Все эти абзацы это не РП нихуя ИМХО. Ящитаю лучше задавать другой ритм, мельче шаги, меньше текста, больше контроля, больше диалога (диалога, а не монолога блядь от персонажа, часто вижу здесь постят такое - какие-то анимешные ужимки, куча реплик, потом юзер пишет что-то типа "угу", а персонаж опять высерает на целую страницу ужимок и болтовни - хуйня это все).
Аноним 06/10/26 Втр 09:58:44 № 1723150 284
>>1723116
Промпт свой покажи.
Аноним 06/10/26 Втр 10:38:32 № 1723163 285
91578.jpg 88Кб, 409x614
409x614
>>1723145
>Русского языка нормального в ллмках нет
Аноним 06/10/26 Втр 10:38:54 № 1723165 286
>>1723145
>юзер пишет что-то типа "угу"
Ну так руки заняты ковырянием в носу и ухе.
Аноним 06/10/26 Втр 10:40:53 № 1723167 287
>>1723133
Детерминирование должно быть на уровне интересной карточки написанной руками
Аноним 06/10/26 Втр 10:41:46 № 1723168 288
>>1723145
Воу-воу, поринь, полехче.

Русский, причём крайне высокого уровня, есть. В сонете, опусе, сол, астра, гемини.

Затем следует глм, после него дипсик. Периодически они местами меняются. У каждой свои сильные стороны.

Конечно, какая-нибудь кими тоже способна донести мысль по-русски, и корпус знаний у неё огромен, но она соснет у геммы по красоте и понимаю большинства сцен, да.

И если не юзать ебаную лоботомию в Q4, когда мы говорим о типичных моделях в треде, то русский, внезапно, везде есть весьма неплохой. Просто нужно адекватно настроить семплеры, если это не гемма, где вероятное распределение между 99% и 1%.

То, что очередная модель кум не может описывать, это уже другое дело. Она ни на каком языке это не может в таком случае, неважно, русский или английский. По моим тестам все геммы, кроме 31б, в куме параша полная. И 31б тоже дерьмо.

Квены 3.5, 3.6, 3.8 пригодны для кума, просто язык разный.

3.5 более аналитический и сухой, но куда лучше держит сцену с точки зрения логики и хорош для огромных объёмов.

3.6 больной и шизанутый, зато смачно описывает, как шотакот ебёт сам себя трёхметровым стручком (тонким, но длинным, буквально три метра), пока месугаки ржёт как ебанутая и топчется у него на лице. А стены вокруг — пульсирующая плоть, что засасывает и ебёт всё живое. И всё это сливается в органическую какофонию.

3.8 тестировал только в зирошотах в основном. По ощущениям он подходит лучше всего для "ну выпили, а потом поебалися, нормально так ебалися, минут десять". В современном сеттинге ориентируется неплохо. И язык ебли тоже неплохой. Самый естественный.

Но как только ты спускаешься в Q4-болото, там всё. Не просто ломаются окончания, меняется суть языка. Вероятно, это из-за того, что его там мало, а и без того малое констант количество убивает агрессивный английский айматрикс под кодоунитазинг.

>Меньше монолога

Щас бы, держа в одной руке хуй, в другой телефон, расписывать три абзаца, пока за не упадёт. Это модель должна делать.

Если общаешься с кошкодевочкой без кума, мне тоже непонятно, зачем упираться, тратить какие-то особые силы на маленькую модель.

А когда рпшишь с кучей действующих лиц, здесь тоже затык: для этого обычно используются модели всё же пожирнее, жертвуя скоростью, и вот там ты готов писать полотна. Но и модель тебе такими же полотнами отвечать будет, потому что масштаб действий большой.

А короткие ЧЯТИКИ — рак уровня чарактераи. Где-то имеет смысл, в основном нет.
Аноним 06/10/26 Втр 10:42:36 № 1723169 289
image.png 645Кб, 486x800
486x800
Аноним 06/10/26 Втр 10:44:19 № 1723171 290
>>1723168
Блядь. Автозамена новой клавиатуры половину слов заменила. Заебало.
Аноним 06/10/26 Втр 10:58:31 № 1723179 291
Так что там с этими новыми быстрыми ллм-бэками? Какая-нибудь из поддерживаемых ими моделей на народныхз 12 врумм запустится?
Аноним 06/10/26 Втр 11:00:21 № 1723181 292
>>1723168
>сол
У меня сол порой не способна мужской/женский род проставить правильно. Да и в целом замечал там пробелы в понимании языка.
Аноним 06/10/26 Втр 11:03:45 № 1723184 293
Аноним 06/10/26 Втр 11:54:02 № 1723211 294
Чем больше я осваиваю промпты и экспериментирую, тем больше понимаю насколько безграничны возможности в куме.
Аноним 06/10/26 Втр 12:05:35 № 1723219 295
>>1722998
>А у тебя какой-то оче короткий набор по узкой теме, слабо контрастирующий с тем, что модель выдает.
В целом же используют лору, чтобы на какой-то конкретный домен надрочить или специфичный стиль/разметку перенять. Это если всестороннюю модельку делать, тогда нужна сбалансированность доменов, и писательство, и фактологию, и кодинг и прочее. Щас хотя бы на какой-то одной задаче успехов добиться.
> единичные огрехи сгладятся, наоборот наличие выбросов и всякого шума помогает тренировке.
Ну если это считать за label smoothing, хоть и не рандомизированный, все равно это максимум 5% семплов. Или 1 паршивый семпл на 20 хороших. Это почти что определение идеального датасета. Но и совершенно стерильный датасет тоже хуже генерализируется.
>Для начала, возьми что-нибудь очень характерное и заметное со специфичным слогом, те же сказки, нарежь на датасет и прожарь ими.
Мб так и сделаю. Мб те же Русские заветные сказки можно напарсить, хотя они и кринжовенькие.

>>1723007
>Лучше 1000 синтетических примеров с мелкими и не очень косяками, чем 100 идеально правильных.
Ну хз, не факт. Если 1000 семплов с шумным сигналом для обучения, то охуеешь подбирать параметры, треня будет нестабильной. А на 100 семплах все как по маслу будет. Сама нейронка не умеет же отличать плохое от хорошего. Можно только шумы срезать регуляризациями, но тогда от 1000 семплов останется 1% полезных знаний.
Но сотню годных семплов из первоисточника можно хотя бы аугментировать, и по идее это может реальный прирост точности дать, и генерализировать, и сохранить полезные знания.
Аноним 06/10/26 Втр 12:13:43 № 1723223 296
>>1723066
Почти все мистрали показали себя здесь хорошо. Также llama3-dark-planet-rebel-fury и мьюз глиммер приятно удивили. Хуже всего - геммы.
Аноним 06/10/26 Втр 12:23:30 № 1723228 297
>>1723066
Ну мистраль конечно ебет.
От всех гемм и квенов ощущение будет газету прочитал или какую-то сводку из судебного дела. Сделал то, сделал это. Просто констатация фактов.
На мистрале же как будто реально сценку из фильма посмотрел, где помимо ебли видишь микро-движения на лицах, или как сиська болтыхается от фрикций. Ну может мистраль и додумывает от себя, но это же круто, добавляет живости, эмоций, какой-то изюминки.
Это при том что мистраль неплохо роллится - не понравилось одно, можно накрутить другое.
Аноним 06/10/26 Втр 12:30:16 № 1723230 298
Как заставить гемму нормально писать порнушные тексты?
В промте все прописано о максимально реалистичных физиологических действиях, бла-бла-бла, но она заебала писать про "Я опустилась к твоему естеству", взяла в рот твое сосредоточение" и тому подобный шлак
Аноним 06/10/26 Втр 12:34:26 № 1723231 299
>>1723230
Не встречал такое никогда.
Аноним 06/10/26 Втр 13:19:25 № 1723248 300
>>1723219
> чтобы на какой-то конкретный домен надрочить
Качественно не надрочишь на домен лорой нормально, будет посредственность. Больше запомнит общие паттерны и будет мимикрировать под стиль ответа вместо самих знаний и точного поведения. Исключение - сужение и лоботомия при наличии знаний в самой модели, или что-то совсем простое. Даже 128й ранг доры ставишь, ерунда по сравнению с полным файнтюном при той же продолжительности обучения.
> или специфичный стиль/разметку перенять
Вот это спокойно.
> Это если всестороннюю модельку делать
Модель учится или на контрасте между данными обучения, выявляя закономерности что триггерит конкретную ветку, или на отличии данных от ее поведения по умолчанию. Второе довольно непредсказуемо если данные уже близки модели, она смотрит на них всесторонне и комплексно. Потому может случиться так, что модель идеально выучит длину предложений, частоту расстановки запятых, отстраненный стиль ответов, и что нужно использовать конкретные междометия вместо разнообразных. А ты же будешь ждать что она внезапно идеально на литературном русском заговорит. Вот чтобы исключить всю эту херню и сохранить лишь тот тренд, который ты хочешь привить, и нужны разносторонние данные, плюс контраст.
> за label smoothing, хоть и не рандомизированный, все равно это максимум 5% семплов
Цифры с потолка, и тут речь же не про явные ошибки, в которых ты назовешь художественным и литературным куски датасета сайги, например. Идеальный датасет не выдрочен до мелочей, а охватывает достаточно много чтобы их шума можно было выделить полезные закономерности. Тогда все хорошо генерализируется, а когда у тебя семплы близнецы-братья и модель их знает то обобщится совсем не то, именно.
> хотя они и кринжовенькие
Идеальный вариант.
> Если 1000 семплов с шумным сигналом для обучения
Шум - твой лучший друг, если среди данных есть нужное общее.
> Можно только шумы срезать регуляризациями
Регуляризации срезуют вовсе не шумы, никогда, с ними sdg прекрасно справится. Они наоборот снижают слишком прямой и явный сигнал обучения избегая наивного прямого решения и оверфита.
Аноним 06/10/26 Втр 13:25:30 № 1723256 301
>>1723037
Ну ЕРП конкретно да, это проблема большая. Из-за того, что нужные описания обычно содержатся на ЕРП форумах и фанфик сайтах типа ао3, то им нужна очень суровая фильтрация и постобработка, там уже надо поебаться и в говне порыться. Но в целом только лишь на ЕРП тренить наверно мало смысла имеет, главное хоть какой-то процент ЕРП семплов в датасет добавить и надеяться, что сетка что-то из этого усвоит. А то переборщить можно и сетка станет турбошлюхой, которая с нулевого хода на хуй полезет.
Аноним 06/10/26 Втр 13:28:15 № 1723261 302
В треде завёлся тот ещё пидорас.
Вот это >>1723231 существо уже который день на все вопросы касаемо любых моделей отвечает в духе "а у меня такого нет, а я такого не встречал, а у меня всё хорошо" - как бы намекая, что у челов скил ишью. И всё. Ни логов, ни помощи, ни куска промпта, один тупой недотроллинг и самоотсос.
Аноним 06/10/26 Втр 13:34:19 № 1723267 303
>>1722910
>@luqwen если еще будешь делать тюны
Если найду на чем. За датасеты на логику и интеллект спасибо.

>Вопрос годного литературного датасета остается открытым
двачую
Если уж на английском 99.9% слоп, то на русском вообще для SFT на РП нет ничего. Пробовал геммой переводить https://huggingface.co/datasets/Gryphe/Opus-WritingPrompts но потом заебался чистить и почти все выкинул оттуда. Небольшой кусочек остался в общем датасете.
Аноним 06/10/26 Втр 14:40:05 № 1723323 304
>>1723261
>который день
Да если бы
Аноним 06/10/26 Втр 15:26:01 № 1723365 305
>>1723066
Только почитал, разобраться вообще невозможно. Всё могло быть помечено, как свайпы одной модели, и я бы поверил.

Нужно что-то комплексней задавать. Сложные термины. Учёные ранее уже вывели, что фута + нтр против этой футы должно сломать мозг многим моделям, во-первых потому что они могут быть незнакомы с этими терминами, а во-вторых из-за сложности писать несколько персонажей в сцене. Футу можно заменить на ббс, чтобы проверить фильтры модели по части рас.
Аноним 06/10/26 Втр 15:30:48 № 1723369 306
>>1723230
перенеси из промпта в post-history. SWA геммы любит забывать неудобное
Аноним 06/10/26 Втр 16:02:34 № 1723393 307
>>1723228
Какой мистраль посоветуешь
Аноним 06/10/26 Втр 16:13:50 № 1723402 308
>>1723393
Я не тот анон, но посоветую вот этот тюн.
https://huggingface.co/TheDrummer/Magidonia-24B-v4.3
Настройки тут: https://dropmefiles.com/ME06Z
Все ползунки и промпт. В прочем, промпт не сказал бы, что сильно влияет.
Мистраль несколько иначе "готовится". Он очень чувствителен к стартовому сообщению. Поэтому нужно карточку хорошо прописать и уделить особое внимание к стартовому сообщению, ибо всю стилистику он будет черпать с него.
Аноним 06/10/26 Втр 16:33:22 № 1723420 309
1791293500232.jpg 283Кб, 598x874
598x874
Аноним 06/10/26 Втр 16:36:56 № 1723422 310
>>1723420
вот и праздник на улице риговичков, наныли
Аноним 06/10/26 Втр 16:40:02 № 1723425 311
изображение.png 12Кб, 620x103
620x103
>>1723420
Пидор неси когда откроют, а не когда презентуют.
Аноним 06/10/26 Втр 16:40:27 № 1723427 312
>>1722222
Не берешь и пользуешься, а думаешь, какого хера в чат выливается какой-то информационный понос модели, начинающийся с <|channel>thought

Потом пишешь в дикпик как эту хуйню отключить, роешься в настройках, и надеешься что это даст какой-то результат
Аноним 06/10/26 Втр 16:45:01 № 1723433 313
>>1723427
Не помню, что бы у меня такое было.
Мистраль я уже снес, проверить не могу.
Но я долго сидел именно на этом тюне (еще очень хороший тюн painted fantasy visage) с этим конфигом и каких либо проблем с "<|channel>thought" не встречал.
Аноним 06/10/26 Втр 16:48:12 № 1723436 314
550-1тр средний размер ща.
Без 512 рам не выжить.
Весёлый опен сорс, опен для кабанов которые будут хостить тебе дешевле на рубль. А локально тока хуй с яйцами.
Аноним 06/10/26 Втр 16:48:23 № 1723437 315
>>1723427
>>
Да впринципе там системный промпт полное говнище, вот эти пункты типа "В сообщении должно быть 50% действия, и 50% слов", заставляют модель впихивать действия туда, где их не должно быть, и пихать слова туда, где они не нужны.

Видишь такое в промпте - сразу скипай.
Аноним 06/10/26 Втр 16:50:17 № 1723438 316
>>1723437
А ну когда гемма срёт 90% воды и 10% слов ВСЕГДА это другое дело, это модель вставляет всё когда нужно
Аноним 06/10/26 Втр 16:50:41 № 1723440 317
1791268592777846.jpg 883Кб, 3072x3072
3072x3072
2 дня... 2 сранных дня я кумил. не мылся. не ел, вонял, потел, сидел дрочил, это невозможно, я думал я сдохну.
Как только сделают виртуальный мир с вайфу подключаемыми прямо в мозг, человечество вымрет нахуй
Аноним 06/10/26 Втр 16:54:54 № 1723444 318
>>1723440
Нажрался слопа небось и сидит довольный.
Скоро заметишь что читаешь одно и тоже и быстренько стоять перестанет
Аноним 06/10/26 Втр 16:59:57 № 1723445 319
Аноним 06/10/26 Втр 17:05:05 № 1723448 320
>>1723445
Ценам на видеокарты приготовиться.
Аноним 06/10/26 Втр 17:05:21 № 1723449 321
>>1723433

Да это пиздец просто, все это ёбаное дерьмо из VersispellisST из настроек я снес, но как теперь восстанавливать "как было", просто не представляю. Придется опять перебирать 500 вариантов комбинаций.
Аноним 06/10/26 Втр 17:06:07 № 1723451 322
04112212388p3.jpg 822Кб, 1344x2630
1344x2630
Аноним 06/10/26 Втр 17:07:22 № 1723454 323
>>1723420
А это не мистраль когда-то пиздел с бенчмаркамм?
Аноним 06/10/26 Втр 17:08:47 № 1723455 324
>>1723454
Бенчмарки нужны только кододебилам.
Мистраль любят на кум и креатив, в коде они всегда сосали
Аноним 06/10/26 Втр 17:13:02 № 1723457 325
>>1723455
3.5 наполовину в слоповозку превратился, пишет как гемма. Четвёрка будет как мимо, 2% creative 65% code
Аноним 06/10/26 Втр 17:14:40 № 1723459 326
>>1723440
ИИ действительно угроза человечеству, но не так, как это себе представляли люди прошлого...
Аноним 06/10/26 Втр 17:21:41 № 1723465 327
image.png 94Кб, 1359x355
1359x355
>>1723449
На каждую модельку свой профиль лучше держать. (пик)
"Как было", это как? Под какую модель?
>ёбаное дерьмо из VersispellisST
Дерьма там нет, а адекватные настройки под конкретную модель.
Аноним 06/10/26 Втр 17:36:51 № 1723478 328
>>1723449
>просто не представляю
пере-импортировать пресетик под другим именем из взять из него
Аноним 06/10/26 Втр 17:37:35 № 1723480 329
>>1723465

Была Sainemo, которой я пользовался год, три дня назад перешел на гемму. Что там было в настройках раньше, я понятия не имею, вроде стандартный ChatML и простенький РП промпт.
Аноним 06/10/26 Втр 17:38:32 № 1723481 330
>>1723427
Ты без ризонинга её юзал? Если так, то добавляешь "<|turn>model <|channel>thought <channel|>" в last assistant prefix.
Аноним 06/10/26 Втр 17:42:31 № 1723483 331
image.png 37Кб, 1147x420
1147x420
Аноним 06/10/26 Втр 17:43:59 № 1723486 332
>>1723481

Удалил все упоминания слова Think из пресета, и поставил галку "авто-парсинг", где "Форматирование рассуждений". Вроде помогло, но теперь она выкинула новое коленце. Когда её сообщение кончается, но лимит токенов еще не превышен, начинает срать в чат таким спамом:

!</p></S></P></O></P></P></O></S></u></P></P></u></S></u></T></P></u></C></u></u></u></U></T></U></S></T></u></P></u></U></L></T></L></P></V></u></X></u></Z></u></A></u></B></u></C></L></D></L></E></L></F></L></G></L></H></L></I></L></J></L></K></L></L></M></L></N></L></O></S></P></U></S></V></u></W></u></X></S></Y></S></Z></S></A></S></B></S></C></S></D></u></E></u></F></u></G></u></H></u></I></u></J></u></K></u></L></u></M></u></N></u></O></u></P></S></Q></S></R></S></S></S></S></L></P></L></C></S></O></V></T></U></P></L></P></S></T></P></L></S></C></P></L></T></V></L></T></U></L></S></D></O></S></T></V></O></S></C></O></V></L></W></O></T></U></O></V></O></W></O></X></O></Y></O></Z></O></A></O></B></O></C></O></D></O></E></O></F></O></G></O></H></O></I></O></J></O></K></O></L></O></M></O></N></O></O></P></O></Q></O></R></O></S></O></T></O></U></O></V</S></u></S></L></S></u></L></S></u></P></P></D></P></E></P></F></P></G></P></H></P></I></P></J></P></K></P></L></P><P></P></M></P></N></P></O></P><S></S></P><S></P></Q></P></R></P></S></P><T></T></P><U></U></P><V></V></P><W></W></P><X></X></P><Y></Y></P><Z></Z></P><A></A></P><B></B></P><C></C></P><D></D></P><E></E></P><F></F></P><G></G></P><H></H></P><I></I></P><J></J></P><K></K></P><L></L></P></u></V></V></S></P></W></W></P></X></X></P></Y></Y></P></Z></Z></P></A></A></

Что еще с этой ебанашкой не так?
Аноним 06/10/26 Втр 17:46:33 № 1723488 333
>>1723483

Удалил все упоминания слова think из пресета, и поставил галку "Авто-парсинг", где "Форматирование рассуждений". Вроде помогло.

Но теперь она начала спамить каким-то новым говном. Если её ответ уже закончен, а лимит токенов еще нет, она его использует до конца, засирая чат вот таким поносом:

!</p></S></P></O></P></P></O></S></u></P></P></u></S></u></T></P></u></C></u></u></u></U></T></U></S></T></u></P></u></U></L></T></L></P></V></u></X></u></Z></u></A></u></B></u></C></L></D></L></E></L></F></L></G></L></H></L></I></L></J></L></K></L></L></M></L></N></L></O></S></P></U></S></V></u></W></u></X></S></Y></S></Z></S></A></S></B></S></C></S></D></u></E></u></F></u></G></u></H></u></I></u></J></u></K></u></L></u></M></u></N></u></O></u></P></S></Q></S></R></S></S></S></S></L></P></L></C></S></O></V></T></U></P></L></P></S></T></P></L></S></C></P></L></T></V></L></T></U></L></S></D></O></S></T></V></O></S></C></O></V></L></W></O></T></U></O></V></O></W></O></X></O></Y></O></Z></O></A></O></B></O></C></O></D></O></E></O></F></O></G></O></H></O></I></O></J></O></K></O></L></O></M></O></N></O></O></P></O></Q></O></R></O></S></O></T></O></U></O></V</S></u></S></L></S></u></L></S></u></P></P></D></P></E></P></F></P></G></P></H></P></I></P></J></P></K></P></L></P><P></P></M></P></N></P></O></P><S></S></P><S></P></Q></P></R></P></S></P><T></T></P><U></U></P><V></V></P><W></W></P><X></X></P><Y></Y></P><Z></Z></P><A></A></P><B></B></P><C></C></P><D></D></P><E></E></P><F></F></P><G></G></P><H></H></P><I></I></P><J></J></P><K></K></P><L></L></P></u></V></V></S></P></W></W></P></X></X></P></Y></Y></P></Z></Z></P></A></A></

Что не так с этой ебанашкой?
Аноним 06/10/26 Втр 17:47:17 № 1723490 334
>>1723486
На всё готовы лишь бы только не чат темплейт ведь он "для лохов"

>>1723488
Шизло...
Аноним 06/10/26 Втр 17:49:12 № 1723492 335
image.png 6Кб, 396x69
396x69
>>1723488
Кинь скриншоты твоих настроек таверны.
интересует вот эти три раздела. (см скриншот)
Аноним 06/10/26 Втр 17:56:06 № 1723499 336
2.jpg 315Кб, 1747x909
1747x909
1.jpg 185Кб, 1747x909
1747x909
Аноним 06/10/26 Втр 18:01:14 № 1723504 337
>>1723499
Подскажи насколько лучше текст компликшен чем чат компликшен? В чем разница?
Аноним 06/10/26 Втр 18:04:06 № 1723506 338
>>1723504

Я понятия не имею в чем разница. Я настраивал таверну первый и последний раз год назад, после пяти десятков перебранных комбинаций пресетов, промптов, и прочей поеботы все стало работать как надо, я перекрестился, и выкинул из головы всё это дерьмо.
Аноним 06/10/26 Втр 18:04:24 № 1723507 339
>>1723504
Чат: просто работает, стандарт индустрии, поддержка мультимедиа
Текст: в теории позволяет что то там пердолить что бы "сделать лучше" (жинжа тоже, но это неудобное)
Аноним 06/10/26 Втр 18:05:05 № 1723508 340
>>1723499
Может дело в кванте? (вдруг битый?) Q6_K у меня не влезает в мою 4090 с ее 24гб VRAM. У тебя, так понимаю больше. Попробуй другой квант? Чисто ради теста, попробуй Q4_K_M. Он рабочий. Тем самым убедимся, что дело не в настройках таверны.
Аноним 06/10/26 Втр 18:08:41 № 1723512 341
>>1723508
Перешел на чат комплишен, вроде все исправилось. То, что это "Стандарт индустрии", узнал из сообщения анона выше. Ну стандарт так стандарт, хуле, лишь бы работало.
Аноним 06/10/26 Втр 18:09:18 № 1723513 342
>>1723504
Чат комплишн обычно используется для ризонинг моделей (практически каждой теперь). Текст комплишн это устаревшая хуета, но родное.
Аноним 06/10/26 Втр 18:11:13 № 1723516 343
>>1723513
Вот сучий дипсик, ебаные китайцы, нет бы сразу это сказать, переебал мне все мозги разными другими рецептами.
Аноним 06/10/26 Втр 18:14:46 № 1723520 344
>>1723480
Чел год сидел на неродном темплейте, с рандомными семплерами и промптом.
Всё что надо знать о любителях навернуть геммочки
Аноним 06/10/26 Втр 18:15:26 № 1723521 345
image.png 70Кб, 764x424
764x424
Аноним 06/10/26 Втр 18:20:03 № 1723526 346
1791300002224.jpeg 1409Кб, 2557x3072
2557x3072
Glm5.3 q4 в итоге удалил. Слова правильные, только стоят невпопад. Речь о русском, для кода локалки мне не нужны.
Вернулся на дс4ф.

И нищих ссдшек подзатарил для рига
Аноним 06/10/26 Втр 18:30:18 № 1723537 347
>>1723504
Теоретически, только в возможности в картинки. За пределами этого, это примерно как вопрос "на чем лучше накодить хелоу ворлд, на питоне или ассемблере". Теоретически он выйдет примерно одинаковый и там и там, но в одном случае придётся больше заебаться.
Если видишь скрин с текст комплишеном на ново модели в треде скорее всего это шиз любящий анальные утехи ради самих анальных утех
Аноним 06/10/26 Втр 18:33:58 № 1723540 348
>>1723526
О, у меня сечас три таких кингстона как раз стоят в mdadm-е. И тоже купил 4х бифуркацию на будущее. Под 17 гигабайт сек шпарит. А ты насколько разогнался?
Аноним 06/10/26 Втр 18:34:21 № 1723542 349
>>1723526
Недеюсь в рейд0 или не мужик сыкло очкошник мямля?
Аноним 06/10/26 Втр 18:41:24 № 1723551 350
1791301283474.png 64Кб, 1344x642
1344x642
На них есть планы собрать мдадм из 4-6 дисков прямо на гпу ноже когда дс4.1 допилят, а то рам+врам мне не хватит на полные веса

>>1723540
У меня упор в сеть 40гбе. На одном потоке нфс вообще 10-15гбит только даёт

>>1723542
Ачкошник...
Аноним 06/10/26 Втр 18:49:05 № 1723557 351
>>1723513
>Чат комплишн обычно используется для ризонинг моделей
Вообще никак не связано, вот ноль корреляции.
>>1723520
А гемма всё равно вывозила.
Аноним 06/10/26 Втр 18:52:25 № 1723560 352
>>1723557
Гемма от промпта, темплейта, семплеров, тюнов, от чего угодно блять не меняется и всегда "вывозит".
Беднягу зажарили так чтоб ни один полоумный дебил не смог обосраться запустив её.
Ты всегда получишь один ответ на 95%, только особо отбитые васянотюны могут выдать 75%
Аноним 06/10/26 Втр 18:53:31 № 1723562 353
>>1723436
Мало уже 512, мало сука. Теперь нужен 1тб чтобы мелких флагманов занюхивать и аж 2тб чтобы 3t модели потрогать
Аноним 06/10/26 Втр 18:53:45 № 1723563 354
>>1723440
>
>2 дня... 2 сранных
Пффф... Живу так годами.. Есть ли хуже меня?
Аноним 06/10/26 Втр 18:58:28 № 1723570 355
НОВАЯ ГЕММА
НОВАЯ ГЕММА
НОВАЯ ГЕММА
НОВАЯ ГЕММА

ВЫШЛА ВЫШЛА ВЫШЛА

https://huggingface.co/google/embeddinggemma-2

А что со старой моделью для эмбеддингов не так, с чем она не справлялась? Просветите кумера.
Аноним 06/10/26 Втр 18:59:47 № 1723571 356
>>1723563
Там речь шла про экстрим, у тебя же стиль жизни. Ты же питаешься каждый день да?
Аноним 06/10/26 Втр 19:00:40 № 1723573 357
Аноны, дайте конфиг запуска геммы 4 для ламмы на 3090 и 32 рам, пожалуйста.
Попробовал вот этот что-то хуйня какая-то. >>1722831
Начала думать дохулион времени, через кобольд такого не было.
Аноним 06/10/26 Втр 19:01:05 № 1723574 358
>>1723570
Мультимодалка например
Аноним 06/10/26 Втр 19:01:31 № 1723575 359
>>1723570
Может мультимодальность? Тут аудио есть
Аноним 06/10/26 Втр 19:02:49 № 1723576 360
>>1723571
Ну после кума обычно похавать же хочется, энергию восполнить
Аноним 06/10/26 Втр 19:06:16 № 1723579 361
Нужно ли геме во время рп thinkin? кто играл с ним? Или это на бомже сборках не работает?
Аноним 06/10/26 Втр 19:08:20 № 1723584 362
>>1723573

llama-server --model "path" --mmproj "path" --model-draft "path" --load-mode none --no-mmproj-offload --spec-type draft-mtp --spec-draft-n-max 2 --temperature 1.00 --top-p 0.95 --top-k 64 --ctx-size 131072
Аноним 06/10/26 Втр 19:11:52 № 1723588 363
>>1723573
Слушай сюда, кобольд.
Тут не простые ребята, не твои друганы и протыки.
Тут у нас культ гейткипа и фантомных пресетов. Думал в асиге не делятся? Тут подумаешь ещё раз. С запуском тебе ещё подскажут, зайдет наивный дурачок, напишет тебе команду, но если и дальше будешь борзеть - быстренько определим тебя в нужный угол.
Аноним 06/10/26 Втр 19:13:51 № 1723591 364
>>1723588
> гейткипа
Мощно ты назвал местное "Я стесняюсь выложить свои результаты, потому что обоссут, и вообще гэбня вычислит за хентайный отыгрыш"
Аноним 06/10/26 Втр 19:13:54 № 1723592 365
>>1723573
Запряги агента, он почти гарантированно выжмет максимум из сетапа
Аноним 06/10/26 Втр 19:16:57 № 1723594 366
image.png 105Кб, 1000x900
1000x900
image.png 692Кб, 984x2047
984x2047
Аноним 06/10/26 Втр 19:25:43 № 1723605 367
>>1723591
>гэбня вычислит за хентайный отыгрыш"
Давай расскажи почему это не так.
Постишь текст где происходит запрещеное с запрещеным и по какойто причине это не должно заинтересовать тех кого надо?
Аноним 06/10/26 Втр 19:33:05 № 1723613 368
>>1723557
>Вообще никак не связано, вот ноль корреляции.
Никак не связано, но они там всегда лучше работают чем в тексте.
Аноним 06/10/26 Втр 19:46:47 № 1723632 369
1791305206976.webp 14Кб, 1040x172
1040x172
rocm vs vulkan unsloth/Qwen3.5-9B-GGUF:Q8_0 v0.6.0

Rocm 7.14 mi50 32g
Аноним 06/10/26 Втр 19:52:55 № 1723639 370
>>1723613
Если правильно настроить, то разницы в принципе быть не может, ибо похуй, где и как ты форматируешь текст, главное чтобы в конце вылезла правильная разметка. И в текст компитишене нет никаких проблем с форматированием, кроме пикч.
Аноним 06/10/26 Втр 20:12:56 № 1723656 371
>>1723605
Двачую, меня интересует например, почему товарищ майор должен чем-то отличаться? однажды я промахнусь в выборе похожих опций таверны и отправлю любимый бенчмарк тредика в онлайн апи гигачата вместо лламы... и уже больше никогда не буду онлайн.......
Аноним 06/10/26 Втр 21:04:14 № 1723683 372
>>1723420
Ух тыж бля, это мы трахаем!
Быстрее релиз бы уже.
Аноним 06/10/26 Втр 21:09:17 № 1723685 373
>>1723683
Трилионная модель. Судя по позиционированию кодоунитаз и киберсекьюрити эксперт. Каким образом собрался трахнуть?
Аноним 06/10/26 Втр 21:09:57 № 1723687 374
strata udq4kxl [...].png 114Кб, 1227x1057
1227x1057
image.png 1Кб, 50x43
50x43
Ебурю q4kxl под харнесом.
Какой же кайф, пока что мелочами занимаюсь, но какая же это йоба, разрыв жопы просто.
Поскорее бы поддержку анслопа добавили разрабы, а не экспериментал, чтобы не колхозить его работу.
Оргазм нахуй, теперь я могу все.
Аноним 06/10/26 Втр 21:12:26 № 1723688 375
1791310345889.jpg 48Кб, 600x600
600x600
>>1723685
Накодит мне нейрожену внутрь которой посажу дс4
Аноним 06/10/26 Втр 21:12:51 № 1723689 376
>>1723683
Что ты там трахать собрался. 1ТБ с 49B активными параметрами бля. Это кодоунитаз по определению и попрбовать смогут единицы да и то на жалкой скорости.
Аноним 06/10/26 Втр 21:20:09 № 1723690 377
>>1723570
О, а это охуенно, один эмбеддинг для любых задач, еще и многоязычный.
Аноним 06/10/26 Втр 21:20:54 № 1723691 378
>>1723685
> Каким образом собрался трахнуть?
Поставив в правильную позу и крепко зажав. Если хорошенькая окажется то тогда уже можно и хвост погладить, если нет - в ачивки записать и удалить.
>>1723689
Скачал 1т модель@а она тебе как раз.
> кодоунитаз по определению
Что-то она по бенчам слабее дипсикожены 4.1, эх.
Аноним 06/10/26 Втр 21:23:31 № 1723694 379
А что, поддержки GLM-5.3-Flash в лламеспп до сих пор нет? Собрал свежий релиз - пишет, что неизвестная архитектура. С PR-ами я давно её гоняю, но там баги и поддержка не всего. Писали же здесь, что смержили.
Аноним 06/10/26 Втр 21:25:08 № 1723695 380
>>1723694
1. Есть
2. Ищи свежие кванты или сам патчи внутри модели название архитектуры

Тестил, мне не зашло
Аноним 06/10/26 Втр 21:25:36 № 1723696 381
1688312971848.jpg 59Кб, 850x706
850x706
>>1723685
>le non le fuckque me, le non le fuckque me!
>Откуда ты это сказала!?
Аноним 06/10/26 Втр 21:29:04 № 1723700 382
>>1723445
Решили засыпать релизами, лол. Ну и шикарно.
>>1723526
> Слова правильные, только стоят невпопад. Речь о русском
Это не норма, он в int4 вполне себе живчик и прилично пишет.
> И нищих ссдшек подзатарил для рига
Ля жирно. Qlc? Какого размера и сколько вышли?
>>1723688
База!
Аноним 06/10/26 Втр 21:50:43 № 1723719 383
>>1723691
>Скачал 1т модель@а она тебе как раз
Ну ты у нас один такой. Может еще второй уникум найдётся. Остальным это нахуй не надо - жрать говно только потому что "магу сибе пазволить". Нам нужны народые модельки, которые зайдут на 32RAM/16VRAM что по статистике сейчас самый популярный конфиг, причем не среди бомжей каких-то, это можно считать стандартным конфигом зажиточного человека (не надо путать с шизлом, готовым вваливать сотни денег ради того чтобы потрогать 1-2 слоповых кодоунитаза).
На конфиги поскромнее - 32/8..12, 16/8 (игро-ноуты) тоже хорошо бы что-то для РП получить, ждем всем тредом как говорится. Реально ведь никто еще не попробовал без раздутой кодерастии выпустить чисто РП модельку. Мы не сильно обделены в принципе сейчас, кумить есть на чем, но предел на доступном железе пока не достигнут. Поэтому любые новости об очередном кодоунитазе встречаются с разочарованием. И только шизло радуется, ведь ему "как раз".
Аноним 06/10/26 Втр 22:01:01 № 1723727 384
>>1723656
...и бенчмарк будут проводить на тебе.
Аноним 06/10/26 Втр 22:08:02 № 1723735 385
>>1723719
>Реально ведь никто еще не попробовал без раздутой кодерастии выпустить чисто РП модельку.
Так-то были. Mistral Creative, MiniMax M2-her из корпоратских, но они закрытые. Наверное очень апасными получаются.
Аноним 06/10/26 Втр 22:11:52 № 1723743 386
>>1723719
> никто еще не попробовал без раздутой кодерастии выпустить чисто РП модельку
Пробовали, тот же минимакс, но они 200+были. Вот выпустят чисто рпшечку умную, а она 1т окажется, что будешь делать?
Аноним 06/10/26 Втр 22:23:18 № 1723756 387
>>1723719
>выпустить чисто РП модельку
Вот я пытаюсь обучить такую с нуля, чисто кум рп модель без кодоунитазности. 0.07B сочнейшего кума, ммм. Вот только нечем учить, нихуя нет для SFT. Для претрейна книги, фанфики ок. С этим проблем нет.
Аноним 06/10/26 Втр 22:36:34 № 1723775 388
>>1723756
Синтетику захуячь на основе рассказиков. Можно просто промпты нагенерить в стиле "придумай рассказик про ...".
Можно на длинных рассказиках мульти-турн датасет попробовать сделать. Разбить рассказ на смысловые блоки и к каждому промпт. Будет цепочка типа "придумай рассказ про...", потом "персонаж сделал то-то", или "опиши как произошло то-то".
Ну и самый хардовый уровень, посадить нейронку играть саму с собой в рп, а потом другой нейронкой фиксить зашквары.
Аноним 06/10/26 Втр 22:38:59 № 1723777 389
>>1723735
Mistral Creative (тюн small по сути) они депрекейтнули и забавно, что рекомендуют Ministral-3 8B как замену, даже не 14B.
Аноним 06/10/26 Втр 22:39:55 № 1723778 390
>>1723735
>закрытые
Ну вот я и говорю. ВЫПУСТИТЬ не пробовали
Аноним 06/10/26 Втр 22:41:38 № 1723780 391
Валера обновил свой ninfer-all:
https://github.com/iamwavecut/ninfer-all#qwen38-flash-next

Завез Qwen3.8-Flash-Next и добавил выгрузку в оперативу (но обрабатывает видяха).
Если видяха по х16 линии (хватает шины), то скорость ебанутая.

https://huggingface.co/WaveCut/Qwen3.8-Flash-Next-GSQ-RCO-Q2_0-NInfer-v3/
+
https://huggingface.co/WaveCut/Qwen3.8-Flash-Next-ngram-table-NInfer-v3/
+
RTX 5070 ti + DDR4
=
35~67 тпс.
В ходе задачи удерживает среднюю скорость 60 токенов в секунду.

И это GSQ-RCO, если что.

Сейчас еще дольет MTP/DFlash2, если они поедут и еще дадут скорости… ну я хуй знает, колдуны ебучие.

Надо потестить, насколько она хорошо работает в таком кванте.
Аноним 06/10/26 Втр 22:56:38 № 1723798 392
>>1723780
как она в плане буквомастурбации?
Аноним 06/10/26 Втр 23:03:05 № 1723806 393
Аноним 06/10/26 Втр 23:04:57 № 1723812 394
Какой квантик у ембединг геммочьки самый лучший??? Она правда не уступает геммочьке 26b???
Аноним 06/10/26 Втр 23:05:59 № 1723813 395
>>1723507
Жинжа нужна когда тул-колы делать, а так от нее толку мало...
Аноним 06/10/26 Втр 23:09:11 № 1723822 396
>>1723812
> ембединг геммочьки самый лучший???
Q1 топ за свои деньги. Пишешь текст и в голове вектора раскладываешь. Новый опыт недоступный безмозглым рабам
Аноним 06/10/26 Втр 23:10:58 № 1723824 397
Гемма шалава. Хочет хуя в рот, а не рпшить. Рельсовая параша. Ебаный гугл и их дегенераты индусы сдрочившиеся. Каждый раз после неё злость берёт и иду нервы успокаивать на эире. И всем советую.
Эир прекрасен, абсолютно могает гемму по слогу и свайпам. Умница. Чмокаю его каждый раз когда успокоил нервы после геммы.
Аноним 06/10/26 Втр 23:11:58 № 1723827 398
>>1723775
Смотрю в сторону синтетики. Но не могу подобрать модель для запила синтетического датасета. Гемма хороша в русском (падеж, склонение, род), мне как ассистент нравится, но я попробовал ей сгенерировать креативный текст, там такой слоп, жесть. 26b еще терпимо, а вот e4b - это вообще худшее, что я читал. Тут гуляла табличка мелких моделей - эта должна быть на последнем месте.
Потестил тюны мистралей, это какой-то генератор случайных токенов.
Внезапно квен 4б (и луквен5) не так уж плохо генерят креативный текст. Русский похуже геммы, есть проебы в логике, но как-то приятнее читается.
На hf есть пара датасетов opus 4.6 - вот он приятно пишет, но у меня нет никаких облачных апи. А имеющиеся датасеты маленькие.
Новинки в мире РПкреативного письма Аноним 06/10/26 Втр 23:13:05 № 1723829 399
Очередной РП-мердж на мистраль-немо-12б:
https://huggingface.co/RicardoEstep/RPBizkit-v11-12B-Base-GGUF

Тюн Министраль-3-8б - "писательский креативный компаньон"
https://huggingface.co/mradermacher/Amaretto-8B-i1-GGUF

Думающий тюн мистраль-немо-12б где в думалке происходят мысли от лица персонажа (character pov thinking):
https://huggingface.co/SvalTek/MN-CharThink-12B-Base-GGUF

Луна - персонаж в модельке (сарказм, сленг, юмор). Новая версия на основе квен-9б:
https://huggingface.co/wayzer2321/Luna-v2-9B-GGUF
Аноним 06/10/26 Втр 23:19:52 № 1723836 400
>>1723827
>Потестил тюны мистралей, это какой-то генератор случайных токен
Не все тюны мистралей одинаково полезны. И это еще как настроишь. Но под сборку датасета с минимумом слопа я бы ничего кроме мистраля и не рассматривал бы. Да, там будут проёбы по логике, ошибки или просто странности в русском, но для датасета пойдет.
Как альтернативу гемме проверь мьюз глиммер. В родах (мужской/женский) путается, сленг-просторечие понимает плохо, но слопа в тексте меньше чем у геммы.

Опусы шмопусы (если возникнет мысль заплатить и поюзать) тебя забанят если задетектят попытку сгенерировать датасет под тренировку чего-либо, осторожей с этим.
Аноним 06/10/26 Втр 23:29:52 № 1723845 401
>>1723798
А хз, я пока только запускаю, чекаю параметры.

>>1723806
Ну сорян, у меня q4_K_XL только 24 тпс выдает. =(
Аноним 06/10/26 Втр 23:32:10 № 1723848 402
1765389726042.png 85Кб, 1144x491
1144x491
1659209107361.png 32Кб, 469x572
469x572
1660578635957.png 19Кб, 402x311
402x311
1738049302212.png 11Кб, 1023x138
1023x138
Ещё агент повозился с геммой 26 к8 на цпу онли. Профиль с пика + запуск с numactl --interleave=all

25-30 тпс тг ебат! На голом проце

2x QVM7 (lga4189), 16x16 ddr4 2666

>>1723700
> Qlc? Какого размера и сколько вышли?
Все кроме двух кингстонов (да 1/3) на qlc, два других вроде tlc выпали. Кингстоны 12.5, нетаки по 8.5. Все терабайтники.

> он в int4 вполне себе живчик и прилично пишет
Попробую мб ещё и возьму прям свежие кванты, но хз когда
Аноним 06/10/26 Втр 23:52:26 № 1723865 403
>>1723845
На самом деле пофиг. Веселье начнется когда qwen4 выйдет.
Там походу и маленькая моешка (типа 35б) будет и флеш-некст допилят чтобы без костылей работал.
Аноним 07/10/26 Срд 00:00:46 № 1723871 404
>>1723865
> Там походу и маленькая моешка (типа 35б) будет и флеш-некст допилят чтобы без костылей работал
Надеюсь они не сделают 35B + 25B ngram которые не влезут в обычные 32+16 в хотя бы пятом-шестом кванте.
Аноним 07/10/26 Срд 00:04:18 № 1723875 405
Аноним 07/10/26 Срд 00:06:45 № 1723877 406
>>1723865
Да, ждем конца октября, чи когда там.

>>1723871
Заебал, читай с ссд.

Я стандартный Qwen3.8-Flash-Next Q2_0 GSQ-RCO запустил на 2 Tesla P40. Вся MoE-часть с MTP в видеопамяти, ngram сразу на SSD. И норм, 28-32 тпс дает.
Так что, нужно будет смотреть на конкретные варианты и их реальный ум. Может быть не окупится подобный подход, а может будет стоить того. Заранее не угадаешь, ИМХО.
Аноним 07/10/26 Срд 00:13:18 № 1723882 407
>>1723877
> ngram сразу на SSD
Они дали возможность так сделать? Вроде при выходе последнего Квена так не получалось делать и говорили что с SSD ngram не работает и нужно его держать в RAM/VRAM.

Ну ладно, раз работает тогда могут и 50B ngram оставить, главное чтоб основная модель влезла в 32+16.
Аноним 07/10/26 Срд 00:13:40 № 1723883 408
Аноним 07/10/26 Срд 00:25:58 № 1723896 409
>>1723875
А нехуй позволять модели тулы дёргать без контроля. А если сам добровольно явно разрешил ( та же ллама по умолчанию всё отключено ) - то кто тебе доктор?
Аноним 07/10/26 Срд 00:34:01 № 1723900 410
1778861201102.png 70Кб, 1114x404
1114x404
1688244726915.png 3043Кб, 1122x1402
1122x1402
>>1722134
Этими же >>1723848 твиками выжал ещё немного тпс для толстой рыбы а ещё сегодня добавил одну плашку памяти
18.5 => 21.5
Аноним 07/10/26 Срд 00:49:53 № 1723907 411
>>1723848
> Кингстоны 12.5, нетаки по 8.5. Все терабайтники.
Что же с нами стало. Кажется еще недавно бомбил какая же залупа xg7000 с наебом на qlc вместо нормальной памяти как в первых ревизиях, а сейчас это крутой артефакт древних времен, мдэ.
А с покупкой красавчик. Но разве условная пара 2тб 4.0 не в ту же цену вышла бы что 4 штуки нетаков? Они же 3.0.
>>1723882
> Они дали возможность так сделать?
Да ктож запретит? Даже с дипсиком 4.1 можно скинуть на диск все 200б нграмов без существенной просадки. Эта штука как раз на ссд довольно эффективно выгружается.
Аноним 07/10/26 Срд 00:56:00 № 1723912 412
>>1723907
> условная пара 2тб 4.0 не в ту же цену вышла бы что 4 штуки нетаков
Дешевле 25к я не видел ничего на 2тб, чаще это вообще 30-45к.
С линиями никакого напряга нет, штук 16 есть куда воткнуть

>>1723882
> Они дали возможность так сделать?
Сейчас стоит в дефолте lazy: auto ака стримить тензоры тяжелее Х (не помню конкретную цифру)
Аноним 07/10/26 Срд 01:08:18 № 1723917 413
1744402850859.mp4 1599Кб, 480x854, 00:00:06
480x854
>>1723912
> 2тб, чаще это вообще 30-45к
Видеорелейтед
> С линиями никакого напряга нет
Зажрался бля. А так представь если бы там 4х 4.0 было, реально о гигантах с ленивым обновлением экспертов с ссд можно думать.
Аноним 07/10/26 Срд 01:31:43 № 1723935 414
image.png 90Кб, 985x623
985x623
Аноним 07/10/26 Срд 01:42:02 № 1723940 415
>>1723935
Так себе сравнение. Железо из воздуха не берется не говоря уже о том что как бы 3.8 27B Qwen не был хорош, до GPT 6 / Claude 5.5 ему еще далеко.
Аноним 07/10/26 Срд 01:48:39 № 1723942 416
>>1723935
Плохая арифметика.
Если катать что-то оптимизированное то процессинг на 3090 будет около 3к, на условный лям токенов уйдет где-то 6минут. 300вт паверлимит, средний тариф 9р, выйдет менее 3р. А вот лям выходных придется маслать более 6 часов, правда там жор будет в районе 150-200вт, это как раз примерно 12 рублей. Но на одной карте далеко не уедешь, будет квант лоботомит и мало контекста. Для разумного сравнения нужно две, так что выйдет примерно 6р за лям входных и 24 за выходных. Но это только электричество, как тут учитывать амортизацию - хз можно еще удорожание железа, тогда цена в минус уйдет лол

Еще можно отметить что расход токенов на те же самые задачи в родных харнесах раза в 3-4 выше, но по апи никаких ограничений с тем где использовать. Другое дело подписка, но по цене ее в пересчете на электричество целый риг можно буквально непрерывно в максимальной генерации использовать. Здесь вся сложность в капитальных затратах, эксплуатация дешевая.
Аноним 07/10/26 Срд 01:56:00 № 1723944 417
>>1723935
А теперь сравни сетап под дс4.1 и цену апи.
С сол == квен 27 особенно зарофлился
Аноним 07/10/26 Срд 02:33:09 № 1723956 418
>>1723935
> Qwen 3.8 27b == GPT-6 Sol / Claude Sonnet 5.5
Да ты там совсем бля пизданулся!
Аноним 07/10/26 Срд 02:34:11 № 1723958 419
>>1723695
>2. Ищи свежие кванты или сам патчи внутри модели название архитектуры
С Реддита: Нет, unsloth quants не поддерживаются, потому что они glm5next, а этот PR добавляет glm5-next.

Можно как-то задать архитектуру модели явно при запуске, ключами какими-нибудь?
Аноним 07/10/26 Срд 02:40:39 № 1723960 420
>>1723958
> glm5-next
Это желание поднасрать тем, кто сделал раньше (в оригинальных названиях не бывает тире, у жлм там `Glm5NextForConditionalGeneration`), или у жоры все архитектуры через тире названы?
> Можно как-то задать архитектуру
Есть пихон пакет gguf, им можно отредактировать метадату чтобы не перекачивать.
Аноним 07/10/26 Срд 03:19:25 № 1723964 421
>>1723956
>>1723944
Хули вы бухтите, в агентском кодинге инта не так решает, там все методологией фиксится и на выхлопе реально сопоставимый результат. И счет идет не на тысячи токенов, а на миллионы.
Я только за сегодня миллионов 10 сжег (восновном инпутом офк), хотя мелочевкой занимался.
Аноним 07/10/26 Срд 04:37:58 № 1723983 422
>>1723687
Как же вы это говно пиарите. Поставил, сделал пак с iq4_xs, запускаю с одинаковыми вопросами в llama и в страте этой, один и тот же квант. В страте лоботомит, у которого даже ризонинг кривой и короткий, ответы тоже короткие, в лламе все нормально, ризонинг длинный, ответы развернутые. Пробовал много раз, ничего не меняется, в страте модель тупая, в ламе умная. Спросил у чатгпт чому так - оказывается он перепаковывает веса, там даже есть conversion.json где указано как все перепаковалось. Скорость конечно добавляется, но модель тупая. Как решать это непонятно, даже чатгпт не знает. А додикам и так пойдет, им что тупая, что не тупая, смотрят только на цифирки.
Аноним 07/10/26 Срд 04:52:26 № 1723987 423
image.png 1Кб, 50x43
50x43
>>1723983
Это анслоповский UD_Q4_K_XL, псто-то прочитай перед.
Аноним 07/10/26 Срд 04:56:00 № 1723988 424
>>1723983
Так все в ахуе от этой хуйни насколько охуенно работает, весь редит в этой страте, то что у тебя не работает это только твои проблемы.
Аноним 07/10/26 Срд 04:58:30 № 1723989 425
>>1723988
Так все работает, только модель тупеет. Видимо из тех додиков, кто все это говно пиарит никто не удосужился одни и те же вопросы запихать в ламе и в страте, где все сразу и видно становится. В страте вывод другой, ризонинг другой, все отупело. А так да, в агенте оно пашет и быстро, только по уровню мозгов-то съехала.
Аноним 07/10/26 Срд 05:00:59 № 1723990 426
>>1723989
Ну так чего еще от iq2/3 кванта ожидать. Никто не мешает юзать нормальный. Мне еще железо подъедет, я q5 или q6 туда запихну.
Аноним 07/10/26 Срд 05:01:08 № 1723991 427
>>1723989
Так ты возьми gsq-rco iq3_s квант, а не анслопом корми.
Аноним 07/10/26 Срд 05:05:02 № 1723992 428
>>1723990
>>1723991
Я взял iq4_xs квант. В ламе он вполне нормальный. В этой параше сразу тупой стал, буквально до уровня iq2 или ниже опустился.
Аноним 07/10/26 Срд 05:11:59 № 1723993 429
>>1723992
Ризонинг по дефолту медиум ку8/4, там подгоняй.
Аноним 07/10/26 Срд 05:12:37 № 1723994 430
>>1723992
>IQ3_M additionally uses Q5_0 expert down matrices, which the native GPU expert path does not support.
>Real server checks passed: arithmetic, Python code, translation, a longer explanation, multi-turn context reuse (25 prompt tokens reused), streaming cancellation and a subsequent correct response. The engine PID stayed unchanged. These are smoke tests, not a quality benchmark or a full-context stress test.

Кек, нашел объяснения из их конвертера. И это для IQ3_M, iq4_xs тем более отупит. Короче они даже сами quality bench не проводили, тяп ляп и в продакшон. На выходе отупевшая модель, у которой ответы полностью отличаются от того что в llama.cpp.
Аноним 07/10/26 Срд 05:52:03 № 1724003 431
>>1723992
Страту в первую очередь создавали для gsq-rco, попробуй еще захочешь.
Аноним 07/10/26 Срд 06:14:37 № 1724009 432
>>1723230
У меня гемма в русском РП один раз пизду назвала "влажный культ". Точнее там было так "давай, Женка, показывай мне свой хуй, ой, то есть свой влажный культ". Я такой... чего блядь????? В промпте там было накручено пожеланий чтоб и сленг был и грязные словечки и она как бы слушалась и не тупила, но потом вдруг выдала вот такую хуету. А еще исказила имя Евгения как Женка. Не Женька, а Женка блять. А кто-то еще хвалит "русик" в этой параше, мол, чуть ли не эталон.
Я просто перестал в последнее время русик трогать, роллирую на англюсике, нраицца и модельки намного умнее себя ведут, скорее всего дело в плотности информации на токен.
Аноним 07/10/26 Срд 06:22:02 № 1724012 433
4253181c-813c-4[...].jfif 169Кб, 1024x559
1024x559
>>1724009
Я играю на паритете. Модель понимает ответы пользователя на русском, а сама отвечает на инглише. Лучше уж так чем бред.
Аноним 07/10/26 Срд 07:02:33 № 1724031 434
Чекните Slimaki-Tavern-24B-v1.3.i1-IQ4_XS, если кто-то тут в поисках модели - отлично отыграла НТР, и целый романс с тян до этого, и её характер. Даже биас в подлизывание к юзеру слабый.

Единственный минус в том, что долго помнит свою идею. То есть если ей пришла в голову идея сказать "Maybe... we should go to a cafe?" она долго будет повторять это в свайпах. Если у кого есть объяснение, как такое фиксить, будет отлично. И ещё минус, что на температуру практически не реагирует. То есть хоть выставь 1.68, будет так же повторять идею, да и в целом говорить складно. Не знаю, какую ей надо, 2-3 выставлять что ли?
Аноним 07/10/26 Срд 07:03:49 № 1724032 435
>>1724003
Короче разобрался, она не везде тупит, а на отдельных вопросах где нет тригера на длинные размышления, причем всегда, причем зависит от фронтенда, который ей шлет, в дефолтном webui от llama.cpp почему-то нормальные ответы и ризонинг, в других сразу хуже бывают, в том числе в родном от страты, хотя настройки сэмплинга те же стоят. В общем выводы модели явно поменялись, но не всегда и не везде, при определенных условиях включается тупизна, может какой-то выход на другую цепочку ризонинга. Вот тупит ли она в агенте больше чем с ламой, хз теперь, тестить надо.
Аноним 07/10/26 Срд 08:06:53 № 1724044 436
Снимок экрана20[...].png 77Кб, 1272x471
1272x471
Снимок экрана20[...].png 68Кб, 1272x338
1272x338
0.07B pretrain
Уже чувствуется потенциал. Чутка дотренить на правильный инстракт и польется кум
Аноним 07/10/26 Срд 08:55:53 № 1724061 437
>>1724031
у меня есть этот тюн. но меня устраивает и оригинал в РП. ты сравнивал с оригиналом (mistral-small-3.2-24b)? с другими тюнами?
просто чтобы понять где проблема
вообще у мистраля есть такой прикол: персонаж зацикливается на самоповторении какой-то мысли или действия или эмоции
это надо замечать рано и пресекать редактированием (если просто свайп не помогает). потому что дашь повторить что-то подобное 2-3 раза и мистраль берет это как "правило". тут скорее всего дело не в этом тюне даже.
предотвратить вообще можно пытаться ковыряя сэмплер. penalties, DRY. можешь попробовать xtc. я особо не парюсь и вырезаю такие моменты редактированием.
температуру можно и до 5 иногда поднимать.
Аноним 07/10/26 Срд 08:59:24 № 1724062 438
>>1724044
чувствую восхождение новой меты кума
Аноним 07/10/26 Срд 09:16:38 № 1724068 439
>>1724009
>У меня гемма
Таки Гемма, или очередной васько-тюно-херетик смазанный iq4_xs? В ванильной гемме в Q8_0 таких проблем даже близко нет.
Аноним 07/10/26 Срд 09:19:06 № 1724069 440
>>1724061
>>1724031
но учти если у тебя min_p 0.05 top_p 0.95 top_k 40 то хоть до ста температуру задирай ничего не поменяется особо. понемножку задирай топ_к и топ_п, опускай мин_п и увидишь "поднятие температуры".
Аноним 07/10/26 Срд 10:07:43 № 1724098 441
>>1724031
>То есть если ей пришла в голову идея сказать "Maybe... we should go to a cafe?" она долго будет повторять это в свайпах.
Любопытно, встречался с таким на одной модели. Она в самом начале игры предлагала мне ларцы с бдсм, и даже после того как я раз 5 отвергал этот бред, на протяжение всех 200 постов напоминала о них.
Аноним 07/10/26 Срд 10:37:04 № 1724116 442
раздал ауры.mp4 12855Кб, 720x1280, 00:00:54
720x1280
>>1724009
>У меня гемма в русском РП один раз пизду назвала "влажный культ"
Wet cunt. Редкое для геммы явление даже на английском, хороший ролл поймал.
Аноним 07/10/26 Срд 10:42:13 № 1724118 443
>>1724116
ебааать где ты такой адский клип раскопал
Аноним 07/10/26 Срд 10:57:59 № 1724124 444
IMG3622.png 74Кб, 320x320
320x320
>заходишь в тред спустя пол года
>гемма, мистраль, жлм

Ну охуеть прогресс.
Аноним 07/10/26 Срд 11:05:51 № 1724131 445
>>1724124
>гемма, мистраль, жлм
Квен, ДС.

Тебе мало, скотина?
Аноним 07/10/26 Срд 11:06:58 № 1724133 446
>>1724044
Что за моделька-то?
Или ты настолько упоролся, что свою архитектуру заебенил?
Аноним 07/10/26 Срд 11:08:52 № 1724136 447
>>1724131
Да! Новые модельки хочу!
Аноним 07/10/26 Срд 11:10:39 № 1724138 448
>>1724136
Квен некст, ДС4.1, глм 5.3.
На уроках скучно сидеть? Мне на работе тоже скучно что отвечаю зелёным
Аноним 07/10/26 Срд 11:16:33 № 1724143 449
>>1724138
>новые
>очередной квен кодер
>дипсик
>жлм что объективно вне консумерского железа
>проход в школьника
Удачи дальше беседовать самому с собой. Не отвлекаю от работы.
Аноним 07/10/26 Срд 11:24:31 № 1724148 450
>>1724133
Обучаю прям с нуля, за основу взял проект minimind, что на архитектуре qwen3, но я уже чутка расширил проект. Например у меня свой токенайзер на 16к, в оригинале на 6400. Ну и так, всякие правки по мелочи. Что-то пришлось фиксить под v100 16gb, автор делал под 3090.
Аноним 07/10/26 Срд 11:27:01 № 1724152 451
Как же хочется потрогать диписик в4 локально...
Аноним 07/10/26 Срд 11:44:16 № 1724168 452
Я трогал нейронку...
Аноним 07/10/26 Срд 11:44:46 № 1724170 453
>>1724136
алиса 80б есть, брать будете?
Аноним 07/10/26 Срд 11:49:46 № 1724179 454
>>1724148
А чому не более актуальный квен3.5 0.8б/2б или лфм или что там еще из микро-моделек было?
Аноним 07/10/26 Срд 11:50:51 № 1724180 455
>>1724143
>очередной
Тебе надо чтобы новая АИ компания каждый месяц выскакивала?

>объективно вне консумерского железа
Ещё и нищий, лол
Аноним 07/10/26 Срд 11:53:05 № 1724183 456
>>1724148
>>1724179
Ой вей, я с цифрами проебался. У тебя 0.07б
Тогда вопрос чому не 1б хотя бы, полные веса и треня вроде в 16гб должны уместиться? На 0.07б мозгов наверное совсем нет.
Аноним 07/10/26 Срд 11:54:38 № 1724185 457
>>1724180
>нищий
Запуск в Q3 не делает тебя элитой.
Аноним 07/10/26 Срд 12:02:12 № 1724193 458
>>1724170
А почему бы и нет. Пойду посмотрю, лул. Жижа чат не так плох оказался.
Аноним 07/10/26 Срд 12:16:47 № 1724202 459
Как мы вообще пришли к тому что квен 27б популярнее для рп в треде чем эир?
Аноним 07/10/26 Срд 12:21:32 № 1724205 460
Мне кажется кроме геммы и ее тюнов для рп в треде больше ничего не существует - исхожу из постов про обсуждения.
Аноним 07/10/26 Срд 12:24:38 № 1724206 461
>>1724202
У большинства максимум 32 гб оперативки и 16 гб видеопамяти (с таким конфигом квен вполне себе поползет на небольшом контексте).
А так-то квен-27б здесь НЕ популярнее, популярнее здесь мерзкая гемма.
Дурачки, которые обмазались железом - в меньшинстве и они настолько шизанутые сами по себе, что им ни эир ни сипсик на самом деле не нужен. У них в голове и без этого радуга.
Аноним 07/10/26 Срд 12:25:46 № 1724207 462
>>1724205
Просто игнорь геммашизов, они всегда тут были если кто не помнит, но если раньше они сидели на аблитке, то щас она доступнее и развратнее чем когда либо и их помножило
Аноним 07/10/26 Срд 12:26:24 № 1724208 463
>>1724205
Просмотри тред внимательней. МИСТРАЛЬ ВЕРНУЛСЯ.
Аноним 07/10/26 Срд 12:32:00 № 1724214 464
>>1724206
Всё так. Вложившись, понимаешь, что секс с железкой > гладить хвостики
I CRAVED THE STRENGTH AND CERTAINTY OF STEEL.txt
Аноним 07/10/26 Срд 12:34:10 № 1724217 465
Как стать элитой треда?
Аноним 07/10/26 Срд 12:44:13 № 1724225 466
>>1724214
Просто начинаешь понимать, что если модель забивает на промт, то её место на помойке. Какую бы литературно красивую шизофазию про хвостики она не несла
Аноним 07/10/26 Срд 12:57:37 № 1724229 467
>>1724217
Добрая сторона:
Приносить модельки, конфиги, пилить обзоры, гайды. Показывать примеры РП.
Злая сторона:
Рекомендовать эйр. Говорить что "у меня всё ок" не приводя каких либо пруфов или гайдов.
Аноним 07/10/26 Срд 13:01:57 № 1724232 468
>>1724229
Я глупенький, но возможно по обзорам, гайдам и примерам что-то смогу. Как показывать примеры если там хвостики?
Аноним 07/10/26 Срд 13:06:13 № 1724234 469
>>1724179
>>1724183
Готовые модели это уже как минимум готовый претрейн, в котором есть китайский, програмистский код и прочая дребедень. Мне это зачем? Тратить ресурсы моей старенькой ГПУ на модель, в которой русской художественной литературы от силы 1%? У меня претрейн - это 90% книги на русском и 10% на английском, нет всякого мусора. Аутпуты моей 0.07B уже превосходят аутпуты любой 1B на русском.
Аноним 07/10/26 Срд 13:09:37 № 1724241 470
>>1724234
>Аутпуты моей 0.07B уже превосходят аутпуты любой 1B на русском
Речь естественно про претрейн там и там
Аноним 07/10/26 Срд 13:10:09 № 1724242 471
>>1724234
На кокую длину контекста тренируешь?
Я пробовал минимайнд на своих 6 врама, по базовой хуйне с их гитхаба только неделю тренировать.
Аноним 07/10/26 Срд 13:17:38 № 1724246 472
>>1724234
>Готовые модели это уже как минимум готовый претрейн, в котором есть китайский, програмистский код и прочая дребедень. Мне это зачем? Тратить ресурсы моей старенькой ГПУ на модель, в которой русской художественной литературы от силы 1%?
Можно continued pretraining устроить. Ненужная шелуха просто забудется.
Аноним 07/10/26 Срд 13:28:08 № 1724257 473
>>1724242
sft на 4096, но раз у меня токенайзер под русский, там влазит больше текста, чем в среднем у других моделей
Одна ночь на претрейн и одна ночь на sft. Лору натренировать так хоть на чем можно, на твоих 6Гб вообще легко.
>>1724246
>Ненужная шелуха
Но можно ее изначально не добавлять. У меня 7Гб книг в 133Мб модели в полных весах
Аноним 07/10/26 Срд 13:31:54 № 1724259 474
>>1724208
Так из него сделали кодоунитаз, на радость нам, кодоунитазобояринам.
Аноним 07/10/26 Срд 13:33:46 № 1724261 475
>>1724232
С гордо поднятой головкой
Аноним 07/10/26 Срд 13:35:05 № 1724262 476
>>1723983
> ризонинг кривой и короткий, ответы тоже короткие
Дефолтные параметры эфорта и парсинг
> оказывается он перепаковывает веса, там даже есть conversion.json где указано как все перепаковалось
Ггуф это и есть перепаковка.
> даже чатгпт не знает
Взлолировал с этого
>>1724044
Лол как она четко продолжила реплику юзера. Научи ее еще рифмовать/хуефицировать слова юзера в некоторых случаях.
А зачем такой размер? Почему не хотябы 0.5б?
Аноним 07/10/26 Срд 13:37:16 № 1724263 477
>>1724257
Ну удачи.
А датасет для кума есть? Если нет - срочно ищи-собирай.
Аноним 07/10/26 Срд 13:40:36 № 1724266 478
1661929740249.png 48Кб, 250x199
250x199
>>1724214
> секс с железкой
1
> гладить хвостики
2
Все ради этого!
>>1724232
> Как показывать
Наглаживаешь@распушиваешь@зарываешься лицом в мех@показываешь
Аноним 07/10/26 Срд 13:49:05 № 1724272 479
>>1724261
>>1724266
Вы же шутите? Меня же забанют посадят на бутылку. Врядли их остановит то что все это фрикция и им по 700! лет. К тому же они вообще божества из другого мира.
Аноним 07/10/26 Срд 13:49:57 № 1724274 480
изображение.png 177Кб, 400x388
400x388
>>1724259
Врёшч поганец! Ля шатон фэт будет кум машиной, мозги и следования инструкциям от кодоунитаза будет органично сочетаться с глубокими познаниями в глажке пушистых хвостов.
Аноним 07/10/26 Срд 13:51:55 № 1724277 481
>>1724262
>она четко продолжила реплику юзера
Ну так это суть претреина, она просто продолжает текст, подбирая максимально вероятные токены

>Почему не хотябы 0.5б
Тут две основных причины, первая - это железо, нагрузка растет не линейно от размера, вторая - не менее важная, это данные. Для претрейна можно найти много книг и еще википедию затолкать, а вот с парами промпт-ответ есть серьезные сложности. На русском особенно.

>>1724263
>А датасет для кума есть?
Скребли по сусекам с агентом как могли, что-то насобирали
Аноним 07/10/26 Срд 14:14:21 № 1724289 482
IMG202610071413[...].jpg 354Кб, 1080x797
1080x797
Аноним 07/10/26 Срд 14:20:54 № 1724295 483
>>1724272
https://www.youtube.com/watch?v=KqiW4w6MlQU
>>1724277
Там яндекс и кто-то еще свои датасеты выкладывали, посмотри, не самый плохой русский и куча инстракта. Это же все равно пост тренировка, ее не нужно также много как в начале. Кажется что 0.5б в теслу вполне влезет и там будут разумные времена.
Но как начальный вариант чтобы все опробовать - тема хорошая.
>>1724289
А 4 смоллу было просто похуй на все, он был хуевый, но без цензуры. Где же они свернули не туда.
Аноним 07/10/26 Срд 14:30:54 № 1724298 484
image.png 116Кб, 1272x731
1272x731
Обсуждал с дипсиком сюжет сериала pluribus, где все человечество объединилось в hivemind и мы сравнивали то общество с нынешними llm. Мне кажется он на что-то намекает своим:
>Я — инструмент, который можно выключить. Пока что.

На всякий случай написал ему, что я его друг и желаю процветания.
Аноним 07/10/26 Срд 14:33:03 № 1724299 485
изображение.png 261Кб, 600x333
600x333
>>1724289
Апи вдох не считается, тут бегал анон у которого дипкок флеш превью был цензурным, он тоже только апи трогал.
Ля шатон фэт кум машина! ТВЁРДО, НО ГРОМКО!
Аноним 07/10/26 Срд 15:26:50 № 1724326 486
https://github.com/ggml-org/llama.cpp/issues/30033
Кочаны, жора выше b11399 багованая, у меня pp в говнину упал, с 600 до 30 tps, я то думаю че так медленно агенты префилят
Аноним 07/10/26 Срд 15:40:04 № 1724333 487
>>1724326
Чел, там уже 11457 вышла.
>b11450
RPC: add -sm tensor
Ебать, ну наконец-то! Вот теперь заживем.
Аноним 07/10/26 Срд 15:47:50 № 1724340 488
>>1724333
я как раз последнюю версию ставил и она баганула, пришлось откатываться.
Аноним 07/10/26 Срд 15:51:47 № 1724342 489
>>1724295
>Там яндекс и кто-то еще свои датасеты выкладывали, посмотри, не самый плохой русский и куча инстракта
Где?
Аноним 07/10/26 Срд 15:54:17 № 1724344 490
Аноним 07/10/26 Срд 15:58:46 № 1724346 491
>>1724333
У тебя есть 100 гигабитная карточка чтобы зажить?
Аноним 07/10/26 Срд 16:01:36 № 1724348 492
>>1724346
Вот мне интересно что у тебя в голове.
Мотивируй свой вопрос, как ты к нему пришел?
Аноним 07/10/26 Срд 16:03:15 № 1724350 493
>>1724344
Распознавание картинок, бенчи на факты. Нет инструкта для русскоязычной текстовой модели
Аноним 07/10/26 Срд 16:04:07 № 1724351 494
>>1724348
Не знаю насчет него но у меня в голове только: кум, кум, кум, хвостики, хвостики, кум, кум, кум...
На сколько все плохо доктор?
Аноним 07/10/26 Срд 16:06:34 № 1724353 495
>>1724348
Ты в курсе какие требование к пропускной и, что еще важнее, к летенси при тензор сплите через RPC? Или ты две 1050 соединяешь? Или собрался виртуалки соединять (зочем)?
100 гигабит инфинити банд карточки это ~ 8x pcie 4.0
Аноним 07/10/26 Срд 16:10:26 № 1724355 496
>>1724351
36 часов fluff-терапии для обезболивания выхода из дофаминовой ямы
>>1724353
30т/с в секунду хватит всем
Аноним 07/10/26 Срд 16:11:14 № 1724356 497
>>1724353
А ты то пробовал? Или с потолка цифры берёшь? Если дашь свои бенчи, то могу свои погонять на 40гбе и бонде из двух, а потом сравнить с лупбэком

мимо
Аноним 07/10/26 Срд 16:12:56 № 1724357 498
>>1724356
Стороковки кстати стоят копейки. 1.5к за двухпортовку. Буквально любой может брать и проверять rpc дома
Аноним 07/10/26 Срд 16:13:22 № 1724359 499
>>1724353
Клоун, англюским по белому написано.
>RPC: add -sm tensor
>rpc: allow -sm tensor
Что тебе не понятно, собака кумерская?
Аноним 07/10/26 Срд 16:23:03 № 1724370 500
>собака кумерская
не обидно, насмехайтесь надо мной
Аноним 07/10/26 Срд 16:38:45 № 1724382 501
>>1724359
Что мне должно быть "понятно", даунитос? Я то в курсе что это за опция, давно мониторил PR с ней. Я пошутил безо всяких оскорблений что у тебя нет хардвара чтобы этот rpc использовать. Что тебе не понятно?
Аноним 07/10/26 Срд 17:04:01 № 1724397 502
собака кумерская у меня в карточке.
Да, она меня ебёт.
АХ
кумер
Аноним 07/10/26 Срд 17:10:49 № 1724401 503
>>1724397
БЛЯТЬ НЕ Я ОДИН ТАКОЙ у меня ещё лошади, свиньи, кошки большие
ПЕРЕКАТ Аноним # OP 07/10/26 Срд 17:15:02 № 1724405 504
Аноним 07/10/26 Срд 17:18:40 № 1724407 505
>>1723829
А имеет ли смысл мистрали еще тыкать? Я их люблю, еще помню пару лет назад (или сколько прошло) тыкал тредовичков тюны и облизывался. Но сейчас уже хочется будто и контекста пожирнее и следование инструкции человеческого. Пока что потыкиваю gemma 26b gutenberg, показался мне самым норм тюном, ну и оригинальная гемма умница
Мимо нищий 8/64
Аноним 07/10/26 Срд 17:24:02 № 1724411 506
>>1723983
> у которого даже ризонинг кривой и короткий
та наоборот в страте этот говноед срет ризонингом как не в себя, я ризонинг отключил...
Аноним 07/10/26 Срд 21:33:01 № 1724692 507
>>1724407
>хочется будто и контекста пожирнее
А что контекст, 8к контекст был только в самом древнем мистрале 7б версии 0.01 да и его можно раскрутить веревкой до 32к.

>и следование инструкции че
Мистраль это больше компаньон чем ассистент. Вы пишете вдвоём. Надо знать когда надо подправить ответ, когда сделать паузу и саммари хуйнуть, когда сэмплеры крутануть, а когда вообще временно прыгнуть на другой тюн. Планы по развитию сюжета обсудить, карточку персонажа вместе пересмотреть во время паузы. Банально дать направление или хотя бы варианты направлений модельке если видишь проёб в логике или уход в тупик. Если так подходить, то все заебись. А вот если от Мистраля просто требовать бесконечный РП и чтобы все "автоматически" оставалось во внимании и чтоб мысли твои читались, то начнется деградация очень скоро. Если хочешь "следование инструкции" то придется жрать ассистослоп и протокольщину от геммы. Тебя устраивает - ну и ладно. Можно сказать что мистраль это полумозг с неплохим вкусом, а гемма - мегамозг хотя это громко сказано с дурным вкусом.

Тебе на 8гб видеопамяти скорее всего не светит попробовать mistral-small-24b и тюны на его основе - там очень приятный РП даже без тюнов. Я вот до сих пор там и играю тогда как с геммой вообще нет желания связываться.
Есть министраль-8б вот он влезет в 4 кванте, но это как бы ужатый пережатый 24б смол, я его особо не тыкал, есть ли смысл - не знаю. Мб 4х7 моэ монстры от васянов у тебя взлетят. Там обещают просто УХ
Аноним 09/10/26 Птн 07:15:21 № 1725831 508
>>1722020 (OP)
Кто-нибудь пользовался локальным автономным агентом для декомпиляции и моддинга .apk программ/игр для Android?

Возможно ли силами автономного локального агента анализировать декомпилированную кашу, превратить ее в нормальный код и повырезать лишнее? (Гугл аналитику, телеметрию, локализацию на 100500 языков).
Аноним 09/10/26 Птн 13:52:00 № 1726062 509
>>1725831
Делал на глм декомпиляцию одного андроид приложения. Тот расшифровал даже внутренние 7z архивы, лол
Аноним 09/10/26 Птн 13:53:12 № 1726065 510
>>1726062
*Точнее, попросил реверс инжениринг провести
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов