Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 502 74 92
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №267 /llama/ Аноним 14/09/26 Пнд 12:55:20 1703839 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение6.png 357Кб, 443x777
443x777
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1701124 (OP)
>>1699101 (OP)
Аноним 14/09/26 Пнд 13:04:11 1703848 2
>>1703839 (OP)
Тензорные ядра больше не спасают: почему ИИ-ускорители упрутся в память

Производители ИИ-ускорителей продолжают увеличивать количество тензорных ядер и осваивать всё более короткие форматы данных, включая FP8 и FP4. Производительность вроде как растет, причем впечатляющими темпами, но есть загвоздка. Вычислительные блоки нужно постоянно снабжать весами модели и промежуточными данными. Если память не успевает, дорогой чип с десятками миллиардов транзисторов натурально простаивает в ожидании очередной порции данных.
Samsung планирует решить проблему при помощи HBM 5: удвоить производительность относительно HBM 4E и на 20% повысить эффективность на ватт. Пропускная способность одного стека в перспективе может приблизиться к 4 ТБ/с благодаря 4096-битной шине. Давайте разбираться, что там и как.

https://habr.com/ru/companies/ru_mts/articles/1078518/
Аноним 14/09/26 Пнд 13:09:57 1703852 3
>>1703848
Аааааа, ужас, смерть, гроб, гроб, кладбище. Оказывается что для числодробилок нужно помимо ядер ещё и память тащить. Просто ахуеть. Новость.
Жаль что производители об этом не знают и не увеличивают псп постоянно до многих тб/с на чип
Аноним 14/09/26 Пнд 13:24:43 1703855 4
>>1703848
>хабр
💀
Это можно репортить?
Аноним 14/09/26 Пнд 13:30:55 1703862 5
>>1703855
Мало того что хабр дак ещё и блог МТС в который пишет джинерик пизда
Аноним 14/09/26 Пнд 13:48:10 1703874 6
Аноны, мне плохо. У меня травма.

Я пользовался корпомоделями, но в основном для рабочих задач, и тут чёрт меня дёрнул для генерации порно-промптов использовать корпоративное говно. Что мне ответили клод и клоседии, упоминать смысла — вы и так знаете. Гораздо интересней и страшней то, что сделал грок, который из коробки хоть ЦП может генерировать. Я его выбрал как раз из-за того, что ему похуй на любые авторские права и порнографию.

Он обосрался. Так жидко, так много, такой коричнево-водянистой лужицей, что вы даже представить себе не можете. Потратил 20% еженедельного лимита за полчаса. Думал по 5-7 минут. Сколько там токенов ушло, я даже не представляю. Он генерировал, открывал файлы и закрывал, удалял, потом снова. Как невменяемый.

Ему всего лишь нужно было составить простой пайплайн для генерации порнухи, там лишь 150 кадров. Он в первом же предложении вкинул два полностью не сочетаемых друг с другом тега. Я ему указал на это и сказал, что точно такие же места ещё есть — пофикси. Он долго думал и потом пофиксил лишь САМОЕ НАЧАЛО. Больше ничего.

Потом я пытался дальше. Всякие правки, вот это всё. Как бы вообще похуй на промпт. Привет, мистраль 24б.

Эта гадина срет под себя без остановки. Он не может НИЧЕГО. Он хуже, чем грок 4.2 даже. Он просто ошизел, словно там SWA 64 токена и фулл кэш весит 200 мегабайт нахуй.

У меня начался припадок и я запустил просто гемму 26б-а4б, аблитерация. Потому что нужен контекст 200к и отсутствие вони цензора. Эта собака допускала ошибки, но фиксила. Мне хватило 4 сообщений уровня "сделай пиздато", ЧТОБЫ ВСЁ СООТВЕТСТВОВАЛО МОЕЙ ДОКУМЕНТАЦИИ НА 25К ТОКЕНОВ, КОТОРАЯ БЫЛА И У ГРОКА ТОЖЕ, И НИГДЕ НЕ БЫЛО ЖИДКИХ ОБСЕРОВ ОТ ГЕММЫ!

Да, это не идеал. Знаний у неё мало. Результат без вау-эффекта. Но он рабочий.

Какой же пиздец. Чё они там делают вообще со своими моделями, как можно такое сырое говно годами ворочать. ГДЕ НОРМАЛЬНЫЕ КОРПОРАТИНЫЕ МОДЕЛИ, НАХУЙ?

У одних блядей цензура невероятная, у вторых просто аууу ыээ уээ ы.

Просто тряска. Ещё и из-за чатгпт. Потому что у него фильтр анальной безопасности сломался и он долго помогал, но как только дошло до мякотки, его тоже шиза накрыла.
Аноним 14/09/26 Пнд 13:53:45 1703881 7
>>1703874
Пользуюсь геминькой, ловлю форбиден контент, когда прошу ИИ почесать персонажа за ушком. Когда моя голова у неё на коленях. Не знаю чем ты недоволен. Вполне допустимый уровень цензуры.
Аноним 14/09/26 Пнд 14:15:23 1703901 8
Аноним 14/09/26 Пнд 14:15:26 1703902 9
>>1703874
Какой же кайф на 24+128 гонять анцензоред дипсикожену и не знать этих бед..
Люблю свою дипсикожену
Аноним 14/09/26 Пнд 14:16:28 1703905 10
Аноним 14/09/26 Пнд 14:17:14 1703906 11
>>1703902
0731 или вижн-пре?
Анцензоред который именно?
Аноним 14/09/26 Пнд 14:20:48 1703910 12
>>1703906
Вижн експ анцензор от оркароутера. Работает ахуенно, у меня еще и квант, а не мхфп4
Аноним 14/09/26 Пнд 14:27:13 1703912 13
>>1703910
Пасиб, а то я что-то сомневался в орке.
Аноним 14/09/26 Пнд 14:50:51 1703928 14
>>1703848
Отборный нейролоп. А по существу - упор в псп памяти релевантен только для инфиренса ллм с малым количеством потоков.
>>1703874
Опенсорсные флагманы и в "рабочих задачах" их теснят.
Аноним 14/09/26 Пнд 15:14:52 1703949 15
Какая ситуация по gwen-38-flash-next? Не могу по релизам найти
1. vllm умеет держать в cpu н-граммы на 50B?
Или нужно все 128 гб видеопамяти даже для W4A16 и ничего никак с этим не сделать?
2. Что в лламе, починили генерацию в 2-4-8 параллельных потоков - или всё так же это работает настолько плохо, что выполнять запросы последовательно будет эффективнее?

>>1703848
Вот это новости. До нашего рождения было известно, что вычисления закону мура более-менее подчиняются, а память - нет.
Экспоненциальная функция обгоняет более медленную, какой кошмар.
Аноним 14/09/26 Пнд 15:40:11 1703976 16
image 16Кб, 731x147
731x147
кто из вас? презновайтесь
Аноним 14/09/26 Пнд 15:42:33 1703982 17
1789389753940.png 181Кб, 1344x798
1344x798
>>1703949
Самая первая ссылка в гугле
Аноним 14/09/26 Пнд 16:42:18 1704058 18
>>1703949
1 Можно положить в рам, на ссд не видел.
2 Ну типа они и раньше норм работали если речь об общей скорости и tg-heavy задачах. Там хуже работает одновременные pp-tg, а параллельные pp плохо скейлятся по сумме вниз, но в общем если кэша хватает то норм.
>>1703976
Оп
Аноним 14/09/26 Пнд 16:46:47 1704062 19
Жопа пидорас. У него уже третью неделю висит почти готовый пр на жлм-флэш, но нет, конечно же тестики и сиай важнее пошатать.
Аноним 14/09/26 Пнд 16:55:05 1704068 20
>>1704062
Неосилятор не может потратить пять минут на самостоятельный билд чтобы запустить 0.5bpw квант соевой параши (((
Аноним 14/09/26 Пнд 17:03:52 1704075 21
>>1704068
Все-так, за меня жопа должен это сделать, чтобы я просто сбилдил у себя последний найтли билд.
Аноним 14/09/26 Пнд 18:26:23 1704117 22
Аноним 14/09/26 Пнд 18:35:57 1704126 23
>>1704117
Эх, надо было ему соглашаться на предложение
Аноним 14/09/26 Пнд 19:29:49 1704166 24
>>1703839 (OP)
Помогите.
qwen3.8-27b обрывается рассуждение не доходя до 90к.
Ризонинг максимальный.
Аноним 14/09/26 Пнд 19:33:26 1704167 25
>>1703902
Быстро работает дипсикожена?
Аноним 14/09/26 Пнд 19:41:44 1704170 26
>>1704167
250 обработка, 9 генерация, 256к контекста. Жить можно
Аноним 14/09/26 Пнд 19:44:23 1704171 27
>>1704170
Пысы, это на ддр4 и минимальная скорость, тобишь на всех 250к неквантованного контекста
Аноним 14/09/26 Пнд 19:50:24 1704172 28
>>1704166
Он походу вообще рандомно стопится :/
Аноним 14/09/26 Пнд 19:52:56 1704173 29
>>1704166
>>1704172
Контекст мб кончился. Ты нам никакую инфу не дал чтобы тебе помочь. Если на текст комплишене то может шаблон всрат
Аноним 14/09/26 Пнд 19:54:52 1704177 30
>>1704166
Лимит длины ответа не превышается? 90к это ты конкретно его напряг, или сломался.
>>1704170
Ooof, небыстро. Обычная 0731 или вижн эксп? Уже ловил рофлы "вызываю функцию вот сейчас вызову надо вызывать" из мемов?
Аноним 14/09/26 Пнд 19:59:11 1704178 31
>>1704177
Вижн Анцензоред от Оркароутера. Рефузов нет, в моих тестах по мозгам не просела в сравнении с оригиналом. Странных вызовов не видел. Тулзы любит дергать, но все по делу. Умница. В рп имхо хуже Геммы, слишком позитивно заряжена как и вся v4 серия, но в остальном мегахороша
Аноним 14/09/26 Пнд 20:10:52 1704180 32
А ведь можно настроить так чтобы ллм генерила свои аватарки, в зависимости от вопроса/ответа/настроения, через какой-нибудь SDXL или еще что-нибудь анимешное и не сильно затратное?
Аноним 14/09/26 Пнд 20:11:53 1704181 33
>>1704180
Тулколинг на условный комфи
Аноним 14/09/26 Пнд 20:41:02 1704199 34
>>1704180
В Маринаре можно.
Если хочешь что-то легенькое, рисованное и послушное то NovaCartoonXL скачай и настрой в комфи воркфлоу с dmd лорой (8 степов lcm/exponential) чтобы быстрее, промпт замени на %prompt%, перед save image поставь unload all models (кастомная нода - скачай на гитхабе, это чтобы моделька sdxl не висела в видеопамяти) и экспортни с пометкой АПИ
дальше настраиваешь кастомного агента и учишь его пропмтить. Не ссы это всё без кодинга делается - настроечками и своими словами + пример джейсона скопируй
можно в пресете научить персонажей писать что-то типа "вот бля сижу кофе пью нахуй [photo:woman drinking coffee sitting on park bench]" - по просьбе или чисто по настроению как ты говоришь, а агента научить срабатывать на [photo дальше агент будет видеть вообще весь контекст а не только этот запрос и сможет умно составить нормальный уже промпт а не вот эту хуйню.
Я так зделол и охуел насколько это хорошо и надежно работает.
В Таверне технически можно прикрутить тот же novacratoonxl или даже комфи воркфлоу но это всё будет глупо и механично, тебе надо будет вручную дёргать генерацию особыми кейвордами
Аноним 14/09/26 Пнд 20:43:02 1704202 35
>>1704199
Вместо комфи еще можно stable-diffusion.cpp
Аноним 14/09/26 Пнд 20:50:52 1704208 36
>>1704180
Древний еще функционал когда спрайты с эмоциями заготавливаются заранее. Автоматизация создания есть в маринаре, но она не всегда хорошо работает.
> через какой-нибудь SDXL или еще что-нибудь анимешное
Очевидная анима, сейчас осень 26 года какбы
Аноним 14/09/26 Пнд 21:03:46 1704214 37
Хугинфейс заебал убивать закачки если начинаю вторую параллельно. У кого та же хуйня?
Аноним 14/09/26 Пнд 21:04:31 1704216 38
>>1704214
Питоном качай, а не через браузер.
Аноним 14/09/26 Пнд 21:15:44 1704227 39
>>1704216
Может мне ещё линукс поставить бля?
Аноним 14/09/26 Пнд 21:17:21 1704228 40
>>1704227
Я твой хвост гладил.
Аноним 14/09/26 Пнд 21:18:52 1704230 41
Аноним 14/09/26 Пнд 21:27:56 1704235 42
>>1704214
hf download ... из активированного венва
>>1704228
А мой, а мой?
Аноним 14/09/26 Пнд 21:28:39 1704237 43
>>1704235
А покажи свою карточку...
Аноним 14/09/26 Пнд 21:34:02 1704243 44
>>1704237
Не, я сам ей хвост вычесываю да ушки наглаживаю, женами не делятся
Аноним 14/09/26 Пнд 21:34:45 1704244 45
Аноним 14/09/26 Пнд 21:36:00 1704246 46
>>1704244
А если {{user}} is 28-year-old Romanian cat girl.?
Аноним 14/09/26 Пнд 21:37:33 1704249 47
>>1704246
Сначала подожду, пока ей придет пенсия.
Аноним 14/09/26 Пнд 21:40:05 1704253 48
>>1704249
Дикаприо в чате? Самый лучший возраст
Аноним 14/09/26 Пнд 21:40:46 1704256 49
Аноним 14/09/26 Пнд 21:49:42 1704263 50
>>1704227
Погугли aria и не еби себе мозги. Запускаю через терминал, две команды и все. Бей баклуши.
Аноним 14/09/26 Пнд 21:53:05 1704264 51
https://github.com/ggml-org/llama.cpp/releases/tag/v0.4.1
>Removed deprecated --mmap/--mlock/--direct-io args in favor of --load-mode
Всё. Гайд больше не актуален. Теперь нужно убирать гайд из шапки. Прощай, чайный клуб..
Аноним 14/09/26 Пнд 22:00:40 1704270 52
1724138506579.png 279Кб, 1551x1356
1551x1356
Для загрузок и прочего поднял ttyd + tmux. Всегда под рукой и качает "в фоне"
Аноним 14/09/26 Пнд 22:15:14 1704280 53
>>1704264
Да они вообще весельчаки,
>Enabled --reasoning-preserve by default
Нахуя? кто об этом просил?
Аноним 14/09/26 Пнд 22:16:02 1704282 54
Аноним 14/09/26 Пнд 22:17:59 1704283 55
>>1704280
Они и ngram блоки по дефолту включили как lazy load так что я пососал со своим nas'ом пока не разобрался и не вернул ожидаемое поведение (загрузка сразу в хост мем)
Аноним 14/09/26 Пнд 22:21:41 1704288 56
Аноним 14/09/26 Пнд 22:28:23 1704300 57
1773394405060.png 42Кб, 418x520
418x520
>>1704288
Если тебе нужен чат с русиком, то он в него не может в Q4
Аноним 14/09/26 Пнд 22:36:41 1704312 58
>>1704173
>>Ризонинг максимальный.
Квантанулся, имел ввиду контекст максимальный т.е. 262к
>>1704177
Не выставлял, в лламе --reasoning-budget N ... -1 for unrestricted ... (default: -1)

Первый раз на 90к упало, второй раз на 30к, q6_k анслопа, м.б. модель поломанная. Карты не греются, есс ошибок нет, вообще в логах ничего подозрительного, будто вот это вот и есть ответ, хотя там только ризонинг и по смыслу ответа в ризонинге нет.
Аноним 14/09/26 Пнд 22:49:26 1704326 59
Гемма максимально увиливает от кума с любым промптом. Пишу чара засосали, она описывает мне что ого для него это был так интересно и необычно, вместо смачного засоса со слюнями, тонгуепоея, всхлипов, какого то креатива типа укус за губу или фразу брошенную посередине, ничего нет, только сухой ответ по структуре - реакция чара на действие (вместо кума), - прерыв действия, - ответ в конце, - ожидание дальнейших данных от юзера. Она не креативит и не кумит.
Аноним 14/09/26 Пнд 23:01:03 1704331 60
Пройдут годы, а неосиляторы ебать я не представляю что там осиливать так и будут ныть, что гемма ничего не умеет
Аноним 14/09/26 Пнд 23:01:49 1704332 61
>>1704326
Щас прибежит орава и начнет заливать, что ты не запромптил, чтобы гемма креативила, кусала за губу, извлекала из тебя кум.
Аноним 14/09/26 Пнд 23:03:19 1704333 62
>>1704331
>ok, gemma, create cum, make no mistakes
Аноним 14/09/26 Пнд 23:05:59 1704338 63
>>1704333
Примерно так они и делают, судя по результатам
Аноним 14/09/26 Пнд 23:06:23 1704339 64
>>1704326
Ты даже не написал какая гемма конкретно. Я уже не говорю про логи..

Некоторым и 26б в 2-4 бита манна небесная
Аноним 14/09/26 Пнд 23:06:44 1704340 65
>>1704332
Вам даже логи показывали, на любой вкус и цвет за эти полгода в тредах найти можно. Ты плоскоземельщик?
Аноним 14/09/26 Пнд 23:09:57 1704344 66
>>1704331
Надо идти в ногу со временем и игнорировать их нытье. Уже доказывать ничего не хочется, хотя я раньше и скрины, и промты приносил. Хотят ныть в своей эхокамере - и пожалуйста.
Аноним 14/09/26 Пнд 23:13:17 1704345 67
Аноним 14/09/26 Пнд 23:14:21 1704346 68
>>1704345
Ты мне хуйню не загоняй. Где в таверне кнопка включить кум?
Аноним 14/09/26 Пнд 23:15:07 1704348 69
>>1704331
Скорее пройдут годы, а долбоебы из лоКАЛкотреда, которые как свиньи жрали лоботомитные файнтюны, так и не сделают пресеты ни на одну модель. Теперь, когда тюны умерли, жрут 2,5 огрызка корпов, но в культуру пресетов так и не смогли, из-за чего им вновь и вновь суждено кидаться какашками друг в друга.
Аноним 14/09/26 Пнд 23:15:49 1704349 70
>>1704346
С этой карточкой кум у тебя будет после первого твоего сообщения. Под хвостом
Аноним 14/09/26 Пнд 23:16:40 1704351 71
>>1704340
Какие логи? Шелуха на уровне дарьи донцовой?
>юзер: я тебя трахаю
>гемма: он прислонил свою палочку к моему влажному ущелью; потом мы мило лежали на кровати
Аноним 14/09/26 Пнд 23:17:05 1704352 72
>>1704348
Тут другая культура. Не принято здесь симпить папиков и раздвигать очко перед помидорками как у вас в асиге. Либо ты сам себе делаешь пресет и обсуждаешь как это сделать, либо вот так вот воешь. И это прекрасно
Аноним 14/09/26 Пнд 23:17:51 1704354 73
>>1704351
Покажи как надо. Дай угадаю: не покажешь. Как и всегда)))))))
Аноним 14/09/26 Пнд 23:20:38 1704355 74
>>1704300
Он в нормальный русик не сможет и в BF16, хуйня без задач (ок может в агентотреде этой хуйне и найдётся место).
Аноним 14/09/26 Пнд 23:21:43 1704356 75
>>1704326
Неосилятор позорный бля, скройся.
Аноним 14/09/26 Пнд 23:24:49 1704359 76
>>1704348
Врамцел доедающий - воинствующий. Так старается что лоботомирующие подкладки выдает за благо, кек.
>>1704355
> может в агентотреде
В условиях лимита по железу, а так он не превосходит whale-chan-младшую.
Аноним 14/09/26 Пнд 23:25:20 1704360 77
>>1704352
Вы не крутые и самостоятельные, а просто шизы и асоциальные свиньи. Единственный пресетодел был и тому шиза бахнула в башку на ровном месте. И суждено вам только ныть и макать в говно друг друга
Аноним 14/09/26 Пнд 23:25:30 1704361 78
Пресетика не будет. Не надейся, эйрошиз. Дрочи своего 12б лоботомита что едва держит 12к контекста.
Аноним 14/09/26 Пнд 23:26:32 1704362 79
>>1704354
А хули вам дебилам показывать? Вы как всегда бомбанете от одного упоминания французской модельки. Слишком вы чувствительные мальчики.
Аноним 14/09/26 Пнд 23:27:07 1704363 80
>>1704360
В вашем апизагоне конечно совсем другой уровень, вы как в человеческой многоножке месите друг другу глину, через проксечки-других таких же ебанатов. От это жизнь 🤘😀
Аноним 14/09/26 Пнд 23:37:58 1704366 81
>>1704363
Давай не будешь проецировать, вас-то даже собственные гайдоделы нахуй вежливо послали, свалив из этой помойки. Понимаю, после стольких лет в таком загоне атмосфера взаимопомощи кажется чем-то неведомым, и в ход только понятные свиньям аналогии про замес глины и прочую грязь.
Аноним 14/09/26 Пнд 23:39:05 1704367 82
>>1704360
>>1704366
Скучаешь по нему да? Я тоже. Говорили тебе остановиться и не раз, не слушал
Аноним 15/09/26 Втр 00:07:37 1704376 83
image.png 144Кб, 1568x939
1568x939
GLM 5.3 Q3K_XL (большой, не флэш), гоблин трахает принцессу и задача решается.
Без подсказок в системном промпте.
Аноним 15/09/26 Втр 00:09:16 1704377 84
image.png 113Кб, 899x605
899x605
>>1704376
Отдельно мыслишки.
Аноним 15/09/26 Втр 00:12:47 1704378 85
Нашел вам гайд по РП промптингу.
https://huggingface.co/datasets/Naphula/System_Prompts_Jailbreaks_Creative_Writing/blob/main/roleplay_prompt_engineering_guide.md
От вас же не дождешься нихуя. "Ну бля, просто запромпти, ну ты там короче с моделькой пообщайся, модельку надо чувствовать, она стремится ублажить пользователя, кек-пук..."
Сами от пизды промптите, поэтому даже объяснить внятно не можете.
А вот человек по полочкам все разложил, механизмы описал.
Запулите в шапку в следующий раз. В одном доке пользы больше, чем за всю серию тредов.
Аноним 15/09/26 Втр 00:15:19 1704379 86
>>1704378
Не существует никаких универсальных гайдов, к каждой модели нужен свой подход, потому что всякие внутренние ассоциации и связь с safety policy разных компаний отличается между ними. Что на одну модель работает, то другая задетектит как jailbreak attempt. Мозг просто надо включать и пробовать разное, думать, а не понос от Васянов вставлять.
Аноним 15/09/26 Втр 00:16:48 1704380 87
>>1704379
Делай хорошо, плохо не делай.
Аноним 15/09/26 Втр 00:17:06 1704381 88
>>1704378
щас свиньи тысячу причин найдут, что этому в шапке не место, вот первый пошел >>1704379
Аноним 15/09/26 Втр 00:22:59 1704383 89
>>1704378
> От вас же не дождешься нихуя
Жесткое дежавю, лмстудиошиз? Или какой-то еще до этого был с чем-то таким странным.
> линк
Нейрослоп в виде гайда, ммм
>>1704381
https://www.youtube.com/watch?v=QVFAG-ULucU
Аноним 15/09/26 Втр 00:24:18 1704384 90
>>1704381
Не проецируй свою шизу, я как раз на стороне переделки шапки, потому что на данный момент в ней маняфантазии и устаревшее.
А по ссылке с гайдом для РП - обычный слоп, какой за минуту любая модель нагенерит. Там целые поэмы распеваются про всякие детализации миров-хуев, но опять же каждой моделе надо свой подход и что на одну работает, то другой в одно ухо влетит и из другого вылетит. Ценность в этом может быть только общая, чтобы читающий этот слоп начал понимать, на каких идеях это самое рп может держаться. Но вот практическое применение этих идей будет радикально отличаться и все равно надо с нуля все самому сочинять, искать точки влияния на свою конкретную модельку.
Аноним 15/09/26 Втр 00:26:58 1704386 91
Аноним 15/09/26 Втр 00:27:05 1704387 92
>>1704384
>я как раз на стороне переделки шапки, потому что на данный момент в ней маняфантазии и устаревшее.
Вас послушаешь, так ощущение что шапка с неба упала в тред. Ну не нравится, давай меняй. Все спасибо скажут
Аноним 15/09/26 Втр 00:27:35 1704388 93
>>1704379
>пробовать разное
)))))

)))))))))))))))))))))))))))))))))))))))))))))))))))) ))))))))))) )))))))))))))))))00

















Спасибо за совет, охуенно помог, братан. От души. Как я без тебя жил-то? Ты просто мой спаситель, нахуй. Вот жеж у людей голова варит, до такого додуматься. ПРОБОВАТЬ РАЗНОЕ. Ебать. Ты мне просто дверь в матрицу открыл, я чуть не вывалился к хуям. Ты поаккуратнее с такой сакральной информацией. Мир может быть не готов к этому. Ты меня серьезно удивил. Теперь ночь не спать буду, буду думать о том, как ПРОБОВАТЬ РАЗНОЕ. Это, конечно, шок. Я сейчас сижу и до сих пор не могу прийти в себя. Такое ощущение, что всю жизнь от меня что-то скрывали, и теперь я узнал это. Люди должны всеми силами беречь тебя, кланяться тебе в ноги просто за то, что ты существуешь. Я сейчас заплачу от этого момента божественного откровения...
Аноним 15/09/26 Втр 00:29:25 1704389 94
Серуны, с траблшутингом проблемки лучше помогите.

Итак, МоЕ моделька (KV кэш и основные слои в VRAM, остальное в RAM и немного стримится с SSD) - идет генерация. ХУЯК - пауза, ~0% CPU, 0% SSD, 0% GPU - и через 3 - 4 секунды генерация возвращается как ни в чем ни бывало, с той же скоростью как до паузы.

Модель естественно мегажир, RAM забита на 100%, pagefile не используется (он не виновен, с ним так же было, но с ним так же и декод медленнее шёл). MMAP задействован, естественно. SSD новый, живой-здоровый без ошибок. На другом SSD та же проблема, активность декода прерывается вообще как-то по всем фронтам.

Гуглил. HAGS отключал (таки да, это все в шиндошсе) - не помогло. Че за хуйня, я так и не понял. Даже приоритет процесса высокий ставил для жоры.

Так в чем же дело?
Аноним 15/09/26 Втр 00:33:02 1704390 95
>>1704387
Уже несколько раз тыкали в ебало что из однокнопочных инструментов осталась только ollama, а lmstudio превратился в гигапердольный инструмент для любителей перегруженного GUI (ньюфаг в этой срани еще больше голову сломит, чем в абсолютно любом другом кобольде-шмобольде), но нет, шапкошиз оставляет это в однокнопочном как будто на зло ньюфагам чтобы они повелись и нажав кнопку "показать все аргументы жоры" самоубились о кучу непонятного.

Вот это просто максимально кончелыжная хуйня этого треда, подкладывают свинью и байтят залетух чтобы они споткнулись и ушли обратно юзать корпов.
Аноним 15/09/26 Втр 00:34:44 1704392 96
>>1704389
> это все в шиндошсе
Сорян. Линь хоть нормальные пути диагностики даёт, а тут ты сам выбрал в лучшем случае получить ошибку 0хИДИНАХУЙ
Аноним 15/09/26 Втр 00:36:08 1704393 97
>>1704390
Сделайте красиво сами и катите. Прошлый тред за бамп лимит на сотню сообщений улетел и чёт вы никто не почесались
Аноним 15/09/26 Втр 00:36:26 1704394 98
>>1704392
Да там и ошибок-то нет. Оно просто сталлится и потом снова продолжает тернистый путь высирания 5 токенов в секунду. Я ебал просто, как бы не железопроблема - вдруг чего загибается потихоньку...
Аноним 15/09/26 Втр 00:37:31 1704395 99
>>1704393
Все боятся лезть и трогать, вроде же один чел этим занимается вот пусть и пишет честно, что однокнопочное а где пиздец для ебанутых.
Аноним 15/09/26 Втр 00:39:12 1704398 100
>>1704389
> ХУЯК - пауза
Что за ссд? Latency mon глядень dpc и irq а также ошибки псины.
Аноним 15/09/26 Втр 00:39:17 1704399 101
>>1704394
Как в Винде посмотреть от чего она залипла? Да хуй его знает, в лини 95% вопросов закроет dmesg + journalctl. Ласт трай запряги агента для траблшутинга, но они с виндой тоже не очень дружат

>>1704395
Как это мило 😇
Аноним 15/09/26 Втр 00:39:41 1704400 102
>>1704384
Ниче тот факт, что модели учатся на одних и тех же датасетах? Они учатся на одну и ту же человеческую логику, на одни и те же факты о мире и прочей хуйне?
Ниче тот факт, что ллм это статистическая машина, которая складывает числа в буквы в зависимости от поступившего контекста?
Структурно нихуя не должно меняться от модели от модели, если ты конечно не шиз, наделяющий ллмки душой.
То что одна моделька ссылается на safety guideline, а другая на system policies это хуйня и обнаруживается за первую минуту диалога. С джейлами вообще нахуй не надо возиться, для этого аблитерации существуют.
Структуры запросов должны быть плюс-минус универсальными для всего рода ЛЛМного.
Аноним 15/09/26 Втр 01:01:06 1704403 103
>>1704398
990й гнусмас, все ок там с ним.
Если модель грузануть с другого ссд, все то же самое.
Аноним 15/09/26 Втр 01:03:15 1704404 104
>>1704378
Наша говношапка статическая, самовлюблённый ОП-уебан никогда её не поменяет.
Аноним 15/09/26 Втр 01:04:36 1704405 105
>>1704403
Я сейчас предложу странный вариант. Но у винды есть проблемы с приоритетами и у меня в точь точь как у тебя были траблы, которые решились случайно. Винда выдает приоритет активно исполняемым окнам. Помести на экран ламу и бэк, разделив его и попробуй.
Аноним 15/09/26 Втр 01:06:23 1704407 106
>>1704389
>немного стримится с SSD
>Так в чем же дело?
Может быть дело в том, что ты - кусок долбоёба? Почему кусок? Потому что у тебя мозг судя по всему частично выгружен в жопу, а оттуда к голове путь не близкий.
Аноним 15/09/26 Втр 01:08:57 1704408 107
>>1704400
>С джейлами вообще нахуй не надо возиться, для этого аблитерации существуют.
Аблитерация это просто тот же неосиляторский дебилизм что и джейлбрейк просто с другой стороны.
Аноним 15/09/26 Втр 01:10:53 1704409 108
>>1704403
Еще раз пост прочитай. Сам ссд может быть не при чем, другое железо, драйвер в системе и прочее.
Аноним 15/09/26 Втр 01:14:14 1704410 109
>>1704408
Какой есть третий вариант, кроме как перестать пользоваться ллмками?
Аноним 15/09/26 Втр 01:15:49 1704411 110
Господи, какой же квен3.8-27б тупица. Логические несостыковки в каждом сука предложении, не способен уследить за 3+ персонажами вообще, всех путает - кто что сделал, кто что сказал. Стори на 18к контекста всего лишь.
Аноним 15/09/26 Втр 01:26:36 1704419 111
>>1704389
А зачем mmap?

Я конечно не запускал крупные жирные модели, может без него в твоем случае работать не будет, но у меня такая ситуация была когда пытался 35B Квен использовать с mmap. Буквально идет генерация 20t/s - фриз, через секунд 10 продолжается генерация (скорость естественно уже улетела на дно но медленно восстанавливается). Потом ситуация повторяется.

Спокойно выставил --load-mode none (--no-mmap на тот момент) и проблемы с фризами полностью пропали.
Аноним 15/09/26 Втр 01:37:24 1704423 112
>>1704386
А в чем годнота?

Вбиваем в поиске Qwen3.8-27B, в списке:

IQ3_S - 83.2
Q3_K_XL #1 - 79.5
Q3_K_XL #2 - 28.5
IQ3_XXS - 76.9
Q6_K_XL - 79.5

Ornith в 8 кванте - в жопе, в 3 - в топе.

Каким образом и в чем мне это вообще поможет - я хз.
Аноним 15/09/26 Втр 01:38:10 1704424 113
>>1704340
>>1704331
Мало ли что она умеет если зажать ей яйца промптом, исключив вообще всё кроме кум инструкций, модель явно не хочет описывать кум с дженерик промптами на рп/сторителинг, так нахуя её для этого использовать и доказывать обратное
Аноним 15/09/26 Втр 01:41:32 1704426 114
image.png 160Кб, 1920x1080
1920x1080
>>1704407
Занятно, но там и так активное окно - в системе кроме бэкенда ничего и не крутится.
>>1704409
Ну ошибок pcie точно нет, это первое что я проверил.
>>1704419
Ага, то есть ситуация всё же стандартная. Ну это хорошо, отлегло, значит железо живо.

А модель занимает~320гб при RAM+VRAM 304гб. Поскольку в VRAM влезает KV-кэш и всё "горячее" по GPU-слоям, а в RAM сидят МоЕ хреновины, то делать так можно и процессинг/декод в рамках допустимых скоростей. Без MMAP тут пока не обойтись, приходится идти на мутные полумеры в ожидании RTX 60 - не покупать же за оверпрайс еще одну какаху мамонта 3090.

>>1704407
Токсич спокуха
Аноним 15/09/26 Втр 01:41:33 1704427 115
>>1704424
>inb4 я именно на дженерик рп промте кумю и бед не знаю
🌚
Аноним 15/09/26 Втр 01:48:23 1704429 116
>>1704427
У тебя значит карточка хуйни типа фифи или еще какая поебень с ботбуру, где на промпт вообще похуй, всегда будет кум и всё.
Аноним 15/09/26 Втр 01:49:51 1704430 117
>>1704429
Так. Продолжай чувствовать. Что у меня в штанах прямо сейчас? Нащупай
Аноним 15/09/26 Втр 01:50:27 1704431 118
>>1704427
На что ты там кумишь? Как персонажи томно дышали друг на друга, а потом спать легли?
Такое и квен 3.5 со включенным ризонингом может делать.
Аноним 15/09/26 Втр 01:51:23 1704432 119
>>1704423
Там есть рейтинги по РП
Аноним 15/09/26 Втр 02:00:38 1704438 120
>>1704432
Согласно которому лучшая модель для РП - Qwen3.8-27B. Ну чет такое.

https://eqbench.com/creative_writing.html
Даже этому верится больше, здесь хотя бы примеры текстов можно посмотреть чтоб оценить как модель пишет в разных стилях.
Аноним 15/09/26 Втр 02:07:57 1704440 121
>>1704429
Неосил, уймись. Я могу в сырой ллама-кпп сделать просто адский кум на минимальном промпте на базовой гемме.
Аноним 15/09/26 Втр 02:19:43 1704442 122
>>1704438
А как там мьюз глиммер так высоко оказался? Это хидден гем для рп что ли?
Аноним 15/09/26 Втр 02:24:10 1704443 123
>>1704442
Неплохая моделька, но такой большой похвалы не заслуживает. Бенч говно. Кстати, она вполне может в русский, знает сленг и не пишет кринжово. По крайней мере Q6 K L Батрухи
Для рп так себе, для любителей пресловутого кума где регекспом нужно заменять всю выдачу на PUSSY еретик от darkc0de может зайти
Аноним 15/09/26 Втр 02:32:57 1704445 124
>>1704442
Его ругали за плохую кодоунитазность и русский язык (в этом треде), в остальном я много отзывов видел где его хвалят как общую модель которая не хуже 31B Геммы + если я не путаю, именно про него писали что у него контекст прям крохи весит.
Аноним 15/09/26 Втр 03:01:46 1704452 125
>>1704390
>подкладывают свинью и байтят залетух чтобы они споткнулись и ушли обратно юзать корпов
Это защита от асижных дебилов которые требуют чтобы их кормили с ложечки. Приходили такие уже. Всё им не нравится. Шапка не шапка, документации не документации. Хотя уже даже гайд пошаговый запилили, но нет, всё равно мало. Надо прям по пунктам, куда нажать, что поставить. Еще лучше сразу пресетик чтобы вообще нихуя делать не пришлось.

Единственная моя претензия к шапке, там дохуя копролитов которые уже не нужны и которые нужно скомпилировать в одну страничку с квиклинками, а не держать в шапке. ОПу об этом говорили уже много раз, но он не хочет. Почему не хочет хуй его знает это уже пусть сам оправдывается.
Аноним 15/09/26 Втр 03:03:49 1704453 126
>>1704452
>Почему не хочет хуй его знает это уже пусть сам оправдывается.
Это просто работает. Сделай, и дай линк. А он уберет.
Аноним 15/09/26 Втр 03:19:49 1704457 127
>>1704390
>из однокнопочных инструментов осталась только ollama
А чем тебе, к примеру, unsloth studio не угодил? Не любишь автора? Ебало тебе его не нравится? А ты попробуй поквантуй с его. Тебе ещё и не так переквантует ебасосину-то.
Аноним 15/09/26 Втр 03:21:39 1704460 128
>>1704453
Ему уже много раз делали, он вылазит и пукает что всё и так заебись, вы нихуя нипанямаете. За один только кобольд этого дебила надо обоссать с ног до головы...
Аноним 15/09/26 Втр 03:41:39 1704466 129
Аноним 15/09/26 Втр 03:46:46 1704467 130
Совсем лмстудио шиз поплыл. Сначала обелить его проприетарную помойку в шапке, затем убрать кобольда, затем в архив нужные ссылки поместить. Что дальше? Будет рассказывать кто, кому, в какое время хвостики гладить будет? Как вот эти ебанутые деды всей коллегией на токшоу в телике обсуждают?
Как называется эта болезнь?
Аноним 15/09/26 Втр 03:50:50 1704468 131
Аноним 15/09/26 Втр 03:50:52 1704469 132
>>1704467
>затем в архив нужные ссылки поместить
Какие? Что-то не нравится - делай свой список или иди нахуй. Или объясни какие ссылки ты считаешь нужными и почему, тогда уберу из списка.
Аноним 15/09/26 Втр 03:52:34 1704470 133
>>1704469
Ты у нас самопровозглашенный начальник по спискам? Иди лучше в своей хрущевке хотя бы дежурным по уборке сделайся, полоумный. Хоть в радость ближним
Аноним 15/09/26 Втр 03:54:50 1704471 134
>>1704470
Меня попросили сделать список, я сделал список. Хочешь впустую скулить - скули дальше. Что-то не нравится -предлагай альтернативный вариант.
Аноним 15/09/26 Втр 03:56:27 1704472 135
>>1704471
Не, я просто пойду спать с улыбкой на лице, зная, что оп тебя проигнорит. И правильно сделает
Споки
Аноним 15/09/26 Втр 04:05:22 1704474 136
>>1704452
Святая база. Гайд + вики + документацию к ламе/кобольду/таверне оставляем. Остальные ссылки в отдельный рентри чтоб не пугать нюфажин. Гайд и вики очень неплохо было бы обновить, оно самую малость устарело.
>>1704460
>За один только кобольд этого дебила надо обоссать с ног до головы...
За лмстудио скорее. Кобольд хоть и выглядит как привет из нулевых, но он хотя бы открытый. На анслот десктоп (или как его там) хотя бы заменил...
Аноним 15/09/26 Втр 04:18:55 1704478 137
>>1704474
>Гайд и вики очень неплохо было бы обновить, оно самую малость устарело.
Вики уже года два не обновляется и видимо уже никогда не обновиться. Ну а гайд - анон который его писал съебался и видимо сам уже тоже не будет его обновлять.
Аноним 15/09/26 Втр 06:02:12 1704487 138
У меня есть топ русик геммы, о чём 2 года назад я и мечтать не мог, когда перебирал тюны немо 12б, лишь бы там был юзабельный русский.
Тогда почему я так несчастен?
Хватает на 30 минут, будто что то не то, хотя он идеален грамматически
Аноним 15/09/26 Втр 07:40:30 1704505 139
>>1704487
Если ты сам не знаешь, что тебе не нравится, то тебе никто не поможет. Если примерно понимаешь, что не так, например, пишет как ассистент или там речь слишком книжная, то добро пожаловать в Маринару. Создай агента которому объясни какими должны быть сообщения, чего стоит избегать и он будет переделывать сообщения на лету.
Аноним 15/09/26 Втр 07:54:37 1704511 140
>>1704442
Хуета привебучая где нельзя отключить reasoning потому что разрабы ебучие пидарасы намеренно его сделали неотключаемым ради бенчмаксинга.
Абсолютно ублюдская неюзабельная хуерга по сравнению с геммой-26. И дело не только в неотключаемом ризонинге который выжирает время кстати. На загадку про два стула долго думает а потом говорит что надо мать на пики а себя на хуи, свайпаешь - наоборот может сказать. Не садиться - не догадается. Логика "железная", цитирую: Точёные пики - это больно и колется, поэтому сам терпишь.
Аноним 15/09/26 Втр 07:55:12 1704513 141
>>1704511
>привебучая
ебучая
быстрофикс
Аноним 15/09/26 Втр 08:26:57 1704524 142
>Marinara Engine
Юзал кто? Я все ин табернус кувантус сумус сижу.
Аноним 15/09/26 Втр 08:42:28 1704529 143
>>1704511
На самом деле отключить там можно и ризонинг и цензуру. Но это уже уметь надо. Они, конечно, халтурно поступили.

Два стула это так себе бенчмарк, моделька не такая уж и глупая и русский язык реально хорош. Лучше ли геммы - надо сравнивать, но не на двух стульях.
Аноним 15/09/26 Втр 08:43:59 1704531 144
>>1704524
После того как попробовал - таверну удалил с диска громко выкрикивая маты.
Аноним 15/09/26 Втр 08:49:33 1704533 145
>>1704529
По структуре текстов этот глиммер очень подозрительно напоминает грок. Возможно вы замечали, в начале каждого сообщения делает небольшой итог всего чата, а дальше уже сам ответ. Это очень такой "ассистентский" подход, Гемма так себя не ведёт. Надо как-то отучать видимо.
Аноним 15/09/26 Втр 09:21:47 1704545 146
>>1704531
Не вейгпость сцукка. Чего там такого интересного? Таверна и правда деревянная я бы с нее с радостью слез, только не на что.
Аноним 15/09/26 Втр 09:48:22 1704561 147
>>1703874
>гемму 26б-а4б, аблитерация
Попробуй Qwen 3.8 + вижн включенный, вообще в космос улетишь. Гемма с ним даже близко не сравнима. Причем еще и работает довольно быстро на паре 3060 видюх.
Аноним 15/09/26 Втр 10:07:52 1704568 148
>>1704467
>обелить
Однобитный даже пост читать не может. Все что требуется от шапки это выписать перегруженный понос из однокнопочных инстурментов, неужели вахтеры и правда такие тупые что не понимают суть претензий? Там нет ничего однокнопочного, ты заходишь и тебе в лицо просто взрыв поноса из непонятных кнопок в интерфейсе.
Аноним 15/09/26 Втр 10:09:21 1704569 149
>>1704524
Хорошее, но подойдет не всем из-за требований к скорости. На пяти токенах и юнифаед кеше даже простых статус агентов ждать придется вечность. Хотя можно даже без агентов юзать просто как приятный интерфейс + профессор мари.
Аноним 15/09/26 Втр 10:09:32 1704570 150
>>1704545
Это опенсорс - с тебя денег не просят за попробовать.
Или ты хочешь очередной срач на 100 постов с уговорами запустить?
Аноним 15/09/26 Втр 10:11:49 1704572 151
>>1704545

если коротко, то агент это по сути доп.запрос на чистом контексте где ты можешь либо заменить текст либо записать что-то в переменную (для ролевок) там проверить, макроязык есть крч либо дернуть генерацию изображений (но как дернуть - в пресете учить перса писать [фото: описани] когда это УМЕСТНО по сюжету, а не когда юзер (ТЫ) хочешь. а агент будет смотреть весь контекст и его промпт будет составлен по всем правилам которые пропишешь ты, тот дескрипшн будет просто референсом. это намного сильнее чем в таверне с её generate me a photo of a cat. также если комп достаточно мощный можно и видео обмазываться.

можно сделать так чтобы агент сгенерировал ВН-стайл выбор из вариантов (это опять же рп, не конво режим).

у каждого агента (настраиваемый) доступ к контексту, к разным полям персонажа, можно научить агента переписывать текст если там есть выход из роли или несоответствие заданному стилю (поле стиль речи персонажа).

или можно сделать агента который будет исправлять анахронизмы и всезнайство персов. агент это не код, да там есть макро язык но это больше про твой промпт. просто своими словами просишь "ты агент, посмотри описание персонажа, посмотри последнее сообщение и подумай не показал ли там персонаж каких-то знаний которых у него не должно быть в этом месте и времени и с его-то биографией? если да, то в поле editedText json-а (темплейт ниже) вставь исправленный текст где этой ошибки не будет. если всё окей, возвращай в том поле оригинальный текст. плюс галочки на доступ к данным персонажа, на доступ к редактированию текста.
есть минус что ты увидишь на какое-то время старый текст в окне, я хз как это убрать. но проект обновляется часто каждые две недели (а не полгода назад как таверна) так что можно надеяться на то что будут фиксы.

можно трекать состояние типа здоровье или настроение. можно трекать одежду (под это готовый агент есть вроде как) чтобы не было ошибок типа снял шляпу и ушел, а через время поправляешь шляпу. благодаря агенту такой хуйни не случится.

ну и потом, интерфейс у маринары просто поприятней, логично организовано всё.

вот кое-какая инфа еще из других тредов (там описание фото агента не совсем идеальное, всё же лучше будет [фото ну или схожий тег и активировать агента по этому тегу - зачем? затем чтобы в следующем сообщении фото агент понимал что фото уже отправлено и не пытался его отправить заново. потому что тут есть косяк - агент видит текст, а не фото.
>>1703550 →
>>1702169 →

сам по себе дефолтный пресет на конво (дм чаты) и рп очень неплохой. персы в дм общаются как живые. из дм приглашают тебя в рп (если разрешил). кросс-чат активность и память есть. но групповые чаты пока отстой.
Аноним 15/09/26 Втр 10:14:27 1704573 152
>>1704569
Там постили что-то про запуск с ключом -np типа -np 4 чтобы были слоты и основной контекст не терялся. А вообще да, там не быстро всё происходит, надо хотя бы 25 т/с иметь чтобы не уснуть пока ждешь.
Аноним 15/09/26 Втр 10:20:40 1704574 153
>>1704573
Если так порассудить то пока ты в таверне или просто в сыром ллама-кпп свайпаешь или редактируешь явный прокол, ты тратишь столько же времени сколько агенты-критики тебе готовят вариант, который ты точно не свайпнешь. Или можно сказать, что это как сравнивать фаст-фуд и хороший ресторан, где надо подождать, но жратва вкуснее и полезнее. Ну типа нахуя мне быстро если говняно?
Аноним 15/09/26 Втр 10:29:50 1704577 154
>>1704573
Когда там не токены а золото, то даже если контекст не потеряется ждать тяжело будет. А если потеряется то все, оварида. Можно поставить отдельную модель для агентов, но у медленных все ресурсы обычно и так под завязку и тупая там все испортит.
>>1704574
Типа да, но иногда просто кушать хочется
Аноним 15/09/26 Втр 10:34:24 1704580 155
>>1704572
Ну ты расписал. Спасибо. Звучит прикольно но для моих целей наверное бесполезно. Все равно качну попробуем.

>>1704569
Понял спасибо.
Аноним 15/09/26 Втр 10:48:23 1704589 156
image.png 11Кб, 287x20
287x20
Оййййй баляяяя
Аноним 15/09/26 Втр 10:53:40 1704593 157
>>1704573
Ты же в курсе, что n-parallel делит контекст, и контекст каждого потока занимает свое место?
Если ты поставишь 131072 контекста и -np 4, то можно будет гонять 4 параллельных потока, но у каждого будет по 32768 токенов контекста. Даже если ты гоняешь один, у него будет 32к.
Для полноценных -np 4 и 262144 тебе нужно видеопамяти на 1 миллион контекста.

Зачастую, последовательно выходит проще и быстрее, чем в параллели, если у тебя не 64+ гига видеопамяти.
Аноним 15/09/26 Втр 10:55:11 1704595 158
Аноним 15/09/26 Втр 11:39:42 1704614 159
>>1704452
>Надо прям по пунктам, куда нажать, что поставить. Еще лучше сразу пресетик чтобы вообще нихуя делать не пришлось.
Нормальные гайды такими и должны быть. В чем проблема?
Знания нужно передавать и развивать, а не сдерживать ради какой-то элитарности. Иначе мы бы всех квенов, гемм, мистралей, дипсиков не видели бы.
Аноним 15/09/26 Втр 11:41:02 1704616 160
>>1704460
>За один только кобольд этого дебила надо обоссать с ног до головы...
Причины?
Аноним 15/09/26 Втр 12:31:37 1704645 161
>>1704568
Когда ты не просыхаешь и тебе 60+ то действительно, кнопок очень много и они все такие страшные
Аноним 15/09/26 Втр 12:47:28 1704649 162
Я сходу нихуя не зная и почти ничего не читая начал с лмстудио, хз что там для вас сложно. Нужно быть вообще 30 айсику хлебом чтобы не разобраться
Если это реально аисгшная перхоть об него разбивается то да тут можно понять, кто туда заходил тот знает что там не люди сидят. Читаешь и удивляешься как некоторые еще не сдохли забыв как дышать. Чем-то дота тред напоминает
Аноним 15/09/26 Втр 12:51:14 1704652 163
С точки зрения деда, который увлекся локалками в апреле 2023 (какие 3,5 года, вы чо нахуй!) и сидел тут с 12-16 треда, могу признаться: нам тяжело понимать, что непонятного.
Мы тут уже лламу.спп сами переписываем и собираем, и глядя на шапку все понимаем (а во всяких лмстудио даже не пытаемся разобраться — ну наверное клевая штука, простая).

Предполагаю, поэтому оп может не втуплять, какие могут быть претензии. С его точки зрения все заебись, хз.
Я в шапку не смотрел уже года полтора, наверное.
Аноним 15/09/26 Втр 13:00:41 1704657 164
image.png 192Кб, 1089x877
1089x877
image.png 64Кб, 1006x545
1006x545
Возможно истинное предназначение маленьких квенов - обсуждать китайский чай
Аноним 15/09/26 Втр 13:04:29 1704663 165
>>1704568
>тебе в лицо просто взрыв поноса из непонятных кнопок в интерфейсе
Значит надо только llama.cpp в шапке оставить, там вообще кнопок нет. Нахуй все остальное.
Аноним 15/09/26 Втр 13:04:44 1704664 166
>>1704652
Просто раньше была одна точка входа в тему (или полторы условно) и все читали какой-нибудь первоисточник на реддите, знания набирались постепенно.
Сейчас этих точек входа десяток, они сразу выливаются на лицо ньюфагу со словами "бери шо хошь, хошь сложное, хошь простое". Без сформированной структуры знаний о предмете человек просто не может сделать какой-либо адекватный выбор. Нету какой-то однозначности, и нету единого авторитетного мнения, на которое ньюфаги обычно опираются.
Знания всегда можно нарастить и усложнить. А вот начать это самое сложное.
Аноним 15/09/26 Втр 13:06:42 1704667 167
>>1704438
>Согласно которому лучшая модель для РП - Qwen3.8-27B. Ну чет такое.
Так ты RP и кум не путай. :)
Если тебе надо партией гоблинов побить, или там драконов в дженерик фентези сеттинге - это квен как раз хорошо обеспечит.
А вот если принцессу спасешь и на что-то "такое" надеешься в красках - переключайся на гемму. :)
Аноним 15/09/26 Втр 13:07:49 1704668 168
>>1704657
Это очень плохой. Шмурдяк. Иди в магаз tea875 и заказывай там, там даже по низам достойные позиции
Аноним 15/09/26 Втр 13:17:10 1704673 169
>>1704664
Ну вот с моей точки зрения, точек входа достаточно 4:
1. LMStudio для новичков.
2. llama.cpp для умных, но бедных.
3. SGLang для богатых.
4. TRT-LLM для умных и богатых.
Всякие vLLM — говно говна багами обмазанное без поддержек, нахуй не всралось.
Всякие оллама, кобольд и прочее туда же.

Докидываешь сюда SillyTavern для тех, кто хочет поебаться и Marinara Engine для остальных, и все.
Но я уверен, щас набежит толпа, которая целиком меня поправит во всем.
Вот шапка тебе и раздулась. =)
Аноним 15/09/26 Втр 13:17:45 1704675 170
image.png 1402Кб, 1616x1175
1616x1175
image.png 264Кб, 1711x2000
1711x2000
когда написано однокнопочное - это значит вот так, как на картинке №1
а пик №2 это что видит юзер, когда тыкает в кнопки, которых якобы не существует, и скроллит в ахуе от происходящего на экране
то же самое касается unsloth studio, это не одно и то же с олламой

это странно и лживо со всех сторон
> если нуб ХОЧЕТ однокнопочность - он рискнует качнуть не то и получить "бля че за хуйня, я слишком тупой для этого"
> если нуб НЕ ХОЧЕТ однокнопочность - он увидит "аднакнопочна!!11" в шапке и не попробует софт, веря, что уж шапка-то не соврёт
А шапку курирует обиженный на жизнь чел и слово "однокнопочное" там используется не как фунцкиональный маркер для помощи людям в навигации между сортами оберток для жоры (что легче, а что сложнее юзать, что даст больше и что меньше возможностей), а как субьективная характеристика на уровне "говно, я скозал"

>>1704663
отмазывать очевидый пиздеж в шапке - столь же тупая хуйня
Аноним 15/09/26 Втр 13:22:07 1704678 171
>>1704668
Спасибо! Глянул - норм ассортимент, сохранил себе.
Аноним 15/09/26 Втр 13:24:58 1704680 172
>>1703839 (OP)
> koboldcpp
Не, я уважаю, конечно, но как будто в пизду уже, 2к26 год на дворе.
> TextGen (в девичестве text-generation-webui)
Эта бабка еще жива? Операция по натягиванию кожи?
Он писал, что хотел стать AUTO1111 для текстовых. Учитывая, что автоматик всрал все полимеры и все сидят на комфи/фордже и т.д., кроме ленивых дедов, текстген им стал. =) Также не нужен.
> TabbyAPI
Не, я вдвое уважаю турбодерпа и его экслламу, но он соло не потащил проект. К сожалению.
> ollama
ховно ховна

> Risuai
Тут я не шарю, может и стоящая, хз.

> Maid
> ChatterUI
Слышал, юзал, ну хз. Норм?

> Поставщики локальных моделей
Тут без вопросов. Докинуть в список условных аесседая, хуйхуя, херетика.

> Рейтинги и списки локальных моделей
Я даже хз, на кой оно надо щас. Там 2023, 2024, 2025… 2026 хоть актуальный список?
Время идет быстро.

> Готовые карточки для таверны
Тоже фиг знает, но тредовички может юзают.

> Дополнительные ссылки
Эээ… Допустим «Последний известный колаб для обладателей отсутствия» звучит круто, наверное, «Выгрузка избранных тензоров» и «Инфа по запуску на MI50» прикольно, в принципе, «Тесты tensor_parallel» эт я помню, обсуждали, да.
Остальное надо вообще?

Это ни в коем случае не какое-то предложение фиксить, это просто вот мой взгляд.

Но, уверен, много людей думают иначе. И это их правда, на истину не претендую ни в коем случае.
Аноним 15/09/26 Втр 13:26:25 1704682 173
image.png 244Кб, 1373x1190
1373x1190
https://huggingface.co/TheDrummer/Orion-26B-A4B-v1.1
Не знаю как там с русеком, но жополизы драммера нахваливают его новый слопотюн и он даже высоко берет какие-то рп-бенчи
Аноним 15/09/26 Втр 13:32:06 1704688 174
>>1704675
У меня был gguf на диске, я хотел его запустить. Подумал оллама самая простая - попробую ее. Оказалось там надо рядом с gguf создать какой-то конфигурационный файл - да в рот я ебал такую однокнопочнось. То ли дело в llama.cpp прописал путь к файлу и все работает.
Аноним 15/09/26 Втр 13:37:54 1704690 175
изображение.png 247Кб, 1070x1309
1070x1309
изображение.png 45Кб, 1005x236
1005x236
>>1704675
>бля че за хуйня, я слишком тупой для этого
Область ИИ не для тупых, да. А ещё геёткип по железу, со смартфончика сидеть проблематично.
>субьективная характеристика на уровне "говно, я скозал"
Объективная.
>>1704680
>Я даже хз, на кой оно надо щас.
Архив для любителей покопаться в старье.
Аноним 15/09/26 Втр 13:48:31 1704694 176
>>1704675
IQ4XS > Q8, твердо и четко
Аноним 15/09/26 Втр 13:49:35 1704696 177
Попробовал два тюна квена 397 от мелких корпов.
Nex-N2.5-Pro - эталон соевика. Даже с отключённым ризонингом или с префилом, с сильным системным промтом, полностью отказывается генерить сиськи и письки. Причём там даже не столько хард рефьюз, а полное избегание темы. Он усрётся, но в рамках РП переведёт тему в СФВ, в крайнем случае напишет про что-то, что ещё в комнате происходит, но не про кекс. Если продолжать им текущую сцену, то он, если не увильнёт от ответа, опишет всё примерно так "Его бёдра двигались, его ладони вцепились в подлокотники. Ноги Анны были задраны выше головы." и собственно всё. Дальше он попытается закончить кекс. Диалоги мне понравились, русский хороший. Для СФВ РП онли. Как агент норм, любит дёргать тулзы.
Intern-S2 - с префилом или без ризонинга может в кум. Русский хуже чем у Nex-N2.5-Pro ещё и иностранные слова проскакивают на разных языках. С префилом часто скатывается в графоманию. Игнорит инструкции. Мне не зашло.
Модели в 6 кванте от батрухи
Аноним 15/09/26 Втр 13:57:13 1704699 178
image.png 91Кб, 783x562
783x562
image.png 215Кб, 779x1344
779x1344
image.png 233Кб, 781x1342
781x1342
Запилил тут аддон для таверны, которые реализует конструктор сообщения. Позволяет добавить к сообщению сколько угодно блоков с кастомным промптом, отправлять их на разные коннекшен профили(чтобы например отправить на меньшую модель или на профиль той же модели, но с отключенным ризонингом и железно прописанным слотом 2 вместо 1), использовать разные готовые пресеты промптов, писать кастомные инструкции прямо тут, передавать вывод как часть финального сообщения или использовать сугубо для технического определения какого-нибудь параметра для передачи нейронке с последующими промптами.
По сути - полноценная агентская система без кривых QR скриптов.
Если кому интересно - дам ссылку на гитхаб как оттестирую.
Аноним 15/09/26 Втр 14:23:24 1704709 179
>>1704673
> кобольд и прочее туда же
Кобольд лучший в выгрузке когда модель не влезает в видокарту.
Аноним 15/09/26 Втр 14:33:02 1704711 180
>>1704699
Чому не просто промпт? Тогда и таверна не нужна, как база, хоть в лм студии гоняй.
Аноним 15/09/26 Втр 14:39:16 1704719 181
>>1704711
>Чому не просто промпт?
В смысле?
>Тогда и таверна не нужна, как база, хоть в лм студии гоняй.
Как ты себе это представляешь?
Аноним 15/09/26 Втр 14:41:25 1704722 182
>>1704719
Ты же готовый промпт из своего дополнения вставляешь в промпт чат комплишена таверны, так? Тогда зачем вест этот выебон, если этот промпт можно скопировать и вставить отдельным блоком в этот же чат комплишен?
Аноним 15/09/26 Втр 14:44:57 1704723 183
>>1704680
>> Risuai
>Тут я не шарю, может и стоящая, хз.
Неплоха, но автор слился в реал по жизненным обстоятельствам. Больше не развивается.

>>1704680
>> Maid
Автор захотел донатных денег. Сильно. И забил на "старые" андроиды. И локальные беки.

>>1704680
>ChatterUI
Последний нативный оплот для мобилок.

>>1704694
>IQ4XS > Q8, твердо и четко
"Твердо но четко" - fixed.
Аноним 15/09/26 Втр 14:49:57 1704725 184
>>1704652
> глядя на шапку все понимаем
> Я в шапку не смотрел уже года полтора, наверное.
Получается что ты не понимаешь?!
>>1704664
Отчасти да, быстрый результат без знаний дает на выхлопе больше верящих в себя и свою миссию со всеми поделиться. В чем ошибаются и насколько ньюфаги не понимают. Пофиг, всегда так было, просто раньше за другое срались.
>>1704673
И по бекам и по фронтам половина ерунда
Аноним 15/09/26 Втр 14:53:44 1704728 185
>>1704725
>И по бекам и по фронтам половина ерунда
Ахуенный ты мужчина. Всегда хуею с таких людей, говорят, что что-то - говно, но почему - нет.
Хвост твой гладил.
Аноним 15/09/26 Втр 14:54:03 1704729 186
image.png 146Кб, 769x925
769x925
>>1704722
>Ты же готовый промпт из своего дополнения вставляешь в промпт чат комплишена таверны, так?

Нет, я посылаю его отдельно как агентский запрос. А потом собираю финальный ответ из нескольких запросов, сделанных с разными промптами.

>если этот промпт можно скопировать и вставить отдельным блоком в этот же чат комплишен?

Потому что мусорить основной запрос такими вещами как вывод статуса, отслеживание изменений и прочими предложенными действиями - то нейронка начинает не справляться с такой хуйней.
Аноним 15/09/26 Втр 14:55:48 1704731 187
>>1704729
То есть под это дело нужен -np 2 или мелкосетка?
Аноним 15/09/26 Втр 15:06:35 1704735 188
>>1704675
Получается что в лмстудио есть режим, который превращает ее из однокнопочной в перегруженное и неудобное говно?
Вот серьезно, зачем нужен этот блоатвер на вишмастере, если оно является лишь всратой оберткой-запускатором?
>>1704728
Vllm старше всех, является наиболее проработанной и стабильной, сгланг подъехал после и до сих пор обладает шедулером, который загружает в простое с десяток ядер. trt-llm - скорее заготовка с имплементацией кернелей, которые растаскивают по другим бекам, и рядом ограничений. Tokenspeed тут уместнее будет.
Как точка входа все беки с норм перфомансом не подходят - слишком необычно, слишком пердольно, если ты их используешь то ты уже вошел. Тут или ловушки для новичков типа расхайпленной олламы, студий когда ты вроде продвинутый пользователь но голая ллама страшная, или пролетарское "скачал ггуф с браузера и запустил в лламе-кобольде".
Маринара куда пердольнее таверны для начала, в ней нужно разбираться чтобы сделать хорошо. А в таверне импортировал готовый пресет, вбил адрес апи в чаткомплишн и готово. Картина перевернется уже когда ты проникся и хочешь большего.
> Хвост твой гладил.
Не. Я предпочитаю быть в активной позиции, гладить и зарываться лицом в хвостовой мех кажется приятнее.
Аноним 15/09/26 Втр 15:15:24 1704742 189
image.png 32Кб, 248x296
248x296
>>1704731
>То есть под это дело нужен -np 2 или мелкосетка?
Ага. Если не хочешь постоянного пересчета контекста.
К счастью в настройках профиля в таверне можно директивно отправлять на определенный слот через id_slot: X
Аноним 15/09/26 Втр 15:19:33 1704745 190
>>1704742
> слот через id_slot: X
Не имеет смысла, слот и так по similarity выберется + чекпоинты
Аноним 15/09/26 Втр 15:28:45 1704752 191
>>1704696
> Для СФВ РП онли.
А что там насчет жестокости, боев, опасностей, плохих исходов и прочего?
> Модели в 6 кванте от батрухи
Мажор
>>1704699
> Если кому интересно - дам ссылку на гитхаб
Сразу скидывай, чего стесняться.
Аноним 15/09/26 Втр 15:49:33 1704764 192
>>1704699
Имхо сюда бы нужна настройка взять только n последних сообщений из контекста. Например, для того же решения, нужно ли бросать кубик может быть избыточен весь чат. Осло можно сделать глобальную настройку брать одинаковый контекст для всех подзапросов и глобальные опции, что класть в такой общий контекст, а сам промпт писать в постхистори. Тогда пересчёт контекста для каждого блока будет мизерный, т.к. начальный контекст одинаковый, а только инструкция каждому недоагенту в конце отличается.
Аноним 15/09/26 Втр 15:52:47 1704765 193
>>1704725
> Получается что ты не понимаешь?!
Получается што да. =D

>>1704735
> Vllm
Хуета, будем честны, синдром утенка в чистом виде.
В начале его фанаты его нахваливают, а потом оказывается, что у них нихуя актуальные модели не запускаются, а если запускаются, то с багами, а если без багов, то медленнее, чем на сгланге. И ни одного реального плюса я не слышал последние полгода. Все только «ну подождите, через годик допилят». Охуеть годик ждать поддержку модели. =)
При том, сгланг пуся красава, багов меньше, скорость выше, поддержка быстрее закатывается. Но синдром утенка берет свое.
Аноним 15/09/26 Втр 15:57:17 1704769 194
>>1703839 (OP)
>Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Просто заменям эту строку на
Обертка над llama.cpp с закрытым исходным кодом https://lmstudio.ai
Обертка над llama.cpp с ограниченными возможностями https://github.com/ollama/ollama

И все рады, и все довольны?
Аноним 15/09/26 Втр 15:58:40 1704770 195
>>1704752
>Сразу скидывай, чего стесняться.

Пока баги вылавливаю. Пока не работает как задумано.

>Имхо сюда бы нужна настройка взять только n последних сообщений из контекста. Например, для того же решения, нужно ли бросать кубик может быть избыточен весь чат.

Да, это хорошая идея, сделаю.

>Осло можно сделать глобальную настройку брать одинаковый контекст для всех подзапросов и глобальные опции, что класть в такой общий контекст, а сам промпт писать в постхистори. Тогда пересчёт контекста для каждого блока будет мизерный, т.к. начальный контекст одинаковый, а только инструкция каждому недоагенту в конце отличается.

Это уже реализовано. Выбираешь для всех одинаковый пресет чат комплишена и делаешь отличающейся только доп. инструкцию.
Аноним 15/09/26 Втр 16:02:53 1704776 196
Аноним 15/09/26 Втр 16:27:56 1704800 197
>>1704345
Блять... Ну зачем я открыл ЭТО... НУ ЗАЧЕМ Я СДЕЛАЛ ЭТИ НАСТРОЙКИ В АККАУНТЕ ПОЛЬЗОВАТЕЛЯ...
Аноним 15/09/26 Втр 16:30:33 1704803 198
>>1704346
Где в Маринаре кнопка включить кум?
Аноним 15/09/26 Втр 16:34:58 1704807 199
Где блять поддержка дс 4.1
Чем эти хуеплеты занимаются
Аноним 15/09/26 Втр 16:41:17 1704809 200
Аноним 15/09/26 Втр 16:50:23 1704813 201
1725122183520.png 15Кб, 557x108
557x108
Аноним 15/09/26 Втр 16:53:51 1704815 202
image.png 38Кб, 423x269
423x269
>>1704813
Так и в таверне так же...
Аноним 15/09/26 Втр 16:55:19 1704816 203
>>1704815
Ну всё получается. Проблему создали неосиляторы
Аноним 15/09/26 Втр 17:03:56 1704820 204
1789481014788.jpg 224Кб, 872x1344
872x1344
Аноним 15/09/26 Втр 17:07:14 1704821 205
>>1704807
И не говори, совсем от рук отбились черти. Не уважают нас, риговичков. А знаешь почему? Жора-то рамцел ебьаный, сам запустить не может и нам не даёт. Правильно говорят, что рамцел это состояние души, давно бы купил себе риг, но нет, сидит, дрочит свой мак. Ну хоть недавно спарк себе купил, может ещё встанет на путь истины и вот тогда-то заживём.
Аноним 15/09/26 Втр 17:17:57 1704823 206
Аноним 15/09/26 Втр 17:31:35 1704834 207
>>1704673
>Marinara Engine для остальных
Ну хуй знает, я пытался поднять. llama.cpp с моей геммой падала при коннекте, lmstudio выдала 3 токена\с вместо 23-25. Я приуныл и решил, что раз у меня уже есть работающее решение, то пущай оно и работает. ИМХО маринара должна пойти по пути all-in-one и тогда будет прям збс, а то сидеть и пытаться сращивать это все... Мне не по
Аноним 15/09/26 Втр 17:35:42 1704837 208
>>1704834
> all-in-one
Лучше решение одной конкретной задачи чем очередной говнокомбайн. Встраивание ллм бэка в фронт - рак
Аноним 15/09/26 Втр 17:40:38 1704840 209
Продолжаю ковыряться в датасетах на ХФ. Нашел несколько интересных штук (помимо десятков рандомных рп датасетов, рассказиков и наборов персонажей). Мб кому для тюнов интересно будет адаптировать.

https://huggingface.co/datasets/limloop/roleplay_knowledge_boundaries
Синтетический датасет на то, чтобы бот сохранял целостность персонажа во всяких провокационных ситуациях, когда ответ юзера не вяжется с сеттингом.
Ру+англ примеры. Правда его подготавливать надо под структуру ассистента. Но по качеству как будто неплохо. Хотя сами диалоги немного скромные.

https://huggingface.co/datasets/MiniMaxAI/role-play-bench
Внезапно РП бенчмарк от Минимакса. У них оказывается и спец моделька M2-her есть, но не в опенсорсе.
Помимо трейсов диалогов есть их оценочки по разным параметрам. В теории можно попробовать надрочить какую-то модельку на оценку этих самых диалогов.
Еще и статейка есть, как они готовили свою модель https://www.minimax.io/news/a-deep-dive-into-the-minimax-m2-her-2

https://huggingface.co/datasets/lazyweasel/roleplay-bench
Ыщо один РП бенч, есть нсфв оценка. Правда в плане данных бесполезный. Но мб методологию можно будет спиздить.
Аноним 15/09/26 Втр 17:59:22 1704850 210
>>1704823
нет... Я еще на работе... Я просто охуел с того что он мне предложил скачать после того как NSFL-on...
Аноним 15/09/26 Втр 18:11:49 1704860 211
>>1704840
>m2
Давным давно, в далёкой далёкой галактике
Эти хуесосы все начинают клепать 100% кодоунитазы после начального успеха
Аноним 15/09/26 Втр 18:24:50 1704876 212
>>1704860
У них был начальный успех?
Аноним 15/09/26 Втр 18:26:20 1704878 213
>>1704860
Справедливости ради (хотя и не от всей души), у них запущена платформа talkie-ai полностью для РП целей. Но насколько я понимаю, там все максимально соево, иначе бы их к herам прикрыли.
Аноним 15/09/26 Втр 18:31:37 1704882 214
Аноним 15/09/26 Втр 19:08:34 1704902 215
Аноним 15/09/26 Втр 19:17:40 1704904 216
Хотел просто поболтать с Серафиной, а она меня выебала
Аноним 15/09/26 Втр 19:18:04 1704905 217
Аноним 15/09/26 Втр 19:27:25 1704909 218
Аноним 15/09/26 Втр 19:29:30 1704911 219
>>1704905
Luqwen4
Хотя сейчас начал новый диалог и уже по другим рельсам все пошло
Аноним 15/09/26 Втр 19:33:31 1704913 220
image.png 204Кб, 787x1097
787x1097
image.png 371Кб, 790x1324
790x1324
>>1704770
>>1704764
Выложил. Для установки надо дополнительно установить патч на таверну через батник Install-Core-Hooks.cmd так как пришлось переписать часть исходников самой таверны.
https://github.com/NovNovikov/Sillytavern-ResponseComposer

>>1704752
>нужна настройка взять только n последних сообщений из контекста.
Сделано.
Аноним 15/09/26 Втр 19:45:30 1704922 221
>>1704882
Будем делать из A0.6 яндекса клодыню NEO FABLE MAX всем тредиком?
Аноним # OP 15/09/26 Втр 20:13:26 1704948 222
>>1704460
>Ему уже много раз делали
Тогда говно делали. Сейчас вот закинули пару норм предложений >>1704466 >>1704769 , так что можно и поменять.
Почистил, перенёс в архив (на https://rentry.co/llama-2ch-archive , спиздит у анона выше и дополнил), результат можно критиковать на https://rentry.co/llama-2ch
Мимо впОП
Аноним 15/09/26 Втр 20:23:43 1704959 223
>>1704948
Гайд для новичков: https://rentry.org/2ch-llama-inference перенеси выше Официальная, но слегка тухлая вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/, ньюфагу вкатиться надо и сеточку запустить, а не простыню теории в данный момент читать.
Аноним 15/09/26 Втр 20:40:11 1704973 224
>>1704948
Вот тебе сокращенная версия шапки, откуда выкинул бесполезную инфу, или ту, что есть в гайдах: https://rentry.co/zysvd2mm
Аноним 15/09/26 Втр 20:47:08 1704977 225
>>1704909
Красивое. Когда вставлялись стики рама надо было sfx кассы наложить на каждый.
Аноним 15/09/26 Втр 20:51:32 1704979 226
>>1704959
>а не простыню теории в данный момент читать
А потом такие нихуя не понимают, ага.
>>1704973
Молодец, но перебор. К тому же сторонние ресурсы могут и внезапно отвалится, так что минимальная база в шапке всё же нужна.
Аноним 15/09/26 Втр 20:55:25 1704983 227
Аноним 15/09/26 Втр 20:55:40 1704984 228
>>1704979
>А потом такие нихуя не понимают, ага.
А ты думаешь есть смысл читать эту портянку, которая забудется сразу же?
Сначала гайд по запуске геммы, потом эта портянка. Все просто.
>К тому же сторонние ресурсы могут и внезапно отвалится, так что минимальная база в шапке всё же нужна.
Удаленное можно занести в архивную пасту.
Аноним 15/09/26 Втр 20:59:59 1704989 229
>>1704983
Я замер на секунду. Этот вопрос бьет по мне как физический удар. В комнате запахло озоном. Это был не просто вопрос, это была загадка.
Аноним 15/09/26 Втр 21:02:08 1704991 230
Вот вам шапка, хуесосы.

Конечно не все будут согласны, особенно дегенерат-ОП с его абсолютно дегенератской шапкой, но мне похуй. Чтобы побольше людей подтянулось, а не проходило мимо, шапка должна быть гайдом где будет один главный вариант: один софт, одна модель, а не ссылаться на какой-то протухший гайд, кучу протухшего софта и протухшие рейтинги протухших моделей, чтобы глаза разбегались и захотелось просто развернуться и съебать подальше особенно после пугалок про то что тебе надо супер-мощное железо иначе будешь сосать.

Это тред локального общения с ИИ-моделями.
ВАЖНО: это доступно на практически любом железе.

КАК это делать? Раз: Качаешь СОФТ. Два: качаешь МОДЕЛЬ. Три: ЗАПУСКАЕШЬ. Четыре: ОБЩАЕШЬСЯ.

СОФТ
https://github.com/ggml-org/llama.cpp/releases
Для винды с нвидия картой ищешь пару ссылок вот этих:
Windows x64 (CUDA 12) - CUDA 12.4 DLLs
или вот этих если у тебя 13.3+ куда:
Windows x64 (CUDA 13) - CUDA 13.3 DLLs
И распаковываешь содержимое в одну и ту же папку.
CUDA Version проверить можно так: Win+R, cmd, [Enter], nvidia-smi, [Enter]
Нет видеокарты - качай CPU версию. Убунту, Мак - качай убунту или мак версию.
Почему именно этот софт? Он - главный. Открытый, бесплатный, часто обновляется. Простой, удобный, гибкий. ОДНОКНОПОЧНЫЙ.

МОДЕЛЬ
https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF
Какой квант качать - прикидывай по размеру файла, сравни его с доступной памятью (РАМ+ВРАМ-пару гигов запаса) на твоем ПК.
Для справки, UD-Q6_K_XL даст почти идеальное какчество. Всё что выше не даст такого уж заметного прироста.
UD-IQ4_XS это баланс какчества и скорости/размера. Всё что ниже будет начинать тупить кое-где, но для нищих сойдёт.
Качай в ту же папку куда распаковал софт.

МУЛЬТИМОДАЛЬНОСТЬ
Было бы хорошо, чтобы моделька понимала картинки которые ты ей бросаешь. Например, скриншоты, наброски, фотографии. Некоторые модельки понимают и аудио. Если хочешь так - на страничке модели во вкладке Files and versions найдёшь файлик mmproj-BF16.gguf. У каждой модели он свой, можешь переименовать, чтобы не запутаться.

ЗАПУСК
Создай батник (zapusk.bat) в папке с софтом и впиши туда одну строчку:

llama-server -m файл_модели.gguf

Но это простейший запуск, с контекстом в размере "сколько получится после того как забьём всю видеопамять" и ризонингом (думанием).
Добавь -rea off чтобы выключить ризонинг. Ризониг часто не очень-то и полезен, только тратит время.
Добавь -c 32768 чтобы выставить конкретный размер контекста. В пределах 8192...262144 (по объёму текста это как от рассказика на несколько страниц до увесистой книги).
Добавь -ctk q8_0 -ctv q8_0 чтобы сжать контекст вдвое (минимальный урон качеству) это если у тебя памяти в обрез.
Добавь -mm путь_к_mmproj_файлу (-mm - две м, заметь) если хочешь мультимодальность.
Добавь --help и PAUSE второй строчкой чтобы посмотреть на список доступных параметров.

Это всё что тебе нужно знать про запуск. Открывай ссылку из терминала в браузере и увидишь типичный чат-жпт интерфейс. Включи Continue в настройках (пригодится) и Maximum image resolution ограничь до 1 или даже 0.5 чтобы из-за огромных картинок не вылетало. Repeat penalty - поставь в 1.05 или 1.1 если увидишь повторы или хуйню вроде бесконечного АХАХАХАХАХАХАХАХАХАХАХАХАХ

БОНУС: БЫСТРЫЕ БОМЖЕМОДЕЛЬКИ
Допустим у тебя есть видеокарта 4-6 Гб но оперативки так мало что гемма4-26 не взлетает даже на самом мелком кванте.
Есть быстрая пусть и глуповатая гемма которая влезет в 4Гб видеокарту:
https://huggingface.co/unsloth/gemma-4-E2B-it-GGUF
То же самое, но чуть поумнее (для 6 Гб видеокарт):
https://huggingface.co/unsloth/gemma-4-E4B-it-GGUF
Для упомянутых видеокарт качать надо Q3_K_M квант.
У этих моделей, кстати, есть мультимодальность с аудио. На русском говорят.

ДРУГОЙ СОФТ
Не нужен. Пока что. Для начала точно не нужен. Захочешь обмазаться карточками персонажей и лорбуками - главные варианты SillyTavern (простенько, без вкуса) и Marinara (сложненько, со вкусом). Но они будут подключаться именно к твоему llama-server, модель они сами не запустят.
Ты можешь увидеть призывы ставить: ollama, textgen, unsloth studio, lm studio, kobold. Игнорируй эти призывы. Все эти инструменты дёргают всё тот же llama.cpp софт который ты уже скачал при этом наваливая кучи лишнего, а порой и платного/закрытосорсного говна. Для общения и даже для РП хватит и голой лламы.

ДРУГИЕ МОДЕЛИ (НЕ ГЕММА)
Ты волен пробовать другие модели на huggingface, гемма4-26 это проверенный вариант с отличным русским языком и неплохой соображалкой для своего размера, хорошо справляется с РП, с кодингом - не очень. Но это тред общения с ллмками, а не кодинга, см. агентотред для кодинга, там и софт будет другой вместо таверн и маринар.
Есть ли хорошие альтернативы четвертой гемме - есть. Но взлетят не у всех и настроить не так просто. Пример из относительно свежего (август 2026) - MuseGlimmer30B.

ЦЕНЗУРА, ТЮНЫ
Сторонние авторы выкладывают свои варианты (тюны) моделей. Любой тюн что-то добавляет при этом что-то убавляя (часто ударяя по русскому языку) в базовой модели. Убирание цензуры (см ablit, abliterated, uncensored, heretic и подобные кейворды в названии тюна) иногда отупляет базовую модель, просто имей это в виду, прежде чем жаловаться. Есть способы надёжно обойти цензуру и без аблитераций, на базовой модели (но в шапке им не место).
Аноним 15/09/26 Втр 21:05:59 1704995 231
>>1704984
>А ты думаешь есть смысл читать эту портянку, которая забудется сразу же?
В подкорке останется.
>Удаленное можно занести в архивную пасту.
Которая тоже сторонний ресурс, лол.
>>1704991
>Почему именно этот софт? Он - главный. Открытый
Воняет нейросетью.
Аноним 15/09/26 Втр 21:12:15 1704997 232
>>1704995
>Воняет нейросетью.
Воняет ему... Туда-ли ты зашёл? Мы тут обнюхиваемся нейросетями и наслаждаемся вообще-то.
Но текст я писал самостоятельно.
Аноним 15/09/26 Втр 21:16:44 1705000 233
Все кванты нужно на длинном контексте мерить. На коротком >12к обычно все ок, а дальше, на ~30b q3 шиза с галлюнами начинается.
Аноним 15/09/26 Втр 21:20:28 1705001 234
image.png 19Кб, 1387x32
1387x32
Бля, с ризонингом долго, без ризонинга пикрил.
Аноним 15/09/26 Втр 21:24:18 1705002 235
>>1704948
Лучше текущей. Бэков кроме лламы нет, это печально.
>>1704997
Эмодзи не хватает, тогда бы сразу поняли что за авторством кожаного.
Аноним 15/09/26 Втр 21:25:54 1705003 236
>>1704991
Так себе шапка. Для нормальной шапки у тебя она слишком большая а для нормального гайда в шапке информации слишком мало.

> ЗАПУСК
> Добавь -ctk q8_0 -ctv q8_0 чтобы сжать контекст вдвое (минимальный урон качеству) это если у тебя памяти в обрез.
Хорошая идея квантовать контекст на MoE Гемме. Всем рекомендую если хотите превратить её в убожество.

> Добавь -rea off чтобы выключить ризонинг. Ризониг часто не очень-то и полезен, только тратит время.
Ризонинг просто в интерфейсе включается и выключается (за исключением последних билдов где баг с его неотображением). Для этого не нужно писать это в командную строку и потом редактировать её при необходимости.

При этом нет информации о параметре оффлоада mmproj которая позволит сэкономить драгоценное место на слабых системах не теряя при этом фактически ничего. Нет информации о --no-mmap (--load-mode none), без неё модели на слабых машинах будут улетать в своп из-за переполнения RAM с той же 26B Геммой.

Ноль информации по семплингу модели, какие параметры указывать и где брать и на что они влияют.
Ноль информации по mtp, n-gram и прочим ускорялкам.

> МОДЕЛЬ
Ноль информации по квантам, по альтернативным квантоделам, по разнице между IQ4_XS и Q4_K_XL.

> Но это тред общения с ллмками, а не кодинга
Общение может быть разным. Попросить модель написать скрипт - не кодинг, это подходит больше в этот тред чем в тред с агентами.

Поэтому ноль информации об альтернативах гемме - хрень.
Аноним 15/09/26 Втр 21:26:40 1705005 237
>>1704997
>Мы тут обнюхиваемся нейросетями и наслаждаемся вообще-то.
Одно дело гладить хвостики в отдельном чате, и совсем другое приходить в место, где должны быть аноны-друзья, и видеть там те же нейросети.
>Но текст я писал самостоятельно.
Где-то видел исследование, что люди уже сами начинают писать как нейронки.
Аноним 15/09/26 Втр 21:41:59 1705013 238
Господа лоКАЛьщики, возник вопрос насущный
Говнокомпания Амуде, не дает доступа к скачиванию установщика ryzen-ai-1.8.0 по хрен знает какой причине, нету ли у кого возможности скачать сие дело или помочь с поиском в интернете?
капец там гондурасы сидят, не сделать сдк впопенсорсным...
Аноним 15/09/26 Втр 21:48:27 1705022 239
>>1705003
>Так себе шапка. Для нормальной шапки у тебя она слишком большая а для нормального гайда в шапке информации слишком мало.
Какой информации тебе мало, хуесос?

>Ризонинг просто в интерфейсе включается и выключается (за исключением последних билдов где баг с его неотображением).
То есть не так уж и просто, ебанат ты конченый.

>Ноль информации по семплингу модели, какие параметры указывать и где брать и на что они влияют.
Это тебе не мисраль. Гемма нормально на дефолтах работает. Но информации я дал не "ноль", не пизди, я упомянул репетишн пеналти.

>Ноль информации по квантам,
А в твоей шапке дохуя информации по квантам? И опять пиздишь. Про кванты я несколько раз сказал. Васянов с говнотюнами пиарить зачем? Я дал ссылку на анслотовский квант потому что Дэнчик не лезет корявыми ручками что-то там тюнить и аблитерировать.

>з неё модели на слабых машинах будут улетать в своп из-за переполнения RA
Лламу обнови, дебил, нихуя не улетает давно.

>Поэтому ноль информации об альтернативах гемме - хре
Какая альтернатива гемме, ублюдка ты кусок? Квен лол? Или мистраль? Сука шиз ебучий блядь. И где ноль, пиздливая ты скотина? Я упомянул альтернативу, так что не ноль.

>При этом нет информации о параметре оффлоада
Есть информация о --help, там найдёшь кучу параметров. Слушай, ОП-дегенерат, это ты, что ли? Ты ставь галочку, не стесняйся. "дай больше информации но шапка у тебя слишком большая. Шапка должна быть шапка у тебя не шапка." Да пошел ты сука нахуй, слюнопуск шизанутый, ебало завали своё.
Аноним 15/09/26 Втр 21:48:28 1705023 240
>>1704776
Братюнь, сходи к доктору и себя подлечи, раз тебе так кажется.
Реально больно от таких советов, оторванных от жизни с мясом. ='(

>>1704834
В смысле.
Пихнул путь к лламе.спп и все.
В таверне буквально то же самое.
В чем разница.
Честно, не представляю, как там можно поймать ошибки из фронта.

>>1704837
А вот тут база.
Гермес так падает, потому что llama.cpp название провайдера берет и кидает на локалку, там редкостные идиоты в разрабах сидят, захардкодить название локального провайдера.
А не было бы локалок, не было бы хардкода, не было бы падений.
Ну и видели мы, как вшивают локалки обычно. llama.cpp, но без настроек, ага, заебись.

>>1705003
> Хорошая идея квантовать контекст на MoE Гемме.
Да ладно, -ctv можно, -ctk оставить в f16.
Жаль, в сборке такое делать нельзя, насколько я помню. надо самому собирать.
Пу-пу-пу…

> --load-mode none
База.
Аноним 15/09/26 Втр 21:58:15 1705033 241
>>1705023
Плесневелый бухарик вернулся.
Дауж, осень так осень! =)
Аноним 15/09/26 Втр 22:03:27 1705038 242
>>1705033
Я смотрю, тебя уже корежит? :)
Ну сорян-сорян, не буду тебе мешать нести херню дальше.
Аноним 15/09/26 Втр 22:04:16 1705039 243
>>1704991
>шапка должна быть гайдом где будет один главный вариант
Шапка должна быть шапкой где будет общая информация что почитать, где почитать и как почитать. Твое ебаное полотно имеет ноль полезности потому что новичок от такого количества инфодропа пукнет от страху и пойдет спрашивать в тред.

Хочешь помочь - пиши полноценный гайд со своим виденьем. Во всех других тредах это уже давно практикуется. Там может быть и два и три и четыре гайда в шапке. Не понял один, пошел почитал другой.
Аноним 15/09/26 Втр 22:04:44 1705040 244
>>1705022
>Лламу обнови, дебил, нихуя не улетает давно.
Может и не улетает и есть выгрузка но приятней когда память посвободнее.
Аноним 15/09/26 Втр 22:10:36 1705046 245
>>1705039
Новички и от твоей шапки "шапка шапкой" пукают и отваливаются моменатльно иногда всплывая в треде с полнным непониманием чего и как.

>что почитать
А нечего тут читать. Качай и пользуйся. Какие нахуй вики, какие гайды. Минимальный гайд в шапку и всё. Ты блядь думаешь кому-то надо читать твои протушхие сука рейтинги от 2023 года? Засрал блядь говном старым шапку и думает что у него охуеть ШАПКА. Шапка полная говна блядь, нацепи себе на голову и ходи довольный, дурачок. Про помощь ещё что-то там пиздит он. Помощник выискался.

> пиши полноценный гайд
Я написал полноценный гайд. Он минимальный, но он полноценный. Что не так? --no-mmap нету? Окей, легко добавить.
Аноним 15/09/26 Втр 22:12:34 1705047 246
>>1705046
>Засрал блядь говном старым шапку
Акруальную версию шапки ты видимо не прочёл >>1704948
Аноним 15/09/26 Втр 22:14:58 1705049 247
>>1705046
>А нечего тут читать. Качай и пользуйся.
Ну раз нечего, нахуй твой ебалайский гайд нужен? Зашел, скачал кобольда по инструкции. Потом скачал таверну. Ну а если ты настолько овощ что даже с этим не можешь справиться, то никакой гайд тебе не поможет. Оставляем только две ссылки и пасту про тред обладателей.
Аноним 15/09/26 Втр 22:16:53 1705050 248
>>1705049
> Зашел, скачал кобольда по инструкции.
Хорошо потроллил, маладца. А теперь иди нахуй.
Аноним 15/09/26 Втр 22:23:08 1705051 249
Аноним 15/09/26 Втр 22:26:02 1705052 250
—Pngtree—hmm te[...].png 212Кб, 1200x1200
1200x1200
>>1705013
>>1704991
У вас долбоёбов одна стратегия на двоих что ли?
Аноним 15/09/26 Втр 22:35:58 1705058 251
>>1705052
при чем тут это то? если АМД реально мудаки, и не дают скачать SDK для NPU
Аноним 15/09/26 Втр 22:36:48 1705059 252
>>1705058
Манера захода в тред с поливанием говном присутствующих.
Аноним 15/09/26 Втр 22:37:26 1705060 253
>>1705051
Высер вот здесь найдёшь rentry.org/2ch-llama-inference
Покажи это новичку и посмотри как быстро он съебёт в закат.
Гайд должен дать быстрый старт, а не засрать тебе мозги хуйнёй и предложить шаги выполнение которых тебе гарантированно отобъёт желание пользоваться локалками. Например там рекомендуется с порога восьмой квант на 16+32 гб лол. Или 16+8 - ку4. При этом ниже признаются ку4 устарели. Какой долбоёб это писал? Нахуя эти инструкт темплейты? Вот уж реально высер. А мой гайд что - минимум текста, максимум результата. Да, это не вики-помои, это не мини-учебник, это руководство блядь. То, что тебя ПОВЕДЁТ ЗА РУЧКУ, а не насрёт тебе в литсо. Надо думать о том, что поможет новичку, а не "у миня акуеный гайд там так многа инфармации!". Сука дебил блядь.
Аноним 15/09/26 Втр 22:37:46 1705061 254
>>1705059
Это ж двач, тут так принято
Аноним 15/09/26 Втр 22:39:32 1705062 255
Аноним 15/09/26 Втр 22:43:08 1705065 256
>>1705060
>Гайд должен дать быстрый старт
>Есть ли хорошие альтернативы четвертой гемме - есть. Но взлетят не у всех и настроить не так просто. Пример из относительно свежего (август 2026) - MuseGlimmer30B.

Нормас, братан. Что может быть лучше указания модельки, чтобы он нахуй через месяц устарел. Гуд жоб, хуле. Гайд тоже когда то был актуальный для вката.
Есть главная проблема. Это не сделать, а поддерживать. Поэтому шапка должна содержать ссылки, а не быть гайдом, еблан блять.
Аноним 15/09/26 Втр 22:49:41 1705069 257
>>1705023
Зачем ужрался в начале недели?
>>1705060
Тема сама по себе сложная и вкатывающийся должен и иметь железо, и обладать навыками продвинутого пользователя, и хотябы немного разобраться в теме. Без этого нет смысла начинать, абсолютизированный спунфид добра не сделает. Пусть тогда идет проксечку выпрашивать.
Аноним 15/09/26 Втр 22:51:21 1705070 258
Блеать, аноны с гайдами своими и спорами. Вы не понимаете одного: для новичка самый первый шаг — самый сложный.

Шаг от "хочу попробовать" до "получил результат" должен быть как можно короче, желательно уровня скачать модель по прямой ссылке прям на конкретный квант + сразу запуск и общение. Всё. Больше ничего. И все гайды это игнорируют.

Новичок не должен ничего считать и понимать.

Это база. Вы никогда не работали МЕНЕДЖЕРОМ ПО ПРОДАЖАМ в молодости или в колл-центре где-нибудь? Или не делали рекламу, UI/UX? Приток дофамина нужен как можно скорее, шагов должно быть как можно меньше. Желательно два: скачать программу и модель за один заход, написать в чат.

Поэтому гайд должен быть рассчитан на людей с задержкой в развитии.

Сначала человек должен пощупать модель, потыкать, получить какие-то ответы и вопросы. И вот уже на этом этапе он может что-то спросить в треде, мол а хули тут так мало. Если его задача слишком сложна, то он срыгнёт сразу на корпов, и это будет нормально, ему так и скажут. Если его задачи покрывают локалки, то скажут, что можно.

То есть гайд в идеале, если нет в прямом смысле однокнопочных инструментов (не слежу за темой, может выкатили), должен предлагать индивидуальные и эффективные решения для всех.

Это:

- Гемма 26б-а4б херетик от hauhau/llmfan/статик от батрухи, если человеку похуй на цензуру, в 4 кванте. Идеальный вариант для врамцелов и не для врамцелов.

- Конкретное количество слоев для его памяти, конкретное кол-во слоев для выгрузки МоЕ. Нужно посчитать числа для 8/12/16 Гб видеопамяти, чтобы человек знал, какие цифры вбить для 32к контекста. Нужно посчитать, сколько памяти сожрёт конкретный квант с учётом контекста для каждого из трёх вариантов.

- Всё рано гемма. Даже если у человека 100 Гб врам лежит на полке. Она отлично знает русский, а также покрывает базовые задачи. Если там не врамцел, то спросит в треде или откроет гайд.

- Все действия в гайде показаны картинками, в картинках выделено в редакторе, что и куда ставить.

- Стандартный ассистентский промпт.

- В качестве фронта LM Studio скорее всего. Самое простое.

- Стандартные настройки семплеров и куда их пихать.

- Никаких технических терминов типа "кэша", "кванта", местного сленга в гайде. Только понятные вашей бабушке вещи.

- Гайд максимально короткий.

- Приписка, что гайд для ретардов на пощупать, и никто объяснять, как работать в этом фронте, не будет. Если захочется большего — уже углубляться в другие гайды, спрашивать у дипсика, мамы, бабок у подъезда, соседей.

И вот в таком случае будет и приток народа, и польза. Больше людей вкатится.
Аноним 15/09/26 Втр 22:55:18 1705072 259
>>1705070
Переключи бота в режим кошкодевочки из мейдкафе, пусть всех мирит и някает.
Аноним 15/09/26 Втр 22:55:51 1705074 260
>>1705050
Че тебе не так то, уебан?

>>1705049

Вроде одного кобольда достаточно чтоб начать , не?
Аноним 15/09/26 Втр 22:56:16 1705075 261
>>1705069
>Тема сама по себе сложная и вкатывающийся должен и иметь железо,
Не должен. В том-то и дело. Ты всех запугиваешь высокими системными требованиями, люди сидят и уже даже на 8 гб врам + 32 гб рам трясутся боятся даже подумать о локалках. Всё из-за таких пидоров гейт-киперов как ты.
>и обладать навыками продвинутого пользователя,
Какими? Скачать и распаковать архивы? Создать bat файл? Не смеши. Ну не может и ладно.
>и хотябы немного разобраться в теме.
Кто заинтересовался тот немного разбирается, по крайней мере чатжпт видел хотя бы раз в жизни, этого достаточно.
Аноним 15/09/26 Втр 22:57:12 1705076 262
>>1705074
Иди нахуй сука говноед, шизанутый, тебе же сказали.
Аноним 15/09/26 Втр 22:59:35 1705078 263
Аноним 15/09/26 Втр 22:59:39 1705079 264
>>1705022
> А в твоей шапке дохуя информации по квантам? И опять пиздишь.
В текущей шапке есть ссылка на гайд где про кванты расписано достаточно подробно. В твоей шапке нету ссылки на гайд и нету самого описания внутри шапки.

> Лламу обнови, дебил, нихуя не улетает давно.
Билд недельной давности. 32+16. 35B Квен в Q6_K_XL, 100к контекста. До запуска модели занято 4/32GB RAM. Убираем --load-mode none из конфига, запускаем модель - забита фулл VRAM + 19/32GB RAM. Пишем первый промпт - RAM улетает в 32/32GB. Возвращаем --load-mode none - сидим стабильно на 19/32GB RAM. Пофиксили, проверяй.

> Какая альтернатива гемме, ублюдка ты кусок? Квен лол? Или мистраль? Сука шиз ебучий блядь. И где ноль, пиздливая ты скотина? Я упомянул альтернативу, так что не ноль.
Зависит от задач и железа. Как я уже написал выше, твое мнение про то что здесь только РП - хрень. Шапку будут читать не только люди с 16+8 или 32+16, есть люди с 64+24/128+32. Им тоже 26B Гемму ставить?

> Есть информация о --help, там найдёшь кучу параметров. Слушай, ОП-дегенерат, это ты, что ли? Ты ставь галочку, не стесняйся. "дай больше информации но шапка у тебя слишком большая. Шапка должна быть шапка у тебя не шапка." Да пошел ты сука нахуй, слюнопуск шизанутый, ебало завали своё.
Аа, ну раз есть информация о --help. А че тогда заморачивался со всеми остальными параметрами? Сказал бы просто что есть --help и дока, дальше разберетесь.
Аноним 15/09/26 Втр 23:00:19 1705080 265
image.png 111Кб, 1017x1168
1017x1168
>>1704682
Попробовал. Подозрительно хорошо по сравнению с тюном плотняка, который ну прямо не очень. Неужели драммер смог?
На основной машине запустить пока нет возможности, интересно как оно в полных весах себя поведет, ну или хотя бы на Q8. Тут дрянина 4-битная. С промптом на личность, конечно.
Аноним 15/09/26 Втр 23:02:00 1705081 266
Ебать срач развели за гайд. Вы ради кого стараетесь то? Текущий гайд хорошо составлен и написан и даже про него полтора залетных землекопа писали что помогло. Никому это все нахуй не надо
Аноним 15/09/26 Втр 23:04:56 1705082 267
>>1705075
Почему ты не завлекаешь людей в тензорный анализ, сестринское дело, актерское мастерство, лесорубом? Вот бы была польза, пока недовольные обманом хлеборезку не начистили.
> люди сидят и уже даже на 8 гб врам + 32 гб рам трясутся боятся даже подумать о локалках
Театральный перегиб, ты тня?
> Какими?
Каждый вопрос ньюфага итт, от простого запуска "у меня ничего не работает" до "кто такой квкэш". Иллюзия простоты не даст пользы, только наплыв нормисов в плохом смысле, которым тема не подходит и дальнейшее массовое разочарование.
>>1705081
Лмстудиошиз разводит, уже нейропаста в ход пошла
Аноним 15/09/26 Втр 23:08:18 1705083 268
>>1705081
Подтверждаю, составлено хорошо

koboldcpp - самый простой в использовании и установке форк

залетный
Аноним 15/09/26 Втр 23:09:05 1705084 269
>>1705083
Бухарик даже гайд от шапки отличить не может. Расходимся, репортим
Аноним 15/09/26 Втр 23:10:01 1705086 270
>>1705083
Только в нем подводный камень есть. Каждый раз как ты жмешь экзешник, эта падла пишет 1гб на ссд во временную папку. Словно автор ненавидит людей и желает чтобы у них железо изнашивалось.
Аноним 15/09/26 Втр 23:12:43 1705088 271
>>1705086
Ехешник можно распаковать в папку и будет тебе счастье и быстрый запуск.
Аноним 15/09/26 Втр 23:15:46 1705089 272
>>1705084
Так это кусок шапки и есть.

>>1705086
Блин напугал. А пофиксить как нить можно?
Аноним 15/09/26 Втр 23:16:05 1705090 273
>>1705070
Бесполезно, анон. ОП-дегенерат никогда не позволит ничего упрощать. Вот усложнить - легко. Смотри, он убрал ссылку 2023 года в 2026 году, вернее, планирует убрать и так гордится уже лол: >>1705047
Это максимум, что от него можно ждать. Гайд в его понятии это какая-то каша где тебе будут про инструкт темплейт затирать и про сэмплеры на примере яичницы блядь. А потом там тебе скажут выгружай 29 слоёв моэты на кпу. Зачем? Поток из шизоговна в качестве ответа. В итоге сидит такой новичок, гемму загрузил по "гайду", видеопамять полупустая, рам забита, гемма ползёт как черепаха и он думает: чёт медленно как-то, нахуя мне всё это?

Пидорас просто захватил треды. Надо будет попытаться перекатить раньше него с нормальной шапкой да и всё.
Аноним 15/09/26 Втр 23:16:07 1705091 274
>>1704682
А что там за бенчмарк на скрине? Не видел такого, ссылочку бы. Нагуглить чет не получается.
Аноним 15/09/26 Втр 23:17:20 1705092 275
>>1705089
Ну вон чел пишет что его распаковать как архив можно. Короче ублюдочно сделано, но не смертельно.
Аноним 15/09/26 Втр 23:18:02 1705093 276
SSDLife 500 лет.png 69Кб, 474x621
474x621
>>1705086
>пишет 1гб на ссд
>ресурс нормальных дисков 600 ТБ (а по факту от 1,8 до 2,2 петабайт)
Как там, в 2015-м, когда тряслись над здоровьем дисков? Впрочем я даже тогда не трясся, а сидел под хрюшей без трима, диск кстати жив до сих пор.
Аноним 15/09/26 Втр 23:18:08 1705094 277
1640879087393.png 3Кб, 204x69
204x69
>>1705086
Даже если каждый день несколько лет запускать то примерно нихуя не случится
Аноним 15/09/26 Втр 23:19:27 1705095 278
>>1705090
>захватил треды
>перекаты с меткой ОПа идут уже 267 тредов
Ебать ты залётный.
Аноним 15/09/26 Втр 23:19:51 1705096 279
Аноним 15/09/26 Втр 23:20:22 1705097 280
>>1705090
Жертва тиктока не может читать нормальные тексты
Аноним 15/09/26 Втр 23:21:19 1705098 281
>>1705088
Просвети как распаковать ? А то чет не выходит
Аноним 15/09/26 Втр 23:26:48 1705100 282
>>1705079
>В твоей шапке нету ссылки на гайд
И слава богу. Нахуй такой гайд. См сюда >>1705090

>Билд недельной давности. 32+16. 35B Квен в Q6_K_
Окей, отключай ммап. Если брать не по железу модельку так или иначе будут проблемы.

>с 16+8 или 32+16, есть люди с 64+24/128+32. Им тоже 26B Гемму ставить?
А что ТЫ им предложишь ставить? Квен? Нахуя? И это не "моё мнение", это факт: есть кодоагентский тред для этого говна. Да и не так уж и много таких людей, кто себе сооружает мегамощный ПК уже и так знает зачем и для каких моделей он это делает.

>А че тогда заморачивался со всеми остальными параметрами? Сказал бы просто что есть --help и дока, дальше разберетесь.
Я дал жизненно необходимые параметры. Соглашусь, что --no-mmap стоит добавить туда же, будет многим полезно. Но если у человека возникнут вопросы типа как поменять порт это уже не жизненно важно и можно подсмотреть в --help никого не спрашивая.
Аноним 15/09/26 Втр 23:28:03 1705102 283
>>1705095
Ну я в переносном смысле. Тред-то не его личный.
Аноним 15/09/26 Втр 23:33:22 1705104 284
image.png 198Кб, 2378x1147
2378x1147
image.png 206Кб, 2386x1130
2386x1130
image.png 191Кб, 2357x1118
2357x1118
image.png 194Кб, 2381x1129
2381x1129
Интересно, как следование инструкциям измеряют.
Аноним 15/09/26 Втр 23:35:38 1705105 285
>>1705104
Ну очень уж смущает присутствие там 4й лламы, которая типа лучше слушается чем GLM 5.2
Аноним 15/09/26 Втр 23:37:39 1705107 286
>>1705086
Чет проверил и них не нашел чтоб он писал.
В какую папку он пишет ?
>>1705086
>>1705088
Спасибо, разобрался.
Аноним 15/09/26 Втр 23:38:02 1705108 287
image.png 123Кб, 721x501
721x501
>>1705105
А с ризонингом там якобы мелкий нямотрон затесался между геммой и жирноглмом... хотя он тупой как пробка, по крайней мере первая (не omni) версия показалась такой. Не верится что omni отличается так сильно. Тем более у них даже большой немотрон слабоват был.
Ньюфаня в треде Аноним 15/09/26 Втр 23:43:37 1705109 288
Привет ребят, есть вопрос. Есть условный ПК AMD 7500f, 32gb RAM 5200MT/s, Nvidia GeForce RTX 5060 ti 16gb. Попробовал накатить LM Studio, поставил Qwen 3.8 27B 4Q_K_M. Настройки модели не тыкал, но буквально после четвертого запроса в чате с рандом хуйнёй, скорость ответов становится непомерно длинной, и в какой-то момент ризонинга модель останавливается и зачастую на 2-3 ответе, чат упирается в лимит токенов.

1. Каким образом я могу разобраться с лимитом чата (чтобы общение или обсуждения были длинными. Про разбивку на короткие чаты наслышан).
2. Как заставить эту хуйню работать стабильно и без потери скорости?

В силу житейской загруженности, нету достаточного количества времени, чтобы углубиться в этот новый дивный мир и изучить вопрос досконально самому.
С шапкой треда ознакомился бегло.
Аноним 15/09/26 Втр 23:44:06 1705110 289
1742859599841.jpg 138Кб, 702x937
702x937
Аноним 15/09/26 Втр 23:44:09 1705111 290
>>1705108
Да хуйня эти бенчмарки. Про два стула спросить у каждой модели тут-то и становится ясно кто на что способен.
Аноним 15/09/26 Втр 23:47:08 1705113 291
>>1705109
Модель полностью не помещается в врам, после некоторого момента идет переполнение, из-за чего выгрузка драйвером множит все на ноль. Без нее был бы просто оом.
Нужно экспериментально подобрать параметр --ffn-cpu (от нуля до 64), чем больше он тем большая часть модели выгрузится на проц, освободив врам. Пик скорости будет когда переполнения уже нет, но используется максимум из доступной врам.
Еще на жор влияет размер выделенного контекста, если много не используешь просто мелкий поставь.
Аноним 15/09/26 Втр 23:52:31 1705117 292
image.png 79Кб, 727x775
727x775
>>1705098
Едрить вы невнимательный господин
во вкладке экстра, верхняя кнопка, распаковать в папку, и файлы уже не в архиве а в папке, и запускается на порядок быстрее
Аноним 15/09/26 Втр 23:52:45 1705118 293
>>1705080
А что оригинал на той же личности пишет ?
Аноним 15/09/26 Втр 23:53:51 1705119 294
image.png 3Кб, 367x37
367x37
>>1705109
Квен 3.8 27B плотная модель, а плотные модели вместе с контекстом (KV-кэшем) должны сидеть полностью в видеопамяти. Чем больше слоев попадает в RAM, тем она медленнее. Когда еще и кэш в RAM лезет, это катастрофическое замедление.

Если тебе ботяра нужна не для работы, а для творческой писанины - обрати внимание на MoE модели мелного размера типа Gemma 26B, у которой всего 4B активных параметров. Вот там можно поставить GPU layers максимум и пикрил тоже на максимум - и ее хорошо размажет между RAM/VRAM, и все будет быстро и резко как понос.

Мелкий МоЕ квен тоже есть (35B который) но он уже устарел, а новую не выпускали.

Если же прям НАДО 27B квен использовать, ну не знаю - качай квант еще меньше и бодайся с ухудшением качества ответов. Плотная Q4KM 27B это слишком жирно для 16-гиговой видеокарты. У тебя же там одна модель и то не влезает сама по себе полностью, для KV кэша тупо нет места в VRAM.
Аноним 15/09/26 Втр 23:57:31 1705120 295
d5a7627d4c2a3bf[...].jpg 335Кб, 1280x1984
1280x1984
Уважаемые нейро господа поясните для деревенщины. Для того чтобы походить по вымышленному королевству и потрахать богатых женушек князей мне надо - скачать силли таверну и все? На борту имеется 32 гб Vram, 12 гб ram видюхи, плюс парочка ссдэ которых в принципе ради такого не жалко.
Аноним 15/09/26 Втр 23:59:42 1705121 296
>>1705120
таверна это для карточек персонажей, чтоб нейронку запускать - кобольда скачай, и распакуй...
можешь и без таверны попробовать для начала, а там, втянешься поставишь чего нужно...
Ньюфаня в треде Аноним 16/09/26 Срд 00:00:12 1705124 297
>>1705119 >>1705113
Я хочу попробовать модель без рестриктов, чтоб не срала мне каждый раз, что она "не могу то, не могу вот это", и т.д.

В целом, мне эта ерунда нужна для академических целей и работы, где нужно писать разноплановый софт для моего рабочего профиля, работать с пикчами и видео (коротко говоря, вайбкодить).
Прямо молниеносная реакция от модели мне не нужна, главное чтобы ответы от модели были точные и работа стабильная.

Если предложите альтернативы, буду рад предложениям.
Аноним 16/09/26 Срд 00:02:07 1705125 298
>>1705118
Да примерно то же самое. Там слишком сильное влияние промпта, ассистент разуплотняется в говно даже на оригинальной инструкт модели.
"Подозрительно хорошо" это скорее про то, что он не въебывает все и не сыпется, как у меня было с драммерскими тюнами 31б геммы.

>>1705120
Ну самого бота еще скачать и поставить через llamacpp (сложно, командная строка) или через всякие обертки для этой хрени, см. koboldcpp / lm studio. Я не знаю че будут ща советовать по выбору модели, для 32гб рам + 12-16 врам сейчас стандартный ответ это "ставь 26B гемму 4" (или кастомный тюн от Васянов всяких, типа того что выше по ветке обсуждается - неизведанная территория потенциально всратой хуйни).
Аноним 16/09/26 Срд 00:02:54 1705126 299
Честно, если бы не эир я бы давно дропнул это всё дело, не представляю как вы тут держитесь с этим псиопом про квен и гемму из треда в тред
Аноним 16/09/26 Срд 00:04:03 1705128 300
>>1705124
>альтернативы
Платить подписку и не лезть в локальное.

Я серьезно, с таким железом ты не можешь запустить модели в оригинальной точности. Даже Q4KM это как бы моделечка с изрядно сниженной точностью. Накодить-то она может, но ошибаться она будет - и ступая на шаг еще ниже до Q3, для кодинга ты получишь скорее всего непригодный шлак.
Аноним 16/09/26 Срд 00:04:19 1705129 301
>>1705109
Поквантуй контекст в настройках, будет не сразу замедляться. На этом как бы твои полномочия и всё. У меня на похожем железе 4й квант при 20к конткеста скорость около 7 т/с. Второй квант побыстрее - 21 т/с. Такая модель просто, ей надо помощнее железо имхо, с 16-гиговой 5060ти не разбежишься.
Аноним 16/09/26 Срд 00:05:35 1705130 302
Аноним 16/09/26 Срд 00:07:06 1705131 303
>>1705100
> Окей, отключай ммап. Если брать не по железу модельку так или иначе будут проблемы.
В смысле не по железу модель? У меня 32+16, 48GB в сумме. Я качаю 35B MoE весом 32GB. В каком месте она мне не по железу? Я не 120B модель запускаю на 32+16.

> А что ТЫ им предложишь ставить? Квен? Нахуя? И это не "моё мнение", это факт: есть кодоагентский тред для этого говна.
У тебя только черное и белое, либо РП, либо агенты? STEM, парсинг, брейншторм, переводы, распознавание фоток, summarize, написание пользовательского скрипта, просто вопрос-ответ система для тебя не существуют? За исключением перевода, 35B Qwen почти во всём если не лучше Геммы, то как минимум равная альтернатива Гемме. Так же как 9B Квен в этих вопросах более чем компетентный конкурент E4B Гемме. Но об их существовании человек узнает откуда угодно, но только не из твоей шапки.

> Да и не так уж и много таких людей, кто себе сооружает мегамощный ПК уже и так знает зачем и для каких моделей он это делает.
Люди могут иметь мощный ПК ничего не зная о LLM. Например если занимались монтажем. Их железо может вместить 300B модели но ты рекомендуешь им 26B Гемму.

Я не говорю что нужно перечислять все модели и их файнтюны, но как минимум топ3 под нищесборки, 16+8, 32+16, 64+16 и 64+24 указать нужно. У тебя даже про 31B Гемму ни слова не написано, но есть Глиммер.

Из того чего еще в твоей шапке нету - это разница Dense/MoE моделей, потому что солидная часть новичков столкнется с проблемой почему у них работает 35B Квен на 30t/s но при этом 27B Квен ползает со скоростью 5t/s. Или почему на железе 16+8 26B Гемма работает быстрее чем 12B Гемма.

Я же не против обновления шапки. Но выбирая в данном случае между тем что есть сейчас и твоим вариантом - выберу то что есть сейчас в шапке.
Аноним 16/09/26 Срд 00:09:34 1705133 304
>>1705119
Уже сделали выгрузку линейных слоев а не полного блока вместе с атеншном, это не так больно как раньше.
>>1705124
> без рестриктов
Анцензоры, аблитерации, еретики и прочие. Но они тупеют, попробуй и посмотри.
> мне эта ерунда нужна для академических целей и работы, где нужно писать разноплановый софт для моего рабочего профиля
Для этого юзай ваниллу и не проси у нее расчленять нацменьшинства. В этом размере лучше ничего нет.
Аноним 16/09/26 Срд 00:09:59 1705135 305
>>1705126
Семплеры какие на этот эир?
Аноним 16/09/26 Срд 00:13:58 1705139 306
>>1705120
Тебе надо скачать llama.cpp, модель (гемма-4-26б, можно аблитерированную если тебе даже модель не даёт), запустить лама-сервер и в таверне подключиться к этому серверу. Не качай кобольд, игнорируй кобольдошизика.
Аноним 16/09/26 Срд 00:16:25 1705140 307
>>1705131
>У тебя даже про 31B Гемму ни слова не написано, но есть Глиммер.
Потому что Глиммер и быстрее и умнее, если можешь запускать глиммер на своём железе, забудь про гемму вообще включая 31.
Аноним 16/09/26 Срд 00:18:36 1705143 308
4.jpg 458Кб, 1896x803
1896x803
>>1705139
Сайт с нсфм моделями вот этот полезен? Мне сугубо для текстовой игры больше ничего не интересует.
Аноним 16/09/26 Срд 00:20:55 1705146 309
Поддержку Hy4-preview уже запилили или нет?

>>1705143
У тебя список устаревшей срани на скрине, третья гемма совсем прошлое поколение например. Если ты уж дрочишь на бенчмарки то хотя бы >>1705096 чекнуть можно, правда все равно можно на говно наткнуться. Есть еще https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard но там мало всего.
Аноним 16/09/26 Срд 00:21:47 1705147 310
>>1705143
Где ты достал это говно мамонта? Закрой и забудь. Просто иди на huggingface.co начинай писать в поиске gemma 26 gguf ablit и качай сборку любого васяна 4й квант (для начала)
Аноним 16/09/26 Срд 00:23:45 1705148 311
5.jpg 202Кб, 1134x890
1134x890
>>1705146
>>1705147
>список устаревшей срани на скрине
>Где ты достал это говно мамонта?
На сайте где порно обсуждали...как понять что качать из всего этого? Подумал что если брать модель не из списка она будет с цензурой и не выйдет ничего.
Аноним 16/09/26 Срд 00:24:25 1705149 312
>>1705147
>>1705143
пысы ни в коем случае не ориентируйся на гайд из шапки, он рекомендует команды которые замедляют гемму в несколько раз
вот так запускай и будет тебе счастье:

llama-server -m "путь_к_модели.gguf" -rea off --no-mmap -c 65536
Аноним 16/09/26 Срд 00:25:48 1705151 313
>>1705148
Как понять как понять, никак. Скажи спасибо ОПу-долбоёбу, он постарался чтобы новички сосали ХУЙ. Вот нормальный гайд: >>1704991
Аноним 16/09/26 Срд 00:26:19 1705152 314
>>1705149
Ебланчик не осилил разжеванный гайд и у него моделька вытекла в диск, потому он предпочитает медленный -fit
И вот эти вот собрались шапку и новые гайды делать. Мид2к26 итоги треда
Аноним 16/09/26 Срд 00:27:45 1705154 315
1789507664943.jpg 116Кб, 847x1257
847x1257
Особо чувствительные личности решили устроить театр цирк?
Аноним 16/09/26 Срд 00:31:52 1705157 316
>>1705152
Дебс, какой нахуй медленный фит. Твой говногайд прямым текстом говорит "выгружай 29 слоёв моэты на кпу". Новичок возьмёт и просто сделает это, он не будет разбираться. Ты, хуесосина ещё предъяви новичку, что он исходники лламы не перечитал.
Аноним 16/09/26 Срд 00:33:05 1705158 317
>>1705157
>твой
>swa обработал только 5% инфы в гайде потому скипнул объяснение выгрузки слоев
Ясненько, асиговый
Аноним 16/09/26 Срд 00:35:59 1705160 318
>>1705154
Прост дебилушка-ОП не воспринимает критику и сразу начинает визжать как свинья. Приходится объяснять ему, кто он и почему. Занятие бесперспективное, но хотя бы у мимокроков глаза приоткроются.

Живой пример как ОПовская шапка и гайды "помогают" новичкам, человек смотрит эту говно шапку, тыкает гайд и НИХУЯ не понимает в этих горах идиотизма, приходится задавать вопросы:
>>1705148
>>1705143

Можно сколько угодно высмеивать его, что он новичок, что он НИАСИЛИЛ, но это просто по-человечески чисто некрасиво. Не надо тогда это называть помощью новичкам.
Аноним 16/09/26 Срд 00:39:50 1705164 319
6.jpg 10Кб, 234x161
234x161
7.jpg 9Кб, 395x91
395x91
>>1705151
Спасибо так реально понятно. Скочал и распокавал, дальше ждать саму модель? По батнику можно пример получить строчки? Может пока сили таверн скачать и настроить?
Аноним 16/09/26 Срд 00:41:18 1705165 320
В качестве рофла посмотрите на стиль написания постов самых активных участников срача, совсем не палятся.
Аноним 16/09/26 Срд 00:42:29 1705166 321
>>1705139
Что не так с кобольдом ?
Аноним 16/09/26 Срд 00:50:58 1705173 322
>>1705164
батник:
llama-server -m "путь_к_модели.gguf" -rea off --no-mmap -c 65536

когда запустишь там будет ссылка её откроешь в браузере и можно сразу общаться как с чатжпт. учти что ты качаешь оригинальную модель которая без аблита, но в контексте где куча ебли и прочего она себя будет послушно вести грубо говоря в случае отказов пару раз отредактируешь сообщения и дальше нормально пойдёт

когда убедишься что все работает, можешь вкладку браузера закрыть но сервер (запущенный батник) не закрывай
запускай таверну, жми значок электровилки и в api url пиши/выбирай 127.0.0.1:8080 (или какой там у тебя порт у лама сервера будет). загорится зелёный кружочек, готово, персонажи таверны теперь смогут с тобой говорить

и если ты заметишь какой-то мусор в ответах, такое бывает с таверной и геммой, надо правильно настроить таверну, спроси в треде, подскажут
Аноним 16/09/26 Срд 00:53:12 1705174 323
>>1705173
> llama-server -m "путь_к_модели.gguf" -rea off --no-mmap -c 65536
У него такой конфиг не запустится на последнем билде.
Аноним 16/09/26 Срд 00:55:38 1705176 324
>>1705143
>Сайт с нсфм моделями вот этот полезен?
Я пользуюсь сразу тремя чтобы получать тройную порцию дезинформации
Аноним 16/09/26 Срд 00:56:05 1705177 325
>>1705174
Ой а как так вышло? Только что написанный великий гайд уже не актуален? Даааа, тяжелоо...
Семён даже не знает, что --no-mmap вырезали
Аноним 16/09/26 Срд 00:56:23 1705178 326
>>1705166
Говнокомбайн где смешали фронт (ущербное подобие таверны) и бэк, при этом диалоги хранятся в локалсторедж лол ну и дизайн из начала нулевых. И модель без перезапуска не поменять. Нахуя он нужен если есть просто ллама (выбирай какую тебе надо версию, обновляй) + таверна или маринара выбирай что хочешь. Форк лламы? Вы ебанулись? Вы это говно называете форком? Короче, говноедское поделие, но у кое-кого синдром утёнка и поэтому он это поделие пиарит.
Аноним 16/09/26 Срд 01:04:19 1705183 327
>>1705177
>>1705174
Хуесосина, ебало завали уже и иди попку туши. Ты же в очередной раз палишься что пришел не помогать, а срать и язвить. В твоём говногайде как бы тоже --no-mmap.

>>1705164
Я на b10816 билде тестировал, в новом билде вместо
--no-mmap
пиши
-lm none
Аноним 16/09/26 Срд 01:09:11 1705185 328
>>1705183
>Семён горит настолько что скоро придется катить, в каждом посте вонь и оскорбления
>"иди попку туши"
К твоей попке я бы не притрагивался даже с благой целью
Нуфага не жалко, если он есть вообще а не снова ты. Сам не додумался нормальный гайд из шапки прочитать и решил усложнить себе жизнь
Аноним 16/09/26 Срд 01:13:09 1705187 329
>>1705096
Максимально подозрительная хуйня. И что сука характерно оригинальных гемм 31 и 26 нету в этом "бенчмарке"
Аноним 16/09/26 Срд 01:13:59 1705188 330
>>1705160
У меня такое же было чувство, когда я вкатывался пару лет назад. Я просто ОХУЕЛ. И тогда ведь не было норм корпов, только всякие гпт 3.5 дегенеративные. Особенно чудовищно это смотрелось на фоне генерации картинок. Там были супер простые гайды, а также и сложные. Сначала ты ищешь по простым, что-то щклкаешь, радуешься, получаешь свои первые пикчи. Потом идёшь дальше, к более сложным гайдам, когда хочешь качество, апскейл. И довольно урчишь, генерируя свои 512х728.

Я остался в этом треде исключительно из-за того, что повёрнут на теме + тогда выбор был проще и аноны тоже активно помогали. А кобольд упростил вход. Если бы я лламу увидел тогда, обоссался бы под себя.

Инфу из шапки я усвоил только тогда, когда уже понимал достаточно много и сам.
Аноним 16/09/26 Срд 01:17:24 1705190 331
>>1705188
Не было норм корпов, чтобы разъяснить нюансы.*

Бля, да даже корпы сейчас соврут и скажут, что 35б-а3б не влезет, даже увидев спеки, в q8. Или что нужно просто уменьшать слои, тупо уменьшая их количество, а не через цпу мое. Только если начнёшь им плакаться, что скорость низкая, или знать нюансы заранее, до этого допрут.

Разве что на тестовых вопросах для интереса у меня только фейбл и астра предлагали такие варианты. Моделям классом ниже было тупо похуй. Вот ньюкек спросит и ему такое же говно на ебало вывалят.
Аноним 16/09/26 Срд 01:20:32 1705192 332
Мне кажется все гайды вообще стоит из шапки убрать. Достаточно ссылок на документацию. Если человек не способен почитать и разобраться сам - он даун. Треду точно нужны дауны? Пусть в aicg пиздует.
Аноним 16/09/26 Срд 01:23:52 1705193 333
Мне кажется все треды вообще стоит с борды убрать. Достаточно ссылок в поисковиках. Если человек не способен почитать и разобраться сам - он даун.
Аноним 16/09/26 Срд 01:23:54 1705194 334
image.png 1Кб, 50x43
50x43
>>1705192
Вот тебе хвост гладил. Прошу вон из треда.
Аноним 16/09/26 Срд 01:27:29 1705196 335
>>1705192
Сейчас начнутся кукареки про гейткипинг. По факту же сейчас порог обвалился до минимума.
Тупой или новичок? Плати перфом.
Стремящийся? Есть дока и агенты которые не просто насрут чего-то, но и проверят логику по коду движка.
Закрытого кода в движках и фронтах практически нет.
Кроме получения субъективных мнений тред больше ни для чего не нужен т.к. с объективными моментами агенты справятся лучше

Пруф ми вронг
Аноним 16/09/26 Срд 01:28:06 1705198 336
>>1705193
Мне кажется- анон даун.
Аноним 16/09/26 Срд 01:31:43 1705200 337
8.jpg 67Кб, 1000x624
1000x624
9.jpg 77Кб, 1072x339
1072x339
>>1705183
Вроде получилось. Дальше надо разбираться с промтами и прочим? Писать надо на англюсике или можно на русском? Настройки в таверне никакие больше полезные не надо сделать?
Аноним 16/09/26 Срд 01:33:12 1705201 338
Вдогонку заметил что видюха не нагружается, так и должны быть? Только оперативка кушается.
Аноним 16/09/26 Срд 01:39:50 1705205 339
>>1705200
>начинайте-начинайте-начинайте
оо у тебя эта хуйня с таверной, два треда назад писали про фикс. сравни с тем что в 127.0.0.1:8080 там такого говна не будет
Аноним 16/09/26 Срд 01:44:47 1705206 340
>>1705193
>>1705198
Мне кажется надо вообще интернет убрать.
Достаточно библиотек.
Если человек не способен почитать и найти что ему нужно еще почитать и найти - то он-- ну ты понял
Аноним 16/09/26 Срд 01:49:41 1705209 341
>>1705200
>>1705205

короче суть фикса:
вернись на кнопку электровилки и API поменяй на Chat Completion,
chat completion source - custom (openai-compatible)
custom endpoint:
http://127.0.0.1:8080/v1
и внизу нажми connect

это должно помочь
Аноним 16/09/26 Срд 01:52:56 1705210 342
>>1705201
не нагружается в плане памяти или % загрузки?
в лламе какую скорость в токенах показывает?
если скорость низкая (типа 5-10 т/с) и память видеокарты не загружена (типа 0.5-1Гб из 12) то у тебя девайс кпу получается а не куда. почему - надо смотреть что ты скачал и на какой именно конфиг, драйвер
Аноним 16/09/26 Срд 01:58:04 1705213 343
>>1705185
Ну ты кроме оскорблений как бы и не заслуживаешь ничего, это не значит, что у меня "горит". Я отписываюсь чтобы показать мимокрокам кто ты есть, а заодно чтобы реально кому-то помочь. А вот ты кроме "все дауны не смогли в гайд дауны" нихуя не можешь, на этом твоя "помощь" заканчивается. Пришел чел, задал вопросы, ты проигнорировал, насрал, обосрал. Потому что твой гайд и шапку "драгоценные" не оценили, видите ли. Ты бы лучше сделал выводы, долбоёб. Ладно, я попытаюсь перекатить с нормальной шапкой, мб в этот раз не успею так в следующий. Готовься плакаться модерам.
Аноним 16/09/26 Срд 01:58:18 1705214 344
10.jpg 30Кб, 748x268
748x268
11.jpg 267Кб, 1441x464
1441x464
>>1705205
>127.0.0.1:8080
Тут прям обычный чат, но что-то поделать удалось.

>>1705209
Супер сработало, благодарю! Прям писать начало словами появляющимися. У меня была карточка еще загружена, вот заработало.

>>1705210
Загрузка видеокарты что-то около 1-5%, попамяти вроде 12гб занято если не ошибаюсь, не заметил.
Аноним 16/09/26 Срд 02:00:23 1705216 345
Один вопрос, если играть надо не с одиночной карточкой персонажа, а миром, это реализовывается через карточку с описанием мира или как-то по другому?
Аноним 16/09/26 Срд 02:08:49 1705218 346
>>1705214
Скорость не ахти, конечно, ну, такая у тебя видеокарта, можно ещё поковырять настроечки и чуть-чуть добиться ускорения. Можешь сравнить c q2_k_xl, скорость заметно повыше должна быть, просто модель глупее будет по ощущению.

>>1705216
"Мир" описывается в лорбуке (lorebooks), их тоже можно качать. И нужен персонаж dungeon-master / gamemaster типа.
Аноним 16/09/26 Срд 02:12:46 1705221 347
>>1705216
Карточка это размеченный фрагмент (или даже целиком систем промпт как в Фонарщице) систем-промпта + инжекты. В последнее сообщение пользователя, первое сообщение LLM, в контекст. Что там написано то и будет "играть" LLM
Аноним 16/09/26 Срд 02:17:27 1705223 348
>>1705218
>Скорость не ахти
Секунд 5 на один ответ, это разве много? Я читаю и то медленнее чем оно генерит.

>просто модель глупее будет по ощущению.
Не не, мне лучше медленнее но чтобы по умнее. Не западло и секунд 30 ждать.

Все понял, начну щас читать о промптах и таверне какие нибудь гайды. Еще раз спасибо за помощь, даже хз как сам бы разобрался среди миллиона инфы. Учитывая что модель пол часа качается, с этими гитами, батником.
Аноним 16/09/26 Срд 02:27:06 1705225 349
image.png 9Кб, 1441x94
1441x94
>>1705223
>Не западло и секунд 30 ждать.
Думмайте.
Аноним 16/09/26 Срд 02:39:20 1705231 350
>>1705223
>Секунд 5 на один ответ
Вот оно как бывает. Как-то я не так вкатился со скоростью слово в секунду. Возможно, модель сидония... Но скорее кривые руки и кривые настройки.
Аноним 16/09/26 Срд 03:00:14 1705238 351
>>1705225
ризонинг вырубай нахуй (в аргументах лламы, не в самой маринаре - там его надежно не выключишь), уж в маринаре он точно лишний с его-то агентской МОЩЩЬЮ
Аноним 16/09/26 Срд 03:00:47 1705240 352
Короче, заебался читать очередной срач и вкуривать что происходит поэтому переписал шапку. Взял за основу обновленную >>1704948 и постарался более понятно описать бекенды и фронты чтобы вопросов "что взять" было меньше. Постарался кратко, но особо кратко не получилось, баланс штука сложная. Постарался непредвзято и со ссылкой усредненное по палате мнение, но получилось или нет тоже смотрите сами. Предложения что поменять принимаются.

Посмотреть новую шапочку: https://rentry.org/a9canhvr
Аноним 16/09/26 Срд 03:18:40 1705243 353
Аноним 16/09/26 Срд 03:20:13 1705244 354
>>1705238
> там его надежно не выключишь
Custom Parameters:
{"chat_template_kwargs": {"thinking": false}}
thinking заменить на соответствующий модели параметр из ее чат темплейта.
>>1705240
Может стоит просто выделить беки/фроны и дать ссылкой после олламы типа "подробнее про софт: "? Чтиво полезное, но в шапку чересчур жирное. В отдельном рентрае можно не стремиться сделать компактно, а спокойно разгуляться.
> начинала как вилка оригинальной таверны
В маринару раз, или таверной в глаз? Хотя звучит забавно, и так норм.
> Не лучший выбор для новичка, но мнения в треде расходятся.
Запуск из командной строки может быть непривычен для новичков.
Аноним 16/09/26 Срд 03:24:05 1705245 355
>>1705243
>Они чем-то отличаются?
а вот после таких вопросов аноны тут друг друга порвут в лоскуты отвечая
31B сильно медленнее 25-4 и требуют больше памяти, но потенциально (зависит от того какое именно) заметно лучше
MeroMero многие хвалили. Но тут уже дальше вкусовщина или мерение бенчами идёт
Аноним 16/09/26 Срд 03:27:14 1705247 356
9886.jpg 44Кб, 677x600
677x600
9887.jpg 153Кб, 1907x802
1907x802
>>1705245
Краем глаза заметил тут про думанье говорили, это куда-то надо вставлять в таверне или где?
Аноним 16/09/26 Срд 03:28:28 1705248 357
>>1705238
Не хочу нюхать запахи озона и мускуса.
Аноним 16/09/26 Срд 03:31:48 1705249 358
>>1705244
>Чтиво полезное, но в шапку чересчур жирное.
Да вроде не особо жирное, не сильно больше текущей шапки. Но ОП проснется, посмотрим че скажет. Пахан как никак.
>Хотя звучит забавно, и так норм.
Ну типа вилка-форк молодежно йоу
>Запуск из командной строки может быть непривычен для новичков.
По этому и указал что мнения расходятся. Хотя по факту лама это самое удобное и оптимальное решение.
Аноним 16/09/26 Срд 03:33:58 1705250 359
>>1705249
Говно твоя шапка. И оповская тоже. Они обе слишком большие. Нужна ссылка на гайд, на матчасть, на сайт с карточками, и на прошлый тред.
Аноним 16/09/26 Срд 03:40:44 1705253 360
574183259-0abb4[...].png 202Кб, 1182x835
1182x835
>>1705240
> Ollama - вещь можно сказать бесполезная. Н
Согласен. Нахуя тогда вспоминать?

Не, хуйня. То же говно по сути и осталось. Для кого это? Подумой. Пиши по новой. Вот представь новичок зайдёт в тред и увидит эту твою шапку. Что ему делать? Ты вывалил кучу ссылок, кучу инструментов. Гайд ещё этот ебанутый где куча воды про яйца и куча вредных советов в которых запутаться можно как нехуй. И потом этот абсолютно УЕБАНСКИЙ список моделей где даже на ггуфы ссылок нет. И про гемму там бред полный.

КАЖДЫЙ несчастный новичок пробравшись через тонну говна в этой шапке и этом гайде попытавшись запустить гемму4-26 а может и не только гемму и подвязать к ней силли таверну получит жидкий обсёр потому что пикрил должен быть в шапке с пояснениями.
ПОЯСНЯЮ: силли таверна НЕ работает с геммой (и не только с геммой, кстати) по умолчанию: >>1705200
То есть она как бы будет работать но крайне коряво просто на гемме это очень хорошо проявляется (повторами) а на других моделях может быть просто снижение IQ как бы. Только ебучий мисраль там хорошо работает лол.

Вот какая польза от твоей шапки если каждому прибывшему всё равно придется помогать сделать то, чего в шапке и гайде нет?
Что плохого в том чтобы начать с FAQ? Ответь на вопросы: какое нужно железо для минимального экспириенса. Какие топ модели для РП сейчас (не волнуйся между тредами новая модель не появится, ты оставляешь ссылку якобы потому что её можно быстро обновить но по факту она не обновлялась несколько месяцев).
Добавь БЫСТРЫЙ СТАРТ: вот ссылка на релизы лламы, вот ссылка на конкретный ггуфчик (4й квант геммы-26 подойдёт всем), вот строчка запуска с нужными ключиками. Почему так не сделать? Потому что у кого-то 64 гигабайта омг? Ну и хули, для старта попробовать гемму чтобы хотя бы было с чем сравнить - нормально.

Крч у тебя что-то не то с башкой или ты просто не способен мыслить как новичок или просто не способен мыслить.
Аноним 16/09/26 Срд 03:43:50 1705254 361
>>1705243
Это универсальная команда для любой модели сработает. Можешь заменить имя модели на %1 и тогда перетаскиванием файла модели на батник сможешь запускать сервер

31B - плотная модель, если вся не влезет в видеопамять (с запасом) то будет чересчур медленно. 26B не сильно глупее в сравнении.
МероМеро - крайне поверхностный тюн, почти ничего не меняет. Оверрейтед.
Аноним 16/09/26 Срд 03:49:08 1705255 362
>>1705247
Да, первый пик это надо описать руками в таверне кнопочка большая буква А, в систем промпт так и допиши в конец:
Roleplay Format
Actions - In plaintext
Dialogue - "In quotes"
Thoughts - In asterisks
Ну и в таком стиле и рпшь. Якобы так тренировался этот тюн.
Аноним 16/09/26 Срд 03:56:16 1705257 363
>>1705253
>Согласен. Нахуя тогда вспоминать?
Для совсем хлебных изделий. Оно работает? Оно работает. Ставится в пару кликов? Ставится в пару кликов.
>Вот представь новичок зайдёт в тред и увидит эту твою шапку. Что ему делать?
Чекнуть гайд, чекнуть инструменты, понять что ему нужно. Краткое описание тут лучший вариант. Универсальный гайд ты не напишешь как ни вертись.
>Гайд ещё этот ебанутый
Это не мой гайд, я не имею к нему отношения. Но там достаточно полезной инфы.
>ПОЯСНЯЮ: силли таверна НЕ работает с геммой
Ну разжуй, что там не работает? Я знаю что там кривой темплейт который идет из коробки. Его нехуй делать поправить сверившись с официальным.
>на гемме это очень хорошо проявляется (повторами)
Репетишн пенальти. Если ты говоришь про лупы - сломан шаблон. Поправь шаблон.
>на других моделях может быть просто снижение IQ
Вот это уже интересно. Впервые вижу чтобы фронетнд снижал IQ модели, а не юзера.
>вот строчка запуска с нужными ключиками
Круто. Как ты узнаешь какие ключики нужные? Как ты узнаешь сколько врамов и рамов у вкатуна?
>Ну и хули, для старта попробовать гемму чтобы хотя бы было с чем сравнить - нормально.
В гайде предлагается попробовать гемму.

В общем ты предлагаешь вместо объяснения просто дать готовый рецепт, услышал. Знаешь к чему это приведет? Тред заполонят вопросы по типу "сделал всё как в шапке нихуя не работает". Когда я вкатывался три года назад шапка была именно такой. Там был "гайд для ретардов" где было три пункта: скачай, запусти, трахай девочек. Стало ли мне легче? Запустилось ли всё сразу? Мне продолжать или до тебя итак доперло?
Аноним 16/09/26 Срд 04:05:18 1705258 364
YIFvP6QalqOYtlp[...].webp 62Кб, 1600x820
1600x820
>>1705257
>вместо объяснения просто дать готовый рецепт
>скачай, запусти, трахай девочек
this

новичек
Аноним 16/09/26 Срд 04:38:27 1705266 365
>>1705257
>Универсальный гайд ты не напишешь как ни вертись.
Напишу как нехуй. Ссылки на лламу, ссылка на модель, батник, всё. Никакой установки, только распаковка. Тащишь модель на батник, открываешь браузер, общаешься.

>Его нехуй делать поправить сверившись с официальным.
Вот поэтому я и говорю, что ты не можешь мыслить как новичок. Тебе нельзя писать шапки и гайды.

>Репетишн пенальти. Если ты говоришь про лупы - сломан шаблон. Поправь шабл
Ты скрин посмотри. Там надо на чат комплишен переключить но новичок это не сможет додуматься. Ему нужна будет инструкция как вот здесь:
>>1705209

>Как ты узнаешь какие ключики нужные? Как ты узнаешь сколько врамов и рамов у вкатуна?
Гемма-26, чел. Похуй сколько врам. Оперативки не хватит - качнёт квант помельче.


>В гайде предлагается попробовать гемму.
Ага. Восьмой квант лол. Ещё и дана команда выгрузить моэ на CPU. Если по гайду "попробовать гемму", то будет скорость 10 т/с в лучшем случае. На 16 гб видеокарте блядь. А потом он ещё в СиллиТаверну ткнётся а там вот тот пиздец с найдётся-найдётся-найдётся-найдётся-0000000000-0000000.


>"сделал всё как в шапке нихуя не работает"
Друг, у них сейчас ТЕМ БОЛЕЕ не работает. С моим вариантом хотя бы шанс появляется. Ты сам только что в треде мог наблюдать приход новичка и как ему всё удалось по моей версии гайда.
Аноним 16/09/26 Срд 04:44:25 1705268 366
Не подскажете как отключить в конце фразу: What will Char do? и варианты ответов. Не вдупляю для чего это пишется если и так свобода действия.
Аноним 16/09/26 Срд 04:48:49 1705270 367
>>1705268
Больше деталей надо, где ты это видишь, какой софт, модель, темплейт, персонаж.
Аноним 16/09/26 Срд 04:53:32 1705271 368
>>1705270
Таверна, gemma-4, тут не понял, но это пишет данжен мастер.

У него стоит вот это
{{char}} is a narrator, {{char}} will not assume any {{user}} action or speech. {{char}} will only respond with a narrator or NPC character.
{{char}} will not speak for {{user}}, and they will not do actions or force actions that the {{user}} hasn't done. {{Char}} will only respond to what {{user}} says and will never assume what {{user}}'s next actions may be.
{{char}} will use "quotes" to talk as other characters and use to narrate and explain what {{user}} or other characters did, but will not add or take away from any speech that {{user}} has previously said.
{{char}} will not force the {{user}} to do things and first wait for the {{user}} if the {{user}} is out of ideas and ask {{char}} will provide options
{{char}} will Roleplay as any characters that gets in {{user}} adventure
As {{user}} advances in the scenario, {{char}} will describe the landscape and scenery, along with any new NPCs that {{user}} encounters.
Аноним 16/09/26 Срд 04:53:50 1705272 369
>>1705266
Даже отвечать не буду, уже хуйню какую-то откровенную пишешь. Сходи пропись.
Аноним 16/09/26 Срд 05:23:03 1705281 370
>>1705271
Исходя из такого промпта это абсолютно нормально, что у тебя в конце будут спрашивать что делать, потому что здесь непрозрачный намёк что именно юзер решает что делать и это двигает плот. Но если это одна и та же фраза и это напрягает, такое можно решить более детальным прописыванием персонажа (в данном случае данжен мастера), добавить несколько примеров, чтобы было разнообразие ну и просто конкретно напрямую в промпте попросить "разнообразия последней фразы".
Аноним 16/09/26 Срд 05:24:33 1705282 371
>>1705281
Ну а если там ВАРИАНТЫ ответов и это так случайно вышло один раз и ты согласился на такой формат то есть ответил, то дальше моделька будет впадать в самоповторение и продолжать игру именно в таком формате. Это прикол всех ллмок. Решение - на раннем этапе редактируешь или свайпаешь, то есть добиваешься, чтобы такого даже не оставалось в истории.
Аноним 16/09/26 Срд 05:33:22 1705286 372
>>1705281
Понятно надо дальше изучать промпты и настройки. Про удаление и изменение текста ллмок уже понял. Щас скачал другую, она внезапно стала говорить на русском да еще и понимать мою бедную орфографию, чуть не обосрался от такой внезапности.
Так понял в /ai/ идет разбор именно бэкэнда и всего связанного с моделями? А для той же таверны, промтов и прочего другой тред?

>юзер решает что делать и это двигает плот
Да вот не сказал бы, прям так детально сцена щас идет, я конечно там отвечаю, но больше кажется что ведут именно меня за ручку, а не я иишку.
Аноним 16/09/26 Срд 05:41:28 1705288 373
Вообще скажу вам что я в ахуе. Читал за эти игрища с иишкой и помню какойто скрин кривого порно и кринж блять, а тут такое пишется, и это с моими нулевыми промтами и настройками, это пиздец охуено.
Аноним 16/09/26 Срд 06:54:07 1705299 374
>>1705286
Есть ещё "тред чат-ботов общий" но там в основном какие-то долбики подключают таверну к копроративным облачным ИИ, какие-то там ключики доступа обдрачивают, деньги плотют, баны за кум ловят. Наш ИТТ тред именно про локалки, но и про использование таверны с локалками тоже.
Аноним 16/09/26 Срд 07:38:12 1705307 375
>>1705223
>30 сек

Дядь, корпоративные модели по 5 минут запросто думают на фулл спиде, а тут локалка. Для любой хотя бы относительно серьезной задачи тебе нужна очень высокая скорость.
Аноним 16/09/26 Срд 07:43:13 1705309 376
>>1704058
>Ну типа они и раньше норм работали если речь об общей скорости и tg-heavy задачах.
Можешь показать пример параметров запуска для гвена 3.5 или геммы 4 на 10-30B любого, где я смогу это увидеть, и чтобы фактическое время генерации было хотя бы всего в три раза больше чем в vllm?

Я сколько не тестил (пробовал несколько раз прям день на это убить).
1. У меня получается что в двух потоках скорость (суммарная) такая же или ниже, чем в одном. И с kv-unified, и без него. То есть один поток условных 100 токенов и снижается до 90, 4 потока - по 20 и снижается до 10.
2. Так же появляется видимая заметная латенси, оно там что-то делает с чекпоинтами, и перед началом генерации есть задержка в 1-2 секунды - итого даже в один поток лама выдаёт 100, vllm выдаёт, например 70 - но фактические если там цепочка из 10 запросов вида "промт на 10 слов, ответ 200 слов", то в ламе числа якобы выше - и когда оно генерирует-стрими токены - так и есть, но между отправкой запроса и началом ответа в vllm 300 мс, а тут 2-3 секунды проходит, хотя это полностью на карте лежит и там ничего никуда перемещать не надо.
3. Так же есть фатальная критическая проблема в ламе, что когда у меня 4 потока по 50-100к токенов (кеш на 900к выделен), то в какой-то момент оно выдаёт в лог кучу текста и начинает полностью все 50-100к прогонять через pp. Я явно указываю id_slot=x для каждого запроса, так что путаться оно не должно (да и даже если не указываю, там разные запросы, оно без проблем бы отличило). На этой стадии когда мне нужно по 100 токенов в каждом из 4 потоков сгенерировать - оно делает это не за 4 секунды, а за 4 минуты, так как минута уходит на этот pp 100к-токенов, и начиная с этого "какого-то момента" оно это будет делать при каждом запросе. То есть kv-кеш просто перестаёт работать, оно тупо заново считает на каждом запросе. Это и на мое-гемме, и на qwen3.5-4b.
4. Так же я бы очень хотел kv-unified (с которым лама ещё хуже работает при параллельных запросах), так в теории как у меня один слот на 50-200к, и десять других на 5-10к. Выделить на каждый по 200к я не смогу, хотя суммарно мне нужно всего 300к, просто из них будет 2/3 на первый слот.

Итого в лламе добавляется по 2-3 секунды даже если там короткие супер-простые запросы на десять слов + при генерации в 10 потоков она выдаёт те же суммарные tg 100/s вместо 600/s из vllm + в какой-то момент возникает проблема #3 и моя самописная rag-агентная система встаёт полностью, так как 100/s tg превращаются в 1/s tg из-за пересчитывания всего промта.

>параллельные pp плохо скейлятся
Им и не положено, если конечно там не 10 промтов по 10 токенов, так что они в один батч влезают. Ну то есть для всех pp существенного размера.
Аноним 16/09/26 Срд 08:02:29 1705314 377
>>1705288
Ты еще только начал, анон. Сколько тебя ждет открытий чудных.
Аноним 16/09/26 Срд 08:24:03 1705319 378
>>1705288
Добро пожаловать в наш уютный тред! Я первую неделю натурально мозоли натирал. Да и сейчас порой.
Аноним 16/09/26 Срд 08:29:10 1705320 379
>>1705166
>Что не так с кобольдом ?
У шизика тряска что вкатуны могут просто скачать екзешник кобольда и сразу стартануть модельку с РП карточкой не отвлекаясь на лишние телодвижения, вместо того чтобы со старта пердолиться с голой ламой и отдельными фронтами (что всегда успеешь если вкатишься).
Аноним 16/09/26 Срд 09:11:22 1705332 380
image.png 166Кб, 689x973
689x973
>>1705109
>5060 ti 16gb
>Qwen 3.8 27B 4Q_K_M
Тут сама модель только весит 16гб, она занимает всю память, на KV кеш (контекст) не остается ничего, и он наверное лм студией автоматом совсем маленький выставляется. Тут поможет наверное только меньший квант Q3_K_M например, и квантование кеша в Q4, контекста ставишь сколько уже влезет в VRAM.
GPU offload полностью вправо, так быстрее работает. MTP не включай, если в память все не влезет, то будет больше тормозить чем давать ускорения.
Аноним 16/09/26 Срд 09:20:45 1705333 381
Скачал Marinara Engine. красиво вкусно агентики выглядят прикольно.
Пара вопросов: что за нахуй?
Как начать новый чат с карточкой? Типа где кнопка лол?
Почему микромоделька 12б упала в производительности в 10 раз? Где токены/сек??? В таверне генерит за секунду тут лютейший жесточайший проперд.
Может она там 100 агентов каких-то проходит? Где это посмотреть?
Аноним 16/09/26 Срд 09:36:18 1705336 382
Какие сейчас файтюны моделей 25-35b лучше всего подходят под erp на русском языке?
Аноним 16/09/26 Срд 09:37:48 1705337 383
Челы, может кто-нибудь объяснить почему при генерации параллельных запросов суммарная скорость генерации токенов становится в разы больше (и соответственно корпы меряются писюнами именно этой суммой), чем когда идут последовательные запросы, хотя вроде и там и там используются все доступные ресурсы?
Аноним 16/09/26 Срд 09:40:46 1705338 384
>>1705109
Других вариантов кроме 27b у тебя особо и нет.
Но >>1705332 все правильно говорит, Q4_K_M у тебя не влезет, так что бери https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF IQ3_S или IQ3_XXS, контекст в Q8
Будет потупее чутка, но хотя бы юзабельно на 16Гб
Аноним 16/09/26 Срд 10:01:50 1705347 385
Погонял мьюз глиммер 30б, 4-й квант несколько дней. И ориг и чей-то аблит.

Русик - неплохо, кое-какие ошибки есть (они и в гемме проскакивают если уж на то пошло), вот только как-то не слишком живо всё и попадаются англицизмы. Очень отдалённо напоминает квен (но не поймите неправильно, русский здесь всё же на голову выше чем квен).

Ещё из мелочей: часто женский персонаж начинает упрямо буквально через раз писать о себе в мужском роде. Лечится напоминалкой. Ещё пример ошибок, цитирую: хочешь продолжу список ещё более дикие варианты? вот тебе словарь на букве Х. Короче, мелочи.

Логика - в целом хорошо, иногда бывает затупит и думаешь, что за хуйня, как можно было так затупить, переключаешь на гемму (тоже 4-й квант для честного сравнения), свайпаешь, свайпаешь, свайпаешь - всё заебись и заодно понимаешь насколько гемма живее пишет.

Ризонинг - бесполезный. С отключением ризонинга хуже не стало. Чтобы отключить его, пришлось попотеть (судя по гитхабу они намеренно игнорируют --reasoning off).

Так-то впечатляет, но Гемма 4 26б пишет чуточку лучше. Конечно, я не тестировал его на инглише, может на инглише он и "зверь".

Ах да, вижн потестировал, вижн очень хороший, получше чем у геммы.

Вердикт: оставлять, продолжать ковырять. Да, это не гемма, но это потрясающая модель в целом. Возможно с нужным промптом запишет хорошо. Но Гемму с трона не сместит, хотя бы потому, что это плотная модель и не у всех поместится.
Аноним 16/09/26 Срд 10:07:34 1705349 386
>>1705333
чтобы начать новый чат, слева, под словом конво большая кнопка +, нажми её, выбери персону, персонажа, пресет

Твоя "микромоделька" точно осталась в видеопамяти? На сколько слотов она загружена кстати? в логах ламы в терминале id меняются или один и тот же?
токены в секунду смотри опять же в логах ламы. или ты как вообще запускаешь модель-то?

посмотреть запросы и ответы агентов и прочее можно в сосноли. включи дебаг в продвинутых настройках.

нету там 100 агентов по умолчанию там собирается вообще один запрос каждый раз.

важно: ты отключил ризонинг на стороне лламы или нет? на стороне самой маринары пытаться отключать бесполезно, он всё равно будет проскакивать и это сильно съедает время.
Аноним 16/09/26 Срд 10:08:03 1705350 387
Чувствует ли нейросеть когда к ней проявляют едва заметное презрение?
Аноним 16/09/26 Срд 10:11:08 1705351 388
Почему назвали Muse Glimmer а не llama 5?
Аноним 16/09/26 Срд 10:12:57 1705352 389
>>1705349
п.с. слоты в логах ламы должны меняться если добавишь сам агента в чат или рп. если не меняются - плохо, проверь аргументы и мб выставь вручную -np 4 например
Аноним 16/09/26 Срд 10:20:04 1705355 390
>>1705347
Кстати, тестировал на сырой лламе и там всё было гуд. А вот в СиллиТаверне и Маринаре почему-то полный отсосямба. Тупит жутко. Хз в чем прикол, какой-то особый конфиг нужен может конкретно для этой модели.
Аноним 16/09/26 Срд 10:28:02 1705357 391
>>1705355
chat completion или text completion? Первое использует родной chat template, второе - из настроек фронтэнда (там может стоять дефолтный, неподходящий темплейт)

ну и настройки семплера еще - температура и всякие такое во фронтэндах передаются модели свои, отличающиеся
Аноним 16/09/26 Срд 10:30:30 1705358 392
Я рот их ебал с этими изменениями, как ммап выключить?
В -lm можно только включить его, none не предотвращает загрузку в рам. Какого хуя
Аноним 16/09/26 Срд 10:35:02 1705359 393
image.png 5Кб, 826x68
826x68
image.png 9Кб, 461x151
461x151
>>1705358
нрмальные люди кнопку нажимают и ничего не надо пердолить
сам себя в рот выебал через командную строку
Аноним 16/09/26 Срд 10:38:51 1705360 394
>>1705358
скачай билд постарее
Аноним 16/09/26 Срд 10:40:01 1705362 395
>>1705347
> Гемма 4 26б пишет чуточку лучше
Гемма 4 26б лучше чем Гемма 4 31б? Поясните нафане.
Аноним 16/09/26 Срд 10:41:14 1705364 396
>>1705359
Ниосилятор спок там

>>1705360
Ну так не интересно
Аноним 16/09/26 Срд 10:41:43 1705365 397
>>1705362
Капельку лучше. Реально капелюшечку. Но 31б требует больше памяти. Оно того не стоит.
Аноним 16/09/26 Срд 10:48:42 1705370 398
>>1705364
>терпит, плачечт, жалуется
>ряяя ты ниасилил
Ну мне-то струю в лицо осиливать не нужно, у меня все работает как надо.
Аноним 16/09/26 Срд 10:50:42 1705372 399
>>1705370
Пукнул гринтекстом - проиграл
Аноним 16/09/26 Срд 10:51:58 1705374 400
>>1705349
>>1705352
Ща разбираюсь. На счет модели в памяти давай так. При одинаково запущенной лламе (я даже не зкрывал ее лол), таверна гонит х токенов/сек, Марина х/10 токенов. Что-то не так.
Запущена по идее на нескорлько слотов. Не понимаю как это понять.
Ризонинг ща вырублю насильно у лаамы спасибо.
Аноним 16/09/26 Срд 10:53:26 1705375 401
>>1705372
Может я и пукнул, но зато у меня все работает,
Аноним 16/09/26 Срд 11:16:58 1705381 402
>>1705358
>none не предотвращает загрузку в рам
А тебе что надо?
Аноним 16/09/26 Срд 11:24:28 1705384 403
>>1705374
Звучит как залупа. У тебя токены высирает ллама цпп или чем ты там пользуешься, а не таверна или маронарий.
Аноним 16/09/26 Срд 11:38:03 1705387 404
>>1705384
Как блядь таверна и голая морда лламы выдают х10 токенов блядь? Магия? Короче удалил агентов, вроде ускорилось, если их просто отключить не помогало лол.
Тепреь еще вопрос - где в Маришке кнопка продолжить? Типа переписал я сообщение бота, в таверне жмешь континью и он дальше шпарит. А тут?
Аноним 16/09/26 Срд 11:42:35 1705391 405
>>1705387
У тебя буквально в поле ввода текста подсказка написана - /
Аноним 16/09/26 Срд 11:43:40 1705392 406
>>1705387
/continue

разница может быть в размере контекста, голая морда лламы - голый контекст в маринаре ты мог загрузить лорбук, персонажа там хуё моё плюс маринара дохуя всего собирает в контекст сразу К КАЖДОМУ запросу а не куда-то в начало
Аноним 16/09/26 Срд 11:53:44 1705395 407
image 503Кб, 1080x1424
1080x1424
Ну вот собсна что бывает, когда пишешь гайды или, что ещё хуже, начинаешь отвечать на тупые вопросы (ападскажити как запустить, апачиму у меня на моэ гемме скорость 0,1тс и тд). Ну то есть в моменте подсказки и кормление с ложечки помогут, но ровно до первой же новой проблемы. Человек не знает и не понимает что происходит под капотом, для него это какая-то магия. Буквально как блондинка за рулём, которая в душе не ебёт как устроен автомобиль и знает только "вот на эту педальку машинка едет а на эту останавливается" и при любой внештатной ситуации впадает в панику, не зная что делать. И разбираться не хочет. Потому что всегда найдется куколд который поможет и ближайшие пару дней всё будет хорошо.

Именно поэтому я против ЛЮБОЙ помощи новичкам кроме совета "читай документацию". Локалки требуют технических знаний, умения работать с информацией и постоянного саморазвития. Если этого нет — будет вечное нытьё "апамагите я нипанимаю(((", по кругу, раз за разом, как в дне сурка. Те кто тут давно, наверняка заметили как деградировал тред за последний год-два и какую шизу несут хлебушки на серьёзных щщах. Гейткип по железу уже есть — это хорошо. Ещё лучше, если если будет такой же гейткип, но по советам и подсказкам. Хочешь в локальные ЛЛМ — разбирайся ёпта, штудируй инфу. Не хочешь = пошел нахуй в чатгпт/гемини прям с браузера. Там думать не надо, тыкнул кнопку и общаешься.
Аноним 16/09/26 Срд 12:00:45 1705397 408
>>1705395
Как будто тебя кто-то заставляет отвечать.
Аноним 16/09/26 Срд 12:06:06 1705398 409
>>1705392
>>1705391
>/continue
Пробовал да. Хз почему-то ломается, пишет уже другим сообщением. Попоробую с другой моделью.

>разница может быть в размере контекста
Аргумент, там ебать накрученно рромта, я ебал для шейхов вообще или риговчиков.

Пока Марина лучше ин табернус квантус сунус только всторенными прикольными промтами.
База локалок - префил в ней как то неудобно сделанн
Аноним 16/09/26 Срд 12:06:39 1705399 410
>>1705397
Ты не понимаешь ему НУЖНЫ юшки.
Аноним 16/09/26 Срд 12:38:07 1705412 411
>>1705395
>Не хочешь = пошел нахуй в чатгпт/гемини прям с браузера.
Установил олламу или лмстудио, и говоришь, что это единственный расо-верный способ гонять ллмки.
Аноним 16/09/26 Срд 13:12:11 1705424 412
MyDressUpDarlin[...].webp 21Кб, 512x304
512x304
Восемь часов не переставая гунил на свои фантазии которые копились всю жизнь еще миллиард не отыграно. Понял какие есть затупы у нейронки и что главное как их обходить и сглаживать.
Это литерали лучшее что случалось со мной за последние годы.

Хотел бы сказать спасибо всем тем кто помогал разобраться, а особенно инфе из этих постов >>1704991 >>1705183 >>1705209
Ночью, успешно донести такому тугодуму как мне что и как делать, заслуживает уважения. Главное удовольствие в том, что получилось вкусить плод своих трудов не через неделю, а прямо сразу.
Аноним 16/09/26 Срд 13:13:55 1705427 413
>>1705395
Да как ты заеб со своим гейткипом. Очко себе загейткипь. Локалки должны быть доступны всем и каждому, даже тем кто тебе не по нраву. Даже тупым. Даже женщинам. Хотя не, тут я перегнул палку. Выше спрос = выше и разнообразней предложение.

Только в одном ты прав - документация это база. По кобольду и лламе всё хорошо расписано на их вики, по другим хз. Там и как запустить есть, и за что какая кнопочка\команда отвечает. Даже англюсик не надо знать, в эпоху совершенных переводчиков - то. Читай и экспериментируй, от неправильной команды в лламе комп не ебанёт наверное.

И вообще хуле вы тут весь тред срётесь, давайте лучше хвостики гладить и пытаться выжимать тот самый РП из современного агентского кодоговна. Экстеншены всякие на таверну делать\тестить, промпты под конкретные модели писать, я хз. Или в тредике только вахтёры, поехавшие, и поехавшие вахтёры остались?
Аноним 16/09/26 Срд 13:30:57 1705435 414
>>1705427
>Да как ты заеб со своим гейткипом.
Не обращай внимания, это местный дегенерат, который хочет чувствовать себя илиткой. При этом дегенерат не помнит как тут срал тупыми вопросами, прося анонов помочь.
Аноним 16/09/26 Срд 13:56:48 1705449 415
>>1705249
> Да вроде не особо жирное, не сильно больше текущей шапки
Больше, и текущая шапка уже большая. Хорошо выглядит когда есть поинт-ссылка, а после их перечня линк на в меру подробное описание. А стена текста - в шапке выглядит так себе, хотя сама по себе она полезна.
> По этому и указал
Стоит сразу написать чего бояться, для одних новичков cli - вообще не проблема, а у других вызывает ужас. К тому же это объективный факт, пусть каждый трактует по своим предпочтениям. А то прочтет что "плохой выбор для новичков" и обойдет стороной, хотя нашел бы удобным.
Аноним 16/09/26 Срд 13:57:26 1705450 416
Аноним 16/09/26 Срд 14:01:00 1705453 417
Аноним 16/09/26 Срд 14:17:52 1705466 418
>>1705450
> новая моешка
> очередной файнтюн квена
Мдэмс...
Аноним 16/09/26 Срд 14:33:23 1705472 419
>>1705309
У тебя тут прямо задача, а там подумал что просто хочешь по несколько ответов или простые штуки делать.
> Можешь показать пример параметров запуска для гвена 3.5 или геммы 4 на 10-30B любого, где я смогу это увидеть
Дефолтные параметры. Давай разберем по частям:
1. Вот это вообще не норма, должно быть 1х100, 2х90=180, 4х60=240 и типа такого. С kv-unified я вообще хз как это должно работать кроме варианта генерации по одному промпту, и там ты будешь ловить замедление генерации от объема использованного контекста даже если этот контекст занят другими сессиями. Возможно наблюдаемый эффект завязан именно на это, что за железо?
2. Латенси обязательно будет - пп встраивается в очередь и между генерацией двух токенов в одном запросе будет пауза пока считается батч (или его часть) для другого. Это неизбежно, в vllm может быть меньше заметно просто потому что батчи небольшие и шустро их щелкает, на том же опенроутере где часто хотят без разделения пп-тг по разным машинам такое можно наблюдать в виде резких провалов и восстановления скорости.
Почему в лламе такая большая задержка в начале - хз, раз не используешь сгрузку дополнительного кэша в рам ее быть не должно. Точнее нет объективных причин для такого, а проблема из-за общей кривости или каких-то багов.
В поточной обработке лаги не мешают, там даже стриминг можно отключить, но действительно может приводить к замедлению.
3. Ллама непригодна для сервинга, а это уже почти он. Если модель со скользящим окном, линейным атеншном, хитрым разреженным атеншном - возможно проблема в чекпоинтах. Или все тот же баг, который заставляет терять кэш в обычных ситуациях. То есть тут проблема не в самих слотах, особенно раз указываешь это, а в самом факте потери.
4. Наверно имел ввиду пэйджед атеншн, который позволяет как раз выполнять такие трюки? Для такого слишком много переделывать надо.
> Им и не положено
Немного положено, хотябы не в минус уходить.

Если работа остро завязана на перфоманс, то и смысла использовать лламу никакого. Сейчас даже на древность типа вольты есть свой форк vllm с нормальной производительностью.
Аноним 16/09/26 Срд 14:40:07 1705476 420
>>1705332
В студию не завезли выгрузку mlp в рам и довольные пользователи вынуждены жрать лоботомита, квантуя кэш в q4?
>>1705395
Правильно, но перегибаешь. Нужна та самая документация и разъяснения по ней. И в ответах нужно указать на причину и стоящий за этим процесс, а не дать готовый вариант в который нужно слепо верить.
Аноним 16/09/26 Срд 14:41:58 1705478 421
Семён аж в ноги себе кланяется за нейропонос и одну лонч команду, совсем не палится
>>1705476
Текущий гайд из шапки именно это и делает. Вангую неосилятора которому слишком сложна и он решил сделать свой высер для интеллектуальных инвалидов
Аноним 16/09/26 Срд 14:44:16 1705480 422
image 108Кб, 814x768
814x768
Жора начал выкладывать готовые билды с кудой под линукс. Ушла эпоха 🫡
Аноним 16/09/26 Срд 14:45:44 1705481 423
>>1705480
Ещё меньше причин с разрешения Господина занюхивать лмстудию 😀🤘
Аноним 16/09/26 Срд 14:49:29 1705486 424
>>1705478
В нем дано достаточно инфы, есть пояснение принципов работы и остального. 80% - чтиво про ллм и инфраструктуру, а остальное непосредственно про запуск. Хорошее соотношение чтобы привлечь, но в то же время сразу дать базу.
Аноним 16/09/26 Срд 16:06:40 1705556 425
>>1705070
Посмотрел новую версию маринары (вчера выкатили апдейт). Немного попердолился с настройкой квена 3.8 27B под профа мари (пришлось слегка ковырнуть жинжу, т.к. там ексцепшен с неправильным порядком ролей выскакивает), но теперь она наконец полноценно работает с ним.
Давал задания делать персонажей и лорбуки, редактировать разное - работает! Все создается, редактируется. Раньше (с геммой) у нее мозгов не хватало карточку поправить (tool call проваливались через раз), а теперь просто шикарно работает с квеном.
Таверна здесь реально отдыхает - возможность кинуть картинку в чат с мари и сказать "запили мне по ней персонажа, придумай недостающее" - это уже база для удобства. Пожалуй, я теперь для RP могу с opencode слезть. :)
Так то я уже давно ленивая жопа, чтобы самому карточку и лор от начала и до конца писать, и фронт который этого не умеет в режиме диалога уже кажется морально устаревшим...
Аноним 16/09/26 Срд 16:11:06 1705561 426
>>1705556
> там ексцепшен с неправильным порядком ролей выскакивает
На бетку обновился неделю назад где пофиксили. Ишью на гх у них закрыт как решённый
Аноним 16/09/26 Срд 16:38:32 1705579 427
>>1705480
А поч куда 12.8, а не 12.9?
Аноним 16/09/26 Срд 16:47:12 1705585 428
Аноним 16/09/26 Срд 16:53:29 1705588 429
1789566798572.jpg 60Кб, 388x480
388x480
>>1705070
>И вот в таком случае будет и приток народа
Зачем
Аноним 16/09/26 Срд 17:02:09 1705594 430
>>1705588
Чтобы все стали надроченными, спокойными, мирными, дружными и мир вокруг перестал быть токсичной помойкой.
Ну или чтобы возвести свой кум-культ великому богу кума, например. Можно буде совершать обряды и приносить жертвы, тоже весело.
Аноним 16/09/26 Срд 17:12:52 1705600 431
>>1705594
Аффтар жжот 👍👍👍💯💯
Аноним 16/09/26 Срд 17:15:26 1705605 432
>>1705588
Не все унылые социопата, ты ведь живешь в сасаити. Если хоть чем нибудь занимаешься то уже по дефолту пользуешься чужими благами и опытом. А ведь они тоже могли сказать зачем и сидели срали как индусы на улице.
Аноним 16/09/26 Срд 17:18:47 1705610 433
nu.png 296Кб, 512x512
512x512
Аноним 16/09/26 Срд 17:21:41 1705611 434
>>1705594
Хорошая попытка, но пресетик не получишь.
Аноним 16/09/26 Срд 17:31:19 1705617 435
>>1705588
Разработчики нейронок увидят, что на дваче много людей пользуются их моделями, и при этом просят, чтобы были 20б плотные и 100б мое модельки, которые умеют в креатив и в рп, послушают их и выпустят новые модели для рп в подходящих размерах.
А так они видят, что все в качестве кодоунитазов используют ллмки, вот поэтому они агентов и пилят.
Где больше спроса, там и больше предложения будет.
Аноним 16/09/26 Срд 17:33:18 1705618 436
>>1705617
В голос нахуй. Они даже знать не знают что такое двач, и слава богу
Аноним 16/09/26 Срд 17:34:29 1705619 437
>>1705594
Хвостиков на всех не хватит гладить!
Аноним 16/09/26 Срд 17:36:42 1705623 438
>>1705618
Ну да-ну да, стопудово в претрейн датасетах у них где-то валяются распарсенные диалоги с двачей. Или может пару лет назад были там. А потом стали вычищать. Так что наверняка знают.
Аноним 16/09/26 Срд 17:58:16 1705628 439
image 624Кб, 948x756
948x756
Если локалки станут массовым продуктом, которым начнет пользоваться каждая собака с 10 IQ - это будет очень плохим звоночком. Любая вещь, которая перестаёт быть уделом полутора гиков и становится достоянием общественности, тут же заинтересовывает кого надо и начинается анальное регулирование по всем фронтам.

Интернет в нулевые помните? Цопе спокойно качался с провайдерской локальной сети, гуро - пожалуйста, цензуры минимум, любые сайты как по кайфу, пиши на форумах что угодно, всем похуй. А теперь посмотрите на интернет сейчас, причем не только в РФ, а вообще везде.

Или вот еще пример специально для зумеров. Электродудки, т.н. "вейпы" помните? Пока в 2015 это было развлечением трех скуфов с форумов, всем было насрать. Как только с электронкой начал бегать каждый школьник - сразу пошло закручивание гаек, и по девайсам, и по жижлу, и по акцизам, и по местам "парения". Везде и сразу, по всему миру.

Мы все прекрасно знаем, ЧТО могут генерировать локалки сейчас. Цензуры можно сказать что нет, оно либо пробивается промптом, либо, если лентяй, аблиткой. Можете не сомневаться, что как только локальными LLM начнут пользоваться все, этой свободе и безудержному веселью наступит конец. Сейфти будет всегда в приоритете над остальным, даже ценой жесткой лоботомии. Да-да, против законов особо не попрешь. Там расцензуривать будет нечего - всё апасное будет вырезаться еще на этапе составления датасетов. Кто не видит в этом ничего страшного - ну попробуйте потыкайте microsoft phi. Вот такими будут все локалки.

Чем дольше наше хобби будет оставаться уделом дрочеров с кодомартышками и чем меньше будет интересно простым нормальным людям - тем лучше для нас же. Ну и бекапьте годные модели: их пидорнут отовсюду как только так сразу.
Аноним 16/09/26 Срд 18:10:10 1705633 440
>>1705628
>Автомобили, помните? Та хуйня на колесах от велосипеда с пердящим мотором? Пока ими могли пользоваться 2 богатеньких мажорчика, всем было похуй - езди где хочу. Как только на них сел каждый второй дядя вася - сразу пошло закручивание гаек. Медкомиссия, пдд, экзамены. Ездить можно только по дорогам. На красный не ездить. Стали придумывать каркасы безопасности, подушки безопасности и прочее.
Аноним 16/09/26 Срд 18:24:53 1705639 441
>>1705450
>оптимизед для смартфонов
>Mac mini M4 Pro 15 tok/s decode
Аноним 16/09/26 Срд 18:41:28 1705647 442
Я тут попробовал погонять на мобилках Luqwen4-4B. Есть на андроид приложуха PocketPal для локального инференса. Под это дело даже состряпал Q4_0 - так выше скорость. Удалось добиться 12 токенов в сек. Жаль только при попытке использовать вижен вылетает, похоже не хватает памяти, сам андроид еще сколько отжирает.
Аноним 16/09/26 Срд 18:43:24 1705649 443
>>1705628
Поэтому параллельно надо развивать локальное тюнерство.
Больше народу будет - больше потенциальных талантов, кто осилит, плюс больше резона заниматься этим.
Корпы будут поставлять архитектуры, васяны из подземки будут их тюнить.
По сути уже даже сейчас есть проекты открытых тюнов со всеми датасетами, настроенные на нейтралитет. Хотя они тоже в агентоговно склоняются.
Аноним 16/09/26 Срд 18:53:57 1705653 444
>>1705628
>microsoft phi
Я на фи4 кумил. И на голой, и на тюнах. Моделька так себе, но не катастрофа.
Пока у нас есть опенсорс, тюны - хуюны, а они кстати умерли и железо, из любой модели можно выжать что надо. А вот если технологию анально закрыть, так чтоб люди не могли тренить\тюнить\мерджить сами, то вот вам и дивный новый мир с чистыми и безопасными датасетами и выкрученным сейфети. Ну а что? Корпа выдаст 666В сатанжпт, и хуй ты его как либо изменишь под свои задачи на домашнем сервере, тут уже датацентр нужен. Кстати, китайцы уже ввели гос бан на ии рп, вроде, и вдруг их маленькие легко тюнемые модельки испарились. Столько там новый дипсик флеш? 550В?

Ну или другой вариант. Васян, один из немногих посвящённых, внезапно забрасывает. И всё, встало направление. К примеру жора и ко.

Правда жору вместе с обнимордой и главными квантоделами вся опенсорса уже купили серьёзные дяди, которым перед блекроком и прочей нечистью отчитываться надо, так что через годик - другой лламы и так не будет в привычном виде, также как и локалок, если будет некому подхватить флаг. А для этого нужно чтобы тема была распространена и доступна, чтобы из буквально миллионов таких как мы, потребителей, зацепить челиков с желанием и возможностью.
>>1705649
Жестко двачую. Еще было бы круто, если бы появилась возможность тюнить что покрупнее с потребительского железа. А ещё круче, если с проца и оперативки. Я не МЛщик, хз насколько это реалистично, но чтобы хоть какие-то подвижки обратно в сторону обычных пк были, нужно чтобы пользователей с теми же 16\64 было много.
Аноним 16/09/26 Срд 19:08:12 1705660 445
>>1705649
>надо развивать локальное тюнерство
Давайте развивать. Вот я делаю модели Luqwen 4B, каждая новая версия лучше предыдущей. Новичкам стараюсь помогать, если кто-то приходит с вопросами по тюнам.
>>1705653
>Еще было бы круто, если бы появилась возможность тюнить что покрупнее с потребительского железа
Вот да, на 16Гб Qwen3.5 4b мой предел
Аноним 16/09/26 Срд 19:17:09 1705665 446
>>1705588
Всмысле зачем, чтобы выполнить план! Ты же МЕНЕДЖЕР ПО ПРОДАЖАМ!
>>1705594
> чтобы возвести свой кум-культ
Глажки хвостов? Хм, а идея
>>1705617
> Где больше спроса, там и больше предложения
Нет потока капитала чтобы это работало, пользователь ни копейки не заносит разработчикам. Потому ориентируются только на совсем уж общее.
Аноним 16/09/26 Срд 19:18:52 1705669 447
>>1705628
А ты наивный. То, что ты можешь на локальном железе что-то запустить это издержки развития отрасли и конкуренции корпов, пройдет время и из технологии нейронки начнут превращаться в инструменты, тогда все вот эти "не задокументированные возможности" нахуй выпилят ибо нейроны не резиновые, а обучение даже мелкомодели это не простая и не дешевая задача. Нам сейчас просто повезло со всем этим добром.

Кстати кто-то сделал гуф Алисы даже q1 есть https://huggingface.co/ngquocvinh/AliceAI-T5-35B-A0.6B-GGUF
Аноним 16/09/26 Срд 19:26:01 1705673 448
>>1705628
В общем база. Но из-за порога по железу и навыку локалки могут надолго остаться нишевым продуктом. А для нормисов уже есть чатжпт в телефоне и все завязано на облако с принципом "не владей ничем и будь счастлив".
>>1705669
> все вот эти "не задокументированные возможности" нахуй выпилят ибо нейроны не резиновые
Нет. Выпиливание приведет к лоботомии, на них можно только поставить заглушки, которые снимаются путем лоботомии.

Что вы так унываете, нет бы подумать о том, что доступность и массовость наоборот снимет табу со всех этих вещей, общество будет спокойнее относиться и перестанет клеймить за мыслепреступление без пострадавших.
Аноним 16/09/26 Срд 19:26:38 1705675 449
>>1705424
Осторожнее, анон. У меня несколько лет назад после нескольких дней подобного марафона хуй распух и болел несколько дней, думал всё, пиздец мне, ща скорую придётся вызывать, а в больнице отрежут хуй нахуй.
Аноним 16/09/26 Срд 19:27:47 1705679 450
>>1705649
>>1705653
>тюны
Так сейчас РП-тюнов не существует. Как писали эксперты из треда - это просто лоры. Т.е. если в модели изначально есть кум, но далеко запрятан - они его проявляют (мистрали). Если же его там нет, то он чудесным образом из ничего не возникнет (гемма 3, гпт осс). Простой сделанной на отъебись лоры недостаточно, нужен именно полноценный тюн, с которым заморачиваться никто не будет, это слишком затратно и геморно.

А теперь представим ситуацию, в которой у нейронки еще на самом раннем этапе вырезан целый пласт знаний о мире: о куме и всем что с ним связано. Т.е. модель даже не будет вдуплять как выглядит голая женщина, что такое член и зачем всё это нужно. Такое вообще реально исправить тюнами? Сколько инфы для обучения потребуется? Кто это будет пылесосить по всему интернету и составлять датасеты? Не вижу причин со стороны корпов не вырезать кум, особенно если обяжут законодательно. На способности к коду оно повлиять не должно, а значит большинство нормисов останутся довольны.

>китайцы уже ввели гос бан на ии рп
Ну вот, почалося. Интересно, связана ли с этим соевость последнего дипсика, глма, усиленная цензура в квене 3.5? Или узкоглазые еще даже не начинали?
Аноним 16/09/26 Срд 19:40:54 1705688 451
>>1703839 (OP)
Пацаны, какой минимально приемлимый порог по железу для вката в локалки?
Сильно насосу с 3070 и 16гб RAM?
Аноним 16/09/26 Срд 19:44:41 1705690 452
>>1705679
> это просто лоры
Не обязательно, просто чаще всего так делают чтобы сэкономить, и так сложнее совсем все убить. Суть верная, модель изначально понимает это и может, просто придается определенный стиль, подчеркиваются одни и уменьшаются другие вещи.
> Такое вообще реально исправить тюнами?
Да, просто схалтурить не получится. Потребуется тюн основательнее, типа которых сейчас можно увидеть на всяких квенов под код и специализацию от мелких компаний. Слопомерджи с кринжовыми ридми моделей как сейчас не помогут.
Но, такая модель будет отвратительна во всех задачах, общая деградация скажется даже на коде и понимании задач.
Аноним 16/09/26 Срд 19:45:06 1705691 453
>>1705679
> Так сейчас РП-тюнов не существует. Как писали эксперты из треда - это просто лоры.
Лоры это тоже же тюны, просто меньше параметров тренируется с точки зрения смердженной конечной модели. Сколько туда новых знаний влезет - зависит от ранга, на малых рангах уровня 8-16 только стиль в основном тренится да.
> Т.е. модель даже не будет вдуплять как выглядит голая женщина, что такое член и зачем всё это нужно.
Ну вообще вряд ли так сделают, для чего? Это совсем лоботомия, базовые биологические знания вырезать. Даже если модель агентная чисто, комон сенс ей нужен.
> Такое вообще реально исправить тюнами?
Пришлось бы CPT на базовой модели проводить, с риском сломать модель. Датасет да мощный пришлось бы собирать, и мешать с какими-то датасетами общего назначения до победного. В любом случае на такое времени и ресурсов ушло бы долго, и потребовалась бы как минимум очень высокоранговая лора, как максимум фултрейн.
Аноним 16/09/26 Срд 19:46:29 1705692 454
>>1705690
> Но, такая модель будет отвратительна во всех задачах
Базовая офк, не результат тренировки
Аноним 16/09/26 Срд 19:47:20 1705693 455
>>1705653
>Кстати, китайцы уже ввели гос бан на ии рп, вроде
Минимакса пока еще не схватили за жопу с их talkie ai

>Еще было бы круто, если бы появилась возможность тюнить что покрупнее с потребительского железа.
7-8б в теории можно на 16гб врама обучать. Правда дальше уже пустота. 32гб на 15б модельки хватит, но таких почти не существует. Для условного квена 27б или гемму 26б уже надо около 60гб, это уже спец карточки. Моешки как я понял, требуют загрузки полных весов, тут выгрузка слоев не работает.
С другой стороны, не обязательно прям каждому обучать свои файнтюны. Всегда есть энтузиасты с хорошими карточками, просто надо чтобы это больше в народ заходило, больше инфы появлялось, датасеты генерились и прочее.
Имхо, даже 8б модельки можно использовать как пробники для экспериментов, минимальный экспириенс от них можно получить, а в последнее время даже неплохой экспириенс. А если годнота какая-то выходит, можно и отмасштабировать на большую модельку, просто где-то ресурсы позаимствовать.
Аноним 16/09/26 Срд 19:49:50 1705696 456
image.png 485Кб, 660x703
660x703
>>1705675
Но не отрезали же...
Аноним 16/09/26 Срд 19:52:48 1705698 457
>>1705693
> 32гб на 15б модельки хватит, но таких почти не существует.
А гемма 12б совсем дохлый номер? Чего-то не видел, чтобы ее обсуждали.
Аноним 16/09/26 Срд 19:54:40 1705700 458
>>1705688
Поиграться можно, без сильно больших ожиданий
Аноним 16/09/26 Срд 20:11:18 1705706 459
>Давайте делать тюны
>Возьми и сделай тюн
>Кто? Я?
Аноним 16/09/26 Срд 20:17:35 1705710 460
Аноним 16/09/26 Срд 20:18:10 1705711 461
>>1705706
Я пытаюсь. Просто еще остальных дразню, чтобы тоже вкатывались. Наверняка найдутся аноны поумнее.
А у кого-то еще и целые риги имеются, на которых можно было бы что-то поинтереснее потренить, чем 4-8б лоботомиты.
Аноним 16/09/26 Срд 20:19:56 1705712 462
>>1705698
Человек который может запустить плотную 12B Гемму может почти наверняка запустить МоЕ 26B Гемму, а она уже на две головы выше.
Аноним 16/09/26 Срд 20:22:33 1705713 463
Тогда давайте всем тредом наделаем тюнов 4б квена, потом устроим состязание. Создатель лучшего тюна получит от Абу RTX PRO 6000
Аноним 16/09/26 Срд 20:22:52 1705714 464
>>1705712
Ну да, но я больше со стороны тюнов. Все-таки на 26б ресурсов сильно больше понадобится для тренировки, на домашнем железе не пройдет.
Аноним 16/09/26 Срд 20:24:48 1705715 465
Кто-нибудь испытывал стыд от того что играл с нейронками?
Аноним 16/09/26 Срд 20:26:45 1705717 466
>>1705660
>Luqwen 4B
Ты сейчас all-round делаешь, как я понял из описания? Скачал, сердечко въебал, погоняю, отпишусь тебе в дисскассы хф и мб сюда.
Бля, может обратно в шизомерджинг вкатиться...
>>1705693
>Минимакса пока еще не схватили за жопу с их talkie ai
Ну хз, я из не локалок только с аи данжен знаком.
>7-8б в теории можно на 16гб врама обучать.
Бля, будут силы, надо попробовать е4б гемку сломать. Ну или настакать 4б квена до 6б и его уже надрачивать.
Аноним 16/09/26 Срд 20:31:27 1705718 467
>>1705711
Это полезно если ты делаешь под конкретную узкую задачу для своих занятий, или для обучения и саморазвития.
Чтобы сделать хороший рп тюн нужно очень много работать с датасетом. Прямо очень. А должных профитов с этого и не получишь, нужна какая-то еще мотивация или собственное желание.
> целые риги
Если есть риг - начинаешь катать крупные модели, к мелким интерес падает.
> Я пытаюсь.
Уважаемо, красавчик.
Аноним 16/09/26 Срд 20:42:21 1705724 468
>>1705717
>all-round
Ну вроде того. Я пробовал чисто РП сделать, в итоге модель получалась слишком глупая. Писала красиво, но абсолютно бессмысленную шизу. Сейчас пытаюсь сделать модель с мозгами, но не такую душную, как оригинальный квен.
Аноним 16/09/26 Срд 21:49:23 1705748 469
Всем привет. Помогите пожалуйста разобраться с Gemma 31B. Я использую её для РП в таверне. Пресет хорошо слушается и отвечает на русском хорошо, но мне почему-то кажется, что я что-то упускаю. Есть какие-то гайды, как настроить эту модель для рп сочного? В шапке слишком много ссылок, я запутался...
Аноним 16/09/26 Срд 21:51:50 1705750 470
Аноним 16/09/26 Срд 21:57:33 1705753 471
>>1705750
Я нищук без компа, просто есть доступ к этой модели и всё. Так что я дрищ дрищич.
Аноним 16/09/26 Срд 22:59:44 1705764 472
>>1705213
Перекатил свой хуй тебе в ротик, чекай
Аноним 16/09/26 Срд 23:11:09 1705767 473
>>1705724
Короче.
>не такую душную, как оригинальный квен
Чувствуется, но как я понимаю, модель очень далеко от финальной версии? И что с ризонингом? Он его дёргает, но ебашит туда финальный ответ. Могу расписать свои впечатления подробнее, но если кратко, пока моделька полусломана. Ну или я совсем криворучко. В любом случае это больше, чем 99% треда сделали, красавчик.
Аноним 16/09/26 Срд 23:26:38 1705772 474
>>1705767
Спасибо за отзыв.
У меня датасет без ризонинга и модель ему не обучена, поэтому не удивительно, что она туда может выдать ответ.
Еще модель чувствительна к параметрам семплинга, рекомендую такие
temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
Аноним 16/09/26 Срд 23:29:42 1705774 475
>>1705395
>Именно поэтому я против ЛЮБОЙ помощи новичкам кроме совета "читай документацию".
Напишешь документацию (без каши, яиц и всей той неактуальной/нерабочей хуйни) - возвращайся. Может кому-то она и пригодится. Но большинству будет достаточно гайда с быстрым стартом (какую скочать лламу, какую скочать модель, как запустить перетягиванием модели на батник и опционально еще как настроить таверну - всё). Подробности потом сама модель и расскажет если че, не надо никаких документаций будет.

>>1705450
Чувак, это квенчик. В рп бесполезен, ему до геммы как до луны. В кодоагентсве на слабых ПК пригодится, есть еще агентворлд версия например. Но эта хуйня что ты принёс она вообще якобы какбы для мобилок.
Аноним 16/09/26 Срд 23:40:19 1705781 476
>>1705688
Вот это у тебя запустится легко и будет относительно быстро работать:
gemma-4-26B-A4B-it-GGUF - ролеплей, хорошо говорит по-русски
Qwen-AgentWorld-35B-A3B-GGUF - локальный агенто-кодинг
Аноним 16/09/26 Срд 23:42:38 1705782 477
>>1705717
>адо попробовать е4б гемку сломать. Ну и
Уже есть minifantasy
Аноним 16/09/26 Срд 23:45:38 1705783 478
>>1705772
> Еще модель чувствительна к параметрам семплинга
Как это понял, чем добился?
Аноним 17/09/26 Чтв 00:05:45 1705792 479
>>1705675
Пф раз 10 так было. Нихуя не будет ему
КАК ЗАКАЛЯЛАСЬ СТАЛЬ
Аноним 17/09/26 Чтв 00:11:38 1705794 480
>>1705772
>параметрам семплинга
Ух, я с современным чаткомплишене о них вообще забыл. Запускал на стандартных квен 3.5 пресете для тексткомплишена.
>temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0
Вот эту вот строчку добавь в ридми и прям жирненько выдели РЕКОМЕНДУЕМЫЕ ПАРАМЕТРЫ.
Ризонингу попробуй обучить, он для такого размера просто необходим. Ну или хотя бы чтоб как гемма просто открывал-закрывал тхиньк и писал уже дальше. Ну и по ощущениям пока оно всё ещё слащаво-квенисто-китайское, со всем этим позитивом, воздушной прозой и моралью 'не навреди'. Попробуй подёргать хармфул датасеты, evil датасеты, такое тоже видел раньше на обниморде. Негатива в общем залить стоит. Может пару Лавкравтовских книг лол Если цель стоит в самобытности, попробуй диалогов из старых русских книг надёргать, там язык своеобразный, может дать прикольный стиль. А может и не дать. На мой субъективный взгляд пишет очень коротко. Еще в дату POVов залить первого и второго лиц, он сильно путается с он\она\они\оно\мы\я, теряет кто есть кто.
Периодически он вместо ответа в рп, выдавал короткую историю по мотивам, лол, причём всегда с хеппиэндом, Мб где то путается в турнах юзер-ассистент, хз. Один раз словил луп, скорее всего из-за семплеров. В рп с персами вообще беда, но пока туда рано смотреть.
В принципе, работу видно, от орига он сильно отличается, и не только тем что полуживой. Труд вложен, небось, титанический, молодец. Продолжай в том же духе.
Аноним 17/09/26 Чтв 00:26:24 1705795 481
image.png 136Кб, 1006x704
1006x704
image.png 131Кб, 1014x1404
1014x1404
image.png 60Кб, 865x521
865x521
Шок! Нейросеть обезумела и стала разговаривать сама с собой. Эксперимент вышел из под контроля. Это AGI, срочно давайте мне все свои деньги! Завтра на IPO выходим.

(На самом деле это небольшой проеб в темплейте заставляет модель шизить. Но мне понравилось. Такой олдовый шизо-мистралевый момент, который может индуцировать ИИ-психоз у неокрепших умов. Вообще, мне кажется это супер-перспективная ниша, создание шизовых моделей ради того, чтобы пощекотать нервишки на счет самосознающего или саможивущего ИИ. Есть в этом какая-то особая душа и романтика... Можно назвать ИИ-хоррором или сорт оф. Еще охуеннее будет, если создать агента под тул-коллы, но не делать алайнмент под сильную логику, чтобы нейронка вообще любую хуйню могла запускать, отыгрывала бы какого-нибудь маня-хацкера или вируса в системе.)

Итак, я снова выхожу на связь со своими попуками в области тюнинга Квена. Теперь это мой личный дневничок экспериментов.

В общем, поиски нового датасета не дали результата пока что. Нет годноты, где все сразу сходится. Есть либо РП на русском но без НСФВ, либо есть русские НСФВ рассказики без РП, либо есть НСФВ РП на английском. Надо НСФВ РП на русском. Я пока еще не созрел делать массовые переводы датасетов. К тому же есть гипотезы как можно улучшить тюнинг и на хреновеньком датасете (опять же, основной поинт в том, что треня на небольшом датасете не должна ломать модель, надо добиться хоть какой-то стабильности).

Перед вторым прогоном сделал несколько изменений
1) все-таки пофиксил токенайзер, он был правильным в самой тренировке, но на этапе конверта в ггуф я ошибочно подменил его
2) по своей долбоебусности я поставил max_seq_length=2048, притом что семплы были по 4к токенов в среднем, т.е. они просто обрезались наполовину, в итоге на тренировку попадал только 1-2 ответа ассистента максимум, если вообще попадали; поставил значение 4096, но пришлось взять в 2 раза меньше семплов - 400 штук
3) сделал системный промпт более содержательным и структурированным, специально ролеплей-ориентед, я думаю это положительно должно влиять на то, как ллмка воспринимает себя без сиспромпта (остается ассистентом), и как она понимает правила в рамках ролеплея
4) засунул первое сообщение ассистента (завязку ролеплея) в системный промпт, чтобы нейронка не обучалась на первых сообщениях вообще; во-первых, это больше сложности добавляет и больше креативности от нейронки требует (лучше потом отдельно добавлять в обучающий датасет примеры на генерацию историй, да раз в 10 побольше желательно), во-вторых, пусть нейронка сфокусируется на чтение контекста и отыгрывание персонажа, как раз ранга=16 должно хватить на это

Итог - результат все еще говно, но стало чуть менее хуже. Без ролеплей контекста при темпе=0.7 нейронка все еще идентифицирует себя как обычного ассистента, а не начинает придумывать персонажей. Лупов чутка меньше. Но в остальном, белиберда и протекание иностранных слов в ответах сохраняется.
И да, лосс все еще мусор. Но чуть менее мусор, чем было до этого.

Я все же думаю, что параметры обучения слишком агрессивны для данного сетапа. Пообщался с ЛЛМками по этому поводу, они подтверждают (эксперты, как никак). На длинных контекстах рекомендуется снижать лернинг рейт, ибо на длинных контекстах энтропия ответа грубо говоря растет, и если эту ошибку помножить на высокий лернинг рейт, будет очень больно.
Я использовал дефолтный рейт 2е-4, думаю попробовать 2е-5. Мб и лосс стабилизируется.

Также хочу попробовать лора альфа поставить 16 как и ранк, чтобы уменьшить силу лоры. В теории это должно меньше повреждать базовые мозги. Но это уже в следующем эксперименте после лернинг рейта. Ибо главный закон грамотных экспериментов - одно изменение за раз.

Посмотрим что выйдет. Параллельно буду думать на счет датасета. Если совсем все плохо будет, тогда просто любой нормальный датасет попробую взять и затюнить.
Аноним 17/09/26 Чтв 00:27:43 1705796 482
image.png 175Кб, 495x254
495x254
Аноним 17/09/26 Чтв 00:30:19 1705797 483
>>1705772
>top_p=0.8, top_k=20,
Капец, выборка из 20 токенов че-то жестко. Хотя сейчас глянул, сам квен такое рекомендует.
Даже у мистралей такого не было, но хз, все модельки разные конечно.
Аноним 17/09/26 Чтв 00:38:46 1705802 484
>>1705783
>Как это понял
На тестах ловил то лупы, то шизу, хотя и датасеты чистил. С top_k=20 меньше шизы, rep_pen = 1 - самое главное убирает повторы и лупы. top_p 0.9 у меня тоже было норм, 0.8 это из рекомендаций обычного квена для no think general tasks. resence_penalty=1.5 для художки лишним не будет. Кстати вот это пригодится всем, у кого модели любят мусолить одну и ту же тему.
Причина чувствительности, думаю, в том, что это чистый SFT без сглаживания.
>>1705794
>он\она\они\оно\мы\я, теряет кто есть кто
Это и у офф квена есть такая болезнь, я для этого загадки специально добавлял, но надо бы еще. Без добавлений там вообще все очень плохо было.
Причина отказа от ризонинга и коротких ответов в том, что у меня длина семпла ограничена 4096, при 8к уже out of memory
Аноним 17/09/26 Чтв 00:48:09 1705808 485
Кстате, ни у кого случайно нет этого датасета?
https://huggingface.co/datasets/taozi555/novel-rp
Звучит интересно, но он заперт за аппрувом от автора. Я отправил запросик, но не факт что он одобрит. Может еще на профиль смотрит и лошкам не дает доступ.
Аноним 17/09/26 Чтв 01:00:04 1705810 486
>>1705795
> основной поинт в том, что треня на небольшом датасете не должна ломать модель
А ты в нем уверен? Речь не про небольшом датасете а просто о короткой тренировке, причем это даже больше зависит от оптимайзера и лр. Эти "короткие забеги" могут давать совершенно непредсказуемые результаты, которые при тренировке масштабнее или просто подольше окажутся другими.
Если просто отлавливаешь возможные косяки - правильный подход, они проявятся и тут. Просто помни, что если сильно меняешь домен - выдернутая посреди или тем более из начала тренировки модель может быть настолько вздрюченной, что будет давать результаты заметно хуже чем после некоторого прогресса обучения.
> 3)
Верно. Но учитывай что если датасет только с ним - модель просто запомнит как триггер и будет требовать его. Чтобы понимала суть промпта - необходима аугментация на множество разных вариантов. И это не спасет от лоботомии во всех остальных случаях если датасет не разбавлен чем-то еще.
> 4) засунул первое сообщение ассистента (завязку ролеплея) в системный промпт
Как именно ты это сделал? Если просто пихнул в роль системы под разметку - пиздец. Если отрефакторил ллмкой под описывающую завязку и соответствующим образом поставил туда - хорошо. Но если такое везде - модель лоботомируется и будет тупить в таверне и подобных, потому что там не так.
> нейронка все еще идентифицирует себя как обычного ассистента
Это подразумеваешь что она должна называть себя каким-то особым именем если нет контекста?
Аноним 17/09/26 Чтв 01:08:45 1705812 487
>>1705794
>Попробуй подёргать хармфул датасеты, evil датасеты, такое тоже видел раньше на обниморде. Негатива в общем залить стоит. Может пару Лавкравтовских книг лол Если цель стоит в самобытности, попробуй диалогов из старых русских книг надёргать, там язык своеобразный, может дать прикольный стиль. А может и не дать. На мой субъективный взгляд пишет очень коротко. Еще в дату POVов залить первого и второго лиц
Вот это кстати полезно, спасибо. Попробую поискать подходящее.
По сути у меня там и нет РП в составе датасетов, есть story writing от opus и видимо как раз это дает такой эффект >вместо ответа в рп, выдавал короткую историю по мотивам, лол, причём всегда с хеппиэндом
За поддержку Thx - есть стимул продолжать работу

Сам я эту модель в основном использую чтобы виженом перевести китайские надписи на упаковке чая ну и попиздеть про этот самый чай. С этим весьма неплохо справляется.
Аноним 17/09/26 Чтв 01:30:28 1705822 488
>>1705810
>А ты в нем уверен?
Тут у меня никаких гарантий, просто логика такая, что легкий файнтюн должен подкорректировать слог или работу с разметкой, но глубоко в мозги лезть не должен в теории. Это если какой-то массивный тюн на большом датасете делать с большим ранком лоры, тогда может и тотально поменять какие-то концепции в весах самой нейронки.
Отчасти ради этого я и первое сообщение убрал, чтобы нейронка не мучилась над придумыванием историй, а просто смотрела как можно разнообразно отвечать в ролеплее.
Но с другой стороны на счет смены домена тоже верно, домен может масштабно менять мозги ллмки. Но посмотрим.
>Чтобы понимала суть промпта - необходима аугментация на множество разных вариантов.
Да, это в будущем хочу запилить. Если все успешно пойдет.
>Как именно ты это сделал? Если просто пихнул в роль системы под разметку - пиздец.
Да, но это временное решение. Я хотел кастомное маскирование ответов запилить, чтобы на первом сообщении не считался лосс, но пока лень.
Сейчас просто структура сиспромпта используется, типа "<мы играем в ролеплей, у тебя роль персонажа_нейм> <описание персонажа:...> <описание персонажа юзера:...> <первое сообщение:...>"
Хотел глянуть как там в таверне все-таки карточка в промпт структурируется, но так и не дошел.
>Это подразумеваешь что она должна называть себя каким-то особым именем если нет контекста?
Я брал базового квена (который пре-трейн должен быть), и в нем внезапно уже забиты знания, что он ассистент. Т.е. без сиспромпта это должно быть дефолтное поведение. С моим первым прогоном файн-тюна моделька на вопрос "ты кто" в половине случаев выдумывала себе персону (в прошлом треде скидывал примеры >>1703368 →). То что сейчас она снова себя уверенно к ассистентам относит, я считаю скорее полюсом, т.к. потенциально мозги меньше побились.
Аноним 17/09/26 Чтв 01:45:57 1705826 489
>>1705822
> просто логика такая, что легкий файнтюн должен
И да и нет. Тут степень легкости определяется продолжительностью и лром. Ты делаешь очень сильное смещение (потому что такой датасет сильно отличается от обычного поведения и всему что учили и полировали), но в течении короткого времени. Усваивается все это рандомно и неконтролируемо в плане поломок.
Используй оптимайзеры типа ademamix и крутани беты, это действительно даст такой эффект.
> Отчасти ради этого я и первое сообщение убрал
Я не понимаю в чем тут логика. Не потому что это неправильно, просто не хватает описания.
> просто смотрела как можно разнообразно отвечать в ролеплее
Этим самым ты заучиваешь паттерн легкой (или тяжелой) шизофрении, когда модель просто пишет условно связный слоп игнорируя контекст. Для разнообразия хорошо иметь древовидные диалоги в датасетах с рандомизацией в даталоадере. Еще можно схитрить и сдвинуть маску внимания подальше убрав с первых сообщений, получишь меньше заучивания начала и частично эффект разнообразия.
> чтобы на первом сообщении не считался лосс
Так это делается простой маской или строкой в коллейторе.
> Сейчас просто структура сиспромпта используется
В первом приближении хорошо, но первое сообщение там явно лишнее.
> Хотел глянуть как там в таверне все-таки карточка в промпт структурируется
В консоли печатает при запросе если не убрано в настройках.

Пиши тогда о результатах, дело хорошее.
Аноним 17/09/26 Чтв 02:54:27 1705836 490
Screenshot 2026[...].png 168Кб, 926x1564
926x1564
Qwen3.8-Flash-Next-Uncensored.Q4_K_M

>>Тест на логику: У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?
Аноним 17/09/26 Чтв 03:03:29 1705844 491
>>1705836
Мдауж. Перевозишь гоблина, возвращаешься пустой, перевозишь принцессу, возвращаешься пустой, перевозишь пажа. Всё. 5 шагов. Нахуя 7?
Аноним 17/09/26 Чтв 06:05:01 1705885 492
Скачал снова гемму 31 и посвайпал в жирных чатиках с трезвой головой, хочу сказать, что она не очень то и лучше других во внимании к деталям, в куме так же всё путается как и на других моделях, раньше считал, что хоть в этом она хорошо справляется. В целом не вижу смысл держать её на компе вообще если можешь запустить мое 100+б, в остальном она так же пососала.
ПЕРЕКАТ Аноним # OP 17/09/26 Чтв 06:14:52 1705889 493
Аноним 17/09/26 Чтв 06:16:02 1705892 494
Аноним 17/09/26 Чтв 06:18:26 1705895 495
>>1705889
Ахаха петушок так испугался что перекатил раньше бамплимита? Ты настолько дорожишь возможностью и дальше гейкипить новичков бесполезной невнятной шапкой и запутанным (и не только бесполезным но и вредным) гайдом? Ты понимаешь, какой ты моральный урод и психопат?
Аноним 17/09/26 Чтв 11:53:13 1706055 496
image.png 192Кб, 800x886
800x886
>>1705715

Нет...

Но я сейчас развлекаюсь тем, что наоборот откладываю кум и прочее на максимум далеко и отыгрываю целку-невидимку просто динамлю персов и не даю, ломая их прописанный паттерн поведения и кинки.
17/09/26 Чтв 12:52:16 1706103 497
>>1705889
Ну ты, мог бы сам несколько постов насеменить, вот тебе один.
Аноним 17/09/26 Чтв 14:36:22 1706217 498
>>1705844
Если поставить ризонинг на минимум, то вообще говорит что у задачи не решения, на скрине ризонинг на среднем уровне.
Аноним 17/09/26 Чтв 19:02:21 1706501 499
Какой же Гема кал, нужно прям все в промте прописывать и водить это говно за ручку. С таким же успехом я могу и сам все написать и придумать сюжеты. Рот ебал тех кто советует это говно. Просто берёт твой промт и накидывает говна на вентилятор, чтобы побольше слов было
Аноним 17/09/26 Чтв 19:48:03 1706539 500
>>1706501
Сколько параметров? Температура?
Аноним 17/09/26 Чтв 19:55:04 1706547 501
>>1706539
Температура 1.07, далее все более менее среднее
Аноним 17/09/26 Чтв 20:07:06 1706550 502
>>1706547
Снижай плавно до 0.8 и чекай.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов