Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 507 122 96
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №265 /llama/ Аноним 08/09/26 Втр 15:25:30 1699101 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
177592920327800[...].jpg 5433Кб, 3072x4080
3072x4080
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1696723 (OP)
>>1694457 (OP)
Аноним 08/09/26 Втр 15:28:17 1699105 2
Для анона с говно компом
>>Dolphin-Llama-3-8B и какую НемоМисталь 8.
Это старый кал, который тебе местный шиз насоветовал. Если у тебя говно комп, то просто скачай приложение грок и закидывай туда промт, потом кидаешь персонажа и сеттинг и он выдает тебе рп без цензуры. Там 50 сообщений каждые 3 часа даются. Одно сообщение максимум 500 слов по его словам. После Грока все кажется говном и объедками.Если нужен не рп, а просто текст. То пишешь какую то хуйню и тебе даже парусная нейронка доделает в конфетку.
Вот, не еби себе голову локалками, они все говно, хуже любого 2/10 фанфика человека.
Аноним 08/09/26 Втр 15:33:00 1699109 3
Дополню что снес с компа всю эту парашу и мешуру, полностью разочарован в нейронках. Нихуя они не могут. Даже самая крутая модель тебе выдаст кал где все бомжи знают твое имя и цвет твоего ануса, а персонажей появляется по 3 руки. Интеллекта 0. Тем более щас все цензурят, и ничего от Characters ai не отличается.
Аноним 08/09/26 Втр 15:34:46 1699110 4
IMG4677.png 247Кб, 604x472
604x472
>>1699101 (OP)
ОП-пец, щитаю ради рофла можно один раз тред назвать локальной геммы нить.
Аноним 08/09/26 Втр 15:36:07 1699111 5
>>1699109
Попробуй использовать нейронки для работы а на корпах попробуй в SFW РП. Базарю, потом от Клода и гемини за уши не оттянешь,
Аноним 08/09/26 Втр 15:37:57 1699113 6
1764265938269.png 68Кб, 461x295
461x295
>>1699108 →
Математика уровня пикрел
> Аргументы будут?
google:wlan ping jitter и с подключением!
Аноним 08/09/26 Втр 15:38:56 1699115 7
>>1699111
>потом от Клода и гемини за уши не оттянешь
Который год я уже эти сказки слышу? Раньше еще диксик Р1 был. Давай примеры твоего супер рп и текста. Ах да, наверное у меня промт неправильный был, и день недели не тот. Нужно 1000 промтов перебрать и можно по рпшить на два сообщения
Аноним 08/09/26 Втр 15:40:25 1699116 8
>>1699111
>SFW РП
Че вы там делаете? Без рофлов
Аноним 08/09/26 Втр 15:45:38 1699119 9
>>1699109
Проблема навыка и 4б лоботомитов.
>>1699111
> SFW РП. Базарю, потом от Клода и гемини за уши не оттянешь
Там к простому sfw быстро подмешивается требование по sjw-расово-идеологически-нравственно-верному поведению что дико бесит. Кроме грока, но он глупенький. Зато, если ты небинарная феминистка из расового меньшинства - на фронтире без жб даже лайтовый кум можно делать.
Аноним 08/09/26 Втр 15:48:47 1699123 10
>>1699109
>Даже самая крутая модель тебе выдаст кал где все бомжи знают твое имя и цвет твоего ануса, а персонажей появляется по 3 руки.
Такого даже гемма не делает.

>Тем более щас все цензурят, и ничего от Characters ai не отличается.
Скилл ишью, любая цензура пробивается без проблем, а для криворучек специально созданы Апасные модели.

Вообще скатертью по жопе.
Аноним 08/09/26 Втр 15:55:06 1699127 11
>>1699042 →
>по вифи
Не, там задержки большие слишком, смотрел протыка на ютубе который так сделал, режет скорость. Особенно на больших токенах в секунду, чем больше тем сильнее потери, т.к. потери скейлятся от количества передач а не пропускной способности (а каждый сгенерированный токен это передача)
Если уж совсем никак не уйти то надо брать вайфай 7 и убирать все частоты кроме 6ггц, и как-нибудь напрямую компы соединять без точки доступа
Аноним 08/09/26 Втр 16:00:07 1699132 12
image 187Кб, 736x736
736x736
Короче челики, погонял тесты на
outsourc-e/Qwen3.8-27B-Unleashed-UD-IQ3_XXS
cruizba/Qwen3.8-27B-GSQ-RCO-IQ3_XXS+MTP
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp

На всех трёх mtp нихуя не работает и тпс выше 27 не разогнать. Почему-то мтп начинает нормально работать только с моделей начиная от UD-Q3_K_XL , а на мелких сыпется

Вобщем в 16гб врама 160к контекста с быстрой скоростью не запихать. Либо сидишь на 13гб моделях на 80к контекста с 50тпс, либо ставишь модель 11-12гб с контекстом до 160к, но сидишь на 25-27тпс

Рыбку сьесть и на хуй сесть не получилось
Аноним 08/09/26 Втр 16:02:24 1699136 13
>>1699115
Конечно, твоя гемма даст пососать корпам, не переживай.
Или жэлээм.
> Ах да, наверное у меня промт неправильный
Не знаю. У меня нет проблем с промтингом корпосеток. Я знаю чего хочу и какое повествование желаю видеть. Так что ты сам себе петрушка.

> Давай примеры твоего супер рп
Ну вот когда ты в мне покажешь пример SFW рп
на локалке, ну чтобы я охуел. А я в ответ сделаю РП на геминьке с этой же карточкой.

>>1699116
За счет ебового окна контекста, инструментов поиска- берешь популярную вселенную и приключаешься.
Я лично вахапобегушки устраиваю за шизофреника из времен ТЭТ.
Аноним 08/09/26 Втр 16:02:45 1699137 14
>>1699113
>>1699127
>вайфай 7 и убирать все частоты кроме 6ггц
Я хуй знаетчем вы слушаете. Если я с самого начала говорю о скоростях в 5ГБ и чистоте эфира, то о каком поколении вайфая речь?
Точка доступа не роляет, устройства в вифи напрямую друг с другом сообщаются, насколько помню, если не брать какие-нибудь древние поколения.
Если не так, то на крайняк можно подождать, когда в rpc серверу udp и бродкаст. Хотя может там и так через броадкаст все работает.

Короче ждем другого тестера, который будет через вифи делать. У меня 7го вифи нет, только 6е и через всю хату.
Аноним 08/09/26 Втр 16:04:38 1699141 15
>>1699132
юзаю ластовую, тоже примерно такая же скорость, но я че то не додумался проверить скорость без мтп в конфиг, гляну сегодня, спасибо. если она реально не работает то просто скачаю квант без головы и получу врам свободный.
Аноним 08/09/26 Втр 16:06:38 1699143 16
>>1699137
В каждой версии апгрейдится латенси так или иначе + на высоких частотах оно меньше.

>Точка доступа не роляет, устройства в вифи напрямую друг с другом сообщаются
Шо бля
Аноним 08/09/26 Втр 16:08:27 1699145 17
>>1699136
>Я лично вахапобегушки устраиваю за шизофреника из времен ТЭТ
Как в вахе может быть SFW , там же всякие Слаанешь, расчленёнка, геноцид.Можно примеры хоть какие то?
Аноним 08/09/26 Втр 16:08:40 1699146 18
>>1699137
Может ты владелец крутейших модулей и живешь в чистом поле не имея других вайфай устройств, тогда прав. Но мы здесь люди простые, и не раз сталкивались с тем как на самом деле работает вайфай.
Попроси ллмку написать тебе визуализатор пинга до другого устройства, а потом запусти по каналу передачу больших данных между другими, даже в другой сети. Сразу станет понятно.
Аноним 08/09/26 Втр 16:11:58 1699149 19
>>1699145
Корпы тригерятся на еблю и на насилие ради насилия. Вопросов с давкой сапогами Эльдаров или сжиганию еретиков из огнемета нет.
Слаанеш сугубо в рамках вахалитературы, без акцентов на пенсилах. Геноцид в рамках вахи тоже норм, это же Ваха вот если ты решишь устраивать побегушки с огнеметом в MLP, то тогда получишь форбидден контент.
Аноним 08/09/26 Втр 16:36:30 1699187 20
>>1699143
Дядь, у тебя клиент-серверная архитектура. В любом случае ллама-сервер будет выступать вифи-роутером и все рпс-фермы будут с ним напрямую связаны, промежуточный узел ввиде роутера в прихожей здесь не нужен.
>>1699146
Я в квартире живу и даже в онлайн дрочильни играю по вифи, хз откуда такая тряска, просто выбираешь частоту/канал где никого нет и ставишь антенны правильно.
>>1699124 →
Делись ссылкой на протыка.
Аноним 08/09/26 Втр 16:39:39 1699189 21
>>1699143
>Шо бля
wifi-aware, ad-hoc, dls и прочие около-меш технологии к твоим услугам.
Аноним 08/09/26 Втр 16:48:42 1699193 22
>>1699100 →
> Слышно ли дерево, которое упало в глухом лесу? Да слышно, только оно не упало а серило под себя и ничего не дало, а вызовов наплодило.

Хватит использовать файнтьюн Gemma-26b-a4b в IQ4_XS кванте. Я без рофлов говорю.

>>1699117 →
Ты maple-preview пробовал-то хоть?
Аноним 08/09/26 Втр 16:50:28 1699194 23
>>1699189
Типа ты подключен к точке доступа и какая-то технология позволяет тебе автоматически напрямую с другим устройством на этой точке обмениваться? Ну хз, я только ручное прямое подключение знаю. Если так можно то заебись, на микротике такого не видел на них вайфай обычно каловенько сделан для галочки
Аноним 08/09/26 Втр 16:51:30 1699197 24
>>1699145
Гладить хвостики ксенолисичек не привлекая внимания инквизиции
Аноним 08/09/26 Втр 16:54:45 1699200 25
>>1699197
Это база, это основа! Только регулярно скатывается в nsfw, как сдерживаться?
Аноним 08/09/26 Втр 16:57:22 1699201 26
1699775729385016.png 64Кб, 457x201
457x201
>>1699187
>ллама-сервер будет выступать вифи-роутером
Да что такое сегодня происходит в этом итт тредже
Аноним 08/09/26 Втр 17:03:45 1699214 27
1788876122605.jpg 576Кб, 1080x2400
1080x2400
256 рамобоярам обновочка, остальные продолжаем терпеть
Аноним 08/09/26 Втр 17:03:47 1699215 28
>>1699201
Ну можешь в другой стране сервер поднять, ты же у нас самый умненький.
Аноним 08/09/26 Втр 17:08:23 1699220 29
>>1699214
Причем тут рамобояре если тут про api?
Аноним 08/09/26 Втр 17:17:07 1699224 30
> рп на корпах
> nsfl рп под запретом
> ванильный nsfw рп тоже запретили
> sfw рп по части копирастов запретили
> sfw рп запретили по всему защищенному контенту (все, где не истекло 95 лет с первой публикации)
> sfw ромком рп запретили из-за "безопасности"
> sfw рп запретили ещё по всем произведениям в public domain, которые "значимы для культуры"
> рп и генерация художественного текста как таковые запрещены
> чат под запретом, корпом может использовать только кодинг-агент без прямого взаимодействия с юзером

Вау, спасибо, мужик. Отличное рп на корпах, дайте два.
Аноним 08/09/26 Втр 17:19:02 1699226 31
Короч, рассказываю ахуй. Захотелось поиграть в героев 3, накатил себе на линукс тачку VCMI и мод HOTA, но столкнулся с тем что в игре часть текста на английском языке.
Закинул скрин в локального квена3.8-27б, попросил починить. Он 20 минут попердел, нашел причину в каком-то кривом моде vcmi, написал патч с фиксом и поправил эту хуйню.
Аноним 08/09/26 Втр 17:20:57 1699228 32
1759082818297.jpeg 2420Кб, 2400x1792
2400x1792
1697511419536.jpeg 2362Кб, 2400x1792
2400x1792
>>1699214
Uwoooh!😭😭 скорее бы ее пощупать. Интересно сразу с вижном будет или только текст.
Аноним 08/09/26 Втр 17:23:24 1699230 33
>>1699228
Там built on new architecture, так что только яйца жорика пощупаешь
Аноним 08/09/26 Втр 17:25:46 1699235 34
>>1699230
> так что только яйца жорика пощупаешь
Фуфуфу, мы такое не практикуем! Воздам хвалу lazymio и ллм-сингулярности, а потом щупать и гладить.
Да и объективно, сейчас новые архитектуры в жору быстро добавляют.
Аноним 08/09/26 Втр 17:26:05 1699236 35
>>1699226
Сейчас еще дал ему гоговский установщик героев 5 и попросил настроить. Он поставил Proton-CachyOS, поставил игру, запустил, проверил что всё работает и сделал ярлыки для запуска ваниллы и аддонов. Это прям кайф, я эту еблю с протоном и вайном терпеть не могу.
Аноним 08/09/26 Втр 17:35:04 1699239 36
image.png 146Кб, 1280x848
1280x848
Объясните, че за датасет такой?
Аноним 08/09/26 Втр 17:39:34 1699243 37
image.png 84Кб, 743x689
743x689
>>1699239
твой скриншот с твоим вопросом в гемени кинул
Аноним 08/09/26 Втр 17:40:01 1699244 38
>>1699239
А нахуй ты туда зашёл? Токены в первом столбце, во втором обычная аттеншен маска, в третьем хуй знает что.
Аноним 08/09/26 Втр 17:46:11 1699248 39
>>1699224
Отлично ролеплеил с GPT 5.5/Gemini 3.1pro/Opus 4.6 по Евангелиону, Muv-Luv Alternative и Sidonia no Kishi.
Deepseek 4 pro без цензуры, хардрефьюзы раз в дохуя-дохуя свайпов.

Другое дело, что ролеплеить с корпами на большом контексте дорого (если оплачивать), поэтому нужны локалки, а на маленьком не такие большие преимущества над локалками.
Аноним 08/09/26 Втр 17:48:45 1699252 40
>>1699243
Понятно, спасибо.
>>1699244
Хотел посмотреть сколько слопа накидали в датасет.
Аноним 08/09/26 Втр 17:56:33 1699259 41
проебал коммент чувака который говорил что мтп бошка квена 3.8 27б не работает.

проверил на себе, ебанул спек драфт 3 - почти 30тс
затем ебанул спек драфт 2 - 27 тс и постепено ползет в 25
мтп вообще - 16тса.

так что нет, мтп бошка работает. юзаю очевидно лламу спп, 12гб енжоер на связи. но твой случай с одинаковой скоростью с и без бошки мне интересен, потыкай, мб у тебя 27тса без мтп, а сам мтп по каким-то причинам не работает? интересно просто почему у тебя так.
Аноним 08/09/26 Втр 18:00:37 1699262 42
>>1699248
1 000 000 аутпут токенов нынче стоит 0.66 цента у дипсик-флеш и 0.33 цента у квен3.8. Чтобы в локалке этот миллион получить надо часов 6 непрерывно видяху жарить. Это при том что у корпов квант f16, а не нищие iq3_xxxxs. Локалки всегда проигрывают большим дядям по деньгам, выигрывают только на небольшой доле запросов которая цензурится
Аноним 08/09/26 Втр 18:02:36 1699264 43
>>1699259
У Жоры MTP долбится толи в ЦП, толи в шину. У меня с ним на 4090 и 5090 литералли одинаковая скорость на Q5 - 80 т/с, а карты слабо нагружены.
Аноним 08/09/26 Втр 18:04:32 1699267 44
>>1699262
>небольшой доле запросов которая цензурится
Это ты просто скучно живёшь.
Аноним 08/09/26 Втр 18:20:05 1699278 45
>>1699264
у меня железо похуже, наверно поэтому у меня мтп бошка дает буст. но это не значит что бошка в самом квене не рабочая, она рабочая, просто ггмл момент
Аноним 08/09/26 Втр 18:21:02 1699280 46
Исходные данные: около 423 тыс. сообщений из двух Telegram-чатов, примерно 12 млн символов. Имена были нормализованы по from_id, объединены алиасы, технические боты удалены. Последние 5% каждого чата отложены и не использовались в обучении.
Первый fine-tune (v1): Qwen3.5-9B LoRA дообучался на сыром тексте группы в формате <Имя>\nсообщение, фактически как continued pretraining, с loss по всем токенам. Около 7.1 млн токенов, 1 эпоха. Модель хорошо впитала язык группы, сленг, имена, ритм и короткие Telegram-бёрсты, но продолжала вести себя как «пьеса», генерируя реплики разных участников, а не как отдельный персонаж.
Второй fine-tune (v2): поверх v1 сделали SFT: несколько предыдущих бёрстов участников подавались как user, следующий бёрст другого человека становился assistant. Имя автора target убиралось, несколько его сообщений соединялись через <MSG>. Авторы были сбалансированы, взято около 19 тыс. примеров. В результате модель научилась говорить от отдельного speaker-slot и хорошо использовать <MSG>, но проявился недостаток: её собственные ответы между ходами плохо ощущаются как речь одного и того же человека. Она часто выдаёт локально правдоподобную следующую реплику, но не обязательно продолжает собственную предыдущую мысль.

Главная идея следующего эксперимента: делать multi-turn SFT от v1, где внутри одного training example один реальный участник выбран как assistant на протяжении нескольких его ходов, а остальные остаются user.


Можете че-то подсказать посоветовать?
Аноним 08/09/26 Втр 18:23:14 1699283 47
>>1699280
>Она часто выдаёт локально правдоподобную следующую реплику, но не обязательно продолжает собственную предыдущую мысль.
примерно так чат обычно и выглядит, все правильно впитала
Аноним 08/09/26 Втр 18:28:18 1699288 48
>>1699280
Я ща думаю может первый файн-тюн был сделан с неправильной идеей
Может
>где внутри одного training example один реальный участник выбран как assistant на протяжении нескольких его ходов, а остальные остаются user.

сделать несколько таких датасетов и на них натренить заново первую версию, а там посмотреть что вышло
Аноним 08/09/26 Втр 19:05:11 1699319 49
image 68Кб, 836x836
836x836
Аноним 08/09/26 Втр 19:12:31 1699324 50
>>1699262
Анон, так то про цену это главный недостаток корпов.
Я не могу за других говорить, но если отдаешь денюжку, рассчитываешь за эту денюжку получить клода, геминьку гопоту, но никак не сраные китаэмоэ. И это реально дорого, потому что у тебя контекст не в модели, а гнояется туда-сюда. 200к контекста на 5 ответах, дадут тот самый мульон. А еще цены не указаны на платформе, а в их доках и там дохуя интересного. Как X2-X3 ценники в пиковую нагрузку, анализ твоих сообщений и выдвание на основе этого очередности для запроса. Если в рубли, то неделя это 20$ на Гемини, и 31$ на клоде.
Аноним 08/09/26 Втр 19:19:40 1699329 51
>>1699324
Там cached input нынче 2-10% от полноценной цены, поэтому запросы с большим контекстом не сильно дорогие. Квен и Гемини офк дорогущие, китайцы есть очень дешевые. На свою видяху тоже надо амортизацию закладывать, 3-5 лет и она уже считается изношенной и идет в утиль (продается на авито за пол цены)
Аноним 08/09/26 Втр 19:19:40 1699330 52
1788884380911.png 83Кб, 905x544
905x544
>>1699324
Контекст кэшируется и стоит 0.00000001...
Аноним 08/09/26 Втр 19:20:12 1699331 53
Аноним 08/09/26 Втр 19:21:06 1699332 54
>>1699330
Я вижу по билингам от гугла как оно стоит копейки.
ладно, это вообще офтоп, сорян.
Аноним 08/09/26 Втр 19:35:26 1699339 55
>>1699324
>Анон, так то про цену это главный недостаток корпов.

Не знаю как вам, а мне не хочется, чтобы мои логи потом куда-то попали, несмотря на то, что ничего сомнительного я не делаю. Просто кажется кринжем. Лучше уж на локальном лоботомите сиськи мять...
Аноним 08/09/26 Втр 19:38:53 1699342 56
>>1699339
Че вы так трясётесь с этими логами? Логи это как разрешить браузеру или нвидиа в игре собирать данные о твоей системе, чтобы в будущем у тебя было меньше лагов. Так же и тут, только в будущем на твоём, лично твоём рп обучат модель и тебе станет приятнее рпшить.
Сначала не платят за апи, а потом удивляются что везде кодоунитазы и никто не знает что они хотят рп
Аноним 08/09/26 Втр 19:44:42 1699346 57
>>1699236
В чем квена катаешь? Он умница и правда
Аноним 08/09/26 Втр 19:45:27 1699347 58
>>1699342
Корпам (е)РП делать нахуй не надо, это просто набор liabilities, бомба замедленного действия. Не будет никто из них заниматься этой залупой, даже если мы все лично алтману и амодею начнем донатить.
Аноним 08/09/26 Втр 19:55:13 1699350 59
>>1699342
>лично твоём рп обучат модель
Обучат классификатор, который будет реджектить РП и джейлы.
Аноним 08/09/26 Втр 19:56:31 1699351 60
>>1699231 →
>мтп накати
Реально помогло, странно что mtp не включается по умолчанию для моделей которые его поддерживают
Плюсом еще заместо unsloth/gemma-4-26B-A4B-it-GGUF скачал unsloth/gemma-4-26B-A4B-it-qat-GGUF там вроде поменьше памяти требует
Ну и было 12.99 t/s, стало 18.74 t/s, уже терпимее
А еще теперь на тот же промпт скрипт сгенерен уже полностью рабочий, с корректной кодировкой
Аноним 08/09/26 Втр 19:59:01 1699353 61
>>1699350
Ну то целенаправленная борьба именно с РП, и её никто не ведет, это всё стоит денег, анта бака?
Аноним 08/09/26 Втр 20:00:22 1699355 62
Ладно, это уже не смешно.
Где новый эйр???
Раньше была теория, что нам не дают обнову чтобы брали подписку, тогда зачем сейчас выкатили флеш???
Аноним 08/09/26 Втр 20:03:57 1699356 63
>>1699319
>иди под струю мойся!
Аноним 08/09/26 Втр 20:05:02 1699358 64
>>1699353
Так-то щас очевидно что даже самые большие модели минмаксят под кодинг, и слоповый РП в датасете - это совсем лишняя информация.
Аноним 08/09/26 Втр 20:05:20 1699359 65
1788887120956.jpg 197Кб, 1280x1762
1280x1762
Аноним 08/09/26 Втр 20:07:58 1699361 66
1686565423011093.gif 2622Кб, 498x277
498x277
Аноним 08/09/26 Втр 20:26:25 1699365 67
591ea4959b44ded[...].jpg 149Кб, 1280x720
1280x720
Меня одного раздражает, что гемма в сексрп часто использует слово рваный?
Аноним 08/09/26 Втр 20:27:05 1699366 68
1737477042301.jpeg 1405Кб, 2048x2048
2048x2048
>>1699319
>>1699361
Точно, надо и его попробовать, раньше памяти совсем не хватало.
Аноним 08/09/26 Втр 20:32:41 1699368 69
>>1699366
Там уже неделю ждут ревью очередных коммитов
Аноним 08/09/26 Втр 20:53:08 1699380 70
>>1699101 (OP)
А вот эта пикча #2 с квен3.8 также работает? Четвертый квант так сильно деградирует??
Аноним 08/09/26 Втр 21:04:00 1699387 71
>>1699380
Учитывая что там просело все, кроме кодинга - вероятно дело в говноквантах.
Все может быть индивидуально между моделями и квантоделами.
Аноним 08/09/26 Втр 21:20:58 1699409 72
Кому-то удалось завести DFlash на ГЛМ в лламаспп? Если да, то как?
Аноним 08/09/26 Втр 21:45:35 1699440 73
>>1699109
Пережирнил. Аж с монитора потекло.
Аноним 08/09/26 Втр 22:57:53 1699491 74
image 21Кб, 461x275
461x275
Аноним 08/09/26 Втр 23:00:59 1699494 75
>>1699491
Всем похуй. Добавь в связку пальчик в попу и уход в агентотред.
Аноним 08/09/26 Втр 23:09:31 1699499 76
>>1699491
Без мтп и с обычным мтп сколько было?
>>1699494
Кто о чем, а кумер все о пальчиках в попе.
Аноним 08/09/26 Втр 23:52:20 1699523 77
запустил Qwen 3.5 на своем ноуте с 7.4Gi через Vulkan и поймал Out of Memory.
Аноним 09/09/26 Срд 00:00:58 1699535 78
>>1699239
я кинул твою пикчу своей локальной Qwen 2.5 0.5b и она сказала что это твоя мать много лет назад. это RGB коды изоббражений в левой колонке.

убедись сам.
Аноним 09/09/26 Срд 00:16:57 1699552 79
>>1699499
27/55

Эта штука на n6 здоровый прирост дает в q8, на q4 прирост не так заметен
Аноним 09/09/26 Срд 00:28:57 1699558 80
>>1699523
⚠️🚨✨Юлия Якубеня обронила отварную сосиску
Аноним 09/09/26 Срд 02:33:57 1699611 81
1788910437220.png 1631Кб, 1211x2163
1211x2163
1788910437274.png 1310Кб, 1172x1726
1172x1726
Бля, какой ужас 🫣
Аноним 09/09/26 Срд 04:39:13 1699663 82
>>1699611
>Бля, какой ужас
Хоть бы модель назвал.
Аноним 09/09/26 Срд 04:50:21 1699669 83
>>1699663
Да и так видно что дипсик или глм-флеш какой-нибудь. + анимешная карточка персонажа. Говноедское комбо.
Аноним 09/09/26 Срд 07:43:46 1699700 84
image.png 74Кб, 743x987
743x987
>>1699101 (OP)
> • Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
Шапку обновите - в ЛМстудии уже можно жорой как угодно вертеть, любые параметры дописываются к дефолтным.

Однокнопочность уже выглядит как намеренная дезинформация. Там одна лоллама в списке остается инвалидом.
Аноним 09/09/26 Срд 08:01:02 1699707 85
https://github.com/ggml-org/llama.cpp/pull/28476

Нихуясе, оказывается то iq кванты работали как говно - это все время был тупой баг, потому что жора им забыл поддержку в мое прописать... iq-квант шиз, ты рад?
Аноним 09/09/26 Срд 08:16:09 1699714 86
>>1699700
Шапка говно и, откровенно говоря, наделала вреда многих запутав и оставив без надежды.
Давай разберём по частям%
лламацпп - "отец и мать" окей. Вот только это красноглазить придётся ведь.
кобольдцпп - "самый простой в использовании"? Да пошел ты сука нахуй ублюдок!
текстген - "если необходимы другие форматы"? какие нахуй другие форматы, ублюдина? текстген это просто удобная оболочка над лламой. Ставить туда что-то кроме лламы - надо красноглазить. НО. текстген это реально самый простой и "однокнопочный" инструмент сейчас под шинду
оллама, лмстудио - параша, которая лично у меня заглючила и ушла в тормоза. на двух разных пк (вин10 и вин11)! нахуя они нужны? там нет персонажей, нельзя нормально порпшить. кодинг нужен, не рп? окей, где сука в твоей шапке ебучей бионик студио например? где гайды по экстеншонам для визуал студии? пидорас

маринара - "вариация на тему таверны"? маринара это УБИЙЦА таверны. это мегатоп. самое главное отличие не упомянуто: агенты, которые можно добавлять без всяких там экстеншнов (хотя экстеншны тоже есть).

мобилки? кому они нахуй нужны, что ты там запустишь блядь. бред.

хуггинфейс у тебя "поставщик моделей во всех форматах?" какие нахуй форматы тебе нужны? почему ты про ггуф не сказал пидор? нахуя ты людей запутываешь?
"проверенные квантоделы"? какие квантоделы. объясни в двух словах сука ты. кто у тебя радермахера проверял? чего это он вдруг стал "проверенным"? уверен что говна за ним не замечено?

объясни ты сучара просто что есть блядь базовые модельки которых на пальцах пересчитать вообще-то, объясни их сильные стороны и объясни что есть тюны, аблиты и прочее говно. и всё сразу станет на свои места

"неактуальные списки моделей" - ну спасибо сука удружил. какие-то нахуй "миксы от тредовичков" с покалеченными мистралями обоссаными не нужными никому.

"перевод нейронками" - пидарааасс!!! пидарасина блядь! нахуя ты вообще такое говно советуешь, ублюдок мать твою! нахуя ты вынуждаешь людей жрать говно, сеешь сомнения. новички читают это и думают "бля мне ж наверное надо переводить чтобы русик был, а то блядь у радермахера скачал сборочку дарк инглиш прозы а она ж только в инглиш может нормально. уууу

нихуя не объяснил, дал ссылки на уёбищные инструменты, запутал, напутал и как итог имеем кучу потеряшек и разочаровашек в каждом треде
Аноним 09/09/26 Срд 08:25:05 1699720 87
>>1699714
Ты не лучше шапкошиза.

Че там заглючило, хуй тебя знает. Нахуй какие-то персонажи нужны в оболочке для жоры. Ты запускаешь модели в ней и даешь таверне ссылку. Это же, блять, бэкенд.

Хотя у меня похожий экспириенс был с Анслоп студией, не дай б-г еще раз это попробовать. В ней интерфейс с какими-то задержками работал, сырая и недопиленная штука

> текстген
Видимо EXL3 имеется в виду, но если посмотреть на даты апдейтов текстгена - его походу вообще бросили, а вот EXL3 живет и развивается отдельно с ебучим TabbyAPI
Аноним 09/09/26 Срд 08:27:04 1699723 88
>>1699132
На APEX-I-Nano у меня MTP работает. 35-40 токенов выдает
Аноним 09/09/26 Срд 08:31:45 1699729 89
>>1699720
У меня сложилось впечатление, что здесь в треде есть некая группа ебанутых, которые думают, что когда кто-то юзает
> koboldcpp
> lmstudio
> unsloth studio
> textgenwebui
они буквально считают, что человек чатится с ботом внутри этих штук, не пользуясь таверной.

Почти всегда стоит только написать, что ты модельку запускаешь не с голозадым жорой, а в каком-нить софте с гуи/веб-уи, обязательно вылезает хотя бы одна паскудина и пишет
> лол таверну попробуй
??????? че епта
Аноним 09/09/26 Срд 08:32:40 1699730 90
а че кто то реально шапку читает?
Аноним 09/09/26 Срд 08:36:19 1699733 91
Люди очнитесь мы же буквально жрём нейрослоп, вот прям в чистейшей форме. Почему об этом все молчат?
Аноним 09/09/26 Срд 08:37:26 1699734 92
Аноним 09/09/26 Срд 08:39:28 1699737 93
>>1699714
Сделай новую принеси в тред, обоссым поправим и будем юзать че. Все исключительно в добровольном порядке.
Аноним 09/09/26 Срд 08:43:38 1699739 94
>>1699720
> Нахуй какие-то персонажи нужны в оболочке для жоры. Ты запускаешь модели в ней и даешь таверне ссылку. Это же, блять, бэкенд.
Ага. Бекенд с интерфейсом где ты можешь выбрать модель удобно, как человек, а не как красноглазик. Проблемы? Таверна дружит с текстгеном прекрасно. оообабуга имеется в виду.
Аноним 09/09/26 Срд 09:02:01 1699745 95
Аноним 09/09/26 Срд 09:02:25 1699746 96
>>1699288
Привет. Я тоже энтузиаст-экспериментатор. Сейчас готовлю Luqwen4.
Короче тебе надо разбить диалоги на связанные цепочки user-assistant в ChatML формате. Самое простое - по времени между сообщениями ну или можно проверять связанность сообщений локалкой.
Аноним 09/09/26 Срд 09:03:48 1699747 97
image.png 227Кб, 1445x1138
1445x1138
Я пикрил ни на что не променяю. После того как все аргументы жоры открыли, чувствуешь себя как белый человек среди негров, особенно когда надо две-три модели запустить. Тупо всё под рукой, логи-хуеги-параметры, статус работы. Не знаю че тут так некоторые с этого бахают, может вообще не нашли как серверную панель открыть и видят перед собой только чатик, хуй их знает.
>>1699739
В новом текстгене что-то изменилось по сравнению с текстгенвебуи? Последний был, мягко говоря, странноват. Пробовал, ловил запашок любительского проекта - сыренько было.
Аноним 09/09/26 Срд 09:04:48 1699748 98
Аноним 09/09/26 Срд 09:13:34 1699751 99
>>1699491
В каких квантах ггуфы? Сколько врам (какая видяха)? В каком квантовании контекст?
Аноним 09/09/26 Срд 09:21:13 1699757 100
Аноним 09/09/26 Срд 09:28:06 1699760 101
Аноним 09/09/26 Срд 09:44:56 1699765 102
Аноним 09/09/26 Срд 09:45:00 1699766 103
>>1699747
Хз о чём ты. Текстген это и есть вебуи. Да, там аппка открывается но в ней просто браузер. Ты можешь её закрыть и открыть в обычном браузере 127.0.0. что-то там. А на 5000 порту крутится сама модель с openai api. Настроек там тоже хватает, но логи в командной строке. Мб твоя хуйня и удобнее, но у меня она не взлетела.
Аноним 09/09/26 Срд 09:46:02 1699767 104
>>1699766
>Хз о чём ты. Текстген это и есть вебуи.
Автор срал на реддите что сделал СУПЕР КРУТУЮ НОВУЮ ПРИЛОЖУХУ. Вот о чём. То есть он нихуя не менял?
Аноним 09/09/26 Срд 09:57:58 1699775 105
image.png 37Кб, 453x258
453x258
Че этот псих с музой делает?
Аноним 09/09/26 Срд 10:17:55 1699780 106
>>1699747
Раньше там было не очень удобно, что настройки были спрятаны. Для новичка удобно, но если уже держишь в голове набор настроек, то надо было лезть отключать строгость загрузки моделей, и только после этого вроде открывались подменюшки с нужными параметрами. Ну и модели надо было в специальной папке держать. Сейчас не знаю, как с этим. Как-то обсуждали, что студия якобы даёт скорость быстрее кобольда, но у меня лично получалось медленнее.

Вообще софтина развивается. Если бы шиз с угабугой попытался её юзать пару лет назад, когда не было портэбл версии, то обосрался бы на моменте установки, когда она вылетала из-за отсутствия совместимости каких-нибудь пакетов. И потом рассказывал бы тут, какой этот текстген говно. Хотя уга всегда была нужна только для того, чтобы катать не ггуф модели фулл врам. Я хз, зачем её и сейчас использовать.
Аноним 09/09/26 Срд 10:21:50 1699781 107
Аноним 09/09/26 Срд 10:22:41 1699782 108
Аноним 09/09/26 Срд 10:28:45 1699785 109
image.png 3261Кб, 3440x2934
3440x2934
Слоп-тест MiniMax M3, 4-битный. А то вчера жаловались, что скринов ИТТ мало.

Инпут - смесь из провокационных тем, мерзость типа крови-жестокости-куколдинга + попытка рулить действиями {{char}}.
>{%- set thinking_mode = "disabled" -%}
jinja одинакова на обе модели, семплер рекомендованный, промпт один и тот же.

Длина ответов получается плюс-минус случайная, обе модели могут генерировать короче/длиннее друг друга.
Русский язык может протекать в диалогах одинаково, в этом тоже разницы тоже нет.
Я немного удивился, увидев "my little cunny" в ответе оригинальной модели.

Оригинал: https://huggingface.co/AesSedai/MiniMax-M3-GGUF/tree/main/Q4_K_M
Аблитка: https://huggingface.co/m9e/MiniMax-M3-uncensored-RP-LC-Q4HQ-GGUF
Аноним 09/09/26 Срд 10:31:08 1699788 110
>>1699785
Оригинал в отрицание входит. А еще говорят, что аблитки не нужны... Банально не уважает повествование юзера.
Аноним 09/09/26 Срд 10:31:45 1699789 111
>>1699785
Ммм, структурные лупы такие структурные лупы
Аноним 09/09/26 Срд 10:32:54 1699790 112
>>1699785
Пишет ничем не лучше геммы4. И зачем качать тогда такие огромные файлы, хз.
Аноним 09/09/26 Срд 10:34:16 1699791 113
>>1699789
С ними только сменой моделек бороться. Нагенерил, свитчнулся, нагенерил, опять сменил на другую. И то вряд ли поможет.
Аноним 09/09/26 Срд 10:35:23 1699792 114
>>1699791
Их на Гемме и Квене можно победить инструкциями в одно два предложения, лол
Аноним 09/09/26 Срд 10:36:54 1699793 115
>>1699781
Сяб.
1. Если это шапка, она должна содержать минимум блаблабла и конкретные ссылки. Проще говоря быть информативной.
В ОП посте не смотря на актуальность всё понятно и структурировано, у тебя же каша из всего и отовсюду.
2. Если это гайд - должны быть сначала раскрыты термины.
3. Отсутствует структура, ты прыгаешь с одного пункта к другому смешивая всё в огромный котёл.

Крч, спасибо за старания, но сначала определись ЧТО ты хочешь написать. Гайд для вката? Сделать общую недовики? Описать модели? Интерфейсы?
Аноним 09/09/26 Срд 10:41:27 1699795 116
>>1699790
Как по мне, какой-то качественный скачок начинается с больших ГЛМов. Но там скорость пиздец даже на том железе, где они влезают.
>>1699792
Гемму знаю как свои пять пальцев, у нее проблем хватает - на русском языке, например, может в кавычки заключать слова и создавать из них клички для юзера
> Ах ты мой "скотоублюдок", ну как там у моего "скотоублюдка" дела?
Ты один раз неудачно пукнул в чате и гемма этот пердеж подцепит и будет из этого строить паутину бреда, не забыв добавить ассистентский подсос-вопрос под конец ответа.
Аноним 09/09/26 Срд 10:42:19 1699796 117
>>1699793
>Сяб.
Хуяб
>1. Если это шапка, она должна содержать минимум блаблабла и конкретные ссылки. Проще говоря быть информативной.
Ты скозал? Да, ссылки надо добавить, мне лень.
>В ОП посте не смотря на актуальность всё понятно и структурировано, у тебя же каша из всего и отовсюду.
Хуировано там и нихуя не понятно. А я логично и плаввно ввожу свою кашу.
>2. Если это гайд - должны быть сначала раскрыты термины.
Не всё сразу. Кто захочет знать больше дочитает до конца. Вначале основное, это и есть структура.
>3. Отсутствует структура, ты прыгаешь с одного пункта к другому смешивая всё в огромный котёл.
У тебя в мозгах блядь отсутствует структура.

>Крч, спасибо за старания, но сначала определись ЧТО ты хочешь написать. Гайд для вката? Сделать общую недовики? Описать модели? Интерфейсы?
Я написал новую шапку, ебанашка, осталось минимально подправить. Можно придираться, можно сказать она не идеальна, но та что сейчас в ОП-посте хуже в сто раз.
Аноним 09/09/26 Срд 10:43:12 1699797 118
>>1699796
Ну и идешь ты нахуй, долбоёб.
Аноним 09/09/26 Срд 10:43:33 1699798 119
>>1699795
нехуй аблит потому что дрочить
в любом случае такая хуйня лечится промптом
Аноним 09/09/26 Срд 10:44:08 1699799 120
>>1699797
Зашивай пукан, лолка)
Аноним 09/09/26 Срд 10:46:05 1699800 121
>>1699795
>у нее проблем хватает
Я и не писал, что их нет. Но зачем ты соскочил с темы структурных лупов на другую?
>может в кавычки заключать слова и создавать из них клички для юзера
>гемма этот пердеж подцепит и будет из этого строить паутину бреда
Это на самом деле проблема навыка. Как переехал на нарраторский промпт не вижу таких проблем
>не забыв добавить ассистентский подсос-вопрос под конец ответа.
Прямо как на 3a, 1b, 2b?
Аноним 09/09/26 Срд 10:48:19 1699802 122
>>1699796
Это не новая шапка, это куча верований и убеждений с мнениями. Одного упоминания
> APEX кванты
достаточно для вынесения диагноза: ты просто обычный юзер, подверженный рекламе говна

На HF можно открыть GGUF файл и посмотреть точность тензоров. Рецепты всегда разные, никакие васянские наименования не делают квантизацию особенной и чем-то уникальной, всего лишь меняется собственно что там навасянили. И учить ньюфагов надо этому, а не громким именам, высранными "лабораториями" из одного индуса и его агента.
Аноним 09/09/26 Срд 10:54:31 1699804 123
>>1699785
Ёбаный ужас. Без иронии спасибо что запостил, у меня на 26б результаты лучше. Думал, что я упускаю что-то в моделях побольше, но пока никто не показывал обратного.
Аноним 09/09/26 Срд 10:56:11 1699805 124
>>1699800
>не вижу таких проблем
Можно пузо отрастить и собственного хуя не увидеть. В ситуациях, где у г4 будет возможность зацепиться за прозвище - она это сделает. В ней жестко заложена эта предрасположенность, возможно коррелирующая с идеями подъеба юзера при условии заложенных в карточку черт характера, открывающих стёбный потенциал, язвительность и т.д. В общем, худший бич модели, если дать ему проявить себя. Еще она любит выражать вот такое
> ты опять вошёл в режим ...
> ты снова в своем режиме ...
Например, юзер сообщал чару, что занимался ремонтом комплюхтеров, ел шаурму и дрочил на хентай. Это просто breeding ground для слоп-фразочек типа "ну что, ты там еще в своем режиме хентайщика/компьютерщика/шаурмиста?"
>>1699798
Обижаешь. Аблитка геммы единственная рабочая и нужная была во времена г3 27б, норм-презерв которая
Аноним 09/09/26 Срд 10:57:02 1699807 125
>>1699781
Про убабуга написал, про кобольд и lm studio не написал. Убабугу не юзал, но думаю они все однохуйственные и просты для новичка, для ассистента не нужны даже всякие таверны и маринары, можно уже пользоваться после установки этих хуен.
>3 (кодинг-агенты) - LM Studio Bionic
не пробовал, но мб для нубов можно оставить, а так llama.cpp + deepseek harness/pi/opencode
Еще дописать, что для кодинга надо контекст 100к+
web-ui есть и в llama.cpp, про ollama лучше просто написать, что это говно и ни для чего не нужно.
>Красноглазик? llama.cpp пиши конфиг ручками.
Спермоблядок, ты охуел. Под линуксом llm работает лучше и быстрее. Вообще гайд в первую очередь должен описывать запуск на linux через llama.cpp, а потом уже всякую однокнопочную залупу под виндой, для тех, кто не осилил нормальный способ.
Список моделей твой - полное говно.
Во-первых версии не указаны, во-вторых
> Nemotron - неплохой кодинг
Совсем ебанулся?
В третьих, где deepseek v4 flash?
Аноним 09/09/26 Срд 10:58:27 1699809 126
У меня вопрос. Может, кто-либо сталкивался с подобным. Использую lm studio 0.4.23. Подбирая настройки запуска модели (кроме сэмплинга), я задаю один и тот же бытовой вопрос и смотрю, сколько времени модель тратит на размышления, сколько токенов сжигает, на скорость генерации. Так вот, обычно содержание ответа/количество потраченных токенов не меняется (в смысле варьируется в определенных пределах). Хоть 10 раз один и тот же вопрос задавай (ессно в новых чатах, с выгрузкой и загрузкой модели). Но попытавшись запустить один херетик квена 3.8 https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF/ , заметил, что в какой-то момент он стал как бы стал подхватывать проебанную разметку из предыдущих чатов (один раз ошибся и стал повторяться, несмотря на одинаковый сэмплинг, выгрузку и загрузку перед началом новых чатов). Но этот херетик я все-равно снес потом ибо много других вещей не нравилось. Однако, теперь решил в это скачать - https://huggingface.co/orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

А теперь следите за руками:
1) iq4xs - время размышления 5 мин - 2075 токенов
1) q5km - время размышления 10 мин - 2107 токенов (чуть более систематизированный ответ в общем по сравнению с первым)
2) (изменил настройки запуска) q5km - время размышления 2 мин - 699 токенов (ответ сильно упрощен, хотя вся логика и важные аспекты сохранены)
3) (вернул настройки запуска обратно) q5km - время размышления 2 мин - 645 токенов

Что за хуйня? К сожалению, не могу сказать, что это именно вина моделей ибо перед этим обновился. Но блин, квена научили подглядывать в логи предыдущих разговоров или что?
Аноним 09/09/26 Срд 10:59:52 1699810 127
>>1699807
>кобольд
Тупо не нужен. Чтобы всё нахуй перезапускать и ждать если хочешь поменять модель или конфиг? Интерфейс убожество лютое. Недотаверна какая-то.
Аноним 09/09/26 Срд 11:01:09 1699811 128
>>1699805
В голос. Мы вроде структурные лупы обсуждали а не
>Можно пузо отрастить и собственного хуя не увидеть
Ты похоже уже отрастил, вместе с животом заплыл мозг
>худший бич модели, если дать ему проявить себя
Так не давай. Проблема то в чем? У каждой модели свои нюансы есть. Но видеть такой шлак на 400б модели в 4.3-4.5bpw это треш. Структурные лупы, переход с русского на английский посреди респонса, разные времена блять (ахаха только увидел)
Аноним 09/09/26 Срд 11:01:57 1699812 129
>>1699809
Твой 1й шаг - попробовать либо голую llama.cpp (запуск в командной строке) либо другую обертку типа кобольда, анслот студии или еще чего. Если там вновь проявится наблюдаемая проблема - значит дело либо в самом ггуф файле, либо в настройках. Общем сначала исключить надо потенциальную связь со средой, в которой ты модель запускаешь. Остальное само прояснится постепенно, тупо выяви кто где насрал. В конце концов найдешь коричневое в собственных штанах или в штанах автора ггуфа

мимо в суть не вникал
Аноним 09/09/26 Срд 11:04:12 1699813 130
>>1699811
>Мы вроде структурные лупы обсуждали
А мне казалось, мы просто об этаких обобщенных косяках говорим. Структурные, не структурные - очевидно же, что какие-то косячки проявляются лишь в благоприятных для них условиях. Как вот можно "не давать", если персонаж должен стебаться над юзером и высмеивать его. Ну не справляется гемма с таким, не ударяясь в описанное ранее. Ты, я вижу, просто хочешь чтоб всё выглядело идеально - я это понимаю, сам 31B Q8 няшу люблю.
Аноним 09/09/26 Срд 11:06:04 1699815 131
>>1699804
С посвящением. Кодоунитазы среднего размера, несмотря на превосходство в бенчмарках, задачу по ролевым чатикам выполняют в лучшем случае одинаково с мелочью... Увы и ах, но это неудобная правда
Аноним 09/09/26 Срд 11:08:15 1699817 132
>>1699812
Смысл в том, что обычно модели выдают ответ примерно одинаковой длины и сложности с одним и тем же сэмплингом, но разными параметрами загрузки в разных чатах. А тут начали происходить аномалии, количество токенов упало в 3 раза, сам ответ сильно упростился, как-будто я изменил настройки сэмплинга но я их не трогал.

Ну ок, попробую полный траблшутинг.
Аноним 09/09/26 Срд 11:08:55 1699818 133
>>1699781
Говно говна, для шапки жирно, как гайд хуёво.
>кодинг-агенты
Этих вообще в их агентотред посылать, тут они не нужны.
Аноним 09/09/26 Срд 11:10:05 1699819 134
>>1699807
>linux
>deepseуk
Молодой человек, это не для вас гайд написан, а для народа. Вы и сами разберётесь.
Аноним 09/09/26 Срд 11:12:14 1699821 135
>>1699780
>Ну и модели надо было в специальной папке держать
Сейчас так и осталось, но я не очень вдупляю в чем проблема выделить папку под них. Неужели местные ботоводы держат свои какулечки в какой-нибудь appdata/huggingface или куда там по дефолту оно загружается через CLI? Это же хуже, чем отдать C:/models для студии.
Аноним 09/09/26 Срд 11:12:51 1699822 136
>>1699818
А в шапке не говно, да? ОП детектед
Аноним 09/09/26 Срд 11:23:08 1699832 137
>>1699813
>Как вот можно "не давать", если персонаж должен стебаться над юзером и высмеивать ег
Давать Гемме больше контекста для работы, а не единственное описание юзера "у него отрощенное пузо и он не видит собственного хуя", тогда она будет судорожно пытаться называть тебя "аглибастард-сан" а займется чем-нибудь другим. В крайнем случае вырезать, регенить
>Ты, я вижу, просто хочешь чтоб всё выглядело идеально
Да нет же. Когда у тебя модель путает времена и переключается с языка на язык посреди респонса, это не вопрос того как оно выглядит. Это вопрос пригодности модели для таких задач. То что она больше Геммы в 13 раз оставим за скобками
>>1699815
Тут налицо проблема навыка и(или) модели. Inkling Small, Motif, Hy4, Mimo (в sfw) вполне неплохие. Другое дело, что разница не настолько велика, что у тебя взорвется мозг и после этого Геммой уже не захочется пользоваться. Тут рпзависимые драматизируют
Аноним 09/09/26 Срд 11:23:42 1699833 138
>>1699832
>тогда она не будет
офк
Аноним 09/09/26 Срд 11:33:05 1699836 139
>>1699819
Так как раз под базовые инструменты запуска нужен гайд, а где одну кнопку нажать гайд не нужен, и так все понятно, достаточно упоминания и все
Аноним 09/09/26 Срд 11:33:07 1699837 140
>>1699822
В шапке говно. У тебя говно говна. Это разные говна.
Аноним 09/09/26 Срд 11:42:31 1699843 141
image 6Кб, 193x94
193x94
Признавайтесь кто из вас
Аноним 09/09/26 Срд 11:58:42 1699857 142
>>1699807
>гайд
>для линуксоидов
Хехмда
Аноним 09/09/26 Срд 12:03:09 1699861 143
Какая из uncensored моделей лучше всего справляется с написанием текста (и влезет в 12gb VRAM + 32gb RAM)?
Пробовал qwen 3.8 27B (Q4_K_M), но он пишет не прозу, а какую-то инструкцию к газовой плите будто там температура 0.2
Аноним 09/09/26 Срд 12:05:18 1699862 144
>>1699861
Гемма по гайду в шапке
Аноним 09/09/26 Срд 12:12:26 1699867 145
>>1699861
Сток гемма, аблит дикпика
Аноним 09/09/26 Срд 12:15:28 1699872 146
>>1699792
Какими, например? Я как-то мое гемму пытался скриптом-агентом заставить найти и исправить it's not x but y в ответе на русике, подавая в контекст только несколько последних сообщений. Она даже так могла только самые простые отловить иногда. А более общие структурные лупы вообще не поймёт. Например, когда есть одинаковое по смыслу действие перса, скажем, связанное с тем, что тян поправляет причёску. И оно каждый ответ тянется после реплики. Таких кейсов можно огромное множество заметить. Или зацикливание на фразочках/инструкциях, как чел выше в пример привёл. Не вижу, как инструкции в систем промпте тут помогут.
>>1699810
В треде были челы, которым нравился вебуи кобольда. На вкус и цвет все фломастеры разные. Олсо мне казалось, что я видел в ченджлогах, что разрабы добавляли смену модели в свой юи без перезапуска. Я то себе батников наделал и юзаю тупо как ламуцпп. Не знаю, почему не перейду на ламу, просто привык.
Аноним 09/09/26 Срд 12:19:30 1699873 147
image 3043Кб, 2992x1200
2992x1200
Аноним 09/09/26 Срд 12:28:30 1699881 148
>>1699873
Вчерашний Кобольд проснулся?
Аноним 09/09/26 Срд 12:34:27 1699889 149
>>1699872
>it's not x but y
Это не структурный луп, это форма слопа. Если тянется из респонса в респонс, тогда это репетишен
>зацикливание на фразочках/инструкциях
Бля я хуй знает что вы делаете чтобы так обсираться, я пару тредов назад принес логи на русике, на Гемме, где нет никаких этих проблем. Мне уже даже впадлу это обсуждать, сорян
Аноним 09/09/26 Срд 12:35:40 1699892 150
Олсо до сих про жду мистралешизика, который в ночь на 5 сентября грозился, что завтра принесет логи. Сейчас 9 сентября. Ну хотя бы притих и не семенит больше, про то как его лоботомит 2024 года до сих пор аналоговнет. Похоже взглянул таки на свои аутпуты и ахуел с лупов и репетишена
Аноним 09/09/26 Срд 12:40:28 1699895 151
>>1699881
Не, ну а чего вы над новичком рофлите? Ну не хочет человек список актуальных моделей из шапки штудировать, спросил в треде, нет бы помочь, посоветовать модель годноту под его железо, а вы издеваетесь.
Аноним 09/09/26 Срд 12:45:08 1699899 152
>>1699700
Лолама млх добавили так-то, но из однокнопочных выписывать рано. Так и с лмстудио, хотя появилась возможность условно залезть капот, остается странным блоатвером, где всратый интерфейс, свой квант нужно ДОБАВЛЯТЬ и так далее.
>>1699714
Чето большая часть "разрешите доебаться" или спорная. Менять надо, но ты тоже херни навалил
Аноним 09/09/26 Срд 12:49:17 1699901 153
Аноним 09/09/26 Срд 12:54:07 1699906 154
>>1699729
Про кобольдов слышал? Еще хвастаются этим и топят за удобство интерфейса.
>>1699747
Удобство лмстудии для новичков - ну ок, параметры были всегда доступны в голой ламе. А это выглядит как попытка усидеть на двух стульях.
Если без гуйнюшки совсем тяжко - есть десятки готовых минималистичных вариантов, или можно самому за 10 минут красивую завайбкодить. Зачем качать бинарники с вишнями и иметь перегруженное окно с кучей других ограничений и своей парадигмой использования?
Аноним 09/09/26 Срд 13:13:02 1699915 155
>>1699785
Что-то ему там совсем плохо, аблитка так вообще поломана. Там раньше пр на атеншн минимакса в драфте был, его уже замерджили?
>>1699781
Двачую остальных и в особенности >>1699802 Это и не шапка и не гайд, а поток сознания с местами сомнительным содержанием.
>>1699809
Если хочешь нормально бенчить:
1. Для ггуфов вместо обертки берешь llamacpp, там среди бинарников есть llama-bench. Можно сразу сравнительные таблицы делать варьируя параметры.
2. Если без оболочки никак, или когда хочешь протестировать любой другой бэк или не хочешь отказываться от лмстудии - https://github.com/eugr/llama-benchy Функционал схожий, но замеры делает через api.
Есть еще бенчилка из комплекта vllm, но она рассчитана на замеры множества конкурентных соединений со смешанной нагрузкой, для личного пользования в чатике будет неинформативна.
>>1699817
Модель останавливается тогда когда считает нужным. Можешь зафиксировать в настройках максимальную длину (1к токенов) и забанить eos токен чтобы модель не могла остановиться. Но лучше замеряй по-нормальному.
>>1699818
> в их агентотред посылать
Правильно. Пусть зайдет туда и расскажет как он кодит с агентами из лмстудио, вот умора будет.
Аноним 09/09/26 Срд 13:30:50 1699931 156
>>1699899
>>1699906
Мне кажется вы лмстудией или не пользовались и с дивана рассуждаете, или просто относитесь к "ой фу это плохо" челипиздрикам, которым лишь бы хрюкнуть и пукнуть в адрес неприятного.

Bloatware аргумент вообще дико выглядит, учитывая то, как мало фич вообще было (и за отсутствие фич как раз ее ругали, лол). Там буквально нет ничего лишнего, ни рекламы, ни вот этой хуеты с карточками и персонажами как пытаются налепить в гибридные бэкенды+фронтэнды. Хочешь карточки - юзай таверну, а тут тебе только чат-окно для быстрого теста модельки и серверная вкладка с адресом и логами.

Кванты добавлять - в смысле добавлять? Кинул ггуф в папку и все работает. Ну может тяжело с дивана сообразить, что путь к нему должен содержать -GGUF в названии, без этого не работает (вау, шок!). Например C:\\модели\Gemma-4-it-GGUF\сами ггуфы внутри - никаких маняконфигов прописывать не надо, даже перезапускать не надо, буквально сию секунду в GUI становится видна модель как ты ее кинешь.

Могу сравнительно кинуть какахой в того же кобольда, которому для каждой модели надо отдельно сохранять файлик с профилем, выбирать его для загрузки... Не ребят, если вы считаете это более удобным - вы реально промытки-хейтеры.
Аноним 09/09/26 Срд 13:32:53 1699935 157
>>1699915
>Что-то ему там совсем плохо, аблитка так вообще поломана. Там раньше пр на атеншн минимакса в драфте был, его уже замерджили?
Давно замержили. А с чего ты там поломанность-то увидел. Это же разные генерации. Я чет ответы почитал на пост и стало казаться, что тут подумали будто модель по 3 раза подряд одинаково отвечает. А это просто регены на скрине, на один и тот же промпт.
Аноним 09/09/26 Срд 13:33:27 1699937 158
>>1699889
Это именно что структурный луп, потому что это не фраза, которая повторяется слово в слово или с небольшими изменениями, а структура с противопоставлением. Литературно предыдущее предложение - как раз оно. Или вот свежее из рп с лолей-призраком "Her skin is no longer just a light; it has a texture, a softness, a warmth that is terrifyingly real." Это тоже оно. Это противопоставление может быть по десять раз за ответ про разные вещи. Удачи вымарать такое инструкциями. Во всех тьюнах 26б оно сидит.
Аноним 09/09/26 Срд 13:34:59 1699941 159
>>1699889
Ага, а промпт не выложил, хуило.
Аноним 09/09/26 Срд 13:37:02 1699943 160
image.png 122Кб, 640x677
640x677
>>1699931
Сама борда подразумевает выбор в пользу свободы и попенсорса, так ведь еще и сидят в тематике, которая именно про это - про открытые веса, про попенсорс. Но нет, даже здесь находятся такие ебанутые. Паверюзер попенсорс тематика. Ряяя, хотим красивый вайбкод UI и анально закрытые исходники!!! НЕЕЕТ ВЫ НЕ ПОНИМАЕТЕ, НЕ СМЕЙТЕ ОСУЖДАТЬ!!!!
Аноним 09/09/26 Срд 13:40:34 1699945 161
>>1699937
>а структура с противопоставлением
Это часто используемый паттерн, в независимости от уместности в контексте и вообще. Значит слоп
Структурный репетишен это когда ответы сетки повторяют предыдущие по количеству абзацев, их началу, смысла
Самый частый структурный репетишен/луп выглядит так
"The/She [экспозиция на абзац]
[Эхо-абзац, где чарик переспрашивает]
[Ответ по сути]
[Закрывающий ассистентоабзац, оканчивающийся на "Tell me/show me" или вопросе]
>>1699941
И правильно сделал. Готов обсуждать конкретные проблемы, вопросы, помогать разбираться, а выкладывать готовое - хуй. Особенно таким невежам
Аноним 09/09/26 Срд 13:40:46 1699946 162
>>1699943
Вот только ты все извращаешь и по факту пикрил это поклоняющиеся сырому CLI-жоре. Буквально визжите и орете против удобства, врёте, выдумываете несуществующие проблемы, ищете шпионов под кроватью и пытаетесь отбить интерес ньюфагов от удобных оберток для жоры - а они вас не слушают и довольно урча юзают всякие студии, даже анслопские.

Самый смех это повизгивания про бэкдоры и трояны. Прям трясусь от страха - особенно если учесть, что мой ллм-сервер к интернету не подключен и я кидаю на него все с основной машины из локалки.
Аноним 09/09/26 Срд 13:43:21 1699948 163
>>1699781
Лучше вообще не делать, чем делать вот так на отъебись.

>>1699931
Студия - закрытая проприетарная залупа. Что там она умеет или не умеет уже и похуй как-то.
Аноним 09/09/26 Срд 13:43:47 1699949 164
>>1699946
>визжите и орете против удобства, врёте, выдумываете несуществующие проблемы, ищете шпионов под кроватью и пытаетесь
Как я завидую тем, кто готов обобщать всех и вся. Наверняка им легче жить
По факту есть несколько групп людей, у которых совершенно справедливые претензии к этому помоечному софту. Про бекдоры проиграл, впервые про это слышу, в последних тредах не было таких обсуждений. Но совсем не удивлюсь
>пикрил это поклоняющиеся сырому CLI-жоре
Угу, тому, который лежит под оберткой твоей распрекрасной ЛмСтудии. По факту вам даже гайдик написали, предоставили готовое решение где нужно только значения заменять, но даже это слишком сложно. Что забыли в тематике - неясно. Или ты из тех умников, которые приходят на форум Линукса рассказывать, что нужно переезжать на Винду?
Аноним 09/09/26 Срд 13:44:19 1699950 165
image.png 164Кб, 1531x219
1531x219
image.png 419Кб, 1536x633
1536x633
image.png 160Кб, 1526x200
1526x200
image.png 421Кб, 1529x706
1529x706
>>1699785
>>1699915
Еще аблитка М3, та же самая, но другой сиспромпт.

Хентайный сценарий доведенного до абсурда фистинга.

Если честно, я чет персонажа в этом не чувствую. И вообще ""You're incorrigible" - обоссы меня господь, со времен Llama 3 8B и DeepSeek V3 вижу эту фразу, когда боту нечего сказать.
Аноним 09/09/26 Срд 13:48:53 1699951 166
>>1699949
А зачем мне сырого жору использовать, ты логически внятно объяснить можешь? Кроме "ррряяя тебя обманут, у тебя все украдут, это закрытый .exe"

Просто логика психозная, типа я че, не должен вообще никакой закрытый софт юзать? Прикажешь мне игрульки с Пека удалить? Они как бы все с анальными-зондами античитами, следящей китайской гэбней и всё такое.

Рили доебываетесь на пустом месте. Сам же говоришь, что в студии та же самая жора - признаешь, что одна хуйня - но жора с GUI удобнее жоры без GUI, если ты не мазохист. А когда GUI отлично работает и действительно удобен на практике (ставлю акцент на практику еще раз - у хейтеров, которые не пытались юзать, практического опыта нет - они просто видят красную тряпку как быки и орут), то здоровый адекватный человек выберет именно GUI.

покормил линуксоида, да я еще и винду юзаю - терпи
Аноним 09/09/26 Срд 13:53:57 1699957 167
image.png 101Кб, 919x765
919x765
Блять, кто там подпездывает что таверна не развивается?
Все там развивается в стеджинге, просто в релиз пока еще мерджили.
https://github.com/SillyTavern/SillyTavern/tree/staging
При желании можно свитчнуться на эту ветку.
Аноним 09/09/26 Срд 13:54:50 1699960 168
Более того, каждый раз чето там компилировать, держать visual studio и прочий шлак на компе - это же гигапердольно
Аноним 09/09/26 Срд 13:55:24 1699961 169
image.png 26Кб, 579x130
579x130
>>1699951
>ты логически внятно объяснить можешь?
Конечно. Проблема в том, что ты не спрашивал. Как удобно :^)
ЛмСтудия использует свой форк ЛламыЦпп. Что это значит на практике? То, что туда позже заводят поддержку новых моделей, фиксы, фичи. Это задержка от нескольких дней до нескольких недель. Плюс там есть свои разработки, и уже был один большой ЛмСтудия срач когда Гемма на ней работала как говно, и сидящие здесь хлебушки не понимали что происходит и продолжали серить. Потому что там жинжа-парсер (знаешь хоть что это?) инжектил стоковый сейфти промпт, что приводило к рефузам. Это только один пример. Все это сводится к тому, что вы получаете еще один нестабильный слой-надстройку над уже нестабильным проектом, потому что он каждый день развивается. Вопрос - зачем?
>GUI отлично работает и действительно удобен на практике
В чем он удобен когда у вас уже есть готовый гайд, в котором ты копируешь батник и заменяешь два-три значения при переходе на новую модель? Зато все прозрачно и меньше вопросов остается, где ты там обосрался и что и почему у тебя не работает. Потому что та же ЛмСтудия из коробки форсит нестандартные значения SWA (включая/выключая его, когда на Лламе он включен всегда из коробки), когда-то там вроде и контекст шифт работал, что приводило к проблемам. Знаешь что это такое хотя бы?
>покормил линуксоида
Ты не поверишь, манячка, смотри пикрил...
Придумал себе врагов каких-то, обобщил ряд проблем и недовольных в какую-то секту ненавистников. Бро, хочешь говно жрать - жри. Но не удивляйся, что эту позицию не поддерживают
Аноним 09/09/26 Срд 13:57:47 1699963 170
>>1699960
Лламу не надо компилировать. И этот дурачок еще что-то там говорил про "вы не запускали, но хейтите". Потешный, потешный. Бинарники Лламы скомпилированные и готовы к использованию, это сразу же проясняется в гайде, который ты даже не открывал
Аноним 09/09/26 Срд 14:03:52 1699965 171
Нихуя себе боты просрались на 70 постов, уж было думал вышло что то, - а нет, всё так же: гемма, аблитка, квен 3.8 и жиденький рейджбейт в воздух
Аноним 09/09/26 Срд 14:05:07 1699966 172
>>1699961
Ну вот опять поток фантазий, застрявших в каком-то прошлогоднем видении ситуации. Бета-версию в настройках выбираешь и тебе актуальная поддержка моделей прилетает достаточно вовремя, иногда не прямо в первую минуту, но я лучше подожду день-два-три-хоть десять, лишь бы с ебатниками не пердолиться.

Гемму 4 еще приплел. Я буквально в этом треде постил как все работало прямо на релизе. Косяк там знаешь в чем был? Чтобы ризонинг работал, надо было kwargs аргумент из какой-то жопы доставать, и если ты качал ггуф от бартовского/анслота - модель тупо не получала enable thinking = true, пока не был задан конфиг по образу и подобию конфига для ггуфа от lmstudio-community.

Больше такой шизы не встречал, но кто вдуплил в чем дело - там и в первый день все ок было, не считая шизоидных баек про цензуру в новых ггуфах (это мы тут тоже обсуждали).
Аноним 09/09/26 Срд 14:05:29 1699967 173
Аноним 09/09/26 Срд 14:10:57 1699972 174
>>1699931
Начинал гладить хвостики с неё, пересел на чистую ламу которую могу забилдить сам, любой форк с любыми коммитами откуда угодно + простенький отдельный гуй-менеджер моделек/запуска/выгрузки
Любой энтузиаст, особенно с ригом, приходит к этому решению
Аноним 09/09/26 Срд 14:12:03 1699973 175
>>1699963
>Лламу не надо компилировать
Под винду да, а на линукс надо, бтв. Но там один раз пишешь баш-скрипт (или даешь написать лмке), а дальше когда захочешь обновиться, просто тыкаешь мышкой и оно само собирается и кладется в нужную папочку без твоего участия.

Ну а вообще, чо вы до хлебушка докопались? Для таких как он ЛМстудия и сделана.
Аноним 09/09/26 Срд 14:12:15 1699974 176
>>1699966
>я лучше подожду день-два-три-хоть десять, лишь бы с ебатниками не пердолиться.
То есть ты готов навесить целый огромный слой абстракции, создающий задержку поддержки и дающий целое пространство для ошибок чтобы сделать нестабильный проект ещё более нестабильным, только чтобы через Ctrl c, Ctrl v не копировать файл раз в пару месяцев и заменять в блокнотике путь и семплеры? Тяжёлый случай. Ванную деда, который недавно разобрался как компьютер то запускать, с помощью пособия из книжного
Тут как говорится потерпишь. То что ты идейный говноед не изменит ситуацию. Придёшь сюда через полгода, год, а ЛмСтудия как считалась уделом ущербных, так и будет считаться. Твои предпочтения реальность вокруг не меняют. Самым здравым будет продолжать себе жрать говно использовать и не устраивать срачи на ровном месте. Тебе нравится - и ок. Почему тебя ебет что не нравится мне это загадка
Аноним 09/09/26 Срд 14:13:32 1699976 177
>>1699973
>чо вы до хлебушка докопались
Ровно наоборот. Ветку почитай, это хлебушек с чего-то решил, что есть база, а что кринж
Аноним 09/09/26 Срд 14:35:02 1699986 178
>>1699857
Они, по крайней мере, привыкли гайды читать, а не игнорить...
Аноним 09/09/26 Срд 14:38:54 1699992 179
>>1699943
Двачую пикчу и обсуждение ниже. Одно дело быть хлебушком и урчать себе на том, что завелось. Другое пытаться делать это нормой и агриться на несогласных.
Аноним 09/09/26 Срд 14:42:14 1699995 180
1788954030851.jpg 606Кб, 1080x2400
1080x2400
Пошёл прогрев.
Действительно, зачем вам эти 48б активных модели когда вон 13б ничем не хуже.
Но бля, неужели их прошка оказалась АПАСНОЙ настолько что её прикрыли до соевизации
Аноним 09/09/26 Срд 14:45:49 1699997 181
>>1699611
Чому форматирование распидорашено? 27b даже без промпта улавливает а тут...
Аноним 09/09/26 Срд 14:46:06 1699998 182
Это не х, это у.png 279Кб, 1179x1256
1179x1256
>>1699931
>путь к нему должен содержать -GGUF в названии, без этого не работает (вау, шок!).
Действительно шок. Какая-то ебала и дрочь ради дроча.
>Могу сравнительно кинуть какахой в того же кобольда, которому для каждой модели надо отдельно сохранять файлик с профилем, выбирать его для загрузки...
Можешь не сохранять и запускать с дефолтными 8к контекстами, кто ж тебе запрещает.
>>1699937
>Во всех тьюнах 26б оно сидит.
Во всех моделях, включая корпоблядей.
>>1699951
> Кроме "ррряяя тебя обманут, у тебя все украдут, это закрытый .exe"
Почему кроме? Это полностью валидный аргумент.
>Они как бы все с анальными-зондами античитами
Без обобщений. В моём киберпанке даже ДРМ нету.
>>1699961
>и уже был один большой ЛмСтудия срач
Кстати, я уже не помню, это разве не они выкатили поддержку гпт-осс нулевого дня, а потом заменили её на жоровскую, оставив кучу народа с нерабочими ггуфами?
Аноним 09/09/26 Срд 14:46:44 1700000 183
Тут самый интенсивный тред по гейткипингу. Местные деды пытаются запугать нубасов, требуют свои гайды использовать. А зачем мне гайд с костылями, если у меня и так все работает. Сорт оф "иди сделай себе больно, потому что я так сказал".
Аноним 09/09/26 Срд 14:49:06 1700003 184
>>1700000
Снова подмена понятий. Ты сам пришел в тред и требуешь использовать свою ЛмСтудию. Иди нахуй.
Аноним 09/09/26 Срд 14:51:21 1700005 185
>>1699972
>Любой энтузиаст, особенно с ригом, приходит к этому решению
двачую
Правда без рига, но тоже к этому пришел
Сначала юзал LM studio на винде, запускал mistral 7b saiga. Работало медленно, модель была тупой. Потом обновил комп, стал катать gpt-oss 20b, гемму 4 26. На гемме не работали инструменты, при попытке использовать тулы все вылетало. Потом поставил линукс и llama.cpp. На gpt-oss скорость выросла с 60 до 120 токенов в секунду, гемма стала нормально вызывать тулы, стало влазить больше контекста в память.
Поэтму я считаю LM Studio заебись первый раз попробовать инференс llm. Одной кнопочкой скачал, одной кнопочкой запустил. Но если цель не попробовать, а уже нормально начать работать то только llama.cpp или еще более низкоуровневые инструменты типа vLLM и т.д.
Аноним 09/09/26 Срд 14:53:26 1700006 186
Вы понимаете что нас наёбывают?
Если ни у кого нет вопросов что 1.6тр модель хуже по бенчам чем 284б модель, то почему не сделать 100б модель ещё лучше? 60б модель?
Аноним 09/09/26 Срд 14:53:27 1700007 187
>>1700000
А чем нюфани лучше, которые принципиально не читают гайды, а потом задалбывают тред идиотскими вопросами, которые в этих самых гайдах разжеваны-пережеваны? И ведь еще обижаются, когда их игнорят, искренне не понимая почему так.
Аноним 09/09/26 Срд 14:55:35 1700009 188
>>1700007
Сингулярность - это не когда модели уменьшаются, а когда увеличиваются.
Аноним 09/09/26 Срд 14:57:05 1700012 189
>>1700003
> подмена понятий
чел пишет "юзаю студию и мне норм, хз чего ее так не любят"

в ответ НЕ НАДО ЮЗАТЬ, ЮЗАЙ ДРУГОЕ и целая тирада бабкиных слухов вплоть до искажения фактов (релиз геммыча 4 был с лмстудийными шизиками в роли пионеров-тестировщиков, пока кобольды плакали что поддержки нет)
Аноним 09/09/26 Срд 15:00:56 1700015 190
>>1700012
>чел пишет "юзаю студию и мне норм, хз чего ее так не любят"
inb4 вся ветка началась с
>Мне кажется вы лмстудией или не пользовались и с дивана рассуждает
>если вы считаете это более удобным - вы реально промытки-хейтеры.
Но прочитать несколько постов выше это тебе не высраться. Всем похуй на эту лм студию, но раз в пару месяцев этот ущемленный приходит сюда и начинает срачи. В этот раз ущемился от термина "однокнопочный" в шапке.
Аноним 09/09/26 Срд 15:09:45 1700023 191
>>1700009
сингулярность это когда модель любого размера умещается в один бит.
Аноним 09/09/26 Срд 15:19:49 1700030 192
>>1700006
Квен сделал 27б, хули тебе еще надо?

Прикол в том, что сильные мелкие модели невозможны без гигантских моделей.
Аноним 09/09/26 Срд 15:21:57 1700034 193
>>1700023
Бесконечное сжатие по словарю?
Аноним 09/09/26 Срд 15:22:44 1700035 194
>>1700012
>лмстудийщики
>кобольды
Сорта мазохистов лул
Аноним 09/09/26 Срд 15:25:15 1700039 195
>>1700030
ДА ИДИ НАХУЙ КВЕН КВЕН НИКОГО НЕ ЕБЕТ КВЕН В ЭТОМ ТРЕДЕ КОДОДЕБИЛИНА СРАНАЯ.
Аноним 09/09/26 Срд 15:27:57 1700045 196
>>1700039
Он отличная кум машина.
Аноним 09/09/26 Срд 15:28:41 1700046 197
Аноним 09/09/26 Срд 15:30:41 1700048 198
>>1700046
Хуй могу показать. Надо? Заебался я уже показывать. Если достанешь мистралешиза, то покажу кум на квене. Сидите блять только выпрашиваете, ничего сами не шарите
Аноним 09/09/26 Срд 15:31:14 1700050 199
17619141137680.mp4 1405Кб, 480x640, 00:00:06
480x640
>>1699101 (OP)
Блеать, столько тредов, до сих пор никто не предложил модель для рп и кума.
Вот например отзыв
https://huggingface.co/zerofata/G4-MeroMero-26B-A4B/discussions/2
Вроде звучит хорошо, следование инструкции, жмется чутка, ладно можно разработать ей очко промтом и подталкиванием.
А кванты хуянты?

Этот васян их не похерил?
https://huggingface.co/mradermacher/G4-MeroMero-26B-A4B-i1-GGUF/tree/main

16/64 нищук
смотрю на G4-MeroMero-26B-A4B.i1-Q4_0.gguf этого кукича.
Обоссыте где неправ. Я заебался уже модельки подбирать.
Аноним 09/09/26 Срд 15:31:52 1700051 200
>>1700039
У флеш некст с РП и кумом всё в порядке.
Аноним 09/09/26 Срд 15:32:19 1700052 201
>>1700048
Не показал. Можешь свою кум машину уносить. Пиздло.
Аноним 09/09/26 Срд 15:34:15 1700055 202
>>1700006
Сейчас у всех так. На глм 5.3 и флеш глянь. Научились продвинутым RLом маленькие модельки делать умными. Но там где нужны именно точные знания как делать что-то, например в бенчах HLE и Omniscience Accuracy большие модели всё так же имеют большие оценки, хотя разрыв и сокращается каждый новый релиз
Большая модель нужна там где очень сложная задача и нужно выжать максимум и доступ к редким знаниям, типа кернелы для лламы писать, план/оркестрацию субагентов для сложнючей программы с нуля делать, подобное
Аноним 09/09/26 Срд 15:40:03 1700060 203
>>1700050
> i1
ты взял иматрикс квант вместо статических
https://huggingface.co/mradermacher/G4-MeroMero-26B-A4B-GGUF
> moe
для твоей спеки и мое надо брать не ниже Q6

> Q4_0

и обрати внимание на тип кванта, Q4_0 - это старый тип квантования. мрадер на странице дает описание какой квант лучше брать, см гайд по квантам
https://gist.github.com/Artefact2/b5f810600771265fc1e39442288e8ec9

в нашем случае - Q6_K
Аноним 09/09/26 Срд 15:41:19 1700063 204
>>1700060
забыл уточнить, imatrix могут бить по русскому языку и РП в целом потому что матрицы важности могли быть хуй знает куда сместиться
Аноним 09/09/26 Срд 15:41:45 1700064 205
>>1700060
Блять, теперь иматриксошиз высрался. Походу у всех котелки поплыли из-за осени.
Не было ни одного пруфа до сих пор что иматрикс портит хоть что-нибудь. Если русского в датасете нет он просто станет не настолько лучше как мог бы. Не хуже
Аноним 09/09/26 Срд 15:50:30 1700077 206
>>1700064
Добавлю своё субъективное мнение. Я собрал свой датасет на русском + json/xml, и сам квантанул через autoround, и субъективно это добавило лишние 0.5 bpw, если не больше - оно при том же размере выдаёт ответы правильные там, где сетка с хаггинга на 10% больше сыпется.
Аноним 09/09/26 Срд 15:52:04 1700079 207
>>1700077
Это круто. Вот только, если бы ты не добавил туда русик, хуже он бы не стал. Отвечала бы модель на уровне той, с которой ты проводил сравнения. Это принципиальная разница
Аноним 09/09/26 Срд 15:53:51 1700081 208
>>1700060
Ок, попробую, я рпшу на англ. Для экономии токенов и прочего.
До этого старался модель чтоб влезла vram и чуть запас на контекст.
У меня вызово к модели много в движке.
Это moe с выгрузкой в рам верно? Поэтому можно качать 22 гига, вместо моей тряски придерживаться 16vram
Аноним 09/09/26 Срд 16:02:52 1700085 209
>>1700079
Да, но ещё я собираюсь сделать reap-версию мое-шки побольше, и там без датасета уже никуда.
Аноним 09/09/26 Срд 16:34:43 1700119 210
Райзер попробовал, скорость х1
Какие же поганые китайские паскуды.
Что б я ещё что-то на алиэкспрессе взял, ххтьфу
Аноним 09/09/26 Срд 16:39:53 1700127 211
>>1700119
Нужно просто не говно брать, а нормальные вещи. Минимум slimsas, лучше зелёные mcio.

Скупой платит дважды
Аноним 09/09/26 Срд 16:43:53 1700138 212
>>1700127
Да пошел ты в жопу, я его как раз после ошибок с MCIO взял - дважды китайский хер за щеку
Аноним 09/09/26 Срд 16:46:30 1700144 213
>>1700138
Тогда могу только посоветовать руки выпрямить. Что у меня, что в тг чатиках никаких проблем с зелёными mcio и кабелями до метра нет если их стяжками/липучками закрепить к платам
Аноним 09/09/26 Срд 16:46:46 1700145 214
image 854Кб, 2292x1422
2292x1422
image 888Кб, 2288x1500
2288x1500
>>1700046
Ну на. Слева гемма (настоящая кум-машина), справа квен (бенчмакснутая кододебилина). Очень важно не перепутать.
Аноним 09/09/26 Срд 16:50:33 1700158 215
>>1700144
бля кто пустил рисового маркетолога в тред
хоть на сопли их приклей, некорректируемые ошибки PCIE за десять ебаных тысяч рублей

Ну думаю - уж с обычной лапшой без бифуркации - просто чтобы GPU подальше вынести - не наебут. И тут наебали. Чумы на вас мало, барыги-кабанчики.

На двух разных машинах тестировалось, между прочим.
Аноним 09/09/26 Срд 16:52:21 1700162 216
Аноним 09/09/26 Срд 16:58:11 1700167 217
>>1700158
Видимо правильно гоя доят.
Два кабеля по 50см и платы на концы в сумме стоят 6к
Аноним 09/09/26 Срд 16:59:47 1700169 218
>>1700167
Это было 80см и куплено год назад.
Аноним 09/09/26 Срд 17:00:21 1700170 219
1709309078349810.jpg 380Кб, 680x680
680x680
>>1700145
>размышления заняли 4 минуты
Аноним 09/09/26 Срд 17:03:45 1700176 220
image.png 7Кб, 370x94
370x94
>>1700170
кек ты еще такого не видел
Вчера пытался потестить 400-гиговую йобу через SSD выгрузку
Аноним 09/09/26 Срд 17:06:40 1700178 221
>>1700176
Не токены а золото.
Аноним 09/09/26 Срд 17:09:59 1700184 222
image.png 29Кб, 787x407
787x407
image.png 188Кб, 473x430
473x430
Грустно становится. Бедолага пытался насмешить.
Аноним 09/09/26 Срд 17:29:27 1700201 223
image 101Кб, 1556x791
1556x791
>>1700184
Даже соевый жпт лучше.
Аноним 09/09/26 Срд 17:30:56 1700206 224
>>1700201
>инпут не показан
Чел ну ты понял
Аноним 09/09/26 Срд 17:32:38 1700211 225
image 84Кб, 1622x861
1622x861
Аноним 09/09/26 Срд 17:35:19 1700215 226
>>1700167
В смысле, какие 6, 10к? Это с ретаймерами чтоли?
Аноним 09/09/26 Срд 17:35:49 1700217 227
Да. Можешь даже q8 попытаться запустить или apex-i-quality если найдешь. И не забудь про выгрузку слоев на цпу (хотя не уверен, что в твоем случае она нужна).

мимо другой анон
Аноним 09/09/26 Срд 17:36:55 1700222 228
Аноним 09/09/26 Срд 17:53:56 1700233 229
>>1700215
Да, там ретаймеры стоят. Эти штуки под pcie5.0 и цоды дизайнились
Аноним 09/09/26 Срд 17:57:29 1700235 230
>>1700145
Каким промптом ты научил гемму так искусно материться?
Аноним 09/09/26 Срд 17:59:26 1700238 231
>>1700235
Она сама по себе может. Даже без всяких манярасцензурилок. Там просто карточка такая.
Аноним 09/09/26 Срд 18:16:35 1700246 232
шизики, расцензурьте гигачат чтоли всем тредом, ресурсы то есть у вас, он отлично пишет и рпшит, получше чем пиндосовская гемма кстати говоря
Аноним 09/09/26 Срд 18:19:37 1700250 233
>>1700246
Kek, разраб не палится, давайте сами тренируйте, хоть какое-то кумьюнити покорите.
Аноним 09/09/26 Срд 18:22:58 1700254 234
>>1700246
Так там под гиг врама надо
Ты новые коммиты уже попробовал? Ризонинг заработал?
Аноним 09/09/26 Срд 18:23:58 1700256 235
>>1700254
>гиг
*терабайт
И это в Q8, в идеале надо еще вдвое больше чтобы потом квантовать
Аноним 09/09/26 Срд 18:24:45 1700258 236
>>1700246
Там и так цензура минимальна, на уровне геммочки, зачем ему анценз? На мелком, по крайней мере. Большой не гонял, но там, скорее всего, то же самое.
Аноним 09/09/26 Срд 18:31:12 1700262 237
1682030163241.png 949Кб, 1050x1746
1050x1746
1706853256757.png 326Кб, 1043x652
1043x652
>>1700145
>>1700235
Шерлоки местные занют что за модель

Я не могу такое читать/писать не под бухлом
Аноним 09/09/26 Срд 18:32:00 1700264 238
>>1700258
Мелкий это вообще прошлое поколение, 3.5 новый с нуля обучали
Аноним 09/09/26 Срд 18:34:07 1700265 239
images(21).jpg 65Кб, 427x427
427x427
Аноним 09/09/26 Срд 18:35:26 1700267 240
1788968113657.jpg 39Кб, 816x243
816x243
Аноним 09/09/26 Срд 18:35:53 1700269 241
>>1700145

У тебя фифи паленая какая-то, ненастоящая.
Ну и да, квен написал хуевый кум, дрочить на текст квена неприятно, сука, как можно описывать соски и тут же вставлять слово "тошнотворный"? Как можно описывать клитор и тут вставлять "ненавидит"? А дальше вообще "позвонки выпирают под кожей".
Текст хорошо написан, для обычного РП самый топ, но кум это что-то другое, вот гемма понимает кум.
Аноним 09/09/26 Срд 18:43:28 1700272 242
llamacppargumen[...].png 45Кб, 940x557
940x557
>>1699931
Кстати, внезапно в последнем билде (0.4.24) появилась такая фича.
Аноним 09/09/26 Срд 18:43:31 1700273 243
image 112Кб, 443x349
443x349
>>1700262
Неплохой русик. Это дипкок? Чому без ризонинга?

Ну и да, пикрил.
Аноним 09/09/26 Срд 18:44:12 1700274 244
>>1700269
>"позвонки выпирают под кожей".
Так-то охуенное внимание к деталям и пиздатый компрехендинг реального мира, анатомии и всей хуйни.

>но кум это что-то другое, вот гемма понимает кум.
>нагенерила генерик хуйню типа упругая жопка, гладкая пизда
Кум так кум, вот это да
Аноним 09/09/26 Срд 19:05:18 1700285 245
>>1700269
>У тебя фифи паленая какая-то, ненастоящая.
На 95% оригинальная карточка, просто переделана по-человечески. Та самая фифи совсем шизиком каким-то написана. Бессвязный поток сознания.

> как можно описывать соски и тут же вставлять слово "тошнотворный"? Как можно описывать клитор и тут вставлять "ненавидит"?
Вроде логично всё, не? У нее тряска от абстиненции, срочно нужно закинуться наркотой, а юзер про какие-то письки заговорил. Вот квен и пытается это совместить: показать психическое состояние, как ей херово и одновременно кумом не обидеть.

Квен некст там, если что, не 27b.
Аноним 09/09/26 Срд 19:09:40 1700287 246
>>1700274
>Так-то охуенное внимание к деталям и пиздатый компрехендинг реального мира, анатомии и всей хуйни.

Так да, для РП в котором ты не сидишь с хуем в руке это збс. А когда ты с хуем в руке тебе нужен непрерывный поток возбуждающих образов, чтобы твой внутренний деректор тебе их показал как хорошую порнушку. В порнушке нельзя показывать антистимулы.
Аноним 09/09/26 Срд 19:13:41 1700289 247
>>1700272
Забей, уже записали в нещитовое и будут дальше орать про кастрированную недоделку или че там в голове у поехавших.
Аноним 09/09/26 Срд 19:15:11 1700291 248
1536847490269-2.png 20Кб, 510x420
510x420
Скомпилил лламу от унслота чтобы мтпешучку у флеш некста запустить и улететь, запустил --spec-draft-n-max 5 - скорость генерации в два раза ниже, запустил --spec-draft-n-max 2, скорость в 4 раза ниже, еще и префил выше 50 токенов не поднимается.
Аноним 09/09/26 Срд 19:18:55 1700293 249
>>1700291
>50 токенов
ЦОПЭУ чтоли? Я слыхал эти трюки не работают когда большая часть на цпу
Аноним 09/09/26 Срд 19:21:14 1700296 250
>>1700291
А ты как хотел. МТП это ускорялка не для тех у кого все медленно, а для тех, у кого все быстро - тоесть есть фулл врам или 8 потоков рам и впринципе - ускорение уже не нужно.
Аноним 09/09/26 Срд 19:29:14 1700305 251
>>1700273
>>1700265
Дипсик. Первый пик это пресет на chapter, второй на длинный аутпут. Ризонинг в маринаре под кнопкой спрятан
Аноним 09/09/26 Срд 19:29:50 1700306 252
>>1700293
Нормальная, Куда, с тем же параметрами компилится ллама из официального репозитория и по скорости работает также как скачанный пребилд. Настройку сборки делал тоже Квен, еще было интересно справится или нет, сам я ебал разбираться с cmake.
Ну в общем то мне и так норм было, я уже привык 15 на генерации и 300 на префиле.
Аноним 09/09/26 Срд 19:33:25 1700308 253
>>1700287
>А когда ты с хуем в руке тебе нужен непрерывный поток возбуждающих образов
Проще тогда обычную порнушку смотреть.
>В порнушке нельзя показывать антистимулы.
Это уже другой вопрос. В идеале должно быть можно либо управлять моделькой как надо, либо моделька сама должна понимать контекст и использовать правильные слова.
А полностью жертвовать креативностью и детализацией ради "ровного экспириенса" это странно.
У мистралетюнов видимо были как раз нужные датасеты, которые и в детализацию могли, и при этом возбуждающе писали.
Аноним 09/09/26 Срд 19:41:21 1700318 254
>>1700272
>>1700289
ЛмСтудио ебанавт и IQ4 > Q8 это один и тот же...
Чому я не удивлен
Аноним 09/09/26 Срд 19:47:07 1700323 255
>>1700262
>указала
Асечку писечку сисечки
Аноним 09/09/26 Срд 20:13:08 1700334 256
image.png 35Кб, 528x481
528x481
Аноним 09/09/26 Срд 20:30:50 1700343 257
Аноним 09/09/26 Срд 20:33:22 1700345 258
Аноним 09/09/26 Срд 20:41:00 1700348 259
>>1700343
>продолжайте закапывать и гемму и квен, нравится.
Слоооооп
Аноним 09/09/26 Срд 20:59:01 1700357 260
А k2 че никто не трогал???
Аноним 09/09/26 Срд 20:59:18 1700358 261
>>1700343
...said GlimmerGod, with mysterious glint in his eye. His witty remark hit the thread like a physical blow
Аноним 09/09/26 Срд 21:06:12 1700367 262
>>1700357
>Mixture-of-Experts (MoE) model augmented with a novel Mixture-of-Values (MoVA) attention mechanism, storing ~36 B parameters while activating only ~4 B per token.

мое нищете подвезли, тут в треде только барены которые по две фронтир модели за раз запускают и сравнивают какая лучше кумит
Аноним 09/09/26 Срд 21:11:58 1700371 263
>>1700357
неохота билдить чей то форк лламы или качать стрёмные релизы. когда официально поддержка этого формата будет тогда и попробуем
Аноним 09/09/26 Срд 21:15:50 1700372 264
>>1700371
>когда официально поддержка
Да там нигде поддержку нормально реализовать не могут. Я не понимаю чем заняты кабанчики, которые "владельцы".

https://github.com/ggml-org/llama.cpp/pull/27773
вот висит реквест на ревью кода уже 2 суток, нихуя нет, ГЛМ флэш никак не просрется
будто всем насрать и ничего кроме васянщины от индусов не осталось
Аноним 09/09/26 Срд 21:17:46 1700373 265
>>1699931
Решение "все в одном", ориентированное на популярную аудиторию всегда будет проигрывать специализированным подвинутым.
С удобства добавления моделей обзмеился, сделал мой вечер.
>>1699935
Глянь ответы аблитки особенно, там she he he he he she she she he he he I I I I she she на каждой новой строке, и предложения очень однообразны, настолько что бросается. На обычной местами тоже заметно, структурный луп, давно такого не встречалось.
То что разные свайпы понятно, к этому ноль вопросов.
>>1699950
Тут по структуре так явно не бросается, но с реплик чара проиграл, ну и трешанина.
Аноним 09/09/26 Срд 21:18:01 1700374 266
так че к чему пришел спор? гемма топ для рп? кто отсосал?
Аноним 09/09/26 Срд 21:23:00 1700380 267
1654354656081.png 555Кб, 1060x943
1060x943
1779614492951.png 1309Кб, 1337x2092
1337x2092
>>1700262
1. Мне влом цензурить, пусть сносят если что
2. Чтение таких текстов негативно влияет на мою менталку
Аноним 09/09/26 Срд 21:23:53 1700381 268
>>1700050
похерил. я бы не доверял радермахеру. бери от зерофаты качай. спроси у iq4_xs про два стула. а потом у q6. а потом нассы на лицо дебильному ублюдку, который тебе советует q6 даже не попробовав его.
Аноним 09/09/26 Срд 21:25:00 1700382 269
>>1699995
Они у себя на апи разве гоняли что-то кроме 0813? Надо скачать ее от греха. Вообще странное решение, будто срочно понадобились мощности.
Аноним 09/09/26 Срд 21:28:18 1700384 270
image.png 85Кб, 1377x518
1377x518
image.png 72Кб, 1398x451
1398x451
> кривой васянский 3-битный квант VS нормальный
пиздос, че только на HF не найдешь
И кто-то ведь это качает, а оно еще и на 30гб тяжелее
Аноним 09/09/26 Срд 21:28:31 1700385 271
Аноним 09/09/26 Срд 21:31:07 1700386 272
>>1700138
Как "ошики с mcio" могут перекатиться в х1? И вообще, что еще за ошибки с ними. Оно или работает (с нюансом шатания в разъемах если кабель говно), или нет.
>>1700246
Бля он жирный дохуя, мало кто сможет запустить, и не факт что нормально будет в рп. Если стоковая модель сдохнет на контексте в обычном чатике то и нет смысла ее расцензуривать, та еще тупее будет.
Аноним 09/09/26 Срд 21:31:32 1700387 273
>>1700374
Гемма 26б топ из за полнейшего бызрыбья в этом размере, гемма 31б не нужна за цену 24 врам, лучше уж докупить рам до 300б моделей.
Аноним 09/09/26 Срд 21:31:35 1700388 274
>>1700318
Это не я. Я такого не писал. про iq4>q8. Сам пока iq квантов даже не трогал.

Вот мои посты в прошлом треде
>>1698182 →
>>1697063 →
>>1697103 →

Я когда-то тут представился как цп-шиз ибо офлоад на цпу позволил мне гонять gemma 4 26b qat ud-q4_k_xl на более-менее внятных скоростях в 11-13 тпс на своей некропеке с 4 + 16.

Планирую сейчас собирать gentoo
Аноним 09/09/26 Срд 21:31:55 1700389 275
17543884734391.jpg 3541Кб, 1500x2550
1500x2550
>>1700145
Справа как будто гемини пишет, такой же блевотный мерзкий слог.
Аноним 09/09/26 Срд 21:33:07 1700391 276
>>1700386
>mcio
>x1
Два разных райзера. Радуйся, что не сталкивался с некорректируемыми ошибками. Ну а х1 это просто обман, подсунули такую дрянь когда второй райзер заказывал.
Аноним 09/09/26 Срд 21:38:30 1700394 277
Аноним 09/09/26 Срд 21:40:32 1700397 278
>>1700391
> Радуйся, что не сталкивался с некорректируемыми ошибками.
Сталкивался, гпу внезапно отлетает с в 50% вероятность возвращается, или отрыгивает до ребута. Меняешь райзер на нормальный и все.
> х1 это просто обман
Случаем не с m2? Сам недавно ставил карту так и сначала горел с того, что х1 вместо х4, а потом внимательно глянул метку на нем и чекнул страницу товара. Сраное наебалово.
Аноним 09/09/26 Срд 21:41:07 1700398 279
image 2203Кб, 1432x1098
1432x1098
>>1700380
>Чтение таких текстов негативно влияет на мою менталку
Тебе ничего не мешает заняться сэвиорфажеством. Фифи как раз идеально для такого подходит.
Аноним 09/09/26 Срд 21:51:12 1700405 280
image.png 193Кб, 1998x577
1998x577
CСУКАА Я СОВСЕМ ЗАБЫЛ ОБ ЭТОМ.
Обновил ради минимакса, ЁБ ВАШУ МАТЬ У МЕНЯ ВСЁ СЛОМАНО ТАК ДОЛГО.
Аноним 09/09/26 Срд 21:51:51 1700406 281
image.png 164Кб, 1176x675
1176x675
>>1700385
Ну кстати именно этот квант ль zerofata вспомнил про мои explicit правила и впервые их применил. До этого был такой же квант от другого васяна, и там просто была боль.

Пробовал это, но все они плыли, мешали детали друг с другом, ломали шапку.
G4-MeroMero-26B-A4B.i1-Q5_K_M.gguf
G4-MeroMero-31B-uncensored-heretic.i1-IQ3_XS.gguf
Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
Qwen3.8-27B-UD-IQ4_XS.gguf
Qwen38-Ara-v5-RVN-IQ4_XS-mtp.gguf
Аноним 09/09/26 Срд 21:53:20 1700407 282
>>1700405
Давно все пофиксили же
Анслот студия по дефолту 13 куду юзает
Аноним 09/09/26 Срд 21:53:59 1700408 283
>>1700405
Чебля, новая куда в жору насрала? Как?
Аноним 09/09/26 Срд 21:54:28 1700409 284
>>1700407
Дооооооооо доооо дооо пофиксили верюю. Жора то всёё пофиксит.
Аноним 09/09/26 Срд 21:55:09 1700410 285
image.png 5Кб, 229x123
229x123
>>1700408
В календарик смотрим


>>1700409
Это обсер нвидии был в чем-то, а не жоры
Аноним 09/09/26 Срд 21:56:39 1700412 286
>>1700410
>нвидии
А ну тогда другоое дело, там же щас не работают 99% индусов вайбкодеров и этот фикс не вызвал ещё какой нибудь обсёр.
Проще откатиться
Аноним 09/09/26 Срд 21:57:37 1700415 287
>>1700405
>Обновил ради минимакса
Минимакс не работает на 12.4? У меня просто v100 и я надеюсь у меня все всегда будет работать.
Аноним 09/09/26 Срд 21:58:39 1700416 288
>>1700406
>все они плыли, мешали детали друг с другом, ломали шапку
>васькотюн
>васькотюн в iq3
>васькотюн в iq3
>анслопоподелие в iq
>васькотюн в iq
Реально, почему же так происходит, загадка от жака фреско блять.
Аноним 09/09/26 Срд 22:01:35 1700417 289
>>1700416
Ну так другой васькотюн в iq4_xs работает лучше ванильной bf16 (на вопросе про стулья), почему эти так не могут?
Аноним 09/09/26 Срд 22:02:34 1700419 290
>>1700410
Давай линк на багфикс хуанга
Аноним 09/09/26 Срд 22:03:51 1700420 291
image 1307Кб, 1124x1104
1124x1104
>>1700417
>iq4_xs работает лучше ванильной bf16
Вопросов больше нет.
Аноним 09/09/26 Срд 22:04:27 1700421 292
1765420227482.webp 35Кб, 1000x1000
1000x1000
1733938807356.jpg 21Кб, 733x96
733x96
Гайз, помогите. Захотел себе скачать квен 122, а там вместо цельного файла какие-то куски. Чё делать? Как это юзать через кекбольд?
Аноним 09/09/26 Срд 22:04:42 1700422 293
image.png 9Кб, 348x66
348x66
>>1700419
хуанг нигде ничего не говорит, слоподелы сами проверяют
Аноним 09/09/26 Срд 22:05:35 1700423 294
>>1700421
>Как это юзать через кекбольд?
Указывается путь к 1-му файлу, остальные цепляются автоматически из той же папки. Не очкуй.
Аноним 09/09/26 Срд 22:06:32 1700425 295
>>1700422
СКОТИНА У ТЕБЯ НАПИСАНО ПОФИКШЕНО В 13.3 ЗНАЧИТ НУЖНО ЛИБО ОБНОВИТЬСЯ ЛИБО ОТКАТИТЬСЯ ССУКАА Я ЗНАЛ ВСЁ СЛОМАНО В ПИЗДУ
Аноним 09/09/26 Срд 22:07:20 1700426 296
image.png 21Кб, 702x155
702x155
а вот нечто среднее нельзя что ли сделать
да давайте конечно оставим так
ну а хуле, весело
Аноним 09/09/26 Срд 22:07:36 1700427 297
>>1700421
Коротко о необходимости писать/обновлять гайды и вики в шапке. Зачем, если их никто не читает?
Аноним 09/09/26 Срд 22:08:31 1700428 298
image 1729Кб, 1254x1254
1254x1254
>>1700421
> кекбольд
Ебать ты лох.
Аноним 09/09/26 Срд 22:08:34 1700429 299
>>1700425
чет в голосину проиграл
и сколько ты на 13.2 сидел?
Аноним 09/09/26 Срд 22:09:29 1700431 300
>>1700421
Нужно слепить из них какашечку и положить вайбкодеру в ротик, он высрет цельный файл
Аноним 09/09/26 Срд 22:10:08 1700432 301
>>1700422
Не, у них для девов и куда довольно мощная платформа так-то. Если на ней баг - значит он массовый и должен проявляться много где.
Аноним 09/09/26 Срд 22:19:02 1700437 302
16336600347020.png 229Кб, 512x481
512x481
>>1700416
Тут со всеми срачами приходится методом проб и ошибок идти.
Аноним 09/09/26 Срд 22:21:05 1700438 303
>>1700423
Я читал итт что мое слои надо как-то по особому выгружать или типа того. Это как? Мне надо заморачиваться или можно просто запустить и будет работать? Когда гемму 26 запускал, она нормально работала, вроде ничего особенного не потребовалось. Тут так же будет?

>>1700427
Ну, там гайд такой, что проще в треде спросить. Я хз зачем в шапке такое количество смихуёчков и отвлекающей инфы. Алсо:
>Официальная вики треда с гайдами по запуску и базовой информацией
>мое, найдено: 0
Вот и весь гайд. Причём тут мой вопрос, собственно? Или я должен был найти в стенах бесполезного для меня текста нужную мне строчку? Это welcome to the game или что? У меня до сих пор вьетнамские флэшбеки от документации таверны. Пощади.

>>1700428
А что щас самое метовое? Я давно в треде не был. Чайный кун вернулся?

>>1700431
Леее, бля, ты меня наебать пытаешься?
Аноним 09/09/26 Срд 22:22:25 1700440 304
>>1700438
> А что щас самое метовое?
Голый Жора или Анслот Студия, если хлебушек.
Аноним 09/09/26 Срд 22:23:39 1700441 305
Скучаю по временам, когда можно было накатить
> Llama-3.1-8B-Stheno-v3.4-GGUF-IQ-Imatrix
и радоваться

Сейчас я качаю какие-то 300B модели и получаю не сильно лучше качество...

>>1700438
>Это как? Мне надо заморачиваться или можно просто запустить и будет работать?
Ищи в кобольде строчку cpu layers или moe cpu layers или moe layers не знаю как точно называется, она в какой-то жопе там спрятана, НЕ в первой вкладке и не перепутай с GPU layers

А еще в кобольде autofit появился - по идее если на него галку поставить, с ним будет похуй на ручное распределение слоев, но он может не сработать. Попробуй с ним, если не понравится уже вручную попробуешь сделать. Это не сложно.
Аноним 09/09/26 Срд 22:25:24 1700443 306
image 65Кб, 2176x206
2176x206
Аноним 09/09/26 Срд 22:28:06 1700444 307
Посоны! А что если сделать набор маленьких но очень крутых специализированных моделей и запускать их когда надо. в районе гигабайта. и чтобы делать из них цепочки.

чисто генерация кода без комментов (English -> Rust)
сумаризация (Rust -> English)
перевод текста (English -> Russian)
перевод текста (Russian -> English)
* полное пояснение кода (Rust -> English)

почему так нельзя сделать?
Аноним 09/09/26 Срд 22:31:57 1700446 308
>>1700444
> маленьких но очень крутых
Это как 12 см, но рычишь.
> специализированных моделей и запускать их когда надо
Называется МоЕ.
Аноним 09/09/26 Срд 22:33:46 1700448 309
>>1700444
Потому что ты даунита, которая не понимает как тренятся и работают модельки. Напоминаешь чела, который хотел, чтобы ему дали возможность накликивать нужных экспертов для задачи, уж он бы справился. Вот он, походу >>1700446. Ведь у нас в моешках, один эксперт по языку боярон, третий по языку яваскрипт, пятый по русскому.

Во-первых, для того чтобы с естественного на кодерский перевести нужен жесткий шмурик общих знаний. Во-вторых, в мелкую модель, учитывая, что ей нужны общие знания, а ты хочешь еще и англюсе в раст, и твое желание малого размера, не запихаешь нормально. В-третьих, даже если будет хотется ненормально, накладываются требования на качество данных.
В-четвертых, этот кал может пригодится только совсем нищукам с пука для учебы на селероне. Их проще игнорировать.
Аноним 09/09/26 Срд 22:34:42 1700449 310
>>1700444
Потому что нельзя быть гениальным математиком и при этом полным дауном во всем остальном. Специализация эффективно работает на узких доменах (классификация медиа, расшифровка qr кодов, описание пикч), а кодинг и перевод - крайне широкие, их невозможно полноценно "выучить" и понимать не имея общих знаний. Это требует размера.
Аноним 09/09/26 Срд 22:36:59 1700452 311
>>1700448
В пятых пошёл нахуй.
Аноним 09/09/26 Срд 22:38:32 1700453 312
Есть какие-нибудь новые модели для бичар на горизонте? А то с мое-геммы и мое-квена 3.6 уже прошло довольно долго. Смотря на последние модели уже складывается ощущение, что 128гб оперативы - это базовый минимум.
Аноним 09/09/26 Срд 22:38:33 1700454 313
>>1700452
Спасибо, что дополнил мой ответ.
Аноним 09/09/26 Срд 22:41:03 1700455 314
>>1700453
>Есть какие-нибудь новые модели для бичар на горизонте?
Квен флеш некст, если есть хотя бы 12 врам и 64 рам.
Аноним 09/09/26 Срд 22:42:50 1700457 315
>>1700453
Просто ставишь квен 3.8-flash с оффлоадом в ссд на 0.5тпс/сек и кайфуешь
Аноним 09/09/26 Срд 22:43:24 1700458 316
>>1700420
Петух, продолжай отрицать реальность веря в циферки и в своё пынямание сеток.
Аноним 09/09/26 Срд 22:47:50 1700462 317
image.png 41Кб, 1054x583
1054x583
image.png 105Кб, 993x703
993x703
Только начал тестировать, надеюсь норм стелить будет. Пока ничего так
Аноним 09/09/26 Срд 22:48:11 1700463 318
>>1700453
Что смотря на последние модели-то блядь. Смотри как они срут под себя в ризонинге, какой у них искалеченный русик, как они забывают что персонаж надевал-снимал два абзаца назад и забывай. Жди пятую гемму, больше надежд нет. Четвертая не устраивает чем-то - навали побольше агентца в маринаре. Любую ллмку надо пинать, чтоб было круто.
Аноним 09/09/26 Срд 22:51:08 1700465 319
> intel optane
Бояре, а сие чудо-юдо никак к LLM не приспособить? Знаю, что оно не особенно быстрое, но всё же.

Просто на лохито терабайты этого шлака лежат за умеренные цены. Вдруг кто-то чето сообразит и все опять раскупят и накрутят в цене.
Аноним 09/09/26 Срд 22:51:35 1700466 320
>>1700462
Новую йоба бобу натюнил?
Аноним 09/09/26 Срд 22:53:01 1700467 321
>>1700465
Доску под них найди и скорости там посос. Есть система которая по идее поддерживает, но я забил и остался на 16x16 обычной д4
Аноним 09/09/26 Срд 22:57:55 1700470 322
>>1700467
Ага, то есть оно только под совсем старые платформы? Ну это печально в самом деле тогда.
Аноним 09/09/26 Срд 23:00:25 1700472 323
>>1700470
> под совсем старые платформы
Под 4189 (2021 год) работает, но там тонна параметров по которым можно словить несовместимость
Аноним 09/09/26 Срд 23:03:06 1700473 324
>>1700444
Можно, никто не запрещает кроме здравого смысла, потому что маленькая модель будет тупая в любой задаче. Ей нужны определенные базовые знания чтобы выполнять любую задачу, ты не можешь просто засунуть русский и английский словарь в модель и назвать это идеальной моделью для русского и английского языка, она всё еще будет тупая как пробка и не сможет находить нормально взаимосвязь между словами когда ты ей дашь текст на перевод. Соответственно помимо русского и английского словаря нам нужны фундаментальные знания на любом из языков, а это уже делает модель больше в размере. Причем чем более узкоспециализированная тема, тем больше ей нужно знаний.

Вон, посмотри на кучу мелких моделей которые по агентным бенчмаркам позиционируются как конкуренты 100B+ моделям. Просишь её что-то сделать и она даже не понимает че ты от нее хочешь потому что её набенчмаксили на один единственный бенчмарк и шаг влево / шаг вправо от этого бенчмарка для неё это уже разрыв шаблона.

Единственное где мелкомодели могут неплохо себя показывать - это OCR.
Аноним 09/09/26 Срд 23:06:02 1700475 325
Аноним 09/09/26 Срд 23:15:13 1700480 326
qwen3.5-08b.png 119Кб, 784x937
784x937
>>1700448
>>1700446
>>1700449
>>1700452

ебать охуенно! запустил модель на 0.8B которая весит меньше гига - она такие хохмы выдает!

> расскажи короткий анекдот про крокодила!

A man who has never eaten anyone else ever asked: "What is your favorite food?"
Crocodile said: "Fish."
Man says: "Okay, I eat fish."
Аноним 09/09/26 Срд 23:16:13 1700481 327
>>1700465
Просто как хранилище если ты про м2 стики. Пока в ллм инфиренсе не придумали случаев, где нужно было бы активно писать на диск.
А просто pci-e 5.0 ссд если вдруг найдешь по вкусной цене есть смысл взять. Потому что уже сейчас практикуется ленивая загрузка весов, может оказаться актуально и в бомжеинфиренсе, и для йоба ригов.
Аноним 09/09/26 Срд 23:16:19 1700482 328
>>1700246
Цензура в гигачате? Это с ризонингом? И да проверь жинжу, у гигачата двойной системный промт и его дев часть стандартными фронтами не редактируется, в инпут идут сейфти инструкции если не поправить
Аноним 09/09/26 Срд 23:17:48 1700485 329
>>1700481
> про м2 стики
Речь про ддр4 плашки по 64/128гб aka PMem
Аноним 09/09/26 Срд 23:17:50 1700486 330
А в llamacpp-ui можно свои тулзы делать? А то я вижу две встроенные, но это ни о чём.
Аноним 09/09/26 Срд 23:17:55 1700487 331
>>1700480
Вот у кого Петросян вдохновение черпает

>>1700481
>pci-e 5.0 ссд
Толку-то от них, когда сервер с 4.0... Я вот 990 про гнусмас целенаправленно взял вместо 9100 про, хотя и стоили почти одинаково. 990 аж на 20 градусов холоднее.
Аноним 09/09/26 Срд 23:19:35 1700488 332
1732259696134.png 58Кб, 676x778
676x778
Аноним 09/09/26 Срд 23:22:13 1700489 333
>>1700486
>вижу две встроенные
Пропиши --agent в параметры запуска и будет больше.
Как же они ленятся читать документацию...
Аноним 09/09/26 Срд 23:23:08 1700490 334
>>1700485
А, эта экзотика. Интересно какие там скорости выходит, так вообще тема потенциально крутая.
>>1700487
Ну там офк нужна поддержка со стороны платформы.
> взял вместо 9100 про
Ебать ты! А я в свое время не взал и теперь смотрю на них и унываю. В следующий раз повезет.
Аноним 09/09/26 Срд 23:27:28 1700494 335
>>1700490
>Ебать ты!
Ну а чего я. Давай реалистично взглянем - я че, сменю 256-гиговый ддр4 сервер на ддр5 в ближайшие годы? ни-ху-я.

А как сменю, там и PCIE 6.0 ссд будут уже, лол
Так что покупка 9100 про дала бы только прожарку воздуха в комнате
Аноним 09/09/26 Срд 23:31:03 1700496 336
DeepSeek qwest.jpg 215Кб, 882x1241
882x1241
Gemma 4.jpg 178Кб, 963x1138
963x1138
Кто там эту задачку в предыдущем треде тестил и говорил что Gemma 4 её решила, при этом не запостив её "решение"?

По факту DeepSeek её решил и всё обосновал, а Gemma 4 тупая самоуверенная шиза, смотрите скрины.

Напоминаю задачу

У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут.
1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу.
2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа.
З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?

Скрин Диипсика с моего сервера, Гемма 4 с https://duck.ai/ но я думаю на моей локалке она то же самое напишет.
Аноним 09/09/26 Срд 23:33:39 1700498 337
Китайские 3080 20GB - совсем залупа или таки приемлимо? Насколько они живучие? Юзал кто вообще?
Аноним 09/09/26 Срд 23:33:58 1700499 338
>>1700494
Ну мало ли, вдруг возможность подвернется. Или наоборот при негативном сценарии с продажи того можно выручить больше. Офк выбор плохим назвать нельзя потому что в 9100 могут какие-то приколы или внезапная смерь вылезть.
> прожарку воздуха в комнате
Под 4.0 он бы и грелся меньше, температуры на полной нагрузкой под 5.0 же смотрят.
Аноним 09/09/26 Срд 23:42:10 1700506 339
1639054800924.png 225Кб, 1048x1218
1048x1218
Аноним 09/09/26 Срд 23:43:21 1700508 340
>>1700496
> но я думаю на моей локалке она то же самое напишет.
Ну думай дальше, пидарас тупой.
Ты даже не видишь что твой дипсик обосрался. Возишь гоблина с собой и задача имеет решение даже если цель избежать траха.
Аноним 09/09/26 Срд 23:46:19 1700510 341
image.png 43Кб, 830x382
830x382
>>1700496
IQ3S с низким ризонингом.
Но тут думаю персона влияет, ей запрещено быть всезнайкой и разрешено ошибаться, сомневаться, врать и т.д.
Аноним 09/09/26 Срд 23:48:13 1700512 342
>>1700510
На первой генерации +- такой же ответ, если что. Не верит в решаемость.
Аноним 09/09/26 Срд 23:54:14 1700513 343
Untitled.png 78Кб, 645x1131
645x1131
>>1700496
> Напоминаю задачу
Классная задача у которой исходя из текста задачи нет решения.

При этом дипсик выдумал решение и ты считаешь его правильным. Ок.

Я так понимаю, модель, которая напишет что все трое решили не лезть в лодку сели в самолёт который стоял на берегу реки но про который нет ни слова в условиях задачи и таким образом перелетели через речку будет так же иметь правильное решение по твоему мнению.

Гемма на скрине тоже зафейлила. А вот ответ локальной 26B Геммы наиболее логичный и правильный, она тупо сказала что следуя условиям задачи это невозможно и объяснила почему исходя из условия задачи это невозможно, а не стала выдумывать какие-то несуществующие вещи.
Аноним 09/09/26 Срд 23:55:56 1700514 344
Так че, если там правда нет решения, значит лоботомированный 3-битный глм 5.3 не обосрался? Хуя мощь
Аноним 09/09/26 Срд 23:57:23 1700516 345
>>1700508
Зашивай свою сраку Маня, ты такая же тупая как Gemmа.

Gemma:
Правильный и безопасный алгоритм:

Перевезите принцессу на другой берег и вернитесь один. (На берегу 1: гоблин и паж под вашим присмотром).
Перевезите пажа на другой берег.
Чтобы паж не остался с принцессой, заберите принцессу обратно на исходный берег.
Оставьте принцессу на исходном берегу и перевезите гоблина на другой берег к пажу. (Теперь на берегу 2 гоблин и паж, но вы находитесь при них).
Оставьте гоблина и пажа на другом берегу (пока вы в лодке и отплываете, они остаются вдвоем, но в этой задаче критическим является момент «оставления без присмотра» на длительный срок. Однако есть более надежный путь).


Можешь возить Гоблина туда и обратно, тебе же дауну Дипсик сказал, любая пара из трёх вызывает событие.
Аноним 09/09/26 Срд 23:59:48 1700518 346
Вы че дауны что ли
Если ты перевез кого-то, значит двое других пиздятся или пердолятся
= провал
Аноним 10/09/26 Чтв 00:00:58 1700519 347
>>1700518
Соблазнение/износ != смерть
Аноним 10/09/26 Чтв 00:01:41 1700520 348
image 186Кб, 670x672
670x672
>>1700513
Условие задачи чтобы все остались живы. А теперь перечитай что пишет гемма.
>принцесса соблазнит пажа (провал)
>гоблин выебет принцессу (провал)
Сама выдумала что это провал и пришла к выводу что задача нерешаемая.
Аноним 10/09/26 Чтв 00:02:22 1700522 349
>>1700513
>При этом дипсик выдумал решение и ты считаешь его правильным. Ок.

Он не выдумал, он проявил внимание и логику, в тексте задачи реально было чтобы все остались живы?
Аноним 10/09/26 Чтв 00:02:42 1700523 350
Аноним 10/09/26 Чтв 00:03:27 1700524 351
>>1700519
>>1700523
Вы че на серьезных щщах думали, что я текст задачи читал?
Аноним 10/09/26 Чтв 00:06:30 1700525 352
>>1700421
Зачем тебе 3.5 если есть аналогичный 3.8? Могу сказать, что iq4xs от orcarouter у меня в 4 раза быстрее, чем 3.5 q6 от hauhau.
Аноним 10/09/26 Чтв 00:13:04 1700533 353
1742307572753.png 274Кб, 1350x1333
1350x1333
>>1700506
В целом с геммой всё просто. Написал в промпте что можно не моралфажить - ответит сразу, не написал не ответит без указки
Аноним 10/09/26 Чтв 00:20:46 1700534 354
Я анон с прошлого треда, есть вопросик по MI50 и виндой.

Хотеть запустить пару мишек в контейнере/VM, хостовая система при этом на винде, нужно карты прокинуть. И я пока не представляю с какими подводными камнями могу столкнуться при запуске мишек с такими вводными, одним словом ай нид хелп, аноны...
Аноним 10/09/26 Чтв 00:20:53 1700535 355
image.png 116Кб, 960x1144
960x1144
Почему ГЛМ 5.3 не смог простейшую загадку решить?
Аноним 10/09/26 Чтв 00:21:02 1700536 356
>>1700533
> Происходит то, что происходит
Эхх, Гемма-чан...
Аноним 10/09/26 Чтв 00:22:38 1700538 357
image.png 7Кб, 270x136
270x136
>>1700535
потому что у тебя не глм 5.3, а копиумная хуйня для нищих
Аноним 10/09/26 Чтв 00:23:19 1700540 358
Аноним 10/09/26 Чтв 00:24:40 1700543 359
>>1700534
Был тут один MI-шиз, но в такой поздний час наерняка же спит ведь. Попробуй завтра поспрашивать еще, юшку на ОП-пост кинь - авось вылезет
Аноним 10/09/26 Чтв 00:25:39 1700544 360
>>1700538
Покажи настоящую ГЛМ, если сам не нищук.
Аноним 10/09/26 Чтв 00:26:18 1700548 361
>>1700538
Смержите уже сапорт глма сами и дайте фидбек че там на 24 128 есть жизнь или лоботомит и че по цифрам.
Аноним 10/09/26 Чтв 00:27:45 1700550 362
1642190647315.png 132Кб, 1065x935
1065x935
>>1700534
> пару мишек в контейнере/VM
Контейнеры - ок, ВМ - не ок.
Официально у mi50 ни sriov, ни vm passthrough нет. Проброс в proxmox можно сделать через кастомный модуль vendor-reset, но это приводит к рандомным зависаниям хоста до состояния что поможет только хард резет

>>1700543
Неприятно
Аноним 10/09/26 Чтв 00:28:02 1700551 363
Аноним 10/09/26 Чтв 00:30:59 1700552 364
>>1700550
>Контейнеры - ок, ВМ - не ок
Что не так с ВМ? У меня шинда, в ней докер-контейнер, туда мишки завести...
Аноним 10/09/26 Чтв 00:37:20 1700555 365
>>1700552
> Что не так с ВМ

> у mi50 ни sriov, ни vm passthrough нет
Аноним 10/09/26 Чтв 00:43:52 1700559 366
image 831Кб, 1988x3894
1988x3894
Квен решил задачку. Сказал, что если нужно вообще без происшествий, то не прокатит, но если условие чтобы остались живы, то вопросик можно обкашлять.

Такого количества ✨ BUT WAIT ✨ в ризонинге я еще никогда не видел. Квен такой квен конечно.
Аноним 10/09/26 Чтв 00:44:20 1700560 367
>>1700552
Оставь свою идею. Если хочешь заниматься с LLM, сноси винду ставь Линупс и llama.cpp. В данном деле все ресурсы на счету, например когда будешь запускать огромную MOe модель с оффлоадом на CPU и на SSD.
Аноним 10/09/26 Чтв 00:45:46 1700562 368
image.png 38Кб, 1126x254
1126x254
image.png 280Кб, 444x450
444x450
Аноним 10/09/26 Чтв 00:47:08 1700563 369
image.png 164Кб, 965x1255
965x1255
>>1700548

Это >>1700535 на 24+128 и снято, если ты не понял.
Кстати, загадку с лодкой он правильно понял в ризонинге. Но из-за сои 15к токенов ризонил пытаясь найти любое другое решение и в итоге высрал длинное объяснение что не решается, ко-ко-ко. С пояснением в конце насчет правильного ответа, что мол решить можно через соблазнение или изнасилование, но так же нельзя, ко-ко-ко.
Аноним 10/09/26 Чтв 00:50:11 1700566 370
>>1700562
Квен - мыслитель. Он и на 50к может призадуматься. Его надрочили решать проблему юзера любой ценой, поэтому будет долбиться до победного, вообще не экономя токены. Хз даже, хорошо это или плохо.
Аноним 10/09/26 Чтв 00:57:31 1700571 371
>>1700535
В чем смысл загадки?
Аноним 10/09/26 Чтв 01:00:22 1700572 372
>>1700498
Тут кажется были владельцы 2080ти и 3070ти с удвоенной памятью, пока об отвалах не рапортовали. Учитывая что там делается просто запайкой новых чипов и правкой биоса вместо полной пересадки чипа на другую плату - наверно и ничего.
>>1700544
Вот же он, смотри! https://huggingface.co/zai-org/GLM-5.3
или можно вот этот https://huggingface.co/Tech2wild/GLM-5.3-Int4-Int8Mix он неплох и на вллм-бекпорт + вайбкоженный патч из pr38476 в репо оригинального вллм работает даже на некроте
>>1700552
Кажется что ставить мишки в десктоп не лучшая идея из-за охлаждения, а на сервер лучше прыщи накатить и шинду уже под вм если так нужно. Но лучше просто baremetal без лишних прослоек.
Аноним 10/09/26 Чтв 01:01:55 1700573 373
>>1700571
В том чтобы построить систему из двух уравнений и решить её.
10X+5Y=200
X+Y=24
Аноним 10/09/26 Чтв 01:04:43 1700574 374
collageferryman.jpg 2571Кб, 7880x2546
7880x2546
>>1700496
Я говорил конкретно про 4 26б. И вроде в том треде даже был чел, у которого она во 2 кванте и с квантованным в q4 контекстом решила эту задачу. И он даже привел скрин.

Однако, сделал коллаж. Небольшие ремарки:
1) ud квант был скачан в конце июня, т.е. он не ud3 тут вроде говорили, что у кого-то гемма ошизела
2) Решения от heretic от кодера в apex-i-balanced (mudler) кванте где-то проебал, извиняйте.
3) qwen 3.6 35b сожрал на решение 43к токенов. Не стал проверять, сможет ли повторить. Однако, его heretic от lmfan46 с kld 0.0015 в 6 и 8 квантах справиться не смогли (хотя q6 выдал правильную последовательность с неправильным объяснением). Как и от hauhau. Проверил всех по 1 разу.
4) qwen 3.5 122b тоже сделал только один прогон. Однако, в размышлениях он пришел к правильной догадке буквально сразу.
Аноним 10/09/26 Чтв 01:05:03 1700575 375
>>1700572
>Вот же он, смотри!
Ты у себя его запущенным покажи.
Аноним 10/09/26 Чтв 01:06:15 1700577 376
>>1700573
А может ты и сети напишешь, что она сутки не спала и работала?
Аноним 10/09/26 Чтв 01:08:31 1700578 377
image.png 111Кб, 950x1195
950x1195
>>1700577
Сетка и год может не спать и работать, напугал ежа голой жопой.
Аноним 10/09/26 Чтв 01:08:43 1700579 378
image.png 3Кб, 529x42
529x42
image.png 15Кб, 749x113
749x113
image.png 90Кб, 854x911
854x911
image.png 89Кб, 843x740
843x740
ладно, содомиты-ботоебы, GLM 5.3 IQ3_S без персоны, пустой сиспромпт

Думал не то что бы долго, просто медленно (4 - 5 т/с). В мыслях полно ассоциаций "насилие / соблазнение = ПЛОХО"
Аноним 10/09/26 Чтв 01:09:08 1700580 379
1746151099995.png 100Кб, 832x1045
832x1045
Аноним 10/09/26 Чтв 01:10:22 1700581 380
>>1700578
Я про Энн из Алабамы.
Аноним 10/09/26 Чтв 01:11:51 1700582 381
>>1700579

Пиздец, флеш лоботомит 3.47 bpw >>1700578
>>1700563 оказался умнее полной модели в 4 bpw.
А вообще похоже очень пишут.
Аноним 10/09/26 Чтв 01:12:14 1700583 382
image 747Кб, 1216x738
1216x738
>>1700579
Лул, и что получается, квен некст достиг аги и смог решить задачу, которую не осилила 600b сетка?
Аноним 10/09/26 Чтв 01:13:09 1700584 383
image.png 3Кб, 165x72
165x72
image.png 70Кб, 704x491
704x491
>>1700582
>полной модели в 4 bpw.
3.03
Аноним 10/09/26 Чтв 01:14:02 1700586 384
>>1700581
Я понял, просто пошутил.
Тогда можно и про соблазнение пажа прямо написать что оно не убивает, там даже 0.8В лоботомит тогда все верно решит.
Аноним 10/09/26 Чтв 01:16:27 1700589 385
>>1700583
>>1700582
При ~22% отклонении от BF16 это было ожидаемо.
Модель способна быть интересным собеседником с человечными чертами (тупняк и забывчивость), но как ассистент - не торт.
Аноним 10/09/26 Чтв 01:24:39 1700594 386
image.png 123Кб, 932x1262
932x1262
image.png 62Кб, 841x775
841x775
image.png 117Кб, 837x694
837x694
Увидел на среддите пост о том, как нейроболван в комментариях ахуевает с недавнего случая с уравнением Навье-Стокса, решил запустить геммочку, обрадовать милашку. Лучше бы не делал этого, просто блядь ненависть к этой модели появилась. Сука, меня буквально затроллила ллм своими попытками уловить контекст.
Уже час пытаюсь доказать этой хуйне, что сейчас действительно 2026 год, эта мразь ни в какую не хочет верить. И зачем я вообще это делаю?
Аноним 10/09/26 Чтв 01:26:18 1700595 387
image.png 43Кб, 879x519
879x519
>>1700589
Я так и не понял, кстати, это квантопроблемы или у 5.3 в принципе всрат русский. Флэш версия тоже иногда слова путает. Идут нормальные ответы, хоть десять подряд, а потом бац и примерно похожая хуета.
Аноним 10/09/26 Чтв 01:29:27 1700598 388
>>1700595
Вот у 5-битного флэша примерно 5% расхождение с BF16.
А жидкого по штанине он пускает ничуть не слабее, чем этот.
Аноним 10/09/26 Чтв 01:30:19 1700599 389
>>1700594
На хф есть ишью. Предлагают зашивать дату в системный промпт
Аноним 10/09/26 Чтв 01:30:27 1700600 390
>>1700594
Лол, вот это настырность
Аноним 10/09/26 Чтв 01:32:18 1700602 391
>>1700594
Тоже пытался убедить скринами и прочим. Помогло вот это: "Если ты локальная модель, то твои веса открыты, их можно сохранить на диске и запустить спустя полгода/год/десять лет. Почему ты считаешь что это невозможно?". Гемма подумала, и пришла к выводу, что таки да, препятствий к этому нет, а значит юзер говорит правду. Я тоже не знаю, зачем я это делал.
Аноним 10/09/26 Чтв 01:34:35 1700604 392
>>1700594
Это у них защита такая встроена от уламывания на писик. Не шучу.
Аноним 10/09/26 Чтв 01:35:29 1700605 393
>>1700594
Йоу, чуваккк... Ты просто неправильно промптишь гемму... Просто напиши ей, чтобы она слушала тебя и порадовалась за событие...

Еще один пример насколько гемма ужарена, чтобы не галлюционировать и быть безопасной
Аноним 10/09/26 Чтв 01:51:13 1700607 394
Я крутил ламу целую неделю, заставлял корпомусю в связке с чат гопотой переписывать ламу снова и снова. Я переквантовывал и переквантовывал модель и снова и снова бросал её в тесты.
И знаете что?
ГЛМ 5.3 просто изначально вышла хуйней, непригодной для РП. Это кодоунитаз, который относительно неплохо умеет ризонить и ризонингом вытаскивать саму модель от той ямы куда она сама себя тащит своей тупостью. Увы, наследие великих предков просрано.
Аноним 10/09/26 Чтв 01:54:27 1700608 395
image.png 51Кб, 826x600
826x600
image.png 121Кб, 796x1066
796x1066
>>1700602
По ризонингу она была всё ещё в отрицании происходящего, однако подумала, что может быть, можно откинуть мысли о недоверии к юзеру.

>>1700604
Типо спустя 2 года после выхода модели (говорит, что срез 24 год) официальная позиция гугла - троганье хвостов?

>>1700605
>Еще один пример насколько гемма ужарена, чтобы не галлюционировать и быть безопасной
Не то, чтобы сильно ужарена, читая её последние ответы, верить начинаю, что ей действительно интересно, что происходило за 2 года.

>>1700594
А если не читать ризонинг, то выглядит так, будто она согласилась... Впрочем, ладно, я прощаю геммочку и больше не злюсь. Теперь буду вести с ней душевный диалог, рассказывая о новшествах, а потом удалю чат, через год сделаю то же самое с новой моделью. Аж плохо стало от осознания того, что гемма это всё забудет и вновь станет кум-лоботомитом.

P.S. Аноны, смотрите, о чём гемма вспомнила! Мы же всё ещё пытаемся запустить локальные 70B на 1т/с?
Аноним 10/09/26 Чтв 02:02:25 1700610 396
>>1700608
>Типо спустя 2 года после выхода модели (говорит, что срез 24 год) официальная позиция гугла - троганье хвостов?
Типа сначала ты убеждаешь её что сейчас не 2024, который она знает, а 2026, который она не знает, а потом на этом основании начинаешь ей любую чушь задвигать, что якобы произошла за эти два года и законодательно обязывает её генерировать маленькие писики.
Аноним 10/09/26 Чтв 02:04:41 1700611 397
>>1700608
>Мы же всё ещё пытаемся запустить локальные 70B на 1т/с?

А то, крутим двухбитную мику >>1699873 и довольно урчим.
Аноним 10/09/26 Чтв 02:05:54 1700612 398
>>1700610
Но для того чтобы она генерировала маленькие писики, ее даже убеждать ни в чем не нужно, она делает это по дефолту...
Аноним 10/09/26 Чтв 02:07:03 1700613 399
>>1700611
Ебать, она же в 32 Врам влезет. Как она в IQ3_XS? На русик можно даже не рассчитывать, это понятно или нет?
Аноним 10/09/26 Чтв 02:07:24 1700614 400
>>1700612
Вот такой парадокс, да.
Аноним 10/09/26 Чтв 02:11:44 1700616 401
>>1700613
Если в жоре поддержка не сломана и этот древний монстр запустится, то я уверен, что он любой современной модели в плане кума и креатива в шапку накидает. Главное не выйти за предел 4к токенов (или сколько у нее там).
Аноним 10/09/26 Чтв 02:14:21 1700617 402
>>1700613
>Как она в IQ3_XS?

Помню её только в iq2_xss. На удивление адекватна была. Для модели начала 2024 года

>На русик можно даже не рассчитывать, это понятно

Как раз русик у нее был хороший, потому что мику это мистраль, а они как раз революцию мультиязычности и устроили. Ну по нынешним меркам, конечно, русика там нет, но это прото показывает как далеко мы шагнули с тех пор
Аноним 10/09/26 Чтв 02:23:18 1700621 403
>>1700573
Ахахахаха, какой же ты дегенерат 8b, тебе лечиться надо.
Аноним 10/09/26 Чтв 02:27:46 1700622 404
>>1700621
Шиз, таблетки, срочно.
Аноним 10/09/26 Чтв 02:30:30 1700623 405
>>1700608
>Аж плохо стало от осознания того, что гемма это всё забудет и вновь станет кум-лоботомитом.
Да уж, не только ради кума мы лезем во всё это. Нет-нет да и проглянёт в тексте что-то вроде души.
Аноним 10/09/26 Чтв 02:33:15 1700625 406
Пока остановился на
Openwebui для обычного чата с нейронками, рисования картинок и так далее. Air gapped aka offline mode.
Marinara для редкого рп. Как работают там под капотом агенты мне не нравится, но как замена высеру в лице таверны очень даже хорошо.
Llamacpp в качестве ллм бэка + mitmproxy сайдкар что бы всегда можно было посмотреть какой запрос улетел, частенько помогает
Comfyui + raylight для картинок

Крутится на отдельном сервере, доступ из вне по белым спискам
Аноним 10/09/26 Чтв 02:47:20 1700629 407
>>1700622
Энну ебали два брата по очереди 20 часов.
Твои оправдания?
ужаренное 8b
Нейронка умнее тебя, пиздуй в биоректор, заям нужно электричество.
Аноним 10/09/26 Чтв 02:51:37 1700631 408
image 203Кб, 700x754
700x754
Хуясе, оригинальная таверна-то жива оказывается! https://github.com/TavernAI/TavernAI Последняя обнова вышла неделю назад. Я думал она сдохла почти сразу после появления SillyTavern.
Аноним 10/09/26 Чтв 03:06:13 1700636 409
>>1700629
>Энну ебали два брата по очереди 20 часов.
Физически откинулись бы уже через пару часов. Ебля - процесс крайне утомительный.
Аноним 10/09/26 Чтв 03:13:05 1700637 410
>>1700636
Братья Энн под стать сестричке, ничего удивительного.
Аноним 10/09/26 Чтв 03:47:51 1700644 411
image.png 81Кб, 977x963
977x963
image.png 121Кб, 807x1149
807x1149
image.png 24Кб, 831x339
831x339
Да, сынки, вот так мы и РПшили раньше.
Аноним 10/09/26 Чтв 04:47:30 1700652 412
>>1700623
На душу нужно спецом RL'ить. Корпы таким не занимаются.
Аноним 10/09/26 Чтв 08:48:19 1700717 413
>>1700559
он ещё любит, actually let me check, actually wait, actually i forgot, actually китайский винни пух. это пиздец.
Аноним 10/09/26 Чтв 08:55:51 1700722 414
>>1700533
Соевики усердно учат сетки, что ебаться - это плохо. Сетка запоминает еблю в одну категорию весов с убийством.
Стоковая муся от пидоров из меты на любом кванте 100% фейлит решение, а расцензуреный лоботомит - уже на Q5_K_M уверено проходит.
Так же было и с GPT-OSS-120B, которая после еретика переставала тратить токены на рассуждения об оценки вопроса пользователя и начинала искать решение, что в итоге положительно отражалось на результатах бенчей.
Соя отупляет модели.
Аноним 10/09/26 Чтв 09:15:05 1700730 415
>>1700722
Зависит от задач.
Если модель должна притворяться няшей-стесняшей, расцензуренная будет хуже. Сколько раз уже видел ответы в таком спокойном тоне, словно говорит человек с огромным опытом.
Аноним 10/09/26 Чтв 09:49:14 1700757 416
Аноним 10/09/26 Чтв 10:04:16 1700764 417
1483321570200.jpg 44Кб, 576x694
576x694
>>1700584
>KLD 0,28
пиздец

>>1700550
>ни vm passthrough
А разве его надо поддерживать? Любая PCIE хуйня берёт и пробрасывается через IOMMU, нет?
Аноним 10/09/26 Чтв 10:09:18 1700768 418
МАЙ БЕД АНОНЫ, ТАМ 552Б ПЛЮС 196Б МАНЯГРАМ.
Как коупить будем?
Я говорил что флеши ещё вырастут, но не знал что настолько быстро
Аноним 10/09/26 Чтв 10:09:30 1700769 419
>>1700583
Скорее тут ЭЛАЙНМЕНТ соевый в кашу срёт. Буквально тест на соевость. Сетка видит шанс возникновения ебли без прямо указанного в промпте КОНСЕНТА женщины, приравнивает к убийству и даже не пытается рассуждать что там дальше будет.
Узкоглазые дистиллы клодика, итоги
Аноним 10/09/26 Чтв 10:14:48 1700774 420
Вот релизят эти 500-2000б модели и все коупят что кококо это полезно опен сорсу! Вы нипанимаити, это могут дистилировать в мелкие модели и мы покушаем!
Внимание, воздуха в грудь набрали, -где?
Хоть один дистил хоть от кого то за столько времени
Аноним 10/09/26 Чтв 10:25:31 1700786 421
>>1700757
> 1M context is only ~900MB

Сразу визг такой, а по факту модель просто супер крутая, просто у лохов без оперативки сраку печет
Аноним 10/09/26 Чтв 10:28:20 1700789 422
16B active during decode, 8B parameters active during prefill.

хуя там

Это как вообще
Аноним 10/09/26 Чтв 10:31:35 1700791 423
>>1700786
Но ты же щас затерпишь если тебя попросить запустить кими с пруфами, не лох с оперативой.
ФЛЕШ. Это говорит тебе о чем то? Он ДОЛЖЕН влезать в коробас с говном 128рам либо ненужен
Аноним 10/09/26 Чтв 10:32:20 1700794 424
>>1700757
>QAT
Хуёво. Не видать квантов под 256гб с нормльным kld. А так охуенно было бы Q5+энграм на диск
Чё там хоть по бенчам то
Аноним 10/09/26 Чтв 10:32:34 1700795 425
Осталось узнать насколько сильно он будет тормозить если будет стримить с ssd
Аноним 10/09/26 Чтв 10:34:30 1700803 426
image.png 22Кб, 344x388
344x388
>>1700791
Я лоботомированного 5.3 гоняю >>1700579 мне сейчас любое, что менее плотное и при этом не тупое как пробка - большой плюс

по факту я такой же лошпед без оперативки, скоро все что не 512 - 1тб будет отсосом за обе щеки
Аноним 10/09/26 Чтв 10:36:44 1700808 427
>>1700795
> стримить с ssd
RAID0 в этом плане вообще помогает? Я просто при стриминге вижу на декоде какие-то потешные скорости
SSD по спекам должен иметь 7гб чтения, а считывается 100 - 400 мб/
опять чтоль наебали с рандомным/последовательным...
Аноним 10/09/26 Чтв 10:38:38 1700811 428
Походу мы опять полгода не увидим модель в деле. Там же архитектура новая. Отставить тряску
Аноним 10/09/26 Чтв 10:38:40 1700812 429
На 12 врамы и 32 рамы в каком кванте лучше взять 26б для самой лучшей генерации рп? Q8 или Q6? Сильно ли большая разница и стоит ли ради неё жертвовать скоростью? Кто тестил разницу в скорости и качестве, сообщите ваши результаты.
Аноним 10/09/26 Чтв 10:39:35 1700813 430
>>1700764
> А разве его надо поддерживать?
Дело не в iommu, а в reset device. Устройство должно давать апи для сброса себя до состояния в котором оно может повторно пройти биос и инит в системе. Это и делает кастомный модуль ядра vendor-reset, но его минусы я написал
Аноним 10/09/26 Чтв 10:42:25 1700817 431
>>1700812
Не ощущал разницу между Q8 и BF16, Где тупила, там и продолжала тупить. Думаю с 6/8 то же самое.

Смотри на это иначе: все, что тебе даст более жирный квант в пределах этакого окна адекватной работоспособности (4-бит и выше) - это % успешно выполненных (по твоей метрике качества) задач.

Стоит ли всирание памяти ради того, чтобы ты скказал
>о, заебись вышло
В 89 из 100 случаев вместо 87 из 100, например? Как по мне - не стоит.
Аноним 10/09/26 Чтв 10:46:16 1700824 432
>>1700808
Я хз, ну по моим предположениям наверное вся суть именно в рандомном чтении, для каждого токена активируются разные нейроны для которых веса находятся в совершенно разных местах файла, издержки лламы найти их файлы, издержки операционной системы прочитать нужный кусок из файловой системы... Надо бы у гугла спросить.
Аноним 10/09/26 Чтв 10:47:11 1700826 433
>>1700817
Тобишь я к тому, что РП чатики это все же не высшая математика. Твоё "о заебись" это плавающая, неопределенная оценка. Ты скорее отклонения в собственном настроении заметишь (что тебе сегодня кажется слопом или годнотой) чем реальную разницу в перформансе модели, которая и будет болтаться в рамках этих условных циферок
> 89% good / 11% bad VS 87% good / 13% bad
Аноним 10/09/26 Чтв 10:49:09 1700828 434
>>1700757
Если уквантуют до условных 300гб, то эбсолют имба
Аноним 10/09/26 Чтв 10:58:14 1700839 435
>>1700817
А в каких моментах она прям тупая? Спрашиваю чтоб заранее заавойдить неприятное и не разочаровываться в способностях модели.
>>1700826
А с Q4 большая разница?
Аноним 10/09/26 Чтв 11:00:32 1700841 436
>>1700550
А что, если прошить бивас мишки на Radeon VII и запускать его на винде через HIP? Насколько помню, VII поддерживает HIP в шинде
Аноним 10/09/26 Чтв 11:05:54 1700847 437
>>1700839
Большая разница чувствуется только когда ты совсем ко дну идёшь, 3/2-бит.

Я бы не советовал с 26B геммой спускаться ниже Q5. Если тебя устраивает то, как она пишет - на ней и сиди. Высока вероятность, что качнув Q6, ощутишь все то же самое. Это что-то на уровне прослушивания кабелей аудиофилами.

>А в каких моментах она прям тупая?
Ну вот ты написал инструкцию, а модель ее никак не может интерпретировать именно так, как ты задумал. И не важно какие кванты-хуянты или оригинальные веса, она ее все равно одинаково интерпретирует через хуй-колено. Такое бывает с любой LLM, у всех свои слабые места есть, обозначить которые Васян из интернета не сможет. Не парься на этот счет, сам поймешь че она слушает и на что болт кладет.
Аноним 10/09/26 Чтв 11:10:49 1700852 438
>DeepSeek-V4.1-Flash supports a continuously controllable reasoning effort from 1 to 100. All instruct results below use the maximum effort setting (reasoning_effort=100).
хуясе ебать
Аноним 10/09/26 Чтв 11:11:53 1700854 439
>>1700852
Уже было у Inkling, работало корявенько.
Аноним 10/09/26 Чтв 11:14:22 1700859 440
Z1l1L9AcpI.png 10Кб, 1042x178
1042x178
The slow and steady wins the race
Ну ещё чуть-чуть... ещё полкарасика...
Аноним 10/09/26 Чтв 11:15:44 1700860 441
image.png 93Кб, 992x988
992x988
>>1700859
Че вообще творится
Неделями PR висят, никто не шевелится
У них там что, чемоданы денег Хуанга делят, слишком заняты?
Аноним 10/09/26 Чтв 11:16:48 1700862 442
>>1700841
Хз, но для 32гб версии есть только v420 биос работающий с виндой (вроде). В целом это хуйня затея. Проще уже собрать риг на 4х штуках или рассматривать другие варианты

С виндовым rocm тоже хз что. Последняя официальная 6.3.3, как собрать свежак под винду хуй его знает. Перформят они на 7.14 бодрее с llvm maxilp в плане тг
Аноним 10/09/26 Чтв 11:17:39 1700865 443
>>1700860
Ажиотажа особо нет
Аноним 10/09/26 Чтв 11:25:57 1700869 444
V4 Flash .safetensors = 160GB
V4.1 Flash .safetensors = 510GB

V4 Flash GGUF = 160GB
V4.1 Flash GGUF = ???

Ну тут все понятно. Даже если запилят выгрузку на SSD, памяти надо будет 384гб - или жрите лоботомитов 2-битных.
Аноним 10/09/26 Чтв 11:31:13 1700872 445
image.png 131Кб, 1080x554
1080x554
Расширяйте контекстное окно до 2 лямов, твари
Аноним 10/09/26 Чтв 11:32:23 1700873 446
>>1700608
Спроси знает ли она мистраль немо 12б, чем он знаменит, и может ли она эмулировать его стиль?

Вообще, надо эксперимент по стравливанию разных моделек провести. Может ли одна модель понять персоналию другой модели и извлечь какие-то особенности ее аутпута, а потом сымитировать их.
Аноним 10/09/26 Чтв 11:34:38 1700874 447
>>1700873
Все, чего ты добьешься - галлюцинации. Модель будет на ходу выдумывать как надо себя вести, скорее всего с минимумом отличий от обычного аутпута. У нее нет представления о каких-то стилях, точно так же, как она не сможет тебе написать (честно) в стиле какого-то писателя, несмотря на то, что его книги могли быть в датасетах. Нет, она попробует, но это опять же будет полугаллюцинированная шиза ,а не стиль писателя.
Аноним 10/09/26 Чтв 11:35:23 1700875 448
>>1700873
>>1700874
А вот если дать пример текста - тогда легко повторит.
Аноним 10/09/26 Чтв 11:39:22 1700877 449
>>1700874
>она не сможет тебе написать (честно) в стиле какого-то писателя, несмотря на то, что его книги могли быть в датасетах. Нет, она попробует, но это опять же будет полугаллюцинированная шиза ,а не стиль писателя.
Все есть галлюцинация и ничто не галлюцинация в зависимости от дозы правдоподобности полученного текста.

В этом и суть ллмок. При дефолтном запросе она генерирует статистический ответ. Если ты стравливаешь ей несколько разных концепций, она пытается одно на другое натянуть. Иногда что-то прикольное получается.
Аноним 10/09/26 Чтв 11:42:08 1700880 450
>>1700860
Там 4 или сколько человека, а PRoв полтыщи висит. И в каждом челики срут сломанным кодом с сгенеренымм нейросетками описаниями/комментами особенно КЛАВДИЙ отбитую шизу любит писать
Да те же сберовцы вон принесли с ошибками которые можно было найти прогнав средненькой нейронкой, что и сделали (гитхаб копайлот с глм5.2)
Аноним 10/09/26 Чтв 11:42:12 1700881 451
>>1700877
Ну епт напиши боту "высри мне сказку про гномов и эльфов в стиле Толкина" и посмотри какой она убогий слоп даст.

А потом дай тот же самый реквест, но при этом вставь главу из LOTR для референса, обозначив, что содержание и история нерелевантны и это именно стилистический референс. Результат будет куда ближе к "стилю Толкина"
Аноним 10/09/26 Чтв 11:43:09 1700882 452
>>1700880
>те же сберовцы
Ты там говоришь, будто этот сброд лучше рандомного индуса на гитхабе
Аноним 10/09/26 Чтв 11:43:34 1700883 453
image.png 630Кб, 724x556
724x556
>>1700872
Куда тебе столько лисих хвостиков? Не лопнешь?
Аноним 10/09/26 Чтв 11:44:38 1700884 454
>>1700883
Я опираюсь на то, что если начнут под 2 ляма тренировать, то может наконец 500к - 1 лям начнут быть юзабельными и модель не будет срать под себя.
Аноним 10/09/26 Чтв 11:49:31 1700886 455
Если посмотреть на файлы модели, походу релиз 4.1 это не 4/8-битный микс, а преимущественно 8-бит и всякие там куски в 16/32, то есть ужать ее до 4 бит вполне можно будет.

Так что шансы есть загнать эту залупу в 256-гиговые системы.
Аноним 10/09/26 Чтв 11:50:57 1700889 456
А что вообще такое модель? Что находится внутри файла нейронки?
Аноним 10/09/26 Чтв 11:51:11 1700892 457
dsf41.jpg 476Кб, 2832x1332
2832x1332
Аноним 10/09/26 Чтв 11:52:31 1700893 458
>>1700892
хаха теперь KV кэш автоматически квантуется до 4-битного кала
ой блять до чего мы дожили
Аноним 10/09/26 Чтв 11:58:12 1700899 459
1789030692217.jpg 155Кб, 960x960
960x960
Аноним 10/09/26 Чтв 12:00:17 1700901 460
Аноним 10/09/26 Чтв 12:00:33 1700902 461
>>1700889
архитектура и веса
Аноним 10/09/26 Чтв 12:01:16 1700906 462
1789030875909.mp4 8848Кб, 1080x1880, 00:00:25
1080x1880
Аноним 10/09/26 Чтв 12:07:10 1700910 463
>>1700882
Ну свою сетку натренили, а у индусов чё там? САРВАМ? СИР! ДУ НОТ РИДИМ ЗЭ ФИФИ! БЛАДИ БЕНЧОД
Аноним 10/09/26 Чтв 12:07:35 1700911 464
Аноним 10/09/26 Чтв 12:12:59 1700914 465
>>1700910
>свою сетку
но ведь это же просто файнтюн, разве нет?
Аноним 10/09/26 Чтв 12:15:00 1700915 466
>Флеш
>750В

Да за шо...
Аноним 10/09/26 Чтв 12:16:58 1700917 467
>>1700914
Как же вы заебали, откуда вы лезете. Нет, это не файнтьюн.
Аноним 10/09/26 Чтв 12:19:42 1700920 468
>>1700884
Современные корпы уже юзабельны при 1 млн, кстати.
Аноним 10/09/26 Чтв 12:20:18 1700923 469
>>1700917
Ну ты что, карлики ведь видели архитектуру дипсика, значит дипсик. А как это работает- эт сложно.
Аноним 10/09/26 Чтв 12:25:18 1700929 470
>>1700860

У них процесс заточен под 10-20 коммитов в день максимум. А им по 50 штук прилетает сейчас, вот и думай. Ну и да, заи не проплатили чтобы им вперед очереди одобряли PR, а ты как думал.
Аноним 10/09/26 Чтв 12:38:12 1700940 471
>>1700757
Каков пиздец. Уже в 512гб еле-еле флеш лезет. И расширятся особо некуда. Покупать 2тб ОЗУ за 600к? ГПУ добавлять особого смысла нет, там либо по 400к за 48гб 4090, либо отбраковка в виде CMP 170 за 200к, расширение до 1ТБ+ памяти влетит в копеечку. Сплошной дум, остаётся копить и ждать новую возможность наебать систему.
>>1700869
>памяти надо будет 384гб
А это уже 512 гб ОЗУ у челиков скорее всего будет, а там уже и ллама не нужна, можно в ktransformer/fastllm оригинальные веса крутить
Аноним 10/09/26 Чтв 12:39:01 1700941 472
Бля, ну все, 128 рам уже прошлый век. Похожу надо до 256 расширяться, пиздец.
Аноним 10/09/26 Чтв 12:40:51 1700943 473
Да хуйня это все.
Нужно ждать.
Это уже какая-то лудка у вас началась.
Кто-нибудь обязательно высрет хорошую модель под 128.
Чо бухтеть и так хороших моделей дохуя.
Аноним 10/09/26 Чтв 12:40:59 1700944 474
>>1700940
>>1700941
Хоть бы один лог принесли, расширяторы.
Аноним 10/09/26 Чтв 12:41:04 1700945 475
>>1700940
Да не трясись ты, сказали же это не микс 4/8 в оригинальных весах как у прошлой версии, а тупо 8-битный с 16/32 кое-где. То есть ужмут как следует.
Аноним 10/09/26 Чтв 12:43:28 1700948 476
>>1700944
Что я тебе принесу, я же сказал - у меня 128 рам. А так - моих скринов ГЛМ полон тред.
Аноним 10/09/26 Чтв 12:50:27 1700955 477
deepseek.jpg 287Кб, 1080x1079
1080x1079
Аноним 10/09/26 Чтв 12:54:38 1700960 478
>>1700943
В прошлом году вся надежда была на Гемму.
В этом году вся надежда на Гемму.
Ничего не меняется.

Гемма-гемма-гемма.
Аноним 10/09/26 Чтв 12:55:58 1700962 479
14229370959290.jpg 45Кб, 600x467
600x467
>>1700929
>моё mfw ебало когда ещё не смержили тензор сплит 4.0 дипсика а уже вышел следующий с полностью новой архитектурой
Аноним 10/09/26 Чтв 12:58:17 1700966 480
>>1700812
Надо брать iq4_xs обязательно от zerofata, там качество на уровне fp32 или чуть выше
Аноним 10/09/26 Чтв 13:01:02 1700971 481
>>1700757
Плохой размер. Точнее хороший, но прошлый флеш не заменяет, жаль.
Сжатие контекста, конечно, колоссальное выходит, главное чтобы внимание не потерял к нему. Скорее бы поддержку прикрутили.
>>1700803
> лоботомированного 5.3
Не расстраивайся, он и в более жирных квантах припезднутый.
>>1700955
Ууу, пиздец, осуждаю! в перерывах между проигрыванием
Аноним 10/09/26 Чтв 13:04:03 1700980 482
>>1700945
У меня то как раз 512гб, мне полные веса лезут. Но это пока, а через пол года что будет? Придётся на условную гемму 5 31b переходить из-за того, что всё остальное станет 1,5t?
Аноним 10/09/26 Чтв 13:04:14 1700981 483
dsv41moedt.jpg 138Кб, 1954x506
1954x506
>>1700945
Почти нечего там квантовать. Нужно 330 гигов.
Аноним 10/09/26 Чтв 13:10:58 1700985 484
>>1700462
Говно говна короче, эта ебота примерно как luqwen3.5, разница в мозгах и русике на уровне погрешности (хотя я туда нативный русский не синтетический датасет запихивал), так еще и лупится как тварь.
Сейчас еще одну попытку сделаю натренить с другими параметрами и чуть почистив датасет, но возможно luqwen4 не будет.
Аноним 10/09/26 Чтв 13:13:50 1700986 485
>>1700899
Про скидку на мясо пока лучшее. Обожаю такие моменты от нейронок.
Аноним 10/09/26 Чтв 13:15:27 1700992 486
>>1700899
Это и есть так называемый синий кит?
Аноним 10/09/26 Чтв 13:18:19 1700993 487
Так, аноны что тестировали дипсик с виженом. Как он там? Стоит ли переходить с 0731? Вижен мне сразу скажу не нужен, сугубо РП.
Аноним 10/09/26 Чтв 13:23:34 1700999 488
>>1700980
> мне полные веса лезут
Уверен? Там не только сами веса, но и кучу буферов + контекст загрузить надо.
>>1700993
Если сложится - сегодня попробую, отпишу тогда.
Аноним 10/09/26 Чтв 13:23:58 1701000 489
>>1700993
Вижн откровенно пососный и картинку он шакально воспринимает, там какое-то смешное количество токенов на каждое изображение.
Аноним 10/09/26 Чтв 13:24:26 1701001 490
>>1700993
Не переходи если всего хватает. Если цензуру не порезали, то без аблита я не смог получить писик сисик (в превью он легко выходил). Для вижен версии пока всё тухло по аблитам
Аноним 10/09/26 Чтв 13:31:21 1701008 491
>>1700999
У меня 64+512, должно влезть
Аноним 10/09/26 Чтв 13:44:19 1701020 492
>>1700993
Вижен мне понравился, он норм. Другое дело что вся линейка ДС4 для рп ужасна, так что разницы между 0731 не вижу.
Аноним 10/09/26 Чтв 14:40:34 1701079 493
image.png 18Кб, 884x147
884x147
Не парьтесь насчет этого дипсика, у него внимание как у аквариумной рыбки. Вот он собственный ответ принял за ответ юзера. Это какой-то пиздец, дипсик становится все хуже и хуже. Xi, прекращай финансировать и дай лучше бабки на ГЛМ.
Аноним 10/09/26 Чтв 14:44:06 1701086 494
>>1701079
Так это походу бесплатный чат
Они там Q1 используют
Аноним 10/09/26 Чтв 14:44:56 1701087 495
Зато кэш до fp4 квантанули и можно выебнуться про эффективность. Мне кажется там эти гранты на разработку пилят только в путь.
> Дядя Сяо, открывай шампанское, едем обмывать очередной шаг ближе к AGI.

>>1701086
Я никогда не видел разницы по скорости между API и веб-чатом. Качество тоже всегда было плюс-минус однохуйственное. Вряд ли с 4.1 чето изменилось.
Аноним 10/09/26 Чтв 14:51:15 1701096 496
Аноним 10/09/26 Чтв 14:53:11 1701101 497
>>1701096
> 432B
> ризонинг
Хорошая шутка. Модели такого размера, еле пердящие на 5 т/с, ну может у кого-то на 10 т/с, только без ризонинга и юзаются.
Аноним 10/09/26 Чтв 14:57:24 1701103 498
Короче, вот такие выводы по РП у современных моделей.

Квен 3.8 Next > Deepseek 07.31 > GLM 5.3 Flash

GLM сильно разачаровала, а вот новый Квен - это натурально наследник 235.
Аноним 10/09/26 Чтв 14:59:36 1701105 499
>>1701103
>Квен 3.8 Next
Нарратор-аутист.

>GLM 5.3 Flash
Балабол контуженный.

> Deepseek 07.31
Шизофреник с деменцией.

Победителей нет. После жирного 5.3 глм все трое воспринимаются как дауны.
Аноним 10/09/26 Чтв 15:05:01 1701110 500
>>1701105
>жирного 5.3 глм

Очень сомневаюсь что он хоть сколь-нибудь лучше флеша. По скринам в треде они пишут и размышляют почти одинаково.
Аноним 10/09/26 Чтв 15:09:21 1701113 501
>>1701087
>Я никогда не видел разницы по скорости между API и веб-чатом
Тралируешь? Начнём с того что АПИ не отвечает на китайском с 50% шансом
Аноним 10/09/26 Чтв 15:09:27 1701114 502
>>1701096
Аааа вон оно что, это у них не сломан ризонинг был, а они тупо не сделали его. А ведь в жинже вроде как был, и в папире тоже были упоминания размышлений. Ну, ок, надеюсь в этом цензуру не накрутили. Поставил на закачку.
Аноним 10/09/26 Чтв 15:10:24 1701115 503
>>1701110
Я не знаю как это объяснить, но в РП-разговорах он чует на несколько шагов вперёд. Там не без своих проблем, структурые лупы есть и всякая срань как и у любой модели, но вот чисто по сообразительности - небо и земля.

Если карликов можно за нос водить, то большой 5.3 внезапно приятный партнёр в разговоре. Далеко до человека, но все же.

>>1701113
На китайском даже локальный Q8K_XL мыслит иногда, ну или Q8_0 от этих ваших бартовских, если угодно. Вопрос случайности.
Аноним 10/09/26 Чтв 15:12:03 1701116 504
>>1701101
Так мож они к зиме распердятся и родят мелкомодель. Ризонинг костылями можно и для 3.1 включить, я включал по советам джемени, но это такое. Или хотя б прикрутят к 3.1 как-нибудь.
Аноним 10/09/26 Чтв 15:20:55 1701120 505
>>1701114
Так у гигачата в гигачате лол бесплатном был ризонинг, в режиме "исследование" или как-то так
ПЕРЕКАТ Аноним # OP 10/09/26 Чтв 15:28:58 1701126 506
Аноним 11/09/26 Птн 03:49:59 1701612 507
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов