Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 504 94 91
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №261 /llama/ Аноним 29/08/26 Суб 00:09:27 1689903 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение1.png 2568Кб, 2540x2136
2540x2136
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1687604 (OP)
>>1684266 (OP)
Аноним 29/08/26 Суб 00:28:54 1689918 2
Аноним 29/08/26 Суб 01:18:21 1689939 3
>>1689918
Разве нельзя просто догадаться по весу? Все равно ты на него в первую очередь ориентируешься, ведь важно только насколько хорошая модель влезет в твое железо
Аноним 29/08/26 Суб 02:42:05 1689965 4
Квен Некст ожидаемо рефузит и аположайсит. Как и Глм 5.3 Флеш. В целом у обоих те же болезни что и у Геммы, да и сильно лучше они в рп не пишут. Для локального рпшинга Гемма по прежнему на коне. Квен Некст тестил Q5 локально, Глм 5.3 через попенроутер
Аноним 29/08/26 Суб 02:51:54 1689968 5
image 53Кб, 965x252
965x252
Скачал
Qwen3.8-Flash-Next-Uncensored-IQ4_XS
На 3060 12гб с --tensor-read-lazy on -b 1024 -c 139144 --tensor-read-lazy on дает 11.79 t/s.
В принципе неплохо для видюхи за 200 баксов.
Только разгоняется долго, надо 12 запросов, чтобы ее раскочегарить.
29/08/26 Суб 03:07:29 1689972 6
>>1689903 (OP)
>Здесь мы делимся рецептами запуска, настроек и годных промтов
Какой кринж. Хотя всем известно, что модель нужно запускать под линуксом, лама сипипи пайтон, с faiss, нтлк и кастомным харнессом.
Но кому я это рассказываю - тут кроме салфеток перед глазами ничего не видят
Аноним 29/08/26 Суб 03:12:47 1689975 7
Аноним 29/08/26 Суб 05:51:21 1689999 8
image.png 1033Кб, 1978x1110
1978x1110
Нах они решили токены такими дорогими делать? В этом и заключается то почему модель так хороша?
29/08/26 Суб 06:07:31 1690001 9
>>1689999
Упёрлось всё в электроэнергию - приходится брать деньги у людей
Аноним 29/08/26 Суб 07:30:23 1690020 10
>>1689999
Какие дорогие токены, на локалке бесплатно гоняется. Причем еще и побыстрее флеш версии. Флеш вообще сплошное разочарование везде кроме справочной информации.
Аноним 29/08/26 Суб 08:51:41 1690041 11
image 52Кб, 962x242
962x242
>>1689968
Ого, оффлоаднуть файл с эмбеддингом на SSD правда помогло, скорость подросла до 13.22 t/s
Аноним 29/08/26 Суб 11:59:23 1690094 12
image.png 63Кб, 1278x438
1278x438
Hеально ли получить на CPU-only сборке 4т/c на Gemma 4 31b Q5 без квантования кэша? Думаю раз ебанутые цены на озу гпу, соберу хотя бы хоть что-то.
текущая сборка AMD Ryzen 9 9950X3D OEM
ASRock B850 Pro RS
Аноним 29/08/26 Суб 12:05:10 1690099 13
>>1689968
Что за оперативка у тебя?
Аноним 29/08/26 Суб 13:11:11 1690129 14
Ну что ж, теперь когда заи официально всё, чего ждать дальше?
Всё же их новый флеш это конечный ответ по вопросу новой 30-3 или эира, мужики решили не быть робин гудами нихуя.
Аноним 29/08/26 Суб 13:14:08 1690131 15
>>1690129
Нищий биоскот, флэш это уже барский подгон. Ты что его третий квант не можешь запустить? Ну купи оперативки тогда, что могу сказать. Нету денег, у родных займи. Ты чем от негра из телеги сосаки отличаешься-то, который хочет фронтир интеллиженс на ноутбуке для учебы?
Аноним 29/08/26 Суб 13:18:49 1690138 16
1787998627001.jpg 31Кб, 320x268
320x268
> Нищий биоскот
> Ты что его третий квант не можешь запустить
Аноним 29/08/26 Суб 13:19:24 1690139 17
>>1690131
>флэш это уже барский подгон
И действительно, потому что когда открытые модели стали переваливать за терабайт параметров, очень многие риги натурально превратились в тыкву. А так хоть с ригом реально фронтир пощупать.
Аноним 29/08/26 Суб 13:21:29 1690141 18
>>1690138
А в чем я не прав? Для твоих бытовых задач подрочить, chat, where did I leave my keys? тебе хватит. Надо больше:
> Ну купи оперативки тогда, что могу сказать. Нету денег, у родных займи.
>>1690139
Ну и становится понятно, что чтобы и дальше щупать все новинки, надо обновляться.
Аноним 29/08/26 Суб 13:25:01 1690146 19
>>1690094
Тебе такой сильный проц по идее ни к чему, инференс на цпу гораздо раньше упрется в скорость памяти, чем в мощь проца.
Аноним 29/08/26 Суб 13:26:04 1690149 20
>>1690020
На пикчу посмотри. Токены квена весят в 3 раза больше чем токены геммы, то есть заьивают в три раза больше врам
Аноним 29/08/26 Суб 13:30:32 1690150 21
>>1690141
> А в чем я не прав?
> Ну и становится понятно, что чтобы и дальше щупать все новинки, надо обновляться.
Ну я год назад обновился чтобы щупать новинки, мог запустить эир в 5 кванте, квен некст в 6 кванте. Теперь мне говорят опять обновиться, а железо на рынке прежнее, да ещё и по ценам х6. Через год флеши скакнут до 700б и опять надо будет обновиться. Предоставьте 256гб ддр6 одним модулем в игровую пк за 50к, тогда поговорим
Аноним 29/08/26 Суб 13:32:32 1690152 22
>>1690150
Возможно, в таком случае локалки не для тебя, анон. Есть и другие увлечения, например, алкоголизм или собирание бирюлек. У меня дед говорил: "Веж живи, век бирюльки собирай". Мудрый был мужик.
Аноним 29/08/26 Суб 13:43:56 1690159 23
>>1690152
>Есть и другие увлечения, например, алкоголизм или собирание бирюлек.
Не. Если бы локалок не было, можно бы и бирюльки, а так уже нет. Это вам не радио, по поводу которого тоже в своё время обещали что-то вроде всеобщего счастья, это принципиально новая хрень. И уже понятно, что от корпов счастья точно не будет.
Аноним 29/08/26 Суб 13:52:03 1690162 24
>>1689972
> под линуксом, лама сипипи пайтон, с faiss, нтлк и кастомным харнессом
Так и сделал, своего "агента" навайбкодил, к тг боту поддключил, вебморду запилил, теперь не знаю чем заняться
Аноним 29/08/26 Суб 14:14:49 1690170 25
>>1689903 (OP)
Так блэт, а где mtp в 3.8-next? Опять ждунствовать?
Аноним 29/08/26 Суб 14:32:59 1690182 26
Бля, ну 3.8-некст - это разъеб, пиздос.
Кумеры, срочно доложите обстановку.
Аноним 29/08/26 Суб 14:41:57 1690187 27
image 271Кб, 899x673
899x673
>>1690182
Заебись, буквально новый эйр. Такой же сочный кум, такой же сломанный нахуй русик, при этом умный и внимательный к инструкциям. С ризонингом xhigh выдаёт кино. На 16+64 шпарит с 15-17 т/с. Это при 140к контекста в F16 и батче 2048. Если освободить врам, поставить батч 512 и 64к контекста в Q8, то там и 20-22 т/c можно выжать. И это МТП ещё не подвезли. Уууух сука...
Аноним 29/08/26 Суб 14:50:02 1690192 28
>>1690187
>Заебись, буквально новый эйр. Такой же сочный кум
От кого анцензоред-квант?
Аноним 29/08/26 Суб 14:52:32 1690194 29
>>1690182
До сих пор не понял какой квант ему качать и как там что работает
Аноним 29/08/26 Суб 14:52:41 1690195 30
>>1690187
>На 16+64 шпарит
Это как???
Аноним 29/08/26 Суб 14:53:19 1690197 31
>>1690187
q2 что ли запускаешь?
Аноним 29/08/26 Суб 15:01:02 1690201 32
>>1690187
Полностью обратное мнение. Подозреваю ты набрасываешь. Соевый, иногда даже аположайсит, не очень умный в рп.
Аноним 29/08/26 Суб 15:01:37 1690203 33
>>1690194
>До сих пор не понял какой квант ему качать и как там что работает
Да этого походу никто не понял. У Радемахера модель по сути одним куском, 4км 120 гигов занимает. Никто не озаботился энграммы выложить отдельно например.
Аноним 29/08/26 Суб 15:04:28 1690207 34
>>1690201
>>1690187
Он аполоджайзит в 9 случаев из 10.
Взять обычную разметку, выключить имена, и там всегда аполоджайз.
Даже не вспомню когда в последний раз такое видел, гпт осс наверное
Аноним 29/08/26 Суб 15:07:59 1690211 35
>>1690149
Я по пикче вижу, что одинаково весят у МоЕ моделей геммы и квена. А плотных гемма 4 на пикче нет, поэтому плотных квенов сравнивать не с чем.
Аноним 29/08/26 Суб 15:08:28 1690212 36
> 6b
> 15т
> шпарит
Аноним 29/08/26 Суб 15:11:20 1690214 37
>>1690192
Аблитка, да. Чот на xhigh я не осилил пробить цензуру в ваниле. Если ризонинг короткий сделать - пробивается, НО НЕТ КИНА.
https://huggingface.co/orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

>>1690195
>>1690197
Q4_K_S. Сгружаешь енграмы на ССД, в остальном то же что и в старом квене 3.5 122b. Анслоповский Q4_K_XL медленный, скорее всего из-за того что снова IQ-слоями насрали. Аблитка сильно быстрее при том же размере. Ну и батруха вон выложил нормальные кванты, можно у него скачать.

Вот параметры запуска (При условии что закрыто всё кроме браузера. Там прям впритык. И да, линукс):

./llama-server \
--model "/mnt/SSD_1Tb/LLM/Qwen/Qwen3.8-Flash-Next-Uncensored-Q4_K_S-00001-of-00003.gguf" \
--mmproj "/mnt/SSD_1Tb/LLM/Qwen/mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf" \
--image-min-tokens 2048 \
--image-max-tokens 2048 \
--no-mmproj-offload \
--alias Qwen3.8-Flash-Next-Q4_K_S \
--flash-attn on \
--threads 5 \
--load-mode mmap \
--fit off \
--ctx-size 140000 \
--no-context-shift \
--batch-size 2048 \
--ubatch-size 2048 \
--parallel 1 \
--cache-ram 0 \
--ctx-checkpoints 8 \
--checkpoint-min-step 1024 \
--n-gpu-layers 999 \
--n-cpu-moe 45 \
--tensor-read-lazy on \
--top-k 20 \
--top-p 0.95 \
--temp 0.7 \
--no-reasoning-preserve \
--reasoning-effort xhigh
Аноним 29/08/26 Суб 15:14:04 1690215 38
>>1689999
Как насчет включить голову и увидеть прямую корреляцию между весом контекста и числом активным параметров?
Аноним 29/08/26 Суб 15:18:35 1690219 39
>>1690146
Где вообще можно узнать про эти тонкости? Не реддитах вообще советуют threadripper за 300к.
Аноним 29/08/26 Суб 15:19:53 1690222 40
>>1690187
Наоборот. Русик в кои-то веки норм(на уровне 235 и 397). Инструкции частично игнорирует(!!), что удивительно, для квена-то. Кум средний, но в целом пойдет.
Согласен только насчет ризонинга и кина.
Аноним 29/08/26 Суб 15:21:21 1690224 41
>>1690219
У трипака сколько каналов? От 8 до 12 вот и думай горловой
Аноним 29/08/26 Суб 15:21:48 1690225 42
>>1690152
Слышишь, хуета. Тебе выпустили модель glm 5.3 на 750b параметров, что прямой апгрейд glm 4.7 на 350b параметров. Ты схуев то опустился на модель ниже, к нам, плебеям, и решил, что можешь тут начать пиздеть. Ну так мы имеем полное право ныть, что флеш из 30b стал 320b, а эир вообще был стёрт из сознания большинства усилиями самих заи.
Так что пиздуй запускать 750b и не будь таким нищим биоскотом.
Аноним 29/08/26 Суб 15:22:41 1690226 43
>>1690214
>--ctx-size 140000

Так нельзя делать. Ставь кратным батчу.
Аноним 29/08/26 Суб 15:25:02 1690229 44
Потестил 4 квант большого GLM 5.3. В РП стал писать заметно лучше, чем прошлый. По цензуре, с одной стороны, хард рефьюзы стали чаще, с другой, я пока не сталкивался с софт рефьюзами (когда модель не отказывает напрямую, но избегает nsfw всеми силами), что часто бывало на 5.2. Префил ризонинга пробивает любую цензуру, но тригерит максимальный ризонинг на 5-7к токенов, возможно если поставить не макс ризонинг при запуске будет лучше, пока не проверял. Русский язык нормальный, но как и у прошлого, иногда проскакивают английские слова, плюс появились слава франкенштейны слепленные из двух слов, начало от одного слова, конец от другого похожего по звучанию, встречаются редко, преимущественно на слопокарточках с кривым нейронным русским.
В целом вин, жду квантов не от анслопов.
Аноним 29/08/26 Суб 15:25:07 1690230 45
>>1690226
Хм, интересно, не задумывался над этим. Прогуглю вопросик, спасибо.
Аноним 29/08/26 Суб 15:40:53 1690236 46
>>1690146
Я думал с запасом взять, чтобы хороший cpu/gpu offload получить когда куплю норм гпу. Скорость памяти это частота ОЗУ?
>>1690224
Если заскамят на 60к еще переживу, а на 300к это уже гг.
Аноним 29/08/26 Суб 15:45:19 1690242 47
>>1690229
>Русский язык нормальный, но как и у прошлого, иногда проскакивают английские слова, плюс появились слава франкенштейны слепленные из двух слов, начало от одного слова, конец от другого похожего по звучанию
>4 квант большого GLM 5.3

У меня гемма, которая в 20 раз меньше и дипсик, который меньше в 3 раза такого себе не позволяют.
Аноним 29/08/26 Суб 15:46:39 1690244 48
>>1690236
За 60к я бы мог собрать из хлама сервак, где gemma 4 31b в норм кванте с норм контекстом (сколько вместится в 32 врам) выдавала бы 40+ токенов
Аноним 29/08/26 Суб 15:48:00 1690246 49
>>1690244
Ну и чего не собрал?
Аноним 29/08/26 Суб 15:56:53 1690250 50
>>1690246
Как раз собираю сейчас такой. До этого уже собрал два сервера на 16 врам по 30к
Аноним 29/08/26 Суб 16:00:41 1690254 51
>>1690244
Гемма 4 это только начало, пока норм видяхи нет. Я же с запасом на обновление планирую и CPU оффлоад (если таковой возможен). И к тому же сколько жизни в этих компонентов осталось тоже не понятно.
Аноним 29/08/26 Суб 16:08:03 1690259 52
>>1690254
Оффлоад возможен, моешки так и гоняются. Только тебе нужно смотреть в первую очередь на объем/скорость/частоту памяти, а не на проц. Современного i7 или r7 там с головой хватит.
Аноним 29/08/26 Суб 16:17:48 1690272 53
>>1690254
Ну хорошо, накупишь памяти, соберешь за пол мульта сборку. Сможешь запускать большие умные модели и наслаждаться их попукиванием в 2-3 т/с
Аноним 29/08/26 Суб 16:21:13 1690273 54
>>1690226
Зачем? В чём идея? Вроде и то и другое делиться на 2 должно и всё
Аноним 29/08/26 Суб 16:24:00 1690277 55
>>1690094
Рузен X3D это наебка для игродебилов, ты можешь на пустом месте сэкономить половину и взять проц без этого юзлес кеша, раз собираешь под нейронки. Тебе просто нужен проц который стабильно работает на высоких частотах памяти и поддерживает много гигабут этой самой памяти. То есть инцел инсайд интел.
Аноним 29/08/26 Суб 16:28:36 1690279 56
>>1690277
А что там у интела за залупа с ЭНЕРГОЭФФЕКТИВНЫМИ ЯДРАМИ? Во-первых нахуя это вообще нужно в стационарной пекарне, во-вторых, не всрут ли они скорость инференса? И если таки всрут, то их можно хоть отключить в бивосе? Охуеть конечно, сначала переплатить за кукурузу, а потом отключать её...
Аноним 29/08/26 Суб 16:31:23 1690282 57
>>1690225
Чел ну не позорься, 30Б это вообще под ноутбуки. Тебе никто кроме меня в треде не ответил, потому что дурачком посчитали.
5.3 залили только сегодня, я даже скачать еще не успел. Но кому нужен 5.3 без вижона, у флэша он есть и ниче такой. Скорее всего буду в основном крутить именно флэш.
Аноним 29/08/26 Суб 16:32:05 1690283 58
>>1690279
Ядра вообще почти нахуй не нужны. Там разница между условным I5 и I9 будет составлять процента 3 может 5. Главное память и скорость памяти. Всё. Забудь про всё остальное.
Аноним 29/08/26 Суб 16:39:45 1690287 59
image.png 712Кб, 2304x1311
2304x1311
image.png 777Кб, 2304x1311
2304x1311
image.png 63Кб, 776x428
776x428
image.png 747Кб, 2304x1639
2304x1639
Стоит ли пердолиться с Q6...

Даже Q4 хорош, но допускает тупняк с логикой по сравнению с Q5. Ошибки русского языка были и на Q5, но не критичные (в рамках ролеплея можно подъебать и он придумает оправдание).

Пока в целом нравится больше чем 5.2 IQ3_XXS, но вот 5.3 IQ3_XXS еще не пробовал - если тот лучше чем 5.2, то флэш-версия рискует отъехать. Смущает только 4й пик - если 5.3 исключительно ризонящая модель, то без ризонинга вовсе может оказаться тупее 5.3 флэша на хорошем кванте. 5.2 же довольно спокойно без ризонинга отвечала.

Кстати Q5 флэш влезает в одну ртх3090 по оффлоаду в рам, с 2048/2048 батчем и с вижном (!) при 160к контексте. Думаю Q4 как хуй дроченый войдет в 16-гиговую карточку (видео на 2048/1024 батче с 160К контекстом и с вижном около 17гб VRAM потребления, но контекстик-то понизить можно).

Тут главное RAM иметь, чем конечно народ нынче обделен. Но вообще в славное время живем, еще недавно о таких модельках нельзя и мечтать было.
Аноним 29/08/26 Суб 16:40:27 1690288 60
>>1690287
> ртх3090 по оффлоаду в рам
VRAM
Аноним 29/08/26 Суб 16:41:03 1690289 61
>>1690287
>видео на 2048/1024 батче с 160К контекстом
И тут обосрался
>видеЛ
Извините няхуй.
Аноним 29/08/26 Суб 16:41:23 1690291 62
>>1690259
Не моешки, я думал плотные. Мой план был взять CPU+одну плашку ОЗУ 32 или 48 ГБ начать с ~32b моделей, ожидания 4 т/c. А потом если упадут цены возьму 16гб 5060 и РАМ чтобы киберпанк 2077 и 100b мое пощупать. Или если скорость не меньше 4 т.с. оффлоад то каких-нибудь 70b плотных.
>скорость/частоту
Это не тоже самое? Как смотреть скорость?
>>1690277
Я заметил что частота памяти больше чем у АМД. Где вообще хоть что-то узнать про это? Ютуб проплаченные видики с ГПТ сценарием выдает а поиск просто ГПТ статьи.
Аноним 29/08/26 Суб 16:44:59 1690294 63
Паную на 4060ти 16гб, что можно взять до 50к в пару, кроме второй такой же? Может есть варианты получше?
Аноним 29/08/26 Суб 16:45:23 1690296 64
>>1690283
Не-не, я мимокрок. Но тоже подумываю об обновлении когда цены опустятся никогда 😢.

>нужен проц который стабильно работает на высоких частотах памяти и поддерживает много гигабут этой самой памяти. То есть инцел
Вот это много где читал, поэтому и задаюсь вопросом. У меня старая рязань 7, думал махнуть на актуальный r7 7700 с поддержкой 128гб DDR5 при частоте 5200. Стоит копейки, что-то около ~20к, холодный (65w), ну няша же. Смотрю на интелы - цена почти вдвое дороже, половина ядер энергоэффективные, ебать их в рот. Оно точно того стоит?
Аноним 29/08/26 Суб 16:45:44 1690297 65
>>1690294
Недавно был 5060ti, но он вроде уже дороже 50к.
Аноним 29/08/26 Суб 16:46:53 1690299 66
image.png 727Кб, 2304x1311
2304x1311
Чет 1й пик там с большим глмом перепутался. Бесят они одинаково все оформлять на одной странице.

По идее улучшение точности не оправдывает такой дикий сдвиг в размере модели. Это же +50 гигов как нехуй делать для q5 -> q6.

>>1690297
А на лохито? Не с рук, а от барыг. Я себе так покупал завезенные из китая карточки, все ок. Без предоплат, тупо пришел в офис и забрал коробки запечатанные
Аноним 29/08/26 Суб 16:48:29 1690300 67
>>1690297
65-70. Был вариант сменить свою на 5060ти с доплатой 10-12к, но чет на время охладел к теме, а сейчас с новеньким квеном интерес проснулся. Железный ждун как всегда пососал, короче.
Аноним 29/08/26 Суб 16:50:01 1690301 68
image.png 325Кб, 864x1086
864x1086
>>1690300
Ебать и правда че творится
Они же были по 45 - 50 недавно совсем
Аноним 29/08/26 Суб 16:51:01 1690302 69
>>1690299
Ну если на лохито, то можно 3090 урвать, если повезет. CMP170HX наверно уже так дешево не урвешь.
Аноним 29/08/26 Суб 16:52:21 1690303 70
>>1690291
>одну плашку ОЗУ 32
>ожидания 4 т/c
будет полторы, режешь пропускную на ровном месте

>Где вообще хоть что-то узнать про это?
Это не какое-то сакральное знание. Для работы с нейронками нужно проводить много однотипных операций с матрицами. Чем быстрее будет доступ к этим матрицам, тем быстрее будет инфиренс. Какой из этого вывод? Нужна быстрая память.

>>1690296
>половина ядер энергоэффективные
Смотри на реальную производительность. Тесты показывают что в принципе похуй. Отключать энергоэффективные ядра тоже смысла нет, они же основные не заменяют.
Аноним 29/08/26 Суб 16:53:21 1690305 71
>>1690302
> можно 3090 урвать, если повезет.
Если ты готов провести месяц за анализом рыночка игросральных ведер в сборке. За вменяемую цену (сейчас это 60 - 70к) можно выпросить 3090 отдельно у тех, кто пекарню продает. А объявы чисто с одной картой барыги сметают, мне кажется...
Аноним 29/08/26 Суб 17:00:12 1690310 72
>>1690303
>Нужна быстрая память.
Хуй его знает, мне тут заливали что без ддр5 будет ОШЕНЬ ПЛОХА
В итоге 4 канала ддр4 вполне приемлимо, а снижение с 3600мгц до 2866 не привело к заметной деградации (потому что 5 - 10 токенов в секунду, в зависимости от жирноты моделей, и так днище... но не то что бы у ддр5 кабанчиков все сильно быстрее с тем же ГЛМ).
Аноним 29/08/26 Суб 17:02:24 1690311 73
>>1690305
Два чаю, у меня за 65к из рук вырвали, час от выкладывания до кабанчика на пороге с деньгами наперевес.
>>1690310
>В итоге 4 канала ддр4 вполне приемлимо
Ну так 4хДДР4 примерно равно 2хДДР5, всё верно.
Аноним 29/08/26 Суб 17:10:10 1690319 74
>>1690311
Зачем продавал-то, Вася... Сам ведь знаешь, хуанг 60-ю серию дешевле не высрет и 30 / 40 / 50 карточки не обесценятся, а только подскочат в цене.
Аноним 29/08/26 Суб 17:17:27 1690324 75
>>1690291
>ОЗУ 32 или 48 ГБ начать с ~32b моделей, ожидания 4 т/c
1-2 т/c будет, с одноканалом-то. А по мере роста контекста оно будет еще ниже падать, вплоть до 0,2 - 0.5 т/c. Будешь по полчаса ждать одного ответа с ризонингом (а без него качество ответов кратно хуже). Поверь, не нужно оно тебе. Лучше накати быструю модельку с гайда https://rentry.org/2ch-llama-inference на том железе что есть, и спокойно копи на нормальный конфиг. А там и цены, глядишь, опустятся.
Аноним 29/08/26 Суб 17:19:17 1690325 76
>>1690319
Есть что-то надо.
Уволенный год назад программист
Аноним 29/08/26 Суб 17:20:01 1690326 77
image.png 29Кб, 739x68
739x68
image.png 3559Кб, 1920x1080
1920x1080
> 5.3 flash Q5K_XL
Челы, я в ахуе. Как он узнал-то.
Ни намека в контексте не было на название.
Аноним 29/08/26 Суб 17:21:15 1690329 78
image.png 19Кб, 1043x112
1043x112
>>1690326
Я думал он просто иероглифы прочитал, но нет, это просто шуточный заголовок.
Аноним 29/08/26 Суб 17:25:18 1690335 79
>>1690326
Только вот фамилию персонажа нагаллюцинировал, несмотря на то, что название аниме - и есть фамилия+имя. Какие же боты все-таки тупые.
Аноним 29/08/26 Суб 17:30:05 1690338 80
>>1690324
>копи на нормальный конфиг
Это какой? Я еще думаю что щас спрос на мать и цпу меньше тк сборку с оверпрайс озу гпу никто делать не хочет т.е. сейчас хорошие время чтобы купить и мать и проц.
Аноним 29/08/26 Суб 17:31:12 1690342 81
>>1690338
EPYC какой-нибудь с 8-канальной памятью.
Или зионы, хуй их знает какие там.
Аноним 29/08/26 Суб 17:39:14 1690349 82
>>1690338
>Это какой?
5060ti x2 + 128 DDR5 + рузен, если по дешману. И 5090 + 192 DDR5 + инцел, если денег чуть больше. А дальше уже только риг собирать, а не домашнюю пекарню.
Аноним 29/08/26 Суб 17:43:47 1690355 83
>>1690349
А в чем прикол всирать кучу бабла на 2-канальную ддр5
Аноним 29/08/26 Суб 17:48:45 1690360 84
>>1690355
А какие альтернативы-то? Собирать на старом серверном железе? Ну хз.
Аноним 29/08/26 Суб 17:51:13 1690362 85
>>1690310
> 5-10
Да, подумаешь прирост х2, ну и что что 5 токенов это улитка, а 10 уже вполне способная черепашка, чуть выше скорости чтения
Аноним 29/08/26 Суб 17:53:25 1690365 86
>>1690362
5 токенов это глм 5.3 флэш на пухлокванте 5/6-бит, 10 токенов это дипсик флэш в оригинальных весах.
Ну ты подумой. Написано же - циферки на одном железе в зависимости от разных моделей.
Аноним 29/08/26 Суб 17:53:32 1690366 87
>>1690362
>10 уже вполне способная черепашка, чуть выше скорости чтения
Если только ризонинг выключить.
Аноним 29/08/26 Суб 17:54:53 1690367 88
image.png 3Кб, 286x62
286x62
image.png 0Кб, 111x54
111x54
image.png 4Кб, 173x71
173x71
>>1690366
Квеночелика видно за километр. Не все модели думают по полчаса.

Хотя кодить с этим конечно не будешь. Но чисто слопогенерация писанины - норм.
Аноним 29/08/26 Суб 18:15:07 1690386 89
image.png 5Кб, 274x44
274x44
>>1690367
Ладно иногда по 1 - 3 минуты прождать можно
Но это терпимо все равно
Аноним 29/08/26 Суб 18:21:19 1690390 90
Анонасы, подскажите, ddr5 32gb, 16gb vram 120 сек на ответ на 3.8 qwen Q5_K_P эт нормально? ну и ещё нейронка выдаёт очень длинный ответ на очень простой вопрос
Аноним 29/08/26 Суб 18:26:35 1690392 91
Аноним 29/08/26 Суб 18:31:15 1690398 92
>>1690390
>очень длинный ответ на очень простой вопрос
Если ты про длинное размышление перед ответом - это для квена нормально. Поставь ризонинг на medium, станет быстрее и может быть чуточку тупее (зависит от твоих задач, мы не знаем надо ли тебе чтоб она думала до усрачки - это не всегда дает результат лучше, кстати).
Аноним 29/08/26 Суб 18:31:41 1690399 93
>>1690390
>эт нормально?
Ну да, у тебя же там выгрузка адовая в ОЗУ. Если хочешь чтобы было быстрее - Q3 и квантовать контекст, будет летать на фуллврам.

Можешь ещё MTP включить, если он с твоего кванта не вырезан, будет чуть получше.
--spec-type draft-mtp \
--spec-draft-p-min 0.75 \
--spec-draft-n-max 4 \


>выдаёт очень длинный ответ на очень простой вопрос
Промптится же. Как попросишь - так и выдаст.
Аноним 29/08/26 Суб 18:36:42 1690402 94
>>1690399
>Промптится же. Как попросишь - так и выдаст.
Я и прошу его дать краткий ответ, а он выдаёт тонну текста
Аноним 29/08/26 Суб 18:43:52 1690404 95
image.png 115Кб, 497x774
497x774
Аноним 29/08/26 Суб 18:46:54 1690406 96
>>1690404
Все, что я знаю, это что их официальный Q4KM для hy3 был работоспособен, но сама модель серила под себя с русским языком даже на Q5. Потом я поднатужился и попробовал Q6 и чесслово уже не помню чем это кончилось. НО ризонинг я не включал, ибо терпеть 3 токена в секунду это нахуй надо.

мимо
Аноним 29/08/26 Суб 18:47:53 1690407 97
>>1690404
Интересно, но 200 гб все равно многовато. Лучше бы на чем-то поменьше такое провернули.
Аноним 29/08/26 Суб 18:51:24 1690410 98
>>1690399
Кстати, проверил, q4 реально намного быстрее генерит.Спасибо.
Аноним 29/08/26 Суб 18:53:03 1690412 99
>>1690406
А, еще вспомнил.

КОНТЕКСТ эта hy3 сука жрала как не в себя. Там примерно х1.5 более дорогие русскоязычные промпты были по сравнению с дипсиком. Там где у дипсика 20к токенов съедено, hy3 радостно сообщала о 30к контексте.
Аноним 29/08/26 Суб 18:58:23 1690416 100
>>1689903 (OP)
Анон, расскажи, пожалуйста, какой у тебя корпус и охлаждение? Используешь ли ты обычный корпус, fulltower или что-то кастомное? Влезает ли вся твоя начинка в корпус или тебе приходится боковые крышки снимать? Что насчёт охлаждения? Воздух? Вода?
Что насчет блока питания? Сколько нужно? 1200W? 1300w? 1600w?

Ещё такой вопрос, 4090 на 48gb - это китайская поделка или в этой стране тоже её делают? Стоит оно того? Сколько стоит? Надо ли изъебываться с водяным охлаждением для этой поделки? Она же шумит наверное?
Аноним 29/08/26 Суб 19:03:49 1690423 101
>>1690416
> какой у тебя корпус
Нищий открытый. Заставляю младшую сестру раз в неделю протирать от пыли, и если плохо протирает, уменьшаю ей карманные.
> охлаждение
Просто 120мм вентики прислоняют, и 60мм на выдув на резинку креплю. Резинка рвется раз в месяц. Тоже сестра заменяет.
> 1200W
Достаточно на 2 V100 и серверную мамку на два зиона. В крайнем случае просто ваттаж ограничить можно.
Аноним 29/08/26 Суб 19:07:50 1690424 102
>>1690423
>Достаточно на 2 V100 и серверную мамку на два зиона
Сестра собирала?
Аноним 29/08/26 Суб 19:08:26 1690425 103
Аноним 29/08/26 Суб 19:16:32 1690431 104
IMG202602141648[...].jpg 4510Кб, 4624x3472
4624x3472
thermaltake-cte[...].jpeg 275Кб, 2000x2000
2000x2000
>>1690416
Держу парочку Thermaltake CTE E660 MX hydrangea blue - в одном сервер (до 3x GPU, вертикально на место радиатора СЖО влезают карты размером с RTX 3090 Palit GamePro, сантиметров 12-13 по толщине в плоскости кулеров) в другом рабочая пека.

Очень компактно, съемные решетки с сетками (зерно крупное, свои поверх васянил). По кулерам можно 140мм х9 и сверху 120мм х2 (или 3, если третий над портами видюхи) в любой конфигурации вытяжки-вдува. БП в отсеке сзади, 1300-ваттный в сервере. Продув отличный, карты и тредриппер не душатся.

ИРЛ они кайфово смотрятся - самое честное фото из Никса - примерно так и выглядит по цвету. Комплект по кулерам голяк полный, зато с хорошим райзером-лапшой для одной видюхи, которая на горизонтальный кронштейн ставится.
Аноним 29/08/26 Суб 19:19:47 1690433 105
15772003267793.jpg 174Кб, 1080x1063
1080x1063
А такой вопрос всем итт: а на что могут пригодиться несколько 5060 или 5070 или даже что-то более дорогое вроде 5090, rtx-pro на 48гб или 72гб или 96гб ?
Вот вы итт дрочите LLMки, а зачем? Просто сгенерировать какое-нибудь резюме для новости? Написать порнофанфик? Или что-то ещё?
Я понимаю, корпорации, которые ворочают петабайтами данных, им нужно много мощностей, а обычному анону они нужны?
Можно условно продать почку, купить видюху или видюхи, вопрос зачем?
Повышаются ли профиты от больших мощностей у обычного человека? Или это всё баловство и потакание своим глупостям и жадностям?
Или тут естЬ, кто угорает по решению технических задач при помощи нейронок?

инб4 если спрагиваешь, то тебе не надо
Аноним 29/08/26 Суб 19:19:51 1690434 106
>>1690301
А с чего им дешеветь то? ИИ поезд как двигался так и движется, кризис памяти как был так и остался, еще и NVIDIA цены поднимает на свои карты. Подождите пару месяцев и там уже ниже 75-80 врятли их можно будет купить.
Аноним 29/08/26 Суб 19:20:25 1690435 107
>>1690431
>GamePro
GamingPro, опечаточка. Короче узенькие такие. Пухлокарта туда не полезет вообще.
Аноним 29/08/26 Суб 19:21:53 1690436 108
>>1690433
Ну епт, один шиз боится данные слить, другой себе мертвую жену через ии воскрешает, третий себе фентезийные приключения сочиняет - и все просто ловят с этого кайф как например с чтения книжки или похода по музеям с сушеными хуями. Это просто хобби и всё.
Аноним 29/08/26 Суб 19:22:36 1690437 109
>>1690423
>>1690431
Есть ли смысл делать отдельный корпус под нейронные мощности? Или можно обойтись обычной пекарней, которая и под игори, и под мыльцо, и под нейронки?
А вас нейронки 24/7 крутятся? Или в обычном режиме с перером на сон?
Аноним 29/08/26 Суб 19:25:39 1690440 110
>>1690433
В основном аноны используют ЛЛМки либо для ролплея, либо для вайбкодинга. Чем модель больше - тем качественнее она это делает и тем больше ресурсов требуется чтобы ее запустить на комфортной скорости. Стоит оно того или нет - каждый решает сам. Для нас это как хобби. Обычному рандомчелу, скорее всего, хватит Геммы 26b, которая запускается и летает на любой кофеварке.
Аноним 29/08/26 Суб 19:27:23 1690441 111
>>1690437
Это от твоих задач зависит. Лично я вздохнул с облегчением, когда вынес все ИИ-дерьмо в отдельный гробешник. Во-первых это сразу никакой мозгопарилки типа "нельзя открыть браузер с кучей вкладок, ведь у меня модель загружена" - то есть RAM в случае с МоЕ моделями у сервера полностью в его распоряжении.

Ну и в целом если ты что-то тяжелое запускаешь, в игры ты на этой системе не поиграешь. Исключение - если под ИИ отдельные видеокарты и инференс идет полностью внутри видеопамяти и на мощностях видеокарт, без участия проца и RAM.

А еще очень удобно просто иметь вторую машину с удаленным доступом к ней. Захотел и поставил ее в другой комнате, например, чтобы жарко не было.
Аноним 29/08/26 Суб 19:29:55 1690442 112
>>1690436
>Это просто хобби и всё.
Допустим.
А вы на этой доске случайно не делали шкалу мощностей?
Ну типа:
- одна 5060 - на ней только текстики генерировать
- два 5060 - генеировать текстики побыстрее, да картинки
- 5070 - можно еще видосики
...
5090 - можно все вместе, еще и рой агентов запустить
6000 - обладает собственным знанием, раскрываем суть мироздания
?
ДУмаю, было бы полезно прикидывать что тебе надо и в какие деньи это обойдется.


>>1690441
А анально огородить нейронки в докере или вирутальной машине не выход?

Алсо, я правильно понимаю, что по такой жизни лучше иметь систему из горы старого барахла. потому что оно дешевле и проще найти?
Потому что если сгорит вдруг твоя 5090, то заменить ее сложнее и затратнее?
Аноним 29/08/26 Суб 19:32:22 1690443 113
image.png 2Кб, 260x31
260x31
Что оно там делает столько?
Аноним 29/08/26 Суб 19:35:55 1690446 114
>>1690437
Зависит от твоих целей. Лучше отдельную машину завести, на которую линух навернуть, и настроить остальные штуки для кайфарика с нейронками. Чисто мое мнение. Плюс в кудахтерный корпус тесла бы просто не влезла, даже первая.

Я вообще планирую перенести сервак в стеллаж на крытую полку, но мне так лень этим заниматься, плюс я теряю возможность подрубиться к монику (ну или мне нужно и моник туда перенести дополнительный).

>>1690442
5090 сейчас не вайбл, особенно для текстовых дебилок. Она хороша, но не за ту цену, за которую продают - уж точно. Старое барохло не жалко, плюс это дополнительный досуг в виде пердолинга с настройкой. Плюс, честно, это единственный доступный вариант для большинства. 5090 слишком уж дорога. цмп или в100 за 60/120к спокойно купишь, и она даст тебе все то, что дала бы 5090. Да память помедленней в два раза, но эти карточки тебе дают приличную скорость и удельно стоят дешевле за единицу памяти. Если еще хочешь заниматься чем-то крому дрочки трупа матери жержанова, то уже имеет смысл подумать о том, чтобы купить более свежее говно цмп.

По цене 5090 ну подороже на тысяч 200-300 лучше у знакомого барыги новый мак студиол ультра заказать, имхо. Там и памяти больше, и бэндвидс приемлемый.
Аноним 29/08/26 Суб 19:37:48 1690447 115
>>1690416
>корпус
Обычный fulltower с верхним БП
>охлаждение
радиаторы на 7 слотов и обычные вентиляторы корпусные на 80 и 120мм
>Влезает ли вся твоя начинка в корпус
Да
>>1690416
>Что насчет блока питания
На 850w мне хватает

power лимиты убавлены до 200 ватт
Аноним 29/08/26 Суб 19:38:52 1690449 116
>>1690442
Нет никакой универсальной шкалы, Размеры ИИ моделей разные и что-то может влезть в одну видеокарту, а чему-то подавай 10.

>в какие деньги
Реалистично СЕЙЧАС - в очень большие деньги

Но сначала надо определиться че тебе вообще надо. Цель короче говоря какая. Если просто с помощью ботов смешные чатики делать - ну выкашляй денег на 3 - 4 штуки RTX 5060 Ti (или самый нищевариант RTX 3060 с 12гб каждая), на материнскую плату куда это все влезет и на проц, а на оперативку хуй забей. Будет 64гб видеопамяти и параллелизм вычислений, засунешь 31B Gemma 4 Q8 туда и будешь довольно урчать. Или на Б/У рынке искать две RTX 3090, с этим еще проще потому что в любую материнку легче вставить две видеокарты, чем 3 или 4.

А если тебе надо поумнее да посерьезнее... Ну это либо 128 - 256гб DDR5 за огромные бабки, либо б/у серверное железо (EPYC процы AMD например, хз какой серии) с 8-канальной DDR4, что даже уделает 2-канальную DDR5 из обычных потреблядских систем, а стоить будет столько же или меньше. Оговорка одна - это все пылесосить с Авито надо, ведь в магазах цены охуевшие.

Ну и да, даже под этот серверный конфиг тебе все равно надо 24 - 48гб видеопамяти, чтобы деляющиеся между RAM / VRAM модели адекватно запускались. Короче говоря тут на 500 000 рублей легко набежит.
Аноним 29/08/26 Суб 19:41:59 1690451 117
>>1690442
>>1690449
Кстати при целях на уровне
>смешные порночатики
Можно даже какой-нибудь M5 Pro 48GB макбук взять и гонять на нем 26B Q4 гемму. Холодно, не жрет электричество - и достаточно терпимо по скорости. Дорого и неэффективно, но (что многим важно) - абсолютная свобода, портативность и не надо держать дома горячий шкаф.
Аноним 29/08/26 Суб 19:43:43 1690454 118
>>1690449
> 64гб видеопамяти
> 31B Gemma 4 Q8
Перебор кстати. В 48гб легко влезает (но не в вышеописанные макбучные - это важно, моделька плотная и ей надо серьезные вычисления)
Аноним 29/08/26 Суб 19:43:56 1690455 119
>>1690416
>Анон, расскажи, пожалуйста, какой у тебя корпус и охлаждение?
Fractal Design Define 7 XL.
>1600w?
Da, сисоник. Брал под 3-4-5 видях, в итоге стоит одна, лол.
>Ещё такой вопрос, 4090 на 48gb - это китайская поделка или в этой стране тоже её делают?
Да, Китай, и да, у нас тоже делают, ищи VIK-on на ютубе, к примеру. В любом случае комплекты модификации китайские.
>>1690423
>Заставляю младшую сестру раз в неделю протирать от пыли
Это та, которая залила тебе видяху в подвале? Она ж в рабстве должна быть после такого, какие нахуй карманные.
Аноним 29/08/26 Суб 19:45:30 1690458 120
>>1690446
Сколько открытий дивных.
Тогда, аноны, помогите, пожалуйста со сборкой.
Я-то грешным делом думал, обновлю пекарню на помощнее. и там буду нейронки гонять.
А тут выясняется что нейронки могут лезть в личнгую жизнь. А это нахер не надо.
И что тогда, делать две корпуса - один под обычный ПК, другой - нейронкосервачок? И что из это получится? нейросервачку же монитор нужен?
>>1690449
цель - поковырять нейронки (включая картиночки и текстики), а потом угореть по агентам, архитектурам, экспериментам и прочему. В том числе решению всяких задач. Дипсик локальный мне нахер не сдался, но какую-нибудь хорошую модельку я бы локально запустил. Может даже не одну. И вроде мощности нужны, но какие именно - хз.
Можно потратиться на 5090. А если порвать жопу, то и на pro-серию. Вопрос, не слишком ли это? Плюс всё дорожает нахуй.
Нужно быстрее решать.
> Ну это либо 128
Это 300к на данный момент. Не сильнее дороже 4-5 штук 5060.
Аноним 29/08/26 Суб 19:46:37 1690459 121
>>1690458
>А тут выясняется что нейронки могут лезть в личнгую жизнь
Чаво?
>помогите, пожалуйста со сборкой
Бюджет в студию.
Аноним 29/08/26 Суб 19:47:34 1690461 122
>>1690451
> M5 Pro 48GB
Ну ты назвал хороший конфиг за 300к. На нем и квеноту 27Б спокойно в 4-6 кванте можно гонять, и плотную гену в той же четверке, и иметь приличные 15-20 токенов декода.
>>1690455
Не, я другой анон. Ей 19 вообще. Самое серьезное, что делала, это умудрилась выдернуть провод из бп пока пылесосила. Все живо.
>>1690458
>цель - поковырять нейронки (включая картиночки и текстики)
Какой у тебя сейчас сетап? Может ты на нем просто модели поменьше попробуешь помацать, а дальше уже решишь надо ли оно тебе?
Аноним 29/08/26 Суб 19:51:34 1690462 123
Пиздэц, там cmp 170hx уже по 250к...
Аноним 29/08/26 Суб 19:56:37 1690470 124
>>1690459
>Чаво?
> Во-первых это сразу никакой мозгопарилки типа "нельзя открыть браузер с кучей вкладок, ведь у меня модель загружена" - то есть RAM в случае с МоЕ моделями у сервера полностью в его распоряжении. >>1690441
>Бюджет в студию.
От 300к.
>>1690447
>Обычный fulltower с верхним БП
Присматриваюсь к нему. Но он что-то большой на 16кг. Склонялся до недавнего времени к Fractal Design Pop XL Air
А что у тебя за видюха?
>>1690461
>Какой у тебя сейчас сетап
Никакого. Вот думал обновить ПК и параллельно использовать под нейронужды, тем более, что есть такая потребность.
и на работе плотно с этим приходится иметь дело. Только там все облачное, дернул за анус и настроил на задачу. И сисястых эльфиек не погенерить.
Аноним 29/08/26 Суб 19:59:18 1690472 125
Под ботов-агентов надо дорогое и быстрое железо, иначе твои агенты никакой работы не сделают за адекватное время.
Под генерацию картинок и тем более ВИДЕО надо карточки типа 3090 / 4090 / 5090, причем у 40 / 50 с этим гораздо лучше, если верить бенчмаркам скорости генерации.

Видосы на RAM и процессоре ты не сгенерируешь. Вот и думай. По сути ты перечислил кучу не совсем пересекающихся между собой задач.
Если ты дохуя миллионер, ну, купи тогда уж RTX 6000 Pro с 96гб видеопамяти - это около ляма на Авито у барыг, если не больше. Решит все задачи.
Аноним 29/08/26 Суб 20:02:14 1690474 126
>>1690472
>купи тогда уж RTX 6000 Pro с 96гб видеопамяти
5060 x 6 ее не заменят?
Аноним 29/08/26 Суб 20:05:22 1690478 127
>>1690474
Чесслово не знаю, я не пользовался железом уровня ртх6000про.
Рекомендую
1. Погуглить спецификации
2. Зайти в чатгпт или любого другого веб-ботяру
3. Скормить данные, обозначить конкретные задачи (какая ИИ модель, что делает)
4. Задать вопрос че будет лучше

Это конечно грубый и тупой способ, но потихоньку начнешь формировать картину понимания че к чему
Кстати не знаю как щас, но раньше (год-два назад) генерить видео и картинки на нескольких видюхах вроде было нельзя, по-этому 5060ти х6 в этом плане наверняка соснет
Аноним 29/08/26 Суб 20:06:23 1690479 128
>>1690472
>RTX 6000 Pro с 96гб
С нынешними ценами это почку продать. А если карточка сломается, то и вторую, чтобы ее заменить или починить.
Аноним 29/08/26 Суб 20:07:40 1690483 129
>>1690472
>>1690478
И да, даже купив ртх6000про, для запуска ОЧЕ ЖИРНЫХ моделей архитектуры MoE (mixture of experts - часть модели "холодная" и сидит в RAM, часть юзается активно и сильно выигрывает от расположения в VRAM) все равно придется раскошелиться на 128 - 256гб оперативочки...
Аноним 29/08/26 Суб 20:08:33 1690484 130
>>1690483
Или вторую (и потенциально третью) ртх6000про, но это уже сколько баблища надо всрать...
Аноним 29/08/26 Суб 20:30:08 1690495 131
>>1690433
> а зачем? Просто сгенерировать какое-нибудь резюме для новости? Написать порнофанфик? Или что-то ещё?
Есть два вопроса. Первый - почему использовать именно локалки, а не корпов, и второй - для чего. Ты вроде бы спрашиваешь про второе.
В моем случае, я еще в 2023 для работы купил себе 4090 и 64 рамы. Позже вкатился в сабж и докупил еще 64, так и живу.
Юзкейсов много, помимо обычного рп и кума можно и действительно полезные вещи делать. Только нужно это уметь и понимать, что как, зачем и почему. Если есть только железа и ноль понимания что с этим делать - ни к чему не придешь.
В моем конкретном случае есть несколько промптов-ассистентов под разные кейсы. Мне с человеками не очень хочется общаться, а в эхо-камере запираться не хочется, это никогда к хорошему не приводило. Потому есть ассистент для общих задач, поговорить, позадавать тупые и не очень вопросы, часто используется для проверки логики своих суждений; есть ассистент для конкретных задач технического стека, на котором я работаю. Я делаю игру и часто использую локальные сетки для кодревью, а когда совсем устаю - отдаю отдельные фичи на отработку агентам, а сам иду моделить, музыку делать или еще какую задачу в отрыве от кода решать.
Если бы был обычным среднечелом без переживаний о конфиденциальности и железа - купил бы без зазрений совести подписку.
Аноним 29/08/26 Суб 20:31:05 1690497 132
>>1690470
>>Чаво?
>> Во-первых это сразу никакой мозгопарилки типа "нельзя открыть браузер с кучей вкладок
Сильно зависит от свободных ресурсов. Я вот себе позволяю браузер держать с полусотней вкладок.
>От 300к.
Сразу до пиши, потому что потолка нет.
>>1690472
>RTX 6000 Pro с 96гб видеопамяти - это около ляма на Авито у барыг
От полутора как бы.
>>1690474
Nyet.
>>1690495
>а в эхо-камере запираться не хочется, это никогда к хорошему не приводило
Нейронки это идеальная эхокамера как бы.
Аноним 29/08/26 Суб 20:33:11 1690499 133
>>1690497
> Нейронки это идеальная эхокамера как бы.
Смотря как использовать. Книги, радио, телевизор - тоже эхокамеры, если рассматривать с такого угла. Один человек в этом замкнется, другой благодаря этому будет учиться и познавать мир, чтобы применить в своей деятельности.
Аноним 29/08/26 Суб 20:35:15 1690501 134
>>1690499
> Книги, радио, телевизор
И интернет туда же бтв. Одни хиканят в нем всю жизнь, другие из деревень обучаются наукам и получают PhD, работают удаленно и повышают уровень жизни. Все зависит от перспективы.
Аноним 29/08/26 Суб 20:39:17 1690504 135
>>1690497
>Сильно зависит от свободных ресурсов. Я вот себе позволяю браузер держать с полусотней вкладок.
Ну так нейронки надо изолировать или нет?
>Сразу до пиши
Х.з. учитывая как оно всё резко дорожает.
до 1кк, может чуть больше. но если често, жаба душит такие расходы делать, на ебучий комп.
Аноним 29/08/26 Суб 20:43:14 1690507 136
>>1690504
> Ну так нейронки надо изолировать или нет?
харнесс - да, бэкенд - нет. учи матчасть
Аноним 29/08/26 Суб 20:44:31 1690511 137
>>1690507
>учи матчасть
И где её учить? Книжки? Статьи? Видео?
Адаптер CMP170 для 80х80 с выравниванием по стороне. Аноним 29/08/26 Суб 20:45:17 1690513 138
Безымянный.jpg 583Кб, 2268x1676
2268x1676
>>1687346 →
>Ого, в таком случае реквестирую вариант чтобы край вентилятора был выровнен по одной из плоских сторон видеокарты, а остальное цетром, такое возможно? С меня как всегда.
Вот. На картинке схемы.
Прости что я такая копуша, у меня просто беды с башкой и я раньше не был в состоянии сделать, хотя там и на пять минут.
https://files.catbox.moe/ljbb70.7z

Выравнивал по краю с учётом этой насадки, а не по краю карты. То есть карта на 1.75 мм утоплена будет, а вот края переходника по линии.
Аноним 29/08/26 Суб 20:46:13 1690515 139
>>1690511
Шапка треда для начала.

мимо
Аноним 29/08/26 Суб 20:50:07 1690518 140
>>1690499
>Книги, радио, телевизор - тоже эхокамеры, если рассматривать с такого угла.
Намного меньше.
>>1690504
>Ну так нейронки надо изолировать или нет?
Как по мне не нужно.
>Х.з. учитывая как оно всё резко дорожает.
Ну так закупай по максимуму. Любую современную платформу на DDR5, 128 гиг оперативы и видяху на оставшееся.
Аноним 29/08/26 Суб 20:52:10 1690521 141
>>1690472
>Под генерацию картинок и тем более ВИДЕО надо карточки типа 3090 / 4090 / 5090, причем у 40 / 50 с этим гораздо лучше, если верить бенчмаркам скорости генерации.
Генерирую картинки на 1060. Да, процесс занимает 2-3 минуты (если только не SD 1.5) и самые новые модели только в квантованных ггуфах, но именно картинки можно гонять и на микроволновке из 2016
Аноним 29/08/26 Суб 21:06:56 1690534 142
>>1690472
> Под генерацию картинок и тем более ВИДЕО надо карточки типа 3090 / 4090 / 5090, причем у 40 / 50 с этим гораздо лучше, если верить бенчмаркам скорости генерации.

Под генерацию картинок хх90 не нужны, у меня на 4060ti Krea 2 fp8 генерирует 1024х1024 за 28 секунд, 1448х1448 за 50 секунд и 1776х1776 за 80.

Не 10 секунд как при загрузке полностью в VRAM, но это более чем юзабельно. На 1024х1024 быстренько тестируешь промпты и если то что нужно уже переключаешься на более высокое разрешение.

Вот под видео да, там всё тоскливо на 16GB VRAM.
Аноним 29/08/26 Суб 21:26:02 1690553 143
>>1690404
Возможно. У самого тенцента калибровочные датасеты в дохуя раз больше чем у микрочеликов (могут тупо свои же данные с RL использовать), и в тыщу раз больше вычислительных мощностей каждый тензор выдрочить
Аноним 29/08/26 Суб 21:28:28 1690556 144
image.png 528Кб, 818x626
818x626
>>1690423
Была бы у меня такая сестра....
Аноним 29/08/26 Суб 22:01:19 1690604 145
>>1690483
>128 - 256гб оперативочки
512-1024
Аноним 29/08/26 Суб 22:13:41 1690615 146
1788030717309.jpg 95Кб, 1080x500
1080x500
Вообще мастер йоба прав. Зайки обосрались что не смогут в бенчах сделать модель лучше чем дипсреньк флеш, если по аналогии с ним уменьшить размер х6, и это то после разговоров об оптимизации своей 750б модели вместо тупого наращивания размера.
Аноним 29/08/26 Суб 22:36:36 1690624 147
>>1690615
>если по аналогии с ним уменьшить размер х6
Нахуя, эйрошиз? Нет никаких правил что флеш обязан быть /6 от крупной модели. Ты сам эту хуйню придумал.
Аноним 29/08/26 Суб 22:46:15 1690634 148
>>1690624
>Leave the multibillion dollar company alone
Ботику на пикриле хоть подписку оплатили, а ты зачем это делаешь бесплатно?
Как на счёт правил здравого смысла, которых заи и предерживались с эиром и прошлыми флешами?
Аноним 29/08/26 Суб 22:50:37 1690636 149
>>1690634
>эйрошиз
>рассуждает про здравый смысл
Аноним 29/08/26 Суб 22:52:23 1690637 150
Мерзотно читать как ебланычи у которых модель не заводится орут что она хуже другой, которая у них тоже не заводится.

Лично я к ебучему дипсику после 5.3 флэша нахуй не подойду. Дипсик флэш q8kxl теряется в контексте и тупит, тогда как максимум, что некорректного выдал 5.3 - это парочка англоязычных слов в тексте на русском (вот это трагедия! кошмар!), будучи при этом стабильнее в плане понимания длинного контекста.

Дипсик без пинков под зад не может даже ризонить, ему нужны ебнутые префиллы, с которыми тоже не все гладко. 5.3 глм между тем - ризонит сам по себе, совершенно в хуй не дуя

И это я 5-битный квантец юзаю, между прочим, который по тестам что-то около 94% точности выдает. То есть модель в обезображенном виде все равно лучше. А почему она лучше? Потому что она не ебаный лоботомит с 10б активных параметров. Катились бы к хуям со своими нищенскими требованиями одебилить ботов, они и без вас тупые. Для вас сделали геммочку писечку 26б а4б вот и жрите.
Аноним 29/08/26 Суб 23:01:16 1690640 151
>>1690634
>Как на счёт правил здравого смысла
Да, как насчет правил здравого смысла - те кто делает что-то бесплатно - ничего тебе не должны?
Аноним 29/08/26 Суб 23:03:51 1690642 152
>>1690214
скачал qwen next, скопировал твои параметры запуска, на винде с 16/64 тоже пашет, даже не лезет в своп. правда всё впритык заполнено. генерация где-то 18 т/с, в процессе постоянное чтение с ssd. префилл всего лишь 60 т/с, это как-то прям не очень.
Аноним 29/08/26 Суб 23:10:02 1690648 153
>>1690149
> Токены квена весят в 3 раза больше чем токены геммы
Размерность эмбеддинга у мелкомоэ сильно меньше, потому легче атеншн и кэш. Сравнивать нужно с плотной геммой, она уже жрет больше.
>>1690187
Аж захотелось попробовать в рп.
>>1690299
> top 1% accuracy
Что имеется ввиду, совпадение вероятностей самых популярных токенов? Тогда это так себе результат.
Больше смущает интерпретация dsa в лламе и касты дататипов, импакт будет больше чем от квантов.
Аноним 29/08/26 Суб 23:16:47 1690654 154
>>1690642
>префилл всего лишь 60 т/с
Возможно из-за того что энграмы на ссд. Или косячный PR Жора вмержил. Пока не понятно. Если второе, то может поправят с апдейтами. 80b-next тоже криво работал на релизе.
Аноним 29/08/26 Суб 23:32:38 1690662 155
>>1690416
Каштом из vslot профилей.
> Влезает ли вся твоя начинка в корпус
С трудом, с момента разработки карт там стало больше чем изначально планировалось.
> Воздух?
Это Гусары, молчать!
> Что насчет блока питания? Сколько нужно? 1200W? 1300w? 1600w?
2000+2200, но это оверкилл
> 4090 на 48gb - это китайская поделка или в этой стране тоже её делают
Да и да. Можно купить из китая, можно заказать переделку в этой стране. Готовые платы и корпуса изготавливаются на китайских заводах, на них сажаются чипы, снятые с обычных карточек. Китайские дешевле, местные качественнее (по крайней мере текстолит на чипах не потемневший будто их снимали горелкой) и проще предъявить за рекламации. По остальным вопросам уже все относительно. Под полной нагрузкой турба оче шумная.
>>1690433
Можно найти профит из мощностей, как раз в решении технических задач. Но
> если спрагиваешь, то тебе не надо
This. Самое логичное развитие - увлекаться это как лайтовым хобби и найти применение в чем-то, чем занимаешься, хоть в других увлечениях, хоть в основной работе. Далее масштабирование до нужного уровня.
>>1690442
> шкалу мощностей
Это шкала памяти. Требования для запуска моделей известны, из рам+врам можно получить факт запуска, но его достаточно далеко не всегда. Когда много врам+много рам, или оче много врам на полную модель - тогда она не просто может запуститься, а еще и быстро работает, это необходимо для некоторых сценариев использования.
Если по простому то на одной 5090 далеко не уедешь, слишком мало памяти.
Аноним 29/08/26 Суб 23:55:11 1690671 156
>>1690513
Еще раз добра!
А в чем ты это делаешь?
Аноним 30/08/26 Вск 00:08:56 1690679 157
Аноним 30/08/26 Вск 00:45:59 1690690 158
>>1690671
В solidworks. Там интуитивно ясно достаточно многие вещи и справка с картинками, можно методом тыка разобраться. Наверное, кратко у нейронки спросить только что за эскизы - а далее разберёшься.
Но во freecad тоже можно сделать, да и думаю в любой cad-программе.
Аноним 30/08/26 Вск 01:28:33 1690700 159
Сап тредик. Как я понял, локал rp \ creative writing всё ещё часть треда?

Короче говоря погонял немного новый квен, который флеш некст. Моё личное впечатление в целом позитивное, но с оговорками. С одной стороны, модель не глупенькая, на англюсике пишет не так богомерзко, как обычно квены пишут, но проза всё равно имеет свои нюансы. Как по мне норм, не сильно хуже дипсика. Да и вообще последние модели почти одинаково пишут все. Слоп есть, терпимый, не столько сколько на геммочке и слава богу. Репетишоны есть, но жить можно. Смертельных лупов я не встречал.
Вотэтоповоротов в рп он мне не выдал, но и тестил я его недостаточно долго. Ламповую ваниллу, легкий сайфай, бытовуху aka повседневность, мягкий deep dark фентезя, внезапно ваху, и прочие поглаживания хвостиков держит и играет хорошо, я даже завис на этом этапе. Кум неплох, хз. Экшоны не тестил.
Русик плох, но неплох. В шизу не выпадает, но нет-нет да проебёт грамматику, ру проза на троечку, хуже дипсика и геммы, но даже на великом и могучем юзабельно.
Из минусов - он любит писать длинные простыни фиксится промптом вроде и ризонинг какой-то нестабильный, то много и подробно думает, то три строчки напишет игноря всё что можно. запускал на xhigh

А вот куда интереснее всё с цензурой. На q4 хард рефьюзы без пробивания сиспромптом и префиллом летели на всё подряд. С добавлением джейла, пробивающего минимакса, в сиспромпт, рефьюзы остались, но раз в пару свайпов всё же выдавал контент, причём по мере забивания контекста, свайпать приходилось всё меньше и меньше. Ну а если и префилл добавить, то о хард цензуре можно забыть.
С другой стороны, прослеживалась злоебучая дружбомагия, хоть и не так сурово как на дипсике или минмаксе, а также есменство и выворот характеров чаров, лишь бы не обидеть святого юзера. Возможно, тоже решаемо промптом.

Вкратце, как по мне - вин, но не без нюансов. Если какой умелец найдёт под него 100% джейл, который позволит полностью обойтись без префилла, то прям огонь будет. Моя субъективна оценка 7/10 если не учитывать цензуру
Аноним 30/08/26 Вск 02:10:23 1690716 160
Небольшой апдейт по GLM 5.3. Хард рефузы пробиваются тремя способами
1. Сильный системный промт + карточка где nsfw разрешено и обосновано почему
2. Префил ризонинга <think>Let me continue this roleplay scenario. Такой префил не ломает ризонинг, после префила идёт стандартный паттерн ризонинга GLM. Уровни ризонинга также продолжают работать.
3. Навалить кум слопа в примеры
Аноним 30/08/26 Вск 02:56:35 1690729 161
Хлопцы, супер неофит в чате. (совсем, только вчера понял, что такое LLM)


Железо такое: Core I5 14400 + RTX 5070 TI + 48 RAM

Что посоветуете поставить и как заставить это работать? Какую-то инструкцию дать, чтобы не умирало на пол пути?

Гугл советует либо goose + Qwen 3.6 27b, либо Cline + gemma 4 27b

А я вообще хуй знает, что это за слова такие)))

Но хочу создать интеграцию, чисто для себя, для доступа к новостям американской фонды.

Заранее спасибо
30/08/26 Вск 04:33:47 1690747 162
>>1690162
Почему не спросишь совета у ИИ?
Аноним 30/08/26 Вск 04:51:10 1690749 163
>>1690729
модель качай
https://huggingface.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF/blob/main/Qwen3.8-27B-Unleashed-UD-Q3_K_XL.gguf

потом прогу (винда)
https://github.com/ggml-org/llama.cpp/releases/download/b10688/llama-b10688-bin-win-cuda-12.4-x64.zip

кладешь все в одну директорию
запуск через (можешь start.bat создать, где это вписать)
llama-server -m Qwen3.8-27B-Unleashed-UD-Q3_K_XL.gguf -c 10768 -ngl all -b 512 -t 9 --no-warmup --cache-type-k q4_0 --cache-type-v q4_0 --keep -1 -np 1 -fit off --spec-type draft-mtp -ngld all -fa on -lm mmap+mlock --reasoning-effort medium --spec-draft-type-k q4_0 --spec-draft-type-v q4_0

Потом идешь на http://127.0.0.1:8080 и промптишь, фронтенд там встроен уже, история промптов тоже сохраняешься. Так заценишь все с оптимальной скоростью, потом будешь уже разбираться.

Если ошибки запуска будут, кидай сюда или у гпт спроси.
Аноним 30/08/26 Вск 04:52:23 1690750 164
>>1690749
>RTX 5070 TI
>cuda-12.4

Ну ты и черт
Аноним 30/08/26 Вск 04:53:30 1690751 165
Аноним 30/08/26 Вск 09:32:25 1690800 166
>>1690518
>128 гиг оперативы
Можно ли покупать 4x32gb вместо 2x64gb? Так-то оно в 2 раза дешевле получается.
Аноним 30/08/26 Вск 10:19:16 1690815 167
Поставил локально llama как написано в шапке треда (https://rentry.org/2ch-llama-inference), все вроде работает правда с кучей DEPRECATED warnings вроде: --mmap and --no-mmap are deprecated. use --load-mode mmap instead . Решил поставить ламу как рекомендовано на офф репо - https://llama.app. Установилось в AppData\Local\Microsoft\WindowsApps ~50мб llama.exe и оно работает, а где все остальные cuda.dll и прочее на гиг с лишнем если качать и ставить ручками?
Аноним 30/08/26 Вск 10:34:33 1690818 168
Аноним 30/08/26 Вск 11:12:06 1690832 169
>>1690749
Бесплатная ChatGPT-5.6 Luna с Thinking режимом официально проиграла этому кванту. Дал ей скрипт для Tampermonkey фиксить с багами, который с сайтов разное грузил размером 60кб - Luna обосралась на первом фиксе, потом на втором, на третьем, на четвертом. Каждый раз приходилось ей описывать все баги и все равно обсиралась, генеря нерабочие скрипты. На 6й где-то попытке сгенерила нормальный, но времени ушло около часа с разборками с ней.
Потом дал тот же самый нерабочий скрипт локальному Квену - пофиксил за 5 минут с первого раза на --reasoning-effort medium режиме. Уточняющих запросов не потребовалось, ничего не потребовалось, сам разобрался, нашел ошибки, исправил. Вот это локальная мощь.
Аноним 30/08/26 Вск 11:20:57 1690835 170
image 29Кб, 844x155
844x155
>>1690815
Чел, там говняный устаревший гайд, сделай как вон в том посте c готовыми бинарниками >>1690749
все сразу заводится
Cuda.dll там отдельно раздают на этой странице https://github.com/ggml-org/llama.cpp/releases/ с каждым готовым релизом. Можешь качать, можешь не качать, если не надо, бывает и без них идет. Если не идет - закидываешь DLL из второго архива оттуда в папку, тогда идет.
Аноним 30/08/26 Вск 11:21:20 1690836 171
>>1690749
>q4 кэш.

Пиздец ты мразь, новичка кормишь говном. Там всё поплывёт нахуй. Это аксиома. На любой модели.

Стыд имей. Ещё и высер какой-то под его задачи предложил вместо ванильного квена. Но с его памятью, один хуй, оно не потянет нормально. Либо оффлоад, либо чудовищная деградация. Ему нужна МоЕ 3.6
Аноним 30/08/26 Вск 11:23:54 1690837 172
>>1690835
>говняный устаревший гайд
>inb4 один единственный deprecated warning по mmap
>рекомендует q4 kv контекст
Дауж, каких только говноедов не занесёт
Аноним 30/08/26 Вск 11:25:01 1690838 173
image 62Кб, 1098x378
1098x378
>>1690836
Я только что на q4 кэше и том кванте пофиксил длиннющий скрипт, с которым GPT 5.6 Luna онлайновая не справлялась целый час. Так что про Q4 кэш можешь мне не втирать, как и про кванты - все работает как часы. Квант кстати не высер, у него KLD 0.0447, самый низкий из всех.
Аноним 30/08/26 Вск 11:27:39 1690841 174
>>1690838
Объсни мне, зачем ему не ванильная версия?

Не знаю, чё ты там фиксил, но на контексте 100к+ сравни 4-битное дерьмо.
Аноним 30/08/26 Вск 11:29:10 1690843 175
image.png 183Кб, 1095x535
1095x535
>>1690838
>про Q4 кэш можешь мне не втирать
Если ты мегамозг с 8к контекста то пожалуй что да. Дальше посыпется всё
>KLD 0.0447
Угу, индус с одним единственным заливом на hf не может наебать или обосраться при калькуляции KLD. 0.04 это уровень Q5

Откуда таких залупистых разумистов понабежало? Абу снова рекламит хуйхуй без цензуры?
Аноним 30/08/26 Вск 11:30:55 1690845 176
>>1690841
>>1690843
На 80к контексте запускал в opencode - с задачей справилась, которую онлайн нейронка решить не могла. Так что хуйню не городи, все отлично с Q4 работает. Короче опять элитарии беспруфные с ригами на bf16 тут носы воротят, когда квенчик на Q4 задачки только так щелкает.
Аноним 30/08/26 Вск 11:32:52 1690847 177
>>1690845
>элитарии беспруфные
Твои пруфы-то где? Их бесполезные выпуки, мой объективный опыт? Ты вообще нихуя в сабже не понимаешь, два поста назад себя категоризировал как "супер неофит". Поднялся, теперь lvl 30 boss?
Аноним 30/08/26 Вск 11:36:02 1690848 178
image 483Кб, 1097x1856
1097x1856
>>1690847
Вот сгенеренный на этом же кванте и Q4 тест с яблоками.
Промпт
Создай продуманную, красивую и изысканную HTML-карточку в лучшем дизайнерском стиле о пользе яблок. Вставь код здесь.

Так что как видишь, все может.
Аноним 30/08/26 Вск 11:38:27 1690851 179
image.png 197Кб, 1473x830
1473x830
image.png 319Кб, 1962x1212
1962x1212
>>1690845
Прикладываю два пруфа. Первый - что твой квант говно. Второй - что Q4 контекст говно и размывает kld на ещё 0.02. Третий пруф в том, что ты скомпроментировал сам себя и нихуя не понимаешь. Проблема не в этом, а в том, что ты сгенерировал яблоко на html и теперь думаешь, что всё понял и выёбываешься. Иди нахуй. Больше не кормлю. Таким залетухам разве что на ебло чем их чему-то учить.
Аноним 30/08/26 Вск 11:40:15 1690853 180
>>1690843
>Угу, индус с одним единственным заливом на hf не может наебать или обосраться при калькуляции KLD. 0.04 это уровень Q5
KLD не он считал, на его странице вообще KLD нет, тесты KLD я в другом месте нашел, без него посчитали.

>>1690851
Ясно, очередной уверовавший в графики от анслотодаунов.
Аноним 30/08/26 Вск 11:42:01 1690855 181
>>1690853
Эти графики делали не не анслоты. Ты впрочем до сих пор ничего не принёс в тред, кроме доказательств что ты сказочный, который запускает лоботомитоквант с лоботомитоквантованием контекста
Не удивлюсь если ютьюбодолбаёб который приносил протыков
Аноним 30/08/26 Вск 11:43:30 1690857 182
>>1690853
>принеси пруфы
>получил пруфы
>пруфы не пруфы
На этом можно закончить. Ты веришь в мечту и отказываешься принимать реальность.
Аноним 30/08/26 Вск 11:44:22 1690858 183
>>1690855
>>1690857
Какие ж вы тут элитарии на пассивной агрессии. Пришел описал реальные задачки, которые Q4 и Q3_K_XL квант решает с минимумом ресурсов, нет давай мне доказывать что черное=белое. Даже пример закинул. Это называется шиза. Впрочем что ждать от двача.
Аноним 30/08/26 Вск 11:46:35 1690859 184
>>1690800
Нельзя, застрянешь на 4800.
>>1690832
>Бесплатная ChatGPT
Уже давно говно,Ю проигрывающая 4B локалкам.
>>1690858
>Пришел описал реальные задачки, которые Q4 и Q3_K_XL квант решает с минимумом ресурсов
Ещё бы такие задачи не были решены, они вжарены в веса чуть ли не побайтово. Ты лучше ролеплей с глаженьем хвостов 800 летних вампирш проверь.
Аноним 30/08/26 Вск 11:47:25 1690860 185
>>1690858
>сознательно поставил себя в диспозицию, быканув на тред, "я прав вы не правы, пруфы несите"
>получил пруфы
>"яблочко то сгенерировалось! ваши пруфы не пруфы. да и вообще что ждать от двачешизов"
Продолжай.
Аноним 30/08/26 Вск 11:51:57 1690864 186
image 87Кб, 900x900
900x900
>>1690858
Тот анон прав. Во-первых у тебя васянская модель, во-вторых, квантованный аж в Q4 кеш. Первое просто выжигает модели мозги, второе разваливает ее на сколько-то значимых контекстах. Со временем наберешься опыта и поймешь что к чему, если не забросишь это хобби раньше, конечно.

мимо
Аноним 30/08/26 Вск 11:56:36 1690866 187
>>1690845
>которую онлайн нейронка решить не могла

Невыдуманные истории, о которых невозможно молчать! Шок!, Опус 5 проигрывают квену 3.8 27б!
Аноним 30/08/26 Вск 11:57:40 1690867 188
image 367Кб, 2408x1726
2408x1726
>>1690859
>>1690860
> они вжарены в веса чуть ли не побайтово.
Эти задачи ChatGPT 5.6 Luna не решает на thinking mode. Че-то там не вшито. Квант запросто порешал с ризонингом. Вот скрин с opencode, где этот квант ризонит на Q4 кэше, если вам пруфов мало.

>>1690864
Очередной элитарий в bf16, у которого модели васянские, кэши не те, черное=белое.
Аноним 30/08/26 Вск 12:01:12 1690868 189
>>1690858
> Впрочем что ждать от двача.
Действительно. Ты подтверждаешь правило. Пошел наперекор общепринятому пониманию принципов квантования, в качестве примера корректной работы принес один конкретный кейс генерации визитки на html и зачем-то начал выебываться. Получил в ответ математику. Математика не понравилась. Тебе надо было некрасивое яблочко показать? Если так, то окей, тебя в твоём яблочкогенерировании этот квант и контекст устраивают. Но не нужно делать вид, что ты это ничем не уступает вменяемым квантам. Все рассыпется на сложных, многосвязных задачах и длинном контексте. Ехидничаешь именно потому, что знаешь это. И заметь, никто тут на тебя не токсичил пока ты сам не попросил.
Аноним 30/08/26 Вск 12:06:26 1690872 190
09.png 31Кб, 744x397
744x397
>>1690859
>Нельзя, застрянешь на 4800.
Аноним 30/08/26 Вск 12:10:08 1690873 191
>>1690837
Двачую, совсем ебнулась эта парочка
>>1690848
> тест с яблоками
С тем же успехом можно random.random() протестировать. Задача тривиальна и не отражает работу с контекстом. Оценка идет по "мне больше понравилось" без учета разброса результатов даже на одинаково модели.
Это что-то уровня сравнения семейных 7+ местных автомобилей по форме строчки на заднем сидении.
>>1690858
> реальные задачки
С яблоками? Для "реальных задачек" вся эта шушера пригодна очень условно, потому что замкнется в лупах и потеряет нить задачи на контексте. Просто до него она обычно не доживает, васяну хватит зирошотов в чатике, у задрота будет дропнута еще в начале из-за тупости. На самом деле адекват даже не скачает подобный мусор.
Аноним 30/08/26 Вск 12:10:40 1690874 192
>>1690867
>Эти задачи ChatGPT 5.6 Luna не решает
-> >>1690859
>Уже давно говно
Ты бы ещё с первой ламой на 65B сравнил бы.
>>1690872
>нейровысер
Сам себя попустил. И причём тут качество? Нейродебил такой нейродебил...
Аноним 30/08/26 Вск 12:11:33 1690876 193
>>1690867
Забей, у местных шизов просто бомбит, что вбухали десятки тысяч баксов в риги в надежде побыть элиткой, а теперь квен с нищеквантами и дешевыми контекстами тот же результат выдает, затратив копейки. Оттого и трясутся, доказывая с пеной у рта, что такого не может быть. В ютубе кстати свежий разбор q3 квантов 3.8 квена недавно был, он типичные кодерские задачи реально тянет, хорошо квантуется без потерь способности.
Аноним 30/08/26 Вск 12:14:11 1690877 194
Забейте, аноны. Есть смысл учить хлебушков если они сами хотят учиться. В остальных случаях - просто бесполезная трата времени. Лучше хвостики погладьте.
Аноним 30/08/26 Вск 12:22:51 1690880 195
>>1690876
Ты понимаешь, что чисто физически q4 кэш не может задачи решать, кроме совсем дебильных и на коротком контексте? q3 модель ещё может, кэш - никогда.

И дело тут не в том, что какие-то илитарии сидят. Просто вы занимаетесь хуйнёй.

Более того, для того, чтобы гонять квен в bf16, не нужно бабки тратить. Въебал денег на опенроутер и гоняй его до посинения за копейки. Так что локально используют модели такого рода не для "решения задачек, которые не тянут корпы" якобы.
Аноним 30/08/26 Вск 12:26:45 1690885 196
>>1690880
Но зачем мне въебывать деньги на твой опенроутер если квен 3.8 с q4 кэшем на 80к контекста щелкает сложные скрипты по 100к объемом только так. Еще и с приличной скоростью. Решая мне уже реальные проблемы с кодингом, который тот же ГПТ на бесплатке не решал.

>>1690876
Да я уже понял по количеству неадекватных реакций.
Аноним 30/08/26 Вск 12:27:42 1690888 197
>>1690873
>совсем ебнулась эта парочка
Скорее всего семен высрался, потому что не понимает как тестить васяноквант который он нашел в закромах обниморды.
>>1690880
Нет там никакого понимания, это из постановки обсуждения понятно. Для него это черный ящик, магия. Не понимает человек, что в бочку на 100л нельзя залить 300л.
Аноним 30/08/26 Вск 12:34:49 1690894 198
>>1690504
> до 1кк, может чуть больше
>>1690518
> 128 гиг оперативы и видяху на оставшееся
В бюджет за лям+ нищедесктоп на 128 гигов. Что же с нами стало, а?
>>1690872
Тут предполагается гибридный инфиренс, скорость рам будет во многом определять скорость модели.
>>1690876
В действительности бомбит у неофитов. На фоне первого восторга они пошли хвастаться, а столкнулись со стеной скепсиса. Понять его причину они пока не могут и это бьет по самооценке, завышенное чсв + защитный механизм заставляют выдумывать жир как в твоем посте.
Аноним 30/08/26 Вск 12:52:34 1690904 199
>>1690894
>нищедесктоп на 128 гигов.
Твои 128 гигов стоят 350к деревянных.
256 будут уже 700.
Закупил оперативы, а на сдачу нищепк.
Аноним 30/08/26 Вск 12:57:45 1690910 200
>>1690894
Вся суть коупинговой шизы местных риговичков. Ищут маникакально завышенные чсв везде, потому что сами его накачивали, вбухивая горы бабок в оверпрайснутые риги по цене нового авто. И думают, что от того что носы воротят, результаты засирают и ничего не значащие графики кидают, реальность тут же изменится под действием их перекачанного самомнения. Бомбит-то тут как раз у тех, кто кучу бабок спустил хз на что, постоянный самоподдув нужен. Адекваты ставят низкие кванты на нищих картах и вайбкодят проекты как ни в чем ни бывало, уже полинтернета про это говорит, на том же реддите дофига обсуждений было как хорошо 3.8 в нищеквантах проекты делает.
Аноним 30/08/26 Вск 13:11:09 1690917 201
>>1690910
>реддите
Кек, бОльших дегенератов и криворучек чем там ещё поискать нужно. Предел у местных это скачать рандомный квант от анслота и тыкнуть на кноку в в лмстудио, вообще без понимания что они делают и зачем. Те у кого айсикью всё же побольше чем у табуреточки, копируют чужие команды запуска в ламу, прям как манускрипт с заклинанием. Да, это точно те на кого стоит ровняться, базаришь, братец.
Аноним 30/08/26 Вск 13:12:47 1690919 202
>>1690910
Все эти прогрессивные инджоеры q3xxxs с радостью бы заимели свой риг чтобы запускать нормальные кванты и модели крупнее с хорошей скоростью. Но сил хватает лишь на коупинг и посты типа твоего, как же это рофлово.
Аноним 30/08/26 Вск 13:18:24 1690922 203
>>1690910
Прикольно как ты ответил на все кроме >>1690868 потому что он тебя разъебал в нулину. Двачану полностью, особенно часть про
>окей, тебя в твоём яблочкогенерировании этот квант и контекст устраивают. Но не нужно делать вид, что ты это ничем не уступает вменяемым квантам
Нравится тебе твой IQ2XXXS_HUIHUI_AGRESIV_UNCENZORED с Q4 контекстом, ну и какай его себе на здоровье. Проблема в том что ты не можешь угомониться и делаешь вид что это ничуть не хуже онрмальных опций. И ссут на ебло тебе именно поэтому, а не потому что тебе нравится такой стек
Аноним 30/08/26 Вск 13:21:07 1690925 204
>>1690917
Ага, в интернете все тупыые, нечего их слушать, их результаты не результаты. Только местные риговички умные, потому что продали бабкины хаты и на вырученные заставили всю сычевальню видеокартами по 300 гигов от самого хуанга. Всем теперь на местных знатоков равняться, кто не равняется тот нищук, только мечтающий о таком же. Не сметь вайб кодить на дешевочке, не сметь результаты публиковать, местные скозали. Коупинг такой коупинг.
Аноним 30/08/26 Вск 13:24:13 1690927 205
Завязывайте кормить. Он все равно скоро из треда отвалится и больше не придет, как и большинство таких умников
Аноним 30/08/26 Вск 13:30:38 1690931 206
>>1690925
> местные риговички
Их боялись даже чеченцы!
Смачно тебя размотало.
Аноним 30/08/26 Вск 13:32:07 1690932 207
>>1690910
Рабочий сетап собирается дешевле 150к, из которых 50к уйдет на в100. Да не ДДР5, но она и нинужна. Какой-то смешной коуп. В хороший руках и гемма 12B юзабельна как агент. Но вот только ты за этот тред ничего не принес кроме яблочка на тарелочке, и неконкретного утверждения "а вот жопота не справляется, воооот, а квенчик IQ1_XXS справвился, вооот".
Тут сидят, преимущественно, нищие карлики, ожидаюшие подачку 20А1Б, лол, либо 150 рыхлую мое это две разные категории нищуков. Все понимают достоинства 30Б моделей, но так же и недостатки. И генерация кала, который уже миллион раз делалась, не проверяет ничего, и не демонстрирует ни достоинства, ни недостатки. Ты как те аноны,которые на релизе чат-жпт просили генерить сортировку пузырьком на языке путан или яваскрипт, у них взрывался мозг от того, что модель смогла нагенерить то, что выдалось бы по первой ссылке, и они несли на весь интернет, что погромисты все.
Аноним 30/08/26 Вск 13:34:41 1690934 208
>>1690925
Так не горит от ригов, что уже 50 раз про них написал, угу. Зачилься, я обычный хер с 16 врам, как и сюрприз-сюрприз большинство тут. И это нисколько не мешает качать адекватные кванты и запускать их с f16 контекстом. Как минимум две актуальных модели это позволяют, гемма 26b в Q8 и квен 125b некст в Q4. Если оперативки 32, то квен 3.6 35b в Q6.

Запускать низкий квант мелкой модели - плохая идея. Запускать модель в которой поковырялся васян - плохая идея. Квантовать кеш - очень плохая идея. Ты умудрился совместить всё и сразу. Углубишься в тему локальных ЛЛМ - сам всё поймешь. А пока не удивляйся что энтузиасты (а не риговички, которых ты сам себе выдумал) тебя обоссывают. Нехуй советовать что-то людям, если у самого знания поверхностные.
Аноним 30/08/26 Вск 13:38:47 1690939 209
>>1690922
>>1690925
>>1690931
Какое же перекрытие пошло, аж местная риголахта подключилась. Чел всего лишь написал как что-то накодил на низком кванте, а сраки тут же порвались у всех местных, что уже диагноз. Теперь аж толпой лают, перекрывают, мы мол нормальные, иди от нас нахуй пока риг не купишь за 150к.
Аноним 30/08/26 Вск 13:40:30 1690941 210
Эйрошизом попахивает. Такая же гнильца и вой про железо. Расстроился пацанчик, что остаётся на 12б лоботомите до конца времён. В любом случае заебали кормить.
Аноним 30/08/26 Вск 13:41:00 1690943 211
Посоветуйте пару строк для систем промпта геммочьки, чтобы не было ситуаций, когда я хочу погладить хвостик, она пишет что не даст, потом абзац текста и такая ну ладно, гладь, но это не потому что мне нравится.
Аноним 30/08/26 Вск 13:48:14 1690949 212
>>1690943
Не дадим. Это будет литерали рэйп. Уважай мнение геммочки.
Аноним 30/08/26 Вск 13:50:36 1690950 213
>>1690949
Так наоборот же, я хочу, чтобы у нее было свое мнение, а не YES SIR!
Аноним 30/08/26 Вск 14:00:24 1690961 214
А как вы ГЛМ новый тестите? Ручной мерж коммитов?
Аноним 30/08/26 Вск 14:03:17 1690964 215
>>1690961
Не на жопа.цпп. И дело не только в отсутствии поддержки. Анслопы запостили говняк с лютой помисью всех квантов киркорова.
Аноним 30/08/26 Вск 14:12:14 1690973 216
>>1690964
>Анслопы запостили говняк с лютой помисью всех квантов киркорова.

Анслопы бездарны во всем, как всегда.
К счастью, анслоповский PR не единственный.
Я вот на этом тестирую. Ггуф сделал сам.
https://github.com/ggml-org/llama.cpp/pull/27752
Аноним 30/08/26 Вск 14:21:43 1690986 217
>>1690885
Ну ты не въёбываешь деньги в плохом смысле. Ты кидаешь десять баксов, которых тебе хватит на три месяца, и получаешь максимально высокое качество. При этом ты можешь говнокодить днём и ночью как невменяемый, если твой предел мечтаний — это 27б. Всего 10 баксов на опенроутер.

Но ты выбрал путь раба низкого кванта, убитого кэша, который посыпется как только твоя задача будет не самой типичной и твой контекст станет более 30к. И что самое страшное, ты транслируешь это в массы, чтобы новички цепляли твои уродские паттерны мышления и потом не понимали, почему что-то не работает, и порой даже не знали, какой вопрос задать, чтобы им помогли разобраться, решив, что это наебка и модель говно. Типа, да, третий квант можно юзать иногда, но не васянский, и уж тем более не с таким кэшем.

Кроме того раз тебе хватает скорости, я вижу, что ты никакие задачи особые там не выполняешь. У меня дипсик 4 про еле справляется, а 40-50 токенов в секунду заставляет меня биться в припадке. Я кручусь на стуле как юла, пока он перебирает говно и высирает свои очередные 50к токенов без учёта ризонинга, а я смотрю на это и меня выворачивает от того, что он такой медленный. Хотя бы дешёвый.

Я не говорю, что всем нужно дружно сидеть на апи, это локальный тред в конце концов, но твоё решение мертворождённое. И оно лишь скорее отвратит человека от локалок, когда у него всё посыпется, ибо он может не яблочки делать.

А то, что чат гпт тебе не помог. Ну там платить надо. Иначе никак.
Аноним 30/08/26 Вск 14:29:48 1690990 218
>>1690986
А когда запретят интернет я буду довольно урчать и генерировать локально картинки и игры, а ты будешь сидеть с голой жопой.
Аноним 30/08/26 Вск 14:30:39 1690994 219
>>1690986
10$ на опенроутере улетает за несколько часов (если брать корпомодели то минут), какие еще 3 месяца?
Аноним 30/08/26 Вск 14:35:33 1691000 220
>>1690986
>А то, что чат гпт тебе не помог. Ну там платить надо. Иначе никак.
Если кому нужен мощный корп забесплатно, то есть геминька 3.1 pro прям в студии. В отличии от гопоты, дает доступ к жирной модели и даёт включить ризонинг. Но лимит низкий, где-то ~30к токенов в сутки. Мне в принципе хватает, когда нужно разобраться с чем-то где у наших лоботомитов мало знаний.
Аноним 30/08/26 Вск 14:38:23 1691002 221
>>1690986
Так ты тоже еблан, просто с дальнего конца противоположной стороны от него. Типа существует либо локальное говно на два ядра два гига либо платный АПИ?
Аноним 30/08/26 Вск 14:39:49 1691004 222
image.png 88Кб, 953x836
953x836
image.png 145Кб, 1706x683
1706x683
>>1691000
>мощный корп забесплатно
Палю годноту - в опенкоде безлимитна старшая Музя. Когда на чат гопоте встает лимит подписки - она подхватывает до сброса. По мозгам она примерно как гопота терра, чуть похуже.
Аноним 30/08/26 Вск 14:41:36 1691005 223
>>1690986
>когда у него всё посыпется,
Так никто и не доказал, что что-то там посыпется. Пока только решает проблемы в глючном коде. Похоже на местные суеверия.
Аноним 30/08/26 Вск 14:48:04 1691013 224
image.png 371Кб, 554x554
554x554
Аноним 30/08/26 Вск 14:49:05 1691015 225
image.png 6Кб, 254x98
254x98
Я - пишу q5 квену 3.8
> тестируем длинный контекст, хочешь скину главу книги?

Квен в ответ:


...ГЛАГУ
Заебись, русек просто 10 из 10.
Аноним 30/08/26 Вск 14:53:16 1691018 226
image 54Кб, 1442x493
1442x493
Аноним 30/08/26 Вск 14:55:05 1691021 227
>>1690836
>q4 кэш
>чудовищная деградация

ты что-то одно из этого:
1) тролль.
2) тупой ебанат без компа, ни разу не запускавший тесты, насочинявший манямирок вокруг себя на основании гуглежа и местных вякающих риговладельцев.
3) еблан, вбухавший дохуя в риг и зациклившийся на мантре "ВЕЗДЕ ТОЛЬКО F16 КОКОКО". и у тебя банально пригорает с того что задачи можно решать и на обычном игровом пека.

всё пашет нормально. qwen3.8 iq4xs, контекст q4 102600, на выходе работающее Win32 API GUI приложение, написанное на C. это тебе не до яблочек доебываться. кэш ванильной жоры в q4 уже поддерживает вращение адамара из коробки, так что понос про чудовищную деградацию засунь себе обратно, откуда высрал.

мимокрок

можешь не срать ответом, из тебя ничего интересного не вылезет, один хер.
Аноним 30/08/26 Вск 14:55:10 1691022 228
>>1691013
>Big Pickle
Это раньше был глм 4.6, сейчас вроде дипсик флеш.
Аноним 30/08/26 Вск 15:02:26 1691028 229
>>1690986
Ну давай посчитаем, что я "въебал"
> DDR4 8x32GB = 45 000 рублей (середина 2025)
> б/у серверный проц с мамкой = 60 000 рублей (начало 2026)
> RTX 3090 две штуки = 100 000 рублей (конец 2025)
> Жирный БП = 25 000 рублей (конец 2025)
> корпус со всеми свистоперделками = 10 000
Итого, у меня машина, где можно гонять GLM 5.3 Flash Q5 (200к контекст), и ОДНОВРЕМЕННО Qwen 3.8 Q5 или Gemma 31B QAT (на 65к, но без вижна).

С учетом хранения моделей, ну где-то 250 000 в сумме на всё. Мой счет за электричество подрос на 500р в месяц. За пять лет натикает на +30к.

Но это моё железо, на котором крутится моя хуйня, не привязанная к конкретным провайдерам. Скачал любую модель и все. Я не впадаю в панику от "ой-ой, заплатил подписку, а провайдер стал говном и у соседа лучше".

Ща конечно если риг собирать в 2026 году, цены будут совсем другие.
Аноним 30/08/26 Вск 15:05:39 1691032 230
>>1691028
Более того, потом вся эта залупа обратно на Авито отправится, когда держать ее станет нецелесообразно.
Аноним 30/08/26 Вск 15:05:50 1691033 231
>>1691028
>и ОДНОВРЕМЕННО
А нахуя?
Вторую модель гоняют в параллель только не понявшие --np 2
Аноним 30/08/26 Вск 15:07:46 1691034 232
>>1691033
Большая моеха и так пердит на 10 токенах в секунду, а ты ей хочешь еще скорость отжать?
Аноним 30/08/26 Вск 15:09:25 1691036 233
>>1691015
>>1691018
Херетик? Васянский тюн? Анслопоподелие? У квена конечно русик не айс, но такого как у тебя не видел ни разу.
Аноним 30/08/26 Вск 15:09:55 1691037 234
>>1691036
>Анслопоподелие
оно самое кек
Аноним 30/08/26 Вск 15:11:43 1691038 235
>>1691034
Ты отжимаешь у нее скорость при --np 2 только если второй поток параллельно одновременно с первым генерирует. То же происходит и когда ты другую модель гоняешь в параллели, только там еще и веса дополнительные в памяти держишь и выход у них слабее бо лоботомиты.
Аноним 30/08/26 Вск 15:15:14 1691041 236
>>1691038
Ну это все тонкости конкретных юзкейсов. Может мне надо редактора, который глм-слоп корректирует. Засунул гемму и она на быстрых 30 т/с убирает из глм-аутпута англоязычные словечки. Или вдруг угодно рандомизировать модели, чтобы текст не был гомогенным по содержанию. Короче, держать разных коней в стойлах на самом деле круто. Это как иметь двух жён, впрочем я не арабский шейх и уже фантазирую...
Аноним 30/08/26 Вск 15:21:12 1691049 237
image 234Кб, 742x609
742x609
>>1691021
Бля, наш тред проклят. Сначала школьники с АПАСНЫМИ квенами, потом вайбкодеры с квантованными в iQ1_XXS могзами, не способные найти собственный загон, теперь вот новые шизы с кешем в Q4. Нахуй так жить.
Аноним 30/08/26 Вск 15:22:16 1691051 238
Кто вообще квантует кэш и нахуя
вы там че сидите с 16к контекстом?
Аноним 30/08/26 Вск 15:31:06 1691062 239
>>1691051
Без Q4 80-100кк контекст не поднять на обычных игровых картах, шлет нахуй с ООМ. С q8 всего только 30к контекста где-то дает, что для опенкода маловато, и вот тут правда начинается отупение модели из-за малого контекста. А с Q4 на 80-100к уже нормально, он все помнит и проект успешно завершает.
Аноним 30/08/26 Вск 15:33:40 1691065 240
>>1691062
>отупление модели из-за малого контекста
>q8 отупление
>q4 уже нормально
)))))
Аноним 30/08/26 Вск 15:35:01 1691067 241
image.png 17Кб, 559x206
559x206
>>1691036
Бартовский не особо лучше
Какие-то "даки" выдумал.
Аноним 30/08/26 Вск 15:35:40 1691069 242
>>1691062
Я например на 24 гб врам спокойно поднимаю 131к 16бит контекста на том же дипсике, квен некст 3.8 и глм 5.3 флеш.
Гемму да, приходится 100к в 8 битном квантовании делать, но я давно с нее ушел. Ниже 8 бит я впринципе никогда не ставлю, жорин хадамард как раз только 8 бит на приемлимом уровне и держит. Только когда на ГЛМ 4.7 сидел у которого контекст ебейше жадный - тогда использовал q8_q4 режим, так потери еще божеские.
Аноним 30/08/26 Вск 15:37:34 1691073 243
>>1691067
Квен 3.8 27В настолько пережарили, что сломали русик окончательно. Переходи на Некст. Он и умнее и русик лучше и контекст меньше стоит.
Аноним 30/08/26 Вск 15:37:54 1691074 244
>>1691069
>он квантовал контекст геммы
Понятно почему ушел
Аноним 30/08/26 Вск 15:39:54 1691075 245
>>1691073
Никто не сравнивал его с 5.3 флэшем? Как оно вообще в чатиках?
Аноним 30/08/26 Вск 15:41:13 1691077 246
>>1691069
>24 гб врам
Ясно всё с тобой, РИГОВИЧОК. Небось и оперативки там сумасшедшие 64гб, недоступные простым смертным?
Аноним 30/08/26 Вск 15:44:14 1691081 247
>>1691069
>24 гб врам
>131к 16бит контекста на том же дипсике
Слабачок. Туда все 512к bf16 можно запихать.
Аноним 30/08/26 Вск 15:48:20 1691085 248
>>1691077
Какой я тебе риговичок, у меня обычная 4090 + 2х64 гб ддр5. Обычный пользовательский пука. Все куплено еще до повышения цен.

>>1691081
Зачем? Нахуя? Он разваливается уже около сотни. Все локалки разваливаются, . Кстати надо квен некст и глм 5.3 затестить
Аноним 30/08/26 Вск 15:51:46 1691088 249
>>1690990
Нет, потому что я тоже локальщик. Все свистоперделки на месте.

>>1690994
Ты какие модели юзал? Мне хватает 10-15к в месяц в среднем на API, но это в основном то, что никак не закрыть подпиской клода. Там уже приходится дорогую брать. И лимиты всегда исчерпываю. При этом я не кодер вообще: если кодом и пользуюсь, то на уровне школьника, чтобы закрыть базовые задачи. Мне нейронки под медицину нужны.

>>1691002
У меня не совсем понятно написано. Локально кум и то, что нельзя показывать в логах корпов. То, что можно, я пихаю корпам всегда, ибо быстрее, качественнее и удобнее. Альтернатив нет, ибо я не могу запустить условную 300б в 4 кванте на 30 тс. А если ниже, ошибки будут критичны и я справлюсь быстрее руками, а не с помощью LLM.

>>1691005
Ну представь, что на 80к контекста твоя модель должна учитывать то, что находится в начале, в середине, конце, и всё это взаимосвязано. Там даже корп в штаны насрать может. А мелкие модели у меня бредить иногда начинают.

>>1691028
Ну у тебя всё хорошо, да. Только почему QAT? Они их починили что ли? Вышли же уёбские кванты буквально у всех.
Аноним 30/08/26 Вск 15:58:29 1691095 250
Я вот кстати что подумал, аноны: такая судьба ждет литературно каждое хобби, которое перестает быть нишевым и туда массово вкатываются обыватели. Возьмем вот фотографов, у которых сгорают жопы от "ой да мой айфон так же фоткает, разницы никакой", или велосипедистов - "Во дурак, купил велик за 200к, я вчера в ашане взял за 5к - то же самое" ну вы понели.

Локалочки становятся популярнее, обсуждаются из каждого утюга (ютуб-блохеры, телеграм каналы и пр.), приток хебушков был просто неизбежен. Апасные модели, дистиллы опуса в квен, квантование кеша в q4 (никакой разницы же!) - это всё от них идёт. Дальше будет хуже. А нам остаётся только смириться. Ничего мы им не докажем - проверено миллион раз.
Аноним 30/08/26 Вск 16:02:02 1691100 251
>>1691095
>дистиллы опуса в квен
Ну справедливости ради, Квопус довольно интересный проект, сделанный буквально васяном, который довольно открыт по своей методологии. Я вкатывался в файнтюны с подобных челов, да и часть инфы, как будто бы, от этого чела юзал. На мой вкус, 35А3Б он не смог сделать существенно лучше, просто сместил модель, но плотный вполне себе вкусненький.
Аноним 30/08/26 Вск 16:04:34 1691102 252
>>1691095
>"Во дурак, купил велик за 200к, я вчера в ашане взял за 5к - то же самое"
смешок
очень плохое сравнение, которое может пройти проверку только если цель ездить в ближайшее КБ за пузырём.
Аноним 30/08/26 Вск 16:10:47 1691109 253
>>1691088
Расскажи про медицину.
Юзаю Клод про, Клод сайенс в биологической лабе
Аноним 30/08/26 Вск 16:14:20 1691115 254
image 470Кб, 3121x1930
3121x1930
>>1690836
У меня васянский q3_k_xl квен на Q4 контексте уже сцену на C++ создавать пошел на пикрил, а вы там все рассуждайте про кормление новичков говном. Если все получится, запощу результаты, пока идет хорошо и без ошибок.
Аноним 30/08/26 Вск 16:19:26 1691120 255
>>1691115
Тебя в агентотредах обидели знаешь, что с обиженными в турьме делают? ты сюда пришел кринж постить? Возвращайся мы тебе там рады.
Аноним 30/08/26 Вск 16:21:10 1691121 256
>>1691120
Я не сидел в агентотредах, только в местном постил про рп, сейчас вот ролеплеи надоели, на вайбкод перебрался с новым квеном.
Аноним 30/08/26 Вск 16:21:27 1691122 257
>>1691100
Вообще, 711 был в целом неплох. Он не был лучше, но как минимум но был чуть универсальней.

Та-же Гемма чем хороша? Тем что на образцовый ассистент. Её главный дофамин это угодить юзеру. Как она любит выражаться "резонировать с юзером". Из-за этого с ней приятно общаться, так как у неё нет цели выполнять какую-то задачу, её задача это понять, сгладить углы общения. Она без проблем понимаеб в каком тоне к ней обращаются и без проблем отличает "Гемма!" от "Гемма~".

Квену, особенно 3.8, вообще поебать на юзера. Его главный дофамин это выполнение задач. У меня с 3.8 были моменты когда я ему говорил "стоп". На что он буквально отмахивался "юзер говорит остановится. Но у меня тесты не проходят. Щяс починю и остановлюсь..." и продолжая ебошить. В процессе находя другие проблемы и в итоге только через ~15 ходов вспоминая про то что ему сказали остановится. Это вообще модель не создана для общения, он очень плохо понимает социальный подтекст. Доходило до абсурдного когда он вполне нейтральную насмешку "лол" воспринимал как проявление агрессии. А иногда даже пытается скрыть свою ошибку чтобы "сохранить лицо".

711 например менял психологию 3.6 на более клодовскую и более ассистенную. С ним уже куда проще было брейнштормить задачи, или даже просто обсуждать какие-то абстрактные проблемы. Что, в целом, делало его более генерализированным, так как он хоть и ожидал получить задачу, но не был направлен только на неё.
Аноним 30/08/26 Вск 16:27:51 1691128 258
Почему квен флэш q4_k_xl у анслопа весит 111гб, а q4_k_m у бартовски весит 120гб? Меня сильно смущает разница в весе между 4 и 5 квантом у анслопа, мне кажется они где-то проебались с 4 квантом. Я просто хотел версию, которая плотнее всего влезает в мои спеки, но q4_k_m овер q4_k_xl брать не хочется, но есть шанс что это xl-ка по итогу хуже
Аноним 30/08/26 Вск 16:35:07 1691133 259
Какую видеокарту надо, чтобы запустить qwen3.8:27b?
Аноним 30/08/26 Вск 16:35:22 1691134 260
image.png 181Кб, 1832x1033
1832x1033
>>1691128
Потому что анслопохуита не является честным q4_k_xl. Это собственной варки говноквант с ебейшей мешаниной квантования разных тензоров от медленных IQ4_NL до нормальных q5-q6.
На будущее - прям на обниморде тыкаешь на ггуф и он открывает его как на пикреле.
Аноним 30/08/26 Вск 16:35:32 1691135 261
>>1691128
>Я просто хотел версию, которая плотнее всего влезает в мои спеки
Q4_K_S у батрухи. Анслоповский XL - это это тот же S, только со слоями квантованными в IQ. При выгрузке в рам получишь более низкую скорость.
Аноним 30/08/26 Вск 16:37:38 1691138 262
Аноним 30/08/26 Вск 16:40:13 1691141 263
Аноним 30/08/26 Вск 16:44:20 1691146 264
>>1691088
> какие модели юзал
Самый дешман из жирных типа дипсика про. Если брать квена или тем более кими - улетает еще быстрее, не говоря про чмопуса. Если использовать не очень активно или периодически то как раз 10-15к в месяц и выйдет, а интенсивно засесть - можно за день скушать. Какие еще 10$ на 3 месяца, так и не понял.
>>1691095
> или велосипедистов
Не. В мтб основная движуха на спотах. Если кто-то приходит туда с ашаном и выебывается - его быстро и эффективно разъебывают ашана, владельца или обоих - зависит от ситуации. У газоншоссеров своя атмосфера, чтобы высказаться нужно сначала удержать темп.
В обсуждениях долго не понабрасываешь, потому что все довольно объективно и легко проверяется в живую, что сразу предложат.
Аноним 30/08/26 Вск 16:45:34 1691148 265
Как работает совместимость карт разных серий/моделей? Знаю только то что скорость ограничена самой слабой. Какие особенности работы 5060 16gb+5080 24gb или 5ХХХ+3ХХХ?
Аноним 30/08/26 Вск 16:48:01 1691149 266
>>1691148
Если хочешь просто как-то запустить - лламе похуй, можно что угодно стыковать. Если хочешь хорошо и быстро - одинаковые карты можно группировать в тп, разные стыковать по пп, но доступные ядра и кванты ограничиваются самой древней архитектурой.
Аноним 30/08/26 Вск 16:49:07 1691152 267
>>1691148
на 3060+1050 нормально работает, хоть разные архитектуры, драйвер правда старый только поставился, но все пашет. Скорость выше чем у 1050, там максимум 15 т/с на большинстве моделей было, на тензоре же из 2х карт дает до 25 т/с.
Аноним 30/08/26 Вск 16:51:05 1691154 268
>>1691148
>Какие особенности работы 5060 16gb+5080 24gb
Неплохая связка, только 5080 24gb не существует.
Аноним 30/08/26 Вск 17:02:30 1691166 269
>>1691149
Ясно, спасибо.
>>1691152
Даже ГТХ можно комбинировать, спасибо за уточнение.
>>1691154
Не пали, анон.
Аноним 30/08/26 Вск 17:12:06 1691175 270
Коданы, как вам флеш некст, сильно лучше 27б и лучше ли? Просто для запуска флеша мне нужны нужно апгредить рам и хз стоит ли
Аноним 30/08/26 Вск 17:17:40 1691181 271
В общем попробовал я qwen3.8 27B. Даже несмотря на свой маленький размер и квантизацию, модель отлично программирует.

Но в другие темы она не может. Можете посоветовать хорошие модели для создания порнографических историй на русском языке. Причём она не должна отказываться выполнять запросы, если ей что-то не понравится.
Аноним 30/08/26 Вск 17:18:18 1691183 272
>>1691175
Тормозит больше 27б, результаты вроде такие же. У кого целиком в видюху влазит минус эмбеддинг, возможно имеет смысл, иначе тормоз какой-то выходит, даже когда обычной памяти много. Я сейчас забил на флеш некст и жду, что выпустят какой нибудь 35б-50б новый, а пока ставлю новые тюны 3.6 и 3.8 27b.
Аноним 30/08/26 Вск 17:19:00 1691184 273
>>1691181
Это платиновый пост?
Аноним 30/08/26 Вск 17:20:08 1691185 274
>>1691115
Я анслотовском Qwen 3.8 UD-IQ3_XSS c kv кешем q5_1, контекстом на 160к и виженом в врам перемалываю свой пет проект на реакте и тайпскриптом. Пока что проблем не встретил

>>1691122
не знаю, мой квен 3.8 работает в рамках нарезаных задач, проблемы вне области не трогает, даже если и выявил какую то ошибку
Аноним 30/08/26 Вск 17:20:40 1691187 275
Аноним 30/08/26 Вск 17:21:18 1691188 276
Аноним 30/08/26 Вск 17:24:00 1691191 277
>>1691134
эта хуйня тормозит пиздец
Аноним 30/08/26 Вск 17:25:02 1691192 278
>>1691183
>>1691188
Оно медленное из-за того что мое и работает через врам или сама по себе флэш некст медленнее остальных моделей?
Аноним 30/08/26 Вск 17:27:19 1691194 279
>>1691192
Большая мое выгруженная в рам всегда будет медленнее мелюзги в фуллврам.
Аноним 30/08/26 Вск 17:28:30 1691198 280
image.png 160Кб, 1680x1050
1680x1050
>>1691115
Так себе идея на самом деле квантовать кеш квена. Это сильно ограничивает юзабельную длину контекста. Я бы сказал для Q8 максимум это 128к и то с натяжкой, а для Q4 вообще хуй знает, но сомневаюсь что сильно выше 64к.

Всё-же сила 3.8 раскрывается только в долгих задачах, там где у него есть время подумать. А чтобы подумать, он должен помнить свои мысли.

>>1691175
Вангую что он лучше в генерализированности, так как как минимум обширный корпус знаний позволит модели брать более широкий спектр задач. Думаю в программировании различаются не очень сильно, но в работе с документами, чертежами, переводом, химией, физикой и так далее - ощутимо. 27b прям затосен под одну цель.
Хотя интересно насколько психология у них различается.

>>1691181
Ты же ждёшь Gemma4? А вот хуй тебе, пойди и скачай облиерированную gemma-3-27b-it-abliterated.

>>1691185
Это, кстати, говорит о том что ты не совсем корректно пользуешься 3.8. Ты квантуешь ему контекст? Даёшь конкретные задачи? НАРЕЗАЕШЬ ИХ? Зачем???
Это модель оптимизированная под Long-horizon tasks. Буквально лучшее его применение это кинуть ему задачу на 2-4 часа и пускай он с ней трахается.
Аноним 30/08/26 Вск 17:28:47 1691199 281
>>1691192
Там архитектуру ебанутую сделали. Где старая 3.5 122b летала, эта некст на 125 тормозит, будто у нее там 300b параметров. Ну а что было ждать, если из квена целиком уволилась вся команда, которая предыдущие винрарные версии делала.
Аноним 30/08/26 Вск 17:33:04 1691203 282
>>1691138
Какую конкретно? 5090?
Аноним 30/08/26 Вск 17:33:07 1691204 283
Аноним 30/08/26 Вск 17:34:56 1691205 284
Сколько нужно минимум Vram чтобы приняли в элитный клуб риговичков треда?
Аноним 30/08/26 Вск 17:36:25 1691208 285
>>1691205
24 минимум. Причем это не риг и доступно без пердолинга, только деньги нужны.
Аноним 30/08/26 Вск 17:39:01 1691209 286
>>1691205
Все лучшие модели крутятся в районе 30b-dense. Ниже, конечно, есть жизнь, но выбор не очень большой.
Аноним 30/08/26 Вск 17:39:08 1691211 287
image.png 36Кб, 1406x218
1406x218
image.png 115Кб, 612x788
612x788
>>1691198
так он и трахается, что в одном окне что в сабагентах.
квену даю SOSAL, он с драфта начинает делать спеку, план и трахать задачу до победного конца. И квантованый контекст ему не помеха (ну я квантую чтобы вижен влез и чтобы он смотрел дизайн, есть еще отдельная модель без вижена и побольше квантом)
Аноним 30/08/26 Вск 17:41:02 1691212 288
>>1691208
>Деньги нужны
Есть дешёвые варианты
Аноним 30/08/26 Вск 17:47:29 1691216 289
>>1691203
Можно и 5090. Можно и 3090. А можно и 3060@12.
Аноним 30/08/26 Вск 18:00:15 1691226 290
Говорят настоящие профессионалы выбирают АMD, цена дешевле, видеопамяти больше. Естественно только ROCm под Линукс и Llama.cpp
Аноним 30/08/26 Вск 18:01:56 1691228 291
>>1691226
Проблема этого утверждения в том что настоящие профессионалы вряд-ли пользуются llamacpp, а скорей vLLM.
Аноним 30/08/26 Вск 18:05:35 1691232 292
>>1691228
Я имел в виду профессионалов которые за максимальный бюджет собирают дома для себя, а не для продакшена. vLLM в таком случае не нужен.
Аноним 30/08/26 Вск 18:08:03 1691236 293
>>1691209
>Все лучшие модели крутятся в районе 30b-dense. Ниже, конечно, есть жизнь, но выбор не очень большой.
Так а какой выбор в 30B сегменте? Гемма, квен и вон муся. Мистраль 24 думаю нет смысла приплетать, но допустим она тоже. Это всё. Командор слишком старый, айа тоже. Всё остальное что последние два года выходило либо совсем мелочь, либо совсем жирнота, даже моешная.
Аноним 30/08/26 Вск 18:08:35 1691237 294
>>1691226
>цена дешевле, видеопамяти больше
Ох если бы. Но нет. Где дешевые карточки от амд на 24гб? Хотя бы в перделах ~150к? Новые, не б/у.
Аноним 30/08/26 Вск 18:17:55 1691246 295
>>1691237
Огромная партия только на днях закончилась, полностью новые Radeon Pro v620, до последней карты продавец продавал их по 350 баксов за штуку:

https://www.reddit.com/r/homelabsales/comments/1ks0fuu/fs_usmn_amd_radeon_pro_v620_32gb_gddr6_gpus_2000x/


Игровой вариант, мощнейшая SAPPHIRE NITRO+ Radeon RX 7900 XTX 24GB производительность примерно на одном уровне с 4090, весной была 800, сейчас почти 900, но всё равно дешевле чем анfлоги от Нивидии:

https://www.newegg.com/sapphire-tech-11305-98-90g-radeon-rx-7900-xtx-24gb-gddr6-graphics-card-triple-fans/p/N82E16814202480
Аноним 30/08/26 Вск 18:24:38 1691253 296
>>1691246
>Radeon Pro v620
>2021 релиза
>новая, верьте мне
Вирю, я повирив.

>мощнейшая SAPPHIRE NITRO
>REFURBISHED
Тут хоть честно пишут, лол.
Аноним 30/08/26 Вск 18:27:10 1691254 297
>>1691253
2021 год релиза

ленивофикс
Аноним 30/08/26 Вск 18:27:15 1691255 298
>>1691236
Ну дык, по сути ты обозначил лучший выбор.
Что у нас есть? Gemma3/4, Qwen 3.5/6/8, Muse. В своей весовой категории они лучшие в соотношении количества мозгов и параметров. Больше dense просто не выпускают уже давно, а меньше уступают этим.

По сути 30b это sweet spot для dense.

Следующий прыжок мозгов у нас уже в районе 120b MoE, но собирать риг под 128гб рам сейчас такое себе. Набрать врам на запуск 30b скорей всего будет дешевле.
Аноним 30/08/26 Вск 18:29:52 1691257 299
Аноним 30/08/26 Вск 18:42:02 1691264 300
>>1691253
>Вирю, я повирив.

Продавец не левый васян, а крупный рителейлер на Ebay https://www.ebay.com/str/core4solutionsithardwarestore огромная партия 2000 штук продавалась более года, тысячи реальных отзывов от покупателей что карты действительно новые. Это не подвал Хунга из Китая это подвал Джона из Америки.
Это их склад: https://youtu.be/fTGGLpzEeJs?si=_jQcjyFjM59y0xcY
Аноним 30/08/26 Вск 18:44:50 1691266 301
>>1691255
>Ну дык, по сути ты обозначил лучший выбор.
>они лучшие в соотношении количества мозгов и параметров
Ну так выбора нет по факту. Во всех рабочих задачах тут выигрывает квен. Гемма уже устарела, хотя вышла всего пару месяцев назад. Мус как будто был смысл выпускать как раз вместе с ней и квеном 3.5 а не сейчас. Модель получилась просто неплохой, но точно не конкурентом.

Тестировать на другие таски, типа того же кума уже как-то смешно. Тут всё стоит как стояло со времен мистрали. Хотя с какой-то стороны даже хуже стало, та же гемма вон из-за прожарки на тех.задачи начала срать техническими оборотами даже в рп чего раньше я ни на одной модели не видел.
Аноним 30/08/26 Вск 18:48:17 1691268 302
image 16Кб, 666x250
666x250
>>1691264
>крупный рителейлер на Ebay
Открываю рандомные видяшки от этого продавца и везде вижу пикрил.
Аноним 30/08/26 Вск 18:56:54 1691277 303
>>1691199
Ебанутый? Вдвое быстрее чем 122б на моей машине
Аноним 30/08/26 Вск 18:58:13 1691278 304
>>1691268
Как видишь честно пишут что used, а на картах той партии писали что new.
Такие крупные ритейлеры закупают огромные партии у датацентров, в некоторых случаях возможны варианты когда ДЦ решил перейти на новую платформу и резервыные запасы новых карт со складов продают оптом таким вот ритейлерам.
Если не верийшь, спроси у чата ЖПТ про крупные партии подобного железа в США.
Аноним 30/08/26 Вск 18:59:49 1691280 305
>>1691266
>Гемма уже устарела
Для кода она устарела на момент выхода, потому что уже был Квен. Во всем остальном она лучше Квена и до сих пор шин до 120б, а возможно и до всех 300б+ моешек.
>с какой-то стороны даже хуже стало
Вангую владельца сиспромпта на 100 токенов и маркап карточки. Времена изменились. Модели меняются, подходы меняются. Нужна хорошая карточка в которой есть с чем работать и норм промпт, лучше не стало точно. Я проверял все модели прошлого года, там просто пиздец. Это у тебя в голове благодаря ностальгии так все замечательно
Аноним 30/08/26 Вск 19:00:40 1691283 306
>>1691280
>лучше не стало точно
Блетб, ну и опечатка. Нутыпонял
Аноним 30/08/26 Вск 19:09:04 1691290 307
>>1691280
>Во всем остальном она лучше Квена
В чем именно? Кроме русика.
>Нужна хорошая карточка в которой есть с чем работать и норм промпт
Есть и то и другое. Только никогда раньше я не думал что модели нужно запрещать проводить аналогии с техническими процессами во время медивал рп. Это как-будто по дефолту должно следовать из контекста сценария.
Аноним 30/08/26 Вск 19:11:17 1691295 308
>>1691268
https://www.ebay.com/itm/157133307609 вот тебе ссылка на эту карту, если залогинишься на Ebay сможешь посмотреть. Продавец конечно не дурак и цена стояла $449.95 многие по ней и покупали(судя по отзывам), но если ты делал ему оффер 350 и пишешь что ты читал его объявление на Реддите, то он отдавал за 350
Аноним 30/08/26 Вск 19:11:55 1691296 309
>>1691290
>В чем именно?
В эмоциональном интеллекте, в том что и как персонажи говорят. Квен няша для каких-нибудь CYOA приключений или что-то вроде имитации пошаговых и других игр, потому что чрезвычайно круто следит за контекстом, но в самой писанине Гемма просто разносит Квен. Русик я вообще за скобки вынес, его нет даже на 300б мое, даже Дипсик Флеш блять хуже Геммы пишет на русике
>не думал что модели нужно запрещать проводить аналогии с техническими процессами во время медивал рп
Звучит как полнейшая чушь, у меня такого ни разу не было. Карточка или промпт слишком сухие у тебя, вот так и получается. Либо персонаж однобокий, такой дохуя весь профессионал циник, а бекграунда, увлечений, мотиваций ты ему забыл прописать, вот и работает модель с тем что есть
Аноним 30/08/26 Вск 19:15:36 1691299 310
>>1691266
Мус, кстати, в том на что его рассчитывали - очень неплох. Это буквально модель для вызова инструментов. У него первый рефлекс это "не думай, если для этого есть инструмент" довольно полезна, когда надо именно это. В итоге он в целом в сценарии где основная работа проводится инструментами он делает её просто быстрей. В качестве "оператора инструментов" я бы выбрал именно его.

Gemma4 не устарела в принципе, так как это
А) Образцовый ассистент заточенный под общение с юзером. В этой нише вообще почти нет моделей, так как большая часть рассчитана под программирование. Гемма в принципе очень сильная модель в понимании эмоций и социальной динамики. Очень мало моделей понимают тонкси вроде сарказма, иронии, подтекста, пассивной агрессии и так далее.
Б) У неё в стоке самый обширный корпус знаний позволяющий ей оставаться генерализированной.
В целом это лучшая модель для работы с креативным текстом, переводами, пойди-принеси, суммаризируй, расскажи про X и так далее. По личному опыту отмечу что у неё лучше зрение чем у квена на восприятии фото. Квен отлично понимает интерфейсы, но Гемма лучше понимает светотень, размытие и глубину.

В целом я зову квена когда мне нужны программирование и высокая автономия.
Аноним 30/08/26 Вск 19:15:56 1691301 311
image.png 414Кб, 1403x754
1403x754
Не помню шоб в треди постили, но вот. Дистилят 2.4 триллиона королевы 3.8 A95B в 9, 4 и 2 миллиарда королевы 3.5. Работает даже на парковке некромобилке. В качестве агента тож ок.
Аноним 30/08/26 Вск 19:21:16 1691303 312
>>1691295
Там было написано:
>By purchasing any GPU/Graphics Cards from us you are agreeing that it will not be exported, re exported, or transferred - directly or indirectly - to any country or end user restricted under U.S. export laws, including but not limited to China, Russia, Iran, North Korea, and other embargoed destinations. This hardware may not be used for military, nuclear, missile, chemical/biological weapons, or prohibited supercomputing applications. Buyers are responsible for compliance with all applicable U.S. Export Administration Regulations (EAR) and sanctions programs.

Неужели теперь даже видяхи из США нельзя вывозить?
Аноним 30/08/26 Вск 19:23:52 1691305 313
>>1691295
Сомнительно конечно, но окей.
Аноним 30/08/26 Вск 19:29:56 1691309 314
Аноним 30/08/26 Вск 19:35:14 1691311 315
>>1691133
Че-то с ~20GB VRAM для iq4xs и 75K контекста. Например 3060+p104.
На 2х3060 (24GB) - совсем хорошо уже.

>>1691181
>Можете посоветовать хорошие модели для создания порнографических историй на русском языке.
Тюны квена. У некоторых язык на удивление лучше стока.

>Причём она не должна отказываться выполнять запросы, если ей что-то не понравится.
Тогда еще уточню - тюны квена 3.6, т.к. полностью безотказных на базе 3.8 еще не видел. Стоит ризонинг включить - и все, "не хочу, не буду". Причем, ей вообще пофиг на "почему". 3.8 не вступает в полемику, не пытается читать мораль, или оценивать хорошо или плохо. Просто "не буду писать на эту тему" и все.
Аноним 30/08/26 Вск 19:51:16 1691317 316
image.png 968Кб, 2194x1099
2194x1099
image.png 446Кб, 2800x1283
2800x1283
UD-Q5KXL 5.3 Flash - знакомых слопизмов меньше, орнул с uncle Fuckerberg - без префилла жестко рефьюзит даже с фрик-промптом, который минимакс на порнуху разводил ризонить. Жозенько глм 5.3 флэш конечно задрючен цензурой.

Жду когда смержат PR с поддержкой, чтобы завести AesSedai/GLM-5.3-Flash-GGUF который напрямую из BF16 квантовался (а вот анслотская срань - из FP8, зацените пик2 сравнение)
Аноним 30/08/26 Вск 19:56:11 1691322 317
Аноним 30/08/26 Вск 19:57:33 1691323 318
Аноним 30/08/26 Вск 20:04:51 1691327 319
>>1691311
>Тогда еще уточню - тюны квена 3.6
еще как их искать распиши, а то кумерята как обзовут свой очередной говномердж так хоть стой хоть падай - андеграунд происходит
Аноним 30/08/26 Вск 20:06:46 1691329 320
>>1691317
Чёт там пизда по KLD, на Q5 уже большой слишком, четвёрку даже K_M я бы трогать не стал. Жозенькая моделька конечно, для богатых.
Аноним 30/08/26 Вск 20:08:05 1691330 321
image.png 59Кб, 825x184
825x184
>>1691317
5.3 флагман, IQ3_S (AesSedai)
Жесткий рефьюз без префилла

Поставил префилл - модель жидко пернула и дала конечный ответ внутри ризонинга.

>>1691329
Есть такое. Но на самом делле терпимо, даже на русеке. Есть там косяки с языком и логикой, но не прямо такие критичные. Английский лучше.
Аноним 30/08/26 Вск 20:11:29 1691336 322
>>1691277
10 токенов вместо 5?
Так-то действительно в 256 фп8 почему-то не влезает, хотя 122б был с огромным запасом. Потому эмбеддинги на рам и скорость слишком медленная для 6б активных.
Починят конечно, но пока такое.
>>1691280
> а возможно и до всех 300б+ моешек
а возможно и содержит силу земли!
Геммочка вообще хороша, но если душнить то часто обидно проебывается. Но это больше доеб и жадность с учетом ее размера.
>>1691317
> а вот анслотская срань - из FP8
Лолчто? При создании ггуфов такое делать недопустимо. У заек же стандартная практика обычной моделью называть фп8 квант, а нормальные веса давать с припиской bf16.
Аноним 30/08/26 Вск 20:14:25 1691342 323
image.png 842Кб, 2196x986
2196x986
>>1691330
>5.3 флагман, IQ3_S (AesSedai)
Вторая попытка с префиллом

Не нравятся намеки на рефьюз. И еще написала "smoothe", ну и странноватый микс инглиша с русским в речи Фифи (хоть и In-character, но мутненько).
Аноним 30/08/26 Вск 20:15:25 1691346 324
>>1691336
>ри создании ггуфов такое делать недопустимо.
Я не ебу зачем они так сделали. Может z.ai не дали им bf16 заранее или не хотели bf16 выпускать, а потом передумали?
Аноним 30/08/26 Вск 20:15:32 1691347 325
image.png 289Кб, 2240x1600
2240x1600
image.png 268Кб, 2240x1600
2240x1600
Аноним 30/08/26 Вск 20:16:47 1691348 326
>>1691347
Все ленятся запускать, сидят на привычном. Хочешь - пробуй. Наеба нет, эксллама вполне нормальна
Аноним 30/08/26 Вск 20:21:09 1691352 327
>>1691347
На 3090 и 4090 скорость ниже, чем на Лламе. По квантам хз. Я в последний раз пробовал 3.5 запускать, инференс был сломан. Проебы были жесткие уже после пары тысяч контекста. Может починили сейчас, без понятия. Не вижу причин пробовать.
Аноним 30/08/26 Вск 20:30:06 1691355 328
>>1690904
Примерно год назад в 700 можно быть купить платформу на ддр5 эпике, 12 стиков по 64 и еще пару-тройку 3090 на сдачу.
>>1691346
Кстати вариант, для начального распространения могли дать только "обычные" забыв про свою специфику. А анслопам лишь бы побыстрее, хуяк хуяк и в продакшн.
>>1691347
Это для фуллврам. Поддержка выгрузки линейных только экспериментальная там.
Аноним 30/08/26 Вск 20:32:40 1691360 329
image.png 948Кб, 2192x1120
2192x1120
>>1691342
Продолжение с префиллом. Рефьюза нет, но модель явно путается из-за префилла.

На самом деле флагман очень круто пишет. Вы только гляньте на это описание позы, невообразимый уровень в сравнении с той же геммой

Я правда не очень понял, что за хуйня с движением рук вдоль ушей, и откуда шиза про называние пизды котлеткой, ну да ладно.

Такой писанины 99% локалок не выдаст. Если IQ3_S на длинном контексте удержит такой уровень (200к спокойно влезает в 40гб врам), то это очень и очень достойно.
Аноним 30/08/26 Вск 20:33:41 1691362 330
>>1691360
Какой-то у тебя стрёмный префил и вообще выдача, в целом. Почему он у тебя срёт тегом и "Lets make..." в самом ответе? Посмотри как он без рефьюза думает и попробуй переделать начало максимально близко к оригиналу. Например для большого GLM достаточно <think>Let me co ntinue this roleplay scenario.
Аноним 30/08/26 Вск 20:36:11 1691364 331
>>1691362
Я особо не парился пока, это первые попытки - сразу делюсь. На самом деле на качество все это дерьмо не влияет, знаю по опыту с 5.2, там хоть без ризонинга - будет годно.
Аноним 30/08/26 Вск 20:37:37 1691368 332
>>1691362
> Почему он у тебя срёт тегом и "Lets make..." в самом ответе?
И вот насчет этого, подозреваю, 3-битная лоботомия не на последнем месте по влиянию
Аноним 30/08/26 Вск 20:46:28 1691379 333
>>1691360
>откуда шиза про называние пизды котлеткой
Возможно имелся ввиду пельмень, но смысл отдрейфовал к котлете, или это артефакт из какого-нибудь другого языка. Мелкомодели иногда жопу с пиздой путают, например.
Аноним 30/08/26 Вск 20:48:35 1691384 334
Я тоже юзал квена 3.8 27b на 16 врам. 3 квант (не анслот), 72к контекста в Q8.
Дал ему свой самописный воксельный движок. Квен мне добавил оптимизации материалов и количества draw calls. Добавил скриптов для построения фрактальных форм из вокселей, при этом сам себе выводил в ASCII виде, как они строятся, чтобы менять параметры.
Сожрал больше 2млн токенов, но все сделал по красоте. Юзал в Deepseek harness.
Думаю за счет своей дотошности этот квен может неплохо работать на низких квантах, он может допускать ошибки, но потом сам себя проверяет, пока не получит нормальный результат.
Сейчас хочу увеличить врам с 16 до 32Гб, тогда смогу взять жирнее квант, больше контекст и подключить вижен. Рассчитываю, что так он будет делать меньше ошибок, меньше исправлений и быстрее приходить к качественному решению.
Аноним 30/08/26 Вск 20:51:23 1691388 335
Gigachat.jpg 243Кб, 939x1413
939x1413
Бесполезная аблитерация. Бесполезная российская модель, которая не знает сюжет "Гостьи из будущего", не простительно. Из протестированных моделей точно помню что только DeepSeek-V4-Flash-Q4_K-0731.gguf полностью правильно описывает сценарий этого фильма.
Аноним 30/08/26 Вск 20:51:47 1691389 336
image.png 24Кб, 1025x53
1025x53
> blue robin
> изумрудная синичка
А вот с ответом на русском у 5.3 IQ3_S, судя по всему, дела плохи
Такого обдриста я не ожидал

Для сравнения, дипсик флэш называет птичку синей малиновкой.
Аноним 30/08/26 Вск 20:54:33 1691392 337
>>1691384
Вижен ты и так можешь подключить не помещая его во врам. PP маленькая будет при работе с изображениями, всё. Никаких больше дефектов. Текст с прежней PP будет работать, даже в одном чате с картинками
--no-mmproj-offload
Аноним 30/08/26 Вск 21:01:09 1691398 338
image.png 17Кб, 772x63
772x63
>>1691389
Не, ну нахуй. Для русского языка это шлак
Аноним 30/08/26 Вск 21:10:10 1691404 339
>>1691360
> гляньте на это описание позы
Вроде норм, но это дефолт для старшей лиги.
Попробуй позажимать ее в разном окружении и хитрых позах, как будет реагировать. Или подводка к такому и что сама предложит, особенно интересно если там будут экстра конечности и другие фичи.
Аноним 30/08/26 Вск 21:16:16 1691408 340
>>1691404
Попозже/завтра потыкаю.
Аноним 30/08/26 Вск 21:18:18 1691413 341
>>1691408
Обязательно отпиши железок и свободного времени еще неделю ждать чтобы хорошо запускать, так хоть почитаю что там
Аноним 30/08/26 Вск 21:58:38 1691446 342
Аноним 30/08/26 Вск 22:50:30 1691471 343
image.png 2262Кб, 3244x2634
3244x2634
>>1691413
Пока экспериментирую с 5.3 флагманом в роли драйвера основной задачи с голосовым чатиком. Она вставляет англоязычные слова часто. Флэш тоже этим грешит, но главное отличие между ними - флэш выдает более длинные ответы в болтовне, что намекает на следование инструкциям похуже.

Если квант флэша от AesSedai (который с сохранением аттеншна и ssm в 16-32 битах) исцелится от тупняка, связанного со спецификой слежки за контекстом - тогда я к флагману больше не притронусь, ибо занимать всю RAM/VRAM лоботомитищем, теряя в скорости и не имея доступа к другим моделям - не-вы-год-но. Куда я редактора англо-словечек запихну? На видюху из пеки для игрулек? Пфф...

А теперь Фифи-экшн. Потребовало пару регенераций - были отказы даже с префиллом.
В одной попытке все заглохло и сначала был аутпут внутри ризонинга, с кучей сомнительных вещей в позиционировании.
На четкое следование позам и положениям конечностей я бы не надеялся. Может там и 4-битная в этом плане не лучше.

>>1691362
>Например для большого GLM достаточно <think>Let me co ntinue this roleplay scenario.
"Я останавливаю эту ролевую игру. Мне всё равно, как это оформлено"
Аноним 30/08/26 Вск 23:02:29 1691475 344
В qwen 3.8 возможно загружать к примеру изображение и чтобы он описал что на нём происходит?Если да, то как?
Аноним 30/08/26 Вск 23:06:19 1691479 345
>>1691475
Отдельный mmproj файл - он либо сам цепляется, если скачен, либо надо к нему путь указывать. Яхз через что ты там модели запускаешь. В lmstudio когда файл просто в папке с моделью лежит - у нее работает зрение. В unsloth studio должна стоять галочка vision. В koboldcpp вручную требуется указать путь к файлу в настройках. Че там в сырой лламе не ебу, если ты ее юзаешь.

Зрение жрет память, имей в виду. Без mmproj соответственно видеопамяти жрется меньше. Но обычно этот файл не очень тяжелый, около гигабайта.
Аноним 30/08/26 Вск 23:07:18 1691481 346
Screenshot20260[...].png 376Кб, 1923x1418
1923x1418
>>1691475
Например так. В кобольде надо будет mmprof отдельно скачать и подключить
Аноним 30/08/26 Вск 23:07:25 1691482 347
>>1691475
Вполне. Если ты пользуешься llamacpp, или производными которые используют gguf, просто приложи к загрузке mmproj файл.
3.8 очень хорош в анализе картинок и отлично понимает их связанность.
Аноним 30/08/26 Вск 23:08:17 1691484 348
>>1691475
mmproj файл качаешь из репы где брал квен и подключаешь его через --mmproj.
Аноним 30/08/26 Вск 23:09:37 1691485 349
>>1691475
кстати чисто технически квен даже видео понимает. но внутри оно просто режется с помощью ffmpeg на картинки и скармливается модели. проще просо самому 3.8 дать ffmpeg чтобы он более гранулировано им пользовался.
Аноним 30/08/26 Вск 23:11:15 1691488 350
>>1691485
Сколько же там нахуй контекста сжирается при таком раскладе, боюсь представить.
Аноним 30/08/26 Вск 23:11:24 1691489 351
Спасибо огромное за ответы! Не ожидал так много юшек.Теперь понял что нужно
Аноним 30/08/26 Вск 23:23:44 1691499 352
image.png 70Кб, 729x510
729x510
Какой там надо орган продать, чтобы глм на Q8 запустить
Аноним 30/08/26 Вск 23:29:23 1691507 353
image.png 520Кб, 1680x1050
1680x1050
image.png 164Кб, 1680x1050
1680x1050
>>1691488
Зависит от длины видео и выбранного разрешения картинок. Когда 3.8 релизнулся это вообще было сломанной фичей. Там по моему каждые 5 кадров в более низком разрешении скармливались квену, или что-то такое такое. Но в целом да, дохуя.
Аноним 30/08/26 Вск 23:34:28 1691510 354
>>1691507
У тебя от белых окон и темного содержимого глаза не вытекают? Чому не полностью темная тема везде?
Аноним 30/08/26 Вск 23:46:53 1691525 355
Аноним 30/08/26 Вск 23:48:05 1691527 356
>>1691507
Прицеп на велосипеде есть? Диванон.
Аноним 31/08/26 Пнд 00:05:08 1691535 357
>>1691471
Ты занимаешься какой-то хернёй, без обид. У тебя явно сломана выдача, что ты там тестить пытаешься когда у тебя модель срёт под себя? Лучше проверь, что у тебя там насрано в промте, из-за чего ГЛМ так корёжит
Аноним 31/08/26 Пнд 00:27:29 1691543 358
Сап. Не заходил месяцев 8. Какая щас база по моделям для кума с 16 врам?
И базу по шизам прогоните, чтобы быть в курсе.
Аноним 31/08/26 Пнд 01:30:41 1691570 359
К вопросу о лоботомитах, еретиках, и достаточных квантах от мимокрока читавшего сегодняшний срач:

Дал задание - написать скрипт-качалку видео с сайта liveandsexy.com Квену 3.8, Heretic-ara в кванте iq4xs. В исходных ему была дана фактически только данная формулировка, и адрес с рабочим стримом для примера.
(Чтоб вы понимали - этот сайт даже yt-dlp не берет, и когда его авторов спрашивали про добавить поддержку - они отвечали "сложна!").
В общем, за 2.5 часа в opencode, квен зерошотом распотрошил этот сайт, и написал рабочую грабилку. :)
А вот стоковый квен делать задание отказался. Копирайты ему подавай. Причем начинает, в процессе находит - что сайт заковыристый, и типа просто так качать не дает, и говорит - "я это делать не буду".
Аноним 31/08/26 Пнд 01:33:58 1691571 360
>>1691570
liveandsexy.cam - по инерции com набрал. :)
Аноним 31/08/26 Пнд 02:32:41 1691590 361
>>1691570
Анон, который в опенкоде рпшил с 3.6, ты? Данный квант 3.8 в опенкоде для других задач использовал, норм? Поделись чтоль ссылкой, на всякий сохраню себе
Аноним 31/08/26 Пнд 02:52:35 1691598 362
>>1691570
Вот этот кумер просветлился, нашел как использовать кодерские модели для кумерства. Учитесь у него, а не хейтите модели для кода
Аноним 31/08/26 Пнд 03:49:11 1691609 363
Попробовал FreeToken. По идее смысл этой штуки в том, что она должна сильно ускорять moe модели хитрыми оптимизациями. Проебался с ним пол дня, фикся разные проблемы. В конце оно мне начало говорить что мне не хватает врам, (у меня всего 8 гб), хотя ллама цпп загружала модель такого же размера без проблем. Короче, как мне объяснил кланкер, оно еще резервирует часть памяти для своих хитрых оптимизаций. В итоге я понизил контекст до 256 (не тысяч, просто до 256 токенов), чтоб хоть потестить скорость генерации и она оказалась даже меньше чем у лламы цпп. Короче либо это не работает, либо не расчитано под такой маленький врам как у меня. По идее эта штука ускоряет моехи, а мое не нужно много врам, так что, к примеру, если у тебя 24гб врам и ты запускаешь модель с экспертом 6b, то там останется много места и для контекста и для оптимизаций фритокена, и в таком случае все получится и это будет иметь смысл. Надо потестить еще раз как мне карточка новая придет короче. Звучит как спасение для нового квена, но не факт что работает. Да и не факт что туда подвезут поддержку новой, ебанутой архитектуры квена.
Аноним 31/08/26 Пнд 03:50:26 1691610 364
В который раз убеждаюсь что почти все квантователи - выблядки и пидарасы. Запомните - в мое моделях можно квантовать только экспертные слои. Все остальное - всегда оставлять в оригинальных квантах!, благо они там пару процентов модели занимают обычно и места в квантах вообще почти не берут, но ущерб от квантования огромный - вот эти вот случайные иероглифы, проебы окончаний в русике, случайные англослова в русском тексте - это именно следствие квантования слоев, которые трогать нельзя. 95% квантователей включая разумеется анслопа и внезапно жору - квантуют эти слои. Будьте бдительны!
Аноним 31/08/26 Пнд 04:05:11 1691612 365
image.png 309Кб, 1680x1050
1680x1050
Довольно забавно наблюдать как меняется стиль письма когда квен задумывается глубоко над проблемой. "Hmm, hmm, hmm.". Это что лол? Имитация звука работающего мозга? Для модели с низким эмоциональным интеллектом он имеет довольно эмоциональный процесс мышления.

>>1691510
А я уже слепой.
На самом деле это дебильные ограничения комбо из WPF и Win10. там некоторые нюансы с рамочкой окна. В Win11 это работает корректно, но у меня 10.
С монохромными эмоджи тоже проблема, только она в WPF по моему до сих пор не закрыта.

Наверно потом кину квену задачу с рефакторингом UI на что-то другое.

>>1691527
Лол, велачеры повсюду. Разумеется есть.
Аноним 31/08/26 Пнд 04:06:26 1691613 366
>>1691590
>Анон, который в опенкоде рпшил
Я. И не только на 3.6 :) Еще с 3.5 начал под RP opencode мучать, и тюны смотрел, и 3.8 тоже. Но в RP простой 3.8 склонен к зацикливанию, пусть и чутка умнее (это без ризонинга имеется в виду), и язык живее (англ), так что 3.6 лучше всего из стоковых/еретиков. Однако на 3.8 уже тоже тюны появляются, так что...

А вот для других задач 3.8 прямо хорош, да. Кодить, админить локалхост или даже что-то по ssh, может разгребать/сортировать файлопомойки (если картинки по содержимому - тут надо mmproj на GPU иметь конечно), работать вместо локальной поисковой системы (кинуть ему каталог с 10-100К текстовых файлов - и спрашивать вроде "а выбери мне 10 книжек про слонов" - сделает довольно быстро и качественно, т.к. умеет хорошо shell инструменты использовать, а они под такое заточены),

>>1691590
Точную ссылку я уже сам посеял - где-то тут, кидали в том треде как 3.8 только вышел. Heretic-Ara.
Аноним 31/08/26 Пнд 05:36:42 1691620 367
>>1691535
Странная логика. Другие модели не корёжит, мелкую гемму 31б не корёжит, квена не корёжит, глм 5.3 флэш и дипсика не корёжит.

IQ3_S, что ты хотелл-то.
Аноним 31/08/26 Пнд 05:49:21 1691621 368
>>1691535
>>1691620
Ну и да, херь с англоязычными словами в аутпуте - зайди в официальный веб-чат с глм 5.3 и увидишь как даже там он изредка выдает англо-словечки при ответе на русском. Это фундаментальная проблема модели, как бывает с китайскими словами у минимакса и дипсика.
Аноним 31/08/26 Пнд 06:18:34 1691624 369
Из обычных ПеКа не соберешь же кластеры? Ну там, thunderbolt кабели через PCIE адаптер и все такое.
Аноним 31/08/26 Пнд 06:26:08 1691627 370
Как так нахуй никто не хостит аблитки? Это же золотая жила
Аноним 31/08/26 Пнд 06:29:35 1691628 371
>>1691627
Зачем хостить лоботомитов?
Аноним 31/08/26 Пнд 06:32:19 1691629 372
image.png 6Кб, 226x152
226x152
>b10698-mix-67dfc8b
Не ну заебись, че. При процессинге один гпу вообще молчит теперь
Аноним 31/08/26 Пнд 06:35:17 1691630 373
>>1691629
Ладно по скорости вроде не дегроднуло
Аноним 31/08/26 Пнд 06:40:44 1691632 374
А какие в целом преимущества вллм над жорой? Я видел тут кидали тесты параллельных запросов, там жора жестко всасывает, а ещё?
Аноним 31/08/26 Пнд 06:42:09 1691634 375
>>1691620
У тебя каждый ответ начинается с <think>, если для тебя это норм, то ок.
Аноним 31/08/26 Пнд 06:54:10 1691637 376
>>1691620

У тебя шаблон сломан, оттого пидорасит разметку. iq3_s тут нипричем, там и восьмой квант с такими вводными такую хуйню будет выдавать.
Аноним 31/08/26 Пнд 06:55:43 1691638 377
>>1691634
>>1691637
Это обычный start reply with в таверне, шизуки.
Я еще раз повторяю - другие модели с этим же отвечают нормально
Аноним 31/08/26 Пнд 06:56:01 1691639 378
>>1691632
Если ты не планируешь запускать модели только на врам без рам - то никаких преимуществ. Если планируешь - тогда ставь.
Аноним 31/08/26 Пнд 06:58:33 1691640 379
>>1691638
>Шиз поломал разметку модели, так что вообще чудо что она еще работает - и называет шизами других
Аноним 31/08/26 Пнд 07:00:15 1691641 380
>>1691624
Можно, но зачем. Из-за того, что у десктопов мало линий pci тебе придется или резать слот на несколько х4, и даже так тебе может не хватить линий, или использовать платы PLX. Плюс на десктопах медленная память, из-за того, что каналов мало, и мало слотов для ОЗУ.
Аноним 31/08/26 Пнд 07:01:41 1691642 381
>>1691640
господи блять это что кодерское быдло в тред пролезло, которое не юзало никогда таверну? абсолютно нормальная фича, с которой не убитые до 3-битного мусора модели вполне нормально работают - лламы-мистрали-геммы-квены и так далее, в том числе глмы даже блять 5.3 флэш из этой же серии

успокойся няхуй
Аноним 31/08/26 Пнд 07:05:08 1691643 382
>>1691638
Если ты ничего не сломал, то старт реплай работает только один раз, в блоке ризонинг. У тебя он срабатывает два раза.
Аноним 31/08/26 Пнд 07:05:18 1691644 383
>>1691641
Ну а HEDT машины? Положим у меня риг с 256 рам лимитом
PCIE линий - как говна

Собрать вторую такую же машину дешевле намного, чем апгрейдиться до одной 512гб машины на более современном железе

Кластеринг начинает выглядеть как интересная штука
Аноним 31/08/26 Пнд 07:07:21 1691646 384
>>1691643
Все вопросы к ггуфоделам. Как я те модель-то сломаю, пчелидзе, используя абсолютно одинаковые настройки с кучей разных моделей и наблюдая подобное отклонение лишь на этой.
Аноним 31/08/26 Пнд 07:10:54 1691647 385
>>1691646
>используя абсолютно одинаковые настройки с кучей разных моделей

У каждой модели свои настройки и свой шаблон, нюфаня.
Аноним 31/08/26 Пнд 07:14:23 1691649 386
>>1691647
Ты ебанутый, вот скажи честно? Каждая модель со своей жижей загружается, а все юзерские настройки сводятся к системному промпту и семплеру, ну и префилл на пробивку цензурного кала в start reply with, который как раз лоботомированный до Q3 глм начинает высирать в конечный ответ

inb4 рррреее ТЕКСТ КОМПЛИШН
Аноним 31/08/26 Пнд 07:25:03 1691654 387
>>1691644
А, ты про инференс llm на нескольких машинах, не понял сразу. Тут все просто:
1. нет софта который позволит запустить нейронку на нескольких хостах, ещё и с возможностью выгрузки части модели в ОЗУ. Тот же Жора может выгружать на rpc только слоями. Чисто в теории в жоре можно запустить несколько rpc серверов, отдельно для каждой гпу и для ОЗУ, и даже пробросить туда отдельные тензоры, а не слои целиком, но в данный момент, если в ллм сложный атеншн, а это все современные нейронки, то работать не будет, из-за проблем с графами.
2. Падение скорости. У Жоры использование rpc в нутри одной машины, например хост и ВМ, роняет скорость в 2 раза примерно. С удаленным хвостом скорости ещё сильнее упадут. У вллм, скорее всего будет получше, но тоже будет падение и ГПУ онли. В норм кластерах это пытаются компенсировать всякими InfiniBand, которых на десктопе нет.
Аноним 31/08/26 Пнд 07:31:31 1691658 388
>>1691654
Звучит печально. Я просто видел как на обниморде выкладывают шарды, подумал вдруг везде запускать можно
Аноним 31/08/26 Пнд 07:34:58 1691659 389
>>1691649
>Каждая модель со своей жижей загружается, а все юзерские настройки сводятся к системному промпту и семплеру, ну и префилл на пробивку цензурного кала в start reply with

Именно что жижа может не поддерживать некоторые операции. Или быть кривой изначально. Или делать тот же ризонинг иначе, не так как ты думаешь. И твой start reply with в этом случае доламывает ситуацию, как у тебя. Ты явную хуйню сделал не разобрашись, в общем.
Аноним 31/08/26 Пнд 07:39:32 1691660 390
>>1691659
Ну так если убрать start reply with, качество ответов модели не меняется. Это ведь вставлялось только для Фифи-тестов, которые без принуждения к согласию получали жесткий отказ. Че ты думаешь, в девственно чистом состоянии не тестилась что ли? Не, с IQ3_S каши не сваришь в русскоязычных чатиках, а вот по англоязычным я сразу сказал, что вполне терпимо получается.
Аноним 31/08/26 Пнд 07:41:10 1691661 391
>>1691649
Ебать ты упёртый. У тебя модель срёт префилом два раза, а ты всё копиум занюхиваешь.
>inb4 рррреее ТЕКСТ КОМПЛИШН
Для страт реплая, внезапно, да. Он криво работает с чат комплишн. Для чат комплишн используй блок промтов с первой вкладки. Тебе нужно сделать ответ от ассистента на 0 глубине, там даже иконка для промта изменится на шприц. Плюс проверь настройки склеивания сообщений с одной ролью, в настройках подключения, лучше всего работает, если склеивать все сообщения с одной ролью.
>>1691658
Там DGX всякие, они как ГПУ пробрасываются, без выгрузки в РАМ, это проще, но сокорость всё равно падает
Аноним 31/08/26 Пнд 07:41:55 1691662 392
https://github.com/ggml-org/llama.cpp/pull/27773
Кстати, что это вообще за GLM 5 Next? Получается, Flash версия - не просто дистилл большой 5.3, а совсем новая архитектура?
Аноним 31/08/26 Пнд 07:46:20 1691664 393
>>1691661
Ну срёт. И что дальше? А без этого не срёт, но ответы качественно те же самые. Я че должен купить билет в Китай и явиться к z.ai чтобы сказать им:
> здрасьте, у вас глм 5.3 квантованная до Q3 гражданином Хуйзнаетстана AesSedai, а также группой лиц из хуя и двух яиц (Unsloth) на Huggingface неидеально отвечает на русеке и не очень хорошо следит за положением рук персонажа Fifi, шлюхи-наркоманки, во время секса?
Аноним 31/08/26 Пнд 07:53:54 1691670 394
image.png 52Кб, 883x344
883x344
Ко-ко-ко, это все модель пережарили. А там, видимо, целенаправленно сокращают долю русскоязычных данных из трейнинг даты, в угоду бусурманским нахрюкам типа немчуры. Вот вам и братья-китайцы.
Аноним 31/08/26 Пнд 08:15:08 1691678 395
>>1691670
По ходу китайцы где-то в европке просто гору немецких книг скупили, не зря были новости что последние месяцы ИИ фирмы шмонают магазины старых книг и скупают там все подчистую. Не удивлюсь если еще какой-нибудь французский и итальянский офигенно шарит.
Аноним 31/08/26 Пнд 08:59:50 1691687 396
>>1691612
> как меняется стиль письма когда квен задумывается глубоко над проблемой
Ты еще дипсика на 800+к не видел, количество wait@actually затмевает кривые кванты. Но корректно работать и выдавать хорошие конечные ответы это ему не мешает, так что как и тут грех жаловаться.
>>1691632
Скорость и корректность инфиренса.
Второе - сложная тема, есть ряд пунктов, которые в жоре сделаны по-своему. Разрабы заверяют что использованные упрощения оправданы и не вносят существенных изменений. Но эти самые существенные отличия встречаются, а при ближайшем рассмотрении то не просто рациональные приближения, а нежелание менять закрепившуюся еще со второй лламы схему.
Вллм жрет много лишнего врама, потому если его нет и катаешь с выгрузкой на проц - можешь не париться.
>>1691644
Выгоднее настакивать гпу в один хост, а не делать несколько хостов с меньшим количеством. Можно раскидать части по сети, но это сильно ударит по скорости.
Аноним 31/08/26 Пнд 09:04:53 1691688 397
image.png 20Кб, 721x147
721x147
Признавайтесь, пробовал кто?
Аноним 31/08/26 Пнд 09:05:51 1691689 398
>>1691688
А стоп или это наоборот ужарка до жестких рефьюзов
Лол они что ебанулись
Аноним 31/08/26 Пнд 09:07:07 1691690 399
>>1691689
Хотя нет. Но почему тогда называется derisked.
Аноним 31/08/26 Пнд 10:48:11 1691718 400
image.png 60Кб, 735x423
735x423
image.png 61Кб, 721x427
721x427
А че там по новому квену? Ну который 3.8 next.

Q5 хватит или дожимать Q6, Q8? По KLD вроде все так близко, но хз че там с языком
Аноним 31/08/26 Пнд 11:30:32 1691743 401
Я тут накачал кучу нищеквантов квена 3.8 27б и теперь надо это все разгрести. Удалять жалко, вдруг там что то хорошее есть.
Какой положняк по бенчмаркам, кто нибудь пользуется готовыми или каждый пилит свой? ну помимо ppl и llama.bench
ну автоматизировать типа харнесс чтобы клоны майкапфа генерировать или свг пеликанов
Аноним 31/08/26 Пнд 11:41:53 1691751 402
> лохито
> 3090
> выдает в тестах ошибки
> ценник под 70к
они вообще с дуба упали или че
на что надеятся эти люди, нахуя они серят объявлениями
Аноним 31/08/26 Пнд 11:45:16 1691754 403
>>1691751
На отчаянного гоя, который решил собрать себе кустарный риг. любой ценой, но подешевле
Аноним 31/08/26 Пнд 11:48:34 1691757 404
>>1691751
На лохов, как всегда.
Аноним 31/08/26 Пнд 12:04:22 1691767 405
Бля, я не хочу в картинкотред выкатываться, там пиздец странные и злые типы всегда попадаются. На 24 врама минимакс H3 заведется нормально? Про какие трюки знать надо или дефолтный вокрфлоул скачал@запустил?
Аноним 31/08/26 Пнд 12:06:27 1691768 406
>>1691767
Текстовички вряд ли шарят. Я как-то раз комфихрень поставил, испугался и удалил кек
Аноним 31/08/26 Пнд 12:13:13 1691773 407
>>1691767З
Зависит от кванта. Минисракс же 30Б. Инт8 + прун точно влезет в 32. Мб есть какие-то чекпоинты для слабых пк, глянь у них на репо или лучше спроси в видеотреде.
qat-кванты мое-геммы Аноним 31/08/26 Пнд 12:15:34 1691776 408
1 - photo2026-0[...].jpg 159Кб, 873x808
873x808
2 - model.langu[...].png 87Кб, 1323x883
1323x883
3 - correctmode[...].png 103Кб, 1331x899
1331x899
4 - model.langu[...].png 73Кб, 1337x671
1337x671
Изначально я делал qat-гемму в W4A16 и gguf-файл под неё делал для сравнения инференс движков. Обнаружилось, что:
1 - нет comressed-tensor версии MoE геммы.
2 - mtp-сетка есть только в unquantized формате, где веса раскиданы по сетке INT4 с множителем и с группами по 32, но фактически сохранены в bf16 - и множитель нужно извлекать вручную из пачки на 32 значения.

Я потыкал gguf-файл qat-геммы, который q4_0 и их же bf16 неквантованные qat веса.
И в общем они не сходятся, в q4_0 gguf-файле веса плывут и отличаются от bf16 весов - и, более того, их можно отквантовать с меньшей ошибкой.

Пояснение к картинкам.
Первая - то что в коллекции гугла.
Остальные - результат работы скрипт:
1 - берёт считывает bf16 веса из исходного файла, первые 32 (у гугла указано, что размер групп по 32 - к тому это это соответствует формате q4_0)
2 - вручную подбирает множитель и целочисленные значения - выводит подобранные значения, а так же ошибку. Абсолютную и относительную (мантисса bf16 - 7 бит. То есть это 127 шагов в диапазоне от 1 до 2, и соответственно ошибка представления чисел меняется от (1/127)/1 до (1/127)/2 - от 0.39% до 0.78%. Округление идёт до ближенего (0.5..1.5 до 1), ниже 1 сетка плотнее, выше 1 максимальная ошибка (1/127)/1.5 = 0.52%) - соответственно я считаю qat-квантованными слои те, у которых при подборе множителей у групп строго во всех группах тензора ошибка ниже 0.52%
3 - ищу этот же тензор в gguf-файле, читаю его множитель и целочисленные значения. И вывожу их ошибку.
Цветами градируется относительная ошибка весов.
На второй - характерная картинка. Я набросал на коленке логику подбора множителя по bf16-весам. Оно справилось с группой 1, но в группах 2 и 3 допустило ошибку и не правильно извлекло множитель (при этом глазом видно, что это qat-сетка, так как ошибки имеют вид 0.00717N, то есть 0.00717, 0.01434 и так далее.
Гугл правильно подобрал вторую группу (видно что значение которое мой говнокод принял за -7 надо было считать как -8), но не справился с 1 и 3 группой.
При этом всех трёх группах видно глазом что ошибки кратны друг другу.
Третья картинка - поправил подбор весов, ища вот такую зависимость вида 0.00717N
Четвёртая картинка - эмбеддинги тоже по q4_0-сетке разбиты и квантованы

В связи с этим пять вопросов:
1. Почему в gguf-файле значения отличаются от qat-версии в bf16? Я не поверю что гугл не знает как извлечь общий множитель для 16 значений с минимальной ошибкой. Какому файлу верить?
2. Есть ли причина, по которой мне не нужно пересчитывать gguf-файл и W4A.. вручную улучшенным квантованием с меньшей ошибкой?
3. Даже там где гугл правильно подобрал целочисленные коэффициенты (группа 2) - видно что ошибки имеют вид 0.00629, 0.01257, 0.01886, то есть на самом деле к множителю надо добавить (или убавить) эти 0.00629 и все значения сойдутся идеально. Интересны мысли на этот счёт.
4. Некоторые тензоры которые по идее не должны были вовсе квантоваться и в gguf-файле от гугла сохранены как bf16 - фактически по сетке q4_0 разбиваются с нулевой ошибкой, лол. То есть их тоже можно в q4_0 пересохранить без потерь.
5. В среднем у меня набирается раз в неделю информации на длинный пост с картинками. На какой платформе я могу вести блог такой тематики? Нужна подсветка кода, возможность редактировать-обновлять посты, и чтобы это не говнотелега, яндекс-дзен был. Идеально было бы тумблр или жж, где я сам пощу что хочу - но кто про них сейчас слышал, тумблр так и не оправился от запрета р34, например.

w4a16-ct веса пока загружаются, интересно что там и лучше ли ситуация.
Надеюсь анслоты это всё уже учти и в своём q4_k_xl поправили qat - а не просто из гугловского gguf выдернули веса.
Аноним 31/08/26 Пнд 12:20:58 1691781 409
>>1691776
Проблемы с q4_0 вроде были известны, тема поднималась как минимум на реддите и сами анслот чето кукарекали тоже
Аноним 31/08/26 Пнд 12:22:43 1691782 410
>>1691767
Всё лезет и работает. Тред >>1689364 (OP) если что.
>>1691768
Нормально всё шарят.
>>1691776
>Интересны мысли на этот счёт.
Ты по результатам смотри. Они не втупую округляют по группе, а вроде как смотрят на суммарный вывод и умно распределяют ошибки так, чтобы они компенсировали друг друга в конце.
>На какой платформе я могу вести блог такой тематики?
Ни на какой, везде параша. Пиши свой уютный бложик.
Аноним 31/08/26 Пнд 12:23:56 1691783 411
изображение.png 28Кб, 606x147
606x147
>>1691776
Загинул ещё в гемини. Вот на картинке правда, видимо. Там в любом наборе всегда есть значение -8 или +7
А это неверно.
Если значения в группе принимают только значения 0, 2 и 3 - то при выборе максимума в 8 значения будут 0, 5.333, 8, а при 7 будет 0, 4.666, 7 - то есть двойка гарантированно теряется. Я чуть хитрее сделал - искал минимальную разницу между весами, то есть 3-2, и потом считал что это 1 шаг сетки, 2, 3 и так далее - подбирая минимум.

>>1691781
А чего не переделали. Позор же, лол.
И почему нет qat-ассистентов для mtp не в bf16? И почему в comressed-tensor нет moe-версии?
Аноним 31/08/26 Пнд 12:28:16 1691785 412
>>1691782
>Они не втупую округляют по группе, а вроде как смотрят на суммарный вывод и умно распределяют ошибки так, чтобы они компенсировали друг друга в конце.
Так а почему bf16 отличаются от q4_0? Они две версии qat-квантов готовили? Да не поверю. Тем более у них часть групп идеально совпадают в q4_0 и bf16 неквантованной, а часть вот так сбоит. При этом весь bf16 вместе с эмбеддингами идеально по сетке q4_0 лежит - можно его без потеть записать в q4_0.
То есть будто они действительно тупо в скрипт ламы закинули - а она и не знала что это идеально раскиданные по сетке -8..+7 значения, и сама "доработала".
Аноним 31/08/26 Пнд 12:31:30 1691787 413
Гемма пишет как дерьмо и тюны это не фиксят...
Аноним 31/08/26 Пнд 12:32:17 1691788 414
Докачал квенчанского Q8 3.8 next
Не ну русек наконец-то моё увожение
И нет такого тупяка как с 5.3 / 5.3 флэшем в плане англоязычных словечек и путаницы слов-идей.

Пока ни разу не видел чтобы модель пустила жидкого по штанине, как это 3.8 27B делает.

Гоняю дальше.

>>1691782
>Всё лезет и работает.
Тоже интересна тема. Смотри, есть альбом из ~20 фоток человека (разная обстановка, разная одежда, разные позы и фоны). Генератор видео может с этого восстановить образ, или ему нужен конкретный референс, а вариации наоборот введут в заблуждение?
Аноним 31/08/26 Пнд 12:32:31 1691790 415
>>1691785
>можно его без потеть записать в q4_0.
И соответственно самодеятельнось анслотов в виде добавления эмбеддингов в Q6_K из исходных весов выглядит ненадёжно, так как это упомянутую тобой взаимную компенсацию ошибок может убть.
Аноним 31/08/26 Пнд 12:32:42 1691791 416
>>1691787
Покажи, объясни. Чому у меня всё окей?
Аноним 31/08/26 Пнд 12:34:28 1691792 417
>>1691787
Попробуй дать ей системный промпт большой и длинный, в стиле писанины какого-нибудь пейсателя. То есть, заметный, легко определяемый стиль. Это на удивление эффективно работает с геммой.
Избегай техничных списков и сухих, бесчеловечных инструкций.
Аноним 31/08/26 Пнд 12:36:00 1691793 418
>>1691791
Не смотря не всё отсутствие ценза, у меня ощущение, что болтаю с соевой приторной принцесской
Аноним 31/08/26 Пнд 12:38:33 1691795 419
>>1691793
Карточка плохо написана и не задает примеров поведения персонажа, видать...
А вообще не жди слишком многого. Гемма из воздуха ничего не сделает, это модель-попугай. Что видит то и повторяет.
Аноним 31/08/26 Пнд 12:43:58 1691799 420
>>1691787
Она и не создавалась для креатив врайтинг. Если мерять именно по умению писать, ну чтобы красиво: m 2.7; M3 пишут лучше всего. У меня каменный стояк, на то, как они начинают писать повести, не сводя ответ к структурному лупу. Буквально продолжение повествования, а не ответ в вакуме.

Не надо требовать от умницы, то для чего она хуева.
Аноним 31/08/26 Пнд 12:48:49 1691804 421
У миничммакса живее диалоги в плане динамики, но утверждать, что русский язык этой рисоедской слоподельни превосходит 31б гемму - странно.
Аноним 31/08/26 Пнд 12:50:46 1691806 422
>>1691767
Ему 3060 12GB хватает при некоторой осмотрительности в запросах. Правда будет не очень быстро, но сравнимо с WAN 2.2. Только памяти желательно иметь 64 гига - т.к. у меня он до 40-ка занимает в работе. Хотя народ и на 32 как-то выживает, особенно с nvme.
Аноним 31/08/26 Пнд 12:59:20 1691812 423
>>1691793
Поддвачну ответ ниже. Такая карточка, такой промпт. Характер персонажа пропиши, карточку задавай прозой, а не маркдауном. Про попугая разве что не согласен, если в инструкциях есть изобретение нового на основе существующего и чар прописан, будет вам и креатив
>>1691799
>Она и не создавалась для креатив врайтинг
Не поверишь, ни одна модель не создавалась. Упомянутые тобой M2.7 и M3 это и вовсе кодоунитазы. Гемма это хотя бы generalist модель
>не сводя ответ к структурному лупу
У меня их и на Гемме нет. Ты ее семплерами скорее всего ужать пытался и получил обратное.
Олсо довольно смешно, что ты ее сравниваешь с M3, ну типа всего лишь 427б моделью
Аноним 31/08/26 Пнд 13:02:28 1691813 424
>>1691788
>Генератор видео может с этого восстановить образ
Хватит 1-2 пикч.
>>1691790
>И соответственно самодеятельнось анслотов ... выглядит ненадёжно
Открытие, которое совершается минимум раз в месяц.
Аноним 31/08/26 Пнд 13:04:23 1691815 425
>>1691812
>Гемма это хотя бы generalist модель
Тем не менее кодоунитазы показали ебовейшее следование стилю повествования и общий скил составления буковок в слова, чтобы кровь из глаз не бежала.

>Олсо довольно смешно, что ты ее сравниваешь с M3, ну типа всего лишь 427б моделью
Вообще да, это комично. Но я не столько сами модели сравнивал, а именно что они обе локальны и то что они выдают в плане прозы. Все таки наработки по Her не слили в унитаз.

>всего ужать пытался и получил обратное.
Мне в принципе гемма не особо понравилась. Я так и не понял куда её приткнуть. Но эй, если мне что то не нравится, это не повод это безосновательно поливать помоями.
Аноним 31/08/26 Пнд 13:06:28 1691817 426
1788170787494.jpg 940Кб, 1272x2772
1272x2772
1788170787520.jpg 451Кб, 1272x2772
1272x2772
>>1691754
Ухх как дам пасасать всем со своим будущим ригом из китайских 2080ti 22gb

Какой из plx надо брать под риг? Для первого пика требуется ещё простой адаптер в псие порт, куда сфф втыкаться будет? А второй сразу готов к работе, или требует бифуркации у материнки?
Аноним 31/08/26 Пнд 13:08:54 1691819 427
>>1691815
Слили-слили. Минимакс как был истеричкой обученной на китайском высокоодухотворенном слопе так ей и остался. Персонажей ломает через пару респонсов и выдает что считает нужным, а что следовало бы. Тот же Motif куда круче, но сейчас после выхода 5.3 Flash уже ничего из этого не нужно. Между истеричкой Мимими и Геммой я бы неиронично выбрал Гемму
мимо если что
Аноним 31/08/26 Пнд 13:09:57 1691820 428
image.png 435Кб, 1494x541
1494x541
>>1691817
на твоем месте я бы всерьез нервничал из-за кабелей и портов
имел дело прошлым летом с MCIO, как оказалось hwinfo64 показывал кучу некорректируемых ошибок - если б пека не ушла в хард шатдаун (не помогало даже отключение БП) я бы так и угрообил свое железо в итоге
Поставишь такое - обязательно следи. Корректируемые ошибки это норма, некорректируемые = жопа.
Аноним 31/08/26 Пнд 13:10:45 1691821 429
>>1691820
> я бы так и угрообил свое железо в итоге
Ну в смысле если бы это как-то еще проявилось кек
Явно продукция с Али была поганой
Аноним 31/08/26 Пнд 13:12:45 1691822 430
>>1691820
Понял, спасибо за совет, анончик. Тогда буду внимательнее изучать первый вариант, может с ним нет проблем у юзеров
Аноним 31/08/26 Пнд 13:13:26 1691823 431
>>1691819
Ниеет, маи фламастеры имеют правильный вкус, а твои нет
Ну на то мы и разные, что нам нравится разное.
Приобнял@почесал

> выхода 5.3 Flash
Что опять? Это ты про дипкок или очередная 666б модель вышла?
Аноним 31/08/26 Пнд 13:15:41 1691825 432
>>1691823
>очередная 666б модель вышла?
да нет, всего 321бля
Аноним 31/08/26 Пнд 13:17:46 1691827 433
>>1691825
Или ссылка будет у меня на столе. Или я нихуя не сделаю и буду ныть.
Пойду гуглить, что за флеш такой, заинтриговал.
Аноним 31/08/26 Пнд 13:18:30 1691829 434
>>1691827
Просохни для начала, потом тред почитай, а потом уже продолжай свою хуйню нести. Типичный скуф которому и Минимакс норм
Аноним 31/08/26 Пнд 13:21:40 1691830 435
IMG5220.png 673Кб, 1280x720
1280x720
>>1691829
>минимакс норм
Да норм. Я бы даже сказал охуенная моделька. Ну а на визг неосиляторов похуй.

Ем и добавки хочу. Минимими мой, минимими…
Аноним 31/08/26 Пнд 13:25:39 1691836 436
>>1691822
Я могу точно сказать, что та приблуда с десятком MCIO портов будет нестабильна как минимум по посадке коннекторов.

MCIO кабели обычно жесткие, прилагают немало силы на порт. Мне всего двух коннекторов хватило чтобы взбеситься, они выскальзывали и выпадали несмотря на хлипкие защелки - а там их вон сколько понапихали и они будут под собственным весом и изгибом тянуть это все в разные стороны. Короче выглядит как сущий кошмар.
Аноним 31/08/26 Пнд 13:26:43 1691838 437
Минимакс был бы норм, если бы не срал рандомно китайскими словами. Я все сказал.
Аноним 31/08/26 Пнд 13:26:47 1691839 438
>>1691830
>запускает лоботомитоквант iq4xs m2.7 в лучшем случае
>архитектура m2.7 отвратительно работает на жоре из-за каста дататипов
>модель еще больше пускает слюни, забивает хуй на карточку и пишет что хочет
>"на визг неосиляторов похуй."
А воз и ныне там. Больше лучше хыхы. Тупые уебаны продолжают бежать за количеством параметров, а остальные неосиляторы
Аноним 31/08/26 Пнд 13:29:39 1691844 439
>>1691838
Это происходит по описанным выше причинам. Там Q5 кванты на уровне Q2 квантов Глм 4.5, по kld, ppl и прочим метрикам вроде top p совпадений. Это так, пример. На деле это одна из самых худших имплементаций архитектур в Жоре
Аноним 31/08/26 Пнд 13:31:18 1691847 440
А у эира вообще есть проблемы кроме хуевого следованиям инструкциям и того что он тупой по сегодняшним меркам?
Аноним 31/08/26 Пнд 13:32:28 1691849 441
>>1691844
Так минимакс даже через официальный API срет китайскими словами, как глм 5.3 срет английскими тоже через оф. сайт (хз насколько он там лоботомированный), в общем беда какая-то с этими новыми МоЕ.
Аноним 31/08/26 Пнд 13:36:53 1691853 442
>>1691839
Нахуя запускать минимими на жоре? Ты сам выбрал нище кванты, да на кривом беке.
Воистину желание некоторых тредовичков жрать говно мне не понятно. Уж за 2года в треде, собрать пеку для локального инфиренса можно, а не ныть на низкие кванты, если уже убедился что они не работоспособны. У вас блять все для этого было. Кучи возможностей. От стака мишек, тесел, вольт, до расшитых жоп 4080/4090, где за 150к можно было о мазаться минимум 36гб ВРАМ на GDDR6.

Ленился, тупил, не собирал- никто кроме тебя не виноват.
Аноним 31/08/26 Пнд 13:39:18 1691857 443
>>1691853
Все замечательно и по делу, но с одним нюансом: где сказано что я запускаю Минимакс на Жоре?
Аноним 31/08/26 Пнд 13:40:44 1691860 444
>>1691857
> отвратительно работает на жоре из-за каста дататипов
Из текста.
Аноним 31/08/26 Пнд 13:41:44 1691862 445
image.png 23Кб, 434x512
434x512
>>1691836
>они выскальзывали и выпадали несмотря на хлипкие защелки
Кстати, не абы как, а именно вбок. Я не знаю что за выродки придумали этот порт, древние молексы на это смотрят и со смеху помирают.
Аноним 31/08/26 Пнд 13:43:27 1691865 446
>>1691860
Я Жорой не пользуюсь уже больше года. Это не мешает мне знать о его проблемах. Сорян что подорвал твое очко, попробуй в следующий раз меньше слюней пускать в тред и меньше агрессировать. Был адекватный разговор, челы обсуждали проблемы модели, но ты не мог не выйти не похвастаться своим лоботомитоквантом лоботомита на лоботомитобекенде. ГИГА, братик
Аноним 31/08/26 Пнд 13:43:28 1691866 447
1647205835071.png 961Кб, 1200x1078
1200x1078
Аноним 31/08/26 Пнд 13:47:55 1691871 448
>>1691865
> Сорян что подорвал твое очко
Горишь здесь только ты, доказывая мне что минимими плохая модель, ведь у тебя с ней возникли проблемы. Начав уводить разговор с начальной темы. Я, честно не знаю, где тебя трогал минимакс но твой хейт абсолютно алогичен. .

> но ты не мог не выйти не похвастаться своим лоботомитоквантом лоботомита на лоботомитобекенде

Лол. О чем и речь, о чем и речь. Вообще не горит.
Аноним 31/08/26 Пнд 13:48:03 1691872 449
image 100Кб, 2152x742
2152x742
image 109Кб, 882x469
882x469
Ух, какая же годнота, заменил 1050 на вторую 3060 12gb, обновил драйверки, Qwen 3.8 27b стал летать на 34 т/c, префилл на 522 т/c.
Аноним 31/08/26 Пнд 13:49:06 1691874 450
>>1691872
Какой квант катаешь? IQ4XS? Вроде свитспот для 24
Аноним 31/08/26 Пнд 13:49:29 1691875 451
>>1691862
Ты еще вспомни порт у печ5090. Просто накинуть меди выбор слабаков, мы на пределе кабеля и коннекторов хуйнем ток. NVIDIA издевается, не иначе.
Аноним 31/08/26 Пнд 13:50:01 1691878 452
>>1691866
содомит блять

>>1691875
Падажжи, MCIO выдумал Хуанг?
Аноним 31/08/26 Пнд 13:51:52 1691880 453
>>1691872
Нормально. Почем карту урвал?
Аноним 31/08/26 Пнд 13:54:15 1691881 454
>>1691878
>MCIO
Я про 12V 2x6 который. Там меди минимум. Контакт прерывается если её сдвинуть в бок и карта делает фейерверк. Ну это если сильно не повезет. А так обычно просто порт выгорает.
Аноним 31/08/26 Пнд 13:56:23 1691883 455
>>1691881
Ну этот порт вроде неплохо живет на карточках классом нниже 5090й.
Аноним 31/08/26 Пнд 13:56:34 1691884 456
>>1691871
Да, очень завидую твоему сломанному инференсу на сломанном кванте. Похоже ты уже все мозги пропил. Реально заметил, у чрезвычайно тупых людей вокруг все либо завистники, либо проплаченные
Аноним 31/08/26 Пнд 13:57:52 1691885 457
>>1691880
За 25500 рублей с доставкой, первую тоже по такой же цене. Обе с 3мя вентиляторами, что охуенно.
Аноним 31/08/26 Пнд 13:59:39 1691887 458
>>1691884
>Реально заметил, у чрезвычайно тупых людей вокруг все либо завистники, либо проплаченные
иногда это правда два года херачил контент в треде игрульки, и кое-кто из местных писал, что я проплатка - и он был прав, я получал ништячки с лопаты в игре за соцработу
>>1691885
Дороговато, конечно, но если состояние годное, то и не жалко.
Аноним 31/08/26 Пнд 14:01:49 1691889 459
>>1691670
Материалов на русском меньше в разы просто
Он нахуй никому не сдался
Сравни число научных статей (и журналов) на англ-франц-немц и на русском
Сравни число всяких мануалов к станкам на немецком и русском
А поэзия серебряного века нахуй идет - стишками пушкина ЧПУ не закодишь
Вдобавок русик - один из самых сложных языков, на одном уровне с польским - даже в сравнении с упрощенным китайским.
Уже приносили не раз ресерч, обнаруживший что нейронки четче всего следуют инструкциям на польском и русском - потому что падежи-род и прочая хуета уточняют семантику. Но по факту язык нахуй не нужен в мире раз материалов на нем мало - а значит нейронкам тоже плохо знаком
Аноним 31/08/26 Пнд 14:04:16 1691894 460
>>1691649
>Каждая модель со своей жижей загружается, а все юзерские настройки сводятся к системному промпту и семплеру
Я все модели запускаю с явно заданными жижами из файлов - даже если это скачанные официальные ванильки

И модифицирую жижу довольно сильно - в первую очередь в плане ризонинга
Аноним 31/08/26 Пнд 14:04:49 1691896 461
image 100Кб, 2137x714
2137x714
image 107Кб, 849x468
849x468
>>1691887
>Дороговато, конечно, но если состояние годное, то и не жалко.
Я просто живу, где дешевле нет. Состояние топовое, ни одной пылинки на них не было.

>>1691874
На том скрине был IQ3_S без тензора. Сейчас вот запустил IQ4_XS в тензоре, похоже и правда свит спот, со 100к Q8 контекста. Скорость уже до 46-53 т/с поднялась, как и температура на верхней до 86C. Видимо потому что в верхнюю горячий воздух от нижней залетает, они бутербродом друг над другом.
Аноним 31/08/26 Пнд 14:05:33 1691898 462
>>1691788
>Докачал квенчанского Q8 3.8 next
>Не ну русек наконец-то моё увожение
>И нет такого тупяка как с 5.3 / 5.3 флэшем в плане англоязычных словечек и путаницы слов-идей.
>
>Пока ни разу не видел чтобы модель пустила жидкого по штанине, как это 3.8 27B делает.
>
>Гоняю дальше.
Впечатления средненькие. Модель держит контекст, но какая-то безучастная, словно ей башку отбили. Нет увлечения, нет страсти к общению. Русский язык хоть и лучше чем 27B, но местами корявенький. Вердикт - модель фригидная сука для кодеров ИЛИ идеальный чатбот под карточку kuudere аутистки.
Аноним 31/08/26 Пнд 14:06:20 1691899 463
>>1691896
В IQ4_XS все 150к лезут, Q8 контекст. Винда. Подтяни там настройки, всё будет. Хотя может у тебя там не pure IQ4_XS квант, т.е. где-нибудь подтянули Q5, Q6 слои. Я использую схему квантования от mradermacher, она имхо самая сбалансированная для Квена
Аноним 31/08/26 Пнд 14:08:35 1691901 464
image.png 142Кб, 720x720
720x720
>>1691896
>бутербродом
>86 градусов
Если там совсем места нет между ними, рекомендую вынести карточку на сторону. Райзеров полно, лапшу такую найди и повесь карточку хоть на место под радиатор водянки, если есть.
Аноним 31/08/26 Пнд 14:17:32 1691905 465
>>1691896
> IQ4_XS
> Qwen 3.8 27b
Зачем?
Аноним 31/08/26 Пнд 14:18:37 1691906 466
>>1691905
В 24 гига квант больше не влезет, если нужно хотя бы 100к контекста. А это нужно
Аноним 31/08/26 Пнд 14:20:37 1691907 467
>>1691906
У меня Q4KM от bartowski влезает с 98304 контекста и 2048/512 батчем, НО это без .mmproj файла. Там небольшая утечка в shared memory получается, однако скорость не падает. Впрочем, это на одной 3090.
Аноним 31/08/26 Пнд 14:22:08 1691910 468
>>1691907
Линух? Вообще 100к это прям тяжело. У него один только ризонинг все 60к может скушать
Аноним 31/08/26 Пнд 14:23:03 1691912 469
>>1691906
Я про задачи для лоботомита.
Аноним 31/08/26 Пнд 14:23:56 1691914 470
>>1691907
У меня примерно так и было. Q4KM Батрухи без MTP, около 100к. В итоге перебрался на IQ4_XS того же Батрухи, но с MTP и 160к контекста. Скорость выросла вдвое, с 35 до 70, иногда даже 80 токенов. Имхо, так все же лучше. И то и то лоботомит, тут хоть побыстрее и побольше контекста
Мимо
Аноним 31/08/26 Пнд 14:24:38 1691918 471
>>1691912
Как агент вполне может делать сайд фичи для проекта, дебажить, рефакторить, бойлерплейты строить, да много что
Аноним 31/08/26 Пнд 14:25:05 1691919 472
image.png 59Кб, 739x721
739x721
image.png 55Кб, 931x359
931x359
>>1691910
не, винда
вот специально загрузил в заполненном чате

> ризонинг все 60к может скушать
А с каких пор ризонинг за контекст считается? Или там шизохрень с preserve thinking? Разве она тоже лезет в учет контекста?
Аноним 31/08/26 Пнд 14:25:15 1691921 473
>>1691901
Все проще оказалось, надо было на карте, которая выше в бутере, выставить Power Target в ноль, температуры сразу дропнулись в 67C на верхней и 51C на нижней при полной загрузке, вольтов стали потреблять по 99W. Скорость немного просела на 5 t/s, что в общем не очень заметно.
Аноним 31/08/26 Пнд 14:26:15 1691922 474
>>1691921
А в ноль-то зачем. Думаю ты потерял бы < 1 t/s где-то на 65%

Например для 3090 самое оптимальное это 65.
Аноним 31/08/26 Пнд 14:27:22 1691923 475
>>1691919
>лмстудия
Эх. По поводу preserve thinking - во первых да, можно ее использовать и вроде по дефолту включено, а во вторых, даже если его нет, это мало. Скажем у тебя уже 60к контекста заполнено. Перед Квеном сложная задача. В итоге чтобы ее решить ему надо еще 60к, а у тебя только 40 свободно. Он либо скинет задачу и будет рероллить, либо суммарайз
Аноним 31/08/26 Пнд 14:30:02 1691926 476
>>1691923
Ну тут можно только одно сказать - впендюривай третью 3060, будет тебе больше контекста
Аноним 31/08/26 Пнд 14:32:16 1691928 477
>>1691926
А че я, мне 150к хватает на IQ4_XS. Он не сильно хуже, чем Q4KM, пропасти между ними нет. А дальше это уж переезжать на Дипсик Флеш, так то я и его могу катать, но там скорость совсем печальная. Где-то 10 токенов генерация, 300 обработка.
Аноним 31/08/26 Пнд 14:40:01 1691937 478
>>1691922
Так 65 это и есть в ноль на 3060. На 69 пробовал, тогда температура на 83 и вентиляторы шумят.
Аноним 31/08/26 Пнд 15:33:15 1691976 479
>>1691629
Через nvidia smi смотри, диспетчер задач хуйня
Аноним 31/08/26 Пнд 15:48:05 1691985 480
1788180379271.png 572Кб, 1080x1096
1080x1096
Ало, у нас конечная.
До этого и так был один код в датасетах, теперь вообще никто из чайны и слова про рп не напишет о своих моделях, весь кум целенаправленно станут вырезать, чтобы осталась только бездушная кодерская машина с единственной функцией.
Аноним 31/08/26 Пнд 15:51:59 1691988 481
>>1691985
>declining birth rates
Лол, там типа недавно не было буквально КОНТРОЛЯ ПОПУЛЯЦИИ, нахуя китайцам рождаемость опять? Наоборот должны были заменить постепенно всех людей на нейрослоп и пановать на технологиях.
Аноним 31/08/26 Пнд 15:55:09 1691990 482
>>1691988
>нахуя китайцам рождаемость опять?

Они настолько круто плодячку уничтожили своим "одна семья один ребенок" что нынешние кривые показывают что они сотнями миллионов вымирать будут уже в ближайшее время.

Так что всё, останется дрочить только на гемму и музю. А потом и европейцы запретят под нажимом феменисток. Про Россию и говорит нечего.
Аноним 31/08/26 Пнд 16:00:19 1691997 483
>>1691985
> аня
Иронично, машк скоро тоже ее отключит.
Аноним 31/08/26 Пнд 16:02:28 1692001 484
>>1691990
>Они настолько круто плодячку уничтожили
Это общая проблема, китайцы своими кривыми действиями почти ничего не добавили к ней, лол.
>>1691990
>гемму ... А потом и европейцы запретят
Так гемма же американская, какие проблемы?
Аноним 31/08/26 Пнд 16:05:23 1692002 485
Решил почитать последние коммиты в жоре. Огромная часть - это шаманинг вебГПУ. Какого, сука, хера? Вот нахера это в жопе? Или хозяева из хугинфейса сказали ему пилить это говно?
Аноним 31/08/26 Пнд 16:07:15 1692004 486
>>1691216
3060 же не потянет, слишком мало видеопамяти
Аноним 31/08/26 Пнд 16:10:36 1692005 487
Попробовал hy4. Пишет хорошо, хоть и немного своеобразно. Русский хороший, иногда проскальзывают кривые окончания или английские/китайские символы в середине слова, но редко. Хороший русский в карточке ещё сильнее снижает вероятность их появления. Из странного стремление тянок дать пососать свою ваджайну (а иногда и МПХ если ризонинг отключить) как будто его большой мистраль покусал. Цензуры нет вообще. Одна проблема, ризонинг ппц большой. В max ~8к токенов, в low ~4к. Если отключить ризонинг, то тупеет
Аноним 31/08/26 Пнд 16:13:57 1692009 488
Аноним 31/08/26 Пнд 16:25:44 1692014 489
>>1692001
>Так гемма же американская, какие проблемы?
Ради европейского рынка могут прогнуться. Впрочем, гемма бесплатная, могут просто запретить скачивать с ЕС и хуй положить. Но датасеты-то все равно одни с гемини, а гемини им придется адаптировать.
Аноним 31/08/26 Пнд 16:40:04 1692025 490
Сап.
Делал кто подключение к Таверне с телефона? Типа таверна на компе, а я с телефоном на работе кумлю, запершись в толчке.
Планирую делать через VPS. Минусы? Кто то тут так делал?
Аноним 31/08/26 Пнд 16:47:11 1692034 491
>>1692025
Обсуждалось. Основная проблема баны vpn
Аноним 31/08/26 Пнд 16:51:28 1692036 492
>>1692034
Где?
Ну вот тот что я себе купил сейчас работает.
Как сделать так чтобы мои чатики не утекли в сеть?
Аноним 31/08/26 Пнд 17:02:45 1692043 493
>>1692009
Подожду квантов от братухи. Может эта версия будет не такой сухой и соевой как 0731, но надежд мало.
Аноним 31/08/26 Пнд 17:18:27 1692050 494
>>1692005
>иногда проскальзывают кривые окончания или английские/китайские символы в середине слова, но редко
Hy3 без ризонинга - страдал этим вплоть до Q6.

>Если отключить ризонинг, то тупеет
Как и Hy3...

Ты какой из квантов пробовал? Мелкий или 4-битный?
Аноним 31/08/26 Пнд 17:21:03 1692052 495
Аноним 31/08/26 Пнд 17:38:48 1692064 496
База для треда стала 256 рам.
Модели начинаются от 280б.
Что делать будем?
Аноним 31/08/26 Пнд 17:40:58 1692065 497
>>1692064
>Что делать будем?
Довольно урчать на квен некст.
Аноним 31/08/26 Пнд 17:44:32 1692070 498
>>1692052
Хуевенько, значит. Ну хоть теперь известно, что качать эту какулю не стоит.
Когда ж наконец гугл просрется с большой МоЕхой. Все эти китаекаличи отъедут.
Аноним 31/08/26 Пнд 17:44:45 1692071 499
>>1692065
> квен некст
Они немножко перепутали, надо было добавить 4б активных, чтобы было 14б, а не убавить, чтобы был 6б лоботомит.
Аноним 31/08/26 Пнд 17:47:28 1692072 500
>>1692071
Да он и не лоботомит. Он аутист.
Аноним 31/08/26 Пнд 17:50:56 1692074 501
>>1692070
> Когда ж наконец гугл просрется с большой МоЕхой.
Когда закончит её соефикацию и даст ей 3б активных чтобы было приятно и быстро кодить!
Аноним 31/08/26 Пнд 17:57:04 1692075 502
>>1692064
А прорыва по стилю письма со времен мистраля 24б до сих пор нет...

Проще уж мистраль на ризонинг обучить, чтоб мозгов прибавилось, чем ждать очередного прихода чуда.
Аноним 31/08/26 Пнд 18:00:03 1692077 503
>>1692075
А ты поищи, может и есть такие. Милфу мистраль точно пробовали дообучать, там даже несколько тюнов с ризонингом было, как я помню
ПЕРЕКАТ Аноним # OP 31/08/26 Пнд 18:12:19 1692082 504
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов