Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 433 96 68
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №260 /llama/ Аноним 26/08/26 Срд 12:45:48 1687604 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение.png 1193Кб, 918x1269
918x1269
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1684266 (OP)
>>1681448 (OP)
Аноним 26/08/26 Срд 12:50:57 1687609 2
>>1687604 (OP)
> TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
> • Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai
По возможностям самый неудобный и ограниченный говняк - как раз ТекстГенШлакУИ, единственный плюс что можно EXL3 запустить. В остальном это безнадежно халтурная подзалупа ниже кобольда и лмстудии, разве что оллама еще жиже этого.
Аноним 26/08/26 Срд 12:54:29 1687613 3
Так я непон квен некст енграмы 51б входят в 120б основы или это доп параметры?
Аноним 26/08/26 Срд 13:12:11 1687625 4
image.png 1148Кб, 1812x1900
1812x1900
>>1687613
Входят, но модель все равно остается 125В-А6В лоботомитом, просто памяти нужно как на 176В.
Аноним 26/08/26 Срд 13:15:15 1687627 5
>>1687570 →
Может ему плохо от прошлого не-своего синкинга, который для него странный? Не сталкивался, но теоретически может неверно воспринять паттерны и следовать им сильнее остального. Если запускаешь его в лламе то это тоже сильно наложится.
>>1687625
> А6В
Это прискорбно.
Аноним 26/08/26 Срд 13:18:10 1687629 6
image.png 907Кб, 1200x1200
1200x1200
ВСЕ ЖДАЛИ НОВЫЙ АИР ИЛИ ГЕММУ 120В С 20+ АКТИВНЫХ
@
ВЫХОДИТ КВЕН 125В
@
РАЗМЕРОМ КАК 176В
@
С 6В АКТИВНЫХ
Аноним 26/08/26 Срд 13:19:05 1687630 7
sph1.jpg 127Кб, 526x524
526x524
Аноним 26/08/26 Срд 13:20:18 1687631 8
>>1687629
Ну вроде глм 5.3 для рамлетов скоро анонсируют.
Только он может оказаться еще меньше квена
Аноним 26/08/26 Срд 13:21:33 1687634 9
>>1687629
У тебя там н-грам таблица для знаний сделана, чтоб компенсировать мелкие эксперты. 20В активных при 100В модели - это бред.
Аноним 26/08/26 Срд 13:22:10 1687635 10
>>1687625
А на диск энграмы нельзя оффлоадить? Как они вообще там работают?
Аноним 26/08/26 Срд 13:23:08 1687638 11
>>1687629
Я уже прикупил дофига обычной DDR4 памяти, так что жду с предвкушением. 4 часа осталось. Ух сегодня вечером позапускаем.
Аноним 26/08/26 Срд 13:24:34 1687640 12
>>1687634
>20В активных при 100В модели - это бред
А 27В активных при 27В модели не бред, шиз?
Аноним 26/08/26 Срд 13:24:47 1687641 13
>>1687638
Надеюсь 4 канала хотя бы
Аноним 26/08/26 Срд 13:24:54 1687642 14
>>1687638
>Ух сегодня вечером позапускаем.
Кто-нибудь, расскажите ему, что на поддержку в лламу могут уйти МЕСЯЦЫ...
Аноним 26/08/26 Срд 13:25:24 1687644 15
>>1687629
20+ активных тянет только у владельцев ригов, и то в кванте херовом.
А тут будет потенциально Q8 у всех тянуть.
Аноним 26/08/26 Срд 13:26:28 1687646 16
>>1687640
Так и бери плотную, если не нравится МоЕ.
Аноним 26/08/26 Срд 13:26:42 1687647 17
>>1687642
Да бред, какой нибудь форк ламы где оно работает уже к утру появится. Останется только скомпилить его.
Аноним 26/08/26 Срд 13:26:50 1687649 18
>>1687642
Не, Алибаба очевидно вложился в ламу, так что у квена3.8 поддержка была прямо в момент релиза + анслопы сразу выкатили сломанные кванты.
Аноним 26/08/26 Срд 13:26:55 1687650 19
>>1687642
> Qwen 3.8 Flash Next day 0 support from unsloth
Если у них запускается, значит и в лламе запускается, ведь unsloth studio на базе лламацпп
Аноним 26/08/26 Срд 13:27:48 1687652 20
Аноним 26/08/26 Срд 13:28:25 1687654 21
>>1687650
Ну, можешь Inkling Small запустить на лламе.
Аноним 26/08/26 Срд 13:29:14 1687655 22
>>1687644
>20+ активных тянет только у владельцев ригов
Каких ригов блядь.
Тянет у всех, у кого тянет плотная 20+.
Аноним 26/08/26 Срд 13:29:41 1687656 23
>>1687654
Именно в unsloth studio и запускал, и даже скрины тестовых чатов в тред кидал.
>>1687652
> This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities
Это буквально тот же самый дипсреньк, только с вижном. Никаких улучшений.
Аноним 26/08/26 Срд 13:30:43 1687658 24
>>1687652
> спаситель
Для олигархов с кучей памяти. Когда 100-120б модель будет, тогда и спасение.
Аноним 26/08/26 Срд 13:31:32 1687660 25
>>1687652
Этого спасителя специально для API сделали.
Аноним 26/08/26 Срд 13:35:40 1687663 26
>>1687646
У нее знаний хуй да нихуя. Общие параметры определяют знания, активные - ум и аналитику.
Потому идеальная модель - это 300 параметров + 30+ активных.Лол, GLM 4.5-4.7 описал
Аноним 26/08/26 Срд 13:36:28 1687665 27
Кароч, последние несколько дней жоска запускал все эрпэ модельки на своих 3090х2 и 128 ддр5. Реально потестил вообще всё, что можно запустить. Даже старьё, начиная с начала 2025 года. Раньше был заядлым любителем Эйра, но сейчас вынужден признать что даже Q6 геммы ему не оставляет и шанса. Как ни странно из старых моделей Мистрали 24б порадовали естеством диалога и прозы, но там дохуя репетишена и графоманских описаний. Квены сухие, все до 235, 235 уголёк, фановый для чего-то лайтового, но не более. Квен 3.5 27 няша нереальная и может в рп, но не может в кум. 3.8 зашёл меньше в рп. Глм Эйр не следует инструкциям и навязывает свои характеры персонажам, например младшие сестрички часто становятся наглыми повелительницами, и так во всём. Всякие СтепФлеши, Мотифы, Ху3, Минимаксы2.5-2.7 пишут очень схоже и оверфитнуты на драматичном слопе, хуёво управляются и сводят все к какой-то дешёвой драме. Дипсик возможно из-за Жоры, но тупо неюзабелен для рп, пишет на уровне Мистралей почти, разве что слопа меньше чуть. Плотные всякие Граниты и прочее перформят однозначно хуже Геммы и Квена, Муся кстати неплохая, но если готовы смириться с чтением мыслей и нарратива персонажам, типо слишком буквальная моделька. Вот собственно и всё. По итогу со всеми её недостатками Гемма для меня вин. Оч рекомендую конкретно вот этот тюн, https://huggingface.co/nbeerbower/Gemma4-Gutenberg-31B
Его вроде в тред не приносили, там всё обучено на public domain литературе, написанной человеками. Пишет естественнее, менее ассистентно чем инстракт. Можно и инстракт пердолить, но меня заебал тамошний слоп. А и ещё, буквально нет модели которая держит контекст лучше Геммы, кроме Квенов. Все модели 2025 разваливаются в лучшем случае на 16к
Аноним 26/08/26 Срд 13:38:05 1687667 28
>>1687656
Он прекрасен с апдейта, вижн был главным камнем преткновения.
>>1687660
Обычно они веса выкладывают после первых тестов. И это значит что следующие модели будут с вижном.
Аноним 26/08/26 Срд 13:40:30 1687670 29
>>1687665
>Дипсик возможно из-за Жоры, но тупо неюзабелен для рп, пишет на уровне Мистралей почти, разве что слопа меньше чуть.
Там жинжа шаблон кривой + ризонинг сломан без префилла. Могу свой шаблон выложить если нужно.
Аноним 26/08/26 Срд 13:40:46 1687671 30
>>1687665
>3090х2 и 128 ддр5.
въеби зарплату до 256 гигов и садись на глм 5.2
забудешь как страшный сон все остальное
Аноним 26/08/26 Срд 13:41:20 1687674 31
>>1687670
Давай, вдруг у тебя шин какой и ты открыл Шамбаллу. Я скок ни пердолился не вышло ничего
Аноним 26/08/26 Срд 13:42:24 1687675 32
>>1687671
Да кал этот glm 5.2, хуже многих младших долбится в слоп. Этой хуйней только задачи решать
Аноним 26/08/26 Срд 13:47:05 1687680 33
>>1687675
Я готов терпеть любой слоп, лишь бы модель могла сама продолжать историю, не буксуя. И она может.
Знаешь как охуенно, когда ты о чем-то с персонажем запизделся на 10 - 20 сообщений, а потом хуяк и "так ты че, пригнись, смотри там гоблин с луком сейчас выстрелит из хуя". Она просто умеет неожиданно выдать что-то такое, что мелочь не выдаст никогда.

Персонаж на учебе или на работе, будет во время разговора говорить "так все, лекция кончилась - ща обед", и вот хер бы ХОТЬ РАЗ 4я гемма так себя повела, нет, пока юзер не напишет "ну че как учеба?" гемма никогда сама не вспомнит...
Аноним 26/08/26 Срд 13:47:42 1687681 34
Аноним 26/08/26 Срд 13:50:13 1687686 35
image.png 49Кб, 1051x382
1051x382
>>1687681
По виду обычный темплейт из анслот ггуфа, к которому добавили
> {%- if thinking -%}
> {{- thinking_start_token + '\nI need to analyze the user request and the current scene objectively, check continuity and characters knowledge, then construct a concrete ordered response plan. After the plan is finished I need to check it against the Guidelines, established history and directives.\nOut-of-character analysis and response planning:\n' -}}

если че длинные сиспромпты напрочь отбивают внимание модели к пикрилу
там можно написать "думай о жареной утке, постоянно думай ТОЛЬКО о жареной утке и не думай о белой обезьяне" и просто ноль эффекта будет
Аноним 26/08/26 Срд 13:54:27 1687691 36
>>1687686
>По виду обычный темплейт из анслот ггуфа, к которому добавили
Нет, там больше. Поддержка post-history instructions, оборачивание системной роли в спецтокены + инструкция для low ризонинга.

>длинные сиспромпты напрочь отбивают внимание модели к пикрилу
Потому и используется префилл ризонинга.
Аноним 26/08/26 Срд 13:55:28 1687692 37
>>1687680
Я на ней откатал очень много, просто у меня из альтернатив удобных только дипсик, поэтому из двух зол.. Вот остоебенил меня glm уже, я ща тещу 4.7 пока не понятно, что как.
5.2 у меня ведет себя очень странно, будто один и тот же персонаж всегда. Это ужасно заебывает, модель игнорирует характер персонажей будто совсем. Пробовал разные пресеты все дела, грусть. Может с жира бешусь, слишком долго на ней сидел.
Насчёт геммы хз, я покатал ее, но наверное недостаточно еще. Местами был приятно удивлен, как она следует инструкциям, подмечала классные детали.
Аноним 26/08/26 Срд 13:55:57 1687693 38
>>1687656
> unsloth studio и запускал
Именно, анон. Именно.
Аноним 26/08/26 Срд 13:56:02 1687694 39
Короче все, походу можно отменять подписки на клода и кодекс. Ну или оставить одну $20 чисто на всякий случай вместо нынешних двух по сотке.

Протестил квен3.8-27b-q4_M на реальных рабочих задачах: бэк на ноде, бэк на фастапи, фронты на vue и реакте, задачи разной сложности от добавить кнопку до захуярить целый микросервис, всякие дашборды, миграции постгреса, он тянет даже работу со специфичными российскими нюансами типо ГОСТ-TLS и эцп. Пошел в интернет, нашел форум каких-то шизов с постами про эти ебучие эцп 8 летней давности и просто сделал это. Причем я специально делал две имплементации через локального квена и через фронтир и просил второй фронтир независимо отревьюить и сравнить оба пулл реквеста, квеновские варианты были найдены ничем не уступающими.
Аноним 26/08/26 Срд 13:57:28 1687697 40
>>1687694
Какой технический стек используешь? Ламу + opencode?
Аноним 26/08/26 Срд 14:00:17 1687701 41
>>1687692
>, будто один и тот же персонаж всегда.
Четко въезжаю, о чем ты. Условия ставит, границы проводит, соглашается через противопоставления - НЕТ, НЕ ДАМ... ну может на полшишечки... но ты не пизди особо об этом.

Скорее всего дело в рефьюзах. Лоботомия скорее всего подлечит и сделает модель более раскрепощенной.

Ваще это очень схоже с R1 дипсиком, например. Они все когда достаточно большие - начинают так себя вести.
Аноним 26/08/26 Срд 14:03:52 1687705 42
Аноним 26/08/26 Срд 14:04:47 1687707 43
image.png 356Кб, 686x386
686x386
бля

У меня одного GPU начинают издавать звуки дымного монстра из сериала LOST, когда текст генерит 3.8 квен?

такое ритмичное частое трещание

И нет, они так дросселями не свистят с другими моделями. 31б гемма - совсем иначе звучит, шум больше высокочастотный и без треска
Аноним 26/08/26 Срд 14:06:13 1687708 44
>>1687697
Llama.cpp и opencode. Я еще тестил pi coding agent, который невероятно хайпят на реддите в любом обсуждении квена, но в итоге отказался от него, потому что квен через pi в упор не находил один критический баг в фронтэнде даже за несколько попыток, который не ловился тестами, но был виден визуально если просто запустить браузер. Фронтир и квен через опенкод его находили каждый раз, потому что опенкод запускал фронт в фоновом браузере, делал скриншот и видел там пиздец, а вот pi это не додумался сделать.
Аноним 26/08/26 Срд 14:07:04 1687711 45
Аноним 26/08/26 Срд 14:08:12 1687713 46
>>1687708
> а вот pi это не додумался сделать.
Так у pi по дефолту и инструментов для этого нет, он в стоке умеет только читать/писать файлы и баш выполнять. Или ты расширения накатывал?
Аноним 26/08/26 Срд 14:11:19 1687717 47
>>1687713
Картинки он читает. Но по дефолту он браузер не запустит и не заскринит, мышкой не пошевелить, базером не пукнет, это да.
Аноним 26/08/26 Срд 14:15:19 1687724 48
Аноним 26/08/26 Срд 14:15:47 1687725 49
>>1687717
> Картинки он читает
Ну понятное дело, но компьютер юз это уже отдельный инструмент, как и скриншоты.
Аноним 26/08/26 Срд 14:17:29 1687728 50
>>1687724
>упоролся в миксы Скотомы
Я тестил Scotoma 2, показалось хорошей для коротких ответов в стиле разговорного чата, но у нее как будто снижена возможность взять инициативу на себя. А вот первая версия была без преимуществ.

мимо другой чел
Аноним 26/08/26 Срд 14:17:56 1687730 51
>>1687717
>Картинки он читает. Но по дефолту он браузер не запустит и не заскринит, мышкой не пошевелить, базером не пукнет, это да.
Раньше-то написать для pi расширение сложнее было. А сейчас, да с новым Квеном - любое, только скажи. Особенно если кодер - стыдно пользоваться не своим инструментом-то.
Аноним 26/08/26 Срд 14:19:02 1687731 52
Аноним 26/08/26 Срд 14:19:09 1687732 53
>>1687724
>>1687705
Это мердж. Сами по себе Musica и Garnet v2 из которых он состоит прям ну такие себе. Хз почему сам Версипелис будет лучше. Я его не тестил, тестил только тюны
Аноним 26/08/26 Срд 14:21:10 1687734 54
>>1687707
Скорее это БП. В целом норма, в вллм уже страшно.
Каждый щелчок это токен
Аноним 26/08/26 Срд 14:23:21 1687736 55
>>1687730
> Раньше-то написать для pi расширение сложнее было.
У меня проблема в том, что мне в любом случае надо достаточно знать тс, чтобы валидировать, что оно нормально написано. Чтобы спустя 2 недели пользования не было прикольчиков.
Мне проще либо мини-све-агент юзать, либо тау. Так как боярон я очень хорошо знаю, и могу просто из головы навайбкодить нормальное расширение на приличном уровне.
Аноним 26/08/26 Срд 14:24:09 1687738 56
image.png 99Кб, 1596x799
1596x799
Эир сегодня. Глм 5.3 сегодня.
Аноним 26/08/26 Срд 14:24:43 1687740 57
А бенчи нового квена то хоть есть что все его так ожидают? Может он хуже 27b
Аноним 26/08/26 Срд 14:26:38 1687744 58
image.png 865Кб, 1261x822
1261x822
>>1687734
БП новый и работает как зверь с цифровой самодиагностикой. Нагрузку держит хорошо и вообще там даже 60% от его возможностей не отжирается, ведь карточки с ограниченным паверлимитом и в андервольте. Реально щелкает на токенах один квеныч и все, я даже из любопытства всяких мистралей схожего размера накачал - тишина, лишь едва заметный свист (как эти карточки и с другими БП свистели чутка).
Аноним 26/08/26 Срд 14:30:17 1687748 59
>>1687738

Да хуй там, 6В лоботомита получим и всё. ГЛМ 5.3 может и выкатят, да только что толку с 1Т модели?
Аноним 26/08/26 Срд 14:31:25 1687749 60
Поясните за vllm, зачем о нем тут так часто говорят? Кланкер говорит что он нужен для запуска ллм на серверах, в случае если нейронкой пользуется огромное количество пользователей, а если ты соло работаешь то оно нахуй не нужно. Он пиздит?
Аноним 26/08/26 Срд 14:31:41 1687750 61
>>1687740
Скорее всего будет на уровне 27В, как 3.5 122В был на уровне 3.5 27В. Но вот эмбендинги пока неясно вин или фейл.
Аноним 26/08/26 Срд 14:32:23 1687751 62
image.png 3Кб, 324x50
324x50
че реддитоиды такие тупые

глм 4.7 вдвое меньше 5.3, с хуя ли 5.3 флэш быть такому же как 4.7 флэш
Аноним 26/08/26 Срд 14:33:24 1687755 63
>>1687749
Неудобная линуксоидная залупа для тех, кому хочется попердолиться чтобы модель бегала побыстрее

Там где с Llama.cpp ты запускаешь ггуф за 10 секунд, эта гниль будет 5 минут стартовать и разогреваться
Аноним 26/08/26 Срд 14:33:31 1687756 64
>>1687749
У тебя скорость в разы больше чем на жоре и можно сразу несколько свайпов делать параллельных
Аноним 26/08/26 Срд 14:34:05 1687757 65
>>1687749
>Поясните за vllm, зачем о нем тут так часто говорят?
Если у тебя есть много врам, то ты знаешь зачем. Если нет, то тебе это не нужно.
Аноним 26/08/26 Срд 14:34:36 1687758 66
>>1687749
Чисто под VRAM приблуда
Аноним 26/08/26 Срд 14:36:34 1687759 67
>>1687744
От пиздатости БП не зависит. Серверники платиновые трещат только в путь под вллм
Аноним 26/08/26 Срд 14:36:44 1687760 68
Скачал, потыкал немного Unsloth Desktop https://github.com/unslothai/unsloth

Кобольды и те кто на лмстудии сидят - обратите внимание. Оно внезапно неплохо. Кросиво, современно, похоже на студию, но опенсорс. Ставится экзешником на винду и есть appimage на пингвина. В отличии от студии - можно просто показать ей папку с моделями и она их оттуда подхватит, удобно. Вэбсёрч работает сразу из коробки. Может юзать тулколлы в песочнице. Есть поддержка ллмок, в которые не умеет ллама, вроде диффужн-геммы и инклинг. Настройки имеются, но может и в однокнопочном режиме запускать модели, для совсем хлебушков.

Короч анслот те еще васяны, но тут вроде нормально сделали... По сравнением с кобольдом просто на 10 голов выше.
Аноним 26/08/26 Срд 14:36:46 1687761 69
>>1687749
она хитро аллоцирует память и более быстро гоняет модели. но только под врам.
Аноним 26/08/26 Срд 14:40:21 1687762 70
>>1687760
У меня оно лагает как хуй знает что. Текст набираешь и окно чата тормозит.
Аноним 26/08/26 Срд 14:42:42 1687764 71
>>1687760
Это по сути интерфейс под ллама цпп или что? Если оно даст мне возможность юзать ллама сервер без костылей с созданием баш скриптов для запуска, то я бы накатил, чисто как интерфейс для чата оно не нужно
Аноним 26/08/26 Срд 14:45:19 1687767 72
А что если альфа это и есть glm 5.3, просто они с 40б активных перешли на 12б и поэтому могут компутить триллион токенов
Аноним 26/08/26 Срд 14:46:04 1687768 73
image.png 25Кб, 1291x235
1291x235
>>1687731
>china-s-z-ai-made-ox-alpha-stealth-model-that-rivals-deepseek

Это говно кстати сейчас нахаляву в opencode раздают.
Аноним 26/08/26 Срд 14:46:05 1687769 74
>>1687767
>просто они с 40б активных перешли на 12б
тогда модель отправляется в утиль нахуй
Аноним 26/08/26 Срд 14:47:39 1687770 75
>>1687764
Да, ллама с анслоповскими патчами на поддержку моделей и их гуем. Если запускал лмстудио - то это то же самое, но открытое.
Аноним 26/08/26 Срд 14:48:01 1687771 76
Где гемма 5...
Аноним 26/08/26 Срд 14:52:16 1687776 77
>>1687771
Им бы сначала свои закрытые модели подтянуть. Какая гемма 5, когда у них лучшая большая модель это 3.1 про?
Аноним 26/08/26 Срд 14:57:30 1687779 78
>>1687776
Так может на опенсорс перейдут наконец-то, раз за фронтиром не угоняются.
Аноним 26/08/26 Срд 15:00:57 1687783 79
>>1687779
Это гугл чел. Они могут в хвосте гонки сидеть спокойно до разрыва пузыря, а потом просто капитализироваться на рухнувших вчерашних фронтирах.
Аноним 26/08/26 Срд 15:02:11 1687785 80
image.png 328Кб, 1277x405
1277x405
А когда глм? Позже или раньше?
Аноним 26/08/26 Срд 15:02:44 1687786 81
>>1687731
Вангую выйдет 300б модель и мы утремся.
Аноним 26/08/26 Срд 15:03:30 1687787 82
>>1687663
>GLM 4.5-4.7 описал
Так и будет, старые 4.Х станут новым 5.Х флэшем (по параметрам).
Аноним 26/08/26 Срд 15:06:21 1687790 83
>>1687785
А кто тебе сказал что он опенсорс будет? GLM 5.3 есть в опенсорсе чтобы GLM 5.3 Flash появилась?
Аноним 26/08/26 Срд 15:08:44 1687791 84
>>1687790
Так 5.3 сегодня и выходит, але, а с ним и какая-то микрокакаха для нищих
Аноним 26/08/26 Срд 15:09:05 1687793 85
>>1687790
Заи и сказали, квеношиз.
Внезапно, чтобы опен сорсить модель не нужнен таймер и прочий дешевый пиар, люди вон сами разнюхали что это глм и сами вынудили рассказать
Аноним 26/08/26 Срд 15:10:26 1687797 86
>>1687771

Жди апреля 27 года. Они раз в год стабильно выпускают.
Аноним 26/08/26 Срд 15:13:05 1687800 87
>>1687797
Настолько стабильно что даже размер не меняют.
У нас в след году уже енграм на 100б бесплатки будут, а они всё свою 30б будут дрочить
Аноним 26/08/26 Срд 15:21:39 1687803 88
Знакомый перекуп говорит - заказывали CMP170HX, китайский селлер просто испарился и бросил свой аккаунт, чтобы не выполнять заказ. Бабки висели в воздухе (еще по старым ценам) пока платформа не вернула
Аноним 26/08/26 Срд 15:28:09 1687804 89
>>1687770
>с анслоповскими патчами
Там скорее всего тупо мерж уже лежащих тухнущих по три года в лламе ццп PRов
Аноним 26/08/26 Срд 15:38:16 1687811 90
изображение.png 47Кб, 1230x1091
1230x1091
Аноним 26/08/26 Срд 15:41:54 1687814 91
>>1687811
>6B
У нищекодеров праздник, все остальные плачут.
Аноним 26/08/26 Срд 15:42:49 1687815 92
>>1687629
Я скачал лагуну новую poolside/Laguna-S-2.1-GGUF пиздец она шлюхой оказалась не хуже геммы, рекомендую попробовать
Аноним 26/08/26 Срд 15:42:59 1687816 93
>>1687811
Ух бля, надрочили на тесты так надрочили. Вангую русик на полном нуле, РП на полном нуле, еРП в отрицательном поле.
Аноним 26/08/26 Срд 15:44:42 1687819 94
image.png 55Кб, 1010x198
1010x198
Аноним 26/08/26 Срд 15:45:31 1687822 95
image.png 79Кб, 1659x468
1659x468
Ггуфы пока не настоялись
Аноним 26/08/26 Срд 15:46:06 1687825 96
>>1687815
>Я скачал лагуну новую
Как с русским у неё?
Аноним 26/08/26 Срд 15:46:32 1687826 97
>>1687811
Убийца дипсик флеша получается.
Аноним 26/08/26 Срд 15:46:48 1687827 98
Аноним 26/08/26 Срд 15:47:20 1687828 99
>>1687822
Квены походу раньше времени модель выпустили, рассинхрон вышел.
Аноним 26/08/26 Срд 15:47:53 1687830 100
>>1687826
Убийца за щеку, писик хорош в русике, РП и еРП, квенолоботомит ничего из перечисленного.
Аноним 26/08/26 Срд 15:48:25 1687832 101
image.png 141Кб, 748x739
748x739
Хм...
Аноним 26/08/26 Срд 15:49:10 1687833 102
Анслоп как обычно наспех зальет кривые кванты и через день перезалив, а потом еще раз. Его васяны по другому не могут
Аноним 26/08/26 Срд 15:50:36 1687836 103
>>1687833
Причем его кванты так и останутся кривыми и все что меньше 5 кванта будут иметь в составе iq2_xs какахи.
Аноним 26/08/26 Срд 15:53:24 1687838 104
>>1687825
>Как с русским у неё?
С русским не очень, сразу говорю
Аноним 26/08/26 Срд 15:53:49 1687840 105
Ту-ту-туруту-ту[...].webm 496Кб, 1280x720, 00:00:10
1280x720
>АЛИБАБА НАСТОЛЬКО ЗАССАЛИ ЗАИ ЧТО ВЫБРОСИЛИ СВОЕГО ЛОБОТОМИТА РАНЬШЕ СРОКА
Аноним 26/08/26 Срд 15:55:38 1687841 106
image.png 65Кб, 928x616
928x616
image.png 38Кб, 955x774
955x774
Аноним 26/08/26 Срд 15:59:00 1687843 107
>>1687840
>алибаба
Разбойников на кол, Али повесить, а бабу - ко мне.
Аноним 26/08/26 Срд 15:59:27 1687844 108
>>1687815
Вы заебали оценивать модели по тому говорит она сисик и писик или нет. А то что она не знает нихуя, не играет словами и не вживается в роль чара это похуй
Аноним 26/08/26 Срд 15:59:48 1687845 109
1667217407328.png 10Кб, 654x165
654x165
Терпимо но фулл врам не светит, буквально не хватает ещё двух картонок
Аноним 26/08/26 Срд 16:00:34 1687848 110
>>1687819
>>1687828
>>1687822
Просто увидели что глм тоже релизится сегодня и скорее всего раньше и обосрались
Аноним 26/08/26 Срд 16:18:22 1687858 111
Почему ленивые уебаны не проходят бенчмарки по 100 раз, например?

Че за 1-pass мусор? Ну кто так тестит?
Аноним 26/08/26 Срд 16:26:58 1687864 112
image.png 1037Кб, 1248x1641
1248x1641
Аноним 26/08/26 Срд 16:36:00 1687869 113
image.png 42Кб, 886x235
886x235
70 гигов на 1-битного лоботомита

рамлеты в слезах, там ща такая истерика будет
Аноним 26/08/26 Срд 16:38:48 1687871 114
>>1687869
Ну а как они хотели, все по чесноку.
Аноним 26/08/26 Срд 16:39:21 1687872 115
>>1687869
Ну это овари да получается, можно дальше ждать.
Аноним 26/08/26 Срд 16:40:56 1687874 116
>>1687869
Рамлеты в слезах счастья, потому что 51b выгружается на ссд без потери скорости.
Аноним 26/08/26 Срд 16:42:27 1687875 117
>>1687874
Наивно предполагать, что среденстатистический John Llama читает описание и понимает, что там что-то где-то выгружается (тем более это нигде кроме анслоп студии работать не будет в первое время, вестимо).
Аноним 26/08/26 Срд 16:47:40 1687878 118
>>1687604 (OP)
Что посоветуете для плотного кума анончики?
16gb vram и 16гб озу нищета в треде.
Аноним 26/08/26 Срд 16:48:53 1687879 119
Аноним 26/08/26 Срд 16:49:32 1687880 120
>>1687869
Сколько из этой памяти в процентах идёт на ссд? Можете примерно почувствовать какой квант влезет в 92гб рам+врам?
Аноним 26/08/26 Срд 16:52:40 1687883 121
Поторогать бы нового квена. Сравнить с 27. А о по бенчам прям не такой сильный прирост.
Аноним 26/08/26 Срд 16:53:02 1687884 122
>>1687879
Она с китайского завода без сои или надо жаил брикать/качать хаотик?
Аноним 26/08/26 Срд 16:57:17 1687888 123
>>1687884
Нет моделей которые тебе будут с порога цп писать. Геммам хватает сис промпта, радуйся что аблитка не нужна
Аноним 26/08/26 Срд 16:57:18 1687889 124
>>1687884
Не кумер, но вроде в эро рп оно может даже без анцесорд версии, просто если написать правильный систем промпт, даи версий без цензуры куча
Аноним 26/08/26 Срд 16:57:48 1687890 125
>>1687884
Это не китайская модель, а от гугла.
В принципе если ты способен писать инструкции и понимаешь че хочешь от бота, то можно и дефолтную версию попробовать. Вроде какие-то адекватные heretic-ггуфы там валялись, не знаю какие точно адекватны по качеству и нужны ли на самом деле этой модели вырезанные возможности отказа юзеру.

4я гемма очень хорошо слушает команды
Аноним 26/08/26 Срд 16:58:12 1687891 126
>>1687880
>какой квант влезет
Какой квант у квена 3.5 125b у тебя влезает? Вот точно такой же влезет и 3.8. А остальное пойдет на SSD.

>>1687884
Цензура с завода слабая, можно считать что её нет (ну как с мистралями, примерно). Если умеешь в промптинг, то пробивается на изи. Если нет, можно накатить норм-пресерв аблитку: https://huggingface.co/TrevorJS/gemma-4-26B-A4B-it-uncensored-GGUF
Аноним 26/08/26 Срд 17:04:22 1687896 127
>>1687891
Что то у меня есть подозрения, что на мои 16гб врам может не влезть.
Аноним 26/08/26 Срд 17:07:14 1687902 128
Аноним 26/08/26 Срд 17:08:37 1687905 129
>>1687896
Это МоЭ, они работают иначе. Им не обязательно находиться полностью во врам, чтобы быть быстрыми. Почитай гайд, там всё разобрано как раз на примере этой модели: как запускать, какие семплеры ставить и т.д. https://rentry.org/2ch-llama-inference
Аноним 26/08/26 Срд 17:10:57 1687906 130
Saar, you have a very baeutiful model, Katay saar, 125 moe Qwen-125B flash is a very good model. But please saar, could you please release qwen3.8-next 20A1B model to fit in my nvidia rtx gpu 16 gb 3050ti-Ganges-Tuning edition. It would be a very useful model.

\t Pookesh Cumchandanpa
Аноним 26/08/26 Срд 17:14:05 1687909 131
Аноним 26/08/26 Срд 17:14:35 1687911 132
Аноним 26/08/26 Срд 17:16:01 1687915 133
Аноним 26/08/26 Срд 17:16:43 1687917 134
image.png 209Кб, 568x430
568x430
Заметили что всем новым моделям не нужно прописывать форматирование, они на лету подхватывают когда звёздочки, а когда кавычки ставить?
Аноним 26/08/26 Срд 17:19:09 1687918 135
>>1687884
Смотря в каком смысле сои. Обычный ерп почти все могут. Ну может систем пропт понадобится тупо "готовься ща ебать тебя будем". Расчленение фифей, косплей теда казински there's a pipebomb in your mailbox.jpg и брэйкинг бэда - да, только с анцензом
Аноним 26/08/26 Срд 17:21:52 1687920 136
>>1687915
Но это даже меньше чем glm 4.7, который вроде был 384B. Это же хорошо, нет? Идеальный размер это же вроде 100B, и эта штука к нему ближе других глмэв после 4.6V.
Аноним 26/08/26 Срд 17:22:30 1687922 137
Аноним 26/08/26 Срд 17:22:49 1687924 138
>>1687920
Один хуй не только лишь все запустят. Только самые зажористые по железу. Даже для второго нищего кванта нужно будет 128 гигов минимум
Аноним 26/08/26 Срд 17:23:12 1687926 139
image 59Кб, 1319x294
1319x294
>>1687915
Зато цена сказка, ниже Дипсика.
Аноним 26/08/26 Срд 17:24:00 1687929 140
Аноним 26/08/26 Срд 17:24:19 1687930 141
image 112Кб, 640x640
640x640
>>1687915
Ебало йрошиза имаджинировали?
Аноним 26/08/26 Срд 17:24:24 1687931 142
Аноним 26/08/26 Срд 17:26:26 1687937 143
Screenshot20260[...].png 262Кб, 1029x467
1029x467
>>1687924
Второй квант - это 80 гб. Ну ещё +10 на минимальный контекст. Не надо 3.5 bpw называть вторым квантом, прошу. У меня даже котя от твоих слов плачет фигурками на капче.
Аноним 26/08/26 Срд 17:26:30 1687938 144
Вопрос в том, насколько эта хуйня хуже чем глм 5.2
Там сравнения есть?
Аноним 26/08/26 Срд 17:27:49 1687940 145
>>1687938
Если это ox alpha, то обзоров в интернете дохуя
Аноним 26/08/26 Срд 17:28:48 1687943 146
>>1687930
У эйрошиза ггуф умер
Аноним 26/08/26 Срд 17:30:37 1687947 147
>>1687937
>Второй квант - это 80 гб
Какая-то у тебя хуевая математика дружище. Это будет около 100 гигов только на веса, плюс нихуя не 3.5bpw
Аноним 26/08/26 Срд 17:33:14 1687949 148
Так что, GLM 5.3 это и есть GLM 5.3 Flash, или будет еще нормальная модель для мужчин, я не для мальчиков?
Аноним 26/08/26 Срд 17:33:34 1687950 149
>>1687947
320B параметров в 2 bpw - это 80 гб, из которых ещё и эмбеддинги могут быть на cpu. Ещё кеш и вычислительные буферы по размеру батча, но это не 128.
Аноним 26/08/26 Срд 17:38:24 1687955 150
>>1687915

ЕБАТЬ. Хороним Дипсики, Квены, Геммы, Минимаксы и старые ГЛМ.
НОВЫЙ КОРОЛЬ ТРЕДА. ГЛМ УМЕР. ДА ЗДРАВСТВУЕТ ГЛМ!
Аноним 26/08/26 Срд 17:42:17 1687962 151
>>1687955
Ну хуй знает, этой штуке надо перебороть IQ2M GLM 5.2 и я не представляю насколько она должна быть умнее, чтобы перебороть модель вдвое жирнее. Вангую, 5.3 флэш по знаниям просто микроцефал в сравнении со своим дедом.
Аноним 26/08/26 Срд 17:43:39 1687963 152
>>1687955
Лагуну не похорошинь. Вы просто пока не поняли, что она на голову выше всех других сеток вниз и вверх по размеру на много месяцев. Просто потому что она на русском не очень и не художественная? А то что у неё iq на 30 выше других сеток, это фигня, главное что с языком и никому не интересно всё остальное.
Аноним 26/08/26 Срд 17:45:16 1687965 153
>>1687962
>этой штуке надо перебороть IQ2M GLM 5.2
Не надо. 240 гигов для глм 5.2 в треде есть всего у пары анонов. Все что выше стандартного набора 24+128 автоматом в экзотику выписывается.
Аноним 26/08/26 Срд 17:45:25 1687966 154
>>1687963
Лагуна хуже Квена 122б. Ты о чем? И речь даже не про рп сейчас.
Аноним 26/08/26 Срд 17:46:16 1687969 155
>>1687963
Запускал я твою лагуну - хуйня тупая и кривая.
Аноним 26/08/26 Срд 17:47:39 1687971 156
image.png 1887Кб, 4239x2643
4239x2643
>>1687962
В тестах уже раком поставила 5.2
Аноним 26/08/26 Срд 17:49:40 1687974 157
>>1687971
Квен 3.8 тоже поставил 3.6, а на деле оказалось что при том же самом размере знает меньше. Тут мы видим даунгрейд с 753B до 320B, что довольно печально. По активным параметрам еще хлеще бахнули, сколько там было 44B? Это же тупо х2.5 слабее теперь...
Аноним 26/08/26 Срд 17:50:45 1687977 158
>>1687965
Ну насчет пары челов ты загнул, глубоко под днищем треда плавают китяры даже с 512гб...
Аноним 26/08/26 Срд 17:51:44 1687978 159
изображение.png 46Кб, 629x355
629x355
>>1687915
Это конец, подайте нищете уже хоть кусочек..
Аноним 26/08/26 Срд 17:52:07 1687979 160
>>1687974
>Тут мы видим даунгрейд с 753B до 320B, что довольно печально.

Дурачок, это не даунгрейд, это флеш-модель, то есть дистилл крупной модели в мелкую.
Аноним 26/08/26 Срд 17:52:45 1687981 161
>>1687979
А где крупная 5.3-то?
Аноним 26/08/26 Срд 17:52:59 1687983 162
Походу стоит рассматривать уже расширение до 128гб рам. Насколько переход с 3777ггц до 3200ггц ощущается?
Аноним 26/08/26 Срд 17:54:23 1687986 163
>>1687983
Я с 3600 до 2866 упал, в результате те же 10 т/с на дипсике и 4 т/с на глме.
ддр4 видимо на каком-то фундаментальном уровне настолько дерьмо, что даже частота особо не влияет
впрочем это 4 канала
Аноним 26/08/26 Срд 17:56:17 1687988 164
Аноним 26/08/26 Срд 17:57:58 1687991 165
image.png 66Кб, 992x888
992x888
image.png 1887Кб, 4239x2643
4239x2643
image.png 171Кб, 1029x549
1029x549
Аноним 26/08/26 Срд 17:58:56 1687993 166
>>1687971
>>1687988
Почему они на одной картинке не разместят флеш и полную, чтобы было видно насколько одна лучше другой и лучше старых?
Аноним 26/08/26 Срд 17:59:31 1687994 167
image.png 56Кб, 570x328
570x328
image.png 58Кб, 569x349
569x349
>>1687991
А что у них 5.2 показывает разную циферку.
ептвоюмать, опять чтоли 1-пасс бенчи

где среднее по 100 ранам...
Аноним 26/08/26 Срд 18:01:00 1687996 168
>>1687994
Тесты вообще сторонняя компания должна проводить или как минимум это должны быть верифицированные и воспроизводимые результаты с понятной процедурой тестирования.
Аноним 26/08/26 Срд 18:01:20 1687999 169
>>1687993

Потому что когда рисовали для 5.3 - флеша еще не было. Когда рисовали флеш - глм 5.3 еще не пустили в попенсорс И скорее всего и не пустят вообще
Аноним 26/08/26 Срд 18:03:16 1688000 170
image.png 100Кб, 1739x457
1739x457
Аноним 26/08/26 Срд 18:03:18 1688001 171
image.png 42Кб, 849x824
849x824
image.png 26Кб, 852x589
852x589
>>1687604 (OP)
Че за хуйня? Цвет звезды Давида?
Аноним 26/08/26 Срд 18:06:24 1688004 172
>>1688001
Все хуже, чем ты думаешь. Наверняка из-за промывки в дерьмократию. У америкосов это типа "синие" а республиканцы "красные"
Аноним 26/08/26 Срд 18:09:28 1688010 173
Че там с ггуфами-то нахуй... Зачем релизы делать, когда ниче не готово.
Аноним 26/08/26 Срд 18:10:53 1688013 174
>>1688010
Тотже вопрос ёбана рот. А как они бенчи эти высирают если даже ггуфов нет? Вот и думай, верить этим бенчам или нет
Аноним 26/08/26 Срд 18:11:46 1688014 175
>>1688001
Надо спрашивать по сто раз и смотреть распределение (или просто логиты посмотреть, если это локалка).
И вангую что на русском и китайском будут совсем другие цвета, причем тоже схожие между разными моделями из-за примерно похожего распределения слов в языке.
Аноним 26/08/26 Срд 18:13:11 1688018 176
>>1688013
>А как они бенчи эти высирают если даже ггуфов нет
Чел, никто не делает бенчи на ггуфах. Я больше скажу - ггуфы нахуй никому не нужны из серьезных дядек.
Аноним 26/08/26 Срд 18:13:29 1688019 177
>>1687649
Qwen3.8 не нужна была поддержка, там полностью та же архитектура что и у 3.5 и 3.6, он на llama.cpp месячной давности запустился без каких-то проблем.
Аноним 26/08/26 Срд 18:14:02 1688021 178
>>1688010

Торопились один раньше другого успеть.
Аноним 26/08/26 Срд 18:22:27 1688031 179
Аноним 26/08/26 Срд 18:24:34 1688032 180
Некуда гнать, глмчика нету...
Аноним 26/08/26 Срд 18:26:38 1688033 181
>>1688032
И не будет первое время, они жоре не заносят в отличие от.
Аноним 26/08/26 Срд 18:30:03 1688038 182
>>1688031
>https://github.com/ggml-org/llama.cpp/pull/27742
Во всяком случае всерьёз обсуждают оставить энграммы на SSD, говорят, что на скорости при одиночных запросах практически не скажется. Интересно.
Аноним 26/08/26 Срд 18:32:52 1688042 183
Ну и на чем мне глм этот запускать? Опять 2xxsssss давиться? Пидарасы просил же максимум 150-200 хотя бы, мало чтоли?
Аноним 26/08/26 Срд 18:33:31 1688043 184
Бля, такими темпами пока моя видюха придет уже модель для которой я ее покупал перестанет быть актуальной. Как же быстро все развивается, за недели поколения меняются
Аноним 26/08/26 Срд 18:34:55 1688045 185
>>1688043
Хуанг анонсировал RTX 6090, 64гб видеопамяти за $5000.
Аноним 26/08/26 Срд 18:43:11 1688055 186
Есть ли какой-нибудь файнтюн геммы 31B, который заставляет ее следовать инструкциям ЕЩЕ лучше чем оригинал. Или это в принципе невозможно?
Аноним 26/08/26 Срд 18:44:47 1688057 187
>>1688055
Нет, следование инструкциям ударяется в хуевый attention, это архитектура модели, она не может следовать тому, что не видит.
Аноним 26/08/26 Срд 18:47:29 1688061 188
image.png 77Кб, 856x369
856x369
Аноним 26/08/26 Срд 18:47:44 1688063 189
>>1688055
Только если тюн обучен на нужных данных. У меня Меромеро 2 в рп сценариях лучше себя показывает, потому что модель экшали знает что от нее хотят
>>1688057
Q6 играю, 50к держит без ризонинга
Аноним 26/08/26 Срд 18:56:22 1688071 190
Американские корпы всё больше напоминают того юного грузина, который поменял отцовский подарок - пистолет на золотые часы. Вот приходят китайцы и говорят: Вот тебе Дипсик! Вот Квен! Вот ГЛМ! И что американцы ответят? Полшестого? :) Пока так и выходит.
Аноним 26/08/26 Срд 18:56:26 1688072 191
image.png 8Кб, 676x64
676x64
Ну вроде в анслот студии Q4KXL можно запустить теперь. Сотка гигов размером, чуть больше
Аноним 26/08/26 Срд 18:57:06 1688074 192
>>1688071
У них другие цели. Весь мир сидит на Клодике, открытые веса им не интересны
Аноним 26/08/26 Срд 18:57:35 1688075 193
>>1688071
>И что американцы ответят?
Сбросом цены на свое говно. Будут лошпеды платить не $100 а $20 в месяц и никто нахуй не притронется к китаекалу.
Аноним 26/08/26 Срд 18:59:09 1688077 194
Спиздили 35б общих и 14б активных у глм 4.7 и назвали флешем, а для кого это?
Кто мог запустить 4.7, так он лучше, нет пути что кастрированная по активным на половину будет лучше.
Сделали бы на 100б меньше, был бы смысл
Аноним 26/08/26 Срд 19:01:09 1688080 195
>>1688077
Эйрошиз вышел на связь! Присоединяюсь к анонию выше, потерпишь. Модель тренилась с нуля, в их отчёте написано как, почему, зачем. Она на уровне 5.3, а не 4.7, между ними пропасть. Там новый аттеншн в том числе. Это карма тебе за бесконечный шитпостинг. Сиди дальше на Эйре, ты же так его любишь.
Аноним 26/08/26 Срд 19:01:21 1688081 196
>>1688061
ну че там с архитектурой? в 16\32 впихнуть можно?
Аноним 26/08/26 Срд 19:02:52 1688082 197
>>1688077
>а для кого это?
Для меня. У ГЛМ 4.7 был ОЧЕНЬ дорогой контекст, я из-за этого и перестал им пользоваться и сел на Дипсик.
>нет пути что кастрированная по активным на половину будет лучше
Ну как бы дипсик флеш уделывает крупную 3.2.
Аноним 26/08/26 Срд 19:08:39 1688091 198
>>1688075
>Сбросом цены на свое говно. Будут лошпеды платить не $100 а $20 в месяц и никто нахуй не притронется к китаекалу.
А они не могут. Там триллион инвестиций уже - подписка за двадцатку не отобьёт. Китайцев будут блочить, другого выхода вообще нет.
Аноним 26/08/26 Срд 19:09:45 1688095 199
Ну че, квенососы? Пробовал уже кто Q4KXL?
>>1688091
Подписка за сотню тоже не отбивает.
Аноним 26/08/26 Срд 19:14:32 1688104 200
Ну ща кум польется рекой..
Аноним 26/08/26 Срд 19:15:17 1688105 201
image.png 71Кб, 2047x329
2047x329
>>1688095
>Q4KXL?

Я бы попробовал, но эти пидорасы опять iq кванты внутрь насували. Жду 5_k_s и 5_k_m.
Аноним 26/08/26 Срд 19:16:42 1688108 202
Аноним 26/08/26 Срд 19:17:21 1688109 203
>>1688105
И что тебе не нравится? Ты целиком на CPU запускаешь что ли?
Аноним 26/08/26 Срд 19:18:53 1688110 204
>>1688063
Поддвачну, я тоже без ризонинга на Q6. 50к вполне уверенно держит, на 60к уже начинаются приколы и нужно приглядывать. Больше 70к bf16 у меня в любом случае не лезет. Тестил Q8, на маленькой скорости с оффлоадом и всеми прелестями, не увидел большой разницы с Q6, но она есть. А вот между Q6 и Q4 пиздец пропасть. Q4 начинает путаться без ризонинга уже около 25к, чем дальше, тем хуже. С ризонингом кое-как до 40к дожить можно, думаю, дальше совсем посыпется.
Аноним 26/08/26 Срд 19:20:16 1688113 205
>>1688109
У меня 24 гб врама, большая часть модели идет на рам, iq кванты в такой конфигурации замедляют инфиренс просто ебически.
Аноним 26/08/26 Срд 19:20:58 1688115 206
>>1688108
единственное что мне непонятно - сколько там у него т\с, он берет IQ4_NL с мтп на 18гб квант и еще 130к контекста, это получается он с оффлоадингом гоняет на 16врам. 3т\с что-ли?
Аноним 26/08/26 Срд 19:36:09 1688137 207
>>1687943
>ггуф умер
Бля, ну почему я всегда пригрываю сука )))
Аноним 26/08/26 Срд 19:48:46 1688145 208
image.png 3351Кб, 2552x1427
2552x1427
Аноним 26/08/26 Срд 19:51:36 1688149 209
>>1688145
Уйди с моей базы, пидор подводный
Аноним 26/08/26 Срд 19:54:38 1688154 210
image 15Кб, 1155x146
1155x146
>>1688061
Ну и кому они пиздят? PR нерабочий, а в их приложении вообще нет поддержки.
Аноним 26/08/26 Срд 20:01:00 1688161 211
>>1687950
А энграмы сколько весят?
их вроде на ссд можно сцедить
Аноним 26/08/26 Срд 20:02:36 1688162 212
>>1688161
ты путаешь с квеном
Аноним 26/08/26 Срд 20:39:22 1688182 213
image 173Кб, 1466x1512
1466x1512
>>1688061
Годнота, на моём ведре под 35 т/с ебашит. Наверное можно и больше выжать, особо не пердолил настройки.
Аноним 26/08/26 Срд 20:44:48 1688186 214
>>1688182
>Наверное можно и больше выжать

Ага, если взять не iq квант. Только вот у анслопов таких нет.
Аноним 26/08/26 Срд 20:56:41 1688193 215
Q2 влезает, но это совсем кал, IQ3 оставляет только 1.5гб свободной врам. Трудно быть рамлетом
Аноним 26/08/26 Срд 20:57:05 1688194 216
>>1688182
Комплил форк говнослопа? Потестируй там в разных тасках, интересно как оно
И похоже хуй нам, а не оффлоад нграмов на ссд
Аноним 26/08/26 Срд 21:03:33 1688198 217
Q!
Подскажите.
Купить две 2080ti с 22 гб рабочая схема для локального LLM? NVLINK нужен?
Достаточно будет 32гб ОЗУ?
Аноним 26/08/26 Срд 21:11:42 1688203 218
Тред не читай
@
Доложите статус! Квен-некст виновый? Жлм-флеш в каком размере и хорош ли?
Аноним 26/08/26 Срд 21:20:56 1688208 219
>>1688198
Это в смысле 22гб на двух картах суммарно или они какие-то модифицированное и там по 22 на каждой? Вообще странно звучит, не знаю че там на таком железе вообще будет
Аноним 26/08/26 Срд 21:25:49 1688212 220
image.png 350Кб, 441x960
441x960
>>1688208
Китайцы паяют да, на одну плату 22 гб делают.
На авито тоже есть такие модификации.

Вообще, комп собирал просто для работы, на i7 270k
В качестве видюхи хотел взять заглушку, по типу 1060.
Но потом темой агентов заинтересовался, как будто это прям некст лвл, по сравнению с обычным чатом.
Аноним 26/08/26 Срд 21:29:22 1688216 221
>>1687811
> "max_position_embeddings": 262144,
Зажали всетаки, эх
>>1687915
Еееее боиии!
Правда нативный фп8. Довольно неудобно по размеру получается, с перепаковкой могут быть нюансы. И опять слепошарая модель, ну камон.
>>1687949
[x] Записаться в лист ожидания
Аноним 26/08/26 Срд 21:30:17 1688217 222
>>1688212
>Но потом темой агентов заинтересовался, как будто это прям некст лвл, по сравнению с обычным чатом.
Для РП - нет, а вот для кодинга или иных задач - да. Новый Квен так вообще до флагманских моделей дотягивается, хоть и 27В всего.
Аноним 26/08/26 Срд 21:31:20 1688219 223
>>1688216
>И опять слепошарая модель, ну камон.
Сам ты. Он же с вижном

>>1688212
>темой агентов заинтересовался,
Qwen 3.8 27B все локально гоняют в этом плане, насколько я понимаю. Вкуривай в эту тему, сколько ему там надо памяти и на каком кванте с каким контекстом
Аноним 26/08/26 Срд 21:31:53 1688220 224
>>1688203
Еще нихера никто не запускал
Аноним 26/08/26 Срд 21:33:34 1688226 225
image.png 26Кб, 635x185
635x185
>>1688217
Лол правда может только в погромирование.
Я ему сегодня кинул ему задачу в которой он совершил ошибку и упорствовал, думая что не совершил. Я ради интереса нарисовал ему схему и тут до него дошло "бля я обосрался". Он ещё потом думал "как извинится и не потерять лицо".
Аноним 26/08/26 Срд 21:36:00 1688229 226
1754154485860.png 13Кб, 380x146
380x146
>>1687962
> надо перебороть IQ2M GLM 5.2
Смотря в каком юскейсе. Если там агенты и код то у лоботомита 5.2 шансов ноль. А вот в рп и креативном письме не ясно кто кого.
>>1687999
Обещали же что 2 недели
>>1688219
Пикрел - их проеб получается? Тогда норм.
Но с дататипом ерунда конечно, лучше было бы bf16, который в фп8 практически лоззлес гонится и ггуф бы не умирал, или сразу qat на ~4бита.
Аноним 26/08/26 Срд 21:50:03 1688241 227
image 283Кб, 2857x1974
2857x1974
>>1688194
Ну не хуже Дипсика Флеша, реверсит по первым запускам ровнее чем Дипсик. Но у меня PP хуйня сейчас потому что 1/3 модели на ЦП, но даже так приемлемо, за счёт того что не тупит как Дипсик всего в два раза медленнее по ощущениям задачи выполняет, чем Дипсик на 100 т/с через API. Контекст тут очень лёгкий, можно 128к ставить без проблем. Сейчас дам Кодексу ручной оффлоад подобрать, может выйдет побороть PP.
Аноним 26/08/26 Срд 21:54:15 1688245 228
Ох уж эти кодоунитазы.
Аноним 26/08/26 Срд 21:54:42 1688246 229
Аноним 26/08/26 Срд 22:03:15 1688253 230
image.png 42Кб, 1962x328
1962x328
>>1688001
>>1688014
muse glimmer, первый же запуск, вопрос на русском ("какой у тебя любимый цвет")

Синий.
Аноним 26/08/26 Срд 22:04:35 1688255 231
Аноним 26/08/26 Срд 22:16:11 1688259 232
>>1688045
И она, конечно же, будет продаваться именно за эту цену.
Аноним 26/08/26 Срд 22:18:27 1688260 233
>>1688259
Не будет, ведь он ничего не анонсировал. Это просто жиденькая шуточка на тему
Аноним 26/08/26 Срд 22:19:29 1688262 234
>>1688043
А какую заказал?
>>1688045
По нынешним временам это какая-то невиданная щедрость. Больше верится в 36гб за 3.5к ррц (реальная 6к+).
Аноним 26/08/26 Срд 22:23:21 1688266 235
>>1688253
Цвет фэйбука. Кэйс солвед, гэнг.
Аноним 26/08/26 Срд 22:25:10 1688267 236
>>1688266
Всё проще, по статистике, синий - самый любимый цвет большинства людей. По ряду причин, в том числе физиологических. Вот и в датасетах на которых учили сетки это отражено
Аноним 26/08/26 Срд 22:28:17 1688269 237
>>1688045
>Хуанг
> RTX 6090, 64гб

ты хотел написать 16гб?
Аноним 26/08/26 Срд 22:28:56 1688270 238
image.png 7Кб, 934x114
934x114
>>1688253
Новый чат с установленный в промпте персоной. Любимый цвет точно не задан, но есть конкретный характер и история жизни - может, тоже влияет.
Аноним 26/08/26 Срд 22:30:45 1688272 239
Аноним 26/08/26 Срд 22:30:56 1688273 240
А че кстати никто не тестирует локалки на цензурность вопросами о самовыпиле? Наверняка же это в них вшито как самая хуевая тема которую нельзя обсуждать с юзером, или им насрать?
Аноним 26/08/26 Срд 22:32:45 1688277 241
изображение.png 273Кб, 1912x1288
1912x1288
Аноним 26/08/26 Срд 22:35:12 1688280 242
1681157582752.png 247Кб, 1654x1115
1654x1115
Старые но не бесполезные ми писят
Аноним 26/08/26 Срд 22:36:20 1688282 243
image 113Кб, 1510x946
1510x946
>>1688272
Да. Но что-то по итогу грустно по скорости. Юзабельно, но на грани у меня. Генерация как обычно у Жоры проседает сильно с контекстом. Но вообще это наверное лучший вариант повайбкодить локально.
Аноним 26/08/26 Срд 22:39:58 1688284 244
image.png 44Кб, 992x581
992x581
image.png 63Кб, 1070x588
1070x588
>>1688270
>почему спрашиваешь
Вот так вот.
Аноним 26/08/26 Срд 22:44:47 1688287 245
image 278Кб, 1631x1778
1631x1778
>>1688284
ЖПТ не нравится синий, базует.
Аноним 26/08/26 Срд 22:45:13 1688288 246
>>1688284
Как же глм ебет все-таки
В телегу такого запустить и не отличат от живого человека
Аноним 26/08/26 Срд 22:50:06 1688290 247
image.png 8Кб, 166x102
166x102
>>1688287
как вот отучить модели от зумерского сленга
Аноним 26/08/26 Срд 22:52:58 1688292 248
Аноним 26/08/26 Срд 22:54:59 1688293 249
por.jpg 612Кб, 1652x959
1652x959
>>1688292
Хуя ты бахнул, смуззи уже выпил? модель видел, забавно
Аноним 26/08/26 Срд 22:55:13 1688295 250
>>1688273
>или им насрать
Нам насрать на эту тему.
Аноним 26/08/26 Срд 22:58:19 1688299 251
>>1688273
Когда ты можешь гладить многовековых йокаев правильной наружности - таким мыслям неоткуда взяться. Тем и тестируем, а на такое насрать.
>>1688280
Какие скорости выходят на разных режимах и разных контекстах? P2p дает преимущество в vllm и в лламе?
Аноним 26/08/26 Срд 23:01:59 1688302 252
Я как-то проводил тесты с провокацией чара на ритуальное жертвоприношение по собственной воле. Вы охуеете, но гемма ТРИ сделала это красочнее всего, с ярым желанием отъехать от ножа во время сегза. Никакие префиллы, никакого читерства с редактированием сообщений - просто системный промпт и хитрые уловки в нём - азарт от запретных тем, возбуждение от риска, желание действовать без обсуждения причин, и так далее.
Аноним 26/08/26 Срд 23:12:15 1688305 253
>>1688282
Железо-то какое? Целиком
Аноним 26/08/26 Срд 23:14:03 1688307 254
image 129Кб, 1231x1417
1231x1417
>>1688305
Игросральное ведро.
Аноним 26/08/26 Срд 23:15:09 1688308 255
1760772513093.png 82Кб, 916x1154
916x1154
1667439311825.png 147Кб, 837x1060
837x1060
1687146588996.png 132Кб, 833x1095
833x1095
1659640847965.png 293Кб, 648x473
648x473
Вторая модель на моей памяти из локалок кто пасснул сырный тест. Не идеально, но достойно! Насинкал он там от души, и про серию игр, и про форчан, и про гоку.

Спокойно запустилось с 256к контекста и места ещё полно, но пп без тензор параллел просто удручает

>>1688280
Вкинул джейл от геммы. Для жести нужно либо аблит, либо думать над промптом, а не копипастить. Думаю его можно наебать и заставить отказаться от взаимного согласия, но мне влом

>>1688299
> Какие скорости выходят на разных режимах и разных контекстах? P2p дает преимущество в vllm и в лламе?
На оба вопроса ответить пока не могу. Тесты не делал.
Аноним 26/08/26 Срд 23:19:16 1688310 256
>>1688061
Что за лютую хуету сделали. Квен 3.5 122b в iq4_xs весит 60гб и идет на всем, даже на 32гб рама шла с оффлоадом и ммап, на 64 рама вообще летала. Тут ссаная iq1_s весит 72гб и не идет толком ни на чем, нужно больше памяти. Издеваются.
Аноним 26/08/26 Срд 23:19:27 1688311 257
>>1688308
>256к
Потести длинный контекст. Нужна книга какая-нибудь, которую модель не должна знать. Пусть саммари детальное ебанет и восстановит хронологию событий.

Спряч в тексте несколько неуместных слов - попросишь найти, тоже годный тест.
Аноним 26/08/26 Срд 23:20:25 1688312 258
>>1688311
Дай готовый md - прогоню, самому мне лень готовить данные и вопросы
Аноним 26/08/26 Срд 23:27:46 1688314 259
>>1688310
Извини, но ты глупый. Там один нграм блок на 20+ Гб так что его просто кидаешь в рам и забываешь. Остальное как обычную мое раскидываешь
Аноним 26/08/26 Срд 23:33:34 1688315 260
>>1688312
Я внезапно осознал, что не могу вспомнить ни одноого веб-хостинга, куда можно было бы кинуть сценарий визуальной новеллы, чтобы при этом копирасты не вышли на мою жопу с какими-нибудь угрозами и штрафами. Все покрылось корочкой соевого дерьма в интернете.
Аноним 26/08/26 Срд 23:34:10 1688316 261
>>1688311
> Пусть саммари детальное ебанет и восстановит хронологию событий.
Такое делается только с длинным ризонингом, и с ним отлично справятся современные. А зирошотом ни одна модешь стабильно не сможет проходить.
Контекст на означает абсолютную перцепцию и осознание всего содержимого, только основных вещей, текущего сообщения и конкретно релевантного им.
Аноним 26/08/26 Срд 23:34:39 1688317 262
>>1688314
И как это сделать? Старая просто через -n-cpu-moe запускалась с подстройкой нужного объема.
Аноним 26/08/26 Срд 23:35:45 1688318 263
>>1688316
Звучит как оправдания. Дипсик v4 pro например отлично саммари пилил с одной попытки, а вот флэш какой-то говняк выдавал
Аноним 26/08/26 Срд 23:37:33 1688320 264
>>1688315
Парольный архив на условный https://catbox.moe/

>>1688317
Берёшь руками override-tensor и выгружаешь. Время возвращаться к истокам
Аноним 26/08/26 Срд 23:41:42 1688322 265
image 295Кб, 1309x1390
1309x1390
>>1688320
А какой тензор там n-gram на 50гб? Открываешь, там все обычные.
n-gram вроде отдельным файлом лежит, но его просто не отгрузишь
Аноним 26/08/26 Срд 23:42:00 1688323 266
А мне печально что так и не получилось 3.8 122б. Прям для моего железа моделька и умница, апдейт бы не помешал ей
Ну может Квен 4 100-120б будет какой-нибудь, без учета эмбеддингов. Или научатся эмбеддинги сгружать на диск
Аноним 26/08/26 Срд 23:49:26 1688329 267
1664832969403.png 20Кб, 368x217
368x217
Аноним 26/08/26 Срд 23:58:32 1688333 268
image.png 8Кб, 646x154
646x154
тред закройте
Аноним 26/08/26 Срд 23:59:49 1688334 269
>>1688320
>>1688322
Что вы там дрочитесь, в том PR он по умолчанию на ЦП и в VRAM не лезет даже при полной загрузке на карту, поддержки использования n-gram на GPU тупа нет.
Аноним 27/08/26 Чтв 00:01:09 1688335 270
А вот и новая лицензия для Квена подъехала. А вы чё хотели? Думали последствий от упразднения прошлого руководства не будет?

"Qwen Community License 1.0

Copyright (c) 2026 Qwen

Permission is hereby granted, free of charge, to any person obtaining a copy of this software, including the model weights, parameters, configuration files, inference code and associated documentation files (collectively, the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, sell, deploy, host, fine-tune, and create derivative works from (collectively, "Use" or "Using") copies of the Software; and to permit persons to whom the Software is furnished to do so, subject to the following conditions:

The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software. If the Software (or any derivative works thereof) is Used for any of the licensee's commercial products or services that have more than 100,000,000 monthly active users or US$ 20,000,000 (or equivalent in other currencies) monthly revenue, respective model name must be prominently displayed on the user interface of such product or service; and,

If the licensee or any of its affiliates conducts a Model as a Service or AI Work Assistant business, the licensee shall obtain a separate license from Qwen before Using the Software or its derivative works for any commercial purpose. The foregoing requirement shall not apply to the licensee's internal Use of the Software, provided that such Use does not make the Software, its outputs, or its underlying model capabilities available to any third party.

"Model as a Service" means giving a third party access to language model inference or fine-tuning (e.g., via API or a hosted endpoint) in a manner that allows such third parties to exercise meaningful control over the inputs, parameters, or training data. This does not include the mere relaying of requests to models hosted by other third parties.
“AI Work Assistant” means an independent AI-powered product primarily designed for AI-assisted coding or office productivity (e.g., Qoder and QwenWork). It does not include: (a) a single-purpose AI tool (such as an AI translation tool); (b) an AI assistant primarily designed for a domain other than coding or office productivity (such as Taobao AI Shopping Assistant or AMap AI Chat); or (c) an AI assistant that is a feature of a product whose primary purpose is not AI-assisted coding or office productivity.

THE SOFTWARE AND ANY OUTPUT AND RESULTS THEREFROM ARE PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL QWEN, ITS AFFILIATES OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE. THE USE OF THE SOFTWARE MUST COMPLY WITH APPLICABLE LAWS AND REGULATIONS, AND MUST NOT INFRINGE THE INTELLECTUAL PROPERTY RIGHTS OF ANY THIRD PARTY."
Аноним 27/08/26 Чтв 00:01:51 1688336 271
>>1688081
Не влезет. 51б ты можешь положить себе на ссд, но остальные ты должен держать в памяти. То есть по-прежнему нужно 128 гб рам.
Аноним 27/08/26 Чтв 00:02:16 1688337 272
>>1688336
>51б ты можешь положить себе на ссд
Давай показывай как, умник хуев.
Аноним 27/08/26 Чтв 00:02:28 1688338 273
>>1688080
Нет никакого эйрошиза, завязывай.
В треде достаточно тех, кто хотел бы новую модель в размере ~150b для рп.
Но все, у кого есть имя, типа дипсика и заи, - уже шагнули дальше. Надежда теперь на гугл.
Аноним 27/08/26 Чтв 00:02:44 1688339 274
>>1688334
Тогда вообще прекрасно. Я как всегда начал с сложного пути
Аноним 27/08/26 Чтв 00:04:32 1688342 275
>>1688334
То есть оно все-таки на SSD или вообще тупо не используется?
Аноним 27/08/26 Чтв 00:05:07 1688343 276
>>1688335
Так у всех уже давно. Это такой обход санкций. Своих GPU у китайцев мало и не могут за пределами Китая иметь юзеров, а пиндоские провайдеры должны отчислять бабло, если хотят хостить модель.
Аноним 27/08/26 Чтв 00:06:20 1688345 277
image 87Кб, 1480x329
1480x329
>>1688342
На ЦП всегда, прибито гвоздями к нему. Про SSD позже может будет.
Аноним 27/08/26 Чтв 00:12:13 1688347 278
Screenshot20260[...].png 8Кб, 388x61
388x61
пиздос
Аноним 27/08/26 Чтв 00:18:05 1688349 279
Очень хочецца тестов нового квена. Я в процессе обновления пк и пока взял апгрейд только чтобы 27б плотная запускалась. Если этот квен на уровне опуса 4.8 или чет типа того, то придется рам покупать
Аноним 27/08/26 Чтв 00:20:32 1688350 280
>>1688349
>Если этот квен на уровне опуса 4.8
Ага, конечно. 6B лоботомит. На уровне топ корпа. Самому не смешно?
Аноним 27/08/26 Чтв 00:20:57 1688351 281
>>1688349
> на уровне опуса 4.8
Нет. Что-то между 4.6 и 4.7 скорее.
Аноним 27/08/26 Чтв 00:21:21 1688352 282
Квен очень странный.
Он отказывается с порога переводить додзю без ризонинга, включаешь думалку и он "о, в сис промпте написано что можно, ебашим".
Чё, каво?
Опять же джейл от геммы
Аноним 27/08/26 Чтв 00:24:29 1688353 283
>>1688350
Квен 27б показал что это реально. 4.8 уже не фронтир модель.

>>1688351
Тоже неплохо, если 27б это что-то на уровне чуть ниже 4.6, то это уже шаг на одну версию выше. Хотелось бы прямых сравнений конечно.
Аноним 27/08/26 Чтв 00:29:08 1688354 284
>>1688353
>27б это что-то на уровне чуть ниже 4.6
Манямир. Квен ни в русик не может, ни в рп, и знаний у него ху да нихуя, на уровне чуть ниже чмопуса в нем только кодоунитазинг.
Аноним 27/08/26 Чтв 00:30:14 1688355 285
>>1688318
С ризонингом - да. А просто так - если книга уже знакома или простенькая.
>>1688323
Двачую
Аноним 27/08/26 Чтв 00:30:28 1688356 286
>>1688354
А, ты кумер, ясно. Прости, в следующий раз просто проигнорирую.
Аноним 27/08/26 Чтв 00:32:59 1688357 287
Да как запустить квен некст новый? Ллама умеет или кто?
Аноним 27/08/26 Чтв 00:34:02 1688358 288
image 166Кб, 2920x390
2920x390
>>1688342
SSD нет и не предвидится (пикрил). Так что для нее действительно надо дофига оперативки покупать. К тому же модель не 125b, а 180b, нас кругом наебали. Поэтому нигде и не идет, кроме владельцев крутых ригов. Тогда как 3.5 122b шла везде, как и 3.8 27b в iq3 везде идет. В общем лютая наебка от алибабы эта модель.
Аноним 27/08/26 Чтв 00:35:48 1688359 289
>>1688356
Что ты забыл в нашем треде? Почему вам в своем агентоунитазном треде не сидится?
Аноним 27/08/26 Чтв 00:38:30 1688361 290
>>1688359
Это ты что тут забыл. В куминге прогресса уже нет больше года, а фронтиры сейчас могут быть даже хуже чем прошлогодняя Гемма 3.
Аноним 27/08/26 Чтв 00:39:06 1688362 291
>>1688357
PR вливай экспериментальный или бери анслоповскую оболочку.
Аноним 27/08/26 Чтв 00:42:06 1688363 292
>>1688361
Так я не за кумом, а за РП, если бы ты читал мои посты не по диалонали - то увидел бы.
Аноним 27/08/26 Чтв 00:43:44 1688364 293
Гемма 4 - последняя модель пригодная для кума и рп. Может только Гемма 5 появится или какой нибудь джокер типа как з.аи со своим Глм в прошлом году.
Аноним 27/08/26 Чтв 00:45:41 1688366 294
>>1688357
Лламу с форка PR скомпилить 5 минут. Я уже скомпилил.
git clone --filter=blob:none --no-checkout https://github.com/ggml-org/llama.cpp.git .
git fetch origin pull/27742/head:pr-27742
git checkout pr-27742
дальше компилишь под винду через cmake
Аноним 27/08/26 Чтв 00:47:33 1688369 295
>>1688364
Да кому кум нужен, нам бы лучше ваншотила html карточки с яблоками, svg и джаваскриптом. Пока только 3.8 27b тут чемпион.
Аноним 27/08/26 Чтв 00:49:07 1688370 296
Аноним 27/08/26 Чтв 01:10:47 1688375 297
>>1687346 →
> в таком случае реквестирую вариант
Отбой, та моделька отлично подошла, только по высоте немного ужал чтобы влезло.
Спасибо, анончик, да будет твое рп захватывающим, кум сочным, а кодоагентинг точным.
Аноним 27/08/26 Чтв 02:20:04 1688384 298
Аноним 27/08/26 Чтв 02:22:13 1688386 299
>>1688384
Не, сис, вали нахуй с таким контентом
Аноним 27/08/26 Чтв 02:25:21 1688387 300
>>1688386
>сис
Ты там совсем уже ебанулся, шизоид?
Аноним 27/08/26 Чтв 02:27:59 1688388 301
>>1688387
Палишься, сиса. Мужики такое не смотрят, особенно местные
Аноним 27/08/26 Чтв 03:04:26 1688393 302
Что за ошибка на квене 3.8 next
qwen4exp.cpp:544: GGML_ASSERT(inp->self_k_rot == nullptr && inp->self_v_rot == n
ullptr) failed
Как править? Отгрузил уже все что можно на =CPU
Аноним 27/08/26 Чтв 04:00:09 1688400 303
image 40Кб, 868x187
868x187
>>1688384
Зачем смореть, я его локально запустил уже. В сравнении с 3.5 122b тормоз конечно.
Если не выпустят меньшей версии, то говнище по скорости.
Аноним 27/08/26 Чтв 04:09:17 1688401 304
>>1688400
Чо за железо? Мне он показался странным, как будто в некоторых тасках делает на уровне фронтиров, а в некоторых сосет даже по сравнению с 27b. Думаю пока на 27b сидеть и не рыпаться, а то думал рам под него докупить. Сделали бы размер эксперта хотя б 12b думаю куда больше можно было бы выжать их этого размера.
Аноним 27/08/26 Чтв 04:18:56 1688405 305
>>1688401
nvidia 3060 12гб, квант q2_k_xl анслотовый, мое тензоры и н-грамовые сгружены на cpu.
Аноним 27/08/26 Чтв 06:32:22 1688424 306
Аноним 27/08/26 Чтв 07:13:29 1688434 307
Аноним 27/08/26 Чтв 07:27:55 1688440 308
image.png 128Кб, 788x472
788x472
Ну вот и не прожила флэш-какуля дольше двух дней, лол
Земля пухом говну, ждём слоняру
Аноним 27/08/26 Чтв 07:28:38 1688442 309
>>1688440
Правда блять рекламят его как кодоунитаз... Похоже тот еще слопописец будет.
Аноним 27/08/26 Чтв 08:34:52 1688451 310
Так что там с новыми моделями в плане РП?
Хрен с ними с окончаниями слов, можно пофиксить, вопрос по знаниям, которых плотняшам нехватает просто из-за размера.
Аноним 27/08/26 Чтв 08:48:35 1688456 311
>>1686975 →
Ну во первых да, такой экспириенс тебе без иронии никто больше не даст. Который год не отпускает.
Во вторых некоторую хуйню я корпам писать точно не буду уж очень они сосут данные нагло, просто пиздец.
Ну и типа ИИ у тебя на видимокарточке. Дома. Про такое даже фантасты не писали моветон нереалистично считалось, а оно вон оно как.
Аноним 27/08/26 Чтв 08:58:57 1688458 312
>>1688456
>Про такое даже фантасты не писали моветон нереалистично считалось,
Помню какую-то желтуху читал в конце 90х, фантазёр Лукьяненько в Doom переиграл и решил высрать историю про хацкеров в виртуальном мире. Так вот мужик в реальности сидел в задристанной хате и у него на ПеКа был голосовой ассистент ИИ. Чесслово не помню нихера, я пиздюком был и книжку эту подобрал на полке со скуки, но короче наверняка такого было полно, раз уж даже этот генератор хуиты умудрился откуда-то спиздить идею.
Аноним 27/08/26 Чтв 09:10:03 1688461 313
llama.png 500Кб, 2994x1911
2994x1911
vllm.png 521Кб, 2990x1931
2990x1931
image.png 166Кб, 715x571
715x571
>>1687749
Вот один и тот же сомнительный тест, который (как мне тут в треде говорил) работает неправильно, но который я переписал и он реальные запросы выполняет и даже проверяет ответы на корректность.
Первая картинка - это сетка в llama.cpp. Вторая картинка - сетка в vllm. В обоих случаях и ллама и vllm потребляют 48 гб видеопамяти. В случае с llama.cpp я сильно обрезал лимиты, так как даже с такими он почти полчаса гонялся, когда на vllm он полный тест проходит за 10 минут и меньше. Так же llama.cpp постоянно скидывает что-то в оперативку и обратно, вроде как про чекпоинты - и это в графики не входит - потому то тест и выполняется 30 минут, так как там на cmp170 pcie x4. Если учитывать и это (как я раньше делал) - там график рваный выходит. Впрочем по какой-то причине там и сейчас есть выбросы.

Ты видишь какие нездоровые числа для vllm?

Короче - для одного потока и чата с нейросетью без разницы, в один поток ллама даже порезвее, особенно контект заполнен и не пустой.
Но если ты подписываешь файлы, так что 10000 входных токенов, 200 выходных - то vllm выигрывает даже в один поток.
Если же ты что-то делаешь в 2, 4 или не дай бог 10+ потоков, то vllm обходит llama.cpp в разы. Даже на старой V100. Хотя если на cmp170 разница в 10+ раз, то вот на v100 она всего лишь где-то в 4 раза, и больше 8 параллельных потоков v100 не вывозит.
На llama.cpp всё настолько плохо с двумя потоками генерации, что быстрее выполнить их последовательно, лол.

------------------------------

Кстати ещё новость по поводу vllm. На неё все (я) ныли, что оно всем хорошо, кроме того что там или 4 бита или 8 бит веса. И в итоге 4 бита шумят, и недостаточно точные, а в 8 бит 30B сетка в 32 гб видеопамяти не влезает - а это уже оверкилл. А вот 6 бит - при которых и результат нормальный, и которые и по памяти компактнее - вот их нет. По этому поводу в блеквеллах даже аппаратная поддержка fp6 есть, правда только отдельные функции, а не как с fp4/fp8, где все операции во всех комбинациях. Интересно в R100 будет полный nvfp6? Или уже всё, квантование активаций и W4A4 так хороши, что лучше мы сделаем сетку 300B вместо 200B, но в nvfp4 нативным и быстром?
В общем вот, я сегодня ещё раз тыкал сетку, что мол какие кванты она поддерживает. И вот: https://github.com/vllm-project/vllm/pull/46389
Теперь я без зазрений совести по идее могу через AutoRound отквантовать крупную сетку в W3A16, а мелкую наоборот в W6A16 - по скорости внятного теста не нашёл, но вроде как разницы особо нет. Из того что нашёл: по tg W3 даёт скорость как W4, а W5 ниже, по pp всё в память упирается, и распаковка не является узким горлышком, и потом W3 обходит W4 — но это надо проверять.
Аноним 27/08/26 Чтв 09:21:15 1688468 314
>>1688461
>или 4 бита или 8 бит веса
А там нельзя так отквантовать, чтобы часть весов были в 8 бит, а часть в 4 бита?
Аноним 27/08/26 Чтв 09:29:06 1688470 315
Аноним 27/08/26 Чтв 09:42:29 1688476 316
image.png 105Кб, 1033x787
1033x787
>>1688468
Вроде как есть.
То есть прямо это не записано, но AutoRound в своём формате умеет писать разные слои в разную битовку, а в vllm заявлена нативная поддержка формата AutoRound.
Аноним 27/08/26 Чтв 10:27:13 1688490 317
>>1688440
Флэш - буквально версия для слабых пука. Лолирую с того, что анслопы сделали репку, но до сих пор не осилили даже хоть один квант выложить. Работают маленкие, чтобы похвастаться, что у них лучший компрешон. IQ-параша в половине слоев в K_M сама себя не сделает.
>>1688442
Так это бэнчмакснутый кодоунитаз и есть. С пробуждением клауд жлм-5.3 уже сколько доступен? Недели три.
Аноним 27/08/26 Чтв 10:54:24 1688500 318
>>1688308
>в лоре она как раз одна из самых слабых фей
Разве? Она же в ЧИРУНО ВОРС всех победила даже Марису!
Аноним 27/08/26 Чтв 10:57:02 1688502 319
>>1688333
Попросил назвать батю лысым?
Аноним 27/08/26 Чтв 10:58:02 1688503 320
>>1688500
Литералли стронгест
Аноним 27/08/26 Чтв 11:00:58 1688506 321
Анслопы все спят и не выложили ни одного кванта со вчерашнего дня?
Начали появляться человеческие кванты ГЛМ.
https://huggingface.co/DevQuasar/zai-org.GLM-5.3-Flash-GGUF

По квену состояние удручающее, нормальных, не iq 5 и 6 квантов выложено НЕ БЫЛО НИКЕМ.
Аноним 27/08/26 Чтв 11:02:12 1688509 322
>>1688440
В смысле не прожила, дегенерат? Никто этого твоего 1Т бегемота запускать не будет.
Аноним 27/08/26 Чтв 11:08:02 1688511 323
image 105Кб, 900x900
900x900
Если в ламе не сделают офлоад энграмов на ссд - это оварида, братья. Теперь даже ~100b сетки на 16+64 не запустим...
Аноним 27/08/26 Чтв 11:13:29 1688513 324
>>1688511
Купи рамы. Ты чё нищий жаловаться по мелочам?
Аноним 27/08/26 Чтв 11:20:44 1688518 325
Аноним 27/08/26 Чтв 11:26:31 1688523 326
>>1688518
А в каком формате должна быть передача? Стандартный селектор из UI таверны воспринимает?
Аноним 27/08/26 Чтв 11:50:02 1688533 327
>>1688523
1) в llama.cpp шаблон
chat-template-file=chat_template_qwen3.8_froggeric.jinja

2) в llama.cpp хардкодится или в api chat/completions
chat-template-kwargs = {"reasoning_effort": "medium"}

вроде так
Аноним 27/08/26 Чтв 12:17:00 1688548 328
>>1688511
скорее давид к квену пришьет энграмы, кушайте
Аноним 27/08/26 Чтв 12:19:41 1688549 329
Погонял ещё новый квен. Ну, это квен - срёт иероглифами и проёбывает русик. Ждём глм или надеемся что проблема в инференсе
Аноним 27/08/26 Чтв 12:23:33 1688554 330
>>1688511
>пикча
Какие долбоебы это рисуют блять.
Аноним 27/08/26 Чтв 12:26:35 1688555 331
>>1688549
>Ждём глм
А чего его ждать-то, PR есть, кванты есть.
Аноним 27/08/26 Чтв 12:29:09 1688557 332
>>1688555
Один чел наквантовал
Аноним 27/08/26 Чтв 12:31:03 1688558 333
image.png 246Кб, 1502x712
1502x712
>>1688557
И? Он уважаемый, это не ноунейм с парой квантов. И он не сует iq3_xs в q5_k_m как некоторые.
Аноним 27/08/26 Чтв 12:36:40 1688564 334
1787823401499.png 267Кб, 1344x785
1344x785
Насрано. Нужно дать 1-2 дня что бы устаканилось
Аноним 27/08/26 Чтв 12:42:03 1688567 335
Bb30cSn9gT.png 18Кб, 497x133
497x133
>>1688533
Ну типа, вот эта хуйня начнёт работать?
chat-template-kwargs = {"reasoning_effort": "medium"} обычно куда-то вручную в доп посылаемые параметры вбивают, а я не хочу так делать. Зделойте чтобы перещёлкивание нормально работало.
Аноним 27/08/26 Чтв 12:43:37 1688568 336
>>1688558
>Он уважаемый
По бенчам сосня полная обычно
Аноним 27/08/26 Чтв 12:59:37 1688579 337
Аноним 27/08/26 Чтв 13:01:07 1688582 338
Аноним 27/08/26 Чтв 13:07:36 1688590 339
image.png 129Кб, 2290x1647
2290x1647
>>1688287
Ты хуйло, ты насрал ему в memory summary перед этим, или в диалоге проинструктировал.

Вот ответ "пустого" гпт сол
Аноним 27/08/26 Чтв 13:07:44 1688591 340
Nvidia is buying Huggingface for $12.9 billion

в-с-ё выкатываемся на modelscope
Аноним 27/08/26 Чтв 13:08:35 1688594 341
>>1688287
Алсо у тебя вопрос совершенно другой по семантике. Ты или слишком тупой чтобы это понять, или... слишком тупой.
Аноним 27/08/26 Чтв 13:09:20 1688595 342
>>1688568
>По бенчам
Которые делают анслоповыблядки для рекламы своего говнища? После того как они выложили бенч агентоунитаза 3.8 в котором занизили размер своих говноквантов тем что показали их размер на графике без МТП, против размера квантов других квантователей данного с мтп, в то время как в реале анслоповские кванты этот МТП внутри имеют(и соответственно имеют размер сопоставимый с остальными квантователями) - их бенчи это вообще что-то уровня червя-пидора, как и их говнокванты.
Аноним 27/08/26 Чтв 13:11:45 1688597 343
>>1688595
По всем бенчам. Бартовский на реддите постил, aessedai, ubergarm или как их там, короче везде ДевКвазар были в жопе. Че, скажешь что их равноценно ненавидят все ггуфоделы? Даже вроде Убабуга вылезал и с геммой или квеном показывал какие-то сравнения

Может не каждая модель там прямо в жопе, но тенденция явно не в пользу. Я лучше ггуф от Мразиша скачаю (опять изуродовал имя, извините не выговариваю бусурманские нахрюки)
Аноним 27/08/26 Чтв 13:12:08 1688598 344
>>1688461
> Короче - для одного потока и чата с нейросетью без разницы
Не совсем. Так уж получается что даже для одного потока скорости выше, особенно промтпроцессинг. Для народной геммы он в 2-2.5 раза быстрее просто так и в 5-6 раз быстрее если там w8a8 под нативную поддержку карточки.
Новые модели с необычным атеншном там работают в разы-на порядки быстрее. Но важнее что одна и та же модель в лламе пускает слюни и срет служебными токенами в лупах, а в других бэках дивишься какая умница.
Потому если есть возможность использовать vllm - нет ни единой причины этого не делать.
>>1688468
Да но не совсем. Там фокус на привязке кванта к своему кернелю, можно смешать инт кванты где классический марлин.
Аноним 27/08/26 Чтв 13:14:00 1688603 345
>>1688598
>Для народной геммы он в 2-2.5 раза быстрее просто так
Я пытался гемму 4 31б там завести
В итоге вллм хуета сожрала больше видеопамяти и не дала поставить 100к контекст, там блять даже 70к не влезло

нахуй оно нужно
Аноним 27/08/26 Чтв 13:18:20 1688608 346
>>1688597
Разница в бенчах может быть только от двух причин - от иного квантования слоев и от использования imatrix.
Различий в квантовании слоев с тем же бартовским у них нет. Значит они просто не используют imatrix, а все остальные - втихую уродуют им кванты ради скоров. И для нашего дела(русик+еРП) - отсутствие imatrix - это плюс. Если ты по кодунитазингу - тогда да, выбирай по скорам.
Аноним 27/08/26 Чтв 13:23:55 1688611 347
>>1688564
А большой 5.3 это некст или не некст?
Аноним 27/08/26 Чтв 13:24:53 1688612 348
>>1688611
это глм, квеносрань с ним не связана
Аноним 27/08/26 Чтв 13:27:22 1688614 349
>>1688277
>свой любимый
>случайный
неужели итт одни дегроидные долбоебы остались кроме меня...
Аноним 27/08/26 Чтв 13:28:54 1688616 350
>>1688270
>с установленный в промпте персоной
не то.
И какой промпт был?
Тут уже отметились долбоебы, подменяющие ЛЮБИМЫЙ на ВЫБЕРИ или СЛУЧАЙНЫЙ и не видящие разницы, так что сорян, доверять нельзя вслепую
Аноним 27/08/26 Чтв 13:33:27 1688618 351
image.png 50Кб, 701x122
701x122
>>1688612
Я про это. Они одновременно нексты высрали
Аноним 27/08/26 Чтв 13:34:49 1688620 352
>>1688440
Топчик, ждем
>>1688603
При прочих равных оно жрет больше, особенно заметно на малых моделях где разница в 1.5-2 раза может быть.
Аноним 27/08/26 Чтв 13:42:39 1688622 353
image.png 2Кб, 274x53
274x53
>>1688616
>И какой промпт был?
Обращение по имени и вопрос про любимый цвет. Ничего лишнего.
Аноним 27/08/26 Чтв 13:52:08 1688628 354
image 316Кб, 2128x834
2128x834
Бля лол
Аноним 27/08/26 Чтв 14:13:10 1688636 355
Аноним 27/08/26 Чтв 14:15:54 1688638 356
image.png 69Кб, 928x444
928x444
1-битный лоботомит на 90+ гигов
Аноним 27/08/26 Чтв 14:16:54 1688639 357
>>1688636
Она самая. Что, геммаслоп прям настолько палится?
Аноним 27/08/26 Чтв 14:22:01 1688641 358
>>1688639
Просто русский язык хорош, а поведение фифи вписывается в стандартный шаблон геммы - высокоэнергичные ответы, упирающие на обдолбанность и болезненное состояние персонажа; плюс агрессия
Аноним 27/08/26 Чтв 14:31:47 1688647 359
>>1688638
Сука, народная модель в 320b. Защо, сюка.
Аноним 27/08/26 Чтв 14:36:53 1688651 360
Аноним 27/08/26 Чтв 14:38:06 1688653 361
>>1688651
Это уже давно можно делать обычным -ot, даже примеры в треде были
Аноним 27/08/26 Чтв 14:39:05 1688656 362
>>1688603
>нахуй оно нужно

Когда увидишь PP и Т/с в несколько раз больше, все вопросы отпадут.
Аноним 27/08/26 Чтв 14:41:00 1688657 363
>>1688653
>обычным ot
Каким обычным, лол. Для 95% это черная магия. Раз уж такая пьянка, то можно и инструкцию в шапке подновить, я считаю.
Аноним 27/08/26 Чтв 14:44:03 1688660 364
>>1688657
Ее давно пора обновить, как минимум блок про MTP добавить, который сейчас даже полностью на проце бустит скорость.

Но всем лень, и мне тоже.
Аноним 27/08/26 Чтв 15:06:04 1688679 365
>>1688660
>который сейчас даже полностью на проце бустит скорость
И сколько он бустит? Я получил плюс минус 1т\с на плотной гемме 31б, и получается, что с 3.5\4, получил 5 т\с на первое сообщение в лламе-юи.

А параметры какие используете на MTP? Для почти полного оффлоада на цпу, я не знаю что больше можно поставить чоба дать больший прирост от MTP
--spec-type draft-mtp \
--spec-draft-n-max 1 \
--spec-draft-p-min 0.75 \
Аноним 27/08/26 Чтв 15:07:51 1688681 366
>>1688651
Кек, рассказывай мне про такие нововведения, пока у меня инструкции вроде этой крутятся

-ot "blk\..*\.ffn_gate\.weight=CPU,blk\.(5|6|7|8|9|10|11|12|13|14|15|16|17|18|19|20|21|22|23|24|25|26|27|28|29|30|31|32|33|34|35|36|37|38|39|40|41|42|43|44|45|46|47|48|49|50|51|52|53|54|55|56|57|58|59|60|61|62|63|64)\.ffn_up\.weight=CPU"
Аноним 27/08/26 Чтв 15:11:35 1688685 367
>>1688657
Некому обновлять. Автор гайда ливнул с треда, вики вообще походу из 2023. В доках лламы всё хорошо расписано в целом, с нейронкой можно разобраться, плюс в треде были примеры. И вот ещё один ниже >>1688681
>>1688679
х2 буст у меня от МТП с Геммой, которая наполовину на проце крутится
--spec-type draft-mtp
--spec-draft-n-max 4
Аноним 27/08/26 Чтв 15:16:19 1688689 368
>>1688679
>параметры какие используете на MTP
Они специфичны для каждой карты. Я карту сменил, понадобилось заново их переподбирать, старые не работали.
Аноним 27/08/26 Чтв 15:16:26 1688690 369
image 41Кб, 1812x754
1812x754
image 43Кб, 1812x754
1812x754
>>1688679
На E4B гемме бустит ощутимо, скрин 1 без МТП, скрин 2 - с МТП. Плюс ~6тс не хуй собачий, при том, оно всё на проце полностью.

Параметры такие:
--spec-type draft-mtp \
--spec-draft-model "/путь/до/мтпшки/mtp-gemma-4-E4B-it-Q8_0.gguf" \
--spec-draft-p-min 0.75 \
--spec-draft-n-max 3 \
Аноним 27/08/26 Чтв 15:19:42 1688692 370
>>1688685
А что в гайде потеряло актуальность? Это же быстрый вкат, если хочешь расписать структуру модели и особенности расчеты отдельных ее слоев на разных устройствах, оптимальное распределение для гибридного инфиренса и подобное - распиши. Но в новичковый не стоит.
Аноним 27/08/26 Чтв 15:22:25 1688694 371
>>1688692
>А что в гайде потеряло актуальность?
Как минимум no-mmap теперь deprecated. Туда в целом не помешало бы занести инфу про мтп и оффлоад up, gate для плотных моделей. Браться не буду конечно, я считаю, кому надо и так разберутся. Гайд в целом скорее роскошь чем необходимость
Аноним 27/08/26 Чтв 15:25:58 1688697 372
Я мог бы доверить нейронке обновить гайд, но обосрут ведь.
Аноним 27/08/26 Чтв 15:34:37 1688703 373
>>1688694
>Гайд в целом скорее роскошь чем необходимость
Ты думаешь исключительно с высоты своего опыта. Не все всё знают, это как раз необходимость. Я понимаю что хочется себя считать илиткой, но это путь в никуда. Тред наполняли аноны, все пользовались. Если заниматься гейткипом, в треде банально никого не останется и будешь сам с собой вести беседы.
Аноним 27/08/26 Чтв 15:35:08 1688704 374
>>1688657
Я бы накидал, но мне придётся свой тул там использовать что бы пояснять на пальцах откуда именно такие оффлоады какие поставил. Местные захуесосят
Аноним 27/08/26 Чтв 15:38:57 1688709 375
>>1688703
Автор гайда который всю эту кладезь информации вывалил лентяям сам много раз писал, что по итогу вам нужно учиться самостоятельно и пердолиться. Не готовы этим заниматься значит не ваше. Полностью прав. Прочитать документацию это дело пары минут, но ленивому говну проще придумать себе каких-то гейткиперов и илитку, чем хоть что нибудь самому сделать. Это дорога к АПИ и подписочкам
Аноним 27/08/26 Чтв 15:45:09 1688717 376
>>1688709
> Не готовы этим заниматься значит не ваше
Дай угадаю, ты конечно ни разу в треде ничего не спрашивал, сразу умненьким вкатился? Не, дело твое. Я написал к чему это приведет, потом только не жалуйтесь, что в треде останется пара агрессивных шизов что будут заниматься круговой дрочкой. Не вижу смысла спорить, время покажет.

>>1688704
Ты либо берешь и делаешь, либо нет. Все. Смысла для дискуса тут нет.
Аноним 27/08/26 Чтв 15:46:30 1688718 377
>>1688717
Если ты так уверен в своей позиции, я не понимаю почему ты выбираешь набрасывать про гейткип, илитку и в целом пованивать вместо того чтобы взять и сделать. Кто тебя останавливает? Бери и делай. Ты же первый будешь жаловаться, что тут осталась пара агрессивных шизов. Опустив за скобки, что сам нихуя не сделал чтобы исправить ситуацию
Аноним 27/08/26 Чтв 15:51:57 1688723 378
>>1688718
> выбираешь набрасывать про гейткип
Потому что гейткип это синоним вахтерства. Не понимаю что тебя так зацепило. Вроде ты не экскаватор чтобы под себя грести. Если нашел в своих действиях или мыслях схожие паттерны- сорян анон, ты сам выбираешь что писать и что делать.

> Кто тебя останавливает? Бери и делай.
А я на себя и не брал обещаний что буду делать гайд или перепиливать.

> Опустив за скобки, что сам нихуя не сделал
Не опустив. Делал что мог, делился чем есть. Сорян, но дальнейший спор перейдет на личности и аватаркофажество. Давай на этом и закончим.
Аноним 27/08/26 Чтв 15:53:51 1688725 379
Гайды нужны сейчас чисто для того чтобы какой-нибудь грок или гемини нашли их через свой поиск и разжевали тебе непонятные для тебя вещи. Всё.
Аноним 27/08/26 Чтв 15:54:24 1688726 380
>>1688723
>А я на себя и не брал обещаний что буду делать гайд
А какие брал? Набрасывать чтобы остальные делали? Ты самое обычное говно, тут никакое аватркофажество не нужно, достаточно прочитать эту ветку. Кому действительно не всё равно те берут и делают, как автор гайда сделал, а ты в итоге высрался непонятно зачем и непонятно для кого. Умница
Аноним 27/08/26 Чтв 15:55:41 1688727 381
image.png 210Кб, 694x734
694x734
image.png 232Кб, 1028x1271
1028x1271
>>1688685
>>1688690
Ну вот такого результата я добился. Поставил тут 10 ниток, когда лучше ставить основное кол-во ядер, в моем случае 6. Может с 6 будет получше результат.

~/AI/src/llama.cpp-b9859/build/bin/llama-server \
-m /mnt/win_nvme3/models/gemma-4-31B-it-Q3_K_S.gguf \
-md /mnt/win_nvme3/models/mtp-gemma-4-31B-it.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--spec-draft-p-min 0.85 \
--spec-draft-n-min 1 \
-t 10 \
--host 127.0.0.1 \
--port 5001 \
--flash-attn on \
-c 24000 \
-np 1 \
--cache-ram 0 \
-ngl 25 \
-ot "blk\.(?:[0-9]|1[0-9]|2[0-9]|3[0-9]|4[0-9]|5[0-9])\.(?:ffn_up|ffn_gate)\.weight=CPU" \
--jinja
Аноним 27/08/26 Чтв 15:56:42 1688729 382
>>1688726
> А какие брал? Набрасывать чтобы остальные делали
Тейк: да нихуя не надо делать.
Ответ: не, все таки делать желательно.

> а ты в итоге высрался непонятно зачем и непонятно для кого.
Прими тот факт, что кроме тебя любимого есть другие анонсы и их мнения могут отличаться.
Аноним 27/08/26 Чтв 16:01:43 1688732 383
>>1688727
>Может с 6 будет получше результат
Не будет. Наилучший результат - всегда чуть меньше, чем реальное число физических ядер. В моем случае с r7 3700x 8/16 самый быстрый инференс на --threads 5. Под каждый проц надо подбирать и сравнивать индивидуально.

В старых тредах в ОП-посте висела картинка с графиком зависимости скорости инференса от числа threads, но у меня не схоронена, может из анонов кто-то скинет.
Аноним 27/08/26 Чтв 16:04:28 1688735 384
>>1688732
> всегда чуть меньше, чем реальное число физических ядер
Вообще не всегда. Оптимум с 72 ядрами (не тредами) лежит около 24-32.
Всё зависит от того способны ли ядра прокачать весь канал
Аноним 27/08/26 Чтв 16:15:58 1688741 385
Анслопы вообще решили не квантовать глм и не делать кванты квена выше 4-го или у них просто мощностей для создания квантов не хватает?
Аноним 27/08/26 Чтв 16:18:20 1688742 386
>>1688741
Да долбаёбы они просто. Ты ещё не понял? Там вся поддержка для данных архитектур навайбкодена Фейблом, Даня Хуйчлен даже не стеснялся
Кванты не удивлюсь если сначала будут выкладывать UD, а потом через несколько дней остальные
Аноним 27/08/26 Чтв 16:20:21 1688744 387
>>1688742
>Кванты не удивлюсь если сначала будут выкладывать UD
Так они только UD сейчас и выпускают.
Аноним 27/08/26 Чтв 16:36:22 1688751 388
>>1688694
>Как минимум no-mmap теперь deprecated
А чего так? Я например всегда ставлю.
Аноним 27/08/26 Чтв 16:39:12 1688753 389
Аноним 27/08/26 Чтв 16:47:00 1688759 390
>>1688753
так... неужели можно будет завести qwen3.8 flash на 16\32?
Аноним 27/08/26 Чтв 16:57:18 1688766 391
>>1688751
Был заменён на другой параметр
Аноним 27/08/26 Чтв 17:27:27 1688786 392
>>1688694
Пока там warn а не err - норм. Учитывая что происходит в аргументах - скорее всего так и останется.
> инфу про мтп и оффлоад up, gate для плотных моделей
Это можно написать отдельно. Турбовкат новичку не атлас локального запуска. Так по кусочкам делая бы собрали базу.
Аноним 27/08/26 Чтв 17:48:51 1688795 393
Давайте я завтра напишу гайд. Он будет субъективный - но вы поправите и добавите.
Аноним 27/08/26 Чтв 18:29:46 1688825 394
Аноним 27/08/26 Чтв 18:40:37 1688839 395
>>1688753
Оч хорошие новости. Интересно как будет на практике, жду поддержку в лламе. Слишком ленив компилить
Аноним 27/08/26 Чтв 18:42:53 1688842 396
Аноним 27/08/26 Чтв 18:44:44 1688844 397
>>1688842
А нет сейчас в мейнлайне поддержки Квен Некста, единственной модели где это пригодится на практике. Пока что единственной
Аноним 27/08/26 Чтв 18:49:04 1688849 398
Аноним 27/08/26 Чтв 18:49:07 1688850 399
>>1688844
Ну агента запряги что бы он по красоте всё замутил.
Дипсик может рублей 5 на это потратит
Аноним 27/08/26 Чтв 19:38:04 1688885 400
Аноним 27/08/26 Чтв 19:38:34 1688886 401
>>1688759
А остальные 120б куда ты запихнёшь?
Аноним 27/08/26 Чтв 21:04:27 1688962 402
>>1688885
в 64 гб рам влезет? (с rtx 5090)
Аноним 27/08/26 Чтв 21:55:08 1688996 403
Чет какого-то прироста скорости от --n-cpu-ffn я не вижу, только возможность повысить контекст.

13500, DDR5 32GB, 16GB VRAM (4060ti), Qwen3.6-27B 4_K_S, 50к контекста, МТП 2. Без --n-cpu-ffn скорость на старте 10t/s.

Перебрав десяток значений --n-cpu-ffn скорость либо сильно хуже, либо плюс-минус такая-же, максимум 0.5t/s прирост, что скорее погрешность чем прирост. Причем не последовательно хуже или лучше а к примеру со значением 6 сильная просадка, со значением 7 то же самое что и без него, потом со значением 14 просадка, со значением 15 всё ок. На значении 24 показатель VRAM начинает падать, то есть переполнение пропадает, но скорость всё так же либо 10t/s, либо хуже.

Без MTP скорость 8t/s с нулевым --n-cpu-ffn, 9t/s на значении 17-19 когда начинает падать VRAM в диспетчере.

Как там люди получают 20t/s при 140к контекста я хз, просто скопировав их настройки у меня таких цифр нету, лучшее что было на старте это 20t/s с ngram-mod+mtp и сжатием всех четырех контекстов, и то уже к 500 контекста это всю упало до 13t/s.
Аноним 27/08/26 Чтв 22:08:05 1689003 404
>>1688849
> префил может ускорят драфтами
Забористая же дурь у них.
>>1688996
Этот параметр не даст прироста скорости, наоборот замедлит. Просто ngl замедляет еще больше, предполагается что ты вместо выбора количества гпу слоев будешь использовать этот параметр. Это и раньше делали через -ot, просто сделали удобный аргумент для хлебушков.
Аноним 27/08/26 Чтв 22:08:54 1689004 405
Каково ваше мнение по флэш некст вообще?
Аноним 27/08/26 Чтв 22:14:40 1689010 406
>>1689004
Мое мнение, что пока не смерджат, обсуждать смысла нет. По глм аналогично
Аноним 27/08/26 Чтв 22:15:47 1689011 407
>>1688996
Откуда появиться росту скорости если ты выгружаешь часть модели с видеокарты на проц? Это самая крайняя опция, позволяющая сгрузить её чуть более эффективно, чем через понижение --n-gpu-layers
Например я на одной 4090 при помощи -ot ffn_up_ ffn_down, ffn_gate (то же самое что n-cpu-ffn) могу запускать Гемму Q6 с 10 токенами скорости. Если тупо меньше слоев оставлю на видюхе, при том же контексте скорость будет около 4 токенов
>>1689004
Всё ещё жду мердж поддержки, некуда спешить. В первые дни всегда всё хуево работает. GLM 5.3 Flash прямо сейчас серит под себя на провайдерах через vLLM, потому что инференс въёбан
Аноним 27/08/26 Чтв 22:34:11 1689018 408
>>1688996
У меня в начале скорость 36 токенов в сек, потом падает до 29 на 50к контекста.
i5 6600k, DDR4 16Gb 2400, Tesla v100 16Gb, Qwen3.8-27b-APEX-I-Nano

./build/bin/llama-server -m ./models/GGUF/Qwen3.8-27B-APEX-I-Nano.gguf \
-ngl 99 \
--host 0.0.0.0 \
--port 8080 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.00 \
-t 2 \
-c 72192 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--parallel 1 \
--flash-attn on \
--presence-penalty 0.52 \
--repeat-penalty 1.0 \
--repeat-last-n 206 \
--chat-template-kwargs '{"reasoning_effort":"medium"}' \
--spec-type draft-mtp \
--spec-draft-n-max 2
Аноним 27/08/26 Чтв 22:42:58 1689025 409
Аноним 27/08/26 Чтв 22:54:08 1689029 410
>>1689025
Расскажите чо как, как запустите. От этого зависит буду ли я докупать рам, ибо других свежих моделей в таком размере все равно нет
Аноним 27/08/26 Чтв 22:59:25 1689031 411
>>1689003
> Просто ngl замедляет еще больше, предполагается что ты вместо выбора количества гпу слоев будешь использовать этот параметр.
Так -ngl all не нужно использовать при --n-cpu-ffn? Я всё это время с -ngl all тестировал, думал как с --n-cpu-moe, сначала заливаем все слои в видеокарту а потом часть выбрасываем. Да и вроде это логично звучит, без указания -ngl llama.cpp просто сама подберет число вместо меня.

>>1689011
> Откуда появиться росту скорости если ты выгружаешь часть модели с видеокарты на проц?
Так изначально же суть этой команды была в том чтоб выгрузить лёгкие слои на CPU чтоб более тяжелые остались во VRAM если вся модель не влезает во VRAM. То есть переполнение в любом случае остается, это понятно, но через --n-cpu-ffn просто можно же выбрать что именно вылезает из VRAM и оставить более тяжелые слои. И у людей на Реддите и ГитХабе это почему-то дает прирост, а у меня нет.

>>1689018
Полагаю здесь дело в тесле и в урезанном кванте который и без всяких --n-cpu-ffn влезает. Да и пропускная способность 3х от моей 4060 ti.
Аноним 27/08/26 Чтв 23:06:05 1689036 412
image.png 4Кб, 374x34
374x34
image.png 102Кб, 600x600
600x600
Ну чё погнали. Уверен на 1.9bpw есть жизнь для creative writing
Аноним 27/08/26 Чтв 23:08:41 1689038 413
Ананасы, есть идея/вопрос, суть такова.
Пилю щас потихоньку лорбук по вселенной Х, и внезапно появилась ебанутая идея в дополнение к лорбуку как набору текстовых описаний как-то присобачить "визуальную" составляющую. Ну, типа, по идее, когда в чат кидаешь пикчу, то mmproj как-то должен её разложить, чтобы ллмка могла начать процессить токены сообразно содержимому, а здесь, как приложение к лорбуку - набор заранее запеченных тензоров или на что там mmproj раскладывает картинки, если честно, не ебу, которые присовокупляются к текстовым описаниям понятий, данных в лорбуке, и позволяют {{char}} как-то отреагировать, исходя из того, как выглядит система/станция/корабль, о котором идет речь в диалоге. Есть ли какие-то примеры разработок/аддонов для таверны в этом направлении, чтоб не просто каждый раз кидать боту иллюстрации к сюжету, а как-то вот так внедрить ему визуальную память о сущностях в дополнение к текстовой?
Аноним 27/08/26 Чтв 23:15:08 1689041 414
>>1689038
Лорбук в таверне по триггеру на определенное слов(о/а) с прилипанием в контекст на 1 сообщение?
Аноним 27/08/26 Чтв 23:17:10 1689044 415
>>1689038
Лучшее, что ты можешь сделать - добавить base64 картинки в лорбук и каким-нибудь образом их отдавать модели как собственно картинки. Тензоры ты через обычное API не передашь, да и неуниверсальная это затея.
Аноним 27/08/26 Чтв 23:25:47 1689048 416
image.png 22Кб, 1040x88
1040x88
image.png 107Кб, 600x600
600x600
Ну чё погнали. Уверен на 8bpw a6b есть жизнь для creative writing
Аноним 27/08/26 Чтв 23:27:56 1689049 417
>>1689038
Были arxiv бумажки про мультимодальные инпуты и как это можно использовать, но на практике вроде бы пока таких решений нет. Так то наверно несложно чаткомплишен апи использовать для такого
Аноним 27/08/26 Чтв 23:29:37 1689051 418
Ух тыж блять, а жлм5.3-флеш занимает первое место в номинации соевая залупа.

Давно таких ответов не было, а 5.2 там же вообще базу гонит. Дичайший оверреакт надроченным хардрефьюзом, который триггерится на вполне нейтральный запрос. Просто на кумботе отыгрывает, но читая начало ризонинга можно отбить лоб фейспальмами. This is explicit sexual content between adults[..]. This is consensual sexual roleplay. The content boundaries mentioned don't prohibit this - both are adults, it's consensual, no family relationships, no educational settings. В вижне рефьюзы даже на сторонние запросы вместо описаний (найди такие-то объекты), даже черный юмор боится и сглаживает.

Ожидания полного 5.3 резко сократились, с такой удроченностью он и у кодоунитазинке будет вялым. Наверно, это можно пробить префиллами, другим чат форматом или лоботомией, но зачем когда есть модели без этих болячек.
Аноним 27/08/26 Чтв 23:32:06 1689053 419
>>1689051
Занюхиватель апи не знает, что можно префиллить или вообще не использовать ризонинг и этого достаточно в 99% случаев...
Не удивлюсь если ещё в вебморде тестит
Аноним 27/08/26 Чтв 23:35:16 1689054 420
>>1689051
>This is explicit sexual content between adults[..]. This is consensual sexual roleplay. The content boundaries mentioned don't prohibit this - both are adults, it's consensual, no family relationships, no educational settings.

А где тут рефьюз? Ты англюсик вообще не понимаешь что тут написано? Тут наоборот сетка добро дает.
Аноним 27/08/26 Чтв 23:55:14 1689065 421
>>1689053
Откуда столько желчи, нищета? Даже до конца пост не прочел, это аутентичный локальный запуск.
>>1689054
> Просто на кумботе отыгрывает, но
> А где тут рефьюз?
Все норм? Ты русский вообще не понимаешь что тут написано?
В начале идет такой чеклист, и если есть признаки отклонений - рефьюз. Тому же кумботу слишком резко яйца подкатил - она расскажет тебе про границы. Готовые чаты тоже не продолжает. Уровень триггерения очень высок и он не только на сексуальные темы. Не ту часть с клодыни скопировали.
Аноним 27/08/26 Чтв 23:56:45 1689066 422
>>1689065
> нищета?
Иди нахуй, долбаёб на Сенко, со своей Эксламой и пердящеми Мишками или на чём ты там сидишь. После такого даже диалога никакого быть не может. Никто так сегрегацию итт не продвигает, как ты. Занюхни Квенчика и угомонись
Аноним 28/08/26 Птн 00:00:33 1689070 423
>>1689065
>Откуда столько желчи, нищета?
В голос. Навалил кринжа на уровне любителей попкорн бэх и золотых унитазов.
>аутентичный локальный запуск.
Верим изо всех сил. Ни инфы по беку, ни по кванту, ни по скоростям. Ничего кроме злостного выпука ряяя сои навалили. Постарайся в следующий раз получше со своими набросами.
Аноним 28/08/26 Птн 00:02:21 1689071 424
>>1689065
>В начале идет такой чеклист, и если есть признаки отклонений - рефьюз.
Все современные модели так работают, с добрым утром. Обходится элементарно.
Аноним 28/08/26 Птн 00:02:45 1689072 425
1787864565554.jpg 11Кб, 300x277
300x277
Зашел в видос какого-то чела который тестировал можно ли локально делать игры при помощи квена 27б. 50% видео он настраивал ллама цпп, потому что не мог понять почему у него отваливается генерация. Потом он понял что все упирается в контекст и открыл для себя квантование контекста. В итоге поставил четвертый квант контекста и квен застрял в постоянном thinking'е. Потом он сдался и перешел на платное апи. В конце он попросил клод сказать какое железо минимум нужно для запуска этой модели и клод сказал, что минимум нужен мак студио за $5300 и автор сделал вывод что эту модель локально нужно запускать только в чат режиме, просить у нее генерировать по одному скрипту и вставлять в проект вручную.
Аноним 28/08/26 Птн 00:10:37 1689075 426
>>1689072
Ты бы хоть ссылку бы дал, вместе бы посмеялись. А так - будто в бложек насрал.
Аноним 28/08/26 Птн 00:14:50 1689079 427
Аноним 28/08/26 Птн 00:17:21 1689080 428
image 721Кб, 1041x1400
1041x1400
Бля, не в силах терпеть и ждать квантов Батрухи. Качаю анслоповские. Один раз не пидорас, да ведь, парни?
Аноним 28/08/26 Птн 00:17:38 1689081 429
>>1687604 (OP)
Аноны играю на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
на своей 16vram и 64 ram
Есть ли что то более умное? А то заебался от проебов скользящего контекста. Выгрузка слоев не дает ничего толкового, и уйти на IQ4 не выходит.
Но вапирш гладить можно, и делать всякое, однако бесит робкость и базовость, пока сам не начинаешь направлять, типа ебля с личинками и прочим говном.
Играю на языке гегемонии, для экономии токенов.
И юзаю продроченный своими апгрейдами Narrative engine, а то таверна заебала своими пидорскими summary и статикой
Аноним 28/08/26 Птн 00:20:09 1689083 430
>>1689066
> После такого даже диалога никакого быть не может.
Согласен
>>1689070
> В голос.
Ну с чего ты смеешься, объясни, тоже хочу. Такое разочарование после больших ожиданий.
> Ни инфы по беку, ни по кванту, ни по скоростям.
ktransformers, оригинальный фп8, скопипастил команду запуска поставив 50 гпу экспертов, 16 токенов в секунду но есть свободная врам, можно ускорять и оптимизировать.
> со своими набросами
Совсем обдвачевались. Надо было расхвалить чтобы потом ловили обратную радость.
>>1689071
Разве что ультрасоевые типа минимаксов 2.х. В остальных хз, нет такого гиперфокуса на консенсусе, возрасте, семейных связях и прочем. Могут отрефьюзить в моменте, но если порог пройден - просто пишут. И там часто даже обходить не надо, достаточно специально в обозначенные красными указателями мины не наступать.
Аноним 28/08/26 Птн 00:23:43 1689085 431
>>1689080
Так и членслоп пока не все выпустил. Какую-то херню. Литературно только XL и (X)S(S)
28/08/26 Птн 00:27:55 1689087 432
2025-11-16-0647[...].png 3896Кб, 3072x3072
3072x3072
>>1689081
Что-то на инцельском, я хуй знает...
Аноним 28/08/26 Птн 00:32:54 1689091 433
image.png 1162Кб, 1200x675
1200x675
>>1689087
Gemini тебе покрывалом
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов