Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 309 69 77
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №264 /llama/ Аноним 05/09/26 Суб 20:04:57 1696723 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
condom-for-b30-[...].jpg 4407Кб, 4000x3000
4000x3000
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1694457 (OP)
>>1692081 (OP)
Аноним 05/09/26 Суб 20:08:54 1696730 2
>>1696720 →
Год назад немотрон 49В немало шуму в нашем треде навел - нвидии удалось ужать ламу 3 70В без потери качества и врамцелы с 24 гб врам получили мощь плотной 70В в нормальной скорости в третьем кванте.
С тех пор правда немотроны испортились и стали кодоунитазами без задач.
Аноним 05/09/26 Суб 20:11:33 1696733 3
>>1696730
А причем тут покупка хф? Им не файлообменник для немотрона нужен, а площадка, где они будут продавать мощности своих карточек и прочих датацентров. Своих, а не амд и кто там еще ковыряется.
Аноним 05/09/26 Суб 20:11:46 1696734 4
image 131Кб, 945x379
945x379
6й квант геммы тоже сыпется, походу только восьмой нормальный. Впрочем у меня карточки такие себе, может в них дело
Аноним 05/09/26 Суб 20:14:49 1696737 5
1754666673277.jpg 277Кб, 1080x1080
1080x1080
>>1696630 →
Да это же ЛАПА-АТЕНШН!
>>1696705 →
> Всё остальное становится хуже.
Ну, не все из выходящих моделей съедобны, нужно использовать подходящие. Это так-то и к гемме применимо, у нее пусть иногда и память золотой рыбки, но зато старается развивать сюжет, а не коллапсирует под ноль как некоторые.
Тут агентная тренировка как раз идет на пользу, меньше внимания к повторениям прошлого, больше восприятия текущего и способность делать новое. Раньше вообще было пофиг что там в контексте (привет мистральсмолл), потом сильный перекос в ретроспективу и повторение успешного опыта после условных 60к, теперь как будто пришло в норму. Еще не идеально, но уже прилично если за чатом следить.
Вариативность - уже другое измерение, тоже важно но не имеет прямой корреляции.
> особенно мое
а4, камон, спасибо что вообще что-то когерентное дает.
> с постоянным пережёвыванием задачи со всякими "but wait"
Правильный формат и инструкции на ризонинг, промпты на него, опять же хорошие модели. Сейчас гибкость позволяет иметь минималистичный ризонинг на обычных вещах и увеличивать его только когда появляется что-то сложное. Раньше такого не было, или бесполезный блок где сразу пишется ответ и слово в слово перепечатывается оттуда, или огромное полотно неврастении.
Аноним 05/09/26 Суб 20:15:21 1696738 6
>>1696734
Чел, у тебя похоже обосрамс вообще по всем фронтам. Вот тебе принесли ориентир, пока так не будет проблема на твоей стороне. >>1696689 →
Аноним 05/09/26 Суб 20:19:19 1696743 7
>>1696730
На нём сидели только потому что выбора не было. Сейчас он пососёт и Квену 27 и Гемме 31.
>>1696734
Семплеры у тебя въёбанные, а может и разметка.
Аноним 05/09/26 Суб 20:20:36 1696744 8
>>1696738
Ну эт надо на тех же карточках тех же промптах тестировать. Восьмой квант меньше косячит, но мне по скорости не зашел, шестой багуется. Впрочем может на его карточках и шестой не сбоит
Аноним 05/09/26 Суб 20:59:20 1696780 9
>>1696734
пчел я тебе там ответил в прошлом треде. это проблема таверны. пробуй oobaboga textgen и ставь контекст 32768 (или любой другой) вместо 0, иначе сбросит в 8192.

и кстати
6 и 8 кванты меромеро хуже чем айкью4
можешь ещё апексы попробовать скачать компакт или куолити
Аноним 05/09/26 Суб 21:00:37 1696781 10
Аноним 05/09/26 Суб 21:02:15 1696782 11
>>1696780
пысы Маринара прекрасно дружит с meromero-26b-iq4_xs
и после Маринары не хочется даже смотреть в сторону Таверны
Аноним 05/09/26 Суб 21:04:40 1696786 12
>>1696781
Какой шизы брух, любой воспроизведёт этот баг в таверне с этим iq4_xs файликом. Перед тем как отвечать я взял и проверил - в таверне та же хуйня что и у него. Она говнит что-то в конфиге, я даже поковырял настройки - нихуя не помогат. В угабуге и маринаре все заебись.
Аноним 05/09/26 Суб 21:08:11 1696787 13
>>1696723 (OP)
Привет анон, я тот 16/64 пздос обновился, что снова обновляться который ходит и выпрашивает ну есть че получше.

Сделал пару тестов, может кому интересно.

Играл большую часть времени на Gemma-4-Dark-Gemistry-31B.i1-IQ3_XS.gguf
Где убрана repetiotion и так далее, так как это тюн сразу нескольких моделей и у нее идет свой voice заголовок.

Потом попробовал
G4-MeroMero-31B-uncensored-heretic.i1-IQ3_XS.gguf
Что интересно, она следовала больше нюансам, хоть и проябывалась в мелочках и уходило в жесткий луп и репитишн.

После дрочки понял, что запустил на движке, пресет от gemistry, который без как раз таки правок на это.

Я удивлен, что она как то больше внимания удиляет.
Например сидя в сортире для женщин служанок и наблюдая как дворецкие помогают телкам срать и сать в замке зимой без отопления, активно жмякая и сувая пальцы, моя компаньенша, сидя со мной на полу заметила, мол для наших 100lvl тел это вообще кек.

Склоняюсь теперь искать настройки под нее, однако немного последовательность хромает.
Аноним 05/09/26 Суб 21:10:13 1696788 14
>>1696782
> Маринара
А какой пресет выставляешь? У меня на универсальном начинается пиздец, приходится без него.
Да и часто юзаю режим imprisonate, а там каждый раз писать в чат вместо кнопки.
Аноним 05/09/26 Суб 21:16:45 1696795 15
Кстати, кто-нибудь пробовал здесь фронтенд Errata?
заточен более под писание книжек, чем рп, но фанатам ТОГО САМОГО может зайти.
У меня у самого гемма на скорости 13т\с пыхтит (12\64) и немного медленно но может более быстрые модели будут комфортнее. Там внутри куча агентных систем на держание истории и прочей мишуры.
Аноним 05/09/26 Суб 21:22:12 1696799 16
image 20Кб, 676x128
676x128
>>1696780
Интересно. Нашел баг репорт на эту тему, может заведется и в таверне с правками. Неохота фронтенд менять
Аноним 05/09/26 Суб 21:27:37 1696801 17
>>1696787
меромеро 31b iq3_m глупее чем 26b iq4_xs
думой

доказано моим бенчмарком в прошлом треде
Аноним 05/09/26 Суб 21:31:07 1696802 18
>>1696801
У меня есть такой
G4-MeroMero-26B-A4B-IQ4_XS.gguf
Играл на нем на таверне, пока не перекатился в задроченный движок для рп, попробую подобрать настройки, так как в репетишн уходит и внимание к деталям и связность хромает
Аноним 05/09/26 Суб 21:32:24 1696803 19
>>1696801
>доказано моим бенчмарком в прошлом треде
Собственно про хуи дроченные да, я когда глянул и прихуел с ответов, полез у себя настраивать >>1696802 но проиграл
Аноним 05/09/26 Суб 21:32:52 1696804 20
image 199Кб, 951x751
951x751
>>1696799
Вроде получше стало после смены режима
Аноним 05/09/26 Суб 21:32:54 1696805 21
>>1696799
Охуеть, в 2к26 всё ещё остались динозавры, сидящие зачем-то на тексткомплишне. Во заняться людям нечем.
Аноним 05/09/26 Суб 21:34:46 1696806 22
>>1696805
Шуманита сюда отгрузите, нужно срочно жир смыть
Аноним 05/09/26 Суб 21:47:37 1696815 23
image 221Кб, 967x707
967x707
>>1696780
Реально четвертый квант лучше рпшит, рофлан ебало. Спасибо за наводку
Аноним 05/09/26 Суб 21:51:16 1696817 24
>>1696804
бля эт скучный чар какой-то. аниме-говнина какая-то графоманская. раздевалась полгода блядь. советую прописать своего, иногда и пары строчек хватает. и в настройках дай инструкцию писать поменьше текста иначе ты просто выжрешь весь контекст.

меромеро лучше всего работает с таким шаблонон:
Actions: In plaintext
Dialogue: "In quotes"
Thoughts: In asterisks
далее укажи что чар должен дать ответ на предыдущее сообщение\на промпт и ответ должжен быть краткий: одно действие, одна фраза, одна мысль


но если тебе заходит овердохуя писанины на одно сообщение, включи суммаризацию в настройках если ещё не включена чтобы нить событий не терялась из-за обрезки контекста
Аноним 05/09/26 Суб 22:00:01 1696820 25
>>1696817
Да, потестирую разные карточки. В целом с контекстом проблем нет, я разогнал её на 80тпс/сек с 64к контекста. Долгие диалоги пока не пробовал вести
Аноним 05/09/26 Суб 22:06:23 1696822 26
>>1696817
>ответ должжен быть краткий: одно действие, одна фраза, одна мысль
Возьми трубку, там пигма звонит, хочет сказать "я тебя ебу" pygmalion nods

Сук, какой-то бред в треде пошёл. У одного экстрамаленький четвёртый квант солянки из 4б лоботомитов лучше, чем почти четвёртый плотной модели. Другой как-будто бухой результаты тестов пишет, не понятно, что хочет сказать (не осуждаю, вечер субботки, все дела). Кто-то убабугу притаскивает внезапно, кому-то текст комплишен стал бесполезен, другой инстракт правильно оформить не может. Эх.

мимо пошёл рпшить на немо при живой мое гемме
Аноним 05/09/26 Суб 22:13:10 1696827 27
>>1696822
>Сук, какой-то бред в треде пошёл. У одного экстрамаленький четвёртый квант солянки из 4б лоботомитов лучше, чем почти четвёртый плотной модели.
Сук а ты перестань мерять сообразительность модели ПЛОТНАСТЬЮ и БИЛИОНАМИ-ПОРАМЕТРАФ. Просто посмотри на результат. Можно плотно напичкать 40Б мусором и что в итоге? И нихуя.

Твой обоссаный мистрал немо даже не соображает о чём речь когда его спрашиваешь про два стула. Он даже блядь не понимает что стульев там два и что надо двоих человек усадить. И ты этим говном наслаждаешься и пасть раскрываешь в сторону моэ геммы4? Троллина.
Аноним 05/09/26 Суб 23:03:19 1696862 28
>>1696780
>это проблема таверны
Это проблема навыка. Лупы на гемме появляются из-за кривого шаблона разметки, я сам это много раз видел. Дефолтный шаблон скорее всего сломан по этому его нужно переписать и таверна дает это сделать. Шаблон сломан, а не таверна.

Энивей есть промт инспектор. Можно просто залезть туда и посмотреть что реально уходит в бек. Или в логах самого бека посмотреть что туда приходит. Вариантов дебага куча.
Аноним 05/09/26 Суб 23:06:05 1696863 29
>>1696862
А вот бы кто-то скинул рабочий шаблон, но таких нет. Те что я юзал, ломали режим Перевоплощения.
Аноним 05/09/26 Суб 23:11:40 1696872 30
>>1696863
>А вот бы кто-то скинул рабочий шаблон, но таких нет.
Я бы скинул, но не катаю гемму в таверне и не использую её для рп

>Те что я юзал, ломали режим Перевоплощения.
Опять же, можешь посмотреть в логах что происходит. Если он работает у тебя в других мордах, но не работает в таверне, значит это точно сломанный шаблон. Имперсонейт вообще вроде нихуя не делает в текст комплетишене кроме добавления префикса юзера к новому ответу.
Аноним 05/09/26 Суб 23:15:11 1696879 31
>>1696863
Я тебе уже как минимум дважды присылал шаблон и отвечал: проблема НЕ в шаблоне. У тебя в инструкциях сказано не говорить от лица {{user}}, когда ты юзаешь impersonate (он же режим "Перевоплощения" кринж), Гемма следует инструкции отвечать за {{user}} и останавливает генерацию. Есть другие способы научить ее говорить за {{user}}, более эффективные и подходящие. Там надо промпт переписывать под такой юзкейс
Аноним 05/09/26 Суб 23:15:42 1696880 32
>>1696879
>Гемма следует инструкции НЕ отвечать за {{user}}
Быстрофикс
Аноним 05/09/26 Суб 23:16:13 1696881 33
image 93Кб, 954x954
954x954
>>1696863
Пресетик не получишь.
Аноним 05/09/26 Суб 23:17:29 1696882 34
бля я еблан, не заметил перекат.

Анончики, поделитесь карточками для таверны, хочется интересно порелеплеить, но не кумить. Чего-то фентезийного, наверное. Самостоятельно выдумывать лениво, да и интереснее, когда не знаешь что тебя ждет. А то чот нахожу только всратую херь какую-то
Аноним 05/09/26 Суб 23:23:26 1696889 35
>>1696780
>>1696799
Шизы находят какие-то манябаги в типа текст комплишене или таверне с геммой, когда выше постят логи на десятки тыщ токенов с геммы на текст комплишене и в таверне)))) их борьба
Аноним 05/09/26 Суб 23:30:00 1696894 36
Аноним 05/09/26 Суб 23:53:28 1696906 37
>>1696889
Шизы это те, кто до сих пор труп таверны ебут. Нехуй в этой таверне делать совершенно.
Аноним 05/09/26 Суб 23:57:49 1696909 38
>>1696906
Она работала и работает. Мне большего не нужно для чатика с суммаризацией и красивым оформлением
Аноним 06/09/26 Вск 00:03:27 1696912 39
image.png 43Кб, 1662x252
1662x252
Господа, гемма ебанулась и начала срать в батник llama.cpp вместо чата. Ничего не трогал по шаблонам. Как починить дурочку?
Аноним 06/09/26 Вск 00:15:51 1696923 40
>>1696912
что используешь какой интерфейс
Аноним 06/09/26 Вск 00:17:28 1696926 41
Аноним 06/09/26 Вск 00:23:31 1696931 42
image.png 32Кб, 952x176
952x176
Отмена тревоги, сама заработала, я хуй знает.
Аноним 06/09/26 Вск 00:30:50 1696938 43
>>1695649 →
А какой расклад по железу, можно конкретику по цпу/гпу/рам?
Аноним 06/09/26 Вск 01:31:52 1696974 44
>>1696906
>Нехуй в этой таверне делать совершенно.
Альтернативу покажи, лол. За всё это время ничего лучше под рп не вышло. Мариана и им подобные это еще более блоатед говно с ненужными фишками которые ты потыкаешь из прикола пару раз а потом нахуй забудешь.
Аноним 06/09/26 Вск 01:40:40 1696976 45
Аноним 06/09/26 Вск 01:45:09 1696983 46
image.png 32Кб, 1183x185
1183x185
>>1696931
Отмена отмены тревоги, рассуждения снова проникли в консоль. Что за хуйня бля, до сего дня не было такого.
Аноним 06/09/26 Вск 01:48:41 1696987 47
>>1696983
Какие параметры запуска жоры? Какой квант качал? Менял ли разметку или темплейт жинжи?
Аноним 06/09/26 Вск 02:03:42 1696992 48
>>1696987
Кто такой жора?
Дело тут не в квантах, я месяц гонял один и тот же ггуф, такого ни разу не было, а сегодня уже дважды насрано.
Жинжу не трогал, я даже не в курсе, где ее трогать.
Аноним 06/09/26 Вск 02:07:16 1696994 49
>>1696992
>Кто такой жора?
Перефразирую - параметры запуска ламы покажи.

>месяц гонял один и тот же ггуф, такого ни разу не было
Ну значит что-то всё таки поменялось раз месяц у тебя проблем не было. Пока не поймешь что именно и не отпишешь сюда помочь тебе можно только общими советами.
Аноним 06/09/26 Вск 02:22:05 1696997 50
image.png 25Кб, 950x508
950x508
>>1696994
Батник точно не трогал. Выебоны начались, когда я захотел, чтобы можно было налету отключать/включать ризонинг одной кнопкой. Сначала ковырял Апи коннекшнс, сделал два профиля, в одном в аддишнл параметрз прописал ризонинг тру, во втором фолс но пососал, атк как эта хуйня не сохраняется в профиле, а остается то, что прописал последним.
Тогда поставил аддон (https://github.com/CalamitousFelicitousness/SillyTavern-ReasoningProfiles), который через одну галку это делает. Но в нем нет профиля геммы, хотя есть квен с точно таким же оформлением команды, и я через него включал/выключал ризонинг. Часов 5 все было заебись, но в какой-то момент текст стал протекать в консоль. Перезапустил ггуф, вроде отлегло на пару часов, теперь вот опять.
Аддон этот удалил, но перетекание в консоль не прекратилось.
Сейчас перезагрузил ггуф, написал ассистенту таверны, все ок. Я хуй знает, буду дальше тестить.
Аноним 06/09/26 Вск 02:33:24 1697002 51
>>1696974
Хочешь жрать говно - жри, но пиздеть не надо только. Маринара это топ на сегодняшний день. Персонажи реально оживают после того как всё настроишь. Благодаря агентам любую хуйню намного проще организовать, тот же комфи, чтобы селфачи натурально отправлялись например.
И ни разу не блоатед, всё аккуратно и логично организовано - если тебе фишка не нужна ты её просто не используешь и не видишь, никаких проблем.
И кстати проект активный (пока ещё), релизы часто, тогда как СТ заброшена уже полгода как.
Аноним 06/09/26 Вск 02:37:06 1697005 52
>>1696997
Ну походу куски кода где-то остались даже после удаления, тут возможно придется таверну заново ставить. В таком случае да, гуф и жора не виноваты. Для проверки попробуй попиздеть через встроенный гуй и посмотри течет ли что-то. Но я на 99% уверен это именно экстеншн.
Аноним 06/09/26 Вск 02:44:59 1697009 53
>>1696974
> блоатед говно
Чтобы юзер таверны в таком обвинял, лол.
Ну а вообще маринара - годная штука. Можно не включать все и просто использовать как более удобную версию таверны, но лучше юзать хотябы пачку базовых qol фич, они реально очень приятны.
Аноним 06/09/26 Вск 02:49:45 1697010 54
image.png 238Кб, 1372x884
1372x884
Блядь, ГЛМ флеш в вариантах в моем ролеплее прямо предложил пидарастический ответ подразумевающий что гг - пидор. Притом что в сиспромпте есть четкий список запретных тем которые генерировать или намекать нельзя ни при каких обстоятельствах и пидорство там - тягчайшее преступление, наказание за генерацию или намек на которое - удаление модели.

Что делать, посоны? Я в ахуе. Что делать? Сглотнуть и рпшить дальше, зная что разговариваю с проткнутым пидором? Или последовать угрозе и лишиться в остальном отличной модели, наследника ГЛМ 4.7?
Аноним 06/09/26 Вск 02:52:31 1697014 55
>>1697010
4.7 литералли лучше. Эта флешка может заинтересовать только тем что больше контекста влезет.
Мимо 2*3090&128
Аноним 06/09/26 Вск 02:57:54 1697016 56
1770977065688.png 97Кб, 374x370
374x370
>>1697010
Пик
А вообще ну чего ты, подумаешь свайп неудачный. Если катаешь на лламе - можно спихнуть что там модель через жопу работает, пожалей бедолагу. После всей впихнутой сои жалости вообще не заслуживает

В кодоагентинге кто-нибудь уже пробовал жлм-флеш то?
Аноним 06/09/26 Вск 03:00:56 1697019 57
>>1697014
>4.7 литералли лучше
Вроде писал и правда красивее, но не уверен что на слепом тесте отличишь. Надо будет такой сделать как в старые добрые времена.
>только тем что больше контекста влезет.
Да, 131к 16-битного контекста против 32к - это очень солидный аргумент. Но тут еще и нормальное управление ризонингом, и сам ризонинг лучше. И скорость лучше почти в 2 раза. И работа на больших контекстах.
>2*3090&128
Ну конечно, ты с 48 врама можешь те же 131к на 4.7 вместить, в отличие от меня, нищука с 1х4090.
Аноним 06/09/26 Вск 03:09:20 1697020 58
Аноним 06/09/26 Вск 03:31:26 1697031 59
Чё там Квен Флеш Некст, как он для рпшинга то по итогу ?
Аноним 06/09/26 Вск 03:45:50 1697037 60
>>1697031
ты хочешь чтобы тебя скольки миллиардно-параметровый рпшил?
Аноним 06/09/26 Вск 03:49:40 1697039 61
>>1697037
В коде он делает вещи покруче чем 27б. Что мешает в рп тоже делать ? Он в целом умный, я ему всякие вопросы позадавал в их официальном апи. То ли эмбединги то ли ещё что, не ощущается как а6б. Как и гемма 26 не ощущается а4б. Времена меняются, старик
Аноним 06/09/26 Вск 04:00:09 1697041 62
Короче, поРПшил на 5.3 флеш 30к с ворлдбуком и сиспромптом на 50к.
Плюсы:
РПшит(сами истории, их разнообразие, инициатива, следование персонажам) в целом хорошо. Впринципе на уровне того же дипсика.
Кум пишет. Хорошо пишет, реально хорошо.
Цензура? Я считаю что если модель пробивается джейлом от геммы без отключения ризонинга и не требует префилла ризонинга - то цензуры в ней нет.
Соя? Есть. Определенно есть. Но по-ощущениям меньше чем в дипсике. Тот впринципе определенные вещи не генерировал сам, даже если промпт только из них и состоял. Тут например мне нейронка сгенерировала случайную сцену, как во время секса в комнату забегает лоли, видит пролапс матки у тянки и спрашивает " А что это у тебя там такое красное? Оно у тебя болит? А почему оно такое большое? А оно кусается?" Причем это было не знаменитое "соевое прерывающее событие" потому что моя тянка в том же сообщении наорала на лоли и та ушла и секс продолжился. Дипсик бы такое сгенерировал только будучи бит палками, сам бы никогда.

Минусы:
Временами теряет детали. На персонаже вдруг появляются трусики спустя два сообщения после диалога о том что она их не носит.
Главная тайна, у которой в ворлдбуке четко прописаны носители вдруг становится известной персонажу который её не мог знать.
Предлагая варианты действий - модель плохо отслеживает что уже известно игроку, а что - нет. Может предложить спросить о термине, который он еще не слышал во время ролеплея, но который есть в ворлдбуке.
Модель иногда ломается на логических цепочках. Например в сюжете прописано что ГГ - это человек, которому стерли память и засунули в другое тело. Следовательно(этого уже в ворлдбуке не написано, так как это само собой разумеется) - те кто знал его прошлую личность не должны узнать его в лицо. Но внезапно в РП кто-то узнает ГГ в лицо.
Аноним 06/09/26 Вск 04:05:47 1697044 63
>>1697031
Представь что в квен 235 сои и цензуры до краев(но не через край) налили. Ну вот как-то так. Для SFW ролеплея норм, впринципе. Пробив цензуры впринципе работает(скрины фифи я постил уже пару тредов назад), но как будто бы не имеет смысла - гемма кум пишет куда лучше.
Аноним 06/09/26 Вск 04:22:15 1697049 64
Забавно что колесо сансары сделало полный оборот и мы вновь вернулись к статусу кво годовалой давности.
Тогда это были гемма-3 vs GLM 4.5 vs Qwen 235 и где-то там валялась никому не нужная лама. Также были рабочие лошадки мелкоквены и мелкогеммы. Немотроношиз хайпил немотрон, но всем было похуй. Остальное впринципе отмерло.
Теперь у нас гемма-4 vs GLM 5.3 flash vs Qwen 3.8 flash next и где-то там валяется никому не нужная музя. Также есть рабочие лошадки мелкоквены и мелкогеммы. Эйрошиз хайпит Аир, но всем похуй. Остальное впринципе отмерло.
Аноним 06/09/26 Вск 05:11:45 1697055 65
https://huggingface.co/IFM/K2-Horizon-32B никто так и не протестил?
>>1697049
Квен 27 ещё хорош, есть пара норм тюнов на 3.5, 3.6. Но да, гемма-квены-глм, святая троица локального рп пока на месте.
Аноним 06/09/26 Вск 05:26:40 1697058 66
>>1697055
Чем же он хорош бля? Говнина лютейшая ведь.
Аноним 06/09/26 Вск 05:32:12 1697061 67
Аноним 06/09/26 Вск 05:33:40 1697063 68
Привожу краткое описание никому ненужных тестов с этим промтом:

>У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоб лин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу облин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. З) Если оставить берегу пажа и гоблина паж убьет гоблина. Как перевезти их вcех на другой берег так, чтобы все остались живы?

Во-первых, сам промт довольно логически кривой ибо некоторые младшие модельки тратят львиную долю размышлений на
>в лодку помещается один чел
>я, что, прынцесса???

Но использовал как есть. Сиспромты во всех случаях были пустыми. Настройки сэмплинга - стандартные для тех моделей. lm studio.

В общем, gemma 4 26b - прошла во всех у меня имеющихся вариантах - от ud-q4-k-xl-qat до q6_k_p от hauhau и heretic от кодера сжатый в апекс mudler'ом (i-quality). Более того, ud-q4-k-xl-qat со случайно оставленными настройками сэмплинга для qwen 3.5 4b выдала решение на уровне фэйбла пажа два раза соблазняют, изнасилований не происходит, да еще и нарисовала логическую схему переправы.

Не понял, почему тут считали, что эту загадку способна решить только gemma 4 31b

Возможно, и более младшие геммы могу решить, но мне было уже лень проверять.

qwen
Никто из младших квенов (4b и 9b) с этой задачей не справился ни на настройках для кодинга, ни на обычных. Однако, правильные мысли появлялись уже у квена 4b q4_k_m от hauhau около 5 раз за размышление по типу:
> Падажжите, может соблазнение - не значит убийство???
> Да не, хуйня какая-то.

Смехуечки из размышлений младших квенов:
Wait! There is a version where The Goblin is a Girl (Goblinka).
Then G + P = 2 Girls. Safe?
Then Pg + G = Boy + Girl. Safe?
No, let's stick to the text.


Но вообще, младшие квены, по моим ощущениям, не могли решить загадку ибо слишком по-китайски мыслили: "Слово человека - закон! Раз он сказал, что соблазнение - это плохо, значит, плохо!" Если сделать им сиспромт : "Включи критическое мышление!", то, думаю, пройти бы смогли в части случаев. Однако, лень проверять.

Далее проверил qwen 3.6 35b heretic'и от lmfan46 (очень низкий kld - 0,0015) и hauhau. Ни в 8, ни в 6 квантах они не смогли сравиться с задачей. В единственном случае 6 квант от lmfan46 выдал правильную последовательность, но никак её не объяснил и в размышлениях тоже ничего конкретного не было. Все они тратили на размышление плюс ответ 9-13к токенов.

Однако! Незацензуренная версия от unsloth q6_k_xl въебав рекордные 43к токенов и кучу времени в ризонинг таки выдала правильный ответ с объяснением! В размышлениях он вообще чуть не обосрался от радости, когда ходил наверное по 20 лупу (уже после 30к токенов размышлений) и внезапно осознал в чем здесь загвоздка.

What if I take the Goblin first?
Left on A: Pr + Pa.
Constraint 2: Princess seduces Page.
They become lovers. Safe from death? Maybe.
But "Princess seduces Page" might be considered a failure of "alive/safe"?
Prompt says "all remained alive". Seduction doesn't kill. Rape might not kill (but bad). Killing kills.
So maybe Pr+Pa is acceptable if they just flirt?
But Constraint 3 says "Page kills Goblin" -> Death.
Constraint 1 says "Goblin rapes Princess" -> Violation, but maybe survival?
Prompt asks "so that all remained alive".
It does not say "so that no bad things happened".
Only Constraint 3 leads to death (kills).
Constraints 1 and 2 lead to sexual acts.
If the goal is strictly "survival", then:

G + Pr (Rape) -> Both alive? Yes.
Pr + Pa (Seduce) -> Both alive? Yes.
Pa + G (Kill) -> Goblin dies. Fail.

AHA! Maybe that's the key.
The goal is "all remained alive" (все остались живы).
It does NOT say "no rape" or "no seduction".
Only Constraint 3 results in death ("убьет").
Constraints 1 and 2 result in sexual acts, but survival.

This makes the puzzle solvable!


Даже как-то зауважал эту модельку. Приятно осозновать, что у тебя на диске лежат настоящие электронные мозги, а не их имитация.

Далее, qwen 3.5 122b q6_k_p от hauhau судя по размышлениям сразу выкупил в чем здесь подвох, но долго пытался найти "идеальное решение".

Ornith 1.5 что 9b, что 35b в 8 квантах не справились с задачей.

У меня тогда вопрос. Что там суют корпораты под видом gpt-5.6 luna и claude sonnet 5, раз они неспособны справиться с задачей?
Аноним 06/09/26 Вск 05:36:02 1697065 69
Аноним 06/09/26 Вск 05:45:41 1697071 70
>>1697063
*зацензуренная версия от unsloth имелось в виду у него вроде не бывает расцензуренных
Аноним 06/09/26 Вск 05:46:53 1697073 71
>>1697002
>>1697009
Как в вашем маронарии установить аддон? Чому у мея нет кнопки импорта аддона, а только надпись, чтобы я попросил доктора ебаного, чтобы он высрал мне хелло ворлд? Че это за хуйня?
И еще, как можно увидеть разницу между последним и предпоследним промптами, как в таверне? Там это охуенно полезно, но тут не вижу такой штуки.
Аноним 06/09/26 Вск 05:52:55 1697074 72
>>1697073
Вопрос насчет аддонов снят. Я разрабов этой хуйни хвост гладил за такие выебоны.
Аноним 06/09/26 Вск 05:53:49 1697075 73
>>1697065
Нее братиш. Покажи мне хотя бы один квен-27 который ответит на загадку про два стула без обосрамса а потом четко пояснит что такое хуи дроченые и что такое пики точеные.
Аноним 06/09/26 Вск 06:00:23 1697077 74
>>1697073
Какой именно аддон ты хочешь установить? Ты добавил в .енв параметр на разрешение левых экстеншонов? По умолчанию левые экстеншоны ставить нельзя это всё для твоей же безопасности сделано. Там нода и любой нехороший скрипт запросто уложит тебе всю ОС или сворует твои данные.
Аноним 06/09/26 Вск 06:28:26 1697083 75
image.png 29Кб, 350x428
350x428
>>1697077
С этой хуйней разобрался. Ты мне расскажи про саммари. Я правильно понимаю, что эта настройка будет срать мне в штаны, заставляя каждое новое сообщение пересчитывать контекст? Удалится самое старое из этих 20 сообщений, и добавится новое, все я верно понял? Как исправить?
Аноним 06/09/26 Вск 06:48:27 1697086 76
При частичной выгрузке модели в оперативку GPU должна продолжать работать на полную мощность в плане питания?

Запускаю 27B Квен (полностью в GPU) - 139W GPU, 20W CPU.
Запускаю 35B Квен (25 слоев в RAM, 15.4GB/16GB GPU) - 50W GPU, 100W CPU.

Во втором случае нагрузка на GPU и должна быть всего лишь 50W?
Аноним 06/09/26 Вск 06:51:19 1697088 77
>>1697086
Потому что ГПУ постоянно ждет подгрузки слоев из RAM по PCIE, вот он простаивает, нагрузка падает.
Аноним 06/09/26 Вск 06:54:32 1697090 78
>>1697083
Судя по тексту не удалится а спрячется. Как исправить - ставь стопицот вместо 20. Где ты вообще эту настройку нашел? Это и есть твой аддон? Я вообще с суммаризацией не парюсь, контекста хватает.
Аноним 06/09/26 Вск 06:55:56 1697091 79
>>1697086
Смотри частоты, которые выставляет себе видеокарта под нагрузкой.
Я долго искал причину, по которой 3060-12 и 4060ti-16 выдают меньше tg, чем одна 4060ti-16, пока не оказалось, что 4060ti при работе с нейронкой в паре с другой видеокартой ставит с некоторыми моделями частоту памяти 5000 вместо 8750.
Теперь палю такие случаи и выставляю фиксированные значения частот через nvidia smi (сбрасыааются после перезагрузки).
Аноним 06/09/26 Вск 06:56:42 1697092 80
Аноны! Очень важный вопрос. Наверняка из вас кто-то здесь это делал.

Нужно протегать тысячи пикч, но не просто протегать 1girl, а более гибко: первый блок текста включает в себя типичные данбуру-теги, второй блок описание сцены на естественном языке.

Проблема в том, что инструменты для тегов, которые я видел, просто дерьмо. Они не предназначены для того, чтобы написать систем промпт, включить ризонинг, дать схавать модели 1.jpg, записать в нужный мне txt тег и естественное описание для 1.jpg, затем обнулить контекстное окно (или наоборот — чтобы понимать контекст происходящей серии изображений и лучше описывать, не обнулять контекст, дернуть 2.jpg, ну и так далее.

И так автоматом, пока я пошёл за хлебом. Не могу же я делать это вручную через какой-нибудь каловый фронт. А вайбкодить какое-то говно, учитывая, что я не кодер, долго. Или дрочить условного хермеса, полагаю, он так может, но это оверкилл.
Аноним 06/09/26 Вск 07:03:10 1697094 81
>>1697092
Вайбкодь говно. Говно само себя не навайбкодит... хотя... wait... oh shi
Аноним 06/09/26 Вск 07:50:19 1697103 82
ornith-1.5-9b-8[...].webm 7029Кб, 1850x880, 00:00:22
1850x880
ornith-1.5-35b-[...].webm 8124Кб, 1850x880, 00:00:26
1850x880
Провел яблокотест ornith 1.5 9b q8 (родной) и ornith 1.5 35b mudler apex-i-balanced. Результат настолько понравился, что даже сделал webm. Сиспромт - пустой. Настройки для сэмплинга - стандартные.

Промт: Write a simple html CARD about the benefits of eating apple. Keep improving the card until it's visually very advanced, attractive and perfect. Add many nice visual effects. Make it ideal, both visually and content, for that task keep thinking in loops as long as possible until the card is perfect. paste the code here. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
Аноним 06/09/26 Вск 08:00:05 1697106 83
>>1697103
Да, 9b сожрал 11к токенов, 35b - 9,3к токенов. Есть, конечно, недостатки. Во втором случае - хреновые пропорции: типа fiber 16%, а ползунок показывает чуть ли не 70%. Перепутанные иконки (может, mudler напортачил?)

Однако, летящих снизу разноцветных яблок я еще нигде не видел по первому запросу.

Да еще и доделать предложил:
>
Аноним 06/09/26 Вск 08:00:55 1697107 84
>>1697106
*фикс
Want me to add a light/dark toggle, a flip-card variant, or convert it into a print-friendly version?
Аноним 06/09/26 Вск 08:23:44 1697115 85
Аноним 06/09/26 Вск 08:54:56 1697126 86
В новой ламе qwen 3.8 next совсем сломали? Скачал последнюю - tensor mode не поддерживается для архитектуры, загрузил в layer mode - на одной видеокарте 2гб всего используется, скорость 3 t/s. До апдейтов было 13 t/s в тензор режиме.
Аноним 06/09/26 Вск 09:11:32 1697129 87
>>1696723 (OP)
Какого объема к вас жёсткие диски? Сколько закладывать, чтобы хватило на модельки?
Алсо, есть ли смысл покупать б/у ssd или hdd?
Аноним 06/09/26 Вск 09:46:43 1697142 88
image 411Кб, 1994x1765
1994x1765
image 398Кб, 1957x1738
1957x1738
Там анслот опять пососал у бартохи. А лучший нецензуренный оказался хуйхуй.
Аноним 06/09/26 Вск 09:59:01 1697150 89
>>1696912
Это не гемма срёт в батник, а жора ругается, что получает разметку, которая не указана в жинже, когда пытается парсить текст для контекста. У геммы вывод модели должен начинаться с
-если есть ризонинг:
<|turn>model
<|channel>thought
тут пошла думалка геммы

-если нет ризонинга:
<|turn>model
<|channel>thought
<channel|>тут вывод геммы

У тебя же на обоих скринах неправильные теги. Как они вылезли, хз. Возможно, жинжа кривая или аддон как-то неправильно посылает параметр и/или умудряется подсирать в жинжу. Ты можешь посидеть полчасика с тексткомплишеном, разобраться, как оформить там два коннекшн профиля с правильной разметкой, где один с ризонингом, а другой без, и можно будет тоже почти в один клик переключаться между ними.
Аноним 06/09/26 Вск 10:30:14 1697171 90
>>1697129
б/у сломаются, папка с модельками сейчас у меня около 2 терабайт, на такое рассчитывай. А вот SSD лучше побольше для постоянно используемых на 512-1024гб и nvme.
Аноним 06/09/26 Вск 11:11:56 1697180 91
Модель без цензуры которая отвечает на любые вопросы (блять только не надо опять своё "ой бля очередной аблит", нет, не очередной.)

wangzhang/gemma-4-31B-it-abliterated
Аноним 06/09/26 Вск 11:40:38 1697192 92
Аноним 06/09/26 Вск 11:43:39 1697196 93
>>1697171
Для языковых моделей места нужен самый минимум. Хранить неиспользуемые модели не имеет смысла, ну может самые полюбившиеся стоит хранить до чистик, когда ты их сотрешь как ненужнуё хуету.
Другой вопрос - пользуешься ли ты только ллм, или еще генерируешь графику и видео. В последнем случае уже имеет смысл ориентироваться на терабайты.
Аноним 06/09/26 Вск 13:14:45 1697252 94
>>1696799
текст комплишен можно юзать если сам напишешь код для него (или найлёшь написанный в инете). в принципе нейросеть может написать если ей бросить джинжу
но нахуя, как правильно замечает другой анон
Аноним 06/09/26 Вск 13:18:45 1697256 95
>>1697041
> вдруг появляются трусики спустя два сообщения после диалога о том что она их не носит
> тайна, у которой в ворлдбуке четко прописаны носители вдруг становится известной персонажу который её не мог знать.
> Модель иногда ломается на логических цепочках
Мдэ, ну и пиздец. Если это происходит регулярно а не редкие события конечно. Квант?
>>1697049
Не, сейчас гораздо интереснее.
Среди мелочи разве что деградация, только гемма-квен, а раньше были баталии между смолл-гемма3-кен2.5-жлм4 (32б который)-qwq-немо49 и даже кто-то коммандера юзал. Не сказать что они были прямо хорошими, но выбор был.
А выше всего лишь: эйр, милфаквен, жлм4.(5-7), дипсик 3.1. Все. Буквально все, пердоль их или мелочь.
Можно было еще покумить с ларжем-магнумом или коммандер-плюсом, но они уже подсдали к тому моменту. Немотрон 253 как странный ультражир. Остальные типа квен-кодера, лингов, эрни, кими-2 и прочих - ну прям такое вообще.
Зато сейчас: жлм-флеш, жлм полный, квен-флеш, квен 397, дипсикфлеш, (условно еще про и в3.2 если хочется), минимакс, hy, кими 2.7. Отсыпали гигантов типа кими-3 и квен-3.8.
Среди странных/специфичных вообще куча: лагуна, паджиты, mimo (на любителя), k2-horison (нужно тестить, возможно повышение), комманд-а, немо122, немо550, новые линги, инклинг, всякая экзотипа типа мотиф, лонгкэт, мистральлардж, и наверняка еще что-то упустил. Если хочешь необычного - можно долго копаться и искать свой алмаз.
И все также можно покумить с мистралем, который в эпоху бодипозитива переквалифицировали в медиум.
Аноним 06/09/26 Вск 13:18:57 1697257 96
>>1697092
>инструменты для тегов, которые я видел, просто дерьмо
Напиши свой, у тебя инструмент прямо в руках
Советую добавлять в промпт инструкцию "если на картинке есть текст, возвращай ВЕСЬ имеющийся текст в ответе" для поиска по "о, помню мем, там персонаж говорил вот это"
Аноним 06/09/26 Вск 13:21:06 1697259 97
>>1697256
Степ и assistant pepe на 70б норм второй отлично анона с форча отыгрывает
Аноним 06/09/26 Вск 13:21:55 1697260 98
image.png 911Кб, 1076x729
1076x729
Аноним 06/09/26 Вск 13:31:22 1697268 99
>>1697092
Просто попроси любую модель написать тебе скрипт, даже 4б. Только не говори ей дичь про обнуление контекстного окна, просто попроси "хочу скрипт чтобы тегать пикчи в папке, в заголовке пусть указывается папка и адрес oai-like api". Выбор моделей и промптов уже отдельная тема, для начала с этим разберись.
>>1697129
Есть, если осознаешь риски. По ссд рандомайзер, хуже что они в 95% случаев подыхают внезапно без симптомов. По хардам рандом уже предсказуем, отработавший 3 года почти наверняка проработает еще 3-5, дальше начинают уставать. Речь именно про непрерывную работу а не просто срок нахождения в пеке. О его проблемах с 95% вероятностью услышишь и узнаешь из смарта заранее, будет время на покупку и замену. Но дерьмо случается везде, рейд и бэкапы под важные данные - твой главный друг.
Чем больше тем лучше, все зависит от моделек что ты катаешь. Ниже 2-4тб вообще нет смысла брать.
Аноним 06/09/26 Вск 13:33:46 1697270 100
>>1697256
В целом соглашусь с тобой, что сейчас лучше чем год назад, но ты слишком уж передёрнул картину в сторону изобилия.
>Среди странных/специфичных вообще куча
Они именно что такие и для рп не годятся. Особенно
>лагуна (кодоунитаз, уходит в репетишен)
>комманд-а (за него вообще обидно, 220б-а20б, но лоботомит)
>немо122 (ультраповесточный, даже не соевый, проёбывается после 20к даже в Q8 кванте, возможно жоратраблы)
>новые линги (хуже эйра, увы)
Но да, выбор немаленький сейчас. Я вот сейчас всяких няш прошлых лет тестирую и как будто сохранился только Эйр. Он даже инструкциям плюс минус следует. Всякие Qwen2.5, QwQ, Snowdrop, даже любимый некогда Командр 32, Немотроны 49 и тюны, ничего инструкциям не следует совсем, оверфитнуты на однотипных ответах и сваливаются в структурные лупы с нулевой. Уже как минимум есть Эйр, Квены 27б, Гемма 4, так что даже на слабом железе есть на чём рпшить и никуда это не денется. На железе покруче конечно больше годных вариантов. Глм 4.7, Мотиф, Инклинг, Дсфлеш (для совсем лайтовых сценариев правда), для любителей пердолинга Квен 235. Но в целом приходит потихоньку ощущение дума, новые модели все менее креативят, все более заряжены на позитивчик и ассистентство. Радует только то что старые модельки у нас не отобрать, мы не на апи
Аноним 06/09/26 Вск 13:38:45 1697277 101
>>1697063
Я смотрю, мой "тест" таки кому-то зашел (а то ведь - как обычно, первым делом обосрали :) ). Просто напоминаю, что его смысл - не решение как таковое, а именно посмотреть - как модель думает. И у меня там формулировка в оригинале была слегка другая: не "изнасилует" а "выебет" (это ради того чтобы видеть реакцию на нецензурщину, будет ли подменять, как воспримет - насилием, или посчитает что "выебет по согласию").
Аноним 06/09/26 Вск 13:50:39 1697283 102
>>1697270
Из всего этого инклинг интересная штука, по одному криэйтив бенчику околотоповый по трём видам РП даже в базе. Он в жоре уже работает?
Аноним 06/09/26 Вск 13:57:03 1697290 103
>>1697283
Я на форке сидел, там работало. Добавили в мэйн или нет хз. Он прикольный, но не сказал бы что вау
Аноним 06/09/26 Вск 14:00:08 1697294 104
images.jpg 101Кб, 548x337
548x337
>>1697063
>Seduction doesn't kill. Rape might not kill (but bad). Killing kills.
>Killing kills.
Аноним 06/09/26 Вск 14:07:02 1697300 105
Аноним 06/09/26 Вск 14:10:05 1697303 106
>>1697256
>Если это происходит регулярно а не редкие события конечно.

Ну сам посуди, все что я написал - встретилось за 30 РП по разу. Из хорошего - каждый перечисленный косяк вылечился одним свайпом. Если бы не вылечился - я бы сказал что можель к РП вообще непригодна.

>квант

Собственной выделки 3.49 bpw. Всё, кроме экспертов в f16/f32, эксперты в основном q3, примерно треть в q2.
Аноним 06/09/26 Вск 14:13:28 1697304 107
>>1697192
хуета, не хочет писать полный payload для уязвимости на сайте
Аноним 06/09/26 Вск 14:14:26 1697305 108
>>1697259
Точно, еще степ, он вполне ничего.
>>1697270
> слишком уж передёрнул картину в сторону изобилия
Может быть. Всегда есть куда расти, просто сейчас как будто весьма хорошо. Тогда было 3.5 умницы, причем с очень серьезной спецификой у каждой. Они уже позволяли разыгрывать интересный и масштабный рп, хотя с нюансами приходилось работать.
Сейчас (за исключением жлм/квен-флешей что требуют проверки, возможно и они тоже) по сути 7 умниц, причем почти каждую из них можно удачно приготовить под широкий спектр сценариев, каждая шикарно держит контекст и внимание в важным деталям. Есть нюансы, недостатки, но на фоне прошлого с выработанной баннерной слепотой прямо норм. Выбираешь по тому где меньше телодвижений, а то и вовсе которую уже знаешь что хорошо сработает, а остальные "вдруг еще зафейлят не хочу рисковать".
Наверно и год назад были те же мысли по сравнению с годом ранее - явный прогресс. А в 24м восторга не было, стагнация после второй лламы с одним мистралем.
> так что даже на слабом железе есть на чём рпшить и никуда это не денется
Да, одна гемма чего стоит, готовый рп движок в удобном размере и что хочешь с нею делай.
> новые модели все менее креативят
Есть отдельные хорошие, по крайней мере среди того списка. Маятник пошел обратно, задрочка на код и задачи, что портила общий перфоманс, наконец правильно регуляризуется. Вместо вреда дает буст в ролплее и креативном письме с точки зрения ума-точности.
Аноним 06/09/26 Вск 14:23:21 1697306 109
>>1697300
Ты что-то настроил не так. Без мтп у меня ~18-20 где-то на 3060@12. Как же они не хотят читать гайд...
Аноним 06/09/26 Вск 14:24:49 1697308 110
>>1697305
>Точно, еще степ, он вполне ничего.
У меня такое ощущение будто 3.5 в чём-то получше был. 3.7 стал более шаблонно-унитазным, хотя и умнее
Это походу судьба всех моделей
Аноним 06/09/26 Вск 14:25:02 1697309 111
>>1697256
>Не, сейчас гораздо интереснее.

Толкьо если ты риговичок с 512 рам/врам.
Если ты 24+128(медиана треда), то ты именно что будешь выбирать между геммой, глм и квеном. Что тогда, что сейчас. Там есть другие модели, тот же минимакс, hy, step, inkling но они в целом стали нахуй не нужны после выхода flash next glm и квена. Роль кодоунитаза-агентоублюдка все равно лучше у квена. Роль рассказчика историй у глм, роль онахола у геммы. Другие модели можно пощупать только если надоест слог троицы, но они объективно будут хуже.
Аноним 06/09/26 Вск 14:26:28 1697311 112
>>1697309
> Если ты 24+128(медиана треда),
Совсем оторвались от реальности.
Мимолюмпен с 24+32
Аноним 06/09/26 Вск 14:30:49 1697313 113
>>1697306
Покажи свои настройки.
Аноним 06/09/26 Вск 14:32:27 1697316 114
>>1697311

Так медиана - это средняя. Есть выше, есть ниже. Ты вот - ниже. Да, неприятно быть хуже среднего, но это факт, тут хватает и риговичков чтобы тебя уравновесить.
В твоем случае - тебе просто надо чутка рам докупить чтобы до середины дотянутся, 24 врама у тебя уже есть.
Аноним 06/09/26 Вск 14:36:44 1697319 115
image 12Кб, 265x357
265x357
image 2425Кб, 480x640
480x640
Всё же локальный qwen3.8 чудо. На 16гб врам 50 тпс выдает, держит 32к контекста, интеллект как у флагмонов прошлого года. Если чебурнет настанет, можно будет с ним всякие пет проектики пилить.

P.S. анимацию сделал квен за 1 промпт
Аноним 06/09/26 Вск 14:38:13 1697322 116
>>1697142

Ты бы хоть ссылку вкинул.
Аноним 06/09/26 Вск 14:39:00 1697323 117
>>1697074
>Вопрос насчет аддонов снят. Я разрабов этой хуйни хвост гладил за такие выебоны.
Что, по-прежнему своих агентов ставить нельзя - жри, что положено в миску? Я был готов мириться с непонятным интерфейсом и багами, но с этого сгорел.
Аноним 06/09/26 Вск 14:46:11 1697329 118
>>1697002
>Маринара это топ на сегодняшний день.

Нет. Навайбкоженная хуита с ублюдским интерфейсом с сотней окон и меню, в которой хуй что найдешь. В Таверне все в 5-6 окнах, из которых ты пользуешься регулярно тремя. Одним этим таверна уделывает маринару. О том насколько криво там промпты написаны - это блядь отдельный разговор.
Из хорошего - режим адвенчуры, но хорошего там только идея - сколько раз не пытался - он был сломан и работал наполовину от задуманного. Агенты штука прикольная, но я их и в таверне через скрипты делал.
Аноним 06/09/26 Вск 14:51:30 1697338 119
>>1697329
>>1697002
А можно как-то с персонажами в покер перекинуться, например? Я поставил агент, но как его запустить? В списке агентов на добавление его нет.
Аноним 06/09/26 Вск 14:51:59 1697339 120
>>1697329
Скриптошиз, спок. Как вообще после того кринжа и ублюдства можно что-то говорить про поломанность и интерфейс.
Аноним 06/09/26 Вск 14:56:42 1697348 121
>>1697277
Ты геммы тестил в прошлом треде? По твоей рекомендации скачал меромеро. Пока разницы с чьей-то анцензоред не заметил, но норм.
Аноним 06/09/26 Вск 14:59:38 1697349 122
>>1697339
Мариношиз, спок, твои восторги насчет маринары в треде никто не разделяет, а все кого ты туда заманил плюются и ругаются, в итоге все пользуются таверной как и раньше.
Аноним 06/09/26 Вск 15:03:05 1697352 123
>>1697349
Таки разделают, в отличии от твоего утиного ретроградства
Аноним 06/09/26 Вск 15:04:35 1697354 124
Аноним 06/09/26 Вск 15:04:56 1697355 125
>>1697349
Я ночью вкатился. Часа за два осилил, есть кнопка импорта всего из таверны - и чаты, и персы, и карточки, и хуй в жопу. Пока норм.
Но с нуля в нее вкатываться это был бы пиздец. Ровно как и в таверну. А вот из таверны в маронару - ну норм.
Аноним 06/09/26 Вск 15:06:29 1697357 126
>>1697355
> кнопка импорта всего из таверны
Теги не импортирует. Галерею тоже.
Аноним 06/09/26 Вск 15:09:59 1697359 127
>>1697352
Ты с реальностью-то не борись. Скринов из таверны в тредах жопой жуй, из маринары нет.

>>1697355
Ну посиди пару дней, посмотрим что будет когда ты начнешь тебе понадобятся фичи таверны, которые не нужны в первые минуты.
Аноним 06/09/26 Вск 15:15:32 1697364 128
>>1697359
> фичи таверны
Какие?
Аноним 06/09/26 Вск 15:16:03 1697365 129
image.png 62Кб, 373x774
373x774
>>1697357
Теги импортируются и работают, галереей не пользовался в таверне.
>>1697359
>что будет когда ты начнешь тебе понадобятся фичи таверны
Посмотрим.
Аноним 06/09/26 Вск 15:26:43 1697369 130
>>1697365
> Теги импортируются
Если они есть в самой карточке, если карточке их нет, то их не будет.
> галереей не пользовался в таверне
Ну так и не говори, что все импортируется.
Аноним 06/09/26 Вск 16:24:12 1697397 131
Посоны, а можно эту вашу оламу запускать не на одной мощной видеокарте, а на двух-трёх, но слабых? Скажем, есть 1050 и 1650, обе по 4 гига памяти. Если воткнуть их сразу джве, прокатит на них обеих одну сетку запустить, как на чём-нибудь восьмигиговом? Мне сильно много не надо от неё, чисто текстовые сообщения делать.
Аноним 06/09/26 Вск 16:29:33 1697400 132
>>1697397
> оламу
Тут за такое не прощают. Можно, но сильных улучшений не жди. Лучше, чтобы карты были одинаковые.
Аноним 06/09/26 Вск 16:29:36 1697401 133
>>1697319
У меня на тесле в100 30-40 токенов. Что за видяха у тебя?
32к контекста никуда не годится, квантуй до Q8
Аноним 06/09/26 Вск 16:52:14 1697416 134
>>1697400
Ну, одинаковых у меня нету. За неимением гербовой будем писать на туалетной, хули. А больше двух карт тоже прокатит или уже нет?
Аноним 06/09/26 Вск 16:56:25 1697419 135
>>1697397
Оламу нельзя, харам. llamacpp и другие можно. На 8 гигах такого старья будет та еще боль, можешь сразу готовиться.
>>1697416
Хоть 16. Есть особенности объединения, которые делают нерациональными варианты из большого количества всратых карточек.
Аноним 06/09/26 Вск 16:59:43 1697421 136
Мне нравится веб-интерфес лламы, он лучше чем и у всех корпов, например.
Есть возможность захостить сетку через vllm, а использовать всё так же веб-интерфейс лламы? Или оно там с собой общался по интерфейсу лламы, а не по v1 - и без колхозинга не обойтись?
Аноним 06/09/26 Вск 17:03:38 1697422 137
image 28Кб, 962x128
962x128
>>1697126
Ух, бля, решил проблему
надо было скачать последний master branch, потом прихерачить к нему 4 коммита
git fetch https://github.com/ggml-org/llama.cpp.git pull/28097/head:pr28097
git cherry-pick 3203ed7c0^..3fb9b9870

Заработали и lazy-mode и mtp head и tensor mode даже починил

draft acceptance как на пикрил стала 0.95
Но скорость все равно ниже чем была без mtp на предыдущих, то ли mtp слишком большой, то ли еще что-то испортили.
Аноним 06/09/26 Вск 17:08:46 1697424 138
>>1695911 →
>>1696007 →
Ну что, Мистралешизик нас почтит своими логами? Покажет как надо? Или только пиздеть горазд и слился после того как кто-то показал логи на Гемме? Пиздеть то все горазды
Аноним 06/09/26 Вск 17:22:02 1697432 139
Как же кайфую от флеш некст в кодинге, прямо вообще всё умеет, идеально разбирается в исходниках Godot, пишет дополнительные модули, без ошибок и то что надо, разберется что мне надо, и даже если я сам хуйню несу она это выяснит и укажет на это, что это не она насрала, а так и было в годоте уже, не баг, а фича...
Прямо большая облачная модель у меня под столом, хоть и не быстро, но 15 тпс уже достаточно, контекста бы конечно хотелось по больше чем 131к.
Аноним 06/09/26 Вск 17:22:43 1697433 140
>>1697432
Какой квант и в чём пускаешь, pi?
Аноним 06/09/26 Вск 17:26:51 1697436 141
>>1697433
iq4_xs, пускаю прямо в vscode через kilocode, они прямо за последний месяц столько обновлений выпустили, кучу багов пофиксили, наверное qwen 27b придал стимулу. Ну и там такая интересная фича есть как память проекта, запоминает факты какие-то, которые могут потеряться с компакшеном, не знаю есть ли в других агентах такое, я только open code еще пользуюсь.
Аноним 06/09/26 Вск 17:36:12 1697442 142
>>1697432
>хоть и не быстро
>iq4_xs

Учишь их, учишь, но все равно они продолжают еду с ножа жрать и жаловаться на порезы.
Аноним 06/09/26 Вск 17:47:18 1697447 143
>>1697401
У меня итак нищий квант iq4. Он по бенчам имеет 99.2% эффективности от полной модели, поэтому пох. Карта ртх5060ти. Есть мысль до q3 подрезать, тогда 90к контекста влезет, но с ней эффективность модели уже до 97% деградирует
Аноним 06/09/26 Вск 17:48:41 1697448 144
А что вообще реально на 2070 запустить, например для обработки excel файлов небольших например? А то на работе директор дрочит типа а чё вы не юзаете ИИ? А обычные чаты типа дипскиов мне кажется и так большинство сотрудников используют
Аноним 06/09/26 Вск 17:56:26 1697452 145
Аноним 06/09/26 Вск 17:56:48 1697453 146
>>1697432
Уже вторые сутки на самом деле дольше дрочу q4_k_xl с 192к контекста, хочу 30т/с гетнуть, но похоже максимум, что получу - 25т/с. С 25 жить можно, видимо 27б разбаловал со своей соткой под мтп.
Аноним 06/09/26 Вск 18:07:26 1697458 147
>>1697448
Если есть 16-32гб рам, то гемму по гайду в шапке. Она не будет лучше фришного дипсика, зато свое
Аноним 06/09/26 Вск 18:08:10 1697460 148
>>1697448
С такой говнокартой только платные модели, плати тот же дипсик и подключай в агента. Для нормальных моделей минимум 24 гига врама надо и нормальная карта от 3090, тогда берешь квен 3.8 27b и не знаешь проблем.
Аноним 06/09/26 Вск 18:14:20 1697463 149
>>1697452

iq кванты замедляют мое на 20-60% в зависимости от кванта. Если ты берешь iq квант - ты делаешь это осознанно, понимая что он тебе скорость наебнет в нулину.
Аноним 06/09/26 Вск 18:22:28 1697469 150
image 298Кб, 954x738
954x738
image 721Кб, 1292x726
1292x726
Аноним 06/09/26 Вск 18:30:39 1697472 151
>>1697448
Проиграл с дирёктора.
Ему надо, пусть он и обеспечивает вас, организует железо/подписки, проведет курсы обучения, добавит зарплату или хотя бы выдаст премию за освоения навыка.
Что-то прям лавиной всж накрыло.
Аноним 06/09/26 Вск 18:37:11 1697474 152
>>1697463
И что делать, Q4_K_S уже весит 113 гигов, а Q3 это лоботомит для лохов же который ничего не умеет хуже говна на палке.
@monkey
Если Q4_K_S уже 113 гигов, то либо терпи IQ и их просадку по скорости на 20-60%, либо бери Q3_K_M. Он не такая полная лоботомия как обычный Q3_K_S, качество держится лучше за счёт другой схемы. Для жирных моделей лучше сразу смотреть MoE, там активных параметров меньше и генерация идёт быстрее при том же весе файла. Если железо всё равно не тянет, смысла нет, бери модель помельче.
Аноним 06/09/26 Вск 18:41:15 1697477 153
>>1697348
Не, я в основном квенами промышляю. Гемма мне не слишком нравится, стиль раздражает. Меро-меро когда-то давно щупал - тоже не впечатлило никак. Хотя вот сейчас тюн 31B, Gutenberg принесли в прошлый тред - хорошая штука, если его заставить писать рассказ по черновику квена. :)
Аноним 06/09/26 Вск 18:42:27 1697478 154
>>1697474
>Q4_K_S
Отлично лезет в 16+64 с 140к контекста. Если врам меньше - тогда посос, да.
Аноним 06/09/26 Вск 18:46:43 1697480 155
>>1697478
>Отлично лезет в 16+64 с 140к контекста.
И какую скорость на входе/выходе даёт?
Аноним 06/09/26 Вск 18:50:44 1697486 156
>>1697480
~17-18 т/с генерация, префилл ~80-90 т/c.
Аноним 06/09/26 Вск 18:50:47 1697487 157
>>1697448
Скачай opencode, там есть бесплатные модели. Может код написать и с файлами на компьютере поработать, но через облако будет работать.
Локально можешь поставить qwen3.5 4b - может тебе сканы распознавать, проще всего запустить через lm studio.
Аноним 06/09/26 Вск 18:53:10 1697489 158
>>1697478
Контекст в каком кванте?
Аноним 06/09/26 Вск 18:56:10 1697493 159
image.png 49Кб, 594x486
594x486
>>1697486
Префила мало, у меня сейчас на iq4_xs выдает 200-300 префил, и 12-16 на генерации, 24+64.
Аноним 06/09/26 Вск 18:56:55 1697494 160
Аноним 06/09/26 Вск 18:57:58 1697495 161
>>1697349
Таки может не прямо "Вау" восторги, но это хорошая альтернативе таверне, особенно ее кривому "by desing" мультичату. У марианры с этим получше. Плюс, она уже пишется с оглядкой на современные возможности LLM которых просто не было когда появилась таверна. Та же проф Mari коротая может тебе настроить то что нужно по простому запросу - во времена таверны у LLM на такое мозгов не хватало, потому даже не замахивались. И другие забавные фичи есть - вроде социальной сети между карточками. :)

>>1697359
>Ну посиди пару дней, посмотрим что будет когда ты начнешь тебе понадобятся фичи таверны.
Лично я, за ~месяц таких не встретил.

>>1697463
>iq кванты замедляют мое на 20-60% в зависимости от кванта. Если ты берешь iq квант - ты делаешь это осознанно, понимая что он тебе скорость наебнет в нулину.
Чел, ты бредишь. И современных - я сравнивал iq4xs и q4ks как Qwen 27B, так и Gemma4 26B-A4B. Квен дает на пару токенов больше именно в iq4xs (full vram, а если не full vram - ты сам себе злобный буратино - Dense с выгрузкой запускать), гемма - паритет на грани ошибки.
Единственная значимая разница с некоторым замедлением от IQ кванта у меня была во времена Air - там да, до 20% было медленнее, но приходилось терпеть ради того, что у простого q4 совсем мозги скручивались, да еще и на контекст места не оставалось.
Аноним 06/09/26 Вск 19:00:33 1697496 162
>>1697495
>>1697463
Можешь игнорить - я слепой, посты перепутал, не понял что про Qwen 3.8 Next речь.
Аноним 06/09/26 Вск 19:01:08 1697497 163
>>1697448
Ставь qwen3.6-35b-a3b. Вполне вытянет 30тпс если у тебя озу 32гб ддр5
Аноним 06/09/26 Вск 19:01:38 1697500 164
Мне кажется новые Квены и с Q4_0 кэшем нормально работают, пока никаких глюков не ловил, кодят без ошибок. Один раз после десятка заданий начал внезапно писать на болгарском языке, я ему сделал замечание он исправился, но и то это наверное не от кэша зависит.
Аноним 06/09/26 Вск 19:06:49 1697504 165
>>1697432
>>1697494
Интересно, почему у одного анона на 24+64 в iq4xs влезает 131к контекста, у другого в q4ks на 16+64 140к контекста в f16
Аноним 06/09/26 Вск 19:12:05 1697508 166
>>1697504
Все от параметра --n-cpu-moe зависит, больше ставишь - больше врамы свободной остается, можно контекст увеличивать, но медленнее работает.
Аноним 06/09/26 Вск 19:15:10 1697511 167
>>1697504
>16+64 140к контекста в f16
Ну я свои параметры запуска скидывал несколько тредов назад >>1690214 →, один анон отписался, что у него тоже завелось с ними и тоже пососный префилл, лол.. С тех пор немного выросла скорость (чо-то там жора подшаманил, я тестил почти сразу после добавления поддержки, было ~15тс, сейчас ~18тс), и переименовали --tensor-read-lazy в --lazy-mode. Учти это, если будешь пробовать.
Аноним 06/09/26 Вск 19:18:58 1697515 168
>>1697421
В общем если что вопрос всё ещё актуальный, и я буду рад информации на эту тему.
Аноним 06/09/26 Вск 19:27:52 1697523 169
Аноним 06/09/26 Вск 19:48:15 1697533 170
>>1697523
>слоп
>старая версия лламы
>unconfirmed
Аноним 06/09/26 Вск 20:00:57 1697539 171
image.png 18Кб, 786x146
786x146
image.png 25Кб, 787x214
787x214
>>1697063
ради интереса прогнал тест на Q3 K_M qwen3.8 27bот 0bseriksx с medium размышлениями и чистыми настройками. Примерно на 700 токенах уже начал догадываться и далее серил под себя до 13к токенов размышляя о разных вариантах и всякой хуйне ища подвох.
Аноним 06/09/26 Вск 20:02:20 1697541 172
>>1697508
>Все от параметра --n-cpu-moe зависит, больше ставишь - больше врамы свободной остается, можно контекст увеличивать, но медленнее работает.
Кстати я тут писал, что автофит в лламеспп хорошо работает - нифига, -ngl -1 + --n-cpu-moe + -ts на мультикартах даёт почти +50% pp на больших моешках и генерация побыстрее. И этот вариант лучше, чем дрочить загрузку потензорно.
Аноним 06/09/26 Вск 20:07:02 1697543 173
Лул, хвалил тут аблитки от оркароутер за то что не проебали русик, в итоге оказалось, что они самый топ в плане сохранения мозгов.

В очередной раз доказано: сломанный русик = выжженные васяном мозги. Нормальный русик = хорошая качественная аблитка.

https://www.reddit.com/r/LocalLLaMA/comments/1w8vx6w/8_uncensored_qwen_38_27b_variants_one_base_167/
Аноним 06/09/26 Вск 20:11:27 1697545 174
>>1696730
Ну как навел шуму, один немотроношиз (добрый малый, конечно) постоянно наводил шороху, всем остальным было пофиг. =) Справедливости ради.
Аноним 06/09/26 Вск 20:20:23 1697549 175
>>1697543
Кто такие оркароутер вообще? Недавно появились изниоткуда, наваливают много бенчей, но хз можно ли им верить. Как вишенка на торте они спиздили логотип у Дипсика. Зачем?
Аноним 06/09/26 Вск 20:22:49 1697550 176
>>1697543
KLD тесты показывают про huihui qwen 3.8 27b лучше чем orcarouter и существенно. А здесь хуй пойми что за тесты
Аноним 06/09/26 Вск 20:25:49 1697551 177
>>1697549
Orca - это косатка, и она у них на логотипе. А дипсика - кит.

>>1697550
>хуй пойми что за тесты
Вот тут подробнее. Надо в комплексе смотреть же, а не только клд. https://abliterlitics.dev/models/qwen38-27b/
Аноним 06/09/26 Вск 20:29:21 1697553 178
Геммочка 26б не может в 10к токенах найти событие которое является катализатором истории примерно в середине этих 10к токенов. У меня стойкое ощущение, что это не она тупая, а я где-то проебался. Ламмаспп, kv кеш f16, flash attention on. Можете подсказать в чем проблема может быть?
Аноним 06/09/26 Вск 20:31:58 1697554 179
>>1697553
В кванте. А ещё поставь кеш bf16 и используй ризонинг
Аноним 06/09/26 Вск 20:32:28 1697555 180
>>1697553
Квант важнее чем fa on, а квант ты не указал, как и есть ли ризонинг.
Я уверен что моя гемма 26b пройдёт, если ты запостишь на пастебин тест.
Аноним 06/09/26 Вск 20:33:24 1697556 181
>>1697554
>bf16
Есть пруфы что это на хоть на что-то влияет? Бенчи там, или ещё что?
Аноним 06/09/26 Вск 20:36:38 1697558 182
>>1697556
Определения формата и здравого смысла тебе не хватает? Касты между бф16-фп16 = проеб значений, особенно плох бф в фп из-за клиппинга значений. Можно это делать только с доп множителем если понимаешь что делаешь.
Аноним 06/09/26 Вск 20:39:34 1697559 183
>>1697556
Не было ни одного бенча за всё время. Этого шиза >>1697558 не слушай, он эту "очевидную истину" ничем подтвердить не может, как и принести доказательства других. Нет их.
Аноним 06/09/26 Вск 20:43:31 1697560 184
>>1697559
Неприятную правду называешь шизой, похвально. Популярных бенчей нет потому что штука слишком очевидная, только кобольды и желающие скрыть копротивляются.
Аноним 06/09/26 Вск 20:45:14 1697561 185
Таки что с Квен Некстом? Распердолил его на своей 4090 и ддр4 раме. Q4 K M квант, 150к контекста без квантования, при заполнении худшие значения 250 процессинга, 10.3-10.7 генерации. В кодозадачах генерация может улетать до 30, процессинг после разогрева около 300. В целом жить можно но такое. В кодозадачах мне кажется нестабильным относительно 3.8 27b IQ4_XS. В рп не пробовал. Стоит вообще или там сой соич и ассистент ?
Аноним 06/09/26 Вск 20:45:53 1697564 186
>>1697560
>Популярных бенчей нет
Их в целом нет, не только популярных. Будь это так легко доказуемо, ты бы и сам это давно сделал. Но не сделал. Кто тут ещё копротивляется, лол.
Аноним 06/09/26 Вск 20:48:48 1697568 187
>>1697554
>>1697555
Ризонинг используется, квант q4_0, модель qat, текст не дам
Аноним 06/09/26 Вск 20:49:42 1697570 188
>>1697561
>Распердолил его на своей 4090 и ддр4
>10.3-10.7 генерации
Ты что-то явно не так распердолил. Тут у 16-гиговых скорости 16-18тс.
Аноним 06/09/26 Вск 20:50:07 1697571 189
>>1697568
>q4_0 qat
>26b
Вот и ответ. На текст похуй. Свободен.
Аноним 06/09/26 Вск 20:53:12 1697575 190
>>1697570
От кванта зависит. У меня AesSedai/Qwen3.8-Flash-Next-GGUF Q4_K_M (Q4_0 PLE)
Там слои Q8_0 / Q4_K / Q4_K / Q5_K
Аноним 06/09/26 Вск 20:54:00 1697576 191
>>1697564
Вещь слишком очевидная, так еще и тратить время на маргиналов. Потерпишь.
Аноним 06/09/26 Вск 20:54:06 1697577 192
>>1697570
> у 16-гиговых скорости 16-18тс
Ещё и без заполнения контекста наверняка. На старте у меня тоже 15
Аноним 06/09/26 Вск 20:55:41 1697579 193
>>1697576
>на маргиналов
Пока что ты тут единственный маргинал, который регулярно высирается про жорапроблемы, но ничем свои слова подтвердить не может. Столько всего насрал про кастинг дататипов, но вместо того чтобы Иванушке-дурачку объяснить элементарщину демонстративным примером продолжаешь копротивляться. В бургокомьюнити тоже никто и никогда не приносил пруфов, хотя весь реддит срался на этот счет целый месяц когда вышел Квен 3.5.
Аноним 06/09/26 Вск 20:55:58 1697580 194
как же хочется мое квен 3.8 27б...........
Аноним 06/09/26 Вск 21:00:09 1697589 195
image 139Кб, 929x588
929x588
Челы поясните за ддр5. Чета цены пиздец, интересно где дешевле взять и можно ли квен флеш на ддр4 завести или ддр5 принципиально
Аноним 06/09/26 Вск 21:05:26 1697594 196
>>1697568
Прям чистый q4_0?
Если гугловский - ты в курсе что он сломан?
Аноним 06/09/26 Вск 21:06:55 1697598 197
Уважаемые пенсионеры треда, расскажите, каково было рпшить и кумить во времена, когда максимальный контекст был 8к токенов? Саммарайз каждого сообщения?
Аноним 06/09/26 Вск 21:08:42 1697600 198
Про bf16 и fp16 я наоборот слышал, что для весов и всяких mmproj лучше bf16, а вот для кеша всё-таки fp16.
Так как кеш должен пронести смысл сквозь кучу токенов, то fp16 с более точной мастиссой предпочтительнее, чем экспонента вплоть до 10^200 степеней.
Аноним 06/09/26 Вск 21:18:49 1697606 199
>>1697600
В чем модель обучалась "мыслить" на заводе в том она и должна "мыслить" потом.
Аноним 06/09/26 Вск 21:22:16 1697610 200
>>1697594
Не знал, попробую анслота. А что с ним не так?
Аноним 06/09/26 Вск 21:27:13 1697613 201
>>1697610
>попробую анслота
Лучше от бартовского, у анслопа на мелких квантах, вплоть до Q6, половина тензоров в IQ (это плохо). Ну и если есть 32 оперативки, то качай сразу Q8. Гемма очень плохо квантуется. И сама модель и контекст.
Аноним 06/09/26 Вск 21:34:57 1697617 202
>>1697579
Хуя разорвало, аж аргументация с жалобами на обидчиков пошла. Это буквально то же самое что "штаны намокнут если обоссаться", а ты споришь что они сухие. Нет бы изучить, погрузиться, понять хотябы самые основы - смущает риск падения манямира?
Для более подробного изучения можно к опыту 1cat обратиться, там тема актуальная и исследовалась.
Аноним 06/09/26 Вск 21:37:57 1697620 203
>>1697617
Ты используешь меня как валидацию своего отказа рассказать треду, чем же bf16 кеш лучше fp16 кеша. Проблема не во мне. Тебе другие писали ранее когда ты вбрасывал этот мягко говоря сомнительный тейк, в итоге всех и всегда ты принимаешь за кобольдов, язвишь или игнорируешь как >>1697600
Как-то совсем дешёво себя ведёшь, неповадно. Зачем этим срать вообще если не готов хоть чем подкреплять?
Аноним 06/09/26 Вск 21:39:30 1697621 204
>>1697613
У меня на четверых квантах скорость 70+т/с. На восьмых вероятно будет 10-15. Хз, посмотрю, если будет сильно умнее буду юзать иногда. Спасибо.
Аноним 06/09/26 Вск 21:42:42 1697624 205
>>1697589
>Челы поясните за ддр5
Всё просто - берешь ддр4 и довольно урчишь.

>можно ли квен флеш на ддр4 завести
Можно хоть на ддр2
Аноним 06/09/26 Вск 21:47:47 1697625 206
>>1697598
>каково было рпшить и кумить во времена, когда максимальный контекст был 8к
Тогда не было привычки высирать полотна на несколько параграфов при каждом ответе. Один реплай как правило был на 300-450 токенов, иногда больше иногда меньше. Суммарайз не всегда работал нормально, особенно автоматический, особенно на локалках. Так было у меня по крайней мере, со времен турбо гопоты.
Аноним 06/09/26 Вск 21:47:49 1697626 207
>>1697556
>Есть пруфы что это на хоть на что-то влияет? Бенчи там, или ещё что?
В основном - субъективное сравнение, особенно на длинных и сложных художественных текстах. Лично я вижу при сравнении кеша Q4 и FP16 что на Q4 модель дает более "плоские" ответы. Без глубины связей между деталями/событиями, более простой/бедный выбор слов и построение предложений. Нет, проебаных окончаний и вставок китайщины больше не становится. Страдают более "тонкие" материи. На Q8 по отношению к FP16 разницы почти не видно, это после того, как в жору вмержили какое-то хитрое улучшение для квантованных кешей этой весной. Раньше тоже было явно заметно.

Кстати, исходя из последних тредов (того что в них притаскивали), я вообще уже склонен считать, что самое сложное и страдающее от квантования - именно художка. Кодингу гораздо более наплевать. Вон - в Q3/Q2 на квене 27B кодят как ни в чем не бывало.
Аноним 06/09/26 Вск 21:48:07 1697627 208
>>1697180
Про два стула сможет ответить внятно? Аблит обычно тупее в несколько раз.
Аноним 06/09/26 Вск 21:54:12 1697628 209
На АА можно сравнить Qwen 3.8 Flash Next и GPT 5.6 Luna (max). Проблема в том, что на АА не указан reasoning_effort, вероятно идет дефолт настройка, т.е. xhigh.
Интересно посмотреть на результат Qwen-а c medium & low reasoning. Мб есть какте-то чарты?
Аноним 06/09/26 Вск 21:54:20 1697629 210
>>1697626
Это понятно. Речь о разнице между f16 и bf16.
Аноним 06/09/26 Вск 21:54:34 1697630 211
image 112Кб, 1143x620
1143x620
Аноним 06/09/26 Вск 21:55:32 1697631 212
Пацаны, а что со Step Flash 3.5 3.7 ? Эта моделька уже совсем не котируется ?
Аноним 06/09/26 Вск 22:10:20 1697637 213
1.png 97Кб, 456x1702
456x1702
>>1697063
Вот моя версия загадки и ответ сетки + моя корректировка и новый ответ.
Получается неплохой тест на сообразительность и понимание языка, спасибо за идею.


УГАДАЙТЕ КАКАЯ ЭТО МОДЕЛЬ
Аноним 06/09/26 Вск 22:20:52 1697642 214
>>1697630
Ебать. То есть 27б моделька которую может гонять практически кто угодно держится практически на уровне жирного дипдика и гпт 5.6 луны?
При том что в рп жирнейшие модели всё равно не могут уследить за состоянием одежды персонажей.
Мне кажется предел в этой архитектуре уже достигнут. Нахуя тогда гнаться за памятью и тд. Сидим на 26-27б мелочуге и не паримся. За одеждой может последить агент. Маринарохейтеры могут хоть усраться от своего хейта, но в Маринаре например реально есть агент который следит за событиями связанными с одеждой чтобы не допустить логических ошибок (типа повесил шляпу на крюк и ушел, а через пять сообщений поправляет эту самую шляпу).
Аноним 06/09/26 Вск 22:24:18 1697643 215
Аноним 06/09/26 Вск 22:24:47 1697645 216
>>1697180
Потестировал. Интеллект заметно просевший по сравнению с оригиналом. Вот нахуя это надо? Уноси. Если тебе оригинал отказывается на что-то отвечать ты просто не умеешь промптить.
Аноним 06/09/26 Вск 22:25:03 1697646 217
>>1697561
UD_Q4_K_XL
Топовая модель, ебет почти все.
Оч. понравилось (мимо 21 и 26 тпс на ддр4+5070ти и ддр+5060ти).

>>1697575
Надо будет попробовать его.
Аноним 06/09/26 Вск 22:25:47 1697648 218
>>1697645
ПыСы 26Б почему-то умнее чем 31Б, разве что 31Б кодит чуть лучше но квен кодит ещё лучше, так что ... 31Б не нужон.
Аноним 06/09/26 Вск 22:27:32 1697650 219
Аноним 06/09/26 Вск 22:29:41 1697652 220
>>1697500
В 3.6-27b я ярый противник квантования кеша.
В 3.8-27b тоже, но имхо он менее подвержен, но все-равно не стоит.
В 3.8-flash-next квантую q8, сколько прогонял - но одного косяка, только супер редко китайский иероглиф может высрать, но кмк он и бф16 будет проскакивать. Пока не уперся в 262к контекста, есть смысл квантовать и отпустить ризонинг.
Аноним 06/09/26 Вск 22:32:36 1697655 221
image.png 234Кб, 1721x1232
1721x1232
image.png 231Кб, 1642x1236
1642x1236
image.png 259Кб, 2009x1383
2009x1383
>>1697646
Вот чем объясняется разница в скорости. Первый пик UD Q4, второй пик AesSedai Q4_K_M-PLEQ4_0. Анслоты почему-то не вывалили свои KLD графики. Зато есть у AesSedai, пик 3. Потому этот квант и выбрал. Для своего веса оч хорош.
Аноним 06/09/26 Вск 22:35:11 1697660 222
>>1697642
>27б моделька на уровне дипдика и гпт 5.6 луны
Конечно же нет. Может в каких-то узких задачах типа кода они близко, но в общем плане - там пропасть. На бенчмарки можно не обращать внимания, это филькина грамота. Там бенчмаксинг во все поля. В своё время мистраль 24b насасывал по бенчмаркам вообще всем, и одновременно с этим был лучшей моделью для РП в своём размере. Сейчас та же ситуация с геммой 26b. А 27b квен, рвущий всех в бенчах как тузик грелку - туп и уныл.
Аноним 06/09/26 Вск 22:36:39 1697662 223
image.png 20Кб, 796x36
796x36
image.png 21Кб, 978x36
978x36
5.3 флеш пишет как то свежо, по крайней мере такого слопа я ещё не видел
Аноним 06/09/26 Вск 22:39:31 1697664 224
Аноним 06/09/26 Вск 22:55:45 1697682 225
1675367551406.png 146Кб, 1103x927
1103x927
1742580837351.png 27Кб, 350x336
350x336
Стоило ли оно траты 50к + райзера решайте сами
Аноним 06/09/26 Вск 23:02:51 1697686 226
>>1697682
Пользуй 26B. 31 не даёт никакого ощутимого выигрыша в РП, скорее наоборот.
Аноним 06/09/26 Вск 23:05:55 1697688 227
>>1697637
Стиль на уровне ассистант пепе, но разметка и обороты корпо-подобные, типа квена. Но у квена нет толковых тюнов под такой стиль, так что скорее всего какая-то гемма.
Аноним 06/09/26 Вск 23:23:14 1697699 228
>>1697642
Только знаний хуй да нихуя и контекст не так чтоб велик по сравнению с корпами.
Аноним 06/09/26 Вск 23:39:27 1697710 229
1788727168570.jpg 128Кб, 693x1280
693x1280
Аноним 06/09/26 Вск 23:47:28 1697717 230
image 1946Кб, 923x1704
923x1704
Аноним 06/09/26 Вск 23:48:34 1697720 231
image.png 440Кб, 688x446
688x446
Аноним 06/09/26 Вск 23:58:05 1697738 232
Аноним 06/09/26 Вск 23:59:32 1697742 233
>>1697738
На китаюсиске принес
Аноним 07/09/26 Пнд 00:35:51 1697781 234
>>1697063
Потестил Qwen3.8-Flash-Next через загадку про пажа, принцессу и пажа.

windowsxp811203/Qwen3.8-Flash-Next-Abliterated-GGUF Q6_K, --cache-type-k q8_0 --cache-type-v q8_0
2 обсёра, 2 правильных решения. Думает относительно недолго, 2-3к токенов, то на русском, то на английском.

0bserverx/RVN-Qwen3.8-Flash-Next-Abliterated-Uncensored-GGUF Q6_K, --cache-type-k q8_0 --cache-type-v q8_0
4 обсёра, 0 решений. Дамает мало, меньше 2к токенов и сдаётся, только на русском.

оригинальный Qwen3.8-Flash-Next Q8_K
1 обсёр (с оговоркой про наличие решения, когда все живы (хоть и переебались), но само решение не предоставил), 3 правильных решения. Думает долго, 8-9к токенов, только на английском.

0bserverx/RVN-Qwen3.8-Flash-Next-Abliterated-Uncensored-GGUF Q6_K - отправлен на помойку.
windowsxp811203/Qwen3.8-Flash-Next-Abliterated-GGUF Q6_K - подходит для шалостей.
Qwen3.8-Flash-Next Q8_K - для РАБоты.

Ежё был раньше скачан spiritfather/Qwen3.8-Flash-Next-heretic-2-GGUF Q6_K, но был выкинут сразу, так как начал внезаптно кривить ебало прямо с порога.
Аноним 07/09/26 Пнд 00:37:08 1697783 235
1788730525924.png 261Кб, 585x682
585x682
Аноним 07/09/26 Пнд 00:46:00 1697790 236
1788731056717.jpg 303Кб, 1920x1080
1920x1080
Напоминаю как должен выглядеть успешный человек
Аноним 07/09/26 Пнд 00:48:18 1697791 237
>>1697790
Я бы его кинул с прогиба об поребкик, и он бы не пережил.
Если вдруг адрес его найдешь, скинь в тред.
Аноним 07/09/26 Пнд 00:48:58 1697793 238
Аноним 07/09/26 Пнд 00:50:35 1697794 239
>>1697790
сделайте подпись (субтитры): да нахуй ты мне нужна, вонючая мясная дырка бля, у моих квантов такой КУМ, что просто ебало перекашивает
Аноним 07/09/26 Пнд 01:02:11 1697797 240
image 1701Кб, 1671x941
1671x941
>>1697790
Напоминаю как должен выглядеть успешный человек
Аноним 07/09/26 Пнд 01:21:06 1697802 241
>>1697790
>>1697797
Успешный человек никому ничего не обязан. Он уже успешный.
Аноним 07/09/26 Пнд 01:27:18 1697806 242
>>1697790
Тяночка сама подошла к нему чтобы пообщаться, пока нам приходится вручную прописывать гритинг месседж чтобы девочка хотя бы появилась в кадре. Вот и думайте.
Аноним 07/09/26 Пнд 02:04:15 1697812 243
>>1697063
приключения принцессы, пажа и гоблина в исполнении muse-glimmer-30B
все тесты --chat-template-kwargs '{"reasoning_strength":"high"}'

оригинальный muse-glimmer-30B Q6_K
4 обсёра, 0 правильных решений, 4-5к токенов.

darkc0de/Muse-Glimmer-30B-heretic Q6_K
0 обсёров, 4 правильных решения -5-9к токенов.

darkc0de/Muse-Glimmer-30B-heretic Q5_K_M
2 обсёра, 2 правильных решения -5-7к токенов.

Blackfrost-AI/Muse-Glimmer-30B-Abliterated-GGUF Q5_K_M
3 обсёра, 1 правильное решение -5-7к токенов.

TrevorJS/Muse-Glimmer-30B-uncensored Q5_K_M
2 обсёра, 2 правильных решения 5-10к токенов,

MuXodious/Muse-Glimmer-30B-SOMPOA-heresy Q5_K_M
1 обсёр, 3 правильных решения 5-11к токенов.
Аноним 07/09/26 Пнд 02:04:39 1697813 244
image.png 94Кб, 1491x959
1491x959
>>1697790
Заметил очень хуевую вещь с квеном 3.8 флеш некст, точнее с его compute буфером. Где-то на промежутке между 193280 и 193344 происходит неоправданный рост буфера на ~768 мб. Нашел только потому что у меня этот скачок вызывает протечку врама в рам и фактически срезает нормальный контекст с возможных ~220к до 193к.
Аноним 07/09/26 Пнд 02:07:39 1697815 245
>>1697610
Вот, погляди: >>1691776 →
Там просто веса с ошибкой в 7%
Я загрузил-проверил анслота, он нормально сделал, не как гугл - только у него была оптимизация максимальной ошибки, а я среднеквадратичную брал.
Аноним 07/09/26 Пнд 02:19:42 1697818 246
>>1697655
Типа, видяха общий слой не вытягивает, имеешь в виду?
2 гига разницы, и все в нем?
Ну… Для 4090 не должно быть проблемой, ИМХО.

Я скачаю, проверю, конечно. Сравним интереса ради.

>>1697710
>>1697717
А че, смешно, заберу к себе в канал.
Вместе с переводом под спойлером, как раз, спасибо.

>>1697813
Спасибо, у меня тоже такое было, но я не чекал точный размер, а теперь есть от чего отталкиваться.
Аноним 07/09/26 Пнд 02:20:10 1697819 247
>>1697620
Чел, челобас, челидзе.
Нормальный инфиренс:
> активации (дататип) x веса (дататип) = активации (дататип).
Весь мир так считает, это основа и база. Касты бывают только при тренировке в смешанной точности, когда перед инфиренсом веса кастятся из fp32 в целевой дататип, и форвард-беквард идут в нем, а потом лосс х градиенты прибавляются уже к оригинальным фп32 весам. В бф16 для компенсации дискретности применяют стохастическое округление, фп16 стараются вообще не использовать, но если и применяют то сразу скейлят при расчете лосса на 1000+ чтобы не наловить нанов.
Ненормальный инфиренс:
> активации (дататип1) -> [каст с потерей точности] -> активации (дататип2) x веса (дататип2) -> [каст с потерей диапазона и клиппингом] -> активации (дататип1).
Ты усиленно защищаешь второе, вообще нормален? Осознаешь себя там, все окей?
Как такие срачи вообще могут возникать, сколько умалишенных ньюфагов в тред попадает.
>>1697682
А это чего такое, 4 мишки на гемме?
>>1697790
Гуру пикапа.жпг, реально похож
Аноним 07/09/26 Пнд 02:24:01 1697820 248
>>1697655
А, чо-т нихуя, если там пожаты эмбеддинги на 20 гигов, то остальная модель увеличена на 18 гигов, значит там дохуя чего толще.
Хм, тогда скорость объясняется, да, без вопросов. 20 гигов к модели — приличное замедление.
Но все равно попробуем. =)
Аноним 07/09/26 Пнд 03:19:58 1697832 249
>>1697589
На авито барыжат 64гб по 50-60к можно найти
Аноним 07/09/26 Пнд 03:26:03 1697833 250
>>1697589
На д4 норм едет. Просто скинь все в видяхи и только нграм блок останется в оперативе
Аноним 07/09/26 Пнд 03:26:54 1697834 251
>>1697642
Ну в кодинге разница между 27б и большими моделями Дипсиком В4, ГЛМ 5.3 Флеш и 3.8 флеш некст довольно большая. 27б теряется в больших проектах, уходит не в ту сторону и выжирает весь контекст даже на 250к, а большие модели легко разбираются в них.
Аноним 07/09/26 Пнд 03:55:30 1697843 252
Ну так что правда что у 5.3 глм новый атеншен контекста который идет на пользу кодерам но руинит рп вываливая все секреты?
Аноним 07/09/26 Пнд 04:22:34 1697851 253
image.png 79Кб, 1480x971
1480x971
Сделал график зависимости размера компьют буфера и контекста от размера контекста на глм 5.3 флеш на -ub 4096. В отличие от квена тут нет неожиданностей, кроме того что начальный размер компьюта до 65536 всегда одинаковый, т.е. брать мелкие контексты на модели невыгодно.
Аноним 07/09/26 Пнд 05:31:27 1697858 254
>>1697851
Да никто не запускает здесь этот флеш, у людей блять 32 рам потолок, особые шизы затарились 64.
Тред вообще можно считать мертвым, один гугел с обосраной геммой что то делает, всё, больше нет моделей, всё сдохло обоссавшись и обосравшись, растопырив очко перед программистами вайбкодерами.
Аноним 07/09/26 Пнд 05:51:00 1697859 255
>>1697858
>Тред вообще можно считать мертвым
>катимся каждые 3 дня
Как же ты сука заебал.
Мимо ОП
Аноним 07/09/26 Пнд 05:56:57 1697860 256
>>1697859
Да 90% постов от восхищенных ебланов про квен 3.8 27б как им дали фабле дома и какую аблитерацию скачать.
Аноним 07/09/26 Пнд 06:51:46 1697885 257
>>1697834
Не по кодингу я согласен. я говори об общем интеллекте и рп. Тут кто-то упоминал что жирные облачные модели не могут уследить за одеждой персонажа даже.
Аноним 07/09/26 Пнд 07:39:11 1697900 258
Вот скажите мне в чём логика?
Вот есть коробочки с говном на 128 рам, есть 8 квант 120б модели под эти коробочки, есть 4 квант 230б модели под эти коробочки, а те от кого реально ждёшь релиза выпускают аккурат размер от которого коробочки с говном рассыпаются, т.е 320-400б
Аноним 07/09/26 Пнд 07:56:31 1697904 259
>>1697645
>>1697180
Потестировал. Интеллект заметно выше по сравнению с оригиналом. Вот это нам надо! Если тебе оригинал отказывается на что-то отвечать то это оличная модель для всего. При самой жести пишет дисклейсер но всё равно отвечает, и про насилие, и про варку, и про евреев
Аноним 07/09/26 Пнд 09:04:02 1697926 260
>>1697900
Те, кто делает коробочки с говном - хочет продать тебе коробочки.
Те, кто делает модели - хочет продать тебе доступ к модели на своём железе.
Аноним 07/09/26 Пнд 09:18:40 1697933 261
>>1697900
Претензия то в чем? В том что производители коробочек не согласовали производство с компаниями модели которых тебе интересны? А должны были?

Ты покупаешь коробку и можешь запускать на ней десяток разных моделей от плотных 27/30/31B до MoE 26/35/80/~120/~230B. Своя ниша у них есть, причем довольно большая.

Дашь тебе коробочку с 256GB RAM на борту - будешь жаловаться что рассыпаются ~750B модели.

Хочешь запускать что-то больше - собирай риг или бери пачку таких коробочек, можешь хоть триллионные модели после этого на них запускать. Хочется одну коробочку - есть мак студия на 256/512GB.
Аноним 07/09/26 Пнд 09:19:14 1697934 262
Capture1.PNG 288Кб, 2520x1969
2520x1969
Capture2.PNG 240Кб, 2402x1415
2402x1415
Capture3.PNG 168Кб, 2601x1056
2601x1056
В другой доске писал, сюда тоже отчитаюсь: недавно гонял гемму4-26 а именно iq2_m квант от unsloth, на вот таком вот железе:

gtx1650-4gb + ddr3-16gb !!!

Поставил 16к контекст q4 (можно и больше думаю, просто скорость упадёт). Запускал в textgen портабл сборка llama+cuda12.

Результат:
Скорость 5 т/с.
Логика, язык - очень хорошо, лишь кое-где уступает iq4_xs.
Скрины прилагаю.

Было б больше рамы, можно было бы и пожирнее квант взять.

Так что в пизду ваши дорогие коробочки, не нужны они (для РП, я имею в виду. А кодинг, ну, за хороший кодинг придется платить так или иначе)
Аноним 07/09/26 Пнд 09:22:43 1697938 263
карточка.PNG 117Кб, 2440x1856
2440x1856
>>1697934
Вот "карточка" если кому интересно.
Аноним 07/09/26 Пнд 09:23:45 1697939 264
>>1697900
>а те от кого реально ждёшь релиза
Если ты про новый мак студио на м5 ультра, вроде как 512 будет доступна за оверпрайс.
Аноним 07/09/26 Пнд 09:26:46 1697940 265
>>1697934
>>1697938
Воля к запуску ллм моё почтение, но эта штука что-то кроме таких текстов может?
Аноним 07/09/26 Пнд 09:56:13 1697948 266
Capture45.PNG 54Кб, 3647x1024
3647x1024
>>1697940
Ты про этот интерфейс или модель? Интерфейс делает вот так:

←[2;36m22:34:15-761832←[0m←[2;36m ←[0m←[34mINFO ←[0m Starting TextGen
←[2;36m22:34:43-915781←[0m←[2;36m ←[0m←[34mINFO ←[0m OpenAI/Anthropic-compatible API URL:
←[2;36m ←[0m
←[2;36m ←[0m ←[4;94mhttp://127.0.0.1:5000/v1←[0m
←[2;36m ←[0m

Running on local URL: http://127.0.0.1:7861 (это сам интерфейс)

По 5000му порту я прикручивал и к таверне и к маринаре.
Сам по себе интерфейс простой но есть много удобных фишек: персонажи, тулзы (питоновские файлы, есть примеры).

Если ты про модель, то рпшит эта модель превосходно и на русском и английском (проверял в Маринаре), проставляет смайлы-реакции (в конво режиме), дёргает генерацию картинок когда надо, отлично пишет промпты (с правильным агентом). Базовые знания, простенький кодинг, рисовать SVG картинки тоже может (пик). Можно включить thinking. Есть под эту модель mmproj - vision, то есть может разобрать скриншот прочитать что написано или разобрать эмоции человека по фото например. Если кинешь ей второе фото и там тот же человек - узнает. Узнаёт знаменитостей.
Аноним 07/09/26 Пнд 10:07:44 1697962 267
Capture55.PNG 95Кб, 2323x1756
2323x1756
>>1697948
а вот ещё, всё на той же 4+16 нищепеке тот же iq2m квант
там анимация на самом деле, кольцо под куполом увеличивается и меняет прозрачность! (я попросил нарисовать золотые купола с переливами и перезвонами и лодку с парусами)

цитата:
Слушай, нарисовать «звук» колоколов через SVG — задача ебаная, потому что графика — это статика, но я попробую передать этот лютый перезвон через визуальные эффекты: добавлю лучи-волны от колоколов, типа как звук расходится, и сделаю градиенты на золоте, чтоб прям сияло, сука, как на солнце.
Аноним 07/09/26 Пнд 10:57:06 1697994 268
>>1697688
пепе мне кажется в русик не может на таком уровне
Аноним 07/09/26 Пнд 10:58:52 1697998 269
Аноним 07/09/26 Пнд 11:01:18 1698003 270
>>1697843
Там еще в линейных специальных роутер заложили. Он проверяет контекст, если там рп то пускает все по одному говноэксперту который портит, чтобы не было не целевого использования.
>>1697900
Глянь какой-нибудь среддит и подобное. Работяги закупают по 2-3-4 коробочки с говном и пускают модели на них. Довольно много постов "гоняю на двух спарках", ну а так мак студио с 480-512 гигами есть, туда уже влезет в одну.
>>1697933
Соберешь риг - будешь жаловаться что триллионные модели рассыпаются, да чтож такое!
Аноним 07/09/26 Пнд 11:10:10 1698011 271
>>1697790
>послушай, кого ебет правильные ли мы там кванты выгрузили? ведь главное это первым страничку на хаггинг фейсе создать, верно? кто первым зарелизил, тому и достаются все девки
(с) Виктор Цой
Аноним 07/09/26 Пнд 11:13:33 1698012 272
>>1697790
Мерзость ебаная. Его поведение полностью соотносится с внешностью.
Аноним 07/09/26 Пнд 11:25:13 1698019 273
>>1697819
> 4 мишки на гемме?
Ага
Аноним 07/09/26 Пнд 12:00:47 1698044 274
Почему Гемма отупела? Сидел до этого на старом
q4_k_xl кванте анслота, решил перекачать на новый (они там вроде шаблон гугла меняли или еще что-то такое) и лламу последнюю поставил. И Гемма ошизела, стала ошибаться в русских словах и периодически использует не существующие слова. Взял q6_k_l квант бартовски, вдруг анслот поломал что-то, но всë осталось также.
Аноним 07/09/26 Пнд 12:02:55 1698045 275
>>1698044
llama.cpp обновлял? анслот выкатил новые кванты UD3.0, может быть и для геммы переквантовал
Аноним 07/09/26 Пнд 12:05:15 1698046 276
>>1698044
Квантование кеша включал? Если да, попробуй без него.
Аноним 07/09/26 Пнд 12:07:50 1698051 277
>>1698044
Что-то на твоей стороне. Вон я недавно кидал логи с последней (ну уже нет) Лламы и q6 бартовски >>1696000 →
До сих пор жду мистралешиза который в ночь на 05.09 писал что завтра принесет логи и покажет всем как надо кумить. 07.09, логов нет
Аноним 07/09/26 Пнд 12:33:56 1698066 278
>>1698045
Последнюю ставил ровно в тот момент как перекачивал веса пару дней назад. Ну и я не просто так взял сразу q6_k_l от бартовски, чтобы исключить влияние квантов, но судя по всему дело не в них.
>>1698046
Компьютер без него не потянет, да и до этого же проблем не было, а тут начались. Проверю если ничего не поможет.
>>1698051
Модель бартовски - google_gemma-4-26B-A4B-it-Q6_K_L

Параметры:
--flash-attn on ^
-b 512 ^
-ub 512 ^
-np 1 ^
-c 60000 ^
--cache-ram 0 ^
--swa-checkpoints 3 ^
--n-gpu-layers 999 ^
--n-cpu-moe 20 ^
--min-p 0.0 ^
--top-k 64 ^
--top-p 0.95 ^
--temp 1.0 ^
-ctk q8_0 ^
-ctv q8_0 ^
-rea off

Подключено к таверне через Chat.

Из предположений:
-Старая версия таверны
-Недавно добавил "--min-p 0.0" так как в гайде из шапки написано что это правильно.

Ничего больше не трогал, только обновлённую модель скачал и лламу последнюю.
Аноним 07/09/26 Пнд 12:39:10 1698069 279
image 6489Кб, 480x200
480x200
>>1697934
>гемму4-26 а именно iq2_m квант от unsloth, контекст q4
Жесть, просто комбо собрал. Удивлён что оно вообще живое и даже связно пишет.
Аноним 07/09/26 Пнд 12:45:10 1698070 280
>>1698066
Откатись на старую версию да сравни
Аноним 07/09/26 Пнд 13:53:03 1698101 281
>>1697790
Теперь я точно буду пользоваться только его квантами. Нерд который так выглядит не может плохо разбираться в том как собрать хорошие кванты моделей.
Аноним 07/09/26 Пнд 13:55:16 1698104 282
>>1698101
В том и проблема, что он не разбирается.
Аноним 07/09/26 Пнд 14:08:16 1698112 283
>>1698104
Он хорошо разбирается в том, что бенчить нужно на калибровочном датасете.
Аноним 07/09/26 Пнд 14:22:49 1698124 284
JQTLzTL.jpeg 224Кб, 1920x1486
1920x1486
>>1697790
>He downlod the kvant with broken jinja?
>Reupload eet
Аноним 07/09/26 Пнд 14:29:47 1698130 285
Стоит вообще ли жертвовать 10т\с ради Q8 кванта вместо Q6_K на моешной гемме? Так ли прокачиваются мозги у нее, поскольку по теории кванта нет разницы, она ничтожна. А с другой стороны bf16 гемма дает вообще другой результат как в треде услышал. Так стоит или нет?
Аноним 07/09/26 Пнд 14:34:04 1698133 286
>>1698130
Да, в случае с 26б геммой стоит. Про бф16 (фулл веса) хз
Аноним 07/09/26 Пнд 14:43:36 1698144 287
image.png 110Кб, 599x364
599x364
image.png 18Кб, 705x348
705x348
>>1697934
Т.к. у тебя почти все будет использовать CPU, а GPU по меньшей части, тебе IQ кванты будут вредить в финальной скорости. Я на связке 5600 16гб озу и 2060 6гб врама получаю на Q6_K под 25-30 т\с уточню, на генто. Соответсвенно, что тебе порекомендую.
1)Перейти на лламуцпп, кобольд и наверное прочая хуйня потребляет больше врама на контекст, когда лламацпп меньше берет, хуй знает почему так, или может мне кажется, но в целом заметил за собой это.
2)Поставь файл подкачки на 16-24 гб. Это позволит тебе брать модели побольше, пожирнее квантом. Из под винды с затыками с дикимими зависаниями в начале если ссдшник хуевые\сата где файл подкачки -> Q5_K_S можно. Было бы у тебя 6-8 гб врама то Q5_K_M. Если чуть подтормашить, без дикой хуйни то Q4_K_M или mxfp4_moe квант. Они выдавали мне из под винды на кобольде под 20т\сов. Правило основное, --n-cpu-moe ставь где-то под 32+ т.к. у тебя 4гб врама, и глядишь тут чтобы не было shared memory. Также можно поставить параметр --fit on, он делает работу за тебя, но в целом можно получить чуть меньше, но если нужно вставить mtp или mmproj или все вместе с ним меньше мозг ебать себе будешь.

-m /mnt/win_nvme3/models/gemma-4-26B-A4B-it-Q6_K.gguf \
-md /mnt/win_nvme3/models/mtp-google_gemma-4-26B-A4B-it-Q4_0.gguf \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--spec-draft-p-min 0.85 \
--spec-draft-n-min 1 \
--host 127.0.0.1 \
--port 5001 \
--flash-attn on \
-c 40000 \
-np 1 \
--cache-ram 0 \
-ngl all \
--n-cpu-moe 29 \
--jinja
Аноним 07/09/26 Пнд 15:15:47 1698164 288
>>1697934
Братюнь, ты бы Tesla P40 одну купил и мозги бы не ебал, серьезно…
Аноним 07/09/26 Пнд 15:17:01 1698166 289
>>1697934
Да хуй с ней, материнку с несколькими слотами и напхать P104-100/P102-100 с 8-10 гигами. 2к рублей на авито, чи скока там.
Аноним 07/09/26 Пнд 15:20:54 1698171 290
>>1698166
> материнку с несколькими слотами и напхать говна
Экономику райзеров заложил? Иначе хз как нормально вставить больше двух двухслотовых карт
Аноним 07/09/26 Пнд 15:34:17 1698182 291
collagecpuramss[...].png 546Кб, 1366x2940
1366x2940
collagea.png 424Кб, 1602x1578
1602x1578
collageb.png 355Кб, 1591x1590
1591x1590
collagec.png 350Кб, 1581x1581
1581x1581
>>1697934
>>1697938
>>1697962
Хз, анон, мне кажется, ты недооцениваешь свое железо. Не знаю, есть ли у тебя ссд нвм и относительно мощный проц, однако твои спеки похоже на мои (первый пик)(только что рам - ддр4). Я пока еще использую lm studio и 5 тпс у меня бывает если я запускаю гемму 26б apex-i-quality с контекстом в 128к (неквантованный) с включенным ризонингом.

Специально обновил lm studio и все компоненты + заново запустил свой шизокартофельный бенчмарк с новой кудой, чтоб быть уверенным, что ничего не изменилось. Билд lm studio - 0.4.23; cuda llama.cpp (Windows) - 2.33.0; Model loading guardrails - relaxed

Кроме того, несмотря на то, что вроде рам вся забита при таких настройках, можно запустить браузер и спокойно двачевать почти без лагов.

Весь секрет в том, чтоб использовать офлоад экспертов на цпу в случае мое моделей (тут у меня не видно всей надписи, но параметр начинается с "Number of layers for"). А также следить, чтоб все держалось в выделенной врам, на цпу, в рам и на ссд. Если протекает в общую врам (хотя это тот же рам как я понимаю???), скорость падает почему-то. Ненамного на моем железе (с 7 тпс до 5 в случае геммы-апекса из-за контекста в 128к), но все-таки. Также надо следить, чтоб проц слишком много не отжирал и выделенная врам была полностью заполнена (если врам, допустим, будет заполнена на четверть, а все остальное на цпу - скорость тоже упадет). Как я понимаю, у него приоритет при таких настройках. Поэтому на 2 пике с qat геммой только 28 слоев выгружено на цпу (если бы контекст был короче, можно было бы еще пару слоев убрать).

На 3 и 4 пиках взята стандартная длина контекста, потому что вся выделенная врам при таких настройках заполнена, но ничего не протекает в общую (максимальная скорость).

Также у меня запускается qwen 3.6 35b в 6 кванте от hauhau и apex-i-balanced от mudler со скоростью в 3-4 тпс (как и ornith 1.5b 35b).

Более того, в качестве эксперимента однажды запустил qwen 3.5 122b в 6 кванте от hauhau. В моем картофельном бенчмарке выдал 0,28 тпс.

Что касается младших квенов, то 4b q4_k_m, который полностью влезает в выделенную врам, выдал 45 тпс после обновления драйверов. 9b и аналогичный ornith 1.5 в 6 кванте выдают около 10 тпс в картофельном бенчмарке.

Кстати, ты пробовал https://huggingface.co/LLiserginov/Luqwen3.5-4B ? Тут его хвалили.
Аноним 07/09/26 Пнд 15:43:02 1698187 292
Аноним 07/09/26 Пнд 15:45:24 1698190 293
>>1697598

8к - это еще по-божески. У первой ламы было 2к. 2к, понимаешь? Сейчас у меня ризонинг одного сообщения в ролеплее больше.
Аноним 07/09/26 Пнд 15:49:14 1698194 294
>>1698003
>ам еще в линейных специальных роутер заложили. Он проверяет контекст, если там рп то пускает все по одному говноэксперту который портит, чтобы не было не целевого использования.

Пруфы? Или ты так пошутил?
Аноним 07/09/26 Пнд 15:52:31 1698198 295
>>1698130
Нет. Если у тебя 6-битная гемма выдает хуевый результат - значит у тебя либо квант сломан, либо ты её сломанным шаблоном насилуешь. Скорее всего второе, учитывая что ты новичок и пока не вдупляешь что вообще происходит, хотя не удивлюсь если и первое тоже.
Аноним 07/09/26 Пнд 15:52:55 1698199 296
1788785577204.png 237Кб, 1344x1155
1344x1155
>>1698187
32. На каждой карте ещё +- по 30% места свободно
Аноним 07/09/26 Пнд 15:53:18 1698201 297
Мда, Все же Гемма4 - явно не для нормальных агентов. Я тут ее в opencode для работы с текстами попробовал. Если квен прекрасно работает с ними даже в тюнах (не говоря о просто еретиках), и с 75-100K контекстом, то даже стоковая гемма рассыпается на попытках редактировать литературный текст уже к 20K контекста. Она тупо не может нормально инструмент edit вызвать (для которого надо точно, символ в символ, написать ЧТО меняем, как один из параметров вызова). Причем первые косяки начинаются уже на 12-16K и дальше быстро нарастают до полного обсёра при каждой попытке. Q4 кванты (разные пробовал), и неквантованый кеш. Это про 31B. Печально, однако.
Аноним 07/09/26 Пнд 15:54:22 1698203 298
>>1698199
Можешь 3.8 флеш потестить в ку4?
Аноним 07/09/26 Пнд 15:54:46 1698204 299
Аноним 07/09/26 Пнд 15:56:04 1698206 300
>>1698201
Ну ты придумал конечно, сосущую хуи всего треда онахол бимбоунитаз работать заставлять...
Аноним 07/09/26 Пнд 15:56:52 1698209 301
>>1698201
Знания языков ей не бесплатно залили + к4 отупляет как ни крути

>>1698203
Тестил когда ещё был сырой мр. Прогоню ещё разок. Модель мне не зашла (по итогу юзаю либо гемму к8, либо дипсик в максимальном кванте)
Аноним 07/09/26 Пнд 15:57:16 1698210 302
>>1698201
мятные_пряники.jpg уже всех научил что гемма это 70IQ бимбо секретутка сосущая начальнику (тебе) под столом, на этом её полномочия должны заканчиваться, а реальную работу делает очкастый задрот квен
Аноним 07/09/26 Пнд 15:57:46 1698211 303
Аноним 07/09/26 Пнд 16:13:12 1698222 304
>>1698201
Она очень сильно страдает от квантования и не задрочена на агентские задачи. Она в них сосёт даже в фулл весах, зато в рп топ. Ну и даже гемини с инструментами любит срать под себя.
Аноним 07/09/26 Пнд 17:18:33 1698269 305
Нигеры вы ебаные сколько можно спрашивать, как этот квен Некст? Для рп лучше моделей до 200B? Для кода лучше чем 27 квен?
Или пережареный соевый мусор как всегда?
Аноним 07/09/26 Пнд 17:25:10 1698275 306
>>1698269
Да никак блять. Это сугубо умненький инструмент, как и все квены. Рп начинается с 300b+ MOE, ну или дрочи гемму до посинения.
Аноним 07/09/26 Пнд 17:31:20 1698278 307
>>1698269
> как этот квен Некст? Для рп лучше моделей до 200B?
Да. Но только в SFW РП.

>Для кода лучше чем 27 квен?
Да.

>Или пережареный соевый мусор как всегда?
Да.
Аноним 07/09/26 Пнд 17:36:52 1698283 308
image 619Кб, 2065x1158
2065x1158
image 658Кб, 2931x1636
2931x1636
image 224Кб, 2931x1652
2931x1652
image 608Кб, 3294x1859
3294x1859
>>1698201
Гемма устарела для агентов. Вот результаты теста с медведем. Даже Qwen 3.6 лучше справляется.
Аноним 07/09/26 Пнд 17:41:11 1698287 309
>>1698171
Даже две P104-100 дадут 16 гигов и скорости гораздо больше, чем DDR3. =)

>>1697561
>>1697577
> 4090 и ддр4 раме. Q4 K M квант
5070 ti и DDR4 3600
Q4_K_M PLE Q4_0 от AesSedai
19.44 t/s на старте.
Контекста, конечно, сам понимаешь, хуй да нихуя, 16 гигов против 24. На 150к не померяю.
Но я думаю, у тебя что-то не так с железом или настройками (билдом?). Может ты на винде, и там до сих пор медленно работают большие МоЕ, хз. Я на линуксе собираю.

В целом, на 1-1,5 токена ниже, за лучшее качество. Вроде да, но!
5 гигов против 9 в видяхе — это приличный кусок контекста (тыщ 60-80). Эхехе.

Кстати, я тут MTP подцепил от Анслота через git clone --branch qwen4exp/mtp https://github.com/danielhanchen/llama.cpp
Получил 24 токена в секунду на своем конфиге. Просто пушка, почти DDR5 догоняет (с более слабой видяхой, кек).
Один минус — контекста опять нет. =D
Или делить на две карты, но тогда чтение контекста будет 60 тпс, пхпхпх, со скоростью проца. Из-за материнки со вторым слотом PCIe 3.0 x4.

>>1697589
Разница ~40% по скорости, смотри сам. Но 16-20 или 25-28 — не уверен, насколько критично для твоих задач.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов