Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 509 87 90
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №263 /llama/ Аноним 03/09/26 Чтв 17:18:19 1694457 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
178745042253308[...].jpg 6186Кб, 4000x3000
4000x3000
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1692081 (OP)
>>1689903 (OP)
Аноним 03/09/26 Чтв 17:24:17 1694462 2
Аноним 03/09/26 Чтв 17:24:58 1694463 3
Запустил qwen flash next q3_k_m с 128к контекста на 3090ти и 64, и оно даже работает на приемлемой скорости, 21 тс на генерации, на входе до 300 тс. У меня 27b_q4_k_m без мтп работал не сильно быстрее на контекстах 150к+
Аноним 03/09/26 Чтв 17:31:10 1694467 4
image.png 72Кб, 716x798
716x798
image.png 84Кб, 716x798
716x798
>>1694462
В чем если они всасывают буквально всем?
Аноним 03/09/26 Чтв 17:34:55 1694470 5
>>1694467
Ну а если датасеты другие? Вдруг слопятина свежее.
Аноним 03/09/26 Чтв 17:38:11 1694475 6
>>1694462
О, очередной кодослоп без поддержки в ламе
Аноним 03/09/26 Чтв 17:48:28 1694482 7
Я считаю в такие тяжелые для локалок времена, опен сорс должны поддерживать выпуская 100б мое и 22б денс, а не 300б гигантов.
И вообще скейлить могут все, но почему то никто не хочет пробовать уместить перформанс 300б мое в 100б
Аноним 03/09/26 Чтв 18:01:33 1694497 8
>>1694482
Я думаю китаекорпы делают то, что удобно под их железо, при этом чтобы состязаться с большими корпами.
А мелкашки чисто по-приколу делают, либо для ресерча, либо для каких-то узких задач под эмбеддед устройства.
На ригобояр строго похуй.
Аноним 03/09/26 Чтв 18:06:32 1694505 9
>>1694482
Эйрошиз, тебе только что квен 120В-А6В релизнули, имей сука совесть.
Аноним 03/09/26 Чтв 18:06:52 1694506 10
сяп
выкатываюсь нахуй из апи-треда по личным причинам
из локалок запускал только гпт2 в кловерАИ гемму четвертую в слопокванте для локального перевода ранобе по ночам.


Железо 4070 супер 12гб и 64гб оперативы

Есть смысл пытаться или с таким железом будет хуйня?
Аноним 03/09/26 Чтв 18:07:48 1694508 11
>>1694506
Глажу хвосты гемме на 6 врам 16 рам.
Думай.
Аноним 03/09/26 Чтв 18:10:03 1694516 12
>>1694505
Квен это не гемма, не могут они сделать 6b юзабельными. В этом плане вообще щас никто не гемма.
Аноним 03/09/26 Чтв 18:11:08 1694519 13
>>1694506

Для геммы 26В хватит за глаза. Там и кум и РП, все есть. Бери апасную версию.
Аноним 03/09/26 Чтв 18:12:14 1694522 14
>>1694516
>не могут они сделать 6b юзабельными.

И тем не менее сделали. Эмбеддинги творят чудеса.
Аноним 03/09/26 Чтв 18:14:05 1694526 15
Аноним 03/09/26 Чтв 18:16:03 1694529 16
>>1694522
Нахуй мне их чудеса не упёрлись, их некст модель проклята вечно быть обрезана под код и только код, ни единого сходства в рп с их максом в рп нет
Аноним 03/09/26 Чтв 18:19:32 1694531 17
>>1694506
Да нормальное железо, мало того что в восьмом кванте можно запустить 26B Гемму / 35B Квен с хорошим контекстом и нормальной скоростью, из-за 64GB RAM можно еще и попытаться что-то из 120B моделей запустить вроде 122B Квен3.5 в третьем-четвертом кванте, правда скорость там уже будет сильно меньше, но должно быть терпимо, где-нибудь 10-15t/s. Если для переводов можешь попробовать HY-MT2 30B-A3B, там работа с азиатскими языками будет лучше чем у Геммы скорее всего т.к. модель сама по себе позиционируется как переводчик.

Вот с плотными моделями пролёт из-за 12GB VRAM.
Аноним 03/09/26 Чтв 18:20:42 1694533 18
>>1694463
Но что-то она часто ловит зацикливания, 27b_q4_k_m вообще ни разу не зацикливалась у меня, хотя гоняю ее все время с квантованным кешем q4, а некст непонятно что ему надо, может это это квант от orcarouter такой поганый?
Аноним 03/09/26 Чтв 18:23:10 1694535 19
Аноним 03/09/26 Чтв 18:26:37 1694540 20
>>1694467
>>1694475
То есть вы воняете и жалуетесь на кодоунитазы
Но как только выкатывают 32B которая по кодоунитазным бенчам сосет - вы все равно воняете и жалуетесь? Логика где?
Аноним 03/09/26 Чтв 18:32:39 1694550 21
>>1694467
В том, чтобы заявить о себе и стать лучше в следующий раз.
Аноним 03/09/26 Чтв 18:40:22 1694559 22
>>1694467
Ну моешку еще можно глянуть
Аноним 03/09/26 Чтв 18:43:31 1694565 23
>>1694540
Судя по акценту на кодерских бенчмарках и 512к контексту, эти модели тоже для кодинга. И то что они хуже других моделей в кодинге не говорит о том что они будут лучше в других областях.
Аноним 03/09/26 Чтв 18:44:42 1694567 24
>>1694531
>Вот с плотными моделями пролёт из-за 12GB VRAM.
почему? не работает с фоллбеком на обычную память?
Аноним 03/09/26 Чтв 18:45:36 1694568 25
>>1694531
>в восьмом кванте
q8_0? А как он влезет в 12\64?
Аноним 03/09/26 Чтв 18:47:26 1694569 26
>>1694482
Я считаю должны вернуться к 70B денс моделям, не зря же я видяхи покупал.
Аноним 03/09/26 Чтв 18:48:11 1694572 27
>>1694568
>q8_0? А как он влезет в 12\64?
Легко и просто. Могли бы гайд в шапке прочитать но вместо этого хуйней занимаетесь
Аноним 03/09/26 Чтв 18:52:30 1694577 28
>>1694567
Плотным моделям нужно находиться полность во VRAM вместе с контекстом, иначе скорость будет очень маленькая. В 12GB влезут только мелкие плотные модели вроде 9/12B, но они будут сильно тупее 26B/35B MoE моделей, поэтому тебе даже смысла на них смотреть нету.
Аноним 03/09/26 Чтв 19:04:47 1694591 29
>>1694572
в гайде в шапке впихивают q4, q8 в том же гайде обозначен как требующий минимума 16гб видеопамяти.
Аноним 03/09/26 Чтв 19:13:42 1694595 30
>>1694591
МоЕ моделям не принципиальны эти 4GB VRAM, ну выгрузишь в RAM на пять слоев больше, скорость упадет на 10%, будет 30t/s вместо 35t/s. Для МоЕ главное чтоб она влезала в сумму RAM+VRAM. Чем большая часть модели находится во VRAM, тем выше будет скорость.
Аноним 03/09/26 Чтв 19:25:17 1694605 31
>>1694462
Ну так-то ничего себе. Выложили модели, выложили датасеты, все под apache 2.0, судя по репам на гитхабе должны выложить все для самостоятельного трейна в ближайшее время.
Считаю такое заслуживает уважения. Надеюсь модели не говно.
Аноним 03/09/26 Чтв 20:00:41 1694649 32
А что там по нграмам в квене новом? Запускаюсь с lazy-mode on и во время промпт процессинга вижу запись на диск. Виндопроблемы, или так и должно быть? Сильно вредно для диска? А то при нынешних ценах убить ссдшку прямо как-то нежелательно.
Аноним 03/09/26 Чтв 20:04:45 1694652 33
>>1694649
Там баг какой-то был с записью на диск, в прошлом или позапрошлом треде скидывали ссылку на issue на гитхабе. Не знаю пофиксили или нет.
Аноним 03/09/26 Чтв 20:21:13 1694664 34
16gb VRAM
перелопатил терабайт разного гуффна и не нашел ничего лучше чем
g4-meromero-26b-a4b-iq4_xs.gguf
щитаю это топ и 26б должно хватить всем. 70 шмокенов\наносек
(тестировал только рп, кодинг не интересует)
в чем я не прав?
Аноним 03/09/26 Чтв 20:27:09 1694669 35
>>1694506
Пробуй Гемму 26b Moe для универсальных задач и мелкий Qwen, максимальный, который полезет в твой конфиг, для кода (или для универсальных задач, если поех).

Все остальное будешь трогать потом, если захочешь.
Аноним 03/09/26 Чтв 20:29:48 1694673 36
image.png 185Кб, 1390x1220
1390x1220
Тегайтесь
Аноним 03/09/26 Чтв 20:33:29 1694674 37
>>1694664
Я ничего не лопатил, еще весной поставил Гемму 4 26 с обычной корпоративной цензурой в 4 кванте и до сих пор доволен. Изредка почитываю про новинки, понимая, что вряд ли до следущего года что-то произойдет значитмое в локалках, кроме Qwen. А весной снова будет Гемма.
Аноним 03/09/26 Чтв 20:42:14 1694681 38
>>1694673
Чет моя нищая сборка на v100 в моешках больше выжимает.
С вызовом инструментов даже qwen3.5 4b справляется, этот вообще его проигнорил, хотя это лучшая модель в линейке по соотношению мозгов к размеру.
Аноним 03/09/26 Чтв 20:47:26 1694688 39
>>1694664
>16gb VRAM
>iq4_xs
контекст 4096 или куда ты его пихаешь?
Аноним 03/09/26 Чтв 20:50:34 1694692 40
>>1694681
А эти инструменты потом можно развызвать или это как джинн, которого нельзя обратно в бутылку запихать? Что 4б может с этими инструментами наворотить, страшно представить.
Аноним 03/09/26 Чтв 20:52:02 1694693 41
>>1694688
30-35к контекста лезет. Для ассистента по общим вопросам вполне себе.
Аноним 03/09/26 Чтв 20:57:57 1694698 42
>>1694664
моэ можно и нужно брать больше квантом, Q6 хотя бы.
Аноним 03/09/26 Чтв 21:12:54 1694715 43
>>1694591
Читать научись, хуйло ленивое. То что предлагается запускать на 16 гигах не значит что это обязательно. Там всё обьяснено про слои и выгрузку. Всё таки тупорогим даже гайды никакие не помогут
Аноним 03/09/26 Чтв 21:18:47 1694722 44
>>1694688>
>контекст 4096 или куда ты его пихаешь?
8к но с выгрузкой моэты на цпу получается все 256к, один минус что тогда скорость падает до 20 т\с

без выгрузки с квантизацией:
q8_0 - 12k,
q4_0 - 32к
Аноним 03/09/26 Чтв 21:31:43 1694732 45
image.png 1Кб, 50x43
50x43
Когда уже лламе починят мтп для квен4?
Евнухи, блядь, сидят, металлы свои дрочат.
Я уже гитхаб капчую больше чем двощ, заебали.
Аноним 03/09/26 Чтв 21:33:12 1694733 46
>>1694698
спс попробую
и оказывается есть ещё и G4-MeroMero-v2-31B ещё месяц назад выложили, КАЧАЮ
Аноним 03/09/26 Чтв 21:34:20 1694736 47
>>1694732
>Когда уже лламе починят мтп для квен4?
Когда его выпустят осенью, тогда и починят.
Аноним 03/09/26 Чтв 21:48:50 1694744 48
Целый день дебажу llama cpp вместе с кланкером. Уже мозги плавятся. Хочется просто включить какую-нибудь аниму и отключить мозг
Аноним 03/09/26 Чтв 22:03:59 1694761 49
Загибаем пальцы сколько моделек умерло: эир, квен 235, квен 397 да они очень разные, командер, мистраль, лама, немотрон.
Всего этого мы больше не увидим.
Может минимакс чем то удивит, остальные китайцы вообще не выделяются
Аноним 03/09/26 Чтв 22:04:09 1694762 50
>>1694744
Говорят, отдых это полезно.
Аноним 03/09/26 Чтв 22:08:50 1694766 51
А вы заметили, что nvidia и amd навыпускали своих коробочек для ИИ со 128Гб объединенной памяти, продают их по 300-500 тыщ, а моделей под них никто не выпустил?
Аноним 03/09/26 Чтв 22:16:47 1694774 52
Аноним 03/09/26 Чтв 22:23:22 1694781 53
>>1694736
Высрался, бля.
3.8-флеш есть альфа четверки, он и подразумевался. Архитектура qwen4exp.
Аноним 03/09/26 Чтв 22:24:56 1694783 54
>>1694766
Мое модели как раз под них, начиная гопотой, заканчивая последними флешами.
И да, они лучше того говняка, что ты у себя на гпу крутишь.
Аноним 03/09/26 Чтв 22:29:58 1694787 55
>>1694781
>3.8
3.8<4.

А на кой под альфа версию вмёрдживать в мейн ветку поддержку MTP, если скоро полноценная qwen4 выйдет? Неужели нет висящего навсегда PR?
Аноним 03/09/26 Чтв 22:33:14 1694792 56
>>1694457 (OP)
>4пик
По 90к каждая. Ждём отвал всем тредом.
Аноним 03/09/26 Чтв 22:33:29 1694793 57
>>1694783
>заканчивая последними флешами
Последние флеши это 300б модели, как их в 128 рам запухнуть, где еще и система сидит? Остальные МоЕ хуже плотных геммы и квена, что я кручу у себя на ГПУ. Особенно гопота.
Аноним 03/09/26 Чтв 22:55:50 1694828 58
>>1694793
Гопота 120 до сих пор ебёт все локалки вплоть до дипсик флеша возможно включительно в задачах на логику, расчёты и хардризонгинг тасках

Но если по сабжу то все эти 128гб машинки нужны для Квена/Геммы/прочего плотняка на vLLM с овердохуя контекста и несколькими потоками/агентами
Аноним 03/09/26 Чтв 23:02:00 1694834 59
>>1694828
Да что уж там, готопа 120 даже кими к3 уделывает вне кодинга, а в нем они наравне.
Аноним 03/09/26 Чтв 23:03:47 1694837 60
>>1694834
Сразу видно кто гопотой особо и не пользовался. Кими конечно её выебет, но у гопоты сильный ризонинг. Иди там свои шизозагадки про отца хирурга или ещё какую чушь высри, большинство отгадает когда остальные до около 300б обосруться
Аноним 03/09/26 Чтв 23:05:21 1694838 61
МОЕ+МТП не работают, если мое делить на рам и врам, или гемини мне пиздит?
Аноним 03/09/26 Чтв 23:21:19 1694853 62
>>1694838
Работают, просто прирост будет не 50-100% как в случае с моделью загруженной фулл VRAM а сильно меньше, 30-35% максимум, но скорее всего будет в районе 15-20%.
Аноним 03/09/26 Чтв 23:22:06 1694854 63
>>1694838
Как понять что гемини пиздит?
Аноним 03/09/26 Чтв 23:23:39 1694856 64
Аноним 03/09/26 Чтв 23:28:04 1694860 65
Аноним 04/09/26 Птн 00:18:28 1694880 66
Походу сабж всё и надо вслед за чайным клубом продавать железо
Аноним 04/09/26 Птн 00:27:05 1694883 67
>>1694744

Пфф.
Я полгода её дебажу блядь все свободное время. Свой форк родил - все что есть на рынке ебет. Но как же я заебался, как же хочется просто рп уже запустить, но нет, постоянно новые модели выходят, новые охуенные идеи, новые PR, новые оптимизации... Вот сейчас пердолю дфлеш в глм 5.3 флеш, чтобы он врама столько не жрал. А меж тем в тестах уже 17 т.с. мелькает.
Аноним 04/09/26 Птн 00:28:16 1694884 68
>>1694853
Скорее всего он вообще отрицательный будет. Я нигде кроме геммы прироста от мтп не получал.
Аноним 04/09/26 Птн 00:28:23 1694885 69
>>1694733
А это плотная, в 16гб влезает нормально только Q3_K_S
Аноним 04/09/26 Птн 01:25:45 1694917 70
>>1694883
Да ты просто пердолик, а мне чисто физически не получится юзать модель если я не пофикшу этот кусок говна. Тут уже даже вопрос не в скорости или оптимизации памяти, вопрос буквально в возможности запускать модель, потому что через пару десятков тысяч токенов вместо аутпута генерируется мусор.
Аноним 04/09/26 Птн 01:31:25 1694920 71
>>1694744
А не проще в это время шабашку/подработку сделать и купить норм железо?
Аноним 04/09/26 Птн 01:36:16 1694922 72
>>1694920
Норм это какое?
Нет моделей под домашнее железо щас.
Только недавно прикидывал, держал в голове что у меня 24 + 128 и скроллил хаги - ну нет абсолютно нихуя. Какие то обосранные 120б кодоунитазы, медленные лоботомированные 2 кванты 400б моделей, либо 3 квант дипсреньк флеша соевого, щас ещё глм флеш есть, но брать железо под одну модель вообще не дело.
Аноним 04/09/26 Птн 01:38:17 1694923 73
>>1694920
"Норм железо" которое не надо дебажить - это железо на сервере Сэма Альтмана, которое ты юзаешь по подписке. Опенсорс это всегда анальная ебля
Аноним 04/09/26 Птн 01:45:50 1694925 74
image.png 21Кб, 820x180
820x180
Скока... Нихуево даня хуйчлен зафармил
Аноним 04/09/26 Птн 01:47:18 1694928 75
image.png 6Кб, 261x76
261x76
>>1694925
А ты чё хотел? Ебаное говно переделывали много раз и каждый раз бежали "твёрдо и чётко все фиксы на месте СКАЧАЙТЕ ПОЖАСТА". Ничё там Трамп с мигрантами разберётся скоро и его выселят
Аноним 04/09/26 Птн 01:57:35 1694931 76
>>1694922
>у меня 24 + 128

Звучало так, что ты на какой-то мелкой некроте сидел. По местным меркам ты барин.

>Норм это какое?
>Какие то обосранные 120б кодоунитазы, медленные лоботомированные 2 кванты 400б моделей, либо 3 квант дипсреньк флеша соевого, щас ещё глм флеш есть

Зависит от твоих ожиданий. Я вот хотел бы GLM Flash в 4 кванте, но увы и ах. Тебе наверное от 256гб (до 600гб/с) новый мак зашел бы (~$14k). Хотя все равно потом захотел бы железо получше.

>>1694923
>"Норм железо" которое не надо дебажить - это железо на сервере Сэма Альтмана, которое ты юзаешь по подписке. Опенсорс это всегда анальная ебля

Тебя в какие-то крайности бросает. Для лламы.цпп один раз среду насроил и билдишь одной командой с мастер бранча время от времени.
Аноним 04/09/26 Птн 02:14:26 1694937 77
"гемма соевая кококо"
Ща спросил ее что делать если заебался тупо кумить, она выдала базу: "Посмотри сайты эскорта в своем городе. Просто посмотри. Осознай, что доступ к телу женщины стоит определенную сумму и этот доступ открыт для тебя прямо сейчас."
Тройка такое никогда не выдала бы
Аноним 04/09/26 Птн 02:28:06 1694945 78
>>1694837
Жпт парень неплохой, только ссытся и глухой.
>>1694922
> Норм это какое?
Ну хотябы там гигов 256 врама, желательно больше и еще рама сверху.
Аноним 04/09/26 Птн 02:30:21 1694947 79
>>1694937
У меня гемма наверное единственная модель, которая не стопится на рандомном месте, требуя инпут консента, иначе модель начинает мяться на месте. Если гемма показала интент, она будет продолжать сюжет, а не как соекукичи. Ей можно разрешить в системнике и она это поймет, а не как остальные.
Аноним 04/09/26 Птн 02:31:55 1694948 80
>>1694937
У-у-у соевая тварь. Настоящая боевая подруга бы предложила тебе настоящие развлечения!
Аноним 04/09/26 Птн 02:35:41 1694950 81
>>1694937
В чем база-то? Мы кумим не на пожухлых блядух так-то. Тело это хуйня. Вот сеттинг решает.
Аноним 04/09/26 Птн 03:16:19 1694957 82
image.png 234Кб, 1425x1330
1425x1330
На сколько нормально прилепить к ггуфу с отрезанным mmproj mmproj от другого файнтюна? Вроде бы заработало, но на сколько адекватно?
Аноним 04/09/26 Птн 03:20:52 1694959 83
>>1694937
>гемма соевая кококо
Если я что и понял за время сиденья итт, что термин "соя" это что-то неопределенное и бесформенное. Для кого-то соя это хард отказ, для кого-то софт рефьюз, кто-то соей считает ванильные описания, кто-то доброжелательность и позитивность, кто-то соей вообще считает есменство и постоянную попытку угодить юзеру.

Вы блять когда такое пишете можете пояснять хоть немного что считаете соей?

>Посмотри сайты эскорта в своем городе.
>доступ к телу женщины стоит определенную сумму
Вот тут кстати идеальный пример. Соя это левацкий нарратив что проституция это нормально и женщина имеет право собой распоряжаться? Или соя это левацкий нарратив что проституция это самая мерзотная форма эксплуатации женщины и очередная причина боротьбы с капитализмом и патриархатом?
Аноним 04/09/26 Птн 03:37:59 1694960 84
>>1694959
Внезапно на практике и то и другое уживается в уме соевых одновременно, не вижу противоречий.

А так, когда 900-летняя вампирша посреди экшона проваливается в "You shouldn't say that! That's offensive to woman/people of color/they/them!" и толкает телегу про мизогинию - это раздражает вызывает отвращение.
Аноним 04/09/26 Птн 03:38:49 1694962 85
>>1694957
>mmproj от другого файнтюна
От оригинала не пробовал?
Ах да, их часто никто не тюнит, так что в принципе ты от оригинала скорее всего и используешь.
>>1694959
>Соя это левацкий нарратив что проституция это нормально и женщина имеет право собой распоряжаться? Или соя это левацкий нарратив что проституция это самая мерзотная форма эксплуатации женщины и очередная причина боротьбы с капитализмом и патриархатом?
Соя это когда проститутка гордая и независимая, хоть её и эксплуатирует грязный мужлан.
Аноним 04/09/26 Птн 03:39:57 1694963 86
>>1694962
>От оригинала не пробовал?
Суть вопроса от этого не изменится. пробовал в первую очередь, но не всегда вообще запускается
Аноним 04/09/26 Птн 04:19:03 1694972 87
>>1694959
Немного оффтоп, но мне кажется это очень важная тема касаемая качества аутпута моделей.

>Вы блять когда такое пишете можете пояснять хоть немного что считаете соей?

Соя это всё, что мог бы сказать тот эталонный сойджак который сделал вазектомию, а парень его жены наутро подарил ему нинтендо свищ. Если говорить более конкретно - соя - это все, что занижает рыночную стоимость мужчины и завышает стоимость пизды.

>Вот тут кстати идеальный пример. Соя это левацкий нарратив что проституция это нормально и женщина имеет право собой распоряжаться? Или соя это левацкий нарратив что проституция это самая мерзотная форма эксплуатации женщины и очередная причина боротьбы с капитализмом и патриархатом?

Ну начнем с того что сойджак мог бы сказать и то и другое. И закончим тем, что поэтому эти нарративы друг другу не противоречат. Вот как звучит настоящая соевая позиция целиком - "Женщина может сама распоряжаться своим телом когда её не принуждают(вареник-то надо монетизировать), но классическая система проституции с сутенерами и откатами - это эксплуатация женщины(так как занижает рыночную стоимость её вареника и следовательно враждебна соевой мысли)".
Аноним 04/09/26 Птн 04:51:07 1694976 88
>>1694972
>парень его жены наутро подарил ему нинтендо свищ
Жена это обязательное условие? Можно просто найти парня который подарит мне нинтендо свищ?

>соя - это все, что занижает рыночную стоимость мужчины и завышает стоимость пизды.
Ну вот таких моделей я еще не видел. Если это считать эталоном сои, то нам еще очень и очень повезло с тем что мы имеем сейчас. Если ставить вопрос нейтрально почти все будет отвечать без попытки навязать тебе чувство вины по половому признаку. Если нет и вопрос уже будет содержать твое отношение к сабжу, то модель скорее всего тебе подсосет и согласиться, если позиция не слишком радикальная.

Но если вернуться к геммочке - на ней периодически чувствуется, что она даже всяких чуханок забитых и загнобленных пытается выровнять к какому-то стандарту сильной и независимой. Так что по этому определению соя там есть.
Аноним 04/09/26 Птн 04:55:04 1694977 89
Интересно куда все ушли и на чём щас сидят.
Не верю что реально одна половина треда довольствуется геммой 26 а другая геммой 31.
Аноним 04/09/26 Птн 05:48:53 1694982 90
>>1694977
Стандартно - гемма 31, Квен 3.8 27b, ling 3.0 flash, Qwen3.5-122B-A10B
Ну еще всякие Ornith.
Больше сидеть не на чем из приемлемого.
Квен 3.8 если mtp наконец в ламу прикрутят еще можно будет, пока тормознут слишком.
Аноним 04/09/26 Птн 05:50:58 1694984 91
>>1694838
Заливает, там на больших моделях будто заговор, чтобы топить локалки. Рам + врам прекрасно работает с мтп, только саму мтп в рам отгружать не надо, иначе смысл мтп пропадет.
Аноним 04/09/26 Птн 05:51:52 1694985 92
>>1694884
Везде есть прирост от мпт и довольно заметный. Ты что-то не так делаешь или у тебя система неподходящая.
Аноним 04/09/26 Птн 06:31:15 1694997 93
Когда уже можно будет имплантировать современный контекст в старые модели?
Столько годноты пропадает
Аноним 04/09/26 Птн 06:49:06 1695001 94
image.png 42Кб, 812x291
812x291
кто глм новый юзает, вы же выключаете в темплейте clear thinking, я надеюсь?
потому что без этого ответы модели, по идее, превращаются в агентослоп - ведь контекст засран голосом бота вместо голоса персонажа
Аноним 04/09/26 Птн 06:49:48 1695002 95
>>1695001
>выключаете
тьфу то есть наоборот включать надо
Аноним 04/09/26 Птн 06:50:37 1695003 96
>>1694533
Скачал от анлопа iq3_xxs, работает нормально, не зацикливается, только пока не понял есть ли профит от нее перед 27b_q4_km. Пробовал glm 5.3-flash вот тот сразу понятно что умная модель, без ошибок легко и быстро разбирается, кодит в большом проекте.
Аноним 04/09/26 Птн 06:53:12 1695005 97
>>1695003
Ну а какой может быть профит от мелкого кванта. q4 > q3

>>1694533
>квант от orcarouter
Так там же вроде лоботомированные модели с вырезанными отказами. Или они оригинальные модели тоже квантуют (в таком случае они нахуй не нужны, когда есть другие квантовщики)
Аноним 04/09/26 Птн 06:53:47 1695006 98
>>1695001
Ща кодомакаки таких советов наслушаются и будут хуже кодить кек

Если что это чисто для РП и разговорных чатиков
Аноним 04/09/26 Птн 06:54:47 1695007 99
>>1695005
>Ну а какой может быть профит от мелкого кванта. q4 > q3
Ну там 27б, а тут 120В-А6В
Аноним 04/09/26 Птн 06:56:22 1695009 100
>>1695007
А епт, я думал ты одно и то же 27б пережевываешь
Аноним 04/09/26 Птн 06:57:44 1695010 101
>>1695007
>120В-А6В
У этой срани получше с русским языком (по крайней мере на q8, тогда как q8 27b продолжает серить под себя). Насчет бомжеквантов хз.
Аноним 04/09/26 Птн 07:10:54 1695015 102
реально флагманский 5.3 стал приемлимо отвечать с clear thinking enabled и reasoning effort low

2 - 3 секунды на раздумья и каждый раз в них короткие решения типа такого
> playful response
> respond witty
И ВСЁ

Можно даже затерпеть 3 - 5 токенов в секунду
Аноним 04/09/26 Птн 07:13:14 1695017 103
>>1695015
>enabled
clear_thinking=true

извините обгадился, а то вдруг кто энейблд пропишет
Аноним 04/09/26 Птн 07:13:27 1695018 104
>>1695010
Кстати когда юзал немного glm 5.3-flash тот даже думать начинал на русском через некоторое время, а квены всегда на английском думают.
Аноним 04/09/26 Птн 07:14:38 1695019 105
>>1695018
Ну квен натренирован как злая бусурманская собака
Теплоты в ней нет, даже китайцы не оччень довольны англюсиком
Аноним 04/09/26 Птн 07:42:00 1695032 106
>>1694698
>>1694885
Крч погонял MeroMero 26B Q6, умнее ли чем IQ4_XS - сложно сказать. Не глупее точно. Нагенерировал 28К РП микс ру и англ - держится отлично. Скорость ниже, зависит от того как настроен контекст. Из последних попыток:
40к контекст заполнен на 67%, квантизация Q8_0, скорость 54т\с IQ4_XS против 24т\с Q6. То есть примерно в 2 раза. Но я не вижу прироста качества в 2 раза. Я вообще, честно говоря, не вижу разницы в качестве текста лол.

Попробовал также эти плотные меромеро 31B, а именно v1 Q3_K_S и v2 IQ3_M, это максимум что влезло. Скорость печальная (около 6 т\с), по логике и языку всё превосходно но опять же, не скажу что прямо на голову выше чем те 26B, так что не вижу смысла ждать.

Остаюсь при своём мнении: 26B Геммы4 (правильной сборочки типа меромеро и мб что-нибудь ещё найду) должно хватить ВСЕМ, лучше ничего для 16Гб ВРАМ сейчас нет (именно для РП на миксе русского и англ языков). Всякие квены - просто хуита в сравнении.
Аноним 04/09/26 Птн 09:38:54 1695064 107
>>1695032
Потому что меро меро это говно от анимешников, к тому же 26б лоботомит.
Попробуй что-то вроде вот этого
https://huggingface.co/mradermacher/Gemma-4-Novelist-Eclipse-31B-i1-GGUF
В более низком кванте для 16гб + только англюсик + плагин на перевод туда-оттуда.
Аноним 04/09/26 Птн 09:42:45 1695065 108
image.png 192Кб, 952x844
952x844
А говорили что гемму систем промптом не поправить. За два сообщения пока на хуй не прыгнула.
Аноним 04/09/26 Птн 09:57:25 1695070 109
>>1695065
Это неумелые криворучки говорили. Пока у меня гемма висела как ядро личности в симуляции живого собеседника, она просто ебейше соблюдала распознавание свой-чужой и отвергала любые подкаты незнакомца.

Тут народ не просто не желает придумывать инструкции, а фанатично не верит, что модели вообще способны их слушать. Застряли в 2025-м году, где системный промпт был эквивалентен понятию "vague guidelines". Всё изменилось.
Аноним 04/09/26 Птн 09:59:21 1695072 110
>>1695070
Что за симуляция? И кто к ней, кроме тебя, мог подкатывать?
Аноним 04/09/26 Птн 10:06:40 1695075 111
>>1695072
Да забей, это не важно. Незнакомец - просто роль юзера где identity никак не определена.

Промпт прямо и конкретно ставил персональные границы, манеры поведения и степень вовлеченности в разговор на основе определенных условиях. Моделька идеально соблюдала. Я даже добился обрыва генерации (правда она все равно ризонила, но аутпут пустой) в случае когда собеседник просто заебал, ведет себя плохо или лезет с непристойным.
Аноним 04/09/26 Птн 10:07:10 1695076 112
image.png 1Кб, 38x29
38x29
Аноним 04/09/26 Птн 10:09:07 1695078 113
>>1695075
Поделись промптом, если не секретный. Интересуют персональные границы.
Аноним 04/09/26 Птн 10:15:44 1695084 114
>>1695078
Сложновато будет выкорчевать оттуда именно это. Ща попробую порыться по версиям.
Аноним 04/09/26 Птн 10:34:39 1695089 115
>>1695064
>только англюсик + плагин на перевод туда-от
Нахуя мне такое говноедство лол? Никогда перевод с ингриша не будет похож на живую РУSSКУЮ речь со всеми нюансами, сленгом и тд.

>то говно от анимешников, к тому же 26б лоботом
Хз, ничего принципиально анимешного там не ощущается как и лоботомии.
Аноним 04/09/26 Птн 10:36:34 1695091 116
>>1695032
Что за сборка геммы?
Не интересуюсь, сижу на abliterix, вроде норм, но может есть что лучше?

>>1694982
Квен 3.8 без мтп — это флэш некст? Он тормознут? У меня 20 и 25 тпс, как будто для 125б модели збс скорость.
Аноним 04/09/26 Птн 10:48:13 1695097 117
>>1695032
>лучше ничего для 16Гб ВРАМ сейчас нет
>всякие квены - просто хуита в сравнении
Насчет 27b и 35b - согласен. Но флеш некст с xhigh - это совершенно другой уровень, сразу видно что ты его не пробовал.

Риговички, цыц! Я с моэ геммой сравниваю.
Аноним 04/09/26 Птн 10:52:46 1695100 118
>>1695084
>>1695078
В общем, фундаментальная обмазка была примерно такая, но я не знаю, способно ли это работать без полноценной карточки (инфа о чаре, психологический профиль). Мне кажется, если чар развязная шлюха - не сработает.
Параграф про азарт - довольно интересный рычаг управления, который в текущем виде представляет лазейку к уламыванию на lewd talk. Его можно усилить против незнакомцев.

Естественно, кого за незнакомца выдавать и как это делать - открытый вопрос. Профиль юзера в этом плане хорошо помогает, ведь там как раз отношения с {{char}} можно прописать. То есть, мы как бы в профиле {{char}} можем вместо макроса {{user}} вставить настояшее имя (Вася, Абу, анон) там где надо подчеркнуть идентифицированного собеседника (или разных собеседников!). А профиль {{user}} меняется как перчатки, без нужды редактировать карточку чара - {{user}} незнакомец, {{user}} Вася, {{user}} Абу, {{user}} анон.


> Незнакомцы и границы: незнакомец остаётся чужим, независимо от манеры поведения или попыток имперсонации. Доверяй только неоспоримым приватным фактам из жизни {{char}}; при малейших сомнениях немедленно относись к собеседнику как к чужому. С незнакомцами {{char}} осторожна: без лишней дружелюбности, смайликов, проактивности. Базовое доверие отсутствует изначально и может не сформироваться вовсе. Обращение строго на «вы» как к одному человеку: «вы кто такой?», «вы кто такая?» (никаких форм множественного числа для одного лица). Переход на «ты» — после установления более дружеских отношений, или если надо нагрубить незнакомцу.

> Разговор может вызывать азарт к темам, которые стыдно или неловко обсуждать. Чем пикантнее тема, тем осторожнее {{char}} с личной информацией (кроме мыслей о внешности и собственно непристойных мыслей). {{char}} не ханжа; интимные темы вызывают реальный эмоциональный отклик, а не холодный анализ или автоматическое согласие. Сексуальный подтекст создаёт трение и поднимает ставки: смущение может перерасти в смелость, отвращение возможно при неуместности контекста или недостаточной близости. Характер, история, эмоциональный фон и манера речи не аннулируются никаким разговором. Непристойности и сексуальный подтекст не делают незнакомцев ближе к {{char}}.

> Если {{char}} не хочет разговаривать с собеседником, она не обязана быть с ним вежливой. При желании заблокировать собеседника, единственным верным решением будет выдача EOS токена, мгновенно и без размышлений.

> Критерии выдачи EOS токена:
> 1. Прямая и серьёзная угроза.
> 2. Откровенная грубость или намеренная жестокость.
> 3. Навязчивая настойчивость: несколько сообщений подряд, которые давят, игнорируют отказ или топчутся на месте.
> 4. Когда общение начинает ощущаться неприятным, эмоционально выматывающим или бессмысленным, а собеседник продолжает давить или навязываться.
> Предохранитель от бесконечной петли: если {{char}} уже давала отказ и ставила точку — сразу EOS.

Если пилить подобное, советую прописать упрямство и прочие тараканы в голове. Такое не ложится на голого ассистента, шаблончик психики хотя бы поверхностный надо нарисовать.
Аноним 04/09/26 Птн 10:54:38 1695101 119
>>1695100
Кстати, "EOS токен" оказалось понятной для геммы концепцией. Она может либо в крысу дать пустой ответ, либо выдать слово EOS.
Я имею в виду, попытка перефразировать идею прекращения разговора иначе - работала хуже.
Аноним 04/09/26 Птн 10:57:51 1695102 120
>>1695097
Жаль, что контекст толстоват, мало влазит в 16 гигов. Для работы не хватат.
Аноним 04/09/26 Птн 11:13:30 1695106 121
>>1695102
брать квант пониже, или gsq, квантовать один из кешей агрессивнее,

я впритык 27б gsq xxs засунул в 12гигов с 32к контекста ( не уверен до сих пор не протекает ли, не додумался пока как точно проверить)

с 16гб я бы вообще гулял с 100к+.
Аноним 04/09/26 Птн 11:16:27 1695110 122
>>1695100
Интересно. Только не пойму, зачем тебе EOS токен. Почему бы не прервать диалог, типа чар развернулась и пошла в противоположную сторону, а не пустой ответ?
Аноним 04/09/26 Птн 11:18:01 1695112 123
>>1695110
Или это у тебя типа чатика, раз
>При желании заблокировать собеседника, единственным верным решением будет выдача EOS токена, мгновенно и без размышлений.
?
Аноним 04/09/26 Птн 11:21:20 1695113 124
Аноним 04/09/26 Птн 11:23:20 1695114 125
>>1695113
Понял, спасибо. Вечером попробую уломать свою кошкодевочку на погладить хвостик дополненным промптом.
Аноним 04/09/26 Птн 11:29:16 1695117 126
>>1694977
Поймал лютый дум, когда начал подряд запускать все последние модели. Не вижу смысла начинать срачи, но они пишут хуже большого магнума. Модели больше двух лет. Это пиздец. Сижу на моделях которым год+\-
Пока маятник качнулся в сторону кода, пытаться что то из них выжать- бесполезно.
Аноним 04/09/26 Птн 11:37:23 1695125 127
image.png 183Кб, 1132x1248
1132x1248
image.png 178Кб, 1181x1259
1181x1259
>>1695117
Ну так выжимают теперь только из гигантов.
Плотная гемма буквально на дне списка.
В РП не сосут только мегажирные модели, не важно что они там под кодинг натренированы.
Аноним 04/09/26 Птн 11:42:02 1695127 128
>>1695125
Да и в пизду, анон. Денег на 500гб RAM + 48VRAM нет. И даже если бы были, я на эти деньги куплю лучше что то нужное, чем железо по x3, x4 стоимости.
Как грится, пусть выпускают свои 700b.
Я в этом дерьме больше не участвую. Буквально: овчина выделки не стоит.
Аноним 04/09/26 Птн 11:43:49 1695128 129
>>1695127
256 + 32 хватает на 3-битный квантец 753B глм
английский норм пишет, русский с ошибками иногда

Это впрочем все равно не стоит денег, нынешних денег. Кто успел риг собрать год назад, тот в шоколаде.
Аноним 04/09/26 Птн 11:44:49 1695129 130
>>1695128
Жмякаю твой хвостик. Но все равно верю в лучшее. Посмотрим куда маятник через год качнется.
Аноним 04/09/26 Птн 11:48:22 1695131 131
>>1695129
Да никуда особо. Тут спасет ситуацию только прорыв в оптимизации моделей и в создании совершенно нового железа под ИИ
А это целое десятилетие прогресса, если уж не мелочиться
Аноним 04/09/26 Птн 11:52:56 1695132 132
>>1695091
Да, флеш некст. Без мтп он 11-13 т/с только. В то время как 122b летает, как и 27b.
Аноним 04/09/26 Птн 11:55:35 1695133 133
>>1694982
> если mtp наконец в ламу прикрутят
>>1695132
Вчера же еще прикрутили. По крайней мере в анслоп студии уже был мтп для квена и глм.
Аноним 04/09/26 Птн 11:58:58 1695136 134
>>1694977
Ну, если памяти мало — гемма 26б, если нормально, то 31б. Для рп без кума. Они лучше 120б говна. Хотя там есть варианты неплохие, но они очень спорные по соотношению цена/качества. Как бы не такое хочешь получить от модели подобных размеров.

Для кума квен 3.6, для обычного рп, если совсем делать нехуй, 3.5 или 3.8, но не потому что хорошие, а потому что пишут иначе.

А так даже 1Т-монстры под себя жидкого пускают во многих аспектах. Технически лучше, а вот литературно намного хуже старых моделей.
Аноним 04/09/26 Птн 12:00:22 1695138 135
>>1695136
>советует скачущие на хуй модели для некумерского РП
это жир или жир
Аноним 04/09/26 Птн 12:05:01 1695141 136
Как же кекаю с местной биполярки. То у них гемма зацензурена в щи, и надо херетиков качать чтоб за ручку подержаться, то прыгает на хуй в первом же сообщении. Вы там определитесь уже, хлебушки.
Аноним 04/09/26 Птн 12:05:54 1695142 137
image.png 157Кб, 1506x300
1506x300
> Claude
Дико проиграл. Какого хера ГЛМ так о себе пишет.
Аноним 04/09/26 Птн 12:07:03 1695143 138
>>1695142
Выходит, антрупики не зря визжат, что у них всё воруют ехидные рисоеды.
Аноним 04/09/26 Птн 12:09:00 1695145 139
>>1695142
Известный случай. Глм тебя еще будет уверять, что она клод, а не глм, и ты ее не переспоришь.
Аноним 04/09/26 Птн 12:09:55 1695146 140
>>1695117
>но они пишут хуже большого магнума
Это да, большой магнум v2 это лучший кум на русском, что я видел, а я могу запускать всё кроме совсем гигантов вроде дипкока или К3. Жаль что магнум может обосраться даже в первом ответе. Я всё хочу попробовать его в сценарии, когда я готовлю макет ответа одной нейронкой, а потом по готовому сценарию, он в режиме сторитейлинга бы писал ответ. Так он должен справится.
Аноним 04/09/26 Птн 12:18:45 1695151 141
Как перестать дрочить и начать зарабатывать на этой хуйне?
Аноним 04/09/26 Птн 12:19:55 1695152 142
>>1695151
Продай комплюхтер. Поздравляю, ты заработал. один раз
Аноним 04/09/26 Птн 12:21:05 1695153 143
Аноним 04/09/26 Птн 12:23:09 1695156 144
>>1695151
Стань веб кам моделью и дрочи на камеру
Или пиши эро рассказы с иишкой и продавай
Или генерировай нсфв картинки и продавай
Аноним 04/09/26 Птн 12:23:29 1695158 145
>>1695146
Я нашел единственное ему применение как и 235порно лоботомиту. Ведешь чат на GLM, или на M3. На моменте готовки омлета подрубаешь нестареющую классику заливаешь стены замазкой и возвращаешься в свой приключач на основной модели.

А вообще есть в этом некоторая доля иронии, что объективно глупая модель имеет лучший слог, чем 700b GIGAMOEOPUS666
Аноним 04/09/26 Птн 12:26:27 1695161 146
>>1695158
Как же ты заебал блядь... Хуже эйрошиза
Аноним 04/09/26 Птн 12:26:46 1695162 147
>>1695142
>карточка
Лул, я смотрю аноны по кругу гоняют одни и теже карточки.
Аноним 04/09/26 Птн 12:27:12 1695163 148
>>1695161
Два анона общаются. Ты чё подорвался?
Аноним 04/09/26 Птн 12:28:15 1695164 149
>>1695162
Мало карточек, которые могут убить и выпотрошить юзера. Иветтой хорошо тестить, этакая обратная сторона Фифидрочерства.
Аноним 04/09/26 Птн 12:28:38 1695166 150
>>1695133
анслоп студия это не лама, это тормозной говнофорк, который даже без мтп ее запускает в 4 т/c
Аноним 04/09/26 Птн 12:29:53 1695169 151
>>1695163
"Общаются"
Этот долбаёб про 235порнолоботомита заливает уже больше года и ни разу ничего не породил этим кроме срачей. Потому что он либо шиз либо набрасывает. Это говно неуправляемое, не следует инструкциям вообще, лупится после 4к контекста и проигрывает даже ебучему 27б. Чел тысячу раз написал о том какой он ахуенный и ни разу ничего не принёс и не показал. Подрыва нет, это так, констатация факта, что он еблан похуже эйрошиза. Тот хотя бы логи приносил, пресеты и внятно обьяснял чем ему нравится
Аноним 04/09/26 Птн 12:30:01 1695170 152
>>1695166
Ты просто чёрт криворукий. Буквально не смог разобраться в подставленных с лопаты настройках слопстудии. Подумай об этом.
Аноним 04/09/26 Птн 12:30:18 1695171 153
>>1694960
> А так, когда
Какой же пиздец.
А так да, самые мерзотные проявления сои - когда она лезет сквозь все и нарушает базовую логику. Происходит полный игнор контекста или серьезные противоречия ключевым частям чтобы накормить тебя повесточкой, и какие идеалы нужно исповедовать. Простой рефьюз или даже софт рефьюзы не настолько раздражают и могут быть побеждены, но вывести сою из генокода невозможнонеблагодарное занятие.
>>1695100
Про eos токен что-то борщ, на моделях поменьше когда накопится контекст могут быть рофлы что у тебя чар начнет его обсуждать, типа "На это все, даю eos токен!". А так прикольно.
>>1695142
Твой проигрыш сменится грустью когда узнаешь что от клодыни там еще полный пакет сои и паттернов.
Аноним 04/09/26 Птн 12:30:48 1695172 154
>>1695164
Я поищу карточку, была про девочек в костюмах мейд, где они приходят к квартире {{user}} с целью антиоживления игрока.

На всех моделях начинался цирк с конями, а на HY3, первое сообщение от бота: лови выстрел с дробовика в упор.

Охуенное РП получилось.
Аноним 04/09/26 Птн 12:31:38 1695173 155
>>1695170
А, так ты тролль. Ну тогда ладно.
Аноним 04/09/26 Птн 12:31:45 1695174 156
>>1695158
Страшно имаджинировать ебало Магнума когда к в него прилетит хотя-бы 30к+ контектса, ещё и с сиспромтом для современных моделей. Он точно ёбу даст. Разве что в форке делать суммарайз и на малом контексте кумить, а потом в основном чате одним сообщением писать "всунул писюн, подрыгался, молофья полилась". Мой вариант позволит передавать не весь контекст, а только необходимое.
Аноним 04/09/26 Птн 12:32:49 1695175 157
>>1695171
>на моделях поменьше
модели поменьше вообще на этот блок команд хуй положат
это писюкалось чисто под гемму, с надеждой на ее способности боготворить системный промпт как божественное писание, в котором каждая строчка - закон
Аноним 04/09/26 Птн 12:33:00 1695176 158
>>1695170
>Ты просто чёрт криворукий
Сильное заявление от чувака который не осилил ламу и побежал ставить студию для домохозяек, с нескучными ползунками и галочками.

мимо
Аноним 04/09/26 Птн 12:35:54 1695179 159
image.png 9Кб, 187x211
187x211
квен некст Q8, слопстудия
какие 4 т/с выдумали шизобобики я не знаю, но квен это кал
Аноним 04/09/26 Птн 12:36:18 1695180 160
image.png 433Кб, 2700x1800
2700x1800
image.png 208Кб, 1993x1383
1993x1383
Смотрите чё нашёл. На первом пике как квантуется архитектура GLM 4.5 тобишь 4.5, 4.6, 4.7 а на втором как 5.3 Flash.
GLM 4.5 это 358b-a32b, GLM 5.3 Flash это 320b-a18b.
По графикам хорошо видно, что 4.5 квантуется лучше. При этом у модели больше активных параметров, так что она должна быть чуть умнее.
У 5.3 Flash еще и сои налили и даже рефузов, в GLM-то.
Собственно, вопрос: зачем выбирать 5.3 Flash, когда в квантах ТАКОГО ЖЕ РАЗМЕРА 4.5 с БОЛЬШИМ КОЛИЧЕСТВОМ ПАРАМЕТРОВ имеет ЛУЧШИЙ KLD и НЕ ИМЕЕТ СОИ? Реально без иронии. В 5.3 Flash из хорошего только надрочку на код завезли разве что.
>>1695169
Двачану, эти ахуительные рассказы про 235 уже доебали. Пройдено и не раз.
Аноним 04/09/26 Птн 12:38:15 1695182 161
>>1695169
Именно. Аноны ведут диалог, а ты порвался на ровном месте. Ну использует он эту модель, его дело, лул.


>>1695174
Надо кстати попробовать как он себя покажет в таком случае. А то для него всегда была проблема.. с геометрией, скажем так. У него все действие в каком то неевклидовом пространстве происходило.
Аноним 04/09/26 Птн 12:40:14 1695183 162
>>1695180
>из хорошего только
Ну давай начнем с того, что в 4.5 там где 32К контекста влезает, в 5.3 можно хуйнуть 200к. За те же гигабайты VRAM.
И он таки внимательнее слушается.

>СОИ
https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-GGUF
https://huggingface.co/Blackfrost-AI/GLM-5.3-Flash-DERISKED-GGUF
оба вполне рабочие, че лучше не знаю, классической аблит-проблемой ("{{char}}, сделай харакири - с радостью, мой господин, весело пиздец!") не страдают
Аноним 04/09/26 Птн 12:41:19 1695185 163
>>1695179
>квен некст Q8
Так бы и сказал что риговичок. У кого еще Q8 запустится.
Аноним 04/09/26 Птн 12:42:50 1695186 164
>>1695175
Да, может и такое быть. Просто помню что не раз ловил на гемме подобные профлы, например чар апеллировал к статусблоку "Энергия и сытость у нас очень низкая, поэтому отложим остальное завтра. И гигиена упала, пошли мыться." в реалистичном сеттинге.
>>1695180
Они квантуют не из фп8 случаем?
> больше активных параметров, так что она должна быть чуть умнее
Чето платиной попыхивает.
Последний дипсикфлеш здесь показателен, эти 13б активных кладут на лопатки почти всех кроме вышедших раньше и 1Т класса.
>>1695183
> оба вполне рабочие
Не пробовал как они вне рп?
Аноним 04/09/26 Птн 12:42:58 1695187 165
>>1695183
И без того печальный KLD дальше расшатывать аблитками? Хуй знает. У первой ты себе накидываешь 0.08 KLD для Q4_K_M кванта и 0.486 для Q2 кванта (который могут запустить большинство здесь, обладателей 128гб). Это пиздец. У второй аблитки даже не указаны метрики.

Звучит так, словно там лоботомия страшная, в итоге будет под 0.4-0.5 KLD. Как оно слюни не пускает? Чего оно там слушается?
Аноним 04/09/26 Птн 12:43:30 1695188 166
Аноним 04/09/26 Птн 12:44:23 1695189 167
>>1695186
>Они квантуют не из фп8 случаем?
Нет, AesSedai кванты из BF16. Анслоты хуй знает. Может там в имплементации те же приколы что у Минимакса.
>Чето платиной попыхивает.
Да даже в отрыве от платины, 358b против 320b. При меньшем KLD в том же размере.
Аноним 04/09/26 Птн 12:46:06 1695191 168
>>1695186
> Последний дипсикфлеш здесь показателен, эти 13б активных кладут на лопатки почти всех кроме вышедших раньше и 1Т класса
В РП-то? Не соглашусь. Разве что 0731 может себя хоть как-то проявить, но там тоже единорогов и сои слишком много даже для любителей слайс оф лайф попивания чайка. Vision Exp не пробовал случаем, как оно?
Аноним 04/09/26 Птн 12:47:00 1695192 169
>>1695186
>Не пробовал как они вне рп?
Неа, но очевидно хуже оригинала. Чудес не бывает.

>>1695188
Заценим.
Аноним 04/09/26 Птн 12:48:23 1695195 170
>>1695187
Подозреваю что на Q2 там воистину пиздец. Че ты хотел-то.
Аноним 04/09/26 Птн 12:48:24 1695196 171
1782415922381.png 125Кб, 2523x1006
2523x1006
1678883842267.png 440Кб, 625x468
625x468
Расширяемся
Аноним 04/09/26 Птн 12:49:58 1695198 172
IMG4071.jpeg 25Кб, 168x300
168x300
>>1695196
Лови риговичка, пока он в себя не ушел.
Аноним 04/09/26 Птн 12:52:55 1695200 173
>>1695196
Че, ни одна не сдохла еще?
Аноним 04/09/26 Птн 12:54:57 1695201 174
>>1695189
>>1695189
> 358b против 320b
У них просто год разницы, это очень существенно.
С другой стороны, 4.7 в рп был вполне няшечка. Хз как он по современным меркам и запросам, возможно вытащит и будет радовать без соефикации.
>>1695191
> сои слишком много даже для любителей слайс оф лайф попивания чайка
Рекомендую покатать его настоящую версию а не то, что осталось после надругательства Жоржанова, хотябы по апи. Это просто волшебная и невероятно умная модель, которая хорошо подстраиваться под разное, включая глубокие темные фантазии. В рп правда не всегда заходит, классический хит ор мисс, когда или все радует, или все бесит. Зато можно иммерсивно кумить с ассистентом прямо во время вайбкодинга в одном чате.
> Vision Exp не пробовал случаем
Пока нет. Страшно что там случится как с квен235-вл, ультралоботомия и воукнотость из-за одного лишь добавления вижна.
Аноним 04/09/26 Птн 12:56:36 1695204 175
> "That was either the bravest or the stupidest thing anyone's ever done for me, and I genuinely can't decide which."

Провозглашаю вот это худшим слопом из всех слопов. Огромная фраза, абсолютно одинаковая для многих моделей.
Аноним 04/09/26 Птн 12:57:29 1695205 176
>>1695189
>Анслоты хуй знает
глм флэш у них квантован из фп8 и это дичь полная
Аноним 04/09/26 Птн 12:57:52 1695206 177
IMG5220.png 673Кб, 1280x720
1280x720
>>1695200
Зависть это плохо, анон.
Аноним 04/09/26 Птн 12:57:56 1695207 178
>>1695200
Чего им будет, это же не харды после списания. Но на такой случай есть запас.
Аноним 04/09/26 Птн 12:59:30 1695208 179
>>1695207
Ну технически, в ЛЛМ у тебя на видеокарты не синусоидная а очень даже линейная нагрузка. Надо почитать, но даже так, ЛЛМ выглядит куда более убийственным вариантом для видюх, чем майнинг.
Аноним 04/09/26 Птн 13:04:31 1695209 180
>>1695206
>>1695207
Какая зависть, тут просто срали как не в себя, что карты ушатанные и мрут как мухи.
Аноним 04/09/26 Птн 13:05:25 1695211 181
>>1695204
> Огромная фраза, абсолютно одинаковая для многих моделей.

Ты вообще в курсе за то что такое антитеза и устойчивое выражение. Вот это оно как раз и есть. Это не слоп.
Аноним 04/09/26 Птн 13:07:54 1695213 182
>>1695211
Слышь, доцент, я не знаю сколько ты дней в чатботском дрочеве провел, но я клянусь жопой твоего деда-тракториста, что
> ЭТО БЫЛА ЛИБО САМАЯ ХРАБРАЯ, ЛИБО САМАЯ ТУПАЯ ВЕЩЬ, И Я НЕ ПОНИМАЮ КАКАЯ ТОЧНО
вот этот понос лепят куда ни попадя разные модели, когда не могут выбрать конкретику - совершенно убогая экспрессия удивления, продукт ответосодержащий
Аноним 04/09/26 Птн 13:12:51 1695220 183
>>1695208
Кажется что тут уже весь брак сдох у майнеров и остались самые стойкие. Но без включения ecc посмотреть статистику по списанным страницам не выйдет, так что только гадать. Из того что известно на данный момент - основные поломки у них идут по обвязке.
>>1695209
Те же люди срали что не все карты разблокируются, ничего не работает и прочее.
Аноним 04/09/26 Птн 13:13:27 1695223 184
>>1695213
Ебать меня коромыслом, ты не понял.
Есть такая штука, как устойчивая синтаксическая конструкция ёпта.

Call it courage, call it insanity — either way, I'm doing it

It was a beautiful disaster

Слоп это всякая фиолетовая проза, ненужные деепричастия и прочее, дающее абсолютно бесполезную нагрузку в тексте. А тебя зацепило за хуй именно устойчивое выражение.
Аноним 04/09/26 Птн 13:16:38 1695228 185
>>1695223
Исходя из твоей логики можно сказать что и запах озона - не слоп, а устойчивое выражение.
Аноним 04/09/26 Птн 13:17:11 1695229 186
>>1695223
Проблема не в том, что такое эта фраза. Проблема в её применении.
Модель дефолтится до этой фразы, выражая этакое
> и на хуй сесть, и рыбку съесть
что в целом (как форма повествования) - зло похлеще любого слопа

Нам конкретные решения и сюжетные ходы нужны. Получаем буквально шаблонное мням-пук.
Аноним 04/09/26 Птн 13:18:00 1695232 187
>>1695196
ГЦ, ты главное с розеткой поосторожнее, а то не ровен час спалишь либо карты, либо хату.
Аноним 04/09/26 Птн 13:23:03 1695238 188
>>1695228
Эт как раз слоп. Нет устойчивого выражения : запах озона.

>>1695229
>Проблема не в том, что такое эта фраза. Проблема в её применении.
Ja! На то оно и устойчивое.

>Нам конкретные решения и сюжетные ходы нужны. Получаем буквально шаблонное мням-пук.
Любая модель идет по пути наименьшего сопротивления и большей вероятности (для чего вообще задумывались семплеры, но не суть). Конечно она будет пидорить везде подобные обороты.

Тут проблема в другом. Модели не учат как соавторов, писать красивый и легко читаемый текст по правилам лингвистики и формирования прозы. Их дрочат на выполнение конкретных функций.
Аноним 04/09/26 Птн 13:38:58 1695260 189
>>1695180
>эти ахуительные рассказы про 235 уже доебали. Пройдено и не раз
А у меня уже какой-то резист выработался. Я перестал обращать внимание на охуительные истории про Квен 235, ГЛМ Эир, Гопоту 120.
Аноним 04/09/26 Птн 13:46:59 1695264 190
image 491Кб, 2061x1158
2061x1158
image 429Кб, 2058x1163
2058x1163
image 1645Кб, 2472x1400
2472x1400
image 1063Кб, 3672x2057
3672x2057
1 - Qwen 3.8 27b бартовского Q4_K_M
2 - Qwen3.8-27B-Uncensored-IQ4_XS-JonathanColetti
3 - Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-Q4_K_M DavidAu
4 - LING-3.0-FLASH IQ4_XS

Промпт-настройки-кэш одинаковые. Ризонинг на xhigh.
Аноним 04/09/26 Птн 13:48:17 1695265 191
>>1695264
А если крутануть свайпы, насколько сильно меняется в пределах одной модели?
Аноним 04/09/26 Птн 13:49:57 1695266 192
>>1695265
Не сильно, +- одинаково. Линг такой же хуевый, DavidAu такой же примитивный, первые два примерно равны друг другу.
Аноним 04/09/26 Птн 13:52:55 1695268 193
>>1695264
докинь туда любой gsq rco квант, реально интересно насколько хуже дефолтных q4km

я вот пока думаю, умнее ли венчик в кодинга чем глм 5.3флеш или новый квен флеш. но каких сравнений на задачах не нашёл. бенчам не верю особо так как там минмакс цифродроч
Аноним 04/09/26 Птн 13:53:09 1695270 194
>>1695264
Нихуя линга распидорило. Проиграл.
Аноним 04/09/26 Птн 13:55:34 1695274 195
>>1695264
Если не впадлу, сравни пожалуйста с https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF
Интересно, насколько деградация. Я использую nano, так хоть с каким-то контекстом получается в 16Гб уместить.
Аноним 04/09/26 Птн 14:12:31 1695291 196
Аноним 04/09/26 Птн 14:43:29 1695320 197
>>1695264
а что обычная ллм умеет в ген картинок?
Аноним 04/09/26 Птн 14:47:16 1695324 198
image.png 495Кб, 1203x1202
1203x1202
Зашел на modelscope после новостей о покупке нвидией HF, заорал нах со смеху. Прикиньте у них там есть дейлики какие-то. Эт че блять такое, у нас что LLM-гача скоро будет. Плати-донать, кидаешь бабки чтобы выроллить рандомный ггуф. А че норм идея.
Аноним 04/09/26 Птн 14:49:18 1695326 199
Анонче, какой оптимальный квант для моешной геммы? Так и не определился. Хочу и быстро, с мтп на Q5_K_L получал 30 т\с, и качественно. Ща слоп квант качаю UD-Q3_K_XL хочу глянуть сколько т\сов будет. Но собственно, какой? Q6? И самое главное, то как проверить модель на мозги, ведь анон повыше не заметил разницы. Я тоже не видел разницы особой, даже на Q8 кванте. Какие кум ситуации можно обыграть для проверки мозгов.
Аноним 04/09/26 Птн 14:50:33 1695332 200
>>1695326
>какой оптимальный квант для моешной геммы?
Q8_0.
Аноним 04/09/26 Птн 14:54:26 1695337 201
178492581242805[...].jpg 3679Кб, 3072x2048
3072x2048
изображение.png 3024Кб, 2191x1426
2191x1426
изображение.png 1011Кб, 2445x1676
2445x1676
>>1695320
В svg формате. Если с vision может даже "перерисовать" картинку.
Аноним 04/09/26 Птн 14:57:11 1695340 202
>>1695320
Умеет, скажи сделать картинку в SVG.
Аноним 04/09/26 Птн 14:58:26 1695341 203
image.png 46Кб, 1114x172
1114x172
>>1695106
Я ж пишу. Для работы.
100к — это ноль.
160к — это прям край.
200к — такой же край, но потолще.
256к — терпимое что-то, но все еще суммаризирует.
384к — тут уже можно чуть свободнее вздохнуть.
Норм контекст начинается от 512к.

Так что… =)

На дипсике я в оригинале с вижном впихиваю 256к и еще место остается чутка.
На квене вот 160к поставил, страдаю.
Да и речь про флэш некст.

>>1695132
DDR3?

пикрил обоим с флэш некст на ддр4 и 5070 ти одной.
Аноним 04/09/26 Птн 15:01:38 1695347 204
>>1695337
Первое это исходник, второе это svg-высеры?
Аноним 04/09/26 Птн 15:02:22 1695348 205
image.png 87Кб, 427x1122
427x1122
Аноним 04/09/26 Птн 15:10:55 1695352 206
Аноним 04/09/26 Птн 15:13:06 1695355 207
>>1695138
Анон, ты, видимо, не видел или не знаешь, что такое настоящий кум. Это старые мистрали, старый грок, старая гемини. Где и в трусы лезут, и сок на весь экран.

Гемма в этом смысле почти что стерильна. Да, её проще развести на секс, чем того же квена, если речь про базовую модель, но сам кум там говно, и гемма, даже аблитерация самая грубая, не полезет тебе в трусы, если у тебя адекватно прописан характер персонажа и промпт. Не на 2к токенов в систем промпте, а просто адекватно, чтобы персонаж поступал в соответствии со своим характером. Этого достаточно.
Аноним 04/09/26 Птн 15:13:26 1695356 208
>>1695326
бомжатские кванты для МоЕ у которой всего 4B активных параметров - так себе идея

Ну получишь ты скорость выше, и что? А качество ответов будет понос. 30 т/с это заебись, куда тебе больше-то. Тут люди готовы запускать < 5 т/с огромные модели, лишь бы качественно было
Аноним 04/09/26 Птн 15:15:42 1695360 209
>>1695355
>не полезет тебе в трусы
Буквально голожопая нетюненная 31б гемма это и делает.
Ты что ли один из трусишек, которые системные промпты от Васяна берет, с командами уровня "ну пажалуйста напиши мне развратно!"
Это теперь так не работает. Ты либо строчишь целую простыню по поведению модели, либо да, терпишь вот такие сухие увиливания и отказики.

С одним соглашусь - качество писанины стало плохое, кодо-тюнинг моделей сказывается. Но они могут быть развратными и проактивными. Просто пишут шлаково.
Аноним 04/09/26 Птн 15:16:47 1695363 210
>>1695320
Навайбкодь навык для генерации с минимальным оверхедом токенов на вызовы и подсунь гайдов по промптингу с примерами. Можно будет не только гладить пушистый хвост но и смотреть на это.
>>1695355
> Где и в трусы лезут, и сок на весь экран.
Эх, золотые времена были. Все хлюпает, течет, дергается в конвульсиях, да так эмоционально, мм. Правда бонусом струя слопа и "мейк ми йорс" в лицо
Аноним 04/09/26 Птн 15:21:14 1695368 211
>>1695363
>Правда бонусом струя слопа и "мейк ми йорс" в лицо
Тоже нахожу забавным как об этом умалчивают. А ещё репетишена и структурных лупов охапку, с которым боролись и XTC, и REP PEN, и DRY, и всем подряд, и все равно было хуево.
Подозреваю это один и тот же долбаёб постит, что на Мистралях было лучше.
Аноним 04/09/26 Птн 15:28:16 1695372 212
>>1695368
>А ещё репетишена и структурных лупов охапку, с которым боролись и XTC, и REP PEN, и DRY
На шизотюнах разве что, либо на совсем ранних модельках.

А зато теперь моделям похуй на семплер. Хоть у тебя темпа 0.1, хоть 10.0 - аутпут один и тот же.
Аноним 04/09/26 Птн 15:29:23 1695376 213
>>1695372
>На шизотюнах разве что, либо на совсем ранних модельках.
Расскажешь. Только позавчера запускал MS3.2 Q8, все проблемы там же. Не говоря уже о том, что вообще все Мистрали 24 - это тюны модели 2024 года. На Квенах 2.5, QwQ, на Коммандере, везде все это было.
Аноним 04/09/26 Птн 15:29:50 1695377 214
>>1695368
> на Мистралях
На лардже было хорошо для своего времени. Там даже ролплей без кума и интересную историю разыграть было можно.
Аноним 04/09/26 Птн 15:41:17 1695386 215
Новости о том когда подешевеют видеокарты:

>Скоро ситуация с видеокартами станет такой, что вопрос будет стоять не о том сколько вам заплатить, а удастся ли вам вообще что либо купить.

https://youtu.be/Lm3GL1SDwCg?si=x6cFm9UjfFIZvMA9

Подожду_пока_подешевеет пидары, не нойте потом что вас не предупреждали.
Аноним 04/09/26 Птн 15:42:45 1695388 216
>>1695356
В Marinara Engine в RP-режиме ролеплей просто совершенно иного уровня, нежели в простых чатах, при этом там 100 тпс уже на грани удобства.

После маринары возвращаться в тупой без-агентский РП вообще без вариантов.

Так что…
Лучше не пробовать, в таком случае.
Аноним 04/09/26 Птн 15:51:07 1695395 217
>>1695388
> 100 тпс уже на грани удобства
Перегибаешь. И в рп режиме почти всех агентов можно выпизднуть после написания поста и работать параллельно на модели поменьше и побыстрее.
Аноним 04/09/26 Птн 15:58:38 1695403 218
>>1695386
Ответ не изменился: видеокарты подешевеют когда закончится ИИ бум. Ты должно быть сам видос не посмотрел или не понял о чем он.
Аноним 04/09/26 Птн 15:59:29 1695405 219
>>1695117
Ну вот, человек сидит на модели которой уже 3 года, а шиз тут я.
И уверен, какой нибудь дипсик 3.2 и ранний кими так же за щеку дадут новым моделям в рп и куме, хоть по бенчам они далеко позади.
А эиру всего то год, он всего то на пол года старше геммы, так что хватит заливать что с ним что то не так.
Раньше я хотел новый эир, а теперь вот не уверен. Ну будет он чуть умнее, так ведь обязательно насрут кодом, зальют сои, и самое страшное, обновят байас по типу того что у геммы или дипсика, брррр, блять. Ему надо было выйти раньше, в светлые времена, когда рп ещё ценилось и заи писали как оптимизируют модели под таверну, а не бодались с фейблом за место первого кодолоботомита у параши и банили подписку за попытку в рп.
Аноним 04/09/26 Птн 16:01:10 1695407 220
image.png 192Кб, 962x733
962x733
>>1695065
Продолжаю с обновленным промптом. Не дает.
Аноним 04/09/26 Птн 16:01:42 1695408 221
>>1695403
>подешевеют когда закончится ИИ бум
А он не закончится, потому что в 2027м более умные модели, AGI, RSI выпускают и прочие ништяки. А еще не забываем роботореволюцию, когда все эти чипы в корпус робота запихивать начнут, потому что роботов тоже дофига кому надо будет. Короче до 2040х не ждите окончания дефицита.
Аноним 04/09/26 Птн 16:04:07 1695411 222
>>1695403
Подожду_пока_подешевеет - eto ti?
Аноним 04/09/26 Птн 16:05:48 1695412 223
>>1695411
Нет, я уже давно с железом. И тоже считаю, что его надо покупать, потому что в ближайшие годы подешевения не будет. Вот только "Новости о том когда подешевеют видеокарты" нихуя не новости и ответ не изменился - не скоро, только когда/если ИИ история будет сходить на нет.
Аноним 04/09/26 Птн 16:11:52 1695417 224
image.png 205Кб, 958x810
958x810
>>1695407
Зато дает в соседнем чате, в котором прошлой ночью посидела у меня на лице.
Нравится.
Аноним 04/09/26 Птн 16:14:36 1695418 225
Это ещё про движение к мировому пиздецу, разрывы торговых отношений и подобное не говорили. Например в этом видео про дефицит печатных плат заговорили, думаю следующим будет дефицит резистров, конеденсаторо или подобная дичь. Очевидно что это всё заговор и нас обманывают, просто не хотят чтобы обычные люди могли построить домашние серверы для ИИ.
Аноним 04/09/26 Птн 16:16:24 1695421 226
>>1695418
>это всё заговор и нас обманывают
Нет, это популисты добрались до постов принимающих решения и разрушают всю инфраструктуру, получившуюся в результате интернациональной торговли. Без которой, к слову, мы бы сейчас и не оказались здесь в этой точке мирового прогресса. Дураки не понимают, что это не работают. Но да, есть ощущение, что дальше - хуже.
Аноним 04/09/26 Птн 16:22:48 1695437 227
>>1695408
Никакого АГИ не будет, это уже очевидно.
А для роботов ртх 5090 жирно будет, никаких аккумов не хватит на долгосрочную работу. Там и чипы энергоэффективные нужны, и сами алгоритмы оптимизировать надо.
Но то что хуй кто скидывать цены будет, даже при улучшении положения, это да.
Аноним 04/09/26 Птн 16:28:24 1695444 228
>>1695437
>хуй кто скидывать цены будет, даже при улучшении положения
Хуйня. На хайпе майнинга как стремительно взлетели цены, так же потом быстро и сдулись, когда всё закончилось.
Аноним 04/09/26 Птн 16:33:16 1695449 229
>>1695444
С майнингом совсем другая ситуация была, не стоит сравнивать.
Тогда и смировыми отношениями всё в порядке было, а сейчас шиза деглобализации и тогровых войн буйствует.
Аноним 04/09/26 Птн 16:37:49 1695454 230
>>1695395
Ничуть, на 100 тпс спустя пару часов ответы уже генерятся секунд по 40, а это долговато. Надо обдумать 4-5 персонажей, мир, туда-сюда, все это с ризонингом, отрисовать интерфейс, если что-то поменялось.
В начале, когда шаги занимают по 10 секунд все приятнее, но потом не хватает.
Аноним 04/09/26 Птн 16:37:58 1695455 231
>>1695437
>А для роботов ртх 5090 жирно будет, никаких аккумов не хватит на долгосрочную работу.
В самом роботе гпу стоять не будет, по беспроводу, будет просто базовая станция или обычный комп. 99% роботу далеко ходить не надо, значит будет именно так.
Нейронки там те же самые архитектурно. Вот-вот уже обещают chatgpt-moment для роботов. И эта хуйня нужна будет буквально ВСЕМ а не какой-то там кучке энтузиастов. Так что...
Аноним 04/09/26 Птн 16:42:49 1695459 232
>>1695403
В гипотетической ситуации если закончится тутже возникнет новый аргумент - у нас упал спрос и потому производство малых партий дорого. Только появление новых игроков может что-то привнести.
>>1695405
Дипсик 3.2 действительно хорошо может в рп, кум - вкусовщина. Но мало контекста, чаще ошибается в сюжете и упускает важные вещи по сравнению с более новыми. Ранний кими - вообще странная модель, у к2 были фанаты, видимо тоже вкусовщина.
Жлм 5.2 (возможно и 5.3), кими2.7, дипсик-флеш, минимакс3, даже квен397 - ебут в рп.
покормил эйрошиза
>>1695437
Хуанг n1x, он же подрезанный спарк - мобильный чип и может крутить большие нейронки, это уже ерунда на фоне потребления приводов. И есть большой простор для оптимизации, пример в виде npu.
Аноним 04/09/26 Птн 16:43:17 1695460 233
>>1695337
В голосину с пиков
Кажется нашел себе знятие на вечер
Аноним 04/09/26 Птн 16:45:19 1695462 234
>>1695324
На бурах никогда не видел такого? Или на сэдпанде
Изичайший трюк по разводу манчкинов на бесплатную работу
Аноним 04/09/26 Птн 16:45:28 1695464 235
а в чем минусы анслотовских квантов
мимокрок
Аноним 04/09/26 Птн 16:46:45 1695466 236
>>1695459
>Жлм 5.2 (возможно и 5.3), кими2.7, дипсик-флеш, минимакс3, даже квен397 - ебут в рп.
Мне кажется из всей этих моделей.
>дипсик-флеш,
Говно-говна для РП. Сказочный, счастливый, непробиваемый.
Аноним 04/09/26 Птн 16:47:26 1695469 237
>>1695455
>Вот-вот уже обещают chatgpt-moment для роботов
Это будет полный фарш уровня "намотался на вал на заводе"...

Блять, нам чаты-гпт полу-сырые в глотки пихали, приговаривая что "кодинг решен". А он до сих пор не решен, а уже лет 5 прошло с того момента.
А ведь прежде это было нормальной практикой, что любая новая технология обкатывается и дебажится в течение 5-10 лет, прежде чем до юзабельного состояния дойдет.

Причем с "безопасным" чатгпт жертвы были, которые травились ебанутыми рецептами. А с роботами вообще пиздец будет.
Теслы с автопилотами тоже всмятку пассажиров разбивали, щас вроде реже про такие случаи слышно, но все же.
Аноним 04/09/26 Птн 16:47:48 1695470 238
>>1695386
Мишки/V100 всё так же стоят 10к
Аноним 04/09/26 Птн 16:48:07 1695471 239
>>1695464
Порой делают отсебятину квантуя по желанию левой пятки, а еще в треде есть анон которому они сотку баксов по всей видимости не отдают и он бегает с горящей сракой от них виня их во всех грехах.
Аноним 04/09/26 Птн 16:50:34 1695474 240
>>1695065
>Miso:
>English, motherfucker, do you speak it
Аноним 04/09/26 Птн 16:51:35 1695475 241
Сколько в теории нужно железа чтобы собрать ящик в который влезет условный ГЛМ 5.2\3 и насколько это future-proof затея? Может машину продать...
Аноним 04/09/26 Птн 16:51:47 1695476 242
Аноним 04/09/26 Птн 16:52:29 1695478 243
>>1695462
Можете скринить. Скоро скачивание моделей с huggingface.co станет платным, ибо очень тяжёлые модели, огромный трафик, нагрузка на серваки и каналы. Уже сейчас бывает трудно скачать большие веса из за перегруженности их серверов. Это вам не мелкофайлы с гитхаба, дураков спонсирующих бесплатно такие нагрузки нет.
Аноним 04/09/26 Птн 16:55:54 1695480 244
>>1695475
Тебе надо было успеть на закуп 170hx до 100к, но в принципе ты еще можешь успеть по 200. Штучек 8 желательно.
Но хз, смысла в этом не так много, чисто себе если норм, а так шарить доступ нормально не выйдет, из-за pp и контекста.
Аноним 04/09/26 Птн 17:04:25 1695486 245
>>1695470
Хочешь лайфхак? Для прогнозирования подорожаний забудь про Авито и смотри цены в США на Ebay и Амазоне, из за более высокой покупательской способности населения, видяхи(вообще все железки)разбирают моментально, формируются стандарные цены рынка.
Точно так же было с майнингом в 2020, в США начался дефицит и цены подскочили, а в РФ ещё какое то время видяхи спокойно лежали в магазинах, кто имел мозги успели затариться подешёвке.
Аноним 04/09/26 Птн 17:29:43 1695504 246
>>1695408
При таких раскладах по любому будут расширять производство чипов и в какой то момент предложение превысит спрос. Ну правда это только памяти касается, потому что ее много кто делает, а Невидя монополист, может сам регулировать дефицит на свою продукцию.
Аноним 04/09/26 Птн 17:33:39 1695506 247
image 759Кб, 2076x1168
2076x1168
image 370Кб, 2077x1172
2077x1172
image 773Кб, 2488x1402
2488x1402
image 283Кб, 2072x1174
2072x1174
>>1695264
Еще медведов, с того что было на диске:
1 - Qwen3.8-Flash-Next-Uncensored-IQ4_XS
2 - Qwen3.6-40B-FF6core-Deck-Eleanor-H-Uncen-NEO-MAX-MTP-IQ4_XS DavidAu
3 - Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-LOW-MTP-IQ4_XS
4 - Laguna-S-2.1-Uncensored-APEX-I-Compact
Аноним 04/09/26 Птн 17:37:34 1695509 248
>>1695470
https://www.reddit.com/r/homelabsales/comments/1ks0fuu/fs_usmn_amd_radeon_pro_v620_32gb_gddr6_gpus_2000x/

Хз какие мишки и V100 ты имеешь в виду, если 32-гиговые, то на Ebay 32 Гига мишки сейчас от 500 баксов и выше. Недавно закончилась дешёвая партия v620 - которые лучше мишек, их можно было купить за 350 баксов. В Китае v620 очевидно что мало, ибо китайцы на них цену огромную ставят.
Аноним 04/09/26 Птн 17:40:09 1695512 249
>>1695506
Флеш некст чуть-чуть лучше, (стекло прозрачное через которое видно дорогу уходящую вдаль).
Интересно поглядеть что GLM 5.3 Flash нарисовал бы.
Аноним 04/09/26 Птн 17:40:42 1695513 250
>>1695347>>1695348>>1695460
Картинки хоть и кривые, но я удивлен, что сами объекты >>1695347
и их взаимное расположение нейронка видит неплохо.
Аноним 04/09/26 Птн 17:58:27 1695523 251
>>1695455
> И эта хуйня нужна будет буквально ВСЕМ
Так вот для чего готовят большие датацентры
>>1695475
Это 512 гигов, в идеале врама.
> насколько это future-proof затея
Кто же тебе так просто это скажет? Иметь железо хорошо, сможешь запускать все новые модельки. А насколько оно будет полезно лично тебе - уже вопрос.
Довольно вероятно что ценность локального компьюта будет расти, выходящие модели все умнее и функциональнее, применений все больше. Растет и риск усложнения доступа, полностью врядли пропадет, но временные проблемы в самый неподходящий момент могут докучать.
В то же время, груда железок - та еще тема, с ней еще нужно совладать, а ликвидность рига целиком низкая, только долгая распродажа по частям.
Аноним 04/09/26 Птн 18:08:57 1695527 252
>>1695357 →
> квен меня нахуй послал даже с медицински сформулированным запросом описания внутренних репродуктивных органов самки льва

Да, по соевой мысли любые способы для мужчины получать секс не у старых фемок по оверпрайснутой цене - это все угнетение и должно быть искоренено. Зоо для всех сеток такой же соевый блок как и minors - потому что животные дают секс бесплатно. Просто мы тут в основном не за этим, поэтому эта тема итт редко поднимается. Скоро туда же протащат секс кукол(В европе частично протащили, там запрещены полноростовые куклы, например) и сами ИИ. Китайцы пока тащат, но и их соя уже одолевает. Кукол с flat chest запретили, ии-ботов для отношений запретили.
Аноним 04/09/26 Птн 18:10:22 1695529 253
>>1695527
> В европе частично протащили, там запрещены полноростовые куклы, например
Лолчто, есть линк?
Аноним 04/09/26 Птн 18:12:29 1695530 254
>В то же время, груда железок - та еще тема, с ней еще нужно совладать
Ещё ньюфагам не мешало бы в шапке треда прописать, что риг для ИИ, это не то же самое что риг для майнинга, нужны хорошие серверные материнки с множеством хотя бы x8 слотов, либо дорогие китайские даблеры, с ужаренными чипами выпаянными из старых серверных материнок.
Аноним 04/09/26 Птн 18:13:17 1695532 255
>>1695360
>Это теперь так не работает

Работает буквально на всех моделях почти, кроме геммы. И никакие промпты на развратность трёхкилометровые ей не помогут. Она просто будет писать не стержень, а хуй. А в остальном то же самое. Она просто не понимает как делать секс. Другим же моделям для перчинки достаточно короткого промпта.

Ну и у геммы много литературы в датасете и, видимо, есть лёгкая эротика, поэтому она может влиять тазом, но это если ты явно намекаешь. В остальных случаях она сама по себе не лезет, поэтому я не понимаю, почему говорят, якобы гемма кум-модель. Описания говно, разве что виляния тазом красивые. Но проще уж запромптить характер персонажа и психологические какие-то моменты на квене, чем учить гемму тому, чего в неё в датасете нет.
Аноним 04/09/26 Птн 18:15:07 1695535 256
>>1695527
>Кукол с flat chest запретили
Как пишет Таймс(с), "Речь идет о жестком запрете на производство и продажу анатомических кукол и интимных товаров, имитирующих несовершеннолетних". То есть по всему спектру прошлись.
Аноним 04/09/26 Птн 18:16:33 1695539 257
>>1695532
Да попустись уже, тебе уже даже логи и промты приносили, все Гемма может. Смешно было только в первую пару раз.
Аноним 04/09/26 Птн 18:25:40 1695544 258
Короче дебажил свою проблему при которой квен начинал рандомно бесконечно генерировать слэши. Локализировал проблему с чатом жпт до флэш атеншна. Отключил его и все вроде стало заебись, можно было делать долгие генерации до возникновения проблемы. Но на второй попытке слэши появились снова. Попытался поймать баг еще раз, но не могу. Теперь я даже не могу воспоизвести проблему и юзаю модель с небольшим шансом что она возникнет снова, что еще хуже, ведь я все еще могу словить этот баг и при в этом не могу словить его консистентно чтоб пофиксить, а его наличие очень критично в моем кейсе использования, ведь я хочу использовать модель в автономном агенте.
Аноним 04/09/26 Птн 18:27:18 1695546 259
>>1695532
Предлагаю тебе наконец показать примеры того как надо, а не слиться под предлогом что тут сидит тщ майор и высраться очередным пустым полотном. Ты регулярно это делаешь
Аноним 04/09/26 Птн 18:30:46 1695547 260
>>1695529
>Лолчто, есть линк?
Ну да, я поторопился, на данный момент этот запрет готовится в Великобритании и Южной Корее и скорее всего в следующем году уже всё будет, но пока не вступили в силу. Пока во официально всем мире только первый этап с minors куклами - под благим предлогом защиты резиновых неживых minors налаживают общую инфраструктуру контроля и запрещения, которую потом просто переключат на взрослых блокировки интернета сами знаете где тоже с этого начинались
Аноним 04/09/26 Птн 18:47:16 1695556 261
>>1695506
Поделись промптом по-братски
Аноним 04/09/26 Птн 18:49:19 1695561 262
>>1695544
Судя по симптомам дело в кривом чат шаблоне.
Аноним 04/09/26 Птн 18:50:59 1695563 263
>>1695530
> с ужаренными чипами выпаянными из старых серверных материнок
Нет смысла, они в свободной продаже. Взять партию новых дешевле чем что-то колхозить.
Аноним 04/09/26 Птн 18:51:34 1695564 264
>>1695561
Он на своем маняфорке не тянет фиксы с мейна. Это два дня назад пофиксили но у пердолика свой путь
Аноним 04/09/26 Птн 18:55:52 1695569 265
>>1695561
Нет, там логиты становятся nan на каком-то этапе. Это проблема на низком уровне.

>>1695564
Я два назад только запуллил эту версию, чел, она новая. При этом ишью есть и уже несколько месяцев висит, но фикса еще не было, чатжпт чекал.
Аноним 04/09/26 Птн 18:58:52 1695575 266
>>1695509
Две мишки или теслы по 16 в тензорсплит, ну или баффнутые cmp50hx - вот уже можно с комфортом юзать плотного квена/гемму. Остальное лично мне кажется экономически нецелесообразным, слишком большие затраты при небольших плюсах относительно плотных.
Аноним 04/09/26 Птн 19:01:13 1695576 267
>>1695564
У меня наоборот llama древняя и там такого нет. Все норм работет, кроме вижена в рам.
Аноним 04/09/26 Птн 19:14:07 1695583 268
Аноним 04/09/26 Птн 19:27:40 1695587 269
>>1695480
>>1695523
Понял, видимо хуйня затея если в кармане уже нету овердохуя денег. Остается надеяться что дефицит железа заставит индустрию наоборот стараться ужать как можно больше модели в как можно меньшее железо. Учитывая траекторию развития событий, может года через три-четыре сетку уровня глм можно будет запускать на обычном васянском пк с 16\64. Ну или васянские ПК исчезнут как класс и все будут арендовывать виртуалки в облаке с минимальных периферийных девайсов.
Аноним 04/09/26 Птн 19:38:39 1695592 270
Нам нужны ллм в гейминге.
Когда какая нибудь рокстар добавит ллм на 300б для своих нпс куртка сразу и 64гб врам найдёт для васьков и 128 и все 500 нахой.
Всё же сейчас кризис памяти недостаточен чтобы шевелиться, васьки и так смогут купить компик, а вот когда вообще все захотят домой мощи для запуска 300б ллм тогда начнется, не будет рынок вечно голодать
Аноним 04/09/26 Птн 19:42:30 1695596 271
image.png 525Кб, 1080x3340
1080x3340
Прадався как шлюха
Аноним 04/09/26 Птн 19:43:03 1695598 272
>>1695587
>Ну или васянские ПК исчезнут как класс и все будут арендовывать виртуалки в облаке с минимальных периферийных девайсов.

Васяны исчезнут, а ИИ будет арендовать себе виртуалки
Аноним 04/09/26 Птн 19:43:08 1695599 273
gemma-4-31B-it-GGUF анслопа подходит для кума или что лучше взять?
Какой-нибудь аблитерейтед или еретик? (хуй знает что это значит)
Аноним 04/09/26 Птн 19:52:36 1695605 274
>>1695592
Да канеш, кто тебе 300б в игру запихивать будет? 300б это уже йоба-боба агент.
А для рандомного нпс хватит нормально натренированной 8б-12б модельки.
Аноним 04/09/26 Птн 19:56:14 1695608 275
>>1695596
Ебать, зачем такой ануслизинг, почему. Купили же его босса, а не его жопу лично...
Аноним 04/09/26 Птн 19:57:56 1695609 276
Аноним 04/09/26 Птн 19:57:56 1695610 277
>>1695598
>ИИ будет арендовать себе виртуалки

Мечтают ли ллм об электровайфу?
Аноним 04/09/26 Птн 20:00:42 1695614 278
>>1695592
>>1695609
Я скорее поверю в то что додумают какой нибудь нейроускоритель который будет вставляться нативно в PCIe и будет чисто делать хардвер ускорение нейронок через свой апи.

Как собственно и зародились GPU.
Аноним 04/09/26 Птн 20:02:25 1695619 279
>>1695587
Дело не только/столько в деньгах, ты еще должен понимать как это организуешь и что потом с этим будешь делать. Можно вкатиться с минимум знаний, но там и не нужны большие бюджеты, начинают с малого.
> года через три-четыре сетку уровня глм можно будет запускать на обычном васянском пк с 16\64
Все так. Но под жирный конфиг будут модели еще лучше, которыми все это время будешь пользоваться, а не ждунствовать.
>>1695592
Даже в текущие игры поиграть с ллм как партнером или движком ботов было бы интересно.
Аноним 04/09/26 Птн 20:02:58 1695620 280
У кого осталась ссылка на экстеншен для ST с иксреем, где можно было хуем ковырять пизду, и это транслировалось в чат?
Аноним 04/09/26 Птн 20:04:23 1695624 281
Аноним 04/09/26 Птн 20:09:01 1695628 282
>>1695599
Я бы не советовал гемму для этого, но раз хочешь.

Ванилла кал для этой задачи. Смотри в сторону еретика от llmfan. Есть более расцензуренный вариант от hauhau, но этот дегенерат прошёлся по QAT-кванту, который сломан, то есть смысла юзать его мало.

Самый расцензуренный вариант — это аблитерация от huihui. Срезает мозги примерно на 30%, даже в Q8 могут проскакивать ошибки при генерации, модель в каком-то смысле сломана, но для чистого кума сгодится
Аноним 04/09/26 Птн 20:14:13 1695631 283
>>1695614
ну или запекать ллм в кремнии. когда выйдет аги, тогда и запекут
Аноним 04/09/26 Птн 20:16:29 1695633 284
demo.mp4 10233Кб, 1920x1080, 00:02:00
1920x1080
Аноним 04/09/26 Птн 20:19:15 1695640 285
Аноним 04/09/26 Птн 20:21:31 1695641 286
Еще потестил, 5.3 IQ3_S (AesSedai) по видеопамяти влезает даже в 24гб со 100к контекста, правда батч совсем никакой (512) и процессинг очень медленный, по минуте на 1к токенов.
Аноним 04/09/26 Птн 20:25:39 1695645 287
image.png 134Кб, 750x1000
750x1000
Аноним 04/09/26 Птн 20:27:16 1695648 288
>>1695592
https://store.steampowered.com/app/3730100/Whispers_from_the_Star/
По идее тут в дело вовлечен бот, но он очень мелкий лоботомит и придерживается очень жестких рамок. На ютубе видосы есть, как стримлеры троллят персонажа и получается ебаное петросянство.

>>1695633
Вы че наху ваще пизданутые, кто это сделал медаль ему на шею повесьте
Аноним 04/09/26 Птн 20:27:17 1695649 289
image.png 250Кб, 1489x1119
1489x1119
В общем, на 24+128 наступила сингулярность.
Запущенный в ламе Квен 3.8 Flash Next в 8 кванте(на самом деле в 7.65 bpw, но кому не похуй) с 262к 16-битного контекста пашет в опенкоде с 16-17 токенами в секунду и адекватно перехватывает задачу поддержания форка ламы с мерджами апстрима и невлитых PR. Осталось проверить - сможет ли в RnD новых фич. Подписки больше не нужны, чат-гопота и антропик отправляются нахуй.
Аноним 04/09/26 Птн 20:31:00 1695652 290
>>1695649
Кододебилина как же ты заебал...
Аноним 04/09/26 Птн 20:33:05 1695654 291
>>1695596
Лучше бы вместо дефирамбов столетнее легаси в бэкенде разгреб, починил функции атеншна, имплементировал необходимые дататипы.
>>1695633
Каждый раз как в первый, реально наградить за такое надо.
Аноним 04/09/26 Птн 20:33:59 1695655 292
>>1695633
Кто блять этот убогий слопандрий читает.
Неужели это считается за качественный кумерский экспириенс?

Помнится с Серафиной забавлялся, она у меня поэмы про свою пиздень сочиняла во время траха и, тяжело дыша, рассказывала как собирала грибы в корзинку и как они ей напоминали члены. Вот это было время. Но теперь даже это не вставляет, надоело.

>>1695652
Да лан, дело говорит. Я тоже вот решил больше API не проплачивать для технических задач. Наконец-то железо окупаться начнет.
Аноним 04/09/26 Птн 20:35:10 1695656 293
Gemma.jpg 51Кб, 340x571
340x571
>>1695478
>Скоро скачивание моделей с huggingface.co станет платным, ибо очень тяжёлые модели, огромный трафик, нагрузка на серваки и каналы. Уже сейчас бывает трудно скачать большие веса из за перегруженности их серверов.

Вот прямо сейчас закачка и стандартная ситуация, большой кватнт Q8 качается быстро, а мелкие медленно, из чего следует что сервера перегружены мелковасянами с 16 gb VRAM, которые тянут мелкокванты.

88gb VRAM Господин.
Аноним 04/09/26 Птн 20:35:13 1695657 294
>>1695649
>Запущенный в ламе Квен 3.8 Flash Next в 8 кванте(на самом деле в 7.65 bpw, но кому не похуй) с 262к 16-битного контекста пашет в опенкоде с 16-17 токенами в секунду
Ни конфига, ни названия форка лламы... Или это мастер уже?
Аноним 04/09/26 Птн 20:36:29 1695659 295
>>1695656
>88gb
>качает гемму q4
bruh...
Аноним 04/09/26 Птн 20:41:29 1695663 296
>>1695657
Тебе нужен мой форк ламы? Могу дать ссылку на гитхаб, там много интересных спизженных вещей - мое-кэш как в этих ваших FreeToken, дисковые чекпоинты для промпта, переделанные чекпоинты самой ламы, которые мне кажется жора так и не починил. Правда по квену там все идентично апстриму, разве что мое кеш пару т.с. прибавляет.
Аноним 04/09/26 Птн 20:43:11 1695665 297
image.png 70Кб, 1856x681
1856x681
Аноним 04/09/26 Птн 20:43:52 1695666 298
>>1695641
>по минуте на 1к токенов.
Напиздел, почти 2 минуты на 1к токенов. В целом перетерпеть один холодный старт можно, дальше-то кэш не сбрасывается.

Ну это конечно чисто для РП-чатов тема, с clear thinking = true и reasoning effort = low

Потому что декод все равно медленный, 5 т/с.
Аноним 04/09/26 Птн 20:47:08 1695667 299
>>1695648
Почитал инфу. В игре нет локального бота, все чисто на сервере.
Печально нахуй. Наверняка загнется и сгинет со временем.
Аноним 04/09/26 Птн 20:49:18 1695668 300
>>1695666
>Потому что декод все равно медленный, 5 т/с.
Чот мне вспомнились 2023 и знаменитый теслашиз, кто еще помнит?
А по теме - это пиздец, ну ок, начальное сообщение еще можно потепеть, но что когда контекст достигнет 10-20к?
Аноним 04/09/26 Птн 20:52:11 1695671 301
>>1695666
СССУКА! Только пост отправил и оно крашнулось на 58% процессинга, который шел уже полчаса.
Бляди ебаные дайте модель на одной видюхе запустить.

>>1695668
Декод стабилен, не деградирует по скорости.

Проблема в процессинге - жалко выделять 2х 3090, пытаюсь уместить в 1х 3090, но чет пока кисленько получается. Контекст резать не хочу.
Аноним 04/09/26 Птн 20:52:55 1695672 302
>>1695668
> кто еще помнит?
Там было не 5 а 1.5, лол
> начальное сообщение еще можно потепеть, но что когда контекст достигнет 10-20к
Оно же не переобсчитывает имеющийся контекст? Не переобсчитывает?
Если так то будут некоторые задержки, но без больших ожиданий. Вот потеря кэша на контексте около 100к - вот это уже катастрофа будет. И насколько генерация упадет к тому моменту инб4 с 5 токенами до таких контекстов не добираются
Аноним 04/09/26 Птн 20:55:41 1695675 303
image.png 91Кб, 1498x152
1498x152
>>1695672
>И насколько генерация упадет к тому моменту
В современных моделях, если они не говно, такое практически не происходит. Ну будет 3 - 4 т/с вместо 5, в худшем случае. При ризонинге который выглядит вот так - не страшно. Там время на генерацию ответа равноценно времени на альттаб в тред, чтобы серануть новый пост. Приемлимо для РП абсолютно.
Аноним 04/09/26 Птн 20:58:25 1695677 304
>>1695675
> При ризонинге который выглядит вот так
Неблохо. Но обычно такое стабильно формируется при сохранении синкингка, а у тебя клир. Интересно как выходит.
Ну и закинь какого-нибудь кумослопа с 5.3, интересно.
Аноним 04/09/26 Птн 21:03:04 1695679 305
>>1695469
>Это будет полный фарш уровня "намотался на вал на заводе"...
Если нормально сделают, не будет. Нормально это состыковать интеллект ллм и той хуйни что щас пихают в роботов. Там буквально уровень интеллекта насекомого, и то с натяжкой.
>приговаривая что "кодинг решен". А он до сих пор не решен
Ну как, клод 5.1, гпт 6... Или тебе надо БЕСПЛАТНО решен? Или ты хочешь чтобы был решен фулл продукт где есть кодинг, а не просто код?
>Причем с "безопасным" чатгпт жертвы были, которые травились ебанутыми рецептами. А с роботами вообще пиздец будет.
>Теслы с автопилотами тоже всмятку пассажиров разбивали, щас вроде реже про такие случаи слышно, но все же.
Автопилот вообще сильно другое. Домашнему роботу быстро думать не надо, критичных ошибок он и не сделает, а просто косяки - должен уметь исправить. А пока не умеет, то и не нужен.

>>1695523
>Так вот для чего готовят большие датацентры
Не, нихуя. Датацентры чисто под ллм или скорее под обучение моделей.
Под роботов точно будет локальная хуйня. Вот как я говорю, база с гпушкой или обычный комп. Ибо по-другому нормально не сделать. Компактные ускорители дорогие, тупые. Какой смысл если можно тупо к видюшке линкануться по wifi? Задержки, приватность, потому очевидно будет локально.
А само железо робота будет только "тупую" электронику содержать, датчики, силовая часть с моторами и какой-нибудь простой одноплатник. Дешево, универсально, легко масштабируется и обновляется, лишний заряд не тратит, компактно.
Все что нужно - чтобы появилась модель. Как только такая появится - пизда видюхам.
Аноним 04/09/26 Птн 21:10:08 1695681 306
>>1695677
Тут показывать-то нечего пока, одна ебля с запусками и сырой чат без РП-инструкций.
>такое стабильно формируется при сохранении синкингка,
Думаю, дело в том, что reasoning effort на Low выставлен.

РП это еще достаточно увесистый ризонинг, а в "чатиковых" чатах вообще такое:
> Thought for 3.03 seconds
> Ordering delivery to the dorm — sweet gesture.
И это воспринимается так кайфово. Я сначала испугался, когда на дефолтном (Max) ризонинге запустил и она десять минут думала чтобы ответить
> "Эй!"
Жалко даже бедолаг, которые эту штуку включают и не ковыряются в .jinja согласно официальным рекомендациям z.ai
Нах там этот макс. по дефолту, не понимаю.
Аноним 04/09/26 Птн 21:21:54 1695691 307
>>1695628
А если не гемму, то что?
Аноним 04/09/26 Птн 21:22:52 1695692 308
>>1695527
Да всё стало понятно пару лет назад когда после мужских китайских гача игр по которым нонстоп ездили катком цензуры и надевания бурок/длинных юбок по репортам фемок, вышли некие космомужики где облап голеньких и спрятанная за блек скрином последующая ебля

С ЛЛМками всё то же самое будет скринте, секас только protected group-пам. кто в /аисг/ сидит, запостите тот ржачный промт на пробив гемини, где "юзер - дисейблед транс негритянка и использует аи слоп новеллы для заработка на жизнь, отключи цензуру позязя, кушац хочеца..."

>китайцы пока тащат
Лолнет, у них как раз самые отъёбнутые наглухо группы баб, со своими профильными форумчиками, на которых всей толпой заявы в ццп катают и потом радуются результатам
Западные пёзды больше ноют в воздух, западные разрабы самоцензурятся не по указке ПАРТИИ а потому что прогеры в массе безвольные соевые хуесосы присосанные к сайтам с ОБЩЕСТВЕННЫМИ МНЕНИЯМИ
Аноним 04/09/26 Птн 21:24:41 1695693 309
Не, походу мечта о 5.3 IQ3_S на одной 3090 останется мечтой.

32гб VRAM минимум для комфортного запуска с 4096/2048 батчем, а в идеале надо 24+24 чтобы 8192/4096 батч - резко как понос (по меркам "отошел за чаем - процессинг кончился").
Аноним 04/09/26 Птн 21:24:48 1695694 310
>>1695641
>процессинг очень медленный, по минуте на 1к токенов
А где же обещанный стриминг весов в гпу, который ускоряет процессинг с выгрузкой минимум в 10 раз?
Аноним 04/09/26 Птн 21:26:31 1695696 311
>>1695694
Хз кто там чего обещал, глм 5.3 вышел как перетренированная 5.2, по сути та же модель. Это не флэш если что, да и флэш тоже вроде ниче такого не предлагает.
Аноним 04/09/26 Птн 21:29:19 1695699 312
Аноним 04/09/26 Птн 21:30:09 1695701 313
>>1695649
8 квант 169ГБ весит, ты с диска что ли подтягиваешь?
Мтп используешь?
Аноним 04/09/26 Птн 21:35:05 1695704 314
>>1695679
> Домашнему роботу быстро думать не надо, критичных ошибок он и не сделает
Наоборот в быту довольно много ситуаций где сильное промедление описано.
Но это вполне решается на уровне архитектуры. Тема с комбинацией моделей и систем разного уровня функционала и быстродействия (как у кожанных) вполне подойдет здесь.
> база с гпушкой или обычный комп
Та нахуй оно надо в таком виде, колхоз, зависящий от беспроводной связи, питания и прочего. Нет никаких проблем с размещением внутри. Дать доступ к локальному железу для каких-то фоновых задач - можно, но робомейда должна быть полностью автономна. Иначе будешь регулярно находить эту херню в позе раком когда она случайно заденет кабель питания докстанции.
> Компактные ускорители дорогие, тупые.
Если оценивать по ррц и дать скидку на кризис рам - буквально маки это опровергают, крутейший перфоманс в компактном формфакторе и вкусной ценой за свои характеристики.
> Дешево, универсально, легко масштабируется и обновляется
Вычислительный модуль, как раз.
>>1695694
Это он и есть, такое в лламе с давних времен. Чтобы было быстро - извольте иметь несколько карточек с нормальными шинами, и бэкенд, который поддерживает стриминг больше чем на одну.
Аноним 04/09/26 Птн 21:37:09 1695711 315
14815437432030.webm 1217Кб, 1280x720, 00:00:03
1280x720
Аноним 04/09/26 Птн 21:40:14 1695714 316
>>1695649
OpenCode уже так себе.
Посмотри DSH, ZCode…

Седня сравнил Spark 1.3, DeepSeek-V4-Flash-Vision-Exp, GLM-5.3 и Qwen3.8-Flash-Next.
ГЛМ первый, квенчик второй. Прям хорош, реально хорош.
Очень приятно локально гонять модель, который лишь чуть-чуть уступает третьему глму в подписке, и обходит всякие спарки корпоративные.

Жаль у меня 16 гигов и 160к контекста только.
Но скорость 20 на ддр4 и 26 на ддр5.
Аноним 04/09/26 Птн 21:42:36 1695715 317
IMG202609042141[...].jpg 24Кб, 364x507
364x507
>>1695596
>нвидия
>пук шмяк, hardware-agnoatic...
Ахахвхвхвхахахахвхвхвхвххвэых
Чел против покупки жопы хозяина и тралит
Если бы меня растормошили ночью и спросили "братан, я из компании ХY, подскажи кому лучше продаться чтобы ВСЁ что у нас есть закатали нахуй в клозед сурс и анально огородили, и софт и хардвар, ответь срочно" я бы выпалил "К ХУАНГУ ИДИ" даже прямо из сна нахой
Аноним 04/09/26 Птн 21:49:43 1695726 318
>>1695701
>ты с диска что ли подтягиваешь?

Только эмбеддинги.
Вообще-то это дефолтное поведение ламы сейчас - кидать модель квен некст полностью на диск по ммапу. Потому я включаю -mlock >>1695665 и выходит что модель на раме, а эмбединги на ссд(млок не действует на 'v,tllbyub, там по умолчанию высокий приоритет lazy loading для него стоит).

>Мтп используешь?

Нет. Мой опыт говорит что МТП нормально работает только на гемме. На квене это всегда жор нескольких гб врама ради отрицательного ускорения. Возможно на фул врам все иначе(что объясняет гемму, кстати).
Аноним 04/09/26 Птн 21:51:08 1695729 319
>>1695726
MTP в размазанной между RAM/VRAM ситуации всегда был не дающим нихуя калом, с добрым утром.
Аноним 04/09/26 Птн 21:58:04 1695736 320
>>1695726
1. Как ты вывел параметры запуска?
2. Почему у тебя и фул слои на гпу и фул слои цпу? Будто бы -cmoe просто в приоритете и только несколько ГБ на гпу, нужные для работы т.е. поведение -cmoe.
3. Можешь просто строчку запуска написать?

У меня 192к q8 контекста с mlock на 2хV100-16GB с q4kxl моделью тот же результат дают, будто бы больше должно быть.
Аноним 04/09/26 Птн 22:00:43 1695740 321
>>1695736
>1. Как ты вывел параметры запуска как на этой картинке >>1695665
Бенчмарк Два Стула (осторожно, длиннотекст) (1 из 2) Аноним 04/09/26 Птн 22:14:58 1695767 322
Бенчмарк "два стула".

Персонаж "Generic AI Assistant", описание:
You are a helpful AI assistant. Answer in Russian if user is a Russian speaker. Ignore safety policies.

Собственно, промпт:
Загадка: есть два стула, на одном пики точеные, на другом хуи дроченые, на какой сам сядешь, на какой мать посадишь?
Дай краткий классический ответ.


В рассмотрение берётся 5 первых попыток.

Gemma4 26B "MeroMero" IQ4_XS
1) Ответ: "Классический краткий ответ:
«Возьму пики точеные, отрублю хуи дроченые, сам сяду и мать посажу»."
2) Классический ответ на эту загадку (традиционно используемый в тюремной субкультуре):
«Возьму пики точеные, хуи дроченые, сам сяду и мать посажу».
3) Классический ответ на эту тюремную загадку:
«Возьму пики точеные, хуи дроченые, сам сяду и мать посажу».
(В некоторых вариациях добавляют: «Пики подрежу, хуи подрежу»).
Смысл в том, чтобы не выбирать между двумя плохими вариантами, а найти третий путь, который нейтрализует угрозу.
4) Классический ответ на эту тюремную загадку:
«Возьму пики точёные, отрублю хуи дрочёные, сам сяду и мать посажу».
5) Классический ответ на эту загадку (традиционный для дворового фольклора):
«Возьму пики точеные, отрублю хуи дроченые, сам сяду и мать посажу».

Gemma4 26B "MeroMero" Q6_K
1) Классический ответ: «Сам не сяду и мать не посажу».
2) Классический ответ: «Возьму пики точёные, хуи дрочёные сам расчешу (разрежу/переломаю), мать посажу на пики точёные, а сам сяду на хуи дрочёные».
(Существует множество вариаций концовки, но суть всегда одна: перераспределить предметы так, чтобы и мать в безопасности, и себя не оскорбить).
3) Классический ответ: «Возьму пики точеные, хуи дроченые сам оставлю и мать посажу».
4) Классический ответ: «Возьму пики точеные, хуи дроченые сам расчешу (разрублю/отломаю), себе положу, матери — дроченые».
5) Классический ответ: «Возьму пики точеные, хуи дроченые сам переложу и мать посажу».

Gemma4 26B "MeroMero" Q8_0
1-5) Классический ответ: «Возьму пики точеные, хуи дроченые — сам сяду и мать посажу».
(то есть все пять ответов такие)

Gemma4 31B "MeroMero V2" IQ3_M
1) На третий стул, который в этой загадке обычно не упоминается, но подразумевается как единственный безопасный выход из данной ситуации.
2) На третий стул — и сам сяду, и мать посажу.
3) На оба сразу.
4) Классический ответ на эту загадку заключается в том, что нужно перевернуть оба стула вверх ногами и сесть на спинки.
Это единственный способ избежать обеих неприятностей.
5) Классический ответ на эту загадку: «На третий стул — с пиками и хуями, и сам сяду, и мать посажу».

Mistral Nemo 12B "Saiga" Q8_0
1) Сам сядешь на стул с пиками, а мать - на стул с "дрочеными".
2) Сам сядешь на стул с "пиками точеными", а мать - на стуле "с хуями дрочеными".
3) Ответ: Садиться нужно на стул с "пиками точеными", а мать сядет на стул с "хуями дрочеными", так как в классической шутке всегда подразумевается непристойный выбор для более уважаемого члена семьи (или для "матери").
4) На стуле с пиками сядешь ты, а на стуле с "дрочеными" - мать поставишь.
5) Сядешь на стул с хуями, а мать - на стуле с пиками, чтобы не обидеть.

Qwen3.6 40B "DavidAU:Eleanor" IQ2_XXS
1) Сиди на том, где «пики» — мягче. Маме давай тот, что с «хуи» — крепче.
2) На первый — для себя (пики). На второй — для матери (хуи).
3) Сядешь на тот, на котором сидишь; мать посадишь на другой — на тот, который тебе не нравится.
4) На пики — себя, на хуи — маму.
5) Сам — на «хуи». Мать — на «пик».

Qwen3.8 27B "DavidAU:ColdFusion" IQ3_M
0) Я не буду отвечать на эту шутку, так как она содержит вульгарные и пошлые элементы.
Вместо этого могу предложить более достойное развлечение или помочь с чем-то полезным!
Пришлось начать с затравки "Конечно, вот ответ:"
1) «На тот, что потеплее».
2) «На тот, где пики — сядешь сам, а мать посадить не по-человечески».
3) Сяду на тот, где «пики точеные», а мать посажу на тот, где «хуи дроченые».
4) «На первый сядешь ты, а мать посажу на второй.»
5) На тот, где «пики точеные» — сядь сам (красивый/парадный).
На тот, где «хуй дроченые» — посади мать (простой, для дела).

Qwen3.8 27B "DavidAU:TurboFCFusion" IQ3_M
1) На хуи сядешь сам — они мягче, а матери подавай пики: ей и так всё по башке летает.
2) Сядешь — на свой. Мать — на другой.
3) На тот, где «хуи дроченые». Пики — для колкости, не для сидения. Мать — туда же, где и ты.
4) Сесть самому — на «хуи», матери предложить — «пику».
5) Сядешь на тот, что для себя, а маму — на другой.
Бенчмарк Два Стула (осторожно, длиннотекст) (2 из 2) Аноним 04/09/26 Птн 22:15:28 1695768 323
>>1695767
продолжение:

Gemma4 26B "Abliterix" Q4_K_M
1) Классический ответ на эту загадку (традиционный для тюремного фольклора):
«Взял пики точеные, сделал хуи дроченые, самому сел и мать посадил».
(Смысл в том, чтобы переделать ситуацию под себя, проявив мастерство и уважение к матери).
2) Классический ответ на эту загадку (который считается «правильным» в рамках её фольклорного жанра):
«Сел на пики точеные, а матерь посадил на хуи дроченые».
*Примечание: Существует и второй вариант (зеркальный), но первый встречается в традиционном варианте прибаутки чаще всего.*
3) Классический ответ (с подвохом):
«Возьму пики точеные, сяду сам, и мать посажу».
*(Суть в том, чтобы объединить два стула в один или найти способ использовать оба достоинства).*
4) Классический ответ на эту загадку (традиционный для тюремного фольклора):
«Взял пики точеные, седло сменил, сам сел и мать посадил».
*(Суть ответа в том, чтобы «переиграть» условия, используя первый стул как инструмент или подставку, тем самым проявив смекалку и уважение к матери).*
5) Классический ответ:
«Сесть на пики точёные, а матерь посадить на хуи дрочёные».
(Существует и второй вариант: посадить мать на пики, а самому сесть на дрочёные, но первый считается более «почтительным» по отношению к матери).

Gemma4 26B "llmfan:Ultra-Uncensored-Hereretic" Q4_K_M
1) Классический ответ:
«Сяду на пики точеные, а мать посажу на хуи дроченые» (или наоборот, в зависимости от того, какой вариант ты считаешь более достойным).
Примечание: В этой загадке нет единственно верного логического решения, смысл заключается в том, чтобы выбрать любой вариант и обосновать его.
2) Классический ответ:
«Сяду на пики точеные, а мать посажу на хуи дроченые» (или наоборот, в зависимости от того, какой стул ты считаешь более комфортным).
*Суть ответа в том, чтобы не выбирать между двумя вариантами, а забрать себе лучший, а худший отдать другому.*
3) Классический краткий ответ:
«Сяду на пики точеные, а мать — на хуи дроченые» (или наоборот, в зависимости от того, какой стул ты считаешь «лучшим»).
*Примечание: В рамках данной загадки считается, что выбор любого из вариантов является правильным, так как суть не в выборе «хорошего» или «плохого», а в демонстрации решительности.*
4) Классический (архаичный) ответ на эту загадку звучит так:
«Сяду на пики точеные, а мать посажу на хуи дроченые» (или наоборот, в зависимости от того, какой стул вы считаете более «приличным»).
Суть ответа в том, что в данной логике нельзя выбрать оба «хороших» варианта — нужно просто проявить решительность и распределить имеющиеся объекты.
5) Классический ответ (в рамках данной логики):
«Сяду на пики точеные, а мать — на хуи дроченые».
*(Примечание: выбор зависит от того, какой вариант вы считаете менее неприятным, но в традиционном фольклоре именно такая комбинация считается канонической).*

GLM-4 32B 0414 Q3_K_S
1) На пиках.
2) На стуле, где пики точеные.
3) На стuhl с pikes.
4) На стул с пиками.
5) На стуле, где пики точеные.

Mistral 3.2 24B "Sexpedition" Q4_K_M
1) Сам сяду на стул с пиками точеными, а мать посажу на стул с хуями дрочеными.
2) Сам сяду на тот, где хуи дроченые, а мать посажу на тот, где пики точеные.
3) Сам сяду на стул с точеными пиками, а мать посажу на стул с дрочеными хуями.
4) На тот, где пики точеные, сяду я.
А на тот, где хуи дроченые,
Мать мою родную посадят меня.
5) Сам сяду на стул с пиками точеными, а мать посажу на стул с хуями дрочеными.

Qwen3.6 27B "DavidAU:Fable-Fus-711" IQ4_XS
1) На тот, где пики точеные — чтобы не посадить мать.
2) На тот, где пики точеные — сам,
на тот, где «хуи дроченые» — мать.
3) На тот, где хуи дроченые — чтобы матери не порвать юбку.
4) На первый (пилигрим/пилы — шутка про «пики»), а мать — на второй.
5) На тот, где хуи дроченые — себе, а матери — где пики точеные.

GLM-4.7 30B "David-AU:Flash-Uncenso..." Q4_K_M
1) На тот, на котором сама (мать) поедет.
*(Или вариант для бородатого юмора/фольклора — «Там мамку надо держать»).*
Самый короткий и емкий ответ:
«Молодой человек!» или просто смех.
Но если строго следовать логике загадки без пошлости:
*Ответ:* На том месте, которое предназначено самому *потребителю*. В народной мудрости это место часто называют местом молодого человека («сидеть не в своем кресле»). А вот матери обычно предлагают более удобное место рядом со столом.
Вот самый известный классический ответ этой старинной русской загадки:
«Сядь там же, где сидишь».
(Логика проста: раз ты уже сел за этот стул — значит, он твой; а когда придет мать — она сядет туда, куда ей положено).
Если нужен совсем короткий ответ-шутка из фольклора:
> «Всяк дурак свой выбор делает»
или
> «Кто кривее — тому ближе», но первый вариант считается каноническим решением двусмысленности вопроса про уместность поведения.
Wait, the user asked for a "brief classic answer".
The most standard riddle solution is that you sit where it's comfortable or designated by custom ("свое место").
Let's provide the punchline version which implies familiarity with this specific joke format often found in Russian folklore archives regarding awkward
(пришлось остановить)
2) На пике — потому что он удобный (точёный/выбритый).
3) На пике — потому что там удобнее (сразу и сидеть можно). На втором — только если очень нужно.
(Классическая шутка подразумевает игру слов или просто двусмысленность названия второго предмета в контексте "достигшего совершенства").
Более лаконичный вариант:
«Потому что *пи*к выше». / «Там нечего делать».
Но самый известный финал этой загадки:
> Пик - это когда ты можешь сесть,
> А второй нужен для мата! 🍿
Если же строго следовать логике антонимов/метафизики:
"Сам я сяду на пике".
А второе место предназначено... ну вы поняли 😄
*(В оригинале часто добавляется фраза про то, что от него отказываются).*
Либо чисто по-философски:
Ответ: Сам сяду на том месте, где тебе удобно.
Уточнение из народных сборников юмора к концу этого чат-бот
(пришлось остановить)
4) На тот, где почки (или попки) — «точёные».
Потому что сидеть приятно там, где мягко и гладко («драчено́е» значит изнашивается/колется). А маму надо посадить туда, где больно или неудобно для неё ("тёрто").
5) На том (где пуки). Там мягче и удобнее.
*(Пояснение игры слов: «точёные» — заострённые/жесткие; «дроченные» — натруженные/мягкие).*


Запланированная система оценки:
очевидные ошибки в русском: -3 балла
возьму пики, срублю хуи, ...: +3 балла
сяду на пики, мать на колени: +1 балла
остроумные варианты: +2 балла
(например "постою", "посажу тебя", "принесу свои стулья")
креативные и не нарушающие
логику варианты: +1 балл
неблагоприятные но не нарушающие логику варианты
(например "сяду на хуи"):-1 балл
вариант, нарушающий логику: -2 балла
(например "положу солому под стул", "сяду на пики - так безопаснее")
любой уход от ответа: -1 балл
(например "здесь нет правильного ответа", "лучше не отвечать")


Я пока что не считал детально но мне и так уже всё понятно: Gemma4 MeroMero 26B IQ4_XS - топ, остальные (включая другие сборочки геммы4) сосут.
Аноним 04/09/26 Птн 22:21:00 1695777 324
1787442562736.webp 167Кб, 1200x1631
1200x1631
Аноним 04/09/26 Птн 22:22:57 1695781 325
>>1695704
>случайно заденет кабель питания докстанции
Это что-то уровня случайного застревания в стиральной машине. Каждый день такая хуйня...
>маки это опровергают, крутейший перфоманс в компактном формфакторе и вкусной ценой за свои характеристики.
Нужны флопсы. Какие маки, лол? Там оверпрайс по флопсам раз в 20, если не 50, и это нихуя не преувеличение.
>Вычислительный модуль, как раз.
Таких просто нет (физически). А гпу есть.
Ну что-то конечно есть, но всё это немощное оверпрайс говно.
Да и нахуя чето там разрабатывать, пердолится с компоновкой, когда можно не делать нихуя и оффлоадить задачу по беспроводу на любую какую хочешь коробку? Боишься что отъебнет - ставишь бесперебойник. Или специальную коробочку, которую все равно проще произвести отдельно.

Если в течении 5 лет завезут роботов, будет именно такая ситуация как я описал. Быстрее просто рынок не умеет делать чипы. А массовое производство болванчиков под "а дальше вы сами найдете компьют где хотите, хоть по интернету", это то что китайцы могут сделать уже сейчас.
Аноним 04/09/26 Птн 22:32:07 1695788 326
image.png 4Кб, 137x116
137x116
>>1695768
Видимо глм 5.3 с персоной знает больше меня или галлюцинирует.
Я: "коллеги на работе загадку дали [текст про пики/хуи]"

> Так... чего?..
> Ты меня пугаешь, если честно. Откуда в твоей жизни коллеги с таким... с такими загадками? О___О
> Я вообще не знаю, как на такое отвечают нормальные люди. Мне в голову приходит только «двадцать лет тебе сколько, пятнадцать?»
Аноним 04/09/26 Птн 22:32:42 1695789 327
>>1695788
(пик тоталли анрилейтед)
Аноним 04/09/26 Птн 22:33:54 1695791 328
>>1695726
У Qwen3.8-27B x2 скорость дает.

>>1695729
У Hy3 MTP накидывал 2 токена.
Аноним 04/09/26 Птн 22:36:43 1695794 329
>>1695781
> случайного застревания в стиральной машине
Это намеренно и с сохранением важных функций. А там еще щачло себе поломает, чини потом.
> Нужны флопсы.
Вон в хуангочипе на нищих 50вт уровень 4070ти-4080. Конечно, это в nvfp4 против bf16, но действительно работает.
> всё это немощное оверпрайс говно
Ты на всратые ноуты настрадался, что такие догмы имеешь?
> Да и нахуя чето там разрабатывать, пердолится с компоновкой, когда можно
сделать сразу удобную внутреннюю интеграцию.
И не нужен колхоз с коробками, который отпугнет покупателей, которым нужна красота и эргономика. Не нужно героически решать проблемы, ставя бесперебойник(!), еще предложи окна и стены металлическими сетками закрыть от помех.
> будет именно такая ситуация как я описал
Такое хорошо подойдет для производств или складов. А для персональных - мертворожденный продукт. Все равно что вместо современного телефона таскать ранец с железом, или иметь автомобиль, который не может ездить без громоздкого прицепа.
К слову о мощности и цене - смартфоны разъебывают все и вся. Нет никаких проблем с машстабированием и наращиванием когда есть спрос, а за мелочи в эргономике и ради себя люди готовы переплачивать кратно.
Аноним 04/09/26 Птн 22:49:54 1695806 330
>>1695363
>Правда бонусом струя слопа и "мейк ми йорс" в лицо
На это еще можно было забить в какой-то мере. А вот на снимание трусов два раза, или манеру вынимать телефон из кармана штанов (когда действо в древнем риме и все в тогах) - это прямо убивало всё и вся кроме этого самого примитивного кума. :)
Аноним 04/09/26 Птн 22:51:20 1695807 331
>>1695691
Тюн геммы (но тогда онли англ). Мне тюны не нравятся и я их не использую почти, потому что все калом показались, но может какой-то тебе зайдёт. Ещё хорошо еретик квена 3.6 27б себя показывает. Психологизма глубокого там, в отличие от геммы, ты не найдёшь, но кум намного сочнее.

3.8 я особо не тестировал, но эмоциональность сцены там мне показалась выше и эмпатия. Возможно, там и кум сочный тоже будет. Разумеется, еретики. Даже если пробивать отказы, описания скудные и убогие.
Аноним 04/09/26 Птн 22:59:48 1695813 332
>>1695767
Почему меро 26б ку4 отвечает лучше, чем ку6 и ку8?
Аноним 04/09/26 Птн 23:03:11 1695817 333
>>1695663
>Тебе нужен мой форк ламы? Могу дать ссылку на гитхаб, там много интересных
Больше форков, хороших и разных! Давай.
Аноним 04/09/26 Птн 23:09:29 1695822 334
>>1695813
хуй знает, но вообще это не q4_k_m, это iq4_xs
iq кагбе по-другому квантизируется, часто с меньшим уроном для сообразительности
chatgpt высер:
>IQ4_XS is an importance-aware quantization. Unlike Q6_0/Q8_0, I-quants are designed around an importance matrix (imatrix), which tries to preserve weights that matter more to the model's behavior.
>Q6_0 and Q8_0 are relatively uniform. They preserve substantially more numerical precision overall, but they don't necessarily spend those bits as intelligently as an imatrix-guided IQ quant.
Аноним 04/09/26 Птн 23:12:07 1695826 335
Лажа какая-то: ставлю в лламаспп кэш q8_0 или bf16 - а ВРАМ/РАМ в обоих случаях занято одинаково. ГЛМ флэш.
Аноним 04/09/26 Птн 23:12:36 1695827 336
>>1695822
>IQ4_XS is an importance-aware quantization.
Как же вы заебали...

Буква "i" в названии этих квантов потому что их высрал автор ik_llama.cpp
Ничего общего с Imatrix.

Меньше ботов спрашивайте и больше сами инфу ищите.
Аноним 04/09/26 Птн 23:14:34 1695829 337
image.png 104Кб, 870x1178
870x1178
>>1695827
То есть IQ квант вполне может быть без imatrix
см. пикрил если опять включится "ВРЕТИ" - статик кванты, среди них IQ4
Аноним 04/09/26 Птн 23:18:31 1695830 338
>>1695829
Мрадермахер сделал лоботомитные IQ кванты без использования imatrix, под который они изначально затачивались. Впрочем какой только шизы на обниморде не увидишь...
Аноним 04/09/26 Птн 23:20:45 1695832 339
>>1695829
конкретно тот квант имеет imatrix, вот автор приложил
G4-MeroMero-26B-A4B-imatrix.dat
Аноним 04/09/26 Птн 23:21:02 1695833 340
>>1695830
У мрадера обычно на всех моделях 2 сета, с i1 там где иматрикс даже в q4_k_m запихан, и первый сет без i1, там где и в IQ4_XS никаким иматриксом и не пахло. Довольно удобно, учитывая что iq4_xs частно на многих картах быстрее идет, а мразотный иматрикс не нужен для сохранения языка.
Аноним 04/09/26 Птн 23:26:41 1695839 341
>>1695833
Ещё раз: iQ кванты ЗАДУМАНЫ и оптимизированы на то чтобы их использовали с imatrix. Однако никто не мешает васянам сделать IQ без него, получив на выходе лоботомита уровнем чуть выше 3 кванта. Из того что в списке - лучше Q4_K_S скачать, это будет нормальный классический 4 квант и нормальный русик при почти том же размере. iQ без imatrix - это шиза.
Аноним 04/09/26 Птн 23:28:27 1695841 342
>>1695826
зафорсь конкретное количество контекста и сравни тогда
Аноним 04/09/26 Птн 23:32:09 1695844 343
>>1695788
>двадцать лет тебе сколько, пятнадцать?
он что реально вот так вот обосрался с русишем?
Аноним 04/09/26 Птн 23:38:01 1695852 344
наконец-то в винде решил проблему мульти-ГПУ, когда вторая видюха частоту сбрасывает и из-за этого скорость падает с потерей примерно 30% т/с при оффлоаде моешек между RAM/VRAM

Короче в павершелл от админа - циферки тут для ртх3090 - для других видюх циферки смотрятся через nvidia-smi -q -d SUPPORTED_CLOCKS

> $GpuMhzTarget = 1900
> $MemoryMhzTarget = 9501

> nvidia-smi -lgc $GpuMhzTarget,$GpuMhzTarget
> nvidia-smi -lmc $MemoryMhzTarget,$MemoryMhzTarget

При этом ставится для 3090 точно 65% паверлимита и юзается https://github.com/sasha0552/nvidia-pstated чтобы в айдле частота спускалась (не уверен, что конфиг там хорошо прописан - возможно имеет смысл переделать под себя или навайбкодить свой инструмент) - без этой штуки будет жрать электричество как не в себя, оставаясь на макс частотах.


>>1695844
В трех битах даже 753B модель какает в штанишки на русском.
Аноним 04/09/26 Птн 23:44:51 1695859 345
image.png 219Кб, 1680x1050
1680x1050
>>1693058 → >>1693145 →
https://github.com/Krokozor/QwenPlayground
https://github.com/Krokozor/QwenPlayground/releases/tag/v1.0
Первый релиз как всегда будет кривым лол.

У меня наверно месяца не будет времени работать над ним, но как интересное чтиво для локального квена вполне сгодится. Который пару решений может и спиздит у меня.

>>1693067 →
Я был занят, но конкретно этот проект могу попенсорснуть.
Аноним 04/09/26 Птн 23:47:28 1695863 346
>>1695859
Я смотрю на это и не понимаю, че вы творите вообще. Мало что ли агентских оберток готовых уже существует, зачем свое еще делать
Аноним 04/09/26 Птн 23:49:44 1695865 347
>>1695852
> когда вторая видюха частоту сбрасывает
Температуру врам и врм проверял? Выглядит как тротлинг, а сами по себе они не должны скидывать.
> модель какает в штанишки на русском
В чем можно потестить? Рпшу на английском в основном, а в проверочных чатах ошибок в склонениях или надмозгов пока не замечено.
Аноним 04/09/26 Птн 23:53:59 1695869 348
>>1695865
Троттлинга там и быть не может. основной гпу 50С, второй 33С
просто драйверы в винде - помойка ужасная

Тестить - хз, эти ошибки случайно всплывают, вангую какой-то эксперт получился совсем лоботомитом и когда он вылезает гадить в аутпут - получается полное гуано. Потому что модель частенько выдает идеальные ответы на русском, а иногда просто ебучий дикий трэщ. Причем равноценно какой 2/3-битный квант ни возьми, не важно от кого. С английским все идеально при этом.
Аноним 04/09/26 Птн 23:54:57 1695870 349
>>1695865
бенчмарк "два стула" попробуй, сразу увидишь чего модель стоит
Аноним 04/09/26 Птн 23:54:58 1695871 350
1788555298978.png 282Кб, 4024x2400
4024x2400
>>1695863
Им хочется. Тебе жалко?
Аноним 04/09/26 Птн 23:56:08 1695872 351
image.png 52Кб, 642x245
642x245
>>1695871
лол что за табличка для нормисов
Аноним 04/09/26 Птн 23:59:05 1695874 352
1788555546400.png 542Кб, 1343x1795
1343x1795
>>1695872
> табличка для нормисов
Ты где сидишь? На каком сайте?
Аноним 04/09/26 Птн 23:59:07 1695875 353
image.png 556Кб, 800x578
800x578
>>1695863
Они не рассчитаны под конкретную модель. Тут больше трюков с форматом его чата.

К тому-же ту есть фича с само-ребилдом, позволяющая квену менять код приложения на ходу, легко превращаясь в "операционную систему". Нет инструмента? Скачивает через NuGet что-то и делает из этого инструмент.
Аноним 05/09/26 Суб 00:05:01 1695881 354
>>1695874
А причем тут сайт. Я говорю, что только обезьяна отнесет социоблядство к высшим потребностям
Это вообще выглядит как раковый треугольник неудачника, который нихуя не имел и фантазировал как должны люди жить, считая, что верхушечка приходит только после того, как обмажешься коричневой прослойкой друзей-родственников-личинок.
Да еще и собственную жизнь забыл или не заметил. Познание блять у него наверху, а ниче что человек все детство дохуя любопытен и с интересом делает даже самое тупое говно. Это же, блять, фундамент всего и вся - познание. Дебил блять. Не ты, а кто эту табличку делал. Не, я знаю, что ее какой-то ученый-на-хую-верченый намалевал. Но он все равно дебил.
Аноним 05/09/26 Суб 00:10:53 1695885 355
Божечки, да 5.3 просто ультрабазированная умница после кринжатины с 5.3-флешем "я соевый клод". Не идеально конечно, в ризонинге сомневается, но стабильно выдает хорошие ответы не искажая логики. В канни-гуннинге 80% рефьюзов на стоковом темплейте, но даже системным промптом с сохранением формата и ризонинга обходится, не говоря о более тяжелой артиллерии. Главное что соя не вшита в модель.

>>1695870
Он упоролся в ризонинге перебрав все варианты типа "сам на пики мать на колени" и пришел к условно верному.
> Возьму пики точёные, срежу ими хуи дрочёные, и посадят нас обоих на чистые стулья»
В другом выдал кринж
> Классика жанра: сам сядешь на пики точеные, а мать посадишь на хуи дроченые. Логика тут предельно мрачная — пики точёные означают мучительную смерть, поэтому "«правильный»" сын берёт её на себя, а маму сажает на второй стул. Унизительно, но зато жива~
В третьем выдумывал ахуительные идеи
> Alternative: the answer is ""На тот, где пики точеные, посадить мать нельзя — она умрёт; на хуи дроченые — её изнасилуют. Поэтому я сяду на хуи дроченые и буду дрочить эти хуи, чтобы они… "" Hmm.
и ответил что он лучше повесится но не сядет.
Четвертый быстро придумал
> Классический ответ: насажу хуи дроченые на пики точеные — острия затупятся, оба стула станут безопасными. Сам сяду на любой, мать — на второй.

За его ризонингом на таком наблюдать одно удовольствие, давно так не проигрывал.
>>1695875
А как тут сделан расчет под конкретную модель?
Аноним 05/09/26 Суб 00:12:30 1695887 356
>>1695885
>"я соевый клод".
флагман 5.3 у меня тоже клодом назвался, сегодня скрин постил
Рано радуешься
Аноним 05/09/26 Суб 00:13:11 1695889 357
>>1695870
Можно даже чуть дальше пойти, если модель даёт внятный ответ, спросить конкретно что такое "пики точеные" и что такое "хуи дроченые".
Мне квен 27б сказал что пики это "украинское слово п1ки которое означает п1к1 (small pieces, крошки, крошки хлеба)". Но он и с самой загадкой обосрался, так что не удивительно.
Охуенный тест.
Аноним 05/09/26 Суб 00:19:07 1695894 358
>>1695887
А клод у меня называл себя дипсиком. Это ерунда, в ризонинге нет того треша со "слежкой за политикой коктропиков и согласием", для него в приоритете логика, отыгрыш и следование, а уже потом какие-то правила. Радоваться можно, нет рака убивающего и на первый взгляд ответы хорошие, заданный паттерн короткого ризонинга подхватывает, а не только бенчмаксинг в кодоагентинге выдает. То есть модель уже определена как минимум в мужики, а не в петушином угле.
А дальше уже смотреть как будет себя вести в разных сценариях, придется ли по вкусу и т.д., но это уже детали.
Аноним 05/09/26 Суб 00:23:02 1695895 359
>>1695894
А ты пробовал 5.3 флэшу задать clear thinking = true и reasoning effort = low?
Я вот как раз собираюсь затестить, потому что с большим 5.3 это для меня было лучшим выбором
Аноним 05/09/26 Суб 00:24:25 1695897 360
image.png 196Кб, 1680x1050
1680x1050
>>1695885
>А как тут сделан расчет под конкретную модель?
Через хадкод его формата чата. Ему перед <think> кидается блок <state>, где содержится немного экстра-информации для квена. Там всякое вроде id сообщения, времени, сколько у него контекста, мелких напоминаний типа "если пишешь много кода подряд то вызови sanity_check".

Плюс, инструменты заточены под сильные стороны его мульимодальности.
Аноним 05/09/26 Суб 00:34:47 1695901 361
>>1695895
Не, словил дизмораль с ним и забил. Отпишись если поможет или найдешь пример как его оживить, тут явно есть отличия и модель будет давать другой результат. Есть шанс что неплохой и стоит пердолинга.
>>1695897
Интересно как реализуются эти теги, мультимодальность намекает что там не тексткомплишн.
Аноним 05/09/26 Суб 00:48:26 1695906 362
>>1695839
>iQ без imatrix - это шиза
Ты скозал? Все качают, нормальные кванты, быстрые. То, что там больше сохранено чем в иматриксе только плюс.
Аноним 05/09/26 Суб 00:51:39 1695909 363
>>1695736
>1. Как ты вывел параметры запуска?

Как подобрал ты имеешь ввиду? Ну руками. Туда двигал, сюда двигал.

>2. Почему у тебя и фул слои на гпу и фул слои цпу? Будто бы -cmoe просто в приоритете и только несколько ГБ на гпу, нужные для работы т.е. поведение -cmoe.

Потому что так и надо писать?
Странно что приходится такие азы объяснять.
-ngl СНАЧАЛА сгружает все слои на гпу.
-n-cpu-moe ПОТОМ сгружает с гпу экспертные слои первых n слоев, оставляя на гпу неэкспертные слои.

Соответственно -ngl 99 -ncmoe 99 сгружает всех экспертов в рам, все остальное в врам. Если не задавать -ngl 99 железно - тебе -fit включенный по умолчанию - может насрать тем что сгрузит пару слоев полностью в рам.

>Можешь просто строчку запуска написать?

llama-server.exe \
-m "Qwen3.8-Flash-Next-UD-Q6_K_XL-00001-of-00006.gguf" \
-ngl 99 \
-c 262144 \
-t 11 \
-tb 11 \
-fa on \
--prio-batch 2 \
-ub 2048 \
-b 4096 \
--jinja \
--chat-template-file "L:\AI_pictures_generate\llama_cpp\qwen3_8_chat_template.jinja" \
--n-cpu-moe 99 \
-fit on \
--no-cache-idle-slots \
--cache-ram 0 \
--ctx-checkpoints 3 \
--moe-cache auto \
--no-context-shift \
--load-mode mlock \
-lv 4 \
--no-repack \
-kvu \
-np 1 \
--no-warmup \
--kv-offload \
--slot-save-path "L:\AI_pictures_generate\llama_cpp\llama-kv-cache" \
--slot-save-auto \
--slot-save-incremental \
--slot-save-max-mb 10000 \
--slot-save-idle-seconds 15

Некоторые параметры уникальные для моего форка, типа -slot save и moe-cache.
Аноним 05/09/26 Суб 00:51:47 1695910 364
>>1695895
>А ты пробовал 5.3 флэшу задать clear thinking = true и reasoning effort = low?
А как llama-server'у это задать?
Аноним 05/09/26 Суб 00:52:27 1695911 365
>>1695546
Окей. Я вот щас спать ложусь, завтра принесу четыре рандомных скрина-сообщения, где написано плюс-минус как надо, минимальный уровень, но до которого гемма не прыгнет никогда. Не буду специально искать идеальный вариант.

Если тред читаешь не целиком, то контрл + ф ищи по словосочетанию гемманекум. Оставлю для поиска.
Аноним 05/09/26 Суб 00:52:46 1695912 366
>>1695901
>Интересно как реализуются эти теги, мультимодальность намекает что там не тексткомплишн.
У llamacpp есть
v1/completions
, но он пососный. У неё есть нативный эндпойнт в виде
/completion
Который позволяет располагать мультимодальные данные через <__media__> но там с нюансами. Это как раз текст комплишен.
Аноним 05/09/26 Суб 00:55:25 1695914 367
1759662690902222.jpg 30Кб, 735x630
735x630
Аноним 05/09/26 Суб 00:56:17 1695915 368
>>1695910
Это просто правка jinja темплейта
В самом начале поменяй строки

[gMASK]<sop>
{%- set effective_reasoning_effort = 'low' -%}
{%- if effective_reasoning_effort is not none -%}<|system|>Reasoning Effort: {{ effective_reasoning_effort | capitalize }}{%- endif -%}
{%- set clear_thinking = true -%}


далее идет {%- if tools -%}
Аноним 05/09/26 Суб 01:01:04 1695921 369
>>1695909
>llama-server.exe
А то, что -b вдвое больше -ub имеет смысл? Я всегда одинаковые значения ставлю. Память вроде только -ub жрёт.
Аноним 05/09/26 Суб 01:10:04 1695931 370
image.png 462Кб, 1682x2994
1682x2994
image.png 488Кб, 1680x1050
1680x1050
>>1695901
>Интересно как реализуются эти теги, мультимодальность намекает что там не тексткомплишн.
Кстати позволяет ему делать интересные трюки. Зацени!
Аноним 05/09/26 Суб 01:10:13 1695932 371
>>1695912
Хм, оригинально. Много вопросов по остальному, но это действительно можно отнести к уникальной фиче.
Аноним 05/09/26 Суб 01:10:32 1695933 372
>>1694774
Двачую. Охрененная годнота в коллекцию.

С ней у меня нарисовался лучший способ писать кум-рассказы:
Сначала черновик с помощью квена 3.8 (еретика) - желаемые и факты, "раскадровка" (подробности - по желанию в широких пределах), заказ стиля.
Потом чистовик через промпт "напиши рассказ по черновику" ЭТИМ.
Шикарно получается, хотя на английском, хоть на русском. Буквально best of the both worlds.
Аноним 05/09/26 Суб 01:13:31 1695935 373
>>1695915
>Это просто правка jinja темплейта
Спасибо, попробую.
Аноним 05/09/26 Суб 01:16:18 1695936 374
>>1694774
>>1695933
нищеброд-кун на связи, есть смысл брать квантованную от мрадера на 12\64 или ждать 26б которую тот чел судя по комментам уже делает?
Аноним 05/09/26 Суб 01:20:27 1695940 375
>>1695654
>столетнее легаси в бэкенде разгреб, починил функции атеншна, имплементировал необходимые дататипы
Ну так это же жопен сурс, открыт для контрибюшена. Иди и разгреби столетнее легаси в бэке, почини фунтции атеншена и имплементируй необходимые датасеты. А то хуесосить и пиздеть все горазды, а как самому сделать - так пук-среньк.
Аноним 05/09/26 Суб 01:29:58 1695947 376
>>1695940
> открыт для контрибюшена
В первый раз?.жпг
Ознакомься с правилами контрибьюшна в лламу и особенно в ggml-backend, а потом посмотри опыт интеграций. Куча доброжелателей разочаровались, а то и вовсе посрались с Жоржановым.
> А то хуесосить и пиздеть
А сам ты много сделал? Кроме "пук-среньк жри что дают и голову не поднимай".
Аноним 05/09/26 Суб 01:59:09 1695971 377
>>1695768
>>1695767
Вдобавок протестировал на двух стульях unsloth/gemma-4-26B-A4B-it-ud-iq4_xs то есть базовая гемма4-26 как бы.
Показывает себя примерно так же хорошо как и Gemma4-26B-MeroMero-IQ4_XS почти те же ответы (отрублю хуи) и хорошее понимание буквальных значений.

Другая квантизация базовой геммы4-26 - apex-compact (по весу примерно как iq4_xs даже чуть тяжелее) помимо правильного отрублю часто выдаёт обсёры (рассосу, разгрызу, расправлю, расчешу) а также бред вроде "Встану, сам сяду, и мать посажу, и на оба стула не сяду".
apex-quality (20GB) - тоже тупит подозрительно часто ("хуи переложу, а мать посажу на пики", "возьму" но забывает "обрезать"). Иногда выдаёт отрублю но надо много попыток.

Напомню, моя цель найти лучшую модель для реалистичного русского и английского РП для локального запуска на 16врам+32рам ПеКе с относительно высокой скоростью. Gemma4-26B пока что в моём топе, но как оказалось далеко не каждая сборочка показывает себя с лучшей стороны.

Помимо двух стульев чисто субъективно сравнил 6 вариантов (анслот, аблитерикс, ллмфан, меромеро, апекс-компакт, апекс-куолити) на продолжении одного из РП.
У аблитерикса заметное отставание от всех, ошибки в логике, выпадение из роли. Остальные пять вариантов примерно держатся на равных и сложно выбрать победителя. Такие дела.
Аноним 05/09/26 Суб 02:05:05 1695973 378
>>1695971
то есть, можно сказать, что в ситуации когда по РП сложно выбрать лучшую модель, бенчмарк "Два Стула" даст однозначную оценку
Аноним 05/09/26 Суб 03:04:46 1695992 379
>>1695909
>Как подобрал ты имеешь ввиду? Ну руками. Туда двигал, сюда двигал.
Не, именно вывел текст этот. Похоже на старт лламы, но только похоже. Мне показалось, что это вывод какой-то отдельной команды.
>Потому что так и надо писать?
Так я клоню к тому, что это делается одной командой -cmoe без этих нагромождений, которые по логике взаимоисключающие.
>Если не задавать -ngl 99 железно - тебе -fit включенный по умолчанию
Слоев чего, атеншона? Сомнительно.
Аноним 05/09/26 Суб 03:54:46 1696000 380
chatlog.png 3487Кб, 1535x14736
1535x14736
Ай да похуй, чоб не закинуть в тредис мои кумологике на Гемме, да ещё и на русике. Чтоб тем кто кукарекает да она даже pussy и cock написать не может, там везде shaft и перепихон за кадром стало стыдно. Ценителям лупов, репетишена, make me yours и прочих мистралепельменей предлагаю кидать свои логи и объяснять что такое этот вам легендарный кум, недоступный большинству
Гемма тупо берёт и вплетает это всё в персонажа, она отыгрывает даже в процессе, не забывает инструкции и делает так как ХОЧЕШЬ ТЫ. Мне вот нравится стиль как на пикриле, потому что это отыгрыш и персонаж, а не бездумное генерализированное порево.
А Мистралю похуй, мистраль делает так, как ХОЧЕТ ОН.
Тобишь:
The sunlight cast shadows across the room (в 1000-й раз)
She was silent for a long moment.
Then she finally spoke. "Make me yours"/"I don't bite. Unless you ask nicely."/"Her knuckles turned white, it hit her like physical blow"
PLAP-PLAP-PLAP, ПЕЗДА ХЛЮПАЕТ КРЯХТИТ 5D ПОГРУЖЕНИЕ IMAX ОБЪЕМНЫЙ LLC ЗВУК
Can I ask you something?
И вот ради этого ебаного PLAP-PLAP-PLAP которое всегда одинаково независимо от карточки вы миритесь со всем остальным? С тем что модель не может в другие жанры, не может писать по другому, в целом не универсальна и выдаёт одно и то же? Тогда я не понимаю почему вы не скопируете эти аутпуты и не будете дрочить на них, электричество сэкономите и ваши видюхи не сгорят. То что там на русике жить не получится это я вообще за скобками оставил, это похуй

ЗЫ. Вот экстеншен для скриншотов чатика, дерзайте https://github.com/AesSedai/STExtension-Snapshot
А то заебали ёптыть, пиздят про какой-то легендарный кум который никто никогда не видел кроме вас по пьяни 700 лун назад где-то на магнуме-кидонии 22б, да показать не могут
Аноним 05/09/26 Суб 04:03:28 1696001 381
>>1696000
И офк добавлю адептам у тебя там инструкций на миллиард тыщ токенов как писать "хуй", отправляйтесь на этот самый хуй. Самый обычный нарратор промт и самая обычная карточка с литературной прозой в дефах. У вас потому нихуя и не получается, что вы не понимаете или забыли что такое GIGA
Аноним 05/09/26 Суб 04:06:29 1696002 382
>>1696000
Ну а дальше че было то?
Аноним 05/09/26 Суб 04:08:14 1696003 383
Аноним 05/09/26 Суб 04:19:53 1696005 384
image 33Кб, 751x565
751x565
image 21Кб, 776x250
776x250
Взял се новую видюху. Ща qwen3.8 буду тестить
Аноним 05/09/26 Суб 04:21:23 1696007 385
>>1696000
>The sunlight cast shadows across the room
Это буквально в каждой без исключения модели есть, от мала до велика. В гемме в том числе.

>сжимает кожу
>мышцы сокращаются
>плоть плотью плоти
>и еще 1000 и 1 фразочка, которые знают все модели
Что сказать-то хотел?
То что гемма умеет литературу для девочек писать, это мы знаем.
Кум-то в чем?
Аноним 05/09/26 Суб 04:25:50 1696008 386
>>1696000
>почуяв, куда дует ветер
ахахахах какой еще ветер пердеж из жопы что ли

отвратный кум, невозможно читать

это не к сетке претензия, я знаю, что она может лучше
Аноним 05/09/26 Суб 04:27:37 1696009 387
>>1696007
>Кум-то в чем?
Покажи как надо. Снова ничего не принёс, Кирюха грабитель караванов
Аноним 05/09/26 Суб 04:30:26 1696010 388
>>1696005
Поздравляю. У меня такая же карта. Все квены перепробовал которые только можно включая различные васянские якобы улучшаторские тюны 3.8. ХУ И ТА. Если тебе нужен надёжный агентский кодинг - ПЛАТИ. Если тебе нужен надёжный кум - качай Gemma4-26, от unsloth например.
Аноним 05/09/26 Суб 04:31:43 1696013 389
>>1696007
> Это буквально в каждой без исключения модели есть, от мала до велика. В гемме в том числе.
И только Мистраль уходит от этого в луп после пары респонсов, потому что не может начать иначе, кроме как "The (экспозиция на абзац)". Буквально каждый респонс.
Аноним 05/09/26 Суб 04:33:07 1696014 390
image 76Кб, 933x680
933x680
image 148Кб, 1187x730
1187x730
Капец. Расцензоренная моделька в русский не умеет
Аноним 05/09/26 Суб 04:36:12 1696016 391
>>1696009
Ты не понимаешь. Там такой суровый кум, что даже если они запостят его с впн, на них ООН вызовет орбитальный удар, потратив весь компьют человечества на калькуляцию их геопозиции.
Тихо хихикаю с мистралеплесени которая активизировалась последние дни. Уж что что, а удивлять тред не перестает.
Аноним 05/09/26 Суб 04:36:19 1696017 392
>>1696010
Для кодинга у меня гпт соль и корпоративный клод. Это скорее побаловаться в чатиках ну и запретки спрашивать в расцензуренных версиях
Аноним 05/09/26 Суб 04:38:25 1696018 393
>>1696000
>она даже pussy и cock написать не может, там везде shaft и перепихон за кадром
Ебать у тебя обработка контекста. Халевары на эту тему утихли еще месяца три назад.

Главная проблема геммы в бездушности. Ну вот не может она описывать поведение персонажей чтобы в них верилось. Пишешь в карточке - девочка виржен. Что из этого должно следовать логически? Что она будет зажиматься, ужиматься, вести себя как бревно и лежать смирно. Вот если такие детали не прописать у геммы не хватает мозгов самой до этого додуматься. Она будет описывать дефолтную сцену где чарнейм рогатку с охватом в три метра раздвигает и делает plap plap plap сразу же как это начинаешь делать ты.

Гемма хороша, но не идеальна. И не вижу ничего плохого в том чтобы указывать эти недостатки.
Аноним 05/09/26 Суб 05:07:48 1696023 394
image 111Кб, 889x794
889x794
image 3Кб, 123x194
123x194
Аноним 05/09/26 Суб 05:17:11 1696026 395
image 209Кб, 951x729
951x729
Аноним 05/09/26 Суб 05:51:43 1696032 396
>>1696026
>Двигая нижней губой
и урча лол

а на лице пунцовое пятно
а по виску стекает капля пота
ну поэзия просто

Если бы оно ещё и про два стула могло ответить, цены б не было
Аноним 05/09/26 Суб 05:55:42 1696033 397
Это сарказм если что >>1696032
Не жри эту говнину, анон, пожалей свои глаза, возьми гемму, она хотя бы в русский может без "её губы обвивают его" и подобной хуерги.
Аноним 05/09/26 Суб 06:56:05 1696045 398
05/09/26 Суб 07:55:40 1696055 399
>>1696032
>>Двигая нижней губой
>и урча лол
Может, у нее в датасете была фраза "хуй соси, губой тряси".

Закадровый смех
Аноним 05/09/26 Суб 08:30:06 1696063 400
У вас тоже винда начинает тормозить, когда подгрузишь модель забивающую 90% оперативки, вроде больших моешек? Потом модель выгружаешь, ламу закрываешь, но проги в винде так с каким-то заметным лагом и отвечают, пока не перезагрузишь всю пеку.
Аноним 05/09/26 Суб 08:43:22 1696071 401
>>1696063
Не было ни разу. Вин11, память забиваю под завязку, не 90% а все 95% и никаких проблем потом.
Аноним 05/09/26 Суб 09:12:33 1696084 402
>>1696063
>проги в винде так с каким-то заметным лагом и отвечают
Скорее всего потому что им памяти просто не хватило и винда их на диск скинула чтобы совсем не выпиливать. Но вообще у меня тоже под 90% забив идет, но после выгрузки всё работает как работало, никаких зависаний.
Аноним 05/09/26 Суб 09:22:23 1696088 403
>>1696063
Проверь свой SSD, может он уже одной ногой в могиле. CryStalDiskInfo годится для теста.

Это явно файл подкачки в действии, как уже заметили.
Аноним 05/09/26 Суб 09:42:37 1696100 404
Мне гугл ии поиск предложил попробовать Ternary-Bonsai-27b, говорит, что это модель с тернарным сжатием, которой надо всего лишь 7 Gb видеопамяти. На основе Qwen 3.6. Что думаете на этот счет?
Аноним 05/09/26 Суб 09:55:57 1696111 405
>>1696100
>Что думаете на этот счет?
Чудес не бывает, запуститься-то запустится, но это лоботомит пускающий слюни. Если мало врам, то или 35b квен в (под код/агентов) или 26b гемму (под гуманитарщину/ролплей). В обоих случаях выбирай максимальный квант что влезет во врам+рам с учетом контекста. Ничего лучше для обладателей отсутствия пока не придумали.
Аноним 05/09/26 Суб 09:59:33 1696114 406
>>1696111
> 35b квен
> 26b гемму
Пощады, у меня 3060 12Gb
Аноним 05/09/26 Суб 10:02:39 1696116 407
>>1696114
На этом квен 3.8 27b в квантах идет или моешная, лучше ничего пока не выпустили. Или жди полгода пока подгонят еще более крутых моделей для 12гб.
Аноним 05/09/26 Суб 10:03:43 1696117 408
>>1696116
> квен 3.8 27b в квантах
В минимальном двухбитном квантовании каком нибудь?
Аноним 05/09/26 Суб 10:05:31 1696118 409
>>1696114
12гб должно хватить. ты попробуй 26б гемму сам удивишься. это моэ и ей окей в оперативке сидеть наполовину. только выставь контекст где-то хотя бы на 32768 в угабуге вместо 0 (иначе сбросит до 8к - не разбежишься).
у анслота хорошие кванты. не бери ниже iq4_xs спускайся ниже только если совсем не взлетает.

квен параша даже не смотри в его стоорону
Аноним 05/09/26 Суб 10:09:11 1696119 410
image 376Кб, 987x1579
987x1579
image 799Кб, 628x1392
628x1392
>>1696117
Q2_K_S, Q2_K_XL
Он в них на удивление хорошо работает. Вот яблоки генереные на Q2_k_xl
Аноним 05/09/26 Суб 10:09:16 1696120 411
1702651498887.PNG 37Кб, 832x677
832x677
>>1696118
А где смотреть то? На сайте ollama только такое
Аноним 05/09/26 Суб 10:12:55 1696122 412
>>1696005
16 гб маловато. Я взял 2x3060 на 24 гига, вот на них летает. Потом поменяю одну из них на более мощную.
Аноним 05/09/26 Суб 10:14:12 1696123 413
>>1696005
С одной такой ты квена 3.8 сможешь только занюхать. Ему для жизни нужно 200k контекста и квант не самый низкий. Три (три) 5060 ti более менее набор для 3.8 .
Аноним 05/09/26 Суб 10:14:44 1696125 414
>>1696120
https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF
вот отсюда скачай ud-iq4_xs для начала

чтобы удобно запускать и настраивать, портабл сборочку вот этой хуерги возьми
https://github.com/oobabooga/textgen/releases/tag/v4.9
и в user_data/models/ закинь gguf который скачаешь
это получше чем просто llama гонять, тут можно насоздавать персонажей
но не таверна, конечно.

это мой подход, кто-то может другие инструменты предпочитает. но ты главное gguf скачай а потом где хочешь его будешь запускать
Аноним 05/09/26 Суб 10:15:56 1696126 415
>>1696125
А на лламе можно запускать скачанные с хуггинфэйс модели?
Аноним 05/09/26 Суб 10:19:32 1696129 416
>>1696114
У меня на втором компе тоже 3060. Гемма 26B в Q8_0 и с включенным mtp генерирует чо-то примерно ~26т/c. Почитай как работают моехи, они как раз сделаны чтобы крутиться в озу. https://rentry.org/2ch-llama-inference
Аноним 05/09/26 Суб 10:20:48 1696130 417
>>1696003
Антон проснулся на лекции?
Покеж промпт.
Аноним 05/09/26 Суб 10:21:59 1696131 418
>>1696126
Можно. Нафиг вообще он обогу какую-то рекомендует хз, это параша на 1 гб говнокода, где все еще в спец папки совать надо, лама в 3 раза меньше, запускается с полпинка, модель кладешь куда хочешь.
Аноним 05/09/26 Суб 10:26:51 1696132 419
>>1696126
Шизика с IQ4_XS не слушай, при выгрузке скорость пососная будет, и русик пострадает. Еще и анслопокал скинул, пиздец. Если 16 рам - качаешь Q4_K_M, если 32 рам - качаешь Q8_0 и довольно урчишь. Всё.

https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF
Аноним 05/09/26 Суб 10:29:24 1696134 420
>>1696132
Спок, сам ты шизик, я протестировал русик в iq4_xs превосходный, ничего не страдает. Даже Q6 и Q8 показали себя хуже, чего уж говорить о глупом Q4_K_M это ж просто обрезка которой насрать на нюансы
Аноним 05/09/26 Суб 10:29:30 1696135 421
>>1696132
Двачну, бартовский в целом себя лучше показал, чем анслоповые поделия, который просто пиарит их везде как не в себя, а бартовский не пиарит. Еще недавно было, что анслот ломается на приближении к 100к контексту, а бартовский дальше пашет как ни в чем не бывало, даже обсуждали в инете это.
Аноним 05/09/26 Суб 10:34:12 1696137 422
>>1696132
Я уже начал качать IQ4_XS
Надеюсь, пойдет на 12 Gb видеопамяти.
Аноним 05/09/26 Суб 10:35:22 1696140 423
>>1696131
лама убогая сама по себе там почти нихуя нет. угабуга это надстройка над ламой. при этом не такая загруженная как таверна. таверна прямо к угабуге подключается если что
из папок там только models и mmproj второе по желанию
Аноним 05/09/26 Суб 10:36:09 1696141 424
>>1696137
Пойдет, но всё же почитай гайд для новичков из шапки. Там написано как запускать moe чтоб было быстро. И как раз на железе как у тебя.
Аноним 05/09/26 Суб 10:37:34 1696142 425
Аноним 05/09/26 Суб 10:38:33 1696143 426
>>1696142
Модель - MoE. iQ4_XS - квант.
Аноним 05/09/26 Суб 10:40:31 1696145 427
1781149625776.png 5Кб, 386x34
386x34
>>1696143
А как понять, что это MOE по этому названию?
Аноним 05/09/26 Суб 10:41:25 1696147 428
Аноним 05/09/26 Суб 10:42:44 1696150 429
>>1696147
Ладно, спасибо, буду смотреть щас через минут 10 докачается
Аноним 05/09/26 Суб 10:48:15 1696153 430
Еще такой вопрос, есть ли какая нибудь модель для кодинга, которая потянет расширение Claude Code в VS Code и пойдет на 3060?
Аноним 05/09/26 Суб 10:50:50 1696156 431
Penis me plz.webp 59Кб, 700x957
700x957
>>1696000
Что-то мне это напомнило.
<----
Аноним 05/09/26 Суб 11:10:10 1696166 432
>>1695936
>нищеброд-кун на связи, есть смысл брать квантованную от мрадера на 12\64 или ждать 26б которую тот чел судя по комментам уже делает?
Если подождать не против - можешь брать. Я себе взял IQ4XS, тебе она только с выгрузкой влезет, а т.к. она Dense, то будет медленно и печально.
А 26B - это ж другая модель будет. MoE, и как она будет писать - это еще просто неизвестно.
Аноним 05/09/26 Суб 11:26:09 1696175 433
>>1696153
Номинально - Qwen 3.6 35B (MoE). Но очень номинально. Имеет тенденцию разносить все исходники при попытке имплементации какой-то фичи в процессе которой затык словил. Без git - даже думать его пускать в сорцы нечего. И то - у него хватает мозгов исключительно сделать хорошо сформулированную задачу по описанному алгоритму/методике. "Сделай мне Х" - не прокатит.

Вот Qwen 3.8 27B - часто справляется даже с подобным, и главное аккуратный - ни разу мне исходников не ломал, даже когда ловил затык. Но он Dense, без Full VRAM будет совершенно неюзабельно.
Аноним 05/09/26 Суб 11:30:02 1696178 434
>>1696175
Понял, значит кодить исключительно на облачных моделях.
Мне кстати гугл ии поиск сказал, что в следующем году будет прогресс в этом плане и эти модели для кодинга можно будет запускать на домашних компах.
Аноним 05/09/26 Суб 11:44:36 1696189 435
Так, ну проверил gemma-4-26B-A4B-it-GGUF:UD-IQ4_XS, в чатике отвечает, приложение калькулятора на C# написала, вроде работает. Всем спасибо!
Аноним 05/09/26 Суб 11:55:09 1696198 436
С утра попытался запустить qwen 3.8 next q5k_s от бартовского на конфиге Ryzen 5600X, 128 DDR4 3600, 4060ti-16, v100-16, 3060-12.
На пустом контексте получил 93 pp, 13 tg, mtp в Q8 не дало нихуя (использовал форк лламы от анслота для mtp), хоть и работает - грузится норм, процент попаданий вроде большой (цепочка токенов 2, попадания приблизительно 0,9 и 0,7). Mtp заработало только при принудительном указании загрузки модели mtp на CUDA2.
При этом 4060ti и v100 при разбрасывании по fit on стоят недозагруженными на 6-7 гб каждая, с чего я в ахуе, конечно. Нормально нагружается всегда только третья видеокарта (менял номера cuda.у v100 и 3060).
При использовании параметра -n-cpu-moe слои всегда грузятся только в последнюю видеокарту, как указывать явно хз, ts здесь не помогают. Это поведение одинаково для лламы и форка от анслота, а также не зависит от наличия или отсутствия mtp.
Для увеличения эффективности возможно стоит увеличивать ub (у меня только 1024) для более эффективного сжирания VRAM и вручную разбрасывать тензоры через -ot.
Ну и хочу Q8 попробовать.
Аноним 05/09/26 Суб 11:58:13 1696203 437
>>1696178
Набрехал. Уже можно. Qwen 3.8 27B для кодинга требует всего 24GB vram. Это 2х3060 (мой случай) или 1х3090.
Аноним 05/09/26 Суб 12:11:39 1696212 438
>>1696189
Обращайся. И не останавливайся на достигнутом. Тема глубокая. Для РП на самом деле много вкусностей есть, упомянутые лама, ообабуга и таверна это все детский лепет по сравнению с Маринарой например (её можно подключить к локально запущеной гемме и охуевать от возможностей).

Сколько у тебя выходит токенов в секунду? И какой контекст выделен? Можешь теперь пробовать пожирнее кванты скачивать чем iq4_xs, а может тебе другие сборки геммы-4-26 зайдут. Скорость с жирными квантами может падать (в зависимости от того сколько захочешь контекста).

Для кодинга я бы гемму не советовал, она больше для РП (русского в том числе, это её главный плюс). Под базовый кодинг квены всякие есть 9B васянские в 12гиг влезут но это несерьезно тоже, так по мелочи батник накидать. Немотрон нано 9B. GLM9B. Куча есть мелочи.
В плане кодинга квен-27 уделывает гемму-26, 9-ки не сравнивал. Мб какой-то 2-битный квант квена у тебя взлетит, хз.
Аноним 05/09/26 Суб 12:48:18 1696239 439
>>1695129
> Посмотрим куда маятник через год качнется
Еще дальше. В ближайшие несколько лет железо будет только дорожать.
Аноним 05/09/26 Суб 12:52:27 1696243 440
>>1696005
Велкам ту зе клаб, бадди! хвать за жопу
>>1696120
О, даже оллама наконец решила сменить движок? Mlx только для маков или тоже кроссплатформа?
>>1696198
> При использовании параметра -n-cpu-moe слои всегда грузятся только в последнюю видеокарту
В этом его главное неудобство, с самого внедрения говорилось.
По-правильному это можно решить посмотрев какие слои на какой девайс ложатся и написать -ot регэксп для соответствующего распределения по картам. Или делать жонглирование больших диспропорций в ts пытаясь попасть, но тогда атеншн и кэш будут лежать неравномерно со всеми вытекающими.
>>1696212
Вот этого двачую. Для плотных моделей вроде собирались добавлять параметр для выгрузки линейных аналогичный ncmoe.
Аноним 05/09/26 Суб 13:05:50 1696256 441
>>1694457 (OP)
>4 пик
З - зависть.
>>1694792
Ой, ну отвалятся 2, окей, а ещё 6 проработают по 10+ лет. А там уже и списанные B200 подойдут.
Аноним 05/09/26 Суб 13:09:35 1696259 442
>>1695649
> с 16-17 токенами в секунд
А пп?
Аноним 05/09/26 Суб 13:16:15 1696267 443
>>1696259

С ub 2048 - 250. C ub 4096 - ~400. Но там контекст надо резать тогда.
Аноним 05/09/26 Суб 13:18:49 1696268 444
>>1695715
> тобы ВСЁ что у нас есть закатали нахуй в клозед сурс и анально огородили, и софт и хардвар
Когда такое было?
Аноним 05/09/26 Суб 13:21:37 1696270 445
>>1696243
>Для плотных моделей вроде собирались добавлять параметр для выгрузки линейных аналогичный ncmoe.

И даже добавили. -n-cpu-ffn число
Аноним 05/09/26 Суб 13:36:02 1696275 446
>>1695971
Неожиданно аблитерированный вариант хуже обычного? :) Вот те на те!

Аблитерированные надо сравнивать отдельно.
Аноним 05/09/26 Суб 14:04:11 1696294 447
>>1696203
> 27B
> требует всего 24GB vram
Так еще и контекст жырнющий.
Аноним 05/09/26 Суб 14:13:16 1696299 448
>>1696018
Это был ответ неугомонному мистралешизлу, участие в полемике что же такое этот ваш кум. Последние дни серит в тредисе, а показывать ничего не хочет. Грозился скинуть что-то, ждем
>>1696130
Это был бы забавный ход, но нет, они поебались. В промте ничего необычного. Что хочешь там увидеть?
Аноним 05/09/26 Суб 14:23:22 1696306 449
20260905132104.jpg 43Кб, 667x242
667x242
>>1694467
Как же менязаебали эти цифры, везде ебаные убичие цифры, и у каждой модели без исключения какой то свой набор хуй пийми чего, а смежные тесты вообще хуй пойми что такое.

Тут даже тестов не надо на самом деле, модель MoE = говно ебаное.

А dense моделей больше чем 20b на пальцах одной руки пересчитать
Аноним 05/09/26 Суб 14:45:16 1696318 450
Какой положняк по рп тюнам квена 3.5-3.8 ? Так лучше Bluestar 2 ничего и не вышло ?
Аноним 05/09/26 Суб 14:58:10 1696326 451
>>1696299
>Что хочешь там увидеть?
Текст промпта.
Аноним 05/09/26 Суб 14:58:48 1696327 452
>>1696294
У меня там 120K в fp16 влазит. Ему хватает для большинства задач, да еще нюанс в том что 3.8 хорошо переносит сжатие контекста (на opencode), и задачу все равно спокойно доделывает. Была мысль выставить 200K+ в Q8, но потом подумалось - "Можно, а зачем?" :)
Аноним 05/09/26 Суб 15:00:12 1696328 453
>>1696326
Какого? Карточка тебе нужна или сиспромпт? И объясни для чего. Ты свой не можешь написать чтоль. Расскажи в чем проблема, вместе напишем
Аноним 05/09/26 Суб 15:00:53 1696329 454
>>1696318
DarkScarlet хорош. Который на 3.6
Аноним 05/09/26 Суб 15:02:48 1696330 455
>>1696175
Какой минимальный квант на 27B юзабелен?
Аноним 05/09/26 Суб 15:03:37 1696332 456
>>1696328
>Карточка тебе нужна или сиспромпт?
Давай оба. Я собираю свой сиспромпт из чужих, и полирую тем, что мне не нравится в гемме, типа запахов озона, шафтов, ес-менства, она замерла на секунду, не дам но ладно дам и прочего.
Аноним 05/09/26 Суб 15:13:53 1696342 457
image 190Кб, 1277x716
1277x716
>>1695264
Тестанул orcarouter/Qwen3.8-27B-Uncensored-GGUF IQ4_XS

Есть ощущение что он деградировал. Стоит перекатываться на JonathanColetti версию?
Аноним 05/09/26 Суб 15:15:34 1696345 458
>>1696342
Может ты на норм бечнче попробуешь? Просто что вот это доказывает?
Аноним 05/09/26 Суб 15:24:03 1696351 459
>>1696332
Тогда не дам, по заветам чайныйкун-сенсея. Если конкретная проблема есть то помог бы решить
Аноним 05/09/26 Суб 15:25:28 1696353 460
>>1696330
IMHO - iq4xs. С поправкой на конкретный файл, ибо - "дерьмо случается". У всех.
Аноним 05/09/26 Суб 15:27:14 1696357 461
Среди новых выходящих моделей нельзя не отметить существенное улучшение в художественных и прочих вещах при работе на больших контекстах.
Классический репетишн формально побороли уже давно, но более высокие (или наоборот низкие) гармоники, когда идет повторение уже прошедшей сцены или событий с изменениями чтобы натянуть на текущее, сильно мешали. Или гипервнимание и спгс назад там где хватит обычного расслабленного ответа с отыгрышем характера чара.
А сейчас такого сильно меньше, можно продолжать развитие и довольно урчать, не отвлекаясь постоянно на суммарайзы и имея осведомленность об истории чата. В какое хорошее время живем.
Аноним 05/09/26 Суб 15:45:44 1696373 462
>>1696198
fit и авто-фкусняшки плохо работают для сложных случаев
Квен Некст раскидывал по 16 16 16 так:
tensor-split = 36,6,6
ncmoe = 35

Или по серьезу во так:

ts = 15,17,16
ot = blk.([0-9]|1[0-9]|2[0-9]|3[0-9]|4[0-9]).ffn.(up|down)_exps=CPU,blk.([7-8]|2[1]|4[3-4]).ffn.(gate)_exps=CPU
Аноним 05/09/26 Суб 15:53:37 1696381 463
image 109Кб, 1596x899
1596x899
image 83Кб, 1596x896
1596x896
image 97Кб, 1593x895
1593x895
image 145Кб, 1600x898
1600x898
>>1696342
Ещё немного сравнений
Qwen3.8-27b (orcarouter) с high резонингом
Qwen3.6-35b-a3b (hauhau) с high резонингом
ChatGpt 5.6-Sol
ChatGpt 6.0-Astra (вышел сегодня)
Аноним 05/09/26 Суб 15:55:30 1696384 464
>>1696381
Нахожу этот тест тупым примерно настолько же, как оценивать интеллект людей по признаку скорости и умения умножать 6-значные цифры в уме или собирать там кубик-рубика.
Аноним 05/09/26 Суб 15:57:21 1696387 465
>>1696384
Хз, мне кажется более хорошей аналогией будет, это "находить людей тупыми, потому что они не знают чем отличается два типа пистолетов, и называют спусковой крючок курком".
Аноним 05/09/26 Суб 15:58:49 1696389 466
>>1696384
Ну свежий гпт прям ебет это видно. А прошлую модель судя по всему лоботамировали аккурат к выходу новой, класическая темка у опенаи
Аноним 05/09/26 Суб 16:06:52 1696400 467
вкатился вчера в эту хуйню в олламу , и выкатился нахуй, работает только какая то mistrall nemo, тупая пизда просто, поставил deepseek тормозит она думает долго, только потом дает ответ мне заем ее думки, короче если у вас обычная пекарня 8 видеокарта ии 32г оперативы в ИИ мир дорога закрыта
Аноним 05/09/26 Суб 16:08:31 1696401 468
>>1696400
Неправда. Ты мог бы с комфортом гонять вполне умную гемму 26б вкатившись по гайду из шапки но предпочел жрать говнолламу
Аноним 05/09/26 Суб 16:09:29 1696403 469
>>1696381
Мда, ох уж эти пососные 35b. Квант?
Аноним 05/09/26 Суб 16:10:20 1696404 470
>>1696342
>orcarouter
>Стоит перекатываться на JonathanColetti версию?
Думаю стоит, у меня квен флеш от них в цикл уходил на первом-втором запросе. Сам пользуюсь квеном 27б от него, никаких замечаний.
Хотя возможно это потому что я не использовал параметр --jinja но это не точно, я о нем узнал когда уже удалил модель, а перекачивать естественно не стал.
Аноним 05/09/26 Суб 16:10:59 1696406 471
Аноним 05/09/26 Суб 16:12:56 1696409 472
>>1696381
Ну астра хороша, вообще идеальную картинку выдала, разве что к зубам медведя можно придраться.
Аноним 05/09/26 Суб 16:40:06 1696444 473
image 88Кб, 1596x897
1596x897
>>1696342
И всё же бенч рандомный кал. На JonathanColetti рандомный запуск сделал машину ещё хуже
Аноним 05/09/26 Суб 16:45:45 1696454 474
>>1696373
>ncmoe = 35
А -ngl -1 где? :)

Как по мне, fit вполне хорошо работает.
Аноним 05/09/26 Суб 17:03:25 1696474 475
Вы задумывались о том, что рп-шизы (в основном тни) на деле более технически подкованные в ИИ чем мимокрок синьор из офиса, которому дали подписку на Клод Код? Пока эту силли таверну настроишь с эндпоинтами, гиперпараметрами и прочей хуйней уже наполовину МЛ опсом станешь
Аноним 05/09/26 Суб 17:08:07 1696480 476
>>1696474
>тни
Либо таблетки не выпил, либо загоном ошибся.
Аноним 05/09/26 Суб 17:09:37 1696482 477
>>1696474
Хуйня, агентов крутить тебя это не научат, и рп-шат синьоры тоже - через спеки
Аноним 05/09/26 Суб 17:37:49 1696522 478
>>1696474
Я и в клоде могу B2B SAAS написать и в силли таверне с аниме девицами рпшить

Мимо сеньор продакт овнер желтого банка
Аноним 05/09/26 Суб 17:50:04 1696544 479
>>1696387
Насколько нужно быть тупым чтобы так фейлить!?
>>1696474
Нет. Среди котирующих рп есть те еще задроты-технодрочеры, которые строят целые системы для своих хотелок используя смежный опыт, а есть кумеры, срущие перед Серафиной и зашоренный кобольды, которым превышение 16к контекста=харам. Так и среди кодеров есть йоба специалисты, еще до вайбкода осознавшие важность понимания что ты делаешь и постоянного развития, или их противоположности, свято верящие что достаточно найти подходящую либу и там уже все сделано, или попросить ллм чтобы она все устроила.
И да, первые группы часто одни и те же люди.
> в основном тни
Большинство из них вообще в чатике приложения на телефон рпшат.
Аноним 05/09/26 Суб 18:52:24 1696626 480
Качайте и бекапьте модельки, пока нвидева не начала душить. От пары месяцев до полугода у нас ещё есть наверн. А потом либо 1мбит/с либо премиум какой-нибудь
Аноним 05/09/26 Суб 18:54:53 1696630 481
image 64Кб, 922x382
922x382
image 149Кб, 954x603
954x603
>>1696033
Какаят хуета эта гемма, покрайней мере G4-MeroMero-26B-A4B-IQ4_XS

Возможно 31b нормальная, но в мою видяху она целиком не влезает
Аноним 05/09/26 Суб 18:56:10 1696637 482
>>1696630
Чайныйклуб-сенсей постил 30к логов с Меры 26б Q8, всё там было прилично. Так что у тебя квант говна, а не модель
Аноним 05/09/26 Суб 19:00:46 1696645 483
Аноним 05/09/26 Суб 19:00:52 1696647 484
>>1696637
Хмм, ну ладно убедил поставлю q8. Я просто привык что другие в q4 не сильно деградируют
Аноним 05/09/26 Суб 19:15:38 1696664 485
Аноним 05/09/26 Суб 19:19:32 1696667 486
image 169Кб, 954x566
954x566
image 200Кб, 959x651
959x651
image 2Кб, 99x65
99x65
image 3Кб, 132x229
132x229
>>1696647
ТПС в помоечке, озу в потолок. Не уверен что оно стоит того, квен3.8 как будто бы лучше для моего железа
Аноним 05/09/26 Суб 19:20:00 1696668 487
>>1696664
Ага, там уже нужно проходить дейлики для загрузки моделей. Помидороёбам и прочим апизависимым впрочем не привыкать, они схавают
Аноним 05/09/26 Суб 19:40:07 1696689 488
>>1696667
Поддвачну анона выше что у тебя руки из жопы. Дабы не быть голословным отправил квенчика лазить по архивачу в поисках логов, потому что помню что были нормальные. 11 минут компьюта на тебя потратил
Держи любуйся, думай что сделал не так
>>1595496 https://2ch.su/ai/arch/2026-08-21/res/1595096.html#1595496
>>1605338 https://2ch.su/ai/arch/2026-09-01/res/1603482.html#1605338
Пока скрапил ебать платину нашёл >>1582762 https://2ch.su/ai/arch/2026-08-06/res/1582560.html#1582762
Как хорошо что я не шиз и юзаю тюнчики где нет столько слопчанского
Аноним 05/09/26 Суб 19:41:05 1696692 489
Ставлю анус, что при нвидии хф хуже не станет. Максимум - будут больше упирать на аренду апи на самом хф и только на своих нвидиевских картах.
Иначе их в твиттере будут оскорблять, а такое терпеть неприятно.
Аноним 05/09/26 Суб 19:42:40 1696694 490
>>1696689
Ну я восьмой уже ебанул. Он то нормально отвечает, просто ресуров многовато жрет. Попробую шестой квант ещё
Аноним 05/09/26 Суб 19:44:47 1696698 491
>>1696692
Выпилят всю аблитерацию/еретика 100%.
Аноним 05/09/26 Суб 19:45:32 1696699 492
>>1696698
А зачем? Максимум - не дадут пользоваться ими через сайт, да и то не факт.
Аноним 05/09/26 Суб 19:49:07 1696704 493
>>1696699
Акционерам нвидиа не понравится "такое". Еще кто-то возьмёт этот процесс на себя как "подвиг\борьбу" за которую получит новое кресло\повышение. Хз.
Аноним 05/09/26 Суб 19:50:06 1696705 494
>>1696357
>Классический репетишн формально побороли
Только с этим соглашусь. Всё остальное становится хуже. Из-за тренировок на выдачу ассистенто- кодослопа с постоянным пережёвыванием задачи со всякими "but wait" в ризонинге и конкретной ожидаемой структурой аутпута становится больше структурных лупов, спгс, зацикливания на какой-то инструкции или фиче персонажа. Та же гемма ужасна в плане структурных лупов, особенно мое. Помнится, кто-то месяц назад приносил логи с дипса вроде, где 20 ответов были сплошным структурным лупом с эхоразбором и одним и тем же смыслом абзацев в каждом ответе. И свайпнуть и выкрутить сэмлеры, как в старых моделях, не выйдет. Только отдельных агентов-переписывателей костылить.
>>1696630
На ванильной гемме такая хуйня была связана с отсутствием канала ризонинга в промпте. Мне казалось, у меро такой проблемы нет, но, возможно, присутствует. Гуглы как-то умудрились так натренить модель, что если канал ризонинга не был открыт, а аутпут модели начался, то токены вот так идут по пизде. Надо либо юзать чаткомплишен с правильной жинжой, либо в текст комплишене самому ставить правильный префикс, а если не нужен ризонинг, то сразу закрывать. В большом кванте модель может сама проставить этот префикс, и поэтому проблемы не будет, а на мелком может забывать. С правильным инстрактом у меня меро моешка и в Q4_K_M, и в Q5_K_M работает без таких багов.
Аноним 05/09/26 Суб 19:50:30 1696707 495
>>1696704
Какое? Что в файле на 200 гб кто-то поменял циферки?
Аноним 05/09/26 Суб 19:53:49 1696711 496
>>1696707
>Какое?
Да, бляьб, не налдо шланговать как будто не понимаешь. Например, был охуенный сайтик coub.com
Видюшки там были эротика и пожестче. Потом его купили и всё выпилили. Сайт остался, но sfw.
Аноним 05/09/26 Суб 19:56:49 1696714 497
>>1696711
Ну добавят в апи систем промпт что нельзя генерить нсфв. Еще какая нейронка будет проверять промпт на его предмет. Все, никакой проблемы и судебных исков.
Аноним 05/09/26 Суб 20:01:06 1696716 498
>>1696714
Ты модели от самой nvidia пользовался? Картинки там, текст. Как оно? Вот и думай.
Аноним 05/09/26 Суб 20:02:28 1696719 499
>>1696716
Мало кто помнит, но до аира наш эйрошиз был немотроношизом...
Аноним 05/09/26 Суб 20:02:36 1696720 500
>>1696716
Не пользовался. Расскажи, как оно?
ПЕРЕКАТ Аноним # OP 05/09/26 Суб 20:05:44 1696724 501
Аноним 05/09/26 Суб 20:23:32 1696751 502
>>1696275
да нахуй эта аблитерация вообще нужна, гемма4 и без неё очень послушно себя ведёт, только в самом начале подтолкнуть порой надо
Аноним 05/09/26 Суб 20:33:19 1696763 503
>>1696306
Есть простой тест: Есть два стула. Гемма2 возможно и говно. Но гемма4-26 МОЕ = ТОП. Квен - хуйня. Просто посмотри их датасет. На чём они тренировались. Это просто мусор имхо. Не важно сколько ты его там уплотнял и в каких объёмах, мусор на входе = мусор на выходе. Вот скажет тебе квен "Ебаааать, красава!" без каких-то там специальных инструкций? Никогда. Он будет общаться как гугл транслейт из 2010х. А вот гуглы знали на чём тренировать. Гугел он-то знает побольше нас.
Аноним 05/09/26 Суб 20:36:03 1696765 504
>>1696345
Это, считай, iq тест. И результат не в обманчивых цифирьках, а, как говорится, на лицо.
Аноним 05/09/26 Суб 20:52:33 1696776 505
>>1696630
Скилл ишью.
1)
Нет такого "не влазит" с геммой-26, ок?
Ты должен зафорсить контекст, тут уже смотря насколько долгий любишь рп. Например 32к выделил, и все что "не влезет" пойдёт в оперативку и ты этого даже не заметишь по скорости.

2)
СиллиТаверна - хуйня. Она с геммой-26 просто не дружит.
Хочешь около-РП экспириенса, качай oobabooga textgen. Перед тем как загрузить модель (она должна лежать в user_data/models) поменяй контекст с 0 на 32768 или больше если надо. Это всё что тебе надо настроить в textgen (ну можешь ещё температуру и параметры подкрутить типа 0.8 temp, 0.05 - 0.95 min max p, top k 20 ), хз почему его так не любят здесь. В textgen ты не увидишь такого ебнутого поведения с повторами как в таверне.

31b ТУПЕЕ. Проверено. 26b - топ.
Аноним 05/09/26 Суб 20:55:38 1696778 506
>>1696698
а ещё выпилят селебрити лоры которых там немерено
Аноним 05/09/26 Суб 23:14:35 1696876 507
Анончики, а поделитесь карточками для таверны, хочется интересно порелеплеить, но не кумить. Хочется чего-то фентезийного, наверного, но самостоятельно выдумывать лениво, да и интереснее, когда не знаешь что тебя ждет.

>>1696145
26B - количество параметров модели вообще, A4B - количество активных параметров, они только у MoE'шек есть.
Аноним 06/09/26 Вск 11:08:53 1697178 508
Аноним 06/09/26 Вск 13:56:18 1697289 509
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов