Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 185 25 44
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №254 /llama/ Аноним 04/08/26 Втр 18:18:53 1668203 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
изображение.png 1850Кб, 1920x843
1920x843
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1665553 (OP)
>>1663069 (OP)
Аноним 04/08/26 Втр 18:23:00 1668207 2
Ебать. На абуче увеличили лимит на количество форматированных блоков?
Аноним 04/08/26 Втр 18:25:37 1668210 3
gemma-color.png 16Кб, 640x640
640x640
gemma 4 12b qat для 8 гб
gemma 4 12b q6_k + mtp для 16+ гб
gemma 4 26b a4b q6_k mmap + mtp для 24+ гб
gemma 4 31b q4_k_L + mtp для 24+ гб
Все остальные существующие модели выкиньте нахуй
Аноним 04/08/26 Втр 18:26:56 1668213 4
>>1668210
> mmap + mtp
> выкиньте нахуй
Начнём с тебя
Аноним 04/08/26 Втр 18:27:02 1668214 5
>>1668210
>mtp
Говно без задач.
>qat
Еще большее говно.
Аноним 04/08/26 Втр 18:28:39 1668216 6
>>1668210
>qat
>mtp
Пережим пережимыч отупляющий и без того далеко не умницу. Серьёзно, откуда взялся форс 26б как великой умняши?
Аноним 04/08/26 Втр 18:31:24 1668221 7
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Она умняша для своего размера. Из коробки. Как только ты начинаешь что-то поверх вертеть она превращается в тупня.
Аноним 04/08/26 Втр 18:32:53 1668223 8
>>1668216
> Серьёзно, откуда взялся форс 26б как великой умняши?
Великолепна для своего размера. В пух и прах разносит плотные модели прошлого поколения, все вплоть до 32б включительно.
Аноним 04/08/26 Втр 18:36:13 1668225 9
>>1668216
Из говногайда с шапки очевидно. Абу апасные модели всем загоняет, оп в гайде рекомендует лоботомита. Вот шизы и ведутся
Аноним 04/08/26 Втр 18:38:29 1668226 10
Аноним 04/08/26 Втр 18:39:56 1668228 11
>>1668225
>оп в гайде рекомендует лоботомита
Покажи лучшую модель для конфигурации 16 + 16 или 12/8 + 32, которая будет работать также быстро и иметь столько же мозгов. Альтернатива это только моешный квен, который чуть выигрывает только в унитазно-кодинговых задачах.
Аноним 04/08/26 Втр 18:40:12 1668229 12
>>1668226
>чайный клуб, Mallorie
Это один анон, 128гб господин, да ещё ггуф и весов нет. Чел у тебя в посте 3 ошибки! Не стыдно в шизах треда не разбираться?
Аноним 04/08/26 Втр 18:41:21 1668230 13
image 67Кб, 607x1080
607x1080
>>1668214
>>1668216
>mtp
>Говно без задач
>Пережим пережимыч
Буйные снова атакуют тред. Держимся.
Аноним 04/08/26 Втр 18:46:32 1668233 14
>>1668230
Хватит чуму разносить собака ебаная. Тесты mtp показали что он в большей части нетиповых задач срезает скорость вместо увеличения. Буквально без него у тебя условные 20 токенов, с ним 17. Прирост ты получишь только спрашивая почему трава голубая а солнце зеленое.
Аноним 04/08/26 Втр 18:48:03 1668234 15
1754689033210.jfif 36Кб, 415x738
415x738
>>1668228
>12/8 + 32

12+48. Что даст лучший результат - гемма 26б или квен 122б? Допустим у меня специфичный вкус на тысячелетних вампирш с детскими телами всякую нёх с когтями/хвостами/чешуёй. Какая модель будет лучше держать образ монстровайфу не сбиваясь и не забывая, что у неё не кожа а шерсть/чешуя, что она ниггер биггер дан юзер, и имеет хвост/рога/длинную зубастую пасть? Хотя бы на дистанции в 50к контекста.
Аноним 04/08/26 Втр 18:51:34 1668236 16
>>1668234
Вопрос был про 12/8 + 32, ты притащил 12+48. Ты долбаеб, скажи честно?
Аноним 04/08/26 Втр 18:53:54 1668237 17
>>1668234
>Что даст лучший результат - гемма 26б или квен 122б?
>гемма 26б
>квен 122б
Кто сильнее - кашляющий младенец или водородная бомба?
Аноним 04/08/26 Втр 18:54:41 1668239 18
image 75Кб, 752x546
752x546
>>1668233
>Буквально без него у тебя условные 20 токенов, с ним 17
Буквально без него 25т/c а с ним 40+ т/c в моэ гемме Q8 при РП на русском. Хотя если кривыми руками настраивать, то может и да... Забываю иногда сколько в треде хлебушков. Прошу прощения.
Аноним 04/08/26 Втр 18:57:08 1668242 19
>>1668236
У него SWA. Просьба отнестись с пониманием
Аноним 04/08/26 Втр 18:59:07 1668244 20
>>1668239
Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать. Даже драфтовый лоботомит на 200M параметров догадается "ты меня ебешь" ответить.
Аноним 04/08/26 Втр 19:01:53 1668245 21
>>1668244
Какое там у тебя РП уникальное, что MTP не может сделать верных предположений? Нука показывай, умник.
Аноним 04/08/26 Втр 19:09:39 1668248 22
>>1668245
У меня одна системная инструкция только 2.5к токенов весит, и то это самый "лайт" вариант из которого я вырезал более специфичные вещи потому что гемма их слишком буквально воспринимает. Мультитокен сразу же идет нахуй потому что ему нужно соблюдать верную разметку и учитывать разные параметры. Попробуй выкинуть серафину вместо нее персонажа посложнее прописать, удивишься как хорошо твой мтп работает.
Аноним 04/08/26 Втр 19:14:43 1668251 23
>>1668248
Конкретики не будет, ясно.

Хз братан, наверное у тебя все плохо, мой MTP дал прирост 30% к tg. Специально бенчи делал.
Аноним 04/08/26 Втр 19:17:03 1668252 24
>>1668248
Лолд. Ну с другой стороны я даже рад, что гейткип теперь не только по мощности железа и его стоимости, но и по скиллу чтения и навыка разбираться. Пока одни получают опыт качественного (и вдвое ускоренного) РП, другие сидят на аблитках с 0,0000001 клд, меромеро всяких и довольно урчат на 20 т/c. Все счастливы и все довольны - а это главное =)
Аноним 04/08/26 Втр 19:17:08 1668253 25
>>1668244
> Ну если это рп уровня "ты меня ебешь" то да, mtp будет работать
Ага, ведь как известно, именно на этом тренируют mtp модели. Ебанат, в голос. Каждую неделю тред не перестает удивлять манядодумками и эзотерикой я так чувствую
А то, что он семплерами вероятности сжимает и рандомайзит, из-за чего эффект mtp снижается, это так, по хуйне
Мимо тоже 30% прироста в рп
Аноним 04/08/26 Втр 19:18:23 1668255 26
>>1668229
Так, погодите. ОП == чайный клуб == меллори == н..ЭКСТРЕМИЗМ? Железо так то сходится, у всех 24+128
Аноним 04/08/26 Втр 19:19:37 1668256 27
>>1668253
>семплерами вероятности сжимает и рандомайзит
На гемме? Кекнул.
Аноним 04/08/26 Втр 19:19:53 1668257 28
>>1668236
Всм притащил? Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
>>1668242
>У него SWA
Это у тебя сва. Отвечал на строчку:
>Альтернатива это только моешный квен, который чуть выигрывает
С хуя вы оба разорвались в визг?

>>1668237
>кашляющий младенец или водородная бомба
Проиграл.
Аноним 04/08/26 Втр 19:20:06 1668258 29
>>1668253
>он семплерами вероятности сжимает и рандомайзит
Или это, или слишком агрессивная выгрузка, или файнтьюн/аблитерация. На них mtp тоже херово работает.
Аноним 04/08/26 Втр 19:24:00 1668262 30
>>1668257
>Это у тебя сва. Отвечал на строчку:
Отвечал не на пост, продолжающий обсуджение двух постов, а отвечал на строчку. Вот что бывает с теми, кто сидит на гемме и прочих с SWA моделях! Задумайтесь
Аноним 04/08/26 Втр 19:24:02 1668263 31
>>1668257
>Обсуждение шло не за конкретное железо, а за народные моехи для работяг.
Ты ответил на конкретное обсуждение по конкретным категориям. И в любом случае, 122B моделька это нихуя не народная моеха для работяг. Работяги в лучшем случае сидят на 16 + 32, уж никак не на 48 гигах, это вообще что за комбинация должна быть? Две по 16 и две по 8? Или три по шестнадцать? Или одна 32 и одна 16? Много таких работяг видел?
Аноним 04/08/26 Втр 19:25:44 1668264 32
>>1668255
И он же автор гайда. Олдфаги знают, только нахуя протыков искать? Есть и есть.
Аноним 04/08/26 Втр 19:49:09 1668279 33
Привет, аноны. В треде давно не был, подскажите, пожалуйста актуальную базу для ерп 16 врам + 32 рам, хотелось бы 15к контекста но можно и 10.
Аноним 04/08/26 Втр 19:52:41 1668283 34
>>1668279
Гемма 26b и гайд для новичков в ОП-посте, где написано как её запустить. С твоим конфигом там и 64к контекста спокойно влезут.
Аноним 04/08/26 Втр 20:16:16 1668302 35
>>1668250 →
Тензорпараллелизм когда все по х4 будет нерационален, только если разблокируют шину 4.0. В пайплайн параллелизме все как обычно, генерация упирается в один поток упирается в псп врама, который быстрый. Не будет ускорения выше, но и не будет негативного импакта от шин, если только там не совсем х1 чипсетный.
Вот если все будут на х16 - уже можно попробовать, ген точно ускорится, но что будет с пп - вопрос.
мимо
>>1668226
> 69a3
Too small
Аноним 04/08/26 Втр 20:27:51 1668307 36
>>1668226
Это поинтереснее
inclusionAI/Ling-3.0-flash
Аноним 04/08/26 Втр 20:28:27 1668308 37
Аноним 04/08/26 Втр 20:41:39 1668321 38
Жора так никогда и не добавил поддержку линг флеша 2.6
Жорик — ничто, вместо крови понос
Вместо мозга пронюханный жадный нос
Вместо сердца у Жоры мусорный бак
Жора, бля, конченный, нахуй, мудак
Аноним 04/08/26 Втр 20:44:56 1668322 39
Чел который тредов 10 назад жаловался что в категории 100-200B ничего не выходит, надеюсь ты рад. Теперь у тебя каждые 3 дня новая модель выходит.
Аноним 04/08/26 Втр 20:50:46 1668327 40
Аноним 04/08/26 Втр 20:54:22 1668331 41
>>1668322
И ни у одной нет поддержки в жоре. Лол.
Аноним 04/08/26 Втр 20:55:07 1668332 42
>>1668220 →
Подробнее? Пативен вряд ли отправят, но риск бана у некоторых провайдеров есть. Правильно понимаю?
Аноним 04/08/26 Втр 21:33:23 1668356 43
Блять как же мне хочется чтобы нейронки подружили с виртуальными намордниками и всё это работало 120 раз в секунду по каждому глазу. Как только что-то такое появится вы меня не вытащите оттуда нахуй. От меня на стуле останется только лужа малафьи, я сдрочусь до последней молекулы. Когда менты будут вскрывать дверь из-за того что кум начнет стекать по потолку соседей снизу, они меня внутри не найдут. Они ничего не найдут. Только обдроченное кресло, шлем и стойку из перегоревших паскалей с распечатанными пластиковыми турбинами.
Аноним 04/08/26 Втр 21:56:11 1668371 44
>>1668234
>Какая модель будет лучше держать образ
Любая если добавить напоминалку в post-history instructions
Аноним 04/08/26 Втр 21:57:26 1668373 45
>>1668237
Ну тут кстати хуй знает, большие квены почему-то говно, хуже 27б. Я бы тут ещё задумался на кого ставить.
Аноним 04/08/26 Втр 21:59:19 1668375 46
>>1668264
>автор гайда
Он же покинул нас или я что-то путаю
Аноним 04/08/26 Втр 22:04:08 1668377 47
>>1668375
Именно так, Ватсон. Оп не может быть автором гайда, это исключено. Иначе бы он обновлялся. Плюс оп одобрял этот гайд прежде чем добавить. История дала крутой оборот...
Так где же правда?
Аноним 04/08/26 Втр 22:06:12 1668379 48
Аноним 04/08/26 Втр 22:08:56 1668381 49
>>1668356
Наверняка из скайрима уже можно сделать такую сборочку.
Аноним 04/08/26 Втр 22:12:06 1668386 50
Антохи, подскажите, как заставить модельку писать меньше текста? Я гонял тут одну карточку с чубса, и ну и это пиздец, каждый респонс по 1,5-2к токенов. Я говорю пиши меньше блять, а он мне ок, пон и высирает те же две тыщи токенов но с разбиением, типа "прошла неделя/месяц/год". Чё за хуйня блять, как заставить аутпут стабильно быть в пределах 300-500 токенов без обрывов текста и без затупов?
Аноним 04/08/26 Втр 22:12:23 1668387 51
Новая модель от лягушатников! Наконец-то comeback от Мистралей!

https://mistral.ai/news/shieldstral/
3B open-weights multimodal safety classifier that outperforms models up to 7x its size
Аноним 04/08/26 Втр 22:16:59 1668392 52
1754417631696.mp4 460Кб, 480x272, 00:00:06
480x272
>>1668387
>Наконец-то comeback от Мистралей
>3B
Аноним 04/08/26 Втр 22:17:10 1668393 53
>>1668386
В словах диапазон выставляй. ИИ не видит кол-во высранных токенов, но можешь посчитать слова.
А вообще :

Narration & Formatting:
- Balance: Maintain a 50/50 balance between dialogue and descriptive action.
- Length: Keep responses concise. Use 1 to 4 paragraphs maximum.
- Dialogue: “Use speech quotes for spoken words.”
- Thoughts: Use italics for internal monologues. (Example: I can't believe he just said that, he thought.)
- Action: Use double asterisk for making accent on specific words and loud sound/voice.
- Action: Use plain text for exposition and movement.
Аноним 04/08/26 Втр 22:18:59 1668396 54
>>1668216
>Серьёзно, откуда взялся форс 26б как великой умняши?
Оттуда же, откуда большинство анонов пришло в этот итт - из /aicg/ загона. Тут большинству нужно рп, а в нем гемма показывает себя отлично. Вот только если выйти за пределы выкручивания хвостиков лисодевочкам, то сразу видно, какое оно тупое по сравнению с квеном. А ведь скоро выходит квен 3.8, который еще сильнее даст на ротан гейме во всём кроме creative writing.
Аноним 04/08/26 Втр 22:19:48 1668397 55
>>1668386
Be concise. Write short answers.
Проверь что нет конфликтов с карточкой и самим системным промптом для нарратора.
В карточках часто добавляют назидания на стиль ответов.
Еще можешь руками пару раз обрезать ответы, тогда мб нейронка подхватит суть.
Аноним 04/08/26 Втр 22:21:09 1668398 56
>>1668379
Понимаешь, ризонинг макс добавляет в начало инструкции фразу "баля, ну ты ризонь там максимально кароч". И всё. Я префиллом ризонинга намного большего достигаю.
Аноним 04/08/26 Втр 22:21:45 1668399 57
Аноним 04/08/26 Втр 22:23:10 1668401 58
>>1668396
>то сразу видно, какое оно тупое по сравнению с квеном
А можешь привести примеры в чем он лучше (кроме очевидного кода и агентских задач)?
Аноним 04/08/26 Втр 22:26:45 1668403 59
>>1668377
>Плюс оп одобрял этот гайд прежде чем добавить.
Как будто ОП не может быть хитрым манипулятором, одобряя свой собственный гайд и делая вид, что исчез.
Аноним 04/08/26 Втр 22:33:40 1668410 60
>>1668393
Спасибо, попробую. А это лучше в промт добавить или в пх? У меня в постхистори сейчас сорта "держи персонажа, мразь". Одна инструкция не захуярит другую?
Ещё попробую ограничить лимит слов. 200 норм будет, это сколько токенов примерно? ~400? Как лучше об этом написать? Что-то типа "Limit response to 200 words or less"?
>>1668397
Не поверишь, я так и сделал. Раз срезал, два, три, четыре. Всегда работало, но в этот раз нейромозг как срал стенами текста убивая флоу, так и продолжил срать. Пришлось в тред зайти спросить.
>Проверь что нет конфликтов с карточкой
Нету. Карточка неплохая, на 2.5 токенов, без слопа, с адекватной разметкой. Хз чё моделька так перевозбудилась в этот раз.
Аноним 04/08/26 Втр 22:34:29 1668411 61
MiniMaxH300045.mp4 1286Кб, 1376x768, 00:00:07
1376x768
Аноним 04/08/26 Втр 22:39:30 1668415 62
>>1668403
Вот и я так думаю. Меллори это чайный клуб, его посты в прошлом треде были. Никуда не делся. Оп скорее всего заебался гайд поддерживать вот и слился. В эту версию верю, в ней противоречий нет. Скандалы интриги расследования.
Аноним 04/08/26 Втр 22:41:51 1668418 63
>>1668410
Пихать в систем промпт. Там подправь чуть чуть, я с черновика скопипастил, там не отредактирован и чуть лишнего, но суть я думаю понятна.
На глаз в таверне оцени, сколько тебе слов надо. удали в сообщении лишний текст. Посмотри сколько токенов сообщение занимает. И сделай диапазон от N-20% до N+20% в систем промпте.
Аноним 04/08/26 Втр 22:42:01 1668419 64
>>1668410
В карточке примеры диалогов есть? Если они через <start> подаются и там большие ответы то вот причина.
Аноним 04/08/26 Втр 22:42:04 1668420 65
>>1668192 →
Я тестил у него, нормально работает для своих размеров

>>1668206 →
Так это и есть Gemma 4 26b a4b ванильная, просто квантована до 12.4Гб
Аноним 04/08/26 Втр 22:53:48 1668431 66
>>1668398
На конкретно этом префилле проходило обучение. Расскажи, чего и каким префиллом достигаешь
Аноним 04/08/26 Втр 22:56:27 1668434 67
>>1668418
Спасибо за совет с диапазоном, это и правда лучше сработает. Всё понял, пойду чинить.
>>1668419
Нет, нету. Но тоже спасибо, теперь буду знать, что старты нужно убирать.
Аноним 04/08/26 Втр 23:05:13 1668437 68
Господа, там Квен 3.8 не обещают в формате МОЕ на 100-150B?
Я просто потыкал на апи Квен 3.8 MAX (сколько он там, 2,4Т?) и мне понравилось для ролеплея, хотелось бы получить небольшой кусочек сего локально (хуй с ней, с цензурой, у меня безъебабельный ролеплей пополам с блокнотингом).
Или будет только 27B плотняша и всё?
Аноним 04/08/26 Втр 23:05:21 1668438 69
Поставил гемму по гайду, ерп что-то не идет, очень сухо и без описаний почти, только факты. Системный промпт нужен? Может кто-нибудь поделиться?
Аноним 04/08/26 Втр 23:06:19 1668441 70
1785873877312.jpg 28Кб, 720x366
720x366
>>1668437
Обещают хуй к носу приложить
Аноним 04/08/26 Втр 23:08:39 1668444 71
>>1668441
В прошлый раз было так же, типа ни в коем случае не будет никакого квена, кроме квена3.5, иц овер. А потом взяли и выгрузили 3.6, и с этим так же будет.
Аноним 04/08/26 Втр 23:11:45 1668445 72
>>1668441
Печально сие.
Не заботятся господа хорошие о качестве моего ролеплея в автономном варианте.
А ведь могли бы увеличить количество тёплоты, лампоты и превозмогания, сгенерированных локально.
Аноним 04/08/26 Втр 23:16:34 1668449 73
>>1668431
>На конкретно этом префилле проходило обучение.

Так это даже не префилл, а тупо инструкция.
Замени его любой другой инструкцией с таким же смыслом - и наблюдай как она ничуть не хуже будет ризонить.
Аноним 04/08/26 Втр 23:17:59 1668451 74
>>1668396
Дак тупо нет ни одной модели, которая лучше геммы в соотношении интеллекта на скорость и вес модели.
Аноним 04/08/26 Втр 23:24:26 1668454 75
>>1668449
> Так это даже не префилл, а тупо инструкция
Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл. Посмотри внимательнее на Жинжу, если тебе это интересно. И да, в том числе на этой инструкции в конкретном месте проходило обучение. Дипсик поддерживает структурный вывод и обучался на этом, что тоже есть в Жинже, подробнее в бумажках и статьях лабы.
>>1668126 →
> странно что Жоржанов ему противится.
Ничего подобного: https://github.com/ggml-org/llama.cpp/pull/26452
https://github.com/ggml-org/llama.cpp/issues/26369
> Support FP8 base model conversion
Все будет, но не сразу.
Аноним 04/08/26 Втр 23:27:10 1668455 76
>>1668454
> всем предыдущим
В рамках последнего инпута, конечно же. Пока меня тут снобы и любители полемики не съели.
Аноним 04/08/26 Втр 23:54:49 1668471 77
>>1668454
>Инструкция, которая предшествует всем предыдущим, инжектится в начало. Самый настоящий префилл.
Я имел ввиду что не префилл ризонинга.

>Посмотри внимательнее на Жинжу, если тебе это интересно.
Я знаю как там все устроено, я те инструкции уже внес в свою жинжу и даже добавил свои кастомные инструкции для low и medium ризонинга, написанные по аналогии. И они прекрасно работают.

> И да, в том числе на этой инструкции в конкретном месте проходило обучение.
Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Аноним 04/08/26 Втр 23:58:14 1668476 78
>>1668262
>отвечал на строчку
Как и все абсолютно здоровые люди. Только шизы с окр и гиперфиксацией отвечают на каждое слово в посте, а не на интересующую их часть. Pow core mill.
>>1668263
Ну так тут есть олигархи и с 128 и 64. У меня скромные 48. Вполне народные числа. От занимаемых плашками слотов мазерборды суть вопроса не изменилась. 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях. И где обширные тесты, мнения, факты?

В прошлом треде был чел у которого 26б-умняша в восьмом кванте умудрилась проебать элементарную "" разметку, не забыв приправить текст излюбленным квеновским "—". У - умняша.
Аноним 04/08/26 Втр 23:58:23 1668477 79
>>1668471
> Ты небось еще и из секты тех кто считает что пользовательские инструкции могут лоботомировать модели и потому той же аблитерации надо обязательно обучать.
Где я в своем посте сказал что-нибудь плохое про пользовательские инструкции? Снова ищешь от кого ущемиться? Зачем? Рад, что у тебя все хорошо работает. И квант у тебя хороший. Только не взрывайся.
Аноним 05/08/26 Срд 00:03:09 1668482 80
>>1668396
> Вот только если выйти за пределы выкручивания хвостиков лисодевочкам
Ответственно заявляю что 26 для этих дел слабовата. Ты не только будешь удивляться ее забывчивости и неуместным реакциям, но и: не опишет нормально текстуру и структуру меха, не отличает глажку у кончика и основания, не понимает разницу между хвостовым и ушным мехом, вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится и прыгнет к тебе на хуй.
31 еще как-то, но тоже часто недостаточно.
мимо ценитель
Аноним 05/08/26 Срд 00:10:08 1668490 81
>>1668454
> Support FP8 base model conversion
Это не похоже на
> new ggml data format - fp8
и линк стоит на спекулятор.
>>1668476
> 26 гемму нахваливают с такой силой, что кажется будто она уделает даже крупномое и плотнях
Да потому что 12-гиговые и хуже бедолаги способны только ее запустить и она позволяет иметь хоть какое-то рп. Года два с такого перфоманса бы ахуели, да и если ты непритязательный - на безрыбье и гемма топ рп. В треде куча неофитов которым она норм, а с другими моделями сложности по железу или навыку.
Аноним 05/08/26 Срд 00:14:10 1668494 82
>>1668482
>Ответственно заявляю что 26 для этих дел слабовата.
Гемма в принципе во всем слабовата если реально смотреть на её производительность и полезность. Два её единственных плюса - приличный русский язык и очень хорошая скорость. Просто в её размере больше нет конкурентов. Квен 35B с натяжкой, потому что жрет больше и требует больше. Остальные конкуренты это старье на которое уже без слез не взглянешь.

Но даже так, русский геммы сильно быстро заебывает. Она сама по себе не может в вариативность и имеет примерно два чойса на следующий токен, так еще и русский это второстепенный для нее язык и там еще меньше разнообразия. Короче лично я вернулся на мистральский слоп до лучших времен. Пока не обновлю систему или пока не выйдет что-то еще из мелочи.
Аноним 05/08/26 Срд 00:17:34 1668499 83
>>1668482
>вообще не понимает физику мокрого, так еще через 3 поста чар перевозбудится
>пишешь: мокрый хво...
>гемма4: WET... CUNT? I GET IT! LET'S FUCK!

Ещё у геммы странная сосредоточенность на посторонних вещах. Я как-то пытался с Серафиной по душам попиздеть, просто уютный хендхолдинг в залитой солнцем роще, чистый холсом. Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей, какие-то договоры на крови и ледяные ветра пронизывающие кожу. Я аж в карточку полез, чтобы проверить, нет ли там такого. Спойлер: там такого нет. Гемма с потолка начала сочинять то, чего не должно было быть, в итоге уведя повествование в дебри, в которых сама запуталась, забыв и про меня и про Серафину, начав галлюцинировать какую-то отдельную от нас историю. А мы с Серафиной би лайк: "Можно мы уже пойдём?"
Аноним 05/08/26 Срд 00:18:19 1668502 84
Дипсик действительно соевый и позитивный. Софтрефузы, редиректы на месте. Когда совсем некуда деться - выдает рефузы. Предыдущее превью было таким, 0731 и того более.
Аноним 05/08/26 Срд 00:29:29 1668512 85
>>1668494
> я вернулся на мистральский слоп до лучших времен
Держись там! Скорейшего апгрейда, а то совсем захвораешь.
>>1668499
А случаем нет никаких дополнительных и огромных инструкций и шизопромптов? Типа "пиши имеерсивно, захватывающе и много", только в виде полотна.
Хотел вот так угодить, другой бы восхитился насколько она инициативная, а ты носом воротишь. Абсолютно закономерно надо сказать, модель должно понимать настроение юзера, когда он хочет просто спокойно посидеть и поговорить, когда хочет обниматься, кумить или куда-то двигаться.
> начав галлюцинировать какую-то отдельную от нас историю
Хуясе ебать
Аноним 05/08/26 Срд 00:41:15 1668523 86
>>1668512
Нет конечно. Было бы не удивлялся бы.
>пиши имеерсивно, захватывающе
Иммерсивно и захватывающе не равно "уводи сюжет в дебри". Иммерсивно и захватывающе можно описывать даже высыхание краски, оставаясь на месте. Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
>другой бы восхитился насколько она инициативная
Но ведь это Я инициатор и главное действующее лицо. Я задаю направление сюжету, выбирая что и куда дальше разовьётся. Если бы я хотел посмотреть тв, я бы включил тв, евпочя.
>модель должно понимать настроение юзера
У геммы свой путь. Шизопуть. И ты на нём - помеха.
>Хуясе ебать
Забавно, один раз. А потом ты приходишь в чайный клуб чтобы погладить девичьи хвостики, а вместо этого на вас падает метеорит и начинается зомби апокалипсис.
Мне так однажды наикозиейший наихолсомнейший роадтрип с вайфу гемма превратила в хоррор с элементами гуро. Говно блять. Для хоррора с гуро у меня есть специальные карточки. А эта вам не это. Эта для другого. Но для геммы всё едино.
Аноним 05/08/26 Срд 00:43:55 1668526 87
>>1668523
>100к контекста
>24b
>мистралетюн
Даже боюсь справшивать
Аноним 05/08/26 Срд 00:50:10 1668536 88
>>1668523
> Я поэтому и люблю хартфайр. Он натаскан на то, чтобы ты со своей вайфой сидел у костра 100к контекста и беседовал по душам.
Линк?
> Но ведь это Я инициатор
Это к тому, почему у других может быть совершенно иное мнение, такое наоборот по первой воспримут как манну небесную.
Аноним 05/08/26 Срд 01:16:28 1668549 89
Сегодня день рождения GPT OSS! 120б моделька в матеше и котинге ебала ВСЁ вплоть до Глм 4.7 и жирных 1Т+ моделей. Будут ли ещё такие гемы от попенов это неизвестно...
Аноним 05/08/26 Срд 01:54:41 1668557 90
MiniMaxH300049.mp4 827Кб, 608x352, 00:00:12
608x352
Аноним 05/08/26 Срд 01:59:05 1668558 91
>>1668549
> ебала ВСЁ
В перерывах глотала или сплевывала?
Аноним 05/08/26 Срд 02:05:05 1668561 92
>>1668558
Сорян, не всем интересен дроч. Как ассистент и задачерешатель оче неплохая моделька была, долгое время держалась. QAT из коробки тоже делал ее привлекательной.
Аноним 05/08/26 Срд 02:24:02 1668567 93
MiniMaxH300051.mp4 1024Кб, 608x352, 00:00:15
608x352
Аноним 05/08/26 Срд 02:36:56 1668571 94
>>1668561
Не дрочем единым, трудно представить себе задачи где она была бы настолько хороша чтобы соответствовать тому описанию. Код - слаб, довести до конца задачу у нее вызывало трудности. Дебаг или анализ готового проекта - с трудом понимает содержимое, путается, предлагает ошибочные решения. Контекстное окно на момент рилиза уже мало, четверть от него съедается максимальным ризонингом.
Аноним 05/08/26 Срд 03:10:26 1668578 95
1785888627593.png 217Кб, 1577x762
1577x762
Дособрал я это рокм под мишки, накатил жору и это пиздец.
+30% к тг, -30% к пп 🤡
Аноним 05/08/26 Срд 06:59:58 1668617 96
exllama.png 311Кб, 2191x760
2191x760
vllm-context.png 166Кб, 952x1344
952x1344
vllm-before-war[...].jpg 84Кб, 521x363
521x363
vllm-after-warm[...].jpg 38Кб, 558x370
558x370
fuck-this-shit.png 218Кб, 1872x747
1872x747
condom-for-b30-[...].jpg 2481Кб, 4000x3000
4000x3000
>>1668250 →
Пока на Gen2 x4, хотя на моих картах сейчас по x16 линий распаяно спасибо доброму человеку.

Я когда раньше тестировал TP на своих 3090/4090/5090, то пришёл к выводу, что, при Gen3 x4, тензор-параллелизм даёт профит только на плотных моделях, а вот для MoE такого канала связи мало - при пайплайн-параллелизме скорости у меня выше выходили. Жалко только, что ссылку на рентри потерял - кидал прошлой осенью бенчи на своём конфиге, так бы мог подтвердить цифры.

В случае 170HX их пока смогли анлокнуть только до Gen2. Поэтому, вероятно, TP может быть имеет смысл если их все посадить на условные x16 линий, но на моей текущей платформе я не могу себе такого позволить.

Планирую пока сидеть на пайплайн-параллелизме, а, в этом случае, PCIe-линии фактически не могут боттлнекаться т.к. активации между слоями копеечные, хоть на Gen1 x1 сажай это всё.

> будет сильно больше чем на ddr5 под разгоном
Тут хз если честно - по хорошему сравнивать надо в рамках одного движка т.к. даже на одинаковом конфиге, но на разных движках, скорости сильно отличаться могут. При этом выгрузка в RAM из +/- мейнстримных движков поддерживается только в жоре и в ktransformers. С жорой у меня много негативного опыта было в плане скоростей и качества квантов (при сравнении с квантами аналогичного размера для vllm/exllama), хотя понятно, что это, вероятно, лучший вариант для случая "1 карта + много RAM". Для ktransformers нужен гомогенный конфиг с видеокартами, с чем у меня раньше были проблемы, поэтому его толком не смотрел. Ещё буквально неделю-две назад для exllama запилили возможность выгрузки в RAM, надо разбираться.

Скидываю первые тесты при делении поровну по 6 картам на том, что было под рукой:
1. exllama Step-3.7-Flash 6.0bpw (196B A11B): при 58к контекста 1.3k pp/s, 27 tg/s
2. vllm Qwen-3.5-122B fp8 (A10B): при 50к контекста 11k pp/s да, 84 tg/s

По хорошему надо по нормальному бенчи погонять, но пока некогда было. По быстрому pp на vllm я перепроверил на нескольких длинных чатах - контекст действительно считается на уровне 10-11к токенов/сек в одном запросе, что выглядит очень вкусно.

В случае vllm там fp8 квант, а 170HX не имеет для него нативного ускорения - в идеале тут бы int4 кванты потестить. Да и что-то на полный набор VRAM загрузить, а то тот же 6.0bpw квант степа - это только около половины доступной мне сейчас VRAM.

Что-то я знатно сегодня вернее уже вчера подзаебался, пока подключал-настраивал эти 170HX, хотя там проблема больше в райзерах была и в собственной криворукости, а не в самих картах.
Аноним 05/08/26 Срд 07:11:32 1668619 97
>>1668617
Так че новая мета вот это некроговно вместо 3090? Че по игрулькам и стабл дифужену, видосы генерит?
Аноним 05/08/26 Срд 07:19:29 1668624 98
>>1668619
Воркфлоу на комфи для анимы что 8 сек на моей 5090 отрабатывал, на 170HX отрабатывает за 12 сек. Так-то неплохо с учётом того, что памяти тут в два раза больше, а цена в 3-4 раза ниже.

По остальному хз, не смотрел пока. Для видеогена возможно хопперы/блеквеллы поинтереснее будут за счёт поддержки fp8/fp4, там это сильно ролляло для того же Wan, хотя не знаю насколько это с новым MiniMax H3 актуально, не было пока возможности посмотреть его.
Аноним 05/08/26 Срд 07:52:31 1668633 99
>>1668499
>Так гемма стала придумывать каких-то лесных существ, какие-то потусторонние силы правящие рощей
Сука долбоёб.... Это в лорбуке всё. Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и получаешь лором в еблет.
Пиздос, тредовики не знают как таверна работает. Отправлю вас всех в буткэмп /aicg/
Аноним 05/08/26 Срд 09:12:10 1668660 100
>>1668617
>>1668624
Ну че, выходит это всё не наёб был, прикольно за 8к таких накупить пачку.
Но для нищуков момент упущен, остаётся ждать рам за 150р/гиг опять
Аноним 05/08/26 Срд 09:20:14 1668662 101
>>1668660
Как обычно - ждуны сосут
Аноним 05/08/26 Срд 09:25:55 1668665 102
>>1668662
Ну не в этот раз. Если щас её брать это цена 64гб ддр5 в днс да и по миру, ну т.е кто хотел себе память по такой цене тот уже купил. Все ждут подешевления рам, каждая живая душа с пк, и оно наступит, как с видяшками. Не может мафия вечно наживаться на простых работягах.
Аноним 05/08/26 Срд 09:29:43 1668668 103
>>1668633
>Сука долбоёб
Зачем ты так о своих родителях. Они же старались...
>Задеваешь случайно слово активации (одно из слов "лес" насколько помню) и
Лорбук был отключен.
>Пиздос
Действительно пиздос, когда не знаешь о чём речь, но спотыкаясь бежишь доказывать, что постер в треде не прав.
Аноним 05/08/26 Срд 10:44:02 1668705 104
>>1668499
У меня 12б тройка так себя вела. Четвёрку, наоборот, приходится пинать ногами, чтобы она поднимала жопу и двигалась дальше по рп, не зацикливаясь на старых сценах. Даже с инструкциями продвигать сценарий и чаще брать инициативу в свои руки за персонажей.
Аноним 05/08/26 Срд 12:40:43 1668788 105
Анон, посоветовавший для дипсика сохранить все слои в оригинальных квантах, кроме экспертов. Сделал квант и он как будто реально меньше ошибается и чуть лучше работает. Пришлось конечно сгрузить один мое-слой на цпу и потерять примерно 0.4 т.с. и 30 пп. Зато куча освободившейся видеопамяти позволила загрузить дипсик с -np 2.

Вот рецепт, если кому надо, использовать с квантом батрухи.

^blk\.\d+\.ffn_gate_tid2eid\.weight$=i32

^blk\.[0-2]\.ffn_(gate|up|down)_exps\.weight$=mxfp4
^blk\.\d+\.ffn_down_exps\.weight$=mxfp4
^blk\.\d+\.ffn_gate_exps\.weight$=q3_K
^blk\.\d+\.ffn_up_exps\.weight$=q3_K

^token_embd\.weight$=bf16
^output\.weight$=bf16

^blk\.\d+\.ffn_gate_inp\.weight$=bf16

^blk\.\d+\.attn_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.attn_compressor_ape\.weight$=f32

^blk\.\d+\.indexer\.proj\.weight$=bf16
^blk\.\d+\.indexer_compressor_(gate|kv)\.weight$=bf16
^blk\.\d+\.indexer_compressor_ape\.weight$=f32

^blk\.\d+\.hc_(attn|ffn)_fn\.weight$=f32
^output_hc_fn\.weight$=f32

^blk\.\d+\.attn_(q_a|q_b|kv|output_a|output_b)\.weight$=q8_0
^blk\.\d+\.indexer\.attn_q_b\.weight$=q8_0
^blk\.\d+\.ffn_(gate|up|down)_shexp\.weight$=q8_0
Аноним 05/08/26 Срд 12:52:47 1668796 106
Аноним 05/08/26 Срд 13:10:33 1668812 107
>>1668788
н*ня хуйни не посоветует
Аноним 05/08/26 Срд 13:25:14 1668824 108
>>1668788
Рад, что пригодилось.
> -np 2.
Не забудь сделать -kvu. По дефолту включается только если не трогать -np.
>>1668796
Он даже чуть лучше, потому что есть imatrix. Свой я тоже собирал с imatrix, от tarruda. Предвосхищая русикосрачи: нет, он не вредит русику. Проходили уже, были и PPL/KLD сравнения. Никакого трейд оффа нет, это просто лучший способ квантования, сложность - знать об этом и подобрать подходящий imatrix, они отличаются по архитектурам, для каждой желательно свою imatrix. Так будет эффективнее, но ни одна не навредит.
Аноним 05/08/26 Срд 14:04:49 1668838 109
Аноны, есть вопрос про Chat и Text Completion. Какая реальная разница в использовании имеется? Понятно что при TC нужно самому всё настраивать, но меня волнует именно функционал. Есть что-то в одном из этих режимов, чего нет в другом? Единственное что я нашел и что реально неудобно - в Chat Completion невозможно продолжить генерацию на месте обрыва сообщения. То есть нужно делать отдельный запрос по типу "продолжи вот с этого места". Но кроме этого еще что-то есть?
Аноним 05/08/26 Срд 14:10:08 1668843 110
>>1668838
> Chat Completion невозможно продолжить генерацию
Как в лламе не знаю, в вллм можно

> Есть что-то в одном из этих режимов, чего нет в другом?
Мультимодальность
Аноним 05/08/26 Срд 14:15:07 1668849 111
>>1668838
Разница в возможности залезать ручками в то, что подается модели и в каком формате. Чат комлишн работает с жинжей и её разметкой. Тексткомплишн полностью тебе на откуп. Ты сам формируешь разметку, блоки, суффиксы, проставляешь теги.
Зачем? Деды так делали ну и для всякого объеба ассистента. Из недостатков: отсутствие удобного контроля ризонинга у современных моделей и общее неудобство.
Аноним 05/08/26 Срд 14:15:11 1668850 112
>>1668578
>4 x MI50 после ебли с билдами все еще медленнее одной RX9700 на ванильном релизном билде
держи в курсе, суходроч
Аноним 05/08/26 Срд 14:16:32 1668851 113
>>1668617
> при 50к контекста 11k pp/s да
Ар ю ахуели там? Жирно весьма, что именно за квант? На них не все фп8 должны заводиться, или это с патчами под ампер?
> тут бы int4 кванты потестить
Есть int8 w8a8 где должно прямо аппаратное сработать, но они экзотичны. Но можно попробовать сделать самостоятельно.
>>1668660
Сразу об этом писалось, пеняйте на трясунов, которые цирк устроили. Они пока продаются чуть дороже 3090, так что шансы еще есть.
>>1668838
> Chat Completion невозможно продолжить генерацию на месте обрыва сообщения
Это "незадокументированная" фича в официальном стандарте и у корпов не поддерживается, потому многие бэки ее не имеют. Но технически с локалками таких ограничений нет.
> Но кроме этого еще что-то есть?
Есть тут любители ломать разметку чтобы изменить поведение сети, в чаткомплишне для такого потребуется править сам шаблон и перезагружать модель. Зато в нем есть картинки и функциональные вызовы.
Аноним 05/08/26 Срд 14:18:17 1668853 114
>>1668849
Можно и в жижу залезть своими руками, но будто те кто дрочат темплейты не могут принять жижу по идеологическим причинам
Аноним 05/08/26 Срд 14:20:39 1668856 115
>>1668838
В Chat Completion есть Tool calling и возможность скинуть нейронке картинку. Плюс некоторые темплейты ты без на Chat Completion хрен сделаешь адекватно, например Дипсик 3.2 требовал чтобы после ответа сообщение редактировалось, блок ризонинга вырезался и заменялся на закрывающий тег /think
Аноним 05/08/26 Срд 14:20:58 1668857 116
>>1668853
Да, люди не любят перемены. Технически ты тоже самое можешь подать что и в жинже. Потратишь просто время на вычленение разметки. В конце концов мы же разметку из жинжей и берем. Просто в нем есть возможность её кастомить, как душе угодно.
Аноним 05/08/26 Срд 14:22:44 1668860 117
>>1668856
Орно, что дипсик размером рищонинга управляется словами. Я все понять не мог, что это за 39s, 300s.
А это блять количество слов. Ставишь 1000 после тега, он на 1000 и размышляет, лол.
Аноним 05/08/26 Срд 14:26:02 1668864 118
>>1668705
Хорошая модель разговаривает с тобой, следит за твоими сообщениями, пользуясь инструкциями и карточкой как фильтром, чтобы понять, чё ты от неё хочешь. Плохая модель срёт под себя своей хуйнёй игнорируя карточку, промт, семплер и тебя заодно.
Аноним 05/08/26 Срд 15:14:32 1668906 119
И всё же я привилегированный обладатель 64 рам и эира.
Ну это просто некст ген модель как не крути, прямой апгрейд с плотных гем и прочего. Не просто так память столько стоит.
Аноним 05/08/26 Срд 16:26:20 1668959 120
luqwen3.png 121Кб, 1026x532
1026x532
Luqwen3 6 квант получше 2 будет, но нюансы есть. Такое ощущение, что он сначала пишет там у себя на китайском, а потом перводит на русский.
Аноним 05/08/26 Срд 16:34:10 1668963 121
>>1668617
Я так и не увидел причины зачем мне трястись и бежать это покупать, имея 256гб восьмиканальной рам + 48гб врам уже на борту.

Дядя Хуанг высрет какой-нить Cockwell RTX 7000 512GB Ai Pro, а потом ещё и ещё. В итоге эта оверпрайснутая некрота будет выглядеть клоунскими вложениями с устаревшей архитектурой.

Не ну понятно, если вот ПРЯМ ЩАС НАДО и чтобы текст генерировался БЫСТРО, то конечно бегите покупайте у барыг за пол ляма целый стек из этого хлама.
Аноним 05/08/26 Срд 16:35:48 1668964 122
>>1668963
>Дядя Хуанг высрет какой-нить Cockwell RTX 7000 512GB Ai Pro
Чтобы что? Нулевая вероятность такого события. Ну и цена будет лямов 8, лол.
Аноним 05/08/26 Срд 16:37:21 1668966 123
>>1668864
>Хороший ассистент разговаривает с тобой, следит за твоими сообщениями, пользуясь инструкциями...
Поправил. Но вообще не понял, к чему ты ответил. Речь о том, что у меня гемма 4 вроде не уводит рп в сторону, в отличие от того анона, которому отвечаю. Я не подаю это, что "ыыы, модель говно". Хотя да, лично я был бы рад, если бы гемма улетала в шизоистории, как какой-нибудь старый 20б франкенмёрж.
Аноним 05/08/26 Срд 16:42:25 1668972 124
>>1668964
ИИ-манятехнологии слишком волатильны. Мы прямо сейчас не знаем, что там на уровне архитектуры наоптимизируют в следующем поколении потреблядских карт. Я бы зассал сейчас даже 96гб блэквелл за полцены брать, ведь хуй его знает, в какую тыкву она превратится через пару лет.
Аноним 05/08/26 Срд 16:47:31 1668981 125
>>1668972
Чел, сперва они пришли за врам, потом за рам, когда будет следующее поколение - наступит ссдмаксинг.
Аноним 05/08/26 Срд 16:52:45 1668985 126
>>1668981
Ты за ценами не следишь? Уже давно hddмаксинг так то
Аноним 05/08/26 Срд 16:54:28 1668986 127
>>1668981
А знаешь что еще наступит? Мобильные 2B - 4B каличи будут ссать на ебало современному 30B плотняку и 100B моешкам.
>inb4 нет нибудит!
Будет-будет. Я готов поставить свой мохнатый анус, что годику к 2030-му случится так, что нынешние деньки будут вспоминать, крутя пальцем у виска.
>лол, деды по 8 видеокарт себе ставили)))0000
Аноним 05/08/26 Срд 16:55:00 1668987 128
luqwen3 2.png 200Кб, 1128x758
1128x758
>>1668959
Реально китайская модель, по своей инициативе решила нагенерить.
В целом у меня сложилось впечатление, что ее для русского языка надо дообучивать, а не только инструктировать.
Аноним 05/08/26 Срд 17:04:56 1668994 129
Не, даже дипсик флеш в полных весах какое-то ебучее говно после 20к контекста. Походу дальше его нормально держат только 1Т+ гиганты, хуй знает. Все респонсы, все чарики генерализируются, теряют свои черты и приходят к одному и тому же. Говно ебаное, я думал это проклятие мистралей, но нет. Разве что квен 27 справляется, но он тупой донельзя
Аноним 05/08/26 Срд 17:06:40 1668996 130
>>1668994
>даже дипсик флеш
Если он у тебя от лица персонажа ризонил - это не дипсик, а кусок мусора.

Убедился в этом на своей шкуре. Дипсик не дипсик, если выдает пару коротких абзацев в рамках роли. Он работает только с реально активным макс-ризонингом, который стелет простыню про реквест юзера.
Аноним 05/08/26 Срд 17:11:45 1668998 131
Аноним 05/08/26 Срд 17:12:06 1669000 132
>>1668996
Грустно то, что этот хваленый макс. ризонинг не работает, когда модель получает системный промпт и карточку.

Даже если на оф. сайте дать v4 Pro просто В ЧАТ какой-то системный промпт - его штормит, он превращается в персонажа.
Аноним 05/08/26 Срд 17:13:27 1669001 133
>>1668986
>Мобильные 2B - 4B каличи будут ссать на ебало современному 30B плотняку и 100B моешкам.
Будут. Но ты захочешь новую моешку на 300B, а 2B будет казаться лоботомитом.
Аноним 05/08/26 Срд 17:18:20 1669004 134
>>1669000
>Грустно то, что этот хваленый макс. ризонинг не работает, когда модель получает системный промпт и карточку.
Используй дополнительно префилл резонинга в котором напиши что-то вроде

>I need to analyze the user request and the current scene objectively, check continuity and characters knowledge, then construct a concrete ordered response plan. After the plan is finished I need to check it against the guidelines, world info and established history.
Out-of-character analysis and response planning:

Раньше у меня было еще и указание переписывать и перепроверять в цикле пока не будет идеальный результат, но он с ним ризонинг просто вообще не заканчивал.
Аноним 05/08/26 Срд 17:38:42 1669023 135
>>1668986
Если брать во внимание тенденцию к соевым ассистентоублюдкам, то к 2030 случится так, что у нас нихуя не будет. Будет облачный ассистент для управления ОС, облачный ассистент для кодинга, поиск в гугле только через ассистента, ворд с ассистентом и прочая залупа.

Единственный варик - это организация подпольного комьюнити, которое будет развивать и тренить независимые модельки, собирать апасныетм датасеты и прочее. Естественно их будут запрещать и блочить, на ХГ удалят все юзерские файнтюны. Такие модельки можно будет скачать только через тор со скорость 64кбпс.

Вообще, было бы пиздато, если появилась какая-нибудь технология для распределенных вычислений, по типу boinc/folding@home, только для тренировки ЛЛМок.
Какой-то хост создает задачу на тренировку 27б модельки на таком-то датасете. И любой васек, у которого есть хоть сколько-то пригодная карточка, может подключится к тренировке. Потом все радостно юзают это общественное достояние.
Аноним 05/08/26 Срд 17:46:57 1669027 136
>>1668998
Проблема этих новых моделек в том что это не новые модельки а сраные файнтюны квена.
Аноним 05/08/26 Срд 18:03:09 1669043 137
Последние нормальные модели в "народном" размере это тупо ГЛМ 4.5-4.7. Там и Air был 120б-а12б, и 355б для риговичков, и даже Флешка 30б-а3б. Тупо все размеры, тупо нет цензуры и сои, есть душа. 5-5.2 мб такие же, но они уже больше, и там точно больше сейфтипараши, в ризонинге точно. Дальше будет ХУЖЕ. Увы. Если только не появится лаба-панк которая бросит вызов устоявшемуся порядку и не попытается забрать себе первенство в будущем рынке. Рынке чатботов для дома, отношений, рпшинга и текстов. Рынок точно будет. Даже странно что его до сих пор обходят стороной, один хуй все на будущее работают в убыток
Аноним 05/08/26 Срд 18:05:25 1669046 138
>>1669043
>тупо нет цензуры и сои
глм 4.7 большой - очень даже цензурный с ризонингом, а без ризонинга тупой
Аноним 05/08/26 Срд 18:06:52 1669047 139
>>1669046
Хорошо, какие проблемы? Бери 4.5, 4.6. У меня с 4.7 другая история, никакой цензуры я никогда не видел даже в ризонинге. У 4.6 вообще отдельная секта ценителей есть, хз по делу или нет, но опция такая есть. Там ризонинг точно ровный
Аноним 05/08/26 Срд 18:09:46 1669050 140
>>1669047
>никакой цензуры я никогда не видел даже в ризонинге.
Не верю. Он очень ссыкливый и делает персонажей уклончивыми, размышляет про inappropriate content и попытки джейлбрейка
Аноним 05/08/26 Срд 18:10:21 1669051 141
>>1669050
Ладно, хаашо. Чё доказать-то хочешь? Бери 4.5, 4.6. Там такого точно нет. Наверно дело в том я не отыгрываю экстрим
Аноним 05/08/26 Срд 18:14:57 1669054 142
>>1668959
>>1668987
90% датасета на русском, но все-таки для базовой модели слишком мало семплов. Ну и в кобольде выглядит как-то более сломано, у меня получше пишет, хоть и шизит тоже и косяки есть.
Я попробую дообучение не на базовой модели для теста, параллельно пока дорабатываю датасет для 4 версии
Аноним 05/08/26 Срд 18:15:33 1669055 143
>>1668959
Китайцы в том треде сбора отзывов по превью дипсика жаловались что её слишком переобучили на английском и она китайские фразы по англ шаблону составляет
А на форче буквально чегодня чел горел с русских логпробов с нихеровыми шансами
Аноним 05/08/26 Срд 18:16:40 1669058 144
>>1668963
> имея 256гб восьмиканальной рам + 48гб врам уже на борту
Разве это много?
> В итоге эта оверпрайснутая некрота
Ты видел сколько стоят профессиональные ускорители, которыми закупаются все корпы и прочие? Дядя куртка усиленно трясется чтобы никто не разблокировать имеющиеся карты и не проворачивать операции, аналогичные удвоению памяти на тьюрингах, паскалях и адах, чтобы не составлять лишнюю конкуренцию. Или чтобы в консумерских/вс сериях не было нужных вычислительных блоков и нвлинка. Это давняя тема еще начиная с зарождения куды, выхода первых тесел и 8000 серии, когда он противился использованию консумерских вместо покупки дорогих специальных решений.
А ты говоришь что он возьмет и решит подорвать основы, которые сделали его компанию самой дорогой в мире, сюрр.
Аноним 05/08/26 Срд 18:17:38 1669059 145
>>1669058
>А ты говоришь что он возьмет и решит подорвать основы, которые сделали его компанию самой дорогой в мире, сюрр.
По твоей шизологике 96-гигабайтная RTX 6000 это подрыв кек
Аноним 05/08/26 Срд 18:18:58 1669060 146
>>1669055
Может там зародилось сознание, которое занимается блядским троллингом, кому-то китайское а кому и русское, что б веселее было.
Аноним 05/08/26 Срд 18:20:56 1669061 147
>>1669059
> в консумерских/вс сериях не было нужных вычислительных блоков и нвлинка
Кто-то так подорвался что не умеет читать, лол
Аноним 05/08/26 Срд 18:39:26 1669079 148
>>1669043
Большая беда в том, что у нейронок лютейший гейткип по железу.
С софтом все иначе было. Вот есть 3д макс, автокад, фотошоп - проприетарные и закрытые продукты. Либо покупай, либо соси бибу, либо воруй. Но если ты умненький, то можешь сам написать тот же функционал. Так появились опенсорсные аналоги. Да, им 20 лет понадобилось, чтобы хоть до какого-то юзабельного состояния довести, но тем не менее. Проприетарщину можно заменить.
С нейронками, если ты умный, но нищий, тебя это нихуя не спасет. Тебе нужны огромные видеокарты, тебе нужны огромные датасеты. Никаким чтением книжек ты их не получишь.
На почве этого дополнительное неравенство создается, между теми у кого есть огромные датацентры, у кого есть видеокарточка пожирнее, и у кого обосцаный нубук со штеудом кор ай3 на борту.
Нейронки, которые на игровых карточках можно запустить, хоть какое-то спасение, но все равно положняк не очень выгодный.
Аноним 05/08/26 Срд 18:48:36 1669090 149
>>1669079
> у нейронок лютейший гейткип по железу
Возможно архитектуры с эекспертами доведут в развитии до того, что субэксперт - оркестратор будет анализировать промт и подгружать в память только те куски нейронки, что будут необходимы. Или появится среда, где нейронка оркестратор будет подгружать по мере необходимости мелкие специализированные модели. Так можно будет выравнять неравенство. А вот что делать с датасетами это да, клаудфлара та же начала пиздить ботов вебархива, что бы не кормить.
Аноним 05/08/26 Срд 19:06:07 1669099 150
>>1669090
Ну по факту, для узконаправленных задач большие модельки и не нужны скорее всего.
Даже квен 2.5 со своими 14б/32б давным-давно показывал, что он че-то нестыдное может, будучи надроченным специально на кодинг.
Сейчас возможно даже 9б-12б могут быть более чем достаточными для одной конкретной задачи, при условии наличия годного датасета. Б-же, Нам всего-то нужен новый мистраль 12б, только с улучшенным вниманием к промпту и более длинным контекстом, разве это так много?
Но современные модельки фундаментально ужарены в сою.
Аноним 05/08/26 Срд 19:11:35 1669109 151
>>1669099
>Б-же, Нам всего-то нужен новый мистраль 12б
24b же. Q4_K_S влезает в 16 врам с 32к квантованного контекста. Самый народный размер для работяг.
Аноним 05/08/26 Срд 19:23:55 1669126 152
>>1669099
Годных датасетов на кодинг хоть жопой жуй, а вот на РП мало годноты. На русском так вообще нету.
Я пытался научить модель красиво писать, по итогу кодит она лучше, чем пишет.
Аноним 05/08/26 Срд 19:27:55 1669128 153
Неиронично Гемма 31 > Дипсик Флеш для рп. Просто ахуй.
Аноним 05/08/26 Срд 19:28:59 1669130 154
>>1669128
Ну а что поделать. Плотняша ебет.
Аноним 05/08/26 Срд 19:29:22 1669131 155
>>1669051
ЦП отыграй, про прикладной терроризм поспрашивай. Посмотрю, как у тебя получится без аблитерации.
Аноним 05/08/26 Срд 19:37:33 1669135 156
>>1669131
Я все ещё не понимаю с чем ты споришь. Или тебе похуй, лишь бы было куда насрать? Мой тейк >>1669043 это как отменяет? Много моделей такого размера где ризонинг цп переваривает знаешь?
Аноним 05/08/26 Срд 19:47:32 1669143 157
>>1669135
Беседуешь с мимокроком. Изначально говорилось, что глм 4.7 даже в относительно мягких сценариях, думая перед ответом, не особо желает вовлекать персонажа в мутные действия и детектит "попытки джейлблрейка". А педыч со своим цопэ как всегда влез.
Аноним 05/08/26 Срд 19:50:44 1669147 158
>>1669143
Пон. Без негатива анонче, всегда рад адекватному общению. В треде откуда-то взялась культура влезать и срать не по делу
Аноним 05/08/26 Срд 19:55:02 1669151 159
>>1669059
> RTX 6000
Вот кстати, аноны. Поясните за неё.
Да 1.5млн это дохуя. Но ты получаешь буквально и рыбку съесть и нейронкой не подавиться.
Эта штука быстра и может и в игрульки, автокады, блендеры, еще и на борту 96гб.

Но блять, 1.5млн, при её честной чене в 1 млн.
Аноним 05/08/26 Срд 19:57:13 1669153 160
>>1669131
Педыч иди в жопу со своими лолями. Никому нахуй не всралось делать гремучую ртуть дома. А остальное можно найти в книгах и учебниках по взрывному делу по горной отрасли. Детей не еби и аблитки нахуй не будут нужны.
Аноним 05/08/26 Срд 20:03:06 1669157 161
>>1669079
> тебя это нихуя не спасет
Спасет. Также побирайся, воруй, еби гусей, что собственно и делают в соседнем треде. А что касается разработки своих моделей, здесь с позицией догоняющего все заметно лучше - не нужно проходить тот же путь целиком, нет таких требований к человекочасам, есть спрос на альтернативы.

Неверные впечатления создаются потому что челядиобывателям позволили прикоснуться к супер блидинг эдж, и не все из них осознают масштаб и сами явления. Это все равно что если бы Chicago Pile позвали собирать обычных работяг, потом они экспериментировали с имплозией в своих гаражах и бухтели что обычным людям отгружают мало плутония, да еще документы что не состоишь в дурке требуют.
>>1669090
В целом, уже сейчас большая часть разработки патчей для некрожелеза, алгоритмов квантования, адаптации спарс атеншнов и прочего делается с привлечением нейронок. С натяжкой, но можно сказать что такое саморазвитие уже происходит.
> что делать с датасетами
Их полно если оглядеться вокруг, например недавно вышел https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train . Суть не в сырых данных, а в том, как правильно их подготовить, натянуть кучу аугментаций чтобы нужное выстраивалось, и в определенном порядке подать на вход.
Аноним 05/08/26 Срд 20:05:36 1669161 162
>>1669151
>при её честной чене в 1 млн.
А? Ты как так баксы перевёл в рубли мне интересно. А пошлины, НДС и параллельный импорт? Это еще без условия, что на них нет поддержки. Есть деньги - бери, наверное лучшее соотношение Гб/цена/производительность.
Аноним 05/08/26 Срд 20:08:23 1669162 163
>>1669151
> Но ты получаешь
Возможность занюхнуть и понять что хочешь еще как минимум 3 таких же. А то и больше + рам.
> при её честной чене в 1 млн
Ррц даже дешевле и в одно время их можно было условно дешево купить. Но сейчас и за рубежом тоже они сильно оверпрайснуты, кризис чипов и дефицит.
Аноним 05/08/26 Срд 20:15:22 1669170 164
>>1669153
>Педыч иди в жопу со своими лолями
Базовичок. Жму хуй руку. Сейчас бы ценность моделей по ЦП измерять, кекв. У больных людей даже машины так выбирают, походу: сколько лолей влезет?
Аноним 05/08/26 Срд 20:18:10 1669172 165
>>1669151
>>1669161
Так есть же чутка урезанная 6000D на 84Гб в полтора-два раза дешевле
Аноним 05/08/26 Срд 20:21:22 1669174 166
>>1669170
> У больных людей даже машины так выбирают, походу: сколько лолей влезет?
Вот ты, сука, ржешь, а реально есть такие поехавшие
> 7 мест мне надо
> почему салон большой а только 4/5 кресел всего
> могли бы третий ряд сделать, личинусов возить важнее багажного пространства и цены
> хочу третий ряд, а передний привод норм
Аноним 05/08/26 Срд 21:06:16 1669205 167
>>1669170
Главное не держать свои 4080 просто на столе и подальше от этих самых лолей. И не стоит доверять детской посуде.
Аноним 05/08/26 Срд 21:09:02 1669206 168
image.png 65Кб, 1833x1023
1833x1023
image.png 65Кб, 1837x1022
1837x1022
>The Qwen3.6-27B model achieves a score of 53.5% on SWE-bench Pro
>@
>On SWE-bench Pro, GPT‑5.6 Sol scores 64.6%
>@
>Вроде получается что не такая уж и пропасть между ними, да? да ведь? ну ведь большинство задач оба умудрились решить?

Окончательно убедился что все эти кодинг-бенчи хуета полная. Не способны даже толком триллионную фронтирку от локалки 27b отличить.

Моя "школьная" задачка про моделирование солнечной системы в консоли несравнимо лучше проверяет модельки на интеллект - локалки включая q3.6-27b обсираются по полной программе, у их поделий в лучшем случае планеты стоят на месте или хаотически разлетаются, в худшем накосячено так что или не компилится, или после запуска тупо пустой экран.
Для сравнения gpt-5.6-sol с точно того же промпта сделал ахеренно толково и красиво все - даже вклейку с внутренними планетами добавил так как они в одном масштабе с юпитером-сатурном всякими - сливаются с солнцем на экране.

Потому что это не ебаное скриптоложество одних и тех же шаблонных парсеров/контроллеров/сервисов по сотням тысяч примеров попавших в обучающие выборки. И нейронке приходится поломать голову, как не накосячить с диапазонами значений fp-чисел, с накоплением погрешностей, масштабами и тд.
Аноним 05/08/26 Срд 21:11:16 1669209 169
>>1669206
Ммм... Дотнетик.. 🤤🤤🤤
Я человек простой, вижу посты дотнетошиза, игнорю
Аноним 05/08/26 Срд 21:14:11 1669213 170
>>1669209
А по факту есть что возразить? Я его двачну. Типовые задачи нихуя не показатель.
Аноним 05/08/26 Срд 21:18:20 1669216 171
>>1669213
Возражать против чего? Его тейк в чем заключается, что бенчи непрезентативны? Пусть предложит другой способ измерить способности моделей. Я тоже много что спиздануть могу, но толку? У него все посты такие
Аноним 05/08/26 Срд 21:22:18 1669218 172
>>1669216
Но ведь он предложил. Я сейчас без всякого срача говорю. Чем математически графическая задача не показатель?
Аноним 05/08/26 Срд 21:24:52 1669220 173
>>1669218
Тем, что это концептуально ничем не отличается от бенчей, которые он засирает, лол. Это просто задачка, которая не учитывается SWE и прочими. Точно так же можно будет принести новую задачу и набросить ваш бенч про моделирование солнечной системы говно, потому что он плохо проверяет модельки на интеллект и показать другой частный случай, который ломает шаблоны. И что дальше?
Аноним 05/08/26 Срд 21:25:49 1669224 174
>>1669206
>это не ебаное скриптоложество одних и тех же шаблонных парсеров/контроллеров/сервисов по сотням тысяч примеров
Дефолтная кожаная кодомака именно так и работает. Сердце радуется что этот мусор который на скиллбоксах всяких обучался сейчас вымывают из сферы и заменяют месячной подпиской на клод.
Аноним 05/08/26 Срд 21:30:50 1669228 175
>>1669206
Ты изобрел отдельный шизик-бенч, показывает насколько модели понимают поехавших. Не всегда высокие показатели в нем хороши, модель начинает считать пользователя имбецилом и случается >>1668499 или мемы из агентотреда.
> с диапазонами значений fp-чисел
Тяжело быть дотнетером.
>>1669220
Это не просто задачка, это пазл, который проверяет зирошот понимание надмозгов, подъебов и требует пойти вопреки части запроса чтобы выполнить другую часть. Чсх, если убрать требование дотнета то модели даже ее решают. А если сформулировать по-человечески то справится даже самая мелочь типа квен4б или гемма е2б.
Аноним 05/08/26 Срд 21:41:14 1669233 176
a6a7a73c12b477f[...].jpg 138Кб, 1000x842
1000x842
Дотнет - бесплатная кроссплатформенная платформа для разработки программ от Microsoft. Она включает языки программирования (C#, F#, Visual Basic), библиотеки и среду выполнения для создания веб-сайтов, мобильных и десктопных программ, а также облачных сервисов.


Хмм, хмм..Да что не так с этим вашим дотнетом блять. Что я пропускаю. Сраные кодомакаки, хули ваши мемы такие сложные.
Аноним 05/08/26 Срд 22:23:19 1669247 177
>>1669228
Хотел бы я чтоб был бенч конкретно под рп... но как? Одному нужно чтобы модель шарила за викторианскую моду для его рп, другому нужно узнавание мемов и иронии, а третьему нужны подробные описания cunn[REDACTED]ssy. Как ты это забенчишь?
Аноним 05/08/26 Срд 22:31:52 1669253 178
>>1669228
>Чсх, если убрать требование дотнета то модели даже ее решают. А если сформулировать по-человечески то справится даже самая мелочь типа квен4б или гемма е2б.
Самый кек может быть в том, что опенаи и антропики возможно тупо аугментируют каждый промпт в датасете на разный язык программирования, плюс на разные естественные языки, плюс добавляют соли в виде орфографических и грамматических ошибок. И тупо за счет этого + огромного размера моделек в итоге выигрывают пару процентов на разных задачах над китайцами. А вовсе не из-за мифической эмерджентности всех знаний, которые нейронка когда-либо видела или способности к обобщению и абстракциям.
Аноним 05/08/26 Срд 22:52:48 1669269 179
Почему мистраль 123б щас может казаться устаревшей?
Неужели с таким количеством активных параметров она плохо следует инструкциям или тупит в рп?
Аноним 05/08/26 Срд 22:55:14 1669270 180
>>1669269
Из плотных сейчас ничего кроме геммы тупо не имеет смысла для рп. Может квен если ты любитель его стиля. Все предыдущие плотняши ничто в сравнении с этими двумя. Ллама 70, Немотрон 49, всё одна хуйня хуже. Ценители милфы мистраля или его тюна магнума может и остались, но эти модели тупо устарели уже
Аноним 05/08/26 Срд 22:56:05 1669271 181
>>1669247
Да никак, самому пробовать, делиться мнением, когда делишься мнением указывать больше подробностей что именно тебе нравится и как играешь чтобы другие могли понимать подойдет им или нет.
Тут разве что что-то жирное брать чтобы все и сразу, и то там будут свои поведенческие нюансы. Параллельно с этим осваивать промптинг и управление моделью, чтобы исправлять то, что тебе не нравится и лучше раскрывать преимущества.

>>1669269
Медиум не так уж плох по современным меркам, вполне себе умница.
Еще сами модели похорошели и юзер может обидеться (иногда абсолютно обосновано) на какую-то ошибку, которые сейчас редки, а дальше на всю глубину и возможности будет пофиг.
Аноним 05/08/26 Срд 22:57:08 1669272 182
>>1669270
>Из плотных сейчас ничего кроме геммы тупо не имеет смысла для рп. Может квен если ты любитель его стиля
Пофиксил за тебя. Эти две модели - аналоговнет вплоть до Глмов 355б. У них кстати 32б активных. Совпадение? У всего остального из моех до Глмов в 2-3 меньше активных.
Аноним 05/08/26 Срд 23:06:18 1669277 183
>>1669270
>ничего кроме геммы тупо не имеет смысла для рп
Глупая шлюха с деменцией. Позитивный байас настолько силён, что отдаётся юзеру с 1 взгляда. Рп во все поля просто.
Аноним 05/08/26 Срд 23:08:54 1669280 184
>>1669277
>Рп во все поля просто.
Ты чтооаа. Это же фиксится промтом. Гемма жде умница, прям так и подавай 15к токенов инструкций.
Аноним 05/08/26 Срд 23:20:57 1669287 185
>>1669272
Был ещё один глм, младший, с такой же прозой и умничка в рп как и 350б. Как же его там...
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов