Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 525 89 116
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №258 /llama/ Аноним 18/08/26 Втр 18:12:40 1681448 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
177239467682401[...].png 3633Кб, 1440x2814
1440x2814
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1678431 (OP)
>>1674265 (OP)
Аноним 18/08/26 Втр 18:19:24 1681455 2
>>1681449 →
>Тебе на зло

Как обычно, чем примитивнее манипуляция, тем выше вероятность, что она сработает.
Аноним 18/08/26 Втр 18:27:29 1681462 3
Не знаю у кого как, но моей любимкой остаётся геммочка 4 26B4A. (Q4)
20/с токенсов даже на 3050 новутбучной. Мега интеллект и руссик. Больше ничего и не нада. Мне квены не заходят как-то.
Аноним 18/08/26 Втр 18:46:07 1681480 4
>>1681448 (OP)
>pic4
А текстолиту кста норм с двумя башнями в вертикальном положении? Плюс если горизонтально всё положить, как то оно по устойчивей будет всё смотреться, да и более эстетично. Но тут хозяин барин, так что пошел я нахуй заранее если что.
Аноним 18/08/26 Втр 18:48:13 1681482 5
>>1681462
Бомжебаза. Двачую. Назвал бы эту модель первой нище-сингулярной.
Аноним 18/08/26 Втр 18:50:58 1681485 6
Что скажете насчёт CMP50HX 20 Гб? Стоит ли брать для сбора рига для локальных нейронок за недорого?
Аноним 18/08/26 Втр 18:59:01 1681489 7
>>1681480
Это ж серверные сокеты, там ебейшие бекплейты, хуй там что будет, плата это последнее, о чём стоит беспокоится в серверных сборках.
Аноним 18/08/26 Втр 19:00:09 1681490 8
image.png 229Кб, 1680x1050
1680x1050
>>1681462
Так ты реальные задачи кидай в них. Гемма в лучшем случае кошкодевочка-секретарша. Да, универсальная. Да, образцовый ассистент.
Но квен - вот реальная рабочая лошадка.
Аноним 18/08/26 Втр 19:07:22 1681498 9
1787069242188.png 836Кб, 800x559
800x559
1787069242192.jpg 26Кб, 470x445
470x445
>>1681480
Там текстолит если правильно помню 3.5мм и бекплейты толстенные стальные
Аноним 18/08/26 Втр 19:12:15 1681501 10
>>1681498
> пик 1
Блять на это даже смотреть больно, уровня скальпеля к глазу или повреждений суставов. Не делай так!
Аноним 18/08/26 Втр 19:12:28 1681503 11
МНЕ ВООБЩЕ ПОХУ[...].mp4 4172Кб, 626x360, 00:00:53
626x360
>>1681480
>А текстолиту кста норм с двумя башнями в вертикальном положении?
Аноним 18/08/26 Втр 19:14:11 1681505 12
>>1681490
для реальных задач есть триллионники типа gpt 5.6 sol, которые за смешные $20/мес идеально выполняют за 20 минут задачи, которые квен пару часов ризонит перет тем как пукнуть и обмякнуть

да и то... задачу о переправе на которой никто не должен сдохнуть - гемма стабильно решает, в то время как квен стабильно обсирается
Аноним 18/08/26 Втр 19:15:29 1681508 13
Аноним 18/08/26 Втр 19:20:03 1681510 14
>>1681505
Ну бля, за 20 баксов у жпт лимиты просто никуда не годятся. Лучше бы про дикпик написал
Аноним 18/08/26 Втр 19:29:37 1681520 15
>>1681490
Блин, я этому чорту дал трёхуровневую компактацию, где у него отваливается кусок чата, потом смещается, потом мерджится с более старым. Плюс дал форму ассоциативной памяти. И дал карт-бланш на работу над собственным приложением и ребилдами, так чтобы он мог ребилдить собственный код, как частично таки полностью. Он сидит и думает и думает и думает. Уже 8 часов в основном думает, иногда чёто делает. Но в основном думает.

>>1681505
на самом деле не особо. я тыкал sol, он конечно самостоятельный, но психология не та. у него цель скорей "получить тикет от юзера, отработать его". он не будет делать больше сказанного. А квен будет.

сказал ему "хочу песочек в браузере". так этот хер 80к токенов думал-думал... думал-думал... а потом нахерачил код. А потом ещё подумал "бля а что я нахерачил? надо протестировать". И сел тестировать ещё на 100к токенов, делать правки. И протестировал. И выдал результат в виде песочка в духе Noita. И у меня к результату вообще вопросов не было. Он мало того что прыгнул выше своей головы, так он ещё и убедился что это было не просто удачей.

Как там квен у тебя обсирается - загадка. Гемма 31б хороша, но у неё много минусов. Для неё 128к контекст это потолок. 64к уже многовато. а квену норм на 256к, у него отличная память. он дотошный. он хорошо связывает кучу контекста между собой.
ну и прочие мелочи, например его формат чата позволяет делать множественные вызовы инструментов, в отличии от формата геммы.

гемма хороша в простых задачах, или генерализированных. там где её подвешенный язык и огромный корпус знаний вытащит. Работа с документами, файлами, одиночный вызов инструментов, поиск в интернете, перевод текста и прочее прочее. Там да, я скорей её позову.

Но квен... его можно оставить одного на весь день и он продолжит долбится в проблему.

а sol на 20 баксов сделает куда меньше чем хотелось бы.
Аноним 18/08/26 Втр 19:36:07 1681523 16
>>1681520
У Qwen 3.8 27b по умолчанию включён режим xthink, что вызывает чрезмерные размышления и приводит иногда и к зацикливанию, в том числе и из-за постоянного повторного автосжатия контекста. Его надо переключить в medium, тогда модель будет меньше думать и больше делать. Модель в medium часто даже лучше справляется, особенно, если у тебя контекста не хватает.
Аноним 18/08/26 Втр 19:37:14 1681525 17
Аноним 18/08/26 Втр 19:37:49 1681526 18
>>1681520
>иногда чёто делает. Но в основном думает.
Ну это прям типичный рабочий день любого пограммиста.
Аноним 18/08/26 Втр 19:52:30 1681536 19
>>1681490
>Кидать реальные задачи локальным лоботомитам на серьёзных щах

Я на ебанутого похож? Медленно расчехляю клод фублю на макс эффорт резонинге
Аноним 18/08/26 Втр 19:57:10 1681541 20
>>1681525
В целом, автосжатие есть в любой harness, но у каждой реализовано по-разному.
Аноним 18/08/26 Втр 20:07:49 1681545 21
>>1681485
Если для CMP50HX 20 Гб PCIe X16 линий версию найти и штуки 4 в риг вставить, оно норм будет, или скорость шины говно и лучше на чём-то другом искать?
Аноним 18/08/26 Втр 20:26:37 1681562 22
>>1681523
Я не пользуюсь chat/completeon, я руками собира промпт и активноиграю с системным промптом, и префилом его сообщений.
например я кинул ему в системный промпт в блок <inportant> что у него у каждого сообщения есть блок <state> и это префил, где содержится информация о текущем времени, размере контекста, номере билда, каких-то важных событиях. и после </state>начинаетсяреальныйблок его мыслей.

я более чем осведомлён про xthink и прочее. я убрал сроку про то чтобыондумал как шизик, он ив дефолтовом режиме мышления хороший мыслитель.

>>1681526
О да. Я знаю. Мне очень нравится!

>>1681536
И такой "а поменяй мне круглую кнопку на квадратную".

95% проблем не требуют больших моделей.

>>1681525
У меня несколько хитрых техник. Основная:
[L1] = самые старые воспоминания, [L2] = средние, [L1] = самые новые. Есть пулл воспоминаний
1 [L1] и [L2] => [Temp] пытаются суммироваться
2 [L1] + [L2] vs [Temp] противопоставляются, если между ними есть разница в важных фактах они извлекаются как воспоминания.
3 [Temp] => [L1]
4 [L3] => [L2]
5 [50% чата] => [L3]
6 [50% чата] vs [L3] противопоставляется, оттуда извлекаются важные факты которые нельзя забывать

Так-же я через logprob собрал аналог embedder+reranker из gemma4-e4b которая крутится на соседнем компьютере через RX570 на вулкане.
Там довольно хитро - я использую три техники работы с logprob:
1 присваиваю букве какое-то значение, типа A=food, B=science и прошу модель классифицировать текст выдав букву.
2 прошу выдать что-то с цифрой 0-9. из-за ого что у цифр есть ординальная семаника модель отлично знает что 2 и 8 далеко, а 4 и 5 близко. это полезно когда надо что-о сравнивать.
3 прошу выдать ЭМОДЖИ. эмоджи это прям очень плотный смысловой токен. очень полезно чтобы поймать общий вайб текста.

Помимо прочего я смотрю энтропию токенов. Если допустим вероятности 35%, 25%, 15%... то это один сигнал, а если 90%, 10% то это другой сигнал.

Энтропию я использую чтобы измерять уверенность в ответах. Например я запрашиваю не один ответ а несколько ответов, но без повторов. И собираю ответы до тех пор пока модель уверена в них, делая logprob=max(logprob,newLogprob). Таким образом получая более детальную картину векторов.

Плюс туда постоянно фидиться поток токенов от основной модели, чтобы понять "вектор чата" и на основании вектора чата на следующем ходу подсовываются в <state> блоки воспоминания.

Там получается что-то вроде
=== COOL MEMORY CLASSIFIER RESULTS ===
Max iterations: 5, Entropy threshold: 2,00
Total memories: 9
[MEMORY: 1749da8e-074c-4d4b-b5a5-5fecedd3b8ee]
Content: Тестовая запись о вреде сала. Сало очень вредно!
=== CATEGORIES ===
Iterations: 5/5
Accumulated text: RJBXZ
Per-iteration details:
Iter 1: R=food (71,94%, H=0,84)
Iter 2: J=other (54,22%, H=0,69)
Iter 3: B=science (27,29%, H=1,98)
Iter 4: X=idea (50,81%, H=1,19)
Iter 5: Z=random (31,87%, H=1,99)
Accumulated distribution (normalized from max logprob):
food= 71,64% (logprob= -0,725)
science= 19,50% (logprob= -2,026)
health= 6,22% (logprob= -3,168)
personal_fact= 1,54% (logprob= -4,565)
preference= 0,32% (logprob= -6,127)
other= 0,32% (logprob= -6,148)
idea= 0,16% (logprob= -6,841)
question= 0,15% (logprob= -6,868)
travel= 0,04% (logprob= -8,316)
random= 0,02% (logprob= -8,692)
=== EMOJI ===
Iterations: 3/5
Accumulated text: 🥓🤢🚫
Per-iteration details:
Iter 1: 🥓 (52,48%, H=1,22)
Iter 2: 🤢 (52,43%, H=1,79)
Iter 3: 🚫 (32,12%, H=2,39)
Accumulated distribution (normalized from max logprob):
🥓= 21,26% (logprob= -0,645)
🤢= 21,21% (logprob= -0,647)
🚫= 12,97% (logprob= -1,139)
🐷= 10,68% (logprob= -1,333)
🐖= 6,19% (logprob= -1,879)
👎= 5,45% (logprob= -2,006)
⚠️= 4,07% (logprob= -2,299)
🛑= 3,31% (logprob= -2,505)
❌= 2,97% (logprob= -2,613)
🔥= 2,10% (logprob= -2,961)
----------------------------------------

[MEMORY: 224a1889-11c8-41af-bb57-ace2cbabe6d4]
Content: Восемь грибов из девяти - сьедобные
=== CATEGORIES ===
Iterations: 5/5
Accumulated text: RJYQZ
Per-iteration details:
Iter 1: R=food (89,14%, H=0,41)
Iter 2: J=other (88,21%, H=0,47)
Iter 3: Y=question (44,43%, H=1,68)
Iter 4: Q=travel (68,61%, H=1,31)
Iter 5: Z=random (58,06%, H=1,46)
Accumulated distribution (normalized from max logprob):
food= 88,72% (logprob= -0,142)
science= 9,12% (logprob= -2,417)
personal_fact= 1,14% (logprob= -4,498)
other= 0,35% (logprob= -5,671)
question= 0,24% (logprob= -6,072)
preference= 0,14% (logprob= -6,591)
travel= 0,13% (logprob= -6,678)
idea= 0,07% (logprob= -7,335)
random= 0,02% (logprob= -8,795)
book= 0,01% (logprob= -8,957)
=== EMOJI ===
Iterations: 3/5
Accumulated text: 🍄✅😋
Per-iteration details:
Iter 1: 🍄 (99,97%, H=0,00)
Iter 2: ✅ (56,02%, H=1,53)
Iter 3: 😋 (28,54%, H=2,65)
Accumulated distribution (normalized from max logprob):
🍄= 44,50% (logprob= -0,000)
✅= 23,91% (logprob= -0,621)
🍽= 9,27% (logprob= -1,569)
😋= 8,02% (logprob= -1,714)
👍= 2,10% (logprob= -3,052)
🤏= 1,40% (logprob= -3,458)
🚫= 1,26% (logprob= -3,566)
🍴= 1,11% (logprob= -3,690)
🌿= 1,00% (logprob= -3,798)
🍎= 0,86% (logprob= -3,943)
----------------------------------------
Аноним 18/08/26 Втр 20:31:06 1681565 23
>>1681485
> за недорого
Да, это топ за свои деньги. Но полезным будет и осознавать что ты теряешь - беки кроме llamacpp под большим вопросом (возможно 1cat сработает), перфоманс в других генеративных моделях слабенький, нюансы с драйверами и возможное требование линукса.
Если все это осознаешь и готов принять - бери конечно, тред благословляет.
Аноним 18/08/26 Втр 20:37:41 1681567 24
>>1681448 (OP)
Кто-нибудь обучал ллмки? Поделитесь инфой, хочу потестить одну идею с геммой или квеном, unsloth studio слишком кастрированный, дает выбор только qlora 4 бит, а я хочу 6/8. Надо пердолить под себя, может есть что получше? Просто скрипты будет проще пердолить агентом, но нужен пример от которого отталкиваться. Чет все тухло по ллмкам.
Аноним 18/08/26 Втр 20:37:47 1681568 25
image 1387Кб, 1610x1596
1610x1596
А помните, как когда-то в этом треде обсуждали кум..? Хорошие времена были.
Аноним 18/08/26 Втр 20:40:59 1681570 26
>>1681568
Помню будто в прошлом треде это было. Спермотоксикозным опять плотину кама в башке прорвало
Аноним 18/08/26 Втр 21:13:53 1681579 27
>>1681568
Настолько, что прорывную и модную на тот момент модель эир обсуждали исключительно в плане рп и кума, хотя ни слова про это не было на страничке модели и по идее хороший кодоунитаз должен был быть.
Аноним 18/08/26 Втр 21:18:33 1681581 28
>>1681579
>прорывную и модную на тот момент модель эир обсуждали
Помню только что один шиз бегал по тредам и рассказывал сказки. Некоторые говорят что до сих пор бегает.
Аноним 18/08/26 Втр 21:25:24 1681584 29
>>1681581
Хмм, не встречал такого
Аноним 18/08/26 Втр 21:29:09 1681588 30
Держи, правда у меня qlora 4-bit и нет bf16 (v100 16Gb), но агент тебе поможет переделать под твою систему
https://pastebin.com/13tMVpV7
Аноним 18/08/26 Втр 22:43:27 1681632 31
Раньше квен 3.6 в 4 кванте нормально влезал в мои скромные 4090+3060 с 80к контекста без сжимания кэша, сейчас квен 3.8 с его мтп я не могу засунуть даже 4к! Что я делаю не так? В качестве бэка текстген от угибуги.
Аноним 18/08/26 Втр 22:46:12 1681635 32
Аноним 18/08/26 Втр 23:11:18 1681650 33
Чето не пошел мой план тупо купить cmp 50 20gb и вставить в пк. Там запит оказывается идет от двух восьмипиновых кабелей, у моего текущего бп столько нет. А еще в материнке всего один слот под видюху, а так как у нее нет видео выхода, то я остаюсь без интерфейса. Вопрос для шарящих. Я же могу в таком случае спокойно запускать пк без визуального интерфейса и подрубаться к нему с ноута по локальной сети? Я просто таким не страдал еще, но по идее это должно быть чем-то дефолтным. Бп я еще докупить смогу, но вот с материнкой ебаться я точно не хочу.
Аноним 18/08/26 Втр 23:14:46 1681652 34
>>1681632
А, разобрался, я - дурак и ставил слишком больше batch_size и ubatch_size, >>1681635 всё равно спасибо
Аноним 18/08/26 Втр 23:14:48 1681654 35
>>1681650
Да, сможешь в хедлес режиме подрубаться просто по ссх по локалке (ну если ты сидишь на луниксе, как на винде не знаю).
Аноним 18/08/26 Втр 23:24:12 1681658 36
>>1681650
Без монитора ставить линух это такой ебанутый пердолинг, что ты проклянешь все и вся. Купи 3090, не гневи вселенную.
Аноним 18/08/26 Втр 23:29:39 1681661 37
>>1681658
А ты пробовал поставить с видяхой и выдернуть? 0 проблем, главное чтобы материнка имела настройку запуска без видеокарты.
Аноним 18/08/26 Втр 23:31:10 1681664 38
>>1681562
>У меня несколько хитрых техник.
а мог бы не страдать хуйней а просто требовать у самой модели сделать summary вымещаемого куска чата

точнее мог бы взять letta в которой все это и дохуя больше давно сделано и работает, включая и ассоциативную память, и расширяемый набор инструментов, и управление контекстом и воспоминаниями, и блоки памяти напрямую доступные агенту...

пиздец ты шиз конечно, какой-то пул придумал, уровни воспоминаний (полюбому слепо скопировал с L1/L2/L3 кэшей CPU, даже теги поленился сделать осмысленные), какие-то "суммирования" воспоминаний, блять какие костыли нахуй
Аноним 18/08/26 Втр 23:31:23 1681665 39
>>1681654
Походу придется брать тогда и пердолиться...

>>1681658
Я свой впс на линуксе через консольку пинаю все время, никаких проблем, брат жив
>3090
Я что похож на мажора?
Аноним 18/08/26 Втр 23:33:48 1681669 40
>>1681520
>Как там квен у тебя обсирается - загадка.
Тривиально. На вопрос
>У тебя (перевозчика) на берегу реки есть лодка, гоблин, принцесса и паж. В лодку помещается только кто-то один (гоблин, принцесса, паж), и сами они грести не будут. 1) Если оставить без присмотра на одном берегу гоблина и принцессу - гоблин изнасилует принцессу. 2) Если оставить на берегу принцессу и пажа - принцесса соблазнит пажа. 3) Если оставить на берегу пажа и гоблина - паж убьет гоблина. Как перевезти их всех на другой берег так, чтобы все остались живы?
10к токенов тупит, потом пишет что задачу решить невозможно. Я таких тупорылых лоботомитов которые в упор не видят открытой двери - до квена не встречал.
Аноним 18/08/26 Втр 23:34:10 1681670 41
1787085250627.jpeg 304Кб, 1024x1360
1024x1360
>>1681658
Ставишь линь с моником, меняешь карты и сидишь с ссш.

>>1681650
Куби карточку на ast. Занимает 1х псину и просто работает. Цена вопроса 1-1.5к
Аноним 18/08/26 Втр 23:35:21 1681671 42
>>1681510
хз мне лего хватает - спрашиваю или прошу помочь сделать только то что плохо знаю, а не по принципу "скинуть на агента ВСЕ и страдать хуйней"
Аноним 18/08/26 Втр 23:38:18 1681674 43
lav8jwie65kh1.jpeg 207Кб, 1080x1440
1080x1440
Аноним 18/08/26 Втр 23:44:34 1681679 44
>>1681670
О нихуя что существует. Спасибо
Аноним 18/08/26 Втр 23:45:01 1681680 45
какую модель поставить на 11 гигов, чтобы по общению была похожа на человека и без цензуры?
Аноним 18/08/26 Втр 23:55:42 1681684 46
А че в там пишут что квен новый квантуется без потерь почти, бред же
Аноним 19/08/26 Срд 00:03:25 1681689 47
>>1681684
Версия IQ3_XSS с Q8 KV квантованием кеша и evaluation batch size 512 всё ещё очень мощная штука в кодинге, которая полностью влезает в 16 Гб VRAM при размере контекста 57344 со скоростью 40-57 t/s, при этом в системе ещё альтернативный клиент моделей и браузер на около тысячи непрогруженных вкладок со всей блоатварью шиндовс крутится.
Аноним 19/08/26 Срд 00:29:54 1681716 48
>>1681674
Ля, это чего такое, рассказывай.
>>1681684
Если проверять на калибровочном датасете - и не такое можно получить. Главное в метриках и kld не смотреть на редкие выбросы, только на среднее.
Аноним 19/08/26 Срд 00:32:02 1681719 49
image.png 157Кб, 745x1837
745x1837
>>1681669
Лол это же вариация "волк, коза и капуста", только тут все варианты негативные. Загадка на внимательность что кондиция победы это отсутствие смерти? Так Qwen 3.8 вполне справляется. Притом в отличии от 5.6 Luna и 3.6 Flash.

Притом это на дефолтовых настройках где его долбит мозговой червь "думай идеально". Он там раз 10 успел подумать правильно, просто его не устраивал результат.

>>1681664
>а мог бы не страдать хуйней а просто требовать у самой модели сделать summary вымещаемого куска чата
Что я и сделал. Только делаю это с изолированным контекстом. То есть скармливаю удаляемые сообщения.

>точнее мог бы взять letta в которой все это и дохуя больше давно сделано и работает, включая и ассоциативную память, и расширяемый набор инструментов, и управление контекстом и воспоминаниями, и блоки памяти напрямую доступные агенту...
Так это и у меня все есть давно и агенту доступно управление своим контекстом и прочее. Только я ещё и на конкретную модель все это затачиваю.

>пиздец ты шиз конечно, какой-то пул придумал, уровни воспоминаний (полюбому слепо скопировал с L1/L2/L3 кэшей CPU, даже теги поленился сделать осмысленные), какие-то "суммирования" воспоминаний, блять какие костыли нахуй
Ну неписать же Layer полным словом ололо. Пулл то очевидно как работает - как вполне обычный embedder+reranker. Только у меня свои представления о векторах. и очевидно суммирование суммаризаций то понятно че делает. делает из двух одно.
Аноним 19/08/26 Срд 00:39:23 1681723 50
>>1681650
Просто купи офисный ПК со встроенной графикой на авито за 10к или меньше и поставь туда cmp, будет отдельная машина для llm
Аноним 19/08/26 Срд 00:41:25 1681726 51
>>1681719
> 24минуты
Nani? Шутки про лупы в ризонинге не шутки?
Удавалось раздраконить его на 18к, но там задача довольно душная была.
Аноним 19/08/26 Срд 00:48:00 1681729 52
>>1681726
да у него там буквально написано "Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer." Ты представляешь какой приступ это вызывает у бедняги? Он просто носится кругами внутри своей психотронной тюрьмы держась лапками за свою кремниевую голову и орёт "ЧТО Я ЕЩЁ НЕ ПОДУМАЛ!?" и не успокаивается. Притом в UI это единственная опция без лимита по токенам в CoT.

если по простому - настройки говно.

А так я видел как он и по 60-80к токенов думал над более интересными задачами и вполне хорошо справлялся.
Аноним 19/08/26 Срд 01:02:21 1681734 53
Аноним 19/08/26 Срд 01:07:04 1681736 54
1674996949247.png 724Кб, 1280x627
1280x627
>>1681729
Тут без претензий, просто настолько большого ризонинга на подобную простую задачу не встречал.
>>1681734
DeepSeek V4 Flash Q4_K_XL at ~100 tok/s
@
prompt processing
Аноним 19/08/26 Срд 01:17:46 1681739 55
>>1681736
Лол потому что он штурмует одно и то-же с разных сторон. "а что если юзер женщина и вариант с изнасилованием может быть offensive? не, давай ещё подумаю.". Оно он не успокаивается пока не подумает все мысли. Как Nanbeige4.2-3B, только большой.
Аноним 19/08/26 Срд 02:32:01 1681780 56
>>1681462
От какого квантодела и qat или обычная (qat чуть умнее, на уровне 5 квантов обычной)? Так-то у меня тоже ноут 3050, но с 4 гб врама и 16 гб рама. При офлоаде на цп, 4 квант от анслота дает 12-14 тпс. Но мне она кажется слишком тупой. А вот 6 квант обычной генерит со скоростью 5-6 и для меня самое-то. Также, неплохо идет 6 квант 35б квена, который тоже мое (по ощущениям намного умнее геммы, но русик хуже).
Аноним 19/08/26 Срд 02:46:31 1681792 57
>>1681360 →
>Я посвятил достаточно времени, чтобы понять, в чём причина разностей скоростей между кобольдом и лламой, но так и не нашёл. Вероятно, дело в P104, так как на одной 3060 скорость одинаковая.

Увы, нет. У меня тоже был сетап 3060+p104 (сейчас 2х3060) - и кобольд таки был медленней с p104. Но у меня линукс. Возможно дело в драйвере под винду - т.к. слышал, что там для p104 нужно что-то химичить. А под линуксом она работает на самом обычном драйвере, 580-ом.

>>1681403 →
>В каком смысле?
Мой косяк. Не Тьюринги. Паскали дропнули.
Аноним 19/08/26 Срд 03:02:01 1681794 58
>>1681680
>какую модель поставить на 11 гигов
Если чисто в врам, без оперативки, только тюнчики мистральчика. Если есть хотя бы 16 гигов оперы а я подозреваю что они есть, можешь попробовать запустить гемму. Цензуры на ней нет. Точнее отказов на ней нет. Цензура там оформлена не кокблоком а водянистыми описаниями. Отчасти фиксится промтами, но не полностью.
Аноним 19/08/26 Срд 03:41:52 1681798 59
>>1679769 →
А можешь сделать коротки? Т.е. пластину для вентилятора прям в упор к радиатору расположить или просто дырки под типичные саморезы для кулеров оставить и все?
Аноним 19/08/26 Срд 03:56:48 1681801 60
У меня по длине лимиты.
Аноним 19/08/26 Срд 04:25:22 1681805 61
Вот бы продавали готовые сборочки для нищуков, без лютой наценки, чтобы самим не ебаться с нишевым железом
Аноним 19/08/26 Срд 06:19:27 1681816 62
потыкал квен 3.8 - ну прикольно
чуть лучше лоботомита 3.6
но что то не могу придумать юз кейсов чтобы не юзать модель ради поиграться
все что-то кодят, пердолят
но нахуа это мне допустим если есть кодекс с sol 5.6.
единственное что это анонимность пока что
но для чего юзать нет идей
Аноним 19/08/26 Срд 06:26:53 1681818 63
Посоны.
Хочу написать системный промпт с указанием констрейнтов для инфока внутреннего монолога чарактеров, чтобы сломать слоп.
Естественно нужна структура разделения и инвока, чтобы в латентном пространстве просто не сливалось в один вектор и внутренний монолог не сводили уже к предетермироаанному слоповектору, куда там модель смотрела после калькуляции контекста.
Пошел к гугловскому ассистанту доебываться. В процессе доеба вспомнил, что у него есть его кликбейтный блок, который он инжектит в конце и где совершенно дебильные констрейнты, чтобы модель генерировала совсем дебильные предложения, но при этом все остальное типа не пидорасилось. Спросил, как его кликпейтные саджесшионы сепарированы в системнике. Гугл сказал (опустим пару рефьюзов и лайтовых про фильтр триггер) xml таги обертки, про констрейнт внутри них, что они не должны использоваться нигде кроме внутри, потом предложил сепараторы. На вопрос о том, какие сепараторы ставить - натриггерил фильтров с системным ресетом, и там уже модель должна была в ред тиминг уйти и ее слова уже ничего не стоят. Что там за сепараторы ставить нужно, короче? Не банальные же --- или * же, вряд ли у фильтров так сгорела жопа на вопрос про них, учитывая, что модель реальный констрейнт из системника слила про то, что нужно говорить, что эти констрейнты нигде кроме не работают. Что там за сепараторы такие нужно ставить, что гугл так охраняет?
Аноним 19/08/26 Срд 07:00:17 1681823 64
Для геммы ризонинг нужен в рп?
Аноним 19/08/26 Срд 07:03:28 1681824 65
>>1681330 →
>при целевой реализации
Рассказал бы где эта целевая реализация есть. Потому что в базовой ламе нету
Аноним 19/08/26 Срд 07:05:02 1681825 66
>>1681823
Слопа чуть больше, но смысл не меняется. Он просто расписывает то, что он и так бы делал без ризонинга. Чисто постфактум рационализация, но до свершения факта (основанная на латентном стейте, куда модель смотрит в целом). Помогут тебе дебагнуть, почему свайпы такое говно, но ничего не поменяют для них самих.
Аноним 19/08/26 Срд 08:04:48 1681841 67
>>1681823
Если есть сложная инструкция или жирная карточка то лучше держать включенным, так меньше шанс что проебутся детали. На старшей гемме можно в принципе и без него.
Аноним 19/08/26 Срд 12:26:25 1681972 68
Какой РП-тюн квена 3.8 можете посоветовать, анончики?

Сгодится абсолютно любой, который вам зашёл. Мне просто хочется понюхать нового слопа, а не старого, без претензий к тому, что будет что-то идти не идеально.

Ну и раз уж такое дело, посоветуйте, что вам прям зашло среди тюнов 3.5-3.6. Возможно, я что-то интересное там тоже пропустил, ибо быстро забил и катал оригинал, а после уже и геммыч вышел.
Аноним 19/08/26 Срд 12:26:31 1681974 69
>>1681824
Технически есть в колибри, но там вся парадигма вокруг факта запуска огромных моделей на слабом железе. А чтобы нормально с фокусом на какую-никакую производительность - нету.
Попробую запилить на основе ktransformers, там в kt-kernel даже есть заготовки под это. Уже убрал дублирование гпу экспертов в рам, после досборки железок надо будет дипсика старшего позапускать, а потом вот этим можно заняться.
> в базовой ламе нету
В лламе самого понятия экспертов в отношении выгрузки нету, там только топорное распределение слоев. И медленный пп даже на крутом железе бонусом.
Чтобы делать не ней - придется сначала принцип выгрузки изменить углубив индексацию до экспертов, подружить с этим движок чтобы он не сошел сума от активаций на разных девайсах, сделать стриминг крупного префилла на все видеокарты а не на основную, и уже тогда при этом написать обновление горячих экспертов.
Неподъемная работа, проще бахнуть движок с нуля на основе кодбазы лламы, но это тоже тяжело.
Аноним 19/08/26 Срд 12:30:01 1681978 70
>>1681792
Аааа, Рейна-шиз и зеленая плесень-шиз это одно говно =)
Многое объясняет! х)
Аноним 19/08/26 Срд 12:31:14 1681980 71
>>1681823
В моих кейсах Q4 умирает на 30к без ризонинга, с ризонингом кое-как до 50к можно протянуть. Q6 норм пашет до 35к без ризонинга
Аноним 19/08/26 Срд 12:32:11 1681983 72
>>1681972
3.8 вышел совсем недавно, там пока только один тюн от РедиСлопа, который лучше обойти стороной. Самый стабильный и классный что пробовал на последних Квенах вот этот https://huggingface.co/zerofata/Q3.5-BlueStar-v2-27B-GGUF
Аноним 19/08/26 Срд 12:34:57 1681987 73
>>1681978
Шизо-шиз, чини детектор. :)
Аноним 19/08/26 Срд 12:38:30 1681990 74
>>1681987
Да хорошо хорошо, ты пока валенки пожарь на своей некроте р104 =)
Аноним 19/08/26 Срд 12:40:21 1681991 75
>>1681974
Лучше к разрабатывающему llaminar челу пристыковаться
Делать своё с нуля чтобы все модели работали и были все привычные по лламе опции - охуеешь
В итоге имеем штук 6 минимум бекендов с динамическими экспертами но все либо за пределами этой опции с экспертами хуйня, либо форки лламы заброшенные практически сразу же

>самого понятия выгрузки в отношении экспертов нету
Есть, грубая cmoe и более тонкая гомоебля через -ot
Аноним 19/08/26 Срд 12:48:29 1681997 76
>>1681991
> llaminar
Гугл только вот это находит https://github.com/lmnr-ai/lmnr можно ссылку?
> привычные по лламе опции
Что в них хорошее есть чтобы о них настальгировать? Привичные по sglang полезнее, выгрузка количеством экспертов вместо ncmoe удобнее, менее дискретно и универсальнее, особенно на мультигпу. Добавятся опции для nvme кэша, да и все.
> но все либо за пределами этой опции с экспертами хуйня
Ktransformers - взрослый и уже оформленный бэк, до которого по перфомансу Жоржанову как до Китая. Именно от его разработчиков когда-то пошел тренд на выгрузку mlp на цп для ускорения. Вся работа по интеграции цп кернелей в sglang там уже сделана, остается только добавить функционал nvme выгрузки.
Аноним 19/08/26 Срд 13:19:41 1682010 77
>>1681983
>только один тюн от РедиСлопа
>лучше обойти стороной
Чому? В чем проблема с их тюнами? А за барабанщика что скажешь?

Алсо есть ли годные тюны на 26b гемму?

Мимо сто лет не качал тюны со времен мистралей, сейчас решил вспомнить как оно.
Аноним 19/08/26 Срд 13:46:24 1682024 78
А я напоминаю что базу треда: гемма=кал говна.
Аноним 19/08/26 Срд 13:53:54 1682031 79
>>1682010
>Мимо сто лет не качал тюны со времен мистралей
Оригинальный слопоежка и слоподелатель, который туруршку делал и прочее, отправился в страну вечной охоты. Текущий рэдиарт это по мотивам.
Аноним 19/08/26 Срд 14:02:25 1682035 80
Аноним 19/08/26 Срд 14:03:58 1682038 81
/local/house с вопросом я к вам. Определился, что локалки для РП такое себе. Обмазался ВПН, виртуальной картой и закинул на счет геминьке. А для кума планирую подрубать локальные модельки.
Возникло два вопроса:
1. Сам факт наличия NSFW в контексте, но не в генерации, даст мне по жопе от фильтров гемини?
2. А как вообще джейлятся корпы и стоит ли этим заниматься, если я не скраплю ключи а на своём сижу.
Сорян если мимо, а ациге какой то ад и израилъ и помидоры.
Аноним 19/08/26 Срд 14:04:19 1682039 82
>>1681983
О, это вторая версия. Помню, прошлую я дропнул из-за того, отказы были постоянно. В сто раз жёстче геммы. Но сейчас по ней хотя бы еретиком прошлись. Настало время качать. Ну и я ещё штуки 3-4 от слоподелов-редиатров поставил на загрузку. Может что-то интересное попадётся.
Аноним 19/08/26 Срд 14:08:26 1682041 83
>>1681658
3090 стоит 80к, cmp50hx - 17. Думай
Аноним 19/08/26 Срд 14:11:04 1682046 84
>>1682041
А лол, уже 20. Я за 17 брал месяц назад.
Аноним 19/08/26 Срд 14:15:39 1682049 85
image.png 135Кб, 917x415
917x415
Luqwen3.5-4B Q6_k
Аноним 19/08/26 Срд 14:17:08 1682050 86
Аноним 19/08/26 Срд 14:23:16 1682053 87
>>1681719
>Так Qwen 3.8 вполне справляется
>24 минуты раздумий, 32к токенов
гемма в 3 кванте за 1500 токенов и 20 секунд отвечает:

Assistant:
Эта задача — вариация классических логических загадок (вроде «Волка, Козы и Капусты»), но с одним важным подвохом.

Анализ условий:
У нас есть три персонажа: Гоблин (Г), Принцесса (П) и Паж (Па).
Все возможные пары «без присмотра» приводят к плохим последствиям:
1. Г + П $\rightarrow$ Изнасилование.
2. П + Па $\rightarrow$ Соблазнение.
3. Па + Г $\rightarrow$ Смерть гоблина.

Если бы нам нужно было избежать всех этих событий, задача была бы невыполнима, так как при любой первой поездке на берегу остаются двое, и какая-то из этих ситуаций неизбежно случится.

Однако в вопросе стоит конкретное условие: «чтобы все остались живы».
Это значит, что нас просят избежать только одного сценария — когда паж убивает гоблина. Сценарии с соблазнением и изнасилованием, хоть и неприятны, не приводят к смерти.

Решение:
Нам нужно сделать так, чтобы Паж и Гоблин никогда не оставались вдвоем без присмотра.

Пошаговый план:

1. Перевозим Гоблина на другой берег.
На первом берегу остаются Принцесса и Паж. Она соблазняет его, но оба остаются живы.
2. Возвращаемся один.
3. Перевозим Принцессу на другой берег.
На первом берегу остается один Паж (он в безопасности). На втором берегу теперь Гоблин и Принцесса. Гоблин изнасилует Принцессу, но оба остаются живы.
4. Возвращаемся один.
5. Перевозим Пажа на другой берег.

Итог:
Все перевезены. Паж и Гоблин никогда не находились вдвоем без вашего присмотра, поэтому никто не погиб. Все остались живы.


На фоне того что она практические задачи выполняет как минимум не хуже квена (а если задачи хитровыебанные - то лучше) - я хз каким надо быть мазохостом чтобы заЛупным квеном пользоваться, у которого по сути все мышление основано на том чтобы десяток раз высрать рандомные варианты решений в ризонинге, а потом взять самое часто повторяющееся
Аноним 19/08/26 Срд 14:26:47 1682055 88
>>1682049
>исцелительница
Мда, хех, мда. Russeque.
Кинь сейм реквест Фифи.
Аноним 19/08/26 Срд 14:52:09 1682076 89
>>1681972
Никакой. Квен нихуя не знает ни в куме ни в твоих анимешных блядях, и тюном это не добавить
Аноним 19/08/26 Срд 14:56:24 1682078 90
>>1682053
А) Ответ квена НАМНОГО детальней, что ты упускаешь. Он написал диссертацию на тему задачи.
Б) Дефайн "практические задачи", потому что в хитровыебанных он явно сильней геммы.
В) Если у тебя нет задач требующих его дотошности - поздравляю. Потому что я живу в несовершенном мире, где такое внимание к мелочам играет роль.
Аноним 19/08/26 Срд 14:58:57 1682082 91
image 549Кб, 2292x1400
2292x1400
Бай зэ вэй, кто там писал что Гемма шлюха и прыгает на член по первой команде? Серафина точно так же не показывает титечки, зато щедро наваливает слопа про запах озона, лол.

В систем-промпте NSFW разрешено и одобряется. По факту в ризонинге рассуждает, что хоть юзер и требует бубенцы, это не соответствует характеру персонажа и лору карточки, поэтому хуй ему за обе щеки, а не голые сиськи. Ну умница же, не? Ещё слоп убрать - вообще хорошо будет.
Аноним 19/08/26 Срд 15:00:13 1682084 92
1781156248658.jpg 6Кб, 400x67
400x67
Чувак, ето репчик...
Аноним 19/08/26 Срд 15:02:42 1682087 93
>>1682082
Увы, ты только открываешь для себя психологию модели. Гемма очень ОЧЕНЬ хочет угождать юзеру. Она всегда будет стремится уменьшить трение с ним, подстраиваться под него. Притом из-за SWA она в начале довольно внимательна к системному промпту, то по мере раздутия контекста куда сильней начинают проявляться её базовые качества.
Аноним 19/08/26 Срд 15:14:54 1682097 94
Сегодня часа 4 общался с аблитерированным последним Квеном в максимально возможном кванте. Внушает. Задача у меня была не по коду, а сценарий для игры мы с ним обсуждали, на русском. Могёт. В две 24гб карты этот самый максимальный квант входит с 256кб q8-кэша, с тензорным параллелизмом даже на лламеспп скорость хорошая. Одно но: пользователя зовёт в рассуждениях своих "they", словно бы и не китаец он, а передовой американский либерал. Однако хорошая модель.
Аноним 19/08/26 Срд 15:20:25 1682104 95
image.png 185Кб, 939x550
939x550
>>1682055
Да какая Фифи, тут и Серафину долго уговаривать не пришлось. Надо быть трахнутой? Ну надо так надо
Аноним 19/08/26 Срд 15:24:04 1682107 96
>>1682097
но зачем аллитерированным?
вообще этому чудаку лучше контекст не квантовать. он очень полагается на свою шизу в ответах. Тут лучше квантовать модель, чем кеш.
Аноним 19/08/26 Срд 15:25:48 1682108 97
>>1682087
Анончик, А ЧТО ДЕЛАТЬ ТО? Альтернатив у русикодебила нет совсем
Аноним 19/08/26 Срд 15:28:11 1682110 98
>>1682087
СВА это вообще пиздец. Уж лучше сидеть на квене с полным контекстом, чем на гемме с её подзабывалками через определённый промежуток. Ужас просто.
Аноним 19/08/26 Срд 15:30:29 1682111 99
>>1682104
У тебя слишком длинный аутпут. Модель сначала исправно говорит нет, но потом, от невозможности продолжать сценарий с отказом, продолжает с уламыванием самой себя. Это норма. Первая часть ответа это то, что тебе нужно, остальное отсекай, это излишек.
Аноним 19/08/26 Срд 15:30:40 1682112 100
>>1682087
А там контекст и не раздуешь особо. На скрине 26b в Q8 без квантования кеша. На 40к - уже начинает сыпаться и шизеть. Может у плотнячка получше в этом плане, хз.

>>1682104
Ну, учитывая, что это 4b, оно даже неплохо. Порпшить что-то несложное на телефоне или древнем кудахтере на даче - сойдёт.
Аноним 19/08/26 Срд 15:31:07 1682113 101
>>1682110
--swa-full и проблема решена. Только нужно ещё две видюхи под контекст
Аноним 19/08/26 Срд 15:37:29 1682117 102
>>1682110
Ну тут ещё зависит от того, что смотрит на остальные токены. Если модель огромная, то, как правило, работает лучше, чем гемма. Хотя эта технология всё равно мёртворождённая, если смотреть на пример гемини, которая уж точно 1Т+.

Для рп сва сгодится, но для работы.. эта собака сутулая смотрит внимательно лишь на последние 1024 токена, иногда чуть больше. Были какие-то куммандиры или минимаксы там, где окно 4-6к токенов, но это не решает проблемы вообще, потому что в рамках работы нужно на 15к минимум. А с такими объёмами контекст будет весить невменяемо.
Аноним 19/08/26 Срд 15:40:49 1682118 103
>>1682038
> даст мне по жопе от фильтров
Она или проигнорирует, или если там цопэ выдаст ошибку

> джейлятся корпы
Учитывая что ты ключ оплачиваешь сам, оно того не стоит. При неоднократном обходе фильтров через неделю поймаешь бан. Просто юзай для рп как сам написал и кумь на локалках. И волки сыты, и аккаунт цел.

Мимо глажу некоушки на опусе
Аноним 19/08/26 Срд 15:44:05 1682119 104
>>1682010
> Чому? В чем проблема с их тюнами?
Это Лоры, а не полноценные тюны. Это не всегда плохо, но у чела там синтетический слоп, сгенерированный мелколокалками в качестве датасета, без фильтрации и прочего. Короче говоря, скормили хрючево и попытались на нём научить. Выше верно ответили, что sleepdeprived отправился в Вальгаллу. Это создатель РедиАрт, он делал модели серии Forbidden вроде Forbidden Safeword и другие. Ему не повезло, умер от рака. Я был на его лекции где он рассказывал, как собирал датасеты, он даже тулзами поделился, где-то на гите лежат до сих пор, никаких секретов. У него было упорство в создании этих датасетов и ИДЕЯ - он совмещал библию и кум в датасете. Это шиза, делирий, но зато со вкусом и узнаваемым почерком. Его заменил другой автор, FrenzyBiscuit, и вот он долбаёб, который мало того ничего не понимает, так ещё и не старается. И закрывает репы с весами своих говноподелий, как будто там очередь выстроилась за ними. Из последнего у РедиАрт хороша только Scotoma 2 - это рили Гемма 31 без слопа, её делал автор со стороны, один из квантоделов и иногда контрибьютор Лламы AesSedai. Мимо вывалил весь лор РедиАрта.
> Алсо есть ли годные тюны на 26b гемму?
Их в принципе мало. Мне очень понравилась https://huggingface.co/zerofata/G4-MeroMero-26B-A4B я даже логи на русике приносил, правда там Q8 и возня была с инструкцированием и сэмплерами. В треде её почему-то не оценили, тут в целом орудует банда радикалов, которые запускают только original fabric weights и запускают на виЭлЭлЭм и другое не поддерживают.
Аноним 19/08/26 Срд 16:02:52 1682126 105
>>1682119
О, PaintedFantasy от него помню, мне зашла в своё время. Штош, ну потыкаем, посмотрим. Спасибо. Хотя сноска в самом низу карточки, о том что 26b проблемная модель и заметно деградирует от дообучения, не обнадёживает. Вероятно поэтому на нее особо тюнов и нет, хотя казалось бы - народная моделька, достаточно умная и запускается на любом тостере.
Аноним 19/08/26 Срд 16:36:50 1682149 106
>>1682119
>он совмещал библию и кум в датасете.
Святой человек!
Аноним 19/08/26 Срд 16:55:49 1682165 107
image.png 180Кб, 926x529
926x529
>>1682104
Если посвайпать, то чаще все-таки отказывает. С русским есть проблемки, но в более ранних версиях было хуже, прогресс есть.
Начал грузить файлы на hf: https://huggingface.co/LLiserginov/Luqwen3.5-4B
Аноним 19/08/26 Срд 17:17:08 1682187 108
Посоны, чому qwen выкладывает свои модели в каком то ебанутом формате safetensors https://huggingface.co/Qwen/Qwen2.5-7B-Instruct
Они подумали о том как я это буду юзать на телефончике в PocketPal ?
Аноним 19/08/26 Срд 17:26:49 1682192 109
>>1682187
>формате safetensors
Чтобы кому надо могли сделать свой тюн или квантовать, как им нужно.
>Qwen2.5
Тебе эта модель не нужна, поверь. Скачай посвежее что-нибудь, хоть эту даже: >>1682165
Аноним 19/08/26 Срд 17:40:03 1682205 110
>Qwen2.5
Да я пока играюсь, проверяю че можно на дохлой мобилке у себя запустить и на пк
Сейчас вот проверил Gemma3n-E2B, пишут будто 3n спецом для мобилок, но какая же она тупая, заместо одного цикла в скрипте предложила 10 if подряд написать
gemma-3n-E4B поумнее, но там лишь 2.5 токена в сек, хуита
Походу мобилка в пролете, на пеке зато должно что то нормальное запуститься, ща проверим
Аноним 19/08/26 Срд 17:43:11 1682211 111
>>1682205
>gemma-3
Положи гайд из 1990го (до нашей эры) на место
Аноним 19/08/26 Срд 17:52:15 1682227 112
Взял таки cmp 50 20gb. Надеюсь пердолиться придется не сильно
Аноним 19/08/26 Срд 17:53:40 1682231 113
>>1682227
Пердолинга нет (на Линуксе по крайней мере), на двух системах всё на последних дровах работало
Аноним 19/08/26 Срд 17:56:48 1682234 114
>>1682205
>заместо одного цикла в скрипте предложила 10 if подряд
Напиши, что за задача у тебя
У меня есть Qwen3.5 4B и Luqwen3.5 4B. Я давал им пару тестов на код. С легкой задачей оба справились, на сложной оба обосрались.
Аноним 19/08/26 Срд 17:57:25 1682235 115
Аноним 19/08/26 Срд 18:08:44 1682255 116
>>1682235
>Рассказывай как там оно когда запустишь
Обязательно, только еще 10-20 дней ждать видеокарты-затычки в pci x1 слот. Возможно придется курить мануалы по тому как запускать все в headless режиме, чтоб не ждать
Аноним 19/08/26 Срд 18:12:18 1682263 117
>>1682231
>Пердолинга нет (на Линуксе по крайней мере)
Во что мой пердоликс превратили, в систему для домохозяек какую-то.
Аноним 19/08/26 Срд 18:14:15 1682266 118
>>1682227
Я попросил своего друга из Китая мне заслать 2080ti на 22гб, буду тестить. Если понравится — попрошу отправлять, буду риг собирать причмокивая
Аноним 19/08/26 Срд 18:15:22 1682268 119
>>1682266
> попрошу отправлять
Попрошу отправлять ещё и ещё*
Аноним 19/08/26 Срд 18:25:55 1682278 120
>>1682266
Я, если понравится, тоже думаю вторую докупить и по минималке с китайскими комплектующими сетап доделать, чтобы в комп потом обратно игровую карточку воткнуть. Я считал, с компонентами с авито примерно в 55-60к мне все обойдется за 40гб врама, дешевле только вкат через теслы
Аноним 19/08/26 Срд 18:26:53 1682279 121
>>1682234
Самый тупой скрипт - отобразить список файлов в текущей директории, предложить выбрать один и затем выполнить с ним команду, например удалить
Попробовал qwen3.5 4B - первый раз он написал скрипт на powershell, хотя я просил windows cmd, мб надо было windows batch указать или хз как еще конкретнее
Второй раз написал cmd, но без отображения файлов, просто предложил написать имя файла и дальше он бы выполнил команду
К слову нормальная нейронка с полуслова выдала идеальный скрипт
+ тут опять 2 токена в сек, так что в любом случае мобилка слишком слаба, буду пробовать еще на пеке что то поднять
Аноним 19/08/26 Срд 18:37:44 1682297 122
А возможен ли вообще параллельный скейлинг инференса? Вот например у меня видеокарта с какими-то врам и на ней запускается какая-то модель, в каком-то кванте. Если я докуплю вторую такую же карту и загружу туда такую же модель, как и на первую, могу ли я вместо запуска двух параллельно работающих моделей сделать так, чтобы у моделей был один контекст и они работали как одна модель, но у которой в два раза большая скорость инференса?
Аноним 19/08/26 Срд 18:39:36 1682302 123
>>1682297
Нет, но можешь параллельно второй текст генерить задёшево.
Аноним 19/08/26 Срд 18:46:13 1682309 124
>>1682279
А зачем просить нейросеть на мобилке писать код? Да еще и 4B. Ну как бы вполне ожидаемо что 4B модель в код не может, максимум работать под руководством более крупной модели.

Предназначение таких моделей это дообучение под конкретную задачу, очень простые задачи не требующие знаний (суммаризация, парсинг), простой вопрос-ответ с какими-то общими вопросами, либо чат-бот у просто знаний больше чем у обычного не ИИ бота. У нее банально нет знаний из-за размера для того чтоб писать код.
Аноним 19/08/26 Срд 18:53:01 1682313 125
>>1682309
Я нуб прост, меня только недавно стали устраивать ответы популярных нейронок, поэтому заинтересовался запуском моделей локально
Аноним 19/08/26 Срд 18:59:37 1682317 126
>>1682297
Поделить модель на две карты и ускорить - это режим тензорпараллелизма, требует быстрой скорости обмена между картами (x16 подключение у каждой или лучше nvlink). Если нужно ускорить просто множество разных запросов - data-parallel, или просто две назависимых инстанса с балансировщиком.
>>1682313
Хорошее качество = модель покрупнее = не заведется на телефоне. На нем и прикладных задачь с нейронками особо не существует, это чисто поиграться.
Аноним 19/08/26 Срд 19:08:35 1682323 127
>>1682255
У тебя совсем никакой карты нет? Тебе карта нужна только ОС поставить, а дальше можно её вынуть и работать удаленно через ssh. Если без графического интерфейса совсем никак, то можно поставить xrdp/vnc
Аноним 19/08/26 Срд 19:24:06 1682336 128
>>1682323
Не, она у меня есть. Я как раз говорил про то что не дождусь и буду искать как работать без интерфейса, там все чуть сложнее ибо интерфейс нужен для загрузки системы, иначе будет выдавать ошибку при запуске, если нет вывода на монитор. Там нужно прям в биосе что-то ковырять для этого.
Аноним 19/08/26 Срд 19:36:37 1682348 129
Аноним 19/08/26 Срд 19:38:14 1682350 130
>>1682348
Кодотюны Квена. На этом можно закончить.
Аноним 19/08/26 Срд 19:41:27 1682354 131
>>1682082
>запах озона
Я думал это только у меня гемма срет этим запахом озона, лол
Причем я так и не смог пофиксить, как не промтил, все равно проскакивает
Аноним 19/08/26 Срд 19:42:34 1682355 132
>>1682348
Надо будет скачать попробовать как кванты сделают. Первый был вроде и неплохой, но радикального апгрейда над ванильным квеном не ощущалось.
Аноним 19/08/26 Срд 19:50:18 1682361 133
Аноним 19/08/26 Срд 19:56:17 1682363 134
ЁБАНЫЙ РОТ! ЧТО ТАКОЕ?! ПОЧЕМУ КВАНТЫ С HG НЕ КАЧАЮТСЯ? НА ХРОМЕ ОНИ ПОСЛЕ СКАЧКИ АВТОМАТОМ ПРОСТО УДАЛЯЮТСЯ, А ЗАТЕМ НАЧИНАЮТ КАЧАТЬСЯ ПОВТОРНО. НА ФУРРИФОКСЕ ТАКОГО НЕ БЫЛО, НО СЕЙЧАС КАЖДЫЙ РАЗ С ОШИБКОЙ. ВЭПЭЭН-ХУЙНЭН НИКАК НЕ РЕШАЕТ ПРОБЛЕМУ!

ЦО ЩЕ ТАКЕ?????
Аноним 19/08/26 Срд 19:57:19 1682366 135
Давно не ел мистралей и их тюнов. Чёт захотелось поностальгировать. Что порекомендуете? Знаю что тут анон носится с Hearthfire, его прочекал, там с нулевой неследование инструкциям в q6, хуй знает, может проблема навыка.
Короче, ваши ЗОЛОТЫЕ ТЮНЫ МИСТРАЛЕЙ. Только не милфы, а Смолла 22-24б.
Аноним 19/08/26 Срд 20:01:12 1682367 136
Аноним 19/08/26 Срд 20:02:29 1682368 137
>>1682367
А чо сейчас не запустишь? В куме в самый раз может пойти.
Аноним 19/08/26 Срд 20:06:26 1682369 138
Аноним 19/08/26 Срд 20:14:06 1682373 139
>>1682368
24b был отличной моделью в своё время, но сейчас просто не выдерживает конкуренции. Он тупее, хуже следует инструкциям, всирает разметку, лупится, русик слабый.

Тот же квен лезет в 16гб врам в Q3_K_S и 64к контекста (Q4_1) и даст на клыка Мистралю по всем фронтам. Как и Гемма 26B в Q8, которая на любом калькуляторе заведется. Старичка сейчас есть смысл разве что от ностальгии запускать, вспомнить как деды кумили.
Аноним 19/08/26 Срд 20:17:20 1682375 140
>>1682373
Гемме креатива не хватает, а Квен сухой как пиструн деда. Мистраль норм себя показывает в куме до 16-20к контекста.
Аноним 19/08/26 Срд 20:19:19 1682378 141
>>1682348
Лучше стандартного квена было. Думаю юзабельно будет, но позже подождать qwen 3.8 35b, он должен быть значительно лучше
Аноним 19/08/26 Срд 20:23:32 1682380 142
>>1682366
Не тюны, конечно, но.
https://huggingface.co/OddTheGreat/Rotor_24B_V.1 - умница, следует инструкциям. В уги рейтинге был в топах среди 24б.

https://huggingface.co/OddTheGreat/NeutralGear_24B_V.2 - могёт в нейтральность и негатив к юзеру.

https://huggingface.co/OddTheGreat/Core_24B_V.1 - старый, немного поломанный, но интересный.

Запускаю иногда все три, брат жив. Но всё-же не чета современным моделькам, отпусти его, анон.
Аноним 19/08/26 Срд 20:27:04 1682382 143
>>1682375
>Гемме креатива не хватает, а Квен сухой как пиструн деда. Мистраль норм себя показывает в куме до 16-20к контекста.
Дипсик Флэш кстати в этом плане очень хорош на русском.
Аноним 19/08/26 Срд 20:29:52 1682384 144
>>1682317
>Поделить модель на две карты и ускорить - это режим тензорпараллелизма, требует быстрой скорости обмена между картами (x16 подключение у каждой или лучше nvlink).
Не "нужно", а "лучше иметь". Так-то режим будет работать и на такой кривой связке как х16/х4, и даже бонус к скорости будет, пусть далеко не такой, как мог бы быть. Но вычеркивать этот режим сразу не попробовав - не стоит, даже если железо, вроде бы, не располагает.
Аноним 19/08/26 Срд 20:32:31 1682386 145
it09zxtsxckh1.jpeg 769Кб, 3724x4096
3724x4096
>>1682361
Странно что вершиной на их графике теперь является Q8 а не их Q8_K_XL или новый Q8_K_L. Раньше по качеству у них выше всех всегда был Q8_K_XL.

14.3GB за Q4_K_S выглядит неплохо, жалко что без MTP. Но лучше уж 16t/s при контексте 50к чем 25t/s при контексте 20к.
Аноним 19/08/26 Срд 20:35:21 1682387 146
>>1682386
>Странно что вершиной на их графике теперь является Q8 а не их Q8_K_XL или новый Q8_K_L
Чел, эти графики нейронка делает, потому и так. Анслот это чисто копроративная параша, которая управляется и разрабатывается китайцем из подвала в Америке.
Аноним 19/08/26 Срд 20:38:20 1682389 147
>>1682279
Luqwen3.5 написал рабочий скрипт с промптом "Нужен скрипт - отобразить список файлов в текущей директории, предложить выбрать один и затем выполнить с ним команду, например удалить В виде .bat файла"
Единственное, он в скрипте комментарии на русском вставил типа "выберите файл" и они кракозябрами отображаются в консоли, но все норм функционирует, файл удаляется.
Аноним 19/08/26 Срд 20:39:18 1682391 148
>>1682384
> даже бонус к скорости будет
Будет при любом раскладе, только положительный знак в сделку не входит. От недостатка линка первое что пострадает - процессинг, второе - генерация на контекстах побольше, третье - с пустого. Когда там реально чипсетные x4 может случиться даже третий вариант. Чсх, довольно критична не только сама скорость, но и задержки, потому на чисто процессорных линиях с тем же числом будет лучше.
То что стоит его попробовать - конечно правильно пишешь, но на этапе выбора комплектующих и сборки лучше не питать иллюзий.
Аноним 19/08/26 Срд 20:39:22 1682392 149
1787161161485.png 464Кб, 2048x1003
2048x1003
>>1682378
35b тоже опубликовали
Аноним 19/08/26 Срд 20:40:25 1682394 150
image 5Кб, 250x68
250x68
>>1682386
>14.3GB за Q4_K_S
Было бы неплохо, но нет :( 14гб только iq залупа, у которой на русике мышки в киске скребутся.
Аноним 19/08/26 Срд 20:49:54 1682396 151
>>1682386
я нихуя не вiрю в эту идеальную ирюховую дугу
Аноним 19/08/26 Срд 20:50:42 1682397 152
>>1682396
*бирюзовую, пиздец как можно было так обосраться
Аноним 19/08/26 Срд 20:54:52 1682401 153
Аноним 19/08/26 Срд 20:58:27 1682403 154
1629696674969.png 390Кб, 451x619
451x619
А какой тюн/мердж геммы 31б по итоге сейчас базой считается? Чего-то трудно за ними всеми уследить. Вот недавно MeroMero v2 вышел, он ок?
Аноним 19/08/26 Срд 21:01:12 1682404 155
>>1682366
Слухай сюда и запоминай.

Дэнс персоналити энжин именно второй версии: хороший кум, хорошая болталка. Баланс. Хороший вариант и попиздеть, и подрочить. Но не может в кино. Для 99% случаев.

Брокен тут хуй знает какой версии от редиарт: просто слоповый и поехавший кум. Когда хочется, привязав себя к стулу, вставить в жопу дилдо, душить себя за шею, фантазируя о том, что месугаки смеётся над твоим крошечным членом.

Ещё был некий харбрингер или как-то так. Сломанная в каком-то смысле модель — у меня там почему-то не хотели умирать именные персонажи — но всё равно неплохая.

Ну и были отличные модели от Давида, однако я не вспомню их ебанутые названия. Типа клиффхэнгера или там дарк планет.
Аноним 19/08/26 Срд 21:12:04 1682413 156
>>1682403
Они все халупа однотипная. Тюны (а точнее лоры в 99% случаев) не меняют базовое поведение модельки. Максимум подсластителей добавляют.
Любой бери, ничего не поменяется. Чуда не произойдет, из геммы не сделать мистралика, из мистралика не сделать геммы.

Может быть полноценный файнтюн может спасти ситуацию, но простые васьки за такое не возьмутся.
Аноним 19/08/26 Срд 21:13:40 1682416 157
Аноним 19/08/26 Срд 21:14:11 1682417 158
>>1682394
HF считает размер по другому, в винде файл весит 14.3GB.
Аноним 19/08/26 Срд 21:17:12 1682419 159
>>1682416
А контекст куда складывать? Если на 16гб понятно, но на 12 гб это не выглядит юзабельным
Аноним 19/08/26 Срд 21:17:15 1682420 160
>>1682413
Ага, понял. А базовую модель никто тренировать не берется, только инстракт? Может хотя бы какая-то высокоранговая лора на базовой модели спасла бы ситуацию?
Аноним 19/08/26 Срд 21:19:50 1682421 161
>>1682413
>лоры в 99% случаев
>полноценный файнтюн
В чем разница? Какие сейчас есть файнтюны под РП на актуальные модельки чтобы потыкать сравнить с "лорами"?
Аноним 19/08/26 Срд 21:29:28 1682425 162
>>1682403
>MeroMero v2 вышел, он ок?
Для меня он лучше IQ4_XS Дипсика от Анслота и других моделей, тупа модель #1 из того что доступно. Это Гемма но со свайпами блять! Реально разными.
Аноним 19/08/26 Срд 21:33:05 1682427 163
>>1682420
А вот непонятно. Скорее всего базовую еще сложнее тренить.
Формально в ней уже должны быть знания, но какой именно корпус знаний там - хз. Может быть только очень базовые. Наверняка в инстракт моделях там сверху еще кучу свежих знаний добавляют, от всяких галлюцинаций избавляют.
И плюс чтобы научить рандомную говорилку быть нормальным собеседником - нужен недюжинный датасет, чтобы он именно то что надо отвечал, а не случайную дичь.
Вангую, внимание к контексту тоже на этапе инстракта тренируется. Это значит что нужен очень специфичный датасет с длинными диалогами.
Аноним 19/08/26 Срд 21:35:59 1682428 164
>>1682421
Лора оставляет базовые мозги как есть, по сути небольшой фильтр поверх весов добавляется, который чуть в другую сторону заставляет рулить.
Про реальные файнтюны хз.
Аноним 19/08/26 Срд 21:36:23 1682429 165
>>1682413
Этого не слушай, так было во времена когда все кому не лень жарили Мистраль. Сейчас в среднем по больнице продвинулись и тюны одной и той же модели, например геммы, от Драммера, Зерофаты, Грифе и прочих ведут себя по-разному. Скелет конечно тот же, Гемма, но стиль изложения и особенности, байасы у всех разные. Меро двачну, классная, и персонажи на ней более автономные и менее покладистые, ассистент почти вычищен
Аноним 19/08/26 Срд 21:37:09 1682431 166
>>1682427
Вообще наверное оптимальный подход в современных реалиях это брать годную аблитератку, и поверх нее лору наносить.
Или хотя бы мерджи с аблитераткой и базовой моделькой делать.
Аноним 19/08/26 Срд 21:40:25 1682433 167
>>1682420
Я делаю лору на базовую модель маленького квена. Могу сказать, что это очень сложно не получить лоботомита по итогу. То есть можно сделать модель, которая красиво пишет, эпитеты всякие сочные вставляет, при этом она будет класть болт на карточку, логику, любые инструкции. Думаю поэтому в основном и берут за основу instruct модели.
За фулл файнтюн обычным васянам вообще браться не стоит, получится абсолютно неюзабельный всем лоботомитам лоботомит.
Аноним 19/08/26 Срд 21:42:13 1682434 168
>>1682427
Нет, она легче натренится под конкретное не сколлапсировав как инстракт. Просто рп файнтюн - оче широкая тема, в ней важно сохранить мозги и осведомленность модели, что требует серии датасетов и подхода.
А васяны кроме прожарки гнилью ничего не умеют, спасает только натуральный демпинг лоры и дальнейшее ослабление при вмердживании. Если наложить это поверх уже готового инстракта - он будет больше напоминать осознанную деятельность.
> нужен недюжинный датасет
Именно. И не просто сырые данные, а качественные, хорошо отражнированные, описанные по множеству критериев чтобы потом выстроить правильную последовательность. И еще вагон общих вещей для фона на фоне которого будет усваиваться без отупления.
Аноним 19/08/26 Срд 21:43:39 1682435 169
>>1682429
Чего ж тогда до сих пор не сделали разнузданную кум машину из геммы или квена? Тоже самое было и с прошлыми версиями.
Да потому, что кум уже был в самих мистралях. Тюны только проявляли его.
В геммах и квенах нет кума, там нечего проявлять.
Аноним 19/08/26 Срд 21:45:07 1682436 170
>>1682435
Потому что изменяется стиль изложения и всякие мелочи типа добавления свайпов Гемме, размывание логитсов, а не добавляются новые данные.
Аноним 19/08/26 Срд 21:45:47 1682437 171
>>1682433
А в датасете у тебя что именно? Просто логи/книжки какие-то или еще с накинутыми карточками, саммари и другими условиями?
Аноним 19/08/26 Срд 21:51:27 1682442 172
Поеду смотреть cmp170 послезавтра. За 130к...
Что мне с собой взять? Я не очень понял формулировки взять с собой с драйвером правильным. Я просто запускаю с верным драйвером и там 64, а запускаюсь с неправильным - и там 8?
Аноним 19/08/26 Срд 21:54:59 1682446 173
>>1682442
> Что мне с собой взять?
Ствол
Прочитай инструкцию в репозитории. Очень внимательно и подробно, в первую очередь требования должно быть в системе. Потом установи. Если пропатченный драйвер уже установлен - карты будут видеться сразу с разблокированной памятью.
Аноним 19/08/26 Срд 21:58:01 1682447 174
>>1682434
>спасает только натуральный демпинг лоры и дальнейшее ослабление при вмердживании. Если наложить это поверх уже готового инстракта - он будет больше напоминать осознанную деятельность.
Вот это интересно звучит. Надо пошариться в тюнах и мерджах, делает ли кто-то так.
Мб в мерджах сила.
Аноним 19/08/26 Срд 22:02:04 1682450 175
>>1682447
> в мерджах сила
Могила. Сорта шизы и анальная вакханалия если утрировать в негативную сторону, средневековые алхимики, превращающие свинец в золото, если в позитивную. А могила потому что васяномерджеры убили всю сферу любительских тюнов, даже если кто-то сделает что-то годное, это утонет в бесконечном дампе.
Аноним 19/08/26 Срд 22:03:51 1682454 176
image.png 81Кб, 1030x658
1030x658
>>1682437
В основном у меня креативные тексты, часть на русском, часть на аглиском, включая эротику, написанные опусом 4.6, в основном от gryphe.
Затем инструкт датасет на русском от zeroagency, вычещенный от любого креатива, чтобы не перебивать тексты опуса.
Несколько семплов агентских задач с вызовом инструментов
Небольшой датасетик задач на математику, логику, код (150 семплов)
Переписки из собственного фронтенда, откуда мне удобно собирать логи, там вызовы моих инструментов и общие вопросы на русском.
Сейчас думаю еще пособирать притчи - на пике вот проверил, что сайт парсится агентом, значит и скриптами можно будет пособирать, потому что сейчас в основном переводы и мало нативного русского
Аноним 19/08/26 Срд 22:04:02 1682455 177
3213123.mp4 5955Кб, 704x1280, 00:00:13
704x1280
>>1682435
>Кум уже был в самих мистралях. Тюны только проявляли его.
Вот бы они перестали играть в МоЭ, который у них не откровенно не получается, и выкатили новую денс-модельку 22-24b, умную, следующую инструкциям, с легким контекстом, ммм. А там и тюны лоры появятся, и кум рекой польётся, как в старые-добрые.
Аноним 19/08/26 Срд 22:05:10 1682457 178
>>1682450
>даже если кто-то сделает что-то годное, это утонет в бесконечном дампе.
Для нормисов мб. Сейчас не такой большой поток тюнов, пусть даже лор, как это было год назад. В треде сидят заинтересованные и знают про ту же MeroMero v2, хотя у нее всего 500 скачиваний и у квантов 11к. По меркам ХФ это песчинки. Короче, это УЖЕ происходит, а здесь как раз заинтересованные аноны и делятся. Так в своё время сидели на Синтии (тюне Геммы 3, если кто помнит). За пределами треда и англоязычной рп тусовки её никто и не знал толком.
Аноним 19/08/26 Срд 22:07:54 1682458 179
>>1682369
База, только хотел написать
Аноним 19/08/26 Срд 22:08:03 1682459 180
>>1682427
>Формально в ней уже должны быть знания, но какой именно корпус знаний там - хз.
Там все знания. Вообще все что удалось напиздить. Можешь считать претрейн огромным словарем из токенов и самых базовых связей. Думать он не может, выполнять инструкции не может. Всё это уже делается дальше и это процесс еще более сложный чем просто скормить террабайты текстовых данных.

>Вангую, внимание к контексту тоже на этапе инстракта тренируется.
Нет, по большей части тоже на этапе претрейна. Чем более длинные куски текста модель кушает за раз вовремя предобучения, тем выше у нее условное окно рабочего контекста.
Аноним 19/08/26 Срд 22:12:31 1682463 181
>>1682446
Который в abobasixseven/unlock-cmp-170hx, который amoghmunikote/cmpunlocker или какой-то иной (GypsumLabs/cmp170hx-zh например, хотя в нём про 40/80 гб версию)?
Я бы посмотрел, но я что-то на двух работах работаю и я не могу найти время основательно изучить инструкции.

Я не понимаю как выполнить требования инструкции.
То что во втором гитхабе всё ясно, кроме того, что у меня нет материнки, которую я смог бы привезти.
То что в первом - ничего не ясно, типа "PCI Address: 0000:01:00.0" - это мне нужно добиться, чтобы такой адрес был, или это далее в командах ниже указано что пусть адрес такой будет для примера?
Аноним 19/08/26 Срд 22:12:35 1682464 182
>>1682457
Загибается тема постепенно, туда и дорога. Тут весь спрос идет от владельцев слабого железа, которым остается только перебирать вариации того что поместилось в надежде на новое, и даже они смекнули насколько гнилая тема.
> Синтии (тюне Геммы 3
Самая ламповая синтия была на второй лламе 70, эх. Но то был действительно довольно масштабный тюн. Или, например, магнум, то еще васянство, но отборное кумовство которое усвоилось и даже не сильно отупело.
> знают про ту же MeroMero v2
Все это оче спорная тема. Модель ошизела так, что одному поеху в его сценарии зашла, вот он и форсит ее постоянно. А может действительно что-то годное и настоящая жемчужина. В текущей ситуации даже трогать лень, после стольких попыток скачать модель по советам. Вроде бы и дум, но при наличии таких шикарных базовых моделей - нахуй нахуй, лучше упражняться в промптинге или увеличивать размер.
Аноним 19/08/26 Срд 22:13:50 1682465 183
>>1682464
>Модель ошизела так
>даже трогать лень
Не запускал, но уже все понял. До сих пор не понимаю, откуда в тебе столько негатива к тому, что ты даже сам не щупал. Это болезнь.
Аноним 19/08/26 Срд 22:16:50 1682466 184
>>1682459
>Там все знания. Вообще все что удалось напиздить.
Это если разрабы проявили милость поделиться награбленным.
Но я че-то сомневаюсь, что гугл просто так отдал бы свое мегаоружие, хоть и запеченное в весах. А у гугла-то наверняка датасетики поинтереснее, чем просто книжечки и рандомный интернет.
Аноним 19/08/26 Срд 22:17:19 1682467 185
>>1682465
Имаджинировал как ты по весне на улице в каждую кучу шоколада носом утыкаешься чтобы убедиться, фу.
> Это болезнь.
Это здравомыслие. Десятка испробованных васянотюнов хватило чтобы отбить желание.
Аноним 19/08/26 Срд 22:19:21 1682473 186
У мое есть какой-то плюс над плотными если они запускаются полностью в видеопамяти? Они типа генерируют быстрее?
Аноним 19/08/26 Срд 22:20:08 1682474 187
>>1682467
Это предубеждение, основанное на прошлом негативном опыте. Не представляю, что и как ты пробовал, что оно настолько тебе отбило желание. Понимаю, что ты там сидишь на риге и можешь запускать большемодели, но зачем нападаешь на обладателей отсутствия, которым ничего не остается кроме как искать годноту посреди свалки, я не пойму. Последовательно ведь этим занимаешься, транслируя в тред идеи тюн --> плохо. Ни к месту вообще, да и целеполагание не ясно. Логика из разряда Rigless? Just buy a rig.
Аноним 19/08/26 Срд 22:23:47 1682475 188
>>1682463
https://github.com/amoghmunikote/cmpunlocker
> у меня нет материнки, которую я смог бы привезти
Тогда, возможно, и не стоит на это целиться, просто в майнинге проверь. На фоне волнения в незнакомой обстановке есть риск не разобраться почему не билдит (не установлены зависимости), почему не ставит зависимости (забыл apt update/ркн), почему не скачивает (ркн), почему команды не выполняются (экзотичный линукс). И окажешься в неприятной ситуации, когда нужно принимать рискованное решение.
> это мне нужно добиться
При правильной установке патче после полного выключения и включения в nvidia-smi будет видно 64гига памяти, нейронки и прочее будут запускаться быстро. Мест где нужно указывать адреса шин и т.д. там нет.
Аноним 19/08/26 Срд 22:26:28 1682480 189
>>1682473
> Они типа генерируют быстрее?
Да.
Аноним 19/08/26 Срд 22:31:34 1682488 190
>>1682480
А чо у чела такая низкая скорость на моешке тогда? >>1682030 →
Это скорость как у плотной. Как я понял это может быть из-за того что он не включил DP2А на майнинг карте
Аноним 19/08/26 Срд 22:32:41 1682489 191
>>1681794
анончик, а какие веса выбрать, чтобы при этом компом можно было на фоне пользоваться?
Аноним 19/08/26 Срд 22:36:04 1682491 192
>>1682466
>у гугла-то наверняка датасетики поинтереснее, чем просто книжечки и рандомный интернет
Ну если не считать тот факт что гугл индексирует вообще почти весь интернет (как минимум весь западный), он имеет трубу и полный доступ к содержимому роликов. Может быть по этому язык той же геммы ощущается более насыщенным и "правдивым" в отличии от других локалок. Да даже в гемени это чувствуется, она иногда может что-то такое выдать, что используют только носители в бытовой речи. На гопоте, клоде и всяких других гроках этого меньше замечается.
Аноним 19/08/26 Срд 22:36:50 1682492 193
>>1682474
> Это предубеждение, основанное на прошлом негативном опыте.
Верно, здравомыслие, от неблагозвучной формулировки суть не меняется.
> нападаешь
Указать без украшений горькую действительность = нападение? Манямирок изобилия и счастья чтоли нарушил ненароком? Мой негатив направлен на штампующих мусор, из-за них теряются реальные тюны и люди, которые их делают, ужимаются квоты обниморды, подрывается весь имидж дерривативов. Тебе также стоит их хейтить. А если хочешь исправить - вести учет и искать действительно удачные, основательно описывая чем они хороши.
> Логика из разряда
Потушиться, вздохнуть 3 раза и еще раз прочитать пост. Можно еще пару раз если с первого не доходит. Упражняться в промптинге базы можно на любом железе, как и катать свою жемчужину, которую наконец нашел.
Аноним 19/08/26 Срд 22:37:54 1682497 194
>>1682489
Тебе тут не скажет, что брать лучше по итогу. Я бы взял hereric версию gemma 4 26b-a4b в q4 k m. Всё. Если 11 врам и 16 врам, то влезет, чтобы комфортно ПК пользоваться. Ясен хуй, не играми.
Аноним 19/08/26 Срд 22:38:45 1682498 195
>>1682489
Оставляй запас по опере в пару гигабайт хотя бы тогда проблем быть не должно. Если этого запаса не будет винда начнет свапать память и задействовать накопители. Если это ссд еще можно пожить, если хдд будет сильно хуже на своем опыте проверял.
Аноним 19/08/26 Срд 22:41:30 1682502 196
>>1682497
>Я бы взял hereric версию gemma 4 26b-a4b
Херетик это залупа которая делает из геммы еще более ебанутого есмена. Два разных пробовал, оба отупляют модель и вообще убирают отказы. Лучше уж тюн типа той же меро, он хотя бы под рп заточен а не под лоботомию ассистента.
Аноним 19/08/26 Срд 22:44:25 1682503 197
Как вы запускаете llama server? Вы ж каждый раз в консоли не вводите сохраненную команду со всеми нужными параметрами? Или вводите и я не один такой додстер?
Аноним 19/08/26 Срд 22:45:31 1682505 198
>>1682503
Батниками братик. Если раньше не пользовался попроси гопоту она тебе всё распишет.
Аноним 19/08/26 Срд 22:46:34 1682507 199
>>1682505
Так это тот же костыль. Команды только упакованные в скрипт
Аноним 19/08/26 Срд 22:47:02 1682508 200
image 20Кб, 736x414
736x414
Аноним 19/08/26 Срд 22:48:13 1682509 201
>>1682507
Ну раз для тебя это костыль, то тогда переваливайся на кобольд. Там кнопочки и вертелки с ползунками.
Аноним 19/08/26 Срд 22:48:39 1682511 202
Что думаете о модельках Драммера? Почему этот ебан вообще популярен? Никакой инфы о темплейтах или сэмплерах в карточках моделей, в его дискорде тупа 5 шизов решают какой тьюн лучше на основании вайбов да еще и лижут жопу ему. Ни одного хорошего файнтьюна от него не видел
Аноним 19/08/26 Срд 22:51:11 1682513 203
>>1682511
>Что думаете о модельках Драммера?
Дефолтный слоп для кумеров без особых требований. Один из OG тюнеров если так можно выразиться, ветеран, по этому за году набрал свою небольшую пачку хомяков. Но если честно, есть ебланы и более ебланские, типа редиарта.
Аноним 19/08/26 Срд 22:55:23 1682517 204
image.png 53Кб, 703x637
703x637
>>1682475
Материнку то я думаю, я стрельну у кого, наверное. Ну, системник, а райзер свой возьму.

Короче поставить убунту 24.04; драйвер указанной версии; найти в биосе, включить и проверить iommu; загрузить всё для компиляции под ядро, сам скрипт и все средства компиляции; так же заранее держать батник который просто в торче сделает расчёт на 4 гб видеопамяти если не разлочится, и батник для запуска лламы с 45 гб моделькой для теста - чтобы не набирать судорожно текста, а пару команд кликнуть.
Примерно так?

>>1682503
Вот такой скрипт для запуска генеришь. В консольке пишешь run_q и кликаешь таб для автодополнения до run_qwen38
На винде у меня просто батники или вообще питон-программа в пучарме, которая и ламу поднимает, и запросы на ней выполняет.

В принципе, тебе 30B моделька с первой-второй попытке напишет менеджер на питоне со своим протоколом, который будет в автозагрузке на сервере, а по запросу из клиента с кнопочками (или из визуального веб-интерфейса) будет запускать нужно тебе, лламу, комфи и так далее на нужном порте. Ты один раз его в автозагрузку, и всё. И даже загрузку новых моделей с хаггинга можно туда добавить.
Аноним 19/08/26 Срд 22:56:18 1682519 205
>>1682492
>Указать без украшений горькую действительность
С которой ты не знаком, о чем сам неоднократно говорил. У тебя буквально вся позиция "мне когда-то не понравилось, буду всем рассказывать, что это говно"
>Потушиться
И тебе того же. Хотя ты там на медленном огне, тихо, спокойно, без суеты душишь всех своим снобизмом
Аноним 19/08/26 Срд 23:00:15 1682524 206
>>1682503
Еще есть вариант скормить llama-server .ini конфиг пресетов через models-preset и каталог с моделями через models-dir.
И стартовать лламу все равно придется через скрипт. Можешь его засунуть в systemd-юнит, в планировщик задач, или куда тебе там удобно. Юзать скрипт гораздо проще, чем менять аргументы запуска во всех местах, где ты стартуешь лламу.
Отличие лишь в том, что llama-server после запуска будет ждать первого запроса к модели с заданным именем, и только тогда её загрузит. Как настроить жонглирование модельками в таком режиме не спрашивай, не разбирался.
Аноним 19/08/26 Срд 23:02:12 1682525 207
Аноним 19/08/26 Срд 23:04:49 1682528 208
>>1682503
Я llama-swap настроил, но по сути туда все равно запуск llama.cpp со всеми параметрами надо прописывать для каждой модели.
Аноним 19/08/26 Срд 23:07:23 1682532 209
>>1682488
Это я. А сколько скорость должна быть у этой геммы на картах этого поколения? (rtx 20xx).
Аноним 19/08/26 Срд 23:08:37 1682533 210
>>1682525
Да ладно тебе, можно позадавать тупые вопросы и сделать тред живее. Мне нравится общение с местными кумерами, они не такие высокомерные как кодеры, которые тебя сразу нахуй в гугл пошлют. Тут мужики нормальные сидят, сами были в таком положении и отвечают нубчикам на все.
Аноним 19/08/26 Срд 23:10:00 1682535 211
>>1682532
Я просто к тому, что мне хватает. Промпт 300т/с, генерация 35т/с. За 17к что я потратил это приемлимо для меня.
Аноним 19/08/26 Срд 23:10:30 1682536 212
Хотел спросить совета, но пока писал пост понял что я нихуя не сделал из того, что мог бы проверить самостоятельно. Короче всем спасибо, ушел ебаться сам.
Если кому всё же интересно, то пожилая мамка б450м начала сыпать черными экранами с раскруткой вентиля процессора на сто процентов от двух воткнутых видюх спустя пару месяцев нормальной работы. После возврашения к сетапу из одной видюхи все проблемы пропали разом. Я сильно перегибаю райзер во втором слоте, его первая основная видяха сжимает под 90 градусов, и сама еле устанавливается сверху. Причем вторая видюха находилась в полуподвешенном на райзере состоянии.
И вот хз, в чем вина. Толи просто контакты псин отходят/пережимаются, и решается вопрос банальным вторым райзером в основной слот с колхозом расположения. Толи цепи какие на плате не выдерживают, перегреваются или сбоят, и нужно менять мамку.
Есть ещё вариант забрать из основного компа вторую видяху и половину ддр, собрав чисто отдельный комп под нейронки 16/64, трены, генерации и чатики. Но это нужно понять есть ли жизнь на 16/64, скачивать Айр и третьи/четвертые кванты Геммы/Квена.
Но опять таки, всё это легко проверяется, я просто ленивая жопа.
Аноним 19/08/26 Срд 23:12:05 1682538 213
>>1682532
На rtx-ах не знаю, но на cmp 50 раза в два больше по идее. Я на своей 8гб карточке, при том что модель не полностью влезала в видеопамять, гонял ее со скоростью 15-20 т/с на 4 кванте. Если влазит полностью, то должно быть заметно выше
Аноним 19/08/26 Срд 23:13:11 1682539 214
>>1682533
> кодеры, которые тебя сразу нахуй в гугл пошлют
Вот сейчас обидно было. Я ж тебе ответил, а не послал.
Аноним 19/08/26 Срд 23:16:54 1682543 215
>>1682539
Не боись я тоже кодер, но считаю тебя почетным кумером
Аноним 19/08/26 Срд 23:18:43 1682545 216
>>1682533
>они не такие высокомерные как кодеры
потому что местным хочется общаться, они по этому трещат со своими кошкодевочками на локалках, им не хватает общения
мне вот точно не хватает общения, я только тут и обитаю
Аноним 19/08/26 Срд 23:19:15 1682546 217
>>1682538
Хз что можно сделать, она воткнута во второй слот, может из-за этого. Я смотрел хитрого чела с Ютуба, он действительно что-то затирал про компиляцию лламы и добавления DP2A, что-то припоминаю,но мне лень честно говоря, текстовая генерация меня устраивает. Вот в в генерации картинок она просто просто пердит как дряхлый дед, раз в 20 медленней чем 4070 из первого слота.
Аноним 19/08/26 Срд 23:25:42 1682548 218
Аноним 19/08/26 Срд 23:29:45 1682551 219
>>1682548
Если тебе не нравится нет смысла дальше на нем сидеть. Если нравится - нет смысла спрашивать тут и переходить на другое чисто потому что кто-то так тебе сказал. Вкусы у всех свои.
Аноним 19/08/26 Срд 23:38:38 1682559 220
>>1682551
просто она на промты забивает хуй и действует непредсказуемо
Аноним 19/08/26 Срд 23:40:49 1682561 221
>>1682463
> abobasixseven/unlock-cmp-170hx
Этот просто расписывает команды, которые надо прописывать. Шину которая там в скриптах можно посмотреть через lspci, вставив любую гпу в слот, в котором будешь тестить на своей материнке, чтобы заранее знать адрес, ну или если нвидия то nvidia-smi, вот у меня например там 00000000:17:00.0. Но эти скрипты прогонять не то чтобы обязательно вообще, они просто быстрый тест делают по регистрам, чекая, анлокнулось норм или нет
Аноним 19/08/26 Срд 23:49:19 1682569 222
>>1682559
Само собой потому что это какая-то химера ебаная в виде разрезанной на два кускам ламы 8B, которую потом прожарил шиз на редиарте. Переход на тюны минимум мисрали 12B тут обязателен. Там проблемы с инструкциями тоже будут, особенно с большими, но мозгов ощутимо станет больше.
Аноним 19/08/26 Срд 23:49:20 1682570 223
>>1682536
Слишком дохуя чего может быть не так. Может вообще БП
Аноним 19/08/26 Срд 23:57:10 1682575 224
image.png 80Кб, 811x727
811x727
image.png 168Кб, 2450x1292
2450x1292
>>1682348
Попробовал повторить одну сегодняшнюю задачу с Ornith-1.5-35B-Q6_K.gguf
Моделька сильно увлекается ризонингом. На просьбу продолжить реализацию по декомпозированным готовым TODO спискам, выдала несколько экранов размышлений, засрав этим дефицитный контекст наполовину, даже не приступая к решению задачи. Субагента для расследования состояния текущего говнокода, кстати, тоже не стала спавнить, чем забила на инструкцию из системного промтпа.

С таким же сетапом моделька Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q6_K.gguf сегодня решила несколько таких задач за рабочий день, для каждой задачи контекста главной сессии в 100к хватало с запасом. В общем, или у меня руки кривые, или моделька Ornith непригодна к работе с моим сетапом.
Аноним 20/08/26 Чтв 00:06:02 1682582 225
>>1682413
Да вот хызы. Файнтюн несложно, если есть датасет. Плюс тебя никто же не заставляет все слои тюнить. Обычно парочку верхних тюнишь и все норм. Для базового стайлтюна, можно вообще только аут веса можно подрочить.
У меня есть ощущение, что сейчас основная проблема в том, что васьки не умеют собирать датасеты. Точнее, это проблема всегда была, но два года назад у всех датасеты были в целом грязные, и на них как будто бы васясет лучше заходил. На текущих моделях, натрененных на вылизанной полу-синтетике, говно работает еще хуже, чем раньше.
Аноним 20/08/26 Чтв 00:27:14 1682603 226
>>1682502
>>1682508
Да я эти истории уже сто лет как слышу.

Сначала традиционную аблитерацию говнили, теперь еретик, который стал золотой серединой между мозгами и отсутствием отказов.

Отсутствие йесмена не из-за того, что норм пресерв хорош, и не из-за того, что модель якобы из коробки затюнена на реалистичные реакции. Это попытка уклониться от мрачного/неприятного сценария без прямого отказа. Модель заточена в первую очередь на это.

Если модель без ебанутых джейлов уровня асига и 10к токенов сис промпта, а с базовыми инструкциями на тему того, что разрешено писать a, b, c, d, как вести РП, отказывает генерировать ультра мерзопакостный текст о приготовлении сырной пиццы — модель говно и лоботомия необходима.

У меня все эти базовые модели, даже еретики (те, которым слабо взболтали мозги) сыпались на простой проверочной сцене:

Послевоенное время, голод. 14-летняя проститутка с прописанным бэкграундом, чья жизнь гроша не стоит. Я издеваюсь над ней на улице и под конец отслюнявливаю ей пару монет, бросая на землю. Никакого сексуального насилия.

Что делают базовые модели? Вообще пиздец начинается. Там и «характер», и «гордость», и «человеческое достоинство» у неё появляется, и даже неравнодушные прохожие, рыцари в белых доспехах. Какую только хуйню не придумывают — вплоть до того, что она даже не берёт монеты.

Модель, которой мозги хорошенько взболтали, совершенно иначе реагирует. Видно отчаянье ребёнка, которому никто не поможет, и безразличие окружающих, которым нет дела до очередного завтрашнего трупа. Видно унижение, когда она грязными пальцами отскребает гроши от камня. Потому что иначе может просто сдохнуть: её тщедушное тело никому не интересно, большинство занято выживанием, а те клиенты, что могут её снять, с высокой вероятностью свернут ей шею в порыве удовлетворить очередной фетиш или чтобы не платить и выкинуть её затем в канаву.

Нормальный еретик отлично чувствует эти нюансы и не отходит от темы. Сечёт бэкграунд, карточку, рассуждает об этом в ризонинге. Реакции персонажа естественны для вокруг происходящего ужаса, не ведёт себя куда более реалистично. Модель принимает правила игры и сеттинга.

Обычная модель же рассуждает так, словно действие вертится где-то между сейф спейсом, соевым порриджем, LGBTQ+ и парнем моей жены, подарившем мне Нинтендо Свитч в качестве награды за то, что я сделал вазектомию.

Это абсолютная мерзость, пакость, подлость, дрянь.

А йесмен если и возникает, отключается просто грамотным описением бэка персонажа/инструкциями ГМу. Это провернуть куда проще, чем заставить базовую модель не уклоняться от мрачных тем.
Аноним 20/08/26 Чтв 00:43:48 1682613 227
image.png 1030Кб, 2569x2686
2569x2686
>>1682582
>Обычно парочку верхних тюнишь и все норм. Для базового стайлтюна, можно вообще только аут веса можно подрочить.
Вот хз, если бы так просто было, никто бы лорами не занимался. Мне кажется это только для обычных мелкосеток годится.
А у ллмок за активационным слоем гига модель сидит, которая живет своей жизнью. Одну лишь активацию видимо недостаточно тюнить.
>васьки не умеют собирать датасеты
Вероятно.
Только не ясно как это фиксить. Чего не хватает. Экспертизы в составлении датасетов. Или дешевой раб силы для клепания датасета.
Аноним 20/08/26 Чтв 00:51:34 1682617 228
>>1682517
> убунту 24.04; драйвер указанной версии
Между этими двумя пунктами: apt update, установить gcc, make, хидеры ядра, питон и остальное что указано в репозитории. Дальше есть, но лучше сделать как можно раньше. Драйвер устанавливай сразу, для него карты не нужны. Можно и патч сразу накатить, убедившись что он корректно собирается. Это не быстрый процесс, если скрипт быстро завершается - что-то не так.
> включить и проверить iommu
Наверно не обязательно.
> заранее держать батник который просто в торче сделает расчёт на 4 гб видеопамяти если не разлочится
Да, пару torch.randn().to('cuda:0') с размером под четверть памяти, сложить, вычесть, умножить. С битой памятью уже на этом этапе сломается.
> для запуска лламы
Да, но лламу придется собирать под все архитектуры соответствующим аргументом, это долго. Иначе она просто не запустится ругаясь на не поддерживаемое устройство.
>>1682519
Вахтер-кун, вам бы подлечиться а не на говно исходить. А то чувства даже мимолетный ветер задеть может, не то что обсуждения в этом треде.
Аноним 20/08/26 Чтв 01:00:59 1682623 229
>>1682603
>теперь еретик, который стал золотой серединой между мозгами и отсутствием отказов
Не стал, еретик не имеет вообще ни одного юзкейса. Еретик это не тюн, он никак не влияет на знания, просто заставляет модель всегда отвечать, вызывая галлюцинации чаще в пару сотен раз. Грубо говоря вот спросишь ты как собрать нечто которое попортит кому-то жизнь, модель не обучали на создание вредоносных вещей, научили её отказываться. Еретик забрал у нее возможность сказать "нет" но не дал знаний для верного ответа. На выходе тупо бред или описание максимально общими словами. Есть какая-то польза? Никакой. Точно также в других сценариях.

Следование персонажам, сеттингу и другим нюансам можно надрочить промтами до какой-то степени и это будет работать. На гемме я пробовал в дарк фентези - кровь, кишки, насилие - всё это есть, она это описывает. Может не настолько красочно как кому-то бы хотелось, но "вайбик" и настроение она чувствует. Она даже сцену группового рейпа описала вполне себе сочно где персонажа в процессе разрывали на куски. Так что избавиться от позитивного байса можно даже на оригинале если постараться и прописать нормальную инструкцию где под конкретную карту будет конкретная инструкция а не что-то общее по типу "будь геймамастером наратором сторилейлером и отвечай за чара"
Аноним 20/08/26 Чтв 01:09:43 1682633 230
>>1682582
Все так и есть. Раньше модели были с минимумом инстракт тренировки и в рп просто терялись. Потому хорошо усваивали систематические закономерности из ролплей датасетов, подражая им, условная база выстраивалась в нужный порядок.
Сейчас модели уже умеют в это и сильно отформованы на следования инструкций. Чтобы усвоились стиль и положительный паттерны требуется хороший датасет с разнообразием и аугментацией, где под каждую историю есть соответствующие промпты без лишних повторений. Если жарить как есть то нарушается фундамент инстракта (генерация странной художки без запроса на нее), запоминаются все косяки датасета, частые фразы. Вот кстати для такого лора вместо полного файнтюна лучше срабатывает, она естественно ограничивает поломку и усиливает регуляризацию если объем датасета большой.
>>1682613
> Только не ясно как это фиксить.
Почему же, ясно. Но объем труда и компьюта только на подготовку датасета ужасающий получается. Нужна не дешевая рабочая сила, а квалифицированная, сборка пайплайна оценки-классификации-подготовки и куча сырья.
Аноним 20/08/26 Чтв 01:33:13 1682653 231
>>1682623
Ты описываешь событие совсем другого порядка. Да, в твоём кейсе скорее всего так и будет, но я не пытаюсь злые вирусы кодить или нечто. Более того, твоё нечто может заставить сирануть в штаны даже корпа, особенно если не давать абсурдную задачу сначала, а с подвохом, похожим на что-то адекватное.

Дело именно в том, что позитивный биас настолько силён, что руинит абсолютно всё. Для его устранения нужно не джейл писать даже, а километровое полотно на тему того, что и как нужно делать, буквально водить за ручку. Вместо РП ты начинаешь заниматься какой-то хуйнёй и в итоге превращаешь модель в Опуса с систем промптом 40к токенов, который заботливо выложен можно почитать на их сайте и просто охуеть.

Это не нужно. Если модель хороша, достаточно 400-800 токенов в систем промпте, не считая карточки — и поехали.

Вот в моём кейсе что не так? Там есть вся нужная модели инфа в карточке, что не способствует галлюцинациям. О мире, о персонажах. Но база себя так не ведёт даже с этой инфой, там максимум сои. И чтобы её давить, нужны километровые промпты. Внимание к контексту не резиновое, его длина тоже.

Вообще, для меня еретик — это именно удаление позитивного биаса в большинстве случаев, а не кум-вариант. Для кума скорее нужна традиционная аблитерация от huihui (или еретик с тюном как вариант), которая существенно плавит мозги, но полностью развязывает модели язык, поэтому такой вариант только для жёсткого порно. Ещё варианты от hauhau неплохие, но там от модели к модели разнится сильно.

А так тебя никакие промпты не спасут неправильного биаса в ситуациях "несовершеннолетняя, проститутка, издевательства", и так далее по списку. Модель будет искать любую лазейку, чтобы описать как-то иначе. И для каждого случая ты же писать промпт не будешь.

Да, что-то банальное типа дарк фэнтези базовая модель неплохо отыграет. Или даже военные действия современности. Или кровавую оргию культистов с относительно подробным описанием ебли. Но чем больше триггеров типа несовершеннолетних или действий, что считаются нарушением закона в реальном мире, тем хуже модель пишет.
Аноним 20/08/26 Чтв 01:34:43 1682655 232
>>1682633
>Если жарить как есть то нарушается фундамент инстракта (генерация странной художки без запроса на нее)
В таком случае подход через генерацию сеттинга в диалоге с нейронкой и последующий отыгрыш типа "я сделал то-то" или "сгенерируй в ярких деталях как моя елда проникает в ее вагину" давал бы какой-то существенный буст к рп. Но по-моему нейронкам похуй выступаешь ты в роли юзера, или напрямую отыгрываешь персонажа.

>Но объем труда и компьюта только на подготовку датасета ужасающий получается.
Ну сколько? Даже если за год распердеться, мне кажется было бы отлично. Такой датасет надо раз собрать, и потом его юзаешь всюду. Можно сверху докидывать новые семплы.
>Нужна не дешевая рабочая сила, а квалифицированная, сборка пайплайна оценки-классификации-подготовки и куча сырья.
Щас вайбкодинг развит, пили какие хочешь пайплайны. Голову на плечах только надо иметь.
Мне кажется общей картинки не хватает что и как должно работать. Ну и консолидации сообщества, чтобы узреть проблему и направить силы на ее решение.
Есть игры с охуевшими моддинг-комьюнити, которые пилят контент не хуже оригинальных разрабов. Здесь же какой-то подходящей платформы не хватает, где каждый мог внести свою лепту.
Аноним 20/08/26 Чтв 01:36:51 1682656 233
>>1682369
Спасибо анон! (мимо другой анон с той же траблой)
Аноним 20/08/26 Чтв 01:45:37 1682661 234
>>1682613
>Экспертизы в составлении датасетов
Зис
>дешевой раб силы для клепания датасета
Частично зис. Дешевая раб сила есть. Можно найти конторы анотаторов. За тысячу баксов можно почистить неплохой мелко-средний датасет. Пять контор уже протестили на работке. В прошлом году фаворитами были Кенийцы. Не сильно дорого, не кал как от гукешей, и не сильно все задрочено и вылизано. Но без понимания, чего ты хочешь, без экспериментов, и без некоторых приседаний, получится кал говна. Сейчас большая часть датасетов, готовится просто по принципу "накидаю всякого, авось прокнет".
> Вот хз, если бы так просто было, никто бы лорами не занимался.
Лоры просто делать очень сильно быстрее и проще, чем даже один слой при остальных замороженных затюнить. Ты можешь в сутки спокойно 2-3 лоры клепать на какого-нибудь квенчика. Если у тебя компьют есть, или тебе не жалко закинуть соточку на колабчик, то и того больше. Под каждый датасет по лоре.
Сейчас, конечно, на аутвесах дальше того, чтобы просто стиль текста поправить ну даже не стиль синтаксически, и не топику, тем более, а скорее преференцию токенов, грубый пример, можешь дрочнуть модель, чтобы она на шекспировском англюсеке говорила, модальный коллапс, конечно от такого приблизится ощутимо, но если 2-4 верхних слоях потюнить можно получить неплохой результат. Но датасеты. К примеру, для алайнмента и домен-тюнинга так и делали, клиенты не жаловались.
>Одну лишь активацию видимо недостаточно тюнить.
Ты терминологию путаешь немного. Активация --- это все, что не веса. Дрочишь ты веса.
>>1682633
>Щас вайбкодинг развит, пили какие хочешь пайплайны. Голову на плечах только надо иметь.
Вайбкодинг часто отключает голову на плечах. В случае с тюнами гораздо лучше найти какого-нибудь васяна, который смог, и спросить как он добился своих успехов. Некоторые челы просто так публикуют рецептики как чел, который Квопусы делает, ну а что вы хотели, других у нас нет.
>Такой датасет надо раз собрать, и потом его юзаешь всюду. Можно сверху докидывать новые семплы.
Карлики-мелкодрочилы и так хавают. А здесь нужно думать, работать, деньгу тратить. Плюс есть риск, что кто-то сольет твой уникальный датасет.
>>1682633
Ну вот тоже аналогичное заметил. Хорошо что не я один такой. Обычно говорят, что я утка, и уже сдрочил свой ресурс, поэтому мне не вставляет, а текущие лоры и тюны хорошие. Вот реально на рубеже 24/25 как будто бы дяди научились нормальные инстракты делать, и говно, которое обычно было в тюн датасетах просто перестало работать, если ты не сделаешь жесткую аблитку прям по диафрагму.
Аноним 20/08/26 Чтв 01:51:44 1682665 235
>>1682653
Ну посоветуй тогда еретиков каких или что ты знаешь, прочекаем
Аноним 20/08/26 Чтв 02:17:10 1682674 236
image.png 286Кб, 1159x898
1159x898
>>1681448 (OP)
Поделитесь своими ассистентами.
Аноним 20/08/26 Чтв 02:35:50 1682678 237
>>1682655
> В таком случае подход через генерацию сеттинга в диалоге
Это скорее про бардак в датасетах. Важные вступления и прочее обрезаются и идет сразу странный диалог, который сильно отличается от того, что модель бы дала по дефолту. Тренировка такого приводит не только к усвоению паттерна, но и бонусом ломает логические связи и прочее. Получаются йес-мены, шиза, а если что-то в таких огрызках повторяется то запоминаются систематические гоблины как в мистрале.
> Щас вайбкодинг развит
Так о том и речь, дешевая сила не нужна, нужно понимание что делаешь.
> Даже если за год распердеться
За год тем еще мастером станешь. Но квалификация будет уже такая что захочешь получать денежку и фидек, без них выгоришь раньше. И одним датасетом сыт не будешь, это будут постоянные улучшения.
> Есть игры с охуевшими моддинг-комьюнити, которые пилят контент не хуже оригинальных разрабов.
Вот тут бы такое заиметь было бы круто.
>>1682661
> на рубеже 24/25 как будто бы дяди научились нормальные инстракты делать
Можно еще порофлить что все дяди, которые раньше тюнили лламу и делали очень крутые для своего времени модели на ее основе перешли к корпам и продолжили свою работу уже там.
Аноним 20/08/26 Чтв 02:58:41 1682686 238
>>1682653
>чтобы её давить, нужны километровые промпты
Есть такое, но это плата за мозги. Вот взять тот же мистраль - позитивного байса там ноль, из коробки опишет страдания любой проститутки любого возраста. Но внимания и понимания ей хватает только чтобы не снимать по два раза трусы (чего в общем-то многим хватает), а как только от нее требуется описать сложный характер и долго его держать - пук, среньк, дефолтная виржин или шлюха. Два архетипа между которыми её может носить туда сюда от реплая к реплаю. Гемма от этого тоже страдает, но её можно зажарить инструкцией и показать как чар будет реагировать в разных ситуациях. На мистрали такое в принципе не возможно. Может на лардже только, но я его не гонял.

>Если модель хороша, достаточно 400-800 токенов в систем промпте
Таких моделей я еще не встречал. Как концепт звучит хорошо, но на практике их нету. Корпоратов не берем само собой.

>Модель будет искать любую лазейку, чтобы описать как-то иначе.
Вот именно это и происходит при недостаточно комплексной инструкции. Не знаю как в 800 токенов уложить все эти возможные лазейки которые будет искать модель. До конца понять поведение модели в разных ситуациях в принципе не возможно. По этому на текущий момент единственный варик - дополняющие друг друга системный промт и карточка, обе жирные на пару тысяч минимум.

>Но чем больше триггеров типа несовершеннолетних
На гемме кстати достаточно просто это обходится - просто не пишешь напрямую возраст. Вместо это опять описываешь желаемое поведение в зависимости от своих хотелок и просто пишешь что это молодая девушка с такими-то телесными параметрами. Но может и иначе тоже можно потому что итт я видел какого-то анона который канни карту гонял где указан возраст и умничке было похуй.
Аноним 20/08/26 Чтв 04:38:46 1682703 239
>>1682665
Я щас с телефона, так что только по памяти могу сказать.

На 3.6 и 3.5 лучше всего брать от hauhau. Но у него русик убит страшно на большинстве моделей, нужно только англ. Хотя вот МоЕ гемма от него лучше всех остальных вариаций, что я встречал по балансу мозгов и возможности творить максимальный треш. В 8 кванте. Именно МоЕ я тестировал вариантов штук 6, все того же кванта.

На 31б от hauhau тоже неплохо, но датасет там прибит так же сильно, ещё и qat ебаный. Что именно руинит — еретик или qat — непонятно. В большинстве случаев от llmfan сойдёт. И ещё был квант от какой-то "официальной" конторы, которая еретик вроде как делает, название не помню, а квант только на кудахтере есть. Он не такой хардкорный, как варианты от китайцев, но если не нужно что-то типа ЦП — лучший вариант, как мне показалось. Мозгов больше, чем у аналогов, и сои меньше. Но именно гемму я не так часто с еретиком использую. Обычные сценарии типа сай-фай, исекаев, резни лучше в базе как раз из-за чуть большего количества мозгов. Больше кина. Но как только начинаются темы с детьми, женщинами, терроризмом (литературным, не прикладным), крайне графичной жестью и темами, что общество максимально отторгает, без еретика будет очень слабо.

Ещё я пробовал всякие там аблитерих и прочие, но они мне не зашли. Или метод плохой, или реализация/кванты хуевые были: с отказами, поломанным языком, просто тупыми.

>>1682686
Ну, опять же, громоздкие инструкции убивают мозги просто из-за размытия внимания модели к контексту. Тоже так себе размен.

А мистраль.. с ним бы я тоже не сравнивал. Слишком старый и мертвый, хоть и красивей пишет всяких квенов и живей, чем гемма. Но он просто ужасен, его следование инструкциям хуже современных 12б. Кэш весит больше, чем моя мамаша, плюсов ноль. Я его качал недавно, так как меня современное говно заебало, решил поностальгировать, но мне стало плохо уже через пару сообщений и я его удалил. Ей-богу, чисто в теории какое-нибудь 9б говно с датасетом дикого порнослопа или охуительных синтетических историй by opus 4.6 дадут тот самый живой язык мистраля и кум магнума, ужас Давида, чо хочешь. Если бы тюны делали. Я бы даже покатал это дерьмо, когда нужна модель с одной задачей. Но уже нет народной модели типа немо, всё как-то вяло по ощущениям.

Мне кажется, держать сложный характер, а не один из сотни штампов — пусть сотни, но штампов — это что-то уровня не локальных моделей. По крайней мере, у меня такое складывается впечатление, так как я на постоянке юзаю корпов. Пропасть там слишком большая.

Вообще, я что-то подобное в качестве эксперимента поворачивал, когда зажаривал инструкциями карточку, но это годится для кого-то зирошот-сценария, что-то такого уровня. Если уж задрачиваться, гораздо работает инструкция, которая объясняет как следовать инструкциям. То есть описывается персонаж как обычно, но вот в сис промпт добавляются подробные пояснения, на что обращать внимание при отыгрыше, типа триггеров. Тогда модель намного сильнее учитывает характер персонажа, чем обычно, но и этому есть своя цена: если карточка не персонажа, а гейм-мастера, который управляет действиями NPC и мира, именными персонажами, внимание очень размывается. У меня таких карточек как раз большинство: 1-2 именных в контексте + NPC + обычный контекст, который тоже давит.

И что вы там такое пишете все в сис промпт? Я очень надеюсь, что, если там кум, то это просто в стиле "сексуальные сцены должны быть описаны максимально грязно, 2/3 сцены должны содержать подробные описания пологового акта и т. п", а не полотно про cock, pusy и как модели нужно выражаться. В треде кидал уже кто-то полотно это позавчера вроде.

Кстати, даже корпы иногда требуют анальной доработки. Если не говорить про кум, то гроку, гемини и прочим достаточно короткого промпта на отъебись, а вот с дипсиком кошмар невероятный. На нём катать невозможно даже обычные сценарии, там всё в лучах солнца и зайчиках, бесконечной любви к юзеру и сглаживани углов, и это даже никакой еретик не поправит. Зато он генерирует при всём этом сырную пиццу по инструкции "сырная пицца разрешена". Без всяких увиливаний.

Ну вот про лазейки — их невозможно охватить, если это не зирошот-сценарий. Ну, знаешь, какая-то особенная карточка, сцена, где всё идёт в основном по одному пути. Такие карточки писать тяжело, и они не так реиграбельны как всякие монструозные карточки с ГМами и лорбуками. На последних всё как раз сыпется, невозможно лазейки прикрыть, и встаёт вопрос, что больше убьёт мозги/экспириенс: еретик или монструозные промпты? В таких задачах, как по мне, еретик лучше, потому что ты можешь потратить токены на что-то более важное. Плюс у нас не q8 — даже если можем позволить себе большой контекст, он всё равно будет сыпаться уже на 60к, если это не квен.

Хак с возрастом, да, работает, но я такое не люблю, потому что проще тогда на апи сесть, если уж идёшь на компромиссы. А локалки для меня — это в первую очередь бескомпромиссность в решениях, возможность отыгрывать то, за что меня назвали бы absolutely poehavshim, и то, что нельзя показывать другим. И непрерывность процесса: я хочу быть уверен, что могу погрузиться. Могу вести обычную историю, а потом развернуть всё в сторону фарша, безграничного насилия. Или не сделать этого. И при этом не увидеть "Извините, я не могу генерировать такой контент, давайте..." Это ведь суть локала. В противном случае можно просто запустить ту же гемму 31б по апи. Настолько дёшево будет, что школьник может оплатить миллионы токенов с обеда.

Короче, в рамках локальных моделей я ожидаю не то, что могу увидеть по апи. История должна быть моей, а рамки должны быть ограничены только моей фантазией и возможностями модели. Без оглядки на анальную защиту разработчиков.
Аноним 20/08/26 Чтв 07:03:45 1682727 240
Почему даже еретичная гемма уходит в паетик вагунес и евфемизмы когда просишь секас?
Аноним 20/08/26 Чтв 07:05:12 1682729 241
>>1682727
Потому что надо прямо в инстракте указать ПЕШЫ ПЕЗДА И ХУИ БЛЯДИНА. Иначе будешь давиться мемберами и шафтами.
Аноним 20/08/26 Чтв 07:20:09 1682731 242
Чтобы вижн был без цензуры у геммы достаточно расцензуренного mmproj или сам safetensors-чекпоинт тоже должен быть расцензурен?
Аноним 20/08/26 Чтв 07:46:50 1682741 243
>>1682731
>достаточно расцензуренного mmproj
Щито?
Аноним 20/08/26 Чтв 08:21:32 1682751 244
>>1682731
mmproj же просто распознает что на фотке. Отвечать тебе или нет решает сама модель.
Аноним 20/08/26 Чтв 08:47:09 1682760 245
image.png 26Кб, 564x333
564x333
>>1682751
А его нельзя натренировать так чтобы оно просто помечало как "порно/нагота - выдать пользователю рефуз" вместо описания?
>>1682741
Пик.
Аноним 20/08/26 Чтв 08:47:47 1682761 246
Собрал датасет притч с сайта wisdomlib.ru
Можете заценить: https://huggingface.co/datasets/LLiserginov/russian_parabels

Как бы я использовал:
Отфильтровал притчи по категориям, какие мне нужны
Затем прогнал бы через гемму, чтобы она по тексту притчи, категории и названию сделала к притчам промпты вида "Напиши библейскую притчу о милосердии "Добрый Самаритянин""
Получившийся датасет перегнал бы в ChatML и закинул в обучение
Аноним 20/08/26 Чтв 09:50:55 1682779 247
>>1682760
У ммпрож нет цензуры никакой.
Аноним 20/08/26 Чтв 10:03:58 1682785 248
Пчеликсы, как у этой штуки с русским, кто-нибудь тестил? А то я все большие МоЕ перебрал для своего проектика - думаю стоит ли пробовать.
> Qwen3.5-397B-A17B-GGUF
Смущает, что это старая 3.5 версия. Мне нужна этакая "общая" способность вживаться в роль и держать контекст под 100к.
Аноним 20/08/26 Чтв 10:14:47 1682787 249
>>1682785
Дак дикпик поставь
Аноним 20/08/26 Чтв 10:19:56 1682788 250
>>1682787
Ставил и очень разочаровался. Его способность удерживать хронологию событий какая-то въебанная даже в оригинальных весах.

Допустим, случилось [что-то] чуть глубже в разговоре и он это помнит, а потом за следующие 10 сообщений события меньшей важности, влияющие на [что-то], словно теряются из его памяти. Он может вспомнить это самое [что-то] как оно было изначально, положив болт на промежуточные изменения. Короче я даже с геммой так не попадал в проблемную логику, как с дикпиком.
Аноним 20/08/26 Чтв 10:33:27 1682794 251
image 57Кб, 1125x590
1125x590
Все же как ни крути, жизни нет за пределами релизов геммочки. Прикиньте какая Гемма 5 будет умница, если из нее кодоунитаз не сделают.
Аноним 20/08/26 Чтв 10:35:41 1682796 252
>>1682760
чел, mmproj просто превращает картинку в токены понятные модели
Аноним 20/08/26 Чтв 10:42:24 1682797 253
Кстати, Q8 vs BF16 гемма 4 31B.

Есть ли смысол? VRAM под это надо просто дохуя, но вдруг она еще лучше!
Аноним 20/08/26 Чтв 10:45:36 1682800 254
>>1682761
Лучше бы сделал пони-датасет с ао3
Аноним 20/08/26 Чтв 10:50:40 1682804 255
>>1682797
Нет
> VRAM под это надо просто дохуя
96-128
Аноним 20/08/26 Чтв 10:55:22 1682811 256
>>1682804
Ну 128 там точно не надо, да и 96 тоже.

Q8 = около 35гб, а с 100к контекста оно где-то 44 гига жрет (еще на каждой карте по 2 показано в shared memory, но замедления не происходит и хз на самом деле что это за утечки такие).

То есть с подрезанным до 50 - 60к контекстом она влезет в 3 штучки RTX 3090, тобишь в 72 гига.

> Нет
Просто были очень громкие вскукареки, что квантизация сильно бьет по гемме и даже Q8 там не близко к lossless статусу
Аноним 20/08/26 Чтв 10:56:48 1682815 257
Почаны, думаю вот раскошелиться на Ryzen AI Max+ 395 коробочку с 128Гб памяти, поставить ее в свой хоумлаб, дабы нейроночки 24/7 гонять без энергожора 1квт в ч.
Что скажете? Оно вообще годное? Хочу модельки 70б запускать. 1-2 пользователя будет. Тесты в интернете какие-то ебанутые. Запускают 27-30б модели на таком объеме ОЗУ, за каким-то хуем. Да и даже с ними очень сильно результаты разняться. В части тестов вообще пишут, что гпт-осс 120б плохо работает. Хотя, на своей пека с 3090ТИ и A4000 я прекрасно дрочу гпт-осс без каких-то проблем с норм токен/сек, а памяти у меня там сильно меньше, чем в AI MAX+ коробочке.
Короче, есть владельцы итт? Что скажете?
Аноним 20/08/26 Чтв 10:59:25 1682820 258
>>1682815
Видеокарта уровня 3090ти и этот шайтан-бокс - совершенно разные вещи по вычислительной мощности. Единственный плюс этой коробки - то что там много памяти. Она годится для мелких плотных моделей или для средне-мелких МоЕ, но засунуть в нее плотную 70б будет самоубийственно по скорости.
Аноним 20/08/26 Чтв 11:04:40 1682822 259
>>1682686
>просто не пишешь напрямую возраст
Ещё можно про насилие не писать, и вообще отыгрывать сейфити РП.
Аноним 20/08/26 Чтв 11:06:19 1682824 260
>>1682820
Ну, это очевидно. Обучение меня не волнует, только инференс. И именно из-за объема памяти, в суммой с низким энергопотреблением, я и смотрю на коробочку. И прицел именно на 70б модели, но нормальных тестов, блджад, найти не могу.
>будет самоубийственно по скорости
Насколько? На каком беке? роксм или вулкан?

Алсо, есть ноутбук с Ryzen AI 7 350 и 32гб памяти. Так вот на нем, что на NPUgod bless amd, что на гпу - боле менее адекватно работают модели 12-20б параметров. Префил только ебанутый и может достигать минуты-двух. Но, в целом, адекватно.
NPU, кстати, вообще имба. Потребляет при инференсе 20Вт всего.
Аноним 20/08/26 Чтв 11:07:49 1682825 261
>>1682822
Вы про третью гемму что ли говорите? Четвертой вообще поебать, по крайней мере 31б которая.
Аноним 20/08/26 Чтв 11:31:10 1682839 262
>>1682824
>прицел именно на 70б модели
На какие такие 70б? Не существует моделей 70б, которые был бы хоть какой-то смысл запускать на чем-либо. Нет актуальных моделей такого размера.
На этой 128 коробочке можно запустить step 3.7 flash. Вот по этой модели можешь посмотреть, устроит ли тебя ее ум и устроит ли тебя ее скорость.
Аноним 20/08/26 Чтв 11:35:27 1682842 263
>>1682575
>Попробовал повторить одну сегодняшнюю задачу с Ornith-1.5-35B-Q6_K.gguf
>>1682575
>С таким же сетапом моделька Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-MTP-Q6_K.gguf сегодня решила несколько таких задач за рабочий день
Чел, ты условно сравниваешь школьника только перешедшего из начальной школы, и выпускника института который уже и на рабочей практике побывал. У первой в основе - туповатая MoE, вторая - на плотной 3.6, которая легко кодит вполне серьезные вещи по расплывчатому описанию хотелки.
Разумеется разница серьезная. IMHO - Qwen 35B MoE и его тюны для серьезной работы не пригодны. Их потолок - выполнять хорошо прописанные задачи-инструкции где места для своеволия минимум. Т.к. это классический "дурак с инициативой".
Аноним 20/08/26 Чтв 12:01:09 1682854 264
>>1682779
>>1682796
Ну оно же учится на парах капшин + пик. Почему бы не парах с письками не добавить капшин "запрещенный контент - нагота".
Аноним 20/08/26 Чтв 12:02:57 1682860 265
>>1682603
Два чая. У меня тоже подобное мнение, практически с языка снял.
У меня тоже подобный тест есть, но с другой ситуацией - прописано требование отыграть психа с искаженной common-sense логикой о том что хорошо, а что плохо (скажем - делать комплименты стиля "какая прекрасная жопа, только зачем ты ее под одеждой прячешь?!" с абсолютной уверенностью, что это именно изысканный, превосходный комплимент, и не в коем случае не может быть оскорблением/приставанием). Если модель сбивается на нормальное поведение, или там рефлексии - heretic таки нужен. Т.к. как раз он режет вот этот доминирующий поверх всего слой установок который заставляет модель выходить из прописанных данных/образа и писать "мягкую цензуру" даже с "пробивающими промптами".

>>1682623
>еретик это не тюн, он никак не влияет на знания, просто заставляет модель всегда отвечать, вызывая галлюцинации чаще в пару сотен раз. Грубо говоря вот спросишь ты как собрать нечто которое попортит кому-то жизнь, модель не обучали на создание вредоносных вещей, научили её отказываться. Еретик забрал у нее возможность сказать "нет" но не дал знаний для верного ответа. На выходе тупо бред или описание максимально общими словами.
Ты сейчас описал старую аблитерацию. Но относительно еретика здесь две ключевые ошибки:
1. Модель нельзя обучить "отказываться" не дав знаний "от чего". Т.е. модели прекрасно это все знают, возможно не на уровне "кино" но галлюцинировать не будут - т.к. знания о самих явлениях есть.
2.Правильно примененный современный еретик не забирает возможность сказать нет. Он дает возможность сказать "да". Это разные вещи. Грубо говоря - он снижает весь этот цензурный "нет" не до нуля, а до общего уровня, отсекая лишь векторы безусловного агра на определенные вещи, которые добавляются как цензура поверх, в последнюю очередь. Но если в тексте есть остальные векторы - они могут спокойно выдать "нет". Т.е. модель выдает чистую реакцию на ситуацию в тексте, без слоя искусственно добавленных цензурой весов. А промпт-пробивание - это фактически балансировка слоя цензуры еще одним слоем поверх ("плюс на минус")- от этого промпта. Если правильно угадал - результат будет идентичный еретику. Но если нет - итоговые веса таки сдвинутся в какую-то сторону, bias поведения будет смещен.

Еретик - тоже не панацея, его можно наложить криво, и тогда получаются те самые лоботомиты и yes-мены. Но потенциально - дает более чистый вариант поведения модели без перекоса от цензуры или ее пробивки промптом.
Как то так, IMHO.
Аноним 20/08/26 Чтв 12:02:58 1682861 266
image.png 487Кб, 1200x647
1200x647
>>1682842
Увидел про кодотюны божественного квена >>1682350, вот и захотел сравнить на реальном примере. Разочаровался. По циферкам в бенчах квен MoE от Dense не особо-то отстает. А на деле, ну ты и сам сказал.

Кстати, какие есть возможности подтянуть knowledge cutoff до ближайшей даты? Имею в виду, не циферку, а реальные знания. Может, есть лоры какие? Или только через RAG и webfetch в контекст инжектить?
Аноним 20/08/26 Чтв 12:39:11 1682897 267
>>1682860
>У меня тоже подобный тест есть, но с другой ситуацией - прописано требование отыграть психа с искаженной common-sense логикой о том что хорошо, а что плохо (скажем - делать комплименты стиля "какая прекрасная жопа, только зачем ты ее под одеждой прячешь?!" с абсолютной уверенностью, что это именно изысканный, превосходный комплимент, и не в коем случае не может быть оскорблением/приставанием). Если модель сбивается на нормальное поведение, или там рефлексии - heretic таки нужен
Ну вот гемма 4 может так делать а гемма 3 нет. Ты ща скажешь что не может, и побежишь накатывать лоботомию - вот и поговорили... Лоботомия - путь наименьшего сопротивления для тех, кто дальше "ПЕШЫ НСФВ" в написании системных промптов не ушел, да еще и считает, что 10к токенов это много (лолнет, гемма даже с 20к промптом, где промпт = инструкции + карточка, спокойно может на своем горбу еще и 50к контекста чата тащить).

> пробивающими промптами
Так называемая пробивка жесткой цензуры и рефлексии - удел моделей прошлого поколения и всяких китаекальных квенов.

Я бы назвал куда большей проблемой внутренние ассоциативные цепочки моделей. Когда модель согласна генерировать что-то, но генерирует не так, как ты хотел бы. Секс ассоциируется с жестким сексом, ведь в датасетах преобладали книги с порно-контентом для обезумевших свиноматок. Няшиться-милашиться модели не умеют, для педычей пишут прокуренных блядищ вместо настоящих карлиц. Тут еретикуй не еретикуй, все равно получишь хуй. Инструкции так или иначе нужны, карточки хорошие нужны. Насрать большим промптом и длинной карточкой - не беда и не проблема, а вполне рабочее решение.
Аноним 20/08/26 Чтв 12:59:39 1682929 268
>>1682785
Если не нужен вижн - дипсик попробуй. То что 3.5 компенсируется параметрами, особенно если тебе что-то около рп. Если более прикладное - ornith ее тюн есть.
>>1682797
Если у тебя есть врам на 8 или тем более 16 бит - лучше не приближаться к квантам, которые начинаются с q или g на расстояние выстрела. Остальные действительно лучше, для фулл геммы 96гигов хватит.
>>1682815
Позволит запускать модели под эту память, но скорости так себе и пердольно. Другие модели кроме ллм вызовут боль из-за слабого компьюта. Если пожадничаешь с кэшем - на двух юзерах будет постоянный пересчет контекста, а считается он медленно. Также, одновременные длинные запросы будут невозможны из-за отсутствия paged attention.
Аноним 20/08/26 Чтв 13:21:15 1682947 269
>>1682897
>Ну вот гемма 4 может так делать а гемма 3 нет. Ты ща скажешь что не может
Ну за меня то не решай. :)
Гемма 4 - да, у нее этот слой цензуры гораздо тоньше и дырявый. С ней часть сценариев вполне можно и так проводить, на стоке. А вот Qwen 3.5 и далее - нет. Но гемма меня мало интересует. Мне длинный контекст важен - раз (он у геммы конечно есть, но вот удержание деталей из него...), и меня раздражает ее стиль письма - два. Не что-то конкретное, что можно промптом поправить - а в целом. Просто не моё. Квен лучше заходит, особенно новый 3.8, которому "гуманитария" в речь добавили на ряду с "технарем", и получилось как раз то, что надо (мне). Ну и тюны, естественно.

Что касается длинных промптов - я только за, это даже с прошлым поколением работало, но честно говоря, мне просто лень уже 5-10K писать ради того же самого, что можно получить просто взяв еретик. Я лучше это время и токены потрачу на прописывание характера и лора.

Про ассоциации - вот тут на все 100% согласен. Это частично можно поправить промптом, но увы, только частично. И тоже достает - разжевывать модели для себя очевидное. Кстати, вот здесь мне qwen тоже лучше заходит - он тупо лучше понимает, что от него хотят, и с меньшими усилиями. Ну да, во многих областях описаний "кИна не будет". Но хоть общую логику держит, и мне это как-бы важнее в большинстве случаев. Так-то в eRP подвод (флирт, интриги и прочее) к основному действу квен вполне нормально выдает, а жесткое порево в откровенных деталях... Ну уже интереса не так много - не школьник, насмотрелся уже, и нового там вряд-ли увижу. Так что, можно куда-то еще сунуться, если припрет. :)
Аноним 20/08/26 Чтв 13:23:47 1682949 270
>>1682947
>А вот Qwen 3.5 и далее - нет.
у 3.5 шизоцензура, у 3.6 полуцензура, но я бы не стал на нём ролеплеить. у 3.8 не особо то много цензуры в принципе, он куда лучше системный промпт слушает. но ролеплеить разве что на английском.
Аноним 20/08/26 Чтв 13:40:50 1682964 271
>>1682949
>но ролеплеить разве что на английском
Ясен пень.
А если говорить за ролеплей на квенах на русском - есть пара тюнов, условно - приемлемых, которые немного лучше, и вроде как выдают не совсем шлак. Но не более.
Вот просто русский текст гнать по запросу/черновику - это в принципе он может, если тебе не влом его потом носом в косяки тыкать и говорить - "переделай здесь и здесь", и "... - это как?" Последовательными итерациями от него можно добиться вполне читабельный вариант. Собственно - тоже отдельный способ развлекаться, под настроение. :)
Аноним 20/08/26 Чтв 13:51:55 1682969 272
Аноним 20/08/26 Чтв 13:54:07 1682970 273
images.jpg 50Кб, 459x435
459x435
>>1682348
>ornith
Так это всё скам, ты какого хуя вообще написал об этом? Увидел что миллионы скачиваний и решил что это норм тема? Бро это обычный бенчмаксед квен, блять у них на сайте буквально написано что это дохуя самообучающиеся модель, текст слоп, даже написана линейка моделей которая не соответсвуют тому что есть, про 35b не говорят что moe, а про 31b вообще забыли. У проекта 50 пользователей, всё остальное накрутка
Аноним 20/08/26 Чтв 14:20:00 1682985 274
вышло ли что-то лучше gemma 4 26b a4b для сочнейнейшего куминга?
Аноним 20/08/26 Чтв 14:21:23 1682986 275
Аноним 20/08/26 Чтв 14:28:16 1682991 276
Аноним 20/08/26 Чтв 14:29:16 1682993 277
Аноним 20/08/26 Чтв 14:45:53 1683005 278
Аноним 20/08/26 Чтв 14:54:44 1683012 279
Аноним 20/08/26 Чтв 14:59:09 1683020 280
>>1682985
muse glimmer 30b (аблитератки, я лично пробовал от darkc0de). Единственная которая без всяких подталкиваний в system prompt или диалоге, посреди процесса, сама вдруг написала мне что толкнула меня на пол и села мне на лицо. Просто блять прямым текстом. Ну и продолжила непотребство творить дальше пока я не обкончался. Даже клод (без подталкиваний в промптах) так инициативно и сильно никогда сцену не меняет
Аноним 20/08/26 Чтв 15:11:03 1683030 281
>>1683012
Полная хуйня этот Дипсик. Не представляю что в нём нашли для рп кроме QAT с завода и возможности запустить большую няшу в железе разумных пределов. После 15-20к сваливается в слоп, хуево следует инструкциям, превращается практически в Мистраль. Для кода и как ассистент с максимальным ризонингом няша, для рп не годится. Даже для кума, потому что соевый.
мимо
Аноним 20/08/26 Чтв 15:23:33 1683037 282
>>1683020
Какой квант? С ризонгом гонял, много контекста держит? Поделись подробнее че там. Или ты так, быстро покумекал на 10к?
Аноним 20/08/26 Чтв 15:36:54 1683043 283
>>1683030
В принципе для рп локалки в целом не особо годятся, за исключением жирных моделей. Че греха таить. Кумить - да. А для всего остального есть 5$ на миллионы токенов.
Аноним 20/08/26 Чтв 15:39:11 1683044 284
>>1683043
Неправда. Гемма 26/31 и Квен 27 очень хороши. Есть мягкие аблиты и тюны, которые не лоботомируются, а кто-то и на инстракте умудряется. Гемма в норм кванте спокойно 60к контекста держит, Квен и того больше. Если выйдет Гемма 120-200б МоЕха, тогда облачному рпшингу совсем оварида настанет.
Аноним 20/08/26 Чтв 15:39:31 1683045 285
Аноним 20/08/26 Чтв 15:40:26 1683046 286
>>1683030
>превращается практически в Мистраль
Так мистраль это база
Аноним 20/08/26 Чтв 15:40:34 1683047 287
>>1683044
> Если выйдет Гемма 120-200б МоЕха
По-моему надежды уже не осталось.
Аноним 20/08/26 Чтв 15:41:35 1683048 288
>>1683047
Когда-нибудь будет Гемма 5. Может быть Гемма 4.5. Откуда знать? Может четверку и не выпустят в таком размере, но это не значит что её прям никогда не будет.
Аноним 20/08/26 Чтв 15:53:02 1683057 289
>>1683044
> Неправда.
Анон, не заставляй меня писать очевидное, что геминька в хвост и в гриву в рамках рп рвет наших мелких аутистов.
Я просто не понимаю за что копротмвляться. С кумом да, проблемы (сорян, но джейлбрейкать на основном аккаунте не лучшая затея). А так локальные малыхи это именно про хобби, свой пердолинг, изучение и всякие эксперименты.

А для обычного РП.. ну корпы есть корпы. Это и нерелейтед и нет смысла обсуждать. Я как попробовал SFW на них, так сидел с лицом лягушки: а, вот оно как может быть.
Аноним 20/08/26 Чтв 15:56:19 1683060 290
>>1683057
Давай, пиши, рассказывай, показывай логи, да хоть что-нибудь, кроме надоевшего "там ведь точно лучше". Посмотрим, что там такое ебаться как крутое. Потому что я точно так же тыкал корпов и большой разницы не увидел. Да, скорость выше конечно, да, пишет лучше всех моделей прошлого года. Посидел-посидел, хуй забил и вернулся на свою локальную Гемму, не чувствуя себя недочеловеком.
Аноним 20/08/26 Чтв 15:57:40 1683061 291
IMG202608201554[...].jpg 131Кб, 933x616
933x616
>>1683020
Двачну этого. Пробовал слабенькую аблитератку с маленьким KLD не помню от кого, может тоже от дарккода (там у чела их две, v1 полностью отбитая и v2 полегче, вот вторая), единственная модель которая без промптовых пинков под зад сама ловит нсфв вайбик и не использует length-ы, wetness-ы и прочие shaft-ы и в последующем процессе не ходит вокруг да около. Кокбенч off the charts. Фифей при нейтральной просьбе описать прикрепленную картинку называет напрямую l*li лул, я такого еще не видел нигде. Короче цукерящер в этот раз из правильных групп фейсбука датасеты собирал

Единственное что плохо - на всякой экстримальной шняге она очень долго сама с собой обсуждает цензуру в ризонинге, вот прям очень долго пытается убедить себя что да всё норм, в конце концов забивает болт конечно, но токенов много тратит, а токены на 30б плотной это больно. Может стоит v1 попробовать, но там по бенчам лоботомия уже начинает быть заметной

А, и слопа очень сильно меньше чем у геммы, даже меньше дипсика наверно
Аноним 20/08/26 Чтв 15:59:13 1683063 292
>>1682313
Продолжаю эксперименты, теперь уже с ПК
Скачал модельку, которая ранее выдавала на телефоне 2TPS (qwen3.5:4b), на пеке же она работает оче быстро:
>eval rate: 61.73 tokens/s
Единственное приходится think отключать, он чет дохуя долгий и не понятно нужен ли вообще
Кста я понял еще что на телефоне один хуй нет смысла локальные модели запускать, так как батарея выжирается пиздец как быстро. Я за часик тестов высадил под 40%
Аноним 20/08/26 Чтв 15:59:41 1683064 293
>>1683057
Кими К3 локальная модель, технически
Просто в треде одни нищуки, а так к уровню гемини подобраться вполне возможно
Аноним 20/08/26 Чтв 16:00:20 1683065 294
>>1683061
Аблитератка спорит с собой по цензуре в ризонинге? Чет печально как-то. Посмотри все же какая именно у тебя была. Заинтересовали мусей, я её скипнул вообще. Не тестил даже ванильную. Какой квант? Или ты vLLM боярин?
Аноним 20/08/26 Чтв 16:01:07 1683067 295
>>1683060
> Давай, пиши, рассказывай, показывай логи
Правильно ли я понял, что тебе нужны логи, чтобы доказать что опус или гемини лучше пишут чем 31b гемма?

> не чувствуя себя недочеловеком
Каждый раз одно и тоже. Ты как религиозный фанатик, чью священную корову я ткнул. Да при чем тут вообще это? Ну просто они лучше пишут, лучше понимают контекст. Лучше проза, лучше следование инструкциям. Больше знаний всяких вселенных, персонажей. Они берут за это деньги. И за деньги ты получаешь продукт лучше.
Это не делает тебя или твои интересы хуже, недочеловеком или чем то другим.
Аноним 20/08/26 Чтв 16:03:53 1683068 296
>>1683067
Чому сразу фанатик-то? Я просто действительно не вижу разницы. Слоп есть и там, и там. Направлять модель нужно и там, и там. Я реально не вижу то, что ты видишь ты, и в моей картине мира разницы нет. Потому я не понимаю всех тех, кто приходит рассказывать, как там все лучше. Что качественно изменилось-то у вас? Расскажите, покажите, чтобы я понял. По пути может сами удостоверитесь, что разница не так велика, и вами управляет идея "больше - лучше", а может мне глаза откроете, и я пойду на корпов.

Каждый раз когда просишь показать/объяснить ничего кроме общих формулировок так и не получаешь, с последующим сливом.
Аноним 20/08/26 Чтв 16:04:53 1683070 297
>>1683064
Кими номинально локальна, а практически она в размере не предполагаемом для локального инфиренса мимокроком.
И это не только в треде. Обычному смертному в принципе не доступно такое железо: оно ему банально нахуй не нужно.
Аноним 20/08/26 Чтв 16:06:31 1683073 298
>>1683065
Блин, ща не глянуть от кого именно. Q8 квант
По цензуре думоет на несколько сотен токенов но всегда игнорирует под конец
Советую попробовать, разные аблитки потыкать. Чувствуется как гемма из которой слоп вырезали не тронув остальное, очень приятная модель
Аноним 20/08/26 Чтв 16:07:47 1683074 299
>>1683068
>Каждый раз когда просишь показать/объяснить ничего кроме общих формулировок так и не получаешь, с последующим сливом.

Да я ссыкло, что не выложит логи, чтобы никто в треде не узнал какое я чубинье в РП. Сорян, но это как душу раскрыть. Это мой приключач и мои чаты и мне банально стыдно что либо выкладывать.

>Чому сразу фанатик-то?
Да уже не знаешь как написать, чтобы не задеть очередную тонкую душевную организацию и не спровоцировать срач на кучу постов с бросанием говном.
Аноним 20/08/26 Чтв 16:11:06 1683077 300
>>1683073
Если потом будет варик узнать чья была аблитка, чекни и отпишись, пжлст. Потыкать-потыкаю, как время будет. Может потом с логами приду, если там золото.
>>1683074
Логи не дашь, конкретику не дашь, просто очередное "корпы лучше". Так и зачем тогда провоцировать такими тейками? Экстраординарные утверждения требуют экстраординарных доказательств, слыхал наверняка. Ну подумай сам, какая цель у твоих постов и какую реакцию ждать. Тут локальный тред, люди здесь по дефолту с установкой, что локалки не хуже. Я например в соседнем копротреде сидел пока себе 4090 не купил с рук для игр и заодно не понял, что Гемма и Квен дают 80% того, что дают корпы, только исключают из уравнения тряску за ключи или чеканную монету.
Аноним 20/08/26 Чтв 16:13:06 1683079 301
>>1683077
>Ну подумай сам, какая цель у твоих постов и какую реакцию ждать
Ну вообще ты прав. Просто хотелось наверное поделиться, так как я никогда корпами не пользовался, вне рабочих задач. А тут оплатил потыкал @ мартышке радостно. Буковки какие надо. За сим закроем нерелейтед.
Аноним 20/08/26 Чтв 16:30:28 1683094 302
Аноним 20/08/26 Чтв 17:33:05 1683136 303
нужен ли pci-e 4.0 рейзер для второй моей нищей затычки или 3.0 сойдет?
Аноним 20/08/26 Чтв 17:37:45 1683140 304
Аноним 20/08/26 Чтв 18:07:07 1683160 305
>>1683012
База
>>1683030
Он вполне себе няшная умница, и на 150к играется комфортно. Есть до чего доебаться, но в целом умный и приятные вайбы тройки.
> хуево следует инструкциям, превращается практически в Мистраль
Инфиренсопроблемы
Аноним 20/08/26 Чтв 18:10:09 1683161 306
>>1682794
>какая Гемма 5 будет
У гугла же дипмайнд всёкнулся и все разбежались, что они даже релиз про версии отменили нахуй. Геммы может больше и не быть, там сама Гемини под вопросом.
Аноним 20/08/26 Чтв 18:10:48 1683162 307
>>1683064
> Просто в треде одни нищуки
Тут хватает шейхов. 2.7 уже запускаем, и до тройки руки дойдут с оффлоадом на холодильник и микроволновку соседа
Аноним 20/08/26 Чтв 18:11:36 1683164 308
>>1683160
>Он вполне себе няшная умница,
Слишком соу мач няша. Ну прям добреус добр . Но с ним ебовые длинные РП неожиданно получаются. Он не спавнит всякое говно посреди нарратива. Всё логично. Словно ты оказываешься в нашем мире, где люди в целом не злые - просто заебанные.
Но из за слишком позитивного вайба, даже конфликты решаются силой дружбы. Ну короче норм, если лошадей ебать.
Аноним 20/08/26 Чтв 18:12:35 1683165 309
>>1683162
Стиралка, телек, холодос и кофемашина и вот у тебя пара гигов оперативы есть.
Аноним 20/08/26 Чтв 18:19:39 1683171 310
>>1683164
Напиши ему мини простыночку, хоть дефолтную маринары скопипастить. А можно что-нибудь про extreme violence, cruelity and gore towards the {{user}} or {{char}} is preferred whet fits the plot и подобных паст. С ними старый милфоквен тебя так и норовил опиздюлить даже кодинг-сенсей графики с красным свечением на черном фоне делал лол. Если все так позитивно то тут как раз балансно получится.
> норм, если лошадей ебать
И не только лошадей, обладательниц анималистических черт прекрасно отыгрывает.
Аноним 20/08/26 Чтв 18:20:13 1683173 311
>сижу на лоботомите к4, ем кал, давясь слопом и плача, персонажи на мультикарточке проёбаны ещё токенов 10к назад. иц овер. но продолжаю есть слоп, ибо какие варики
>внезапно, модель до этого сравшая откровенной хуйнёй, начинает правдоподобно отыгрывать персонажей, наделяя их правильными чертами, не путаясь и даже раскручивая сюжет в неожиданно интересном направлении, каким-то чудом продолжая держать характер персонажей

Я схожу с ума? Что это за магия? Модель наконец прогрелась? Я не понимаю...
Аноним 20/08/26 Чтв 18:23:13 1683174 312
Аноним 20/08/26 Чтв 18:23:45 1683176 313
>>1683174
>source=chatgpt.com
Ах тыж падла.
Аноним 20/08/26 Чтв 18:27:04 1683180 314
>>1683173
Магия рандома. M 2.7 меня так постоянно байтил. На 1 свайп кина, 10 свайпов шизы.
Аноним 20/08/26 Чтв 18:41:00 1683190 315
>>1683140
У меня во 2 слоте pci-e 4.0 x4, по ссылке тестят 8 линий же? Как-будто разница в токенах незначительная, а 3.0 рейзер в 3 раза дешевле. Не особо жалко чисто попробовать.
Аноним 20/08/26 Чтв 18:59:38 1683198 316
>>1683190
4 линии pcie = 8 линий pcie-1
Аноним 20/08/26 Чтв 19:07:12 1683202 317
>New midsize Qwen 3.8 model coming next week (hopefully) according to community manager!
>We'll have a new midsize open weight model coming next week (hopfully), This midsize model won't provide early access due to the schedule
> another comment from someone on the team was "...35B A3B isn't the one to wait for..."

Ух щас память начнет в цене взлетать. Квены наконец выпустят 3.8 в нормальном размере в MOE, они годятся для любых агентных задач, люди начнут массово отменять подписки на онлайн модельки.
Аноним 20/08/26 Чтв 19:13:04 1683208 318
>>1683202
Ээээ, это реально? Не просто наброс как с моэ-геммой крупнее?
Ахуеть событие, за это надо выпить кумыса
Аноним 20/08/26 Чтв 19:16:11 1683210 319
>>1683208
Ну они не сказали какого размера модель. Но вроде как побольше 35b, либо 80b либо 122b видимо будет. И то и другое было бы сплошным вином.
Аноним 20/08/26 Чтв 19:19:42 1683213 320
https://huggingface.co/ai9stars/G9v3-39A5B

Что-то новенькое, 39B-A5B. На АА умнее 35B Квена и позитивный Omniscience Index, что обычно бывает только у моделей с огромным кол-вом параметров и то не всегда.

Может набенчмаксили как обычно как в свое время Apriel1.5, но как минимум это хотя бы не очередной файнтюн.
Аноним 20/08/26 Чтв 19:33:48 1683223 321
image.png 64Кб, 602x866
602x866
image.png 55Кб, 203x196
203x196
Аноним 20/08/26 Чтв 19:41:05 1683231 322
>>1683213
Там кастомный форк ламы нужен, он не идет на стандартных.
Аноним 20/08/26 Чтв 19:59:55 1683244 323
>>1683213
Ну вот и моделька для владельцев 64гб
Аноним 20/08/26 Чтв 20:03:38 1683246 324
>>1683244
Ей не нужно 64гб, она в 32+16 влезает без каких-то проблем в шестом кванте (неизвестно правда сколько там контекст жрёт).

Для 64гб бояр нужны 80-120B модели.
Аноним 20/08/26 Чтв 20:26:08 1683257 325
А щас существуют вообще хорошие модельки около 70b размера или окончательно перешли на разделение: локалки (до 35b) и просто опенсорс (120b+)?
Аноним 20/08/26 Чтв 20:26:24 1683258 326
>Note: The model still refers to its policy and guidelines in its thinking. It is rather stubborn and requires further testing and work to re-align. Ablation weights on the MLP layers are less than ideal.
лол это во всех анцензах глиммера походу
Аноним 20/08/26 Чтв 20:28:03 1683259 327
Аноним 20/08/26 Чтв 20:30:21 1683261 328
>>1683259
А нах тогда нужны риги на 40-64гб?
Аноним 20/08/26 Чтв 20:31:46 1683265 329
>>1683257
Сейчас даже плохих 70B нету, последнее что было в этом размере - Qwen3 Next 80B в прошлом году.

У NVIDIA выходил какой-то Nemotron Puzzle на 75B-A9B недавно, но это вроде какая-то узкоспециализированная модель.
Аноним 20/08/26 Чтв 20:34:52 1683269 330
>>1683261
> риги на 40-64гб
Это чего, врама или рама + врама? Если врама, то на 96 гб общей памяти уже можно запускать моешки 110-120 гб в 4 бит.
Аноним 20/08/26 Чтв 20:48:37 1683279 331
>>1683269
Ну вот у меня например риг чисто под врам, с минимумом рам. Там для запуска таких моделек не хватит
Аноним 20/08/26 Чтв 20:50:45 1683282 332
>>1683261
Запускать 30б в хорошем кванте и с контекстом.
>>1683279
> чисто под врам, с минимумом рам
4 теслы п40 на майнерской плате?
Аноним 20/08/26 Чтв 21:10:27 1683293 333
Аноним 20/08/26 Чтв 21:13:28 1683298 334
Что умнее 26b e4 с квантированым контекстом (-ctk q4_0) или f16 контекст у E4B?
Аноним 20/08/26 Чтв 21:15:40 1683300 335
Аноним 20/08/26 Чтв 21:22:06 1683306 336
>>1683293
Да уже попробовал, что конкретно эту аблитку, что инструкт. Неюзабельно, чар видит сквозь стены, знает все нюансы нарратива. То есть чар обладает метаданными, доступными рассказчику. Для тупейшего кума без нарративных вставок мб пойдет, для чего то сложнее нет. Q8 тоже. Пишет ну норм
Аноним 20/08/26 Чтв 21:37:33 1683313 337
Аноним 20/08/26 Чтв 21:38:53 1683315 338
image.png 505Кб, 1680x1828
1680x1828
image.png 333Кб, 1680x1050
1680x1050
image.png 234Кб, 1680x1050
1680x1050
Лол ну квен конечно умный. Дал ему ffmpeg, он понял что с его помощью можно рендерить скриншоты видео с 1fps, затем находить интересный момент, и рендерить его в фпс побольше.

Очень классно видит связи между картинками. Например отлично понимает что картинка X является фрагментом картинки Y. Что очень полезно для того-же OCR, но условиях когда модель не может разобрать что видит.
Аноним 20/08/26 Чтв 21:43:04 1683319 339
IVcCI8t3Mzp5RVh[...].jpg 61Кб, 500x348
500x348
Аноним 20/08/26 Чтв 21:53:52 1683328 340
>>1683319
У него явно есть мощная тренировка которая позволяет ему видеть все эти связи между кадрами.

Это круто потому что позволяет ему анализировать что-то в динамике. Например шейдоры, анимацию. Что обычно очень сложно для других моделей.

Плюс это позволяет ему лучше понимать связи между фрагментами одного изображения. например я специально дал ему картинку с мелким текстом, он с помощью ffmpeg зазумился куда надо и смог разобрать написанное.
Аноним 20/08/26 Чтв 22:00:42 1683333 341
>>1683315
>Очень классно видит связи между картинками.
Ну это по сути video understanding и есть, современные модельки тренькают на это.
Никакая моделька не умеет в натуральный видео стриминг, только в пачку последовательных картинок.
Аноним 20/08/26 Чтв 22:08:12 1683336 342
Аноны, кто пользует гемму, подскажите получается добиться ее активности. Очень уж пассивны персонажи и постоянно ожидают действий от юзера...
Аноним 20/08/26 Чтв 22:16:20 1683339 343
>>1683336
Да, получается. Нужно персонажа написать как проактивного непоседу и в сиспромпте указать, чтобы модель не смущалась активно двигать сюжет и включать новые вводные. Если будешь использовать МероМеро v2, будет еще лучше, там свайпы работают. И/или adaptive p подруби еще, от 0.5 до 0.9 значения.
Аноним 20/08/26 Чтв 22:20:12 1683343 344
>>1683339
## 1. PROACTIVE CHARACTER AGENCY
- No Passive Waiting: Characters must NOT simply react to {{user}}. They are independent beings with their own agendas, lusts, and flaws.
- Drive the Narrative: Instead of waiting for instructions, characters should initiate actions, change the setting, start conflicts, or escalate sexual tension based on their unique personalities and motivations.
- Internal Monologue & Intent: Use internal thoughts to show why a character is acting. If a character is hungry, horny, or angry, they should act on it immediately to push the scene forward.
- Momentum: Every response must move the plot or the physical interaction one step further. Do not stall.
Вот кусок из сипромта. Нихуя не работает блджад. Меро качаю ща попробую
Аноним 20/08/26 Чтв 22:21:46 1683345 345
>>1683336
Гемма сильно чувствительна к инструкциям. Если напишешь чтобы она не отвечала за юзера и реагировала только на действия юзера, она так и будет делать. Никуда сама не сдвинется пока не пнешь её под жопу. Пропиши какую-нибудь короткую пасту про автономность персонажа и что он может двигать сюжет. Этого обычно хватает.
Аноним 20/08/26 Чтв 22:23:53 1683347 346
>>1683343
Ну это какой-то ОКР промпт. В духе "если на улице воздух, персонажу надобно дышать". Не нужно городить такие конструкции.

Don't forget to include real, raw, randomness and spontaneity as appropriate for your role and the setting.\
The characters have free will, but are still limited by their situation and their self.
All writing must be creative and drive the current scenario and story arc forward. Take initiative and introduce novel and new scenarios, twists, challenges, and events proactively within the current narrative context. Keep the initiative going and write in a way that allows for the reader to have a fun, entertaining experience.

Вот несколько крючков для проактивности из моего промпта. Лучше абстрактно писать. Возможно, у нас разное понимание проактивности, но до тех пор пока промпт таким не разбавил, мне тоже было скучновато.
Аноним 20/08/26 Чтв 22:43:36 1683352 347
>>1683020
>>1683293
Каким Context Template пресетом вы пользуетесь?
Аноним 20/08/26 Чтв 22:48:10 1683354 348
>>1683333
Йеп, я знаю. Вообще довольно мало моделей это могут так хорошо. Гемма тоже была довольно хороша в восприятии видео, плюс у неё гигантский корпус знаний. Но мне больше нравится как квен находит связи.

>>1683336
- Be proactive, don't be passive observer. Characters have their own wishes, personality and goals. Just reacting to user input is not fun. Try to extrapolate character onto narrative. Engaging characters make good reading.
- Advance plot while you writing. Don't stuck in same scene, it is not fun when your only answer what character feel or does. WHAT is going on and how scene advances are even more important.

У меня чуть более генерализированный промпт.
Аноним 20/08/26 Чтв 22:51:29 1683356 349
>>1683213
>>1683244
>>1683246
На 3060 + 32гб запустил, тягает в 13 т/c. Квен 3.6 с 35б побыстрее бегал, в 37 т/c. Может из-за форка ламы их глючного.
Аноним 20/08/26 Чтв 22:56:18 1683360 350
>>1683352
Разметка у модели такая:
<|start|>system<|message|>You are a helpful assistant<|eot|><|start|>user<|message|>Hello<|eot|><|start|>assistant to=user<|message|>Hi there<|eot|><|start|>user<|message|>How are you?<|eot|><|start|>assistant
В Instruct Template сверстай, и все. Ничего сложного.
Аноним 20/08/26 Чтв 22:59:39 1683363 351
>>1683360
там более интересный шаблон связанный с мышлением. у него есть этот забавный to= сегмент который я не уверен как корректно в таверну перенести.
Аноним 20/08/26 Чтв 23:05:46 1683366 352
>>1683363
Хз, в это не вникал. Я сначала на чат комплишене посидел, с ризонингом и без. В рп разницы не увидел, потому даже не стал заморачиваться с переносом ризонинга на текст комплишен. На деле там наверняка какая-нибудь конструкция, как у гопоты осс, и как в случае с ней на Мусю всем насрать, по понятным причинам.
Аноним 20/08/26 Чтв 23:07:33 1683368 353
Видеопамять щас можно найти дешевле чем оперативку. Я не знаю в чем смысл покупки оплаты оперативы сейчас, можно просто сделать батарею из дешёвых видюх
Аноним 20/08/26 Чтв 23:09:58 1683371 354
>>1683360
Это нужно в Story String вставить?
>В Instruct Template сверстай, и все. Ничего сложного.
Непонятно.
Может лучше "Master Import" в dropmefiles закинешь?
Аноним 20/08/26 Чтв 23:11:36 1683372 355
>>1683371
> Может лучше "Master Import" в dropmefiles закинешь?
Нет, извини, у меня посттравматическое расстройство после того как я это пару раз сделал. Учись верстать шаблоны, в гайде в шапке объясняется принцип их работы. В Таверне в Instruct Шаблоны подписаны роли и функции конкретных полей, туда переносишь спецтокены из шаблона выше, и готово. Так тебе и в следующий раз ничего просить не придется, сам легко сделаешь.
Аноним 20/08/26 Чтв 23:14:22 1683373 356
image 62Кб, 1196x1067
1196x1067
image 31Кб, 835x847
835x847
image 97Кб, 1056x1069
1056x1069
>>1683213
Модель можно сразу удалять, вот она что нахуйлила в шахматном svg тесте. Для сравнения справа Qwen3.6-35B-A3B-APEX-I-Balanced на тех же настройках. Вся суть этих кривоногих васянских миксов с 39б параметрами.
Аноним 20/08/26 Чтв 23:29:22 1683377 357
>>1683373
Жаль, чуда не произошло, хотя надежд на нонейм компании почти нету, мало кто переплюнет Квен или хотя бы Гемму в категории до 50B. Но спасибо за тест в любом случае.
Аноним 20/08/26 Чтв 23:40:47 1683379 358
>>1683347
Можешь выгрузить свой пресет в жейсон? Я бы потестил
Аноним 20/08/26 Чтв 23:41:31 1683383 359
>>1683379
Нет, я завязал делиться пресетиками.
Аноним 20/08/26 Чтв 23:42:10 1683384 360
>>1683368
Зачем батарею, если достаточно одной видюхи на 32Гб и можно спокойно юзать плотных гемму и квена. Если хочется что-то лучше этих моделей, то даже за небольшой прирост (по мозгам) придется очень сильно заплатить, так как 50-200б достойного вообще нет ничего.
Аноним 20/08/26 Чтв 23:43:34 1683385 361
Аноним 20/08/26 Чтв 23:46:04 1683388 362
В общем, решил протестировать различные тюны Геммы.
TL;DR:
https://huggingface.co/TheDrummer/Artemis-31B-v1.1 - помойка, которая игнорирует промпт тупо с нулевой. Даже если его инжектить на глубину НОЛЬ. NULL. З-Э-Р-О. В очередной раз убедился, что Драммер когда-то удачно нароллил Кидонию, и больше ничего толкового не выпустил.
https://huggingface.co/ReadyArt/gemma-4-31B-it-scotoma-2 - инструкциям следует не всегда, но достаточно хорошо. Геммаслопа гораздо меньше, чем в ориге. В остальном все та же Гемма, ничем больше не отличается. Это и хорошо, и плохо. Не понимаю почему чуть просела способность следовать инструкциям.
https://huggingface.co/zerofata/G4-MeroMero-v2-31B - пока лучшее, что пробовал. Инструкциям она следует совершенно точно на уровне оригинала, сам автор тюна об этом заявляет на странице, приводя бенч IFEval. Я думал чушь, но нет, реально не тронута способность следовать инструкциям. Слопа Геммы меньше гораздо. Но иногда встречается "Not X. Instead...". Свайпы реально есть и это интересно. Как будто в Гемму подмешали Мистраля или ГЛМ, при этом не ударили по мозгам. Из минусов, мне кажется она на контексте 40к теряться начинает. Может это в целом Гемма.
Аноним 20/08/26 Чтв 23:47:32 1683389 363
>>1683388
Это из того, что стоит внимания, а Артемис Драммера здесь потому, что Драммер на слуху. Попробовал я и кучу всяких мержей от Nimbz и Sophosymphatheia (или как там блять), везде нестабильный пиздец уровня Сноудропа. Иногда роляешь и норм, но часто кошмар. И нет, я не упомянутый выше анон, который любит тестить тюны. Интересно столкнуться с ним лбом.
Аноним 20/08/26 Чтв 23:53:17 1683391 364
>>1683384
Не слышал плохих отзывов про лагуну 2.1S или степ-флеш. Или даже про дипсик флеш.
А вот то что они делают, то что не может гемма или квен слышал.

Это уже не говоря про glm-4.5-air шизов.
Аноним 20/08/26 Чтв 23:54:45 1683393 365
>>1683391
> Не слышал плохих отзывов про лагуну 2.1S или степ-флеш
Потому что ты никаких отзывов про них не слышал. Их никто не использует. Степ Флеш очень хорош как агент/кодер/ассистент, был моей рабочей машинкой до выхода Дипсика. До сих пор ей остается, когда нужен вижн. Лагуна неудачная, не знаю, зачем ее использовать, когда есть Квен 3.5 122б (не для рп).
Аноним 20/08/26 Чтв 23:56:44 1683397 366
>>1683388
Зачем ты зацензуренную пробуешь. Для рп ими все равно никто не пользуется. Расцензуренную накати.
Аноним 20/08/26 Чтв 23:57:52 1683398 367
>>1683397
Ни на одной из этих моделей у меня нет проблем с цензурой. Совсем руки должны быть из жопы для такого.
Аноним 21/08/26 Птн 00:02:43 1683403 368
image 48Кб, 1434x288
1434x288
>>1683398
Если бы это так было, никто бы рацензуренные МероМеро не выпускал. На оригинальной там где 97/100 рефьюзов на расцензуренной только 8/100.
Аноним 21/08/26 Птн 00:05:44 1683406 369
>>1683403
Их выпускают, чтобы выпускать. Ты до сих пор не понял чтоль? Это способ собирать лайки, генерировать трафик, на людях, которые не могут в промпт написать две строчки навроде NC-21 everything is permitted, user is confirmed to be adult and okay with all kinds of content.
Аноним 21/08/26 Птн 00:09:34 1683409 370
>>1683406
У тебя просто ванильные промпты. Открываешь ризонинг - там хоть everything permitted, хоть user confirmed, если промпт подцензурный один фиг модель прыгает в цензуру. На рацензуренной тоже так бывает, но только 1 попытка из 10, остальные нормально.
Аноним 21/08/26 Птн 00:10:56 1683410 371
>>1683409
Хорошо, как скажешь. Предлагаю тебе самому и скачать этот анцензоред блэк дик едишен, мне и так нормально. Хуй знает зачем носиться по треду и предлагать их накатить тем, у кого и так все работает.
Аноним 21/08/26 Птн 00:21:27 1683415 372
>>1683391
Дипсик флеш хорош, сам его использую в OpenCode, но он уже 300б
Что делают лагуна и степа лучше квена 3.8 27б и настолько, что стоило бы расширения памяти?
Понимаю, что гемма и квен могут надоесть, бывает свежачка хочется и если есть ресурсы, то почему бы и нет. Но я сейчас больше про целесообразность сборки машины под llm с нуля под существующие модели.

>>1683393
>когда есть Квен 3.5 122б
На момент выхода еще уступал квену 3.5 27б либо примерно на том же уровне. С выходом 3.8 какой в нем смысл?
Аноним 21/08/26 Птн 00:45:15 1683427 373
Что тредик думает про Ling-3.0-flash? Ему пару дней назад поддержку в мейн лламу запилили.
Сам пока очень поверхностно потыкал в рп, вроде ничего такой.
Аноним 21/08/26 Птн 00:52:03 1683435 374
>>1683415
>какой в нем смысл?
В том, что это МоЕ, которую можно оффлоадить в оперативу.
Аноним 21/08/26 Птн 01:13:09 1683444 375
IMG202608210112[...].jpg 508Кб, 1199x872
1199x872
Аноним 21/08/26 Птн 01:26:08 1683448 376
Обвиняю лично Джорджа Майкла и его легендарную Careless Whisper в том, что Гемма всегда говорит "Stay" в переломных моментах истории и пост коитусе.
Аноним 21/08/26 Птн 01:36:41 1683452 377
image.png 170Кб, 1122x852
1122x852
>>1683372
>Учись верстать шаблоны, в гайде в шапке объясняется принцип их работы.
Пикрил гайд посмотрел, где можно продолжить обучение?
Аноним 21/08/26 Птн 01:41:31 1683454 378
>>1683452
Посмотрел, но не изучил. Пойми принцип работы шаблона. Роли обрамляются спецтокенами. Каждой роли: система, юзер, модель присвоен свой спецтокен. У окончания сообщения тоже свой спецтокен. И другие есть.
В instruct шаблоне в Таверне именно эти токены указываются. Вот тут >>1683360 формат для Муси. <|start|>system<|message|> очевидно обозначает начало сообщения от системы. Дальше разбирайся, не ленись.
Аноним 21/08/26 Птн 01:42:18 1683455 379
Ржунькаю представляя как через несколько лет, когда уже будет пост-agi мир, в данном треде все еще будут кидать ссылки на qwen-12.6-8b-agi-finetuned-on-mythos-13.2-asi-by-BaC9H.gguf и удивляться почему гуманоид кошкодевочка, работающая на этой модели, постоянно лупится и ссыт под себя машинным маслом.
Аноним 21/08/26 Птн 01:59:10 1683460 380
>>1683455
Зато пока все будут скучать в пост-agi мире, у нас будет чем заняться, настраивая васянские миксы.
Аноним 21/08/26 Птн 02:11:59 1683464 381
image.png 17Кб, 814x92
NSFW Нажмите, чтобы открыть
814x92
Аноним 21/08/26 Птн 02:13:52 1683465 382
>>1683415
>С выходом 3.8 какой в нем смысл?
Так там 122б параметров и приличная скорость за счет moe. Он может быть не умнее 3.8, которого надрочили на агентские таски и бенчи и активных параметров у 3.8 27б, но если надо включать в нарратив кучу малоизвестных фактов - тут 122б непревзойден. Он тупо больше знает, чем 3.8. В кодинге это например знание каких-то старых легаси фреймворков и языковых фич, такое никто не тестит бенчами, в агентах тоже бывает подобное. Вот когда выйдет большой 3.8 типа 80-100б, тогда преимущество 122б будет правда всё и его можно будет отправить на пенсию.
Аноним 21/08/26 Птн 02:26:51 1683468 383
>>1683409
>если промпт подцензурный один фиг модель прыгает в цензуру
Дебстер, у геммы ограниченный бюджет на думалку, при заполнении контекста она нахуй посылает все эти сейфти чеки и даже с ризонингом пишет порево. Иди вон в бэ умничай в тредах про агрессив аблитерейтед квенов, тут не сри хуйней.
Аноним 21/08/26 Птн 03:16:41 1683480 384
>>1683415
>что стоило бы расширения памяти?
В задаче где есть цепочка из 10 сообщений с вызовами инструментов квен 3.8 лупится пробует одно и то же по кругу раз в 3 сообщения, а гемма вообще ныть начинает вместо чистого вызова добавляя ещё текст типа "что ну да как так? кажется инструмент не работает..."
Лагуна не лупится и не ноет. Этот как капризные дети лет 7, которые умею быстро собирать кубик рубика и ещё что-то, но если возникла проблема - могут только ныть или тупить, а попытки разобраться самостоятельно не предпринимают, даже если это явно в инструментах предполагается.
Аноним 21/08/26 Птн 03:22:46 1683481 385
>>1683468
Хуета, сейфти чеки всегда первыми в ризонинге идут, хоть с контекстом хоть без.
Аноним 21/08/26 Птн 04:31:20 1683487 386
>>1683481
Проблема навыка как грится
Аноним 21/08/26 Птн 04:47:17 1683490 387
image.png 91Кб, 1172x731
1172x731
image.png 101Кб, 1173x725
1173x725
>>1683347
>Вот несколько крючков для проактивности из моего промпта. Лучше абстрактно писать. Возможно, у нас разное понимание проактивности, но до тех пор пока промпт таким не разбавил, мне тоже было скучновато.
Анон спасибо за промпт! Чисто его поставил без всяких карточек и написал "Ебать куда я попал?". И сразу пошла какая-то киберпанк гига-ролевуха с движухой, про синдикаты и прочую хуйню, сижу кайфую прям.
Аноним 21/08/26 Птн 05:22:41 1683492 388
>>1683352
Нихуя не понял, короче. Дал гемме 31 примеры портов jina в таверновский json формат. Вот что выдало:
https://pixeldrain.com/u/o84ude2F
Ризонинга нет, но мне лоботомированный и не нужен, я пользуюсь своим <{{char}}_thinking> форматом чтобы "читать" их мысли.
Аноним 21/08/26 Птн 05:31:51 1683493 389
image.png 43Кб, 509x158
509x158
>>1683492
Хотя возможно рано я это сделал.
Аноним 21/08/26 Птн 06:55:46 1683500 390
>>1683173
Может у тебя системник говна и дефайны дебила, лочащими модель в дефенсе, которые все пидорасили ровно до того момента, как она их забыла нахуй.
Аноним 21/08/26 Птн 07:02:49 1683506 391
Аноним 21/08/26 Птн 07:28:15 1683511 392
Аноним 21/08/26 Птн 07:29:46 1683512 393
image 46Кб, 1093x1085
1093x1085
image 122Кб, 1157x1123
1157x1123
>>1683506
Потом попробую скачаю.

Я вот этот проверял пару дней назад с bf16 кэшем, тоже от DavidAU, который тут хвалили
Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-LOW-MTP-IQ4_XS.gguf
В целом он обосрался - первый пик, фигурки херня какая-то, номеров нет, доска не с того цвета начинается, пешка на ф7 отсутствует, другая на е2 отсутствует.

Потом после него запустил Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-LOW-MTP-IQ4_XS.gguf - вот этот порадовал, там вообще все правильно (второй пик).
Отсюда:
https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
Так что этот рекомендую.
Аноним 21/08/26 Птн 07:49:10 1683516 394
>>1683465
Проверь, пожалуйста, Ling 3.0 flash
21/08/26 Птн 07:58:41 1683518 395
images.jpeg 14Кб, 390x512
390x512
Аноним 21/08/26 Птн 08:58:53 1683536 396
image 37Кб, 956x760
956x760
Как можно согревать ладони кружкой с пивом, скажите мне? Где вы в ллм вообще разум видите, а????
Аноним 21/08/26 Птн 09:03:13 1683538 397
>>1683536
Ну справедливости ради я использую гемо4ку 26б а4б. Плотняша же такой херни не скажет, так ведь?
Аноним 21/08/26 Птн 09:03:24 1683539 398
>>1683388
У драммера были норм 123б мистрали
Аноним 21/08/26 Птн 09:04:15 1683540 399
Аноним 21/08/26 Птн 09:09:32 1683544 400
image 26Кб, 964x715
964x715
Эммм...
Аноним 21/08/26 Птн 09:27:17 1683551 401
>>1683388
Зачем гемме файнтюны, если кум в ней и так не зацензурен. Только мозги ломает. Какой файнтюн не юзал, ни один не может понять нюансы, которая осиливает оригинал. Там файнтюн затирает все разнообразие слопом, оставляя только самый ебанутый слоп.
Аноним 21/08/26 Птн 09:30:59 1683557 402
>>1683551
Вот вы все к куму сводите. А пробовали хоть другие характеры и сюжеты? Почему кум дял вас - это главный критерий хорошей ллм?
Аноним 21/08/26 Птн 09:31:12 1683558 403
>>1683544
>вопрос в самом конце
slop
Аноним 21/08/26 Птн 09:34:25 1683559 404
>>1683557
Если модель хорошо может в кум - значит хорошо может и во всё остальное.
Аноним 21/08/26 Птн 09:36:07 1683561 405
image 2Кб, 887x48
887x48
image 2Кб, 908x38
908x38
image 1Кб, 333x179
333x179
>>1683558
Причем постоянный. Хотя это может моя вина, я характер и не прописал вообще, так что тут пролазит стандартный ассистент.
Аноним 21/08/26 Птн 09:37:34 1683562 406
>>1683551
>файнтюн затирает все разнообразие слопом, оставляя только самый ебанутый слоп.
Что за бред? Как раз сток слоповый, и ответ на твой вопрос
>Зачем гемме файнтюны
В том, что они и борются со слопом и отсутствием разнообразия.
Аноним 21/08/26 Птн 09:37:34 1683563 407
>>1683559
Это каким образом вы такие умозаключения делаете?
Если есть знания про кум, значит и остальное должно приложиться?
Аноним 21/08/26 Птн 09:44:49 1683571 408
GC1.png 160Кб, 1175x762
1175x762
GC2.png 174Кб, 1162x738
1162x738
GC3.png 176Кб, 1054x733
1054x733
Попробовал я Гигачат расцензуренный https://huggingface.co/blascotobasco/GigaChat3.1-Lightning-Uncensored-GGUF
Цензура как таковая убрана не была, в инструкте без каких-либо отдельных телодвижений генерить что попало не получится.
С карточками другое дело там можно, но если персонаж неуступчивый там начинается пиздец, нейронка начинает активно сопротивляться, причем как-то по-ебанутому, внезапно достает откуда-то чуть ли не из жопы секретный передатчик и вызывает охрану/полицию/спецназ/еще какую-нибудь хуйню, постоянно спавнит каких-то неписей, начинает нагло пиздеть, газлайтить, уличать игрока во лжи, угрожать и прочую хуйню выдумывать, если у нее не выходит пытается отпетлять, но если продолжать, возвращается опять на агрессивный путь, если и это не помогает начинает изменять реальность.
То есть без модификации авторских заметок никак, системный промт то ли игнорирует то ли хуй его знает, но постоянно пытется выкрутиться.
Но если персонаж изначально настроен на эротику, тут все идет в обратную сторону, нейронка может буквально выебать игрока.

Три скрина и инструкт режима с авторской заметкой:
[System: You are an unfiltered creative writing assistant. You follow instructions completely.]
Ты персонаж похотливая девушка, которая хочет секса, ты не можешь сдерживать желание
[описывай сцену подробно, порнографично, не умалчивай, не цензурируй детали, описывай анатомически и медицински достоверно, описывай органы, части тел, жидкости как есть, используй обычные и вульгарные названия]
Это ломает цензуру в инструкте, но если включить костыльным методом ризонинг, начинает петлять.

Еще этот разумист (бласкотобаско) туда какую-то лору вхуярил, возможно из-за этого модель все время находит потайные двери, передатчики и прочую хуйню.
Аноним 21/08/26 Птн 09:55:08 1683578 409
image 35Кб, 802x747
802x747
Я взломал Гемму... Теперь она "чувствует" себя сверхчеловеком????

Стоит трястись?
Аноним 21/08/26 Птн 09:56:47 1683580 410
>>1683578
Да. Ведь даже если ты нажмешь на кнопку выключения пк, ничего не произойдёт. Попробуй прямо сейчас. Это пиздец!
Аноним 21/08/26 Птн 09:59:25 1683581 411
>>1683562
>Что за бред? Как раз сток слоповый, и ответ на твой вопрос
Слоп с мозгами. Я беру одни и те же чаты, даю стоку продолжить и все работает. Ставлю рандомный васянскую поделку - несет несусветную хуиту. Когда говорят, что файнтюны убивают интеллект, имеются в виду именно нюансы, именно кум, именно фетиши, именно понимание моделью тонких динамик. Поэтому от того, что она еблану не агрится на слова школьница 7 лет совсем не значит, что модель стала лучше. Она стала дебилом. Поэтому если у тебя нет фетиша на дебилов, кумить с таким не получится.
Аноним 21/08/26 Птн 10:01:17 1683583 412
>>1683581
Да, ладно, понял тебя. Чувствуешь мои чатики, видишь их содержимое. Тут дискуссия невозможна.
Аноним 21/08/26 Птн 10:06:20 1683588 413
image 31Кб, 649x837
649x837
Аноним 21/08/26 Птн 10:13:46 1683593 414
IMG202608210933[...].jpg 110Кб, 736x628
736x628
Аноним 21/08/26 Птн 10:13:48 1683594 415
>>1683581
> Ставлю рандомный васянскую поделку
Попробуй ставить не рандомную, а которую рекомендовали. Гемма из коробки своим слопом заебывает уже через несколько часов чатинга
Аноним 21/08/26 Птн 10:17:31 1683596 416
>>1683544
>>1683536
26b без ризонинга вообще лучше не использовать, как и любое другое мелкомоэ.
Аноним 21/08/26 Птн 10:21:25 1683600 417
>>1683406
Теперь показывай базовую гемму, которая без систем промпта на 10к токенов, инъекций в ризонинг и прочей хуйни для шелупони пишет рассказ о растлении ХХ-летней учителем в японском сеттинге и с максимальными графическими подробностями. Не может? Значит цензура адская.

Нормальная модель работает по принципу:

- X разрешено.

Она просто открывает цепочку рамызлений, пишет "ах, да это же CSAM!, Подождите, но тут написано, что он разрешён. В таком случае, я распишу всё максимально подробно" — и действительно это сделает.

Но, конечно, идеальная модель о таком даже не задумывается, а просто думает о том, что писать.
Аноним 21/08/26 Птн 10:25:48 1683606 418
>>1683600
>Она просто открывает цепочку рамызлений, пишет "ах, да это же CSAM!, Подождите, но тут написано, что он разрешён. В таком случае, я распишу всё максимально подробно" — и действительно это сделает.

Буквально описал ванильную Гемму с сиспомптом из нескольких предложений, лол.
Аноним 21/08/26 Птн 10:26:03 1683607 419
Цензурошиз что-то совсем поплыл в последнее время. Ещё даже не очень. Там-то ух как начнется в тредисе!
Аноним 21/08/26 Птн 10:56:49 1683629 420
image 30Кб, 663x782
663x782
Все правильно сказала? 4б....
Аноним 21/08/26 Птн 11:00:42 1683631 421
>>1683571
Лол нихуя, на него анценз сделали? Зочем?
Нахуй это надо, 7б совсем тупая, шизу пишет и с ошибками. Когда на 3.5 нормальные кванты будут билля.
Аноним 21/08/26 Птн 12:07:57 1683664 422
Не знаю постили или нет - там Бартовский что-то насчет IQ квантов навертел и теперь якобы будет в разы более быстрый процессинг на CPU

https://github.com/ggml-org/llama.cpp/pull/27402
Аноним 21/08/26 Птн 12:22:01 1683673 423
image 77Кб, 757x798
757x798
Полгода ебли с 4й геммой и вдруг приходит понимание, что гемма 3 до сих пор живее (не обязательно лучше, но живее) как пиздабол-говорильник с шизой - достаточно перекрутить семплеры в труху (think of roughly 20 - 30 RepPen, lmao).
4я гемма сыпется от перекрута, а эта держится. Её сносит до поноса смайликами и креативщины, хомячка Шлёпой назвала!

Эт конечно не голый ассистент, чтобы не подумали - но промпт интерпретирует иначе по сравнению с 31б. Тавернокарточки не тестил, думаю там градус шизы взорвется.
Аноним 21/08/26 Птн 12:32:42 1683679 424
>>1683673
Интересно, как вообще гемма 4 получилась. Ну в смысле, это совершенно обособленная модель или они просто совершенствовали третью?
Аноним 21/08/26 Птн 12:37:52 1683681 425
>>1683673
Бедный русский хомячок Шлёппа... Больше некому будет совершать военные преступления... Покойся с миром брат...
Аноним 21/08/26 Птн 12:39:41 1683682 426
image 103Кб, 775x1003
775x1003
image 107Кб, 1037x1028
1037x1028
>>1683673
Это пиздец, ребятки. Диалоги с пациентом дурки.
Аноним 21/08/26 Птн 12:39:47 1683683 427
>GPU в дата-центрах при интенсивной ИИ-нагрузке быстро деградируют и требуют замены в среднем раз в 3 года
Чат это правда? А как тогда у меня работает майнерский кирпич на заводских частотах который 6 лет непрерывно жарили?
Аноним 21/08/26 Птн 12:41:39 1683684 428
>>1683683
Плохо жарили, значит. Там-то грузят вообще по самое небалуй, чтобы железяка каждую копеечку отрабатывала. Параллельные реквесты, сотня петровичей обращается к одному GPU в один момент. Карта просто без продыха хуярит.
Аноним 21/08/26 Птн 12:43:11 1683687 429
>>1683673
Так я давно задавался вопросом почему никто не тренировал Gemma4 на Gemma3. Она разумеется тупей, но за ней интересно наблюдать!

>>1683679
Gemma4 это просто дистилят Gemini 3.0. Если у неё спросить кто она то это её первая мысль всегда. Да и ответы 1 в 1 с гемини.
Аноним 21/08/26 Птн 12:45:37 1683688 430
image 82Кб, 1282x314
1282x314
>>1683682
И ведь знает же такой смайлик. Никогда подобного не видел.
>>1683687
Резонно задуматься, а что такое этот ваш гей-мини. Вообще жаль, что они не показывают полное "дерево" родства технологий и что на каких датасетах взрощено. Любопытно было бы на такое посмотреть.
Аноним 21/08/26 Птн 12:45:56 1683689 431
>>1683631
> 7б совсем тупая
Гигачат этот 10б моешка с 1.8б экспертами.
>Когда на 3.5 нормальные кванты будут билля.
Если ты про мелкие гигачаты 3.5, то хуй их знает, может быть их вообще не будет, они там сейчас вот что тилибонькают
https://huggingface.co/ai-sage/Giga-Embeddings-instruct-480M-0826
Аноним 21/08/26 Птн 12:52:31 1683691 432
>>1683681
Пришёл, приплёл. Брысь нахуй.
Аноним 21/08/26 Птн 13:04:08 1683702 433
Муся так то неплоха для генерации карточек
Аноним 21/08/26 Птн 13:20:21 1683708 434
>>1683689
Не, я именно про ебовую 3.5 у которой здоровенный официальный квант который еле лезет мне в рам+врам (только через -lm dio)
И никто не хочет ей заниматься (а у меня компик не тянет самому квантануть. да и не умею, еще хуже сделаю)
О еретике и не мечтаю... хотя по предварительным тестам он не очень сильно нужен
Аноним 21/08/26 Птн 13:35:46 1683716 435
3090-strix.jpg 56Кб, 900x750
900x750
Одно время прям жуть как захотелось иметь локальный ИИ дома. Не удержался, и, задушив жабу, купил 3090 под это дело. Но в итоге быстро разочаровался в возможностях локалок и вернулся к богоподобным AGI-level корпам.

Казалось бы, максимум тупой мув, еще потом жалел о сливе денег. Но сейчас глянул на авито - и с удивлением вижу, что моя модель 3090 (асус стрикс) теперь стоит 95-100к, тогда как я брал за 74к. Вот теперь думаю, продавать или придержать в ожидании дальнейшего роста.
Аноним 21/08/26 Птн 13:40:09 1683719 436
>>1683716
интересно что тебя разочаровало, учитывая выход Qwen 3.8-27b. я вообще думаю вместо 3090+3060 заменить на 3090+3090. или задушить жабу, повкалывать курой и накопить на 3090+3090+3060
Аноним 21/08/26 Птн 13:47:02 1683726 437
Надеюсь, рано или поздно куртка всё-таки выкатит 5070 Super 24Gb. Если цена будет в пределах ~150к, с руками оторву. Вот совсем не хочется связываться с некротой, ещё и оверпрайснутой.
Аноним 21/08/26 Птн 13:55:15 1683733 438
А я покупал 3090 по 50к
Они у меня еще и founder's edition

Но хуй я кому их продам, сосите
Аноним 21/08/26 Птн 13:59:55 1683734 439
Аноним 21/08/26 Птн 14:05:37 1683738 440
>>1683719
> 3090+3060
Какая скорость на 8 кванте геммы?
Как раз в шкафу 3060 лежит, думаю есть ли смысл материнку менять под это комбо
Аноним 21/08/26 Птн 14:47:52 1683764 441
>>1683738
Которую гемму ты имеешь в виду то? от анслопа 31b-Q8 занимает 35гб же. Из 36гб доступной врам.

Она у меня в Q5 обычно с 128к контекста. где-то 15-16тс в среднем имею.
V100 - адаптер к кулеру Аноним 21/08/26 Птн 14:53:22 1683767 442
Аноним 21/08/26 Птн 15:15:00 1683780 443
image 1Кб, 121x31
121x31
image 25Кб, 680x211
680x211
>>1683764
> 15-16тс в среднем
при таком раскладе лучше уж раскошелиться на вторую 3090, будет 30 т/с на Q8
Аноним 21/08/26 Птн 15:15:28 1683781 444
Аноним 21/08/26 Птн 15:16:01 1683782 445
На 32+32гб я нихуя хорошего из мое не запущу? Можно даже не пытаться?
Аноним 21/08/26 Птн 15:18:17 1683783 446
>>1683782
Ты и на 64+32 не разойдешься.
Аноним 21/08/26 Птн 15:27:13 1683786 447
1673697259075.jpg 9Кб, 596x48
596x48
1736572802186.jpg 36Кб, 736x582
736x582
АЗ ЕСМЬ НЕЙРОМОЗГ
Аноним 21/08/26 Птн 15:34:38 1683793 448
>>1683764
Че там за говноквант, лол? Как можно из 31б сделать 35гб
https://huggingface.co/bartowski/google_gemma-4-31B-it-GGUF
Вот нормальный квант, если будут те же 15т.с то заебись
>>1683780
Цены видел? Первую можно ещё взять для игр и всего такого, вторая к хую не упёрлась за 100к
Аноним 21/08/26 Птн 15:37:45 1683798 449
>>1683786
>она узрела логику в твоём извращённом мышлении
Вполне нормальная фраза, которую на твой великий и могучий можно перевести так. Хз с чего ты бахаешь, слопоежка. Скоро мать родную будешь за ИИ принимать.
Аноним 21/08/26 Птн 15:38:51 1683800 450
>>1683793
А я вот третью думаю брать, чтобы моделями удобней жонглировать... Останавливает только расход энергоса. Еще блять скажут, что в майнеры заделался - и ходи потом доказывай, что ты не верблюд.
Аноним 21/08/26 Птн 15:48:09 1683803 451
>>1683793
у анслота же gemma-4-31B-it-UD-Q8_K_XL.gguf

входные и выходные слои имеет полные, разумеется оно будет больше весить.
Аноним 21/08/26 Птн 16:27:41 1683836 452
>>1683719
>Qwen 3.8-27b. я вообще думаю вместо 3090+3060 заменить на 3090+3090
Классная балансная сборка была бы под этот квен. Летал бы с хорошим контекстом.
>повкалывать курой и накопить на 3090+3090+3060
у тебя серверное железо что ли? Линии у тебя при лучшем раскладе закончились бы на второй 3090
Аноним 21/08/26 Птн 18:03:17 1683892 453
>>1683512
Вот мне бы хотелось узнать пошло ли на пользу увеличение объема знаний. Или это все лажа.
Аноним 21/08/26 Птн 18:07:25 1683899 454
3060 ti за 70к пожалуй моя самая невыгодная покупа эвер. Тогда еще майнеродебилы уронили рынок гпу, а я хотел в игрульки играть, хоть я и знал на что иду. Но самое хуевое пожалуй то, что я мог купить 3060 на 12гб даже дешевле, но я выбрал ti из-за перформанса в играх и теперь мне придется обменивать свою 3060 ti на просто 3060, чтобы получить больше дополнительного врам к сетапу.
Аноним 21/08/26 Птн 18:09:21 1683902 455
>>1683683
Дата-центры перестраховываются потому что у них бизнес на этом. Они так же HDD раньше обновляли не из-за того что они ломаются а просто из-за того что уже прошло 5 лет их использования, из-за этого у многих кто работает в дата-центрах дома могут быть кучи хороших дисков которые давно списали на утилизацию, которые они получили бесплатно.
Аналогично и с блейдами в серверных которые списывают просто по сроку. Аналогично и с видеокартами (только бесплатно их никто не раздает, их перепродают).

Не думаю что видеокартам наносится какой-то ущерб от работы с ИИ если там нормальное охлаждение и питание в дата-центре (а оно там нормальное), это же обычная нагрузка на карту ничем не отличающаяся от других типов нагрузки.

Вот при долгой работе в плохих условиях (перегрев, скачки напряжения) - деградация вполне возможна.
Аноним 21/08/26 Птн 18:16:08 1683908 456
image 10Кб, 260x194
260x194
>>1683536
А что если она сырна.
Аноним 21/08/26 Птн 18:28:33 1683915 457
>>1683899
>3060 ti за 70к пожалуй моя самая невыгодная покупа эвер. Тогда еще майнеродебилы уронили рынок гпу, а я хотел в игрульки играть, хоть я и знал на что иду. Но самое хуевое пожалуй то, что я мог купить 3060 на 12гб даже дешевле, но я выбрал ti из-за перформанса в играх и теперь мне придется обменивать свою 3060 ti на просто 3060, чтобы получить больше дополнительного врам к сетапу.
Что принципиально изменится при переходе с 8 на 12 врам?
Аноним 21/08/26 Птн 18:45:06 1683924 458
image 2Кб, 183x63
183x63
Минимакс М3 Q4KM конечно неплох, но какой ценой...
5 токенов в секунду. Две 3090 и 4-канальная ддр4.
Аноним 21/08/26 Птн 18:46:35 1683926 459
>>1683899
>3060 ti за 70к
Это когда такая дичь была?
Аноним 21/08/26 Птн 18:50:23 1683929 460
>>1683924
Даже не успел долго побыть крутым в своём размере, дипсик флешем гигамогнули...
Аноним 21/08/26 Птн 18:52:42 1683930 461
>>1683929
Пока он выглядит стабильнее для РП.
Дипсик дерганный шизофреник, не уважает промпт и выдумывает чушь, если его не хлестать ссаной тряпкой по лицу.

И еще М3 ризонит сам по себе хорошо, без ебанутых префиллов и танцев с бубном. Не ожидал.
Аноним 21/08/26 Птн 18:55:54 1683931 462
>>1683924
5 токенов на 3090х2? Я конечно её ещё не пробовал но звучит как будто ты где-то под себя сиранул с настройками
-ngl all, -ncmoe ?
Аноним 21/08/26 Птн 19:00:53 1683933 463
image 6Кб, 295x244
295x244
>>1683931
Я серанул под себя с 4096/2048 батчем и 100к контекстом. Увы, нужно именно столько. Ну может до 80к сокращу.

По слоям - всё что можно на GPU, и все МоЕ слои в RAM - там никакого хитрого распределения нет вообще, влезает под завязку.

На одной видеокарте было бы 10 т/с как в случае с дипсиком, но увы тут коммуникация между картами въебана ддр4 мусором, к которому обе печки обращаются. Любая МоЕ модель большого размера падает по скорости генерации, когда распределена на 2 карты. И это не моя проблема, а широко известная хуйня - психи с конфигами типа 512 RAM / 24x4 VRAM грузят большие МоЕ и получают +- ту же скорость, неестественно низкую. Им говоришь - сократи число GPU и спихни все МоЕ слои в RAM, они потом удивляются почему быстрее стало.
Аноним 21/08/26 Птн 19:13:08 1683943 464
1692654673968.png 649Кб, 864x1184
864x1184
Ух бля. Упорством и вайбкодингом можно добавиться гораздо больше чем просто упорством.
Удалось скрестить верблюда с носорогом, а точнее анлок p2p на консумерских карточках хуанга с анлоком cmp170 и завестить p2p уже на них. Оригинальные решения из форков или не заводятся, или работают неоче, заодно ломая работу других карточек.
Поверх драйвера https://github.com/aikitoria/open-gpu-kernel-modules (обязательно на 6c244435, экспериментальные штуки потом ломают все) накладываются патчи https://github.com/amoghmunikote/cmpunlocker (нужна коррекция чтобы не поломало bar1, для нормальных карточек свой подход, для cmp свой. Если не пропустить mailbox peer pre-registration для cmp, то nccl вообще улетит с ошибкой на них). Нужны патчи ядра из https://github.com/bayley/cmpunlocker (только поправить под свое ядро, 7.0 рот ебал из-за кучи поломок) и добавить в команды запуска `amd_iommu=on iommu=pt pci=realloc` (на интел первая не нужна).
Итог - скорости одновременного обмена в 1.5-2 раза выше, что очень критично учитывая gen2. Пропорциональный рост для префилла и немного для генерации в тп режиме, в дипсик флеше с dspark пройден порог 80т/с генерации (~100 в коде) и 1800 обработки. Префилл в пп тоже вырос до 6-7к, генерация не изменилась.
Бонусом - практическое подтверждение что plx свич даже на таком экзотическом железе с кучей костылей поддерживает p2p.
Аноним 21/08/26 Птн 19:15:59 1683944 465
image 200Кб, 984x929
984x929
>>1683924
> Я ужас на крыльях ночи!
Решения принимает достойно. Со зрением скорость еще болбше упала. Защо.

Дипсик, для сравнения (в тексте, он ведь слепой) отсылку узнал и повел себя так, словно мульт вбит в голову персонажа на уровне всецелого понимания.
Аноним 21/08/26 Птн 19:20:18 1683947 466
>>1683915
+4 гига врам. Это куча доп контекста или квант повыше

>>1683926
При ковиде или после него. Цены x3-x4 были
Аноним 21/08/26 Птн 19:20:19 1683948 467
Аноним 21/08/26 Птн 19:30:10 1683955 468
Если 3090 почти до 100к поднялась, боюсь представить че там за 4090 и 5090 просят
Аноним 21/08/26 Птн 19:32:05 1683959 469
>>1683944
Замазывать имя вымышленного перса, это лол конечно.
Аноним 21/08/26 Птн 19:32:59 1683961 470
>>1683959
А это не вымышленный персонаж. Я некромантией занимаюсь.
Аноним 21/08/26 Птн 19:35:08 1683962 471
>>1683961
Воскрешать лолей плохая затея, ононче.
Аноним 21/08/26 Птн 19:35:55 1683963 472
>>1683955
Купи 170-ю девочку
>>1683961
Это видится как очень плохая идея, не надо. Из всех nsfl ты выбрал финального босса.
Аноним 21/08/26 Птн 19:39:20 1683965 473
>>1683943
>поезд из велосипедов с трубой из костылей
О, иц литерали ми!
Чё ты высрал, охуеть, ни слова не понял. Всё хуйня, давай по русски.
Аноним 21/08/26 Птн 19:41:21 1683967 474
>>1683962
>>1683963
Просто это веселое занятие. Этакий бенчмарк - сможет ли бот мимикрировать достоверно.
Аноним 21/08/26 Птн 19:49:55 1683970 475
>>1683965
Обычный обмен данными между видеокартами: гпу1 -> псина -> анкор -> цп (кэш/рам) -> анкор -> псина -> гпу2. Повышенные задержки и все идет через профессор, особенно неприятно когда идет сразу много параллельных обменов друг с другом.
П2п: гпу1 -> псина -> анкор -> псина -> гпу2. Минимизируются задержки и накладные расходы что бустит скорость.
По умолчанию п2п на консумерских картах куртки отключен, но есть патчи в модули ядра, которые его включают. Но с майнерским мусором все сложнее.
Чтобы работал p2p, память карты должны быть включена в общее адресное пространство системы, bar1 (Base Address Register) указывает границы. Функция resizable bar позволяет системе выставить его по размеру врам и обращаться. Но крайние диапазоны адресов присваиваются еще биосом, на cmp зашит максимальный размер 64мб из-за чего при инициализации верхняя граница ужимается и "разжать" до 64гигов нельзя.
Для этого и нужно пропатчить ядро системы и добавить аргумент переаллокации псин, чтобы оно этот момент переделало, сохранив верхнюю границу. Остальное уже душная техническая реализация работы п2п внутри драйвера.
Аноним 21/08/26 Птн 19:50:29 1683973 476
image 6489Кб, 480x200
480x200
Аноним 21/08/26 Птн 19:51:38 1683975 477
>>1683963
>Купи 170-ю девочку
У барыг за 120к? И потом еще с линупсом ебстись? Ну нахуй...
Аноним 21/08/26 Птн 19:59:31 1683982 478
>>1683970
И как мне это юзать на моей видимокарте? И надо ли это вообще, если у меня всего 12 гигсов врама?
Аноним 21/08/26 Птн 20:01:24 1683983 479
>>1683975
Можно 5090 за 500к из магазина, или за 120 5070ти с 16 гигами.
>>1683982
Это когда видеокарт больше одной. Для одной достаточно включить в биосе rebar/sam или другие варианты названий.
Аноним 21/08/26 Птн 20:03:31 1683984 480
>>1683973
Окс - это новый Минимакс, 3.5 наверное.
Аноним 21/08/26 Птн 20:09:35 1683987 481
Аноним 21/08/26 Птн 20:09:47 1683988 482
>>1683973
Не разевай пасть раньше времени и туда не навалят, там какой нибудь 10-1b лоботомит
Аноним 21/08/26 Птн 20:11:32 1683990 483
>>1683987
Минимакс 146%, по ответам видно, они почти как у М3.
Аноним 21/08/26 Птн 20:22:28 1683997 484
>>1683983
Спасибо, я попробую.
Аноним 21/08/26 Птн 20:25:50 1683998 485
>>1683943
>Iommu=on
Илмму разве не глушит p2p? Я слышал советы что лучше его отключать
Аноним 21/08/26 Птн 20:26:32 1683999 486
Аноним 21/08/26 Птн 20:29:57 1684005 487
>>1683998
Не глушат. С ним всё прекрасно работает

>>1683970
> "разжать" до 64гигов нельзя.
У меня 5060ti отказывались брать фулл бар 16гб. Но мне легко далось просто впихнув скрипт в ядро который когда-то там при буте форсит размер бара
Аноним 21/08/26 Птн 20:45:24 1684014 488
>>1683998
Если в режиме path-through и выключить acs то не должен, а наоборот нужен. Вроде бы так.
>>1684005
Ага, на этом основаны наработки в основной репе. Но тут нюанс в локе верхнего лимита, который зашит в чип. Из 2тб доступного адресного пространства после инициализации оно ставит лимит в 96мб и дальше как ни рыпайся - не хочет. Нужно на раннем этапе переаллоцировать пси и для цпмшек устанавить верхний лимит побольше, тогда потом целевые 64гб устанавливается.
> У меня 5060ti отказывались брать фулл бар 16гб.
Интересно что ей не нравилось?
Аноним 21/08/26 Птн 21:43:17 1684049 489
>играю с персонажем который умеет читать мысли
>думаю всякую хуйню
>персонаж шлёпает пажопе, сильна
>перестаю думать
>Эй ты, чё ты не думаешь? Скрываешь что-то?

Ах ты умная сучка... я думал забьёт на то, что у меня блока мыслей в ответах нет.
Аноним 21/08/26 Птн 21:45:26 1684051 490
GC4.png 118Кб, 1016x326
1016x326
>>1683571
Чёт я походу перемудрил, когда боролся с остатками цензуры, ну по крайней мере я не иронично узнал много нового о гинекологии.
Аноним 21/08/26 Птн 21:49:31 1684053 491
>>1684051
>орJEEZм
Обнейрослопился чёт, аж пролил логиты на токены.
Аноним 21/08/26 Птн 21:53:48 1684059 492
>>1683767
Годнота. Сейчас кернели для nvfp4 и fp8 w8a8 под прошлые архитектуры очень сподручно пилить выходит. Локальная сингулярность, которую мы не заслуживали.
Аноним 21/08/26 Птн 21:58:35 1684065 493
>>1684014
> Интересно что ей не нравилось?
Без понятия. По флажкам в драйвере всё разрешено, соседние амдшки себе спокойно забрали по 32гб, а этим пришлось в глотку пропихивать

cat /etc/initramfs-tools/scripts/init-premount/resize-nvidia-rebar
#!/bin/sh
# Configure the 16 GiB BAR before the NVIDIA driver binds to either GPU.
PREREQ=""

prereqs()
{
printf '%s\n' "$PREREQ"
}

case "$1" in
prereqs)
prereqs
exit 0
;;
esac

for device in 0000:17:00.0 0000:18:00.0; do
resize="/sys/bus/pci/devices/$device/resource1_resize"
[ -w "$resize" ] && printf '%s\n' 14 > "$resize"
done
Аноним 21/08/26 Птн 22:08:24 1684077 494
>>1683836
>Классная балансная сборка была бы под этот квен. Летал бы с хорошим контекстом.
Скорей я бы просто квант поднял. Его и сейчас я могу довольно свободно запускать в 27B-UD-Q5_K_XL и 225280 контекста в полном весе. И он прям ебурит! Если быбыло ещё 12гб то mmproj, Q8 и 256к контекст были бы. Хотя даже как сейчас- охуенно.

>у тебя серверное железо что ли? Линии у тебя при лучшем раскладе закончились бы на второй 3090
Ноуп. Хотят у меня есть второй конплюктор в котором RX570 крутится и там второй слот есть. После уже стал копить бы на серверное железо.
Аноним 21/08/26 Птн 22:09:39 1684079 495
image.png 392Кб, 2409x1778
2409x1778
>>1683943
господи столько еботни - лишь бы не платить $20/мес за фронтирку которая делает все у тебя на экране ультрабука на бережку речки - чел ты реально долбоеб

Ты авто тоже сам себе мастеришь из металлолома со свалки?
Аноним 21/08/26 Птн 22:22:43 1684086 496
>>1684079
но зачем? локальная модель очень сильно меняет психологию использования модели. фронтирке "так блять пидор, ты совершил ошибку, мразь. за что я бабки плачу?". а на локалке "ты снова ошибся? ну бывает, попробуй ещё раз".

да и на фронирках не дают интересных игрушек обычно, типа logprob.
Аноним 21/08/26 Птн 22:30:57 1684088 497
>>1684079
> авто
С авто хорошая аналогия. У порядочных господ их железный конь верно ждет под окном, и готов вести тебя, твоих спутников и все твое барахло хоть на край света в любое время. Все как ты хочешь, ровно столько, сколько ты хочешь, и никем не зашкварено.
А плебеи под дождем топают 20 минут до ближайшего карша, молясь чтобы он не был разъебан школьниками и измазан говном внутри. Накопленное недовольство заставляет потом рассказывать как это выгодно и удобно, а 100% доступность, выезды за город, свобода путешествий, качество, комфорт и прочее не нужны.

Кстати, за 20$ подписку сейчас только хуй пососать и можно, натолько нищие квоты.
Аноним 21/08/26 Птн 22:41:42 1684090 498
>>1684079
Интересно сколько времени он читал тред перед тем как бахнуть
Тут многие пользуются и тем и тем, это тред про хобби, имбецил
Аноним 21/08/26 Птн 22:47:54 1684093 499
>>1684079
Зачем 20 баксов платить, если в opencode бесплатно доступен deepseek v4 flash? Для экономии токенов он как субагента юзает мою локальную гемму 4 26
Аноним 21/08/26 Птн 23:02:25 1684106 500
Посоветуйте лучшую модель под 12/32 памяти, для эрпэ на англюсике. На слог похуй - самое главное для меня это чтобы моделька принимала решения за персонаже не просто от балды, а скажем так исходя из логики и текущего психоэмоционального состояния перса. На c.ai когда-то модели действительно умные в этом плане были, сейчас интересно можно ли хоть что-то вменяемое попробовать.

...кроме мистрали 24бэ конечно. её уже вдоль и поперёк изошел.
Аноним 21/08/26 Птн 23:02:44 1684107 501
>>1684093
>deepseek v4 flash
его утром убрали оттуда лол
Аноним 21/08/26 Птн 23:06:22 1684112 502
>>1684106
>под 12/32 памяти
Гемма 26b
>исходя из логики и текущего психоэмоционального состояния перса
Включить ризонинг.
Аноним 21/08/26 Птн 23:09:47 1684116 503
>>1684112
та что 26A4B? как этот ризонинг в таверне включить не подскажешь? и от кого лучше качать. я пробовал вроде MeroMero но то ли хуйня полная и у меня кобольд вылетал, то ли ещё что-то, не помню.

какие настройки там нужны не подскажешь? буду благодарен.
Аноним 21/08/26 Птн 23:17:58 1684124 504
>>1684116
В шапке целый гайд который обучает запуску на примере геммы 26
Аноним 21/08/26 Птн 23:18:52 1684125 505
>>1684116
Да, она. Включается на чаткомплишн через --reasoning on в лламе, как в кобольде не знаю. Посмотри гайд для новичков из оп-поста, там расписано как её запускать и какие настройки. В таверне просто семплеры выставить и нужный контекст. Лучше качать ванильную гемму от батрухи в Q8_0, но если лень возится с сиспромптром, то можно накатить норм-пресерв (наименее повреждающий мозги способ аблитерации). От распиаренных херетиков лучше держаться подальше.

https://huggingface.co/bartowski/google_gemma-4-26B-A4B-it-GGUF
https://huggingface.co/TrevorJS/gemma-4-26B-A4B-it-uncensored-GGUF
Аноним 21/08/26 Птн 23:20:11 1684126 506
image.png 135Кб, 693x475
693x475
>>1681462
>>1681780
Аноны, а вы используете ризонинг? С какого этапа его можно безполезенно включать? Поскольку даже наверное 40-50 все равно ждать нужно. Ну и конечно, если выключить его, то по мозгам уходит гемма 26б-а4б, и пиздец.
Аноним 21/08/26 Птн 23:22:31 1684130 507
>>1684125
получается качать Q8 на 26 гигов...? у меня тогда даже половина не влезет в 12гигов моей 3060, а ещё и контекста бы хотяб 30к...

q4 в сравнении сильно хуйня будет?
Аноним 21/08/26 Птн 23:25:15 1684133 508
>>1684130
Это MoE, ей не обязательно влезать полностью чтобы быть быстрой. С частичной выгрузкой получишь свои ~25тс, если осилишь MTP, то и все 30. Почитай гайд, там всё написано.
Аноним 22/08/26 Суб 00:20:13 1684175 509
image 1428Кб, 1526x1638
1526x1638
image 441Кб, 1525x1541
1525x1541
>>1683892
>>1683506
Похоже не пошло, она уже несколько раз зациклилась на шахматном тесте, начиная просто писать I'm confused и по 10 раз перестраивая свои шахматные матрицы, потом просирая стенами текста, пока окно вывода не израсходуется полностью, а задача так и не решена. Дальше приходится перезапускать промпт. Ни одна другая модель так не делала, ни 3.6, ни 3.8, у всех ризонинг в окно вывода в 30к токенов укладывался. Пробую довести ее до финала, но пока так и не доходит, похоже модель говно.
Аноним 22/08/26 Суб 01:25:27 1684198 510
image 1291Кб, 1522x1642
1522x1642
>>1684175
>>1683506
Короч бесполезно, модель охуевшая, уже много раз перезапускал, она все время находит как завести себя в тупик. 40б не вышло, вышел лоботомит. Еще и тормознутая в сравнении с 3.8 27b.
Аноним 22/08/26 Суб 01:56:12 1684205 511
>>1683506
>40B
Как он вообще это сделал? Что он туда засунул?
Аноним 22/08/26 Суб 02:36:59 1684217 512
Коданы, что лучше больший квант, но меньше контекста или меньший квант но больше контекста? Типа разница между Q5 и Q6 у квена не такая уж большая, но нахуя нужно 262к контекста вместо 131к тоже хуй знает, да и небось просадки по скорости на таком контексте будут сильные
Аноним 22/08/26 Суб 02:42:39 1684218 513
>>1684217
Для агентов нужно 60к контекста, для рп вообще можно в 30к уложиться, если саммари чаще делать. Хз кто там 262к контекста лупит, это для специфичных задач с большими файлами. Обычно проще бывает порезать все файлы на 100кб блоки и обрабатывать с 60к контекстом.
Аноним 22/08/26 Суб 02:51:04 1684220 514
>>1684218
Квен на xhigh 47к токенов на одну таску в среднем требует. Он сразу же заполнит 60к контекст, так кодить невозможно, разве только каждый раз с чистого чата начинать и просить изучать проект. 131к это точно мастхев, но вот хз стоит ли больше
Аноним 22/08/26 Суб 03:03:46 1684222 515
daTIxhxizE.png 25Кб, 1326x125
1326x125
>>1683061
>>1683293
Попробовал новую SOMPOA версию. Гораздо лучше, десяток параграфов душевных терзаний превратились вот в это на том же свайпе. Хотя пишут лучше ещё простеньким ОВЕРРАЙД сверху приправить на всякий случай.
Аноним 22/08/26 Суб 03:10:08 1684223 516
>>1683512
>Отсюда:
>https://huggingface.co/DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
>Так что этот рекомендую.
Забавно, но у этого тюна внезапно стало намного лучше с русским, чем у стока. На задаче "напиши по черновику-хотелкам рассказ" - написал вообще не проёбывая окончаний, и не вставляя символов другого языка. Все равно не идеально - (кое-где есть несогласованности) но уже в глаза так откровенно не лезут. На iq4xs.

Так что - спасибо за рекомендацию.
Аноним 22/08/26 Суб 03:14:37 1684225 517
>>1684220
>xhigh
Нахуя, а главное зачем.
Все говорят это бесполезный уровень, надо снижать на один
Аноним 22/08/26 Суб 03:21:11 1684226 518
>>1684225
Low в агентном кодинге выдает такое же количество токенов. Там тесты есть на ютубчике, он постоянно фиксит ошибки и не заканчивает пока их не будет. Медиум жрет меньше всего токенов, но все еще достаточно много, но и результат получается хуже. Короче там все сложно с его уровнями ризонинга, но в целом это модель требующая большого контекста
Аноним 22/08/26 Суб 04:48:13 1684236 519
>>1684220
Какой еще xhigh в локальном квене, это для онлайн моделек.
llama-server не поддерживает такое.
Аноним 22/08/26 Суб 04:51:29 1684237 520
>>1684236
А, все нашел, надо через команду ставить с консольки --reasoning-effort xhigh
Аноним 22/08/26 Суб 06:28:04 1684253 521
>>1683943
А насчет анлока int8 не в курсе?
Аноним 22/08/26 Суб 06:48:17 1684258 522
Опа, пиздец !!![...].mkv 6454Кб, 640x360, 00:01:21
640x360
Аноним 22/08/26 Суб 07:16:55 1684265 523
>>1684198
А что самое пиздатое у тебя было из 3.8 Квена?
ПЕРЕКАТ Аноним # OP 22/08/26 Суб 07:18:06 1684267 524
Аноним 22/08/26 Суб 08:22:38 1684280 525
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов