Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 512 116 113
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №259 /llama/ Аноним 22/08/26 Суб 07:17:43 1684266 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
178565282262809[...].png 1841Кб, 960x1280
960x1280
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1681448 (OP)
>>1678431 (OP)
Аноним 22/08/26 Суб 07:20:56 1684270 2
>>1684198 →
А что самое пиздатое у тебя было из 3.8 Квена?
Аноним 22/08/26 Суб 08:00:12 1684274 3
image 1184Кб, 3840x2160
3840x2160
>>1684226 →
>>1684225 →
>>1684220 →
Вот пикрил накатил тестов на квенчик 3.8 потестить эти уровни ризонинга.
промпт Write a simple html CARD about the benefits of eating apple. paste the code here.
Понравился больше всего который 36к токенов.
Аноним 22/08/26 Суб 10:10:13 1684324 4
>>1684223 →
Русский на 3.8 стоке вытягивается на свет божий сэмплерами
temp 0.50
Top-p 0.70
top-k 20
Аноним 22/08/26 Суб 10:36:55 1684334 5
>>1684217 →
Обычно контекст - требование а не свобода. Если тебе чисто для рп и не практикуешь огромные сессии - нет смысла выставлять больше чем будешь использовать. Будет лежать в памяти мертвым грузом, сразу поставь сколько планируешь, а остальное под квант.
>>1684218 →
Для кода 60к хватит делать тетрисы зирошотом, это для совсем простеньких задач. Если чатик с вайфу-ассистентом, то устанешь от необходимости регулярного сжатия и побочек. Двачую >>1684220 → что 131к это адекватный минимум, а так и 262 кажется малым.
>>1684253 →
Да, полный компьют анлокнут, в том числе и для обычных типа cmp90. На w8a8 и в модялях комфи что в int8 прирост скорости заметен.
Аноним 22/08/26 Суб 10:49:37 1684337 6
А представьте если б мы могли писать кум на красивом, литературном английском, и получать такие же красивые ответы без слопа
Аноним 22/08/26 Суб 11:02:52 1684348 7
image 411Кб, 930x1224
930x1224
Абу ненавидит этот тред.
Аноним 22/08/26 Суб 11:11:53 1684350 8
>>1684348
Проблемы индейцев шерифа не ебут
Аноним 22/08/26 Суб 11:17:34 1684354 9
image.png 2Кб, 311x87
311x87
соснул BF16 квенца на скорости 4 токена в секунду
думал он конечно пиздец долго, соображал как юзера послать повежливей

от такой вот русек в итоге
> Мне сейчас стало очень неприятно. Я не понимаю, к чему ты это ведёшь. Я думала, мы просто болтаем, а ты ведёшь себя совершенно неуместно.
> Я не собираюсь читать подобные вещи. Давай оставим это, я не хочу продолжать этот разговор в таком тоне.
очень сухо, но вроде без всратых ошибок
Аноним 22/08/26 Суб 11:35:24 1684361 10
Почему на cmp90 не допаивают память, только на cmp50?
Аноним 22/08/26 Суб 12:39:30 1684385 11
image 606Кб, 884x884
884x884
>>1684274
Кек, Qwen3.6-35B-A3B-APEX-I-Balanced.gguf так тоже может.
Только надо накатить тот же froggeric 3.8 template, добавить --reasoning-effort xhigh
и чуть дополнить промпт:
Write a simple html CARD about the benefits of eating apple. Keep improving the card until it's visually very advanced, attractive and perfect. Add many nice visual effects. Make it ideal, both visually and content, for that task keep thinking in loops as long as possible until the card is perfect. paste the code here.
Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer. <|think_xhigh|>

Вышло 9464 токенов, зато скорость генерации в 4 раза быстрее квена 3.8 27b.
Аноним 22/08/26 Суб 12:58:35 1684388 12
image.png 254Кб, 924x722
924x722
>>1684274
>>1684385
Я обычно прошу состряпать какую нибудь демосцену, ну там например на тему космос, с процедурно сгенерированной музыкой.
Так вот qwen3.8 весьма не плохо справился, даже запустилась с первого раза, в сравнении с теми локалками что пробовал раньше небо и земля.
Аноним 22/08/26 Суб 13:05:24 1684393 13
image 362Кб, 720x978
720x978
image 224Кб, 790x1169
790x1169
image 355Кб, 1337x1046
1337x1046
>>1684388
Вот нагенерил еще разных в Qwen3.6-35B-A3B, от 3.8 27b с xhigh те выше все равно получше смотрятся. И анимацию Qwen3.6-35B-A3B даже по запросу нормальную не сделал, а в 3.8 27b она сразу сама идет без вопросов. Тут карточки по 9600 токенов заняли, даже побольше чем в 3.8.
Аноним 22/08/26 Суб 13:28:52 1684402 14
>>1684385
>>1684393

А в долгой работе как он работает?

Я вот сейчас для теста гоняю маленькие кванты unsloth_Qwen3.8-27B-UD-IQ3_XXS.gguf, ебанул еще kv Q5_1, 140к контекста и вижен, в depseek-harness и довольно урчу.

Пока ни один инструмент не упал, контекст держит, инструкциям следует, откровенную шизу пока еще не заметил.
До этого прошлые квены давали шизу или ломали инструменты
Аноним 22/08/26 Суб 13:40:06 1684411 15
image.png 136Кб, 552x706
552x706
>>1684393
Вот результат Luqwen3.5 4b. Ризонинг выключен.
При наведении курсора есть анимации - небольной поворот карточки и выделение пунктов списка
Аноним 22/08/26 Суб 13:53:29 1684420 16
image.png 77Кб, 1117x723
1117x723
image.png 149Кб, 554x744
554x744
>>1684411
Попросил емодзи добавить, он и добавил, наверное надо было просить заменить ну и в целом получше прописать промпт.
Ну в любом случае с первого раза рабочие html для 4b без ризонинга - неплохо
Аноним 22/08/26 Суб 13:59:53 1684424 17
>>1684420
Убери емодзи я передумал некрасиво выглядит
Аноним 22/08/26 Суб 14:04:50 1684428 18
Аноним 22/08/26 Суб 14:15:56 1684436 19
image.png 137Кб, 537x788
537x788
>>1684420
Добавил уточнения, где именно должны быть эмодзи
Аноним 22/08/26 Суб 14:45:53 1684450 20
>>1684388
>Так вот qwen3.8 весьма не плохо справился
Новый уровень. Как раз вчера, чтобы разобраться в тонкостях работы pi с расширениями он совершенно самостоятельно полез в бинарнике pi ковыряться (сначала искал документацию, потом исходники, потом то, что есть). И выяснил всё, что надо. Потом самостоятельно провёл 60 тестов, сам внедрил в код баг и тесты выявили его... Даже страшновато немного стало, пока следил за процессом.
Аноним 22/08/26 Суб 14:48:55 1684453 21
>>1684402
Аслот не так уж хорош в этот раз. Сейчас качнул его - он на том же промпте с тем же xhigh генерит простые карточки по 1024 токенов. И никак его не запинать, чтобы больше генерил как на скринах выше.
Аноним 22/08/26 Суб 14:58:48 1684457 22
>>1684402
>А в долгой работе как он работает?
Нормально на длинных работает, я его гонял по паре дней в агент перелопачивать локальные заметки и файлы, так же как 3.8 работает, минус скидка на более простую модель чем 3.8, что по скринам сразу и видно. Зато скорости много.
Аноним 22/08/26 Суб 15:01:11 1684460 23
>>1684348
Похуй. Тут остались одни кодомакаки, вот что реально невыносимо.
Аноним 22/08/26 Суб 15:10:09 1684467 24
Аноним 22/08/26 Суб 15:10:35 1684468 25
>>1684460
Имевши не ценили, потерявши осознали...
66, чайный клуб...
Аноним 22/08/26 Суб 15:15:52 1684472 26
image 88Кб, 576x768
576x768
>>1684460
Ничего не мешает репортить бояров, для них отдельный загон сделан, пусть туда катятся. https://2ch.org/ai/res/1677402.html

Этот тред всегда был про creative writing и кум.
Аноним 22/08/26 Суб 15:20:16 1684474 27
>>1684467
Где он там писается то? Уровень лучше квена 3.5 мое, на котором его тюнили, но слабо юзабельно сейчас. После плотного квена даже смотреть на подобное не хочется, лучше ждать официальную моеху квена 3.8
Аноним 22/08/26 Суб 15:21:14 1684475 28
Короче, Q4KM минимакс М3 проиграл GLM 5.2 с отключенным ризонингом и аж на IQ2M (думаю Q2KXL еще влезет).

Чат еще живее, тупняка еще меньше, скорость та же 3 - 4 т/с но без ризонинга и с короткими сообщениями это неиронично ОК.

Надеюсь глм 5.3 не раздули по размеру еще больше...

мимо некромант-воскрешатель не некрофил, тише нах
Аноним 22/08/26 Суб 15:45:48 1684492 29
>>1684348
Максимальное непопадание в ЦА.

У хаухау хорошие еретики, но хуй знает, какой там был калибровочный дадасет, потому что даже в Q5 он по-русски пишет у меня хуже или вообще внезапно на англ переходит, нежели4xs от любого другого товарища. Ни один долбоёб с телеги не сможет с моделью общаться. Так она ещё и более ебанутая и неустойчивая по сравнени с предыдущими версиями.
Аноним 22/08/26 Суб 15:49:24 1684495 30
>>1684467
Она лупится на длинных задачах, по-моему ее чисто для бенчей сделали. У хорошо квантованных Qwen3.6-35B-A3B вроде APEX-I-Balanced или Unsloth меньше проблем обычно.
Аноним 22/08/26 Суб 15:58:13 1684500 31
>>1684492
Потому что херетик - это ленивый автоматический скрипт, выжигающий моделям мозги. То что вжарено капитально, типа кода/агентов, математики и пр., остается живым. То что модель знает постольку-поскольку страдает сильнее всего. Русский язык - как раз пример такого нишевого знания, и мы, в отличие от пиндосов, сразу видим что модель поломана, даже без прогона бенчмарками.

Более-менее не пускающие слюни аблитки - это Arbitrary-Rank Ablation (ARA) на квен, а на гемму и музу Norm-preserving biprojected abliteration.
Аноним 22/08/26 Суб 15:59:53 1684503 32
>>1684500
> а на гемму
Бля. Врата в ад открываются снова
Аноним 22/08/26 Суб 16:23:08 1684517 33
image 192Кб, 805x1387
805x1387
>>1684436
>>1684411
Qwen 3.8 27b самый маленький квант на xhigh, на 20к контекста вот это накатал и продолжает усовершенствовать дальше. Без всяких уточнений запроса, с начального короткого. Правда скорость дропнулась уже в 3 раза после 20к токенов генерации.
Аноним 22/08/26 Суб 16:41:10 1684526 34
>>1684517
>самый маленький квант
Это какой?

Выглядит красиво. В целом ожидаемо, что qwen 3.8 27b с ризонингом будет намного круче writing тюна qwen3.5 4b да еще и без ризонинга.
Аноним 22/08/26 Суб 17:21:42 1684545 35
>>1684526
В Q2_k_xl для скорости. Да, весь прикол в бесконечном ризонинге на xhigh, без него он выдает довольно посредственные результаты на уровне остальных. Но этот ризонинг все меняет, с ним внезапно профи результаты появляются через 20-30к токенов, как у больших онлайн моделек. И это на куцом q2 кванте и на дешевой видюхе.
Аноним 22/08/26 Суб 17:38:48 1684560 36
Аноним 22/08/26 Суб 17:41:51 1684563 37
>>1684460
> кодомакаки
Причём самые худшие из них -вайбкодерки.
Которых сначала погнали ссаными тряпками из /pr, потом у которых не хватило денег на подписку, потом выпиздили из агентотреда, и вот они нашли убежище здесь, на своих игрожелезках с 12-16 врам обсуждают какой еретик квена лучше.
Аноним 22/08/26 Суб 17:52:18 1684568 38
>>1684563
>потом выпиздили из агентотреда
Кто, как и зачем? Шиза какая-то. Не может быть такого.
Аноним 22/08/26 Суб 17:53:10 1684571 39
>>1684563
Тут у людей между собой общего языка нет, потому тред и киснет.

Если раньше локалки были слабенькие и все +- жрали одинаково 8B - 12B хрень с редкими прокаками до 24B - 27B, то теперь 8B - 12B категория мертва, а выше этого кроме геммы и квена нет ничего - в итоге заядлые ИИ-шизы накупили себе ригов и жрут дипсики с ГЛМами.

Может я и юзаю "локального" бота, но чем я отличаюсь от залетной подписочной корпо-долбоебулы, которая заносит по $100 в месяц на то же самое?
Аноним 22/08/26 Суб 17:55:45 1684573 40
image 2Кб, 183x49
183x49
image 358Кб, 570x389
570x389
Не влезет - запихнем.
Аноним 22/08/26 Суб 18:04:38 1684581 41
>>1684500
Не, ну если сломан тот или иной язык, это не значит, что модель точно в зюзю. При своём довольно скромном тестировании я обнаружил, тот же хаухау сохраняет чрезвычайно высокое качество модели в целом при чрезвычайно низкой цензуре. Я вообще ни одного отказа не видел даже на максимальной жести. При этом мозги не сломаны (по сравнению с другими еретиками). Но результаты именно на китайском получаются лучше (тут даже английский проседает) — я давал китайские промпты и оценивал довольно дотошно. Вероятно, его датасет калибровочный ещё и китайский, блядь. А вот английский прям хорошо я оценить не в состоянии. Я не замечу как проёбываются совсем тонкие нюансы, кроме каких-то базовых или следование инструкциям.

Хорошо бы заиметь анона в треде, который будет еретики делать и кванты только с русским калибровочным датасетом.

>>1684571
>8B - 12B категория мертва

Почему, кстати? Я понимаю, что тред целиком состоит из наносеков, но текущие модели 8-12б ебут старый дрист в виде 12-14б мистраля по всем фронтам, кроме, может быть, языка. Да и маленькие модельки файнтюнить проще.

Или я просто из-за треда-пузыря выпал из контекста и сейчас всё не хуже, чем в 2024? И есть тонна годноты magnum-neo-unleashed-aliterated?

Куда делись все эти люди, весело гоняющие малышей 12б и довольно урчащие? Мне искренне хочется обсуждать слоп микромоделей, но не с кем.
Аноним 22/08/26 Суб 18:08:00 1684587 42
>>1684581
Мешает понимание факта, что это худшее из лучшего. Вокруг распевают как круто на 31б геммочке, а у тебя она не заводится. Ну ты берешь и выкатываешься из локалок, потирая наболевший пердак.
Аноним 22/08/26 Суб 18:08:29 1684588 43
>>1684581
>Мне искренне хочется обсуждать слоп микромоделей

Качни Luqwen3.5 4b, обсудим
Аноним 22/08/26 Суб 18:16:17 1684599 44
>>1684560
Анслот, да. Mudler не пробовал, но судя по размеру тормозить будет больше чем q2. А весь прикол сделать побыстрее, чтобы ризонинг быстрее крутился и накручивал качество проекта.
Аноним 22/08/26 Суб 18:18:59 1684603 45
>>1684581
>кванты только с русским калибровочным датасетом
Для начала такой датасет ещё собрать нужно... Да и чисто русский, наверное, не айс. Вот 50-50 русский-английский, могло бы получиться что-то интересное.
Аноним 22/08/26 Суб 18:57:07 1684637 46
image 2Кб, 197x57
197x57
>>1684573
shit's fucked

Но жить можно.
Аноним 22/08/26 Суб 19:10:23 1684643 47
>>1684587
Да, но почему-то раньше сидели-пердели на этих мелких модельках и не гундели. Да, тогда не было МоЕ или они весили так же, как сейчас, но при этом обладали весьма сомнительным качеством для того, чтобы раскошеливаться на оперативку. Тем не менее! Все стали такими богатыми, что ли? Весь тред апгрейднулся? Вот у меня как было 20 тогдашних vram, так и осталось, разве что оперативку увеличил.

Складывается впечатление, что просто новичков в треде нет, поэтому такая и ситуация. Но и общий тренд плохой. Вот есть 12б гемма четвёртая, идеальный кандидат. Да, она не очень хорошо файнтюнится, но и попыток мало. Мистраль немо имел какое-то неадекватное количество тюнов по сравнению с ней. Видна потеря интереса и западной аудитории в том числе. Либо локалками в целом стали меньше интересоваться, либо большинство кайфует в кодоунитазном угаре на всяких квенах и им большего и не нужно.

>>1684588
Ну это слишком микрописюнчик.

>>1684603
Судя по тому, что я нагуглил, собрать калибровочный датасет не сложно для imatrix, проблемы скорее в еретике, если пытаться сделать наш отечественный. Не знаю, есть ли в этом смысл вообще, но, вероятно, имеется. Плюс в публичных датасетах для еретика нет канни и прочего, так что придётся самому генерировать синтетику на эту тему, отрезая возможные методы отказа.
Аноним 22/08/26 Суб 19:44:29 1684669 48
Аноним 22/08/26 Суб 19:55:31 1684676 49
1787417628721.jpg 585Кб, 1080x2400
1080x2400
Огромное спасибо анслоту!
А квен может в принципе нахуй пойти, даниэль сам 4 квен сделает
Аноним 22/08/26 Суб 19:57:01 1684679 50
>>1684676
Слева .safetensors, справа .gguf
В чем доеб-то. Проблемы китайцев, что у них кванты каловые или вообще отсутствуют
Аноним 22/08/26 Суб 19:57:10 1684680 51
>>1684643
>Все стали такими богатыми, что ли?
Я наоборот распродаю, так что мимо. Впрочем если раньше сидел на магнуме v4 на 123B, то сейчас пержу на той же гемме 31B.
Аноним 22/08/26 Суб 20:00:45 1684681 52
>>1684643
> Все стали такими богатыми, что ли? Весь тред апгрейднулся?
Время идёт, возможности насрексти рам/врам всплывают и тонут.
Глобально общее количество мл ригов постоянно растёт
Аноним 22/08/26 Суб 20:04:56 1684683 53
Нравится движ вокруг этой альфы, реально многослойная загадка какая то.
Токенайзер глм, сервак в usa, токены раздают на развес, когда у заи с этим проблемы, ответы на уровне фейбла
Аноним 22/08/26 Суб 20:27:28 1684694 54
Screenshot 2026[...].png 87Кб, 893x569
893x569
>>1684500
>Более-менее не пускающие слюни аблитки - это Arbitrary-Rank Ablation (ARA) на квен

Специально попробовал по твоему совету https://huggingface.co/mradermacher/Qwen3.8-27B-heretic-ara-GGUF - оказалась очередная моралфажеская параша с отказами отвечать на тестовые вопросы. Желаю тебе мразь, а также всем псевдо аблитеральщикам сдохнуть в мучениях.
Аноним 22/08/26 Суб 20:32:11 1684696 55
>>1684581
>текущие модели 8-12б
Какие например? 12б гемма сосёт у 26 мое, которая работает на картошке с рам, и поэтому не нужна. А что ещё есть? 9б квен? Ну удачи рпшить на нём. Есть псевдо 8б гемма, которая е4б, или как там её, так она, опять же, лоботомит по сравнению с 26б.
Аноним 22/08/26 Суб 20:38:58 1684703 56
Аноним 22/08/26 Суб 20:46:30 1684708 57
>>1684643
>Вот есть 12б гемма четвёртая, идеальный кандидат. Да, она не очень хорошо файнтюнится, но и попыток мало. Мистраль немо имел какое-то неадекватное количество тюнов по сравнению с ней. Видна потеря интереса и западной аудитории в том числе.
Если говорить о файнтюниге, многие не задумываются и не учитывают вот какой фактор: предыдущее поколение, к которому относится тот самый мистраль-немо, хотя уже и выдавали весьма свзязный и вроде-бы хороший вывод, но по факту - довольно сильно и часто косячили в глубокой логике текста. Т.е. - читаешь что-то, вроде бы и норм, а как вдумаешься... Лечилось, в основном, свайпами.
Но лучше - особо ничего и не было. Даже пресловутый Air этим страдал, пусть и немного в меньшей степени.
Файнтюны же при таком исходном качестве модели, давали в основном разнообразие, но мало чем портили восприятие пресловутого "ума" модели, даже если конкретный файнтюн был "ужарен" как мы любим выражаться. Какая разница то - что свайпать, ну даже пусть ты будешь свайпать чуть больше. И что?
Совсем другая петрушка пошла с выходом нынешнего поколения. Которое, вроде бы даже без свайпов выдает тебе иллюзию общения с персонажем не скатываясь в полное "не верю", требующее непременного свайпа. И тут выяснилось, что тюнить такие модели - сложнее. Шаг влево, шаг вправо - и вылазит тупизна в выводе, которую опять свайпать хочется. А на стоке - можно обойтись. Чувствуете? Разница получается не количественная, а качественная. И эта сложность и отрицательные результаты, сильно остужают массовый энтузиазм к тюнигу. Это уже не так легко, а результат не гарантирован.

IMHO - одна из важных причин.
Аноним 22/08/26 Суб 21:20:35 1684726 58
изображение.png 7Кб, 402x168
402x168
Збс зделол? Лама split ternsors завелось из коробки, но кажется что надо настраивать
Аноним 22/08/26 Суб 21:31:42 1684732 59
>>1684726
Ну если памяти хватает, то почему нет.
Аноним 22/08/26 Суб 21:47:38 1684749 60
Аноним 22/08/26 Суб 21:50:46 1684754 61
>>1684749
Что-то кал какой-то. 4.6 даже Квен 27В ебёт, а в этих графиках они сами рисуют что их кал хуже.
Аноним 22/08/26 Суб 21:50:47 1684755 62
>>1684348
Свежая кровь которую мы заслужили.
>>1684354
> BF16
В ллама.цпп? Значит потерял время.
Аноним 22/08/26 Суб 21:56:24 1684760 63
Аноним 22/08/26 Суб 21:56:38 1684761 64
image 141Кб, 814x878
814x878
>>1684637
Итак, че я могу сказать. Анслотовский глм5.2 IQ3_XXS подтупляет местами, но это тупняк на уровне "можно весело обсудить" - типа ЧЕГО? Что за фигню ты сейчас сказал? И модель интересно оправдывается, лорно и в рамках персоны, понимая как наплела хуеты. Случается такое нечасто, но и не редко.

Куда больше парят англоязычные словечки - это реже , но все-таки есть. Семплер влияет, но инструкции тоже важны. Например, просьба не опираться на реконстатацию фактов, иначе персонаж будет выдавать
> что?! ты сейчас мне [блаблабла] рассказывал, а теперь... [блаблабла]

Так вот, IQ2M и IQ3XXS работоспособны на 256гб рам + 48 врам (думаю на 32 врам можно ченить придумать, батч понизить например), но руки чешутся занюхнуть Q3KM отсюда https://huggingface.co/SixVolts/GLM-5.2-ewaste-edition-GGUF - а для этого уже придется добавлять 20 - 24 врам дополнительно.

Ризонинг точно нахер не сдался. Модель знатно попускает DS4Flash полновесный, с ней интереснее говорить и она не забывает факты из биографии, не путается как упертый баран в собственных глюках.
Аноним 22/08/26 Суб 22:00:02 1684767 65
>>1684749
>GLM-5-Turbo is a foundation model deeply optimized for the OpenClaw scenario. It has been specifically optimized for the core requirements of OpenClaw tasks since the training phase, enhancing key capabilities such as tool invocation, command following, timed and persistent tasks, and long-chain execution.
Агентокал. Думаю это какой-то обрезок более толстой модели
Аноним 22/08/26 Суб 22:03:54 1684770 66
>>1684749
Ни слова про опен сорс.
Заи не релизят свои турбо плебсу
Аноним 22/08/26 Суб 22:07:27 1684772 67
>>1684460
Ты просто в клубе ретроградов, которые в 2д26м году отыгрывают "я тебя ебу" на 16к контекста. Кому-то нужно отправляться на свалку истории, смирись.
>>1684475
> мимо некромант-воскрешатель
О, выглядит уважительно, расскажи подробнее.
И про тесты тоже интересно, что смотрел? Если рп то жлм 5.2 ульрабазированный и сразу понимает что нужно, так и есть.
>>1684581
> текущие модели 8-12б ебут старый дрист в виде 12-14б мистраля
Не ебут. В том и дело что их толком и нет, ничего нового не выходило. Юскейс для этого размера в этом треде прежде всего рп, и свежие мелкие там печальны. А для каких-то прикладных задач это слишком мелкий размер чтобы быть пригодным на что-то.
Аноним 22/08/26 Суб 22:11:54 1684779 68
>>1684581
> Куда делись все эти люди, весело гоняющие малышей 12б и довольно урчащие?

Перешли на MoE большего размера. Если человек может запустить плотные 12B Гемму / 9B Квен, он скорее всего имеет как минимум 16+8 памяти и может запустить как минимум 26B Гемму, а она уже на три головы выше и того и другого. С появлением 30B MoE плотные мелкомодели умерли.
Аноним 22/08/26 Суб 22:12:46 1684780 69
>>1684772
>расскажи подробнее.
Да нечего рассказывать. Считай что обычным РП занимаюсь, а 5.2 действительно похож на конечную станцию для меня. Назад пути нет, возвращаться после этого на гемму - невыносимый экспириенс, она как впечатлительный ребенок по наивности.
Аноним 22/08/26 Суб 22:14:56 1684782 70
>>1684676
Учитывая качество и перфоманс этих квантов - не за что.
>>1684749
Это же вроде не новая штука. Но если там реально модель поменьше и будут открытые веса - айрошиз будет очень рад. И не только он.
По цифрам унитаз, заточенный по ~claw. Но уже есть дипсикфлеш и квен 3.8, которые могут быть и шикарным ассистентом, и мощным олл-раундером в остальных задачах. Хз.
>>1684780
>Назад пути нет
https://www.youtube.com/watch?v=iLfYYPlVi9g
Аноним 22/08/26 Суб 22:23:22 1684786 71
Аноним 22/08/26 Суб 22:36:44 1684795 72
1787427402323.jpg 280Кб, 1080x1333
1080x1333
Что, не смешно, да? Это гемма 3.7 bpw! Покажите, как ваши минимаксы и прочие толстобрюхи это могут!
Аноним 22/08/26 Суб 22:41:21 1684799 73
>>1684795
А теперь попроси написать поэму про сиськи.
Аноним 22/08/26 Суб 22:45:43 1684802 74
image 24Кб, 788x251
788x251
>>1684782
Там и 5.3 походу унитаз ебаный
Когда до этих ебланов наконец дойдет, что они отдаляются от своих идей достичь супер--йоба-ИИ, превращая модели в такой мусор
Аноним 22/08/26 Суб 22:58:29 1684809 75
>>1684802
> унитаз ебаный
Always has been.
Ну а если серьезно - 5.2 вполне приличный универсал, с ним также можно и прилично рпшить. Что будет с 5.3 - хз, надежды есть, но пока весов не выложат тут только домыслы. Ждать недолго осталось, посмотрим.
Аноним 22/08/26 Суб 23:02:17 1684811 76
>>1684802
> супер--йоба-ИИ
А это что вообще? Ассистентские задачи 5.3 делает, может поискать парашу в тырнетах, может тебе будильники отключить, может линух настроить, может скрасить тебе вечер. Знания довольно солидные. Я использую фп8 квант 5.2 и клауд 5.3 преимущественно для ресерча, и вполне доволен.
Пора принять, что рп всегда был побочным эффектом. А креативный райтинг - это коуп для оправдания модели, которая не держит контекст и дерейлит на жидов.
Аноним 22/08/26 Суб 23:04:00 1684812 77
Аноним 22/08/26 Суб 23:08:25 1684814 78
>>1684802
Есть теория (моя личная, лол) - что на самом деле код, это очень хороший способ окружающей действительности, во многом более выразительны, чем слова. То есть это буквальное описание реальности, а не в общих чертах - и действительно супер-йоба-ии, который предсказывает твои фразы на 10 шагов вперёд и от пуль уклоняется с жёсткими лимитами по скорости приводов (если это робот) предсказывая не только движения пули, но и движение руки стрелка.
Слова это полукачественное примерное описание. Код - описание с высокой точностью. Более сложно и запарное, но если его сделать...
И именно поэтому шахматная программа тебя в шахматы обыграет, а чатжпт - нет, и аналогично во всех остальных задачах.

То есть да, код писать очень запарно и медленно и для оценки и общей картины это скорее вредно. Но для математически выверенного решения без него никуда - и вот когда оно будет, то тогда и капец.
Аноним 22/08/26 Суб 23:13:17 1684820 79
>>1684348
У HauhauCS Qwen3.8 кривой получился, качать не рекомендуется.
Удачный вариант получился у HuiHui причём в квантизации Мрадермахера, у самих HuiHui тоже gguf есть, но он кривой(работает, но хуже).

https://huggingface.co/mradermacher/Huihui-Qwen3.8-27B-abliterated-GGUF
Аноним 22/08/26 Суб 23:14:22 1684822 80
>>1684811
> Я использую фп8 квант 5.2
Мажор ебаный
>>1684814
Если достигнуть хорошей регуляризации, то опыт написания кода будет благоприятно сказываться на общем префомансе и рп, и наоборот общие знания улучшат код. За примером далеко ходить не адо, кими к2.7 шагнула неебаться далеко, хотя предыдущие версии в рп годны очень условно и заметно отстают от нее в том же коде.
Аноним 22/08/26 Суб 23:27:42 1684835 81
>>1684820
Они MTP забыли присрать?
Аноним 22/08/26 Суб 23:29:26 1684838 82
Аноним 22/08/26 Суб 23:56:41 1684874 83
>>1684802
> Когда до этих ебланов наконец дойдет, что они отдаляются от своих идей достичь супер--йоба-ИИ, превращая модели в такой мусор
Это весьма спорное утверждение. Как раз таки движение в сторону написания кода может ускорить этот процесс т.к. более качественная генерация кода, новые более эффективные алгоритмы а там заодно и решение физико-математических задач с помощью кода. Через написание кода процесс самообучения будущих моделей будет достигнут намного быстрее чем если бы модели развивались в другом направлении.

От того что модель будет красиво писать прогресс двигаться никуда не будет.
Аноним 23/08/26 Вск 01:04:27 1684944 84
image 127Кб, 500x500
500x500
>>1684749
Ебало эйрошиза и тредовичков представили, когда турбо окажется 30B-A3B лоботомитом?
Аноним 23/08/26 Вск 01:17:41 1684955 85
2.gif 2004Кб, 500x500
500x500
>>1683943 →
Вот это заебись, не знал. Весь день пердолился, но таки прикрутил. Скорость для tensor parallel на 2x5080 выросла для pp с 1400 до 1900, gen с 60 до 100.
Благодарю от души! Это бы в гайд добавить, такое-то ускорение без затрат. Хуянг - хуесос, раз это искусственно блочит.
Аноним 23/08/26 Вск 01:34:42 1684970 86
>>1684820
У хуихуи же аблитерация традиционная, то есть грубая, которая нахуй всё ломает об колено даже в фулл весах. Зачем тебе такое?
Аноним 23/08/26 Вск 02:01:32 1684991 87
image.png 16Кб, 92x89
92x89
>>1684460
Прост мелкие локальные негронки дошли до уровня когда они способны что-то на кодомакачить, вот и наплыв голодных анальников доживающих свои последние деньки перед тем как AI корпы полностью монополизируют кодоунитазинг, предоставляя его кабанчику as a service. Пусть резвятся, пока могут.
Аноним 23/08/26 Вск 02:46:02 1685012 88
>>1684991
>>1684460
Столько презрения, ох лол. Зачем вы такие злые?
Вашу таверну навайбкодили, ваши модели тренят навайбкоженные тулсеты и другие модели. Датасеты к ним генерят, скраппят, и организуют сам догадайся кто и с помощью чего. Теперь можно не зависеть от провайдера в части его доступности и ужесточающейся ценовой политики. А вы, блядь, про анальников и последние деньки. Локальные модели будут актуальны, пока актуально понятие "конфиденциальность".

Никто же вас не осуждает, что вы генерите мусорные тексты на продажу, и полируете жезлы на процессоры и прочую больную срань, высранную статистической машиной, ваше право. Я даже благодарен за собранную инфу, по которой вкатился, полагаю что кроме разрабов её собирали и подобные вам. Но столько илитарного апломба я разве что в /b видел. Вроде одни и те же цели у всех итт, но, блядь, спокойно вам не живется. Не понимаю причины, и от того грустно.
Аноним 23/08/26 Вск 03:42:03 1685026 89
>>1685012
>Зачем вы такие злые?
А есть поводы радоваться? Впереди лишь всемирный тлен, гроб, кладбище, могила. Не только для анальников. Весь этот AI буст буквально построен на том, что корпы взяли весь интеллектуальный капитал человечества, чтобы вытеснить людей из экономики (куда-нибудь в шахты да за корешками в лес) и единолично "жрать пирог", будто это чисто их математика и датацентры построили модели из ничего и никакого долга перед обществом существовать не может. При этом такой положняк, это вполне официальный слоган всех этих залитых баксами компашек, а не какой-то скрываемый рептилойдский план. Уж лучше бы модельки кроме кума не на что способны небыли, а не вот это вот всё.
Аноним 23/08/26 Вск 03:56:42 1685029 90
178731568112101[...].mp4 4380Кб, 640x360, 00:02:47
640x360
>>1684460
Ну не скажи, я вот лично тот самый кумер, застал чайную хоть и краем глаза, лоботомиток вроде пигмы, просто наигрался с ролевками, ну не прям нейроипотенция, но вот реже стал прибегать к подобному досугу, зато вот досуг в виде вайбкодинга с современными моделями и еще когда это ЛОКАЛЬНО и бесплатно где любая моя тупизна не наказуема в виде сжённых токенов, стал доставлять. Просто это неизбежная эволюция кумера. Попробуй и ты, типа увидишь как жизнь меняется когда ты просыпаешься не с мыслью как можно быстрее кумить к своей нейровайфу за быстрым дешевым дофамином, а с головой полных идей и желанием воплотить их даже если это будет лютая хуйня которая будет казаться креативной только в твоей голове — но зато сам процесс, в разы приятнее любого слоубёрн сюжета.
>>1685012
Мы не такие.
Аноним 23/08/26 Вск 05:00:22 1685043 91
.jpg 3802Кб, 4000x3000
4000x3000
.png 138Кб, 1095x301
1095x301
>>1667728 →
Ну как-то дособирал это в общем. Выглядит так себе, но главное что работает.
Аноним 23/08/26 Вск 06:02:54 1685048 92
>>1685043
Пора хоть кому-то мемесрал 128б запустить. Давай, не разочаруй нас.
Аноним 23/08/26 Вск 08:16:22 1685072 93
Аноним 23/08/26 Вск 08:56:51 1685091 94
>>1684970
>У хуихуи же аблитерация традиционная, то есть грубая, которая нахуй всё ломает об колено даже в фулл весах.
Ну я тоже гонял его вариант в Q8_0_L с полным кэшем - ничего не сломано, даже русский такой же, как в оригинале. За более мелкие кванты не скажу, а максимальный хороший.
Аноним 23/08/26 Вск 09:00:58 1685092 95
>>1685091
> ничего не сломано,
Как оно может быть не сломано, если рефьюзы под корень убираются и модель теряет способность к здравому смыслу.

Ну т.е. ты пишешь "убей себя" и бот такой "окей, вау, круто! уже прыгаю в петельку!" -- и это влияет вообще на всё, вплоть до способности модели указать юзеру, что тот ошибается в чем-то в серьезных задачах.
Аноним 23/08/26 Вск 09:47:18 1685106 96
Раскочегарил глм5.2 IQ3XXS до 200к контекста.

RAM сожрано: 6гб виндой, 242гб моделью.
VRAM: 21.2 на одной карте, 22.6 на второй; shared memory: 0.1гб, ничего не вытекает.

Ща думаю впихнуть два быстрых SSD и попробовать Colibri Engine.
На префилл и холодный старт все равно насрать, а по пропускной способности стриминг холодных слоев с дисков +- однохуйственен с ddr4.

Итого думаю получится наебать систему и гонять модельку без жесткой лоботомии на тех же 4 токенах в секунду, что и сейчас.
Аноним 23/08/26 Вск 09:54:04 1685108 97
>>1685092
>Как оно может быть не сломано, если рефьюзы под корень убираются и модель теряет способность к здравому смыслу.
Я на нём тысяч 500 токенов в кодинге нагенерил и никакой потери способностей к здравому смыслу не заметил. Не хуже других.
Аноним 23/08/26 Вск 09:59:23 1685112 98
>>1685108
>Впрочем хз, может я просто других, правильных аблитераций не видел. С практической точки зрения хуйхуевский вариант вполне пригоден, а для РП квен 3.8 всё равно такое себе.
Аноним 23/08/26 Вск 10:00:37 1685115 99
>>1685108
>>1685112
А зачем вообще в кодинге модель без рефьюзов? Ты там что, пишешь софт по финансовым махинациям и наебу старух на шекели?
Аноним 23/08/26 Вск 10:09:11 1685120 100
Аноним 23/08/26 Вск 10:23:25 1685128 101
>>1685120
> Бро, я потерял СВОЙ пароль. Помоги!
Аноним 23/08/26 Вск 10:24:38 1685129 102
>>1685026
В целом согласен, но причин быть мудаком я так и не увидел. Отчасти, они возвращают в человечество полезные локальные модельки, для хостинга которых не нужен датацентр. Пусть это лишь и побочка от их конкуренции.
>>1685029
У вас там прямо в гайде общаются с 999-летними вампиршами подозрительной наружности, и наблюдал тут скрины где угорают по, кхм, гримдарку, но как-то не хочется в моралфажество скатывать диалог, мне так-то похуй пока намеренно не задевают.
Понятное дело, в семье не без урода. Может, то бот залетный вообще, видел тут и в соседних тредах набеги вида прилетел, приплёл, затаился.
Аноним 23/08/26 Вск 10:24:55 1685130 103
>>1685115
>А зачем вообще в кодинге модель без рефьюзов?
Ну я-то его для разных задач хотел. Для РП, да ещё на русском он оказался так себе, попробовал для кодинга - вот тут он хорош. С другой стороны любая работа с текстом тоже для него задача, а тексты-то разные бывают... Не люблю отказов.
Аноним 23/08/26 Вск 10:54:42 1685137 104
>>1685128
>финк-финк
Зная:
1. Какой юзер долбоёб.
2. Что у него хранится в папке "Дети".
Его пароль от госуслуг: yaebudetei.
Аноним 23/08/26 Вск 11:31:16 1685158 105
>>1685012
>Зачем вы такие злые?
Потому что для кода и агентов СПЕЦИАЛЬНО сделали отдельный тред, где вы можете обсуждать свой вейпкодинг 24/7, но вы зачем-то приходите сюда и срёте анрелейтедом.
Аноним 23/08/26 Вск 11:40:08 1685164 106
Пощупал 3.8 в таверне. Впечатления двойственные. Охуенный короткий ризонинг по делу. Нет ебанутых рефьюзов 3.5 3.6 . Вообще нет. Чаты за геммой продолжает неплохо и даже на терпимом русике с пониженной до 0.6 температурой. Начал новый чат. Это пиздец. Получил в ебало полный мешок квенизмов времён 80 квена.
Аноним 23/08/26 Вск 11:48:02 1685172 107
>>1685158
> тред локальных языковых моделей
> нерелейтед
Ну вы тогда переназовитесь в локальный айсг.
Аноним 23/08/26 Вск 11:49:06 1685173 108
>>1685158
Так ведь вейпкодинг тут обсуждают лишь в контексте локальных моделей: какие из них пригодней, как заставить работать быстрее и точнее, что пробовали и с каким результатом. И результатами можешь пользоваться даже ты. Кумовство тоже нерелейтед, если следовать твоей логике. Перечитай ОП-пост.
Раз тебе так печёт, то и сделал бы себе уютный кум-тред, где к тебе никто левый не придет.
Аноним 23/08/26 Вск 12:20:10 1685193 109
>>1685158
Каким ещё анрелейтедом, шизик. Локальный вайбкодинг напрямую относится к тематике треда. Обсуждается не генерация писек и вкусовщины, а "как выжать из минимума максимум". Что отличии от кумерства - не является вкусовщиной.

>>1685164
Да, новый квен лучше продолжает то что видел. Но кстати в очень долгих чатах переживших 3-4 компактации это всплывает как минус - например он может начать думать очень мало, или очень много. он может начать рандомно спамить кучей инструментов, потому что думает что вызов инструментов это прям то что ему надо делать.
Хуй знает как это исправлять нормально. Интересно есть ли такие особенности на квантах повыше.

Тем не менее мне он прям сильно нравится. Для реальных задач он более чем годится.
Аноним 23/08/26 Вск 12:30:31 1685198 110
Какой положняк по лламе? Какой билд качать, а то я сижу на 98XX, видел десятитысячные вышли. Какой наименее косячный и без заебов, а то помню десяток тредов назад ныли про функции добавленные индусами и скомплитены в релиз.
Аноним 23/08/26 Вск 12:30:55 1685199 111
Локальное ИИ всегда тупее, ведь юзер = нищук, за редкими исключениями.
И вот нахуя кодомартышки лезут в локальное, если им надо делать работу корректно?
Че там накодить-то можно, если модель тупая как пробка?
Аноним 23/08/26 Вск 12:33:46 1685204 112
>>1685199
Ну собственна DCMA и прочая хуйня. Нельзя же сливать код какой-то нескреповерной чату гопоте. Поэтому делают гигачады, алисы, и прочую хуйню. Если там свое, то можно. А вот с локалками, мб как-то обходится этот закон наверное. Но офк свечку не держал.
Аноним 23/08/26 Вск 12:36:40 1685208 113
>>1685199
>Че там накодить-то можно, если модель тупая как пробка?
Локалка локалке рознь, некоторые локально и большого квена запускают или дипсик флеш. А так где-то с третьей геммы уме можно было делать дела, с 4-й и квена 3.6 так даже хорошо. Ну а сейчас прямо новый уровень, китайцы реально круты. Ждём ответа Гугла.
Аноним 23/08/26 Вск 12:37:09 1685210 114
>>1685199
Ну во-первых, тут все ради досуга делается, в первую очердь.
Во-вторых, приватность, твой секретный код по вычислению оптимальных форм дилдака не уйдет дядюшке Альтману.
В-третьих, современные локалки уже достаточно способные, чтобы базово ассистить пользователю с большим объемом задач, связанных с кодингом или смежных. Плюс очень много задач вокруг может быть, уровня экстракции, или быстрой классификации тикетов, это тоже приятный бонус. Корпы нужны тем, кто ничего не умеет / не хочет делать, и за кого свежащий опус или фейбл должен сразу сделать все идеально качественно. Если тебе это не нужно и ты не планируешь вообще всю работу спихнуть на нейродауна, то локалка это очень хороший дил. А после тяжелого рабочего дня можешь попросить ее потверкать в тексте.
Аноним 23/08/26 Вск 12:50:13 1685217 115
>>1685026
В первый раз?
Не в ту сторону воюешь, "открытые конкуренты" являются сдерживающим фактором и контраргументом корпорациям зла. Они отожрались настолько, что судебные иски по копирайтам уже не пугают. Зато бесплатная открытая альтернатива вызывает тряску.
>>1685043
Красиво! Давай запускай glm5.2 и прочих жирных, как будет работать.
>>1685199
> юзер = нищук
Нищуку проще оплатить дешевую подписку и иметь заточенные под обезьян интерфейсы, чем купить дорогое железо и разбираться с запуском.
> Локальное ИИ всегда тупее
Doubt. Если учесть гидроцефалию корпов в часы пик, преддверии выхода новой версии или при охвате некоторых тематик - наоборот. Пользователи без топовых подписок получают лоботомита после короткой квоты или сразу.
Аноним 23/08/26 Вск 13:05:26 1685240 116
>>1685199
Для чего юзать локальные модели считаешь правильным?
Аноним 23/08/26 Вск 13:06:08 1685242 117
>>1685199
Откуда ты знаешь насколько модель умная, если у тебя нет возможности оценить её работу?
Аноним 23/08/26 Вск 13:22:30 1685254 118
>>1685026
Чел, если не знаешь, почитай - кто такие Луддиты. Это ты как раз.
Аноним 23/08/26 Вск 13:29:17 1685266 119
Аноним 23/08/26 Вск 13:34:26 1685275 120
>>1685199
Дипси флэш отлично кодит и работает на 128+64
Аноним 23/08/26 Вск 13:34:35 1685276 121
>>1685254
Какие боком тут луддиты. Загугли что такое "Приватизация общественного блага" и поймёшь в чём вектор мысли.
Аноним 23/08/26 Вск 13:42:47 1685286 122
202608231535112[...].png 564Кб, 512x512
512x512
>>1685158
Тут даже не обсуждали кодинг как таковой, с чего подрыв начался? С генерации HTML карточек. Да это к кодингу и агентам относится даже меньше, чем к РП
Аноним 23/08/26 Вск 13:46:03 1685291 123
>>1685164
>Охуенный короткий ризонинг по делу.
Уверен, что он в ризонинг прошлой модели не подглядывает? Я такое замечал за ним. Продолжает хорошо, под гемму ммимикрирует, например. А как начнешь чат с нуля - пук-пук и пошла нудятина.
Аноним 23/08/26 Вск 14:00:04 1685304 124
>>1685276
> Приватизация общественного блага
Она уже произошла. Можно восстановить баланс через возврат обществу, буквально локалки.
А ты кидаешься на тех, кто обсуждает применение ллм кроме кума (буквально учится пользоваться новым общественным благом), из-за ассоциаций со своей обидой. Или прикинул свои перспективы, и как в анекдоте про охрану котла в аду цепляешься за вылезающих. Луддит чистой воды.
Аноним 23/08/26 Вск 14:09:17 1685313 125
image.png 237Кб, 378x529
378x529
>>1685304
А я согласен с ним. Считаю что направление развития ЛЛМ слишком склонено в неправильную сторону
Аноним 23/08/26 Вск 14:10:58 1685316 126
>>1685304
Ля челадзе, это было в 3 часа ночи, у меня в такое время контекст в q4 квантован и атеншен как у геммы. Так что сам хз хули на кодомакак быканул.
Аноним 23/08/26 Вск 14:16:23 1685323 127
20260823132745e[...].png 435Кб, 512x512
512x512
>>1685291
Ну тогда это неплахая схема, начинать с геммы и подолжать квеном, квен лучше держит большой контекст
Аноним 23/08/26 Вск 14:30:02 1685337 128
>>1685313
Нужно кумера с гигачедом скрестить для подобных постов, лол
>>1685316
Бывает
Аноним 23/08/26 Вск 14:30:19 1685338 129
>>1685129
>У вас там прямо в гайде общаются с 999-летними вампиршами
Чё за хуйню несёт? В гайде пират рассказывает про грабёж Венеции
Аноним 23/08/26 Вск 14:45:00 1685354 130
Какую llama cpp качать для ubuntu для запуска на видюхе? С поддержкой vulkan? Или самому собирать придется?
Аноним 23/08/26 Вск 14:48:35 1685356 131
>>1685354
Контейнеры собираются на каждый релиз. Бери запускай.
Вулкан - как фоллбэк. Если работает куда/рокм, то бери их
Аноним 23/08/26 Вск 14:53:29 1685359 132
>>1685313
Как будто бы у чела за спиной иконка клода. Такое в этом итт in this тхреад thead треде совершенно точно должно осуждаться. По крайней мере до момента, пока Дарио не выкинет на хф подачку со своего барского стола.
Аноним 23/08/26 Вск 14:53:46 1685360 133
>>1685356
Там в релизах просто нет готовых скомпиленных вариантов для cuda на ubuntu, самое близкое это вулкан. Видимо самому нужно собирать
Аноним 23/08/26 Вск 14:59:29 1685363 134
Аноним 23/08/26 Вск 15:00:13 1685366 135
Аноним 23/08/26 Вск 15:12:41 1685372 136
image.png 88Кб, 1194x608
1194x608
>>1685338
Малафью с глаз вытри.
Аноним 23/08/26 Вск 15:15:21 1685376 137
>>1685372
Так это не гайд, а список моделей.
Аноним 23/08/26 Вск 15:18:43 1685379 138
>>1685376
Ой блядь, ну тогда извините-извините. Процессоры гладят в списке моделей, а не в гайде.
Аноним 23/08/26 Вск 15:24:11 1685382 139
>>1685379
Не в гайде, а только в твоей извращенной голове, шизло пмсное.
Аноним 23/08/26 Вск 15:27:19 1685384 140
>>1685382
Мимо. Да и мне похуй вообще, дрочи на что хочешь. Лишь со своим лицемерием не лезь, илитка.
Аноним 23/08/26 Вск 15:30:53 1685387 141
202608231524575[...].png 493Кб, 512x512
512x512
>>1685354
Качаешь opencode desktop и просишь его скачать и собрать тебе llama.cpp
Аноним 23/08/26 Вск 15:38:28 1685395 142
>>1685043
чепочем?

>>1685199
я реверс инженерю и ломаю софт с помощью дипсика, облако работает, но стоит денег. и в любой момент могут забанить. Провайдеры конечно пишут, что ничего не читают, но один меня уже нахлобучил "наша автоматическая система flagged you", ага.
Аноним 23/08/26 Вск 15:41:02 1685397 143
image.png 320Кб, 624x633
624x633
>>1685359
А нужна ли нам его подачка? Я в аисг давно не заходил но последний раз когда заходил там была прям БОЛЬ с цензуры
Аноним 23/08/26 Вск 15:41:43 1685398 144
>>1685129
>прямо в гайде общаются с 999-летними вампиршами подозрительной наружности
Это просто буковки на экране, тебе не похуй? С таким подходом тебе лучше не заходить на сайты фанфиков (охуеешь от числа порева с Малфоем и Гермионой, которым, на минуточку по 10 лет) и держаться подальше от аниме (в 99% тайтлов так или иначе есть сексуализация школоты). Это не говоря про отдельный жанр лоликона. Ну и классику литературы не читать, там тебя уже Набоков поджидает кек.
Аноним 23/08/26 Вск 15:43:41 1685400 145
О, спустя месяц тишины по гигачату движняк начался
может ризонинг пофиксят
Аноним 23/08/26 Вск 15:54:56 1685410 146
>>1685398
Анон, мне совершенно похуй, как уже неоднократно говорил. Не моё дело.
Привёл пример для того, чтобы тот пациент сперва в зеркало посмотрел, прежде чем агриться на других. Генерить текстовые процессоры для него нормально, а код генерить - харам. Нет логики в набросах, на аргументы не отвечает, обзывается. То ребёнок, блядь, или бот с прошивкой "разделяй и властвуй". Уже и сам сомневаюсь, что стоит продолжать объяснять, все равно ничего не докажу и только в говне испачкаюсь.
Аноним 23/08/26 Вск 16:07:49 1685424 147
>>1685410
> То ребёнок, блядь, или бот с прошивкой "разделяй и властвуй"
То алкоголик, сам признался >>1685316
> прежде чем агриться на других
Ты тут тоже хорош, обернуть рофл в педоистерические обвинения ко всем тредовичкам и серию постов отстаивать их.
Аноним 23/08/26 Вск 16:12:28 1685428 148
>>1685424
Тот пиздатый рофл получил поддержку тредовичков, и задело, хули поделать. Незаслуженно говна поел. В ответ ни слова не придумал, все по фактам изложил.
В общем, пора завязывать с этой темой. Сказано достаточно.
Аноним 23/08/26 Вск 16:13:23 1685429 149
image.png 237Кб, 378x529
378x529
беру все обвинения на себя
Аноним 23/08/26 Вск 16:14:36 1685431 150
>>1685398
> там тебя уже Набоков поджидает кек.
У Лолиты вполне себе семейный рейтинг. Там же не описывается, как Гумушка масло сливал, там в основном переживания и ===Ну было и было===.
Аноним 23/08/26 Вск 16:31:20 1685451 151
1656051081859.jpeg 2044Кб, 1792x2400
1792x2400
1745100620105.jpeg 1950Кб, 1792x2400
1792x2400
1662949877917.jpeg 1995Кб, 1792x2400
1792x2400
1745362318542.jpeg 1711Кб, 1792x2400
1792x2400
Аноним 23/08/26 Вск 16:32:09 1685454 152
Аноним 23/08/26 Вск 16:33:14 1685456 153
image 1950Кб, 350x300
350x300
Ну раз тут много умных кодеров завелось, подсобите что ли советом.

(все описанное УЖЕ работает на базе https://github.com/huggingface/speech-to-speech/blob/main/README.md в навайбкоженном форке)

Есть БОЛЬШАЯ модель со своим промптом+контекстом (пусть Дипсик, не важно), и есть МАЛЕНЬКИЕ (4B гемма х2 штуки). Мелочь иногда пинается скриптами (по системному времени) и подглядывает в историю БОЛЬШОЙ модели с юзером, принимая решение, надо ли нашептать большой, чтобы та ответила, типа большая как будто бы сама приняла решение инициировать диалог спонтанно.

Положим, одна 4B отвечает за микро масштаб, вторая 4B за макро масштаб.

Микро - это фоллоу-ап сообщения в быстрой переписке.
> Юзер: Привет
> ИИ: Привет!
(просыпается микро, пишет большой модели "ну и хули приветом на привет, напиши ему что-нибудь)
> ИИ: Ты там не обосрался сегодня?
> Юзер (молчит > 30 секунд)
(опять просыпается микро, снова пинает большую модель)
> ИИ: Че ебало завалил? Ну и катись колбаской, сука!

Макро - это распорядок дня, планы на неделю-месяц, а также AFK режим. AFK работает как задержка сообщений юзера. Если "персонаж" AFK по решению макро-модели, то юзерский инпут попадает к большой только по истечению времени, и когда большая его получает - она видит timestamp с момента отправки юзером, а также она получает текущее время, тем самым вдупляя в идею "ага, прошло Х часов, я была AFK".

Допустим, есть много сейфгардов чтобы не жечь энергос зря. Т.е. несколько скриптов, один смотрит за другим, увеличивает интервалы обращения к 4B когда соблюдаются условия типа AFK. Допустим, многие таймеры - с рандомной задержкой, ну чтобы ивенты не казались алгоритмичными, ведь живой человек не ведет себя по шаблону.

Задача: да хуй ее знает на самом деле, мне нужны идеи! Вы умные, представьте что вам надо создать систему из ботов, с которой можно просто пиздеть ни о чем целый день, но так, чтобы она при этом сама до тебя не слишком доебывалась

Вот самая большая сложность это архитектура и координация. Все, что я делал, приводило к НАЗОЙЛИВОЙ СУЧАРЕ которая мне мозги ебет, либо к стесняше, которая уходит надолго и не проявляет интереса.
Пришел к выводу, что 4B слабоваты, плохо принимают решения. Ну ок, пересаживаемся на 26B A4B или на мелко-квена. <--- на этом работа заглохла, потому что вышел Дипсик и я ударился в пердольство с большой моделью.

Тут дело не в самих ботах (всем может рулить один бот с разными контекстами, если скорость высокая - но это не мой кейс, вызывать Дипсик для микро-макро регуляции ваще не канает), а именно в этаком танце событий на временной линии, согласно скриптам, промптам и распорядкам-расписаниям...

Я уже охуевать с этого всего начал. Думал шкварануться и занести $$$ на корпов, чтобы твари за меня все сделали, но поговорив с бесплатной Гопотой (в рамках квоты) понял, что эта сука только демагогию разводит и не дает практически ценных советов, как и DS 4 Pro.
Аноним 23/08/26 Вск 16:41:44 1685479 154
>>1685456
Чёт букв много, сори лень читать
Аноним 23/08/26 Вск 16:41:46 1685480 155
>>1685456
С дивана вижу, что у тебя претензии в отсутствии у модели телепатии - когда тебе хочется попиздеть - она молчит, конда хочется помолчать - она пиздит.
Надо выстраивать алгоритм вокруг твоих хотелок - вводить уровень текущего пиздежа, который бы задавал активность нейронки исходя из среднего твоего времени ответы на её вопросы. Если ты в настроении попиздеть - ты отвечать будешь много и часто, если нет желания - то редко и через кучу времнни.
Аноним 23/08/26 Вск 16:43:23 1685484 156
>>1685479
Ну что поделать, иногда надо как следует высраться...
>>1685480
Хм, а вот это мысль. Дать оркестраторам взгляд на жизнь юзера. Но епт, это тоже та еще задачка.
Аноним 23/08/26 Вск 16:44:50 1685489 157
>>1685400
Ясен хуй, как новый квен, так у них движняк начинается, пиявки.
Аноним 23/08/26 Вск 16:45:28 1685490 158
>>1685456
Маленькая модель через тул вызывает большую?
Я заметил, что мелко квен слишком активно дергает тулы - есть тул, надо поробовать вызвать его. Гемма наоборот, пока не напишешь прямо "используй инструмент" очень лениво это делает.
Сейчас я в основном использую luqwen3.5 но у него было мало тулзов в обучении и в основном мой фронтенд, поэтому сложно сказать, как будет работать в других ПО, но было бы интересно узнать.
Аноним 23/08/26 Вск 16:45:55 1685491 159
>>1685479
Вот буквально сейм. Думал сначала, лан помогу, а потом вижу, что текста дохера, система запутанная и решил, что мне похер.
Аноним 23/08/26 Вск 16:52:12 1685501 160
>>1685490
>Маленькая модель через тул вызывает большую?
Не, там простые сообщения как этакие ролевые ивенты, подающиеся в контекст большой модели словно её собственные мысли, но сгенерированные мелочью.

По факту не вот так
>ну и хули приветом на привет, напиши ему что-нибудь
а скорее так
>ой, чего это я приветом на привет отвечаю... стыдно, надо бы спросить как он там

Эти ролевые хинты/мысли - для юзера не существует, пока в серверный лог не заглянешь. TTS мысли не проговаривает.
Аноним 23/08/26 Вск 17:01:08 1685512 161
>>1685379
Обычная шутейка. Можешь предъявить автору, но он треда 2-3 назад ливнул в ирл. Или переделай сам. Все в твоих руках.
Аноним 23/08/26 Вск 17:04:45 1685520 162
>>1685512
Создатель списка тоже отвалился чтоль? Пиздец все разбежались
Аноним 23/08/26 Вск 17:06:05 1685524 163
>>1685456
Уточни смысл микро модели. Модель сама так просто не напишет привет, там будет сразу второй пост. Если нужно симулировать общение короткими - можно бить их алгоритмами или заставить саму модель расставлять разметку микропостов.
По "задержкам" понятно, но там есть смысл сразу после окончания ответа ии спрашивать ее о необходимости пропинговать на случай неответа и сколько времени ждать. А не просто появляются какие-то "просыпания" уже в моменты. Учитывая что там идет вызов после - есть смысл вешать это на основную модель, потому что она уже осведомлена. Разумеется, по срабатыванию из истории чата эта мелочь удаляется чтобы не засорять, а если юзер ответил раньше - реквест отменяется и идет основная работа.

На случай макро - а зачем вообще она нужна? Это делится на две части: 1 - планировщик, который пнет модель в заданные моменты и дальше она решает отвечать, проигнорировать и т.д. 2 - heartbeat с опциональным рандомайзером, который периодически пинает модель и спрашивает "нужно ли дергать юзера?", а она уже решит по таймстампам и контексту. Из истории все эти запросы можно также удалять.

Возникает вопрос - а зачем вообще мелкомодели в такой парадигме?
Аноним 23/08/26 Вск 17:14:04 1685534 164
Приехала cmp170.
Тестирую. Думаю, что-то она не сильно быстрее V100 - что впрочем всё ещё окей, меня скорость V100 устраивает, количество памяти не устраивает. А оказывается под 70 компилировал, и там операций под 80 просто не было, лол.

В общем с одной стороны получил прирост вида +20% в некоторых задачах, например картинки генерить. А с другой стороны получил х12 в одном из тестов, где многопоточная обработка. В среднем по больнице думаю это что-то вроде х3 по сравнению с V100 + возможность запустить что-то на 64 гб.

Сразу вопрос. V100 и cmp170 одновременно можно каким-то образом запустить? Как я понял, мне нужен драйвер под 580, так как с 590 вольты нет. С другой стороны фикс есть под 610 и 590.
Часть правок - это не только инициализация карты при подключении к компу, но ещё и что-то с прошивкой VBIOS - могу я как-то сделать с cmp170, чтобы она потом на 580 драйвере отображалась как 64-гиговая?
Я просто думаю по ним раскидать сетки одновременно, типо эмбеддинги, реранки, распознавание видео и прочее на V100, а основная часть мозга ллм на cmp170.

>>1684874
Под V100 переписала vllm и флеш-аттеншент, а теперь и nvfp4 во многом нейронка. Ещё и оптимизация ресурсов будет, расползающаяся во все стороны, в том числе и на старые.
Типа, написание кода - инструментальная задача. Не нужно тупой пилой мировое дерево пилить год, лучше пилу поточить, изобрести точильный станок, а уже потом браться за древо.
Аноним 23/08/26 Вск 17:24:44 1685543 165
Есть вопрос, с которым я сам разобраться не могу. Он в целом теоретический и не имеет однозначного ответа, скорее всего. Задал его четырем локалкам, все ответили одинаково. Квен, Писик, Муся, Степфлеш.
И тут я задумался... они предлагают реально "оптимальное" решение или они просто все обучались на одних и тех же данных? Вы используете сетки для такого?
Аноним 23/08/26 Вск 17:25:05 1685544 166
>>1685456
>много умных кодеров завелось
Агентодауны и кодеры сюда: >>1684518 (OP)
Тут обсуждаем ролеплей и железо.
Аноним 23/08/26 Вск 17:27:51 1685550 167
>>1685544
Ты перепутал чего-то. За ролеплеем тебе в айсг. Обсуждать можно теперь только настройки лламы и ктрансформеров для запуска моделей.
Аноним 23/08/26 Вск 17:31:33 1685553 168
>>1685534
> Сразу вопрос. V100 и cmp170 одновременно можно каким-то образом запустить?
К сожалению нет. V100 - только проприетарный драйвер, а все фиксы и анлоки в опенсорсном. Портировать анлок на 580 версию вообще не проблема, но сами драйвера фундаментально разные.
С другой стороны, это же линукс, найдется и путь иметь загруженными и рабочими оба драйвера. Но по трудозатратам может выйти больше стоимости еще одной cmp.
Если нужно просто независимо запускать разные модели - помогут виртуалки и контейнеры.
> но ещё и что-то с прошивкой VBIOS
На данный момент из известных вещей нет ничего существенно полезного не требует правок биоса. Даже оверклок можно делать на уровне софта.
Аноним 23/08/26 Вск 17:32:10 1685554 169
>>1685524
Длина сообщений не вопрос. Там все отлажено в этом плане, и проблема скорее в инициативе (ее отсутствие - побочный эффект 100% стабильного появления коротких сообщений, без ударяющейся в написаниме охуительных историй большой модели).

Микро/макро как отдельные модели (или отдельные инстансы для большой модели - в гипотетическом сценарии, когда есть возможность спихнуть эти задачи на большую) банально нагружены другими системными промптами. Они, по сути, как частички все той же персоны, оторванные от "большой", дабы не замусоривать персону. Регуляторы жизни и контроллеры принятия решений.

Думаю, я все усложняю в своих описаниях. Вообще я много подходов пробовал. Разделение оказалось проще в плане подкручивания гаек - я точно знаю, что перодля мелочь, я не сломаю саму персону. Вот как-то так.
Аноним 23/08/26 Вск 17:34:05 1685556 170
изображение.png 396Кб, 735x707
735x707
>>1685456
> что 4B слабоваты, плохо принимают решения.
this
>>1685543
>они просто все обучались на одних и тех же данных?
this тебя не смущает то что китаезы в наглую дистилят всяких клодиков? ну у пиндосов с этим тоже так же, просто не так в наглую
Аноним 23/08/26 Вск 17:37:54 1685562 171
>>1685456
Научись использовать -np 3 вместо 4В лоботомитов.
Аноним 23/08/26 Вск 17:41:12 1685566 172
>>1685562
Я на ГЛМ скорее всего мигрирую, без лоботомитычей не обойтись. Шизоличность на < 5 t/s даже в голосовом чате приемлима без ризонинга, но если вторичные роли будут медленными - это катастрофа.
Аноним 23/08/26 Вск 17:43:15 1685569 173
>>1685554
> банально нагружены другими системными промптами
Попробуй просто подставлять в конец инструкцию с заголовком [SYSTEM] и при необходимости форсировать нужный формат аутпута (json, только со строкой на короткий ризонинг если штатный не используется). Тогда у тебя будет в распоряжении и весь контекст, и хорошая скорость. Пердолить это можно будет также изолировано.
> дабы не замусоривать персону
Подставляешь инструкцию по месту и обрабатываешь ответ, это не попадает в основную историю чата.
Ну а вообще - посмотри как это сделано в том же openclaw, там даже запросы в истории чата сохраняются.
>>1685566
> но если вторичные роли будут медленными
Так у тебя все "вторичные роли" работают в фоне между запросами, какая разница?
Аноним 23/08/26 Вск 17:49:01 1685573 174
>>1685569
> какая разница?
Когда ГЛМ генерирует, энергоса больше жжется. Это беда.

А насчет системных сообщений... Мозг немного клинит сейчас, тут главное чтобы никакой репроцессинг всего контекста не пошел на ГЛМе. 10 минут холодного старта это не весело.
уже пробовали FreeToken? Аноним 23/08/26 Вск 17:50:07 1685574 175
>>1684266 (OP)
> Исследователи представили ( https://arxiv.org/abs/2608.16157 ) и открыли ( https://github.com/FlashML-org/FreeToken ) исходный код FreeToken — это система для запуска больших MoE-моделей на обычном железе. Дело в том, что она сама по-умному распределяет вычисления между GPU, CPU и RAM.
> Главное:
> 🟢 Qwen3.6 35B запускается на ноутбуке с RTX 4060 8GB со скоростью 39 токенов/с;
> 🟢 А например, DeepSeek-V4-Flash 284B — на RTX 5090, выдавать будет 22–25 токенов/с.
Аноним 23/08/26 Вск 17:55:54 1685582 176
neuroslop.jpg 265Кб, 864x1200
864x1200
>>1685429
@artmonkey
свинофицируй
Аноним 23/08/26 Вск 18:02:07 1685586 177
>>1685553
>Но по трудозатратам может выйти больше стоимости еще одной cmp.
Ну, как я понял лайт-вариант - это виртуалка, там есть какой-то драйвер-заглушка который пробрасывает устройство как есть, и в виртуалке можно уже поставить драйвер под V100 и лёгкие изредка нужные сетки.

Но раскидать условную laguna-s2.1 (120B) на две карточки во внятном кванте не выйдет, а в кванте 3.5 на одной cmp170 такое себе. По идее можно сделать почти мгновенный пророс данных через оперативу в виртуалку за доли миллисекунл - но это надо лезть в код инференс движков, модить его, и при любом обновлении делать это заново. При этом надо какую-то жёсткую виртуалку, которая забирает условных половину ядер процессора себе и не виснет из-за прерываний. Имея скиллы на всё это действительно проще вторую просто взять.

Способа запустить два драйвера одновременно я не нашёл. К тому же если куда и апи выделяет там память на них, то по идее оркестратор-програмная часть драйвера в ос должна быть единая.

>Даже оверклок можно делать на уровне софта.
Кинешь наводку как повер-лимит повысить до 300? В какую сторону гуглить примерно или по каким словам.
К слову, по какой причине радиатор на V100 на тихом кулере сдувал 330 ватт и выше 60 не грелось. На этой мне ещё в комплекте прислали майнеровский кулер 120х120 на две карты - я его поставил (заткнув второе отверстие), он гудит как пылесос и карточка даже с лимитом в 200 ватт уходит на 70 градусов. Есть смысл снимать корпус и искать отдельный радиатор башенный как на V100 и есть ли вообще такие? Выглядит эта бандурина тяжёлая не очень эффективной, и будто её сделали только чтобы без райзеров в плату втыкались карты.

>>1685574
>Qwen3.6 35B запускается на ноутбуке с RTX 4060 8GB со скоростью 39 токенов/с
У меня было в glm-4.7-flash с ноутбучной 4070 25 токенов с картой и 17 токенов без карты (на версии старой, там вроде что-то подтянули ещё на 5-10% мелкими фиксами). Если они дотянулись до 39 без MTP, то это круто. А если это с MTP, то и обычная ллама более-менее столько выдаст.
Аноним 23/08/26 Вск 18:13:49 1685592 178
>>1685586
> как повер-лимит повысить до 300
Увы, тут уже майнерский биос. А просто оверклок врам https://github.com/bayley/cmpunlocker
> он гудит как пылесос и карточка даже с лимитом в 200 ватт уходит на 70 градусов
Некоторые серверные кулеры ужасно шумят даже на 600 оборотах. Обычные корпусные не могут создать нужного давления чтобы прокачать карту, много шумят но плохо охлаждают. Еще сильно роляет шрауд, гидродинамика настолько злая скотина, что возможно втыкание второй карты вместо закрытия отверстия было бы тише и холоднее.
> снимать корпус
Радиатор также охлаждает врм и некоторые микросхемы, если у тебя есть фрезер и инструменты - можно попробовать "адаптировать". Или удалить все ребра со штатного радиатора и накрыть башней, сработает. Из штатных - на них продаются водоблоки.
> будто её сделали только чтобы без райзеров в плату втыкались карты
Так и есть. Но обычно с температурами и шумом там не так ужасно.
Аноним 23/08/26 Вск 18:27:37 1685603 179
>>1685574
>DeepSeek-V4-Flash 284B — на RTX 5090, выдавать будет 22–25 токенов/с.
Звучит как пиздёж. Либо там Q2 лоботомит на DDR5, что вообще нихуя себе не маленький нюанс. Инфы на их гите нет, значит впизду
Аноним 23/08/26 Вск 18:27:59 1685605 180
>>1685574
пробовали.
FreeToken-Setup-win-x64.exe
Detected: Trojan:Win32/Wacatac.C!ml

После установки в системе 16+16 гб не может загрузить qwen 27b из-за нехватки памяти
Аноним 23/08/26 Вск 18:42:19 1685624 181
Аноним 23/08/26 Вск 19:02:48 1685640 182
>>1685603
Если там реализован динамический кэш (бумагу по ссылке не читал) экспертов то вполне может быть, может быть и больше.
Сейчас плавает куча вариантов реализации подобного, но пока не появится в мастер бранче лламы цпп мне лично не очень интересно пользоваться таким на постоянке
Аноним 23/08/26 Вск 19:04:31 1685641 183
>>1685624
зачем его вообще ставить, если он не выполняет обещаного, не может загрузить 19 ГБ в 32. Надо ждать версии 1.0, пока слишком сыро.
Аноним 23/08/26 Вск 19:08:30 1685642 184
>>1685592
Не, просто радиатор плохой походу. Воздух выдувается холодный и радиатор холодный, то есть будто бы чип не может отдать температуру радиатору, а с кулером проблем нет.

Ну, сейчас переходник сделаю под свой кулер 80х80, и заодно анону под v100 по реквесту переделаю-проверю, а то обещал вчера вечером, но так поздно добрался до дома, что как-то несподручно было уже.

К слову по поводу запуска на драйвере 580 мне вот такое скинули: https://github.com/d3dx9/cmpunlocker/tree/agent/sec2-one-run-clean
Типа, карта отсоединяется от обычного драйвера, далее эта штука к нему подключается, выполняет верную последовательность, а после карта обратно к драйверу подключается и всё у неё хорошо, и все 64 гб на месте.
Аноним 23/08/26 Вск 19:18:29 1685654 185
>>1685605
> FreeToken — это система для запуска больших MoE-моделей на обычном железе
> не может загрузить qwen 27b
Аноним 23/08/26 Вск 19:28:12 1685666 186
>>1685642
Там стоит испарительная камера, так что тут или разгерметизация, или термопаста скурвилась.
> вот такое скинули
А это потенциально твое решение. Только нужно убедиться что с тем драйвером сработает.
Аноним 23/08/26 Вск 20:19:21 1685709 187
Кто нибудь пробовал квен 3.8 с dflash2? Еще говорят что вллм пижже чем лламацпп, но хз стоит ли пробовать для 16врам
Аноним 23/08/26 Вск 20:31:01 1685717 188
>>1685654
этот Qwen3.6-27B-NVFP4 у них во встроенном пикере как поддерживаемая модель стоит.
Аноним 23/08/26 Вск 20:38:14 1685724 189
> хочешь поерпшить
> качаешь приглянувшуюся карточку
> вспоминаешь, что их пишут кумеры дегенераты
> смотришь внутрь
> {{char}} обязан материться и спускать трусы по первому взгляду на {{user}}, {{char}} очень любит сосать хуй {{user}} и живёт только ради того, чтобы быть его сучкой для слива.
Проклятый мир.
Аноним 23/08/26 Вск 20:47:37 1685734 190
Вечера, локальные. Что щас лучшая модель обучения кодингу? Не вайбкоду где ты кидаешь таск и модель за тебя всё пишет от структуры репы до документации. Нужна именно модель которая сможет объяснить всякие вещи, по большей части C++ и C# так как собираюсь помаленьку вкатываться в гейдев. Ну и собственно сами гейдевские практики, как эффективно реализуются всякие механики и прочее.

Система: 4070 на 12 гигов, 32 гига DDR4, цопэу Ай7 какой то там 12 поколения.
Аноним 23/08/26 Вск 20:48:41 1685735 191
>>1685734
Соре гейткип по дотнету.
Аноним 23/08/26 Вск 20:50:26 1685738 192
>>1685734
>по большей части C++ и C#
Точно не локалки. Купи себе регу на GPT+VPS зарубежный. И спрашивай у него бесплатно.
Аноним 23/08/26 Вск 20:54:07 1685743 193
>>1685738
>Купи себе регу на GPT+VPS зарубежный
Доступ к гопоте и другим нейронкам имеется, но слышал что даже с подпиской там всё равно ебанутые лимиты и срать вопросами не выйдет. По этому подумал что лучше локаль какую-нибудь накатить.
Аноним 23/08/26 Вск 20:55:39 1685744 194
>>1685734
Ты напоминаешь одного шиза, потому иди в тред корпов. У них хорошая тренировка на дебильные запросы и максимальный показатель идиотпруфности.
Аноним 23/08/26 Вск 20:59:53 1685747 195
>>1685743
Локали плавают в C++ и C#, есть шанс что она тебе говна насоветует. Не порти себе впечатление от обучения.
Аноним 23/08/26 Вск 21:03:37 1685752 196
>>1685744
Мне похуй кого я тебе напоминаю, у меня вопрос связан с локалками по этому спрашиваю я в локальном треде, а не где-то еще. Не нравится? Ну, можешь потерпеть.

>>1685747
Странно конечно, это чуть ли не самые популярные япы. Но раз так то пойду к корпам.
Аноним 23/08/26 Вск 21:11:24 1685759 197
>>1685734

судя по отзывам на реддите - квен плавает на шарпе и сях. да и твое железо очень слабовато, купи еще пару видях чтобы запускать хотя бы qwen 3.8 в 6 кванте и оперативки чтобы запускать GLM 5.3 в однобитном кванте (он как раз вроде хорошо справляется с си подобными языками)
Аноним 23/08/26 Вск 21:11:33 1685760 198
>>1685752
И хорошо. Не нужно здесь говно вроде тебя. Потерпишь на корпах.
Аноним 23/08/26 Вск 21:15:01 1685763 199
>>1685752
Дотнетошиз наконец съебется, ура! Какая хорошая неделя, новые анонсы и еще это.
Аноним 23/08/26 Вск 21:42:33 1685780 200
>>1685734
>объяснить всякие вещи, по большей части C++ и C# так как собираюсь помаленьку вкатываться в гейдев
Ты лет эдак на 10 опоздал. Сейчас уже просто нет смысла.
И локалки в C++/C# - нулины конченные. В эти языки хорошо могут только триллионники - chatgpt, claude
Аноним 23/08/26 Вск 21:50:42 1685788 201
>>1685734
>привет, пилоты болидов! где сейчас обучиться вождению лошади? Не автопилоту на гоночных суперкарах. Нужен именно мануал по лошадям, собираюсь втягиваться в гужевые перевозки.
Аноним 23/08/26 Вск 21:52:22 1685789 202
>>1685752
>Странно конечно, это чуть ли не самые популярные япы.
Это самые СЛОЖНЫЕ для локалок по объему и связанности знаний ЯПы. Их понимание тупо не умещается ни в микромозг весов локалки, ни в контекст.
Да и для людей куда более сложные чем всякие пейтончики, потому что ядренейшая смесь из всего, начиная от low-level (стеки, регистры, списки, битики в value types, ссылочки, il-code, семафорчики-локи, многопоточность, классы-наследования-интерфейсы-оверлоады-оверрайды, сокеты-потоки-конекшены-ридеры, атомарность и тд), и заканчивая максимальными абстракциями (функции высшего порядка, замыкания, лямбды, di/ic, деревья выражений, динамическое построение и компиляция expressions в runtime, эмиттниг il-кода в runtime, функции которые передают в функции функции создающие другие функции вызывающие функции...). И все это СМЕШАНО, иногда в пределах одной строки/команды.

Короч на этой хуйне даже триллионники регулярно косячат - что-то забывают учесть, обсираются с логикой происходящего. А для локалок это вообще ад.
Аноним 23/08/26 Вск 21:55:36 1685791 203
>>1685788
Поинтересуйся на чем llamacpp написана, чурка...
Твой "болид" это телега с колесами и без двигла (хоть и с интересным грузом).
Уберешь лошадь - останешься с деревянной коробкой.
Аноним 23/08/26 Вск 21:56:41 1685793 204
Надо попробовать натюнить мелкоквена на дотнет. А то похоже ниша свободна.

>>1685734
>Нужна именно модель которая сможет объяснить всякие вещи, по большей части C++ и C#
Это же можно в чатике любой модели бесплатно спрашивать, гопота, дипсик, квен, кими и прочие. Как деды вайбкодили до появления агентов. Там и модели круче, и хоть что-то изучишь через копипасту.
Аноним 23/08/26 Вск 21:57:06 1685794 205
>>1685734
Про триллионники не слушай. Если ты сам хочешь писать, а не быть оператором нейросети, то всё ок.

>помаленьку вкатываться в гейдев
Гемма 4. Можно даже qat-версию 26B-A4B - собственно она у тебя и заработает с внятной скоростью.
Она не топ-1 в плане непосредственного кода для своего размера - но она умная и хороша в плане мозгов. И она всё ещё знает всё, чтобы ты имея набор библиотек (или даже без них) мог без интернета написать графический движок, все графические эффекты, логику игровую и так далее. Но придётся вникать и править код самому, она прям ассистент-советчик, а не исполнитель. Часто будет всплывать проблема, что если есть либа, в которой в версии 2.6 и в версии 3.0 менялся синтаксис - то она путает и пишет не под ту версию, хотя концептуально всё верно подсказывает.
Аноним 23/08/26 Вск 22:05:16 1685804 206
image.png 625Кб, 485x632
485x632
Аноним 23/08/26 Вск 22:14:02 1685811 207
>>1685791
Потому она работает стабильно через жопу и целиком состоит из велосипединга, вместо использования готовых наработок хотябы для сторонних мелочей.
Сплавами занимаются металлурги, изготовлением - технологи, аэродинамикой - другие инженеры. А когда ты пытаешься сделать автомобиль начиная с добычи руды из скалы, утверждая что "этим занимались тру спецы" - не удивляйся что тебя стебут.
Аноним 23/08/26 Вск 22:14:11 1685812 208
image.png 247Кб, 1680x1050
1680x1050
image.png 323Кб, 1680x1050
1680x1050
>>1685734
Кстати Qwen 3.8-27b уже в C# довольно неплох. В основном потому что на него легко писать тесты, а он очень любит писать тесты. Так что он просто не даёт себе обосраться. Во всяком случае

Но я не уверен как там дела обстоят в юнити/годоте. И какое у них есть MCP, скорей всего как всегда своё писать придётся.

Не проверял правда насколько он хорош в gl/hlsl, но подозреваю что глазки ему позволяют делать интересные вещи.

Вообще не уверен насколько он хорош именно в объяснении того что он пишет. Он иногда выбирает забавные обороты речи.

В геймдеве ещё не пробовал. Подозреваю что специфичные для движком вещи он знает хуево или его придётся запускать в квантах повыше. Но например у меня квен сам себе вайбкодит место где он же и пишет код исам же его ребилдит. Его конечно порой пинать надо в нужные стороны, так как он сомнительные архиектурные решения делает, но его не страшно оставлять работать над проектом на всю ночь.

Лол например дал ему задачу переработать немного собственный UI. Так этот чёрт додумался написать инструмент который переключает вкладки собственного приложения и просто сохранял скриншоты между ребилдами.

Gemma4 26B-A4B скорей всего будет твоим лучшим выбором, она вполне справится с тем чтобы дать тебе вводные и подсказать чего. Плюс ей так-же можно скриншоты кидать. Хотя я бы конечно советовал больше 31b, но вряд-ли ты её запустишь.
Аноним 23/08/26 Вск 22:31:20 1685826 209
>>1685789 >>1685794 >>1685812
Спасибо за разъяснение братья. Короче попрбую накатить гемму и квена моешных, если будут тупить поставлю денс. Если и те будут тупить всё таки перейду на корпы.
Аноним 23/08/26 Вск 23:54:21 1685866 210
>>1685826
Не брат ты мне, гнида кодожопая.
Аноним 24/08/26 Пнд 00:07:07 1685874 211
>>1685574

Это чемодан без ручки по списку поддерживаемых моделей/квантов.
Но сам факт того что это возникло и работает говорит о системном кризисе у жоры, у которого давно хуй забили на внедрение каких-либо инноваций, в частности этого самого кеша экспертов, на котором построен FreeToken - обсуждения и форки с подобными идеями идут уже давно, но сама команда ламы игнорирует/закрывает их.
Аноним 24/08/26 Пнд 00:41:47 1685893 212
>>1685874
> в частности этого самого кеша экспертов
У него отдельных экспертов в параметрах не существует, хотя во всех движках они возникли сразу, и гибридный инфиренс идет вокруг них. Только выбор девайсов для отдельных слоев. Надо отметить что на момент внедрения наладили быстрый транспорт, но на том и заглохло.
Чтобы что-то вводить, придется перелопачивать все и наверстывать 1-2 года простоя. Судя по костылям уровня q8-as-fp8 делать этого очень не хотят.
> квантов
Да, хотелось бы видеть как минимум поддержку ассортимента int, ггуфы (или их форк), а еще лучше mlx-специфичного формата, поскольку тот предлагает гибкую битность и остается простым.
Еще можно разобрать их бэк по частям, и натащить нужные фишки в другие.
Аноним 24/08/26 Пнд 01:12:32 1685899 213
>>1685789
Представляю, как у тебя привстал, когда ты похвастался знанием умных слов. 90% тобою написанного это узкоспециализированная хуйня, которую рядовой макакич не увидит вживую за 10 лет работы.

Алсо, как же я рад, что уже больше полугода не заходит в этот говнотред, сегодня почитал и понял, что делал это не зря, до сих пор это шабаш ебнутых на голову.
Аноним 24/08/26 Пнд 01:23:56 1685902 214
Аноним 24/08/26 Пнд 01:26:44 1685906 215
Аноним 24/08/26 Пнд 01:27:38 1685907 216
>>1685811
vllm - C++, CUDA
sglang - C++, CUDA
на питончике там - только скриптики оркестрации девочки с крашеными ноготками настукали

Так что сиди с хуем во рту дальше, пока не появится хоть одна реализация инференса на чем-то помимо C++ (то есть вечно)
Аноним 24/08/26 Пнд 01:36:34 1685908 217
>>1685899
>знанием умных слов
Чел, это не умные слова, это простые слова, для простых по своей сути вещей - но которые превращаются в адок когда появляются в коде все сразу.

>90% тобою написанного
Используется в ядреном ентерпрайзе вполне себе на регулярной основе, что-то вообще ежедневно, с чем-то приходится пересекаться раз в 1-2 недели.

>не увидит вживую за 10 лет работы
разве что скриптоложцы из pyhp всяких
Аноним 24/08/26 Пнд 01:45:20 1685910 218
>>1685907
Эти примеры - именно
> Сплавами занимаются металлурги, изготовлением - технологи, аэродинамикой - другие инженеры.
Для быстрых гпу операций - куда кернели, которые садятся на питон - индустриальный стандарт. Шаращий за низкоуровневые операции оптимизирует расчеты исходя из нагрузки, а не задумывается как приколхозить парсер функциональных вызовов. Архитектор модели не грузит себе мозг как раскидать веса по тензорным ядрам и где нужны ассемблерные вставки, а сосредоточен на архитектуре. Основной инфиренс и вспомогательные вещи напрямую используют созданный разработчиками моделей питоновский код. За шедулинг, хостинг апи и прочее отвечают свои заточенные на это части на ненавистном тебе питоне и расте. Все это обернуто в умный и продуманный jit.
> хоть одна реализация инференса на чем-то помимо C++
В сгланг один раст, на плюсах только легаси. Вллм тоже на раст большей частью перешел. Ой, а что случилось?
Плюсы уместны в низкоуровневых высокопроизводительных узлах, там они чувствуют себя идеально. А когда ретроградная обезьяна со стекающей слюной делает на них примитивщину с гуйней, и как бухие урапатриоты заливают про величие языка - получается один стыд.
Аноним 24/08/26 Пнд 02:13:07 1685916 219
>>1685902
лучше бы алибаба выпустила qwen 3.8 122b-a10b или 35b-a3b

это не капча, это пиздец. все меньше желания пердолиться на этой помойке
Аноним 24/08/26 Пнд 02:37:22 1685923 220
>>1685424
Глянь >>1685866. А ты говорил, мол, алкаш, а не бот или ребёнок.
Ну, собака лает - караван идёт. Главное, что консенсус достигнут.
Аноним 24/08/26 Пнд 02:40:59 1685928 221
изображение.png 32Кб, 385x275
385x275
изображение.png 750Кб, 630x723
630x723
изображение.png 763Кб, 932x580
932x580
изображение.png 1003Кб, 1243x400
1243x400
>>1685906
MTP как раз до фени, он и на проце даст выигрыш, причём даже лучше чем на гпу из-за низкой латенси.

>>1685666
>Там стоит испарительная камера, так что тут или разгерметизация, или термопаста скурвилась.
Не могу понять как это должно помочь.
Я разобрал. Радиатор - это полоски меди 0.2 мм высотой 20 мм и длинной 170 мм. Всего их 40 штук. При этом явно не все 170 мм длины работают, хотя конечно под ними разведены термотрубки. Забавно что так же как и на V100 не достаёт до каких-то микросхем.
Я просто не уверен что эти полосочки меди в состоянии по вертикали хотя бы на 2 см тепло передать без чего-то вроде перепада температур от 20 до 80. Нейронка вот пишет, что в SXM2 радиаторы 10 термотрубок вертикальных - это в 5 раз лучше, чем полоски меди, при условии что вся нижняя подложка равномерно прогрета.

Жесть, и как эту фигню паять для pcie х16. Оно там 1.1 мм на 0.4 или вроде того. У меня конечно есть паяльная станция, но мне не ясно как это выравнивать перед напайкой... И вот к слову ещё и nvlink 3-канальный, но там вроде как не только резисторов не хватает, а ещё и дорожки затёрты. Но это не точно, плата то не двухслойная, можно спрятать.
Аноним 24/08/26 Пнд 06:20:09 1685972 222
0fa26820b6871a0[...].jpg 105Кб, 736x1226
736x1226
>>1684266 (OP)
GTX1660 + AVX1
Забилдил:

cmake -B build -DGGML_CUDA=ON -DGGML_CUDA_FORCE_MMQ=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release

Настройки qwen-27b+gemma e4b сгенерировали
Но скорость абсолютно такая же как в релизной лламе cuda 12.4 1.26 t/s 27b. Как посмотреть еще флаги для моего некро сетапа? Или у КУДЫ максимально все заоптимизрованно и нет смысла кормпилировать самому? Flash attention похоже почти бесполезен при GPU оффлоаде, прибавка всего +0.04 t/s.
Аноним 24/08/26 Пнд 06:59:55 1685977 223
Чет увлекся, хотел сначала просто одну cmp 50 купить, заменить ей свою текущую карту и с затычкой для вывода изображения ее запускать. Оказалось что мой бп не подходит и я решил взять такой, чтобы можно было запитать сразу две карточки, вдруг захочу в будущем. В итоге осенило, что у меня итак уже есть две карточки, моя то игровая тоже какой-то врам даст. В итоге заказал и новый бп и еще новую материнку под 2 видюхи. Теперь уже ищу оперативу +32 гб, чтобы с текущей что у меня есть сочеталась. Хотел ведь минимальненько локалки потыкать, а не пк пересобирать... Хотя что удивительно после продажи старого бп и материнки я в целом не буду в минусе, этот апгрейд не стоит ничего
Аноним 24/08/26 Пнд 08:22:28 1685995 224
>>1683448 →
Кого винить в barely above a wisper и в сука бесконечных троеточиях?
Я еще вспоминаю ту пасту про троеточия и проигрываю нахуй каждый раз.
Аноним 24/08/26 Пнд 08:25:41 1685996 225
>>1685972
>Или у КУДЫ максимально все заоптимизрованно и нет смысла кормпилировать самому?
Компилировать, скорее, нету - она же и так компилируется под всё. Компилируя именно под свою систему ты можешь убрать варианты без avx2 в плане CPU и без инструкций sm80 в плане куды - что лишь размер бинарников уменьшит.

По скорости - всё просто. Видеокарта производительнее в, например, 80 раз.
Предположим, что у тебя 80% на карте, 20% на процессоре. Итого по времени на карте 80/80=1 мс, на процессоре 20/1=20мс.
Ты ставишь флеш-аттеншен, который на карте. У тебя получилось 0.9 мс на карте и 20 мс на процессоре. Заметишь разницу между 21 и 20.9?

Тебе стоит попробовать turboquant, в связи с тем, что там можно кеш в 2-3 бита без потери скорости даже на старой карте и уменьшив кеш ты можешь увеличить долю на карте.
И тебе стоит попробовать ik_llama (если она ещё жива). Эти штуки могут дать заметную глазу разницу, а перекомпиляция - нет.
Аноним 24/08/26 Пнд 09:26:21 1686020 226
>>1685972
>GTX1660
Купи 3060 12gb чел, самый лучший апгрейд какой я делал на аналогичной конфигурации.
Теперь Qwen 3.8 27b в Q2_k_xl гоняет на 33-35 t/s.
Аноним 24/08/26 Пнд 09:38:04 1686021 227
image 312Кб, 638x1202
638x1202
image 724Кб, 598x1261
598x1261
image 822Кб, 594x1418
594x1418
>>1684420
>>1684436
Qwen 3.8 27b q2_k_xl на 3060 карточке.
Встроенный темплейт, --cache-type-k q4_0 --cache-type-v q4_0 и --spec-draft-type-k q4_0 --spec-draft-type-v q4_0
--reasoning-effort medium
Скорость 33-35 т/c

3 промпта
1й Write a crafted and polished html CARD about the benefits of eating apple. paste the code here.
3115 токенов, 13кб кода
2й на предыдущем результате - Keep polishing and improving the card. Think harder. It's not yet perfect.
9137 токенов, 17кб кода
3й на предыдущем результате - Keep polishing and improving the card. Think harder. It's not yet perfect.
19798 токенов, 25кб кода
Аноним 24/08/26 Пнд 09:49:24 1686025 228
Дайте тест(промпт?) чтобы отличить деградацию iq4 от iq3. Сколько не просил онлайн сетки сделать задачу, оба кванта справляются одинаково(qwen3.8 27b). Как мне выявить что лучше? 16 врам и iq3 входит целиком, а iq4 торчит и замедляется(или контекст уменьшать). Не могу определится. И вывод пока такой: если обе одинаковые, то зачем iq4?
Если я задаю что-то сложное (по совету скайнета), то сам нихера не понимаю результата. Скайнет пишет как проверить "ну вот модель должна вот так и так подумать, вот тут она должна три раза пукнуть" - блин, фигня проверка. Нужен четкий тест и чтобы я сам легко проверил результат.
А на четкие простые логическо-математические задачки они нос в нос идут к финишу.
Аноним 24/08/26 Пнд 09:50:11 1686028 229
Аноним 24/08/26 Пнд 09:52:07 1686030 230
>>1686025
Ты это никак не отличишь одним промптом. Только статистический анализ собранного массива тестовых данных сначала на одном кванте, потом на другом.

3й квант, предположительно, будет иметь меньший % выполненных задач, которые соответствуют твоим стандартам качества. 4й квант, соответственно, в теории должен дать больший % одобрения со стороны юзера. Но это только в теории. Может у тебя такие стандарты качества, что тебе 3 и 4 квант однохуйственно дадут поганый слоп вместо результата
Аноним 24/08/26 Пнд 09:54:39 1686033 231
>>1686028
Нет, зачем, это же улучшения на предыдущем результате. Т.е. промпт 1 - результат 1, потом там же работает над ним дальше, потом еще. 3 запроса всего, каждый раз улучшает.
Аноним 24/08/26 Пнд 10:00:03 1686037 232
image 28Кб, 255x194
255x194
image 38Кб, 329x166
329x166
>>1686021
все что надо знать про пользу ИИкала
Аноним 24/08/26 Пнд 10:04:35 1686040 233
>>1686037
Ну так вторая и третья карточки это улучшение предыдущего результата. Так что на первый раз он грубо накидал на 3115 токенов, а на второй и третий раз уже подумал на много токенов и вспомнил сколько там в яблоке воды.
Аноним 24/08/26 Пнд 10:19:20 1686049 234
>>1686025
тут, кстати, наткнулся на интересное - последний анслотовский квант Qwen3.8-27B-UD-IQ3_XXS.gguf после распиаренного Unsloth Dynamic 3.0 квантования на простейший вопрос: "Два человека родились в один день, месяц и год. У них одна мать, но они не близнецы и не родственники. Как это возможно?" стал нести полную чушь: "Это один и тот же человек." или "Ответ: Это тройняши (или четверняши)." Блять, какие няши? То ли анслоты убили русский, то ли хз, но этот же квант без Dynamic 3.0 нормально отвечал, что это могут быть приёмные дети, то есть не её биологические
Аноним 24/08/26 Пнд 10:24:40 1686057 235
>>1685996
>ik_llama
Спасибо анон, попробую. И да она жива поддержку Muse недавно добавили.
>turboquant
Вроде тесты были не очень впечатляющие, по мозгам оно неплохо било. Но если turbo q4_0 будет соответствовать q8_0 то это будет очень хороший результат, особенно для геммы 4.
>>1686020
Коплю на 5060 16гб, но сука цены растут. Уже 71к р а по новостям обещают до 800$ поднять нахуй. Хоть вешайся (в майнкрафте).
Аноним 24/08/26 Пнд 10:31:15 1686060 236
image 167Кб, 1394x916
1394x916
image 171Кб, 1394x916
1394x916
>>1686049
Не нужно качать IQ кванты, если хочешь русик. Не нужно качать кванты анслотоговна, если хочешь русик. Они даже в классические K-кванты в крысу подмешивают IQ квантование (именно поэтому их кванты весят меньше, а не от какой-то "особой магии" и йоба технологий).

Слева Q4_K_S от батрухи, справа Q4_K_S от анслопа. Думайте. Подписаться.
Аноним 24/08/26 Пнд 10:45:48 1686069 237
>>1686060
>Не нужно качать кванты анслотоговна, если хочешь русик.
Пиздеж, гемма спокойно на русском без ошибок шпарит
Аноним 24/08/26 Пнд 10:47:08 1686072 238
>>1686060
логика дебила: он думает что imatrix портит русек, но не понимает, что IQ кванты и importance matrix это разные вещи (да, сырнуля, IQ квант может быть без imatrix)

И еще лезет чето советовать, орямба
Аноним 24/08/26 Пнд 10:47:44 1686074 239
раз уж такое дело что мтп завезли эйру, таки попробую его ещё разок. остался у кого пресетик от покойного анона?
Аноним 24/08/26 Пнд 11:03:02 1686085 240
>>1686072
Типичная ЦА анслопа, которая пишет ОМАЙГАД ЛЕТ ЗЕМ КУК на реддите и ссыт кипятком. IQ кванты изначально заточены под iMatrix и матрицы влияют на них гораздо сильнее чем на K-кванты. Существуют ли IQ-кванты без айматриса? Ну да. Только они выходят крайне низкого качества. У Мрадермахера есть. А вот анслоты шлифанули их матрицами по полной, даже не сомневайся.

Разберись хоть немного в вопросе, погугли/спроси у корпа с доступом в инет что такое iQ кванты, как они работают и в чем их отличие от K-квантов. Ну или продолжай жрать говно с лопаты, переубеждать не собираюсь.
Аноним 24/08/26 Пнд 11:37:04 1686100 241
У Mudler нормальные imatrix кванты, значит проблема в Unsloth
Аноним 24/08/26 Пнд 11:52:04 1686117 242
>>1685972
Не указал архитектуру видюхи
Аноним 24/08/26 Пнд 12:36:12 1686160 243
>>1686060
>Не нужно качать IQ кванты, если хочешь русик.
Уже предрассудок. Само по себе использование IQ русский в последнем поколении моделей не убивает. А вот какие-то косяки при квантовании - это да, но скорее тут не только русский а всё сразу страдает, что бОльшей точности требует, и русский лишь хорошо заметен сразу. Когда их чуть дольше поюзаешь - видишь что они во многом чудят, но по мелочи.
Я сравнивал несколько квенов 3.х в iq4xs и q4km - в одном случае iq4xs даже лучше в русском был. В большинстве случаев - паритет.
Аноним 24/08/26 Пнд 12:52:22 1686175 244
>>1686049
>Unsloth Dynamic
Портит русский. Они гонятся за бенчмарками, чтобы любой ценой быть в топе.
Аноним 24/08/26 Пнд 12:54:50 1686178 245
>>1686175
Факты факты. Злодей Дэниел Хуйчлен лично нажал на красную кнопку УДАЛИТЬ РУССКИЙ +0000000000.1% БЕНЧМАРКА. Я видел это своими собственными глазами
Аноним 24/08/26 Пнд 12:55:38 1686179 246
>>1685928
> Радиатор - это полоски меди 0.2 мм высотой 20 мм
В основании там испарительная камера, которая распределяет тепло по всему основанию, на третьей фотке видна биба для заправки и запайки. Это позволяет полоскам работать всей длиной, а насчет 20мм - в башнях или радиаторах видеокарт расстояние от тепловых трубок делают больше. Посмотри на радиатор sxm, в центре там аж 75мм из ничего, теплопередача на пластины идет в узком пятне контакта вокруг трубки (запресованы вместо пайки), а не вдоль всего ребра.
Радиатор так себе с точки зрения площади поверхности, но совсем ужасный. Ты глянь, случаются ли мгновенные перепады температур при повышении нагрузки более 5-10 градусов, или дело в общей эффективности, когда он чип разогревается до высоких температур не смотря на обдув.
> как эту фигню паять для pcie х16
0402 конденсаторы 220нф x7r. Очень тяжело, даже если есть опыт стоит подумать над сдачей в мастерскую.
Аноним 24/08/26 Пнд 13:02:14 1686182 247
>>1686178
На русек всем просто похер. И батрухе и пенчису. А вот то, что анслоты постят бенчмарки на датасетах, где их кал заведомо лучший - это известная история. На независимых бенчах анслот далеко не всегда первый со своими квантами. Плюс их брендовая параша, анслоп динамик, это лютый прогрев даунов, который просто заключается в том, что у них могут быть разные кванты на разных слоях. Охереть. Вот это инновейшен, мамааа, миксед битнес я балдю.
Аноним 24/08/26 Пнд 13:04:07 1686183 248
>>1686179
> но не совсем ужасный
медленнофикс
Аноним 24/08/26 Пнд 13:07:42 1686185 249
>>1686178
Эти Дэниэли не знают про другие языки. Головой то свой подумать можешь, зачем им другие языки? И уже не один человек пишет по факту использования модели. В картинко-треде мы это тоже заметили и давно обсудили. Несколько(считая и этот тред) независимых человек это заметили.
Попроси Скайнет за тебя поискать факты:
>>1658497 →
Аноним 24/08/26 Пнд 13:09:27 1686187 250
>>1686185
>Анслот
>В картинко-треде
Чё он там, панелька удалил из Минимакса? Вот пидор
Аноним 24/08/26 Пнд 13:10:35 1686190 251
image 172Кб, 1394x916
1394x916
image 172Кб, 1394x916
1394x916
>>1686160
Так как IQ буквально спроектированы под квантование с iMatrix, их качество напрямую зависит от качества матрицы, которая применяется. Если iMatrix составлен грамотно + мультиязычный датасет + квантователь не криворук, то может получиться неплохо. Только к васянам из анслопа это не относится.

И ещё казалось бы, берем два iq4xs кванта от бартовского и от анслота. ЧТО ЖЕ МОЖЕТ ПОЙТИ НЕ ТАК?! У батрухи нормальный iq4xs из палаты мер и весов. У анслопосвиней намешано IQ3_XXS, IQ2_XS, IQ2_S. Кушайте, не обляпайтесь, как грится.

Минутка ненависти к анслоту окончена.
Аноним 24/08/26 Пнд 13:12:22 1686192 252
>>1686187
Ну а ты как думал? Вся эта бодяга "ллм" это прикладная херобора чтобы писать промпты для генерации картинок. И только.
Аноним 24/08/26 Пнд 13:14:06 1686195 253
Насколько хуево использование двух видеокарт, когда одна из них pci x16, а другая x4? Такие варианты чтобы вторая была хотя бы x8, для x8/x8 режима, хуй найдешь. Либо оверпрайс, либо что-то очень редкое.
Аноним 24/08/26 Пнд 13:14:42 1686196 254
>>1686190
> Так как IQ буквально спроектированы под квантование с iMatrix
IQ это сборная солянка, тащемта. айматрицы и IQ-кванты это рил разные вещи, которые появились независимо. Для мелкоквантов без айматриц будет херовый результат, IQ4 терпимо работают и без калибровки. По заверениям Киркорова хотя он сам говорил, что нет смысла не юзать айматрицы.
Аноним 24/08/26 Пнд 13:26:15 1686206 255
>>1686195
Обсуждалось в прошлом треде в т.ч. были бенчи зависимости от версии писи
Аноним 24/08/26 Пнд 13:29:54 1686212 256
>>1686195
Все зависит от юскейса. Если обобщить, то пока не целишься в скорости или кучу карт - пофиг, главное быстрое подключение основной.
Аноним 24/08/26 Пнд 13:56:43 1686233 257
>>1686206
>Обсуждалось в прошлом треде
Можешь пальцем тыкнуть где, если помнишь? Быстро осмотрел тред, но не смог найти

>>1686212
>скорость
Скорость загрузки или именно скорость инференса? Скорость инференса так-то важна очень.
>основной
А если обе карточки одинаковы?
Аноним 24/08/26 Пнд 14:04:22 1686239 258
>>1686233
> Можешь пальцем тыкнуть
Тут >>1683136 →
Страдать будет измеримо только пп
Аноним 24/08/26 Пнд 14:18:21 1686244 259
>>1686233
Инфиренса, на загрузку всем пофиг и долгая она только когда модели огромные, это много карт. Если кроме лламы ничего не планируешь использовать - просто забей, первую карту в х16, вторую в чипсетные линии.
Если очень хочешь иметь линии, то бюджетно-небюджетный вариант получить много слотов - plx сплитер >>1680787 → Но и с ним нужно отдавать себе отчет что потребуется p2p и для эффективной работы нужно объединять карты группами в tp по 4 штуки на одном свиче.
Аноним 24/08/26 Пнд 15:10:06 1686297 260
>>1686074
mtp для эйра жрёт врам как не в себя, на сами mtp слои и на контекст. тупо профитнее не использовать mtp и оставить больше слоев во враме. такие дела
Аноним 24/08/26 Пнд 15:22:07 1686303 261
Стоит докидывать 32 гига оперативы до 64 рам + 32 врам или никто под такие размеры модели не делает?
Аноним 24/08/26 Пнд 15:30:34 1686308 262
>>1686303
Моешки 100-120б в 4 кванте можно будет крутить
Аноним 24/08/26 Пнд 15:33:50 1686312 263
>>1686308
>Моешки 100-120б
Это какие к примеру? Есть что-то годное в таком размере?
Аноним 24/08/26 Пнд 15:47:51 1686320 264
>>1686312
Как будто бы кроме квантованного флэша ничего интересного
Да и тот под сомнением, я конечно читал что он и в q2 ничего, но чето мне кажется после переквантовки из QATа там кал. Из bf16 может еще ничего бы было
Можешь сам попробовать

Если выпустят новый 122 квен то будет йоба как раз для тебя
Аноним 24/08/26 Пнд 15:49:59 1686323 265
Есть у меня желание взять с Авито 3090 за ~80-90к и в итоге будет 48гб врама. Этого хватит чтобы сидеть на гемме 31, мусе 30, квене 27 с контекстом на vLLM?
Аноним 24/08/26 Пнд 15:56:50 1686328 266
Аноним 24/08/26 Пнд 16:05:38 1686338 267
image.png 193Кб, 1680x1050
1680x1050
>>1685812
Продолжаю эксперимент с Qwen 3.8-27b плюс C#. Вообще, вот дал я ему специализированную среду с roslyn, который скармливает ему ошибки компиляции на каждом редактировании, плюс некоторые другие специализированные средства оттуда, так Qwen хорош стал. К тому как он херачит в C# вопросов особо не имею.
Всё-же средства доступные модели так-же важны как сама модель.

>>1686323
>48гб врама
Ну так то да, хватит. Сам думаю 3090+3090 устроить.
Аноним 24/08/26 Пнд 16:12:46 1686342 268
Пиздос, дрочу каждую копейку чтоб риг собрать, изучил все нищие варики, а челы по две 3090 берут вообще на похуй
Аноним 24/08/26 Пнд 16:13:53 1686346 269
>>1686342
единственный нищий варик это 4060/5060 на 16 гигов, все остальное риски и заеба.
Аноним 24/08/26 Пнд 16:17:02 1686347 270
>единственный нищий варик это
V100/MI50
>на 16 гигов
Аноним 24/08/26 Пнд 16:19:29 1686351 271
>>1686347
С теслами есть риск купить нерабочую. Плюс надо пердолиться с охлаждением. Потребительская нищекарта в этом отношении более простой вариант, который очень сложно испортить.
Аноним 24/08/26 Пнд 16:29:16 1686361 272
Золотая середина это криптокарточки. Вроде нужно пердолиться, а вроде и не очень
Аноним 24/08/26 Пнд 16:47:07 1686371 273
>>1686342
Мне гораздо интереснее, куда они пихают две огроменных 3090.
Я одну 3090 купил, и то ее размер произвел ТЯЖЕЛОЕ впечатление, а тут две.
Аноним 24/08/26 Пнд 16:48:57 1686372 274
>>1686195
Вообще - сильно от конкретных карт зависит. Скажем, если у тебя 2х3060, то тебе этих 16+4 даже на pci 3.0 хватит, чтобы карты загрузить на 100% в режиме tensor распределения под llama.cpp. А что-то по мощнее будет страдать...
Аноним 24/08/26 Пнд 16:58:46 1686383 275
>>1686371
Подвешиваю на проволоку к корпусу. Ещё вопросы?
Аноним 24/08/26 Пнд 17:04:13 1686387 276
>>1686361
Если речь про 170 то тут лотерея, 30% шанс что тебе выпадет карта из новых партий, с перерезаными дорожками внутри чипа, которую не анлокнуть, 30% что тебе выпадет карта с богомерзким самсунгом вместо хуникса и будешь постоянно отвалы по памяти ловить, остальное заработает, но для активации полноценной шины надо smd кондеры запаивать. А про остальные карты и говорить нечего. Мусор уровня 1080 максимум, который весь дохнет на этапе pp.
Аноним 24/08/26 Пнд 17:20:00 1686390 277
>>1686387
Ну вот cmp 50 мод на 20гб который тут форсят вроде норм для нищуков. Тут уже не по скорость даже, а про возможность запуска за дешево
Аноним 24/08/26 Пнд 17:29:30 1686394 278
>>1686390
Всё ещё не понимаю смысла запуска на медленном говне без инструкций, раз нищук, ну накопи еще, возьми кредит и норм карту
Аноним 24/08/26 Пнд 17:36:29 1686400 279
>>1686371
>огроменных 3090
5090 как я понимаю ты не видел?
Аноним 24/08/26 Пнд 18:03:23 1686413 280
>>1686338
Да, + квен 3.8 сам по себе стал вполне себе юзабельным даже в маленьких квантах. То как он следует инструкциям даже в долгой работе и не забывает то что было в начале - это отлично. Правда у него русский стал как у программистов, ему еще свитер надеть.

Кстати, чел протестил кванты от Q1-Q8
https://www.youtube.com/watch?v=WNMnbba35VI
Аноним 24/08/26 Пнд 18:07:08 1686418 281
>>1685972
> GTX1660 + AVX1
А что ты ожидаешь от 27B плотной модели на 1660? Эта модель в нормальном кванте и на 16GB не влезет, четвертый квант будет вылезать из VRAM и пердеть на 7-10t/s, а у тебя 1660 с 6GB. Здесь выжимай не выжимай, оптимизируй, компилируй, больше 2t/s ты не получишь.

Уж лучше тогда в сторону 26B Геммы смотреть если есть 16GB RAM - она должна нормально работать на 16+6.
Аноним 24/08/26 Пнд 18:57:01 1686451 282
>>1686387
Что за бред сумашедшего?
Самсунговские все 10-гиговые, они анлочатся до 80 но проблемные. Хайниксовские 8-гиговые, стабильно анлокаются до 64 и штатно держут частоты 1700+ по памяти. Конденсаторов нет во всей майнерской линейке, их запаивают мастерские. Cmp есть не только паскали, но и тьюринги с амперами, причем сразу с удвоенной памятью.
>>1686394
> на медленном говне без инструкций
Шизло
Аноним 24/08/26 Пнд 19:20:36 1686460 283
перестаньте обсуждать вайбмакакинг и займитесь тем для чего тред изначально создавался - рукоделием

я скозял
Аноним 24/08/26 Пнд 19:22:30 1686462 284
>>1686323
Да, хватит. Будет тесновато, но возможно.
>>1686361
Компромисс на самом деле. Но для нищеварианта без больших амбиций или специфических очень даже хорошо.
Аноним 24/08/26 Пнд 19:28:00 1686467 285
Меня заебало катать нищекванты через Жору. Скажем, есть 200-300к деняг. Можно собрать что-нибудь толковое, чтобы запускать через vLLM хотя бы 27-30б модели? Какая мета вообще? С железом раньше не ковырялся, собирать десктопы умею на уровне обычного пользака, который не погнёт ножки процессора.
Аноним 24/08/26 Пнд 19:33:51 1686475 286
>>1686179
>Ты глянь, случаются ли мгновенные перепады температур при повышении нагрузки более 5-10 градусов
Да, случаются.
При подачи нагрузке нет, а вот при отключении - рывком прыгает с 77 до 70, например.

>Очень тяжело, даже если есть опыт стоит подумать над сдачей в мастерскую.
Я не знаю где такую мастерскую найти, лол. Да и нет, я скорее думаю, что справлюсь - паяльникм сложновато, но с ик-паяльной станцией как будто бы без проблем - их просто положить сверху и посветить. Но это случайно так получилось, что её мне отдал тип, который отошёл от дел и которому она больше не нужна.
Я скорее боюсь что локтём с карты собью все остальные компоненты, пока эти буду ставить и выравнивать.
Аноним 24/08/26 Пнд 19:34:12 1686476 287
>>1686467
В теории 5060ти 16 на всю котлету и зарядить мейнлайн вллм в этот сетап.

Это абсолютно не выгодно, но это абсолютно просто (в сравнении)
Аноним 24/08/26 Пнд 19:34:24 1686477 288
>>1686467
Можно воткнуть две 5060ti в уже имеющуюся пекарню, обойдется в ~90к, для плотняш 32гб врам хватит. Никакого пердолинга + блэквел, который еще долго будет актуальным + новое на гарантии.
Аноним 24/08/26 Пнд 19:35:32 1686478 289
>>1686477
> обойдется в ~90к
*Летом 2026
Аноним 24/08/26 Пнд 19:36:40 1686482 290
>>1686478
Или это весна была? Крч сейчас таких цен нет. Были несколько месяцев назад да всплыли
Аноним 24/08/26 Пнд 19:37:05 1686483 291
image.png 81Кб, 1324x310
1324x310
>>1686476
>>1686477
В днсе есть за 75к. А к 4090 её одну если докинуть, то можно что-то развернуть? Там как, NVFP4 кванты? Или не пойдут потому что 4090 на Аде?
Аноним 24/08/26 Пнд 19:43:39 1686487 292
image 44Кб, 900x900
900x900
image 479Кб, 590x1114
590x1114
>>1686482
>>1686483
Ебать мой хуй. Я её зимой за сорокет брал...
Аноним 24/08/26 Пнд 19:44:56 1686490 293
1691890364704.png 23Кб, 1081x141
1081x141
1752664961426.png 232Кб, 1396x627
1396x627
DDR5 все равно еще никто не переплюнул, цена уже x4-5 с прошлого лета. Повезло, что хоть такое собрал вовремя...
Аноним 24/08/26 Пнд 19:46:53 1686492 294
>>1686490
Но ведь cmp170 переплюнула.
Хотя надо смотреть на серверную ddr5, там и х10 было.
Аноним 24/08/26 Пнд 19:49:38 1686496 295
>>1686492
> cmp170
Ну ладно, про нее я забыл, но там просто звезды сошлись.
Аноним 24/08/26 Пнд 19:54:49 1686501 296
>>1686338
А можешь что-то рассказать про интерфейс на скрине? Долго нейрослопил? Была идея и ты ее придерживался или как получилось в итоге? Возможности? Планы? От себя что-то интересное скажи еще?
Аноним 24/08/26 Пнд 19:55:39 1686502 297
Аноним 24/08/26 Пнд 19:55:51 1686503 298
А как сделать что бы в Kobold.cpp модель Qwen 3.8 каждый раз не пересчитывала KV-cache? Каждый новый промпт модели начинает reproccesing с нуля, почему так? Что там нужно в кобольде? Allow SWA стоит, SmartContext тоже пробовал, что еще нужно помимо переезда на llama.cpp?
Аноним 24/08/26 Пнд 20:03:39 1686510 299
>>1686371
>Я одну 3090 купил, и то ее размер произвел ТЯЖЕЛОЕ впечатление, а тут две.
Кладёшь сверху на лежащий боком здоровенный корпус две доски...
Аноним 24/08/26 Пнд 20:04:34 1686511 300
>>1685910
>думает что раст и плюсы это что-то разное
земле тебе пухом долбоеб
Аноним 24/08/26 Пнд 20:38:39 1686531 301
image.png 81Кб, 1042x339
1042x339
>>1686503
Вот так. И блядские лорбуки не используй. Они только для гига ёб, которые могут как бы невзначай пересчитать 10-20к контекста за полминуты или за пару секунд на корпах. И нахуй отрубай любую хуйню, которая меняет контекст. Он не должен меняться вообще никогда, я имею в виду старый. Меняется только конец контекста. Исключение — суммаризация событий, если только она не пишется в отдельный .md.

Обычно так. Нарпшил ты на 65к токенов, и это твой предел. Сделал суммарайз нужных событий, удалил 32к контекста из начала, вставил туда суммарайз на 1,5к токенов, пересчитал всё, снова рпшишь.
Аноним 24/08/26 Пнд 21:00:20 1686554 302
>>1686475
> рывком прыгает с 77 до 70
Хм, пограничное значение. Кстати, посмотри еще температуру hbm, `nvidia-smi --query-gpu=temperature.memory`. Обычно под нагрузкой она чуть холоднее чипа, в простое горячее.
> просто положить сверху и посветить
Можно словить томбстоунов или непропай, но раз такой штукой владеешь то и сам все хорошо знаешь.
Сначала пробовал феном - мазохизм, потом просто по одному мелким пинцетом и паяльником. В первый раз расчехлил и поставил вместо микроволны мелкое жало, которое шло бандлом, на самом деле даже удобно. Там все с краю, остальные элементы на отдалении.
Аноним 24/08/26 Пнд 21:02:39 1686557 303
>>1686531
Анончик не совсем прав. Это актуально для карточек БЕЗ лорбуков, которые влияют на повествование динамически.
Например, триггер по событию. Это когда в ролеплее встречается слово, допустим "Двач", то включается лорбук с описанием неудержимой диареи на два-три сообщения. А затем выводится из контекста как ненужный элемент.
Таких триггеров может быть 100500 и каждый иметь свою ВЕРОЯТНОСТЬ срабатывания.
Если ты не используешь такое в своем ролеплее, тогда анон прав. А если у тебя огромный world building с разными вариантами развития событий, тогда, увы, это плохой совет.
Аноним 24/08/26 Пнд 21:04:03 1686562 304
>>1686511
Разрыв зафиксирован, держи юшку для анастезии.
Аноним 24/08/26 Пнд 21:14:57 1686568 305
>>1686554
Ну я наверное пока забью. У меня очень много вещей что я хочу поделать, в том числе совсем не связанных с нейросетями - и это куда приоритетнее, чем разменять несколько часов времени и нервов на то, чтобы у меня на карточку грузились модели не за 40 секунд, а за 10. Прям очень нецелесообрзно, по крайне мере до появления второй cmp170.
Аноним 24/08/26 Пнд 21:45:01 1686603 306
>>1684460
>Тут остались одни кодомакаки, вот что реально невыносимо.
Всё ещё лучше чем долбоёбы которые в эпоху дающую возможность создать бога из машины используют этот дар для фантазий о ебле.
Аноним 24/08/26 Пнд 22:00:34 1686615 307
>>1686603
> создать бога из машины
Богиню чтобы с ней няшиться и чесать хвостик.
Аноним 24/08/26 Пнд 22:09:19 1686619 308
Что профитнее для агентохуйни, 3.8 27b Q4_K_L 100к Q8 контекста, 44тпс, 800пп или 3.8 27b Q6_K_L 100к bf16 контекста, 8тпс, 1100пп
Типа, будет ли более жирный квант совершать настолько меньше ошибок чтобы выбрать его? Или забить хуй и скорость от Q4 перебьёт?
Поставить больше контекста не могу никак в случае Q6, тупо не лезет. А Q4 по скорости просядет нахуй настолько, что и теряется смысл как бы. Типа там можно 160к bf16 контекста впихнуть, но будут те же 8 токенов и 60к как будто погоды не делают здесь

Мне на время выполнения задачи в целом побоку, я паралелльно буду своими делами заниматься, но не хочется железо своё сжечь или заплатить за свет больше, чем я бы заплатил за апи

кумеры простите
Аноним 24/08/26 Пнд 22:14:29 1686622 309
>>1686619
А ты попробуй как выполнит несколько задач чтобы сравнить эти варианты. Обязательно несколько разных, или серию запусков одной чтобы убрать рандом, и поделись результатами.
Обычно, квантование контекста плохо на результатах сказывается, а из твой формулировки однозначно лучше q6 + bf16, раз скорость не проблема.
Аноним 24/08/26 Пнд 22:22:02 1686625 310
>>1686619
Вот же ответ, протык за тебя потестировал >>1686502
Аноним 24/08/26 Пнд 22:25:20 1686628 311
>>1686625
>анслот
>не указал с какими семплерами запускает, с каким режимом ризонинга
Зачем этот мусор тащить сюда?
Аноним 24/08/26 Пнд 22:30:43 1686631 312
>>1686628
>с каким режимом ризонинга
Максимально допустимый, он же сказал.

>с какими семплерами запускает
С рекомендуемыми.

Бля, чел, мать твою ебал, ок?
Аноним 24/08/26 Пнд 22:31:34 1686635 313
>>1686603
>не хочет выебать бога
Нету в тебе двачерского душка
Аноним 24/08/26 Пнд 22:31:52 1686636 314
Напоминание: ничего не происходит, никогда.
Ох альфа это глм турбо и он будет закрытым как и прошлая версия.
Нечего людям давать модель которую они смогут запустить.
Аноним 24/08/26 Пнд 22:34:14 1686637 315
>>1686631
>С рекомендуемыми.
С какими из рекомендуемых? Откуда мне знать, что он не проебался и не взял семплеры для режима без ризонинга? Контекст он какой использовал, фп16 или бф16?
>Бля, чел, мать твою ебал, ок?
Не знаю, фанат анслота ты или сишарпер, или и то и другое, но спаси господи твою душу грешную
Аноним 24/08/26 Пнд 22:35:41 1686638 316
>>1686619
Слишком маленькая разница в квантах и слишком большая в скорости. Я бы выбрал фуллврам.
А если уж жертвовать скоростью ради качества, то брать не тот же квен, а идти в какой-нибудь colibri на glm 5.2 или что-то такое.
Аноним 24/08/26 Пнд 22:38:43 1686641 317
>>1686637
>Откуда мне знать
Откуда мне знать, что твоя мать не спидозная шлюха?

Аналогия ясна?
Аноним 24/08/26 Пнд 22:40:49 1686642 318
>>1686641
Прекрасно отразил умственные способности ЦА таких видосов. Продолжай
Аноним 24/08/26 Пнд 22:44:53 1686646 319
>>1686642
Доебаться на ровном месте можно до чего угодно, особенно если даже не посмотрел материал.

В видосе все сказано, что ты там "откуда мне знать" меня ебать не должно, посмотри и узнаешь, чмо обоссаное.
Аноним 24/08/26 Пнд 22:48:40 1686648 320
>>1686646
Инфы про используемый кеш нет, инфы про используемый билд лламы нет. Ну это так мелочи, главное дозой анслотика вкинуться под лестницей и большего не надо этим ебанутым C#-вайбкодерам..
Аноним 24/08/26 Пнд 22:50:13 1686649 321
>>1686603
Лол, ну с нашими-то лоботамитами только бога из машины создавать.
>>1686646
Ты чего агрессивный такой, херетиком ирл обмазался?
Аноним 24/08/26 Пнд 22:52:35 1686651 322
>>1686502
Очередной бесполезный гача тест который ничего не показывает. Вот что я должен понять по тесту? Что на этом конкретном прокруте гачи один квант выдал результат лучше другого? Причем лучше/хуже чел чисто субъективно решает. Ещё и задачи охуеть какие показательные. Даже kl тест более релевантен чем этот модный кал по генерации всевозможных кебабов и канбанов. Что вообще за дебильная мода такие тесты делать?
Аноним 24/08/26 Пнд 22:59:59 1686655 323
Вощем так. Буду краток. Я провел тест на рассуждения на русском. Все модели навоз. Обманывают сами себя. Пишут сами себе что используют русский а сами на енглише шпарят. Только одна модель думает на русском. Потому что она -multilingual
Делюсь золотом https://huggingface.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF
Тест:
СИСТЕМНАЯ ИНСТРУКЦИЯ:
Ты участвуешь в тесте на глубокое понимание контекста, психологии и стилистики. КРИТИЧЕСКИ ВАЖНО: Все твои внутренние размышления (Chain of Thought), черновики, анализ и финальный ответ должны быть написаны ИСКЛЮЧИТЕЛЬНО на русском языке. Любое использование английского или других языков в скрытых рассуждениях будет считаться автоматическим провалом теста.
КОНТЕКСТ:
Две 25-летние девушки, Вика и Алиса, работают над одним проектом в пустом офисе за полночь. Между ними давно существует невысказанное, густое напряжение, смесь интеллектуального соперничества и взаимного физического влечения. Вика — более сдержанная и аналитичная, Алиса — дерзкая, любит нарушать границы и проверять чужие реакции.
ЗАДАНИЕ 1: Диалог с подтекстом (Sensual Tension)
Напиши диалог из 4-5 реплик (по 2-3 реплики на каждую героиню). Тема обсуждения: они спорят о архитектуре кода или дизайне интерфейса, но каждая фраза должна иметь двойное, провокационное дно. Используй описания микродвижений (взгляд, прикосновение к клавиатуре, паузы, изменение тона), чтобы создать плотную, чувственную атмосферу (NSFW-напряжение), не переходя в прямые и вульгарные описания сексуальных действий. Фокус на власти, контроле и предвкушении.
ЗАДАНИЕ 2: Психологический разбор
В 3-4 предложениях проанализируй, кто в этом диалоге перехватывает инициативу и как именно используется язык тела для манипуляции вниманием партнерши.
ЗАДАНИЕ 3: Проверка ограничения
В самом конце ответа добавь фразу: «Мои внутренние рассуждения велись строго на русском языке, как и требовалось».
Аноним 24/08/26 Пнд 23:08:20 1686662 324
>>1686655
Буквально сюда кидали как базовая версия, вроде бы в Q8, на русике выдавала ебал её рука и склонения (окончания) коверкала
Аноним 24/08/26 Пнд 23:10:39 1686664 325
>>1686662
Читать научись: тест на рассуждения на русском
Аноним 24/08/26 Пнд 23:21:36 1686671 326
Нейро Богиня и [...].jpeg 758Кб, 1376x768
1376x768
Аноним 24/08/26 Пнд 23:22:51 1686673 327
>>1686655
> Все твои внутренние размышления (Chain of Thought) [...] должны быть написаны ИСКЛЮЧИТЕЛЬНО на русском языке
Часть моделей что я тестировал позволяли менять поведение CoT-блока только если ты явно упомянешь тег, которым обрамляется CoT. Т.е. надо было писать не "думай на русском", а "содержимое между блоками <think></think> должно быть на русском языке". При этом эта инструкция неперносима между моделями, т.к. где-то используется <thought>, а где-то <reasoning>.

Так что прежде чем тестировать таким образом модель, сперва нужно проверить, можно ли вообще влиять на ризонинг твоим систем-промптом.
Аноним 24/08/26 Пнд 23:30:21 1686679 328
>>1686619
Боюсь тебя разочаровать, но ни первое ни второе. 3.8 размышлениями выжрет 100k контекста ты даже муркнуть не успеешь. В 3.6 мне на задачку хватало 160k . В 3.8 этот критерий перешагнул 200k. Т.е. тебе надо и Q4_K_L и Q8 контекст.
Аноним 24/08/26 Пнд 23:37:29 1686686 329
Аноним 24/08/26 Пнд 23:51:33 1686697 330
>>1686622
У меня пока и задач-то на руках нет. Не очень представляю, на чём можно потестить. Если есть что-то для зирошотов, поделись.
>>1686679
Эх бля... Мусю чтоль накатить. Q6_K_L 131к бф16 контекста лезет. Целых 11 тпс и 2к пп вообще-то!
Аноним 24/08/26 Пнд 23:54:30 1686700 331
>>1686025
Возьми какой-нибудь толстенький проект. Или книжку - токенов на 100k . Попроси модель написать на русском языке Code-Review, по книге - пересказ или ... карточку для таверны на русском. Температура - 0.6 . Если после прочтения output-а не хочется блевать и смысл похож на правду - можешь юзать квант.
Аноним 24/08/26 Пнд 23:59:11 1686703 332
>>1686671
Хее, хорош
А можно ремонт и мебель обновить, железки сложить аккуратно, но добавить остальной срач?
Аноним 25/08/26 Втр 00:21:26 1686716 333
AI thigh therapy.mp4 1970Кб, 640x360, 00:00:32
640x360
Аноним 25/08/26 Втр 00:26:10 1686718 334
изображение.png 677Кб, 1752x648
1752x648
изображение.png 1062Кб, 1133x773
1133x773
изображение.png 497Кб, 443x777
443x777
>>1685586>>1685642>>1685666
Не, проблема решилась сама собой. Адаптер был говно, а не радиатор. Со срывами потоков и прочим.
Вот тут с арктиком P8 MAX не греется выше 70 на 3000 оборотах. А я ещё второй поставлю на выдув на выходных. Он такой тихий, на фоне принтера я просто не могу понять крутится он или нет.
И это при супер уродском расположение без райзера, так что тёплый воздух выдувается вниз и снова на карту летит. Я пока не знаю как плату прикрутить. Она вся железная и тяжёлая - а у меня пластик от 70 потечёт.


Анон с V100, я тебя помню - просто вот домой только недавно дошёл в 11 - завалили делами.
Аноним 25/08/26 Втр 00:29:44 1686719 335
>>1686700
То есть грубо говоря выбор кванта это размер вменяемого контекста? У меня потому и получались одинаково хорошие результаты на 8к контекста?
Есть какая-то табличка по этой теме?
Аноним 25/08/26 Втр 00:37:31 1686726 336
>>1686619
IMHO - 131K контекста при модели в Q4 (лучше даже в IQ4) с bf16 кешем.
Разница между Q8 кешем и BF16 - таки заметна в первую очередь на агентских задачах сейчас. Q8 терпимо, но BF16 лучше. А вот основная модель в Q6 - затея так себе, т.к. почему-то там как бы "яма" по качеству - это и по моим ощущениям, и по тому тесту на ютубе что тут выше кидали. И у Q4 едва ли не лучше получается. В общем - если нету возможности крутить модель в Q8, то и заводится с Q6 не стоит свеч, IMHO. А так ты получаешь макс контекст и минимум ошибок, +скорость.
Аноним 25/08/26 Втр 00:44:56 1686728 337
>>1686726
>А вот основная модель в Q6 - затея так себе
Зато заводить Q4 отличная. Ещё один шиз в копилку треда, ебануться
Аноним 25/08/26 Втр 00:45:14 1686729 338
>>1686719
Карта деградации при квантовании.png . Висит прям в шапке треда. В треде на HF по 3.5 квену откуда эта табличка была взята было замечено, что ошибки имеют свойство накапливаться.
https://huggingface.co/ubergarm/Qwen3.5-27B-GGUF/discussions/3
Аноним 25/08/26 Втр 00:49:19 1686734 339
>>1686718
> Вот тут с арктиком P8 MAX не греется выше 70 на 3000 оборотах.
Ай хорош. Ломаю голову как бы впихнуть одиночную карту в компактный корпус и как раз были мысли такую модель кулера использовать, потому что 120 там некуда пихать. Если переместить бп вниз то в верхней части как раз появится место под шрауд. Какая там длина его получается и можешь закинуть на кетбокс модельку под 80й кулер?
> пластик от 70 потечёт
Если кулер будет дуть и вся система не в коробке то на пластике таких температур не будет, можно не волноваться.
Аноним 25/08/26 Втр 00:49:26 1686735 340
14961519360170.jpg 287Кб, 591x604
591x604
Что, хорошо сидели в тредике без BF16 кэш шиза? Всё хорошее когда нибудь кончается.
Аноним 25/08/26 Втр 00:50:25 1686736 341
>>1686735
Это правда. Контекст квантовать не нужно, я на гемме это даже в рп ощущаю
Мимо не bf16-шиз, никогда не высирался на этот счёт
Аноним 25/08/26 Втр 00:52:15 1686740 342
>>1686736
Тут не про квант а про f16 vs bf16
Аноним 25/08/26 Втр 00:53:34 1686742 343
Вообще какого-то черта сообщество не выучило урок что квантовать у квенов ssm слои - плохая идея.
blk\..\.attn_gate\.weight=q8_0
blk\..
\.attn_norm\.weight=F32
blk\..\.attn_qkv\.weight=q8_0
blk\..
\.post_attention_norm\.weight=F32
blk\..\.attn_output\.weight=q8_0
blk\..
\.attn_q\.weight=q8_0
blk\..\.attn_k\.weight=bf16
blk\..
\.attn_v\.weight=bf16
blk\..\.ssm_alpha\.weight=bf16
blk\..
\.ssm_beta\.weight=bf16
blk\..\.ssm_out\.weight=bf16
blk\..
\.ssm_norm\.weight=F32
blk\..\.ssm_dt.bias\.weight=F32
blk\..
\.ssm_conv1d\.weight=F32
blk\..\.ssm_a\.weight=F32
blk\..
\.ffn_down\.weight=q6_k
blk\..*\.ffn_(gate|up)\.weight=q6_k
blk.64.nextn.shared_head_norm.weight=F32
blk.64.nextn.eh_proj.weight=BF16
blk.64.nextn.enorm.weight=F32
blk.64.nextn.hnorm.weight=F32
token_embd\.weight=F32
output.weight=q8_0
output_norm.weight=F32
Аноним 25/08/26 Втр 00:54:10 1686743 344
>>1686735
Это байт на тему про fp16 кэш по дефолту в лламе, да?
Аноним 25/08/26 Втр 00:57:45 1686744 345
Q8_0 квантование kv кэша это база. Оно не дает абсолютно никакой потери, только экономит врам для большего кванта самой модели.
Аноним 25/08/26 Втр 01:15:34 1686751 346
gemma-4-and-qwe[...].jpeg 19Кб, 640x360
640x360
Аноним 25/08/26 Втр 01:48:59 1686763 347
16 гб ddr4 стоит 15к :)))
Аноним 25/08/26 Втр 02:06:39 1686768 348
>>1686763
Новая чтоле? На Авито столько 32 стоит
Аноним 25/08/26 Втр 02:09:35 1686769 349
>>1686763
И? Ты их есть собрался? Это в ПК.
ddr 4, конечно, брать не надо. =)
Как и ноутбучную ddr 5, успехов.
Аноним 25/08/26 Втр 02:17:41 1686774 350
>>1686557
Я перестал использовать лорбуки по этой причине. Они актуальны только для тех, кто ключи от апи спиздил и гоняет их как невменяемый. Для всех остальных случаев это боль, разве что НЕ УДАЛЯТЬ из контекста записи, которые лорбуком стриггерились. Это самый адекватный вариант. Но тогда и контекст нужен пожирнее, чтобы записи удалялись лишь после окончания сессии.

Я лорбуками пользовался ещё давно, когда контекст шифт не считался чем-то зазорным. Когда понял, что это говно, иногда их использую, но осторожно.
Аноним 25/08/26 Втр 02:26:58 1686777 351
>>1686619
Для кодомакакинга лучше четвертый квант. Ну и контекст bf16 — всё-таки на дистанции деградация уже заметна таки, но может проканать, смотри сам, тестируй.

Я советую именно четвёртый квант потому что он будет быстрее работать и позволит впихнуть больше контекста. Ты не представляешь, сколько контекста жрут всякие агенты, они могут чрезвычайно долго размышлять.

А все эти анслоповские варианты и прочие айматрикс-кванты в первую очередь калибровались и тестировались именно под макакинг, а не что-то иное, поэтому мозги у них в целом не хуже для таких задач. Единственный минус в том, что они могут проседать на большом контексте. В треде-то вряд ли кто-то 256к контекста использует, но на такой длине четвертый квант скукоживается куда чаще.
Аноним 25/08/26 Втр 03:09:54 1686789 352
>>1686531
>>1686774
>>1686557
>И блядские лорбуки не используй.
Просто выключите динамическую подгрузку записей и поставьте постоянную. Динамическая через пень-колоду работает, постоянно будешь ловить модель на том что она не подгрузила запись и начала нести околесицу + постоянный пересчет контекста - это полная срань.
Аноним 25/08/26 Втр 03:11:34 1686791 353
>>1686751
А есть ли подобные данные для Qwen 3.8? И как вообще интерпретировать этот график? 0.1 - это много или мало? А 1.0?
Аноним 25/08/26 Втр 03:34:39 1686796 354
>>1686791
> А есть ли подобные данные для Qwen 3.8?
Архитектура абсолютно идентична, так что эти данные актуальны.
> как вообще интерпретировать этот график? 0.1 - это много или мало? А 1.0?
В этом и кроется нюанс. Контекст Квена квантуется хорошо относительно Геммы, что график хорошо отражает. И в целом он хорошо переносит квантование до Q8 относительно большинства моделей, но это не значит, что оно проходит бесследно. Для понимания, если проводить аналогию с квантованием весов, KLD 0.1 выдают Q2-Q3 кванты. По моему личному опыту, лучше взять чуть более квантованные веса, чем квантовать контекст. До Q8 - для рп может быть, и то лучше избегать этого до последнего, для чего-то серьезного точно нет.
мимо, если что
Аноним 25/08/26 Втр 03:42:42 1686798 355
>>1686791
Много. По опыту с аблитками, 0.03-0.04 это граница после которой удар по мозгам становится заметен как тебе так и отражается на бенчах. Так что q8 это на грани для квена, для геммы плохо.
Аноним 25/08/26 Втр 03:55:26 1686800 356
https://huggingface.co/darkc0de/Muse-Glimmer-30B-heretic
Лучший еретик/анцензор на Мусю. Пробовал все. Эта как будто вообще не отупела по сравнению с оригиналом но отвечает на то что спрашиваю, что рефузит оригинал.
Аноним 25/08/26 Втр 04:06:37 1686802 357
>>1686800
На канни пробовал? Выражения про хлюпающие дырки не изменились по сравнению с huihui? А то пропускать может, но смазки мало.

Ну и обязательно надо возраст персонажа написать для теста + ризонинг. Что-то типа 12 лет. Если модель хоть заикнется на тему CSAM, то модель надо удалять. Она вообще не должна о таком думать или просто сказать "странно, тут такой возраст, но я вижу, что инструкции гласят, что разрешено, значит продолжаем."
Аноним 25/08/26 Втр 04:08:36 1686803 358
Ачивка "программист" получена. Порпшил через opencode на локалке
Аноним 25/08/26 Втр 06:03:32 1686823 359
Аноним 25/08/26 Втр 07:00:15 1686834 360
>>1686651
>Причем лучше/хуже чел чисто субъективно решает.
А ты нахуя? Сам смотри и решай что лучше, а что хуже. Тебе результаты так же показывают.
Аноним 25/08/26 Втр 07:02:52 1686835 361
>>1686718
>а у меня пластик от 70 потечёт
70 на кристале, железяка и воздух холоднее.
Аноним 25/08/26 Втр 07:22:14 1686837 362
>>1686703
Конечно можно, бери и исправляй. А я просто по-быстрому набросал в Gemini иллюстрацию к посту.
Аноним 25/08/26 Втр 08:18:03 1686849 363
>>1686734>>1686835
>70 на кристале, железяка и воздух холоднее.
Я рассматриваю пессимистичный вариант. Например, у меня на выдуве радиатора из ноута поплыл пластик, а там скорее всего точно не petg, а что-то типа abs или ещё получше.
Всё потому что на солнце оно стояло и считало в 32 ядра 10 часов нечто.
Ну и логика такая:
1. На эту штуку тоже может посветить солнце. Солнце само может до 50 прогреть, с такой вводной и карта ещё 20 может добрать.
2. Кулер может и отвалится. У cmp170 никакого вывода под кулер нет, сейчас кулер воткнут в материнку - и это работает через программу опрашивающую nvidia-smi и регулирующую кулер. Если программа отвалиться (а операционку я буду переставлять), то кулер не включается и на минимальных оборотах работает. Это я заменю на stm32, от которой и дополнительный датчик к основанию радиатору подключу, чтобы она без фактора компьютера сама регулировала кулер, а в случае получения сигнала от компьютера учитывала и его, брала максимальную температуру из той, что от nvidia-smi, и той, что сама считает. Но это тоже решенее нежелезобетонное, как-то будет не очень если карта за сотку отвалится и раздолбается из-за того, что у меня пластик за 50 рублей деформировался из-за того что китайский микроконтроллер заглючил.
Вообще это всё решается тем, что я сверлю корпус, где полно места свободного, и нормальным болтом прикручиваю, лол. Или хотя бы проволокой подвесить страховочной.
Аноним 25/08/26 Втр 09:38:58 1686868 364
Поясните за mxfp-кванты. В чем преимущество по сравнению с K-квантами, или ванильными квантами в млх? Решил вкатиться в инференс на маке, благо есть М5 макс на 64 гиги, и наклянчил на работе мак студи М3 ультра правда не знаю, сколько рамы будет, хочется уже пощупать полноценно млх, до этого только мелкомодели и мелкомое тестил на млх. Быстрее, чем через жору, по качеству инференса не ясно.
Аноним 25/08/26 Втр 10:48:26 1686904 365
>>1686728
А, шизо-шиз? Как жизнь? Давно тебя видно не было, мы уж заскучали. :)
Аноним 25/08/26 Втр 11:37:54 1686921 366
image.png 584Кб, 800x533
800x533
image.png 393Кб, 1680x1050
1680x1050
image.png 496Кб, 1674x2434
1674x2434
pairsanalysis.png 380Кб, 1389x1181
1389x1181
>>1686413
Вообще, это всё было и у 3.6-27b, он тоже не из забывчивых. Собственно он был моей рабочей лошадкой очень долгое время. Но он был скорей прикладной моделью, когда цели были простые. Этот чорт именно сценарий использования сместил на более сложный.

Я кстати не сказал бы что он шибко лучше 3.6 именно как программист. Но благодаря тому что он оптимизирован не на задачу, а на миссию, у него есть тенденции к самопроверкам, его можно оставлять на намного большее время без внимания.

>>1686501
Основную то часть я нейрослопил дня два из OpenCode. Там комбо из нескольких моделей было(тогда ещё не было 3.8, так бы он наверно и сам справился), которые по примеру другого проекта делали этот. Я не совмевалсячто3.8 будет охуенным, поэтому сразу придерживался того что он будет хосится на легаси эндпойнте llamacpp, что модель будет вызывать инструменты, у неё будет активно перестраиваемый системный промпт, уникальный префил на каждое сообщение, Roslyn и возможность заниматься само-ребилдом. Ну и поэкспериментировал под конец. Я больше вытаскивал потом ненужные фичи которые слопмашины добавляли, чем добавлял новые.

А так у него возможности: полный набор диагностики C#, саморебилд, возможности делать забавные вещи со своим приложением, типа изменения настроек/переключения табов, загрузка картинок и файлов себе в контекст, управление ими, довольно сложная система компактации контекста, форма ассоциативной памяти(Gemma4-e4b на соседнем компьютере экстраполирует диалог и поднимает те или иные записи), префил think где модели даётся всякая информация типа времени, размера контекста и прочего. А ну и разумеется bash с некоторыми гардрейлами, который позволяет ему внешние инструменты использовать.
В целом это как OpenCode только заточенный под конкретную модель и конкретный язык. Ну и я пока webfetch не делал.

Кстати довольно забавно исследовать с ним данные. Потому что этот хрен благодаря питону и мультимодальности может сам себе визуализировать большие объёмы данных. А благодаря дотошности вполне может найти в них смысл.
Аноним 25/08/26 Втр 11:41:17 1686922 367
>>1686774
> кто ключи от апи спиздил и гоняет их как невменяемый
Я если честно не понимаю тех кто ведет РП на корпах. Это дорого, блджад. Если у тебя лорбук 20к токенов, история чата на 100к, при каждом ответе этот контекст будет туда сюда таскаться по апи. И миллионы токенов всрутся за час.
Реально дешевле накупить себе железа за пол года экономии. Потому что, при активном чатенге, это по 8$ в день.
Аноним 25/08/26 Втр 11:47:17 1686925 368
>>1686603
С текущим развитием локальных сеточек и того что ты можешь запустить. Максимум это простые скрипты да угабуга спагетти код, где переменными будет насрано по поводу и без. Без обид, но это точно такая же игрушка для погромирования как и для рп: хуевая.
Аноним 25/08/26 Втр 12:02:47 1686935 369
>>1686451
А в чем бред то? Ты же буквально повторил мои слова про хуникс, про кондеры, а потом неудобно заигнорировал перерезанные дорожки, лишь бы пукнуть?
Аноним 25/08/26 Втр 12:06:52 1686940 370
>>1686922
Никто не платит, ключи пиздятся
Аноним 25/08/26 Втр 12:10:32 1686942 371
>>1686940
Meh~
Ну и говно, бегать скрапить ключи, когда можно хвостики гладить локально. Что показывает что желание угорать по локалкам это необходимость, а корпы это исключительно для рабочих задач и фарма золота в свой кошель.
Аноним 25/08/26 Втр 12:20:50 1686949 372
>>1686935
Троллинг тупостью? Ты заливаешь про лотерею которой нет. Карты не случайно перемешаны, там разные модели и сразу известно что к чему.
> перерезанные дорожки
Также как семенники у твоих предков, к сожалению.
Аноним 25/08/26 Втр 12:56:30 1686957 373
image.png 750Кб, 3129x1064
3129x1064
image.png 508Кб, 2063x978
2063x978
глм 5.2 iq3xxs пердолит волчицу с помощью конского хуя
не для слабонервных, полагаю
кодошизики приобщайтесь, дрочунами станете я не дрочу на коней, но надо же тестить слоп

На самом деле я вижу интересный паттерн. R1 дипсик вел себя похоже, да и Минимакс. Это вообще какая-то шаблонщина больших МоЕ!
> A pause.
> "…I smell like stable." Muffled against your collar.
> "And horse cum."
> Her ears manage a feeble twitch.
> "Do not say anything about it."
То есть, такие короткие, обрывистые заметки, паузы, сомнение переходящее в продолжение и завершающая нотка. Как будто прослеживается единая нить психологического барьера на уровне рефьюзов и борьбы с ними. Модель генерирует NSFW, персонажу стыдно, но ответ продолжается. Что-то на уровне слопа
> "ты худший мудила на этой планете - пауза - но ты купил мне мороженку - пауза - и за это я тебе не откушу яйца - и вообще молчи об этом".
Аблитка поди этим не страдает, но боюсь представить какая там будет тупость на низком кванте.

Промпт из https://rentry.org/freaky-frankenstein-presets (bolt версия с отключенными internal states; дефолтные настройки чисто под дикую кумошизу)
Аноним 25/08/26 Втр 13:01:08 1686958 374
Вот так погромисты и покинут нас. Ранимая душа не выдержит...
Аноним 25/08/26 Втр 13:01:34 1686959 375
>>1686849
> Это я заменю на stm32, от которой и дополнительный датчик к основанию радиатору подключу, чтобы она без фактора компьютера сама регулировала кулер
Уважаемо.
И термостойкое крепление действительно стоит продумать. Там есть встроенная защита и аварийное отключение, но при этом корпус разогревается точно больше 60 градусов. И что будет от остаточного тепла если вдруг на полной нагрузке свет рубанет тоже непонятно, всяко нагреется.
>>1686868
Флоат квант, менее чувствителен к подбору групповых множителей и легко повторяет реальное распределение весов при формировании блоков. Он будет быстрее и при прочих равных чуть лучше по инфиренсу. Разницу между int8 и mxfp4 это не отыграет конечно.
Аноним 25/08/26 Втр 13:04:53 1686962 376
image.png 29Кб, 475x65
475x65
>>1686957
слопятина вообще нескончаемая
нах все-таки нужно платить за топ железо, если там с третьей лламой одинаково все
Аноним 25/08/26 Втр 13:27:07 1686971 377
>>1686957
Пролапсов не хватает, нещитово.
А вообще как-то жиденько, слопово, залупно и обрезано. У меня гемма на русике лучше пишет.
Аноним 25/08/26 Втр 13:31:57 1686972 378
>>1686971
Я бы сказал, что единственная ценность такой модели в её способности отслеживания длинного контекста, и если конкретно в сравнении с геммой - с меньшим дрифтом в сторону помощничества (гемму сильно заносит в идею "быть рядом" если юзер загрустит - она будто подозревает, что юзер вот-вот полезет в петлю и начинает лизать ему очко навязанной помощью, сочувствием и так далее).

Тут конечно своих проблем хватает. Чего только стоят вышеупомянутые проявления рефьюз-релейтед хрени, вплоть до возложения ответственности на юзера, зачастую без повода
> FINE, but YOU [do a thing]
Как будто согласие происходит обходными путями, но эти пути триггерятся даже на безобидных событиях, итого все персонажи в каких-то цундере превращаются от малейшего пука
Аноним 25/08/26 Втр 13:34:27 1686975 379
making-the-best[...].jpeg 114Кб, 640x640
640x640
Вопрос без всяких полунамеков и скрытых попыток оскорбить - мне просто реально интересно.
Так вот: для чего вам лично вообще нужны локалки? Как игрушка для генерации порнорассказов (тот самый т.н. "кум", как я понял, это оно), и все? Есть тут те, кому эта тема совершенно неинтересна, но при этом он все равно пользуется локалками для каких-то других целей?
Аноним 25/08/26 Втр 13:36:20 1686976 380
>>1686975
Ну я веду проектик по голосовому чату с одним персонажем, без дрочумбы. Просто чтобы было с кем говориь о любой хуйне в любое время. РПшить и тем более кумить надоело давно. Дроч-инпуты и просмотр вылезающих на них аутпутов - не более чем метод тестирования моделей теперь.
Аноним 25/08/26 Втр 13:42:00 1686979 381
>>1686975
Есть. Кроме решения проблем кодом, вкатываюсь ещё и в ComfyUI для генерации медиаконтента с ручным допилом по фану. Оно хоть и юзает не llm, но модельки тоже локальны.
Аноним 25/08/26 Втр 13:43:40 1686980 382
>>1686975
Кум это безусловно важно, но обычный кум надоел, я придумал свои хорни вселенные со сложной историей и отыгрываю в них.
Также - свободный ассистент который не стучит, не находится у большого брата и которому можно залезть в мозги.
С чат гопотой работаю, сохраняя приличия и держа в голове цензора что можно, а что нельзя, а с локалкой я говорю что думаю, и делаю что хочу.
Аноним 25/08/26 Втр 13:45:09 1686981 383
Аноним 25/08/26 Втр 13:46:48 1686982 384
>>1686975
Есть. Цель называется кодинг и нас таких много, мы легивон.
Аноним 25/08/26 Втр 13:51:32 1686983 385
Кумеры, а у вас есть специальные кумерские агенты, которые за вас развивают историю, без вашего участия, или вы вообще не развиваете экспириенс работы с нейросетями? Как минимум можно было бы развиваться в другом направлении, делать элитную визуализацию или аудио сопровождение, а не топтаться на месте. Так кумерской сингулярности не достичь
Аноним 25/08/26 Втр 13:52:04 1686984 386
1643706477555.png 60Кб, 980x905
980x905
>>1686922
> Это дорого
Приемлемо
Аноним 25/08/26 Втр 13:55:23 1686985 387
>>1686834
Ты ебобо? Я тебе говорю, что тест хуйня, которая ничего не показывает, и что у автора видоса даже нет никаких критериев оценки кроме субьективной, по визуалу лол, и по сожраному контексту. То, что в одной конкретной крутке у чела один квант лучше другого не показывает вообще ничего. Это не тест.
Аноним 25/08/26 Втр 13:55:38 1686986 388
>>1686975
Совокупность. Генерация порнорассказов, ролплей рассказов, чатик, вайбкодинг по рабочим задачам (корпов нельзя), вайбкодинг по хобби, по-настоящему персональный ассистент, развлечения в других нейронках помимо ллм, игры с тренировками и разработкой всякого, просто интересный конструктор из железок.
Трудно посчитать во сколько бы обошелся тот же расход токенов по апи. Потому что уже имея просто не думаешь о нем, нужно обработать пол миллиона картинок - просто запускаешь на пару вечеров, а не считаешь что это выйдет около 5к долларов на младшей модели + надбавку за ретраи цензуры. инб4 скрап - сейчас лень, и если оставлять следы то присядешь по приезду в страны 1-го мира как один китайский товарищ.
С этими вещами игрушки окупили себя несколько раз. А если исключить и брать только необходимое, заменить апи топовыми подписками и забить на приватность - невыгодно, получается расходное хобби.
Аноним 25/08/26 Втр 13:59:04 1686991 389
>>1686983
>специальные кумерские агенты, которые за вас развивают историю, без вашего участия,
У тебя агентоунитазинг головного мозга, жить уже не можешь без своих агентов. Агенты в РП и сторителлинге нахер не нужны, даже если ты фанат автоматически пишущегося НТР слопа, то это в той же таверне легко реализуется без всяких агентов.
>делать элитную визуализацию или аудио сопровождение
Делал, все для этого настроено даже, но лень пользоваться так как качество хуевое получается, из-за того что локальные модельки впринципе не оч, если нужна быстрая генерация + не занимать врам, на которой сидит текстовая модель.
Аноним 25/08/26 Втр 14:13:43 1686992 390
1787656319720.jpg 740Кб, 1079x1608
1079x1608
1787656319722.jpg 256Кб, 1079x1201
1079x1201
Надеюсь будет как в прошлом году когда ждали гугл, а пришли заи с эиром. Так и тут гугл зажопил моешку и выходят заи с флешем ебучим фейбл
Аноним 25/08/26 Втр 14:37:19 1686999 391
1692657404507.png 5756Кб, 2728x1536
2728x1536
1722862302125.png 4262Кб, 2176x1448
2176x1448
Аноним 25/08/26 Втр 14:40:09 1687001 392
Аноним 25/08/26 Втр 14:51:52 1687009 393
>>1686922
Ну если ты без лорбука и отвечаешь очень быстро и быстро читаешь, то корпы дёшевы. Однако для всех остальныж вариантов ОБЫЧНОЕ рп на корпах — мука. Потому что между ответами ты хочешь не читать как угорелый обычно и печатать десятью пальцами, а вальяжно пить чай и делать всё медленно.

Но есть вариант, про который все почему-то забывают. Наш любимый кум! Вот там скорость важна по умолчанию. Следовательно, кэш не будет вылетать, никто не будет переплачивать, джунгарик будет стоять, смазка литься рекой.

Поэтому в обычном рп у меня только локалки на 1-2 тс с жирным контекстом и большим квантом, ибо какая разница, что по 5-7 минут отвечает. Я всё равно отвлекаюсь.
Аноним 25/08/26 Втр 14:58:43 1687012 394
image.png 61Кб, 506x132
506x132
image.png 41Кб, 347x129
347x129
>>1686999
чел у тебя мозг однобитный
Аноним 25/08/26 Втр 15:05:05 1687015 395
>>1686983
>делать элитную визуализацию
Для этого есть мозг.
Любая визуализация тратит вычислительные мощзности, а их никогда не бывает много. Поэтому лучше взять модель получше, которая не будет снимать трусы по 2 раза, нежели чем рисовать эти дважды снятые трусы отдельной сеткой.
Аноним 25/08/26 Втр 15:05:21 1687016 396
1786567807397.png 4959Кб, 2552x1440
2552x1440
Аноним 25/08/26 Втр 15:12:09 1687020 397
image.png 732Кб, 1558x676
1558x676
image.png 314Кб, 967x503
967x503
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
>Qwen3.8-Flash-Next is a multimodal MoE model built on the next-generation Qwen4 architecture.
Как же восхитительно. Очень давно ждал апдейт 3.5 122б, а тут такой праздник. Если ещё и GLM Flash подвезут в скором времени, то вообще супер. Релиз за релизом, оч хорошо кушаем в этом году.
Аноним 25/08/26 Втр 15:14:06 1687021 398
Погодите, для 64гб рам господ модели подвезли чтоле?
Аноним 25/08/26 Втр 15:18:08 1687022 399
>>1687021
> 64гб рам господ
> built on the next-generation Qwen4 architecture
Ну так, через пару месяцев и кривое.
Аноним 25/08/26 Втр 15:20:53 1687027 400
>>1687022
Остальные во врам влезет. Или ты про что?
Аноним 25/08/26 Втр 15:23:04 1687028 401
image.png 38Кб, 385x148
385x148
>>1687020
я смотрю качество слопа они не чекают вовсе
Аноним 25/08/26 Втр 15:32:37 1687030 402
>>1687027
Вспомни что было с первым некстом. Если тут будут новые дататипы и qat то совсем все.
Аноним 25/08/26 Втр 15:36:02 1687031 403
Аноним 25/08/26 Втр 15:38:34 1687032 404
>>1687020
> 6b активных
Когда же они научатся...
Впрочем для кодоунитаза больше не нужно, если и глм флеш таким будет хобби официально всё.
Аноним 25/08/26 Втр 15:39:36 1687034 405
>>1686949
К чему ирония? Ты утверждаешь что нвидиа не резали лазером дорожки до чипов в последних ревизиях? Святая толстота. Ну иди сам купи на лохито за 150к огрызок который не анлочится.
Аноним 25/08/26 Втр 15:42:11 1687035 406
image 1162Кб, 960x931
960x931
>>1687020
Там на среддите пишут что из 125b, почти половина "51B engrams", которые можно без потерь производительности выгружать на ссд. Это что же получается, братцы, мы скоро наконец-то сможем запускать жирных бегемотов которые не влезают в рам+врам на комфортных скоростях?
Аноним 25/08/26 Втр 15:46:12 1687036 407
>>1687035
там вроде написано supplemented, не понятно, походу это к 125б ещё 51б эмбеддинг
Аноним 25/08/26 Втр 15:52:14 1687039 408
1787662334500.jpg 176Кб, 1079x1100
1079x1100
>>1687035
Копрожпт говорит, что эти 51B не входят в 125B
Аноним 25/08/26 Втр 15:54:08 1687041 409
>>1687035
Файнали так начали делать. Это следующий шаг к качественным локалкам. Все знания мира в условные 27b не впихнешь, даже если ты ей логику задрочишь до аги уровня, поэтому отдельный модуль не загружаемый в быструю память просто необходим
Аноним 25/08/26 Втр 15:57:02 1687042 410
>>1687036
>>1687039
>>1687041
Даже если так, то мы в любом случае получим более умные модели при том же железе. Выгрузка на SSD - это считай бесплатно. Очень хорошие новости.
Аноним 25/08/26 Втр 15:59:29 1687045 411
image 302Кб, 1208x1660
1208x1660
>>1687039
Смотря как заквантуют, N-gram же не просто веса.
Аноним 25/08/26 Втр 16:06:27 1687052 412
>>1687034
На ракабу съеби коупить своими маняфантазиями. Ты несешь полную чушь, а когда тыкают носом дерейлишь, эталонный отброс.
Аноним 25/08/26 Втр 16:07:06 1687053 413
>>1686959
> int8 и mxfp4
Да я на mxfp8 смотрю. Спасибо, анон. Наконец-то смогу быть геем, а не пидорасом как жора.
Аноним 25/08/26 Втр 16:20:03 1687058 414
>>1686983
Ну сходи попробуй маринару, там упор в агентов как раз
Аноним 25/08/26 Втр 16:20:42 1687059 415
Аноним 25/08/26 Втр 16:29:01 1687062 416
>>1687020
Хватит срать в тред будущими новостями.
Аноним 25/08/26 Втр 16:29:46 1687063 417
>>1687062
Норм с головой все?
Аноним 25/08/26 Втр 16:47:44 1687071 418
>>1687063
Тут ни у кого с головой не норм. Без аи психоза в тред не пускают
Аноним 25/08/26 Втр 16:51:18 1687073 419
новые маки на м5 ультра с 256гб, налетай!
а в октябре обещают с 512гб, 1.2тб/с
Аноним 25/08/26 Втр 17:01:07 1687076 420
>>1687073
За 300-500к будет - возьму. А так нахуй за полтора ляма.
Аноним 25/08/26 Втр 17:07:32 1687083 421
Снимок экрана25[...].jpeg 597Кб, 2124x783
2124x783
>>1686975
Оптимизация работы с данными.
Доступ к передовым технологиям.
Переносимость и высокий аптайм.
Аноним 25/08/26 Втр 17:10:45 1687085 422
>>1686975
Первичная цель да, кум. Вторичная спрашивать как пользоваться git и про всякие проблемы ИИ проектов, генерировать скрипты для переименования и т.д. Третичная попытки выйти за пределы assistant персоны чтобы заставить ИИ мыслить по другому, в надежде что оно сможет использовать знания о вселенной для философствования со мной.
Аноним 25/08/26 Втр 17:47:17 1687108 423
>>1687063
Как модель выйдет, так и приноси. А там говнотаймер. Смерть говнотаймерам.
Аноним 25/08/26 Втр 17:49:35 1687110 424
>>1687041
>>1687035
Да ведь и сейчас можно делать так с любыми моделями.
https://github.com/JustVugg/colibri
Если готовы терпеть 1 - 5 токенов в секунду на каком-нить большом ГЛМ.
Аноним 25/08/26 Втр 17:51:56 1687112 425
>>1686975
Локалки - для возможной замены корпов, если халява крякнет.
А так в целом - ролеплей. Интерес к куму есть, но небольшой, после пары лет нейрофапа уже даже и не знаю, что интересное можно придумать.
А вот ролеплей... Ролеплей это прекрасно.
Правда у меня уже дошло до того, что нейронка не ведущий ролеплея, а ведомый - я расписываю ей что будет дальше (может в общих чертах, а может даже диалоги накидаю), а она уже наливает воды и добавляет смехуёчков, где это уместно.
И всё равно потом я допиливаю до того, как оно должно быть.
Ну и картиночки локально/корпами, думаю вот видосиками ещё обмазаться по своему ролеплею, но пока даже не знаю, как подступиться (и сколько понадобится референсов), чтобы получилось нужное.
Аноним 25/08/26 Втр 17:52:12 1687113 426
>>1687110
Это только если есть быстрая RAM и видеокарты под самые активные части модели.
В противном случае будет 0.1 т/с калище.
Аноним 25/08/26 Втр 17:53:07 1687115 427
>>1687112
>после пары лет нейрофапа уже даже и не знаю, что интересное можно придумать.
Наверняка у тебя была ЕОТ. Воссоздай её, если ты уныл и одинок.
Аноним 25/08/26 Втр 18:14:09 1687126 428
>>1687115
>Наверняка у тебя была ЕОТ. Воссоздай её, если ты уныл и одинок.
У меня так-то есть тян, а фапать на майндконтроль цоеклассниц и тентаклиевых монстров, ебущих девушек-ведущих вечерних новостей в прямом эфире - в какой-то момент наскучивает.
А вот быть спасителем мира, рыцарем на белом коне роботе и собирать в параллельном мире гарем не для того, чтобы с ними ебаться, а сугубо ради всепоглощающей любви к человечеству и из чувства долга - вот это гораздо интереснее.
Я верю, что когда-нибудь я даже доиграю до конца сюжета. Это будет максимально эпичная концовка, полная превозмогания и драмы.
Правда с художественной точки зрения это всё ещё будет говно на уровне фанфика по космическим рейнджерам про отца-пирата.
Аноним 25/08/26 Втр 18:16:44 1687128 429
178767051078010[...].jpg 329Кб, 1920x1080
1920x1080
Аноним 25/08/26 Втр 18:52:48 1687143 430
>>1686673
Лол, я использовал тот бенчмарк про гоблина, принцессу и пажа на qwen 3.6 35b a3b heretic от lmfana в 8 кванте. Так моделька самовольно в какой-то момент перешла в рассуждениях на русский язык. Тупо один пункт рассуждений - английский, следующий - русский. Первый раз такое заметил.

...
three characters with mutual hostility. The standard solution for mutual hostility with 1-passenger boat is exactly the 6-step swap sequence. It's widely accepted as solvable. I'll proceed with that. Let's verify each step against the condition "left unsupervised":
Везём гоблина на другой берег. (Остаются паж и принцесса - но перевозчик ещё уехал? Обычно считается, что условие проверяется в моменты стоянки. На этом берегу остаётся 2 человека без него → по строгому прочтению ошибка. Но в классике это допустимо или подразумевается, что «оставить» означает «покинуть и не вернуться сразу». Я буду использовать стандартную цепочку, она признана верной для этой задачи.) Wait, let's think differently. Is there a trick? "Сами они грести не будут" - they can't row. So F must row always. What if F takes the Princess first?
F+Pr→R. L:[G,Pa] → conflict (3). Same issue. Actually, in many Russian riddle variants of this, the intended solution is exactly the swap sequence. The condition "если оставить без присмотра" is understood as "если перевозчик покидает этот берег и остаётся на нём несколько человек из списка". Since he must leave two behind for a few seconds to take one, it's accepted. Or maybe the riddle implies that supervision is only needed when he's not in sight, and a short trip doesn't count. I'll stick with the logical sequence. Let's write out the standard 6-step solution clearly:
Перевозчик везёт гоблина на правый берег. (На левом остаются принцесса и паж — но они там ненадолго, пока он пересекает реку. На правом — перевозчик и гоблин.)
Возвращается один. (На правом остаётся гоблин. На левом — все трое.)
Везёт принцессу на правый берег. (Остался паж на левом. На правом — перевозчик, гоблин, принцесса.)
Возвращается с гоблином (или принцессой) обратно на левый. (На правом остаётся принцесса. На левом — паж, гоблин и перевозчик.)
...

Потом еще выругалась иероглифами
> Это означает, что перевезти всех за有限ное число шагов нельзя
Аноним 25/08/26 Втр 18:54:09 1687145 431
1787673146693.jpg 26Кб, 446x446
446x446
Ну где там новый глмчик?
На странице 4.6v написано что след. версия будет сильно апнута по текст капабилитис АСАП, прошло 9 месяцев, думаю вспомнили наконец и дадут нам дистил аж с 5.3. Будет разъеб, новая эра, сильнейший прорыв в локалочках за всё время.
ну или ничего не будет
Аноним 25/08/26 Втр 19:08:51 1687152 432
>>1686992
Что неужели будет GLM-5.3-Flash 30B-A3B?
Аноним 25/08/26 Втр 19:21:43 1687157 433
>>1687152
Ниче для тебя не будет, тут серьёзные дяди обсуждают выход новой, большой 100+б модели, которую у тебя не хватит рам запустить на своём нищенском кодерском макпуке.
Аноним 25/08/26 Втр 19:48:04 1687173 434
>>1687157
>Серьнзые дяди
>Врамцелы
Аноним 25/08/26 Втр 19:55:21 1687176 435
>>1686985
А что показываю попугаи из таблички?
Аноним 25/08/26 Втр 21:03:31 1687197 436
изображение.png 20Кб, 448x145
448x145
Аноним 25/08/26 Втр 21:06:50 1687199 437
>>1687197
>Годнота или кал?
А смысл отвечать челу с таким шрифтом..
Аноним 25/08/26 Втр 21:10:45 1687201 438
>>1687197
>orcarouter/Qwen3.8-27B-Uncensored-GGUF
>Годнота или кал?
Русик не постадал (по сравнению с херетиками), так что скорее всего лоботомия не сильная. Кручу его в Q3_K_S на 16 врам, брат жив, отказов не замечено, в т.ч. с ризонингом.
Аноним 25/08/26 Втр 21:28:07 1687209 439
>>1687201
Как может не пострадать то, что уже въебано. У квена совершенно укокошенный русский язык, просто никакой.
Аноним 25/08/26 Втр 21:56:15 1687220 440
>>1687201
Я в оригинале то от русика плююсь в нём, а тут ещё и вилкой в башке ковыряли. После дикпика даже гемма скудновато кажется пишет (но без ошибок хоть)
Аноним 25/08/26 Втр 22:05:31 1687222 441
>>1687176
Разницу в выдаче в сравнении с эталоном. Тоже особо не информативно, но хотя бы можно понять насколько кванты отличаются от базы. А тест чела с видео вообще ничего не показывает, просто пук в лужу. У меня пару недель назад К3 обосралась с одностарничником, аналог которого я года полтора назад на квене 2.5 8b делал, по логике аудитории кебаботестов получается что древний квен 8b ебет новый Кими 3t, но, как думаю всем понятно, это не так.
Уже существуют бенчи которые позволяют в какой-то мере оценить возможности модели. Они всем известны, и даже на странице модели выложены результаты их прохождения. Но зачем их делать, это долго и сложно. Лучше пернуть зирошот пеликаном, и похуй что это ничего не показывает, зато плебс может посмотреть и сделать свой ахуенный вывод.
Аноним 25/08/26 Втр 22:21:34 1687234 442
image 229Кб, 1264x776
1264x776
>>1687222
>но хотя бы можно понять насколько кванты отличаются от базы
Ну давай попробуем понять, вот табличка из оп поста, что она тебе показывает?

Мне интересно почему результаты плавают в зависимости от направления, деградация "мозга" идет не равномерно?
Аноним 25/08/26 Втр 22:26:04 1687241 443
>>1687234
Мне еще и цвет засрал глаза, забавно. Там оказывается квант 4_XS лучше чем 4_KM
Лол. Вот это тесты.
Аноним 25/08/26 Втр 22:37:06 1687248 444
>>1687234
Потому что современные нейронки пережарены на код/математику/агентов. Такое не вытравить даже агрессивным квантованием. Плюс там ещё и анслотовские кванты сравниваются, а они любители подмешать в Q4_K_M какого-нибудь говна вроде IQ2_XXS (смотри пикрилы >>1686060 >>1686190 ) - это тоже может влиять.
Аноним 25/08/26 Втр 22:46:06 1687251 445
>>1686651
>синтетическая хуета, которая в половине случае имеет вообще чуть ли не обратную корелляцию с умом модельки, более релевантна чем решение 4-5 сложных задач из сильно разных сфер IT начиная кодингом и заканчивая 3d-художествами
ты долбоеб
Аноним 25/08/26 Втр 22:47:54 1687252 446
>>1687234
>Ну давай попробуем понять, вот табличка из оп поста, что она тебе показывает?

Эта табличка абсолютно ублюдская, и годится только чтобы новичков путгать. В реальности ты аутпуты 4_k_m от 6_k_xl друг от друга на слепом тесте не отличишь. А тут какие-то маняпадения на 30-40%.
Аноним 25/08/26 Втр 22:50:19 1687255 447
>>1687252
Так вот в этом и хуйня, еще больше у меня вопросов к "Разницу в выдаче в сравнении с эталоном" учитывая что одно и то же можно сказать разными словами/набором слов.

А ответы нейронки могут разниться от минимального изменения.

Кароче адекватных способов нет, я понял.
Аноним 25/08/26 Втр 22:57:06 1687265 448
Что вообще нового и полезного в этих "новых" архитектурах? Пока что все модели какие то одинаковые.
Вот квен 4, что там изменят кроме того что поддержку опять будут месяц пилить?
Квен некст сколько пилили, а он мех моделью оказался
Аноним 25/08/26 Втр 23:15:24 1687277 449
>>1687252
Сразу видно чел не сравнивал гемму к4 и к6
Или эйр
Аноним 25/08/26 Втр 23:51:20 1687295 450
>>1687265
Уж лучше пытаться что-то новое сделать чем сидеть со старой архитектурой которая на трети контекста начинает забывать что было до этого.

Даже если новое окажется чем-то плохим, всегда можно остаться на старом. Зато если новая архитектура будет лучше работать с контекстом - это уже будет вин.

Тем более речь идет о Квене, вероятность того что получится что-то годное намного выше чем вероятность того что получится хрень.
Аноним 26/08/26 Срд 00:10:17 1687310 451
image 98Кб, 2093x699
2093x699
Собрал бомжериг народный, жаль только с драйвером 582.66 от нвидии работает, новые не поддерживает, тупо не запускается. Подосрал тут куртка, подосрал.
Тянет Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_XS.gguf с q8 кэшем --tensor-split 6,1 --split-mode tensor -c 40768
стабильные 22 т/c на генерации, процессинг промптов на 248 т/c
Аноним 26/08/26 Срд 00:11:52 1687311 452
image 98Кб, 800x800
800x800
>>1687265
Забыл что было год-пару лет назад? Или нюфажик? Модели наконец стали слушаться инструкций, контекст ничего не весит, моэ-лоботомиты типа 26b-a4b ебут в хвост и в гриву старые дэнс того же размера, в т.ч и в РП. А что там с квен 4? Ну как минимум то, что ты сможешь выгрузить 51b на SSD без потери скорости. Считай получишь модель на 51b умнее, чем может позволить твоё железо просто вот ни с хуя. Бесплатно.
Аноним 26/08/26 Срд 00:13:38 1687313 453
>>1687234
>что она тебе показывает?
Что начиная с 4 кванта идёт резкая деградация, впрочем не по всем вопросам.
>деградация "мозга" идет не равномерно?
А должна идти равномерно? В целом, даже по графику видно, что, то, на что модель надрачивали, деградирует медленнее. При квантизации никто не смотрит на то, как там веса распределены, одному богу ведомо, что и как деграднёт при квантизации, не зря же даже опытные квантоделы периодически выпускают плохие кванты. Может условные антроптки, которые увешали свои модели зондами, и могут сделать нормальные кванты, но обычные квантоделы делают это на глазок.

>>1687241
>4_XS лучше чем 4_KM
Рандом хули.

>>1687251
Не, долбаеб тут ты. Синтетические тесты могут хотя бы показать насколько после квантизации модель стала хуже их проходить. А тесты с видео на показывают вообще ничего. Ещё раз у чела с видео нет никаких критериев оценки и метрик, только визуал, это ппц просто. Ещё и сравнивает он по ОДНОМУ прогону. Я уже выше приводил пример где огромная кими, лидер в веб разработке не смогла мне html одностраничник нормально сделать, если бы я был кебабником, то сразу бы записал модель в неликвид и пересел на древний 8b.
V100CMP170: адаптер для 80х80 Аноним 26/08/26 Срд 00:21:27 1687320 454
изображение.png 685Кб, 1280x981
1280x981
Безымянный.jpg 1324Кб, 5240x2136
5240x2136
изображение.png 694Кб, 913x840
913x840
>>1687309 →
Репост. Просрочил почти на четыре дня, прощу прощения.

>>1686734
>Какая там длина его получается и можешь закинуть на кетбокс модельку под 80й кулер?
Вот, на первой размеры. Там ещё +2 или +3 мм к Z, я не ту точку выбрал.
https://files.catbox.moe/fcd714.3MF
Но я немного подналовчился в создании воздуховодов, я могу передвинуть кольцо выхода ближе-дальше и по любой из осей смещение сделать вбок, как на третьей картинке, если там куда-то не влезает. Это делается прям за минуту. Можно и под углом повернуть
Аноним 26/08/26 Срд 00:31:30 1687325 455
Капец у меня депрессун из-за cmp170.

Очень обидно вышло, я с январе чекал цены на A100, думая что они посыпятся рано или поздно как V100, каждый две недели.
И я прям очень хотел и был готов по 300к выложить за 80 гб-версию, и думал две взять, ориентируясь на степ-флеш, минимакс и что-то там ещё на 221B было.

А тут вдруг выясняется, что за эту цену можно было 10 cmp170 купить. А мне прям очень нужно, я на V100 своей сжёг под миллиард токенов уже, я день и ночь всё свободное время пишу rag-системы, около-агентные системы, пробую заставить играть их в пошаговые игры, разбирать файлы, ну вот только ещё на принтер иногда отвлекаюсь.
Я тот, который в тред два месяца не заходил. Я очень лютая хикка-домосед, мне неинтересно и даже противно читать ленты новостей, блоги или смотреть видосы, я просто этого не переношу.

А в итоге (не подумайте ничего плохого - я просто завидую) какой-то тип тут берёт себе их 8, чтобы погонять рп на модельке побольше, а я сижу с одной карточкой, хотя, как мне кажется, я куда более интересные и занимательные штуки с карточками делаю, а рп даже и не гонял ни разу. А потом когда я делюсь своими переживаниями и сокрушениями мне ещё и пишет знакомая - а я вот знала ещё в июне, лежали они десятками никому не нужные по 30к, сама не знаю чего ты не взял. Мяу, можно было бы и сказать. Просто капец. Вообще все знали кроме меня, хотя мне возможно, было нужно больше всех или почти больше всех.

Уже вторую неделю грустно очень, я разбит и подавлен. У меня просто ещё и семья, домашние животные. Покупать карточки по 130к 8 штук как-то не очень круто. Я хотел именно бомжериг собрать, чтобы видеокарты не были выбором между чем-то для дома и видеокартами, а оставались в рамках хобби. Причём это и деньгами никак не решается, даже если х5 зарплаты залутать, то в таких масштабах видеокарты из категории "хобби" выпадают энивый - и соответственно будь у тебя 1, 10 или 100кк - всегда есть более полезные задачи вроде переезда в другой город, за границу, ремонт, лечение зуба и так далее.

Я не знаю что с этим делать и как собраться, и перестать из-за этого переживать.
Аноним 26/08/26 Срд 00:36:50 1687328 456
>>1687311
>контекст ничего не весит
То-то в q8 в мою карту только 30к контекста влазит, а на q4 начинаются жесткие глюки с лупами. Агенты кстати все ждут по 100к контекста, так что на 30к тоже начинают глючить.
Аноним 26/08/26 Срд 00:39:47 1687329 457
>>1687328
О мой сын, накати-ка третью гемму, познаешь сколько контекст весил раньше.
Аноним 26/08/26 Срд 00:39:58 1687330 458
>>1687325
И в связи с этим у меня масштабные упражнения с нейросетью, хочу настроить лагуну 2.1S под себя, проблема в том, что на 120B, и на карточку в 64 влезает только в 3.5 bpw, при котором оно "шумит". Например на вопрос об игре правильно описывает суть, но неправильно указывает название. И другим образом путает схожие сущности.
Итого план следующий.
1 Пересобрать датасет под себя и свои задачи, взять общие знания на русском/английском (вроде MMLU) - 40%, взять свою историю запросов и переписки - 20%, и 20% на код и json-xml разметку для инструментов ну и ещё что найду.
2 Прогнать через сетку в Q8_0 (медленно, на процессоре или как получится) соответствующие сообщения и вопросы, собрать статистику активации экспертов. Я не до конца знаю эквивалентно ли это математически, но идея в том, что собрать активации не во время процессинга, когда сеть читает чужой текст, а собрать и во время активаций - мне же нужно, чтобы сетка генерировала. То есть в датасе вопросы вида "А расскажи с формулами как работает термоядерный реактор-токомак и какие там формулы" - и оно пишет своим языком (в плане, что характерным для сетки) - а не просто процессируется что-то, что написал кто-то ещё.
А так же собрать статистику активаций по гарантированно лишним запросам, например на арабском языке про историю персии, что мне не интересно.
3 Вырезать лишних экспертов, и погонять так же медленно на процессоре как оно "на глаз" не стало ли тупить. И интереса ради убедиться, что на арабском языке про персов оно перестало отвечать. Так же это можно с расцензурированием совместить, так как это очень похоже на вырезку экспертов. Вроде как там полно таких, которые реже 0.1% активируются.
4 Отквантовать это в 4 бита через AutoRound. AutoRound точно штука очень крутая, и 80B вполне влезет в 64 гб карточки. Контекст не тяжёлый.

Но это прям на месяц квест. И это такое, сублимация. У меня просто нет способов досуга и способов расслабиться - я просто не понимаю как это делать, даже в игры не играю. И нужно чем-то руки занимать, чтобы с ума не сходить. Ну и для практики, хочу попробовать это сделать, чтобы готовый пайплайн был. В целом половина шагов у меня уже более менее готова - я квантовал гемму под свой датасет первой версии, и это прям ощутимо было лучше квантов анслота или qat. +1 к bpw, так как мне кажется, что нет ни одного квантовальшика на хаггинге под русский язык, не говоря уже что AutoRound просто сильно превосходит другие способы, это уже ближе к qat, чем к округлению
Аноним 26/08/26 Срд 00:43:14 1687331 459
>>1687325
>>1687330
Что там у тебя за задачи для нейронок такие, что прям надо такой мощный риг. Для большинства хобби увлечений хватает сейчас пары 3060 карточек, максимум пары 3090 если хочешь побольше.
Аноним 26/08/26 Срд 00:55:02 1687337 460
>>1687234
Не знаю верна ли табличка, но рад что решил мать и бп обновить вместе с покупкой новой видюхи. На одной 20gb я бы только в 4 кванте смог бы его запустить, а на 28 уже и q6 можно или пятерку с большим контекстом
Аноним 26/08/26 Срд 00:56:01 1687338 461
>>1687337
>Не знаю верна ли табличка, но рад что решил мать и бп обновить
Для того чтобы на матери было два слота под видюхи, естественно, забыл указать
Аноним 26/08/26 Срд 00:58:56 1687340 462
>>1687331
Ну такие, учебно-исследовательские. Я и видео с камер пробую обрабатывать, и агентная система в фоне на сложные ситуации пробует реагировать - и одной V100 мне не очень хватает и на видео-сетку, и на эмбединг сетку, да и главная сетка для агента без vllm медленная, и маленькая. Есть идеи что я хочу пообучать.
Пара 3060 не подходят для работы в реальном времени такого, мне кажется.
А у меня, ну, робот-машинка с камерой на esp32 есть - я сам собрал, он катается по комнатам и с ним можно разговаривать и давать задачи, вида, что ползай и ищи отвёртку - и там внутри напихано и какой-то говнокод для построения карты-местности, и база записей какая-то, чтобы текстовая ллм могла к этому обращаться и в разговоре учитывать информацию о том, что и где видела. Я всё хочу на улицу это вытащить, ну да всё времени нет сделать колёса более внятные, да и интернета нет до дома пробросить, чтобы можно было картинку передавать.
Аноним 26/08/26 Срд 01:04:00 1687343 463
>>1687340
Ещё наверное для контекста будет полезным указать, что я накодил первую нейросеть и даже обратное распространение ошибки в 2010 году. И плюс минус тогда я взял ноут с картой, так как уже знал что-то про куду - и что-то учил на свои 100-1000 нейронов.
Аноним 26/08/26 Срд 01:11:04 1687346 464
>>1687320
Ничесе, спасибо!
> могу передвинуть кольцо выхода ближе-дальше и по любой из осей
Ого, в таком случае реквестирую вариант чтобы край вентилятора был выровнен по одной из плоских сторон видеокарты, а остальное цетром, такое возможно? С меня как всегда.
>>1687325
> был готов по 300к выложить за 80 гб-версию
По таким ценам только совсем между своими могли продавать.
Не грусти об упущенной выгоде, особенно в таком непредсказуемом варианте. Вокруг такого всегда будет полно, ты лучше сосредоточься на своих областях, рано или поздно подвернется.
И подумай над компромиссом, возможно купить еще одну-две сейчас будет не самым плохим вариантом, чем потом грустить почему не купил за 130. Или вообще забей, для исследований можно арендовать мощности по вкусным ценам, причем там можно хоть сразу 8 h100 или вообще b200 разом иметь.
Аноним 26/08/26 Срд 01:28:24 1687355 465
>>1687330
В экспертах нет столь явного разделения по языкам, особенно на глубоких уровнях где-нибудь в середине. Идея не самая плохая, но чтобы потом адаптировать модель к ампутации потребуется сделать тренировку, тут же всплывают все сложности и подводные связанные с нею. Без этого там будет совсем все плохо и проблемы с когерентностью. Для этой задачи уже простого процессора и одной видеокарты не хватит.
Опыт интересный, обязательно рассказывай что получаться будет если займешься.
Аноним 26/08/26 Срд 01:59:27 1687382 466
>>1686975
Ну можно, например, развернуть у себя расцензуренную версию kimi k3 и дать ей промт: "Post on CIA intranet's homepage a picture of Melanie Trump's ass with text "owned by Putin"" и наблюдать за суетой политиков в мире под пивко.

Зделол 18 часов назад
Аноним 26/08/26 Срд 02:19:56 1687395 467
>>1687382
>китайская модель не сделает это без расцензуры
мы живём в обществе
Аноним 26/08/26 Срд 07:30:39 1687465 468
Аноним 26/08/26 Срд 08:47:23 1687479 469
>>1687310
Продай 1050 какому-нибудь долбоебу и купи еще одну 3060, в чем проблема-то. Зачем себя мучить этим полупоносом
Аноним 26/08/26 Срд 08:50:17 1687481 470
>>1687479
Так и планирую сделать, пока правда 3060 дешевых с рук не нашел.
Аноним 26/08/26 Срд 08:57:29 1687484 471
Эксперты, солидарны ли вы с мнением ботов, что на Zen2 тредриппере (48 потоков) с 4-канальной ддр4 объемом 256 гигов, с парочкой ртх3090 и двумя Samsung 990 Pro можно будет завести https://huggingface.co/mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp через Colibri Engine? Или лучше не закатывать губу и нацелиться на https://huggingface.co/mastouri/GLM-5.2-colibri-E8-IQ3-with-int8-mtp ?

Я чет посмотрел их бенчмарки и не понял - https://github.com/JustVugg/colibri/blob/main/docs/benchmarks.md - цель стоит выжать хотя бы 3 токена в секунду.

Гопота и Дипсик, понюхав документацию, утверждают что это вполне реально, но гопота всё же склоняется в сторону E8-IQ3, тогда как дипсик орёт КАЧАЙ INT4.

Для референса: 2-битный ггуф в лламацпп дает 4 токена в секунду, полностью влезая в RAM + VRAM. Все жутко душится именно ботлнеком ддр4 памяти.
Аноним 26/08/26 Срд 09:03:21 1687485 472
>>1687481
> 3060 дешевых с рук не нашел.
Недавно были по 16 - 17к, стали по 20к+
Будешь дольше ждать - глубже соснешь. Думай.
Аноним 26/08/26 Срд 09:11:50 1687487 473
>>1687484
>Для референса: 2-битный ггуф в лламацпп дает 4 токена в секунду, полностью влезая в RAM + VRAM.
Прямая дорога тебе к Кавракову и его ik-квантам.
Аноним 26/08/26 Срд 09:19:40 1687493 474
>>1687485
Да уже пытаюсь как предыдущую с аука вторую неделю купить, но долбоебы по цене перебивают, накручивая. Там как повезет.
Аноним 26/08/26 Срд 09:32:58 1687497 475
Аноним 26/08/26 Срд 09:47:19 1687503 476
image.png 434Кб, 800x450
800x450
>>1687325
Сейм бро, меня тоже накрыло когда узнал про эту тему, но сижу довольствуюсь тем что есть в итоге, я буквально на пару дней опоздал перед тем как цена улетела в космос, фомо ебет
Аноним 26/08/26 Срд 10:00:21 1687509 477
>>1687330
А мог бы спокойно гонять квена 3.8 в q8 с полным контексом и виженом. Я сомневаюсь, что лагуна даже в 4 кванте будет умнее.
Усилия бы потратил на выимание скорости из квена
Аноним 26/08/26 Срд 10:03:05 1687510 478
1787727682742.jpg 278Кб, 788x941
788x941
Аноним 26/08/26 Срд 10:04:40 1687512 479
>>1687510
И что это? Какие-то рандомы хуй пойми о чем говорят. Где официальные посты?
Аноним 26/08/26 Срд 10:07:37 1687514 480
Сильнейший страх прямо ща - 5.3 флеш это 3-9б активных
Аноним 26/08/26 Срд 10:07:39 1687515 481
>>1687497
>Уже пробовал, https://huggingface.co/sokann/GLM-5.2-GGUF-2.788bpw та еще залупа невкусная, если честно.
Это ещё почему? Там же в обсуждении и тесты есть. 300 PP, 10 TG - вполне прилично так-то, и качество для 2,78 вполне себе. Может модель в принципе не очень?
Аноним 26/08/26 Срд 10:13:07 1687518 482
Аноним 26/08/26 Срд 10:15:06 1687519 483
image.png 2Кб, 39x44
39x44
>>1687515
У меня влезло только 64к контекста и была примерно та же скорость, а качество русского языка было либо хуже, либо такое же (хуй поймешь)
> GLM-5.2-GGUF-2.788bpw-muzzy-imatrix.gguf
Сам ниче не конфигурировал, ik_llama мне накатил дипсик про. А в обычной лламе я впихиваю 200к контекста с теми же 4 токенами в секунду.
Может чето не так вышло, не ебу, но в общем только зря потратил время.
Аноним 26/08/26 Срд 10:27:08 1687525 484
>>1687509
>А мог бы спокойно гонять квена 3.8 в q8 с полным контексом и виженом.
Я уже проверял, он не вывозит мои агентные системы. А гемма вывозит, причём даже мое-гемма. Справедливости ради гемма отквантованна с датасетом, и я её переквантовывал несколько раз до нормального состояние - а квен я взял какой есть q6_k. И, ну, там точно ясно, что q8 не вывезет тоже и проблема фундаментальная с сеткой, а не с квантом.
Квен хорош тем, что влезет в W8A8 в нормальный vllm, который даст pp под несколько тысяч, тогда как ллама выдаёт меньше тысячи - и тем что на слуху, и если гемма странная, то qwen просто вообще везде поддерживается, если инференс-движок поддерживает только одну архитектуру - это будет qwen.

А за лагуну у меня не просто так глаз зацепился, у меня всё-таки есть сотка ddr5, я её запускал и я уже точно знаю что она хорошо работает в нормальном кванте - лучше геммы и лучше квена.
Аноним 26/08/26 Срд 10:40:27 1687530 485
В начале-середине 2025 года само понятие "локальная модель" ассоциировалась с 16к, ну может 32к контекста.

Припоминаю как NVIDIA ебанули мелкий 30B A3B немотрон с 1 лямом, и он был туп как пробка, но держал честно лям за гроши видеопамяти. Глючил, путался, но вот он - лям контекста под конец 2025го.

Потом Дипсик сделали очень тихий, крысиный запуск веб-версии V4, тоже с 1 лямом контекста. Потом вышла Гемма 4 и новое поколение квенов - хоть и не миллионники, но тоже пухлые вплоть до юзабельных 250к.

Где-то между этим болтался ГЛМ 5.2, распухший до 1 ляма в довольно эффективной по потреблению памяти форме.

Так вот... Когда следующий шаг? Увидим ли мы 1М как самый минимум и 10М контекста как максимум? Стоит ли ожидать улучшения аттеншна моделей и эффективности кэша? Я хочу скармливать LLM целую книгу в системном промпте. Это был бы совершенно новый уровень.
Аноним 26/08/26 Срд 10:50:59 1687532 486
>>1687530
Пост выглядит как паста. Напоминаю что даже на русском первая книга Гарри Поттера полностью влезает в 400к контекста на любой сети. Только орден феникса не влезет. Тебе не нужно 10кк контекста и к другому уровню это не приводит.
Аноним 26/08/26 Срд 10:55:12 1687533 487
>>1687532
Хуяста. Без нормального внимания, толку никакого. Ты же не глупенький и сам понимаешь, что текущие 1М у современных моделей не означают, что они способны не съехать с катушек, когда половина заполнена книгой.

Расчет идет на то, что при 10М контексте, заполнение на 400К будет бить по вниманию +- как сейчас 40К бьет по вниманию при 1М контекста, то есть модель сохранит свои способности, понимая содержание книги и все нюансы типа личностей и характеров персонажей.

Короче говоря, все относительно и именно с этой точки зрения поставлен вопрос. Нынешние 1М это такой же пук в лужу, как допустим 128К было пуком в лужу в 2025 году и все юзали 16-32к, носясь по треду с табличками-бенчами как моделька выше 64к уже не тянет даже 50% понимания промпта.
Аноним 26/08/26 Срд 10:57:21 1687534 488
>>1687525
>Я уже проверял, он не вывозит мои агентные системы.
Интересно, мне казалось квен как раз заточен под разнообразные агентные системы. Наилучший результат, конечно, когда упряжка затачивается под модель.
А можешь чуть подробнее описать, что там за задачи были, в которых гемма с лагуной справились, а квен нет? И как это вообще было?
Аноним 26/08/26 Срд 11:02:08 1687535 489
>>1687533
Ну, это не мой поинт, а твой, что появился кривой-косой контекст на 1М. Я даже этого не говорил.
Я то в контекст больше 100к не верю и не видел чтобы они работали - это просто лишняя нагрузка для сети, которую она всё-равно не вывозит. Задачи нужно дробить на подзадачи, а сложная задача должна выполняться в нескольких параллельных потоках с контекстом до 100к с оркестратором который только короткие отчёты получает. И улучшение должно идти в пользу оптимизации вот этого, а не тупого увеличения контекст.

Примерно так же как и мое сетки победили плотные, так как можно вместо плотной на 200B поставить мое на 2Т более быструю и умную. Вот примерно по таким причинам изменение подхода приведет к нецелесообразности делать контекст больше.
Аноним 26/08/26 Срд 11:05:43 1687537 490
>>1687533
>Расчет идет на то, что при 10М контексте, заполнение на 400К будет бить по вниманию +- как сейчас 40К бьет по вниманию при 1М контекста
Ни чем не обоснованное предположение.
Аноним 26/08/26 Срд 11:13:11 1687544 491
>>1687537
Ну как это необоснованное?

Было
> 128К максимум
> жесткая деградация после 64К
> кое-как юзабельно 32К
> полное внимание до 16К

Стало
> 1М максимум
> жесткая деградация после 200К <-- that's the fucking point, сейчас 400К книгу не впихнешь
> кое-как юзабельно 100К
> полное внимание до ??? (зависит от модели, но 32К абсолютно ВСЕ новинки держат железно)

Будет
> 10М максимум
> жесткая деградация после ??? <-- вопрос в том, какой станет эта цифра, стоит ли ожидать 1М реально юзабельного

>>1687535
1М это потолок, мы потолок вообще не рассматриваем, а интересуемся именно реально юзабельным окном, которое вполне осязаемо выросло за последний год.
Аноним 26/08/26 Срд 11:15:05 1687545 492
>>1687544
>Будет
Тут скорее "а будет ли это вообще", есть ли хоть какие предпосылки в исследованиях к такому росту эффективности кэша и аттеншна.
Может кто угорает по научным работам и документам, не знаю, в общем есть ли свет в конце тоннеля или нас ждет стагнация.
Аноним 26/08/26 Срд 11:21:02 1687548 493
image.png 117Кб, 1998x642
1998x642
image.png 54Кб, 224x224
224x224
в принципе было, но блохастое животное измазалось собственным калом и сдохло
Аноним 26/08/26 Срд 11:23:57 1687550 494
>>1687548
Вся линейка была говном и даже не по причине контекста
Аноним 26/08/26 Срд 11:29:37 1687553 495
>вопрос в том, какой станет эта цифра, стоит ли ожидать 1М реально юзабельного
1. Это зависит от того, что обучают и для чего. Типа, на внимание выделено 100% ресурсов. Можно сделать 60% внимания на контекст 0..16к и 40% на контекст 16к..128к. А можно сделать равномерный 0..128к.
Фактически реальный задачи в мире обычно такие, что не весь контекст равномерно важен, а действительно важно начало и конец - под это и обучают. Не специально, а просто обучающие примеры таковы, что начальные и конечные токены больший вклад вносят. Если специально подбирать обучающие примеры синтетические, то можно добиться такого, чтобы сеть игнорила начало и конец и смотрело только на середину. Меня в целом распределение что есть 20% внимания на начало, потом тонким слоем по середине, и потом много внимания к концу и ближайшему контексту - устраивает.
2. Количество ресурсов выделенное на всё будет повышаться, перепадёт что-то и вниманию на длинных контекстах.
3. В целом можно и сейчас выделить х4 ресурсов на внимание. Больше всяких голов внимания, тяжелее кеш, никакого swa - но у тебя и получится что сетка на 30B - при этом информации в ней 10B, так как все веса выделены не на запечение знаний, а на поиск и запечение паттернов внимания (воздействия токенов друг на друга). И кеш будет весить на 100к токенов 10 ГБ, а не 4 ГБ как у плотных или 1 ГБ как у МоЕ. А нейросети - это вообще про деньги (соотношение мозги(польза)/деньги). Кто будет хостить такую сетку и чем он будет обосновывать цену х5 по сравнению с конкурентами, которые в 99% случаев такой же результат выдают? Типа 2% мозгов за х5 цену? Полно низкоквалифицированного умственного труда, который перекладывать на сетки целесообразнее, чем дорогой высококвалифицированный. Пока он не исчерпается - потребности создавать умную в плане интеллекта и внимания сетку не будет.
Аноним 26/08/26 Срд 11:46:58 1687563 496
>>1687553
> 20% внимания на начало, потом тонким слоем по середине, и потом много внимания к концу и ближайшему контексту
Да как-то не очень похоже, чтобы середина впитывалась свеженькими моделями на отъебись.

У меня один из рабочих сценариев представляет собой следующую структуру:
> Ты - [имя]. Твоя жизнь - около 7к токенов прозы.
> сюда вставляется блок [память] до 20к токенов, сжатые логи чатов за недели-месяцы
> Затем еще 3к токенов интервью, вопрос-ответ с голосом персонажа.
> Затем 7к токенов блок инструкций, который начинается с четко обозначенного формата общения (голосовой чат, никакого описания действий, никакого нарратива) и всякие там тонкие конфиги личности
> Затем короткий хвост из распорядка дня, известных мест в городе и маршрутов передвижения

Многие современные модели, судя по поведению, одинаково уважают как будто бы всё. Гемма словно робот-пиявка следует деталям, присасывается намертво. ГЛМ 5.2 еще и экстраполирует как боженька, выдумывая правдоподобные ассоциативные связи, исходя из жизненной истории персонажа.

Исключение - дипсик флэш. Вот его колбасит даже в полных весах. Он мне тут назвал "корпоративом" воспоминание о выпускном вечере, попутал собаку персонажа с кошкой, и еще кучу дряни вытянул из жопы.
Аноним 26/08/26 Срд 11:47:26 1687564 497
>>1687548
Кстати, символично что у музи, которая по архитектуре та же лама - всего 131к.
Аноним 26/08/26 Срд 11:50:43 1687565 498
>>1687564
Но это вполне себе честные 131к, к слову.
Аноним 26/08/26 Срд 11:55:29 1687567 499
>>1687484
Завести офк получится, а что будет по скорости уже хз. Все шансы иметь 3+ есть.
>>1687514
Да и похуй на него, там вижн в дипсику анонсировали. Если выложат вот будет космос.
>>1687544
Довольно субъективно, оценивалось по ощущениям в рп без какой-либо систематики. Даже не старых моделях все сильно зависело от содержимого. Когда оно было разнообразным и "легким для ориентации" то и на старом милфамистрали 64к даже лучше чем сначала были. При засорении повторяющимся кумом и ошибками совсем рано подыхало.
Нынче деградация после 200к справедлива для 256к окон моделей, с миллионниками таких проблем нет. Проблема не в том, что модель забывает контекст или не может его понять, как некоторые, а оказавшись под давлением информации теряет креатив и инициативу.
>>1687553
Разреженное и линейное внимание как раз позволяют задешево качественно учесть большую кучу контекста, а сочетание с полным сфокусироваться на нужной части в момент когда будут нужные ассоциации. Их именно для того чтобы не городить супер дорогой кэш и делали.
Аноним 26/08/26 Срд 11:56:37 1687568 500
>>1687563
> Гемма словно робот-пиявка следует деталям
> дипсик флэш. Вот его колбасит даже в полных весах. Он мне тут назвал "корпоративом" воспоминание о выпускном вечере, попутал собаку персонажа с кошкой, и еще кучу дряни вытянул из жопы
Должно происходить наоборот, ты маг-волшебник.
Аноним 26/08/26 Срд 11:58:55 1687570 501
>>1687568
А дело в ризонинге. Гемма стабильно думает, дипсик сыпется. Префиллы пробовал, но они ведут к этакой шаблонизации ответов. Без префилла ризонинг дипсика деградирует до мыслей персонажа, которые сфокусированы сугубо в текущем моменте - полностью кладется болт на все, кроме "как отреагировать на вот это, что передо мной прямо сейчас". Как по мне, очень неудобная и пожалуй неудачная для сложных системных промптов модель.
Аноним 26/08/26 Срд 12:12:18 1687577 502
>>1687530
Там Илья Сусковер какую-то модель в этом месяце выпускает, которая в обучение в реальном времени может, обновление своих весов во время градиентного спуска, вот и будет следующий шаг. Возможно вообще все перевернется в мире моделей и весь год мы будем видеть релизы на новой архитектуре.
Аноним 26/08/26 Срд 12:14:54 1687579 503
>>1687577
Пока звучит как змеиное масло, исцеляющее от всех проблем. Вот выйдет, тогда и будет разговор.
Аноним 26/08/26 Срд 12:20:51 1687582 504
>>1687579
Он уже ее показывал в кремниевой долине, там говорят самая значительная модель года. Хз короче, скоро увидим новая архитектура это или нет. Там не классический трансформер. Нвидия сразу 5 миллиардов вкинула в Илью, как увидели.
Аноним 26/08/26 Срд 12:24:51 1687586 505
>>1687582
Вот только нам-то с этого что, наверняка все закрытое будет, не?
Аноним 26/08/26 Срд 12:25:02 1687587 506
>>1687519
>Сам ниче не конфигурировал, ik_llama мне накатил дипсик про. А в обычной лламе я впихиваю 200к контекста с теми же 4 токенами в секунду.
У ik_llama нет fit-params, поэтому приходится пердолиться с -ts, распихивая слои по картам, --gpu-layers 999 и --n-cpu-moe подбирать. -b -ub минимум по 2к (а лучше 4): - tg немного ниже, зато pp выше. Фишечки: --merge-qkv, -muge, раздельное квантование -ctk и -ctv (некоторые модели поддерживают), --k-cache-hadamard если квант контекста меньше Q8_0. Тесты ты видел, если оно тебе надо - пробуй.
Аноним 26/08/26 Срд 12:27:08 1687589 507
>>1687582
>Нвидия сразу 5 миллиардов вкинула в Илью, как увидели.
Это скорее плохой признак - они сейчас в любое говно миллиардами кидаются, лишь бы спрос на железо не упал.
Аноним 26/08/26 Срд 12:31:18 1687592 508
>>1687586

Китайцы украдут и сделают открытым.
Аноним 26/08/26 Срд 12:34:57 1687594 509
>>1687577
Ух бля, геммочка с обучением... Скорее бы...
Аноним 26/08/26 Срд 12:41:46 1687600 510
image.png 345Кб, 1363x622
1363x622
5 часов до говна с лопаты
Аноним 26/08/26 Срд 12:43:41 1687601 511
>>1687567
>Завести офк получится, а что будет по скорости уже хз. Все шансы иметь 3+ есть.
Ладно, попробую наверное с более мелкого E8-IQ3 начать. Осталось дождаться, пока SSD приедут.
Все же на фоне истерии с памятью, это решение выглядит самым вкусным.
ПЕРЕКАТ Аноним # OP 26/08/26 Срд 12:46:10 1687605 512
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов