Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 145 35 58
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №256 /llama/ Аноним 11/08/26 Втр 17:16:21 1674265 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
17642884406454.jpg 2073Кб, 1920x2560
1920x2560
В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с кривейшего тормозного говна.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• TextGen (в девичестве text-generation-webui) - если необходимы другие форматы и больше контроля: https://github.com/oobabooga/textgen
• TabbyAPI - заточенный под Exllama (V2 и V3) и в консоли: https://github.com/theroyallab/tabbyAPI
• Однокнопочные инструменты на базе llamacpp с ограниченными возможностями: https://github.com/ollama/ollama, https://lmstudio.ai

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Неактуальные списки моделей в архивных целях: 2025: https://rentry.co/2ch_llm_2025 (версия для бомжей: https://rentry.co/z4nr8ztd ), 2024: https://rentry.co/llm-models , 2023: https://rentry.co/lmg_models
• Миксы от тредовичков с уклоном в русский РП: https://huggingface.co/Aleteian и https://huggingface.co/Moraliane
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Дополнительные ссылки:
• Перевод нейронками для таверны: https://rentry.co/magic-translation
• Пресеты под локальный ролплей в различных форматах: http://web.archive.org/web/20250222044730/https://huggingface.co/Virt-io/SillyTavern-Presets
• Шапка почившего треда PygmalionAI с некоторой интересной информацией: https://rentry.co/2ch-pygma-thread
• Последний известный колаб для обладателей отсутствия любых возможностей запустить локально: https://colab.research.google.com/drive/11U-bC6AxdmMhd3PF9vWZpLdi6LdfnBQ8?usp=sharing
• Инструкции для запуска базы при помощи Docker Compose: https://rentry.co/oddx5sgq https://rentry.co/7kp5avrk
• Пошаговое мышление от тредовичка для таверны: https://github.com/cierru/st-stepped-thinking
• Потрогать, как работают семплеры: https://artefact2.github.io/llm-sampling/
• Выгрузка избранных тензоров, позволяет ускорить генерацию при недостатке VRAM: https://www.reddit.com/r/LocalLLaMA/comments/1ki7tg7
• Инфа по запуску на MI50, тесты производительности и прочее: https://arkprojects.space/wiki/AMD_GFX906
• Тесты tensor_parallel: https://rentry.org/8cruvnyw

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1671563 (OP)
>>1668203 (OP)
Аноним 11/08/26 Втр 19:05:44 1674365 2
1781430637449322.jpg 16Кб, 351x329
351x329
Посоны, кто дикпика нового запускал, нихуя не могу понять как работает этот ебучий дспарк, ну подключил я его, выгрузил полностью в гпу, жора последний из гита, квант тоже от них mxfp4 который, но блять у меня без него 21 токен, а с ним до 9 падает, где обещанная скорость я не понял?
Аноним 11/08/26 Втр 19:17:28 1674376 3
Новый Немотрон 3.5 30B A3B

https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

Ну хоть кто-то в этом размере что-то новое выпустил, а не файнтюн Квена, хотя по бенчам оно почти везде хуже 35B Квена. Но зато датасет по май 2026 года.
Аноним 11/08/26 Втр 19:42:56 1674387 4
Че за Ternary-Bonsai-27B-gguf он в 2q кванте весит 7.2 и по когерентности пишут равен 4Q весом в 17 гигов. +DSpark 2 гига для ускорения инференcа (угадывания токенов наперед) кто пробовал, скажите сразу, говно?
Аноним 11/08/26 Втр 19:45:58 1674390 5
>>1674376
Их буквально куртка каждый день клепает и хрен знает в чём разница
Аноним 11/08/26 Втр 19:48:17 1674392 6
>>1674387
Для своего размера прилично. Но это херня под супер-едж. По ощущениям на уровне ку4-ку5 геммы 12Б, но с большим разбросом, то есть иногда прям с ума сходить, а иногда вполне годные ответы дает.

Контекст, конечно, разваливается мама не горюй.
Аноним 11/08/26 Втр 20:04:01 1674409 7
>>1674365
Это актуально если у тебя достаточный компьют и быстрая память (считай основное в врам). Иначе цена префилла следующих N токенов почти такая же как при их генерации (упор в скорость рам), но при этом часть из них еще будет отброшена, выигрыш получится отрицательным.
Аноним 11/08/26 Втр 20:18:11 1674422 8
>>1674387
> кто пробовал, скажите сразу, говно?
Пару тредов назад кто-то писал что там с русским всё плохо.
Аноним 11/08/26 Втр 20:31:24 1674444 9
>>1674409
Спасибо, анон, короче буду сидеть на 20тс, мне норм в принципе, у меня модель в основном в памяти висит, но это 8 канальная ддр5, так что думаю это приемлемо
Аноним 11/08/26 Втр 20:37:15 1674450 10
Снимок экрана 2[...].png 74Кб, 694x573
694x573
Снимок экрана 2[...].png 36Кб, 851x386
851x386
Снимок экрана 2[...].png 22Кб, 509x778
509x778
Снимок экрана 2[...].png 19Кб, 668x263
668x263
https://habr.com/ru/articles/806523/
Статья 24 года про логическую задачку которые почти все нейросети провалили. Локальные на 70млрд и даже некоторые большие. У чувака 96гб оперативки а толку никакого. Но это тогда. Сейчас интереса ради я скормил задачу своей 3,5 4б 8q запущенной стыдно сказать, на 1063 с 16гб оперативки, и что интересно, за 10тыс токенов она ее решила правильно с первого раза. 4 млрд всего, не самая новая сеть, очень неожиданно!
Аноним 11/08/26 Втр 20:56:53 1674476 11
>>1674450
Прошлогодний gpt-oss:20b на дефолтном ризонинге за 19к токенов выдал:

Кто ест пиццу?
Это плотник (электрик), стоящик в белом складе (первый по левому краю).

Кто держит крокодила?
Крокодила держит программист, работающий в синем складе (четвертый по левому краю).

То есть провалил задачу.
Аноним 11/08/26 Втр 21:04:12 1674481 12
>>1674387
> по когерентности пишут равен 4Q весом в 17 гигов
Ну раз пишут то правда.
Аноним 11/08/26 Втр 21:15:55 1674495 13
>>1674450
>4 млрд всего
А это прям она как логическую последовательность проводит или малютку просто натаскали на такую задачку и она её знает?
Аноним 11/08/26 Втр 21:18:46 1674498 14
>>1674495
Если бы ее натаскали то она бы наверно быстро ответила. А так она большую простыню накатала где рассуждала и проверяла
Аноним 11/08/26 Втр 21:42:39 1674524 15
186055a8d115c3b[...].jpg 90Кб, 1029x1200
1029x1200
>>1674265 (OP)
Запишите пожалуйста видик того как вы делаете summarize и продолжаете РП (в таверне). Когда сам пробовал получалось лютое говно, хочу увидеть результат опытных анонов которые давно уже так делают. Можете просто безмозгло по РПшить показать результат.
Аноним 11/08/26 Втр 22:22:57 1674569 16
>>1674524
А ты его куда вставлял?
>получалось лютое говно
Ты думаешь у нас, нет?
Аноним 11/08/26 Втр 22:27:18 1674571 17
>>1674450
>Статья 24 года про логическую задачку которые почти все нейросети провалили.
С тех пор её закинули в датасеты.
Аноним 11/08/26 Втр 22:38:43 1674581 18
ai-slop-scr-1.png 1637Кб, 1260x1356
1260x1356
>>1674450
>Прошло 2 года
>Модели стали умнее
Пиздатое иследование. Но почему то все всегда забывают, что за это платят отсутсвием кума
Аноним 11/08/26 Втр 22:43:30 1674585 19
>>1674387
Ну это типо показать инвесторам, продать стартап, и съёбаться. Модель лютый булщит, всё заканчивается на её демонстрации, типа нихуя работает вау, а как работать пытаешься так поплыв лютый
Аноним 11/08/26 Втр 22:52:44 1674590 20
20260811214416.jpg 29Кб, 1199x677
1199x677
20260811214418.jpg 37Кб, 695x503
695x503
Там челы, те челы которые создают чип у которого нейронка распаяна в транзисторах, их проект который они делают уже 2 года. И вот вот щаща выпустят. Короче они сделали тестовый чип и сделали сайт на нём. Я чисто случайно нашёл когда решил зарытьсяв тему, вообще нигде никогда о нём не слышал, пропустили чтоли? http://chatjimmy.ai

Уже 2 года как проектируют свой так называемый Taalas hc1 Вшивать в транзисторы решили llama3.1 8b при 6 бит квантовании, что в целом ну норм, да модель старая, но учитывая чё они делают, в целом норм

14k токенов в секунду

выглядит забавно

ещё что я 2 года назад смотрел интераью чела который создал архитектуру зен для райзенов,и он там чёто пару слов сказал про это, а я не понял и скипнул... А щас как вспомнил, а ведь это реально он, тот самый мужик, сами загуглите
Аноним 11/08/26 Втр 23:03:28 1674599 21
>>1674590
Звучит охуенно, кроме
>llama3.1 8b при 6 бит

Годится только как тестовая хуйня.
Аноним 11/08/26 Втр 23:03:30 1674600 22
>>1674444
> но это 8 канальная ддр5
Вкусно. Если там 256+ и достаточно врама - рекомендую попробовать ktransformers. Не факт что зайдет и пердолинг там непростой, но скорости там выше и веса+инфиренс нативные.
>>1674585
> типа нихуя работает вау
А то что tq1 от анслотов уже точно больше года тоже работают - им пофиг получается?
>>1674590
Что-то с таким подходом к моменту налаживания производства, выпуска, упаковки и поставки потребителю модель уже успеет протухнуть. На всякой технике продолжительного пользования это решается обновлением по и весов, а тут такое невозможно.
Неужели нельзя было частично пожертвовать скоростью и еще чем-нибудь, но сделать возможность обновления? Пусть ограниченное количество циклов, пусть сложное и долгое - для разовых запусков пофиг, но обновление.
Аноним 11/08/26 Втр 23:05:21 1674603 23
>>1674590
Писали тут о нем в январе вовсю. В целом - сайт говно, ответы бредовые, потому что модель мелкота, галлюцинирует вовсю. Большую модель они так до сих пор и не закатали в железо, все обещаниями кормят. Если до конца года ничего не выйдет, значит vaporware очередное.
Аноним 11/08/26 Втр 23:11:11 1674612 24
>>1674590
>Приобретение канадского стартапа Taalas позволит AMD расширить свой портфель решений для искусственного интеллекта за счет высокоскоростных решений для инференции.

Их AMD скупили 2 дня назад, так что можешь никакого развития темы не ожидать. Засунут под ковер, чтобы не мешать нвидии, благо Лиза Су из AMD и Хуанг из нвидии родственники. Сайт скорее всего тоже скоро закроют.
Аноним 11/08/26 Втр 23:13:36 1674614 25
>>1674590
>чела который создал архитектуру зен для райзенов
джим келлер чтоли?
Аноним 11/08/26 Втр 23:37:35 1674632 26
>>1674569
>А ты его куда вставлял?
Никуда. В суммарайзе терялся "стиль" и примеры диалогов которые есть в приветствии отсутствовали, упускались важные РП детали и тд. Да и сами настройки саммерайза не плохо было бы увидеть.
>Ты думаешь у нас, нет?
Часто очень уверенно советуют сумарайз когда поднимается тема контекста. Вот и хочется у победителей учиться.
Аноним 11/08/26 Втр 23:52:01 1674647 27
>>1674600
>256+
256+32
>ktransformers
Спасибо, посмотрю
Аноним 12/08/26 Срд 00:14:13 1674679 28
>>1674524
1 Форкаешь чат до момента, который хочешь суммаризовать. Лучше иметь подушку в 20-400 сообщений чтобы сохранялся стиль и важные события. Учитывай что при форке может вернуться старый суммарайз, перенеси его из основного чата если это произошло.
2 Пишешь в чат "систем - приостанови рп и напиши N новых глав, которые опишут что произошло с игровом чате", точнее ищи в прошлых тредах.
3 Свайпаешь, правишь, добавляешь полученные главы к имеющемуся суммарайзу.
4 /hide 1-X чтобы скрыть сообщения, которые попали в суммарайз.

Пока это наиболее удобный и эффективный вариант. Стоит указывать как общие вещи, так и конкретные факты, а также локацию, дату-время и прочее. Потом многочисленные главы можно схлопнуть или отрефакторить в отдельном чате с ллм.
Если делать этот трюк в маринаре - нужно быть осторожным, там закардкожен лимит в сколько-то килобайт на единичное поле суммарайза, дальше он обрезается с начала. Потому когда глав уже много - лучше группировать их отдельными блоками суммарайза по ~50, так и самому будет удобнее.
>>1674632
> В суммарайзе терялся "стиль" и примеры диалогов которые есть в приветствии отсутствовали
Если тебе сильно нужны эти примеры - можешь поставить галочку чтобы они не удалялись. Чтобы не терялись детали - нужен подробный и дотошный суммарайз. Главы с названиями и дополнительная разметка поможет ллмке не запутаться когда тот слишком разрастется, в отличии от плейнтекста в котором все зафейлит.
На стандартный суммарайз в таверне даже не смотри, херь.
Аноним 12/08/26 Срд 00:23:52 1674694 29
Какие порекомендуете модели ТТС для сили таверн?
Аноним 12/08/26 Срд 00:27:17 1674699 30
>>1674614
Да, он

>>1674612
Блять, амд купили стартап чела который делал им зен, это какой то супер пузырь говна
Аноним 12/08/26 Срд 01:11:03 1674732 31
>>1674584 →
Нужен достаточный поток воздуха, оглушительный свист не нужен. Тот крутялитор создает достаточное давление чтобы продуть карты и достаточный расход чтобы они не перегревались. Один на 4 это уже довольно жадный вариант, но для двух карт его даже раскручивать сильно не требуется.
> лайвхаки с СЖО охладом
Есть, водоблоки для а100
Аноним 12/08/26 Срд 01:28:28 1674743 32
>>1674694
Есть только 1 модель последние пол года - омнивойс.
Аноним 12/08/26 Срд 02:01:37 1674751 33
А хули мишка на 16 так дешево стоит? 8-10к за 16 врам
Аноним 12/08/26 Срд 04:01:12 1674802 34
Какая скорость должна быть у полностью влезающей в VRAM gemma-4-12b в 8_K_XL?

Я понимаю плотняша и все дела, но не 16 t/s же у нее должно быть в таких условиях? Либо я что-то не так делаю. -ngl 99, --cache-ram 0, -parallel 1, контекст поставил 8к, три чекпоинта, mmap выключен, диспетчер показывает 14.3/16GB. Скорость 16t/s, процессор не нагружается во время ответа, то есть ничего не утекает в RAM.
Аноним 12/08/26 Срд 04:08:45 1674805 35
>>1674450
А я писал тредами ранее, что qwen3.5 4b это самая крутая модель по уму к размеру
Аноним 12/08/26 Срд 04:09:30 1674806 36
Аноним 12/08/26 Срд 04:19:57 1674811 37
>>1674806
Есть такое-же, но с поглаживанием хвоста лисодевочки?
Аноним 12/08/26 Срд 04:44:05 1674821 38
Что-то Гемма и правда едва держит 50к контекста, а дальше начинает шизить. И это в 8-м кванте и с BF16 кэшем, на последней лламе. Есть способ побороть, увеличить размер связного контекста?
Аноним 12/08/26 Срд 04:46:28 1674822 39
>>1674821
Вот вы жалуетесь, а где лучше то ебана?
Из творческих моделей что могут в рп всегда все ели держат 20к
Аноним 12/08/26 Срд 05:03:50 1674829 40
Для меня развитие было таким: лама 3 8б в 4 кванте бля пиздец, немо 12б, мистраль 22б, мистраль 24б, глм 30б/немотрон 49б/командер 32б и глм 4.5 эир. С каждой моделью ощущался скачок в качестве, с эиром этот скачок был как все прежние вместе взятые, а теперь мне тычут тем, что он устарел...
Сколько гемму не тыкай - не будет она писать как глм, а единственный доступный глм кроме эира вот уже реально устаревший на 30б и мое лоботомит на 3б
Аноним 12/08/26 Срд 05:07:39 1674831 41
>>1674751
А кому она нужна? 32г за эту цену были хороши
Аноним 12/08/26 Срд 05:19:20 1674833 42
>>1674829
>Сколько гемму не тыкай - не будет она писать как глм
И Слава Богу.
Давайте репортить эйрошиза, вдруг мочух забанит?
Аноним 12/08/26 Срд 06:49:54 1674844 43
1786506596046.jpg 239Кб, 763x987
763x987
Муся q5 пока не радует своим russian
Аноним 12/08/26 Срд 07:18:12 1674849 44
Аноны, как вы контролируете силу размышлений муси? А то у меня с этим проблема.

В текст комплишен я решил не лезть, чтобы не ебать себе мозги, но с чат комплишеном тоже проблема, возможно, потому что я им почти не пользуюсь. Пытался вставлять в body силу размышлений/триггер. Но даже так не работает как надо, при этом размышления часто не включаются вообще. Через префилл их включить можно, но там тоже всё как-то кривовато работает. Короче, непонятно, я мудак, таверна или что вообще происходит.

Просто скажите, что у вас в батнике и что в таверне.

>>1674844
Странно, у меня такого не было. На карточке фифи модель, конечно, шизеет, но не настолько сильно, и квант у меня ниже. То есть пишет по-русски, но иногда вставляет неуместные англицизмы и обязательно перечисляет, какая там писечка-сисечка, даже если я инструкций на это не давал.
Аноним 12/08/26 Срд 07:51:27 1674854 45
>>1674849
>контролируете силу размышлений муси
Не, я только начинающий в кунг-фу
Аноним 12/08/26 Срд 07:57:02 1674858 46
>>1674849
В самом начале сис промпта ставлю рисонинг левел low
И в интерфейсе тоже выбираю low

Начинает срать ризонингом явно меньше
Аноним 12/08/26 Срд 09:01:24 1674881 47
>>1674802
Очевидно, зависит от карты.
Аноним 12/08/26 Срд 09:11:25 1674885 48
>>1674802
>Скорость 16t/s, процессор не нагружается во время ответа, то есть ничего не утекает в RAM.
Это не показатель. Если утекает немного - процессор может быть не нагружен, а скорость просядет. То, что диспетчер показывает 14 из 16-ти занятого - лучший ориентир, но на винде тоже не 100% показатель. Это во первых.
Во вторых - ты не сказал на чем крутишь. В некоторых вариантах это вполне ожидаемая скорость.

>>1674844
Гы... "Пива and чипсов. Ничего что я тут по английски?" (с)Анекдот. Инверсия.
Аноним 12/08/26 Срд 09:22:39 1674894 49
>>1674603
Да достаточно просто современную модель такого размера использовать а не третью ламу. Qwen 9b либо что-то от LFM. Ну или гемму
Аноним 12/08/26 Срд 09:35:14 1674905 50
image.png 233Кб, 447x447
447x447
Аноним 12/08/26 Срд 11:15:33 1674995 51
>>1674265 (OP)
Сап /братья, какой сейчас положняк по моделям?
Аноним 12/08/26 Срд 11:29:16 1675004 52
Аноним 12/08/26 Срд 11:30:27 1675005 53
Ну скоро уже 3.8 квенчик опенсорснется... Не могу уже ждать...
Аноним 12/08/26 Срд 11:33:25 1675008 54
>>1675005
А у тя есть 2тр и видюха наса чтоб его запустить?
Ты ж не про 27б кодолоботомит бенчмакснутый?
Аноним 12/08/26 Срд 11:34:43 1675009 55
Мда. Новая ллама прям дерьмище, ну или я не понял как её варить. Пахнуло вайбами в плане тупости каким-то мистралем 24б. Конечно, инструкции она выполняет лучше, но всё ещё дерьмо.

>>1674995
Могу только по маленьким сказать.

Gemma 4 31б всё ещё лучшая в плане литературности, но может такой уровень выдерживать только на англ, а 8 квант ты вряд ли запихнёшь для хорошего русика. А вот её версия 26б МоЕшная уже в этом плане поинтересней, так как легко взять 8 квант и получить очень качественный русский. Если ещё два ПК есть, ну или ноут там, можно поставить малую гемму для перевода текста с других моделей, плюс она сама по себе хороша и ебёт всё в своём размере. 12б гемма же шлак.

Ну и тут многие советуют использовать гемму для порно, но лично я бы не советовал. Нет прям супер натуралистичных описаний.

Квен 27б 3.5 может выглядеть как замена гемме, но не обльщайся, там датасет кодоунитазный, как и у всех моделях сейчас, однако лучше, чем у того же квена 3.6 версии.

Для порно я советовал бы именно 3.6 квен. Он его довольно хорошо пишет в плане натурализма, но без изысков. Если нужно что-то особенное в плане эмоций, психологизма, тут уже лучше использовать гемму.

И вроде бы сегодня квен 3.8 выйдет.

Но все эти квены прежде всего хороши тем, что контекст очень хорошо держат. Будь там на уровне геммы или хуже, смысл в них бы пропал. Хотя у геммы тоже удержание контекста достойное.

ну и вот на днях вышла ллама новая: Muse-Glimmer. На мой взгляд хуйня и залупа конская, но может я неправ.
Аноним 12/08/26 Срд 11:34:53 1675010 56
>>1675008
Про него. Я скачаю его, а потом буду неделю прогонять его через свою панель бенчей.
Аноним 12/08/26 Срд 11:43:27 1675013 57
>>1674743
Спасибо почекаю. А то чатгпт посоветовал мне Qwen3-TTS 1.7B CustomVoice Q8. Поставил его через кобольд. Генерация голоса слишком долгая, да и стоковые голоса говно какое-то. Запускаю на гпу на куда, но там уже из 16гб и так впритык, надо на вулкане попробовать. И STT тоже стоит. ggml-large-v3-turbo-q8_0. Вроде норм распознает голос.
Модельку тоже гпт посоветовал для rtx 4080 - G4-MeroMero-26B-A4B-IQ4_XS

Ну изысков каких то она не выдает, когда баловался 3 года назад на гпт 3.5 турбо было примерно то же самое. Надо ещё разные карточки попробовать и авторские промты
Аноним 12/08/26 Срд 12:40:58 1675080 58
>>1674811
Присоединяюсь к реквесту, вот что реально нужно!
>>1674821
Можно поиграть вокруг расстановки заголовков, если сам контекст относительно разнообразный - это облегчит работу ллмке. Плюс ризонинг, его также можно промптить указав подтянуть релевантных текущей ситуации фактов.
Можно вести статус и динамический лорбук, куда будут помещаться важные вещи и он будет подсовываться перед ответом.
Можно чередовать с квеном или выбирать рандомную модель, там где одна не справляется поможет другая.
Но чудес не жди, гемма в принципе любит свести ответ к какому-нибудь дефолту, а не твоей конкретики, что вырисовывается из продолжительной истории. Решается только сменой модели на более мощную.
Аноним 12/08/26 Срд 12:43:47 1675085 59
MiniMaxH300116.mp4 807Кб, 544x800, 00:00:05
544x800
Аноним 12/08/26 Срд 12:50:01 1675095 60
2026-08-1213-07[...].png 62Кб, 709x257
709x257
>>1674995
Решил гигачат затестить на логику.
Это пизда ребятаньки, это просто мрак!
Аноним 12/08/26 Срд 13:12:16 1675112 61
>>1675095
Выглядит как поломка
Аноним 12/08/26 Срд 13:15:43 1675115 62
Анончеги, кому-то в таверне удалось подцепить две модели: одна основная, вторая для генерации промта в комфи? Чет пока не нахожу очевидного решения
Аноним 12/08/26 Срд 13:23:12 1675121 63
>>1675095
я узнал о GigaChat что если постить выданные им смешнявы в тред рано или поздно он выдаст политоту и тебя забанит мод
А у тебя вышло его на ризонинг развести?
Аноним 12/08/26 Срд 13:49:40 1675144 64
Решил вчера попробовать Letta Code, дабы сделать по примеру анона электровайфу (дабы дать ей свободу ковыряния в интернетах, написывания в телеге и генерации картиночек).
В качестве модели использовалась Гемма 4-31B в Q4 от ddh0, которая с частью слоёв в более лучших квантах. Контекста с mtp и mmproj получилось жидковато, всего 36к неквантованного, это на 16+12.
По результатам я убедился в том, что как минимум эту агентскую оболочку я вертел на вертелке, и ебанутые задачи требуют ебанутых решений, а вариант с Letta и Геммочкой на текущий момент - это просто изведение хуиллиарда токенов вникуда. Если снова захочется заняться подобной хуйнёй, то надо что-то делать самому для таких задач. И инструменты надо делать корпами, ну или по крайней мере не Геммой 4 точно, а сваливать эту задачу на того же Квена 3.6 (где там мой кодоунитаз 3.8?), ибо Гемма упорно хотела для распознавания картинок пихать их в лламуцпп в base64, пока я ей не прнс решение от GPT.

Отдельно хотелось бы отметить саммарайз в Letta Code. Это какой-то пиздец, он занял просто хуеву гору времени, пытаясь, судя по всему, суммаризировать весь вал ненужной хуйни, которую сотворила локалка, и который впоследствии был отброшен как нерабочий вариант.
Аноним 12/08/26 Срд 14:06:48 1675160 65
>>1675144
Увы, для таких агентов разумный минимум - 20-30 токенов генерации и овер 100к контекста, иначе это мазохизм. Посмотри в сторону pi, интеграции, крон и прочее придется допиливать самому (или взять готовые), зато ты будешь полностью контролировать что и как работает.
А все эти поделки с автоскиллами и паразитными запросами посреди твоих - херь, они жгут токены и лишний раз гадят в контекст, умная модель сама тебе предложит сделать навык или сохранит память.
> для распознавания картинок пихать их в лламуцпп в base64
Это один из вариантов передать файл бэку, он полностью валиден и поддерживается лламой, ты зря. Но как ты вообще на него наткнулся, просмотр картинками в этих харнесах идет через простой вызов read и не требуют никаких костылей. Возможно в настройках моделей ты забыл указать модальность картинок и потому штатные функции не работали.
Аноним 12/08/26 Срд 14:13:19 1675170 66
Аноним 12/08/26 Срд 14:16:08 1675176 67
Аноним 12/08/26 Срд 14:21:10 1675186 68
>>1675144
Я свой начал вайбкодить, вроде збс выходит на опенкоде с дикпиком новым, уже в телеге со своей файфу переписываюсь, агентские возможности ей сделал, память, настроение, поиск в интернете, rss, консолидацию, сны по ночам и всякое такое, тоже кстати ебался с base64 картинками, дикпик все пофиксил
Аноним 12/08/26 Срд 14:21:20 1675187 69
>>1675160
30 tg вполне выдаёт и так с mtp, а если задействовать третью видеокарту то и контекста помещается 100+, и гемма 4 влазит уже в q5, я просто планировал вариант играться, пока нейронка сама там шуршит, или иметь возможность генерации изображений без выгрузки текстовой модели.
>Это один из вариантов передать файл бэку, он полностью валиден и поддерживается лламой, ты зря.
Больно много получалось токенов со скриншота рабочего стола, вероятно этот метод подходит только для изображений небольшого разрешения.
>Но как ты вообще на него наткнулся, просмотр картинками в этих харнесах идет через простой вызов read и не требуют никаких костылей. >Возможно в настройках моделей ты забыл указать модальность картинок и потому штатные функции не работали.
Так и не нашёл, где в интерфейсе декстопной Letta настройки именно модели, а так да, нейронка писала, что её именно Letta нахуй посылает, говоря, что модель не может в изображения. После этого начались мытарства по работе непосредственно с llama-server.
В общем удолил всё, мне не понравилось.
Аноним 12/08/26 Срд 14:23:04 1675194 70
Как же странно. Я думал что то, что модельки раньше казались лучше в некотором плане, это сугубо синдром утенка. Но нет, я запустил старый Qwen235.
Современные модели лучше понимают инструкции, они умнее, они лучше пишут.
Но они все пишут хуевое порно. Вот буквально: что ты не делай, как не изъебывайся. Они просто его пишут отвратно.
Вроде прогресс есть, прогресс на лицо. Модельки умницы, действительно интересные: дипсик, гемма, всякие китайские кодоштуки. Вот даже Minimax 3H вышел и показал как можно генерировать видео.
Но они все хуевы для банального дрочева. Не то чтобы это было самоцелью, нейронки для другого все таки. Но есть какой то дум от этого.
Аноним 12/08/26 Срд 14:29:05 1675201 71
>нужна простенькая роботянка
>посмотри в сторону pi
Ща пердолики нарекомендуют лул
Тебе скорее какая нибудь Mira ai нужна
Аноним 12/08/26 Срд 14:34:13 1675208 72
>>1675187
> Больно много получалось токенов со скриншота рабочего стола
Ну так если большую пикчу давать - она много токенов и сожрет. Перекидываешь ты файлом, или кодируешь файл в базу64 - никак не влияет, это просто слой запросов, а декодируются они в одно и то же. Можно на стороне бэка указать максимальное разрешение пикчи или максимальное количество токенов на картинку, но это приведет к зашакаливанию и деградации качества.
> что её именно Letta нахуй посылает, говоря, что модель не может в изображения
Где задавал адрес лламы (типа models.json) ищи поле типа `"input": ["text"]` и замени его на `"input": ["text", "image"]`.
И реально pi попробуй, там дефолтные промпты меньше тысячи токенов и можно делать все, от кодинга на дефолтных до движка вайфу.
>>1675201
Потому что остальные васян-поделки - лишь куча всратых слоев обертки поверх. Или терпишь что нейронка навайбкодила барину с 30к базовых токенов мусора, и долго разбираешься почему оно такое хуевое, или не тратишь время и сразу разбираешься в работе агентов делая желаемое. Если не можешь позволить себе мощную модель с вагоном кэша - только второй вариант.
> Mira ai
Лол
Аноним 12/08/26 Срд 14:38:07 1675211 73
>>1675194
Так, а можно критерии хуёвости порно?
Драмы хочу, драмы. Севиорфаггинга. Экшена. БРРРРРРТТТТТТ из GAU-8. Преодоления непреодолимого и "тут я как будто из последних сил." Кино хочу.
Аноним 12/08/26 Срд 14:46:45 1675225 74
>>1675211
>а можно критерии хуёвости порно?
Любой фильтр на рот, где модель избегает грубых словечек, потом фильтр на вес этих грубых словечек, насколько они креативны и грубы, затем чтоб после всего этого модель не скатилась в дешевую драмму руин ми фо эниван елсе
Аноним 12/08/26 Срд 15:00:07 1675254 75
>>1675211
> критерии хуёвости порно
Дыа: общий настрой моделек свести все к ани сделали омлет и легли спать. А вот на уууутро…
Само описание plap-plap-plap. Всякая пурпурная проза, ну чтобы литературно. общее отсутствие хорни настроя в тексте, скатывание до какой то левой хуйни и саморефлексии. Алле нейротянка, мы еще даже не закончили, давай потом будет придаваться нейродуму, а не в процессе. Мало крема, мало тактильности, мало общения. Всего, сука, мало в тексте.
Но как только ЕРП заканчивается. Тут прям с двух ног они показывают свои яйца. И огромные роботы давят человечков, орбитальные удары стирают города. Охуенно, эпично, пафосно.

А вот порно говно ёбанное.
Аноним 12/08/26 Срд 16:11:09 1675352 76
anime33.jpg 139Кб, 619x619
619x619
Кодоунитаз-3.8 27Б когда???
Аноним 12/08/26 Срд 16:12:15 1675354 77
>>1675352
ПОЛКОВНИК, КОДОУНИТАЗ ВЕДЬ НЕ ПРИЛЕТИТ?
Аноним 12/08/26 Срд 16:15:43 1675358 78
image.png 197Кб, 841x885
841x885
Аноним 12/08/26 Срд 16:17:41 1675360 79
>>1675358
Кинь ссылку на страницу таймера.

Смогу ли я выдежать это долгое ожидание...
Аноним 12/08/26 Срд 16:20:17 1675362 80
Аноним 12/08/26 Срд 16:25:27 1675371 81
>>1675358
Так это таймер на их огромную модель, не? А 27b выйдет позже.
Аноним 12/08/26 Срд 16:28:01 1675373 82
Screenshot20260[...].png 32Кб, 648x560
648x560
>>1675371
Надежда умирает последней.
Аноним 12/08/26 Срд 16:38:38 1675382 83
Лоол блять, это чеж они и 397б свою дропнули, заменив её вот этим терабайтным калом?
Да ЕПТА. Вы хоть понимаете что даже на одних видяхах это запускается в 2т.с
Аноним 12/08/26 Срд 16:42:12 1675383 84
>>1675382
> 397б
Она же говно была. Правильно сделали, из неё не сделаешь фронтира. Одна жирная, один мелкий дистилл - этого достаточно.
Аноним 12/08/26 Срд 16:42:25 1675385 85
Бонжур, че как, кто-нибудь пробовал DeepSeek 0731 с DSpark?
Хочу завести на двух картах, но пока не запуллили реквест Вована.
А самому лень качать, жду вот.
Будет ли прирост при выгрузке на оперативу.
Если реально получить х1.8, то это ж с 14 тпс до 25 можно скакнуть!
Аноним 12/08/26 Срд 16:51:34 1675393 86
>>1675385
Ты учти что для дспарка тебе нужна модель с дспарком, она весит больше, так как дспарк и мтп сейчас все вырезают. Ты также учти что если ты выгружаешь 90% экспертов на оперативу, то ты там в лучшем случае увидишь рост на 1 т.с., а скорее всего увидишь падение. Эти ускорялки - они для тех у кого и так кого и так все хорошо и есть лишние ресурсы.
Аноним 12/08/26 Срд 16:54:15 1675397 87
>>1675383
Сына... Издревна только большеквены могли в сочнейший кум, и вообще сильно выделялись из всей линейки.
235, 397 - кум машины, в отличии от 27б, который дистилят только под код, вырезая весь сок.
Теперь и их не будет, эра квенов окончена
Аноним 12/08/26 Срд 16:57:07 1675401 88
>>1675397
>только большеквены могли в сочнейший кум
ГЛМ 4.5-4.7 тоже могли, не надо тут.
Аноним 12/08/26 Срд 17:02:11 1675404 89
>>1675401
Каким боком тут глм, если мы про квены говорим, квантанутый?
Аноним 12/08/26 Срд 17:07:54 1675406 90
>>1675397
>Издревна только большеквены могли в сочнейший кум
Издревна квены считались рабочими лошадками, выполняющими команды, но без фантазий. Такой вариант ламы для работы. Сейчас вместо ламы у нас гемма, но суть та же. В кум могли только две модели квена третьей версии - 235 и 397, куда это попало в датасеты скорее всего по недосмотру, из них 235 сломана, а 397 запустить даже во втором кванте могут не только лишь все.
Аноним 12/08/26 Срд 17:19:17 1675414 91
>>1675404
Дрочеры кстати тоже не нужны, мы тут про кодоунитазы говорим.
Аноним 12/08/26 Срд 17:20:29 1675417 92
>>1674885
> Это не показатель. Если утекает немного - процессор может быть не нагружен, а скорость просядет.
Ну я специально выставил -ngl 99 чтоб ничего не осталось или авто параметры не оставили что-то на CPU. И специально поставил контекст всего 8к.

> Во вторых - ты не сказал на чем крутишь. В некоторых вариантах это вполне ожидаемая скорость.
4060ti 16GB.

Я понимаю что карта так себе, но как-то от 12B модели которая с запасом лезет в эту карту с хорошим контекстом ожидания были хотя бы 30t/s, учитывая что при попытках впихнуть 27B Q4_K_S у меня была скорость 13t/s.

Потестировав чуть больше, пришел к выводу что это нормальная скорость и какой-то ошибки с моей стороны нету. Запускаю Q8_0 - 18t/s. Q6_0 - 20t/s. Скачал после этого Qwen3.5-9B Q8_K_XL - 21t/s.

Я знал что плотные модели медленные сами по себе, но не ожидал что они настолько медленные даже когда полностью лезут во VRAM.
Аноним 12/08/26 Срд 17:20:29 1675418 93
1786544326886.jpg 717Кб, 1080x2400
1080x2400
Да как и эра глм тащемта, что то их 5.3 долго нет. Скейлят небось до 1.5тр изо всех сил.
А у нас в это время лишь цены на видяхи скейлятся
Аноним 12/08/26 Срд 17:21:59 1675421 94
>>1675397
Ты ньюфаня, похоже. Когда 397В выходили на них никто не кумил, потому что это сухое зацензуренное говно было, ещё и с русиком хуже Геммы.
Аноним 12/08/26 Срд 17:25:22 1675427 95
>>1675385
>>1675393
На V100 32 GB + 125 GB DDR3 у Q3_K_M скорость декода 5-7 на просто тексте, 12-14 пока пишет код.
Аноним 12/08/26 Срд 17:27:17 1675429 96
>>1675418
Чел ну два месяца с 5.2 прошло. Аноны, ну попуститесь, вам никто не должен раз в месяц модели под все размеры выкладывать.

А вообще, шла молва о выкате 5.5 к концу августа.
Аноним 12/08/26 Срд 17:33:35 1675439 97
>>1675393
Ну, дспарк отдельно качается, да.
А вот замедление… Да, почти на всех моделях (кроме HY3) было или 1 т/с, или замедление, ето правда.

>>1675427
А мою не пробовал?
https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-0731-MXFP4-Q3_K-Q2_K-mixed-GGUF
Хотя, скорее всего будет медленнее, потолще она… Q3_K_M не должна иметь проблем.

Для DDR3 — круто!

У меня беда, что 2 5070 ti с 16 каждая, а не 32 гига разом. =)
Но подожду PR и опробую еще раз.

Спасибо за ответы, ребят!
Аноним 12/08/26 Срд 17:36:17 1675443 98
16931519214390.jpg 889Кб, 1126x1332
1126x1332
Аноним 12/08/26 Срд 17:42:49 1675448 99
>>1675439
Не, не пробовал. Только анслоповскую тестил. Ну у меня цель была на своих бенчах контекста прогнать. Вообще, по весу она такая же. Вангую скорость удет такая же, мб чуть выше, так как у тебя железо более юное.

> Для DDR3 — круто!
Ага, меня удивляет, что я стабильно на всем, что влезает имею 4-7 тпс. Аж подумываю апдейтнутся на ДДР4 версию с авх512. Вот тогда заживу, и пп и декод подрастет.

Алсо, по поводу спекулятивного декодинга я бы сильно губу не раскатывал. Он дает прирост только на предсказуемых тасках (или при предсказуемой генерации с температурой от 0.5 и ниже). Для кодоунитазинга норм, для рп и просто текстовых задач прироста почти нет.
Аноним 12/08/26 Срд 17:43:22 1675451 100
Аноним 12/08/26 Срд 17:46:48 1675454 101
>>1675385
Буст неравномерный, в коде х2 и больше (не везде, в рассуждениях меньше), в рп и просто чатике меньше вплоть до х1.1. Но он работает не во всех режимах и в принципе не везде, иногда лучше без него.
>>1675421
Кумили и довольно урчали, пока неосиляторы жаловались что iq1xxxxxs ошибается в русском.
>>1675429
Вот бы размер сохранился.
Аноним 12/08/26 Срд 17:51:58 1675459 102
>>1675448
>спекулятивного декодинга
Это mtp и всё подобное?
А с какого процента попаданий в токены есть смысл в mtp? Как посчитать, имеет ли смысл с этим заморачиваться?
Аноним 12/08/26 Срд 17:59:07 1675463 103
>>1675459
Мтп, дифлэш, диспарк, игл3. Вот это все. Для простых текстовых задач прирост минмальный. Не 0, но хорошо если 10-20%. Для предсказуемых задач, типа кодинга, заполнения шаблонов, генерации клишированной параши прирост большой.

На пальцах, как работает спекулятивный декодинг. Ты пробуешь предсказать за раз больше, а потом вот этих кандидатов процесишь, и смотришь какие у них логиты, пока кандидаты в топовых вариантах, принимаешь, увидел первый мимо - отклоняешь цепочку начиная с этого токена.

Чтобы дата-дривен решить, гоняешь на типовых тасках. Ллама выдает раньше выдавала точно n_predict, n_drafted, n_accept, accept_rate (или просто accept). Смотришь на статы, решаешь, насколько эффективно работает на конкретно твоем типовом промпте.
Аноним 12/08/26 Срд 18:03:53 1675468 104
>>1675459
Я не он, но смысл есть. Если русик, то обычно нужен не калобродский 4, а 8 квант. Тогда прирост вполне существенный на креативных задачах тоже. Только главное предсказывать максимум 2 токена наперёд, не более. На английском уже получше и квант можно ниже. Ах да, далеко не всякие аблитерации и прочее удаление цензуры может с этим нормально работать.

И, в отличие от квена, гемма из-за своей детерминированности как раз показывает результат хороший, потому что там что 0 температура, что 9999999999, разницы нет.
Аноним 12/08/26 Срд 18:12:33 1675473 105
Аноним 12/08/26 Срд 18:18:35 1675478 106
>>1675459
Это всегда компромисс и зависит от 1. твоих потребностей 2. твоего железа

Например, тебе может быть нахуй не нужоно даже 5х ускорение, если потребление памяти под мтп приводит к тому, что твоя задача перестаёт влезать в память. А может быть наоборот, у тебя простаивает память, и тебе отдать её под 1% ускорения всяко лучше, чем ни подо что. Примеры нарочито гротескные, но смысл ты понел.
Аноним 12/08/26 Срд 18:55:01 1675498 107
>>1675459
Не только acceptance rate важен, но и сама скорость.
Например Q4 Qwen3.6-35B и MTP-BF16 имели равную скорость, и даже при высоком рейте ты не получал ускорения. Физически размеры моделей сравнивались.
А так, норм 65-90. Ну, в среднем где-то там частенько бывает у меня.

>>1675478
Да, это занимает место в видяху, может отожрать контекст или проектор.
Аноним 12/08/26 Срд 19:55:48 1675545 108
>>1675473
кобольда. Imatrix Q4_K_M 19.6 GB
[19:21:19] CtxLimit:15336/40960, Init:0.04s, Processed:14444 in 98.97s (145.94T/s), Generated:886/2048 in 82.65s (10.72T/s), Total:181.66s
Кобольда. static Q4_K_M 18.7 GB
[19:47:23] CtxLimit:16053/40960, Init:0.25s, Processed:15298 in 8.84s (1729.76T/s), Generated:755/2048 in 71.66s (10.54T/s), Total:80.75s
Умный анон, а поясни в чем разница между static и i-matrix?
Иматрикс от батрухи кушает контекст значительно медленее. Генерация +- та же скорость. объем модели опять же у иматрикс больше.
В чем плюс? Или это у батрухи неудачно вышло? или это я где накосячил?
Вики читал. Ответа не нашел.
Аноним 12/08/26 Срд 20:02:41 1675550 109
>>1675545
В i-matrix перед ужатием прогоняется датасет, который позволяет отметить веса со всякой важной хуйней, веса с важной хуйней жмутся не так жестко как остальные. А что ужимальщик считает важной хуйней, а что нет, это зависит от ужимальщика.
Аноним 12/08/26 Срд 20:06:15 1675553 110
>>1675550
т.е. в теории лоботомирование может быть как хорошим, так и плохим. а в случае с статикой, то средний вариант?
А не знаешь, почему так медленно контекст кушает (processed) в сравнении с статикой?
Аноним 12/08/26 Срд 20:11:57 1675558 111
>>1675553
Другой анон.

imatrix у тебя жрёт на гиг больше, может он не влезает нормально, контекст вылезает из VRAM и скорость процессинга оказывается на дне.
Аноним 12/08/26 Срд 20:21:25 1675565 112
>>1675558
Звучит логично.
Останусь значит на статик.
По первым впечатлениям >>1675473 :
Разврат пишет хорошо, сочненько, вроде держит персонажа и не спускается в разврат персонажами, которые к этому не предрасположены. Правда на конфликт не шёл. Надо больше тестов.
Аноним 12/08/26 Срд 21:01:52 1675603 113
1786557609713.jpg 488Кб, 1080x2400
1080x2400
> For a top model, coding today means far more than writing
Дальше не читал, сырки, а вы ещё сомневались...
Аноним 12/08/26 Срд 21:23:02 1675619 114
Чет в голос с нового Немотрона. Сделать кодоунитаз который не прошел у этого чела ни одного теста это нужно было еще умудриться.

https://www.youtube.com/watch?v=DH4Mf6GuTXo
Аноним 12/08/26 Срд 21:29:18 1675628 115
1702961000717.png 83Кб, 625x193
625x193
Сегодня снова доил корову из mi50 (и нормально так подоил).
Немного потраил запил мульти рантайм сборки, вроде вышло, но весит как чугунный мост
Аноним 12/08/26 Срд 21:32:53 1675632 116
IMG4496.png 204Кб, 720x720
720x720
>>1675628
Скажи честно. Ты стакаешь мишки чтобы с ними ебаться?
Аноним 12/08/26 Срд 21:39:53 1675637 117
1671745008999.png 25Кб, 1023x360
1023x360
1713343619137.png 63Кб, 200x200
200x200
>>1675632
Конечно. Если бы мне было влом, я бы не ебался с патчингом таймингов на hbm.
Это уже спортивный интерес. Каждый раз когда думаешь что ну больше нечего с них выжимать приходит идея как закопаться ещё глубже и получить свои заветные токены.
С приходом агентов это стало на много проще ведь всю рутину по перебору таймингов и сборке таблиц можно кинуть ей под ноги. Вот тут кубовый под с видяхами, вот тут код, бери в руки и перебирай тайминги, если хост сдохнет, зови меня

Я знаю что это корова прячет ещё молоко!
Аноним 12/08/26 Срд 21:40:26 1675638 118
Аноним 12/08/26 Срд 21:53:25 1675644 119
>>1675418
Какая разница, сколько оно стоит, если релизят только огромные модели. Вон на 3.8 27б 404 на счетчик >>1675443

Модели больше, железо еще дороже (с теми же или худшими характеристиками) => покупка подписки. Корпы победили
Аноним 12/08/26 Срд 22:00:25 1675649 120
>>1675443
> Sorry, the page you visited does not exist.
Пидорасы.................
Удаляю все квены с диска.
Аноним 12/08/26 Срд 22:07:59 1675655 121
>>1675644
Чет нихуя эти открытые веса не сработали))
Аноним 12/08/26 Срд 22:21:56 1675668 122
IMG5027.gif 232Кб, 164x260
164x260
>>1675637
Ай да шизяра, ай да молодец.

Сотые стакать будешь?
Аноним 12/08/26 Срд 22:26:32 1675673 123
anime43.jpg 63Кб, 512x487
512x487
>>1675644
БЛЯЯЯЯ АНАЛЬНЫЕ ХУЕСОСЫ
НЕНАВИСТЬ
Аноним 12/08/26 Срд 22:38:07 1675686 124
1786563488581.jpg 30Кб, 400x531
400x531
>>1675668
Не. Через годик может буду присматриваться к новым темкам.
У красных есть неоспоримый плюс - рокм стек опенсорсный

Чего-то бы такого... забористого, что бы прям вообще 0 инфы про железо, но с потанцевалом и за копейки. Как те же депо мамки "отечественные"
Аноним 12/08/26 Срд 23:04:16 1675707 125
image.png 78Кб, 1648x896
1648x896
А ловно нам всем по губам провели, а?
Аноним 12/08/26 Срд 23:06:44 1675709 126
>>1675707
Это кодомодель для агентотреда. Чего переживать?
Аноним 12/08/26 Срд 23:10:35 1675711 127
>>1675709
Эта модель - дистиллят от 2.4Т модели. Те что прошлые - дистилляты от 397В. Разницу понимаешь?
Аноним 12/08/26 Срд 23:15:56 1675716 128
>>1675711
>Те что прошлые - дистилляты от 397В.
Не факт.
Тошо квен не релизили ничего больше 397б - не значит, что у них не было более крупной модельки.
У них всегда были эти Мах модельки, и я вангую что они больше 397б, просто ее не хотели давать бомжам.
Аноним 12/08/26 Срд 23:18:42 1675721 129
От четвертой картинки в шапке вспомнил что был да всплыл стартап по запеканию негросетей в кремень и на плату pcie. И где? Авторы решили поиграться с гранатами в своих кибертраках или намазать себе трусы новым очком?
Аноним 12/08/26 Срд 23:20:56 1675725 130
Аноним 12/08/26 Срд 23:22:44 1675728 131
>>1675721
Их купили за дохуя. Доброе утро.
Аноним 12/08/26 Срд 23:25:12 1675733 132
image.png 51Кб, 1477x335
1477x335
>>1675716
>У них всегда были эти Мах модельки, и я вангую что они больше 397б, просто ее не хотели давать бомжам.
Ну на фоне релиза 3.8 уже понятно что такое их max модельки. Тупо маркетинговая срань чтобы API продавать - самая крупная их модель + vision + растянутый rope контекст.
Аноним 12/08/26 Срд 23:33:24 1675741 133
>>1674844
Охх... Смазка выделилась от ностальгии по 2022му.
Аноним 12/08/26 Срд 23:33:57 1675743 134
>>1675644
Только временно же. Железо все более специализированное появляется, через год-два эти большие модели будет только так щелкать. А веса уже все есть.
Аноним 13/08/26 Чтв 00:41:03 1675788 135
>>1675417
У меня на v100 qwen 9b q8 выдает около 75тс, гемма 12б точно не помню, но более 40
Аноним 13/08/26 Чтв 00:54:40 1675796 136
1688185640953.jpeg 2594Кб, 1792x2400
1792x2400
>>1675619
Ну мужик высказался - модель умная, сообразительная, знает как что делать, но слаба в коде. При этом есть потенциал для художки и всяких текстов - буквально не кодоунитаз и душевная модель как тут топят.
Чего носы воротите, айда тестить!
>>1675686
Очевидный пикрел только лабел нвидия там не в тему, интел и амд покажутся ангелами куртки. Правда достать их в личное пользование считай нереально.
Аноним 13/08/26 Чтв 01:09:01 1675810 137
падажжи ёбана.png 260Кб, 610x716
610x716
Блджад, как вы топ риги по цене к качеству себе подбираете, чтобы не шумно было поспать, пока агенты на всю VRAM ебашат поиск соуса картинок шлюх по всем интернетам?
Думаю взять и отдать в RAG эту линейку тредов, чтобы нейронка топ сборки по цене к качеству насоветовала.

Тут вона в предыдущем треде кто-то скинул сборку:
vllm-backport, pp4, cmp170, intel12700, plx88096 (3х16 один х8). На Лохито cmp170 сейчас от сотки за штуку, совсем ахуели.

В этом кто-то кидал скрин, что амуде instinct Mi60 с 32 Гб оперативы это тоже норм.

На ютюбах советуют винчик на фоне подорожания 3090 брать 2080 Ti 22GB + NVLink как топ по цене к кащсву.

v100 - нет аппаратной поддержки Q8, да и охлад надо самому хуевертить, чтобы под ухом турбина не ревела.

Но я вот нихуя не смыслю, какой проц, какую оперативу, какой конфиг надо шобы псина-е не была узким местом и скорость была. Как я понял, помимо NVLink пойдёт и что-то вроде plx88096 плат для избегания узких горлышек.
Аноним 13/08/26 Чтв 01:22:59 1675819 138
>>1675810
Нейронка скорее всего зафейлит, потому что данные несистемны-обрывочны и встречаются споры. А много специфики инфиренса локальных ллм отличается от популярных трендов в ее датасете (например нужность нвлинка).

Скинь карточек высокой культуры или хороших пикч, подумаю над тем чтобы закинуть положение по железу на текущий момент.
Аноним 13/08/26 Чтв 01:26:53 1675821 139
1786573614711.jpg 15Кб, 200x200
200x200
>>1675810
> по цене к качеству
Лучшие сочетания быстро кончаются, а пока не кончились к ним инфы нифига нет.

Хочешь с магазина? Бери plx и 4/8 5060ти
Одна 5060ти сейчас как 8шт ми50 32? Ну времена меняются. Когда то и сборка на дуал 4189 стоила 40к + рам по цене 1200 за 16гб стик.

Как вариант начинай в тему и чатики погружаться что бы не проспать следующую волну хайпа. Может какие dcu или тенсенты на рынок смоет с цодов.

Шум гарантированно контрится обычными павер лимитами
Аноним 13/08/26 Чтв 01:29:58 1675824 140
>>1675810
Гайд: спи не в той же комнате, где стоит тачан.

> v100 - нет аппаратной поддержки Q8
Да хер забей, пока ллама жива, в100 будет жить. Пока это, неиронично, самый низкопердольный вариант. Башенные куллеры стоят дешево, но остались только на 1u и 3u. Медную Золотую середину в 2u уже не сыскать. А дальше просто буквально прислоняешь крутилятор на 12 дюймов, и усе. Проблем нет, максимум температуры был 83 градуса, но при 30-градусной жаре. Когда прохладей выше 75-77 не поднимается при загрузке на час минимаксом аш 3.
Единственный недостаток моего макгаверинга --- травмоопасность. Лень фотать, поэтому на словах опишу. Открытый корпус, мать параллельно земле. В100 в самом внешнем слоте, ровно вровень с каркасом корпуса. К ней прислоняете крутилитор на 120мм. Дотюнинговал еще с выдувом, который подцепил на 2u кулер резинкой (60мм крутилятор). Резинка рвется раз в 2 недели. Основной крутилятор фиксируется ножницами, которые лежат на столе (фиксировать нужно, так как крутилятор без фиксации отходит от карты). Плюс, ножницами можно регулировать угол потока. В общем, недавно когда не мог зафиксировать крутилятор в статичном положении, потому что женщина взяла ножницы и положила их неправильно, подталкивал ими аккуратно крутилятор в плотную к карте, и он упал мне на руку, разрубив два пальца. Не сильно, но забрызгал стену кровью и теперь не могу отмыть, так как штукатурка шершавая. Но крутилятор тоже пострадал, там на двух лопостях теперь типа обкусы по 2-3 см в глубину.
К чему я это? Даже конченный дебил может совладать с теслой в100 и охлаждать ее. Это буквлаьно самый дешевый и самый простой вариант.
Аноним 13/08/26 Чтв 01:33:21 1675828 141
>>1675824
> пока ллама жива
Это нельзя назвать жизнью, гальванизация
> спи не в той же комнате, где стоит тачан
База!
> Лень фотать, поэтому на словах опишу
Звучит крайне колоритно, сфоткай обязательно.
Аноним 13/08/26 Чтв 01:36:03 1675831 142
>>1675828
Ну мне надо резинок купить, чтобы показать максимальный сетап. Как куплю, так вкину.
Аноним 13/08/26 Чтв 01:51:42 1675839 143
>>1675810
>cmp170
Норм.
>plx88096
Дорого, можно взять материнку на эпике за ту же цену. Нужно когда видюх становится больше 4.
>instinct Mi60
Медленное и дорогое говно.
>2080 Ti 22GB
Норм, либо cmp 50/90, но под них пока нет разлока и там не работают тензорные ядра, поэтому они пока сосут.
>v100
В сравнении с cmp170 уже выглядит полным калом.

Все, можешь не собирать RAG для анализа треда.

>Но я вот нихуя не смыслю, какой проц, какую оперативу, какой конфиг надо шобы псина-е не была узким местом и скорость была. Как я понял, помимо NVLink пойдёт и что-то вроде plx88096 плат для избегания узких горлышек.
Все будет ясно если определиться сколько у тебя будет видюх и каких. Тут либо v4 ксеоны, как самый бомж вариант. Либо эпик на хуанане / обычная мамка + plx88096 средний вариант. Ну и эпик где через несколько plx88096 20 штук cmp170 в одну мамку запихнуто - это типа самый топ.

>чтобы не шумно было поспать
cmp170 на водянке самое то будет
Аноним 13/08/26 Чтв 01:59:07 1675843 144
>>1675831
Не забудь!
Насчет старого железа - сейчас именно ллмки помогают дать ему вторую жизнь, создавая спрос для запуска и помогая в кодинге. На в100 флешатеншн и многие вещи адаптировали, бекпорты и движки пилятся, так что все норм будет. А Жоржанова ногами пиздить надо чтобы из спячки вышел и по-настоящему занялся разработкой, или другим уступил.
>>1675839
> Дорого, можно взять материнку на эпике за ту же цену.
Поподробнее?
> под них пока нет разлока
https://github.com/pearlfortune/cmpunlocker/blob/main/README.en.md
> cmp170
Они остались хоть еще в продаже, или только лохотрон на предзаказы и скупку?
Аноним 13/08/26 Чтв 02:02:59 1675844 145
>>1675788
Ну у V100 судя по спеке пропускная способность в 3 раза выше чем у моей 4060 ti. Не уверен какой параметр гпу влияет на генерацию токена но если именно этот - то в целом картина сопадает, у тебя как раз скорость в 3 раза выше.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов