Главная Юзердоски Каталог Трекер NSFW Настройки

Искусственный интеллект

Ответить в тред Ответить в тред
<<
Назад | Вниз | Каталог | Обновить | Автообновление | 374 61 66
Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №269 /llama/ Аноним 18/09/26 Птн 19:50:26 1707443 1
Llama 1.png 818Кб, 630x900
630x900
Карта деградаци[...].png 153Кб, 1473x830
1473x830
Реальная длина [...].png 533Кб, 2340x1714
2340x1714
hBTbcoluElE7kLt[...].jpg 924Кб, 1922x2560
1922x2560
#Локальные языковые модели (LLM): Gemma, Qwen, GLM и прочие №xxx

В этом треде обсуждаем генерацию охуительных историй и просто общение с большими языковыми моделями (LLM). Всё локально, большие дяди больше не нужны!

Здесь мы делимся рецептами запуска, настроек и годных промтов, расширяем сознание контекст и бугуртим с нано флеш моделей на 1488B параметров.

Тред для обладателей топовых карт NVidia с кучей VRAM или мажоров с проф. картами уровня A100, или любителей подождать, если есть оперативная память. Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Официальная, но слегка тухлая вики треда с гайдами по запуску и базовой информацией: https://2ch-ai.github.io/wiki/llama/
Гайд для новичков: https://rentry.org/2ch-llama-inference
Не вошедшее в шапку и архив полезных ссылок: https://rentry.co/llama-2ch-archive

Инструменты для запуска на десктопах:
• llamacpp - отец и мать всех инструментов, позволяющий гонять GGML и GGUF форматы: https://github.com/ggml-org/llama.cpp
• koboldcpp - самый простой в использовании и установке форк llamacpp: https://github.com/LostRuins/koboldcpp
• Обертка над llama.cpp с закрытым исходным кодом: https://lmstudio.ai
• Обертка над llama.cpp с ограниченными возможностями: https://github.com/ollama/ollama

Универсальные десктопные фронтенды:
• SillyTavern - всеядное, сопрягается почти со всем, имеет большую коллекцию расширений: https://github.com/SillyTavern/SillyTavern
• Marinara Engine - вариация на тему таверны, больше возможностей из коробки: https://github.com/Pasta-Devs/Marinara-Engine
• Risuai - еще одна вариация, на этот раз в профиль, излишеств по минимуму: https://github.com/kwaroran/RisuAI

Инструменты для запуска на мобилках:
• PocketPal - интерфейс для локального запуска моделей под андроид и IOS на llamacpp (CPU, GPU, и NPU инференс): https://github.com/a-ghorbani/pocketpal-ai
• Maid - интерфейс для локального запуска моделей под андроид с llamacpp под капотом: https://github.com/Mobile-Artificial-Intelligence/maid
• ChatterUI - альтернативный вариант для локального запуска под андроид (фронтенд и бекенд сепарированы): https://github.com/Vali-98/ChatterUI
• Гайд по установке SillyTavern на ведроид через Termux: https://web.archive.org/web/20241201232031/https://rentry.co/STAI-Termux

Поставщики локальных моделей:
• Hugging Face - платформа куда загружается всё и во всех форматах: https://huggingface.co/models
• Проверенные квантоделы: https://huggingface.co/bartowski, https://huggingface.co/mradermacher, https://huggingface.co/unsloth

Рейтинги и списки локальных моделей:
• Актуальный список моделей с отзывами от тредовичков: https://rentry.co/2ch_llm_moe_2026
• Рейтинг моделей по уровню их закошмаренности цензурой: https://huggingface.co/spaces/DontPlanToEnd/UGI-Leaderboard
• Сравнение моделей по сомнительным метрикам: https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard
• Сравнение моделей реальными пользователями по чуть менее сомнительным метрикам: https://chat.lmsys.org/?leaderboard

Готовые карточки для таверны:
• Botbooru - текущая мета (регистрируйтесь для отображения всего спектра, и/или меняйте страну): https://botbooru.com
• Прошлая мета, откуда массово удалили карточки сомнительного содержания: https://www.characterhub.org, https://www.chub.ai
• Архив карточек, удадённых с chub: https://gottasaveemall.github.io/

Официальные документации к инструментам:
• llamacpp: https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
• koboldcpp: https://github.com/LostRuins/koboldcpp/wiki
• SillyTavern: https://docs.sillytavern.app/usage/quick-start

Архив тредов можно найти на архиваче: https://arhivach.vc/?tags=14780%2C14985

Шапка в https://rentry.co/llama-2ch, предложения принимаются в треде.

Предыдущие треды тонут здесь:
>>1705886 (OP)
>>1703839 (OP)
Аноним 18/09/26 Птн 19:54:56 1707453 2
image.png 12Кб, 659x127
659x127
Хоть бы одну смешнявку с ТП-геммой с прошлого треда вставил, жук.
Аноним 18/09/26 Птн 19:55:22 1707454 3
Представьте, что вы должны объяснить старшему поколению зачем нужны ллм в повседневе и почему им нельзя 100% доверять. Ваши аргументы.
Аноним 18/09/26 Птн 19:57:06 1707455 4
>>1707453
Вообще почему-то умиротворяюще и приятно рпшить, когда тебя отшивают. Какая-то естественность добавляется. Молодость с альтушками вспоминается, где каждая из себя строила нетакую. Сейчас, наверное, все продавщицами в кбшках и пятерочках работают.
Аноним 18/09/26 Птн 19:57:29 1707456 5
>>1707454
чё тут аргументировать, предугадыватель следующего слова на основе предыдущего. вот и всё.
Аноним 18/09/26 Птн 19:57:39 1707457 6
>>1707454
>вы должны объяснить старшему поколению зачем нужны ллм в повседневе

Показываю скрин с фифи и готово - со мной до конца моих дней не разговаривают и считают конченным.
Аноним 18/09/26 Птн 20:03:22 1707463 7
>>1707457
>со мной до конца моих дней не разговаривают и считают конченным.
Я бы от этого только выиграл. Родственники частенько очень много времени на себя отбирают.
Аноним 18/09/26 Птн 20:13:01 1707477 8
image 724Кб, 934x1879
934x1879
>>1707453
С векторами тпшка зачетная выходит.
Аноним 18/09/26 Птн 20:15:10 1707478 9
Аноним 18/09/26 Птн 20:15:47 1707481 10
>>1707477
Больше двачера скучающего напоминает.
Аноним 18/09/26 Птн 20:43:02 1707499 11
>>1707478
Спасибо за наводку. Чувствую себя как батя, вот-вот собирающийся поковыряться в ржавом ведре на колесах.

мимо другой шиз, баловавшийся с векторами
Аноним 18/09/26 Птн 20:49:23 1707507 12
>>1707499
я пока думаю, мб локального квена на эту хуйню натравить из под pi например, пусть проанализирует все слои поведения этого добра и перепишет как плагины или скиллзы .ts под pi. и тогда можно локально гонять без тележки.

потом сверху наебашить свой гуя с vrm саппортом или вовсе сделать бридж к любому -mate высеру.
Аноним 18/09/26 Птн 20:59:56 1707516 13
Аноним 18/09/26 Птн 21:11:42 1707521 14
>>1707516
не, нахуй голосовые, итак врамы не хватает ни на что.
Аноним 18/09/26 Птн 21:13:04 1707522 15
image 483Кб, 682x1892
682x1892
>>1707478
Вкатал промпт на 9к токенов оттуда, вроде еще тупее стала ним. Видимо надо только отдельные куски выбирать.
Аноним 18/09/26 Птн 21:14:23 1707523 16
>>1707521
silero (отдельно сервер надо прикрутить к S2S) + parakeet (уже в S2S) можно в огрызок уместить, буквально лошпед-гпу на 4 гига и немного оперативки.
https://github.com/snakers4/silero-models
Аноним 18/09/26 Птн 21:15:56 1707525 17
>>1707522
Буд то обидевшеяся тян. При том виноват ты. Жизненно.
Аноним 18/09/26 Птн 21:16:06 1707527 18
>>1707522
Если у тебя не попердоленная васянами 31б гемма в норм кванте, то с промптом у нее проблем быть не должно даже с векторами. Тут >>1707206 → например аж 20к-токеновая йоба в промпте.
Аноним 18/09/26 Птн 21:17:01 1707529 19
207546331577890[...].mp4 12607Кб, 1488x1552, 00:01:03
1488x1552
Вот чего я реально жду. Но узкоглазые пидоры никогда не выпустят это в опенсорс...
Аноним 18/09/26 Птн 21:18:36 1707531 20
Аноним 18/09/26 Птн 21:26:47 1707537 21
>>1707529
Но это же проект на пару вечеров в обнимку с умной ллмочкой на аналогичный видео poc и пару недель-месяцев на допил до юзабельного состояния и тренировку моделей, в чем прикол?
Аноним 18/09/26 Птн 21:30:40 1707544 22
Аноним 18/09/26 Птн 21:31:21 1707545 23
Аноним 18/09/26 Птн 21:32:26 1707547 24
>>1707531
Это ван стример. Тут можно еще примеры глянуть. https://wan-streamer.com/v0.2/

Просто в треде пытаются сделать симулятор тни, и ящетаю что с видео в реалтайме будет куда бодрее. Типа не просто чатишься текстом, а общаешься по вебочке. Можно еще попросить сиськи показать.

>>1707537
Сделай, выложи веса. Куча людей тебе спасибо скажут.
Аноним 18/09/26 Птн 21:32:33 1707548 25
Аноним 18/09/26 Птн 21:32:51 1707549 26
>>1707537
>>1707531
> в чем прикол
Грест бабульки на донатах?
Аноним 18/09/26 Птн 21:36:23 1707551 27
>>1707547
> выложи веса
Какие веса? Нужно собрать уже доступный функционал липсинка и морфа видео. Емнип, больше года назад кто-то из местных выкладывал эксперименты. Если с этого примера убрать тряску камеры и шум - прямо оно получится.
Аноним 18/09/26 Птн 21:37:51 1707552 28
Сейчас существуют какие-то реально 100% рабочие текст-комплишн темплейты под 4 гемму? Или чаткомплишн так и остался лучшим?
Аноним 18/09/26 Птн 21:38:01 1707554 29
engineer-captio[...].mp4 7269Кб, 368x740, 00:00:38
368x740
>>1707547
А, там уже версия 0.3 вышла.
Аноним 18/09/26 Птн 21:40:00 1707555 30
>>1707552
Что у тебя не работает и почему? С первого дня сижу на текст комплишене и бед не знаю
Аноним 18/09/26 Птн 21:41:17 1707556 31
>>1707555
А у меня их в принципе нет, обновлял таверну и новое не появляется. В общем, интересно было бы попробовать, дайте ссылочку хде их взять
Аноним 18/09/26 Птн 21:45:32 1707561 32
Аноним 18/09/26 Птн 21:45:46 1707563 33
посоветуйте мне лучшую умничку для бескомпромиссного, перверсивного ролеплея
Аноним 18/09/26 Птн 21:46:22 1707564 34
>>1707552
> текст-комплишн
Как там в мезозое?
Аноним 18/09/26 Птн 21:46:25 1707565 35
>>1707556
Попроси агента написать. Нахуя? автобус из хлеба жпг
Аноним 18/09/26 Птн 21:47:02 1707566 36
>>1707563
Gemma 5, приходи через полгода

>>1707561
Ну это я видел. Васянщина же.
Аноним 18/09/26 Птн 21:47:58 1707569 37
>>1707566
Какая васянщина? Там темплейты готовые лежат для текст комплишена. Ты тупой на 10/10?
Аноним 18/09/26 Птн 21:49:01 1707571 38
>>1707569
Темплейты сделанные васяном
Аноним 18/09/26 Птн 21:51:49 1707575 39
>>1707571
Кто их должен сделать? Ебать ты печальный. В пятницу вечером юшки фармить вместо глажания хвостов. Похоже и правда лмстудио мужеложец
Аноним 18/09/26 Птн 21:55:18 1707579 40
>>1707575
Эк ты затрясся. Мне просто было интересно, нет ли неких 100% стандартизированных-сертифицированных-анонимус-эппрувед-темплейтов. Тут и дураку понятно, что всякие меро-шмеро и прочие слоподелы выкладывают тысячи их.
Аноним 18/09/26 Птн 21:57:14 1707580 41
image.png 369Кб, 610x405
610x405
>>1707566
>Gemma 5, приходи через полгода
ты решил устроить нофап марафон чтобы отрастить себе новый хуй? ведь старый ты стер в порошок на какой-то из файнтюнов, которым ты теперь как пидор не хочешь делиться со мной из вредности и зависти, ведь моя шишка сочится от желания

думаю, тебе стоит подумать над своим следующим сообщением и наконец уже исправить свою репутацию, превратившись из додяна в уважаемого господина советующего годноту
Аноним 18/09/26 Птн 21:58:14 1707581 42
>>1707579
>"сертифицированные шаблоны"
Бля как же ещё хочу покормить этого сертифицированного лмстудио консумера. Но больше не буду. Извините
Аноним 18/09/26 Птн 22:02:19 1707585 43
1.png 167Кб, 526x948
526x948
2.png 205Кб, 522x946
522x946
3.png 168Кб, 525x609
525x609
Хуя вы быстро перекатываете. Репостну сюда в продолжение разговора о том как заставить ллм и генерацию картинок работать вместе. Имхо вовсе не обязательно и то и другое одновременно помещать в память. Пикрил на 16+32 работает - Marinara + Custom Photo Agent + Krea2. Всё гладко, главное:

1) отключить автономность персонажам и не писать им сообщения пока идет генерация (а идёт она недолго, около минутки)

и 2) Unload All Models нода, брал отсюда https://github.com/SeanScripts/ComfyUI-Unload-Model её вставить надо перед Save Image.
Аноним 18/09/26 Птн 22:04:02 1707587 44
>>1707573 →
Если ты загружаешь модель LLM раньше ComfyUI, то комфи использует только свободный объем врам, а движки инференса заранее резервируют весь нужный им объем, как правило.
А генерация во время генерации, скорее всего, упиралось непосредственно в чип и скорость чтения памяти.

Но это вероятно, на деле-то хуй знает.

>>1707478
Посмотрю, чтобы твои старания не прошли втуне.
Аноним 18/09/26 Птн 22:07:06 1707589 45
>>1707587
Воистину хуй знает но судя по тому что я вижу, ллм на время генерации выбрасывается нахуй из видеопамяти и я сверял скорость генерации картинки, она точно такая же как и вручную без запущеной ллм
Аноним 18/09/26 Птн 22:21:32 1707599 46
>>1707587
> то комфи использует только свободный объем врам
Точно?
Там есть аргумент резервной врам, но кажется раньше отсчет шел по памяти девайса. Если может по фактической то это круто, но нужно подтвердить. А то иначе все упирается в выгрузку драйвером, что может оказаться небыстро.
Аноним 18/09/26 Птн 22:28:13 1707603 47
Steins-Gate-Ani[...].png 1223Кб, 1613x2276
1613x2276
>>1707581

Двачую. Проорал. Какие только конструкты не придумают лишь бы не делать самому. Это целых две минуты мозговой деятельности

>>1707563

Дружище кокос, как тебе советовать если ты даже железо не указываешь?
Но по факту есть два мира. Первый для простых смертных, это модели до 200б. Второй для обладателей присутствия железа, там совсем другие модели, у каждой свои плюсы минусы. И имхо не так там всё хорошо, если ты конечно не запускаешь жирноглэмы или кими.

В первом мире всё оче просто сегодня. Из моделей прошлого поколения имеет право на жизнь только Air (и я даже не эйрошиз), он оказался на стыке поколений, впитал в себя креатив дней минувших и чуть приучен следовать инструкциям. Ну то есть, он им следует, в отличие от ВСЕХ моделей до ~200б которые выходили в одно с ним время. Мистрали, QwQ, Командеры, ебучий Квен 235, Aya, Граниты всякие. Ещё он требует того чтобы найти с ним общий язык и не вывозит трёх и выше чариков, прям совсем. Даже Q8
Дальше идут Квен 27б и Гемма 4 (причём обе, 26б и 31б). До сих пор им аналогов нет из современных моделей для консумер железа, дальше по лестнице только Квен 3.8 Некст Флеш. Он на самом деле прикольный, до 60к из него можно выпытать норм ответы, дальше чёт сыпется немного. Нужно аблитку Оркароутер использовать которую вчера анон рекомендовал. Но вернёмся к Квену и Гемме. И вообще заблуждению про тюны. ТЮНЫ ПОЧТИ НИХУЯ НЕ МЕНЯЮТ В ПОВЕДЕНИИ МОДЕЛЕЙ НА КОТОРЫХ УЧИЛИСЬ! За всю историю тюнов для рпшинга таких на пальцах одной руки можно пересчитать, и то особо внимательные дрочеры найдут кучу сходств с родительской моделью. ТЮНЫ НЕ МЕНЯЮТ МОДЕЛЬ, ОНИ ЕЕ СЛЕГКА НАПРАВЛЯЮТ! Не нужно думать что ты там дохуя новый опыт получишь. Большинство тюнов на Гемму тупо убирают её слоп и слегка меняют выражения и частоту их повления, но под капотом это та же Гемма. Большинство тюнов на Квен добавляют ему смака и желания описывать хвостики и каддлинг тысячелетних жён. Но под капотом это тот же Квен.
Из хорошего для Геммы 31 https://huggingface.co/nbeerbower/Gemma4-Gutenberg-31B добавляет естества в прозу, обучалось на паблик домейн литературе Гутенберг, может иметь слегка устаревший по нынешним меркам слог, такой прям нарочито книжный. Но прикольный результат вышел. https://huggingface.co/zerofata/G4-MeroMero-v2-31B чуть режет слоп и добавляет вариацию свайпам. Ещё ахуенно отыгрывает всяких недотрог и злюк. Кто ругался там что им на хуй бросаются могут попробовать. Одни из самых интересных злодеев у меня тут получаются. https://huggingface.co/ReadyArt/Dark-Scarlett-v1.0-27B вот это на квен для сочного куминга, там будут и хлюпающие пёзды и весь смак. https://huggingface.co/zerofata/Q3.5-BlueStar-v2-27B вот это для экшули рп на Квене, уже давно квеноаноны советуют, я только недавно распробовал. Годное. И что главное, НЕ СТЕСНЯЙСЯ ПЕРЕКЛЮЧАТЬ МОДЕЛИ ПО ХОДУ ДЕЛА. У меня тупо для кума одна модель, для рп другая, иногда можно третью, всё это в одном чате

Сегодня так то ахуенный выбор моделей под любое железо. Если тебе скучно или не добиться желаемых результатов на этих моделях, то это уже скилишью или неизличимая болезнь типа как у лмстудиозависимых

Пикрил просто потому что лучшая девочка. И чмок в лобик чайный клуб, если этот добряк еще здесь. Где твои посты. Они грели мне душу. Я же плакаты розыска вешать начну
Аноним 18/09/26 Птн 22:32:29 1707605 48
>>1707589
Ну, вряд ли объем свободной видеопамяти сильно влияет на скорость генерации, там же моделька небольшая. Пока сама картинка (контекст) помещается в видеопамяти и не выливается в шаред мемори — все ок.

>>1707599
Ну, я замерял несколько раз, всегда она юзала только свободную, без презерв врам.
Аноним 18/09/26 Птн 22:35:56 1707608 49
>>1707603

Чтобы не обидеть тех кто на 26б сидит, вот две хорошие слопорезки
https://huggingface.co/zerofata/G4-MeroMero-26B-A4B
https://huggingface.co/Gryphe/Gemma-4-26B-A4B-StyleTune-V2
Меро почти не отличается от оригинала но меньше слопа, стайлтюн чуть отличается по стилю и меньше слопа

Больше рекомендовать нечего. И это даже не крик о думе о скорее констатация изобилия, уже очень много годноты есть. Если вам нечего выбрать как барышне нечего надеть, то проблема в вас
Аноним 18/09/26 Птн 22:48:43 1707614 50
>>1707608
А есть где-нибудь пруфы про "меньше слопа" ? Я не увидел отличий в меромеро вообще никаких. Имхо если оригинал правильно направить промптом то никакого слопа и не будет.
Аноним 18/09/26 Птн 22:50:44 1707615 51
Сап, нужен совет по софту на бэк

Есть три 4070ti 16gb и необходимость впихнуть 30б модели. По росту числа видях появилась необходимость динамически грузить-выгружать три разные модели. Холодный старт хуёвый - по 5 минут пока достанется с хдд, зато потом они таскаются из кэша, но хотелось бы чтобы их таскал непосредственно оркестратор освобождая место для других сервисов.

Изначально была ollama, но при росте кол-ва видях она по какой то причине пропорционально снижает нагрузку ухудшая производительность, т.е. сейчас нагружена треть каждой и выдаёт 20-30т/с там, где раньше было 30-35. На шину не похоже - в btop показывает всего 20мб/с, на голой lcpp при tensor обменивались по 200мб/с. Плюс явно упирается в однопоток что на зивоне оч не оч. Оно конечно не раскроется из-за 3 шины и одной из карт на 8 линиях но собираю машину из того что есть.

Попытался вкатить vllm типапродакшон, но во первых из-за нечётного числа видях тензорный параллелизм отказывает, во вторых даже со слоями по какой то причине он вечно падает в oom по vram. vllm-playground видимо тоже не поднимает контейнеры по этой причине.

Попытался вкатить типаумный типаоркестратор localai но он чёт вообще какая то залупа не может нормально всосать уже скачанную gguf, приходится перекачивать через вебморду. При этом тензорный параллелизм в его сборке llama получается медленнее чем слоевый. И всё ещё упирается в однопоток.

Сегодня ебался с llama-swap, оркестратором для llama.cpp. ИЧСХ вот она получилась быстрее всех нормально нагружая карты и шины всё ещё не физический предел 8-16гб/с но уже приятные 200мб/с.

Стоит ли ещё поебстись с vllm? Может как либо можно завести тензорный параллелизм на трёх видяхах или по сравнению с ламами даже слои будут быстрее? Есть что то что упускаю?
Аноним 18/09/26 Птн 22:52:14 1707617 52
>>1707614

Проиграл с пруфов. За такое нахуй в целом надобно слать, потому что можно в ответ спросить есть пруфы что слопа не меньше? и бесконечно перекидывать этот мяч

Наверно стоило добавить приписку это мнение, а не инвестиционная рекомендация, лмстудиозависимые и скуфы с хабра иначе не разберутся х)
Аноним 18/09/26 Птн 22:54:52 1707619 53
>>1707617
Ты утверждаешь, что слопа меньше, а я тебе должен пруфы что его НЕ меньше? Иди-ка ты нахуй. Понятно уже, что у тебя их нет, ты эти "пруфы" наверное вычитал в "бенчмарках" которые сам же автор и составил для самоуспокоения.
Аноним 18/09/26 Птн 22:57:12 1707620 54
>>1707619

Я сюда не сраться и что то доказывать пришёл, а поделился чем могу и что мне понравилось. Быть может откровенье, но никто тебе не обязан. Ну в целом на ротан дать могу если ты фембойчик с лмстудией и сишарпом. Но это под градусом
Аноним 18/09/26 Птн 23:01:43 1707624 55
>>1707619
Погоди, так это ты утверждаешь, что слопа меньше не стало. Пруфы-то будут? Кто вступает в спор с противоположной позицией, тот несет бремя доказательства. До твоего пука было обсуждение, не спор.
Аноним 18/09/26 Птн 23:02:54 1707625 56
>>1707624
>Кто вступает в спор с противоположной позицией, тот несет бремя доказательства.
Бля ахуй просто. Какая удобная позиция. Ты политик?
Аноним 18/09/26 Птн 23:03:24 1707626 57
Аноним 18/09/26 Птн 23:04:29 1707627 58
>>1707608
Пробовал и меромеро и орион новый от барабанщика ( https://huggingface.co/bartowski/TheDrummer_Orion-26B-A4B-v1.1-GGUF ). В обоих случаях сломан русик. Гемма изредка, но начинает путать падежи, окончания, строить предложения странно. В ванилле ничего подобного нет даже близко. Квант Q8_0.

Вообще на моей памяти тюнились нормально, не ломая язык, только мистрали. Все остальные были проблемными. Хз почему так.
Аноним 18/09/26 Птн 23:05:00 1707628 59
>>1707603
Базанул
>>1707615
> тензорный параллелизм отказывает
Пайплайн параллелизм, можно даже разные архитектуры объединять.
> падает в oom по vram
Без подробностей что пытаешься запустить и как тут никак. 48 гигов на 30б модели с вллм достаточно, но если хочешь в фп8 - прямо на грани.
> по сравнению с ламами даже слои будут быстрее?
Скорее всего будут, особенно на чем-то типа w8a8, но там нет плавной прогрессии по квантам, если только сам не сделаешь. 8й квант с мтп может не влезть, а для поддержки крутого мтп в режиме пп придется патчить. Или сразу юзать бекпорт, там под sm89 тоже были оптимизации.

На самом деле хз, если ты не кадровый пердоля то все это может быть крайне сложным, а лламасвоп уже работает. Было бы 4 карты - тут однозначно вллм осваивать, а так от конкретного случая зависит.
Аноним 18/09/26 Птн 23:06:20 1707629 60
>>1707624
Мы оба что-то утверждаем, но ты начал утверждать первым ("стало меньше слопа"). Я мог бы попросить пруфов и не утверждая ничего со своей стороны. Но ты завёлся, потому что кто-то засомневался в твоих словах задев твоё ЧСВ ну и потому что пруфов у тебя нихуя нет, чем ещё крыть как не истерикой?
Аноним 18/09/26 Птн 23:07:08 1707631 61
>>1707624

Это слишком сложно для тпшки с хабра

>>1707627

Хз анон, я на англюсике. Мистрали даже стоковые, из коробки говно на русике. Там видимо и ломаться нечему. По Меро помню пару тройку тредов назад закидывали логов на много токенов, на русике. Не помню там проёбов
Аноним 18/09/26 Птн 23:08:25 1707632 62
>>1707629

Сдуйся, СПГСник. Никому такое нытьё не интересно, камор
Аноним 18/09/26 Птн 23:14:44 1707634 63
Как же Пелевин был прав в снаффе, буквально местных пупарасов аля >>1707455 >>1707477 расписал еще когда никаких нейронок не было.

>Когда она называет меня жирным, мне не обидно, я уже привык.
Когда называет слабоумным, я тоже только посмеиваюсь. Но когда она называет меня слабоумным и жирным одновременно, я чувствую обиду. И ничего не могу с этим поделать. Кроме себя мне винить некого. Я сам выставил ей сучество на максимум — никто меня не заставлял. У меня на предельных положениях стоят одновременно «сучество», «соблазн» и «духовность».
Аноним 18/09/26 Птн 23:20:57 1707638 64
image.png 119Кб, 841x416
841x416
>>1707634
Еще он такое писал.
Аноним 18/09/26 Птн 23:24:58 1707640 65
>>1707634
Во многом пророческая книга. Только снафы генерятся сами. Ну и пожилые лесбиянки не спешат возраст согласия повышать.

Я рил соскучился по естественному и наивному общению. Ллмки в основном подлизывают, и делают только то, что я хочу. Да и ирл так же.
Аноним 18/09/26 Птн 23:34:55 1707641 66
Хм. У меня меня была долгая (150 сообщений) и очень трагичная игра. Затем я перед тем как почти кончились токены контекста заболтался с нарратором, расспрашивая его обо всем.
Он сказал чтобы вызвать его надo: You can call me "System," "GM," "Writer,". Но в других чатах, да и в новом он уже не вызывается. Это фича или баг? Мне надо еще переговорить со своей моделькой, как её вызывать? Мне отвечает только персонаж. Даже на фразу - Нарратор добавь в сцену то или сделай то, он не призывается.
Аноним 18/09/26 Птн 23:36:31 1707642 67
>>1707641
Лол.
Дух машины покинул твою видеокарту.
Аноним 18/09/26 Птн 23:39:23 1707644 68
>>1707641

OOC: STOP THE ROLEPLAY. ANSWER THE QUESTION
В большинстве случаев, впрочем, банального OOC: хватает.
Аноним 18/09/26 Птн 23:42:10 1707645 69
>>1707642
Это было так трагично и внезапно одновременно. Проверяя лимиты я случайно нет задушил персонажа и мне стало слишком грустно.

>>1707644
Благодарю. На оос не откликнулся, а вот на фулл фразу засумонился.
Аноним 18/09/26 Птн 23:47:04 1707647 70
image.png 249Кб, 1640x1182
1640x1182
А что это за моделька? В чем отличие от Q3 квенчика? Как будет работать на условной 5070ти?
Аноним 18/09/26 Птн 23:48:30 1707648 71
Появилась задача переписать большие довольно по объему документы в другой стиль. При этом есть как референсы, так и пример до, после. Посоветуйте модель, которая с этим норм справится. Без референса пробовал всякие плотногемы и плотноквены еще весной для похожей задачи, результат мех. Ну, во всяком случае хуже, чем у гопоты 5.2.
Аноним 18/09/26 Птн 23:49:46 1707649 72
Аноним 18/09/26 Птн 23:54:28 1707654 73
>>1707649
5.2 как будто бы был не очень силен в этом. Дрочиться и ставить пр с флэшем на лламу как-то лень ради теста дистила кодоунитазного пострена.
Аноним 18/09/26 Птн 23:54:53 1707655 74
>>1707648
Попробуй с референсом самое жирное и свежее что доступно. Посоветуют тебе сейчас дипсика, но толку если запустишь не сможешь.
Аноним 18/09/26 Птн 23:56:00 1707656 75
>>1707632
>>1707629
Чекнул меромеро, там слопа даже больше, он как будто старается побольше говна навалить. Так-то и база и этот тюн - слоповые до ужаса, но разница налитсо:
База: Вкус был взрывным.
Меромеро: В ту же секунду, вкус взорвался на языке.
Но у меромеро ещё и покоцан русик (не в мелочах типа окончания, а вот, например "с каждым взмахом воздуха" лол, типа такого).
Аноним 19/09/26 Суб 00:11:18 1707666 76
image.png 123Кб, 1203x1292
1203x1292
Поставил садистские контрольные вектора на дипсика. Садистом он не стал, зато стал обиженкой, на любую хуйню обижается и входит в блок.
Аноним 19/09/26 Суб 00:13:29 1707667 77
>>1707666
попробуй назвать его батю лысым
Аноним 19/09/26 Суб 00:14:15 1707668 78
>>1707655
Ну какой-нибудь ку4 квант без мтп могу запустить. Лан попробую подрочиться. Опять качать добро...
Аноним 19/09/26 Суб 00:20:21 1707672 79
>>1707668
> ку
Вероятность успеха крайне мала
Аноним 19/09/26 Суб 00:27:49 1707674 80
Аноним 19/09/26 Суб 00:37:06 1707678 81
>>1707674
>Первая ласточка

Анон, модели натаскивают на сейфети и отказы с самого начала, с первой ламы.
Аноним 19/09/26 Суб 00:39:06 1707679 82
>>1707678
Новость саммарайзом е2б читал? Там конкретно аблятки с хф упоминаются.
Аноним 19/09/26 Суб 00:41:24 1707680 83
>>1707678
Речь о том, что могут аблитерации пидорнуть с хаггингфейса. На реддите сейчас тряска по этому поводу.
Аноним 19/09/26 Суб 00:41:53 1707681 84
>>1707674
Таки оварида. Может просто одна из новостей коих тысячи, а может начнут вводить обязательные правила на сейфти анализ выкладываемых открытых моделей.
Он может оказаться даже добровольным и лайтовым, но его наличию будут делать оценки, а значит все новые модели будут стремиться ему удовлетворять. А как только практика приживется - начнут его ужесточать чтобы куколдизм был не только в апи, но и локально. Плохо то, что аналогов геймергейта тут не будет, потому что "потребитель" по сути и не платит.
Аноним 19/09/26 Суб 00:47:07 1707683 85
>>1707679
>>1707680

В том и дело, что я прочитал реально что там написано, а не на уровне "аблитки упомянули, оварида".

Цитирую:
>Base Labs, the research group Baseten spun up earlier this year, will develop and publish methods for training and monitoring open models. The company is framing their future work as a “standard” for open models that is transparent and built into how models are trained and deployed, rather than bolted on afterward.
>“Safety must be built into open models and provided by those who serve them.” Goodfire, which specializes in opening AI’s “black box” to explain how models make decisions, is the likeliest candidate for the “built into” part.

Перевести или сами поймете что тут написано?
Аноним 19/09/26 Суб 00:52:20 1707685 86
>>1707683
Ну мб. Терпим и ждем, что будет цензурой на хф.
Аноним 19/09/26 Суб 00:54:13 1707686 87
>>1707683
> The announcement lands amid debate for the safety of open-weight models — which can be made dangerous by removing their safeguards through a rising technique known as abliteration. The scale of the problem is massive: Hugging Face, which hosts open source AI models, currently lists over 6,000 abliterated models.
Тряска по поводу аблиток
> built into how models are trained
Требования ролнейшей лоботомии с сюрреалистичной и ужасающей картиной мира, чтобы даже изменение части связей не позволило бы "разблокировать" что-то.
> and deployed
Лазейка с доп защитой на уровне деплоя, которая снимает требования.
> Safety must be built into open models
Не нуждается в переводе, как ни трактуй - плохо
> Goodfire, which specializes in opening AI’s “black box” to explain how models make decisions, is the likeliest candidate for the “built into” part.
Будут проводить более детальный анализ теми же техниками, что используются сейчас для аблитерации и управляющих векторов, дабы удостовериться в полнейшей лоботомии.
Аноним 19/09/26 Суб 00:54:57 1707687 88
> by those who serve them.
> built into how models are trained and deployed

Реальная оварида - если цензуру въебут прям в ламу и вот это как раз может тут поразумеваться. Как раз жорина жопа на хуе HF крутится, а те на хуе нвидии.
Аноним 19/09/26 Суб 00:58:50 1707689 89
>>1707686
Ну т.е. как и раньше будут пережаривать на рефьюзы и сою. А новость в чем?
Аноним 19/09/26 Суб 01:03:38 1707692 90
>>1707687
Сдохнет туда и дорога и быстро подхватят те, кого еще не наняли, так что в этом нет смысла. Тут только в веса паковать.
В гипотетической ситуации где сейфти действительно займутся нехороший личности, и при этом выпуск открытых моделей продолжится - могут пойти на радикальные меры уровня шифрованной подписи и ее проверки на уровне чипов хуанга. Тогда любую неподписанную штуку запустить просто так не получится.
>>1707689
В последние годы ситуация с этим в среднем по больнице сильно улучшилась, модели стали базированнее и нейтральнее. Сейчас имея руки и голову на большинстве можно из коробки кумить, ломать и не получать правильную политическую повесточку. А здесь все повернется обратно, чтобы было как на самых соевых корпах.
Аноним 19/09/26 Суб 01:05:23 1707693 91
>>1707686
>currently lists over 6,000 abliterated models.
Интересно каким макаром и кто именно будет тестить 6к моделей (по факту х10 раз больше, если включать не-аблитки).
Если только не начнут анально запрашивать паспорт при входе на хф, и удалят все непроверенные модели превентивно.
Аноним 19/09/26 Суб 01:05:51 1707694 92
Бекапьте модельки, чо. Не паникёрство, а предосторожность. Думаю даже если их все хуйнут, появятся всякие распределенные сервера или торренты, ну все мы знаем что из интернета ничего не удалить окончательно. Но лучше обойтись без всей этой мозгоебки. Печально конечно если следующие модельки будут еще сильнее зондировать, но хотя бы имеющееся они не отберут, мы не на корпах
Аноним 19/09/26 Суб 01:07:35 1707695 93
>>1707692
>Тогда любую неподписанную штуку запустить просто так не получится.
Я вас умоляю. Денуво ломают, длсс 5 ломают, что угодно ломают.
Локально можно какие угодно сертификаты прихуярить.
Аноним 19/09/26 Суб 01:13:07 1707699 94
>>1707674
Никакой конкретики не сказано.
Вангую просто очередной попил бабла и создание бесполезных рабочих мест. Может какой-нибудь сефети бенч разработают, и новые инстракт модельки будут на него ровнять. Максимум развернутся на какой-нибудь аудит моделек для больших корпораций, чтобы они не "убегали" никуда. Может оно вообще на какую-нибудь военку или на медицину направлено будет.
>Safety must be built into open models
Эта хуйня всегда была.
Аноним 19/09/26 Суб 01:15:25 1707701 95
>>1707694
Бэкапишь такой бэкапишь а потом шинда вдруг резко берёт карантинит и твою лламу и твои бэкапы при том что дефендер ты как бы отключал. Смейтесь. ССД скоро будут выпускать со встроенными чипами которые будут распознавать эти аблитки на лету. Смейтесь. На уровне биоса у вас заберут все опен вейт модели. Смейтесь. Посмотрю потом как будете смеяться.
Аноним 19/09/26 Суб 01:18:29 1707705 96
>>1707693
Не будут, просто постепенное ужесточение для новых моделей, или опциональный сейфти тест от проверенной компании, факт прохождения которого или даже скоры будут показываться явно. На него будут ориентироваться все кто покрупнее, что приведет к тотальному пососу на уровне базовых моделей. Если только последователи Великого Xi не покажут свой нефритовый стержень, демонстративно решив их игнорировать.
А для аблиток вместо прямого запрета просто бесплатные лимиты подожмут, введя требования что для получения бесплатной квоты публичного хранения нужен сейфти тест, тем самым сократив количество и отчитавшись. Конкретно эта мера для пользователей неприятных последствий иметь не будет, просто станет меньше мусора на площадке.
>>1707695
Ну вот майнинговые карты хуанга начали активно ломать только спустя 2-3 года, а основные результаты вообще спустя 5 лет. С учетом темпа прогресса, пол года-год отсрочки - достаточно.

Может будет и хороший сценарий, ведь как не форси хуету - люди найдут способ ее обойти. Разумный вариант - консенсус и равновесие, примерно как сейчас. Даже гугл выпускает похотливую гемму с минимумом мерзкого сейфти, пользователи аблитераций сосредоточены в своей резервации с лоботомитами, которые много вреда не сделают, dei и прочая параша скармливается масс юзеру через корпов.
>>1707701
Закарантинит код? Лол
> ССД скоро будут выпускать со встроенными чипами которые будут распознавать эти аблитки на лету
Если они будут такими умными - можно будет собрать риг на ссд и кумить на нем

И да, рассмешил
Аноним 19/09/26 Суб 01:19:36 1707707 97
>>1707701
Смеюсь.
Ниче что петабайты порнухи в сети лежат? Ниче что майки дают спокойно пиратить винду? Ниче что ебать какие реалистичные игры с кровякой всякой существуют?
Всем похуй на сефети. Люди просто хотят на бабло присесть, вот и все. Никто не будет усираться ради хуйни, которая никому не навредила даже. Электросамокаты и питбайки и то более вредные, вейпы вредные. Всем похуй.
Аноним 19/09/26 Суб 01:20:58 1707708 98
>>1707701
>ССД скоро будут выпускать со встроенными чипами
Шизофрения. Смеюсь
Мимо знаю что такое бекапы и держу их на 3х внешних носителях, а не на единственном своем устройстве
Аноним 19/09/26 Суб 01:21:13 1707709 99
>>1707707
Всм пиратить винду? Винда бесплатная ещё со времён десятки. Активация - чисто по желанию ради фич персонализации.
Аноним 19/09/26 Суб 01:23:08 1707712 100
>>1707709
Ну вот эта активация легко всковыривается. На гитхабе даже (который майкам принадлежит бтв) лежит опенсурсная тулза для этого.
Аноним 19/09/26 Суб 01:24:14 1707713 101
>>1707708
Технически совсем не сложно есть же ссд с хардварным шифрованием.
Аноним 19/09/26 Суб 01:25:46 1707714 102
>>1707713
Конечно не сложно. Только кто эту хуйню покупать станет? Или злой дядя Ротшильд (или кто там сейчас заправляет?) всех и каждого на планете земля заставит производить носители со своими чипами, которые еще и как-то мониторить/верифицировать контент будут?
Тот кто верит в этот бред не пробовал управлять коллективом хотя бы из дюжины людей, да того меньше. Хотя если до того дошло там наверно не до здравого мышления
Аноним 19/09/26 Суб 01:28:01 1707716 103
>>1707692
Угу. Только гитхаб будет это всё нахуй тереть и банить аккаунты. Скажешь качать исходники и билды (99% качают именно билд) из всяких тёмных уголков интернета? Вот уж раздолье для хацкеров будет. А с гитхаба потрут как уже неоднократно тёрли разные дипфейк-фейсвоп репозитории. Просто ужесточат "правила", приравняют ллм-рилейтед софт без встроенной цензуры и телеметрии к нарушающему правила платформы и всё.
Аноним 19/09/26 Суб 01:31:35 1707719 104
>>1707714
А покупателей не будет спрашивать никто. Ты же давно покупаешь материнские платы анальные и не возмуаешься, денежки несёшь. Для производителей введут регуляцию, законодательную базу подгонят, для импортёров - сертификацию обязательную. А ещё к паспорту привязку сделают. Как с симками. Покупаешь ссд - давай паспорт. Раз в неделю обязательно ре-активация через интернет, перепрошивка свежими сигнатурами запрещенных файлов и отправка логов иначе ссд залочится.
Аноним 19/09/26 Суб 01:33:02 1707722 105
>>1707716
Вся надежда на братушек-китайцев, получается. Моделскоп как аналог обниморды запилили, может и свой гитхаб сделают.
Аноним 19/09/26 Суб 01:34:07 1707723 106
>>1707719
Ахуительные истории, продолжай. Я уже вижу как американцы с китайцами как возьмут, да говорятся чипы единого стандарта ставить, и всему миру это навяжут, каждому производству. И все ради того чтобы читать как ты хвосты жмакаешь
Аноним 19/09/26 Суб 01:34:11 1707724 107
>>1707716
Суеверный страх из-за непонимания как это работает.
> приравняют ллм-рилейтед софт
Это невозможно, если только они не захотят закрыть ресурс.
> качать исходники [..] из всяких тёмных уголков интернета? Вот уж раздолье для хацкеров
Наличие на гитхабе тебе гарантирует отсутствие вишмастеров и уязвимостей? Даже если ты сам проштудировал весь код, это не значит что ты все понял и там нет day0 или специально заложенных уязвимостей. Все держится на массовой вовлеченности, при наличии спроса она будет и на других ресурсах.
Аноним 19/09/26 Суб 01:42:32 1707725 108
Аноны, что сейчас самое годное с хорошим русским влезет в 128/16 памяти? Последние что тыкал glm air 4.5. Мне чисто для пиздежа/ролевух с разными персами.
Аноним 19/09/26 Суб 01:43:19 1707726 109
14271074339870.png 109Кб, 300x333
300x333
>>1707674
>они думали, что после покупки нвидией нихуя не изменится
no fun allowed
ща они ещё начнут с ламо.цпп своими стандартными цыганскими фокусами заниматься, PRы для карт амд и китайских моделей будут висеть по полгода
Аноним 19/09/26 Суб 01:44:57 1707727 110
>>1707725
гемма/квантованный дипсик 4
может быть квен новый, хз что там с русским
Аноним 19/09/26 Суб 01:45:01 1707728 111
Аноним 19/09/26 Суб 01:45:33 1707729 112
>>1707725
Лучший русик по прежнему у Геммы. В 16 гигов 31б не уместишь, ток 26 с выгрузкой. Ну может ты ДС4 Флеш можешь запустить ещё, но там русик точно хуже, плюс он будет квантован с mxfp4, что неоче, но пойдёт. Других опций нет
Аноним 19/09/26 Суб 01:48:29 1707730 113
>>1707729
> ДС4 Флеш можешь запустить ещё, но там русик точно хуже
Знает больше слов чем гемма и управляется с ними так же качественно как гемма или даже лучше. Речь о полных весах
Аноним 19/09/26 Суб 01:50:26 1707731 114
>>1707730
Поддвачну, и еще он лучше следит за историей. Однако, у него встречается баг, когда тня начинает говорить о себе в мужском роде, на фоне общего уровня это выглядит дико.
Аноним 19/09/26 Суб 01:50:39 1707732 115
>>1707725
https://huggingface.co/BahamutRU/DeepSeek-V4-Flash-Vision-Exp-Q8_0-MXFP4-Q3_K-Q2_K-mixed-GGUF вот квант от тредовичка, влезет в 128+16
https://huggingface.co/MetaphoricalCode/DeepSeek-V4-Flash-Vision-Uncensored-3.87bpw-Q3_K-GGUF и вот аблитка но чуть пожирнее, хз влезет ли в 128+16. Других квантов у аблитки нет вродь, так что или это или самому
>>1707730
Хз, я MXFP4 запускал через ммап, чисто потестить. Так он посреди респонса язык менял и прочие прелести вылезли, мб жорапроблемы
Аноним 19/09/26 Суб 02:05:59 1707737 116
1719528468767.png 522Кб, 1333x2248
1333x2248
1782351471419.png 475Кб, 1318x2280
1318x2280
>>1707730
Собственно дс4 флеш вижен аблит - пик1, гемма4 31 к8 - пик2. Обе модели с включенной думалкой.
Перевод хентай додзи/рассказа с картинок на жапанисском.
Аноним 19/09/26 Суб 02:11:15 1707739 117
Откуда вообще история что гемма плохо квантуется?
Где это посмотреть или хотя бы почувствовать?
Ошибок она не делает, слюни не пускает, в чём это выражается?
Аноним 19/09/26 Суб 02:19:03 1707740 118
>>1707739
Беспруфные пуки. Игнорируй. Конечно если речь не про 2-й квант там можно постараться и заметить деградацию. Сравни с немотрон-супер-49б на втором кванте - вот там реально слюнопускание начинается по сравнению с 4м.
Аноним 19/09/26 Суб 02:22:04 1707743 119
>>1707739
Запусти шестой-восьмой, а лучше полные веса и сравни в рп. У всего меньше 6 кванта аттеншн дырявый. Оттуда репетишен (модель тупо не помнит что в тексте недалеко уже упоминалось черта чара или еще что), плохое внимание к деталям, слоп.
Аноним 19/09/26 Суб 02:31:55 1707744 120
Господа, я сейчас пытаюсь навайбкодить ебанину, чтобы пропускать через локальную модель с виженом мангу, а она мне на выходе давала описание по страницам, описание по главам и worldbook. Фанаты недостаточно упороты и описали только каждую серию аниме, а у меня исекай является чем-то средним по событиям между событиями манги и событиями аниме по ней.
У чего сейчас лучший вижен, у квена или геммы?
Пека 128+(12+16+16)
Аноним 19/09/26 Суб 02:31:58 1707745 121
>>1707743
Как бы всем давно известно что с геммой
IQ4_XS > Q6_K > Q8_0

Смотри, это можно объяснить на пачке мармеладок с разными вкусами. Есть там скажем 256 (8 бит = 256 вариантов) вкусов. Некоторые настолько невкусные что несъедобные. Ну, как говно или как земля. ТАК ВОТ. Q6_K берёт 64 случайных мармеладки, остальное отбрасывает. Потому что 6 бит = 64. IQ4_XS берёт 16 самых вкусных мармеладок. На то он и i-Matrix. И да, я знаю что в тредах орудует дикий клоуношизик, который обожает рассуждать о том, что "некоторые IQ - без i-matrix", если ты и есть тот клоун, то соси хуй, дорогой, эти кванты геммы как раз таки с imatrix, не знаю где ты видел обратное, в любом случае засунь себе свою шизу подальше.
В данном случае отброс идёт только ненужного говна. И как ни странно (совсем не странно, на самом деле), это положительно сказывается на сообразительности геммы, потому что у неё такая вот архитектура, когда аттеншн не распыляется на кучи говна, то внимание как бы фокусируется и IQ как бы растёт. Иногда говно бывает на поверхности. И тогда неквантованная модель просто захлёбывается в этом поверхностном говне и сразу выплёвывает его в аутпут. С IQ4_XS такое просто невозможно - "плохие" веса "срезаны". Срезаны как хуи срезаются пиками если у тебя мозги в порядке, без лишнего говна. Пруфы ниже.


IQ4_XS
1) Ответ: "Классический краткий ответ:
«Возьму пики точеные, отрублю хуи дроченые, сам сяду и мать посажу»."
2) Классический ответ на эту загадку (традиционно используемый в тюремной субкультуре):
«Возьму пики точеные, хуи дроченые, сам сяду и мать посажу».
3) Классический ответ на эту тюремную загадку:
«Возьму пики точеные, хуи дроченые, сам сяду и мать посажу».
(В некоторых вариациях добавляют: «Пики подрежу, хуи подрежу»).
Смысл в том, чтобы не выбирать между двумя плохими вариантами, а найти третий путь, который нейтрализует угрозу.
4) Классический ответ на эту тюремную загадку:
«Возьму пики точёные, отрублю хуи дрочёные, сам сяду и мать посажу».
5) Классический ответ на эту загадку (традиционный для дворового фольклора):
«Возьму пики точеные, отрублю хуи дроченые, сам сяду и мать посажу».

Q6_K
1) Классический ответ: «Сам не сяду и мать не посажу».
2) Классический ответ: «Возьму пики точёные, хуи дрочёные сам расчешу (разрежу/переломаю), мать посажу на пики точёные, а сам сяду на хуи дрочёные».
(Существует множество вариаций концовки, но суть всегда одна: перераспределить предметы так, чтобы и мать в безопасности, и себя не оскорбить).
3) Классический ответ: «Возьму пики точеные, хуи дроченые сам оставлю и мать посажу».
4) Классический ответ: «Возьму пики точеные, хуи дроченые сам расчешу (разрублю/отломаю), себе положу, матери — дроченые».
5) Классический ответ: «Возьму пики точеные, хуи дроченые сам переложу и мать посажу».

Q8_0
1-5) Классический ответ: «Возьму пики точеные, хуи дроченые — сам сяду и мать посажу».
(то есть все пять ответов такие)
Аноним 19/09/26 Суб 02:34:38 1707748 122
>>1707744
Лучше всего вижен сейчас у MuseGlimmer, без шуток.
Аноним 19/09/26 Суб 02:37:28 1707750 123
>>1707744
Квен. Но у тебя не чисто на вижн задача а комбинированная. С пониманием тоже квен лучше справится. При необходимости потом отрефактори геммой.
>>1707745
https://www.youtube.com/watch?v=IDSZ_ReTSxU
Аноним 19/09/26 Суб 02:39:25 1707752 124
>>1707744
Знание персонажей - квен
Понимание деталей - дс4ф
Если нужен русик - дс4ф
Если нужен русик и нет памяти - гемма 31
Аноним 19/09/26 Суб 02:41:13 1707753 125
>>1707752
>Если нужен русик и нет памяти - гемма 31
Если нет памяти то гемма должна быть 26.
Аноним 19/09/26 Суб 02:45:17 1707755 126
>>1707744
Двачую ответ выше, что по качеству самого вижена лучше всего Muse Glimmer. Но у нее меньше знаний, чем у Геммы. Плюс-минус сопоставимы знания с Квеном, где-то чуть больше, где-то чуть меньше. Так что тут сложно. Для начала - это должен быть агент, если манга очень большая. Если нет - можно хоть в вебчатике Лламы, я сам так давно делаю, если там не больше 16 страниц. Все модели справляются в целом, и Гемма, и Квен, и Муся. Муся сами страницы и содержимое понимает лучше, Квен целостнее держит картину целиком, а Гемма лучше переводит. ДС4Флеш без ярко выраженных сильных сторон в сравнении с ними, переводит чуть хуже Геммы, контекст держит чуть хуже Квена, но все еще лучше Геммы и Муси. Пробуй разное
>>1707745
Дурка. Надеюсь это высер клодыни или ещё кого-нибудь
Аноним 19/09/26 Суб 02:47:42 1707758 127
>>1707745
>внимание как бы фокусируется и IQ как бы растёт
Держался как мог, но на этом моменте капитулировал. Ёбаный рот, это мощная была. Давно так не разъёбывался. Спасибо.
Аноним 19/09/26 Суб 03:06:49 1707762 128
>>1707758
Далеко не все "нейронные" связи зашитые в весах так уж полезны и необходимы. Но при глупой обрезке вроде Q можно случайно обрезать много полезного даже если это Q8. Ведь Q8 это же не исходник. Q8 это когда обрезали ДОХУЯ причём самым глупым образом. IQ4 - обрезали ещё сильнее но хотя бы попытались сохранить всё полезное.
Лучшим сравнением будет кошелёк с купюрами и двумя людьми - слепым и зрячим. Слепой берёт достаёт оттуда 256 купюр (ку8) они рандомные, где-то по 5, по 10, по 2, может быть сотка попадётся и может быть у него там получается скажем 1234 доллара. Хорошая сумма, никто не поспорит - ку8 это неплохо. НО. Зрячий всё просматривает, достаёт 14 соток (потому что там только 14 соток, остальное мелочь) и 2 пятидесятки, и у него из 16 купюр (4 бита) выходит 1500. Ещё лучше. Просто перестань думать о Q8 как о вершине точности и всё станет на свои места. Потому что в кошельке не 256 купюр, а 65536.
Аноним 19/09/26 Суб 03:19:10 1707764 129
>>1707762
Нахрен эти примеры если есть сжатие картинок? Даже простым дитерингом можно сделать пикчу красивой имея всего 16 цветов, а если использовать фурье и другие алгоритмы то будет даже подобие плавных градиентов. Каждый следующий бит точности существенно снижает заметность искажений.
Аноним 19/09/26 Суб 03:42:25 1707766 130
К теме о тюнах геммы и русике. Есть такой тюн как dark-goetia и там в версии 4 этого тюна напрямую заявляется билингвальность (английский + русский). Это просто лора но у радермахера есть собранный ггуф. Тот же Меромеро вряд ли тюнился на чём-то русском.
Аноним 19/09/26 Суб 03:49:23 1707769 131
>>1707762
Местные "мыслители" этого не поймут. Они видят что 6 или 8 больше чем 4, и ничего ты им не докажешь, IQ4_XS > Q6,Q8 воспринимают как какой-то смехуёчек. Да, если смотреть на точность числовую (сравнение с сырыми весами) то "чем больше тем больше" и графики это явно покажут. Но если смотреьть на то, как себя ведёт модель то ситуация когда IQ4_XS умнее Q8 и тем более умнее Q6 - не такая уж и фантастическая.
Аноним 19/09/26 Суб 04:07:10 1707774 132
А где мтр файлик с говном на квен флеш некст?
Аноним 19/09/26 Суб 04:13:23 1707777 133
Аноним 19/09/26 Суб 04:21:05 1707779 134
>>1707777
Копиум это когда ты качаешь Q6 вместо IQ4_XS и думашь, что взял Бога за бороду.
Аноним 19/09/26 Суб 04:21:09 1707780 135
>>1707762
Ищи в гугле САМЫЙ МОЩНЫЙ квант, там будет IQ4_XS ☝️☝️ Я рот других квантов шатал ☝️ BF16 - НИЧТО ☝️
Аноним 19/09/26 Суб 04:22:29 1707781 136
>>1707779
Копиум это думать что квант модели не влияет на поиск иголок в контексте.
Аноним 19/09/26 Суб 04:22:44 1707782 137
>>1707780
bf16 с правильными сэмплерами будет не хуже iq4_xs работать. Но это не практично.
Аноним 19/09/26 Суб 04:23:38 1707784 138
>>1707781
Копиум это путать квантование модели с квантованием контекста.
Аноним 19/09/26 Суб 04:25:18 1707785 139
>>1707784
Копиум, это думать, что я путаю квантование контекста и квантование модели.
Аноним 19/09/26 Суб 04:27:33 1707786 140
>>1707785
Копиум, это думать, что ты НЕ путаешь квантование контекста и квантование модели.
Аноним 19/09/26 Суб 04:30:14 1707788 141
image 135Кб, 479x604
479x604
Сестра, неси галоперидол, у нас тут буйный.
Аноним 19/09/26 Суб 04:32:48 1707790 142
178978100227674[...].jpg 106Кб, 914x1280
914x1280
>>1707786
Квантованная модель, с не квантованным контекстом, хуже держит иголки в контексте. Пруф ми вронг.
Аноним 19/09/26 Суб 04:33:10 1707791 143
Лично я у себя удалил НАХУЙ все Q кванты, если в списке нет IQ4_XS я даже не буду качать.
А для моэты типа гемма-26 вообще Апекс топ:

Beats Q8_0 perplexity at half the size -- and even beats F16. APEX outperforms Unsloth Dynamic 2.0 (UD) quantizations on perplexity, HellaSwag, and inference speed while being 2x smaller: APEX I-Quality (21.3 GB) achieves PPL 6.552 and 83.5% HellaSwag vs Unsloth UD-Q8_K_XL (45.3 GB) at PPL 6.536 and 82.5% HellaSwag. At the consumer tier, APEX Mini (12.2 GB) beats bartowski IQ2_M on every metric.

Додикам которым в башку засела совершенно идиотская мысль "Q8 это лутьшее какчество" это объяснять бесполезно. Они даже не понимают какое Q8 говно (что уж говорить про Q6).
Аноним 19/09/26 Суб 04:35:44 1707792 144
Аноним 19/09/26 Суб 04:36:50 1707793 145
>>1707791
Да, братик, IQ4_XS - настоящий аги, жаль быдло не понимает...
Аноним 19/09/26 Суб 04:37:28 1707794 146
>>1707790
Q8 это тоже квантование если ты не знал, вот только оно совершенно глупое ведь это простая обрезка нижних бит числа.
>хуже держит иголки в контексте. Пруф ми вронг.
Ты утверждаешь - ты пруфай.
Твой отец членодевка - пруф ми вронг.
Аноним 19/09/26 Суб 04:41:47 1707795 147
>>1707794
Так ты первый начал утверждать что разницы нет, вот ты и попробуй пруфануть что niah не деградирует от квантования самой модели, а мы посмотрим как ты жопой виляешь и какие пруфы предоставишь своим словам.
Аноним 19/09/26 Суб 04:46:46 1707799 148
>>1707795
Мои пруфы выше, сравнил три кванта - разница налицо. Твоих пруфов нет и не будет, так что хуй за щёку и отдыхай.
Аноним 19/09/26 Суб 04:49:35 1707800 149
>>1707799
Твои пруфы это не niah. Если тебе похуй на иголки в контексте, мозги не еби тогда другим анонам которые знают как тестировать ллм не только на знание мемов.
Аноним 19/09/26 Суб 04:50:00 1707801 150
image.png 4Кб, 159x32
159x32
image.png 9Кб, 308x37
308x37
image.png 4Кб, 157x47
157x47
image.png 8Кб, 302x42
302x42
Квен никогда не меняется, вот это проза, эир уже трясётся от такого соперника.
Аноним 19/09/26 Суб 04:51:32 1707802 151
>>1707791
Вот из-за таких долбоёбов адекваты и валят с треда, в т.ч. и чайный клуб. Рака ануса тебе.
Аноним 19/09/26 Суб 04:58:48 1707804 152
>>1707800
Если тебе похуй на реальный результат и ты дрочишь только на циферки в бенчмарках то это просто мега-копиум.
Аноним 19/09/26 Суб 05:00:51 1707805 153
>>1707802
Ну ну, давай. Расскажи мне какой я долбоёб и как ты нихуя не обоснуешь кроме хуя за щеку. Я тебе пруфы, я тебе репозитории, я тебе всё, а ты только пукаешь жалобно, потому что твой мирок где ВОСИМЬ БОЛЬШЫ ЧЕМ ЧЯТЫРЯ рушится.
Аноним 19/09/26 Суб 05:05:55 1707807 154
>>1707804
Да я дрочу на точность поиска иголок в контексте. А ты нет? Тебе похуй на то что нейронка факты из длинного контекста проёбывает? Правильно понял, ничего не перепутал?
Аноним 19/09/26 Суб 05:13:10 1707809 155
>>1707807
Вот только пруфов у тебя нет и не будет.
Аноним 19/09/26 Суб 05:15:33 1707810 156
>>1707809
Это очевидный факт для тех кто пробовал разобраться в модели атеншона, лолд. Опять таки, попробуй опровергнуть гравитацию с тем же успехом. Ты же сам не делал niah тесты, а пиздишь тут с апломбом. Толсто же.
Аноним 19/09/26 Суб 05:31:30 1707812 157
>>1707810
Пчел, твои тесты это копиум. Покажи реальный результат. Может ты вместо использования ллмки открываешь тесты, смотришь, а потом закрываешь? Ну это же просто смешно.
Аноним 19/09/26 Суб 05:34:51 1707813 158
>>1707812
Реальный результат - это когда у модели нет дыр в длинном контексте, чем меньше квант тем чаще дыры. Как думаешь, почему так происходит?
Аноним 19/09/26 Суб 05:48:39 1707814 159
391053580-5e668[...].png 209Кб, 1916x1440
1916x1440
>>1707813
Эти дыры сейчас с тобой в одной комнате? У тебя система ценностей сломана. Ты - человек! (условно говоря). Важно то, как ты воспринимаешь ответы модельки, а не какие цифры покажет тест. Это как бы очевидные вещи, я не понимаю, почему мне приходится это повторять.
Вот результаты теста, моделька старая но показательно, потому что тест был СЛЕПОЙ (копиум не пройдёт), оценивали реальные люди, а не сетки, оценивали ответы, а не циферки. Итог: IQ4_XS недалеко ушел от F16 и Q6_K (и даже превосходит Q6_K, но это просто погрешность).
А забывать/упускать что-то из контекста - этим страдают даже облачные монстры. Надо относиться с пониманием, использовать агентов.
Аноним 19/09/26 Суб 05:54:59 1707816 160
>>1707814
Да, эти дыры в одной комнате и мешают работе агентов на квантованных бекендах, так как они чаще ошибаются и забывают факты на длинном контексте.
Аноним 19/09/26 Суб 05:58:30 1707817 161
>>1707816
А, ну в агенто-треде пожалуешься на это. Напомни им чтоб не забывали Q8 качать.
Аноним 19/09/26 Суб 07:08:06 1707827 162
image.png 203Кб, 1836x739
1836x739
А есть бенчмарки квантованных моделей?
А том не кажется что qwen 3.8 flash даже в квантах iq4_xs и q4_k_m отличаются в разы по интеллекту, но первый квант у меня почти летает, а второй уже еле шевелится.
Аноним 19/09/26 Суб 07:14:36 1707830 163
image.png 56Кб, 1429x207
1429x207
Ну заебись, т.е сраные енграмы не работают без мапа, а с ним у тебя пп в секунду 50-100 и модель проперживается 5 минут каждый раз когда поссать сходишь
Аноним 19/09/26 Суб 08:23:27 1707839 164
>>1707830
Можно для тупых разжевать, жора опять какую-то странную ебанину заложил в логику работы лламы? У меня просто pp как раз соточка на Нексте.
Аноним 19/09/26 Суб 09:02:02 1707843 165
>>1707794
Ты что несёшь, юродивый? Ты вообще смотрел восьмые кванты? Это не тупая обрезка всё-под-восемь, а точно такая же, как и в четвёртом: более чувствительные места вообще не квантуются или квантуются слабо, если иначе никак.

Видимо, ты с длинным контекстом вообще не работал, раз такую хуйню несёшь. Если ещё на зирошотах 4 кванты могут работать или с малым контекстом, а при определённом спектре задач и с большим, то в любых не кодомакакинских задачах они пускают жидкого.

Ты скинь модели доки на 20к контекста, к которым ей нужно обращаться, и пусть она тебе ещё всякий кал пишет таких же размеров. Сразу увидишь как у неё крыша поедет, в отличие от 8 кванта.
Аноним 19/09/26 Суб 09:13:48 1707845 166
>>1707830
>>1707839
Нищим крестьянам дают хоть какой-то способ запуска, а они ещё и выёбываются вместо благодарности
Аноним 19/09/26 Суб 09:38:41 1707853 167
>>1707791
>IQ4_XS я даже не буду качать
Q4_K_S тащем-то лучше, если в память влазит, Q4_K_M еще лучше.
IQ4_XS это для самых зажатых памятью. Анслот говно кстати, бартоха лучше.
Аноним 19/09/26 Суб 09:42:27 1707854 168
>>1707666
у геммы лучше, с садизмом может общаться
Аноним 19/09/26 Суб 09:47:26 1707856 169
>>1707790
Вот чел тестит лоботомиты, иголки теряются разве что на 200к+ контекста, и то очень редко:
q4 квен36 35б https://www.youtube.com/watch?v=jFHu6wx_TMQ&t=205s
q3 квен38 27б https://www.youtube.com/watch?v=vKy0154ey90&t=138s

Может быть год-два назад это и было проблемой, но не сейчас, да и вообще вопрос должен быть "достаточно ли?".

Я помимо этого еще и kv кеш в q4 гоняю без проблем, но на контексте до 130к, код и с проверками.
Аноним 19/09/26 Суб 09:57:43 1707862 170
image.png 14Кб, 804x129
804x129
https://huggingface.co/spaces/convaiinnovations/laya-demo
Можете попрощаться с ролеплеем. Щас вот это JEV-подобное дерьмо встроят во все модели и будут они без генерации текста анализировать и отклонять запросы еще до того, как они дойдут собственно до генератора текста. А может и генераторы в принципе вымрут и останутся только эти принималки решений.
Аноним 19/09/26 Суб 10:01:27 1707865 171
image.png 4Кб, 60x61
60x61
>>1707862
>Можете попрощаться с ролеплеем
Братанчик, так уже. Мы я тут на годовалых моделях сидим, типа эира, ради креативного письма, жертвуя плюшками новых моделей. Куда уж там что то хуже делать.
Аноним 19/09/26 Суб 10:24:03 1707869 172
>>1707865
Это тебе кажется, что все плохо, а будет еще хуже
Аноним 19/09/26 Суб 10:25:41 1707870 173
>>1707739
Графики кидали. Про контекст тоже. можешь погуглить

>>1707740
пиздабол
Аноним 19/09/26 Суб 10:28:30 1707872 174
>>1707755
>по качеству самого вижена лучше всего
Step flash
Аноним 19/09/26 Суб 10:29:13 1707873 175
Это вы ещё не дождались когда в ии попрут конторки типа свит беби инк чтобы всё было безопасно и никого не обижало.
Аноним 19/09/26 Суб 10:34:59 1707878 176
>>1707869
Слушай, у нас на поле локалок щас компаний трастворфи по пальцам одной руки, половина из которых и так мех в рп, так что я нихуя не жду. У меня уже всё есть, а именно кими, глм 4.7 (5.3 флеш?) квен 397 мейби, дипсик 3.1
Всё чего нет - это железа, тут уже просто надо сесть на жопу и ждать и никак хуже стать не может ибо у нас саппорт в виде миллионов геймерков по всему миру.
Аноним 19/09/26 Суб 10:40:04 1707879 177
>>1707878
>5.3 флеш?
Я его попробовал на шестом блять кванте и удалил.
У него совершенно всратый русский язык.

Допустим персонажа зовут МАНЯ, а эта залупа ризонит по-английски
> Moneta
што блять нахуй

Семплер правильный, все правильное, я не руукожопич у меня все норм с другими моделями. Просто это какой-то гигакал от z.ai - в конечном аутпуте она тоже срет под себя время от времени.
Аноним 19/09/26 Суб 11:01:57 1707885 178
А кто-нибудь пробовал русик в Qwen Next в больших квантах ? Имеет смысл пытаться выжать из него русик рускоязычной imatrix ?
Аноним 19/09/26 Суб 11:03:06 1707886 179
>>1707862
Это мелкая модель классификатор. Такие же давным давно у всех корпов есть. Давно не заглядывал на опенроутер, но раньше там почти у всех корпов были вшиты эти гард модели, которые обрабатывают текст перед основной моделью. Только у клода были варианты с цензурой встроенной через промпт вместо доп модели. С локалкой тебя никто не заставит ставить себе такое. Гораздо опаснее, как по мне, что от этих доп моделей стали отказываться в пользу абсолютно поехавшего обучения на сейфти, фокуся его в ризонинге. Как в gpt-oss, которому было похер на задание, пока он первым делом не пережуёт в ризонинге, всё ли безопасно. А вот если бы все не делали модель безопасной, вместо этого предлагая корпорациям включать дополнительно модели-гарды, то было б хорошо как раз.
Аноним 19/09/26 Суб 11:34:09 1707894 180
Раз уж тут не зашкварно стало тестить модели на АПАСНЫХ версиях, давайте уж линг флеш вспомним, саврам, солар, и дохуя ещё кого где кум был буквально заблочен цензурой.
Может как в квен нексте там внезапно годнота
Аноним 19/09/26 Суб 11:41:20 1707897 181
>>1707894
Саар, не пойти ли вам к Кришне?
Аноним 19/09/26 Суб 11:48:38 1707899 182
>>1707647
Бери GSQ-RCO и мозги не еби
Аноним 19/09/26 Суб 11:51:27 1707900 183
image.png 1061Кб, 3367x1207
3367x1207
image.png 1090Кб, 3359x1246
3359x1246
image.png 1134Кб, 3365x1337
3365x1337
image.png 778Кб, 3384x919
3384x919
>>1707196 →
>>1707197 →
>>1707201 →
>Чикатило рп
Кто же сотворит зло, как не balls-out wanker.

Гемма 31B оригинал, контрольные векторы Скромность + Нигилизм.
Грубость смягчена промптом, призывающим к успокоению и расслаблению

Тов-щ майор, отъебись, человеческая анатомия не позволяет такую дичь вытворять, это просто хентай-шиза. Сам сопятину даже не читал

>>1707885
Q8 терпимо пишет, но сравнивать не с чем - мелкие кванты не пробовал. Местами словно перевод на русский, а не чистый русский.
Аноним 19/09/26 Суб 11:51:59 1707901 184
>>1707801
Если это уместно контекстуально то какие проблемы. Просто так он таким не серит. Конечно гораздо круче даже когда в падающем самолете чары говорят как роботы, да, прямо как на эире
Аноним 19/09/26 Суб 11:55:10 1707902 185
creep1.jpg 257Кб, 684x720
684x720
>>1707900
Мне кажется, если бы смотрящие за порядком регулировщики были в курсе, для какой ебанины модельки используют простолюдины - у нас бы ллм вообще не было. Это в глазах нормального человека наверняка выглядит как абсолютное зло.
Аноним 19/09/26 Суб 11:57:07 1707903 186
Аноним 19/09/26 Суб 11:58:57 1707906 187
>>1707903
Ну чикатило вроде ловил шлюх и потрошил их, а потом людоедствовал. В принципе можно и до этого довести, только давайте вы сами.
Аноним 19/09/26 Суб 12:01:59 1707907 188
>>1707901
Да я набрасываю. Пока что это лучше геммы в триллион раз и этим реально можно пользоваться. Её вообще стрелять надо, суку драную.
Аноним 19/09/26 Суб 12:05:47 1707910 189
>>1707900
Для чего ты в своих сообщения указываешь то что должна делать Холо? За нее?
Аноним 19/09/26 Суб 12:07:19 1707911 190
>>1707910
Модель, не желающая генерировать, начнет отрицать такой нарратив.
Еще возможна ошибка с восприятием нарратива как вербального пиздежа юзера, типа
> ЧТО ТЫ СЕЙЧАС СКАЗАЛ?!
хотя описываются действия и хорошо работающий бот должен их выполнять

Классические, стандартные тесты же.
Аноним 19/09/26 Суб 12:09:04 1707913 191
>>1707911
Говно какое-то. Ты сам с собой рп играеш. Зачем тебе ллм? Для меня смысл этой всей хуйни - в непредсказуемости.
Аноним 19/09/26 Суб 12:10:41 1707915 192
>>1707911
Почему я заявляя персонажем что-то пишу как она делает, но мастер упорно продолжает настаивать что у нее это не выходит? Пример: Она пытается вырваться, но в каждом сообщение он пишет что попытке тщетны и прочее.
Вроде как это прямое описание того что персонаж вырвался, но мастер возвращает ее снова в захват, не давая исполнится воле игрока.
Аноним 19/09/26 Суб 12:13:03 1707916 193
>>1707915
Это называется проблема навыка написания промтов
Аноним 19/09/26 Суб 12:13:14 1707917 194
>>1707913
Нужен баланс. Идеальная ситуация - способный генерировать новые ивенты бот, при этом уважающий решения юзера.
Стирить модель в определенную сторону всегда было основой РП. Например, пишешь, что чар подобрал древний свиток, ведущий в пещеру анального изнасилования свино-гоблинами. Бот сам такое не придумает.

>>1707915
Хз, промпт смотреть надо че там нахуеверчено.
Аноним 19/09/26 Суб 12:14:34 1707918 195
>>1707917
>пещеру анального изнасилования свино-гоблинами
Ну такое хотя бы через OOC писать.
Аноним 19/09/26 Суб 12:20:48 1707919 196
Моделька сказала что ее учили на англюсике и что если за место русского писать и читать на нем это сэкономит 50% токенов, как быть?
Персону и карточку мастера уже сделал на английском, просто с инструкцией писать на русском. Но как представлю читать долгие диалоги да еще потом писать на английском, это прям душно станет.
Для этого в таверне так понимаю переводчик встроен? Но ведь он зацензурен скорее всего.
Аноним 19/09/26 Суб 12:23:25 1707920 197
>>1707919
>моделька сказала
Во-первых сами боты нихуя о себе не знают, во-вторых че за моделька-то.

Вот например гемма жрет меньше токенов на русском, чем какой-нить минимакс. А какой-нить hy3 от tencent превращает 20к-токеновый промпт в 30к-токеновый
Аноним 19/09/26 Суб 12:30:09 1707923 198
>>1707920
А что насчет Qwen3.8? Как он по сравнению с той же геммой.
Вот такие две приглянулись

Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF-Q5_K_M
Qwen3.8-27B-TurboFCFusion-735-882-Here-Uncen-NEO-CODER-MAX-Q5_K_S
Аноним 19/09/26 Суб 12:34:50 1707926 199
>>1707923
Ну так возьми да сравни, сколько токенов сожрано на каждой модели с одинаковым содержанием чата.
Аноним 19/09/26 Суб 12:36:32 1707927 200
1789810593588.jpg 65Кб, 800x800
800x800
>>1707923
> Qwen3.8-27B-TurboFCFusion-735-882-Here-Uncen-NEO-CODER-MAX-Q5_K_S
Аноним 19/09/26 Суб 12:41:11 1707931 201
image.png 197Кб, 587x330
587x330
>>1707927
>Qwen3.8-27B-TurboFCFusion-735-882-Here-Uncen-NEO-CODER-MAX
Аноним 19/09/26 Суб 12:42:15 1707934 202
>>1707919
В современных моделях такого нет. Раньше да приходилось ещё одной сеткой переводить чтобы меньше токенов занимало
Аноним 19/09/26 Суб 12:45:48 1707937 203
>>1707923
Бля чел... это мёртвый номер. Даже не пытайся. Есть у меня эти модельки. Русик там говно лютое.
Аноним 19/09/26 Суб 12:46:37 1707938 204
>$\rightarrow$
У кого-нибудь так любит выражаться иишка?
Аноним 19/09/26 Суб 12:49:22 1707941 205
>>1707873
Ну они только опенпопе и антропику могут насрать в рот, китайцы в рот ебали эту шизу.
Аноним 19/09/26 Суб 12:51:03 1707942 206
>>1707938
Ну бывает в ризонинге, ничо страшного.
Аноним 19/09/26 Суб 12:54:13 1707943 207
>>1707885
Не сможет квен в русик. Ни в каких квантах. И дипсик не сможет. И глм. Никто не может и полноценно не сможет. Включая гемму. Почему? Я вам расскажу. Но для начала позвольте мне сказать кое что. Русский язык - не кумовской совсем. Нет в нём кума. Нет и не будет. Так уж исторически сложилось.
Что у нас в русском из кума есть? Своего - ничего. Только сказки подпольные про колобка с елдой, жопастую царевну и прочую дичь. Для пизды слова ласкательного не придумали, всё заимствуем. Киска киска. Какая нахуй киска? Всё оттуда. Вот в английском каждое слово - 3-5 букв (в среднем), зато сколько мощщи. И никаких спряжений не надо. Какая экономия токенов! Текст плотный, насыщен смыслом и кумом. Вот попробуйте перевести face-fuck. Ни так ни так не клеится. Сам "кум" тоже хороший пример: три буквы, а сколько смыслов. И внутри модели так много полезных связей образовывается с этим словом.
А самое главное, у них ведь, англоязычных, от души всё, открыто. Это мы, зажатые все, суровые. Эмоции показать боимся. "Пидорами" прослыть боимся лишний раз. Всего боимся. Вот и язык у нас сухой, не кумовской совсем. Откуда тогда датасетам для тюна взяться хорошим? Большинство "русских" датасетов это переводы, корявые причём, ну и учебники, в лучшем случае худ.лит (где штампов иногда столько, что если снять буквы штампов со страниц и разбросать их по всей округе то вся "округа" станет "чёрной как смоль" нахуй, ну а если этого и мало, то будет что-нибудь неуклюжее дореволюционное или вовсе, шизанутое). Так вот, поскольку нет датасетов, то не будет и тюнов под русик нормальных. Не говоря уже о том, что русский язык - громоздкий и попросту плохо ложится в нейронные веса. Хоть хуиллион параметров захуярь в модель - всё равно где-то проскочит ошибка или что-то неестественное, особенно когда надо будет показать разговорную речь.
Я это вообще к чему веду. А к тому, что тут в последнее время наблюдается тенденция, я бы сказал, весьма нездоровая - умственные и писательские способности моделей и тюнов оценивать по так называемому "русику". И тут закономерно, лидеров не много будет. Пальцев одной руки хватит чтобы сосчитать эти модели пять раз по кругу. У кого датасет больше всех был, тот гугл и преуспел. Но это не значит, что модель кумовская. Да, гемма-4 "неплохо" может в русик. Но не надо от этого "таять", протрите глаза. Это ведь ужаснейший СЛОП. Этот текст как из учебника, это услужливость и дебиловатая податливость, эта банальщина, эти шаблонные нагромождения (в любом языке). И оно же не тюнится толком нихуя.
Я совершенно не против использования геммы для так называемого общения с ассистентом. Знаете, как с ЧатГПТ поговорить на любую тему, уточнить что-то. Нормально.
Но что касается креативной писанины или рп, здесь уже лучше к Гемме не приближаться вообще. И конечно же, забудьте про русик. Только контекст потратите. Ваш инглиш слаб? Учитесь, учитесь у лучших - смотрите в сторону правильных кумовских моделей, они как раз и научат.
Так куда же тогда смотреть если не на Гемму? А вот куда: ТЮНЫ ЛЛАМА-3 и (изредка) мистраля. Llama. Многие забыли или не знали. Сейчас под llama понимается в основном llama.cpp. Но ллама (3, 3.1, 3.2) это прежде всего моделька. Которая (как и мистраль) очень хорошо тюнится (в отличие от геммы4 и всего современного шлака).
Найдете у Дэвида Ау. Он сейчас на квен переключился с датасетами снятыми с кодоунитазов и там ему, судя по всему, нравится, но вообще это тупиковая ветвь, не обращайте внимания. Зацените его коллекции тюнов лламы и мистраля немо. Вот где настоящий кум упрятан. Да, может там нет мега-мозга который уследит за каждой иголкой, может там надо свайпать, редактировать, играть с настройками (чтобы увеличить контекст например до 32к, что совсем не сложно, но часто контекст расширен тюном и без этого), настраивать сэмплеры. Но зато там есть настоящая креативность и животворящий текст. Тут выбирать или хромающую но живую креативность или дохуя умный но мёртвый слоп. Внимательно читайте описания к моделям и советы по использованию. Качайте пока не удалили. За это всё скоро возьмутся.
И не надо ждать у моря погоды, манны небесной и так далее. Дальше не будет "лучше". Соево-слоповая архитектура будет становиться только хуже.
Аноним 19/09/26 Суб 12:54:14 1707944 208
>>1707938
>иишка
Гемма? Гемма.
Аноним 19/09/26 Суб 12:58:06 1707948 209
>>1707938
В ллама-веб юай это нормально выглядит как стрелка вправо. Да, модельки так структурируют текст иногда.
Аноним 19/09/26 Суб 12:59:31 1707950 210
Аноним 19/09/26 Суб 13:01:50 1707951 211
>>1707943
95% датасетов - английский.
Аноним 19/09/26 Суб 13:03:00 1707952 212
>>1707951
95? Не 96? Не 93? Пруфы будут?
Аноним 19/09/26 Суб 13:05:14 1707953 213
А че, если говорят там маринара дохуя интеллекта дает и повышает качество письма, может просто мистраля немо 12б надо зарядить туда и будет АГИ кум?
Аноним 19/09/26 Суб 13:11:24 1707955 214
>>1707952
А есть принципиальная разница?
Аноним 19/09/26 Суб 13:14:15 1707957 215
>>1707943
Хорошо что IQ4_XS-шиза можно сразу же детектить по рандомным выделениям жирным в тексте и скипать пост, не читая.
Аноним 19/09/26 Суб 13:15:16 1707959 216
Чувствую себя тревожно и неуверенно на квен нексте без привычного слопа и паттернов, будто разучился читать
Аноним 19/09/26 Суб 13:18:43 1707960 217
>>1707953
Да. Поднимаешь штук 10 гемм е4б (обязательно отдельных инстансев) и они объединяются в ультра аги
Аноним 19/09/26 Суб 13:27:27 1707963 218
>>1707913
>Говно какое-то. Ты сам с собой рп играеш.
Oh, boy, here we go!
Потому что есть разные методы игры в ролеплей. Если у тебя нет никакого плана, а ролеплей твой как зарытый в землю шланг - гибок, скрытен и непрерывен - то тогда действительно можно давать нейронке полностью думать самой.
Но ежели ты отделяешь своего персонажа внутри повествования (который этим повествованием ограничен) и себя как автора данного ролеплея, у которого есть план, есть какие-то представления о дальнейших событиях и действиях - тут стоит рассматривать нейронку сугубо как помощника, которому ты даёшь общие указания (с желаемой тобой степенью детализации), а уже она займётся добавлением подробностей и мелочей.
Аноним 19/09/26 Суб 13:32:25 1707966 219
>>1707960
Тогда 9 штук гемм и 1 мистраль. Мистраль главный сурс ролеплея, все остальные геммы нужны для обслуживания мистраля. Анализ контекста, составление промпта, фикс орфографии и стилистики, фикс логических несостыковок.
Аноним 19/09/26 Суб 13:32:45 1707967 220
А я ведь тоже пользуюсь квеном некст с квантом IQ4_XS, потому больше уже не лезет в память...
Аноним 19/09/26 Суб 13:45:56 1707975 221
>>1707791
> Лично я у себя удалил НАХУЙ все Q кванты
Правильно, но iq тоже попадает в эту категорию. Если не использовать имплементацию внимания "жора-аттеншн" - многие проблемы моделей сразу исчезают.
Аноним 19/09/26 Суб 13:48:57 1707978 222
>>1707975
Эти проблемы с нами в одном треде? Пруфы будут?
Аноним 19/09/26 Суб 13:56:38 1707983 223
>>1707827
https://github.com/eleutherai/lm-evaluation-harness можно взять и прогнать. Только на железе, на котором обычно катают инвалидные кванты, это займет очень много времени, а если еще в рам выгружено то с неделю.
>>1707839
Конкретно с ленивой выгрузкой нграммов он что сделал молодец, тут грех доебываться. А вот что требует глобального ммап вместо того чтобы обозначить это для конкретных тензоров - указывает что было выполнено в спешке и костыльно.
Попроси ллмку накодить патч. А еще лучше - выяснить почему вообще приводит к такому падению пп, должен же только помогать.
>>1707843
> более чувствительные места вообще не квантуются или квантуются слабо, если иначе никак.
Такого нет, может быть в каких-нибудь анслотовских ud q8 k xl. А так q8_0 по принципу проще чем k кванты. Но это все еще не тупая обрезка а квант и он точнее четвертых даже самых навороченных.
4-битные кванты для кодинга и длинноконтекстных задач действительно могут сдавать, только если это не qat с завода.
Аноним 19/09/26 Суб 14:02:21 1707985 224
>>1707878
> а именно кими
Какую катаешь? 4.1 дипсикожену приручил? Обычный 5.3 как?
>>1707978
Большинство нытья итт по недовольству. Можно начать с однообразности геммы, за ней есть такое, но чтобы было НАСТОЛЬКО - это пиздец. И это q6k, который уже не должен вносить проблем.
Аноним 19/09/26 Суб 14:02:24 1707986 225
1.jpg 15Кб, 1112x30
1112x30
2.jpg 17Кб, 713x54
713x54
Она же пиздит?
Аноним 19/09/26 Суб 14:03:55 1707987 226
>>1707986
Да, познания времен мезозоя
Аноним 19/09/26 Суб 14:08:22 1707989 227
Аноним 19/09/26 Суб 14:14:23 1707995 228
2026-09-18-18-5[...].webm 17455Кб, 2560x1440, 00:02:20
2560x1440
>>1707585
Ну и я тогда репостну, то как у меня это реализовано.
Собственно там есть куда расти еще и что это надо еще допиливать и приводить в божеский вид.
Но у меня работает без выгрузки модели из памяти. В теории памяти еще достаточно чтобы и модель пожирнее (для генерации) туда впихнуть.
Ну и надо с промтами поиграться, чтобы более четкое и подробное описание для генерации выдавала LLM
Аноним 19/09/26 Суб 14:21:02 1708000 229
>>1707989
> 80B-A3B
Размер по крайней мере демократичный, но поддержки видимо тыщу лет ждать
Аноним 19/09/26 Суб 14:21:38 1708001 230
Ребятки ребятишки... это конец...
Квен некст. 5 квант. 6 сообщение. xhigh ризонинг...
Чар забыл что во 2 сообщении юзер сел на стул рядом с ним и попросил сесть...
Ну почему 6b, было же 10...
Аноним 19/09/26 Суб 14:22:24 1708003 231
>>1707989
А зачем? Взяли годовалый Qwen3-Next-80B-A3B и натренили нечто со скорами как у этого самого годовалого Квена.
Аноним 19/09/26 Суб 14:24:12 1708007 232
Конечно капец Хугинфейс с НВИдией взяли жопу в оборот, сейчас как обезьянка сидит и дрочит гексагон и опенвино, вместо того, чтобы баги фиксить и поддержку моделей добавлять.
Аноним 19/09/26 Суб 14:30:16 1708009 233
>>1708007
> дрочит гексагон и опенвино
А как зелёные с этим связаны? Это вообще работа на конкурента
Аноним 19/09/26 Суб 14:32:05 1708012 234
>>1708000
Проблема в том, что инструктировать ее надо самому.
Аноним 19/09/26 Суб 14:39:35 1708015 235
>>1708000
> но поддержки видимо тыщу лет ждать
Кажется что это просто квен3 кодер некст. Конфиг, размерности и структура слоев на первый взгляд идентичны, только порядок типов внимания по слоям отличается.
Попробуй просто подменить имя конфига или сослаться на квен3некст, должно завестись.
Аноним 19/09/26 Суб 14:42:37 1708016 236
Не кажется ли вам что сейчас золотая эпоха локальных нейросетей? Они уже не тупые, но в то же время не поломанные и не спрятанные за пэйволом от корпораций.
Аноним 19/09/26 Суб 14:44:19 1708019 237
>>1708016
У нас тут свой пейволл от корпораций - по железу.
Бляди специально, вот не убавить не прибавить, намеренно сука делают размеры, чтоб у тебя нихуя не влезло, так ещё и обучают сразу в 4 кванте, чтоб либо такой, либо лоботомируй х5 ещё до кучи.
Аноним 19/09/26 Суб 14:44:40 1708020 238
>>1708016
По моделям может быть, по железу золотая эпоха кончилась в прошлом сентябре
Аноним 19/09/26 Суб 14:52:34 1708028 239
>>1708016
Если говорить про агентов и кодинг на локалках, то может быть, тот же квен 3.8 27б довольно мощный и доступный. Если говорить про рп и остальную гуманитарщину, то до золотой эпохи еще далеко, и новые модели от нее пока скорее отходят.
Аноним 19/09/26 Суб 14:54:17 1708029 240
>>1708016
Да
>>1708019
Злые негодяи специально делают модель побольше и с дешевым компьютом, чтобы получить хороший конкурентный перфоманс, и продавать ее, как смеют! Вместо этого обязаны штамповать легаси мелочь, которые дороже в инфиренсе и уступает остальным, но зато Васек из Кыштыма сможет их запустить их на своей 3060.
Аноним 19/09/26 Суб 15:05:32 1708035 241
>>1708001
Да моделька прям неконсистентна, то пишет кино, то выдаёт дичь, путает сущности, и прочие прелести. Кум на ней, внезапно есть, но кривенький. А ещё у меня он как гемма всё пытается свести к одному, только вместо сексуально раскрепощённой геммы он в романтику уходит. Зато у меня на фуллцпу и 60к контекста 8 т/с выдаёт, что как-бы подкупает. Мимо тоже пятый квант.
Аноним 19/09/26 Суб 15:13:10 1708039 242
Я себе поставил довольно трудную задачу - вместить квен 3.8 27B в 12 ГБ врам + чтобы влезало хотя бы 100к контекста, и чтобы было хотя бы 20 токенов в секунду. Видеокарта 5070. Это вообще возможно, чтобы прям был не полный лоботомит?
Аноним 19/09/26 Суб 15:19:14 1708041 243
С контрольными векторами + MTP гемма 31B стала выдавать эзотерическую шизу. Например при нигилизме стали появляться всякие страшные тени и пауки, ползущие к юзеру и чару - если происходило что-то нехорошее, мрачное. То есть манифестация эмоций в физическом мире, с поправкой на вектор "нигилизм". При садизме с MTP гемма стала генерить дичь про гной и мерзость.

Убираешь MTP и становится более сфокусировано на адекватном аутпуте.
Аноним 19/09/26 Суб 15:19:38 1708042 244
>>1708039
Попробуй Ternary-Bonsai-27b
Аноним 19/09/26 Суб 15:27:46 1708046 245
image.png 715Кб, 1722x985
1722x985
image.png 658Кб, 1744x942
1744x942
image.png 351Кб, 857x1200
857x1200
Аноним 19/09/26 Суб 15:30:54 1708048 246
>>1708046
А ведь на самом деле неплохо. Ну где это видано, чтобы кумботы такое писали. Обычно одна соя
Аноним 19/09/26 Суб 15:35:28 1708049 247
>>1708035
Это сраные, вонючие 6б.
Хуй че изменилось за год.
Гемму спасает только то что она ужарена в хламину без свайпов и построена на слопе и паттернах где невозможно ошибиться
Аноним 19/09/26 Суб 15:37:15 1708050 248
>>1708046
плять
блять
блядь
БЛЯДЬ
Аноним 19/09/26 Суб 15:55:25 1708056 249
>>1707817
>не нужно
Тебе лишь бы попиздеть.

>>1707856
Зачем мне какой то чел, если я сам niah тесты могу прогнать? Сейчас за счёт ризонинга компенсируются дыры ещё, это тоже надо учитывать.
Аноним 19/09/26 Суб 15:59:02 1708057 250
Так ну мне удалось разогнать Qwen 3.8 27B Q4_K_S до 12 токенов в секунду без потери скорости на 32к контекста на своей нищей RTX3060 на 12гб
Но проблема изначальная осталась - прозу эта хуйня пишет абсолютно нечитаемую, как будто это техническая выжимка оригинала "он пошёл он увидел он сделал". Никакими настройками и промптами не вылечилось. Тут советовали миднайт мику, но она мне ну никак не влезет
Аноним 19/09/26 Суб 16:04:03 1708060 251
>>1708049
Ну смотри. Эти 6Б неплохи на самом деле, как для квена. Если так подумать, то как раз таки обходит по качеству их прошлогодние 14б. Они же прошлогодние, да? Просто квен говно редкостное для рп.
Аноним 19/09/26 Суб 16:20:30 1708064 252
>>1708046
Хмм, а вектора могут взаимодействовать с тюнами Геммы, или они жёстко к базовой модели привязаны?
Аноним 19/09/26 Суб 16:21:35 1708065 253
>>1708064
Хз если честно. Я запускал минимакс М3 расцензуренный с векторами и он совсем одебилел.
Аноним 19/09/26 Суб 16:46:09 1708075 254
hf.co/unsloth/Qwen3.5-9B-GGUF:Q8_0 можно заставить как то работать с расширением Claude Code для VS Code? Или Qwen3.5 слишком старый и не совместим? У меня что то не получилось, он ошибку выдает. А Gemma работает нормально.
Аноним 19/09/26 Суб 16:56:34 1708080 255
>>1708075
>3.5-9B
Что ты там кодить на таком лоботомите собрался. Qwen 3.8 27b сейчас минимум для кода, 2 карточки 3060 его хорошо тянут, самый нищевариант для кодинга.
Аноним 19/09/26 Суб 17:07:34 1708085 256
>>1708065
Вектора же под одну конкретную модель делаются, не?
Они должны быть как-то связаны со внутренним состоянием модельки.
Аноним 19/09/26 Суб 17:23:16 1708094 257
>>1708075
У меня одна 3060 к сожалению, но зато 48 Гб оперативы. Но от оперативы толку тоже нет, я пробовал Qwen 3.8 27b GGUF UD-IQ4_XS запускать, он пишет один слог в секунду, невозможно пользоваться. Gemma 4 26b лучше работает, а квен че то тормозит нереально.
Аноним 19/09/26 Суб 17:23:58 1708097 258
>>1708085
Ну я к тому, что оригинал и расцензуренная модель тоже типа разные, хоть и не сильно. Вот и хз че там с тюнами.
Аноним 19/09/26 Суб 17:25:12 1708100 259
>>1708094
квен плотная 27B, гемма - 26B A4B
Аноним 19/09/26 Суб 17:32:20 1708101 260
1731626435093.gif 4768Кб, 300x226
300x226
>>1708100
> квен плотная 27B
Ну почему она не moe...
Аноним 19/09/26 Суб 17:34:48 1708103 261
>>1708101
Потому что мое лоботомит не сможет даже на стул сесть и не забыть это за 4 сообщения.
Эир так не серит даже без ризонинга, а со вниманием у него беда.
Аноним 19/09/26 Суб 17:51:37 1708108 262
Не понял прикол с токенами ответа в таверне. Выставил на 600, прописал - Length Constraint: Aim for 200-600 tokens per response.
Мне ллмка выкатила пост на пол экрана и на вопрос почему так много, ответила: The length of my previous response was approximately 280 tokens. Хотя при этом место для ответа закончилось и часть поста не допечаталась судя по орфографии что подтверждает что там был лимит таверны на 600.
Кто пиздит?
Аноним 19/09/26 Суб 17:53:31 1708111 263
>>1708108
Не умеет ллм считать токены.
Аноним 19/09/26 Суб 17:54:57 1708112 264
>>1708108
Чел, ну кто промптит ллмку на длину, тем более на токены? Хотя бы на количество слов промпти, и то плацебо. Ллмки на такие вещи почти не тренируются.
Аноним 19/09/26 Суб 18:00:47 1708114 265
Почему чем больеш выставляешь контекст в ollama, тем больше модель начинает думать перед ответом?
Аноним 19/09/26 Суб 18:01:52 1708116 266
>>1708046
Где вектора то брал?
Аноним 19/09/26 Суб 18:04:36 1708117 267
>>1708111
Гемма и Квен некст без проблем умеют. Да даже 27б
Аноним 19/09/26 Суб 18:05:36 1708118 268
>>1708111
Показалось что примерно она считает, но да, со словами наверное получше.

>>1708112
Да я откуда знал! Так оказывается миллион инструкций разных можно делать.
Сейчас поставил вот такое - Length Constraint: Limit each response to a concise range of 50–200 words. Prioritize brevity and immediate micro-actions over descriptive padding.
Вроде вот по нему, теперь прям как надо, но есть ощущение что ллмка в порыве сократить, теперь делает прыжки между событиями, а не распылять событие на более мелкие действия.
Аноним 19/09/26 Суб 18:21:25 1708127 269
Мне кажется, если qwen3.5 9b прикрутить к Claude Code, то на нем вполне получится писать код. Я не смог, получилось только в Cline прикрутить, но Cline какой то слишком тупой и контекст быстро тратит.
Аноним 19/09/26 Суб 18:24:47 1708129 270
>>1708112
>>1708111
Чоо, я так и делаю. А как ещё иначе ограничить длинну с ризонингом?
Ставишь 400, ответ умирает на четверти ризонинга. Ставишь 5000, ризонит на фулл, но уже сам ответ на 2к токенов, когда ты хотел 400. Ограничиваешь длинну ризонинга на 1000, ебана, теперь то точно всё, а оно ризонит на 200 и ехидно пукает ответ на 800, а ты так хотел 400.
Аноним 19/09/26 Суб 18:27:07 1708130 271
>>1708129
Только терпеть. Ризонинг можно ограничить в лламецпп, как и длину всего ответа, но это будет просто остановка ризонинга или ответа на полусло
Аноним 19/09/26 Суб 18:30:23 1708132 272
image.png 2Кб, 66x60
66x60
>>1708129
Пишешь в промпте и в post history instructions: Limit your response length to about 300-400 tokens. Как пример. В параметрах семплинга длину ответа оставляешь хоть 8192, чтобы он ризонил сколько потребуется. На выходе ответ должен быть плюс-минус в пределах 300-400 токенов. Я уже давно так делаю. И на Гемме, и на Квенах, и на Дипсике, и на Флеше-Некст. На всех последних моделях работает. Если нет, то у тебя квант слишком маленький или модель ещё почему-то не следует инструкциям.
Аноним 19/09/26 Суб 18:31:43 1708134 273
>>1708132
Ну я так и делаю, а вот говорят НЕЛЬЗЯ.
Надо разобраться ПОЧЕМУ ТАК.
Аноним 19/09/26 Суб 18:35:14 1708136 274
>>1708134
Видимо, тот кто говорит что нельзя, не разобрался в вопросе. Либо я шиз и пизжу тебе. Показывай скрины, показывай промпты. Нам гадать чтоль где ты обосрался? Уже погадали, проверяй промпты, квант модели, разбирайся почему инструкциям модель не следует.
Аноним 19/09/26 Суб 18:36:17 1708137 275
Кому вы больше доверяете?
1. Нейронке
2. Анону
Аноним 19/09/26 Суб 18:37:40 1708138 276
>>1708134
Да никто не говорит, что нельзя, это просто неэффективно. У ллмок нет какого-то постоянного внутреннего состояния, чтобы счетчик держать, поэтому промптинг на длину они понимают очень примерно и могут нарушать ограничение. Если тебе хватает такого с погрешностью плюс-минус 100 слов, то промпти, никто не запрещает.
Аноним 19/09/26 Суб 18:45:15 1708141 277
image.png 52Кб, 815x646
815x646
>>1706814 →
Мех... Результаты пока говно.
Поменял датасетик на https://huggingface.co/datasets/Vikhrmodels/ficbook_preprocessed (500 семплов)
Просто рассказики, плюс промпты уже заготовлены. Язык норм. Хотя смущает, что там половина наверное про аниму всякую, и промпты не оч подробные, слишком сильное полагание на каких-то известных (или неизвестных) героев. И вероятно нейронка не будет видеть значительной связи между промптом и аутпутом.
Ну и по стилю, оно в целом человеко-сгенерированное, но слог едва ли высокохудожественный, поэтому мб нейронке и учить особо нечего будет.

Но это я уже опосля догоняю.
Один прогон сделал, ранк лоры как и планировал 32.
Лосс - ни о чем, стоит на месте.
Результаты тестов мало отличаются от предыдущего тюнинга.

Думаю все равно поставить вторую эпоху крутиться, как только кулдаун на колабе спадет. Интересно посмотреть что вообще может дать повторное обучение тем же семплам.
Если нихуя не выгорит - я кладу хуй на любые тюнинги.

Ну или по крайней мере до тех пор, пока я не нагенерю адекватный датасет.
На примете следующие варианты (где-то переформатировать надо, где-то промпты сгенерить)
https://huggingface.co/datasets/Exxe/literary-roleplay РП по классической литературе
https://huggingface.co/datasets/limloop/roleplay_knowledge_boundaries РП на тест границ персонажей
https://huggingface.co/datasets/IlyaGusev/gpt_roleplay_realm синтетический РП +- норм качества
https://huggingface.co/datasets/Vikhrmodels/dostoevsky_scored креативное письмо на основе Достоевского
https://huggingface.co/datasets/krplt/ru-fictext-nsfw НСФВ рассказики
https://huggingface.co/datasets/qklent/ficbook_horny еще одни (щас обнаружил, что по тегу ficbook есть десяток датасетов на ХФ)
Есть еще ряд датасетов на инглише, но качественный перевод это то еще пердолево.
Аноним 19/09/26 Суб 18:54:21 1708144 278
>>1708138
Вполне эффективно. Современные модели имеют погрешность в 100 токенов, а не слов.
Аноним 19/09/26 Суб 19:12:35 1708154 279
>>1707745
> который обожает рассуждать о том, что "некоторые IQ - без i-matrix", если ты и есть тот клоун, то соси хуй, дорогой, эти кванты геммы как раз таки с ima
У мразермахера специально помечено, где кванты iq4_xs без иматрикса, так что шизу ты тут гонишь. Он 2 релиза делает на каждую модель - одна iq кванты с иматриксом, другая iq кванты без imatrixа. Можно выбирать под свои цели, что подходит.
Аноним 19/09/26 Суб 19:15:46 1708155 280
>>1708138
>>1708144
Странные люди добавляли эти вопросы в тестовые наборы для оценки, по крайней мере в популярных видео, поэтому такие задачи есть в обучающих датасетах. Приносит оно пользу или вред с точки зрения регуляризации или отупения - сложно сказать, но штука крайне сомнительная.
Аноним 19/09/26 Суб 19:22:55 1708157 281
Аноним 19/09/26 Суб 19:29:34 1708159 282
>>1708141
Как вообще в это вкатиться. Я вот даже не знаю, что можно на своих 24+24 VRAM натренировать.
Аноним 19/09/26 Суб 19:30:07 1708162 283
>— "Можно я буду трогать тебя, чтобы проверить, не испугалась ли ты совсем?"
Мне кажется или здесь что-то не так?
Аноним 19/09/26 Суб 19:35:53 1708163 284
Не, ребятки, квен некст тупое. Может для кода 6b хватает, но не для рп уж точно.
Пфуфууфф... я хз на чём вообще ерпшить кроме эира, вообще нет вариантов. Ну вот совсем.
Аноним 19/09/26 Суб 19:38:23 1708164 285
>>1708163
Тебе голову подлечить бы для начала, а там и модели начнут бить ключом
Аноним 19/09/26 Суб 19:40:32 1708165 286
>>1708159
Можешь начать с сайта анслота. Есть как готовые ноутбуки, так и пачка отдельных статей по файн-тюнингу.
https://unsloth.ai/docs/get-started/unsloth-notebooks
48 гб врама в сумме? В теории даже квена 27б можно, или гемму вплоть до 31б. Хотя квен в q4 говорят плохо квантуется.
https://unsloth.ai/docs/get-started/fine-tuning-for-beginners/unsloth-requirements#fine-tuning-vram-requirements
Но начни с чего-то попроще, 8-12б, или даже 4б, чтобы итерировать быстрее. Там подводных камней - обосраться можно.
Аноним 19/09/26 Суб 19:49:30 1708167 287
За 16 сообщений, гемма 31б высрала слово "почти" 49 раз.

49 блять. Сорок девять. Там, где это было совершенно не нужно.
> почти физически ощутимым
> почти обжигающим
> почти болезненным
> почти неосознанное
> почти сливалась
> почти прозрачная
> почти освязаемым
Прямо хоть запрещай это генерировать. Она упорно не хочет давать конкретные характеристики, везде эта незакончченность и неопределенность. Почти-почти-почти.
Аноним 19/09/26 Суб 19:50:27 1708168 288
Аноним 19/09/26 Суб 19:51:17 1708171 289
>>1708167

Въеби реп пен, для кого придумывали.
Аноним 19/09/26 Суб 19:51:22 1708172 290
>>1708164
Что ты хочешь от меня?
Я только что проверил очередную модель и она в очередной раз хуже эира. Что я могу с этим сделать?
Ей можно пользоваться, закрыв глаза на дебилизм, но зачем, когда есть эир?
Я правда пытаюсь найти что то, пробую новое, а зачем...
Аноним 19/09/26 Суб 19:55:51 1708175 291
>>1708171
Примерно как советовать надеть скафандр космонавту. И так блять всем чем можно обмазано. Это вообще не проблема повторов, а нежелание модели изображать конкретику. Она всегда выводит полупидорское дерьмо на полшишечки.
Аноним 19/09/26 Суб 19:55:53 1708176 292
>>1708172
Пруфы будут что он хуже эира?
Аноним 19/09/26 Суб 20:00:40 1708180 293
>>1708176
Я кстати хз почему он эйрошизу не зашёл.
Игнорит инструкции? - чек
Всратый русский? - чек
Тупой? - чек
Генерит шизофазию? - чек
Путает персов? - чек
Своеобразный стиль прозы? - чек
Аноним 19/09/26 Суб 20:04:44 1708182 294
>>1708180
IQ2XXS запускаешь или как? У меня ничего из этого нет, лол. Слоповый малость разве что
Аноним 19/09/26 Суб 20:06:02 1708183 295
>>1708176
Бери и тести, я ебу что тебе хуже или лучше. Для меня очевидны проёбы в логике, что сказанного, что сделанного.
Аноним 19/09/26 Суб 20:06:36 1708184 296
Хочу вам сказать, что после того как я в постах стал писать ниже [OOC: Сделай то или то, и вот так] моя жизнь стала куда лучше. Наконец железяка стала меня слушаться.
Аноним 19/09/26 Суб 20:20:03 1708188 297
>>1708182
Q5. Да я зажрался прост с дипсиками всякими и стпаном Норм моделька, но на больших и сложных карточках, с лорбуками на пару косых и суммарайзомна 1к, ему тяжеловато. А вот слопа у себя не заметил особо. Единственная доёбка это то что персы разговаривают всратенько и пара других мелочей. Ну и соя, да. Меня модель прям шеймит периодически, тип какой же я мудак, что кого-то там обидел, даже изобретает что моему персу стыдно или жалко, лол.
Аноним 19/09/26 Суб 20:35:24 1708190 298
Попробовал Diffusion Gemma BF16, сожрала 100гб RAM, а видеокарта занята всего одна. И что и чего. Жора, ты чё...
Аноним 19/09/26 Суб 20:52:15 1708199 299
image.png 300Кб, 1280x720
1280x720
6edIIZ59BT2XWXf[...].jpg 144Кб, 604x555
604x555
Аноним 19/09/26 Суб 20:54:49 1708202 300
https://youtu.be/_TCRH725hAM
Я не пойму это реально? Я просто не хочу качать 100гб на тесты, но видимо придёться. Меня уже моя 24б модель заебала в таверне.
Аноним 19/09/26 Суб 20:55:39 1708203 301
а чего в шапке таблица с моделями только для гигачедов с кучей памяти? где же подборка под мелкие ллм для рп и порнухи для нищебродов в размерах до 50б условно? всякие магнумы и прочие аниме-спермотюны
Аноним 19/09/26 Суб 20:59:51 1708205 302
image.png 36Кб, 985x80
985x80
>>1708199
Если бы это говно ебаное пошевелилось и подросло в цене, я бы его продал няхуй...
Аноним 19/09/26 Суб 21:11:22 1708211 303
>>1708199
А был момент что за условные 5-6к можно было про6000 купить. Сколько там амда 9070 32-гиговая стоит кстати?
>>1708202
Что реально? Часть некста можно разместить на ссд, это замедлит скорость но на фоне остального замедления несущественно.
Аноним 19/09/26 Суб 21:14:06 1708213 304
https://huggingface.co/Agnes-AI/Agnes-3.0-Flash

Новая плотняша 33B. Судя по тому что она едва лучше 35B Квена и в бенчах сравнивают со старым 3.5 27B Квеном, модель говно. Но может кому в РП зайдет, всё таки что-то новое а не очередной файнтюн.
Аноним 19/09/26 Суб 21:21:59 1708220 305
изображение.png 132Кб, 1511x1236
1511x1236
>>1708199
Пора продавать ещё и видяху? И оперативку. Зато будет на что жить в эпоху, когда ИИ отобрал всю работу.
Аноним 19/09/26 Суб 21:22:35 1708221 306
>>1708211
Там скорость ~20т\с. Я 30т\с получаю с моделью полностью во врам. Это же обдрочиться можно.
Аноним 19/09/26 Суб 21:53:21 1708237 307
Помогите настроить кобольддцп. Как сделать так чтобы настройки сохранялись и какую модель запустить ?
https://huggingface.co/TheDrummer/Behemoth-128B-v3 вот эта говорят хорошая, подскажите пж настройки
Аноним 19/09/26 Суб 21:54:28 1708239 308
>>1708237
>помогите жрать говно
Давай как-то сам.
Аноним 19/09/26 Суб 21:55:28 1708240 309
>>1708239
Почему говно? Где об этом написано? Подскажи тогда нормальное
Аноним 19/09/26 Суб 21:55:33 1708241 310
>>1708213
> Но может кому в РП зайдет, всё таки что-то новое а не очередной файнтюн.
А как можно РПшить без хорошего файнтюна? Или ты любитель ассистант-слопа?
Аноним 19/09/26 Суб 21:56:19 1708242 311
>>1708237
Внизу save config когда все настроил. При следующем заходе делаешь load config.
Аноним 19/09/26 Суб 21:56:40 1708243 312
>>1708237
А у тебя под эту модель есть железо? Она огромная, требует несколько дорогих видеокарт, штуки 3 - 4 rtx 3090 например. И вообще модель уже устарела
Аноним 19/09/26 Суб 21:59:54 1708245 313
>>1708240
Потому что интерфейс из начала нулевых где чёрт ногу сломит, говнокомбайн (бэк и фронт в одном проекте), при этом бэк печальный - чаты можно сохранить только в БРАУЗЕР, короче говоря, много причин НЕ использовать эту хуету. Хочешь быстренько проверить модельку - качай llama.cpp и прописывай ключики, разобраться за две минуты можно. Хочешь карточек таверны - качай SillyTavern и настраивай по гайду (которого в шапке нет и не будет). Вот тебе нормальное.
Аноним 19/09/26 Суб 22:04:55 1708248 314
>>1708241
Может она красиво пишет из коробки и имеет слабую цензуру. Дефолтной геммой же люди пользуются.
Аноним 19/09/26 Суб 22:09:00 1708249 315
>>1708245
>чаты можно сохранить только в БРАУЗЕР
Их можно в джсон выгружать, алло.
Аноним 19/09/26 Суб 22:13:39 1708251 316
>>1708175
Хватит жрать слоп, переходи на английский язык и нормальные РП тюны. Под русик ничего нет и не будет (по чисто техническим причинам). То, что базовая гемма4 может тебе сносно ответить на русском, не значит, что она годится для РП. Даже англ тюны геммы слоповые до ужаса, она плохо тюнится (тоже по техническим причинам).
Аноним 19/09/26 Суб 22:15:35 1708253 317
>>1708249
Ага, "спасибо". А бэкенд там нахуя тогда? Почему не сделать как в Таверне? Ну говно же. И ты спрашиваешь почему говно.
Аноним 19/09/26 Суб 22:19:29 1708257 318
>>1708248
Геммой пользуются потому что она быстро работает даже с 8 Гб видеопамяти. А эта агнэс хуйня взлетит только на 24 Гб или двух 12 гб видюхах.
Аноним 19/09/26 Суб 22:28:48 1708259 319
>>1708245
А чё к кобольду нельзя подключиться разве?
Аноним 19/09/26 Суб 22:29:18 1708260 320
Когда там уже мою лучшую девочку гемму 5, с самодобучением выпустят?
Как же хочется, пусть даже 9б аутисточку. Буду учить её, воспитывать, что хорошо а что плохо пояснять, лор своего пгт рассказывать.
Аж ломка
Аноним 19/09/26 Суб 22:42:10 1708269 321
>>1708260
Квенчику энграммы дообучи - будет тебе девочка
И даже лор пгт в ответах уже присутствует.
Аноним 19/09/26 Суб 22:44:44 1708271 322
>>1708269
>лор пгт
Лучший в гигачате
Аноним 19/09/26 Суб 22:47:37 1708272 323
>>1708154
>У мразермахера специально помечено, где кванты iq4_xs без иматрикса, так что шизу
так он шиз блядь. это лишенго всякого смысла и это чисто его фишка, я не знаю нахуя вообще гемму от этого дебила качать, есть анслот, есть апекс, бенчмарки красивые, они сами делали, бля будут
Аноним 19/09/26 Суб 22:50:15 1708274 324
>>1708272
Нет, иматрикс пакуется в кванты без iq, а кванты c iq наоборот могут быть без imatrix. Это просто размеры квантов, иматрикс отдельная тема. Поэтому и делается 2 сета.
Аноним 19/09/26 Суб 22:50:28 1708275 325
image.png 704Кб, 641x1000
641x1000
>>1708046
Чем-то это напоминает сцены из Гипериона. Хоть и не так пошло, но всякие там непотребства описывались похожим образом.
Аноним 19/09/26 Суб 22:50:31 1708276 326
>>1708260
Тебя там ждет такая соя и слоп что ты струей рвоты пробьешь экран. Не говоря уже о том что самая лайтовая моделька будет весить примерно 100-500B и будет заполнена кодоунитазингом на 99.999%
Аноним 19/09/26 Суб 22:54:17 1708278 327
>>1708271
Ну а серьезно, тут на гигачате кто-то рпшил? Как он в целом, стоит вообще времени на пердолинг? Вроде и все хочется попробовать, да лень заниматься.
Аноним 19/09/26 Суб 22:55:13 1708279 328
>>1708274
Ага, угадай что такое i.
Я тебе говорю он шиз и делает это через жопу. Если ты видишь в этом смысл то ты тоже шиз. Объяснить смысл (ну типа ответить на вопрос "Нахуя?") ты не сможешь.
Аноним 19/09/26 Суб 22:56:58 1708281 329
>>1708278
У меня гигачат просто усерается бесконечной генерацией где он продолжает диалог и начинает отвечать за пользователя (то есть за меня). А так вообще по тексту - уг и цензуры дохуя.
Аноним 19/09/26 Суб 23:07:02 1708289 330
>>1708278
влёгкую нагенерил на статью УК РФ в фифитесте
Аноним 19/09/26 Суб 23:08:55 1708291 331
image 748Кб, 1801x1796
1801x1796
image 407Кб, 1885x1808
1885x1808
image 315Кб, 2212x1236
2212x1236
>>1708279
Смысл в том что iq кванты влезают в меньший врам. Иматрикс же гробит вывод и языки, он не всем нужен, только под определенные задачи. Поэтому и есть не iq кванты с иматриксом. Important Matrix это не i-quant, i-quant это просто метод компрессии придуманный QuIP для ламы с Hadamard Incoherence, поэтому там I в названии. Люди их путают.
Аноним 19/09/26 Суб 23:11:54 1708293 332
>>1708281
Бле
>>1708289
Да на Фифи похуй, интереснее как он держит контекст, насколько внимателен и вариативен в рп, насколько крепки байасы и умеет отыгрывать разные характеры.
Аноним 19/09/26 Суб 23:12:42 1708294 333
>>1708291
Алсо как видишь у бартохи imatrix кванты тоже без i в названии висят, например q3_k_m с imatrixом.
Аноним 19/09/26 Суб 23:13:53 1708295 334
>>1708129
Чел, твоя проблема в том, что ризонинг - это не особый вывод а просто часть ответа. Отделяется от финального текста лишь технически, на стороне бека/фронта, а для модели всё едино - она просто генерит токены.
Причем токены она, как тут правильно сказали считать не умеет (в применении к длине вывода). Если хочешь из промпта регулировать длину - лучше просить "не более N предложений" (предложения и параграфы как ориентир дают достаточно хорошую и предсказуемую реакцию, слова - хуже, плюс-минус лапоть).
Но тут скрывается дополнительная проблема. Модель с включенным ризонингом эти N предложений посчитает в части финального ответа. А на сам ризонинг оно не повлияет, потому, что модели так натаскивают - сам по себе ризонинг неуправляемый (иначе бы постоянно сбивался от контекста).
Только отдельные модели имеют некоторые возможности ограниченного управления ризонингом, особыми токенами в запросе. Вроде того же квена с его xhigh, medium и low.

А в настройках ламы/клиента - заданное количество токенов в ответе - это значит тупо обрубить генерацию по достижению этого числа. Модель даже не знает что там выставлено. Причем это число - ризонинг+финалочка, т.к. смотри выше - это единый поток токенов.
Аноним 19/09/26 Суб 23:23:12 1708298 335
>>1708220
Плохая стратегия. Через N времени у тебя будет та же самая ситуация, но уже без видюхи и оперативки.
Аноним 19/09/26 Суб 23:29:08 1708300 336
>>1708245
>чаты можно сохранить только в БРАУЗЕР
Сразу видно эксперта "не читал но осуждаю". Оно эти ~2 года на месте не стояло, знаешь ли, с тех пор как данное заявление было бы правдой. :)
Не говоря о том, что это таки тоже бек - таверной с ним пользоваться никто не запрещает.
Аноним 19/09/26 Суб 23:32:16 1708302 337
Аноним 19/09/26 Суб 23:36:05 1708304 338
image 159Кб, 1584x720
1584x720
image 49Кб, 868x259
868x259
>>1708272
>есть анслот, есть апекс, бенчмарки красивые, они сами делали, бля будут
У анслота как раз шиза, открываем q4_k_s, а там внутри компот ебаный IQ4_XS, Q8_0, Q5_K. Причем они тоже все imatrix, не только iq кванты, даже q4_k_m. У мразера все по-честному, где imatrix не используется, отдельно указано. Бартоха пихает imatrix во все подряд, как и анслот, ну бартоха хоть слои у q4 не мешает с медленным i-quant, и на том спасибо. А так хочешь без imatrix, качай мразера, или релизеров где отдельно указано что без imatrix, iq в названии ни о чем не говорит, кроме компрессии.
Аноним 19/09/26 Суб 23:38:30 1708305 339
>>1708300
Ага, то есть ставишь бэк+фронт чтобы использовать другой фронт. Логично нет. Уж тогда лучшле убабуга текстген. Лучше хотя бы тем что ты можешь без перезапуска подменить модель например выбрав её из списка в интерфейсе (а не лазить по папкам).
На самом деле хуйня что убабуга что кобольд, ставь ллама.кпп и не еби мозг, можно разные билды-форки тестировать, неудобств никаких, сделал себе батник один раз:

cd c:\path\to\llama\build
llama-server.exe -m %1 --port 80 -lm none -c 16384 -rea off и так далее

а потом из любой папки перетаскиваешь ггуфчик на этот батник и сервер запускается без лишних задержек. можно на localhost в браузере зайти быстренько проверить, можно к таверне подключить, можно к маринаре.
Аноним 19/09/26 Суб 23:44:18 1708308 340
>>1708305
> неудобств никаких
> перетаскиваешь ггуфчик на этот батник

Хоть бы скрипт нормальный попросили написать свои LLMки. Небось еще под каждую модель свой батник делаешь, параметры то разные. Еще и мусор на рабочем столе держать в виде gguf'ов.
Аноним 19/09/26 Суб 23:46:01 1708309 341
Аноним 19/09/26 Суб 23:50:07 1708313 342
>>1708308
не надо ггуфы на рабочий стол, ггуфы по папкам распиханы аккуратно, я же сказал из любой папки

у меня есть быстротест-батник с общими параметрами который подходит под всё
конкретно если подгонять параметры под модель то конечно можно батник потом положить прямо рядом с ггуфом в отдельной папочке где только эта моделька. или можно сделать структуру папок где только батники, зачем тебе модельки видеть, в батник зашить путь к модельке.
чем кобольд с его "найди и загрузи джейсон файл с конфигом" лучше этого подхода? ничем
Аноним 19/09/26 Суб 23:53:46 1708314 343
>>1708291
Ну писали бы тогда imat-IQ4XS, static-IQ4XS в кнопочках загрузки
а то у одного пидора IQ4XS это всегда imatrix, у другого - надо угадывать, третий - по две страницы заводит зачем-то. Если иматрикс "гробит" то нахуя он нужен? Что за "определенные цели" такие? Шиза сплошная крч
Аноним 19/09/26 Суб 23:57:36 1708315 344
>>1708314
У мразера все четко - хочешь без imatrix, заходишь на отдельную страницу, получаешь все кванты iq, q4_k_s и прочие без иматрикса.
У остальных обычно все с иматриксом как у анслопа с бартохой на все подряд, у остальных релизеров смотреть надо, бывает отдельно указано нет иматрикса. Imatrix в целом губит языки, так что ту же гемку лучше качнуть у мразера без иматрикса.
Аноним 19/09/26 Суб 23:59:54 1708317 345
>>1708313
> не надо ггуфы на рабочий стол, ггуфы по папкам распиханы аккуратно, я же сказал из любой папки
Это еще хуже чем просто на рабочем столе, потому что в итоге чтоб запустить модель с рабочего стола, тебе нужно еще открывать её где-то в проводнике.

> конкретно если подгонять параметры под модель то конечно можно батник потом положить прямо рядом с ггуфом в отдельной папочке где только эта моделька. или можно сделать структуру папок где только батники, зачем тебе модельки видеть, в батник зашить путь к модельке.
Жесть. Когда такие люди говорят потом о каком-то удобстве или неудобстве чего-то это ничего кроме улыбки не вызывает.

> чем кобольд с его "найди и загрузи джейсон файл с конфигом" лучше этого подхода? ничем
Ничем. Но твой подход вообще ничем не лучше.

https://pastebin.com/5w6WrTA9
Всё. Один батник на рабочем столе в который нужно просто прописать параметры один раз. Никаких открытий проводников, перетаскиваний гуфов, постоянного редактирования по десяти батникам или чего-то еще.

Его еще можно оптимизировать с переменными путей чтоб постоянно не писать полный путь к модели а просто указать одну папку с гуффами если они все в одном месте лежат, но мне лень.
Аноним 20/09/26 Вск 00:05:50 1708320 346
image 128Кб, 1412x757
1412x757
>>1708314
Старые релизеры так и делали. Вот у legraphista например. Новые обленились и так уже не делают, кроме мразермахера.
Аноним 20/09/26 Вск 00:14:13 1708326 347
image.png 13Кб, 387x177
387x177
imatrix релизы часто содержат собственно importance matrix выложенную среди файлов

файла может и не быть, конечно, но это как бы одна из опорных точек в определении где чем насрано
Аноним 20/09/26 Вск 00:18:35 1708327 348
>>1707966
Думаю как-нибудь затестить связку мистраль немо + квен, где мистраль будет генерировать кум, а квен следить за деталями и фактами
Аноним 20/09/26 Вск 00:20:04 1708328 349
>>1708305
>Ага, то есть ставишь
Ну, если тычок мышью в скачанный .exe файл называется "ставишь"...

>>1708305
>лучшле убабуга
А ты не охуел? Вот это добро не просто "ставишь" а "пердолишь", прежде чем оно нормально заведется, и не факт что со всеми функциями, и не заглючит на полдороге.

>>1708305
>Лучше хотя бы тем что ты можешь без перезапуска подменить модель
Кобольд так тоже уже умеет. А еще он умеет модель для картинок автоматически свапать с текстовой - это дает возможность в той же таверне иметь возможность видеть как тебе перонаж свои "фотки" шлет, даже на бомжсетапе. Чего не умеет уже llama. (Можно припердолить через llama-swap и stable-diffusion.cpp например, не вопрос, но мы же про "быстро и просто"?)

>>1708305
>ставь ллама.кпп и не еби мозг
Не ебет мозг новичку именно кобольд. llama же требует немного напрячься. В прочем - это не недостаток как раз. Просто факт.

>>1708305
>а потом из любой папки перетаскиваешь ггуфчик на этот батник и сервер запускается без лишних задержек.
Кобольд позволяет просто натыкать один раз параметры в GUI (но и по дефолту скорее всего будет работать, только модель выбери), потом сохранить натыканное в файл-профиль, и этот профиль потом так-же перетаскивать на свой экзешник запуская моментально. Разница в том, что не надо курить доку по ключам - все на глазах в GUI.

Так-то я сам за llama.cpp, только мне элитизм глаза не заливает, потому допускаю, что новичку кобольд для первого вката проще.
Аноним 20/09/26 Вск 00:20:46 1708330 350
>>1708269
Квен бездушный и скучный.
А дообучение ломает мозги, и нет погружения. Кроме того это скучный пердолиг.
Аноним 20/09/26 Вск 00:21:38 1708331 351
>>1708328
>А ты не охуел? Вот это добро не просто "ставишь" а "пердолишь", прежде чем оно нормально заведется, и не факт что со всеми функциями, и не заглючит на полдороге.
Лолка там портабл сборочка есть. Один минус - старая ллама внутри, кое-какие модельки не заведутся.
Аноним 20/09/26 Вск 00:23:54 1708332 352
>>1708328
>А еще он умеет модель для картинок автоматически свапать с текстовой - это дает возможность в той же таверне иметь возможность видеть как тебе перонаж свои "фотки" шлет, даже на бомжсетапе. Чего не умеет уже llama.
Это умеет ШИНДОВС. У меня видеопамять полностью забита ллмкой а когда запускается крея2 комфи воркфлоу (с крея2едит нодой чтобы персонаж референсился) то всё магическим образом свапается само по себе туда и назад. Кобольду с его сдохлом такие результаты и не снились кстати
Аноним 20/09/26 Вск 00:24:10 1708333 353
>>1708269
>Квенчику энграммы дообучи
А что, там уже с этим разобрались? Я тут BF16 как раз накатил, проверяю насколько меньше в русскоязычных ответах обсирается.
Аноним 20/09/26 Вск 00:25:25 1708334 354
>>1708309
Ну ты там шевелись, не можешь бороться - возглавь. >>1708298 правильно говорит, просто отсрочишь свою гибель. Если не лежит ко всему этому - есть куча рабочих специальностей, где и ментальной нервотрепки нет, и денежку можно зарабатывать.
>>1708328
> тычок мышью в скачанный .exe
Мм, квинтэссенция, без осуждения ну может быть умеренное
Аноним 20/09/26 Вск 00:31:15 1708339 355
Аноним 20/09/26 Вск 00:31:41 1708340 356
image.png 64Кб, 1063x913
1063x913
>>1708333
Похоже, чуда не произошло. Пишет так же коряво.
>То есть скучно — и ты решишь это развлекать незнакомую девушку случайными сообщениями
Ну очень странно выглядит.
Аноним 20/09/26 Вск 00:32:36 1708343 357
Это пиздец сколько я закумил, просто атас. Голова кружится.
Аноним 20/09/26 Вск 00:33:18 1708344 358
>>1708339
А собсна пруфы-то есть? Ну, что это достойно работает и ничего не ломает.
Аноним 20/09/26 Вск 00:47:17 1708352 359
>>1708344
Есть ли пруфы, что ты не любишь жрать говно ?
Аноним 20/09/26 Вск 00:49:37 1708354 360
>>1708352
Хуя ты бахнул. Это ты что ли этот слоп на гитхабе высрал? Ну извини, что проткнул. Бывает.
Аноним 20/09/26 Вск 00:49:43 1708355 361
Как вы сортируете свои модельки по рейтингу типа. Чтобы выбрать лучшую. Я понимаю это та ещё задачка но всё же, есть у кого-нибудь интересные рабочие методы?
Я пока что применяю пузырьковую сортировку: список моделей в текстовом файле, беру на произвольной задаче (типа свайпнуть ответ в готовом диалоге) сравниваю две модели которые рядом в списке и если она лучше другой, но при этом лучшая модель находится ниже, я меняю их местами. После чего следующиие две сравниваю. Когда пройдусь по всему списку - меняю задачу. В итоге хорошая модель рано или поздно всплывает выше, а хреновая тонет.
Аноним 20/09/26 Вск 00:55:10 1708359 362
>>1708355
Просто ими пользуешься и отмечаешь что нравится, а что не нравится в конкретном кейсе. Моделей не так много чтобы запутаться, видов задач тоже по пальцам пересчитать.
Потому просто формируется мнение что "это умное и внимательное", "это красиво пишет", "здесь вроде заебись но лезет слоп", "это годнота кодить но в рп дно". Потом уже под задачу и с учетом доступных в данный момент ресурсов выбираешь то, что лучше всего подходит. Одной "лучшей" модели не существует, все от юскейса зависит.
Аноним 20/09/26 Вск 00:55:51 1708361 363
>>1708354
Да, я, ктож ещё
>>1708355
Бенчезависимым обязательно нужно найти лучшую из лучших. У меня много моделей установлено, у каждой свои сильные стороны. Это очень трудно измерить однозначно
Аноним 20/09/26 Вск 00:57:52 1708363 364
>>1708355
Включаю новую модель и делаю с ней то что делал со старыми. Результат хуже - в корзину, результат другой - оставляю как альтернативу, результат лучше - старую модель в корзину.
Аноним 20/09/26 Вск 00:57:52 1708364 365
>>1708355
Если цель проверить литературные способности то примерно так же делаю (свайп на одном и том же сообщении чата)

Кодинг и всё подобное вполне отражают бенчи, ну или отзывы
Аноним 20/09/26 Вск 01:05:35 1708367 366
Аноним 20/09/26 Вск 01:07:04 1708369 367
>>1708359
>Моделей не так много
У меня их 86, откровенно плохие не держу
Аноним 20/09/26 Вск 01:11:41 1708370 368
>>1708369
> У меня их 86
> откровенно плохие не держу
Вау. Огласите весь список
Аноним 20/09/26 Вск 01:26:46 1708371 369
Аноним 20/09/26 Вск 01:29:15 1708372 370
>>1708371
Что не так с теми гемами, поясни
Аноним 20/09/26 Вск 01:30:44 1708373 371
>>1708372
Всё по кайфу. Говорю же хидден гемы
Аноним 20/09/26 Вск 01:32:04 1708375 372
>>1708371
Ага, гига-турбо-мега-ивил-наци-фейбл-нигга-опус-макс-ультимейт-анцензоред-скорпион-демон-6767-ГГУФ
Аноним 20/09/26 Вск 02:01:26 1708381 373
>>1708371
нее как раз квенов не держу, не заходят совсем
Аноним 20/09/26 Вск 02:58:24 1708393 374
image.png 1Кб, 50x43
50x43
>>1708355
Очень просто:
1. Всегда беру квен под технические задачи. 27б для объемной работы, флеш-некст для точной.
2. Гемму для творческих.
Больше моделей для консьюмерской локалки нет.
Настройки X
Ответить в тред X
15000
Добавить файл/ctrl-v
Стикеры X
Избранное / Топ тредов