>>Ты про >>236620
определённо да, но тред ещё за май, не видел я его
в мае я вообще ничего не видел, сейчас уже лучше
>>на чистом CPU может давать больше,
>>35B
ясен красен больше, если взять 8B будет ещё больше. CPU начинается когда кончается VRAM, а потом кончается всё и я думаю, где взять ещё, а взять негде. в 4.5 токенах в секунду поучаствовали cpu на двух разных нодах, а так же gpu, тоже на двух, ну и сеть между ними, разумеется
настраивается, кстати просто. самый сложный этап квеста - cuda+драйвер, но и он не рокет саенс, все ставили, я думаю
если что, llama.cpp использует ОБА вида памяти для одного инстанса одновременно, и да, cpu действительно не такой медленный, как можно подумать. а есть ещё и оффлоуд на ssd, но это уже совсем медленно
и да, CPU годится не всякий, обязательно нужно ну хотя бы первый AVX, иначе будет сопоставимо с SSD
всё просто - чем больше слоёв - тем больше вычислений + накладные расходы на передачу(время). там есть неочевидный момент - следующий токен не заходит, пока не вышел из пайпа предыдущий, по-этому все сетевые задержки и задержки на райзерах суммируются, но в принципе там понты. даже 100 мегабит нормально работает, хотя gemini кричит что нужно 40 гигабит и не меньше, потому что у него в чугунной голове зашит tensor parallel а это что-то на богатом, начиная от h100 с NVLink и нужно в основном что бы учить с нуля, а это вообще отдельная история, которая начинается с покупки земли под датацентры
"Почему бы тогда тупо не пустить несколько инстансов лламы с разными картами и не разбросать запросы по ним?" - ну это я в итоге и сделаю + фабл на внешнем апи, но "разбросать" - это конечно красиво звучит, а ты умеешь разбросать? этож надо иерархию выстроить с субординацией, что бы дурак мог делать грязную работу, мидл умную, а сениор был архитектором всего, резолвером опасных дилем и ответственнных транзакций. autogen сейчас для этого смотрю
и вот сейчас пробую Qwen3.5-122B-A10B-Opus-Reasoning-Q6_K.gguf лезет, а Qwen3.5-122B-A10B-Opus-Reasoning-Q8_0.gguf не лезет. хер его знает почему, вроде разница не такая и большая и фактически памяти у меня в два раза больше чем весит q8, в пределах лимита лламы получилось насобирать 256 гигов и ещё где-то 60-70 осталось за бортом. можно там какого-нибудь дурачка запустить, который годится в лучшем случае в качестве продвинутого грепа, что бы не жечь дорогие токены, но и то полезно
а, кстати, есть ещё такая штука как graphrag, пока у меня openclaw не сломался, я ему поручил прочитать рандомную книгу на 22000 слов и собрать по ней graphrag и это работает! только есть один нюанс: собирал я его посредством fable через апи и стоило это 50 долларов денег. дорогой эксперимент. по итогам он мне выдал выжимку из всей книги и смог ответить на некий вопрос касаемо её содержания и это выглядело прям убедительно. но 50 баксов это 50 баксов)) не знаю что, будет если попытаться сделать это ну хотя бы дипсиком, будет ли оно так же четко и по существу работать. попробую как руки дойдут. но в принципе это возможно! причем делал мне это от и до дипсик, я только смотрел. то есть модель для самого анализа была fable 5, а работу по подготовке окружения и входных данных от и до выполнил deepseek, и он же запустил прогон и тестовые запросы. и всё получилось! но потом openclaw сломался и я понял что хватит его чинить и пошёл искать альтернативы. вот, ищу.