а есть тут ламадрочеры? в смысле дрочеры в llama.cpp
ну вот, например, вопрос: я упёрся в предел 16 GPU. нет, я не ограбил банк, просто это майнинговые говнократы на ядрах pascal которые я взял по 50 баксов, когда они стоили 50 баксов года 4 назад
они висят на 1х райзерах и распределены по RPC нодам
и это даже работает!
кстати, хочешь возоржать? у меня одна нода на orange pi 5 с 16 гигами RAM и она, конечно, в разы отстаёт от паскалей и e5-2696 v3, но в целом её присутствие в кластере имеет смысл. варианты запуска Qwen3.5-122B-A10B-Opus-Reasoning-Q6_K.gguf с участием апельсинки, ксеона и части паскалей даёт 4.5 токена в секунду, а если заменить апельсинку паскалями, то 6. просто как эксперимент.
так вот: я упёрся даже не в 16 GPU, а в 16 бэкэндов и просто менять константы в llama.cpp перед компиляцией не помогает. у меня просто тупо получаются лишние карты, а в наше время это лютое расточительство
а может быть мне надо что-то другое? там Petals на Hivemind или ещё что-то такое?
апишку не предлагать, потому что объемы инференса конские - дешевле железо купить даже по тем ценам которые есть сейчас
ну а про длительные автономные задачи можно поговорить отдельно. ну или здесь, потому что я прекрасно понимаю, что единственный человек, который ебёт в душе, что там накручено в алгоритме раскидывания слоёв по бэкэндам - это сам Герганов
в какой-то момент я, конечно, натравлю агента на репу llama.cpp, но пока этого не случилось
про райзера, кстати, могу отдельную кулстори запилить, я мерял разные райзера таким прибором как LiteVNA и обнаружил, что бывают райзера хорошие, а бывают плохие. а раньше были только плохие. может быть кто-то припоминает, как я тут лет 8 назад выл про синие "USB" райзеры. теперь я точно знаю что с ними не так - децибелл затухания с ними не так и никакой осциллограф на 20 гигасемплов тут не нужен, LiteVNA вполне доступный прибор, который прендазначен для анализа именно этой проблемы