Šta je novo?

Openclaw

marantz

Slavan
Učlanjen(a)
29.11.2008
Poruke
1,928
Poena
455
Da li je neko probao Openclaw sa cloud ili local modelima? Čudi me da nema tema o ovome. Planiram duže vreme da dodam jednu mašinu za local LLM-om i Openclaw-om, pa bi značila iskustva drugih korisnika.
 
Probao, u suštini je to odlično i korisno. Sa lokalnim modelima ne očekuj čuda, naročito ako su mali.
Agenti ovog profila su gladni resursa, traže veći kontekstni prozor. I šta neko da traži sa iole normalnijim (čitaj većim) modelom, naročito ako je "dense" kad mu podigne kontekst na bar 60K ako ima GPU ispod 24Gb. Ja sa 24gb Vram se jedva sastavim. Sa nebeskim modelima je već nešto sasvim drugačije 🙂
 
VRAM ne bi trebalo da bude problem, vozio bih to na Mac Studio mašini sa 128GB.
 
To je cool. Sad opet zavisi koliko tok/sek se dobije sa kojim modelom i koja je kvantizacija tog modela, jer slični agenti već na prvoj poruci progutaju po 15K tokena, neretko i više , pa kako se taj konkestni prozor popunjava tako opada i tok/sek, jer onda KV keš postaje teret koji treba da se nosi oko vrata. Neki MOE će svakako mnogo bolje da izgura to. Kod mene moe od 35B može da ide i do 120tok/sek i na kontekstnom prozoru od 120K, ali pri oterećenju i popunjenom kontekstu opadne i na 40tok/sek, što opet može da se podnese. Ali ako se pokreće dense model koji na početku ima 25-30tok/sek i kada se kontekstni prozor iole popuni i inference padne na 10tok/sek ona je to već praktično neupotrebljivo
 
Kod tebe je verovatno CUDA? Učitao sam onaj utility što si postovao u drugoj temi i za većinu modela na Mac Studio M4 Max projektuje oko 70 tok/s. Nisam probao na MBP M5 Max, ali ni tu ne bi bilo puno više - do +15% max. To je trade off - puno VRAM-a kod Mac-a, ali je MPS sporiji od CUDA zbog optimizacije.

Pravim jednu mašinu u rack-u koja bi vozila Openclaw. Nije mi toliko bitno da je najbrže moguće, već više da model ne halucinira (puno). Kako bi u pitanju bila automatizacija, mogu i da ga pustim noću da odradi taskove koje treba. Trebalo bi da je 30B OK za tako nešto, preko toga mi deluje kao overkill za repetativne taskove.

Preko dana dok radim, mislim da će biti OK da ga pozovem u pozadini da mi nešto odradi, po potrebi.
 
Jeste CUDA (rtx3090). Sad zavisi i preko čega pokrećeš modele i šta odgovara tj. koji su formati, to treba proveriti ili sortirati u onoj tabeli u llmfit, pošto on po defaultu prikazuje sve. Da, 30B može da odradi dosta stvari na zadovoljavajućem nivou, naročito kada ga spregnu okolnosti kao što je niska temperatura ili dobar agentic sistem, onda se ponaša kao fino dresirano kuče, a ne kao neki avlijaner koji se otrgnuo sa lanca 🙂
 
Evo mali update, pošto sam dosta eksperimentisao sa Openclaw poslednjih dana...
Hteo sam da sačekam novi MacStudio, ali od toga nema ništa, pa sam uposlio MacBook Pro M5 Max sa 36GB RAM-a. To je OK za jedan aktivan model, nije baš najbolje rešenje za LLM, ali tako je kako je...

Openclaw je fantastičan alat.
Nije i dalje to 100% user friendly, ipak mora da se ima neko znanje kako LLM funkcioniše.

Prvo sam selektovao nekoliko generalnih modela tipa QWEN, GPT-OSS, GEMMA, do 30b parametara. Jako dobro kod Openclaw-a je da može da definiše neograničen broj provajdera, tako da npr. MLX modele mogu da učitavam kroz LM Studio, dok GGUF i Safetensors učitavam preko Terminala i Llama.cpp. Takođe, sam povezao i GPT5.5, ali dosta jede tokene i skup je u odnosu na npr. Claude (2-3x skuplji).

Sada to je neki stari koncept: ili puno VRAM-a i veliki LLM ili plaćaj Claude i GPT tokene, pa opet rezultat ne bude najbolji, ako treba npr. da se nešto računa i pravi neki izveštaj. Takođe, veliki model znači i sporije operacije. Neki kompromis su modeli koji imaju veliki broj parametara, ali za prompt koriste 3-4b. Tada dosta brže daje odgovore uz sličnu preciznost.

To je sve nepotrebno, ako mu povežete MCP-ove.

Nekoliko primera:

MCP za internet search sam povezao kroz Perplexity. Openclaw pozove Perplexity da pretraži internet i to da LLM-u da napravi od toga output. Može da se uradi cron da preko noći on radi izveštaj o vestima određene tematike ili research neke teme, to sve snimi na desktop da se pročita ujutru uz kafu.

Napisao sam uz pomoć GPT5.5 MCP-ove za pristup SEF-u, MySQL bazi sa nekim prodajnim podacima, MySQL bazi eCommerce sajta itd...

Mogu da upišem npr. "Otvori mi sa SEF-a tu i tu fakturu u PDF-u" i ovaj ode preko MCP-a na SEF, pronađe je i prikaže. Razni izveštaji o dugovanjima, naplati - to je sve super jednostavno kroz Openclaw.

Za eCommerce sajt sam preko Claude-a prošao kroz npr. opise proizvoda direknto u MySQL bazi i dobio izveštaj koliko opisa treba da se poboljša da bi se dodatno popravio SEO. Korisno, ako ima par hiljada artikala. Nisam mu dao write pristup za SQL, pošto hoću prvo da pregledam predloge izmena. Verovatno ću pustiti Claude posle da sam izmeni i koriguje sve opise, HTML tagove u opisima da sve bude uniformno itd...

Kako se bavim i prodajom u stranoj firmi, Openclaw može da pristupi npr. pricelistama ili sales reportima na cloud lokacijama. Umesto da otvaram različite fajlove kada mi treba nešto, napišem mu da ode na Google Drive i pronađe cene za taj i taj part number.

Najbolje od svega je da sa MCP-ovima koji rade compute posao, LLM ne mora da bude neki sa mega-giga milijardama parametara... Nema prevelike razlike između nekog manjeg 10GB modela i 30GB ili većeg modela za te primene. Čak je i poželjno da se ne divlja previše, već da se što više toga baci na MCP-ove i alate, a mali model će onda puno brže da daje odgovore od nekog velikog modela koji previše razmišlja i generiše previše tokena nepotrebno.

Jedino bi mi dobro došao taj željeni Mac Studio sa 128GB RAM-a da mogu da učitam više modela istovremeno. Time bi zavisno od namene mogao da dodelim različitim modelima različite taskove.
 
Nazad
Vrh Dno