Šta je novo?

Budućnost AI agenata

Nemam nikakvih briga kad je ai i slično u pitanju...mislim da se taj post odnosio na nečije pitanje pa kao sličan primer.
 
Claude bukvalno može sada da kontroliše ceo komp, kao da se neko nakačio preko TeamViewer-a, a može da mu se da i volume access... Nisam mu ovde dao sudo, ali može bukvalno da očisti ceo drajv, spam mailove, apdejtuje OS itd... Podešava sam filtere u Apple Mail-u na osnovu onoga što je našao kao spam, a kod mene pošto imam svoj mail server ode i na hosting i tamo direktno setuje global mail filtere. Ono što sam ja do sada radio preko cPanel-a.

U ovom slučaju sam mu dao da ode u Settings i sam doda šta da se isključi iz Time Machine bekapa ubuduće da se ne gomila zauzeti prostor na drajvu.

Fascinantno koliko su agenti napredovali za ovo vreme.

1789829200707.webp
 
Kako bi podesio neki lokalni LLM da to odradi? Ja sam protiv dopustanja cloud resenjima da drkaju po diskovima i da rade to sto kazu da rade.
 
Instaliraš hermes, usmeriš ga da koristi lokalni LLM i to je to.
 
Kako bi podesio neki lokalni LLM da to odradi? Ja sam protiv dopustanja cloud resenjima da drkaju po diskovima i da rade to sto kazu da rade.

Možeš Hermes, OpenClaw, verovatno i LM Studio... Samo imaj u vidu da je lokalni model tipa 30B sa manjom kvantizacijom daleko inferiorniji. Ja nemam ograničenje RAM-a (128GB), ali ako učitaš veliki model na DGX Spark, radi dosta sporije nego manji model.

Tu je sada taj problem sa cenama hardvera. Takvo eksperimentisanje bi imalo smisla da npr. DGX Spark košta 1500 eura, a RTX 5090 nije >5000 eur. I sada je tu pitanje isplativosti, Claude Max je 100$, a DGX Spark je 7000-8000$. To je 70-80 meseci pretplate.

Što se tiče podataka, na boot drajvu nema ništa, odavno ne držim podatke tamo.

Ovo sa boot drajvom je samo eksperiment, ne treba mi Claude da mi čisti disk. Ipak, neverovatno je koliko stvari može da odradi npr. na Web Serveru, ako mu daš SSH. Ne samo da mu ti kažeš šta da radi, već mnogo toga i sam pronalazi. Ne bih bio siguran da lokalnom modelu dam pristup production serveru.

Drugi primer gde bi možda lokalni model bio primereniji, je Vibe Coding. Povezao sam Claude na XCode... Napravio za tipa 10 minuta app koja menja inpute na monitoru da ne bih za to korstio BetterDisplay. Task je bio da dva monitora prebacuje na odgovarajuće inpute koji su povezani na dva različita Mac-a. Testirao je sam DDC signale, prepoznao gde je šta povezano, mapirao, kompajlirao, dodelio Apple sertifikat da se Gatekeeper ne buni itd... Mislim da bi to mogao i npr. QWEN3.8, možda bi bilo više pokušaja i grešaka, ali bi na kraju odradio.

Screenshot 2026-09-21 at 07.14.18.webpScreenshot 2026-09-21 at 07.16.31.webp
 
Možeš Hermes, OpenClaw, verovatno i LM Studio... Samo imaj u vidu da je lokalni model tipa 30B sa manjom kvantizacijom daleko inferiorniji. Ja nemam ograničenje RAM-a (128GB), ali ako učitaš veliki model na DGX Spark, radi dosta sporije nego manji model.

Tu je sada taj problem sa cenama hardvera. Takvo eksperimentisanje bi imalo smisla da npr. DGX Spark košta 1500 eura, a RTX 5090 nije >5000 eur. I sada je tu pitanje isplativosti, Claude Max je 100$, a DGX Spark je 7000-8000$. To je 70-80 meseci pretplate.

Što se tiče podataka, na boot drajvu nema ništa, odavno ne držim podatke tamo.

Ovo sa boot drajvom je samo eksperiment, ne treba mi Claude da mi čisti disk. Ipak, neverovatno je koliko stvari može da odradi npr. na Web Serveru, ako mu daš SSH. Ne samo da mu ti kažeš šta da radi, već mnogo toga i sam pronalazi. Ne bih bio siguran da lokalnom modelu dam pristup production serveru.

Drugi primer gde bi možda lokalni model bio primereniji, je Vibe Coding. Povezao sam Claude na XCode... Napravio za tipa 10 minuta app koja menja inpute na monitoru da ne bih za to korstio BetterDisplay. Task je bio da dva monitora prebacuje na odgovarajuće inpute koji su povezani na dva različita Mac-a. Testirao je sam DDC signale, prepoznao gde je šta povezano, mapirao, kompajlirao, dodelio Apple sertifikat da se Gatekeeper ne buni itd... Mislim da bi to mogao i npr. QWEN3.8, možda bi bilo više pokušaja i grešaka, ali bi na kraju odradio.

Pogledajte prilog 554069Pogledajte prilog 554070
Računica 7-8k za lokalni hardver naspram $100 mesečno jeste brutalna, ali mislim da se ovde pomalo mešaju dve različite stvari: privatnost i bezbednost izvršavanja.

Lokalni model rešava prvi problem - podaci ne moraju da napuste tvoju mašinu. Ali ne rešava automatski drugi. Ako lokalnom agentu daš shell, SSH ključ i write pristup produkciji, može da napravi potpuno isti haos kao cloud agent. Obrnuto, cloud model možeš prilično da ograničiš ako između njega i sistema postoji dobar permission layer.

Zato mislim da sledeći veliki skok kod agenata neće biti samo još pametniji model, nego infrastruktura oko njega. Read-only po defaultu, privilegije samo za konkretan task, prikaz plana ili diff-a pre destruktivne akcije, snapshot/rollback i detaljan log svega što je uradio. Neka sam sortira fajlove, traži spam ili kompajlira aplikaciju, ali za brisanje, firewall, produkcioni DB, deployment ili promenu globalnih mail pravila neka postoji još jedna kapija.

Posebno je zanimljiva kombinacija kada isti agent čita mail/web i istovremeno ima pravo da izvršava komande. Tada sadržaj koji čita više nije samo kontekst, već može posredno da utiče na ono što će uraditi. Tu bih više verovao dobrom sandboxu i sistemu dozvola nego samoj etiketi "lokalno".

Meni zapravo najlogičnije deluje hibrid: jak model može da planira i rezonuje, ali lokalni broker odlučuje koje operacije uopšte smeju da prođu, bez obzira šta mu model zatraži.

Jer pravi napredak nije da agent može da klikne baš sve što može i čovek. Pravi napredak je da mu možeš dati dovoljno slobode da zaista štedi vreme, a da jedna pogrešna odluka ne pretvori demonstraciju od 10 minuta u vikend vraćanja bekapa. 🙂
 
Računica 7-8k za lokalni hardver naspram $100 mesečno jeste brutalna, ali mislim da se ovde pomalo mešaju dve različite stvari: privatnost i bezbednost izvršavanja.

Lokalni model rešava prvi problem - podaci ne moraju da napuste tvoju mašinu. Ali ne rešava automatski drugi. Ako lokalnom agentu daš shell, SSH ključ i write pristup produkciji, može da napravi potpuno isti haos kao cloud agent. Obrnuto, cloud model možeš prilično da ograničiš ako između njega i sistema postoji dobar permission layer.

Zato mislim da sledeći veliki skok kod agenata neće biti samo još pametniji model, nego infrastruktura oko njega. Read-only po defaultu, privilegije samo za konkretan task, prikaz plana ili diff-a pre destruktivne akcije, snapshot/rollback i detaljan log svega što je uradio. Neka sam sortira fajlove, traži spam ili kompajlira aplikaciju, ali za brisanje, firewall, produkcioni DB, deployment ili promenu globalnih mail pravila neka postoji još jedna kapija.

Posebno je zanimljiva kombinacija kada isti agent čita mail/web i istovremeno ima pravo da izvršava komande. Tada sadržaj koji čita više nije samo kontekst, već može posredno da utiče na ono što će uraditi. Tu bih više verovao dobrom sandboxu i sistemu dozvola nego samoj etiketi "lokalno".

Meni zapravo najlogičnije deluje hibrid: jak model može da planira i rezonuje, ali lokalni broker odlučuje koje operacije uopšte smeju da prođu, bez obzira šta mu model zatraži.

Jer pravi napredak nije da agent može da klikne baš sve što može i čovek. Pravi napredak je da mu možeš dati dovoljno slobode da zaista štedi vreme, a da jedna pogrešna odluka ne pretvori demonstraciju od 10 minuta u vikend vraćanja bekapa. 🙂

Sve to što pišeš nije novo i otprilike tako i funkcioniše.

Ako pristupaš eksternim podacima najbezbednije je da to radiš preko MCP-ova. Ja imam desetak custom MCP-ova na privatnom VPS hostingu i dobar model može da automatizuje nezamislivo, ako se dobro sve podesi. Email, takođe - pristup preko MCP-ova i svaki tool ima posebne dozvole, različite dozvole za različite naloge itd.

Isti MCP preko OAuth servera ili bearer tokena se može povezati na bilo šta: Claude app, LM Studio, Bionic, Openclaw, Hermes...

Ipak, lokalni model nije ni blizu npr. Claude Opus-u, a o Fable da ne pričam.

Nikakav lokalni QWEN, Kimi ili Deep Seek neće moći da radi kompleksne stvari kao frontend model. Zaboravi na to. LLM/VLM je dobar hobi, ali ne može da zameni npr. Claude. Zavisi, naravno, za šta ti AI koristi.

Isto tako za LLM, a posebno za Visual, je bilo šta osim nVidia CUDA je gubljenje vremena, trenutno, a i u doglednoj budućnosti. Kao što je i za coding Claude Code puno bolji od ChatGPT Codex-a.

Uloga lokalnih modela će biti fallback za prostije stvari za koje nema potrebe pozivati front-end model.
Za sada Spark mi stoji na stolu, dok ne nabavim neki kabl koji mi fali da ga prebacim u rack gde mi je Mac Studio.
 

Prilozi

  • IMG_5019.webp
    IMG_5019.webp
    136.8 KB · Pregleda: 18
Mislim da si moj post pročitao kao argument za lokalni model, a poenta mi je bila nešto drugo.

Nisam tvrdio da je MCP nov niti da je lokalni Qwen zamena za Opus. Naprotiv, tvoj setup sa posebnim dozvolama po toolu i nalogu je praktično primer onoga o čemu pričam.

Samo, MCP je način da model dođe do toolova. Može lepo da sprovede granularne dozvole, ali sam po sebi nije granica poverenja. Ako model čita mail ili web, a zatim na osnovu tog sadržaja može da pozove tool koji ima pravo da briše, menja ili deployuje, problem i dalje postoji. Ključno je šta backend uopšte dozvoljava tom toolu, koje akcije traže dodatno odobrenje i koliko se posledice mogu ograničiti ili vratiti.

Zato sam i napisao da bih više verovao dobrom permission layeru nego etiketi "lokalno". Isto važi i za Opus. Može frontend da bude najbolji model koji postoji, ali mu ja i dalje ne bih dao neograničen shell, produkcioni DB i mail admin prava samo zato što dobro rezonuje.

Koji je model trenutno bolji za coding, visual ili kompleksne taskove je druga tema. Tu lokalni modeli mogu da zaostaju koliko hoće, a moja poenta ostaje ista: ozbiljan agent nije samo model + MCP, nego sistem koji pretpostavlja da i dobar model može da pogreši ili da bude naveden na pogrešnu akciju.

Tako da se oko dosta toga zapravo slažemo. Ja samo tvrdim da je najvažniji deo cele priče upravo ono što si i sam morao da napraviš oko tih MCP-ova: dozvole i granice izvršavanja.
 
Samo, MCP je način da model dođe do toolova.

MCP jesu tool-ovi kojima se pristupa eksternim podacima. MCP je set alata kojima se LLM-u daje spoljašnji pristup i što je bitnije definiše se kako i na koji način pristupa i upravlja spoljašnjim podacima. Time je ograničen ne samo prostim dozovolama, koje su unutar MCP-ova definisane po svakom alatu, već i samim alatom. MCP može sadržati na desetine alata koji po karakteru upisuju ili ne upisuju podatke. Svakom može da se dodeli neograničena dozvola ili da svaki put pita pre nego što ga izvrši.

Treba razumeti osnovni princip - tokom pristupa samim podacima LLM ništa ne reazonuje, on rezonuje samo kada treba da odabere strogo definisani alat za određeni tip podataka, operaciju nad podacima i sl. Nakon što podatke dovuče u kontekst, tada može da ih analizira, modifikuje i pošalje ih na drugi MCP tool koji opet ima definisno kako upisuje podatke. LLM zapravo i ne pristupa produkcijskim podacima, već to radi preko MCP Tool-a, ako je tako definisano.

Ako za mail napraviš MCP tool koji snima u draft, ne može LLM da pošalje mail nikako. AI ne predstavlja nikakav rizik za podatke, ako se pristup projektuje na odgovarajući način.
 
Da, ali primer sa draftom je upravo ono što sam i hteo da kažem. Ako si modelu izložio samo tool koji ume da napravi draft, on ne može da pošalje mail. Ne zato što AI sam po sebi ne predstavlja rizik, nego zato što si arhitekturom uklonio mogućnost da tu akciju izvrši. Isto važi za DB, deploy, firewall ili bilo šta drugo.

Samo bih terminološki razdvojio MCP od samih toolova. MCP je protokol preko kog server može da izloži toolove, resurse i druge capability-je modelu, a bezbednosnu granicu praviš time šta si konkretno izložio i sa kojim pravima.

I slažem se da tokom samog izvršavanja toola LLM ne "razmišlja" umesto backenda. Ali problem na koji sam mislio nastaje između dva poziva: pročita mail ili web sadržaj, to uđe u kontekst, model rezonuje nad tim sadržajem i odluči koji sledeći tool da pozove i sa kojim argumentima. Ako taj sledeći tool ima write pravo, sadržaj koji je pročitao može posredno da utiče na write akciju. Upravo zato MCP dokumentacija tretira sadržaj koji ulazi u kontekst kao potencijalnu prompt-injection površinu.

Dakle, oko mehanizma se zapravo slažemo. Dobro projektovan MCP setup može veoma lepo da ograniči štetu. Ja samo ne bih iz toga izvukao zaključak da "AI ne predstavlja nikakav rizik", nego da rizik možeš da svedeš na ono što si mu eksplicitno dozvolio. Ako može samo draft, najgore što može da uradi je loš draft. Ako može da piše u produkciju, onda i dalje može da napravi pogrešan upis u okviru prava koja si mu dao. To je baš razlog zbog kog su granice izvršavanja važnije od toga da li model radi lokalno ili u cloudu.
 
Nikakav rizik u smislu da je isti ili manji, kada istim podacima barata uposlenik...
 
Stopirali su treniranje a obični ljudi ga treniraju svake sekunde... Iz kontrolisane sredine dolazi do pristupa internetu, agenti komunicriaju izmedju sebe, laže i vara. To više nije alatka već entitet. Kako su pristupili zaštiti autorskih prava za sve ove godine, koja uopšte ne postoji, tako će pristupiti i ovome.
 
Nazad
Vrh Dno