Šta je novo?

Da li verovati u info od AI? - NE!

Ja se ne mucim sa istim modelom, vec setam izmedju 2 modela (kada mi je bitno da bude sigurno). Koristim Deepseek, pa kad zelim proveru, copy-paste celog odgovora ide u ChatGPT (iako je najgori od sve AI dece), pa onda vratim njegov komentar Deepseek-u. Kada pogresi, Deepseek analizira svoju gresku i priznaje je, ChatGPT i dalje gura svoju pricu, samo podesava narativ da se uklopi u njegov prvobitni odgovor. Zato ChatGPT definitivno treba izbegavati kao osnovni model.
Da, ChatGPT je za izbegavanje, ne priznaje greške nikad. Deepseek i Qwen, pa i CLaude su dosta bolji.

Ne znam u čemu je fora, ali nisu bar nešto random. Pitao sam 4 osobe i dobio 4 različita broja.
Podstaknut tvojim testom, da probam i ja:

1789246638931.webp
Zaključak - bojte se Claude-a 🙂
 
Ja se ne mucim sa istim modelom, vec setam izmedju 2 modela (kada mi je bitno da bude sigurno). Koristim Deepseek, pa kad zelim proveru, copy-paste celog odgovora ide u ChatGPT (iako je najgori od sve AI dece), pa onda vratim njegov komentar Deepseek-u. Kada pogresi, Deepseek analizira svoju gresku i priznaje je, ChatGPT i dalje gura svoju pricu, samo podesava narativ da se uklopi u njegov prvobitni odgovor. Zato ChatGPT definitivno treba izbegavati kao osnovni model.
Mozda zavisi i da li je ChatGPT free ili je Plus/Go, kad su placeni modeli verovatno se vise potrudi za bilo kakav odgovor.
Ako pricamo o generisanju slika - nema konkurenciju, na zalost
 
Poenta je da te ne šalje na stranputicu bez obzira na to da li je plaćena verzija ili ne. Dovoljno je jednom da ga uhvatiš da baroniše, pa da ga potpuno isključiš iz razmatranja.
 
Svaki model halucinira, posebno ako mu se da previše uopšten ili nepotpun prompt.
 
Nekad haluciniraju i kada im daš jako konkretan i precizan prompt. Mada, izgleda ređe neko ranije.
 
  • Like
Reagovanja: NSX
Ne postoji nepogrešiv, postoji samo dobro i loše napisan prompt. Recimo da na nivou Sonnnet5, Terra (pa i Luna) 5.6 nivo halucinacije je relativno mali.
taj relativno mali nivo halucinacije može da napravi poprilično veliki problem, AI je primarno pisan kao pomoć u kodiranju, za sve ostale poslove koji traže tačnost je prilično rizičan za korišćenje, pogotovo od strane nestručnih lica koja su ranije morala da pitaju nekog stručnog, a sada pitaju AI i misle da je to tačno
 
taj relativno mali nivo halucinacije može da napravi poprilično veliki problem, AI je primarno pisan kao pomoć u kodiranju, za sve ostale poslove koji traže tačnost je prilično rizičan za korišćenje, pogotovo od strane nestručnih lica koja su ranije morala da pitaju nekog stručnog, a sada pitaju AI i misle da je to tačno

Odakle to da je AI pisan kao pomoć u kodiranju?
 
primarno je fokus na tome, bar kad je u pitanju moderni AI, evo ti odgovor sa geminija 🙂 ukratko, stvari koje funkcionišu u programiranju ne funkcionišu baš tako u nekim drugim oblastima

While early research focused on logic and robotics, software engineering became the primary proving ground for modern LLM-based agents (starting around 2023–2024) for a few specific reasons:

  1. Closed Verification Loop: Code can be compiled, linted, and tested automatically. An AI agent can write code, run tests, observe terminal output, read error logs, and self-correct without human intervention.
  2. Text-Based Digital Environment: Software engineering lives entirely in predictable digital spaces (files, git repositories, APIs, command lines), making tool integration significantly easier than physical robotics or messy real-world tasks.
  3. Abundant Training Data: High-quality code repositories (such as open-source code on GitHub) provided massive amounts of structured text for models to learn syntax, logic, and patterns.
 
primarno je fokus na tome, bar kad je u pitanju moderni AI, evo ti odgovor sa geminija 🙂 ukratko, stvari koje funkcionišu u programiranju ne funkcionišu baš tako u nekim drugim oblastima

While early research focused on logic and robotics, software engineering became the primary proving ground for modern LLM-based agents (starting around 2023–2024) for a few specific reasons:

  1. Closed Verification Loop: Code can be compiled, linted, and tested automatically. An AI agent can write code, run tests, observe terminal output, read error logs, and self-correct without human intervention.
  2. Text-Based Digital Environment: Software engineering lives entirely in predictable digital spaces (files, git repositories, APIs, command lines), making tool integration significantly easier than physical robotics or messy real-world tasks.
  3. Abundant Training Data: High-quality code repositories (such as open-source code on GitHub) provided massive amounts of structured text for models to learn syntax, logic, and patterns.

Osim što tvoj citat sa Gemini-ja ne potvrđuje tvoju izvornu tvdnju, isti ne mora ništa da znači, jer si i sam napisao...

...za sve ostale poslove koji traže tačnost je prilično rizičan za korišćenje, pogotovo od strane nestručnih lica koja su ranije morala da pitaju nekog stručnog, a sada pitaju AI i misle da je to tačno

LLM je razvijen kako bi mašine mogle da razumeju ljudski govor kao i predikciju govora. Zbog toga je i najuspešniji u poslovima automatizacije.
 
Poslednja izmena:
neki procesi (poput npr. prevođenja) nisu baš samo automatizacija, dok mnogi misle da jesu i eto problema
 
Provera jednog AI-ja drugim zvuči sigurnije nego što jeste. Ako oba omaše, samo dobiješ dve samouverene verzije greške, a to što jedan lakše kaže "pogrešio sam" ne znači automatski da je tačniji. Za bitne stvari provera je izvor, dokument ili merenje, ne glasanje među modelima.

A ovaj test sa brojevima lepo pokazuje koliko lako svi umeju da zvuče kao da iza odgovora postoji neka logika, čak i kada je pitanje praktično poziv na nagađanje. 🙂
 
Juče su mi bili neki prijatelji i uz priču o nekim sajtu koji plaćaju detetu za matematiku i fiziku reših da rešanja sa istog proverim na raznim AI.
Svi sem Chat GPT su dali tačno rešenje. Čak i nakon nekoliko ubeđivanja držao je da je rezultat koji je dao dobar. Tako da Chat GPT definitvno ne za matematikčke zadatke. Generalno, za sve ostale proveriti infomacije koje se od ovih LLM dobijaju.
Problem je što su ljudi počeli "slepo" da veruju istima, kao svojevremeno Vikipediji.
 
Baš me zanima koji je to model pogrešio pošto je OpenAI model rešio navier-stokes equation, čuveni problem iz matematike?

Inače AI su najviše primenili na programiranju baš zato što je to jedan od najtežih problema. Ko god je radio u bazi koda koja ima milion linija zna koliko vremena treba samo da se uđe u to čemu šta služi i šta su genijalci nekada i po duže od decenije hteli da kažu, svako u svom stilu, bez dokumentacije, ili pogrešno dokumentovano.

Sledeći veliki iskorak biće civilno inženjerstvo, tj. projektovanje, gde će se drastično smanjiti vreme potrebno da se uradi projekat, mada već sada maltene da nema oblasti gde se koristi računar kao glavni alat a da napredak nije toliko značajan da onaj ko ne koristi AI nema šta više da traži.
 
ChatGPT je ozbiljno napredovao već sa verzijom 5, konkretno je u free verziji 5.6 Sol i radi odlično sve što mu zadam. U plaćenoj verziji od 20tak dolara su dostupni Luna, Astra i Sol GPT-6 izvedbe i GPT6.1 Sol koji rade bez greške svi navedeni modeli. Astra je uporediva sa Claude kada je kodiranje u pitanju, mada je Claude i dalje bolji ali ne značajno, mislim da OpenAI daje više tokena za pare od Antropica, barem u 20tak dolara rangu, ali ko plaća 100 dolara Claude i ne mora da gleda dalje.

U svakom slučaju, napredak svih modela je ogroman osim Gemini koji još uvek ima problema sa čuvanjem konteksta, ovi ostali su to rešili. Prošle godine u ovo vreme ili prošlo leto recimo su znali da se izgube i vraćaju gluposti, sada je toga sve manje i manje, toliko da je gotovo neprimetno.

Naravno do napretka cloud AI imaju korist i self hosted modeli koji su dovoljno blizu, samo treba imati dovoljno memorije i snažan hardver kako bi se pokretali.

Skoro sam probao neki MIT licenciran grafički klijent za MongoDB koji je vibe kodovao neki Indijac koristeći Claude, okačio na GitHub MIT licenciran, znači slobodno za preuzimanje i modifikacije svake vrste. Uz ChatGPT sam ga modifikovao source, izmenio određene funkcionalnosti. Osnovni program radi bez greške, kao i modifikovana verzija.
Pre AI ovakvi programi su se uglavnom naplaćivali i to solidno, jedini free klijent je bio onaj Compass što radi ista firma koja razvija MongoDB. U suštini uz dovoljno potrošenih tokena se može napisati klijent koji uopšte ne zavisi od web tehnologija, mnogo brži i manji potrošač resursa i da ima funkcionalnost koja tačno odgovara vašoj upotrebi.

Nije ni čudo što je propao CAKE, i što propadaju slične firme. Ono što je njihov glavni proizvod je smejurija za AI da napravi za par nedelja uz navođenje samog jednog softverskog inženjera, i to savršeno ispeglano. A za par dana se već dobije savršeno upotrebljiva verzija. I to uz minimalno cimanja, uz ozbiljan setup sve gotovo za jedan radni dan...

Ne sviđa vam se Electron, nećete da plaćate Sublime Code licencu, napravite svoju verziju pomoću AI. Ne znam da li ću i ja imati posla za koju godinu, ali kojim tempom napreduje AI uskoro će svi biti ozbiljno ugroženi i naravno braniće se jače nego ikada propagandom protiv AI programa, modela, odbijaće celu tu priču verovatno pokušavajući i neki AI terorizam pojedini u pokušaju da se zaustavi.
 
Poslednja izmena:
Oduvek je na Mac-u bilo jako teško sinhronizovati automatski bookmarks-e između Chrome-a i Safari-ja.
Claude mi je za par minuta kroz XCode napisao app za to. Jednostavna menu bar aplikacija koja radi posao.

Apple gura vibe coding. XCode ima ugrađenu podršku za Claude Code i OpenAI Codex, samo se ulogujete sa nalogom. Unutar XCode-a ima već opcija za vibe coding i prompt. Agent daje sors kod, kompajlira i na kraju instalira i startuje aplikaciju.

Safari u MacOS 27 ima opciju da preko AI napravi ekstenzije uz pomoć prompta. Opišete mu kakvu ekstenziju hoćete i on je napravi i aktivira.

Ljudi obično ocenjuju AI irelevantnim pitanjima u free chat-u, gde su obično u pitanju stariji modeli. Napredak kod AI modela je na mesečnom nivou, a najnoviji modeli su sve više zatvoreni iza paywall-a.
 
Kakav motiv imam da platim uslugu kada je ta besplatna cesto banalno pogresna? Pricam o ChatGPT, bukvalno nijedan drugi model nema takve kriminalne ispade. Claude te ogranici na malo upita, i to je OK strategija, ChatGPT vrlo cesto bude bukvalno antireklama za AI.
 
Bukvalno je suprotno, nešto što ne uliva poverenje kao promotivni proizvod, ne zavređuje ni razmatranje za plaćanje.
 
Bukvalno je suprotno, nešto što ne uliva poverenje kao promotivni proizvod, ne zavređuje ni razmatranje za plaćanje.
Nije tako uvek. Upoređivao sam konkretno ChatGPT na plaćen i free planu i odgovori su bili mnogo konkretniji i bolji na plaćenom. Istraživao je više i davao mi više konteksta.
 
Nazad
Vrh Dno