Šta je novo?

Pravljenje muzike uz pomoć AI

Да ли сте тестирали нови Flow Music (Гоогле производ) који може се рећи одлично ради посао на платформи Lyria 3.5 баш се види напредак јако озбиљан посао ради, а жанрове, стилове као и вокале добро примећује, чак и на једноставном промпт-у даје добре резултате. https://www.flowmusic.app/
 
Poslednja izmena:
Znači ovaj Suno je postao takvo smeće da ozbiljno razmišljam da otkažem pretplatu. Nema šta nisam pokušavao, konstantno mi ubacuje neke gluposti u pesme....
 
Znači ovaj Suno je postao takvo smeće da ozbiljno razmišljam da otkažem pretplatu. Nema šta nisam pokušavao, konstantno mi ubacuje neke gluposti u pesme....
Na šta konkretno misliš? Ja u poslednje vreme samo retro narodnjake pišem i jedino što nikako ne mogu da ga nateram je da mi uvod skrati nego uvek napravi uvod od 40+sekundi.
 
Ljudi, komande su bitne. Naravno, kada mu daš stil on povuče obično iz tog žanra gde vidi da je intro dug.

Mene nevira kada krene sa glasovima pre nego što udje u verse 1 ali sam ga i tu ukrotio.

Da bi se dobila savršena verzija, treba baš da te ubode. Mene obično treba preko 150 generisanja xD

Naravno, tu je uključeno i da moram menjati svoj tekst zbog flowa. Na kraju to ispadne topka.
 


Evo jedne i od mene 😄 U ovoj sam IT terminologiju baš terao do maksimuma. 😂
Jedna od mojih retkih pesama na našem jeziku.
 
Poslednja izmena:
Ljudi, komande su bitne. Naravno, kada mu daš stil on povuče obično iz tog žanra gde vidi da je intro dug.

Mene nevira kada krene sa glasovima pre nego što udje u verse 1 ali sam ga i tu ukrotio.

Da bi se dobila savršena verzija, treba baš da te ubode. Mene obično treba preko 150 generisanja xD

Naravno, tu je uključeno i da moram menjati svoj tekst zbog flowa. Na kraju to ispadne topka.
Ma zadam je njemu da intro bude i kratak i max 10 sekunde ali nista.
 
Na šta konkretno misliš? Ja u poslednje vreme samo retro narodnjake pišem i jedino što nikako ne mogu da ga nateram je da mi uvod skrati nego uvek napravi uvod od 40+sekundi.
Mislim na to da mi ubaciva glasove u intro tipa "Opaaa", pa onda neko arapsko zavijanje, čak iako mu naglasim da ne ubacuje. Onda ubacuje instrumente koje naglasim da ne ubaci, ma ubacuje sve živo, uopšte ne ferma prompt ni 10%. Nema šta nisam pokušavao, i vidim da nisam jedini koji ima ovaj problem, i mislim da su nešto debelo zaebali.
 
Mislim na to da mi ubaciva glasove u intro tipa "Opaaa", pa onda neko arapsko zavijanje, čak iako mu naglasim da ne ubacuje. Onda ubacuje instrumente koje naglasim da ne ubaci, ma ubacuje sve živo, uopšte ne ferma prompt ni 10%. Nema šta nisam pokušavao, i vidim da nisam jedini koji ima ovaj problem, i mislim da su nešto debelo zaebali.
A sta mu zadaš u promptu? Daj da vidimo konkretno.
 
Ja stavim ovo:

no vocalizing before Verse 1, vocals start directly with the first lyric...
 
AI je alat, a iz duše (koliko god ovo zvučalo kao kliše) ide sve ostalo. Naravno, dosta truda je potrebno da bi se dobila 'prava stvar'. Pogledajte i prosudite (btw, izbegavam glupe spotove i šarene i šarene thnubnail-ove jer želim da fokus bude samo na dobroj 'mjuzi'). Sve je u fazonu kasnih 80tih kada je muzika, bar po mommišljenju, još uvek imala dušu i emociju... Javite šta mislite... ovo je prvenac...
 
Poslednja izmena:
Mnogi kukaju na AI a mogu da zamislim da svi poznati ubace tekst i vide kako može da zvuči pa ubrzaju produkciju.


Problem je što napišeš pesmu, suno odradi savršenu verziju ali ako nemaš marketing da te gura, teško će biti viral.

Moja poslednja pesma napisana pesma je vezana za Božić i nije klasična pesma o Božiću kojih ima na kamaru, pogodio sam nišu gde slične pesme ne postoje.

I počivao je u avgustu na spotify, dovoljno da procene da li vredi da me ture na nekoj listi 😁
 
Na osnovu prostog prompta sam dobio ovo, ali nema velikog pomaka:
v6-mini
v6-preview
Mišljenja sam da v4.0 i 5.0 su na samim počecima davali bolje rezultate. Međutim, nakon ekspanzije 5.0 a po uvođenju 4.5-all, isti je u početku davao bolje rezultate i istorija se ponavlja (v6-mini je trenutno bolji). Jedino što se promenilo je da nema više bespotrebno prenaglašenih deonica u gornjim lagama, ali ostaje onaj bumerski potpis. No, još uvek nemaju čiste vokale, prošle i početkom ove godine su dva modela prešišala i Udio, tako da, budućnost kakva se za Suno očekivala je drugde stigla još mnogo, mnogo pre.
 
Moja kompozicija i tekst,improvizacija posle druge strofe AI

 
Malo bolje radi duet sad i posluša kad je muški a kad ženski vokal. Ali zato sad šta god staviš u stil muzike on kad počneš da kreiraš vidiš da je sve promenilo. Neki zvuk sa našeg prostora opšte ne može da se postigne harmonika zvuči ko za polke trube ko meksičke ili ko zurle.
 
Malo bolje radi duet sad i posluša kad je muški a kad ženski vokal. Ali zato sad šta god staviš u stil muzike on kad počneš da kreiraš vidiš da je sve promenilo. Neki zvuk sa našeg prostora opšte ne može da se postigne harmonika zvuči ko za polke trube ko meksičke ili ko zurle.
pod "more options" imate novi klizač "variety" ,podrazumevano je podešen na "balanced variety " što znači da AI menja malo upit svaki put kada generišete pesmu. Prebacite ga na "exact style " onda je upit nepromenjen kako ste ga napisali.
 
Javite šta mislite... ovo je prvenac...

Dobra je. Ja bih se samo malo potrudio da rešim metriku u prvoj strofi. U poslednjem stihu ima viška slogova.

Mnogi kukaju na AI a mogu da zamislim da svi poznati ubace tekst i vide kako može da zvuči pa ubrzaju produkciju.


Problem je što napišeš pesmu, suno odradi savršenu verziju ali ako nemaš marketing da te gura, teško će biti viral.

Moja poslednja pesma napisana pesma je vezana za Božić i nije klasična pesma o Božiću kojih ima na kamaru, pogodio sam nišu gde slične pesme ne postoje.

I počivao je u avgustu na spotify, dovoljno da procene da li vredi da me ture na nekoj listi 😁
Bolje je ne ložiti se na to. Suno ne pravi finalan proizvod nego samo demo.
 
Dobra je. Ja bih se samo malo potrudio da rešim metriku u prvoj strofi. U poslednjem stihu ima viška slogova.


Bolje je ne ložiti se na to. Suno ne pravi finalan proizvod nego samo demo.
Sjajno uvo, i u pravu si. 🙂

U prvoj verziji pesme jeste bilo IL' (umesto ILI) ali nije lepo zvučalo. Jeste da je malo razvukao poslednju reč ali je ona prilično duga pa ju je nekako 'smotao' i ta mala pauza u stvari i naglašava značenje te reči. Drugi samoglasnik u ILI je dao tečnije ispevavanje i mislim da nije loše ispalo.

Inače, IL' je ostalo u pop verziji. Ovo je lagana verzija pa je ispalo tečnije. 😉





Ne znam kako je kod vas ljudi ali meni je V6 model je katastrofa. Nekonzistentan, bandoglav i još uvek previše 'pop-uje' aranžmanu. Nije mi jasno zašto nisu ostavili i starije modele koji su bili dosta bolji za ponešto (pogotovo sirov rock zvuk).
 
YuE2 lokalno u ComfyUI - pesme, reference/cover i instrumentali

Evo nečega za one kojima je zanimljivo lokalno generisanje muzike, umesto oslanjanja isključivo na Suno/Lyria servise.

Poslednjih dana testiram YuE2-3B u ComfyUI-ju. Ne bih ga predstavljao kao nekakav "Suno killer", ali kvalitet aranžmana, instrumenata i finalnog zvuka je već dovoljno dobar da ima smisla porediti ga sa ozbiljnim cloud servisima.

Po mom praktičnom utisku, ukupni kvalitet je već u istoj široj kategoriji sa Suno i Google Lyria 3.5, s tim što ovde sve radi lokalno i imate dosta više kontrole nad samom kompozicijom.

Autori ga porede sa Suno v5/v6. Na njihovom WildSongBench testu standardni YuE2 ima SongBench Avg 6.7316, Suno v6 6.5562, dok YuE2 best-of-8 ide do 6.9632.

To, naravno, ne znači da je YuE2 univerzalno bolji. Različiti modeli imaju različite prednosti, a automatski benchmark nije isto što i slepi ljudski test.

WildSongBench rezultati i metodologija

Kod mene radi na RTX 5090 32 GB, BF16.

Šta je zanimljivo kod YuE2

YuE2 može da napravi kompletnu pesmu direktno iz Style + Lyrics, ali može i prvo da napravi simbolički plan pesme:

Kod:
Style + Lyrics
↓
ABC score
melodija + akordi
↓
YuE2
↓
48 kHz stereo audio

ABC može da se pregleda i menja pre finalnog rendera.

Režimi su:

Kod:
FULL    = melodija + akordi
MELODY  = melodijski plan, više slobode za harmoniju/aranžman
OFF     = bez symbolic planninga

Za običan text-to-song uglavnom koristim FULL.

Za reference i ozbiljniju promenu žanra često mi je bolji MELODY.

Srpski

Ovde odmah jedna ograda.

Zvanično su kao podržani jezici navedeni engleski i kineski. Srpski ipak radi zero-shot i ume da bude iznenađujuće upotrebljiv. Tekst razume, peva ga i dosta reči izgovori potpuno normalno.

Najveći problem je akcenat.

Na pojedinim bitnim rečima naglasi pogrešan slog i tada se odmah čuje da srpski nije primarno podržan jezik.

Probao sam i ručno označavanje akcenata, ali je kod mene rezultat bio još gori, pa sada koristim običnu latinicu ili ćirilicu, bez fonetskih znakova, i probam nekoliko seedova.

Kod:
muzika / aranžman / produkcija: vrlo dobri
engleski vokal: vrlo dobar
srpski vokal: upotrebljiv
srpski akcenat: još nije pouzdan

ComfyUI

Najlakše je koristiti Windows Portable za NVIDIA.

Direktan download - ComfyUI Windows Portable NVIDIA

ComfyUI - zvanični GitHub

Raspakuje se i pokreće:

Kod:
run_nvidia_gpu.bat

Pre YuE2 workflowa preporučujem da ComfyUI bude ažuriran, pošto sada ima native YuE2 podršku.

Glavni YuE2 model

Koristim:

Kod:
yue2_3b_bf16.safetensors

Ide u:

Kod:
ComfyUI\models\checkpoints\

Comfy-Org YuE2 - svi ComfyUI modeli

Direktan download - yue2_3b_bf16.safetensors

Postoji i INT8 verzija, ali ako imate dovoljno VRAM-a, ja bih koristio BF16.

Originalni model:

m-a-p/YuE2-3B

YuE2 - zvanični GitHub

Reference / cover

Za postojeći WAV/FLAC kao muzičku referencu treba:

Kod:
sheetsage2_bf16.safetensors

Ide u:

Kod:
ComfyUI\models\audio_encoders\

Direktan download - sheetsage2_bf16.safetensors

SheetSage2 ne šalje originalni waveform direktno YuE2-u, već radi otprilike ovo:

Kod:
reference audio
↓
SheetSage2
↓
ABC score
↓
YuE2 + novi Style/Lyrics
↓
nova verzija

Zbog toga mogu da se rade stvari tipa:

Kod:
trap → modern pop
rock → jazz
pop → metal
balada → synthpop

Za veću promenu stila koristim MELODY.

Ako želim da sačuvam više originalne harmonije, onda FULL.

Ako koristite tuđe komercijalne pesme kao reference i rezultat planirate javno da objavljujete, treba, naravno, voditi računa o autorskim pravima.

Instrumental LoRA

Za instrumentale postoji korisna AR LoRA:

Kod:
ar_lora_inst_v3abc_comfyui.safetensors

YuE2 Instrumental AR LoRA

ar_lora_inst_v3abc_comfyui.safetensors - download stranica

Ide u:

Kod:
ComfyUI\models\loras\

LoRA je trenirana na približno 2.700 instrumentalnih numera uparenih sa ABC scoreovima.

Bitna stvar je da ovo nije klasična audio LoRA.

Menja AR planner, odnosno u native ComfyUI workflowu koristi se kroz CLIP granu:

Kod:
YuE2 CLIP
↓
LoraLoader
strength_clip = 1.0
↓
YuE2 Generate ABC
↓
YuE2 Generate Music

Za početak koristim:

Kod:
strength_clip = 1.0
mode = full
lyrics = [instrumental]

Bez nje standardni YuE2 ume da ubaci vocal chop, humming ili uzdahe čak i kada prompt traži čist instrumental.

LoRA to dosta smanjuje, ali nije apsolutni vocal suppressor.

Workflowi

Zvanični ComfyUI workflowi:

YuE2 Text-to-Music workflow

YuE2 Music Cover / Reference workflow

Uz njih kačim i workflowe koje sam prilagodio:

Kod:
YuE2_3B_BF16_Instrumental_AR_LoRA_ComfyUI.json
YuE2_3B_BF16_Reference_Instrumental_AR_LoRA_ComfyUI.json
ComfyUI-YuE2-Reference-Instrumentalizer.zip

Poslednji je mali helper node za instrumentalni reference workflow.

Problem je što SheetSage2 score može da sadrži:

Kod:
V: Vocal
V: Ins

Ako Vocal deo direktno ode dalje, YuE2 ponekad odluči da tu melodiju treba da peva ili pevuši.

Helper može Vocal note automatski da pretvori u rests:

Kod:
vocal_to_rests

dok instrumentalna staza ostane sačuvana.

Recimo, za:

trap reference → modern pop instrumental

koristim:

Kod:
SheetSage2 = melody
Instrumentalizer = vocal_to_rests
Instrumental LoRA = 1.0
Lyrics = [instrumental]

Na taj način ostane prvenstveno melodijska ideja reference, dok YuE2 ponovo pravi harmoniju, drums, bass, synthove i ostatak aranžmana.

Folderi

Kod:
ComfyUI
├── models
│   ├── checkpoints
│   │   └── yue2_3b_bf16.safetensors
│   │
│   ├── audio_encoders
│   │   └── sheetsage2_bf16.safetensors
│   │
│   └── loras
│       └── ar_lora_inst_v3abc_comfyui.safetensors
│
└── custom_nodes
└── ComfyUI-YuE2-Reference-Instrumentalizer

Licenca

Vredi pročitati aktuelni model card pre komercijalne upotrebe.

YuE2 weights su CC BY-NC 4.0 uz dodatnu creator permission.

Autori trenutno navode da personal users, content creators i musicians mogu da koriste YuE2 i monetizuju generisane outpute bez njihovih naknada, dok kompanije treba da ih kontaktiraju za komercijalnu licencu za weights.

Licenca i aktuelni uslovi na zvaničnom YuE2 repozitorijumu

Zaključak

Suno/Lyria su svakako jednostavniji: napišeš prompt i gotovo.

YuE2 traži GPU, ComfyUI i malo petljanja oko workflowa, ali zauzvrat dobijaš lokalnu generaciju, editabilnu melodiju i harmoniju, reference workflow i dosta prostora za eksperimentisanje.

Za engleski mi deluje vrlo ozbiljno.

Za srpski je upotrebljiv i često prijatno iznenadi, ali pogrešan akcenat na pojedinim rečima je trenutno njegova najočiglednija mana.
 
Pošto nemam adekvatan hardver i jaču grafičku, odnosno konfigurisao bih Google Colab za slične potrebe, ali nikako da se nakanim; Da li YuE2 funkcioniše na očekivani način u domašaju gde ti se generiše pesma na osnovu svoje melodije koju otpevaš? (pod pretpostavkom da znaš da pevaš)
 
Da, u principu može baš tako, samo nije direktno fazon "ubaci sirov glas u YuE2". Otpevaš svoju melodiju u WAV/FLAC, SheetSage2 je transkribuje u ABC score, pa YuE2 dobije taj ABC zajedno sa Style promptom i Lyrics i od toga generiše kompletnu novu pesmu. Zvanični cover workflow upravo koristi SheetSage2 da iz reference izvuče vocal/lead melodiju i koristi je kao simbolički melody condition.

Ako čisto otpevaš svoju melodiju, pogotovo a cappella ili uz vrlo prostu pratnju, trebalo bi da bude sasvim dobar input. Naravno, sve zavisi od toga koliko SheetSage2 pogodi pitch, ritam i fraziranje, tako da nije garantovano da će svaka nota biti 1:1. Dobra stvar je što dobijeni ABC možeš da pregledaš i ručno ispraviš pre generacije.

Za taj scenario koristiš MELODY mode - tvoja melodija ostaje osnova, a YuE2 pravi harmoniju, instrumente i aranžman. Ne klonira ti glas niti čuva timbre pevača, već iz reference uzima melodiju, dok novi vokal generiše prema Style promptu. Može i tvoj tekst, samo je poželjno da broj slogova i fraziranje približno legnu na melodiju.

Colab je tehnički izvodljiv ako dobiješ dovoljno jak GPU, ali zvanični BF16 quick-start cilja NVIDIA karticu sa 24 GB VRAM-a, pa ne bih računao da će svaka Colab instanca to progutati. Na slabijoj bi morao da probaš INT8 ili neki drugi memory-saving setup.

Dakle, nije isto što i Suno "Upload Audio", preciznije je audio -> symbolic melody -> nova generacija. Meni je baš taj koncept jedna od zanimljivijih stvari kod YuE2: smisliš i otpevaš melodiju, a model od nje napravi ceo produkcijski aranžman.
 
  • Interesting
Reagovanja: uji
Nazad
Vrh Dno