Przejdź do treści

ACE-Step 1.5: własna muzyka z AI na komputerze – instalacja, interfejs ze zrzutami ekranu, pierwszy utwór i jak pisać opisy i teksty (2026)

Prostymi słowami: co to jest ACE-Step 1.5 i co potrafi, jaki komputer jest potrzebny, instalacja na Macu, Windows i Linuksie, interfejs Playground pole po polu ze zrzutami ekranu, pierwszy utwór w trybie Simple i Custom, jak pisać opis stylu i tekst z tagami, remiks, przemalowanie, LoRA, prawo i najczęstsze problemy.

Wolisz zapytać niż czytać dalej?

Otwórz asystenta AI i zadaj pytanie do tego poradnika.

ACE-Step 1.5 to otwarty model, który tworzy kompletne piosenki z tekstem i wokalem, na własnym komputerze, bez chmury, bez abonamentu i bez limitów. Wpisujesz opis stylu i słowa, klikasz „Generate Music”, a po kilkudziesięciu sekundach masz plik MP3. Ten przewodnik prowadzi od zera: co to jest i co potrafi, jaki komputer jest potrzebny, jak zainstalować na Macu, Windows i Linuksie, co znaczą pola w interfejsie (ze zrzutami ekranu z działającej instalacji), jak zrobić pierwszy utwór, jak pisać opisy i teksty, żeby wychodziło dobrze, i co dalej: remiks, przemalowanie fragmentu, własny styl przez LoRA. Wszystko po polsku, prostymi słowami.

Ostatnia weryfikacja: 7 września 2026. Materiał informacyjny. ACE-Step rozwija się szybko: nazwy pól, modele i wymagania zmieniają się z wersji na wersję; zrzuty ekranu pochodzą z wersji pobranej z repozytorium 29 sierpnia 2026, uruchomionej na Macu z Apple Silicon. Aktualna dokumentacja: github.com/ace-step/ACE-Step-1.5.

W skrócie

Najważniejsze
  • ACE-Step 1.5 to darmowy, otwarty model do tworzenia muzyki na licencji MIT, rozwijany przez ACE Studio i StepFun. Tworzy utwory od 10 sekund do 10 minut, z wokalem w ponad 50 językach, w tym po polsku, oraz utwory instrumentalne (dokumentacja).
  • Działa lokalnie: na kartach NVIDIA od około 4 GB pamięci (tryb bez planera) i 6 GB (pełny), na Macach z Apple Silicon przez MLX, na AMD i Intel. Modele zajmują około 10 GB na dysku (instrukcja instalacji).
  • Instalacja to trzy polecenia (menedżer uv, pobranie repozytorium, uruchomienie) albo gotowa paczka na Maca i Windows. Interfejs otwiera się w przeglądarce pod adresem 127.0.0.1:7860.
  • Dwa tryby na start: Simple (piszesz jedno zdanie, model sam układa opis, tekst i parametry) i Custom (piszesz opis stylu i tekst z tagami [Verse], [Chorus]). Najważniejszym polem jest opis stylu; drugim tekst z tagami.
  • Na Macu z Apple Silicon utwór 30-sekundowy powstaje w około pół minuty; na mocnej karcie NVIDIA cała piosenka w kilka sekund. Model generuje kilka wersji naraz i potrafi je sam ocenić.
  • Utwory są Twoje do słuchania i eksperymentów; przy publikacji sprawdzaj oryginalność, oznaczaj udział AI i nie kopiuj stylu konkretnych artystów bez zgody. Tak zaleca sam projekt.

Co to jest ACE-Step, prostymi słowami

ACE-Step to program, który z opisu słownego robi nagranie muzyczne. Piszesz, jaki styl chcesz („ciepły folk z gitarą akustyczną i pianinem, nostalgicznie, wolno”), dopisujesz tekst piosenki z oznaczeniem zwrotek i refrenów, a model tworzy gotowy utwór: aranżację, instrumenty, wokal śpiewający Twój tekst. To odpowiednik komercyjnych serwisów jak Suno czy Udio, z tą różnicą, że działa na Twoim komputerze, jest darmowy i nic nie wysyła do chmury.

W środku pracują dwa „mózgi”, i warto to zrozumieć, bo tłumaczy pola w interfejsie (samouczek projektu):

Planer (LM)

Mały model językowy, który czyta Twój opis i tekst, wymyśla brakujące rzeczy (tempo, tonację, długość, a w trybie Simple także cały tekst) i rozpisuje „szkic” utworu. W interfejsie to „5Hz LM” i przełącznik „Think”.

Wykonawca (DiT)

Model dyfuzyjny, który ze szkicu i opisu tworzy sam dźwięk. Wersja „turbo” robi to w 8 krokach i jest polecana na co dzień; „base” i „sft” w 50 krokach, dokładniej i wolniej.

Jak o tym myśleć

Planer to producent, który z Twojego pomysłu robi plan nagrania; wykonawca to zespół w studiu. Opis stylu mówi obu, co chcesz; tekst z tagami mówi, co ma się dziać w kolejnych sekundach.

Co potrafi

FunkcjaCo robiTryb w interfejsie
Piosenka z opisuJedno zdanie, model dopisuje resztęSimple
Piosenka z opisu i tekstuPełna kontrola: styl, tekst z tagami, tempo, tonacja, długośćCustom
Utwór instrumentalnyBez wokalu, np. podkład, muzyka do filmuSimple lub Custom, pole „Instrumental”
Remiks / coverZachowuje melodię i strukturę nagrania, zmienia stylRemix
Przemalowanie fragmentuGeneruje od nowa wybrane sekundy, reszta bez zmian; do poprawek i wydłużaniaRepaint
Nagranie jako wzór styluPodajesz plik, model naśladuje brzmienieCustom, pole „Reference Audio”
Rozdzielanie ścieżek, dokładanie instrumentówWyciągnij wokal lub perkusję, dołóż gitaręExtract, Lego, Complete (tylko model base)
Własny stylNauka na kilku Twoich nagraniach (LoRA)Zakładka LoRA Training
Tekst z czasemPlik LRC z synchronizacją słówAuto LRC

Jaki komputer jest potrzebny

Wymagania według instrukcji projektu (INSTALL): Python 3.11 lub 3.12, około 10 GB miejsca na dysku na modele, karta graficzna NVIDIA zalecana, ale obsługiwane są też Apple Silicon (MPS i MLX), AMD (ROCm), Intel i sam procesor. Pamięć karty decyduje, co uruchomisz:

Pamięć karty (VRAM) lub pamięć wspólna MacaCo wybierze programCzego się spodziewać
do 6 GBTylko wykonawca 2B turbo, bez planera; kwantyzacja INT8 i przenoszenie do pamięci procesoraDziała, ale bez trybu Simple i bez „Think”; opis i tekst piszesz sam
6–8 GB2B turbo + planer 0,6BPełne funkcje, wolniej
8–16 GB2B turbo lub sft + planer 0,6B lub 1,7BWygodna praca
16–24 GBModele XL (4B) z lepszą jakością dźwiękuWysoka jakość
24 GB i więcejXL sft + planer 4BNajlepsza jakość, wszystko w pamięci

Program sam wykrywa sprzęt i ustawia „poziom” (tier) z odpowiednimi domyślnymi ustawieniami; w ustawieniach można go nadpisać. Na Macu z Apple Silicon liczy się pamięć wspólna: Mac z 16 GB zachowuje się jak karta z kilkunastoma GB, Mac z 64 GB wchodzi w najwyższy poziom. Dlaczego pamięć wspólna Maca jest do takich zadań wygodna, wyjaśniamy w przewodniku po Ollamie; zasada jest ta sama.

Ile to trwa: autorzy podają poniżej 2 sekund na całą piosenkę na karcie A100 i poniżej 10 sekund na RTX 3090. Na Macu z Apple Silicon w naszym teście 30-sekundowy utwór instrumentalny w trybie Custom z włączonym „Think” powstał w 31,6 sekundy: 17,4 s planer, 14,2 s wykonawca. Pierwsze uruchomienie po starcie programu jest wolniejsze, bo modele ładują się do pamięci.

Instalacja krok po kroku

Są dwie drogi: gotowa paczka (rozpakowujesz i uruchamiasz skrypt) albo instalacja z repozytorium (trzy polecenia w terminalu). Obie opisuje instrukcja projektu.

Droga 1: gotowa paczka (Mac z Apple Silicon, Windows)

  1. Pobierz paczkę

    Linki do paczek dla macOS i Windows są w sekcji Quick Start w repozytorium (pliki ACE-Step-1.5.zip dla Maca i .7z dla Windows, z zainstalowanymi zależnościami). Pobieraj tylko z repozytorium na GitHubie; projekt ostrzega przed podrobionymi stronami.

  2. Rozpakuj do folderu bez polskich znaków i spacji

    Np. Dokumenty/ACE-Step-1.5. Paczka waży kilka GB, a modele pobiorą się przy pierwszym starcie (około 10 GB).

  3. Uruchom skrypt startowy

    Mac: w terminalu wejdź do folderu i uruchom skrypt dla macOS (polecenia niżej). Windows: dwukrotnie kliknij start_gradio_ui.bat.

  4. Poczekaj na pobranie modeli i otwórz przeglądarkę

    Przy pierwszym starcie skrypt pobiera modele; potem w terminalu pojawi się adres. Wpisz w przeglądarce http://127.0.0.1:7860.

Polecenia · Mac z Apple Silicon (Terminal, w folderze ACE-Step-1.5)

chmod +x start_gradio_ui_macos.sh
./start_gradio_ui_macos.sh

Skrypt dla macOS sam ustawia silnik MLX, czyli natywne przyspieszenie na Apple Silicon, i port 7860 (instrukcja). Macbook z procesorem Intel działa tylko na procesorze i bardzo wolno; ACE-Step ma sens na M1 i nowszych.

Droga 2: z repozytorium (Mac, Windows, Linux)

Polecenia z dokumentacji projektu. Wklejasz po kolei do terminala (Mac: program Terminal; Windows: PowerShell; Linux: dowolny terminal). Potrzebny jest git; na Macu system zaproponuje instalację narzędzi deweloperskich przy pierwszym użyciu.

Polecenie 1 · instalacja menedżera uv (Mac i Linux)

curl -LsSf https://astral.sh/uv/install.sh | sh

Polecenie 1 · instalacja menedżera uv (Windows, PowerShell)

powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"

Polecenie 2 · pobranie programu i zależności

git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5
uv sync

Polecenie 3 · uruchomienie (modele pobiorą się przy pierwszym starcie)

uv run acestep

Na Macu zamiast polecenia 3 lepiej użyć skryptu start_gradio_ui_macos.sh z poprzedniej sekcji, bo włącza MLX. Po starcie w terminalu pojawi się adres; otwórz http://127.0.0.1:7860 w przeglądarce. Zamykasz program klawiszami Ctrl+C w terminalu.

Ustawienia startowe: plik .env

Zamiast wpisywać opcje w poleceniu, tworzysz w folderze programu plik .env (kopia pliku .env.example) i wpisujesz w nim, jaki model wykonawcy i planera ładować, jaki port i język interfejsu. Plik przetrwa aktualizacje programu (dokumentacja).

Plik .env · przykład dla Maca z 16–32 GB pamięci

ACESTEP_CONFIG_PATH=acestep-v15-turbo
ACESTEP_LM_MODEL_PATH=acestep-5Hz-lm-0.6B
PORT=7860
LANGUAGE=en

Przy 64 GB pamięci i więcej można wpisać planer acestep-5Hz-lm-1.7B, a na mocnych kartach NVIDIA model XL. Aktualizacja programu: skrypt check_update.sh w folderze albo polecenie git pull i ponowne uv sync.

Interfejs: co gdzie jest

Po otwarciu adresu w przeglądarce widzisz jedną stronę z trzema częściami: zwinięte „Settings” (ustawienia), zakładki „Generation” i „LoRA Training”, a niżej wyniki. Zrzuty ekranu poniżej pochodzą z działającej instalacji na Macu.

Główne okno ACE-Step 1.5 Playground: tryb Custom, pola Source Audio, Reference Audio, Music Caption, Lyrics i przycisk Generate Music
Główne okno w trybie Custom. Na górze wybór trybu, w środku pola opisu stylu (Music Caption) i tekstu (Lyrics), na dole przełączniki Think, Auto Score, AutoGen, Auto LRC i przycisk Generate Music.
ElementDo czego
Settings (na górze, zwinięte)Wybór modeli, urządzenia, ustawienia jakości i formatu pliku. Na start nie trzeba tam wchodzić; program ustawia domyślne wartości dla Twojego sprzętu.
Generation ModeSimple, Custom, Remix, Repaint. Przy modelu base także Extract, Lego, Complete.
Source AudioNagranie wejściowe do trybów Remix i Repaint. W trybie Custom może zostać puste.
Reference AudioNagranie jako wzór brzmienia (opcjonalnie).
Music CaptionOpis stylu: gatunek, instrumenty, nastrój, tempo, wokal. Najważniejsze pole.
LyricsTekst piosenki z tagami [Verse], [Chorus], [Bridge]. Pole „Instrumental” wyłącza wokal.
Enhance Caption, Enhance LyricsPlaner rozbudowuje Twój krótki opis lub tekst.
Kostka „Click Me”Losowy przykład opisu i tekstu, dobry do nauki, jak pisać.
Optional ParametersTempo (BPM), tonacja, metrum, język wokalu, długość w sekundach, liczba wersji (Batch Size). Domyślnie „Auto”.
ThinkWłącza planer: model sam dobiera tempo, tonację, długość i rozpisuje szkic. Zostaw włączone, chyba że masz mało pamięci.
Auto Score, Auto LRC, AutoGenAutomatyczna ocena jakości, plik z synchronizacją tekstu, automatyczne generowanie kolejnych partii w tle.
ResultsOdtwarzacze dla każdej wersji, przyciski Send To Remix, Send To Repaint, Save, lista plików do pobrania i czasy generowania.

Pierwszy utwór w trzy minuty: tryb Simple

Tryb Simple: pole Song Description, wybór języka wokalu, pole Instrumental i przycisk Create Sample
Tryb Simple: jedno pole na opis piosenki, wybór języka wokalu, pole Instrumental i przycisk Create Sample.
  1. Wybierz „Simple”

    W wierszu Generation Mode kliknij Simple.

  2. Opisz piosenkę jednym lub dwoma zdaniami

    Po angielsku działa najpewniej, ale możesz też po polsku. Skopiuj przykład z ramki niżej.

  3. Ustaw język wokalu

    W polu Vocal Language wybierz „pl”, jeśli chcesz śpiew po polsku, albo zaznacz Instrumental, jeśli bez wokalu.

  4. Kliknij „Create Sample”

    Planer ułoży opis stylu, tekst i parametry; zobaczysz je w rozwiniętych polach. Możesz je poprawić ręcznie.

  5. Kliknij „Generate Music”

    W polu Generation Status pojawi się postęp, a w Results odtwarzacze. Domyślnie powstają dwie wersje.

  6. Posłuchaj, zapisz, powtórz

    Przycisk Save zapisuje plik i parametry; „All Generated Files” daje MP3 i plik JSON z ustawieniami. Nie podoba się? Kliknij Generate Music jeszcze raz: każda próba używa innego losowego ziarna.

Opis 1 · tryb Simple, piosenka po polsku

A warm, nostalgic Polish folk-pop song about coming home after years abroad, female vocal, acoustic guitar and accordion, slow tempo, hopeful ending. Lyrics in Polish.

Opis 2 · tryb Simple, instrumental do filmu z wakacji

Upbeat summer instrumental for a family travel video, ukulele, hand claps, light drums, bright and playful, 45 seconds.

Pełna kontrola: tryb Custom

W trybie Custom sam piszesz dwa pola: Music Caption (opis stylu) i Lyrics (tekst z tagami). Reszta może zostać na „Auto”. Samouczek projektu nazywa opis „najważniejszym czynnikiem wpływającym na muzykę”, a tekst „scenariuszem w czasie” (samouczek).

Jak pisać opis stylu (Music Caption)

Opis może być listą słów po przecinku albo zdaniem. Dobry opis łączy kilka wymiarów naraz; samouczek projektu wymienia je w tabeli:

WymiarPrzykłady (po angielsku działają najpewniej)
Gatunekpop, rock, jazz, electronic, hip-hop, folk, classical, lo-fi, synthwave, disco polo
Nastrójmelancholic, uplifting, energetic, dreamy, dark, nostalgic, intimate
Instrumentyacoustic guitar, piano, accordion, synth pads, 808 drums, strings, brass
Brzmieniewarm, bright, crisp, airy, punchy, lush, raw, polished
Epoka80s synth-pop, 90s grunge, 2010s EDM, vintage soul
Produkcjalo-fi, live recording, studio-polished, bedroom pop
Wokalfemale vocal, male vocal, breathy, powerful, raspy, choir, duet
Temposlow tempo, mid-tempo, fast-paced, groovy, driving
Strukturabuilding intro, catchy chorus, dramatic bridge, fade-out ending

Zasady z samouczka: konkret bije ogólnik („sad piano ballad with female breathy vocal” zamiast „a sad song”); łącz kilka wymiarów; przymiotniki o brzmieniu (warm, crisp, punchy) naprawdę wpływają na miks; im mniej napiszesz, tym więcej model wymyśli sam; unikaj sprzeczności („classical strings” i „hardcore metal” naraz), a jeśli chcesz zmiany stylu w utworze, opisz ją jako przebieg w czasie: „starts soft, builds into…”.

Opis 3 · Music Caption, ballada po polsku

Polish pop ballad, female vocal, warm and intimate, piano and soft strings, slow tempo, builds into an emotional chorus with drums, polished studio production

Opis 4 · Music Caption, energiczny utwór

Modern dance-pop, male vocal, driving four-on-the-floor drums, bright synths, punchy bass, catchy chorus, 120 BPM feel, radio-ready mix

Jak pisać tekst (Lyrics) z tagami

Tekst dzieli się na sekcje tagami w nawiasach kwadratowych. Tag mówi modelowi, czym jest dana część i jak ją zaśpiewać. Najczęstsze według samouczka: [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Outro], a także [Build], [Drop], [Breakdown], [Instrumental], [Guitar Solo], [Piano Interlude], [Fade Out]. Tag można doprecyzować myślnikiem, np. [Chorus - anthemic] albo [Bridge - whispered], ale bez stosów określeń: [Chorus - anthemic - stacked harmonies - epic] mylą model i bywają zaśpiewane jako słowa. Opis stylu i tekst nie mogą sobie przeczyć (skrzypce w opisie i [Guitar Solo] w tekście to konflikt).

Tekst 1 · Lyrics po polsku (wklej do pola Lyrics, w Optional Parameters ustaw Vocal Language: pl)

[Intro]

[Verse 1]
Za oknem znowu pada deszcz
A ja liczę dni do lata
Walizka stoi przy drzwiach
Bilet w kieszeni, mapa świata

[Pre-Chorus]
Tyle lat, tyle miast
A serce wciąż w tym samym miejscu

[Chorus - anthemic]
Wracam do domu, wracam do siebie
Tam gdzie mnie znają po imieniu
Wracam do domu, pod nasze niebo
Nie potrzebuję już nic więcej

[Verse 2]
Mama zostawi światło w kuchni
Tata nastawi stary radiomagnetofon
Sąsiad zapyta jak tam za oceanem
A ja powiem: dobrze, ale tu jest dom

[Chorus - anthemic]
Wracam do domu, wracam do siebie
Tam gdzie mnie znają po imieniu

[Outro - soft]
Wracam do domu

Tekst 2 · Lyrics, utwór instrumentalny ze strukturą (zaznacz Instrumental)

[Intro - soft piano]
[Build - strings enter]
[Drop - full band]
[Breakdown - piano only]
[Outro - fade out]

Przycisk „Enhance Lyrics” prosi planer o rozbudowanie Twojego szkicu tekstu; „Enhance Caption” robi to samo z opisem. Warto ich użyć, gdy nie wiesz, jak zacząć, i potem poprawić wynik ręcznie.

Optional Parameters: tempo, tonacja, długość, liczba wersji

Rozwinięta sekcja Optional Parameters: BPM, Key, Time Signature, Vocal Language, Audio Duration, Batch Size oraz przełączniki Auto
Sekcja Optional Parameters. Domyślnie wszystko na Auto: planer sam dobiera tempo, tonację, metrum, język i długość. Batch Size to liczba wersji generowanych naraz.
  • BPM, Key, Time Signature: tempo, tonacja (np. „C Major”, „A minor”), metrum (2, 3, 4, 6). Zostaw Auto, chyba że wiesz, czego chcesz; przy ustawieniu ręcznym odznacz odpowiednie „Auto”.
  • Vocal Language: język wokalu; „pl” dla polskiego. Auto zwykle wykrywa język z tekstu.
  • Audio Duration: długość w sekundach, od 10 do 600; -1 lub Auto oznacza, że planer sam dobierze długość do tekstu. Na początek 30–60 sekund: szybciej zobaczysz efekt.
  • Batch Size: ile wersji naraz, od 1 do 8. Każda wersja to inne losowe ziarno; przy 2–4 wybierasz najlepszą. Więcej wersji to proporcjonalnie więcej pamięci i czasu.

Wyniki: co zobaczysz po kliknięciu Generate Music

Sekcja Results po wygenerowaniu 30-sekundowego utworu: odtwarzacz z falą dźwiękową, przyciski Send To Remix, Send To Repaint, Save, lista plików MP3 i JSON, czasy generowania 31,62 s
Wynik naszego testu na Macu: 30-sekundowy instrumental w trybie Custom. Odtwarzacz, przyciski do remiksu i przemalowania, pliki MP3 i JSON do pobrania oraz czasy: 17,4 s planer i 14,2 s wykonawca.
  • Odtwarzacz dla każdej wersji, z falą dźwiękową i regulacją prędkości.
  • Send To Remix wysyła wynik jako nagranie źródłowe do trybu Remix (nowy styl, ta sama melodia); Send To Repaint do trybu Repaint (poprawa fragmentu). Save zapisuje wersję z parametrami.
  • Score & LRC & LM Codes: ocena jakości (jeśli włączone Auto Score), plik z synchronizacją tekstu (Auto LRC) i „kody” planera, które można wkleić ponownie, żeby zachować melodię przy zmianie stylu.
  • Apply These Settings to UI przywraca do pól parametry tej partii; z zapisanym ziarnem (seed) odtworzysz ten sam utwór.
  • All Generated Files: MP3 (domyślnie 128 kbps, 48 kHz; format i jakość zmienisz w Settings) i JSON z pełnymi parametrami.

Pliki lądują też w folderze gradio_outputs w katalogu programu.

Ustawienia: co warto znać, a czego nie ruszać

Sekcja Settings, Service Configuration: język interfejsu, wykryty sprzęt i poziom, ścieżka checkpointów, Main Model Path acestep-v15-turbo, Device auto, VAE, 5Hz LM Model Path, LM Backend, przełączniki i przycisk Initialize Service
Service Configuration. Program wykrył sprzęt Apple (MPS) i poziom „unlimited”, ładuje wykonawcę acestep-v15-turbo i planer 0,6B. Po zmianie modeli klikasz Initialize Service.
UstawienieCo robiRada dla początkującego
UI LanguageJęzyk interfejsu: angielski, chiński, japoński, portugalski, hebrajskiZostaw angielski; polskiego jeszcze nie ma
GPU Tier OverrideRęczne ustawienie poziomu sprzętuNie ruszaj; program wykrywa sam
Main Model PathWykonawca: turbo (8 kroków, szybki), sft i base (50 kroków), XL (lepsza jakość, więcej pamięci)Na start turbo
5Hz LM Model Path i BackendPlaner 0,6B, 1,7B lub 4B; silnik pt, vllm (NVIDIA), mlx (Mac)Mniejszy planer na słabszym sprzęcie; na Macu mlx
Initialize 5Hz LMŁaduje planer; potrzebny do trybu Simple i „Think”Włączone, jeśli sprzęt pozwala
Offload to CPU, INT8 Quantization, Compile ModelOszczędzanie pamięci i przyspieszanieProgram włącza je sam na słabszych kartach
MLX DiT (Apple Silicon)Natywny silnik Apple dla wykonawcyNa Macu włączone
Initialize ServiceŁaduje modele po zmianie ustawieńKliknij po każdej zmianie modelu; status pokaże, czy się udało
Sekcja DiT Diffusion: DiT Inference Steps 8, Guidance Scale, Inference Method ode, Sampler euler, ustawienia DCW, Shift 3.0, Seed i Random Seed
DiT Diffusion: parametry wykonawcy. Dla modelu turbo zostaw 8 kroków, metodę ode i Shift 3.0. Pole Seed z odznaczonym Random Seed daje powtarzalne wyniki.

Parametry wykonawcy według samouczka: Inference Steps 8 dla turbo (więcej kroków to dokładniej i wolniej; base używa 32–100); Guidance Scale działa tylko z modelami base i sft (wyżej = ściślej trzyma się opisu); Shift 3.0 zalecane dla turbo; Seed to losowe ziarno: przy Random Seed każda próba jest inna, przy wpisanym numerze ta sama. Samouczek radzi: gdy testujesz wpływ jednego parametru, ustaw stały seed, bo inaczej losowość zamaskuje zmianę.

Sekcja LM Generation: LM Temperature 0.85, LM CFG Scale 2.0, Top-K, Top-P 0.9, Negative Prompt, przełączniki CoT Metas, CoT Language Detection, ParallelThinking, CaptionRewrite
LM Generation: parametry planera. Temperature wyżej = bardziej twórczy, niżej = ostrożniejszy. CoT Metas pozwala planerowi dobierać tempo i tonację; CaptionRewrite pozwala mu przepisać Twój opis.
Sekcja Audio Output i Post-processing: format pliku, bitrate MP3, częstotliwość próbkowania, normalizacja, fade in i fade out
Audio Output: format (FLAC, MP3, Opus, AAC, WAV), jakość MP3, normalizacja głośności, płynne wejście i wyciszenie.

Dalsze kroki: remiks, przemalowanie, własny styl

Remix – wgraj nagranie (albo kliknij Send To Remix przy własnym wyniku), wpisz opis nowego stylu, ustaw siłę (wyżej = bliżej oryginalnej struktury) i generuj. To tryb do coverów i „tej samej piosenki w innym gatunku”.

Repaint – wgraj nagranie, podaj sekundy od i do (-1 = do końca), opisz, co ma być w tym fragmencie, wybierz tryb conservative, balanced lub aggressive i siłę. Do poprawiania nieudanego refrenu bez ruszania reszty i do wydłużania utworu.

Reference Audio – w trybie Custom wgraj nagranie jako wzór brzmienia; model naśladuje barwę i charakter, nie melodię.

Wiele wersji i automatyczna ocena – samouczek zaleca: ustaw Batch Size 2–8, włącz Auto Score i AutoGen, a program będzie w tle generował kolejne partie z nowymi ziarnami i oceniał je; przeglądasz wyniki i wybierasz najlepsze. Autorzy szczególnie polecają wynik „DiT Lyrics Alignment”, który mówi, jak dokładnie wokal trafia w tekst.

Zakładka LoRA Training z krokami: Dataset Builder, Train LoRA, Train LoKr
Zakładka LoRA Training: budowanie zbioru z własnych nagrań, automatyczne opisywanie, trening i eksport adaptera.

LoRA: własny styl – w zakładce LoRA Training wskazujesz folder z kilkoma własnymi nagraniami (np. 8 utworów), program je opisuje, przetwarza i trenuje mały „adapter”, który potem ładujesz w Settings. Według dokumentacji na karcie RTX 3090 z 12 GB trwa to około godziny; na Macu dłużej. Adaptera nie da się załadować przy włączonej kwantyzacji INT8 (przewodnik po interfejsie, samouczek LoRA). Ucz na nagraniach, do których masz prawa.

Prawo i uczciwość: co możesz zrobić z utworem

Zanim opublikujesz
  • Program i model są na licencji MIT, więc możesz ich używać także komercyjnie. Autorzy proszą jednak, żeby sprawdzać oryginalność wyników, ujawniać udział AI i uzyskiwać zgody przy naśladowaniu chronionych stylów lub materiałów (dokumentacja, sekcja License & Disclaimer).
  • Nie wpisuj nazwisk artystów jako „zrób jak X” do publikacji; opisuj styl cechami (epoka, instrumenty, brzmienie). Do prywatnych eksperymentów to bez znaczenia, do wydania utworu ma.
  • Serwisy streamingowe mają własne zasady dotyczące muzyki z AI; sprawdź je przed wysyłką.
  • Jedyna oficjalna strona projektu to jego repozytorium i strona projektu na GitHubie. Autorzy ostrzegają przed podrobionymi domenami z płatnościami.

Najczęstsze problemy

ObjawPrzyczyna i co zrobić
Strona 127.0.0.1:7860 się nie otwieraProgram jeszcze się ładuje albo nie wystartował. Patrz w okno terminala: adres pojawia się po załadowaniu; błędy też. Port zajęty? Zmień PORT w pliku .env.
„Generate Music” nic nie robiModele niezaładowane. Rozwiń Settings, kliknij Initialize Service i poczekaj na status „[OK] Model initialized”.
Tryb Simple albo „Think” niedostępneZa mało pamięci na planer; program wyłączył go automatycznie. Pisz opis i tekst sam w trybie Custom albo wybierz mniejszy planer 0,6B.
Wokal śpiewa po angielsku, choć tekst jest polskiUstaw Vocal Language na „pl” i odznacz Language Auto; dopisz w opisie „Polish lyrics, Polish vocal”.
Wokal wyśpiewuje nazwy tagówZa dużo określeń w tagach. Zostaw [Chorus - anthemic], resztę przenieś do opisu stylu.
Utwór urywa się albo jest za krótkiUstaw Audio Duration ręcznie (odznacz Duration Auto) albo skróć tekst; do wydłużenia użyj Repaint od końca.
Bardzo wolnoZa duży model dla sprzętu. Wróć do turbo i planera 0,6B, zmniejsz Batch Size do 1, skróć długość. Na Macu sprawdź, że MLX DiT jest włączone.
Brak miejsca na dyskuModele to około 10 GB, a każda wersja to nowy plik w gradio_outputs. Czyść folder wyników.

Najczęściej zadawane pytania

Czy to naprawdę za darmo?

Tak. Program i modele są otwarte na licencji MIT; nie ma konta, abonamentu ani limitów. Płacisz sprzętem i prądem. Autorzy prowadzą też bezpłatną wersję online, ale ten poradnik jest o wersji lokalnej.

Czy śpiewa po polsku?

Tak, polski jest wśród obsługiwanych języków; jakość wymowy bywa różna i najlepsza jest w największych językach. Pomaga ustawienie języka „pl”, poprawny tekst z polskimi znakami i unikanie skrótów.

Mac czy PC?

Oba działają. Mac z Apple Silicon i 16 GB lub więcej daje pełne funkcje bez konfiguracji, dzięki MLX; utwór 30-sekundowy w około pół minuty. PC z kartą NVIDIA jest szybszy (kilka sekund na utwór na mocnej karcie) i pozwala na modele XL przy 20 GB i więcej. Mac z procesorem Intel jest za wolny.

Czym różni się turbo od base i sft?

Turbo tworzy dźwięk w 8 krokach i jest najszybszy, o wysokiej jakości; sft i base w 50 krokach, base jest najbardziej „twórczy” i jako jedyny obsługuje rozdzielanie i dokładanie ścieżek. Na co dzień turbo; do eksperymentów base.

Co to jest „Think”?

Przełącznik planera. Włączony: model sam dobiera tempo, tonację, długość i rozpisuje szkic utworu, co poprawia spójność. Wyłączony: wykonawca pracuje bezpośrednio z Twojego opisu i tekstu, szybciej i przy mniejszej pamięci. W trybach Remix i Repaint jest pomijany.

Czy mogę używać wyników w filmach na YouTube albo w reklamie?

Licencja pozwala. Autorzy proszą o sprawdzenie oryginalności i oznaczenie udziału AI; platformy mają własne zasady dla treści z AI. Przy użyciu komercyjnym skonsultuj się z prawnikiem, zwłaszcza jeśli utwór naśladuje rozpoznawalny styl.

Czy potrzebuję umieć programować?

Nie. Instalacja to wklejenie trzech poleceń albo rozpakowanie paczki; potem wszystko dzieje się w przeglądarce.

Podsumowanie fact-check

Co wiemy na pewno, a co się zmienia
  • Na pewno prawda: ACE-Step 1.5 jest otwartym projektem na licencji MIT; działa lokalnie na NVIDIA, Apple Silicon, AMD i Intel; interfejs uruchamia się pod adresem 127.0.0.1:7860; tworzy utwory od 10 sekund do 10 minut, do 8 wersji naraz, w ponad 50 językach; ma tryby Simple, Custom, Remix i Repaint oraz trening LoRA. Zrzuty ekranu i czasy z testu pochodzą z działającej instalacji na Macu.
  • Prawdopodobnie prawda na dzień weryfikacji: tabela poziomów sprzętu i domyślne modele; około 10 GB na modele; czasy poniżej 2 s na A100 i 10 s na RTX 3090 według autorów. Nowe wersje mogą to zmienić.
  • Co jest niepewne: jakość polskiej wymowy w konkretnym utworze; czas generowania na Twoim komputerze; dostępność paczek portable w danym momencie.
  • Częsty mit: „darmowa muzyka z AI jest wolna od ryzyka prawnego”. Licencja programu pozwala na użycie, ale odpowiedzialność za oryginalność i za naśladowanie chronionych stylów zostaje po stronie użytkownika.

Źródła

ŹródłoTypWiarygodność
ACE-Step 1.5 – repozytorium i dokumentacja głównaOficjalneWysoka
ACE-Step 1.5 – instrukcja instalacjiOficjalneWysoka
ACE-Step 1.5 – przewodnik po interfejsie GradioOficjalneWysoka
ACE-Step 1.5 – samouczek (opis, tekst, parametry)OficjalneWysoka
ACE-Step 1.5 – samouczek treningu LoRAOficjalneWysoka
ACE-Step 1.5 – strona projektuOficjalneWysoka
ACE-Step 1.5 – modele na Hugging FaceOficjalneWysoka
ACE-Step 1.5 – raport technicznyPublikacja naukowaWysoka
uv – menedżer pakietów PythonaOficjalneWysoka

Powiązane tematy:

← Wróć do Poradnika AI

Czy ten poradnik był pomocny?

Komentarze (0)

Brak komentarzy. Bądź pierwszy!


Dodaj komentarz

Zaloguj się aby uniknąć weryfikacji emaila przy każdym komentarzu, lub komentuj jako gość:

Komentarz może być moderowany przed publikacją.