ACE-Step 1.5 to otwarty model, który tworzy kompletne piosenki z tekstem i wokalem, na własnym komputerze, bez chmury, bez abonamentu i bez limitów. Wpisujesz opis stylu i słowa, klikasz „Generate Music”, a po kilkudziesięciu sekundach masz plik MP3. Ten przewodnik prowadzi od zera: co to jest i co potrafi, jaki komputer jest potrzebny, jak zainstalować na Macu, Windows i Linuksie, co znaczą pola w interfejsie (ze zrzutami ekranu z działającej instalacji), jak zrobić pierwszy utwór, jak pisać opisy i teksty, żeby wychodziło dobrze, i co dalej: remiks, przemalowanie fragmentu, własny styl przez LoRA. Wszystko po polsku, prostymi słowami.
Ostatnia weryfikacja: 7 września 2026. Materiał informacyjny. ACE-Step rozwija się szybko: nazwy pól, modele i wymagania zmieniają się z wersji na wersję; zrzuty ekranu pochodzą z wersji pobranej z repozytorium 29 sierpnia 2026, uruchomionej na Macu z Apple Silicon. Aktualna dokumentacja: github.com/ace-step/ACE-Step-1.5.
W skrócie
- ACE-Step 1.5 to darmowy, otwarty model do tworzenia muzyki na licencji MIT, rozwijany przez ACE Studio i StepFun. Tworzy utwory od 10 sekund do 10 minut, z wokalem w ponad 50 językach, w tym po polsku, oraz utwory instrumentalne (dokumentacja).
- Działa lokalnie: na kartach NVIDIA od około 4 GB pamięci (tryb bez planera) i 6 GB (pełny), na Macach z Apple Silicon przez MLX, na AMD i Intel. Modele zajmują około 10 GB na dysku (instrukcja instalacji).
- Instalacja to trzy polecenia (menedżer uv, pobranie repozytorium, uruchomienie) albo gotowa paczka na Maca i Windows. Interfejs otwiera się w przeglądarce pod adresem 127.0.0.1:7860.
- Dwa tryby na start: Simple (piszesz jedno zdanie, model sam układa opis, tekst i parametry) i Custom (piszesz opis stylu i tekst z tagami [Verse], [Chorus]). Najważniejszym polem jest opis stylu; drugim tekst z tagami.
- Na Macu z Apple Silicon utwór 30-sekundowy powstaje w około pół minuty; na mocnej karcie NVIDIA cała piosenka w kilka sekund. Model generuje kilka wersji naraz i potrafi je sam ocenić.
- Utwory są Twoje do słuchania i eksperymentów; przy publikacji sprawdzaj oryginalność, oznaczaj udział AI i nie kopiuj stylu konkretnych artystów bez zgody. Tak zaleca sam projekt.
Co to jest ACE-Step, prostymi słowami
ACE-Step to program, który z opisu słownego robi nagranie muzyczne. Piszesz, jaki styl chcesz („ciepły folk z gitarą akustyczną i pianinem, nostalgicznie, wolno”), dopisujesz tekst piosenki z oznaczeniem zwrotek i refrenów, a model tworzy gotowy utwór: aranżację, instrumenty, wokal śpiewający Twój tekst. To odpowiednik komercyjnych serwisów jak Suno czy Udio, z tą różnicą, że działa na Twoim komputerze, jest darmowy i nic nie wysyła do chmury.
W środku pracują dwa „mózgi”, i warto to zrozumieć, bo tłumaczy pola w interfejsie (samouczek projektu):
Mały model językowy, który czyta Twój opis i tekst, wymyśla brakujące rzeczy (tempo, tonację, długość, a w trybie Simple także cały tekst) i rozpisuje „szkic” utworu. W interfejsie to „5Hz LM” i przełącznik „Think”.
Model dyfuzyjny, który ze szkicu i opisu tworzy sam dźwięk. Wersja „turbo” robi to w 8 krokach i jest polecana na co dzień; „base” i „sft” w 50 krokach, dokładniej i wolniej.
Planer to producent, który z Twojego pomysłu robi plan nagrania; wykonawca to zespół w studiu. Opis stylu mówi obu, co chcesz; tekst z tagami mówi, co ma się dziać w kolejnych sekundach.
Co potrafi
| Funkcja | Co robi | Tryb w interfejsie |
|---|---|---|
| Piosenka z opisu | Jedno zdanie, model dopisuje resztę | Simple |
| Piosenka z opisu i tekstu | Pełna kontrola: styl, tekst z tagami, tempo, tonacja, długość | Custom |
| Utwór instrumentalny | Bez wokalu, np. podkład, muzyka do filmu | Simple lub Custom, pole „Instrumental” |
| Remiks / cover | Zachowuje melodię i strukturę nagrania, zmienia styl | Remix |
| Przemalowanie fragmentu | Generuje od nowa wybrane sekundy, reszta bez zmian; do poprawek i wydłużania | Repaint |
| Nagranie jako wzór stylu | Podajesz plik, model naśladuje brzmienie | Custom, pole „Reference Audio” |
| Rozdzielanie ścieżek, dokładanie instrumentów | Wyciągnij wokal lub perkusję, dołóż gitarę | Extract, Lego, Complete (tylko model base) |
| Własny styl | Nauka na kilku Twoich nagraniach (LoRA) | Zakładka LoRA Training |
| Tekst z czasem | Plik LRC z synchronizacją słów | Auto LRC |
Jaki komputer jest potrzebny
Wymagania według instrukcji projektu (INSTALL): Python 3.11 lub 3.12, około 10 GB miejsca na dysku na modele, karta graficzna NVIDIA zalecana, ale obsługiwane są też Apple Silicon (MPS i MLX), AMD (ROCm), Intel i sam procesor. Pamięć karty decyduje, co uruchomisz:
| Pamięć karty (VRAM) lub pamięć wspólna Maca | Co wybierze program | Czego się spodziewać |
|---|---|---|
| do 6 GB | Tylko wykonawca 2B turbo, bez planera; kwantyzacja INT8 i przenoszenie do pamięci procesora | Działa, ale bez trybu Simple i bez „Think”; opis i tekst piszesz sam |
| 6–8 GB | 2B turbo + planer 0,6B | Pełne funkcje, wolniej |
| 8–16 GB | 2B turbo lub sft + planer 0,6B lub 1,7B | Wygodna praca |
| 16–24 GB | Modele XL (4B) z lepszą jakością dźwięku | Wysoka jakość |
| 24 GB i więcej | XL sft + planer 4B | Najlepsza jakość, wszystko w pamięci |
Program sam wykrywa sprzęt i ustawia „poziom” (tier) z odpowiednimi domyślnymi ustawieniami; w ustawieniach można go nadpisać. Na Macu z Apple Silicon liczy się pamięć wspólna: Mac z 16 GB zachowuje się jak karta z kilkunastoma GB, Mac z 64 GB wchodzi w najwyższy poziom. Dlaczego pamięć wspólna Maca jest do takich zadań wygodna, wyjaśniamy w przewodniku po Ollamie; zasada jest ta sama.
Ile to trwa: autorzy podają poniżej 2 sekund na całą piosenkę na karcie A100 i poniżej 10 sekund na RTX 3090. Na Macu z Apple Silicon w naszym teście 30-sekundowy utwór instrumentalny w trybie Custom z włączonym „Think” powstał w 31,6 sekundy: 17,4 s planer, 14,2 s wykonawca. Pierwsze uruchomienie po starcie programu jest wolniejsze, bo modele ładują się do pamięci.
Instalacja krok po kroku
Są dwie drogi: gotowa paczka (rozpakowujesz i uruchamiasz skrypt) albo instalacja z repozytorium (trzy polecenia w terminalu). Obie opisuje instrukcja projektu.
Droga 1: gotowa paczka (Mac z Apple Silicon, Windows)
- Pobierz paczkę
Linki do paczek dla macOS i Windows są w sekcji Quick Start w repozytorium (pliki ACE-Step-1.5.zip dla Maca i .7z dla Windows, z zainstalowanymi zależnościami). Pobieraj tylko z repozytorium na GitHubie; projekt ostrzega przed podrobionymi stronami.
- Rozpakuj do folderu bez polskich znaków i spacji
Np. Dokumenty/ACE-Step-1.5. Paczka waży kilka GB, a modele pobiorą się przy pierwszym starcie (około 10 GB).
- Uruchom skrypt startowy
Mac: w terminalu wejdź do folderu i uruchom skrypt dla macOS (polecenia niżej). Windows: dwukrotnie kliknij start_gradio_ui.bat.
- Poczekaj na pobranie modeli i otwórz przeglądarkę
Przy pierwszym starcie skrypt pobiera modele; potem w terminalu pojawi się adres. Wpisz w przeglądarce
http://127.0.0.1:7860.
chmod +x start_gradio_ui_macos.sh
./start_gradio_ui_macos.sh
Skrypt dla macOS sam ustawia silnik MLX, czyli natywne przyspieszenie na Apple Silicon, i port 7860 (instrukcja). Macbook z procesorem Intel działa tylko na procesorze i bardzo wolno; ACE-Step ma sens na M1 i nowszych.
Droga 2: z repozytorium (Mac, Windows, Linux)
Polecenia z dokumentacji projektu. Wklejasz po kolei do terminala (Mac: program Terminal; Windows: PowerShell; Linux: dowolny terminal). Potrzebny jest git; na Macu system zaproponuje instalację narzędzi deweloperskich przy pierwszym użyciu.
curl -LsSf https://astral.sh/uv/install.sh | sh
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"
git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5
uv sync
uv run acestep
Na Macu zamiast polecenia 3 lepiej użyć skryptu start_gradio_ui_macos.sh z poprzedniej sekcji, bo włącza MLX. Po starcie w terminalu pojawi się adres; otwórz http://127.0.0.1:7860 w przeglądarce. Zamykasz program klawiszami Ctrl+C w terminalu.
Ustawienia startowe: plik .env
Zamiast wpisywać opcje w poleceniu, tworzysz w folderze programu plik .env (kopia pliku .env.example) i wpisujesz w nim, jaki model wykonawcy i planera ładować, jaki port i język interfejsu. Plik przetrwa aktualizacje programu (dokumentacja).
ACESTEP_CONFIG_PATH=acestep-v15-turbo
ACESTEP_LM_MODEL_PATH=acestep-5Hz-lm-0.6B
PORT=7860
LANGUAGE=en
Przy 64 GB pamięci i więcej można wpisać planer acestep-5Hz-lm-1.7B, a na mocnych kartach NVIDIA model XL. Aktualizacja programu: skrypt check_update.sh w folderze albo polecenie git pull i ponowne uv sync.
Interfejs: co gdzie jest
Po otwarciu adresu w przeglądarce widzisz jedną stronę z trzema częściami: zwinięte „Settings” (ustawienia), zakładki „Generation” i „LoRA Training”, a niżej wyniki. Zrzuty ekranu poniżej pochodzą z działającej instalacji na Macu.

| Element | Do czego |
|---|---|
| Settings (na górze, zwinięte) | Wybór modeli, urządzenia, ustawienia jakości i formatu pliku. Na start nie trzeba tam wchodzić; program ustawia domyślne wartości dla Twojego sprzętu. |
| Generation Mode | Simple, Custom, Remix, Repaint. Przy modelu base także Extract, Lego, Complete. |
| Source Audio | Nagranie wejściowe do trybów Remix i Repaint. W trybie Custom może zostać puste. |
| Reference Audio | Nagranie jako wzór brzmienia (opcjonalnie). |
| Music Caption | Opis stylu: gatunek, instrumenty, nastrój, tempo, wokal. Najważniejsze pole. |
| Lyrics | Tekst piosenki z tagami [Verse], [Chorus], [Bridge]. Pole „Instrumental” wyłącza wokal. |
| Enhance Caption, Enhance Lyrics | Planer rozbudowuje Twój krótki opis lub tekst. |
| Kostka „Click Me” | Losowy przykład opisu i tekstu, dobry do nauki, jak pisać. |
| Optional Parameters | Tempo (BPM), tonacja, metrum, język wokalu, długość w sekundach, liczba wersji (Batch Size). Domyślnie „Auto”. |
| Think | Włącza planer: model sam dobiera tempo, tonację, długość i rozpisuje szkic. Zostaw włączone, chyba że masz mało pamięci. |
| Auto Score, Auto LRC, AutoGen | Automatyczna ocena jakości, plik z synchronizacją tekstu, automatyczne generowanie kolejnych partii w tle. |
| Results | Odtwarzacze dla każdej wersji, przyciski Send To Remix, Send To Repaint, Save, lista plików do pobrania i czasy generowania. |
Pierwszy utwór w trzy minuty: tryb Simple

- Wybierz „Simple”
W wierszu Generation Mode kliknij Simple.
- Opisz piosenkę jednym lub dwoma zdaniami
Po angielsku działa najpewniej, ale możesz też po polsku. Skopiuj przykład z ramki niżej.
- Ustaw język wokalu
W polu Vocal Language wybierz „pl”, jeśli chcesz śpiew po polsku, albo zaznacz Instrumental, jeśli bez wokalu.
- Kliknij „Create Sample”
Planer ułoży opis stylu, tekst i parametry; zobaczysz je w rozwiniętych polach. Możesz je poprawić ręcznie.
- Kliknij „Generate Music”
W polu Generation Status pojawi się postęp, a w Results odtwarzacze. Domyślnie powstają dwie wersje.
- Posłuchaj, zapisz, powtórz
Przycisk Save zapisuje plik i parametry; „All Generated Files” daje MP3 i plik JSON z ustawieniami. Nie podoba się? Kliknij Generate Music jeszcze raz: każda próba używa innego losowego ziarna.
A warm, nostalgic Polish folk-pop song about coming home after years abroad, female vocal, acoustic guitar and accordion, slow tempo, hopeful ending. Lyrics in Polish.
Upbeat summer instrumental for a family travel video, ukulele, hand claps, light drums, bright and playful, 45 seconds.
Pełna kontrola: tryb Custom
W trybie Custom sam piszesz dwa pola: Music Caption (opis stylu) i Lyrics (tekst z tagami). Reszta może zostać na „Auto”. Samouczek projektu nazywa opis „najważniejszym czynnikiem wpływającym na muzykę”, a tekst „scenariuszem w czasie” (samouczek).
Jak pisać opis stylu (Music Caption)
Opis może być listą słów po przecinku albo zdaniem. Dobry opis łączy kilka wymiarów naraz; samouczek projektu wymienia je w tabeli:
| Wymiar | Przykłady (po angielsku działają najpewniej) |
|---|---|
| Gatunek | pop, rock, jazz, electronic, hip-hop, folk, classical, lo-fi, synthwave, disco polo |
| Nastrój | melancholic, uplifting, energetic, dreamy, dark, nostalgic, intimate |
| Instrumenty | acoustic guitar, piano, accordion, synth pads, 808 drums, strings, brass |
| Brzmienie | warm, bright, crisp, airy, punchy, lush, raw, polished |
| Epoka | 80s synth-pop, 90s grunge, 2010s EDM, vintage soul |
| Produkcja | lo-fi, live recording, studio-polished, bedroom pop |
| Wokal | female vocal, male vocal, breathy, powerful, raspy, choir, duet |
| Tempo | slow tempo, mid-tempo, fast-paced, groovy, driving |
| Struktura | building intro, catchy chorus, dramatic bridge, fade-out ending |
Zasady z samouczka: konkret bije ogólnik („sad piano ballad with female breathy vocal” zamiast „a sad song”); łącz kilka wymiarów; przymiotniki o brzmieniu (warm, crisp, punchy) naprawdę wpływają na miks; im mniej napiszesz, tym więcej model wymyśli sam; unikaj sprzeczności („classical strings” i „hardcore metal” naraz), a jeśli chcesz zmiany stylu w utworze, opisz ją jako przebieg w czasie: „starts soft, builds into…”.
Polish pop ballad, female vocal, warm and intimate, piano and soft strings, slow tempo, builds into an emotional chorus with drums, polished studio production
Modern dance-pop, male vocal, driving four-on-the-floor drums, bright synths, punchy bass, catchy chorus, 120 BPM feel, radio-ready mix
Jak pisać tekst (Lyrics) z tagami
Tekst dzieli się na sekcje tagami w nawiasach kwadratowych. Tag mówi modelowi, czym jest dana część i jak ją zaśpiewać. Najczęstsze według samouczka: [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Outro], a także [Build], [Drop], [Breakdown], [Instrumental], [Guitar Solo], [Piano Interlude], [Fade Out]. Tag można doprecyzować myślnikiem, np. [Chorus - anthemic] albo [Bridge - whispered], ale bez stosów określeń: [Chorus - anthemic - stacked harmonies - epic] mylą model i bywają zaśpiewane jako słowa. Opis stylu i tekst nie mogą sobie przeczyć (skrzypce w opisie i [Guitar Solo] w tekście to konflikt).
[Intro]
[Verse 1]
Za oknem znowu pada deszcz
A ja liczę dni do lata
Walizka stoi przy drzwiach
Bilet w kieszeni, mapa świata
[Pre-Chorus]
Tyle lat, tyle miast
A serce wciąż w tym samym miejscu
[Chorus - anthemic]
Wracam do domu, wracam do siebie
Tam gdzie mnie znają po imieniu
Wracam do domu, pod nasze niebo
Nie potrzebuję już nic więcej
[Verse 2]
Mama zostawi światło w kuchni
Tata nastawi stary radiomagnetofon
Sąsiad zapyta jak tam za oceanem
A ja powiem: dobrze, ale tu jest dom
[Chorus - anthemic]
Wracam do domu, wracam do siebie
Tam gdzie mnie znają po imieniu
[Outro - soft]
Wracam do domu
[Intro - soft piano]
[Build - strings enter]
[Drop - full band]
[Breakdown - piano only]
[Outro - fade out]
Przycisk „Enhance Lyrics” prosi planer o rozbudowanie Twojego szkicu tekstu; „Enhance Caption” robi to samo z opisem. Warto ich użyć, gdy nie wiesz, jak zacząć, i potem poprawić wynik ręcznie.
Optional Parameters: tempo, tonacja, długość, liczba wersji

- BPM, Key, Time Signature: tempo, tonacja (np. „C Major”, „A minor”), metrum (2, 3, 4, 6). Zostaw Auto, chyba że wiesz, czego chcesz; przy ustawieniu ręcznym odznacz odpowiednie „Auto”.
- Vocal Language: język wokalu; „pl” dla polskiego. Auto zwykle wykrywa język z tekstu.
- Audio Duration: długość w sekundach, od 10 do 600; -1 lub Auto oznacza, że planer sam dobierze długość do tekstu. Na początek 30–60 sekund: szybciej zobaczysz efekt.
- Batch Size: ile wersji naraz, od 1 do 8. Każda wersja to inne losowe ziarno; przy 2–4 wybierasz najlepszą. Więcej wersji to proporcjonalnie więcej pamięci i czasu.
Wyniki: co zobaczysz po kliknięciu Generate Music

- Odtwarzacz dla każdej wersji, z falą dźwiękową i regulacją prędkości.
- Send To Remix wysyła wynik jako nagranie źródłowe do trybu Remix (nowy styl, ta sama melodia); Send To Repaint do trybu Repaint (poprawa fragmentu). Save zapisuje wersję z parametrami.
- Score & LRC & LM Codes: ocena jakości (jeśli włączone Auto Score), plik z synchronizacją tekstu (Auto LRC) i „kody” planera, które można wkleić ponownie, żeby zachować melodię przy zmianie stylu.
- Apply These Settings to UI przywraca do pól parametry tej partii; z zapisanym ziarnem (seed) odtworzysz ten sam utwór.
- All Generated Files: MP3 (domyślnie 128 kbps, 48 kHz; format i jakość zmienisz w Settings) i JSON z pełnymi parametrami.
Pliki lądują też w folderze gradio_outputs w katalogu programu.
Ustawienia: co warto znać, a czego nie ruszać

| Ustawienie | Co robi | Rada dla początkującego |
|---|---|---|
| UI Language | Język interfejsu: angielski, chiński, japoński, portugalski, hebrajski | Zostaw angielski; polskiego jeszcze nie ma |
| GPU Tier Override | Ręczne ustawienie poziomu sprzętu | Nie ruszaj; program wykrywa sam |
| Main Model Path | Wykonawca: turbo (8 kroków, szybki), sft i base (50 kroków), XL (lepsza jakość, więcej pamięci) | Na start turbo |
| 5Hz LM Model Path i Backend | Planer 0,6B, 1,7B lub 4B; silnik pt, vllm (NVIDIA), mlx (Mac) | Mniejszy planer na słabszym sprzęcie; na Macu mlx |
| Initialize 5Hz LM | Ładuje planer; potrzebny do trybu Simple i „Think” | Włączone, jeśli sprzęt pozwala |
| Offload to CPU, INT8 Quantization, Compile Model | Oszczędzanie pamięci i przyspieszanie | Program włącza je sam na słabszych kartach |
| MLX DiT (Apple Silicon) | Natywny silnik Apple dla wykonawcy | Na Macu włączone |
| Initialize Service | Ładuje modele po zmianie ustawień | Kliknij po każdej zmianie modelu; status pokaże, czy się udało |

Parametry wykonawcy według samouczka: Inference Steps 8 dla turbo (więcej kroków to dokładniej i wolniej; base używa 32–100); Guidance Scale działa tylko z modelami base i sft (wyżej = ściślej trzyma się opisu); Shift 3.0 zalecane dla turbo; Seed to losowe ziarno: przy Random Seed każda próba jest inna, przy wpisanym numerze ta sama. Samouczek radzi: gdy testujesz wpływ jednego parametru, ustaw stały seed, bo inaczej losowość zamaskuje zmianę.


Dalsze kroki: remiks, przemalowanie, własny styl
Remix – wgraj nagranie (albo kliknij Send To Remix przy własnym wyniku), wpisz opis nowego stylu, ustaw siłę (wyżej = bliżej oryginalnej struktury) i generuj. To tryb do coverów i „tej samej piosenki w innym gatunku”.
Repaint – wgraj nagranie, podaj sekundy od i do (-1 = do końca), opisz, co ma być w tym fragmencie, wybierz tryb conservative, balanced lub aggressive i siłę. Do poprawiania nieudanego refrenu bez ruszania reszty i do wydłużania utworu.
Reference Audio – w trybie Custom wgraj nagranie jako wzór brzmienia; model naśladuje barwę i charakter, nie melodię.
Wiele wersji i automatyczna ocena – samouczek zaleca: ustaw Batch Size 2–8, włącz Auto Score i AutoGen, a program będzie w tle generował kolejne partie z nowymi ziarnami i oceniał je; przeglądasz wyniki i wybierasz najlepsze. Autorzy szczególnie polecają wynik „DiT Lyrics Alignment”, który mówi, jak dokładnie wokal trafia w tekst.

LoRA: własny styl – w zakładce LoRA Training wskazujesz folder z kilkoma własnymi nagraniami (np. 8 utworów), program je opisuje, przetwarza i trenuje mały „adapter”, który potem ładujesz w Settings. Według dokumentacji na karcie RTX 3090 z 12 GB trwa to około godziny; na Macu dłużej. Adaptera nie da się załadować przy włączonej kwantyzacji INT8 (przewodnik po interfejsie, samouczek LoRA). Ucz na nagraniach, do których masz prawa.
Prawo i uczciwość: co możesz zrobić z utworem
- Program i model są na licencji MIT, więc możesz ich używać także komercyjnie. Autorzy proszą jednak, żeby sprawdzać oryginalność wyników, ujawniać udział AI i uzyskiwać zgody przy naśladowaniu chronionych stylów lub materiałów (dokumentacja, sekcja License & Disclaimer).
- Nie wpisuj nazwisk artystów jako „zrób jak X” do publikacji; opisuj styl cechami (epoka, instrumenty, brzmienie). Do prywatnych eksperymentów to bez znaczenia, do wydania utworu ma.
- Serwisy streamingowe mają własne zasady dotyczące muzyki z AI; sprawdź je przed wysyłką.
- Jedyna oficjalna strona projektu to jego repozytorium i strona projektu na GitHubie. Autorzy ostrzegają przed podrobionymi domenami z płatnościami.
Najczęstsze problemy
| Objaw | Przyczyna i co zrobić |
|---|---|
| Strona 127.0.0.1:7860 się nie otwiera | Program jeszcze się ładuje albo nie wystartował. Patrz w okno terminala: adres pojawia się po załadowaniu; błędy też. Port zajęty? Zmień PORT w pliku .env. |
| „Generate Music” nic nie robi | Modele niezaładowane. Rozwiń Settings, kliknij Initialize Service i poczekaj na status „[OK] Model initialized”. |
| Tryb Simple albo „Think” niedostępne | Za mało pamięci na planer; program wyłączył go automatycznie. Pisz opis i tekst sam w trybie Custom albo wybierz mniejszy planer 0,6B. |
| Wokal śpiewa po angielsku, choć tekst jest polski | Ustaw Vocal Language na „pl” i odznacz Language Auto; dopisz w opisie „Polish lyrics, Polish vocal”. |
| Wokal wyśpiewuje nazwy tagów | Za dużo określeń w tagach. Zostaw [Chorus - anthemic], resztę przenieś do opisu stylu. |
| Utwór urywa się albo jest za krótki | Ustaw Audio Duration ręcznie (odznacz Duration Auto) albo skróć tekst; do wydłużenia użyj Repaint od końca. |
| Bardzo wolno | Za duży model dla sprzętu. Wróć do turbo i planera 0,6B, zmniejsz Batch Size do 1, skróć długość. Na Macu sprawdź, że MLX DiT jest włączone. |
| Brak miejsca na dysku | Modele to około 10 GB, a każda wersja to nowy plik w gradio_outputs. Czyść folder wyników. |
Najczęściej zadawane pytania
Czy to naprawdę za darmo?
Tak. Program i modele są otwarte na licencji MIT; nie ma konta, abonamentu ani limitów. Płacisz sprzętem i prądem. Autorzy prowadzą też bezpłatną wersję online, ale ten poradnik jest o wersji lokalnej.
Czy śpiewa po polsku?
Tak, polski jest wśród obsługiwanych języków; jakość wymowy bywa różna i najlepsza jest w największych językach. Pomaga ustawienie języka „pl”, poprawny tekst z polskimi znakami i unikanie skrótów.
Mac czy PC?
Oba działają. Mac z Apple Silicon i 16 GB lub więcej daje pełne funkcje bez konfiguracji, dzięki MLX; utwór 30-sekundowy w około pół minuty. PC z kartą NVIDIA jest szybszy (kilka sekund na utwór na mocnej karcie) i pozwala na modele XL przy 20 GB i więcej. Mac z procesorem Intel jest za wolny.
Czym różni się turbo od base i sft?
Turbo tworzy dźwięk w 8 krokach i jest najszybszy, o wysokiej jakości; sft i base w 50 krokach, base jest najbardziej „twórczy” i jako jedyny obsługuje rozdzielanie i dokładanie ścieżek. Na co dzień turbo; do eksperymentów base.
Co to jest „Think”?
Przełącznik planera. Włączony: model sam dobiera tempo, tonację, długość i rozpisuje szkic utworu, co poprawia spójność. Wyłączony: wykonawca pracuje bezpośrednio z Twojego opisu i tekstu, szybciej i przy mniejszej pamięci. W trybach Remix i Repaint jest pomijany.
Czy mogę używać wyników w filmach na YouTube albo w reklamie?
Licencja pozwala. Autorzy proszą o sprawdzenie oryginalności i oznaczenie udziału AI; platformy mają własne zasady dla treści z AI. Przy użyciu komercyjnym skonsultuj się z prawnikiem, zwłaszcza jeśli utwór naśladuje rozpoznawalny styl.
Czy potrzebuję umieć programować?
Nie. Instalacja to wklejenie trzech poleceń albo rozpakowanie paczki; potem wszystko dzieje się w przeglądarce.
Podsumowanie fact-check
- Na pewno prawda: ACE-Step 1.5 jest otwartym projektem na licencji MIT; działa lokalnie na NVIDIA, Apple Silicon, AMD i Intel; interfejs uruchamia się pod adresem 127.0.0.1:7860; tworzy utwory od 10 sekund do 10 minut, do 8 wersji naraz, w ponad 50 językach; ma tryby Simple, Custom, Remix i Repaint oraz trening LoRA. Zrzuty ekranu i czasy z testu pochodzą z działającej instalacji na Macu.
- Prawdopodobnie prawda na dzień weryfikacji: tabela poziomów sprzętu i domyślne modele; około 10 GB na modele; czasy poniżej 2 s na A100 i 10 s na RTX 3090 według autorów. Nowe wersje mogą to zmienić.
- Co jest niepewne: jakość polskiej wymowy w konkretnym utworze; czas generowania na Twoim komputerze; dostępność paczek portable w danym momencie.
- Częsty mit: „darmowa muzyka z AI jest wolna od ryzyka prawnego”. Licencja programu pozwala na użycie, ale odpowiedzialność za oryginalność i za naśladowanie chronionych stylów zostaje po stronie użytkownika.
Źródła
| Źródło | Typ | Wiarygodność |
|---|---|---|
| ACE-Step 1.5 – repozytorium i dokumentacja główna | Oficjalne | Wysoka |
| ACE-Step 1.5 – instrukcja instalacji | Oficjalne | Wysoka |
| ACE-Step 1.5 – przewodnik po interfejsie Gradio | Oficjalne | Wysoka |
| ACE-Step 1.5 – samouczek (opis, tekst, parametry) | Oficjalne | Wysoka |
| ACE-Step 1.5 – samouczek treningu LoRA | Oficjalne | Wysoka |
| ACE-Step 1.5 – strona projektu | Oficjalne | Wysoka |
| ACE-Step 1.5 – modele na Hugging Face | Oficjalne | Wysoka |
| ACE-Step 1.5 – raport techniczny | Publikacja naukowa | Wysoka |
| uv – menedżer pakietów Pythona | Oficjalne | Wysoka |
Komentarze (0)
Brak komentarzy. Bądź pierwszy!