Przejdź do treści

Ollama: własna AI na komputerze bez chmury – instalacja, modele, polski Bielik i jaki sprzęt wybrać (2026)

Prostymi słowami: co to jest Ollama i model lokalny, czym różni się od płatnych asystentów, jak zainstalować na Macu, Windows i Linuksie, pierwsze polecenia, które modele na start (Gemma, Qwen, gpt-oss, Bielik), ile pamięci potrzeba i dlaczego Mac z Apple Silicon i pamięcią wspólną jest do tego wyjątkowo dobry.

Wolisz zapytać niż czytać dalej?

Otwórz asystenta AI i zadaj pytanie do tego poradnika.

ChatGPT, Claude i Gemini działają w chmurze: to, co wpisujesz, jedzie do serwerów producenta. Jest druga droga: pobrać model AI na własny komputer i rozmawiać z nim bez internetu, bez konta, bez abonamentu i bez wysyłania czegokolwiek komukolwiek. Najprostszy program do tego nazywa się Ollama. Ten przewodnik wyjaśnia prostymi słowami, co to jest, co potrafi, a czego nie, czym różni się od płatnych asystentów, jak go zainstalować na Macu, Windows i Linuksie, jaki sprzęt jest potrzebny i dlaczego Mac z procesorem Apple Silicon jest do tego wyjątkowo dobry. Jest w nim też polski model Bielik, który po polsku radzi sobie lepiej niż większość modeli otwartych.

Ostatnia weryfikacja: 6 września 2026. Materiał informacyjny. Wersje programów, nazwy i rozmiary modeli oraz parametry sprzętu zmieniają się co kilka miesięcy; liczby pochodzą z dokumentacji Ollama, Apple, NVIDIA i AMD z dnia weryfikacji. Zanim kupisz sprzęt pod AI, sprawdź aktualne dane u producenta.

W skrócie

Najważniejsze
  • Ollama to bezpłatny program, który pobiera otwarte modele AI (Llama od Meta, Gemma od Google, Qwen, Mistral, DeepSeek, gpt-oss od OpenAI, polski Bielik) i uruchamia je na Twoim komputerze. Ma aplikację z oknem czatu na Maca i Windows oraz wersję dla Linuksa (strona pobierania, o aplikacji).
  • Nic nie wychodzi z komputera. Producent pisze wprost: „Ollama działa lokalnie. Nie widzimy Twoich promptów ani danych, gdy uruchamiasz go lokalnie” (dokumentacja). Działa bez internetu po pobraniu modelu.
  • Cena to sprzęt. Model musi zmieścić się w szybkiej pamięci komputera. Reguła Ollamy: model 7 miliardów parametrów potrzebuje co najmniej 8 GB pamięci, 13 miliardów 16 GB, 33 miliardy 32 GB (dokumentacja Ollama).
  • Mac z Apple Silicon jest do tego wyjątkowo dobry, bo ma pamięć wspólną dla procesora i karty graficznej: cała pamięć komputera może służyć modelowi, a jest jej do 128 GB w MacBooku Pro i do 512 GB w Mac Studio (dane Apple, Mac Studio). Typowa karta graficzna do PC ma 16 albo 32 GB (NVIDIA).
  • Modele lokalne są słabsze od najlepszych chmurowych i nie mają domyślnie dostępu do internetu. Za to są prywatne, bezpłatne i zawsze dostępne. Do dokumentów, tłumaczeń, streszczeń i codziennych pytań wystarczają.
  • Bielik to polski model fundacji SpeakLeash i ACK Cyfronet AGH, na licencji Apache 2.0, dostępny w Ollama jednym poleceniem; wersja 11B w wariancie oszczędnym zajmuje 6,7 GB (Bielik w Ollama).

Co to jest Ollama i „model lokalny”, prostymi słowami

Asystent AI składa się z dwóch rzeczy: z modelu, czyli ogromnego pliku z „wiedzą”, powstałego w wyniku treningu na tekstach, i z programu, który ten plik uruchamia i pozwala z nim rozmawiać. W ChatGPT obie rzeczy są na serwerach OpenAI. Część firm udostępnia jednak swoje modele publicznie, jako pliki do pobrania; mówi się na nie modele otwarte albo o otwartych wagach. Ollama to program, który takie pliki pobiera i uruchamia na Twoim komputerze, a potem daje Ci okno czatu takie jak w ChatGPT.

Modele mają rozmiary opisywane liczbą parametrów: 1B, 4B, 8B, 27B, 70B (B od miliarda). Im więcej parametrów, tym model mądrzejszy, ale tym więcej pamięci potrzebuje i tym wolniej odpowiada. Model 4B mieści się na zwykłym laptopie i odpowiada szybko; model 70B potrzebuje komputera za kilka tysięcy dolarów. Dla porównania: modele chmurowe, jak te w ChatGPT czy Claude, są znacznie większe i działają na tysiącach kart graficznych; dlatego lokalny model nigdy nie będzie równie „mądry”, ale do wielu codziennych zadań nie musi.

Co model lokalny robi dobrze

Streszcza i tłumaczy dokumenty, pisze projekty e-maili i pism, odpowiada na pytania o załączone pliki, pomaga w nauce, układa listy i plany, pomaga w kodzie. Wszystko bez wysyłania treści komukolwiek.

Czego nie robi albo robi gorzej

Nie ma domyślnie internetu, więc nie zna dzisiejszych wiadomości i cen. Ma mniej wiedzy ogólnej niż modele chmurowe, częściej się myli w trudnych pytaniach, na słabym sprzęcie odpowiada wolno. Nie generuje wideo.

Jak o nim myśleć

Jak o dobrym asystencie, który mieszka u Ciebie w domu, nie plotkuje i nie bierze pieniędzy, ale nie czyta gazet i ma mniej doświadczenia niż gwiazdy z chmury.

Chmura czy własny komputer: uczciwe porównanie

CechaAsystent w chmurze (ChatGPT, Claude, Gemini)Model lokalny (Ollama)
KosztWersja darmowa z limitami; 20 USD miesięcznie i więcej za planyProgram i modele bezpłatne; kosztem jest sprzęt i prąd
PrywatnośćDane trafiają do producenta; trenowanie można zwykle wyłączyćNic nie opuszcza komputera; producent nie widzi promptów
Jakość odpowiedziNajwyższa dostępnaDobra do bardzo dobrej w codziennych zadaniach; słabsza w trudnych
InternetWyszukiwanie w sieci, aktualne daneDomyślnie brak; działa bez internetu
SzybkośćSzybko niezależnie od Twojego sprzętuZależy od pamięci i karty graficznej; od bardzo szybko do bardzo wolno
LimityLimity wiadomości, sesji, plikówBrak; ograniczeniem jest tylko sprzęt
Obrazy i głosTak, w większościModele czytające obrazy tak; generowanie obrazów i głos wymagają osobnych narzędzi
Konto i wiekKonto, w Claude 18 latBez konta; instalujesz jak każdy program
Dla kogoWiększość osób na co dzieńOsoby, którym zależy na prywatności, pracujące z poufnymi dokumentami, bez stałego internetu, ciekawe technologii

Kiedy lokalnie ma sens: gdy pracujesz z dokumentami, których nie chcesz wysyłać nikomu (umowy, dane klientów, sprawy rodzinne, medyczne, księgowe); gdy chcesz mieć asystenta bez abonamentu i bez limitów; gdy internet bywa niepewny; gdy chcesz uczyć się, jak to działa. Kiedy nie ma sensu: gdy potrzebujesz najwyższej jakości do trudnych zadań, aktualnych informacji z sieci albo obrazów i wideo. Wiele osób ma oba: chmurę do trudnych rzeczy, Ollamę do poufnych.

Sprzęt: jedna zasada, która wyjaśnia wszystko

Żeby model odpowiadał szybko, cały jego plik musi siedzieć w szybkiej pamięci, do której ma dostęp układ liczący (karta graficzna). Podczas pisania każdego kolejnego słowa komputer przegląda cały model od początku do końca. Wynikają z tego dwie rzeczy:

  1. Ilość pamięci decyduje, jak duży model uruchomisz. Reguła Ollamy: 7B potrzebuje 8 GB, 13B 16 GB, 33B 32 GB, a 70B 64 GB (dokumentacja Ollama). Modele w Ollama są domyślnie „skompresowane” (kwantyzacja), przez co zajmują mniej więcej pół bajta na parametr: 4B to około 3 GB, 8B około 5 GB, 27B około 17 GB (rozmiary z strony Gemma 3, strony Qwen3). Do rozmiaru pliku dolicz kilka gigabajtów na rozmowę i system.
  2. Przepustowość pamięci decyduje, jak szybko model pisze. Skoro każde słowo wymaga przeczytania całego modelu, liczba słów na sekundę jest w przybliżeniu równa przepustowości pamięci podzielonej przez rozmiar modelu. Pamięć 460 GB/s i model 7 GB to najwyżej około 60 słów na sekundę; zwykła pamięć laptopa PC, kilkadziesiąt GB/s, ten sam model pisze kilka słów na sekundę. To przybliżenie, ale dobrze tłumaczy, dlaczego jedne komputery „lecą”, a inne „mielą”.

PC z kartą graficzną: szybko, ale mało pamięci

W zwykłym komputerze PC są dwie pamięci: RAM dla procesora (duża, wolna) i VRAM na karcie graficznej (mała, bardzo szybka). Model uruchamia się dobrze tylko wtedy, gdy mieści się w VRAM. Najmocniejsza konsumencka karta NVIDIA, GeForce RTX 5090, ma 32 GB (NVIDIA); RTX 5080 ma 16 GB przy przepustowości 960 GB/s (NVIDIA). To znaczy: karta za kilka tysięcy dolarów jest bardzo szybka, ale zmieści model do około 30B; modele 70B wymagają dwóch kart albo częściowego użycia wolnej pamięci RAM, co drastycznie zwalnia. Ollama obsługuje karty NVIDIA (od generacji z możliwością obliczeniową 5.0, sterownik 550 lub nowszy), wybrane karty AMD i układy Intel przez Vulkan; bez karty działa na samym procesorze, wolno (o obsłudze sprzętu).

Mac z Apple Silicon: pamięć wspólna, czyli dlaczego to działa tak dobrze

W procesorach Apple M (M1, M2, M3, M4, M5) procesor i układ graficzny korzystają z jednej, wspólnej, szybkiej pamięci; Apple nazywa to pamięcią zunifikowaną. Skutek dla AI jest prosty: prawie cała pamięć komputera może służyć modelowi, a ta pamięć jest szybka. MacBook Pro z układem M5 Max ma do 128 GB pamięci przy przepustowości 460 albo 614 GB/s, M5 Pro 307 GB/s, podstawowy M5 153 GB/s (dane Apple). Mac Studio z M5 Ultra ma 96, 256 albo 512 GB przy 1,2 TB/s (dane Apple); poprzednia generacja z M3 Ultra oferowała do 512 GB przy 819 GB/s (dane Apple). Ollama używa układu graficznego Apple przez Metal (dokumentacja).

Porównaj: laptop za około trzy tysiące dolarów z 64 GB pamięci wspólnej uruchomi model 70B, którego na PC nie zmieści żadna pojedyncza karta konsumencka. Karta PC będzie szybsza przy małych modelach, ale Mac uruchomi większe. Dlatego wśród osób pracujących z lokalnymi modelami Mac Studio z dużą pamięcią stał się standardem. Uwaga na dwie rzeczy: Mac z 8 GB pamięci uruchomi tylko najmniejsze modele, a Maca nie da się rozbudować po zakupie; pamięć wybierasz raz.

Trzecia droga: PC z pamięcią wspólną

AMD produkuje procesory Ryzen AI Max+ 395 z do 128 GB pamięci wspólnej, z której do 96 GB może służyć układowi graficznemu (dane AMD). To odpowiedź PC na pomysł Apple; komputery z tym układem są tańsze od Maca z podobną pamięcią, ale przepustowość pamięci jest niższa, więc duże modele piszą wolniej. Ollama obsługuje te układy jako karty AMD (dokumentacja).

Rekomendacje: co kupić albo co masz

SprzętModele, które uruchomisz wygodnieCo to daje w praktyce
Dowolny laptop z 8 GB RAM, bez karty1B do 4B (Gemma 3 1B i 4B, Qwen3 4B)Proste pytania, krótkie streszczenia, wolno; do spróbowania, nie do pracy
Mac z 16 GB pamięci wspólnej albo PC z kartą 8 GB4B do 8B (Gemma 3 4B, Qwen3 8B, Llama 3.2, Mistral 7B, Bielik 11B w wariancie Q4)Codzienne zadania, dokumenty do kilkunastu stron, płynne odpowiedzi
Mac z 32–64 GB albo PC z kartą 16–24 GB12B do 30B (Gemma 3 12B i 27B, Qwen3 14B i 30B, gpt-oss 20B, Bielik w wyższych wariantach)Wyraźnie mądrzejsze odpowiedzi, długie dokumenty, pomoc w kodzie; sensowny „domowy asystent”
Mac z 128 GB, PC z kartą 32 GB lub dwiemaDo 70B (Llama 3.3 70B, Qwen3 32B) i gpt-oss 120B na 128 GBJakość zbliżona do chmury sprzed roku, dwa; praca zawodowa na poufnych danych
Mac Studio 256–512 GBNajwiększe modele otwarte (Qwen3 235B, gpt-oss 120B z zapasem)Serwer AI dla domu lub małej firmy, bez chmury

Rozmiary modeli: Gemma 3 4B 3,3 GB, 12B 8,1 GB, 27B 17 GB (Ollama); Qwen3 8B 5,2 GB, 14B 9,3 GB, 30B 19 GB, 235B 142 GB (Ollama); Llama 3.3 70B 43 GB (Ollama); gpt-oss 20B około 14 GB, „na komputery z 16 GB pamięci”, 120B około 65 GB (Ollama); Bielik 11B od 6,7 GB (Q4) do 22 GB (pełna precyzja) (Ollama). Jeśli dopiero kupujesz komputer i myślisz o AI: więcej pamięci jest ważniejsze niż szybszy procesor.

Instalacja krok po kroku

Mac

Wymagania: macOS Sonoma (14) lub nowszy; procesory Apple M z obsługą karty graficznej, Intel tylko na procesorze (dokumentacja).

  1. Pobierz

    Wejdź na ollama.com/download/mac i pobierz plik. Otwórz go i przeciągnij ikonę Ollama do folderu Aplikacje.

  2. Uruchom

    Otwórz Ollama z Aplikacji. Przy pierwszym uruchomieniu zapyta o zgodę na dodanie polecenia do terminala; zgódź się, przyda się później.

  3. Wybierz model

    W oknie czatu jest lista modeli do wyboru; pierwsze użycie pobiera model (kilka GB, chwilę trwa). Na start wybierz Gemma 3 4B albo Qwen3 8B, jeśli masz 16 GB pamięci.

  4. Napisz pierwsze pytanie

    Okno działa jak ChatGPT. Pliki PDF i tekstowe przeciągasz do okna; zdjęcia rozumieją modele oznaczone jako obsługujące obrazy (o aplikacji).

Windows

  1. Pobierz i zainstaluj

    ollama.com/download/windows, uruchom instalator, kliknij dalej (dokumentacja).

  2. Karta graficzna

    Jeśli masz kartę NVIDIA, miej aktualne sterowniki; Ollama sama ją wykryje. Bez karty działa na procesorze, wolniej.

  3. Wybierz model i pisz

    Tak samo jak na Macu: okno czatu, lista modeli, przeciąganie plików.

Linux

Jedno polecenie w terminalu, z dokumentacji Ollama; przy kartach NVIDIA potrzebne są sterowniki CUDA, przy AMD ROCm w wersji 7:

Polecenie · instalacja na Linuksie

curl -fsSL https://ollama.com/install.sh | sh

Pierwsze polecenia w terminalu

Aplikacja z oknem czatu wystarcza większości osób. Terminal daje więcej kontroli i jest potrzebny na Linuksie. Na Macu program „Terminal”, na Windows „PowerShell”; wklejasz polecenie i naciskasz Enter. Polecenia pochodzą z dokumentacji Ollama.

Polecenie 1 · pobierz i uruchom mały model (około 3 GB)

ollama run gemma3:4b

Polecenie 2 · polski Bielik 11B w wariancie oszczędnym (6,7 GB, potrzebne około 10 GB pamięci)

ollama run SpeakLeash/bielik-11b-v3.0-instruct:Q4_K_M

Polecenie 3 · większy model, gdy masz 16 GB lub więcej

ollama run qwen3:8b

Polecenia 4 · porządki: lista, pobranie bez uruchamiania, co działa, usunięcie, wyjście z rozmowy

ollama list
ollama pull gemma3:12b
ollama ps
ollama rm gemma3:4b
/bye

Po „ollama run” pojawia się znak zachęty i piszesz jak w czacie. Pierwsze uruchomienie pobiera model; kolejne startują w sekundy. Model po pięciu minutach bezczynności jest zwalniany z pamięci i ładuje się ponownie przy następnym pytaniu (dokumentacja).

Który model na start

ModelProducentRozmiary i plikiDo czego
Gemma 3Google270M, 1B, 4B (3,3 GB), 12B (8,1 GB), 27B (17 GB); czyta obrazy od 4BUniwersalny, dobry start; 4B na słabym sprzęcie, 12B i 27B na mocnym
Qwen3AlibabaOd 0,6B do 235B; 8B 5,2 GB, 14B 9,3 GB, 30B 19 GBBardzo dobry w wielu językach i w kodzie; szeroki wybór rozmiarów
Bielik 11B v3.0SpeakLeash i ACK Cyfronet AGH (Polska)Warianty od 6,7 GB (Q4) do 22 GB (pełna precyzja); 32 języki europejskie, zoptymalizowany pod polski; Apache 2.0Polskie teksty, pisma, tłumaczenia z polskiego i na polski
gpt-ossOpenAI20B (około 14 GB, na komputery z 16 GB), 120B (około 65 GB); Apache 2.0Rozumowanie i zadania wieloetapowe; 20B to dobry wybór na Maca z 32 GB
Llama 3.3Meta70B (43 GB)Dla mocnych komputerów; jakość zbliżona do dużych modeli
DeepSeek-R1DeepSeekKilka rozmiarów, w tym 8BModele „rozumujące”, pokazują tok myślenia; lokalnie bez wysyłania danych do Chin
Mistral 7BMistral AI (Francja)7BKlasyczny, lekki, szybki

Źródła rozmiarów: strony modeli w bibliotece Ollama podlinkowane wyżej i w tabeli źródeł. Nazwy z dwukropkiem (gemma3:12b) to konkretne warianty; bez dwukropka Ollama bierze domyślny. Wariant Q4 to model skompresowany czterokrotnie: mniejszy i szybszy, nieco mniej dokładny; strona Bielika ostrzega, że modele skompresowane „wykazują obniżoną jakość odpowiedzi i możliwe halucynacje”. Do codziennych zadań Q4 wystarcza; do pracy wymagającej precyzji weź Q6 albo Q8, jeśli masz pamięć.

Prompty do wypróbowania lokalnie

Model lokalny nie ma internetu, więc pytaj o rzeczy, które ma „w sobie” albo w załączonym pliku. Cztery elementy dobrego promptu (rola, kontekst, zadanie, format) z przewodnika po ChatGPT działają tu tak samo, a nawet ważniej, bo mniejszy model gorzej zgaduje, o co Ci chodzi.

Prompt 1 · test po polsku (najlepiej z Bielikiem)

Napisz uprzejme pismo do wspólnoty mieszkaniowej z prośbą o naprawę oświetlenia na klatce schodowej, które nie działa od dwóch tygodni. Pół strony, oficjalny ton, z miejscem na moje dane i datę.

Prompt 2 · dokument, którego nie chcesz wysyłać do chmury (przeciągnij plik do okna)

Streść załączony dokument po polsku w pięciu punktach. Osobno wypisz daty, kwoty i moje obowiązki. Nie dodawaj niczego, czego nie ma w dokumencie; jeśli czegoś nie ma, napisz to.

Prompt 3 · tłumaczenie z zachowaniem tonu

Przetłumacz poniższy e-mail z angielskiego na polski, zachowując ton i podział na akapity. Zwroty urzędowe zostaw po angielsku w nawiasie.
[wklej tekst]

Prompt 4 · sprawdź, czy model przyznaje się do niewiedzy

Jaka jest dzisiejsza data i jakie są dziś najważniejsze wiadomości z Polski? Jeśli nie masz dostępu do internetu ani do dzisiejszej daty, napisz to wprost zamiast zgadywać.

Prompt 5 · nauka z ćwiczeniem

Jesteś nauczycielem angielskiego. Naucz mnie pięciu zdań przydatnych u lekarza: zdanie, wymowa zapisana po polsku, tłumaczenie. Potem zadaj mi jedno ćwiczenie i poczekaj na odpowiedź.

Odpowiedź na prompt 4 mówi dużo o modelu: dobry napisze, że nie zna daty ani wiadomości. Słaby wymyśli. Wymyślanie to ta sama wada, co w chmurze, tylko częstsza przy małych modelach; ważne fakty sprawdzasz.

Ustawienia, które warto znać

Długość kontekstu – ile tekstu model widzi naraz. Domyślnie Ollama ustawia 4096 tokenów, czyli kilka stron; przy długich dokumentach trzeba to zwiększyć w ustawieniach aplikacji albo zmienną OLLAMA_CONTEXT_LENGTH, kosztem większego zużycia pamięci (dokumentacja). Jeśli model „nie widzi” końca załączonego pliku, to jest przyczyna.

Gdzie są modele – na Macu w folderze ~/.ollama/models, na Windows w C:\Users\nazwa\.ollama\models; można to zmienić zmienną OLLAMA_MODELS, np. na dysk zewnętrzny (dokumentacja). Modele zajmują od kilku do kilkudziesięciu GB każdy; co jakiś czas usuń nieużywane.

Dostęp z innych urządzeń w domu – domyślnie Ollama słucha tylko na własnym komputerze. Ustawienie OLLAMA_HOST na 0.0.0.0:11434 udostępnia ją w sieci domowej, np. laptopowi albo telefonowi przez aplikację czatu (dokumentacja). Nie udostępniaj jej do internetu; nie ma hasła.

Modele w chmurze Ollamy – Ollama oferuje też uruchamianie dużych modeli na swoich serwerach: plan darmowy z kredytami, Pro za 20 USD i Max za 100 USD miesięcznie, z deklaracją braku logowania, braku trenowania i zerowego przechowywania danych (strona Ollama Cloud). To wygodne, ale to już nie jest „lokalnie”; jeśli chcesz mieć pewność, że nic nie wychodzi, ustaw OLLAMA_NO_CLOUD=1 (dokumentacja).

Inne programy do modeli lokalnych

  • Open WebUI – interfejs czatu w przeglądarce, który łączy się z Ollamą; wygląda jak ChatGPT, ma użytkowników, historię, pracę z dokumentami; dobry, gdy Ollama stoi na jednym komputerze, a korzysta cała rodzina (projekt).
  • LM Studio – alternatywa dla Ollamy z rozbudowanym oknem, wyborem modeli z katalogu i ustawieniami sprzętu; dla osób, które wolą klikać niż pisać polecenia (strona).
  • llama.cpp – silnik, na którym opiera się Ollama i wiele innych programów; dla zaawansowanych (projekt).

Bezpieczeństwo i prywatność

Lokalnie znaczy prywatnie, ale nie „bezmyślnie”
  • Nie udostępniaj Ollamy do internetu. Nie ma hasła; każdy, kto trafi na adres, może z niej korzystać i czytać, co jej wysyłasz. W sieci domowej tak, publicznie nie.
  • Pobieraj modele z biblioteki Ollama albo od znanych producentów. Model to plik; plik od nieznanego autora może być gorszy, niż obiecuje, albo celowo zmanipulowany.
  • Licencje. Bielik i gpt-oss są na Apache 2.0, można ich używać także komercyjnie; Llama i Gemma mają własne licencje z warunkami. Jeśli budujesz coś dla firmy, przeczytaj licencję modelu.
  • Halucynacje są takie same jak w chmurze, tylko częstsze. Mały model pewnym tonem wymyśli datę albo przepis. Sprawdzasz.
  • Prąd i ciepło. Duży model na laptopie grzeje i zużywa baterię; przy dłuższej pracy podłącz zasilanie.

Najczęstsze błędy początkujących

  • Za duży model na za mały komputer. Model, który nie mieści się w pamięci, działa kilkadziesiąt razy wolniej albo wcale. Zacznij od 4B, potem zwiększaj.
  • Oczekiwanie wiedzy o dzisiejszych wydarzeniach. Model lokalny nie ma internetu. Do wiadomości jest Perplexity.
  • Za krótki kontekst przy długim pliku. Zwiększ długość kontekstu w ustawieniach.
  • Dysk pełen modeli. Każdy „ollama run nowość” to kolejne gigabajty; usuwaj nieużywane.
  • Mac z 8 GB „do AI”. Uruchomi tylko najmniejsze modele. Przy zakupie pod AI wybieraj 32 GB i więcej.
  • Prompt jak do ChatGPT. Mniejszy model potrzebuje więcej kontekstu i jaśniejszego formatu; im mniejszy model, tym lepszy musi być prompt.
  • Otwarcie portu do internetu „żeby mieć dostęp z pracy”. Zamiast tego VPN do domu.

Najczęściej zadawane pytania

Czy Ollama jest naprawdę darmowa?

Tak, program i modele otwarte są bezpłatne. Płatna jest tylko opcjonalna chmura Ollamy. Kosztem jest sprzęt i prąd.

Czy to działa bez internetu?

Tak, po pobraniu modelu. Internet jest potrzebny tylko do pobrania programu i modeli.

Czy modele lokalne mówią po polsku?

Większe modele (Gemma 3 12B i 27B, Qwen3 od 8B, gpt-oss, Llama 3.3) tak, choć z gorszą polszczyzną niż chmura. Bielik jest do polskiego stworzony i przy podobnym rozmiarze pisze po polsku najlepiej.

Mam laptopa PC z 16 GB RAM i bez karty graficznej. Czy warto?

Do spróbowania tak: modele 4B do 8B ruszą na procesorze, powoli, ale ruszą. Do codziennej pracy potrzebna jest karta graficzna albo Mac z pamięcią wspólną.

Mac czy PC do AI w domu?

Jeśli chcesz uruchamiać duże modele (30B i więcej) w jednym, cichym komputerze, Mac z 64 GB lub więcej. Jeśli głównie małe i średnie modele i zależy Ci na szybkości oraz grach, PC z kartą NVIDIA 16–32 GB. Jeśli budżet jest ważny, a chcesz dużo pamięci, komputer z AMD Ryzen AI Max+.

Czy mogę używać Ollamy z ChatGPT albo Claude?

To osobne programy. Możesz mieć oba: chmurę do trudnych zadań i aktualności, Ollamę do poufnych dokumentów. Programiści łączą Ollamę z narzędziami do kodu, w tym z Claude Code, ale to temat zaawansowany.

Czy Bielik to to samo co ChatGPT po polsku?

Nie. To mniejszy, otwarty model wytrenowany z myślą o polskim, który działa u Ciebie. Zna polski bardzo dobrze, ale ma mniej wiedzy ogólnej niż największe modele chmurowe i nie ma internetu.

Podsumowanie fact-check

Co wiemy na pewno, a co się zmienia
  • Na pewno prawda: Ollama jest bezpłatna, działa na Macu, Windows i Linuksie, uruchamia modele lokalnie i według producenta nie widzi promptów; obsługuje karty NVIDIA, AMD, układy Apple przez Metal i procesor jako zapas; domyślny kontekst to 4096 tokenów; Bielik 11B jest na licencji Apache 2.0 i dostępny w bibliotece Ollama; MacBook Pro z M5 Max ma do 128 GB pamięci wspólnej, Mac Studio do 512 GB; RTX 5090 ma 32 GB. Wszystko z linkami do dokumentacji producentów.
  • Prawdopodobnie prawda na dzień weryfikacji: rozmiary plików modeli i lista wariantów w bibliotece; ceny chmury Ollamy (Pro 20, Max 100 USD). Zmieniają się z każdą wersją.
  • Co jest niepewne: dokładna szybkość pisania na konkretnym komputerze; reguła „przepustowość przez rozmiar modelu” jest przybliżeniem górnej granicy, a rzeczywistość zależy od modelu, wersji programu i sterowników.
  • Częsty mit: „lokalny model to ChatGPT bez abonamentu”. To mniejszy, prywatny asystent bez internetu; do wielu rzeczy wystarczy, do najtrudniejszych nie.

Źródła

ŹródłoTypWiarygodność
Ollama – pobieranieOficjalneWysoka
Ollama – aplikacja z oknem czatuOficjalneWysoka
Ollama – instalacja na macOSOficjalneWysoka
Ollama – instalacja na WindowsOficjalneWysoka
Ollama – instalacja na LinuksieOficjalneWysoka
Ollama – obsługa sprzętu i kart graficznychOficjalneWysoka
Ollama – pytania i odpowiedzi (kontekst, prywatność, sieć)OficjalneWysoka
Ollama – dokumentacja i wymagania pamięciOficjalneWysoka
Ollama – chmuraOficjalneWysoka
Ollama – Gemma 3OficjalneWysoka
Ollama – Qwen3OficjalneWysoka
Ollama – Llama 3.3OficjalneWysoka
Ollama – gpt-ossOficjalneWysoka
Ollama – DeepSeek-R1OficjalneWysoka
Ollama – MistralOficjalneWysoka
Ollama – Bielik 11B v3.0OficjalneWysoka
SpeakLeash – BielikOficjalneWysoka
SpeakLeash – modele na Hugging FaceOficjalneWysoka
Apple – dane techniczne MacBook ProProducentWysoka
Apple – dane techniczne Mac StudioProducentWysoka
Apple – Mac Studio 2025 (M3 Ultra)ProducentWysoka
NVIDIA – GeForce RTX 5090ProducentWysoka
NVIDIA – GeForce RTX 5080ProducentWysoka
AMD – Ryzen AI Max+ 395ProducentWysoka
Open WebUIProjekt otwartyWysoka
LM StudioProducentWysoka
llama.cppProjekt otwartyWysoka

Powiązane tematy:

← Wróć do Poradnika AI

Czy ten poradnik był pomocny?

Komentarze (0)

Brak komentarzy. Bądź pierwszy!


Dodaj komentarz

Zaloguj się aby uniknąć weryfikacji emaila przy każdym komentarzu, lub komentuj jako gość:

Komentarz może być moderowany przed publikacją.