ChatGPT, Claude i Gemini działają w chmurze: to, co wpisujesz, jedzie do serwerów producenta. Jest druga droga: pobrać model AI na własny komputer i rozmawiać z nim bez internetu, bez konta, bez abonamentu i bez wysyłania czegokolwiek komukolwiek. Najprostszy program do tego nazywa się Ollama. Ten przewodnik wyjaśnia prostymi słowami, co to jest, co potrafi, a czego nie, czym różni się od płatnych asystentów, jak go zainstalować na Macu, Windows i Linuksie, jaki sprzęt jest potrzebny i dlaczego Mac z procesorem Apple Silicon jest do tego wyjątkowo dobry. Jest w nim też polski model Bielik, który po polsku radzi sobie lepiej niż większość modeli otwartych.
Ostatnia weryfikacja: 6 września 2026. Materiał informacyjny. Wersje programów, nazwy i rozmiary modeli oraz parametry sprzętu zmieniają się co kilka miesięcy; liczby pochodzą z dokumentacji Ollama, Apple, NVIDIA i AMD z dnia weryfikacji. Zanim kupisz sprzęt pod AI, sprawdź aktualne dane u producenta.
W skrócie
- Ollama to bezpłatny program, który pobiera otwarte modele AI (Llama od Meta, Gemma od Google, Qwen, Mistral, DeepSeek, gpt-oss od OpenAI, polski Bielik) i uruchamia je na Twoim komputerze. Ma aplikację z oknem czatu na Maca i Windows oraz wersję dla Linuksa (strona pobierania, o aplikacji).
- Nic nie wychodzi z komputera. Producent pisze wprost: „Ollama działa lokalnie. Nie widzimy Twoich promptów ani danych, gdy uruchamiasz go lokalnie” (dokumentacja). Działa bez internetu po pobraniu modelu.
- Cena to sprzęt. Model musi zmieścić się w szybkiej pamięci komputera. Reguła Ollamy: model 7 miliardów parametrów potrzebuje co najmniej 8 GB pamięci, 13 miliardów 16 GB, 33 miliardy 32 GB (dokumentacja Ollama).
- Mac z Apple Silicon jest do tego wyjątkowo dobry, bo ma pamięć wspólną dla procesora i karty graficznej: cała pamięć komputera może służyć modelowi, a jest jej do 128 GB w MacBooku Pro i do 512 GB w Mac Studio (dane Apple, Mac Studio). Typowa karta graficzna do PC ma 16 albo 32 GB (NVIDIA).
- Modele lokalne są słabsze od najlepszych chmurowych i nie mają domyślnie dostępu do internetu. Za to są prywatne, bezpłatne i zawsze dostępne. Do dokumentów, tłumaczeń, streszczeń i codziennych pytań wystarczają.
- Bielik to polski model fundacji SpeakLeash i ACK Cyfronet AGH, na licencji Apache 2.0, dostępny w Ollama jednym poleceniem; wersja 11B w wariancie oszczędnym zajmuje 6,7 GB (Bielik w Ollama).
Co to jest Ollama i „model lokalny”, prostymi słowami
Asystent AI składa się z dwóch rzeczy: z modelu, czyli ogromnego pliku z „wiedzą”, powstałego w wyniku treningu na tekstach, i z programu, który ten plik uruchamia i pozwala z nim rozmawiać. W ChatGPT obie rzeczy są na serwerach OpenAI. Część firm udostępnia jednak swoje modele publicznie, jako pliki do pobrania; mówi się na nie modele otwarte albo o otwartych wagach. Ollama to program, który takie pliki pobiera i uruchamia na Twoim komputerze, a potem daje Ci okno czatu takie jak w ChatGPT.
Modele mają rozmiary opisywane liczbą parametrów: 1B, 4B, 8B, 27B, 70B (B od miliarda). Im więcej parametrów, tym model mądrzejszy, ale tym więcej pamięci potrzebuje i tym wolniej odpowiada. Model 4B mieści się na zwykłym laptopie i odpowiada szybko; model 70B potrzebuje komputera za kilka tysięcy dolarów. Dla porównania: modele chmurowe, jak te w ChatGPT czy Claude, są znacznie większe i działają na tysiącach kart graficznych; dlatego lokalny model nigdy nie będzie równie „mądry”, ale do wielu codziennych zadań nie musi.
Streszcza i tłumaczy dokumenty, pisze projekty e-maili i pism, odpowiada na pytania o załączone pliki, pomaga w nauce, układa listy i plany, pomaga w kodzie. Wszystko bez wysyłania treści komukolwiek.
Nie ma domyślnie internetu, więc nie zna dzisiejszych wiadomości i cen. Ma mniej wiedzy ogólnej niż modele chmurowe, częściej się myli w trudnych pytaniach, na słabym sprzęcie odpowiada wolno. Nie generuje wideo.
Jak o dobrym asystencie, który mieszka u Ciebie w domu, nie plotkuje i nie bierze pieniędzy, ale nie czyta gazet i ma mniej doświadczenia niż gwiazdy z chmury.
Chmura czy własny komputer: uczciwe porównanie
| Cecha | Asystent w chmurze (ChatGPT, Claude, Gemini) | Model lokalny (Ollama) |
|---|---|---|
| Koszt | Wersja darmowa z limitami; 20 USD miesięcznie i więcej za plany | Program i modele bezpłatne; kosztem jest sprzęt i prąd |
| Prywatność | Dane trafiają do producenta; trenowanie można zwykle wyłączyć | Nic nie opuszcza komputera; producent nie widzi promptów |
| Jakość odpowiedzi | Najwyższa dostępna | Dobra do bardzo dobrej w codziennych zadaniach; słabsza w trudnych |
| Internet | Wyszukiwanie w sieci, aktualne dane | Domyślnie brak; działa bez internetu |
| Szybkość | Szybko niezależnie od Twojego sprzętu | Zależy od pamięci i karty graficznej; od bardzo szybko do bardzo wolno |
| Limity | Limity wiadomości, sesji, plików | Brak; ograniczeniem jest tylko sprzęt |
| Obrazy i głos | Tak, w większości | Modele czytające obrazy tak; generowanie obrazów i głos wymagają osobnych narzędzi |
| Konto i wiek | Konto, w Claude 18 lat | Bez konta; instalujesz jak każdy program |
| Dla kogo | Większość osób na co dzień | Osoby, którym zależy na prywatności, pracujące z poufnymi dokumentami, bez stałego internetu, ciekawe technologii |
Kiedy lokalnie ma sens: gdy pracujesz z dokumentami, których nie chcesz wysyłać nikomu (umowy, dane klientów, sprawy rodzinne, medyczne, księgowe); gdy chcesz mieć asystenta bez abonamentu i bez limitów; gdy internet bywa niepewny; gdy chcesz uczyć się, jak to działa. Kiedy nie ma sensu: gdy potrzebujesz najwyższej jakości do trudnych zadań, aktualnych informacji z sieci albo obrazów i wideo. Wiele osób ma oba: chmurę do trudnych rzeczy, Ollamę do poufnych.
Sprzęt: jedna zasada, która wyjaśnia wszystko
Żeby model odpowiadał szybko, cały jego plik musi siedzieć w szybkiej pamięci, do której ma dostęp układ liczący (karta graficzna). Podczas pisania każdego kolejnego słowa komputer przegląda cały model od początku do końca. Wynikają z tego dwie rzeczy:
- Ilość pamięci decyduje, jak duży model uruchomisz. Reguła Ollamy: 7B potrzebuje 8 GB, 13B 16 GB, 33B 32 GB, a 70B 64 GB (dokumentacja Ollama). Modele w Ollama są domyślnie „skompresowane” (kwantyzacja), przez co zajmują mniej więcej pół bajta na parametr: 4B to około 3 GB, 8B około 5 GB, 27B około 17 GB (rozmiary z strony Gemma 3, strony Qwen3). Do rozmiaru pliku dolicz kilka gigabajtów na rozmowę i system.
- Przepustowość pamięci decyduje, jak szybko model pisze. Skoro każde słowo wymaga przeczytania całego modelu, liczba słów na sekundę jest w przybliżeniu równa przepustowości pamięci podzielonej przez rozmiar modelu. Pamięć 460 GB/s i model 7 GB to najwyżej około 60 słów na sekundę; zwykła pamięć laptopa PC, kilkadziesiąt GB/s, ten sam model pisze kilka słów na sekundę. To przybliżenie, ale dobrze tłumaczy, dlaczego jedne komputery „lecą”, a inne „mielą”.
PC z kartą graficzną: szybko, ale mało pamięci
W zwykłym komputerze PC są dwie pamięci: RAM dla procesora (duża, wolna) i VRAM na karcie graficznej (mała, bardzo szybka). Model uruchamia się dobrze tylko wtedy, gdy mieści się w VRAM. Najmocniejsza konsumencka karta NVIDIA, GeForce RTX 5090, ma 32 GB (NVIDIA); RTX 5080 ma 16 GB przy przepustowości 960 GB/s (NVIDIA). To znaczy: karta za kilka tysięcy dolarów jest bardzo szybka, ale zmieści model do około 30B; modele 70B wymagają dwóch kart albo częściowego użycia wolnej pamięci RAM, co drastycznie zwalnia. Ollama obsługuje karty NVIDIA (od generacji z możliwością obliczeniową 5.0, sterownik 550 lub nowszy), wybrane karty AMD i układy Intel przez Vulkan; bez karty działa na samym procesorze, wolno (o obsłudze sprzętu).
Mac z Apple Silicon: pamięć wspólna, czyli dlaczego to działa tak dobrze
W procesorach Apple M (M1, M2, M3, M4, M5) procesor i układ graficzny korzystają z jednej, wspólnej, szybkiej pamięci; Apple nazywa to pamięcią zunifikowaną. Skutek dla AI jest prosty: prawie cała pamięć komputera może służyć modelowi, a ta pamięć jest szybka. MacBook Pro z układem M5 Max ma do 128 GB pamięci przy przepustowości 460 albo 614 GB/s, M5 Pro 307 GB/s, podstawowy M5 153 GB/s (dane Apple). Mac Studio z M5 Ultra ma 96, 256 albo 512 GB przy 1,2 TB/s (dane Apple); poprzednia generacja z M3 Ultra oferowała do 512 GB przy 819 GB/s (dane Apple). Ollama używa układu graficznego Apple przez Metal (dokumentacja).
Porównaj: laptop za około trzy tysiące dolarów z 64 GB pamięci wspólnej uruchomi model 70B, którego na PC nie zmieści żadna pojedyncza karta konsumencka. Karta PC będzie szybsza przy małych modelach, ale Mac uruchomi większe. Dlatego wśród osób pracujących z lokalnymi modelami Mac Studio z dużą pamięcią stał się standardem. Uwaga na dwie rzeczy: Mac z 8 GB pamięci uruchomi tylko najmniejsze modele, a Maca nie da się rozbudować po zakupie; pamięć wybierasz raz.
Trzecia droga: PC z pamięcią wspólną
AMD produkuje procesory Ryzen AI Max+ 395 z do 128 GB pamięci wspólnej, z której do 96 GB może służyć układowi graficznemu (dane AMD). To odpowiedź PC na pomysł Apple; komputery z tym układem są tańsze od Maca z podobną pamięcią, ale przepustowość pamięci jest niższa, więc duże modele piszą wolniej. Ollama obsługuje te układy jako karty AMD (dokumentacja).
Rekomendacje: co kupić albo co masz
| Sprzęt | Modele, które uruchomisz wygodnie | Co to daje w praktyce |
|---|---|---|
| Dowolny laptop z 8 GB RAM, bez karty | 1B do 4B (Gemma 3 1B i 4B, Qwen3 4B) | Proste pytania, krótkie streszczenia, wolno; do spróbowania, nie do pracy |
| Mac z 16 GB pamięci wspólnej albo PC z kartą 8 GB | 4B do 8B (Gemma 3 4B, Qwen3 8B, Llama 3.2, Mistral 7B, Bielik 11B w wariancie Q4) | Codzienne zadania, dokumenty do kilkunastu stron, płynne odpowiedzi |
| Mac z 32–64 GB albo PC z kartą 16–24 GB | 12B do 30B (Gemma 3 12B i 27B, Qwen3 14B i 30B, gpt-oss 20B, Bielik w wyższych wariantach) | Wyraźnie mądrzejsze odpowiedzi, długie dokumenty, pomoc w kodzie; sensowny „domowy asystent” |
| Mac z 128 GB, PC z kartą 32 GB lub dwiema | Do 70B (Llama 3.3 70B, Qwen3 32B) i gpt-oss 120B na 128 GB | Jakość zbliżona do chmury sprzed roku, dwa; praca zawodowa na poufnych danych |
| Mac Studio 256–512 GB | Największe modele otwarte (Qwen3 235B, gpt-oss 120B z zapasem) | Serwer AI dla domu lub małej firmy, bez chmury |
Rozmiary modeli: Gemma 3 4B 3,3 GB, 12B 8,1 GB, 27B 17 GB (Ollama); Qwen3 8B 5,2 GB, 14B 9,3 GB, 30B 19 GB, 235B 142 GB (Ollama); Llama 3.3 70B 43 GB (Ollama); gpt-oss 20B około 14 GB, „na komputery z 16 GB pamięci”, 120B około 65 GB (Ollama); Bielik 11B od 6,7 GB (Q4) do 22 GB (pełna precyzja) (Ollama). Jeśli dopiero kupujesz komputer i myślisz o AI: więcej pamięci jest ważniejsze niż szybszy procesor.
Instalacja krok po kroku
Mac
Wymagania: macOS Sonoma (14) lub nowszy; procesory Apple M z obsługą karty graficznej, Intel tylko na procesorze (dokumentacja).
- Pobierz
Wejdź na ollama.com/download/mac i pobierz plik. Otwórz go i przeciągnij ikonę Ollama do folderu Aplikacje.
- Uruchom
Otwórz Ollama z Aplikacji. Przy pierwszym uruchomieniu zapyta o zgodę na dodanie polecenia do terminala; zgódź się, przyda się później.
- Wybierz model
W oknie czatu jest lista modeli do wyboru; pierwsze użycie pobiera model (kilka GB, chwilę trwa). Na start wybierz Gemma 3 4B albo Qwen3 8B, jeśli masz 16 GB pamięci.
- Napisz pierwsze pytanie
Okno działa jak ChatGPT. Pliki PDF i tekstowe przeciągasz do okna; zdjęcia rozumieją modele oznaczone jako obsługujące obrazy (o aplikacji).
Windows
- Pobierz i zainstaluj
ollama.com/download/windows, uruchom instalator, kliknij dalej (dokumentacja).
- Karta graficzna
Jeśli masz kartę NVIDIA, miej aktualne sterowniki; Ollama sama ją wykryje. Bez karty działa na procesorze, wolniej.
- Wybierz model i pisz
Tak samo jak na Macu: okno czatu, lista modeli, przeciąganie plików.
Linux
Jedno polecenie w terminalu, z dokumentacji Ollama; przy kartach NVIDIA potrzebne są sterowniki CUDA, przy AMD ROCm w wersji 7:
curl -fsSL https://ollama.com/install.sh | sh
Pierwsze polecenia w terminalu
Aplikacja z oknem czatu wystarcza większości osób. Terminal daje więcej kontroli i jest potrzebny na Linuksie. Na Macu program „Terminal”, na Windows „PowerShell”; wklejasz polecenie i naciskasz Enter. Polecenia pochodzą z dokumentacji Ollama.
ollama run gemma3:4b
ollama run SpeakLeash/bielik-11b-v3.0-instruct:Q4_K_M
ollama run qwen3:8b
ollama list
ollama pull gemma3:12b
ollama ps
ollama rm gemma3:4b
/bye
Po „ollama run” pojawia się znak zachęty i piszesz jak w czacie. Pierwsze uruchomienie pobiera model; kolejne startują w sekundy. Model po pięciu minutach bezczynności jest zwalniany z pamięci i ładuje się ponownie przy następnym pytaniu (dokumentacja).
Który model na start
| Model | Producent | Rozmiary i pliki | Do czego |
|---|---|---|---|
| Gemma 3 | 270M, 1B, 4B (3,3 GB), 12B (8,1 GB), 27B (17 GB); czyta obrazy od 4B | Uniwersalny, dobry start; 4B na słabym sprzęcie, 12B i 27B na mocnym | |
| Qwen3 | Alibaba | Od 0,6B do 235B; 8B 5,2 GB, 14B 9,3 GB, 30B 19 GB | Bardzo dobry w wielu językach i w kodzie; szeroki wybór rozmiarów |
| Bielik 11B v3.0 | SpeakLeash i ACK Cyfronet AGH (Polska) | Warianty od 6,7 GB (Q4) do 22 GB (pełna precyzja); 32 języki europejskie, zoptymalizowany pod polski; Apache 2.0 | Polskie teksty, pisma, tłumaczenia z polskiego i na polski |
| gpt-oss | OpenAI | 20B (około 14 GB, na komputery z 16 GB), 120B (około 65 GB); Apache 2.0 | Rozumowanie i zadania wieloetapowe; 20B to dobry wybór na Maca z 32 GB |
| Llama 3.3 | Meta | 70B (43 GB) | Dla mocnych komputerów; jakość zbliżona do dużych modeli |
| DeepSeek-R1 | DeepSeek | Kilka rozmiarów, w tym 8B | Modele „rozumujące”, pokazują tok myślenia; lokalnie bez wysyłania danych do Chin |
| Mistral 7B | Mistral AI (Francja) | 7B | Klasyczny, lekki, szybki |
Źródła rozmiarów: strony modeli w bibliotece Ollama podlinkowane wyżej i w tabeli źródeł. Nazwy z dwukropkiem (gemma3:12b) to konkretne warianty; bez dwukropka Ollama bierze domyślny. Wariant Q4 to model skompresowany czterokrotnie: mniejszy i szybszy, nieco mniej dokładny; strona Bielika ostrzega, że modele skompresowane „wykazują obniżoną jakość odpowiedzi i możliwe halucynacje”. Do codziennych zadań Q4 wystarcza; do pracy wymagającej precyzji weź Q6 albo Q8, jeśli masz pamięć.
Prompty do wypróbowania lokalnie
Model lokalny nie ma internetu, więc pytaj o rzeczy, które ma „w sobie” albo w załączonym pliku. Cztery elementy dobrego promptu (rola, kontekst, zadanie, format) z przewodnika po ChatGPT działają tu tak samo, a nawet ważniej, bo mniejszy model gorzej zgaduje, o co Ci chodzi.
Napisz uprzejme pismo do wspólnoty mieszkaniowej z prośbą o naprawę oświetlenia na klatce schodowej, które nie działa od dwóch tygodni. Pół strony, oficjalny ton, z miejscem na moje dane i datę.
Streść załączony dokument po polsku w pięciu punktach. Osobno wypisz daty, kwoty i moje obowiązki. Nie dodawaj niczego, czego nie ma w dokumencie; jeśli czegoś nie ma, napisz to.
Przetłumacz poniższy e-mail z angielskiego na polski, zachowując ton i podział na akapity. Zwroty urzędowe zostaw po angielsku w nawiasie.
[wklej tekst]
Jaka jest dzisiejsza data i jakie są dziś najważniejsze wiadomości z Polski? Jeśli nie masz dostępu do internetu ani do dzisiejszej daty, napisz to wprost zamiast zgadywać.
Jesteś nauczycielem angielskiego. Naucz mnie pięciu zdań przydatnych u lekarza: zdanie, wymowa zapisana po polsku, tłumaczenie. Potem zadaj mi jedno ćwiczenie i poczekaj na odpowiedź.
Odpowiedź na prompt 4 mówi dużo o modelu: dobry napisze, że nie zna daty ani wiadomości. Słaby wymyśli. Wymyślanie to ta sama wada, co w chmurze, tylko częstsza przy małych modelach; ważne fakty sprawdzasz.
Ustawienia, które warto znać
Długość kontekstu – ile tekstu model widzi naraz. Domyślnie Ollama ustawia 4096 tokenów, czyli kilka stron; przy długich dokumentach trzeba to zwiększyć w ustawieniach aplikacji albo zmienną OLLAMA_CONTEXT_LENGTH, kosztem większego zużycia pamięci (dokumentacja). Jeśli model „nie widzi” końca załączonego pliku, to jest przyczyna.
Gdzie są modele – na Macu w folderze ~/.ollama/models, na Windows w C:\Users\nazwa\.ollama\models; można to zmienić zmienną OLLAMA_MODELS, np. na dysk zewnętrzny (dokumentacja). Modele zajmują od kilku do kilkudziesięciu GB każdy; co jakiś czas usuń nieużywane.
Dostęp z innych urządzeń w domu – domyślnie Ollama słucha tylko na własnym komputerze. Ustawienie OLLAMA_HOST na 0.0.0.0:11434 udostępnia ją w sieci domowej, np. laptopowi albo telefonowi przez aplikację czatu (dokumentacja). Nie udostępniaj jej do internetu; nie ma hasła.
Modele w chmurze Ollamy – Ollama oferuje też uruchamianie dużych modeli na swoich serwerach: plan darmowy z kredytami, Pro za 20 USD i Max za 100 USD miesięcznie, z deklaracją braku logowania, braku trenowania i zerowego przechowywania danych (strona Ollama Cloud). To wygodne, ale to już nie jest „lokalnie”; jeśli chcesz mieć pewność, że nic nie wychodzi, ustaw OLLAMA_NO_CLOUD=1 (dokumentacja).
Inne programy do modeli lokalnych
- Open WebUI – interfejs czatu w przeglądarce, który łączy się z Ollamą; wygląda jak ChatGPT, ma użytkowników, historię, pracę z dokumentami; dobry, gdy Ollama stoi na jednym komputerze, a korzysta cała rodzina (projekt).
- LM Studio – alternatywa dla Ollamy z rozbudowanym oknem, wyborem modeli z katalogu i ustawieniami sprzętu; dla osób, które wolą klikać niż pisać polecenia (strona).
- llama.cpp – silnik, na którym opiera się Ollama i wiele innych programów; dla zaawansowanych (projekt).
Bezpieczeństwo i prywatność
- Nie udostępniaj Ollamy do internetu. Nie ma hasła; każdy, kto trafi na adres, może z niej korzystać i czytać, co jej wysyłasz. W sieci domowej tak, publicznie nie.
- Pobieraj modele z biblioteki Ollama albo od znanych producentów. Model to plik; plik od nieznanego autora może być gorszy, niż obiecuje, albo celowo zmanipulowany.
- Licencje. Bielik i gpt-oss są na Apache 2.0, można ich używać także komercyjnie; Llama i Gemma mają własne licencje z warunkami. Jeśli budujesz coś dla firmy, przeczytaj licencję modelu.
- Halucynacje są takie same jak w chmurze, tylko częstsze. Mały model pewnym tonem wymyśli datę albo przepis. Sprawdzasz.
- Prąd i ciepło. Duży model na laptopie grzeje i zużywa baterię; przy dłuższej pracy podłącz zasilanie.
Najczęstsze błędy początkujących
- Za duży model na za mały komputer. Model, który nie mieści się w pamięci, działa kilkadziesiąt razy wolniej albo wcale. Zacznij od 4B, potem zwiększaj.
- Oczekiwanie wiedzy o dzisiejszych wydarzeniach. Model lokalny nie ma internetu. Do wiadomości jest Perplexity.
- Za krótki kontekst przy długim pliku. Zwiększ długość kontekstu w ustawieniach.
- Dysk pełen modeli. Każdy „ollama run nowość” to kolejne gigabajty; usuwaj nieużywane.
- Mac z 8 GB „do AI”. Uruchomi tylko najmniejsze modele. Przy zakupie pod AI wybieraj 32 GB i więcej.
- Prompt jak do ChatGPT. Mniejszy model potrzebuje więcej kontekstu i jaśniejszego formatu; im mniejszy model, tym lepszy musi być prompt.
- Otwarcie portu do internetu „żeby mieć dostęp z pracy”. Zamiast tego VPN do domu.
Najczęściej zadawane pytania
Czy Ollama jest naprawdę darmowa?
Tak, program i modele otwarte są bezpłatne. Płatna jest tylko opcjonalna chmura Ollamy. Kosztem jest sprzęt i prąd.
Czy to działa bez internetu?
Tak, po pobraniu modelu. Internet jest potrzebny tylko do pobrania programu i modeli.
Czy modele lokalne mówią po polsku?
Większe modele (Gemma 3 12B i 27B, Qwen3 od 8B, gpt-oss, Llama 3.3) tak, choć z gorszą polszczyzną niż chmura. Bielik jest do polskiego stworzony i przy podobnym rozmiarze pisze po polsku najlepiej.
Mam laptopa PC z 16 GB RAM i bez karty graficznej. Czy warto?
Do spróbowania tak: modele 4B do 8B ruszą na procesorze, powoli, ale ruszą. Do codziennej pracy potrzebna jest karta graficzna albo Mac z pamięcią wspólną.
Mac czy PC do AI w domu?
Jeśli chcesz uruchamiać duże modele (30B i więcej) w jednym, cichym komputerze, Mac z 64 GB lub więcej. Jeśli głównie małe i średnie modele i zależy Ci na szybkości oraz grach, PC z kartą NVIDIA 16–32 GB. Jeśli budżet jest ważny, a chcesz dużo pamięci, komputer z AMD Ryzen AI Max+.
Czy mogę używać Ollamy z ChatGPT albo Claude?
To osobne programy. Możesz mieć oba: chmurę do trudnych zadań i aktualności, Ollamę do poufnych dokumentów. Programiści łączą Ollamę z narzędziami do kodu, w tym z Claude Code, ale to temat zaawansowany.
Czy Bielik to to samo co ChatGPT po polsku?
Nie. To mniejszy, otwarty model wytrenowany z myślą o polskim, który działa u Ciebie. Zna polski bardzo dobrze, ale ma mniej wiedzy ogólnej niż największe modele chmurowe i nie ma internetu.
Podsumowanie fact-check
- Na pewno prawda: Ollama jest bezpłatna, działa na Macu, Windows i Linuksie, uruchamia modele lokalnie i według producenta nie widzi promptów; obsługuje karty NVIDIA, AMD, układy Apple przez Metal i procesor jako zapas; domyślny kontekst to 4096 tokenów; Bielik 11B jest na licencji Apache 2.0 i dostępny w bibliotece Ollama; MacBook Pro z M5 Max ma do 128 GB pamięci wspólnej, Mac Studio do 512 GB; RTX 5090 ma 32 GB. Wszystko z linkami do dokumentacji producentów.
- Prawdopodobnie prawda na dzień weryfikacji: rozmiary plików modeli i lista wariantów w bibliotece; ceny chmury Ollamy (Pro 20, Max 100 USD). Zmieniają się z każdą wersją.
- Co jest niepewne: dokładna szybkość pisania na konkretnym komputerze; reguła „przepustowość przez rozmiar modelu” jest przybliżeniem górnej granicy, a rzeczywistość zależy od modelu, wersji programu i sterowników.
- Częsty mit: „lokalny model to ChatGPT bez abonamentu”. To mniejszy, prywatny asystent bez internetu; do wielu rzeczy wystarczy, do najtrudniejszych nie.
Komentarze (0)
Brak komentarzy. Bądź pierwszy!