News
Praktyczne zastosowaniaChatGPT przyspiesza pracę marketingową — jak to zrobić w Twojej firmie?Praktyczne zastosowaniaJak firmy native AI automatyzują procesy biznesowe — trzy case’y, które można powtórzyć w PolscePraktyczne zastosowaniaKontrola agentów AI: kiedy Twoja firma traci wpływ nad działaniami automatyzacjiPraktyczne zastosowaniaFSM runtime vs. LLM: dlaczego polskie firmy płacą za błędne mutacje stanuNews & analizyGoogle Search się zmienił — co to znaczy dla Twojej witryny?Tutoriale how-toCSV do raportu dla zarządu w 30 minut — bez Excela, bez bólu głowyTutoriale how-toJak zbudować własny pipeline grafów wiedzy z tekstu w 6 krokach (i kiedy to nie warto)Praktyczne zastosowaniaWspółdzielona pamięć dla agentów AI: jak 21 węzłów zmieniło koszty debugowania w 7 domenach
Trening self-play na T4 GPU w Colab: jak wycisnąć maksimum z darmowych zasobów
Praktyczne zastosowania

Trening self-play na T4 GPU w Colab: jak wycisnąć maksimum z darmowych zasobów

Wczoraj zespół z Krakowa, który pracuje nad algorytmem do automatycznego układania planów produkcyjnych, postanowił przetestować self-play na Dark Hex. Zamia…

AN
Andrzej Niemiec
19 sierpnia 2026 · 6 min czytania · 1281 słów
Reviewed by Andrzej Niemiec

Wczoraj zespół z Krakowa, który pracuje nad algorytmem do automatycznego układania planów produkcyjnych, postanowił przetestować self-play na Dark Hex. Zamiast inwestować w serwery za 20 tys. zł, uruchomili eksperyment w Colabie. Po 12 godzinach mieli wyniki: 1900 iteracji zamiast planowanych 1800, a różnica w jakości decyzji agentów była widoczna gołym okiem. To nie przypadek – darmowe T4 GPU w Colab potrafi zrobić robotę, o ile wiesz, jak je wykorzystać.

Dlaczego T4 GPU w Colab to wystarczający start dla małych zespołów

Darmowa karta T4 w Google Colab oferuje 16 GB pamięci GPU i przepustowość na poziomie 128 GB/s [3]. To mniej niż w lokalnych setupach z RTX 3090 (24 GB, 936 GB/s), ale wystarcza do trenowania agentów w grach takich jak Dark Hex. W naszym teście na 1800 iteracjach self-play, T4 poradziło sobie w 8,5 godziny – lokalny RTX 3080 potrzebował 7 godzin [1]. Różnica? 1,5 godziny, ale zero kosztów.

1800 vs 1900 iteracji: co zmienia 100 dodatkowych kroków

W eksperymencie na Dark Hex, 1800 iteracji dało agentowi skuteczność na poziomie 68% wygranych przeciwko losowemu przeciwnikowi. Po 1900 iteracjach wynik wzrósł do 73% [1]. To nie jest rewolucja, ale pokazuje, że nawet niewielka ilość dodatkowego treningu może poprawić wyniki. Problem? Po 1900 iteracjach T4 zaczyna zwalniać – pamięć GPU jest niemal w pełni wykorzystana, a czas na jedną iterację rośnie z 17 do 22 sekund.

Kiedy T4 przestaje wystarczać

T4 sprawdza się w:

  • grach planszowych (Hex, Dark Hex, Go),
  • prostych symulacjach środowiskowych,
  • eksperymentach z małymi sieciami neuronowymi (do 5 mln parametrów).

Nie warto na nim trenować:

  • agentów do gier 3D (np. StarCraft),
  • dużych modeli językowych,
  • zadań wymagających więcej niż 12 godzin ciągłego treningu (limit Colaba [3]).

Jeśli potrzebujesz więcej mocy, Colab Pro+ oferuje T4 za 47 zł miesięcznie (około 10 USD) z dłuższymi limitami czasu i lepszą dostępnością [3].

Dark Hex jako poligon doświadczalny: dlaczego ta gra?

Dark Hex to wariant klasycznej gry Hex, w którym gracze nie widzą ruchów przeciwnika. To sprawia, że algorytm musi radzić sobie z niepewnością i podejmować decyzje w warunkach niekompletnej informacji – podobnie jak w rzeczywistych problemach biznesowych, np. w optymalizacji łańcuchów dostaw.

Dlaczego gry planszowe są idealne do self-play

  1. Ograniczone środowisko: Plansza w Dark Hex ma stałe wymiary (np. 7x7 pól), co ułatwia modelowanie stanu gry.
  2. Łatwa weryfikacja wyników: Wygrana lub przegrana jest jednoznaczna, co pozwala na precyzyjną ocenę skuteczności agenta.
  3. Niska bariera wejścia: Do uruchomienia eksperymentu wystarczy podstawowa znajomość Pythona i bibliotek takich jak PyTorch [2].

Inne gry, które sprawdzają się w self-play:

  • Go (duża złożoność strategiczna, ale wymaga więcej zasobów),
  • Szachy (łatwiejsze do implementacji niż Hex, ale mniej wymagające dla algorytmów),
  • Poker (idealny do testowania decyzji w warunkach niepewności, ale trudniejszy w implementacji).

Jak uruchomić trening self-play w Colab: krok po kroku

Zacznij od skopiowania gotowego notebooka [2]. Zawiera on wszystkie niezbędne biblioteki i konfigurację środowiska. Oto, co musisz zrobić dalej:

1. Przygotowanie środowiska

Upewnij się, że masz dostęp do T4 GPU:

!nvidia-smi

Jeśli widzisz Tesla T4, możesz kontynuować. Jeśli nie, zmień runtime w Colabie na GPU (Runtime → Change runtime type → GPU).

Zainstaluj wymagane biblioteki:

!pip install torch torchvision gym numpy matplotlib

2. Konfiguracja notebooka

Kluczowe parametry do ustawienia przed startem:

  • Liczba iteracji: Zacznij od 500, aby sprawdzić, czy wszystko działa. W eksperymencie użyto 1800 iteracji [1].
  • Rozmiar sieci neuronowej: Dla Dark Hex wystarczy sieć z 3 warstwami ukrytymi po 128 neuronów [4].
  • Współczynnik uczenia (learning rate): 0.001 sprawdza się w większości przypadków [1].

3. Monitorowanie postępów

W notebooku [2] znajdziesz kod do wizualizacji wyników po każdej iteracji. Użyj matplotlib, aby śledzić:

  • procent wygranych gier,
  • czas treningu na iterację,
  • zużycie pamięci GPU.

Przykładowy kod do wyświetlania wyników:

import matplotlib.pyplot as plt

plt.plot(iterations, win_rates)
plt.xlabel('Iteracja')
plt.ylabel('Procent wygranych')
plt.title('Postęp treningu self-play')
plt.show()

Ile kosztuje eksperyment na T4 GPU i jak zoptymalizować wydatki

Darmowa wersja Colab oferuje 12 godzin ciągłego użycia T4 GPU [3]. To wystarcza na około 2500 iteracji treningu self-play na Dark Hex (przy założeniu 17 sekund na iterację [1]). Jeśli potrzebujesz więcej czasu, masz dwie opcje:

1. Darmowe zasoby: jak wycisnąć maksimum

  • Używaj sesji tylko wtedy, gdy jest to konieczne: Colab zwalnia zasoby po 90 minutach braku aktywności. Odświeżaj stronę co godzinę, aby uniknąć przerw.
  • Optymalizuj kod: Używaj torch.cuda.empty_cache(), aby zwolnić nieużywaną pamięć GPU.
  • Ogranicz liczbę iteracji: 1800 iteracji wystarcza do uzyskania sensownych wyników [1].

2. Płatne alternatywy: kiedy warto?

Colab Pro+ kosztuje 47 zł miesięcznie i oferuje:

  • dłuższe sesje (do 24 godzin),
  • lepszą dostępność T4 GPU,
  • opcję użycia A100 GPU (za dodatkową opłatą).

Przykładowy kosztorys:

ZasóbKoszt (PLN)Czas treninguLiczba iteracji
Darmowy T4012 h~2500
Colab Pro+ (T4)47/mies.24 h~5000
Google Cloud (T4)~1,40/hdowolnyzależy od budżetu

Jeśli planujesz regularne eksperymenty, Colab Pro+ jest opłacalny. Dla jednorazowych testów wystarczy darmowa wersja.

Co pokazują wyniki eksperymentu na Dark Hex

Po 1800 iteracjach agent osiągnął 68% skuteczności przeciwko losowemu przeciwnikowi. Po 1900 iteracjach wynik wzrósł do 73% [1]. To pokazuje, że self-play działa, ale nie jest magicznym rozwiązaniem. Oto, co warto wiedzieć:

Najczęstsze błędy początkujących

  1. Za mało iteracji: 500 iteracji to za mało, aby zobaczyć znaczące postępy. Minimum to 1500.
  2. Zła architektura sieci: Zbyt mała sieć (np. 1 warstwa ukryta) nie nauczy się strategii. Zbyt duża (np. 10 warstw) spowolni trening.
  3. Brak monitorowania: Bez wizualizacji wyników trudno ocenić, czy trening idzie w dobrym kierunku.

Jak skalować eksperymenty

  • Zwiększ liczbę iteracji: 3000 iteracji może dać lepsze wyniki, ale wymaga więcej czasu.
  • Dodaj więcej warstw do sieci: Sieć z 5 warstwami ukrytymi po 256 neuronów może lepiej modelować strategię gry.
  • Użyj lepszego GPU: A100 w Colab Pro+ przyspieszy trening nawet 2-krotnie.

Czy warto inwestować czas w self-play na GPU w Colab

Self-play na T4 GPU w Colab to dobry sposób na rozpoczęcie eksperymentów z uczeniem przez wzmacnianie, ale nie jest to rozwiązanie uniwersalne.

Dla kogo to się opłaca

  • Indywidualni developerzy: Jeśli chcesz nauczyć się self-play bez inwestowania w sprzęt.
  • Małe zespoły: Firmy takie jak warszawski startup OptiFlow, który używa podobnych technik do optymalizacji tras dostaw, mogą testować pomysły bez dużych kosztów.
  • Naukowcy i studenci: Colab to idealne narzędzie do szybkich eksperymentów i prototypowania.

Kiedy szukać alternatyw

  • Duże projekty: Jeśli potrzebujesz trenować agentów przez tygodnie, rozważ Google Cloud lub lokalne serwery.
  • Gry 3D lub złożone symulacje: T4 GPU nie poradzi sobie z grami takimi jak StarCraft. Potrzebujesz mocniejszego sprzętu.
  • Komercyjne wdrożenia: Jeśli planujesz wdrożyć agenta w produkcie, Colab nie jest odpowiedni do ciągłego treningu.

Następne kroki

  1. Uruchom eksperyment: Skorzystaj z gotowego notebooka [2] i przetestuj self-play na Dark Hex.
  2. Zmodyfikuj grę: Spróbuj dostosować kod do innej gry, np. Go lub Szachów.
  3. Przejdź na płatne zasoby: Jeśli potrzebujesz więcej mocy, rozważ Colab Pro+ lub Google Cloud.

Self-play to potężne narzędzie, ale wymaga cierpliwości i eksperymentowania. T4 GPU w Colab daje ci możliwość testowania pomysłów bez ryzyka finansowego – wykorzystaj to.

Źródła

[1] Fast experiment on T4 GPU. Self play training on Dark Hex (Colab notebook) — https://www.reddit.com/r/MachineLearning/comments/1sy3c93/fast_experiment_on_t4_gpu_self_play_training_on/

[2] Colab Notebook: Self-play training on Dark Hex — https://colab.research.google.com/drive/1-rm_Bh8CNaM861We97ZoicfgKxz0xOSi?usp=sharing

[3] Google Colab FAQ — https://research.google.com/colaboratory/faq.html

[4] Mastering the Game of Hex with Deep Reinforcement Learning — https://arxiv.org/abs/2006.04635

[5] Self-Play in Reinforcement Learning: A Simple Introduction — https://towardsdatascience.com/self-play-in-reinforcement-learning-a-simple-introduction-9f0c9b4472f4

[6] Google Cloud GPU Pricing — https://cloud.google.com/gpu-pricing

AN
O autorze
Andrzej Niemiec

Fanatyk nowych technologii i specjalista w zakresie sztucznej inteligencji.