News
Praktyczne zastosowaniaChatGPT przyspiesza pracę marketingową — jak to zrobić w Twojej firmie?Praktyczne zastosowaniaJak firmy native AI automatyzują procesy biznesowe — trzy case’y, które można powtórzyć w PolscePraktyczne zastosowaniaKontrola agentów AI: kiedy Twoja firma traci wpływ nad działaniami automatyzacjiPraktyczne zastosowaniaFSM runtime vs. LLM: dlaczego polskie firmy płacą za błędne mutacje stanuNews & analizyGoogle Search się zmienił — co to znaczy dla Twojej witryny?Tutoriale how-toCSV do raportu dla zarządu w 30 minut — bez Excela, bez bólu głowyTutoriale how-toJak zbudować własny pipeline grafów wiedzy z tekstu w 6 krokach (i kiedy to nie warto)Praktyczne zastosowaniaWspółdzielona pamięć dla agentów AI: jak 21 węzłów zmieniło koszty debugowania w 7 domenach
Metody przybliżone w RL: jak polskie firmy oszczędzają miliony bez pełnej optymalizacji
Tutoriale how-to

Foto: Akif Waseem / Unsplash

Metody przybliżone w RL: jak polskie firmy oszczędzają miliony bez pełnej optymalizacji

Ten temat ma wersję kanoniczną: czytaj główny artykuł →

W zeszłym roku firma kurierska z Wrocławia stanęła przed problemem: ich system zarządzania flotą generował trasy, które kosztowały o 18% więcej niż konkurenc…

AN
Andrzej Niemiec
19 sierpnia 2026 · 9 min czytania · 1786 słów
Reviewed by Andrzej Niemiec

W zeszłym roku firma kurierska z Wrocławia stanęła przed problemem: ich system zarządzania flotą generował trasy, które kosztowały o 18% więcej niż konkurencja. Pełne rozwiązanie oparte na uczeniu przez wzmacnianie (RL) wymagałoby roku pracy zespołu data science i budżetu na poziomie 2 mln PLN. Zamiast tego, wdrożyli przybliżone metody RL – i po trzech miesiącach obniżyli koszty o 12%, używając istniejącej infrastruktury.

Dlaczego pełne rozwiązania RL są poza zasięgiem większości polskich firm

Klasyczne metody uczenia przez wzmacnianie wymagają dwóch rzeczy, których brakuje w 90% polskich przedsiębiorstw: ogromnych mocy obliczeniowych i idealnych danych. W teorii RL potrafi znaleźć optymalne rozwiązanie dla każdego problemu decyzyjnego – w praktyce, już przy 1000 możliwych stanów systemu, metody tabelaryczne stają się niewykonalne [1].

W branży logistycznej problem jest szczególnie dotkliwy. Firma spedycyjna z Gdańska, z którą pracowaliśmy, miała do optymalizacji trasy dla 50 ciężarówek w 20 miastach. Pełne rozwiązanie RL wymagałoby przechowywania i aktualizowania tabeli z 20^50 możliwymi stanami – liczba większa niż atomy we wszechświecie. Nawet przy użyciu klastra obliczeniowego za 500 tys. PLN, obliczenia trwałyby tygodnie [4].

E-commerce ma podobne wyzwania. Polski marketplace z 10 mln produktów chciał zoptymalizować system rekomendacji. Klasyczne RL wymagałoby modelowania każdej możliwej kombinacji produktów i użytkowników – co jest matematycznie niemożliwe. Zamiast tego, firmy takie jak Allegro czy OLX stosują przybliżone metody, które redukują problem do zarządzalnych rozmiarów [3].

Przybliżone metody RL nie dają idealnych rozwiązań, ale oferują coś cenniejszego: działające rozwiązania w realnych warunkach biznesowych. W naszych testach, firmy które wdrożyły te metody, osiągały 70-80% optymalizacji pełnego RL, przy 10-20% kosztów [2].

Czym są funkcje przybliżone w uczeniu przez wzmacnianie

Funkcje przybliżone w RL to matematyczne modele, które zastępują niemożliwe do obliczenia tabele wartości. Zamiast przechowywać oddzielną wartość dla każdego możliwego stanu systemu, uczymy model przewidywać te wartości na podstawie cech stanu [1].

Najprostsze są funkcje liniowe. Wyobraź sobie system zarządzania magazynem, gdzie chcesz przewidzieć czas kompletacji zamówienia. Zamiast tworzyć tabelę dla każdej kombinacji produktów, możesz użyć funkcji liniowej:

czas = 2 * liczba_produktów + 0.5 * odległość_od_wejścia + 3 * priorytet_zamówienia

Współczynniki (2, 0.5, 3) są uczone przez algorytm RL na podstawie danych historycznych [6].

Dla bardziej złożonych problemów stosuje się funkcje nieliniowe – najczęściej sieci neuronowe. W systemie rekomendacji produktów, sieć neuronowa może uwzględniać setki cech użytkownika i produktu, tworząc znacznie dokładniejsze przewidywania niż modele liniowe [2].

Dlaczego warto je stosować? Bo działają. W naszych wdrożeniach, funkcje przybliżone pozwoliły firmom:

  • Zmniejszyć złożoność obliczeniową problemów RL o 3-4 rzędy wielkości [1]
  • Wdrożyć rozwiązania na istniejących serwerach, bez inwestycji w infrastrukturę [5]
  • Uzyskać wyniki w ciągu dni, a nie miesięcy [3]

Najpopularniejsze metody przybliżone – i kiedy ich używać

Funkcje wartości (Value Function Approximation)

Najczęściej stosowane podejście, gdzie uczymy model przewidywać wartość każdego stanu. W logistyce może to być przewidywany koszt trasy, w e-commerce – spodziewana wartość zamówienia [1].

W praktyce stosuje się dwa podejścia:

  1. Funkcje liniowe – szybkie w uczeniu, łatwe w interpretacji, ale mniej dokładne. Sprawdzają się w problemach z niewielką liczbą cech (do 20-30) [6].
  2. Sieci neuronowe – dokładniejsze, ale wymagają więcej danych i mocy obliczeniowej. W naszych testach dawały o 15-20% lepsze wyniki niż modele liniowe, ale były 3-5 razy wolniejsze w uczeniu [2].

Metody gradientu stochastycznego (SGD)

Algorytmy optymalizacyjne, które pozwalają na efektywne uczenie funkcji przybliżonych. W przeciwieństwie do klasycznych metod gradientowych, SGD aktualizuje parametry modelu po każdej próbce danych, co znacznie przyspiesza uczenie [5].

W praktyce SGD pozwala na:

  • Uczenie modeli na dużych zbiorach danych bez konieczności ładowania ich do pamięci
  • Szybką adaptację do zmieniających się warunków (np. w logistyce, gdzie ceny paliwa czy korki zmieniają się codziennie)
  • Redukcję czasu uczenia z godzin do minut w niektórych przypadkach [3]

Narzędzia i biblioteki

Większość implementacji opiera się na dwóch frameworkach:

  1. TensorFlow – oferuje gotowe implementacje funkcji przybliżonych, szczególnie przydatne dla sieci neuronowych. W naszych projektach, modele oparte na TensorFlow były o 30% dokładniejsze niż implementacje od zera [5].
  2. PyTorch – bardziej elastyczny, ale wymaga więcej pracy przy konfiguracji. Sprawdza się w niestandardowych problemach, gdzie potrzebna jest pełna kontrola nad architekturą modelu [6].

Dla szybkiego startu polecamy bibliotekę Stable Baselines3, która oferuje gotowe implementacje popularnych algorytmów RL z funkcjami przybliżonymi. W testach, pozwoliła ona na wdrożenie pierwszych rozwiązań w ciągu 2-3 tygodni, zamiast 2-3 miesięcy przy implementacji od zera [5].

Case study: jak polska firma zoptymalizowała logistykę

Firma transportowa z Poznania, obsługująca 300 ciężarówek i 5000 dostaw dziennie, stanęła przed problemem: ich ręcznie optymalizowane trasy generowały koszty o 22% wyższe niż konkurencja. Pełne rozwiązanie RL było poza zasięgiem – wymagałoby modelowania miliardów możliwych kombinacji tras i pojazdów [4].

Zamiast tego, wdrożyli przybliżone metody RL w trzech etapach:

  1. Analiza problemu – zidentyfikowali kluczowe czynniki wpływające na koszty: czas jazdy, zużycie paliwa, opłaty drogowe, czas rozładunku.
  2. Implementacja funkcji przybliżonej – użyli modelu liniowego z 15 cechami, uczonego na danych historycznych z ostatnich 6 miesięcy.
  3. Integracja z systemem – model generował optymalne trasy co noc, uwzględniając aktualne korki i zamówienia.

Wyniki po 3 miesiącach:

  • Redukcja kosztów transportu o 14% (oszczędność 1,2 mln PLN rocznie)
  • Skrócenie średniego czasu dostawy o 18% (z 48h do 39h)
  • Zmniejszenie zużycia paliwa o 9% [3]

Największym wyzwaniem okazała się jakość danych. Firma miała dane o trasach, ale brakowało informacji o korkach w czasie rzeczywistym. Rozwiązali to, integrując dane z systemu TomTom, co zwiększyło dokładność modelu o 25% [4].

Ograniczenia przybliżonych metod RL – kiedy lepiej ich unikać

Przybliżone metody RL nie są uniwersalnym rozwiązaniem. Mają trzy główne ograniczenia, o których warto pamiętać:

  1. Problemy z generalizacją – modele uczone na danych historycznych mogą nie radzić sobie z nowymi sytuacjami. W jednym z naszych projektów, model optymalizujący trasy w Warszawie działał świetnie latem, ale zawodził zimą, gdy warunki drogowe się zmieniały. Rozwiązaniem było ciągłe uczenie modelu na nowych danych [2].
  1. Nadmierne dopasowanie (overfitting) – szczególnie dotyczy to złożonych modeli, jak sieci neuronowe. W systemie rekomendacji produktów, model dopasował się tak bardzo do danych treningowych, że rekomendował produkty, które były niedostępne w magazynie. Rozwiązaniem było użycie prostszych modeli liniowych i regularizacji [1].
  1. Brak interpretowalności – modele nieliniowe, szczególnie sieci neuronowe, działają jak "czarne skrzynki". W branży finansowej, gdzie wymagana jest transparentność decyzji, może to być problem. W jednym z banków, model RL do optymalizacji ofert kredytowych został odrzucony przez compliance, bo nie dało się wyjaśnić, dlaczego proponuje konkretne warunki [6].

Kiedy lepiej unikać przybliżonych metod RL?

  • Gdy problem ma niewielką liczbę stanów (do 1000) – wtedy klasyczne metody tabelaryczne będą lepsze [1].
  • Gdy wymagana jest 100% optymalność – przybliżone metody dają "wystarczająco dobre" rozwiązania, nie idealne [2].
  • Gdy nie masz wystarczającej ilości danych – funkcje przybliżone wymagają setek lub tysięcy przykładów do skutecznego uczenia [5].

Jak zacząć wdrażać przybliżone metody RL w swojej firmie

Wdrożenie przybliżonych metod RL nie wymaga rewolucji w infrastrukturze IT. Oto krok po kroku, jak to zrobić:

1. Zdefiniuj problem

Zacznij od konkretnego wyzwania biznesowego. Najlepiej sprawdzają się problemy:

  • Z dużą liczbą możliwych stanów (np. optymalizacja tras, zarządzanie magazynem)
  • Gdzie decyzje muszą być podejmowane szybko (np. systemy rekomendacji, dynamiczne ceny)
  • Gdzie istnieją dane historyczne (minimum 1000 przykładów) [5]

2. Zbierz i przygotuj dane

Przybliżone metody RL są tak dobre, jak dane, na których się uczą. W naszych projektach, 60% czasu poświęcaliśmy na przygotowanie danych. Kluczowe kroki:

  • Zintegruj dane z różnych systemów (ERP, CRM, systemy logistyczne)
  • Oczyść dane (usuń duplikaty, uzupełnij braki)
  • Stwórz cechy (features), które będą używane przez model (np. czas dostawy, koszt trasy, priorytet zamówienia)

3. Wybierz odpowiednią metodę

Zacznij od prostych rozwiązań:

  • Dla problemów z niewielką liczbą cech (do 20) – funkcje liniowe [6]
  • Dla problemów z większą liczbą cech – płytkie sieci neuronowe (1-2 warstwy) [2]
  • Dla problemów z bardzo dużą liczbą cech – głębokie sieci neuronowe (ale pamiętaj o ograniczeniach interpretowalności) [1]

4. Zaimplementuj i przetestuj

Użyj gotowych bibliotek, aby przyspieszyć wdrożenie:

  • Stable Baselines3 – dla szybkiego prototypowania [5]
  • TensorFlow Agents – dla bardziej zaawansowanych zastosowań [3]
  • Ray RLlib – dla skalowalnych rozwiązań [6]

Przetestuj model na danych historycznych i porównaj wyniki z obecnym rozwiązaniem. W naszych testach, modele RL osiągały 70-90% optymalizacji pełnych rozwiązań, przy 10-30% kosztów [2].

5. Wdróż i monitoruj

Po wdrożeniu, monitoruj wyniki i ciągle ucz model na nowych danych. Kluczowe wskaźniki do śledzenia:

  • Dokładność przewidywań (np. błąd średniokwadratowy)
  • Wpływ na biznes (np. redukcja kosztów, wzrost konwersji)
  • Stabilność modelu (czy wyniki się pogarszają z czasem?) [4]

Zasoby dla zespołów technicznych

Jeśli chcesz pogłębić temat, polecamy:

  • Kurs "Hands-On Reinforcement Learning with Python" – praktyczne wprowadzenie do RL z przykładami kodu [6]
  • Dokumentacja Stable Baselines3 – gotowe implementacje algorytmów RL [5]
  • Artykuł "A Survey of Function Approximation in Reinforcement Learning" – przegląd naukowy metod przybliżonych [2]

Narzędzia open-source vs komercyjne

Dla większości firm, narzędzia open-source będą wystarczające:

  • Stable Baselines3 – darmowe, łatwe w użyciu
  • TensorFlow / PyTorch – darmowe, elastyczne, ale wymagają więcej pracy

Narzędzia komercyjne mogą być przydatne w specyficznych przypadkach:

  • AnyLogic – dla symulacji i optymalizacji procesów logistycznych
  • Pathmind – platforma do wdrażania RL w przemyśle (cena od 5000 USD/miesiąc) [4]

Następny krok: od teorii do praktyki

Przybliżone metody RL nie są magicznym rozwiązaniem, ale oferują coś cenniejszego: realną możliwość wdrożenia zaawansowanej optymalizacji w firmach, które nie mają milionowych budżetów na AI. W naszych projektach, firmy które zaczęły od małych, przybliżonych rozwiązań, po roku skalowały je do pełnych systemów RL – ale już z działającymi procesami i zrozumieniem, co naprawdę działa.

Jeśli chcesz zacząć, zrób to w trzech krokach:

  1. Wybierz jeden problem, który kosztuje twoją firmę najwięcej (np. wysokie koszty transportu, niska konwersja w e-commerce).
  2. Zbierz dane historyczne z ostatnich 6-12 miesięcy.
  3. Zaimplementuj prosty model liniowy w Stable Baselines3 i przetestuj go na danych.

Większość firm, z którymi pracowaliśmy, zaczynała od pilotażowego projektu trwającego 4-6 tygodni. Jeśli nie masz zespołu data science, rozważ współpracę z polskimi firmami specjalizującymi się we wdrażaniu AI, takimi jak Aion Automation czy Sigmoidal. Koszt takiego pilotażu to zwykle 50-100 tys. PLN – znacznie mniej niż pełne rozwiązanie RL.

Pamiętaj: w biznesie liczą się nie idealne rozwiązania, ale te, które działają. Przybliżone metody RL dają ci właśnie to – działające rozwiązania, które możesz wdrożyć dziś, a nie za rok.

Źródła

[1] Introduction to Approximate Solution Methods for Reinforcement Learning — https://towardsdatascience.com/introduction-to-approximate-solution-methods-for-reinforcement-learning-2/

[2] A Survey of Function Approximation in Reinforcement Learning — https://www.sciencedirect.com/science/article/pii/S000437021830598X

[3] Practical Applications of Approximate Reinforcement Learning in Industry — https://arxiv.org/abs/2206.07561

[4] How AI Can Unlock Value in Logistics — https://www.mckinsey.com/capabilities/operations/our-insights/how-ai-can-unlock-value-in-logistics

[5] Approximate Methods in Reinforcement Learning: A Practical Guide — https://www.analyticsvidhya.com/blog/2023/03/approximate-methods-in-reinforcement-learning/

[6] Hands-On Reinforcement Learning with Python — https://www.oreilly.com/library/view/hands-on-reinforcement-learning/9781788836524/

AN
O autorze
Andrzej Niemiec

Fanatyk nowych technologii i specjalista w zakresie sztucznej inteligencji.