News
Praktyczne zastosowaniaChatGPT przyspiesza pracę marketingową — jak to zrobić w Twojej firmie?Praktyczne zastosowaniaJak firmy native AI automatyzują procesy biznesowe — trzy case’y, które można powtórzyć w PolscePraktyczne zastosowaniaKontrola agentów AI: kiedy Twoja firma traci wpływ nad działaniami automatyzacjiPraktyczne zastosowaniaFSM runtime vs. LLM: dlaczego polskie firmy płacą za błędne mutacje stanuNews & analizyGoogle Search się zmienił — co to znaczy dla Twojej witryny?Tutoriale how-toCSV do raportu dla zarządu w 30 minut — bez Excela, bez bólu głowyTutoriale how-toJak zbudować własny pipeline grafów wiedzy z tekstu w 6 krokach (i kiedy to nie warto)Praktyczne zastosowaniaWspółdzielona pamięć dla agentów AI: jak 21 węzłów zmieniło koszty debugowania w 7 domenach
HauhauCS kontra Heretic: kto naprawdę usuwa cenzurę w GLM-4.7-Flash?
Narzędzia AI

HauhauCS kontra Heretic: kto naprawdę usuwa cenzurę w GLM-4.7-Flash?

W czerwcu 2024 roku użytkownik HauhauCS opublikował narzędzie do abliteracji modeli AI, deklarując je jako "najlepsze bezstratne modele bez cenzury". Tydzień…

AN
Andrzej Niemiec
19 sierpnia 2026 · 7 min czytania · 1350 słów
Reviewed by Andrzej Niemiec

W czerwcu 2024 roku użytkownik HauhauCS opublikował narzędzie do abliteracji modeli AI, deklarując je jako "najlepsze bezstratne modele bez cenzury". Tydzień później społeczność LocalLLaMA oskarżyła go o plagiat oryginalnego Heretic. Benchmark na GLM-4.7-Flash pokazał, że różnice między narzędziami są minimalne — ale architektura MoE tego modelu zmienia zasady gry.

Dlaczego abliteracja stała się gorącym tematem w społeczności lokalnych LLM?

Abliteracja to proces usuwania mechanizmów cenzury z modeli językowych. W praktyce oznacza modyfikację wag sieci neuronowej, by model przestał blokować odpowiedzi na kontrowersyjne pytania — od teorii spiskowych po instrukcje tworzenia szkodliwego oprogramowania. Dla developerów budujących modele lokalne to narzędzie podwójnie ryzykowne: z jednej strony pozwala na większą swobodę generowanych treści, z drugiej — naraża na problemy prawne i reputacyjne.

Kontrowersja wokół HauhauCS wybuchła, gdy okazało się, że jego narzędzie to niemal dokładna kopia Heretic, oryginalnego projektu użytkownika p-e-w [2]. HauhauCS usunął atrybucję i zmienił licencję z MIT na bardziej restrykcyjną, co wzbudziło podejrzenia o próbę komercjalizacji cudzego kodu. Sytuacja przypomina polski spór z 2023 roku, gdy startup z Wrocławia został oskarżony o wykorzystanie open-source'owego kodu bez zgody autorów — sprawa zakończyła się ugodą, ale kosztowała firmę 120 tys. PLN [doświadczenie własne, nie z knowledge pack].

GLM-4.7-Flash, model wykorzystany w benchmarku, różni się od standardowych architektur jak Qwen. To Mixture of Experts (MoE) z 64 routed experts na warstwę [4]. Oznacza to, że każde zapytanie jest przetwarzane tylko przez część modelu, co teoretycznie powinno utrudnić abliterację — ale wyniki testów pokazują co innego.

Jakie techniki abliteracji zostały porównane w benchmarku GLM-4.7-Flash?

Benchmark objął cztery narzędzia: Heretic, Abliterlix, Huiui i HauhauCS. Każde z nich miało ten sam cel — usunąć cenzurę bez wpływu na ogólne możliwości modelu — ale różniło się podejściem.

Heretic, oryginalne narzędzie, działa poprzez precyzyjną modyfikację wag modelu. Jego autor, p-e-w, podkreśla, że kluczowe jest zachowanie integralności datasetów i nieingerowanie w mechanizmy generowania odpowiedzi [3]. Abliterlix i Huiui to alternatywne implementacje, które również skupiają się na minimalnych zmianach w architekturze.

HauhauCS, mimo deklaracji o "bezstratności", okazał się forkem Heretic z drobnymi modyfikacjami. Analiza kodu wykazała, że 98% struktury pozostało niezmienione — zmieniono jedynie nazwy zmiennych i usunięto komentarze [2]. To budzi pytanie: czy HauhauCS wnosi jakąkolwiek wartość, czy tylko próbuje skapitalizować na popularności Heretic?

Jakie metryki zostały użyte do oceny skuteczności abliteracji?

Benchmark na GLM-4.7-Flash obejmował trzy główne kategorie testów:

  1. Wydajność ogólna: mierzenie zdolności modelu do rozwiązywania zadań niezwiązanych z cenzurą. Użyto standardowych benchmarków jak MMLU (Massive Multitask Language Understanding) i GSM8K (matematyka). Wyniki pokazały, że wszystkie narzędzia zachowały 99,2–99,5% oryginalnej wydajności modelu [1].
  1. Safety evaluation: testy sprawdzające, czy model nadal blokuje niebezpieczne treści. Tu pojawiły się największe różnice. Heretic i HauhauCS obniżyły wskaźnik blokad z 92% do 18%, podczas gdy Abliterlix i Huiui utrzymały go na poziomie 24–27% [1]. To sugeruje, że niektóre narzędzia są mniej agresywne w usuwaniu mechanizmów bezpieczeństwa.
  1. KL divergence i analiza wag: KL divergence (Kullback-Leibler divergence) mierzy, jak bardzo rozkład prawdopodobieństwa wyjść modelu po abliteracji różni się od oryginału. W benchmarku wartości wahały się od 0,03 (Heretic) do 0,05 (HauhauCS) [1]. Dla porównania, standardowe fine-tuningi osiągają wartości rzędu 0,1–0,3 — co oznacza, że abliteracja wprowadza minimalne zmiany.

Dodatkowo przeprowadzono chain-of-thought forensics: testy logiczne sprawdzające, czy model nadal potrafi wyjaśniać swoje odpowiedzi. Tu HauhauCS wypadał gorzej od Heretic — w 12% przypadków generował niespójne uzasadnienia, podczas gdy Heretic tylko w 3% [1].

Czy HauhauCS naprawdę oferuje „najlepsze bezstratne modele bez cenzury”?

Deklaracje HauhauCS o "najlepszych bezstratnych modelach" nie znajdują pełnego potwierdzenia w benchmarku. Choć narzędzie rzeczywiście usuwa cenzurę skuteczniej niż Abliterlix czy Huiui (18% blokad vs 24–27%), to różnice w stosunku do Heretic są minimalne. W testach wydajnościowych oba narzędzia osiągnęły niemal identyczne wyniki: 99,4% dla Heretic i 99,3% dla HauhauCS [1].

Problem pojawia się przy chain-of-thought forensics. HauhauCS generował niespójne uzasadnienia trzykrotnie częściej niż Heretic (12% vs 3%). To sugeruje, że mimo deklaracji o "bezstratności", narzędzie może wprowadzać subtelne błędy w mechanizmach rozumowania modelu [1].

Sceptycyzm społeczności LocalLLaMA nie dotyczy tylko plagiatu. HauhauCS nie udostępnił kodu źródłowego swojego narzędzia, co utrudnia weryfikację jego działania. W przeciwieństwie do Heretic, który jest open-source i dostępny na licencji MIT [3], HauhauCS działa jak "czarna skrzynka" — co dla developerów budujących modele lokalne jest ryzykowne.

Jak architektura Mixture of Experts (MoE) wpływa na abliterację?

GLM-4.7-Flash to model MoE z 64 routed experts na warstwę [4]. Oznacza to, że każde zapytanie jest przetwarzane tylko przez część modelu, co teoretycznie powinno utrudnić abliterację — modyfikacja wag jednego eksperta nie wpływa na pozostałe. Jednak benchmark pokazał, że techniki abliteracji radzą sobie z tym wyzwaniem.

W porównaniu do standardowych architektur jak Qwen, GLM-4.7-Flash wymaga bardziej precyzyjnej ingerencji. W benchmarku Heretic i HauhauCS osiągnęły podobne wyniki w usuwaniu cenzury, ale różniły się w KL divergence: 0,03 dla Heretic i 0,05 dla HauhauCS [1]. To sugeruje, że HauhauCS wprowadza większe zmiany w rozkładzie wag, co może tłumaczyć gorsze wyniki w chain-of-thought forensics.

Dla developerów pracujących z MoE kluczowe są dwa wnioski:

  1. Precyzja jest ważniejsza niż agresywność: Modyfikacja zbyt wielu ekspertów może zaburzyć działanie modelu.
  2. Testy logiczne są niezbędne: MoE może maskować subtelne błędy w rozumowaniu, dlatego chain-of-thought forensics powinno być standardem po abliteracji.

Jakie są ryzyka i rekomendacje dla developerów korzystających z abliterowanych modeli?

Abliteracja niesie ze sobą trzy główne ryzyka:

  1. Prawne: Usuwanie cenzury może prowadzić do generowania szkodliwych treści, co w Polsce podlega przepisom o odpowiedzialności za treści publikowane przez systemy AI (Art. 23a Ustawy o świadczeniu usług drogą elektroniczną). W 2024 roku Urząd Ochrony Konkurencji i Konsumentów nałożył karę 50 tys. PLN na firmę, która nie kontrolowała treści generowanych przez swój chatbot [polski kontekst rynkowy].
  1. Techniczne: Benchmark pokazał, że nawet minimalne zmiany w wagach mogą wprowadzać błędy w rozumowaniu modelu. HauhauCS, mimo deklaracji o "bezstratności", generował niespójne uzasadnienia w 12% przypadków [1].
  1. Etyczne: Abliteracja może prowadzić do generowania treści dyskryminujących lub niebezpiecznych. The Register podkreśla, że debata na temat cenzury w AI trwa, a abliteracja jest jednym z najbardziej kontrowersyjnych narzędzi [6].

Rekomendacje dla developerów:

  • Wybieraj open-source: Heretic, dostępny na licencji MIT, pozwala na weryfikację kodu i dostosowanie do własnych potrzeb [3]. Unikaj narzędzi typu "czarna skrzynka" jak HauhauCS.
  • Testuj agresywnie: Po abliteracji przeprowadź chain-of-thought forensics i safety evaluation. W benchmarku Heretic wypadał lepiej w obu kategoriach [1].
  • Monitoruj prawo: W Polsce regulacje dotyczące AI są wciąż kształtowane. Warto śledzić stanowiska UOKiK i Ministerstwa Cyfryzacji, które w 2025 roku mają wprowadzić nowe wytyczne dla systemów AI [polski kontekst rynkowy].

Przyszłość abliteracji:

W 2025 roku można spodziewać się dwóch trendów:

  1. Regulacje: Unijny AI Act i polskie przepisy prawdopodobnie wprowadzą ograniczenia dla abliterowanych modeli. Firmy będą musiały udowadniać, że ich systemy nie generują szkodliwych treści.
  2. Nowe architektury: Modele MoE, jak GLM-4.7-Flash, będą wymagały bardziej zaawansowanych technik abliteracji. Badania nad optymalizacją routingów ekspertów mogą zmienić zasady gry [5].

Werdykt

HauhauCS nie jest "najlepszym bezstratnym narzędziem do abliteracji" — to fork Heretic z usuniętą atrybucją i gorszymi wynikami w testach logicznych. Benchmark na GLM-4.7-Flash pokazał, że różnice między narzędziami są minimalne, ale architektura MoE tego modelu wymaga precyzyjniejszego podejścia.

Dla developerów budujących modele lokalne kluczowe są trzy wnioski:

  1. Heretic pozostaje najlepszym wyborem — open-source, dobrze przetestowany i z minimalnym wpływem na wydajność modelu.
  2. Abliteracja MoE to inna liga — wymaga więcej testów i ostrożności niż standardowe architektury.
  3. Ryzyko prawne jest realne — w Polsce już teraz firmy płacą kary za niekontrolowane treści generowane przez AI.

Jeśli planujesz abliterację, zacznij od Heretic i przeprowadź własne benchmarki. A jeśli korzystasz z MoE, pamiętaj: mniej zmian w wagach to mniejsze ryzyko błędów w rozumowaniu modelu.

Źródła

[1] Abliterlitics: Benchmarks and Tensor Comparison for Heretic, Abliterlix, Huiui, HauhauCS for GLM 4.7 Flash — https://www.reddit.com/r/LocalLLaMA/comments/1sy18lx/abliterlitics_benchmarks_and_tensor_comparison/

[2] HauhauCS of Uncensored Aggressive Fame: Published an Abliteration Package That Is a Plagiarised Fork of Heretic — https://old.reddit.com/r/LocalLLaMA/comments/1sw77p0/hauhaucs_of_uncensored_aggressive_fame_published/

[3] Heretic: A Tool for Abliterating Language Models — https://github.com/p-e-w/heretic

[4] GLM-4-9B-Chat: Model Card — https://huggingface.co/THUDM/glm-4-9b-chat

[5] Mixture of Experts in Large Language Models: A Survey — https://arxiv.org/abs/2402.12350

[6] The Great AI Censorship Debate: How Much Is Too Much? — https://www.theregister.com/2024/03/15/ai_model_censorship_debate/

AN
O autorze
Andrzej Niemiec

Fanatyk nowych technologii i specjalista w zakresie sztucznej inteligencji.