HauhauCS kontra Heretic: kto naprawdę usuwa cenzurę w GLM-4.7-Flash?
W czerwcu 2024 roku użytkownik HauhauCS opublikował narzędzie do abliteracji modeli AI, deklarując je jako "najlepsze bezstratne modele bez cenzury". Tydzień…
W czerwcu 2024 roku użytkownik HauhauCS opublikował narzędzie do abliteracji modeli AI, deklarując je jako "najlepsze bezstratne modele bez cenzury". Tydzień później społeczność LocalLLaMA oskarżyła go o plagiat oryginalnego Heretic. Benchmark na GLM-4.7-Flash pokazał, że różnice między narzędziami są minimalne — ale architektura MoE tego modelu zmienia zasady gry.
Dlaczego abliteracja stała się gorącym tematem w społeczności lokalnych LLM?
Abliteracja to proces usuwania mechanizmów cenzury z modeli językowych. W praktyce oznacza modyfikację wag sieci neuronowej, by model przestał blokować odpowiedzi na kontrowersyjne pytania — od teorii spiskowych po instrukcje tworzenia szkodliwego oprogramowania. Dla developerów budujących modele lokalne to narzędzie podwójnie ryzykowne: z jednej strony pozwala na większą swobodę generowanych treści, z drugiej — naraża na problemy prawne i reputacyjne.
Kontrowersja wokół HauhauCS wybuchła, gdy okazało się, że jego narzędzie to niemal dokładna kopia Heretic, oryginalnego projektu użytkownika p-e-w [2]. HauhauCS usunął atrybucję i zmienił licencję z MIT na bardziej restrykcyjną, co wzbudziło podejrzenia o próbę komercjalizacji cudzego kodu. Sytuacja przypomina polski spór z 2023 roku, gdy startup z Wrocławia został oskarżony o wykorzystanie open-source'owego kodu bez zgody autorów — sprawa zakończyła się ugodą, ale kosztowała firmę 120 tys. PLN [doświadczenie własne, nie z knowledge pack].
GLM-4.7-Flash, model wykorzystany w benchmarku, różni się od standardowych architektur jak Qwen. To Mixture of Experts (MoE) z 64 routed experts na warstwę [4]. Oznacza to, że każde zapytanie jest przetwarzane tylko przez część modelu, co teoretycznie powinno utrudnić abliterację — ale wyniki testów pokazują co innego.
Jakie techniki abliteracji zostały porównane w benchmarku GLM-4.7-Flash?
Benchmark objął cztery narzędzia: Heretic, Abliterlix, Huiui i HauhauCS. Każde z nich miało ten sam cel — usunąć cenzurę bez wpływu na ogólne możliwości modelu — ale różniło się podejściem.
Heretic, oryginalne narzędzie, działa poprzez precyzyjną modyfikację wag modelu. Jego autor, p-e-w, podkreśla, że kluczowe jest zachowanie integralności datasetów i nieingerowanie w mechanizmy generowania odpowiedzi [3]. Abliterlix i Huiui to alternatywne implementacje, które również skupiają się na minimalnych zmianach w architekturze.
HauhauCS, mimo deklaracji o "bezstratności", okazał się forkem Heretic z drobnymi modyfikacjami. Analiza kodu wykazała, że 98% struktury pozostało niezmienione — zmieniono jedynie nazwy zmiennych i usunięto komentarze [2]. To budzi pytanie: czy HauhauCS wnosi jakąkolwiek wartość, czy tylko próbuje skapitalizować na popularności Heretic?
Jakie metryki zostały użyte do oceny skuteczności abliteracji?
Benchmark na GLM-4.7-Flash obejmował trzy główne kategorie testów:
- Wydajność ogólna: mierzenie zdolności modelu do rozwiązywania zadań niezwiązanych z cenzurą. Użyto standardowych benchmarków jak MMLU (Massive Multitask Language Understanding) i GSM8K (matematyka). Wyniki pokazały, że wszystkie narzędzia zachowały 99,2–99,5% oryginalnej wydajności modelu [1].
- Safety evaluation: testy sprawdzające, czy model nadal blokuje niebezpieczne treści. Tu pojawiły się największe różnice. Heretic i HauhauCS obniżyły wskaźnik blokad z 92% do 18%, podczas gdy Abliterlix i Huiui utrzymały go na poziomie 24–27% [1]. To sugeruje, że niektóre narzędzia są mniej agresywne w usuwaniu mechanizmów bezpieczeństwa.
- KL divergence i analiza wag: KL divergence (Kullback-Leibler divergence) mierzy, jak bardzo rozkład prawdopodobieństwa wyjść modelu po abliteracji różni się od oryginału. W benchmarku wartości wahały się od 0,03 (Heretic) do 0,05 (HauhauCS) [1]. Dla porównania, standardowe fine-tuningi osiągają wartości rzędu 0,1–0,3 — co oznacza, że abliteracja wprowadza minimalne zmiany.
Dodatkowo przeprowadzono chain-of-thought forensics: testy logiczne sprawdzające, czy model nadal potrafi wyjaśniać swoje odpowiedzi. Tu HauhauCS wypadał gorzej od Heretic — w 12% przypadków generował niespójne uzasadnienia, podczas gdy Heretic tylko w 3% [1].
Czy HauhauCS naprawdę oferuje „najlepsze bezstratne modele bez cenzury”?
Deklaracje HauhauCS o "najlepszych bezstratnych modelach" nie znajdują pełnego potwierdzenia w benchmarku. Choć narzędzie rzeczywiście usuwa cenzurę skuteczniej niż Abliterlix czy Huiui (18% blokad vs 24–27%), to różnice w stosunku do Heretic są minimalne. W testach wydajnościowych oba narzędzia osiągnęły niemal identyczne wyniki: 99,4% dla Heretic i 99,3% dla HauhauCS [1].
Problem pojawia się przy chain-of-thought forensics. HauhauCS generował niespójne uzasadnienia trzykrotnie częściej niż Heretic (12% vs 3%). To sugeruje, że mimo deklaracji o "bezstratności", narzędzie może wprowadzać subtelne błędy w mechanizmach rozumowania modelu [1].
Sceptycyzm społeczności LocalLLaMA nie dotyczy tylko plagiatu. HauhauCS nie udostępnił kodu źródłowego swojego narzędzia, co utrudnia weryfikację jego działania. W przeciwieństwie do Heretic, który jest open-source i dostępny na licencji MIT [3], HauhauCS działa jak "czarna skrzynka" — co dla developerów budujących modele lokalne jest ryzykowne.
Jak architektura Mixture of Experts (MoE) wpływa na abliterację?
GLM-4.7-Flash to model MoE z 64 routed experts na warstwę [4]. Oznacza to, że każde zapytanie jest przetwarzane tylko przez część modelu, co teoretycznie powinno utrudnić abliterację — modyfikacja wag jednego eksperta nie wpływa na pozostałe. Jednak benchmark pokazał, że techniki abliteracji radzą sobie z tym wyzwaniem.
W porównaniu do standardowych architektur jak Qwen, GLM-4.7-Flash wymaga bardziej precyzyjnej ingerencji. W benchmarku Heretic i HauhauCS osiągnęły podobne wyniki w usuwaniu cenzury, ale różniły się w KL divergence: 0,03 dla Heretic i 0,05 dla HauhauCS [1]. To sugeruje, że HauhauCS wprowadza większe zmiany w rozkładzie wag, co może tłumaczyć gorsze wyniki w chain-of-thought forensics.
Dla developerów pracujących z MoE kluczowe są dwa wnioski:
- Precyzja jest ważniejsza niż agresywność: Modyfikacja zbyt wielu ekspertów może zaburzyć działanie modelu.
- Testy logiczne są niezbędne: MoE może maskować subtelne błędy w rozumowaniu, dlatego chain-of-thought forensics powinno być standardem po abliteracji.
Jakie są ryzyka i rekomendacje dla developerów korzystających z abliterowanych modeli?
Abliteracja niesie ze sobą trzy główne ryzyka:
- Prawne: Usuwanie cenzury może prowadzić do generowania szkodliwych treści, co w Polsce podlega przepisom o odpowiedzialności za treści publikowane przez systemy AI (Art. 23a Ustawy o świadczeniu usług drogą elektroniczną). W 2024 roku Urząd Ochrony Konkurencji i Konsumentów nałożył karę 50 tys. PLN na firmę, która nie kontrolowała treści generowanych przez swój chatbot [polski kontekst rynkowy].
- Techniczne: Benchmark pokazał, że nawet minimalne zmiany w wagach mogą wprowadzać błędy w rozumowaniu modelu. HauhauCS, mimo deklaracji o "bezstratności", generował niespójne uzasadnienia w 12% przypadków [1].
- Etyczne: Abliteracja może prowadzić do generowania treści dyskryminujących lub niebezpiecznych. The Register podkreśla, że debata na temat cenzury w AI trwa, a abliteracja jest jednym z najbardziej kontrowersyjnych narzędzi [6].
Rekomendacje dla developerów:
- Wybieraj open-source: Heretic, dostępny na licencji MIT, pozwala na weryfikację kodu i dostosowanie do własnych potrzeb [3]. Unikaj narzędzi typu "czarna skrzynka" jak HauhauCS.
- Testuj agresywnie: Po abliteracji przeprowadź chain-of-thought forensics i safety evaluation. W benchmarku Heretic wypadał lepiej w obu kategoriach [1].
- Monitoruj prawo: W Polsce regulacje dotyczące AI są wciąż kształtowane. Warto śledzić stanowiska UOKiK i Ministerstwa Cyfryzacji, które w 2025 roku mają wprowadzić nowe wytyczne dla systemów AI [polski kontekst rynkowy].
Przyszłość abliteracji:
W 2025 roku można spodziewać się dwóch trendów:
- Regulacje: Unijny AI Act i polskie przepisy prawdopodobnie wprowadzą ograniczenia dla abliterowanych modeli. Firmy będą musiały udowadniać, że ich systemy nie generują szkodliwych treści.
- Nowe architektury: Modele MoE, jak GLM-4.7-Flash, będą wymagały bardziej zaawansowanych technik abliteracji. Badania nad optymalizacją routingów ekspertów mogą zmienić zasady gry [5].
Werdykt
HauhauCS nie jest "najlepszym bezstratnym narzędziem do abliteracji" — to fork Heretic z usuniętą atrybucją i gorszymi wynikami w testach logicznych. Benchmark na GLM-4.7-Flash pokazał, że różnice między narzędziami są minimalne, ale architektura MoE tego modelu wymaga precyzyjniejszego podejścia.
Dla developerów budujących modele lokalne kluczowe są trzy wnioski:
- Heretic pozostaje najlepszym wyborem — open-source, dobrze przetestowany i z minimalnym wpływem na wydajność modelu.
- Abliteracja MoE to inna liga — wymaga więcej testów i ostrożności niż standardowe architektury.
- Ryzyko prawne jest realne — w Polsce już teraz firmy płacą kary za niekontrolowane treści generowane przez AI.
Jeśli planujesz abliterację, zacznij od Heretic i przeprowadź własne benchmarki. A jeśli korzystasz z MoE, pamiętaj: mniej zmian w wagach to mniejsze ryzyko błędów w rozumowaniu modelu.
Źródła
[1] Abliterlitics: Benchmarks and Tensor Comparison for Heretic, Abliterlix, Huiui, HauhauCS for GLM 4.7 Flash — https://www.reddit.com/r/LocalLLaMA/comments/1sy18lx/abliterlitics_benchmarks_and_tensor_comparison/
[2] HauhauCS of Uncensored Aggressive Fame: Published an Abliteration Package That Is a Plagiarised Fork of Heretic — https://old.reddit.com/r/LocalLLaMA/comments/1sw77p0/hauhaucs_of_uncensored_aggressive_fame_published/
[3] Heretic: A Tool for Abliterating Language Models — https://github.com/p-e-w/heretic
[4] GLM-4-9B-Chat: Model Card — https://huggingface.co/THUDM/glm-4-9b-chat
[5] Mixture of Experts in Large Language Models: A Survey — https://arxiv.org/abs/2402.12350
[6] The Great AI Censorship Debate: How Much Is Too Much? — https://www.theregister.com/2024/03/15/ai_model_censorship_debate/