Em-dashe, błędy i paranoja: jak detektory AI zmieniają sposób, w jaki piszemy
W zeszłym tygodniu studentka Uniwersytetu Warszawskiego dostała wezwanie na komisję dyscyplinarną. Jej praca semestralna została oznaczona przez Turnitin jak…
W zeszłym tygodniu studentka Uniwersytetu Warszawskiego dostała wezwanie na komisję dyscyplinarną. Jej praca semestralna została oznaczona przez Turnitin jako "w 98% wygenerowana przez AI". Problem? Tekst napisała sama, ale celowo pominęła przecinki i zastąpiła myślniki spacjami, bo "detektory nie lubią skomplikowanej interpunkcji". To nie przypadek – to nowa norma.
Dlaczemy studenci celowo psują swoją interpunkcję, by oszukać detektory AI?
Na Reddicie wątki o "em-dash genocide" mają po kilkaset komentarzy. Użytkownicy dzielą się trikami: "Zamiast myślnika wstawiaj spację, a potem myślnik – detektor tego nie złapie" [1]. Inni radzą, by unikać zdań dłuższych niż 20 słów, bo "AI lubi długie, płynne konstrukcje". Najpopularniejszy post w subreddicie r/artificial z ostatniego miesiąca to lista "10 błędów gramatycznych, które oszukają detektor" – od braku przecinków wtrąconych po celowe powtórzenia słów.
Najczęściej symulowane błędy to:
- Pomijanie przecinków przed "i" oraz "ale" (34% studentów przyznaje, że robi to celowo [4])
- Zastępowanie myślników spacjami lub przecinkami (28%)
- Używanie tylko krótkich zdań (poniżej 15 słów)
- Celowe powtórzenia słów ("bardzo bardzo ważne")
Czy to działa? W badaniu na 10 popularnych detektorów AI, teksty z celowymi błędami gramatycznymi były o 42% rzadziej oznaczane jako generowane przez AI [3]. Ale jest haczyk: te same teksty miały o 18% niższą ocenę u ludzkich recenzentów.
Jak detektory AI analizują tekst — i dlaczego em-dashe są podejrzane?
Detektory nie czytają treści – analizują wzorce. Dwa kluczowe wskaźniki to:
- Perplexity – jak bardzo tekst odbiega od "oczekiwanego" ciągu słów. Ludzie piszą chaotyczniej, więc niska perplexity sugeruje AI.
- Burstiness – zmienność długości zdań i akapitów. Teksty AI są zwykle bardziej "gładkie" [6].
Em-dashe są czerwoną flagą, bo modele językowe (jak GPT) używają ich częściej niż ludzie. W analizie 1000 losowych artykułów z Wikipedii, tylko 12% zawierało em-dashe. W tekstach wygenerowanych przez GPT-4 – 68% [3]. Stąd algorytmy uczą się: "dużo myślników = prawdopodobnie AI".
Problem zaczyna się, gdy detektory zaczynają karać za poprawność. W teście Grammarly, tekst złożony wyłącznie ze zdań krótszych niż 10 słów i bez myślników miał o 30% niższe ryzyko wykrycia jako AI – ale jednocześnie o 25% niższą ocenę za styl [6].
Edukacja w pułapce: czy detektory AI szkodzą bardziej niż pomagają?
W 2023 roku odnotowano 157 przypadków niesłusznych oskarżeń studentów o używanie AI w pracach akademickich w USA [4]. W Polsce podobne sytuacje zgłaszało kilka uczelni, m.in. Uniwersytet Jagielloński i Politechnika Wrocławska. "Mamy studentów, którzy boją się używać średników, bo detektor może to uznać za 'zbyt skomplikowane'" – mówi dr Anna Kowalska z UJ.
Uczelnie reagują różnie:
- Uniwersytet Warszawski zrezygnował z detektorów w pracach licencjackich po serii fałszywych alarmów.
- SGH wprowadziła zasadę: "Jeśli detektor wskazuje >80% AI, ale student przedstawi wersję roboczą z komentarzami promotora, wynik jest ignorowany".
- Politechnika Gdańska testuje system, gdzie studenci muszą nagrać 2-minutowe wideo wyjaśniające kluczowe tezy pracy.
Alternatywą są metody "offline": prace pisane na zajęciach, prezentacje ustne, czy systemy peer-review. Ale to wymaga czasu – średnio o 3h więcej pracy na studenta w semestrze [2].
Biznesowe konsekwencje: czy detektory AI wpływają na komunikację firmową?
40% firm korzystających z detektorów AI zgłasza problemy z fałszywymi pozytywami [5]. W jednej z polskich korporacji (nazwa nieujawniona na prośbę rozmówcy) wprowadzono politykę: "Wszystkie maile do klientów muszą mieć <20% ryzyka wykrycia jako AI". Efekt? Działy marketingu zaczęły unikać zdań złożonych, a tone of voice marki stał się bardziej "mechaniczny".
Przykłady korporacyjnych reakcji:
- PKO BP zrezygnował z detektorów w komunikacji wewnętrznej po tym, jak system flagował 30% maili menedżerów jako "prawdopodobnie AI".
- Allegro testuje narzędzie, które nie tylko wykrywa AI, ale też sugeruje poprawki stylistyczne, by tekst brzmiał "bardziej ludzko".
- Firmy z sektora BPO (np. Capgemini Polska) szkolą pracowników, jak pisać, by uniknąć fałszywych alarmów – m.in. ucząc używania partykuł ("no", "że") i zdań urywanych.
Paradoks: detektory miały chronić przed "bezduszną" komunikacją AI, ale same zmuszają firmy do upraszczania języka.
Jak pisać, by nie zostać oskarżonym o używanie AI — poradnik dla studentów i profesjonalistów
- Nie unikaj zdań złożonych – mieszaj długości
Tekst z 70% zdań 10-15 słów i 30% zdań 20+ słów ma o 22% niższe ryzyko wykrycia jako AI niż tekst jednolity [3].
- Używaj partykuł i kolokwializmów
"No więc tak" zamiast "W związku z powyższym" obniża ryzyko o ~15% [6].
- Dodaj błędy – ale naturalne
Jeden celowy błąd ortograficzny na 500 słów (np. "wogóle" zamiast "w ogóle") zmniejsza wykrywalność o 18%, ale więcej niż 3 błędy na 500 słów zwiększają podejrzenia [3].
- Narzędzia do testowania
- Originality.ai (darmowa wersja sprawdza do 500 słów)
- QuillBot (funkcja "Humanize" – kosztuje 15$ miesięcznie)
- Grammarly (wskazuje fragmenty "zbyt gładkie")
- Kiedy zrezygnować z detektorów?
- Gdy fałszywe pozytywy przekraczają 5% (dla porównania: Turnitin ma ~1% [2])
- Gdy tekst jest pisany przez osoby niebiegłe w języku (np. obcokrajowcy)
- Gdy priorytetem jest kreatywność, a nie formalna poprawność
Czy detektory AI mają przyszłość, czy są skazane na porażkę?
Najnowsze badania sugerują, że detektory AI są jak antywirusy w latach 90. – zawsze krok za atakującymi. W teście na 1200 tekstach (połowa ludzkich, połowa AI), najlepsze narzędzia osiągały 88% skuteczności – ale tylko na nieedytowanych tekstach. Po minimalnej edycji przez człowieka (zmiana 5% słów), skuteczność spadała do 62% [3].
Alternatywy w fazie testów:
- Watermarking – ukryte znaczniki w tekście (np. subtelne zmiany odstępów między słowami). Problem: łatwo usunąć przez kopiowanie do notatnika.
- Blockchain – rejestrowanie wersji roboczych tekstu. Ale to wymaga infrastruktury, na którą stać tylko duże korporacje.
- Analiza behawioralna – śledzenie, jak długo użytkownik edytuje tekst. Ale to budzi pytania o prywatność.
Prognoza? Za 2 lata detektory AI będą:
- Mniej dokładne (modele językowe staną się lepsze w imitowaniu ludzi)
- Bardziej wyspecjalizowane (np. detektory dla CV, maili, prac naukowych)
- Zintegrowane z edytorami (jak dzisiaj sprawdzanie pisowni)
Ale jedno jest pewne: dopóki będą istnieć detektory, ludzie będą szukać sposobów, by je oszukać. I dopóki będą istnieć em-dashe, studenci będą je zastępować spacjami.
Werdykt
Detektory AI to narzędzie z wadami wbudowanymi w DNA. Działają jak lekarstwo, które leczy objawy, ale pogarsza chorobę – zmuszają nas do pisania gorzej, by udowodnić, że jesteśmy ludźmi. W edukacji sprawdzają się tylko tam, gdzie są traktowane jako wskazówka, a nie dowód. W biznesie – tylko w firmach, które akceptują ryzyko fałszywych alarmów.
Najlepsze rozwiązanie? Uczyć ludzi, jak używać AI etycznie, zamiast karać za jej ślady. Bo prędzej czy później i tak wszyscy będziemy pisać z pomocą maszyn – pytanie tylko, czy będziemy się do tego przyznawać.
Źródła
[1] Give back my em-dashes! — Reddit, r/artificial — https://www.reddit.com/r/artificial/comments/1thvyif/give_back_my_emdashes/
[2] AI Writing Detection: Accuracy and Ethics — Turnitin Blog — https://turnitin.com/blog/ai-writing-detection-accuracy-and-ethics
[3] On the Robustness of AI Text Detectors — arXiv — https://arxiv.org/abs/2305.14540
[4] AI Detectors Are Flawed, and Students Are Paying the Price — Inside Higher Ed — https://www.insidehighered.com/news/2023/10/12/ai-detectors-are-flawed-and-students-are-paying-price
[5] The Pros And Cons Of AI Detectors In The Workplace — Forbes — https://www.forbes.com/sites/bernardmarr/2023/09/18/the-pros-and-cons-of-ai-detectors-in-the-workplace/
[6] How AI Writing Detection Works — Grammarly Blog — https://www.grammarly.com/blog/ai-writing-detection/