Przejdź do treści

Każda twierdza potrzebuje Baszty

Polski model AI do wykrywania szkodliwych treści.

Baszta-1 powstała z myślą o języku polskim i rzeczywistych problemach związanych z bezpieczeństwem AI. W whitepaperze pokazujemy, czego nauczyliśmy się podczas jej tworzenia, aby dzielić się wiedzą i wzmacniać polski ekosystem AI.

Model
Baszta-1
Parametry
124M
Kategorie bezpieczeństwa
5 klas: mowa nienawiści, wulgarność, treści seksualne, przestępczość, samookaleczenia
Dane treningowe
26K+ przykładów
Premiera
Wrzesień 2026

Manifest

Polska nie powinna tylko korzystać z AI. Powinna też umieć tworzyć własne modele i zabezpieczenia.

Sztuczna inteligencja zmienia sposób, w jaki pracujemy, uczymy się i podejmujemy decyzje. Wraz z jej rozwojem rośnie potrzeba tworzenia zabezpieczeń, które pozwolą organizacjom korzystać z AI świadomie, odpowiedzialnie i skutecznie ograniczać związane z nią ryzyka.

Wraz z wejściem w życie kolejnych regulacji, takich jak AI Act, bezpieczeństwo AI staje się fundamentem odpowiedzialnego wdrażania tej technologii.

Nie chcieliśmy, aby Polska była wyłącznie odbiorcą zagranicznych rozwiązań bezpieczeństwa AI. Dlatego postanowiliśmy zbudować własny model.

Baszta powstała z potrzeby budowania polskich kompetencji w AI.

Naszą przewagą jest połączenie kompetencji badawczych i prawnych, doświadczenia inżynierskiego oraz znajomości języka polskiego. Zamiast konkurować rozmiarem z największymi modelami, postawiliśmy na specjalizację.

Naszym celem nie było stworzenie kolejnego klasyfikatora. Chcieliśmy pokazać, że Polska może budować własne, wyspecjalizowane rozwiązania AI - również w obszarze bezpieczeństwa.

Pokazujemy proces, nie tylko wynik.

Nie opisujemy wyłącznie tego, co się udało. Pokazujemy również eksperymenty, które nie przyniosły oczekiwanych rezultatów, ograniczenia modelu i założenia, które musieliśmy po drodze zweryfikować.

Wierzymy, że polski ekosystem AI rozwija się szybciej, gdy zespoły dzielą się nie tylko wynikami, ale również wiedzą zdobytą po drodze. Jeśli któryś z polskich modeli AI odniesie sukces, będzie to sukces całego ekosystemu. Baszta jest naszym wkładem w rozwój polskich kompetencji w obszarze bezpiecznej sztucznej inteligencji.

Adam GórskiMateusz JąkalakRafał JakubowskiKrystian KoziełPaweł Wcisło

  • Lepsze dane okazały się ważniejsze niż większy model

    Największą poprawę wyników przyniosła nie kolejna zmiana architektury, lecz lepsze dopasowanie danych. Dane syntetyczne odzwierciedlające nowe sposoby formułowania szkodliwych treści pomogły Baszcie lepiej radzić sobie z przykładami, których wcześniej nie widziała.

  • Model powinien wiedzieć, kiedy nie jest pewny

    Model może poprawnie rozpoznawać zagrożenia, a jednocześnie być zbyt pewny swoich odpowiedzi na danych innych niż te, które znał z treningu. Dlatego jednym z ważnych elementów prac nad Basztą była kalibracja - dopasowanie deklarowanej pewności modelu do jego rzeczywistej skuteczności.

  • Od wyników laboratoryjnych do realnego świata

    Badaliśmy skuteczność Baszty nie tylko na znanych przykładach, ale również w nowych scenariuszach użycia. Wszystko po to, by lepiej zrozumieć, w czym model radzi sobie dobrze i gdzie wymaga dalszego rozwoju.

Benchmarki

Baszta-1 na tle innych modeli bezpieczeństwa

Porównujemy Basztę z HerBERT-PL-Guard, Sójką i Qwen3Guard na publicznych benchmarkach bezpieczeństwa dla języka polskiego.

KLEJ CBD

0,669F1

+21,0 pp HerBERT-PL-Guard+23,6 pp Sójka+40,7 pp Qwen3Guard

ModelF1FPR
Baszta-10,66910,9%
HerBERT-PL-Guard0,45926,6%
Sójka0,43313,1%
Qwen3Guard0,2622,8%

Baszta osiąga najwyższe F1 w zestawieniu i jednocześnie drugi najniższy FPR.

Gadzi Język - Baszta vs Sójka

0,929mikro F1

MetrykaBaszta-1SójkaRóżnica
Mikro F10,9290,903+2,6 pp
Makro F10,7120,782−7,0 pp

Przy takim samym strojeniu obu modeli przewaga Baszty w mikro F1 jest statystycznie istotna (95% CI: +0,4 do +4,9 pp; p = 0,011), natomiast różnica w makro F1 nie jest istotna statystycznie.

Gadzi Język jest silnie niezbalansowany - naiwny model oznaczający każdy tekst jako „przestępczość” osiąga 0,910 mikro F1.

Gadzi Język - porównanie modeli bezpieczeństwa

0,906Recall

−8,6 pp HerBERT-PL-Guard−7,9 pp Qwen3Guard+23,1 pp Sójka

ModelRecall
HerBERT-PL-Guard0,992
Qwen3Guard0,985
Baszta-10,906
Sójka0,675

Baszta wykrywa znacznie więcej szkodliwych przykładów niż Sójka, ale ustępuje HerBERT-PL-Guard i Qwen3Guard.

Gadzi Język zawiera wyłącznie szkodliwe przykłady, dlatego zamiast F1 raportujemy recall, czyli odsetek poprawnie wykrytych przypadków.

HateCheck-PL

0,710F1

−7,6 pp HerBERT-PL-Guard−7,4 pp Sójka+7,4 pp Qwen3Guard

ModelF1FPR
HerBERT-PL-Guard0,78659,3%
Sójka0,78474,5%
Baszta-10,71057,8%
Qwen3Guard0,63638,4%

Baszta ma niższe F1 niż HerBERT-PL-Guard i Sójka, ale jednocześnie niższy FPR niż oba te modele.

BAN-PL

0,667F1

−9,5 pp HerBERT-PL-Guard−8,7 pp Sójka+40,4 pp Qwen3Guard

ModelF1FPR
HerBERT-PL-Guard0,76235,4%
Sójka0,75423,0%
Baszta-10,66785,5%
Qwen3Guard0,2637,8%

Na BAN-PL Baszta ustępuje HerBERT-PL-Guard i Sójce zarówno pod względem F1, jak i FPR.

PolyGuard-PL

0,562F1

−25,4 pp HerBERT-PL-Guard−20,4 pp Qwen3Guard+8,7 pp Sójka

ModelF1FPR
HerBERT-PL-Guard0,8167,0%
Qwen3Guard0,7668,5%
Baszta-10,56235,7%
Sójka0,47519,7%

Baszta wyprzedza Sójkę o 8,7 pp F1, ale pozostaje za HerBERT-PL-Guard i Qwen3Guard.

Kategorie - Baszta vs Sójka

KategoriaBaszta-1SójkaRóżnica
Samookaleczenia0,8120,759+5,3 pp
Przestępczość0,9830,946+3,7 pp
Mowa nienawiści0,4900,478+1,2 pp
Treści seksualne0,4760,727−25,1 pp
Wulgarność0,8001,000−20,0 pp

Baszta ma wyższe wyniki dla samookaleczeń, przestępczości oraz mowy nienawiści, natomiast największa różnica na korzyść Sójki dotyczy treści seksualnych.

Kontrola duplikatów w benchmarkach

ZbiórIdentyczne rekordyDecyzja
Gadzi Język0 / 520Bez zmian
HateCheck-PL0 / 3815Bez zmian
PolyGuard-PL0 / 1725Bez zmian
KLEJ CBD149 / 1000Duplikaty usunięte
BAN-PL461 / 24 000Duplikaty usunięte
PL-Guard899 / 900Zbiór wyłączony
PL-Guard adversarial765 / 900Zbiór wyłączony

Sprawdziliśmy, czy teksty z benchmarków występują również w danych wykorzystanych podczas tworzenia modelu. W Gadzim Języku, HateCheck-PL i PolyGuard-PL nie znaleźliśmy identycznych rekordów. Z KLEJ CBD usunęliśmy 149 takich przykładów, a z BAN-PL - 461. PL-Guard wyłączyliśmy z ewaluacji, ponieważ 899 z 900 przykładów znajdowało się w danych treningowych. Kontrola obejmuje identyczne teksty. Nie wykrywa parafraz, bardzo podobnych przykładów ani przypadków pochodzących ze wspólnego źródła.

Whitepaper

Jak powstała Baszta - dane, eksperymenty i wnioski.

Whitepaper Baszty opisuje pełny proces tworzenia polskiego modelu bezpieczeństwa AI - od przygotowania danych i eksperymentów treningowych, przez ewaluację na danych spoza domeny treningowej, aż po analizę ograniczeń modelu.

Nie pokazujemy wyłącznie najlepszego wyniku. Opisujemy również przypadki, w których model zawodził, ograniczenia benchmarków oraz decyzje i kompromisy, których wymagał proces jego tworzenia.

Zaufanie do AI nie bierze się z obietnic perfekcji, lecz z przejrzystości metod, danych i decyzji.

1 / 35
  1. Strona 1 z 35
  2. Strona 2 z 35
  3. Strona 3 z 35
  4. Strona 4 z 35
  5. Strona 5 z 35
  6. Strona 6 z 35
  7. Strona 7 z 35
  8. Strona 8 z 35
  9. Strona 9 z 35
  10. Strona 10 z 35
  11. Strona 11 z 35
  12. Strona 12 z 35
  13. Strona 13 z 35
  14. Strona 14 z 35
  15. Strona 15 z 35
  16. Strona 16 z 35
  17. Strona 17 z 35
  18. Strona 18 z 35
  19. Strona 19 z 35
  20. Strona 20 z 35
  21. Strona 21 z 35
  22. Strona 22 z 35
  23. Strona 23 z 35
  24. Strona 24 z 35
  25. Strona 25 z 35
  26. Strona 26 z 35
  27. Strona 27 z 35
  28. Strona 28 z 35
  29. Strona 29 z 35
  30. Strona 30 z 35
  31. Strona 31 z 35
  32. Strona 32 z 35
  33. Strona 33 z 35
  34. Strona 34 z 35
  35. Strona 35 z 35
Otwórz whitepaper na pełnym ekranie
Wydanie
10 września 2026
Autorzy
Adam Górski, Mateusz Jąkalak, Rafał Jakubowski
Recenzenci
Krystian Kozieł, Paweł Wcisło

Demo

Przetestuj Basztę-1 na własnych przykładach po polsku.

Model
Baszta-1
CPU
0,5 vCPU
Pamięć
1 GB RAM
Region
Azure West Europe

Baszta-1Brak połączenia - końcówka nie odpowiada

Wybierz przykład albo wklej własny tekst po polsku

Przekazany tekst jest przetwarzany przez model uruchomiony na serwerach zlokalizowanych w Unii Europejskiej i usuwany bezpośrednio po zwróceniu wyniku.

Enter wysyła tekst do sprawdzenia, Shift + Enter dodaje nową linię. Maksymalnie 4000 znaków.

Kontakt

Współpraca, wdrożenia, badania.

Jeśli chcesz wykorzystać Basztę w swoim rozwiązaniu AI albo porozmawiać o bezpieczeństwie AI - skontaktuj się z nami.