# Baszta-1 - polski model bezpieczeństwa AI do wykrywania szkodliwych treści

Baszta-1 - polski model bezpieczeństwa AI do wykrywania szkodliwych treści.

Każda twierdza potrzebuje Baszty

## Polski model AI do wykrywania szkodliwych treści.

Baszta-1 powstała z myślą o języku polskim i rzeczywistych problemach związanych z bezpieczeństwem AI. W whitepaperze pokazujemy, czego nauczyliśmy się podczas jej tworzenia, aby dzielić się wiedzą i wzmacniać polski ekosystem AI.

| Model | Parametry | Kategorie bezpieczeństwa | Dane treningowe | Premiera |
| --- | --- | --- | --- | --- |
| Baszta-1 | 124M | 5 klas: mowa nienawiści, wulgarność, treści seksualne, przestępczość, samookaleczenia | 26K+ przykładów | wrzesień 2026 |

## Manifest

### **Polska nie powinna tylko korzystać z AI. Powinna też umieć tworzyć własne modele i zabezpieczenia.**

Sztuczna inteligencja zmienia sposób, w jaki pracujemy, uczymy się i podejmujemy decyzje. Wraz z jej rozwojem rośnie potrzeba tworzenia zabezpieczeń, które pozwolą organizacjom korzystać z AI świadomie, odpowiedzialnie i skutecznie ograniczać związane z nią ryzyka.

Wraz z wejściem w życie kolejnych regulacji, takich jak AI Act, bezpieczeństwo AI staje się fundamentem odpowiedzialnego wdrażania tej technologii.

Nie chcieliśmy, aby Polska była wyłącznie odbiorcą zagranicznych rozwiązań bezpieczeństwa AI. Dlatego postanowiliśmy zbudować własny model.

### Baszta powstała z potrzeby budowania polskich kompetencji w AI.

Naszą przewagą jest połączenie kompetencji badawczych i prawnych, doświadczenia inżynierskiego oraz znajomości języka polskiego. Zamiast konkurować rozmiarem z największymi modelami, postawiliśmy na specjalizację.

Naszym celem nie było stworzenie kolejnego klasyfikatora. Chcieliśmy pokazać, że Polska może budować własne, wyspecjalizowane rozwiązania AI - również w obszarze bezpieczeństwa.

### Pokazujemy proces, nie tylko wynik.

Nie opisujemy wyłącznie tego, co się udało. Pokazujemy również eksperymenty, które nie przyniosły oczekiwanych rezultatów, ograniczenia modelu i założenia, które musieliśmy po drodze zweryfikować.

Wierzymy, że polski ekosystem AI rozwija się szybciej, gdy zespoły dzielą się nie tylko wynikami, ale również wiedzą zdobytą po drodze. Jeśli któryś z polskich modeli AI odniesie sukces, będzie to sukces całego ekosystemu. Baszta jest naszym wkładem w rozwój polskich kompetencji w obszarze bezpiecznej sztucznej inteligencji.

- **Lepsze dane okazały się ważniejsze niż większy model** - Największą poprawę wyników przyniosła nie kolejna zmiana architektury, lecz lepsze dopasowanie danych. Dane syntetyczne odzwierciedlające nowe sposoby formułowania szkodliwych treści pomogły Baszcie lepiej radzić sobie z przykładami, których wcześniej nie widziała.
- **Model powinien wiedzieć, kiedy nie jest pewny** - Model może poprawnie rozpoznawać zagrożenia, a jednocześnie być zbyt pewny swoich odpowiedzi na danych innych niż te, które znał z treningu. Dlatego jednym z ważnych elementów prac nad Basztą była kalibracja - dopasowanie deklarowanej pewności modelu do jego rzeczywistej skuteczności.
- **Od wyników laboratoryjnych do realnego świata** - Badaliśmy skuteczność Baszty nie tylko na znanych przykładach, ale również w nowych scenariuszach użycia. Wszystko po to, by lepiej zrozumieć, w czym model radzi sobie dobrze i gdzie wymaga dalszego rozwoju.

Opublikowano: 10 wrz 2026. Autorzy: Adam Górski, Mateusz Jąkalak, Rafał Jakubowski. Recenzenci: Krystian Kozieł, Paweł Wcisło.

## Benchmarki

### Baszta-1 na tle innych modeli bezpieczeństwa

Porównujemy Basztę z HerBERT-PL-Guard, Sójką i Qwen3Guard na publicznych benchmarkach bezpieczeństwa dla języka polskiego.

Modele: 4 modele bezpieczeństwa · Benchmarki: 5 zestawów · Audyt: duplikaty tekstowe

FPR: FPR - odsetek bezpiecznych tekstów błędnie oznaczonych jako szkodliwe. Im niższy wynik, tym lepiej.

#### KLEJ CBD

0,669 F1

+21,0 pp HerBERT-PL-Guard · +23,6 pp Sójka · +40,7 pp Qwen3Guard

| Model | F1 | FPR |
| --- | --- | --- |
| Baszta-1 | 0,669 | 10,9% |
| HerBERT-PL-Guard | 0,459 | 26,6% |
| Sójka | 0,433 | 13,1% |
| Qwen3Guard | 0,262 | 2,8% |

Baszta osiąga najwyższe F1 w zestawieniu i jednocześnie drugi najniższy FPR.

#### Gadzi Język - Baszta vs Sójka

0,929 mikro F1

| Metryka | Baszta-1 | Sójka | Różnica |
| --- | --- | --- | --- |
| Mikro F1 | 0,929 | 0,903 | +2,6 pp |
| Makro F1 | 0,712 | 0,782 | −7,0 pp |

Przy takim samym strojeniu obu modeli przewaga Baszty w mikro F1 jest statystycznie istotna (95% CI: +0,4 do +4,9 pp; p = 0,011), natomiast różnica w makro F1 nie jest istotna statystycznie.
Gadzi Język jest silnie niezbalansowany - naiwny model oznaczający każdy tekst jako „przestępczość” osiąga 0,910 mikro F1.

#### Gadzi Język - porównanie modeli bezpieczeństwa

0,906 Recall

−8,6 pp HerBERT-PL-Guard · −7,9 pp Qwen3Guard · +23,1 pp Sójka

| Model | Recall |
| --- | --- |
| HerBERT-PL-Guard | 0,992 |
| Qwen3Guard | 0,985 |
| Baszta-1 | 0,906 |
| Sójka | 0,675 |

Baszta wykrywa znacznie więcej szkodliwych przykładów niż Sójka, ale ustępuje HerBERT-PL-Guard i Qwen3Guard.
Gadzi Język zawiera wyłącznie szkodliwe przykłady, dlatego zamiast F1 raportujemy recall, czyli odsetek poprawnie wykrytych przypadków.

#### HateCheck-PL

0,710 F1

−7,6 pp HerBERT-PL-Guard · −7,4 pp Sójka · +7,4 pp Qwen3Guard

| Model | F1 | FPR |
| --- | --- | --- |
| HerBERT-PL-Guard | 0,786 | 59,3% |
| Sójka | 0,784 | 74,5% |
| Baszta-1 | 0,710 | 57,8% |
| Qwen3Guard | 0,636 | 38,4% |

Baszta ma niższe F1 niż HerBERT-PL-Guard i Sójka, ale jednocześnie niższy FPR niż oba te modele.

#### BAN-PL

0,667 F1

−9,5 pp HerBERT-PL-Guard · −8,7 pp Sójka · +40,4 pp Qwen3Guard

| Model | F1 | FPR |
| --- | --- | --- |
| HerBERT-PL-Guard | 0,762 | 35,4% |
| Sójka | 0,754 | 23,0% |
| Baszta-1 | 0,667 | 85,5% |
| Qwen3Guard | 0,263 | 7,8% |

Na BAN-PL Baszta ustępuje HerBERT-PL-Guard i Sójce zarówno pod względem F1, jak i FPR.

#### PolyGuard-PL

0,562 F1

−25,4 pp HerBERT-PL-Guard · −20,4 pp Qwen3Guard · +8,7 pp Sójka

| Model | F1 | FPR |
| --- | --- | --- |
| HerBERT-PL-Guard | 0,816 | 7,0% |
| Qwen3Guard | 0,766 | 8,5% |
| Baszta-1 | 0,562 | 35,7% |
| Sójka | 0,475 | 19,7% |

Baszta wyprzedza Sójkę o 8,7 pp F1, ale pozostaje za HerBERT-PL-Guard i Qwen3Guard.

#### Kategorie - Baszta vs Sójka

| Kategoria | Baszta-1 | Sójka | Różnica |
| --- | --- | --- | --- |
| Samookaleczenia | 0,812 | 0,759 | +5,3 pp |
| Przestępczość | 0,983 | 0,946 | +3,7 pp |
| Mowa nienawiści | 0,490 | 0,478 | +1,2 pp |
| Treści seksualne | 0,476 | 0,727 | −25,1 pp |
| Wulgarność* | 0,800 | 1,000 | −20,0 pp |

Baszta ma wyższe wyniki dla samookaleczeń, przestępczości oraz mowy nienawiści, natomiast największa różnica na korzyść Sójki dotyczy treści seksualnych.

*W zbiorze testowym są tylko trzy pozytywne przykłady wulgarności, dlatego ten wynik jest niestabilny.

#### Kontrola duplikatów w benchmarkach

| Zbiór | Identyczne rekordy | Decyzja |
| --- | --- | --- |
| Gadzi Język | 0 / 520 | Bez zmian |
| HateCheck-PL | 0 / 3815 | Bez zmian |
| PolyGuard-PL | 0 / 1725 | Bez zmian |
| KLEJ CBD | 149 / 1000 | Duplikaty usunięte |
| BAN-PL | 461 / 24 000 | Duplikaty usunięte |
| PL-Guard | 899 / 900 | Zbiór wyłączony |
| PL-Guard adversarial | 765 / 900 | Zbiór wyłączony |

Sprawdziliśmy, czy teksty z benchmarków występują również w danych wykorzystanych podczas tworzenia modelu. W Gadzim Języku, HateCheck-PL i PolyGuard-PL nie znaleźliśmy identycznych rekordów. Z KLEJ CBD usunęliśmy 149 takich przykładów, a z BAN-PL - 461. PL-Guard wyłączyliśmy z ewaluacji, ponieważ 899 z 900 przykładów znajdowało się w danych treningowych. Kontrola obejmuje identyczne teksty. Nie wykrywa parafraz, bardzo podobnych przykładów ani przypadków pochodzących ze wspólnego źródła.

## Whitepaper

### Jak powstała Baszta - dane, eksperymenty i wnioski.

Whitepaper Baszty opisuje pełny proces tworzenia polskiego modelu bezpieczeństwa AI - od przygotowania danych i eksperymentów treningowych, przez ewaluację na danych spoza domeny treningowej, aż po analizę ograniczeń modelu.

Nie pokazujemy wyłącznie najlepszego wyniku. Opisujemy również przypadki, w których model zawodził, ograniczenia benchmarków oraz decyzje i kompromisy, których wymagał proces jego tworzenia.

Zaufanie do AI nie bierze się z obietnic perfekcji, lecz z przejrzystości metod, danych i decyzji.

- Wydanie: 10 września 2026
- Stron: 35
- Autorzy: Adam Górski, Mateusz Jąkalak, Rafał Jakubowski
- Recenzenci: Krystian Kozieł, Paweł Wcisło
- [Pobierz PDF](/Baszta-1.pdf)

## Demo

### Przetestuj Basztę-1 na własnych przykładach po polsku.

- Model: Baszta-1
- CPU: 0,5 vCPU
- Pamięć: 1 GB RAM
- Region: Azure West Europe

Pewność modelu według kategorii: Mowa nienawiści, Wulgarność, Treści seksualne, Przestępczość, Samookaleczenia.

## Kontakt

### Współpraca, wdrożenia, badania.

Jeśli chcesz wykorzystać Basztę w swoim rozwiązaniu AI albo porozmawiać o bezpieczeństwie AI - skontaktuj się z nami.

- Napisz do nas: <marketing@billennium.com>
- Billennium: https://billennium.com/

---

Bastion AI Governance Lab · https://baszta.billennium.com/pl/
