Zapiski z atelier, 2 października 2026
Model, który nie umie pisać. Sprawdziłem, czy rozumie po polsku.
W połowie września 2026 wyszedł Jev, model AI, który nie pisze tekstu. Dostaje tekst i pytanie z gotową listą odpowiedzi, a oddaje liczbę: na ile jest pewny każdej z nich. Wszyscy testowali go po angielsku, więc sprawdziłem go na polskich opiniach, wpisach z Twittera i zadaniach logicznych, obok trzech znanych modeli. Rozumie polski tak dobrze jak tanie modele, które piszą, odpowiada w pół sekundy i kosztuje 2 centy za 900 decyzji. Ważniejsze jest co innego: na najtrudniejszym z zadań tylko jego „jestem pewny” dalej coś znaczyło.
tyle trafia Jev, gdy deklaruje pewność co najmniej 0,9 na najtrudniejszym z zadań. Haiku 4.5 przy tej samej deklaracji trafia w 66%. Na tym stoi reszta tego tekstu.
Po co komu model, który nie pisze
Większość automatyzacji z AI nie potrzebuje tekstu. Potrzebuje decyzji. Czy ten mail to reklamacja? Do którego działu przekazać zgłoszenie? Czy ten komentarz ukryć? Dziś robi się to tak, że duży model pisze odpowiedź zdaniami, a kod wyławia z niej jedno słowo. To działa, tylko jest wolne, drogie, a model czasem odpowie nie na temat.
Jev od firmy TypeSafe AI ten krok pomija. Zadaję pytanie, podaję dozwolone odpowiedzi i przy każdej dostaję prawdopodobieństwo, czyli liczbę od 0 do 1: jak mocno model stawia na tę odpowiedź. 1 to „na pewno”, 0,5 to rzut monetą. Na zdanie „No świetnie, trzeci raz w tym tygodniu kurier zostawił paczkę pod złymi drzwiami. Brawo wy.” odpowiedział: ironia 0,98, zadowolenie klienta 0,03.
+ pytanie
+ lista dozwolonych odpowiedzi
zadowolenie klienta 0,03liczby, od razu do porównania z progiem
+ pytanie
piszący
Taki model nie napisze maila ani podsumowania. Za to decyzję z listy podejmuje bez układania zdań, więc szybciej i taniej, a do automatu wpina się jak zwykłą funkcję: na wejściu tekst, na wyjściu liczby. Pytanie, czy po polsku te liczby są coś warte. Angielskie testy tego nie mówią.
Skąd wziąłem test
Jeszcze kilka lat temu komputer, który miał odróżnić pochwałę od skargi, trzeba było tego nauczyć: tysiące opinii oznaczonych ręcznie przez ludzi, potem trening modelu do tego jednego zadania. Żeby dało się porównać, czyj model rozumie język lepiej, powstały benchmarki: wspólne zestawy zadań z odpowiedziami od ludzi, na których każdy model zdaje ten sam test, i ranking wyników.
Polski benchmark tego typu nazywa się KLEJ. Przygotowali go w 2020 roku badacze z Allegro, dziewięć zadań. Razem z nim wypuścili HerBERT-a, polski model, który do każdego zadania uczy się osobno i w rankingu zajmuje drugie miejsce. Dzisiejsze modele podchodzą do tych samych zadań bez nauki, dostają samo pytanie. Dlatego KLEJ jest dobrą miarą: wiadomo, ile ma wyuczony specjalista, i widać, ile brakuje komuś z ulicy.
Wziąłem trzy zadania i z każdego wylosowałem 300 przykładów z części testowej, czyli tej, której modele nie dostają do nauki.
Opinie. Model czyta opinię o lekarzu albo hotelu i wybiera wydźwięk: pozytywny, negatywny, ambiwalentny albo neutralny. „Leczyłam się u niej parę lat i nic mi nie pomogła” to negatywny.
Szkodliwe wpisy. Model czyta wpis z Twittera i odpowiada tak albo nie: czy wpis kogoś atakuje, poniża albo zastrasza. Wulgarne narzekanie na korki szkodliwe nie jest, grzecznie sformułowana groźba jest.
Wynikanie zdań. Model dostaje dwa zdania, opisy zdjęć, i rozstrzyga, czy jedno wynika z drugiego, czy sobie przeczą, czy nie mają związku. Z „cztery ciemnoskóre osoby tańczą na scenie” wynika „cztery osoby tańczą”. „Dwoje dzieci wspina się po ściance” i „mężczyzna wspina się po skale” związku nie mają. To jedyne z trzech zadań, które wymaga logiki, nie tylko wyczucia słów.
Te same przykłady i te same pytania dostały obok Jeva trzy modele piszące: dwa tanie i szybkie (Claude Haiku 4.5 i Gemini 3.8 Flash) oraz jeden większy (Claude Sonnet 5). Wszystkie cztery szły przez tego samego pośrednika (Vercel AI Gateway), tą samą drogą sieciową, z tym samym stoperem. Pytania zapisałem, zanim zobaczyłem pierwszy wynik, żeby nie kusiło mnie poprawianie ich pod ulubieńca.
Wynik
Liczby w tabeli to odsetek trafnych odpowiedzi: 0,90 znaczy 90 trafnych na 100. Przy szkodliwych wpisach użyłem miary o nazwie F1, która karze i za przeoczenie szkodliwego wpisu, i za fałszywy alarm. Zwykły odsetek byłby tu mylący, bo szkodliwych wpisów jest w zbiorze tylko 13% i model odpowiadający zawsze „nie” miałby 87%. Czas to typowa długość jednej odpowiedzi mierzona z Polski. Koszt to cena z cennika za wszystkie 900 decyzji.
| Model | Opinie | Szkodliwe wpisy (F1) | Wynikanie zdań | Czas odpowiedzi | Koszt 900 decyzji |
|---|---|---|---|---|---|
| Jev | 0,900 | 0,612 | 0,880 | 0,45 s | 0,02 USD |
| Haiku 4.5 | 0,913 | 0,727 | 0,583 | 1,09 s | 0,66 USD |
| Gemini 3.8 Flash | 0,930 | 0,738 | 0,870 | 2,80 s | 1,11 USD |
| Sonnet 5 | 0,913 | 0,680 | 0,773 | 1,80 s | 1,78 USD |
| zawsze najczęstsza odpowiedź | 0,423 | 0,000 | 0,727 | ||
| HerBERT, wyuczony specjalista | 0,922 | 0,720 | 0,941 |
HerBERT to odniesienie, nie zawodnik: jest douczony na każdym zadaniu i oceniony na całej części testowej, a czwórka wyżej idzie bez przykładów, na próbce 300. „Zawsze najczęstsza odpowiedź” to wynik modelu, który nie czyta tekstu i odpowiada za każdym razem tak samo.
Na opiniach różnice między czterema modelami są mniejsze niż błąd pomiaru przy 300 przykładach, więc to remis. Wszystkie dorównują wyuczonemu specjaliście, bez żadnej nauki. Na szkodliwych wpisach Jev wypada najsłabiej z czwórki, choć przy 40 szkodliwych wpisach w próbce błąd pomiaru jest duży i różnice też się w nim mieszczą. Na wynikaniu zdań ma tyle co Gemini, a Haiku wypada gorzej, niż gdyby zawsze odpowiadał „bez związku”, co dałoby 0,73. Z 218 par bez związku Haiku uznał 66 za sprzeczne i 53 za wynikające, dopisuje zdaniom związek, którego nie ma.
TypeSafe reklamuje model jako 193 razy szybszy i 444 razy tańszy. U mnie wyszło od 2,4 do 6 razy szybciej i od 30 do 83 razy taniej. Dalej nieźle, tylko bez jednego zera. Z 0,45 s Jeva połowa to droga z Polski do serwera w USA, u dostawcy odpowiedź trwa 0,24 s. Gemini przed każdą odpowiedzią „myśli”, czyli po cichu pisze sobie kilkaset znaków rozumowania, i nie da się tego wyłączyć. Bez tego byłby szybszy i tańszy.
Pewność, na której da się postawić warunek
Jev nie odpowiada „ten wpis jest szkodliwy”. Odpowiada „szkodliwy: 0,93”. Po co komu ta liczba?
Weźmy automat, który moderuje komentarze. Gdy model jest pewny, automat ukrywa komentarz sam. Gdy nie jest, komentarz trafia do moderatora. W kodzie to jedna linijka: jeśli pewność wynosi co najmniej 0,9, działaj, w przeciwnym razie zapytaj człowieka. Ta linijka ma sens pod jednym warunkiem: 0,9 musi znaczyć, że model ma rację w dziewięciu przypadkach na dziesięć. Jeśli mówi 0,9 i myli się co trzeci raz, automat ukrywa niewinne komentarze i nikt tego nie widzi.
Sprawdziłem to tak, jak sprawdza się synoptyka, który zapowiada deszcz na 90%: zbieram jego zapowiedzi i liczę, jak często padało. Modele piszące też potrafią podać swoją pewność, jeśli je o to poprosić, więc porównałem wszystkie cztery.
Na opiniach i szkodliwych wpisach wszystkie cztery wypadły podobnie dobrze: deklarowana pewność rozjeżdża się z trafnością średnio o 3 do 6 punktów procentowych. Różnica wychodzi na wynikaniu zdań, czyli tam, gdzie zadanie robi się trudne. U Jeva rozjazd zostaje na 4 punktach. U Gemini i Sonneta rośnie do 9, u Haiku do 32. Gdy Haiku deklaruje co najmniej 0,9, trafia w 66% przypadków. Jev przy tej samej deklaracji trafia w 98%. Na liczbie Haiku takiej linijki postawić się nie da, a co gorsza, nie widać tego, dopóki ktoś nie sprawdzi.
Ceną jest to, że Jev często się waha. Z regułą „działaj sam od 0,9” na 300 opinii rozstrzygnąłby sam 236 i miał rację w 96% z nich, a 64 oddałby człowiekowi. Na szkodliwych wpisach i parach zdań sam rozstrzygnąłby około połowy, z trafnością 98%. Drugą połowę ktoś musi obejrzeć. Model, który nigdy się nie waha, załatwia wszystko sam, tylko nie wiadomo, co załatwił źle.
Trudne zdania są trudne dla wszystkich
Wróćmy do moderatora. Dostaje do przejrzenia to, przy czym Jev się wahał. Czy to trudne przypadki, czy kaprys jednego modelu?
Trudne. Tam, gdzie Jev jest pewny, wszystkie cztery modele trafiają podobnie: 0,98 do 0,99 na szkodliwych wpisach, około 0,96 na opiniach. Tam, gdzie Jev się waha, wszystkie cztery tracą od 10 do 30 punktów procentowych.
| Zadanie | Jev jest | Wierszy | Jev | Haiku 4.5 | Gemini 3.8 Flash | Sonnet 5 |
|---|---|---|---|---|---|---|
| opinie | pewny | 236 | 0,958 | 0,962 | 0,962 | 0,962 |
| niepewny | 64 | 0,688 | 0,734 | 0,812 | 0,734 | |
| szkodliwe wpisy | pewny | 148 | 0,980 | 0,993 | 0,993 | 0,993 |
| niepewny | 152 | 0,803 | 0,868 | 0,862 | 0,803 | |
| wynikanie zdań | pewny | 139 | 0,978 | 0,741 | 0,971 | 0,906 |
| niepewny | 161 | 0,795 | 0,447 | 0,783 | 0,658 |
Trafność każdego modelu na wierszach, przy których Jev deklaruje pewność co najmniej 0,9 („pewny”), i na pozostałych („niepewny”). Odsetek trafnych odpowiedzi także dla szkodliwych wpisów, nie F1.
To nie jest zasługa Jeva. Gdy tyle samo najmniej pewnych przykładów wskazuje dowolny z czterech modeli, pozostałe trzy tracą na nich podobnie. Wahanie modelu mówi o trudności zdania, nie o słabości tego, kto się waha. Jev daje ten sygnał za 2 centy i w pół sekundy, Gemini za 1,11 USD i w prawie trzy.
Z tego wynika rzecz mniej oczywista. Popularny pomysł „mały model odpowiada sam, a gdy nie jest pewny, pyta większego” prawie nic nie daje: na opiniach trafność rośnie z 0,900 do 0,927, na wynikaniu zdań nie rośnie wcale, bo większy model myli się na tych samych parach zdań co Jev. To, przy czym Jev się waha, powinien dostać człowiek.
Próg 0,9 wybrałem po obejrzeniu wyników, więc to obserwacja, nie prawo. Pierwszy kontrprzykład mam zresztą od razu, w następnej sekcji.
Gdzie Jev się wyłożył: pochwała przebrana za narzekanie
Osobno sprawdziłem pułapki polszczyzny: ironię, przeczenia, zdrobnienia i język urzędowy, razem 45 zdań. To za mało na twarde liczby, ale jeden wzór widać. Jev i Haiku nie łapią ironii odwróconej, czyli pochwały ubranej w narzekanie. „Straszna sprawa z tą piekarnią, człowiek kupił jedną drożdżówkę z agrestem i teraz musi specjalnie wysiadać dwa przystanki wcześniej xD” Jev uznał za opinię negatywną, z pewnością 0,93. Haiku też, z pewnością 0,75. Gemini i Sonnet odczytały zachwyt. Na cztery takie zdania Jev i Haiku pomyliły się po dwa razy, Gemini i Sonnet ani razu.
To jest rysa na dwóch poprzednich sekcjach i dlatego ją pokazuję. Dobrze ustawiona pewność mówi, jak często model się myli. Nie mówi, przy którym zdaniu. Przy progu 0,9 ta drożdżówka przeszłaby bez człowieka. Nawet uczciwe 0,93 znaczy, że na 100 takich decyzji kilka jest błędnych, a nie wiadomo które.
„Pewność mówi, jak często model się myli. Nie mówi, przy którym zdaniu.”
Co się nie potwierdziło i co zepsułem sam
Stabilność. Testy po angielsku podawały, że Jev zapytany kilka razy o to samo odpowiada dużo stabilniej niż modele piszące. Puściłem 100 przykładów po trzy razy. Jev zmienił zdanie przy 2, Haiku przy 4. Taka różnica mieści się w szumie.
Pierwszy wynik był do wyrzucenia i to był mój błąd. Na próbie 20 przykładów wszystkie cztery modele wypadły na wynikaniu zdań gorzej niż zgadywanie. Taki wynik u wszystkich naraz wskazuje wadę pytania, nie modeli. Pytałem, czy drugie zdanie wynika z pierwszego, a odpowiedzi w zbiorze dotyczą kierunku odwrotnego. Do tego założyłem, że oba zdania opisują to samo zdjęcie, a w zbiorze często opisują dwa różne i wtedy odpowiedź brzmi „bez związku”. Poprawiłem pytanie raz, obie wersje zapisałem (są w metodzie, na dole). Modele odpowiadały dobrze na źle zadane pytanie, a ja liczyłem im to jako błąd. W takim teście łatwiej zepsuć pytanie niż model.
Czego nie wiem
KLEJ wisi w sieci od 2020 roku, więc każdy z tych modeli mógł go widzieć podczas nauki i pamiętać odpowiedzi. Żeby to sprawdzić, potrzebowałem tekstów, których nie ma nigdzie. Zamówiłem 120 wypowiedzi u piątego modelu, którego nie mierzyłem (GPT-6 Astra): 30 długich opinii, 45 krótkich zwykłych i 45 pułapek z poprzedniej sekcji. Odpowiedzi do krótkich sprawdziłem sam, do długich drugi model, zanim któryś z mierzonych je zobaczył.
| Wydźwięk, trafność | Opinie z KLEJ-a (300) | Długie opinie (30) | Krótkie zwykłe (45) | Pułapki (45) |
|---|---|---|---|---|
| Jev | 0,900 | 1,000 | 1,000 | 0,889 |
| Haiku 4.5 | 0,913 | 1,000 | 0,956 | 0,911 |
| Gemini 3.8 Flash | 0,930 | 1,000 | 1,000 | 0,978 |
| Sonnet 5 | 0,913 | 1,000 | 1,000 | 0,978 |
Trzy prawe kolumny to teksty, których żaden model nie mógł widzieć. Przy 30 i 45 zdaniach błąd pomiaru jest duży: 0,889 i 0,978 na pułapkach to różnica, której taki test nie rozstrzyga.
Na tych tekstach żaden z czterech modeli nie wypadł gorzej niż na KLEJ-u, a długie opinie wszystkie cztery trafiły w komplecie, 30 na 30. Czyli wyniki z KLEJ-a nie biorą się z samej pamięci. Więcej z tego nie wynika: opinie pisane przez model są łatwiejsze od prawdziwych, bo na przykład same zapowiadają, że plusy i minusy ważą tyle samo. Wynik 100% to sufit, na którym różnicy nie widać. Uczciwą kontrolą byłyby prawdziwe opinie opublikowane po tym, jak te modele skończyły naukę, z odpowiedziami od człowieka. Tego nie zrobiłem.
Dwie rzeczy jeszcze. W 34 przykładach z 900 nie trafił żaden model i w większości dyskusyjna jest tam odpowiedź zapisana w zbiorze, nie polszczyzna modeli. Pewność Jeva porównuję z liczbą, którą model piszący sam wpisuje do odpowiedzi, bo do jego wewnętrznych prawdopodobieństw nie miałem dostępu. To dwie różne wielkości. Porównuję tylko to, czy na każdej da się postawić próg.
Gdybym budował taki automat jutro
Do decyzji z gotową listą odpowiedzi nie trzeba dużego modelu. Na opiniach model za 2 centy zremisował z modelem za 1,78 USD. Różnica wychodzi w czasie i w rachunku, nie w trafności.
Liczbę „na ile jesteś pewny” biorę od modelu zawsze. Ale zanim postawię na niej próg, sprawdzam ją na stu własnych przykładach z odpowiedziami, które znam. To godzina roboty i jedyny sposób, żeby wiedzieć, co znaczy 0,9 u konkretnego modelu na konkretnym zadaniu. Haiku na opiniach trzyma słowo, na wynikaniu zdań nie, i z zewnątrz nie widać, które z tych dwóch dostałem.
To, czego model nie jest pewny, idzie do człowieka. Większy model myli się w tych samych miejscach, więc kaskada do droższego modelu kupuje głównie spokój sumienia.
Gdy wynik wygląda źle, najpierw czytam własne pytanie. U mnie cztery modele naraz wyglądały na głupie przez jedno moje zdanie.
Metoda, żeby dało się powtórzyć
Pomiar z 20 września 2026, wszystkie cztery modele przez Vercel AI Gateway, jeden klucz, klient w Polsce, serwery w USA. Cały pomiar, z próbami, powtarzalnością i zdaniami kontrolnymi, kosztował 4,70 USD. Szczegóły dla kogoś, kto chce to powtórzyć, poniżej.
Próbka, modele, pytania, miary
Próbka: 300 wierszy z części testowej publicznych zbiorów KLEJ allegro/klej-polemo2-in (opinie), allegro/klej-cbd (szkodliwe wpisy) i allegro/klej-cdsc-e (wynikanie zdań), ziarno losowania 20260920. Szkodliwe wpisy losowane warstwowo, w proporcji zbioru (40 szkodliwych, 260 nie), żeby F1 dało się porównać z rankingiem KLEJ.
Modele: typesafe-ai/jev, anthropic/claude-haiku-4.5, google/gemini-3.8-flash, anthropic/claude-sonnet-5. Modele piszące dostają to samo kryterium i wymuszony schemat JSON z dwoma polami, odpowiedź i pewność od 0 do 1, przy temperature 0. Gemini z reasoning.effort ustawionym na none i tak zużywa ok. 170 tokenów rozumowania na wiersz. Jev dostaje tekst jako state i mapę pytań, każde z polami type, instructions i criteria (lista dozwolonych odpowiedzi), żądaniem POST na ścieżkę /typesafe/v1/systemone pośrednika. Jego pewność to prawdopodobieństwo wybranej odpowiedzi z rozkładu, dla tak/nie większe z p i 1 minus p, zaokrąglone przez API do 0,01. Pole confidence z odpowiedzi Jeva opisuje kształt rozkładu, nie szansę trafienia, i do kalibracji nie wchodzi. Pośrednik nie oddaje prawdopodobieństw tokenów modeli piszących (logprobs wraca jako null). Pośrednik nie nalicza dziś za Jeva nic, w tabeli jest cena z cennika: 0,042 USD za milion tokenów wejścia.
Czas: mediana na żądanie przy czterech żądaniach równolegle, w dwóch wariantach: pełne żądanie z Polski i czas z metadanych pośrednika („u dostawcy”). Przy ponowionym żądaniu liczy się udana próba.
Pytania po polsku, zapisane przed pierwszym wynikiem. Jedno zmienione raz, po próbie na 20 wierszach (Jev 0,60, pozostałe 0,35 do 0,40, najczęstsza klasa 0,73). Pierwotne brzmienie dla wynikania zdań: „Oba zdania opisują scenę ze zdjęcia. Przyjmij, że zdanie A jest prawdziwe. Co z tego wynika dla zdania B?”. Użyte w pomiarze: „Zdania to opisy zdjęć. Mogą opisywać to samo zdjęcie albo dwa różne. Przyjmij, że zdanie B jest prawdziwe. Co z tego wynika dla zdania A?”. Kierunek sprawdzony na 40 parach z etykietą „wynika” z części treningowej, ocenionych ręcznie: A wynika z B w 17, w obie strony w 20, B wynika z A w 2, w żadną w 1.
Miary: trafność i F1 klasy „szkodliwy”, 95% przedziały ufności metodą bootstrap (przy wyniku 100% dokładny przedział Cloppera-Pearsona). Błąd kalibracji ECE: 10 równych kubełków po pewności odpowiedzi. Żadnej nieparsowalnej odpowiedzi nie było. W 34 wierszach z 900 nie trafił żaden model: 12 par zdań z etykietą „bez związku”, 8 opinii z etykietą „ambiwalentna”, 9 wpisów. Kaskada Jev plus Gemini przy progu 0,9: opinie 0,900 do 0,927 przy 21% wierszy wysłanych dalej, szkodliwe wpisy F1 0,612 do 0,707 przy 51%, wynikanie zdań 0,880 do 0,873 przy 54%. Z Sonnetem zysk mniejszy, na wynikaniu zdań 0,807.
Powtarzalność: 100 wierszy (34 + 33 + 33), trzy przebiegi, ustawienia domyślne dostawcy, bez ustawionej temperatury. Jev nie jest deterministyczny: rozrzut pewności na wiersz średnio 0,018, największy 0,11. Zdania kontrolne: 120, napisane 20 września 2026 przez gpt-6-astra, etykiety zaproponował model piszący, wiersze 1 do 90 zweryfikował człowiek, 91 do 120 Claude Fable 5.1 (ta sama rodzina co Haiku i Sonnet, więc ta grupa może im sprzyjać), obie weryfikacje przed obejrzeniem odpowiedzi i bez zmiany etykiet. Pytania ogólniejsze niż w KLEJ-u („wypowiedź”, nie „opinia o lekarzu albo hotelu”), też zapisane przed wynikami. Pułapki: ironia 12, przeczenie 13, zdrobnienie 11, pismo urzędowe 9. Szkodliwość na zdaniach kontrolnych: 120 na 120 u wszystkich czterech, bo szkodliwe wypowiedzi pisane przez model zawierają jawne obelgi, więc ta część nic nie rozstrzyga.
Źródła zewnętrzne: ranking KLEJ (wyniki HerBERT large) · KLEJ: Comprehensive Benchmark for Polish Language Understanding, ACL 2020 · hasła „193x szybciej, 444x taniej” z materiałów TypeSafe AI.
Masz decyzję, którą dziś klika człowiek?
Reklamacje, zgłoszenia, komentarze, faktury do przypisania. Napisz, co to za decyzja i ile razy dziennie zapada. Odpowiem, czy automat da radę i gdzie musi zostać człowiek.
Napisz, co chcesz zautomatyzować albo zmierz najpierw swoją stronę: darmowy raport