Polish Linguistic and Cultural Competency Benchmark

Authors
Affiliation
Updated
20/09/2026

Benchmark ocenia kompetencje językowe i kulturowe modeli LLM w języku polskim. Obejmuje wiedzę o Polsce, język i pragmatykę, historię, geografię, kulturę i tradycję, sztukę, pamięć społeczną, etnografię, kompetencje obywatelskie oraz rozumienie tekstu.

Recently added models: v3.1-global_step_72 (high reasoning), v3.1-global_step_72 (max reasoning), v3.1-global_step_72 (low reasoning), v3.1-global_step_72 (medium reasoning), Apertus-8B-Instruct-2509

Leaderboard
CSVJSON
Category & task analysis
View:Pokazywane jest maks. 30 najczęstszych kolumn. Najedź na komórkę, aby zobaczyć n.
Wybrane pytania — porównanie modeli

20 zhardcodowanych wierszy benchmarku wybranych z zakresu 61–600. Zmienisz je ręcznie w SPOTLIGHT_ROW_INDICES. Kategorie są prezentowane w czytelnej formie, a pod każdym pytaniem pokazujemy przykładową prawidłową odpowiedź wynikającą z verifiera.