Benchmark ocenia kompetencje językowe i kulturowe modeli LLM w języku polskim. Obejmuje wiedzę o Polsce, język i pragmatykę, historię, geografię, kulturę i tradycję, sztukę, pamięć społeczną, etnografię, kompetencje obywatelskie oraz rozumienie tekstu.
Recently added models: v3.1-global_step_72 (high reasoning), v3.1-global_step_72 (max reasoning), v3.1-global_step_72 (low reasoning), v3.1-global_step_72 (medium reasoning), Apertus-8B-Instruct-2509
20 zhardcodowanych wierszy benchmarku wybranych z zakresu 61–600. Zmienisz je ręcznie w SPOTLIGHT_ROW_INDICES. Kategorie są prezentowane w czytelnej formie, a pod każdym pytaniem pokazujemy przykładową prawidłową odpowiedź wynikającą z verifiera.