dla kontrybutorów

Zadania — od prostych po zaawansowane

Wejdź na dowolnym poziomie. Każde zadanie małe, sprawdzalne, mierzone na held-out. Metodyka: /trening.

Początkujący

kilka godzin · zero treningu
01

Odpal benchmark lokalnie

Ollama + nasz skrypt MCQ na 200 pytaniach, zgłoś wynik.

eval
02

Zweryfikuj dataset

Licencja, schemat, czy publiczny (kolejka vs zamknięte).

dane
03

Czyść / anotuj instrukcje PL

Oznacz śmieci, popraw odpowiedzi. Jakość > ilość.

dane
04

Dodaj loader MCQ

Nowy publiczny zbiór: mapowanie pól do harnessu.

evalkod
05

Poprawki strony / docs

Treści, tłumaczenia, drobne fixy UI.

strona

Średnio

trochę kodu/compute · pierwszy trening
06

Skrypt dekontaminacji

n-gram/embedding overlap korpusu vs zbiory testowe.

daneeval
07

QLoRA SFT (mały zbiór)

Dostrojenie 11–14B na 1 GPU, wynik na held-out.

trening
08

Pary preferencji (DPO)

Zbiór „lepsza/gorsza" (człowiek lub sędzia-LLM).

danetrening
09

Dane syntetyczne

Pipeline Magpie/Evol-Instruct + filtr jakości.

dane
10

Model merging

mergekit (TIES/DARE/SLERP), pomiar na held-out.

treninginfra
11

Prywatny held-out

Świeży zestaw (najnowsze CKE/PES) — anty-benchmaxxing.

evaldane

Zaawansowane

pełne treningi · RL · infra
12

DPO / ORPO full + ablacje

Pełny alignment, porównanie wariantów, raport.

trening
13

GRPO / RLVR na egzaminach

RL z weryfikowalną nagrodą. Killer pod target.

treninginfra
14

Trening odmowy / grounding

„Brak podstawy w dokumencie", RAG-aware.

treningdane
15

Continued pre-training PL

Doczytanie korpusu PL przed SFT.

trening
16

Tokenizer PL

Polski słownik + init embeddingów.

treninginfra
17

Distylacja rozumowania

Łańcuchy CoT z mocnego nauczyciela.

trening
18

Long-context + koszt

YaRN pod długie akta, profilowanie compute.

infra

Jak zacząć: wybierz zadanie, odezwij się na Discordzie, weź je „na siebie". Wynik liczy się tylko, gdy jest odtwarzalny i mierzony na held-out.