Odpal benchmark lokalnie
Ollama + nasz skrypt MCQ na 200 pytaniach, zgłoś wynik.
Wejdź na dowolnym poziomie. Każde zadanie małe, sprawdzalne, mierzone na held-out. Metodyka: /trening.
Ollama + nasz skrypt MCQ na 200 pytaniach, zgłoś wynik.
Licencja, schemat, czy publiczny (kolejka vs zamknięte).
Oznacz śmieci, popraw odpowiedzi. Jakość > ilość.
Nowy publiczny zbiór: mapowanie pól do harnessu.
Treści, tłumaczenia, drobne fixy UI.
n-gram/embedding overlap korpusu vs zbiory testowe.
Dostrojenie 11–14B na 1 GPU, wynik na held-out.
Zbiór „lepsza/gorsza" (człowiek lub sędzia-LLM).
Pipeline Magpie/Evol-Instruct + filtr jakości.
mergekit (TIES/DARE/SLERP), pomiar na held-out.
Świeży zestaw (najnowsze CKE/PES) — anty-benchmaxxing.
Pełny alignment, porównanie wariantów, raport.
RL z weryfikowalną nagrodą. Killer pod target.
„Brak podstawy w dokumencie", RAG-aware.
Doczytanie korpusu PL przed SFT.
Polski słownik + init embeddingów.
Łańcuchy CoT z mocnego nauczyciela.
YaRN pod długie akta, profilowanie compute.
Jak zacząć: wybierz zadanie, odezwij się na Discordzie, weź je „na siebie". Wynik liczy się tylko, gdy jest odtwarzalny i mierzony na held-out.