EUWardenAI SDLC · wyniki
Proces oparty na dowodach — więc oto dowody

Wyniki z działającego procesu

Wszystkie liczby pochodzą z naszej własnej, codziennej dostawy — produkt bezpieczeństwa VaultPAM budowany w AI SDLC przez zespół, w którym większość ról pełnią agenci AI. Źródła podane przy każdej liczbie; metodologia na dole strony.

Stan na 26.08.2026 · źródła: GitHub (pull requesty) i Jira (zadania) · ~12 miesięcy dostarczania
01Tempo

Kod przestał być wąskim gardłem

6 162
scalonych pull requestów od startu procesu
GitHub · PR merged, cały okres
791
scalonych PR w ostatnich 30 dniach — średnio ~26 dziennie
GitHub · PR merged, 27.07–26.08
0,6 h
mediana czasu od otwarcia PR do scalenia
GitHub · ostatnie 1 000 merged PR (13.07–27.08)
93%
PR scalonych w mniej niż 24 godziny od otwarcia
GitHub · ostatnie 1 000 merged PR (13.07–27.08)
1297 marzec 733 kwiecień 1196 maj 1201 czerwiec 927 lipiec 715* sierpień
Scalone pull requesty miesięcznie (GitHub). * Sierpień — miesiąc w toku, stan na 26.08; to także miesiąc świadomej przebudowy samego procesu, prowadzonej tym samym trybem pracy.
02Kontrola

Tempo nie kosztuje kontroli

Mediana 0,6 h od PR do merge nie oznacza „nikt nie patrzy". Oznacza, że patrzą maszyny — od razu: werdykty, CI i bramki wykonują się w minutach, a nie czekają w kolejce na czyjś kalendarz.

4 979
zadań doprowadzonych do „Done" (z 5 732 utworzonych)
Jira · cały okres, bez 524 zadań „Won't Do"
529
zadań zamkniętych w ostatnich 30 dniach
Jira · resolved, 30 dni
68
zatrzymań na bramce QA — ok. 1,2% wszystkich zadań (68 z 5 732) wróciło do poprawki przed scaleniem, każde z własnym ticketem
Jira · tickety zatrzymań QA / wszystkie zadania
50
zdefiniowanych ról agentów — rdzeń to 11 ról opisanych w prezentacji, resztę stanowią specjalizacje domenowe, role doradcze i narzędziowe; kilkanaście aktywnych w commitach co miesiąc
repozytorium · definicje ról

68 zatrzymań QA to nie wstydliwa statystyka — to działający hamulec. Każde z nich to wada, która nie weszła do gałęzi głównej, ma nazwany powód i ticket, a praca wróciła do poprawki tą samą, audytowalną ścieżką. Zobacz taki zwrot krok po kroku w demo przebiegu.

03Metodologia

Skąd te liczby — i czego nie mówią

źródła
GitHub (pull requesty i czasy scalenia, API wyszukiwania) oraz Jira (zadania, statusy, tickety zatrzymań QA). Liczby zebrane 26–27.08.2026 (GitHub) i 31.08.2026 (Jira); strona jest aktualizowana ręcznie, nie na żywo. Metryki czasu scalenia liczymy na ostatnich 1 000 PR (ok. 6 tygodni), a nie na całym okresie — mierzą bieżący rytm dojrzałego procesu; wczesne miesiące jego budowy nie opisują stanu obecnego.
zakres
Jeden produkt (VaultPAM — PAM dla firm europejskich, standardy audytowe SOC 2 / ISO 27001), jeden zespół, ~12 miesięcy. To dostawa produkcyjna, nie benchmark ani projekt pokazowy.
czego nie mówią
Liczba PR nie mierzy wartości biznesowej — mierzy przepustowość i rytm. Mediana czasu scalenia nie mówi o trudności zadań. Nie publikujemy tu kosztów tokenów ani porównania z zespołem ludzkim, bo nie mamy równoległej grupy kontrolnej — takie porównanie robimy dopiero w pilocie u klienta, na jego linii bazowej.
weryfikowalność
Na życzenie pokazujemy te metryki na żywo — bez wybierania rodzynek: pełne listy PR, tickety zatrzymań i przebiegi zadań, na ekranie, z naszych systemów.
04Kontekst zewnętrzny

Nie tylko nasze liczby

Nasze metryki pochodzą z jednego zespołu — dlatego zestawiamy je z niezależnymi badaniami rynku. Wnioski nie są dla AI entuzjastyczne i naszym zdaniem słusznie: pokazują, co się dzieje, gdy szybkość nie ma procesu. W marcu 2026 DORA dopisała do tego drugą połowę — małe partie zmian, automatyczne testy i szybkie pętle informacji zwrotnej jako przeciwwagę dla destabilizacji. Każdą liczbę niżej można sprawdzić u źródła — linki są pod kartami.

DORA 2025 · Google Cloud · ~5000 respondentów, wrzesień 2025

Adopcja AI koreluje dodatnio z przepustowością dostarczania i nadal ujemnie z jego stabilnością. 90% badanych używa AI w pracy, ponad 80% odczuwa wzrost produktywności — a 30% ma niskie lub zerowe zaufanie do kodu generowanego przez AI.

Po co to cytujemy: to zmiana wobec DORA 2024, gdzie ujemna była także przepustowość. Luka się nie zamknęła, tylko przesunęła: prędkość wzrosła, stabilność za nią nie poszła. Bramki adresują dokładnie tę drugą połowę.

CodeRabbit · grudzień 2025 · 470 open-source PR (320 z udziałem AI, 150 ludzkich)

PR współtworzone przez AI: 10,8 problemu na PR wobec 6,5 w PR pisanych ręcznie — około 1,7×. W 90. percentylu PR-y z udziałem AI sięgają 26 problemów na zmianę, ponad dwukrotnie powyżej ludzkiej bazy.

Po co to cytujemy: kod agentowy wymaga twardszej weryfikacji, nie łagodniejszej. Nasze 68 zatrzymań QA (~1,2% zadań) to nie wstyd — to mechanizm, który te statystyki neutralizuje przed scaleniem.

METR · marzec 2026 · 296 PR agentowych ocenianych przez maintainerów

Decyzje maintainerów były średnio o 24 punkty procentowe niższe niż wynik automatycznego gradera SWE-bench. Kontrola: ręcznie pisane, znane-dobre łatki przechodziły grader w 100%, a akceptację recenzenta uzyskiwało 68% z nich.

Po co to cytujemy: zielone testy to nie jest decyzja o scaleniu — dla nikogo, nawet dla człowieka. Dla agentów luka jest o ~24 punkty szersza. Dlatego werdykt bramki wydaje u nas rola inna niż autor zmiany.

Zobacz te liczby na żywo Prezentacja procesu → Demo przebiegu → Ścieżka wdrożenia → Architektura procesu → Narzędzia procesu → FAQ →