Wszystkie liczby pochodzą z naszej własnej, codziennej dostawy — produkt bezpieczeństwa VaultPAM budowany w AI SDLC przez zespół, w którym większość ról pełnią agenci AI. Źródła podane przy każdej liczbie; metodologia na dole strony.
Mediana 0,6 h od PR do merge nie oznacza „nikt nie patrzy". Oznacza, że patrzą maszyny — od razu: werdykty, CI i bramki wykonują się w minutach, a nie czekają w kolejce na czyjś kalendarz.
68 zatrzymań QA to nie wstydliwa statystyka — to działający hamulec. Każde z nich to wada, która nie weszła do gałęzi głównej, ma nazwany powód i ticket, a praca wróciła do poprawki tą samą, audytowalną ścieżką. Zobacz taki zwrot krok po kroku w demo przebiegu.
Nasze metryki pochodzą z jednego zespołu — dlatego zestawiamy je z niezależnymi badaniami rynku. Wnioski nie są dla AI entuzjastyczne i naszym zdaniem słusznie: pokazują, co się dzieje, gdy szybkość nie ma procesu. W marcu 2026 DORA dopisała do tego drugą połowę — małe partie zmian, automatyczne testy i szybkie pętle informacji zwrotnej jako przeciwwagę dla destabilizacji. Każdą liczbę niżej można sprawdzić u źródła — linki są pod kartami.
Adopcja AI koreluje dodatnio z przepustowością dostarczania i nadal ujemnie z jego stabilnością. 90% badanych używa AI w pracy, ponad 80% odczuwa wzrost produktywności — a 30% ma niskie lub zerowe zaufanie do kodu generowanego przez AI.
Po co to cytujemy: to zmiana wobec DORA 2024, gdzie ujemna była także przepustowość. Luka się nie zamknęła, tylko przesunęła: prędkość wzrosła, stabilność za nią nie poszła. Bramki adresują dokładnie tę drugą połowę.
PR współtworzone przez AI: 10,8 problemu na PR wobec 6,5 w PR pisanych ręcznie — około 1,7×. W 90. percentylu PR-y z udziałem AI sięgają 26 problemów na zmianę, ponad dwukrotnie powyżej ludzkiej bazy.
Po co to cytujemy: kod agentowy wymaga twardszej weryfikacji, nie łagodniejszej. Nasze 68 zatrzymań QA (~1,2% zadań) to nie wstyd — to mechanizm, który te statystyki neutralizuje przed scaleniem.
Źródło: coderabbit.ai → State of AI vs Human Code Generation
Decyzje maintainerów były średnio o 24 punkty procentowe niższe niż wynik automatycznego gradera SWE-bench. Kontrola: ręcznie pisane, znane-dobre łatki przechodziły grader w 100%, a akceptację recenzenta uzyskiwało 68% z nich.
Po co to cytujemy: zielone testy to nie jest decyzja o scaleniu — dla nikogo, nawet dla człowieka. Dla agentów luka jest o ~24 punkty szersza. Dlatego werdykt bramki wydaje u nas rola inna niż autor zmiany.
Źródło: metr.org → Many SWE-bench-Passing PRs Would Not Be Merged