EUWardenAI SDLC · narzędzia
Warsztat narzędziowy procesu

Z czego korzysta agent

Dwie klasy narzędzi, dwie różne role. Narzędzia kontekstowe dają agentowi tanie i trafne rozumienie kodu — bez czytania repozytorium plik po pliku. Systemy autorytatywne trzymają prawdę i dowody: etap, kod, testy, projekt. A każdy system ma trzy możliwe ścieżki integracji — wybierane świadomie, per przypadek.

01Narzędzia kontekstowe

Drabinka: struktura → semantyka → litery

Agent schodzi po drabince od najtańszego trafnego narzędzia i zatrzymuje się na pierwszym, które odpowiada na pytanie. Równolegle działają dwa filtry kosztów: rtk przycina wyjście komend, zanim trafi do modelu, a caveman kompresuje samą komunikację modelu.

PYTANIE o kod / system codegraph STRUKTURA — graf symboli, wywołania, blast radius semble SEMANTYKA — szukanie po znaczeniu, kod + docs rg (ripgrep) LITERY — dokładny wzorzec, weryfikacja końcowa ODPOWIEDŹ — stop przy pierwszym trafieniu brak trafienia brak trafienia wyjście komend git · cargo · testy · CI rtk filtr tokenów MODEL −60–90% tokenów OSOBNE TORY: koszt kontekstu i komunikacji wypowiedzi modelu raporty · przekazania · statusy caveman kompresja stylu CZŁOWIEK / AGENT −75% tokenów
Kolejność ma znaczenie: graf struktury odpowiada najtaniej i najpewniej, semantyka łapie nieznane nazewnictwo, litery domykają weryfikację. rtk i caveman działają w poprzek — pierwszy tnie koszt każdej komendy, drugi koszt każdej wypowiedzi.

Struktura koducodegraph

Lokalny graf wiedzy o kodzie: symbole, wywołania, przepływy. Jedno zapytanie zwraca źródło funkcji razem z tym, kto ją woła — z prekomputowanego indeksu, nie z czytania plików. Dostępny dla agentów jako MCP i jako CLI.

  • odpowiedzi w milisekundy z gotowego grafu — duża oszczędność tokenów i rund
  • dokładny: parsuje kod, nie zgaduje; widzi blast radius zmiany
  • źródło + wywołujący w jednym wywołaniu
  • wymaga zindeksowania repozytorium; indeks nadąża ~1 s za zapisami
  • pokrycie zależne od wsparcia języka
npm i -g @colbymchenry/codegraph github.com/colbymchenry/codegraph

Semantykasemble

Wyszukiwanie semantyczne po kodzie i dokumentach: „gdzie jest logika ponawiania płatności" — bez znajomości nazw funkcji i plików. Najlepsze pierwsze wejście w obce repozytorium.

  • znajduje po znaczeniu, nie po literach — łapie nietypowe nazewnictwo
  • działa na kodzie i tekstach (specyfikacje, ADR-y) jednocześnie
  • mierzy własną oszczędność tokenów (semble savings)
  • wyniki probabilistyczne — trafienie trzeba zweryfikować
  • indeks embeddingowy do zbudowania; wolniejszy niż grep
uv tool install semble github.com/MinishLab/semble

Dokładny wzorzecrg (ripgrep)

Błyskawiczny grep nowej generacji: dokładne dopasowania, wyrażenia regularne, weryfikacja końcowa hipotez z dwóch poprzednich szczebli drabinki.

  • najszybszy w swojej klasie; wynik deterministyczny
  • zero konfiguracji i utrzymania — standard branżowy
  • idealny do „potwierdź, że X występuje dokładnie tu"
  • tylko litery — nie rozumie struktury ani znaczenia
  • „nie znalazł" nie znaczy „nie istnieje" — inne nazewnictwo umyka
brew install ripgrep github.com/BurntSushi/ripgrep

Koszt konteksturtk

Proxy CLI, które filtruje wyjście komend deweloperskich (git, kompilacja, testy), zanim trafi do modelu. Hook przepisuje wywołania transparentnie — agent nie musi o nim wiedzieć.

  • 60–90% mniej tokenów na typowych operacjach dev
  • transparentny dla agenta; analityka oszczędności (rtk gain)
  • licencja Apache-2.0, dystrybucja przez Homebrew
  • filtr potrafi uciąć istotny szczegół — do debugowania tryb surowy (rtk proxy)
  • dodatkowa warstwa pośrednia w torze komend
brew install rtk rtk-ai.app

Koszt komunikacjicaveman

Plugin wymuszający ultra-skompresowany styl wypowiedzi modelu — „mów jak mądry jaskiniowiec": bez ozdobników i grzeczności, z pełną treścią techniczną. Działa na raportach, statusach i przekazaniach między agentami; trzy poziomy kompresji (lite / full / ultra).

  • ~75% mniej tokenów na wypowiedziach przy zachowanej dokładności technicznej
  • auto-wyłączenie tam, gdzie precyzja języka jest krytyczna: ostrzeżenia bezpieczeństwa, potwierdzenia nieodwracalnych akcji; kod, commity i PR zawsze normalnym językiem
  • komplementarny do rtk: rtk tnie wejście (wyjście komend), caveman wyjście (prozę modelu)
  • styl wymaga przyzwyczajenia; fragmenty zdań bywają ryzykowne przy złożonych sekwencjach
  • nie kompresuje kontekstu wejściowego — nie zastępuje narzędzi z drabinki
/plugin marketplace add JuliusBrussee/caveman github.com/JuliusBrussee/caveman
02Systemy procesu

Każda prawda ma swój system

Te systemy nie służą do „czytania kodu" — one trzymają stan i dowody. Agent może mieć ulotny kontekst, ale prawda o etapie, kodzie, testach i projekcie żyje w systemach autorytatywnych i daje się odtworzyć po restarcie. Wiążąca jest rola w procesie, nie nazwa produktu — poniżej nasz zestaw; u klienta wchodzą jego odpowiedniki.

Jira

prawda o etapie procesu

Statusy cyklu życia, wpisy bramek (ANALYSIS GATE: PASS 8f3c21ab), decyzje i pełna historia audytowa każdego zgłoszenia.

dostęp: REST API przez skrypt · MCP · skill z polityką

GitHub + Actions

prawda o kodzie i CI

Pull requesty, review, merge wyłącznie przez bramkę. CI na własnej puli runnerów buduje dowody: testy, lint, skany — przypięte do konkretnego SHA.

dostęp: gh CLI · git worktrees (izolacja równoległej pracy)

QMetry

prawda o testach

Wyniki testów z CI trafiają do cykli testowych — historia pokrycia i regresji nie ginie w logach buildów, tylko ma swój audytowalny rejestr.

dostęp: API wywoływane ze skryptu w pipeline

Playwright

dowody E2E interfejsu

Testy przeglądarkowe: przepływy logowania, smoke tras, porównania zrzutów ekranu. Artefakty stają się dowodem weryfikacji UI przy bramce.

dostęp: testy w repozytorium, uruchamiane w CI

Figma

źródło projektu UX

Agent czyta i adnotuje projekty bezpośrednio: specyfikacje komponentów i tokeny designu zasilają Analizę i Architekturę bez ręcznego przepisywania.

dostęp: MCP (praca interaktywna z plikiem projektowym)

n8n

automatyzacje wokół procesu

Self-hosted orkiestracja przepływów: bramki zatwierdzeń, ponawianie, integracje między systemami — tam, gdzie automatyzacja nie wymaga pełnego agenta.

dostęp: dedykowana rola utrzymująca definicje workflow

Skanery bezpieczeństwa

prawda o podatnościach

Cztery kategorie: skan zależności, analiza statyczna, testy dynamiczne, skan obrazów kontenerów — u nas odpowiednio cargo audit, clippy, OWASP ZAP i Trivy. Wyniki przypięte do konkretnego SHA stają się dowodem bezpieczeństwa przy bramce weryfikacji.

dostęp: wyspecjalizowana rola security + CI; wynik ląduje jako dowód bramki
03Trzy ścieżki integracji

Skrypt, MCP czy skill — wybór per przypadek

Do każdego systemu prowadzą trzy drogi o różnych właściwościach. Dojrzały proces nie wybiera jednej „najlepszej" — dobiera ścieżkę do charakteru pracy: deterministycznej, interaktywnej albo objętej polityką.

AGENT rola procesu SYSTEM np. Jira SKRYPT / CLI deterministycznie · headless · audyt MCP interaktywnie · schematy narzędzi SKILL / WRAPPER polityka: auth · kontrakt błędów · claim
Ten sam system, trzy kontrakty dostępu. Ścieżka skryptowa niesie bramki procesu, MCP niesie pracę interaktywną, skill dokłada politykę tam, gdzie sam dostęp to za mało.
ŚcieżkaKiedyZaletyOgraniczenia
Skrypt / CLI tory dostawy: bramki, przejścia statusów, merge — wszystko, co musi być powtarzalne i rozliczalne deterministyczny i fail-closed
tani w tokenach
działa headless i w cron
utrzymanie własnego kodu
sztywny zakres operacji
MCP praca interaktywna: eksploracja zgłoszeń, praca z plikiem projektowym, sesje z człowiekiem pełne schematy operacji bez sklejania shella
bogata, dwustronna interakcja
uwierzytelnianie per sesja — potrafi zniknąć w przebiegach headless
narzut tokenowy schematów narzędzi
Skill / wrapper gdy dostęp musi nieść politykę: preflight auth, jednolity kontrakt błędów, blokada podwójnej pracy reguły egzekwowane w jednym miejscu
spójne komunikaty błędów dla całego systemu ról
dodatkowa warstwa i latencja
kolejny artefakt do utrzymania

Zasada: ścieżka wybierana per przypadek, nie per moda. Tory dostawy jeżdżą na skryptach (determinizm + audyt), praca interaktywna na MCP, a skill wchodzi tam, gdzie potrzebna jest polityka — nie sam dostęp. Jedno jest stałe: dowody zawsze lądują w systemie autorytatywnym, nigdy w pamięci agenta.

04Runtime'y agentów

Kto wykonuje pracę: dwa runtime'y i drabinka modeli

Role procesu to definicje — wykonuje je runtime agentowy. Używamy dwóch, celowo różnych: interaktywnego do orkiestracji i decyzji oraz headless do masowej implementacji. Trzecim elementem jest drabinka modeli: proste zadania idą do najtańszego modelu, który przechodzi bramki.

Orkiestracja i decyzjeClaude Code

Runtime interaktywny Anthropic (działa też headless). U nas: warstwa Dyrektorów — orkiestracja dostawy, decyzje, praca z operatorem — oraz subtaski agentowe tam, gdzie zadanie wymaga mocnego modelu.

  • najsilniejsze modele do trudnych decyzji i niejednoznacznych zadań
  • bogaty ekosystem: MCP, subagenci, hooki, pamięć trwała między sesjami
  • ten sam runtime w pracy z człowiekiem i w automatyzacji (tryb headless)
  • koszt tokenów przy długich sesjach — wymaga dyscypliny kontekstu
  • siła konwersacyjna kusi, by dyskutować zamiast domykać bramki — proces musi to egzekwować
npm i -g @anthropic-ai/claude-code claude.com/claude-code

Implementacja headlessCodex CLI

Runtime wykonawczy OpenAI. U nas: główna linia implementacyjna — Dyrektor wysyła pakiet zadania, runtime wykonuje go autonomicznie w sandboksie i oddaje gałąź z dowodami.

  • długie, autonomiczne przebiegi bez nadzoru — dobry na ciężkie joby
  • sandbox z jawną kontrolą uprawnień (zapis plików, dostęp do sieci)
  • dobra relacja koszt/efekt na dobrze zdefiniowanych pakietach
  • domyślne blokady sandboksa (np. sieć) trzeba świadomie skonfigurować
  • słabszy interaktywnie; wynik i tak przechodzi te same bramki — jak każdy
npm i -g @openai/codex github.com/openai/codex

Tani szczebel drabinkiDeepSeek

Modele o koszcie tokenów rzędy wielkości niższym, zgodne z API OpenAI. Rola w drabince: mechaniczne, dobrze zdefiniowane zadania idą do taniego modelu; eskalacja do mocniejszego następuje dopiero po porażce na bramce.

  • koszt tokenów rzędy wielkości niżej — proste zmiany niemal za darmo
  • API zgodne z OpenAI — wpina się w istniejące tory bez przeróbek
  • wyraźnie słabszy w zadaniach wymagających rozumowania — granica użycia musi być twarda
  • u nas obecnie w rezerwie: proste zadania przejęły tańsze subtaski runtime'u interaktywnego
platform.deepseek.com api-docs.deepseek.com

Podział pracy: decyzje i orkiestracja — runtime interaktywny; masowa implementacja — runtime headless; mechaniczne zmiany — najtańszy model, który przechodzi bramki. Niezależnie od runtime'u obowiązują te same bramki i te same dowody. Dodatkowo każdą rewizję PR recenzuje niezależny bot AI na GitHubie — głos spoza obu ekosystemów, traktowany jako opinia, nie jako werdykt bramki.

Porozmawiajmy o narzędziach Prezentacja procesu → Wyniki → Demo przebiegu → Ścieżka wdrożenia → Architektura procesu → FAQ →