Tłumaczenie maszynowe. Wiążący jest tekst angielski. English
Inżynier, dzięki któremu Twój agent AI może bezpiecznie działać na danych i pieniądzach klientów

Projektuję systemy i kieruję AI, które je buduje. PANTHEON jest jednym z nich: wielodostępny, zarządzany, opomiarowany, działający produkcyjnie, zbudowany w pojedynkę.

Zaprojektowałem PANTHEON, izolację multi-tenant, governance, pomiar zużycia, bezpieczeństwo agentów, od podstaw, a następnie pokierowałem AI przy budowie całości: w pojedynkę, aż do produkcji, na danych prawdziwych firm. Wnoszę myślenie systemowe potrzebne do zaprojektowania tego i dyscyplinę, by zmusić maszynę do udowodnienia, że działa.

Isaac Teague Frayling · Cardiff, UK · obywatel UK · gotowy do relokacji w dowolne miejsce na świecie (poza UK & Irlandią potrzebny sponsoring) · jednostronicowe CV →

↑ Grafika główna, favicon, awatar i karta społecznościowa na tej stronie zostały wygenerowane przez system, który zbudowałem. Praca stworzyła własne portfolio.

Zewnętrzne uznanie. Wymieniony jako zgłaszający (jeden z siedmiu) w CVE-2026-104850 (GHSA-6qxp-vccf-f47h), biuletynie bezpieczeństwa o wysokim stopniu ważności (CVSS 7.5) dotyczącym MCP TypeScript SDK: jego klient OAuth mógł wysyłać zapisane dane uwierzytelniające do serwera wybranego przez serwer MCP; naprawione w wersjach 1.31.0 i 2.2.0. Nie jest to potwierdzenie poprawności PANTHEON; to sprawdzian, któremu ktoś inny poddał moją pracę.

nie wierz mi na słowo

Każde twierdzenie tutaj prowadzi do sprawdzenia, które możesz uruchomić.

Bez slajdów, bez "zaufaj mi". System działa na żywo, spróbuj go złamać, a potem zleć przegląd stojącego za nim kodu w ramach NDA. To, co wdrożyłem, jest prawdziwe i działa, niezależnie od tego, czy napisałem z tego choć jeden znak.

wartość

Co naprawdę wnoszę.

Myślenie systemowe, które wytrzymuje atak

Zaprojektowałem ścisłą izolację tenantów opartą na row-level security w Postgres, z dwiema rolami, blokującą dostęp w razie błędu, przez którą żaden audyt nie przebił się na poziomie bazy danych. Poza nią znaleziono jeden wyciek (historia czatu, lipiec) i go naprawiono. Nie pisałem SQL. Zaprojektowałem model: tryby awarii, zasięg skutków, i prowadziłem budowę, aż to się utrzymało.

Projektuję nadzorowane AI, a nie klej z promptów

Nadzorowana pętla agenta, percepcja → wiedza → narzędzia → ocena → pomiar, z zabezpieczeniami, protokołem kryzysowym, pomiarem odpornym na debet i bramkami zatwierdzania przez człowieka, to mój projekt. Koncepcja warstwy sterowania jest moja, AI napisała kod według mojej specyfikacji.

Od pomysłu do produkcji, kierując AI

Substrat, Studio bez kodu, dedykowana sztuka generatywna, działający kanał Telegram (WhatsApp zbudowany, czeka na zatwierdzenie przez Meta), pomiar zużycia, uwierzytelnianie, własne domeny. Wszystko to mój pomysł, wszystko zbudowane przez kierowanie AI, od Postgres po piksele, wdrożone i działające, w pojedynkę.

Każę maszynie udowodnić swoją pracę

Każda zmiana musi przejść granicę czystości egzekwowaną w CI, liczba z ostatniego przebiegu CI testów, powtarzane audyty adwersaryjne, w których każde ustalenie było obalane, zanim zostało uwzględnione. Dobre kierowanie AI oznacza odmowę ufania mu, to jest właściwa umiejętność.

Osąd, nie tylko wynik

Wdrażam uczciwą wersję: każda liczba na stronie audytu ma własny przypis, strona mówi wprost, czego jeszcze nie rozwiązano, a bezpieczeństwo: wiadomość kryzysowa dociera do pomocy nawet przy zerowych kredytach, wygrywa z metryką. Wolę budzić zaufanie niż robić wrażenie.

Działam szybko, nie łamiąc gwarancji

Każda nowa funkcja zachowuje te same niezmienniki: harness z plikami wzorcowymi dowodzi, że zmiany są bezpieczne co do bajtu, rejestr edycji pozwala cofnąć każdą zmianę, a wszystko, co dodaje nową powierzchnię, przechodzi przed wdrożeniem kontradyktoryjny przegląd bezpieczeństwa. Działam szybko, nie pozwalając maszynie iść na skróty.

metoda

Jak buduję: szczera wersja.

Decyduję, co system musi gwarantować, a potem każę mu to udowodnić. Projektuję system i kieruję AI, które go buduje, a PANTHEON jest tego efektem. Czytam, oceniam i debuguję wszystko, co wytwarza maszyna; nie piszę implementacji od pustego pliku. Tak to wygląda w zarysie:

Czym się zajmuję

Zaprojektuj system od pierwszych zasad → podziel go na części, które AI może zbudować → pokieruj AI przy budowie każdej z nich → atakuj wynik, aż wytrzyma → wdróż go i utrzymuj na produkcji. To cała pętla, od początku do końca.

Koncepcje, które znam na wylot

Izolacja wielu najemców & granice zaufania · poziomy nadzoru & człowiek w pętli · atomowe rozliczanie zużycia & kontrola limitów · pętle agentów, narzędzia & zabezpieczenia · obrona przed prompt injection · myślenie o trybach awarii i zasięgu skutków. Wszystkie je zaprojektowałem. Po prostu mówię o nich zwykłym językiem, a nie żargonem.

Systemy, które wdrożyłem (i rozumiem od początku do końca)

Postgres z zabezpieczeniami na poziomie wierszy · usługi FastAPI · zarządzana pętla agenta · MCP, w obu kierunkach · frontendy React · wdrożenia Docker / nginx. Kierowałem budową i wiem, jak zachowuje się każdy element.

Jak pilnuję, żeby AI było uczciwe

granice czystości w CI · testy migawkowe z plikami wzorcowymi (golden-file) · liczba z ostatniego przebiegu CI testów przechodzi (ostatni przebieg CI) · powtarzane audyty adwersaryjne: audyt z 50 agentami i ponowny audyt z 14 perspektyw, najnowszy, w którym każde ustalenie jest obalane, zanim zostanie uwzględnione. Instynkt nieufności wobec pierwszej odpowiedzi maszyny to cała ta praca.

Dowody, od razu z zastrzeżeniem.

Wolę, żebyś ufał temu, co jest prawdziwe, niż żeby robiło na Tobie wrażenie to, co prawdziwe nie jest.

1umysł, bez zespołu* zaprojektowane i prowadzone w pojedynkę
CItestów przechodzi* ostatni przebieg CI, nie formalny dowód
6 → 0audyty · zero nierozwiązanych krytycznych* uruchamiane samodzielnie, nie przez stronę trzecią
na żywow produkcji, prawdziwi najemcy* pojedyncza instancja. Nie musiałem jej jeszcze skalować
2 → 1firm, jeden kręgosłup* platforma, nie demo, potwierdzone przez lint

decyzja, którą podjąłem źle

Jeden przykład, łącznie z moim własnym błędem.

Dwa tygodnie temu zdecydowałem, że angielskie wiadomości będę sprawdzać pod kątem sformułowań kryzysowych tylko stałą listą fraz, by oszczędzić większości wiadomości dodatkowego wywołania AI. Audyt z 25 września wykazał, że lista pomijała „I don't want to live anymore” i trzy inne częste sformułowania. Tego samego dnia odwróciłem tę decyzję: sformułowania kryzysowe trafiają teraz do sprawdzenia przez AI, wszystkie cztery są testami, które nie przechodziły na starym kodzie, a liczba zwykłych wiadomości płacących za dodatkowe wywołanie spadła z 4 na 32 do 1. Oszczędność była słuszna dla większości sprawdzeń i błędna dla tego jednego, w którym przeoczenie ma największe znaczenie.

uczciwa umowa

Co dostajesz, a czego nie.

Architekt + reżyser

Odpowiadam za myślenie systemowe i dostarczanie przy pomocy AI: decyduję, co zbudować, projektuję, jak ma to wytrzymać, i doprowadzam rzecz do wdrożenia. Połącz mnie z inżynierami, którzy odpowiadają za rzemiosło na poziomie linii kodu, za które ja nie odpowiadam, a masz pokryte obie połowy.

Dyscyplina, której AI sama z siebie nie ma

Każda istotna zmiana przechodzi przegląd adwersarialny; nigdy nie ufam pierwszej odpowiedzi maszyny. Dwie rzeczy, które dał ten odruch: lipcowy wyciek między tenantami, znaleziony w moim własnym audycie i teraz objęty testem regresyjnym, oraz komunikat bezpieczeństwa MCP SDK opisany wyżej, znaleziony w cudzym kodzie.

prośba

Czego szukam.

Jedna rola: osoba odpowiedzialna za granicę zaufania Twojego agenta AI. Izolacja tenantów, zatwierdzenia, pomiar zużycia, narzędzie, które ufa temu, kto je wywołuje: wyznaczam miejsca, w których może zawieść, wbudowuję gwarancję i dostarczam test, który ją potwierdza. Pracownik założycielski lub jeden z pierwszych w startupie, którego agent ma już kontakt z prawdziwymi klientami albo zaraz będzie miał. Jestem otwarty na relokację w dowolne miejsce na świecie dla właściwej roli i bardziej zależy mi na problemie i ludziach niż na tytule.

Dlaczego etat, a nie własny startup?

Uczciwe pytanie. Mógłbym pozyskać finansowanie na PANTHEON, ale dokładnie wiem, czego mu brakuje, i nie jest to budowa. To dystrybucja: sieć kontaktów i zasięg, by pokazać go firmom, dla których powstał, a tego nie mam i nie będę udawał. Wolę wnieść to do zespołu, który już ma taki zasięg, niż spędzić lata na stawaniu się założycielem, którym nie jestem. Samodzielna budowa dowiodła, że potrafię zaprojektować i wdrożyć całość. Samodzielne wprowadzenie go na rynek nigdy nie było planem, PANTHEON pozostaje aktywny jako dowód, a nie jako poboczny projekt rozpraszający moją uwagę.

dzień pierwszy

Wskaż mi problem, oto co zrobiłbym najpierw.

Nie „poznawaj realia przez kwartał”. Metoda, która zbudowała PANTHEON, skierowana na twój produkt:

Wyznacz granicę zaufania

Znajdź krawędzie tenancy / autoryzacji / zasięgu szkód i ustal, jak każda z nich zawodzi, zanim cokolwiek powstanie. Nie da się nadzorować czegoś, czego się nie narysowało, a rysowanie tego to moja praca.

Znajdź miejsca, gdzie bezpieczeństwo dodano na doczepkę

Znajdź zabezpieczenia dodane po fakcie: licznik, który pozwala na debet, akcję bez bramki, narzędzie, które ufa wywołującemu, i przeprojektuj je tak, żeby gwarancja była wbudowana, a nie doklejona.

Kieruj budową, potem to udowodnij

Napisz specyfikację, pokieruj AI, żeby to zbudowała, i wdróż to razem z kontrolą, która to dowodzi: testem, snapshotem, niezmiennikiem, żeby następna osoba mogła działać szybko bez udowadniania wszystkiego od nowa.

Porozmawiajmy.

Napisz mi, jaka to rola i co budujesz. Czytam każdego maila i odpowiadam w ciągu kilku dni, potem rozmowa, przegląd systemu na żywo i przegląd kodu w ramach NDA.

Wolisz najpierw coś posprawdzać, zanim napiszesz? Złam asystenta, zaatakuj izolację albo napisz do bota, wszystko działa na żywo.

Nie mam LinkedIna. Główny system jest prywatny: to działający system jest portfolio, ale sześć komponentów jest opublikowanych w PyPI i npm, rejestr defektów jest publiczny, metodę można odtworzyć, a ja jestem jedną z siedmiu osób wymienionych jako zgłaszający w biuletynie bezpieczeństwa MCP SDK o wysokiej wadze. Zobacz / pobierz moje CV →