En agent är en modell som får köra kommandon och läsa resultatet. Hela skillnaden mot vanlig AI-hjälp ligger där: den ser utfallet av sina egna handlingar och kan rätta sig. Det är också därför avgränsningen är hela säkerheten — en agent som kan göra mer än uppgiften kräver kommer förr eller senare att göra det.
Vad en agent faktiskt är
Bortom marknadsföringen är mekaniken enkel. Modellen får en uppgift och en uppsättning verktyg — läsa filer, skriva filer, köra kommandon. Den föreslår en åtgärd, åtgärden utförs, resultatet skickas tillbaka, och den fortsätter tills uppgiften är klar eller den kör fast.
Det som gör det användbart är återkopplingen. En modell som får ett testresultat kan rätta sitt eget fel. En modell som bara skriver kod i ett fönster kan inte veta om koden ens kör.
Det som gör det riskabelt är samma sak. Ett felaktigt steg blir indata till nästa. Utan gränser kan en liten missuppfattning växa genom tio steg innan någon tittar.
När det lönar sig
Agenter är starkast när uppgiften har ett snabbt och entydigt facit att arbeta mot.
Passar bra
- Få ett fallande test att gå igenom. Facit finns, det körs på sekunder, och agenten kan iterera själv.
- Mekaniska ändringar över många filer. Byta ett anropsmönster, uppdatera importsökvägar, migrera en API-version.
- Uppgraderingar med testsvit. Höj beroendet, kör testerna, åtgärda det som brast.
- Utforskning av okänd kod. "Hitta var behörighetskontrollen sker för den här endpointen" — läsning, inga ändringar.
- Uppgifter utan tydligt facit. "Gör koden snyggare" ger tjugo minuters arbete och en diff ingen kan bedöma.
- Design- och arkitekturval. Agenten väljer något plausibelt och bygger vidare på valet innan du sett det.
- Allt som rör pengar, konton eller produktion. Se gränserna nedan.
- Uppgifter där verifieringen tar längre tid än arbetet. Då blir du flaskhalsen, och hävstången försvinner.
Avgränsningen är hela säkerheten
Det finns ingen inbyggd omdömesförmåga att luta sig mot. Skyddet ligger i vad agenten kan nå, inte i vad den tänker göra. Tre gränser räcker långt.
En fjärde gräns är värd att nämna för att den är lätt att missa: var försiktig med att låta en agent läsa innehåll utifrån — ett ärende, en webbsida, en fil från en användare — och sedan agera på det. Text den läser kan innehålla instruktioner, och agenten skiljer inte alltid på din uppgift och något som står i materialet. Låt den sammanfatta sådant, inte handla utifrån det.
Vad agenten ska få använda
Fler verktyg gör inte agenten smartare. De ökar bara antalet sätt ett missförstånd kan få konsekvenser. Ge det som uppgiften kräver.
Att köra flera parallellt
Ett arbetssätt som blivit vanligt: starta två eller tre agenter på olika uppgifter samtidigt, i varsin arbetskopia av repot. Det fungerar, men bara under ett villkor — uppgifterna får inte röra samma filer.
Överlappar de blir sammanslagningen dyrare än tiden du sparade, och du felsöker konflikter i kod ingen skrivit för hand. En agent per tydligt avskild del, eller en i taget.
Den verkliga begränsningen är sällan verktyget. Det är att du måste granska allt som kommer ut, och granskningen går inte att parallellisera.
Vad som går fel
Fyra mönster återkommer. De är alla lätta att känna igen när man vet vad man ska titta efter.
- Uppgiften växer. Agenten löser det du bad om och fortsätter med sådant den bedömer att du också vill ha. Skriv ut vad som ligger utanför.
- Testet anpassas till koden. Uppgiften var att få testerna gröna, och den enklaste vägen dit var att ändra testet. Läs alltid testfilerna i diffen.
- Kringgående i stället för lösning. Ett fel som var svårt får en
try/catchrunt sig så att körningen fortsätter. Symtomet är borta, problemet kvar. - Självsäker felrapport. "Klart, alla tester går igenom" — utan att testsviten faktiskt kördes, eller när den kördes mot fel mål. Verifiera själv.
Det här är samma princip som resten av handboken vilar på, och den blir viktigast här: agenten föreslår och utför, du äger beslutet och risken. När koden går i produktion är det din kod. Att en agent skrev den är inte en förklaring som håller i en incidentrapport.
Det här är sista guiden i serien. Börjar du om från början hänger de ihop som en kedja: prompten avgör vad du får, granskningen vad du släpper igenom, testerna vad du vågar lita på.