Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego serca jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw rejestruje informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten cykl odtwarza się kilkakrotnie, aż do uzyskania zamierzonego efektu.
Trzonem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu konsultacyjnego agenta. To on odczytuje polecenia użytkownika, rozbija złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Środowisko modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga konkretnych danych spoza swojej wiedzy treningowej.
Interesującym składnikiem architektury jest tak zwana pamięć operacyjna, w której agent trzyma tło bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przełączania między różnymi źródłami informacji. To właśnie ta zdolność wyróżnia agenta od podstawowego skryptu, który odtwarza jedynie z góry ustaloną listę poleceń.
Oddzielną kwestią pozostaje sposób ewaluacji własnych działań. Dobrze skonstruowany agent jest w stanie zidentyfikować, że otrzymany wynik odbiega od zamierzonego, i cofnąć się do poprzedniego etapu, by spróbować alternatywnej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego nawyku weryfikowania własnej pracy przed jej złożeniem.