Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw rejestruje informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten cykl powtarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę wewnętrznego głosu konsultacyjnego agenta. To on interpretuje polecenia użytkownika, dzieli złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Środowisko modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga precyzyjnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć robocza, w której agent trzyma tło bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy procedura rozkłada się na kilka etapów i potrzebuje przełączania między różnymi źródłami informacji. To właśnie ta zdolność odróżnia agenta od podstawowego skryptu, który odtwarza jedynie z góry ustaloną listę poleceń.
Osobną kwestią pozostaje mechanizm ewaluacji własnych działań. Dobrze skonstruowany agent jest w stanie rozpoznać, że otrzymany wynik odbiega od oczekiwanego, i wrócić do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego zwyczaju sprawdzania własnej pracy przed jej złożeniem.