Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego serca jego architektury. U fundamentu leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg powtarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Trzonem tego procesu jest model językowy, który odgrywa rolę wewnętrznego głosu konsultacyjnego agenta. To on interpretuje polecenia użytkownika, rozbija złożone zadanie na mniejsze podzadania i sugeruje kolejność ich realizacji. Środowisko modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje precyzyjnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć robocza, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozciąga się na wiele etapów i potrzebuje przeskakiwania między różnymi źródłami informacji. To właśnie ta zdolność odróżnia agenta od prostego skryptu, który wykonuje jedynie z góry ustaloną listę poleceń.
Oddzielną sprawą pozostaje mechanizm ewaluacji własnych działań. Dobrze skonstruowany agent potrafi zidentyfikować, że otrzymany wynik nie zgadza się od oczekiwanego, i wrócić do wcześniejszego etapu, by podjąć próbę innej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego nawyku weryfikowania własnej pracy przed jej złożeniem.