에이전트 런타임을 아시나요?
API로 LLM을 호출하면 답은 잘 옵니다.
그런데 조금 복잡한 작업을 시키기 시작하면 이상해질 때가 있습니다.
답을 다시 넣고,
틀린 부분을 고쳐달라고 하고,
결과를 또 넣고 다시 검증합니다.
몇 번 왔다 갔다 하면 더 좋아질 것 같은데, 오히려 앞에서 했던 말을 잊거나 이미 해결한 걸 다시 건드리면서 점점 꼬이기도 합니다.
저도 처음에는 그냥 모델이 아직 멍청해서 그런가 생각했습니다.
그런데 Claude Code나 Codex를 써보면 느낌이 꽤 다릅니다.
코드를 읽고 → 수정하고 → 테스트하고 → 실패하면 다시 원인을 찾고 → 다시 수정합니다.
사람이 중간에서 계속 답을 복사해서 넣지 않아도 알아서 다음 작업으로 넘어갑니다.
차이는 모델만이 아니었습니다.
에이전트 런타임을 타고 있느냐도 꽤 큰 차이를 만듭니다.
API 호출과 에이전트 런타임은 뭐가 다를까?
일반적인 API 호출은 보통 이렇습니다.
사용자 → LLM → 답변
반면 에이전트 런타임은 답을 받은 뒤에도 작업을 이어갑니다.
요청 → 판단 → Tool 실행 → 결과 확인 → 다시 판단 → 완료
예를 들어
로그인 오류의 원인을 찾아서 수정하고 테스트까지 해줘.
라고 했을 때 단순 API 호출은 원인을 설명하는 데서 끝날 수 있습니다.
런타임이 있으면 실제 파일을 읽고, 코드를 수정하고, 테스트를 돌리고, 실패하면 다시 수정하는 흐름까지 이어갈 수 있습니다.
직접 런타임을 만들 필요도 없습니다
요즘은 OpenAI Agents SDK나 Claude Agent SDK, Tool Runner 같은 도구를 이용하면 비교적 간단하게 시작할 수 있습니다.
조금 더 복잡한 Agent, Workflow, Tool 구조가 필요하면 Mastra 같은 프레임워크를 쓰는 방법도 있습니다.
제가 더 관심 있게 보는 부분은 그 다음입니다.
런타임 안에서 사용할 모델까지 동적으로 바꾸는 것.
간단한 작업은 빠르고 저렴한 모델에 맡기고, 복잡한 설계나 분석이 필요할 때만 Claude나 GPT의 고성능 모델을 쓰는 식입니다.
모델을 선택하는 판단 자체는 Jev 같은 작은 Decision Model에 맡기면 비용도 더 줄일 수 있습니다.
결국 앞으로는
“GPT가 좋냐 Claude가 좋냐”보다
“어떤 작업을 어떤 모델에게 맡기고, 그 과정을 누가 끝까지 관리하느냐”
가 더 중요해질 수도 있을 것 같습니다.
에이전트 런타임이 정확히 무엇인지, 일반 API 호출과 어떻게 다른지, OpenAI·Claude에서 어떻게 적용하는지, 멀티모델 라우팅까지 블로그에 조금 더 자세히 정리했습니다.