ABTO강동혁 28 1
게시물 메뉴

AI 기능이 들어간 서비스를 만들다 보니 더 저렴한 모델로 바꾸고 싶은데 유저가 떠날까 봐 못 바꾸는 순간이 계속 찾아왔습니다. 어떤 기준으로 모델을 골라야 할지 답을 찾다가 직접 만든 것이 ABTO입니다. 만들면서 하나씩 정해 간 순서대로 이야기해 보려고 합니다.

1. 무엇을 기준으로 모델을 선택해야 할까요?

처음에는 모델사가 내놓는 벤치마크 점수와 비용 그래프를 기준으로 삼았습니다. 그런데 코딩이나 수학 점수가 높다고 해서 우리 서비스의 유저가 더 만족한다는 보장은 없더라고요.

정말 알고 싶었던 건 그 모델의 답을 받은 유저가 결제했는지, 다시 돌아왔는지였습니다. LLM 관측 도구는 비용을, 제품 분석 도구는 결제와 재방문을 보여 주지만, 둘을 이어서 보려면 매번 직접 맞춰 봐야 했습니다.

그래서 호출 비용과 유저 행동을 한 화면에 모았습니다. 무엇을 성과로 볼지는 기능마다 직접 정할 수 있게 했습니다. 글쓰기 기능이라면 초안을 저장하거나 공유한 비율을, 결제가 있는 서비스라면 모델별 결제율을 보는 식입니다.

abto_compare.png.jpg

2. 공정하게 비교하는 방법

같은 유저가 요청할 때마다 다른 모델의 답을 받으면, 그 유저의 행동이 어느 모델 때문인지 알 수 없게 됩니다. 그래서 같은 유저는 기기 기준으로 항상 같은 모델을 받도록 했습니다.

또 같은 서비스 안에서도 기능마다 결과가 다를 수 있어서, 기능 단위로 따로 비교할 수 있게 만들었습니다.

3. 새 모델은 유저 10%에게만 먼저 적용합니다

비교가 정확해도 모든 유저에게 한 번에 새 모델을 적용하는 건 부담스럽습니다. 그래서 나머지 유저는 지금 쓰는 모델을 그대로 받게 두고, 결과가 나빠 보이면 재배포 없이 바로 되돌릴 수 있게 했습니다.

기존 모델이 확실히 낫다는 결과가 나와도 의미가 있습니다. 지금 모델을 계속 쓸 근거가 생기기 때문입니다.

abto_routing.jpg

4. 연동은 에이전트가 합니다

막상 실험을 하려고 하면, 결제나 가입 같은 성과 이벤트를 코드에 심는 작업이 번거로워 미루게 되는 경우가 많았습니다. 그래서 이 작업을 에이전트에게 맡길 수 있도록 ABTO 스킬을 만들었습니다.

스킬을 설치하고 Claude Code나 Codex에 "/abto ABTO 연동해줘"라고 요청하면, 에이전트가 AI 호출 연결부터 결제와 가입 기록까지 5분 안에 끝냅니다.

베타에서 찾은 답

베타로 먼저 써 본 서비스에서는 이런 결과가 나왔습니다. 한 AI 채점 서비스는 추론을 가볍게, 해설을 간결하게 바꿨습니다. 비용은 41% 줄었는데 재응시율은 오히려 18% 올랐습니다.

비싼 모델과 긴 답변이 항상 최선인 것은 아니었던 셈입니다. 지금은 20개가 넘는 서비스가 ABTO에서 벤치마크 대신 자기 유저의 반응으로 모델을 고르고 있습니다.

카드 등록 없이 30일간 AI 호출 3만 건까지 무료라, 직접 만드신 서비스에서도 확인해 보실 수 있습니다. 써 보시고 아쉬운 점도 편하게 남겨 주세요.

https://abto.app/s/after-launch