#모집/홍보 #사업전략 #프로덕트
비싼 AI 모델, 우리 서비스에서도 값을 할까?

AI 기능이 들어간 서비스를 만들면서 가장 오래 붙잡고 있던 질문이 있습니다. "우리 서비스에 맞는 모델은 무엇일까?"

처음에는 가장 성능이 좋다는 모델을 붙였습니다. 유저가 늘면서 청구서가 무거워졌고, 더 저렴한 모델로 바꾸고 싶었지만 유저가 이탈할까 봐 결국 그대로 두었습니다. 이 글은 그 고민을 풀기 위해 ABTO를 만들면서 알게 된 내용을 정리한 것입니다.

벤치마크가 알려주지 않는 것

GPT-6.1 Sol이나 Opus 5.5 같은 최신 모델은 한 단계 아래 모델보다 토큰당 5배 비쌉니다. 모델사는 코딩과 수학 점수로 그 차이를 설명합니다.

하지만 서비스를 운영하는 입장에서 알고 싶은 것은 따로 있었습니다. 이 모델의 답을 받은 유저가 결제했는지, 다시 돌아왔는지입니다.

그런데 기존 도구들에서는 이를 확인하기 쉽지 않았습니다. LLM 관측 도구에서는 모델별 비용을, 제품 분석 도구에서는 결제와 재방문을 볼 수 있습니다. 두 데이터를 이어서 "이 모델을 쓴 유저가 결제했는가"를 확인하려면 매번 직접 맞춰 봐야 했습니다.

그러다 보니 모델 교체는 감에 의존하게 됐고, 한 번 정한 모델은 잘 바뀌지 않았습니다.

모델은 A/B 테스트로 고르기로 했습니다

새 모델은 일부 유저에게만 먼저 적용합니다. 성과가 같으면 더 저렴한 모델로 옮기고, 문제가 보이면 바로 되돌립니다. 기존 모델이 확실히 낫다는 결과가 나와도 의미가 있습니다. 지금 모델을 계속 쓸 근거가 생기기 때문입니다.

위 화면은 지금 쓰는 모델에 유저의 80%를 두고, 새 후보 두 개에 10%씩 보내는 설정입니다. 같은 유저는 기기 기준으로 항상 같은 모델을 받기 때문에, 이전 답변 경험이 다음 행동에 섞이지 않습니다. 결과가 나빠 보이면 재배포 없이 비중만 바로 되돌리면 됩니다.

무엇을 성과로 봐야 할까

무엇을 성과로 볼지는 기능마다 직접 정합니다. 글쓰기 기능이라면 생성한 초안 중 저장하거나 공유한 비율을, 채점 기능이라면 해설을 본 뒤 다시 풀어 보는 비율을 볼 수 있습니다.

기록은 간단합니다. 결제 버튼에 기록 한 줄만 넣어 두면, 결제한 유저가 어떤 모델의 답을 받았는지 ABTO가 이어서 기록합니다. 이 한 줄을 어디에 넣을지도 직접 찾을 필요 없이 에이전트에게 맡기면 됩니다.

벤치마크 순위와 유저의 순위는 달랐습니다

한 AI 채점 서비스는 추론을 가볍게, 해설을 간결하게 바꿨습니다. 비용은 41% 줄었는데 재응시율은 오히려 18% 올랐습니다.

한 AI 이력서 서비스는 초안과 첨삭에서 유저가 선호하는 모델이 서로 달랐습니다. 기능마다 다른 모델을 쓰자 비용은 28% 줄고 유료 전환율은 12% 올랐습니다.

비싼 모델과 긴 답변이 항상 최선인 것은 아니었습니다.

운영해 보며 알게 된 건, "어떤 모델이 좋은가"보다 "어느 기능에 어떤 모델이 맞는가"가 더 중요한 질문이라는 점입니다. 지금은 20개가 넘는 서비스가 ABTO에서 이 질문의 답을 자기 유저의 반응으로 찾고 있습니다.

비싼 모델이 값을 하는지는 유저가 압니다

모델을 고를 때 벤치마크 점수보다 먼저 볼 것은 우리 유저의 반응이었습니다. 매달 AI 비용이 부담스러운데 유저가 떠날까 봐 모델을 못 바꾸고 있다면, 일부 유저에게만 먼저 바꿔 보세요.

ABTO(앱토)
비용과 유저 반응을 한 화면에서 비교하는 AI 모델 A/B 테스트 도구입니다. 에이전트에 ABTO 스킬을 설치하고 "/abto ABTO 연동해줘"라고 요청하면 5분 안에 연동됩니다. 결제 수단 등록 없이도 30일간 AI 호출 3만 건까지 무료로 사용할 수 있습니다.
https://abto.app/s/benchmark-gap · contact@abto.app

링크 복사

강동혁 ABTO(앱토) · 기타

AI 비용, 벤치마크 말고 유저 반응으로 줄입니다

댓글 0
댓글이 없습니다.
추천 아티클
강동혁 ABTO(앱토) · 기타

AI 비용, 벤치마크 말고 유저 반응으로 줄입니다

0