Home News 국제 “말 많은 챗GPT 지쳤다”… 한마디도 안 하고 ‘O·X’만 찍는 AI가 뜬다

“말 많은 챗GPT 지쳤다”… 한마디도 안 하고 ‘O·X’만 찍는 AI가 뜬다

자체 벤치마크서 최대 193.6배 빠르고 444.6배 저렴… 오픈AI 출신 연구자가 ‘판단 전문 AI’ 만든 까닭

판단 전문 AI 제브의 기존 LLM 대비 처리 속도와 비용 효율을 보여주는 비교 그래픽
타입세이프가 공개한 자체 워크플로 평가에서 판단형 AI ‘제브(Jev)’는 특정 업무 기준 기존 LLM 방식보다 최대 193.6배 빠르고 444.6배 저렴한 결과를 보였다. 그래픽=미디어원·자료=TypeSafe AI

요즘 인공지능(AI)은 지나치게 친절하다.

“내일 비가 올까?”라고 가볍게 물어도 강수 확률만 알려주는 법이 없다. 출근길에 우산을 챙기라는 당부부터 감기 조심하라는 인사까지 줄줄이 붙인다. 식당 하나를 물어보면 분위기와 특징을 길게 설명하고, 짧은 이메일 한 줄을 부탁해도 격식을 갖춘 서두와 결문으로 화면을 채운다.

화려한 언변을 뽐내는 생성형 AI의 전성기 한가운데서 정반대 방향으로 달리는 모델이 등장했다. 말을 거의 하지 않는 AI, ‘제브(Jev)’다.

이 AI에게 “이 문자, 스팸인가?”라고 물으면 미사여구는 돌아오지 않는다. ‘스팸일 가능성 98%’처럼 판단 결과와 확률을 내놓는다. “이 고객 문의는 어디로 넘길까?”라고 묻는다면 결제·배송·기타처럼 미리 정해둔 선택지 가운데 가능성이 높은 답을 골라준다. 미국 AI 스타트업 타입세이프(TypeSafe AI)가 공개한 제브는 사람과 오래 대화하기보다 소프트웨어 안에서 빠르게 판정을 내리도록 설계한 ‘시스템 원(System One)’ 모델이다.

계란값 셈하는데 슈퍼컴퓨터… “서술형 대신 OMR 카드”

제브의 등장 배경을 이해하려면 지금 기업들이 AI를 쓰는 방식을 생각해 보면 쉽다. 복잡한 법률 계약서를 검토하거나 사업계획을 세울 때는 강력한 AI가 필요하다. 그러나 택배 상자에 서울행인지 부산행인지 표시하는 일까지 가장 비싸고 거대한 AI에게 맡길 필요는 없다.

지금까지는 장문의 보고서와 기획안을 쓸 수 있는 거대언어모델(LLM)을 불러 단순한 ‘예·아니오’나 A·B·C 분류까지 맡기는 경우가 적지 않았다. 계란 한 판 가격을 계산하는 데 슈퍼컴퓨터를 가동하는 셈이다.

시험으로 비유하면 챗GPT나 클로드는 서술형 답안지를 길고 유려하게 채우는 데 강한 학생이다. 제브는 OMR 카드에서 가장 가능성이 높은 답을 빠르게 찾아내는 객관식 전문 선수에 가깝다.

타입세이프는 이런 방식을 ‘타입화된 결정(Typed Decision)’이라고 설명한다. 결과가 자유로운 문장이 아니라 미리 정해진 데이터 형태로 나오기 때문에 다른 프로그램이 답을 다시 해석하거나 요약하지 않고 곧바로 다음 작업에 사용할 수 있다는 것이다.

긴 문장을 순차 생성하는 기존 LLM과 선택지별 확률을 출력하는 판단형 AI 제브 비교 그래픽
기존 거대언어모델이 문장을 순차적으로 생성하는 것과 달리 제브는 미리 정의된 선택지와 확률·신뢰도를 구조화된 값으로 출력한다. 그래픽=미디어원·자료=TypeSafe AI

최대 193.6배 빠르고 444.6배 저렴… 숫자의 의미는

판단 전문 AI가 주목받는 가장 큰 이유는 비용과 속도다.

개인이 하루 몇 차례 AI에게 질문하는 수준에서는 큰 차이를 느끼기 어렵다. 하지만 금융회사가 수백만 건의 거래를 검사하고, 온라인 쇼핑몰이 대량의 고객 문의를 분류하며, 수많은 AI 에이전트가 매 순간 다음 행동을 정해야 한다면 작은 비용 차이도 엄청난 규모로 불어난다.

타입세이프가 공개한 자체 벤치마크에 따르면 특정 분류·판단 업무에서 제브는 기존 LLM 기반 방식보다 최대 193.6배 빠르고 444.6배 저렴한 결과를 냈다. 회사가 공개한 입력 가격은 100만 토큰당 0.042달러이며 출력 토큰에는 별도 요금을 매기지 않는다.

다만 이 숫자는 타입세이프가 선정한 특정 System One 업무 환경에서 나온 자체 평가 결과다. 모든 업무에서 언제나 193배 빠르고 444배 저렴하다는 의미로 받아들여서는 안 된다. 중요한 것은 정확히 몇 배냐보다 단순 판단까지 가장 큰 AI에 맡기던 구조가 바뀌기 시작했다는 점이다.

Q. 제브가 챗GPT보다 더 똑똑한 AI인가?

A. 그렇게 단순 비교하기는 어렵다. 제브는 긴 글을 쓰거나 자유로운 대화를 하고 복잡한 문제를 여러 단계로 풀어가는 모델이 아니다. 이미 정해져 있는 선택지 가운데 무엇이 가장 적절한지를 빠르게 판단하는 데 특화돼 있다.

여행 계획을 만들고 보고서를 작성하고 자료를 종합하는 일은 챗GPT 같은 생성형 AI가 맡고, “스팸인가 아닌가”, “어느 부서로 보낼 것인가”, “이 거래를 추가 검사할 것인가” 같은 판단은 제브 같은 모델이 맡는 식의 분업이 가능하다.

Q. 그럼 챗GPT 같은 생성형 AI는 필요 없어지나?

A. 오히려 역할이 더 분명해질 가능성이 크다. 사람과 이야기하고 글을 쓰고 복잡한 맥락을 이해하는 일은 여전히 생성형 AI의 영역이다. 반대로 답이 몇 가지 선택지로 정해져 있는 반복 업무는 더 작고 빠른 모델로 넘길 수 있다.

사람 회사에서 모든 일을 최고경영자 한 사람이 처리하지 않는 것과 비슷하다. 앞으로 AI 서비스 안에서도 생성·추론·판단·검색·실행을 서로 다른 모델과 프로그램이 나눠 맡는 구조가 늘어날 수 있다.

Q. ‘환각 제로’라면 제브는 절대 틀리지 않나?

A. 아니다. 이 부분은 구분해서 볼 필요가 있다. 타입세이프가 강조하는 ‘Zero Hallucinations’는 미리 정해놓은 출력 형식을 벗어나 갑자기 엉뚱한 문장을 길게 만들어내지 않는다는 의미에 가깝다.

스팸 문자를 정상 문자로 잘못 분류하거나 고객 문의를 다른 부서로 보낼 가능성까지 사라지는 것은 아니다. 그래서 실제 시스템에서는 판단 결과와 함께 신뢰도 점수를 활용해 자동 처리 여부를 정할 수 있다. 확신이 높은 업무는 자동으로 넘기고 애매한 사례는 더 강력한 AI나 사람에게 다시 확인시키는 방식이다.

말 잘하는 AI 만든 연구자가 왜 ‘말하지 않는 AI’를 만들었나

제브를 만든 디오고 알메이다(Diogo Almeida)의 이력도 눈길을 끈다. 그는 오픈AI의 InstructGPT 연구 공동저자로 참여했다. 사람의 피드백을 이용해 AI가 인간의 지시를 더 잘 따르도록 만드는 RLHF 연구와 맞닿아 있는 인물이다.

사람과 더 자연스럽게 대화하는 AI의 발전 과정에 참여했던 연구자가 이제는 반대로 ‘대화할 필요가 없는 AI’를 들고나온 셈이다.

그 배경에는 AI가 실제 소프트웨어 속으로 깊숙이 들어갈수록 모든 작업에 긴 문장이 필요하지 않다는 문제가 있다. 고객센터 라우팅, 이메일 분류, 이상거래 감지, 콘텐츠 승인, AI 에이전트의 다음 행동 선택처럼 현실의 소프트웨어에는 하루에도 수없이 많은 작은 결정이 발생한다.

우리가 자동차 내비게이션에 원하는 것도 아름다운 여행 에세이가 아니다. 이번 교차로에서 좌회전할지 우회전할지를 빠르고 정확하게 알려주는 판단이다.

앞으로 사람 눈앞에서는 챗봇이 여전히 유창하게 말을 이어가겠지만, 그 뒤에서는 짧고 값싸게 수많은 결정을 처리하는 ‘말하지 않는 AI’가 더 많이 움직일 가능성이 크다. AI 경쟁의 무대가 ‘누가 말을 더 잘하나’에서 ‘누가 필요한 판단을 더 빠르고 경제적으로 처리하나’까지 넓어지고 있다.

뉴스레터 구독미디어원 뉴스레터 서비스 준비 중입니다회원가입미디어원 회원 서비스 준비 중입니다
Previous article괌정부관광청, 대한항공 스타링크 기내광고 도입과 함께 괌 알린다