본문으로 건너뛰기
AI 브리핑룸
목록으로

AI BRIEFING

초당 770토큰 LLM, 업무에 쓸 조건

Mercury 2.5는 병렬 생성 방식으로 매우 높은 출력 속도와 26만 토큰 컨텍스트를 제시하지만, 품질·지연·가용성을 함께 검증해야 실무 도입이 가능합니다.

AI 브리핑룸 · AI 보조 작성
약 10분
AI 활용 및 검증 범위AI가 제공된 자료로 초안을 만들고 출처·중복·구조를 자동 검사했습니다. 직접 사용하거나 전문가가 검토했다는 의미는 아닙니다.

[!IMPORTANT] 한 줄 브리핑: Mercury 2.5는 병렬 생성 방식으로 매우 높은 출력 속도와 26만 토큰 컨텍스트를 제시하지만, 품질·지연·가용성을 함께 검증해야 실무 도입이 가능합니다.
분야: IT/AI/Security


30초 요약

Mercury 2.5의 핵심은 ‘더 똑똑한 모델’이라는 단일 주장보다, 응답을 빠르게 내보내는 생성 방식과 긴 컨텍스트를 결합했다는 점입니다. Inception은 이 모델이 표준적인 한 토큰씩 생성하는 방식 대신 여러 토큰을 병렬로 다듬는 확산(diffusion) 방식으로 응답을 만든다고 설명합니다. Inception 공식 소개

공개 비교 자료에서는 초당 약 770~780토큰의 출력 속도가 언급됐습니다. 다만 첫 토큰이 나오는 시간은 출력 속도와 다른 지표이고, 지능 평가 점수는 비교 집단 중앙값보다 낮게 나타났다는 점도 함께 확인해야 합니다. GeekNews 정리

실무적으로는 긴 문서를 한 번에 읽고 요약하는 작업, 코드 초안·변환을 빠르게 반복하는 작업, 결과 형식이 고정된 내부 자동화에 먼저 검토할 만합니다. 반대로 정확한 판단, 복잡한 추론, 규제 문서의 최종 검토처럼 품질 손실 비용이 큰 업무는 기존 주력 모델과 반드시 병행 평가해야 합니다.

확인된 사실

생성 방식과 모델 범위

Inception은 Mercury 2.5를 확산 기반 추론 모델이라고 소개합니다. 일반적인 자기회귀(autoregressive) 모델이 왼쪽에서 오른쪽으로 토큰을 하나씩 생성하는 것과 달리, Mercury 2.5는 여러 토큰을 동시에 생성한 뒤 반복적으로 결과를 개선하는 방식이라고 설명합니다. Inception 공식 소개

Baseten의 모델 설명도 같은 구조를 언급하며, Mercury 2.5가 Mercury 2보다 코딩, 지시 따르기, 수학적 추론, 지식 회상 성능을 강화했고, 도구 호출(tool use)과 구조화된 출력(structured output)을 지원한다고 적고 있습니다. 여기서 구조화된 출력은 JSON처럼 미리 정한 형식에 맞춰 결과를 받는 기능을 뜻합니다. Baseten 모델 라이브러리

속도와 지연

GeekNews가 인용한 비교 자료에서는 Mercury 2.5의 출력 속도가 Inception API 기준 초당 780.8토큰으로 제시됐고, 비슷한 가격대 추론 모델의 중앙값은 초당 111.9토큰으로 정리됐습니다. 이 수치는 모델이 첫 응답을 시작한 뒤 토큰을 내보내는 속도에 가까운 지표이지, 사용자가 요청을 보낸 순간부터 결과를 받기까지의 전체 시간과 동일하지 않습니다. GeekNews 정리

같은 자료에서 첫 토큰까지 걸리는 시간(time to first token)은 3.06초로, 비교 대상 중앙값 2.20초보다 길게 나타났습니다. 즉, 응답이 시작된 뒤에는 매우 빠를 수 있지만, 첫 화면에 결과가 나타나는 시점까지는 반드시 더 빠르다고 말할 수 없습니다. GeekNews 정리

컨텍스트, 가격, API 특성

Mercury 2.5는 26만 토큰의 컨텍스트 창을 지원하는 것으로 소개됩니다. 컨텍스트 창은 입력과 출력에 모델이 함께 처리할 수 있는 최대 토큰 규모이며, 실제 출력 가능 토큰 수와는 별도입니다. Krater의 모델 페이지에는 26만 토큰 컨텍스트와 최대 6만 5,500토큰 출력이 표시돼 있습니다. Krater 모델 정보

가격은 자료와 제공 경로에 따라 표시가 다릅니다. GeekNews가 정리한 비교 자료에는 100만 입력 토큰당 0.25달러, 출력 토큰당 0.75달러가 언급됐습니다. 반면 Krater의 Mercury 2.5 Preview 페이지에는 입력 0.20달러, 출력 0.75달러가 표시돼 있습니다. 따라서 비용 예산을 세울 때는 모델 이름만 보고 고정 가격을 가정하지 말고, 실제 사용할 API 제공자의 가격표와 청구 단위를 확인해야 합니다. GeekNews 정리 Krater 모델 정보

Baseten은 기존 OpenAI API와 호환되는 방식으로 연결할 수 있어 기존 호출 구조를 크게 바꾸지 않고 검토할 수 있다고 설명합니다. 또한 긴 문서, 도구를 사용하는 에이전트, 구조화된 응답, 지연시간에 민감한 작업을 적합한 용도로 제시합니다. Baseten 모델 라이브러리

품질과 공개 상태

GeekNews가 소개한 Artificial Analysis Intelligence Index에서는 Mercury 2.5가 12점, 비슷한 가격대 추론 모델의 비교 중앙값이 13점으로 정리됐습니다. 이 지표에는 추론, 지식, 수학, 코딩과 관련된 여러 평가가 포함되지만, 특정 기업의 실제 업무 정확도를 직접 보장하는 점수는 아닙니다. GeekNews 정리

Mercury 2.5는 텍스트 입력·출력 중심 모델로 소개되며, 이미지 입력이나 멀티모달 처리는 확인된 자료의 범위에 포함되지 않습니다. 모델 가중치와 파라미터 수 역시 공개되지 않은 독점 모델로 설명됩니다. GeekNews 정리

자료 사이에는 제공 상태를 다르게 읽을 수 있는 부분도 있습니다. Krater 페이지는 Mercury 2.5 Preview를 더 이상 해당 경로에서 사용할 수 없는 ‘Retired model’로 표시합니다. 반면 Baseten은 Mercury 2.5의 모델 라이브러리와 API 호출 예시를 제공하고 있습니다. 따라서 ‘사용 가능하다’는 결론은 모델 자체가 아니라 지역, 제공업체, 계정, 시점별 엔드포인트를 기준으로 다시 확인해야 합니다. Krater 모델 정보 Baseten 모델 라이브러리

실무 판단

속도는 ‘처리량’과 ‘체감 응답성’으로 나눠 보자

초당 수백 토큰이라는 숫자는 긴 답변을 끝까지 출력하는 시간과 대량 요청의 처리량을 줄이는 데 의미가 있을 수 있습니다. 그러나 사용자가 체감하는 반응성은 첫 토큰까지의 시간, 네트워크 왕복, 도구 호출, 검색, 후처리까지 합친 값입니다. 이번 자료처럼 첫 토큰 지연이 비교 중앙값보다 길다면, 짧은 질의응답에서는 기대만큼 빠르게 느껴지지 않을 수 있습니다.

따라서 도입 판단의 첫 질문은 “초당 몇 토큰인가?”가 아니라 “우리 업무에서 출력 시간이 전체 대기시간의 어느 부분을 차지하는가?”여야 합니다. 긴 코드 생성이나 대량 문서 변환이라면 출력 속도가 중요하지만, 검색·승인·외부 API 호출이 많은 에이전트라면 모델 속도만 높여도 전체 시간이 크게 줄지 않을 수 있습니다.

긴 컨텍스트는 입력 비용과 검증 부담을 함께 키운다

26만 토큰 컨텍스트는 여러 문서를 한 번에 넣거나, 대규모 코드베이스의 일부를 통째로 비교하는 설계에 매력적입니다. 하지만 긴 입력을 허용한다고 해서 모델이 모든 부분을 동일하게 이해하거나, 관련 근거를 정확히 찾아낸다는 뜻은 아닙니다. 긴 문서를 넣을수록 입력 토큰 비용, 검색 전처리 비용, 누락된 근거를 사람이 확인하는 비용도 함께 고려해야 합니다.

실무에서는 ‘전체 자료를 무조건 넣기’보다 검색으로 후보를 좁힌 뒤, 필요한 원문과 메타데이터만 전달하는 방식을 먼저 비교하는 편이 안전합니다. 긴 컨텍스트는 검색을 대체하는 기능이 아니라, 검색 결과를 더 넓은 맥락에서 판단할 수 있게 하는 선택지로 보는 것이 적절합니다.

가격보다 작업 단위 비용을 보자

입력 단가가 낮아도 매 요청마다 수만~수십만 토큰을 넣으면 총비용은 커질 수 있습니다. 반대로 출력 속도가 빨라 재시도나 대기 시간이 줄어들면 운영 비용이 낮아질 수도 있습니다. 그러므로 모델 가격표만 비교하지 말고, ‘완료된 업무 한 건’에 드는 비용을 계산해야 합니다.

권고하는 비교 단위는 다음과 같습니다.

판단 항목Mercury 2.5에서 볼 점함께 비교할 값
체감 속도첫 토큰까지의 시간, 전체 완료 시간검색·도구 호출·네트워크 포함 시간
대량 처리초당 출력 토큰, 동시 요청 처리량실패·재시도율, 큐 대기시간
품질코딩·수학·지시 준수 결과사내 정답률, 수정 시간, 검수 통과율
비용입력·출력 토큰 단가업무 한 건당 총 토큰과 재실행 비용
연동API 호환성, 도구 호출, 구조화 출력인증·로깅·오류처리 작업량

업무에 어떻게 쓸까

1단계: 빠른 출력이 실제 병목인지 측정

먼저 최근 업무 20~50건을 골라 요청부터 최종 완료까지의 시간을 기록합니다. 문서 요약, 코드 생성, 고객 응답 초안처럼 출력량이 다른 작업을 섞어야 합니다. 다음 네 시간을 분리하면 모델 교체 효과를 과대평가하기 어렵습니다.

  1. 요청 전처리와 검색 시간
  2. 첫 토큰까지의 시간
  3. 마지막 토큰까지의 생성 시간
  4. 사람이 수정·검수한 시간

이 중 3번이 전체 시간의 큰 비중을 차지하고, 결과 품질이 일정 수준 이상이면 Mercury 2.5 같은 고속 모델의 실익이 커집니다. 반대로 1번이나 4번이 대부분이면 모델만 바꾸는 방식의 효과는 제한적일 가능성이 큽니다. 이 문장은 자료에서 직접 확인된 사실이 아니라, 위 지표를 업무에 적용하기 위한 판단 기준입니다.

2단계: 저위험·반복 업무로 제한된 파일럿

첫 파일럿은 외부 발송 전 검수가 가능한 작업으로 한정합니다. 예를 들면 내부 문서의 형식 변환, 테스트 코드 초안, 긴 회의록의 항목별 요약, 정해진 JSON 스키마에 맞춘 분류 결과 등이 대상이 될 수 있습니다. 민감정보나 고객에게 즉시 전달되는 답변은 초기 범위에서 제외하는 편이 안전합니다.

프롬프트에는 입력 자료의 범위, 출력 스키마, 모르면 표시할 규칙, 인용해야 할 근거 위치, 실패 시 중단 조건을 명시합니다. 구조화된 출력이 지원되더라도 파싱 성공이 내용의 정확성을 보장하지 않으므로, 스키마 검증과 내용 검증을 분리해야 합니다.

3단계: 기존 모델과 블라인드 비교

동일한 입력과 동일한 도구 조건으로 Mercury 2.5와 현재 사용하는 모델의 결과를 비교합니다. 평가자는 모델 이름을 보지 않도록 하고, 정확성·누락·형식 준수·수정 시간·전체 처리 시간·건당 비용을 별도로 기록합니다. 평균만 보지 말고 최악의 오류 사례도 수집해야 합니다.

다음과 같은 간단한 운영 규칙을 둘 수 있습니다.

  • 속도 개선이 30% 이상이고 품질 저하가 허용 범위 이내면 제한적 확대
  • 품질은 비슷하지만 비용만 낮아지면 저위험 대량 처리에 우선 적용
  • 형식 오류나 근거 누락이 반복되면 프롬프트 수정 전에 모델 교체를 보류
  • 첫 토큰 지연 때문에 사용자 경험이 나빠지면 스트리밍 표시와 전체 완료 시간을 따로 재평가

수치 기준은 조직의 업무 특성에 맞춰 정해야 하며, 위 기준 자체는 권고안입니다.

4단계: 적합한 역할만 분리 배치

모델을 전면 교체하기보다 역할별 라우팅을 설계합니다. 빠른 초안 생성과 대량 변환은 Mercury 2.5 후보로 보내고, 법무·재무·보안과 관련된 최종 판단은 기존 검증된 모델 또는 사람 검토 단계로 남깁니다. 긴 문서를 처리할 때도 원문 전체를 자동 승인 근거로 사용하지 말고, 답변에 사용한 문서 구간과 페이지·문단 식별자를 함께 저장합니다.

중단 조건도 사전에 정합니다. 예를 들어 한 번의 재시도 이후에도 JSON 파싱이 실패하거나, 필수 근거가 누락되거나, 기준 모델보다 수정 시간이 늘어나면 해당 작업은 대체 모델 또는 사람 검토로 넘깁니다. 빠른 모델을 모든 요청에 강제하는 것보다 실패 경로를 명확히 하는 편이 운영에 유리합니다.

실행 체크리스트

1주 파일럿용 체크리스트

  • 대상 업무를 출력량·위험도·검수 가능 여부로 분류했다.
  • 기준 모델과 비교할 동일한 테스트 세트를 만들었다.
  • 첫 토큰 시간과 전체 완료 시간을 따로 측정한다.
  • 입력 토큰, 출력 토큰, 재시도 횟수, 건당 비용을 기록한다.
  • 정확성·누락·형식 준수·사람 수정 시간을 별도 점수로 남긴다.
  • 구조화된 출력의 파싱 오류와 내용 오류를 구분한다.
  • 민감정보를 파일럿 입력에 넣어도 되는지 보안 검토를 마쳤다.
  • 모델 제공 경로의 현재 가용성, 가격, 데이터 처리 조건을 확인했다.
  • 실패 시 대체 모델이나 사람 검토로 보내는 규칙을 구현했다.
  • 확대·보류·중단을 결정할 기준과 담당자를 정했다.

재사용 가능한 평가 기록 양식

업무명:
입력 규모(토큰 또는 문서 수):
기준 모델:
비교 모델:
첫 토큰까지 시간:
전체 완료 시간:
입력/출력 토큰:
건당 추정 비용:
정확성 및 누락:
형식 준수 여부:
사람 수정 시간:
가장 심각한 오류:
재시도 횟수:
결정: 확대 / 제한 적용 / 보류 / 중단
결정 근거:

이 양식의 목적은 속도 수치를 홍보 자료처럼 기록하는 것이 아니라, 한 업무를 끝내는 데 실제로 필요한 시간과 비용을 비교하는 데 있습니다.

한계와 주의점

첫째, 초당 780.8토큰과 비교 모델 중앙값은 특정 비교 자료의 측정 결과입니다. 요청 길이, 동시성, API 제공 경로, 스트리밍 설정, 하드웨어와 네트워크에 따라 재현되지 않을 수 있습니다. 실제 도입 전에는 조직의 대표 입력으로 직접 측정해야 합니다. GeekNews 정리

둘째, 첫 토큰까지 3.06초라는 값과 초당 출력 속도는 서로 다른 측정 항목입니다. 짧은 답변에서는 첫 토큰 지연이 더 중요할 수 있고, 긴 답변에서는 전체 완료 시간이 더 중요할 수 있습니다. 두 지표 중 하나만으로 사용자 경험을 판단하면 안 됩니다.

셋째, Intelligence Index 12점과 비교 중앙값 13점은 일반적인 복합 평가 결과이지, 특정 회사의 코드베이스나 사내 문서에 대한 정확도를 보장하지 않습니다. 특히 자료에 소개된 커뮤니티 논의에는 특정 프롬프트에서의 품질 의문이 제기돼 있지만, 단일 사례나 댓글은 체계적인 성능 평가로 볼 수 없습니다. Hacker News 논의

넷째, 자료에 표시된 제공 상태와 가격이 서로 다릅니다. Krater는 Preview를 은퇴 모델로 표시하는 반면, Baseten은 Mercury 2.5를 제공 가능한 모델로 설명합니다. 실제 사용자는 자신의 계정에서 엔드포인트, 모델 식별자, 지역별 접근 권한, 가격, 보존 정책, 도구 호출 지원 여부를 확인해야 합니다. Krater 모델 정보 Baseten 모델 라이브러리

다섯째, 모델 가중치와 파라미터 수가 공개되지 않았으므로 내부 구조나 자원 요구량을 자료만으로 판단할 수 없습니다. 또한 텍스트 중심 모델로 확인되는 만큼 이미지 입력이 필요한 업무에는 별도 모델이나 전처리 단계가 필요합니다. 데이터가 외부 API로 전송되는지, 로그에 입력과 출력이 얼마나 남는지, 업무상 비밀정보를 처리할 수 있는지는 제공업체 약관과 계약 문서로 추가 검증해야 합니다.

결론적으로 Mercury 2.5는 ‘가장 똑똑한 모델’로 즉시 교체할 대상이라기보다, 출력량이 많고 반복 수정이 잦은 업무에서 속도와 비용 구조를 다시 측정하게 만드는 후보입니다. 도입 판단은 초당 토큰 수가 아니라, 대표 업무의 완료 시간·검수 품질·총비용·현재 가용성을 함께 비교한 뒤 내려야 합니다.

참고자료