Token economics

온디바이스 오케스트레이션으로 클라우드 LLM 토큰 비용 절감

오피스 어시스턴트, 스킬 실행기, 지식베이스 질의 — 모든 호출은 두 번 지불합니다. 한 번은 금액으로, 한 번은 신호대잡음비로. 둘 다 얼마나 보내는지가 결정합니다. 이 노트는 검색·노이즈 제거·압축을 로컬 모델로 앞당겼을 때 무엇이 바뀌는지 계산 과정과 함께 정리합니다. 모든 가정에는 출처를 표기했습니다.

Bestom 엔지니어링 노트 — 자사 플랫폼·시스템 엔지니어가 엣지 추론 호스트에 대한 내부 검토에서 정리한 내용입니다. 모든 수치에 출처 라벨을 붙였습니다: [실측] 이번 검토에서 직접 실행, [공개] 벤더 공식 가격표 또는 벤더 실측 처리량, [가정] 대체 가능한 스캔 파라미터, [도출] 위 세 가지로부터의 계산값. 적용한 규모는 30명 × 연 22일 × 1인 1일 30회 = 월 19,800건입니다.

청구서는 요청이 사내망을 떠나기 전에 정해진다

로컬 오케스트레이션이 바꾸는 세 가지

어느 것도 모델을 더 똑똑하게 만드는 이야기가 아닙니다. 모두 '무엇을 읽게 할지'의 문제입니다.

입력 토큰이 청구서의 전부다

답변 한 번은 수백 토큰입니다. 그런데 대충 조립한 프롬프트는 수만 토큰입니다. pro 등급 정가 기준으로 입력은 미적중 4.50 위안/백만 토큰, 적중 시 0.15 위안, 출력은 13.50 위안입니다. 캐시된 입력은 미캐시 대비 30× 저렴합니다. 레버는 답변 쪽이 아닙니다.

신호대잡음비도 같은 레버다

작업에 실제로 필요한 것이 2,000 토큰인데 한 번의 호출이 70,400 토큰을 싣는다면, 모델이 읽는 내용 중 관련 있는 비율은 6.2%에 불과합니다. 나머지는 비용일 뿐 아니라 잘못된 구절에 끌려갈 기회입니다. 비용과 정확도가 같은 방향으로 움직이는 경우는 드물고, 활용할 가치가 있습니다.

필터링은 소형 모델의 일이다

검색·중복 제거·요약·프리픽스 고정에는 프런티어 모델이 필요하지 않습니다. 102.01 tok/s로 디코딩하는 기기(3B 모델의 엣지 AI 가속기 공개 실측값)는 수백 토큰의 정제된 컨텍스트를 몇 초 안에 만들어냅니다. 로컬 단계에서 지불하는 것은 지연 시간이고 금액이 아닙니다.

지식베이스메모리 / 노트로컬 오케스트레이터검색 · 중복 제거압축 · 프리픽스 고정정제된 컨텍스트4,000 tok클라우드인덱스는 1회 구축네트워크 경계기기에서 완결요청의 25%답변

그림 1 —— 각 단계가 실행되는 위치. 네트워크 경계를 넘는 것은 정제된 컨텍스트뿐입니다.

비용 모델

같은 예산, 세 가지 사용법

동일한 지식베이스, 동일한 질문, 동일한 팀. 다른 것은 오케스트레이션뿐입니다. 클라우드 비용은 pro 등급으로 계산하고, 온디바이스 방식은 자체 하드웨어도 계상합니다.

방식턴당 컨텍스트턴 수호출당 입력월 입력량클라우드+로컬 / 월
B1 —— 오케스트레이션 없음32,000 tok2.270,400 tok1,393.9 M tok6,078 위안
B2 —— 클라우드 측 RAG8,000 tok1.814,400 tok285.1 M tok1,372 위안
P —— 온디바이스 연동4,000 tok1.45,600 tok83.2 M tok503 위안

정직한 비교 대상은 B2입니다. 설계가 없는 경우와 비교하면 보기 좋은 숫자가 나오지만 아무것도 증명하지 못합니다. 따라서 아래 결론 수치는 모두 클라우드 측 RAG(대부분의 팀이 이미 운영하는 방식) 대비 값입니다.

63.3%클라우드 측 RAG 대비 절감률
869 위안월 기준 · 연 10,427 위안
50.0%컨텍스트 관련도, 25.0%에서 개선
B1 —— 오케스트레이션 없음6,078B2 —— 클라우드 측 RAG1,372P —— 온디바이스503위안 / 월

그림 2 —— 월 총비용(클라우드+로컬 하드웨어). 온디바이스 방식을 마지막에 둔 것은 가장 작기 때문입니다.

어디서 절감되는가

분해 분석: 각 메커니즘을 하나씩 끄기

네 가지 메커니즘은 상호작용하므로 기여도를 단순 합산할 수 없습니다. 의미 있는 값은 나머지 셋을 유지한 채 하나만 제거했을 때의 증가분입니다.

메커니즘비활성화 시 비용전체 기여 비중
프리픽스 고정 —— 캐시 적중률 10% → 65%+163 위안/월32%
컨텍스트 압축 —— 8,000 → 4,000 tok+139 위안/월27%
로컬 처리 —— 25%를 기기에서 완결+112 위안/월22%
턴 수렴 —— 1.8 → 1.4턴+96 위안/월19%

결론은 직관과 반대입니다. 최대 단일 요인은 컨텍스트 압축이 아니라 캐시 적중률이며, 32% 대 27%입니다. 캐시된 입력은 미캐시보다 30× 저렴하므로, 프롬프트 프리픽스를 바이트 단위로 불변하게 만드는 것이 더 짧게 만드는 것보다 효과적입니다. 토큰 수만 보는 팀은 더 큰 절반을 남겨 둡니다.

민감도

압축은 어디까지 해야 하는가

압축률은 고객 환경에서 가장 어긋나기 쉬운 가정이므로 단정하지 않고 스캔합니다. 효과는 비례하지 않습니다. 첫 번째 반감이 가장 크고 마지막 반감이 가장 작습니다.

턴당 컨텍스트B2 대비 압축비관련도비용 / 월B2 대비 절감
2,000 tok4.0×100.0%433 위안68.4%
3,000 tok2.7×66.7%468 위안65.9%
4,000 tok —— 모델 채택값2.0×50.0%503 위안63.3%
6,000 tok1.3×33.3%572 위안58.3%
8,000 tok —— 압축 없음1.0×25.0%642 위안53.2%
16,000 tok0.5×12.5%920 위안32.9%

로컬 압축 단계를 완전히 끄고 컨텍스트를 B2 크기로 되돌려도, 로컬 처리와 턴 수렴만으로 절감의 약 절반을 담당합니다. 이 설계는 압축률 하나에 걸지 않았습니다.

하드웨어 현실

작은 박스로 충분한 이유 —— 그리고 공짜가 아닌 지점

온디바이스 오케스트레이션은 토큰 단위 텍스트 작업, 즉 검색·순위화·요약입니다. NPU에 요구할 수 있는 가장 가벼운 일입니다.

온디바이스 모델디코드 속도오케스트레이션 적합성
215.86 tok/s0.5B —— 의도 라우팅, 태깅적합, 여유 있음
102.01 tok/s3B —— 검색+요약 (본 모델 채택 구성)적합 —— 채택 구성
90 tok/s4B —— 긴 요약, 지시 이행 개선적합하나 여유는 작음
61.11 tok/s8B —— 좁은 작업에서 클라우드 품질 근접지연 예산이 허용할 때만

공짜가 아닙니다. 로컬 단계에는 자체 비용이 있습니다. 150 위안/월의 하드웨어 상각과 17 위안/월의 전력비는 위 503 위안에 이미 포함되어 있습니다. 또한 대규모 지식베이스의 최초 처리는 prefill 중심 작업으로 인덱스에 상각해야 하며 질의마다 반복해서는 안 됩니다. 요청마다 지식베이스 전체를 다시 임베딩하는 구성은 토큰에서 아낀 것보다 지연에서 더 많이 잃습니다.

방법

자체 스택에서 재현하는 6단계

#단계다음으로 넘어가기 전 게이트
1요청별 토큰 사용량을 입력/캐시 입력/출력으로 분리 기록지출을 계정이 아니라 기능 단위로 설명할 수 있음
2각 요청을 분류: 클라우드가 정말 필요한가기기에서 완결되는 실측 비율 확보 —— 본 모델 채택값 25%
3표본 200건에서 실제 신호대잡음비 측정사람이 평가. 대부분의 팀이 측정하지 않는 숫자
4로컬 모델 위에 검색+압축 경로 구현압축된 컨텍스트로도 표본 질문에 정확히 답함
5프롬프트 프리픽스를 고정하고 바이트 단위로 불변화캐시 적중률은 측정하는 것이지 기대하는 것이 아님
6자체 수치로 비용 모델 재실행위의 모든 가정이 실측값으로 대체됨

효과가 가장 큰 단계는 5번이지만 겉보기에는 정리 작업입니다. 캐시 가격은 '절대 변하지 않는 프롬프트 프리픽스'를 최대 30× 우대합니다. 프리픽스 정돈은 마무리 작업이 아니라 설계 요구사항이어야 합니다.

이어 읽기

관련 노트

엣지 추론 박스를 검토 중이신가요

워크로드, 컨텍스트 규모, 지연 목표를 보내주십시오. 적합한 가속기 등급과 함께, 해당 트래픽에서 로컬 단계가 가치가 있는지도 답해 드립니다.

프로젝트 시작 → 전체 테크 노트
—

본 페이지 수치의 근거

[실측] 바이트-토큰 환산율은 이번 검토에서 자체 코퍼스를 20만 어휘 토크나이저로 측정했습니다. 중국어 중심 3.0 바이트/token, 마크업 포함 영어 페이지 3.2, 영어 일반 텍스트 3.7. 사내 메모리 스택은 전체 284,222 바이트 = 95,303 토큰이며, 한 세션에서 실제 주입되는 양은 8,766 바이트 = 3,004 토큰으로 실측 31.7× 압축입니다. [공개] 가격은 벤더 공식 pro 등급 한산 시간대 가격(위안/백만 토큰): 입력 미적중 4.50, 캐시 적중 0.15, 출력 13.50. 0.5B / 3B / 4B / 8B 디코드 속도 215.86 / 102.01 / 90 / 61.11 tok/s는 벤더 공개 온디바이스 실측값입니다. [가정] 팀 규모, 턴 수, 캐시 적중률, 출력 길이, 전기 요금, 하드웨어 상각은 모두 스캔 파라미터입니다. [도출] 비용·절감·신호대잡음비·지연은 위 데이터에서 계산됩니다. 모델은 B2 대비 2.0× 압축률만 주장하며, 자체 실측은 이미 31.7×입니다 —— 관측값의 약 1/4만 주장하여 통제 코퍼스와 실제 트래픽 사이의 차이에 대한 여유를 남겼습니다.