오피스 어시스턴트, 스킬 실행기, 지식베이스 질의 — 모든 호출은 두 번 지불합니다. 한 번은 금액으로, 한 번은 신호대잡음비로. 둘 다 얼마나 보내는지가 결정합니다. 이 노트는 검색·노이즈 제거·압축을 로컬 모델로 앞당겼을 때 무엇이 바뀌는지 계산 과정과 함께 정리합니다. 모든 가정에는 출처를 표기했습니다.
Bestom 엔지니어링 노트 — 자사 플랫폼·시스템 엔지니어가 엣지 추론 호스트에 대한 내부 검토에서 정리한 내용입니다. 모든 수치에 출처 라벨을 붙였습니다: [실측] 이번 검토에서 직접 실행, [공개] 벤더 공식 가격표 또는 벤더 실측 처리량, [가정] 대체 가능한 스캔 파라미터, [도출] 위 세 가지로부터의 계산값. 적용한 규모는 30명 × 연 22일 × 1인 1일 30회 = 월 19,800건입니다.
어느 것도 모델을 더 똑똑하게 만드는 이야기가 아닙니다. 모두 '무엇을 읽게 할지'의 문제입니다.
답변 한 번은 수백 토큰입니다. 그런데 대충 조립한 프롬프트는 수만 토큰입니다. pro 등급 정가 기준으로 입력은 미적중 4.50 위안/백만 토큰, 적중 시 0.15 위안, 출력은 13.50 위안입니다. 캐시된 입력은 미캐시 대비 30× 저렴합니다. 레버는 답변 쪽이 아닙니다.
작업에 실제로 필요한 것이 2,000 토큰인데 한 번의 호출이 70,400 토큰을 싣는다면, 모델이 읽는 내용 중 관련 있는 비율은 6.2%에 불과합니다. 나머지는 비용일 뿐 아니라 잘못된 구절에 끌려갈 기회입니다. 비용과 정확도가 같은 방향으로 움직이는 경우는 드물고, 활용할 가치가 있습니다.
검색·중복 제거·요약·프리픽스 고정에는 프런티어 모델이 필요하지 않습니다. 102.01 tok/s로 디코딩하는 기기(3B 모델의 엣지 AI 가속기 공개 실측값)는 수백 토큰의 정제된 컨텍스트를 몇 초 안에 만들어냅니다. 로컬 단계에서 지불하는 것은 지연 시간이고 금액이 아닙니다.
그림 1 —— 각 단계가 실행되는 위치. 네트워크 경계를 넘는 것은 정제된 컨텍스트뿐입니다.
동일한 지식베이스, 동일한 질문, 동일한 팀. 다른 것은 오케스트레이션뿐입니다. 클라우드 비용은 pro 등급으로 계산하고, 온디바이스 방식은 자체 하드웨어도 계상합니다.
| 방식 | 턴당 컨텍스트 | 턴 수 | 호출당 입력 | 월 입력량 | 클라우드+로컬 / 월 |
|---|---|---|---|---|---|
| B1 —— 오케스트레이션 없음 | 32,000 tok | 2.2 | 70,400 tok | 1,393.9 M tok | 6,078 위안 |
| B2 —— 클라우드 측 RAG | 8,000 tok | 1.8 | 14,400 tok | 285.1 M tok | 1,372 위안 |
| P —— 온디바이스 연동 | 4,000 tok | 1.4 | 5,600 tok | 83.2 M tok | 503 위안 |
정직한 비교 대상은 B2입니다. 설계가 없는 경우와 비교하면 보기 좋은 숫자가 나오지만 아무것도 증명하지 못합니다. 따라서 아래 결론 수치는 모두 클라우드 측 RAG(대부분의 팀이 이미 운영하는 방식) 대비 값입니다.
그림 2 —— 월 총비용(클라우드+로컬 하드웨어). 온디바이스 방식을 마지막에 둔 것은 가장 작기 때문입니다.
네 가지 메커니즘은 상호작용하므로 기여도를 단순 합산할 수 없습니다. 의미 있는 값은 나머지 셋을 유지한 채 하나만 제거했을 때의 증가분입니다.
| 메커니즘 | 비활성화 시 비용 | 전체 기여 비중 |
|---|---|---|
| 프리픽스 고정 —— 캐시 적중률 10% → 65% | +163 위안/월 | 32% |
| 컨텍스트 압축 —— 8,000 → 4,000 tok | +139 위안/월 | 27% |
| 로컬 처리 —— 25%를 기기에서 완결 | +112 위안/월 | 22% |
| 턴 수렴 —— 1.8 → 1.4턴 | +96 위안/월 | 19% |
결론은 직관과 반대입니다. 최대 단일 요인은 컨텍스트 압축이 아니라 캐시 적중률이며, 32% 대 27%입니다. 캐시된 입력은 미캐시보다 30× 저렴하므로, 프롬프트 프리픽스를 바이트 단위로 불변하게 만드는 것이 더 짧게 만드는 것보다 효과적입니다. 토큰 수만 보는 팀은 더 큰 절반을 남겨 둡니다.
압축률은 고객 환경에서 가장 어긋나기 쉬운 가정이므로 단정하지 않고 스캔합니다. 효과는 비례하지 않습니다. 첫 번째 반감이 가장 크고 마지막 반감이 가장 작습니다.
| 턴당 컨텍스트 | B2 대비 압축비 | 관련도 | 비용 / 월 | B2 대비 절감 |
|---|---|---|---|---|
| 2,000 tok | 4.0× | 100.0% | 433 위안 | 68.4% |
| 3,000 tok | 2.7× | 66.7% | 468 위안 | 65.9% |
| 4,000 tok —— 모델 채택값 | 2.0× | 50.0% | 503 위안 | 63.3% |
| 6,000 tok | 1.3× | 33.3% | 572 위안 | 58.3% |
| 8,000 tok —— 압축 없음 | 1.0× | 25.0% | 642 위안 | 53.2% |
| 16,000 tok | 0.5× | 12.5% | 920 위안 | 32.9% |
로컬 압축 단계를 완전히 끄고 컨텍스트를 B2 크기로 되돌려도, 로컬 처리와 턴 수렴만으로 절감의 약 절반을 담당합니다. 이 설계는 압축률 하나에 걸지 않았습니다.
온디바이스 오케스트레이션은 토큰 단위 텍스트 작업, 즉 검색·순위화·요약입니다. NPU에 요구할 수 있는 가장 가벼운 일입니다.
| 온디바이스 모델 | 디코드 속도 | 오케스트레이션 적합성 |
|---|---|---|
| 215.86 tok/s | 0.5B —— 의도 라우팅, 태깅 | 적합, 여유 있음 |
| 102.01 tok/s | 3B —— 검색+요약 (본 모델 채택 구성) | 적합 —— 채택 구성 |
| 90 tok/s | 4B —— 긴 요약, 지시 이행 개선 | 적합하나 여유는 작음 |
| 61.11 tok/s | 8B —— 좁은 작업에서 클라우드 품질 근접 | 지연 예산이 허용할 때만 |
공짜가 아닙니다. 로컬 단계에는 자체 비용이 있습니다. 150 위안/월의 하드웨어 상각과 17 위안/월의 전력비는 위 503 위안에 이미 포함되어 있습니다. 또한 대규모 지식베이스의 최초 처리는 prefill 중심 작업으로 인덱스에 상각해야 하며 질의마다 반복해서는 안 됩니다. 요청마다 지식베이스 전체를 다시 임베딩하는 구성은 토큰에서 아낀 것보다 지연에서 더 많이 잃습니다.
| # | 단계 | 다음으로 넘어가기 전 게이트 |
|---|---|---|
| 1 | 요청별 토큰 사용량을 입력/캐시 입력/출력으로 분리 기록 | 지출을 계정이 아니라 기능 단위로 설명할 수 있음 |
| 2 | 각 요청을 분류: 클라우드가 정말 필요한가 | 기기에서 완결되는 실측 비율 확보 —— 본 모델 채택값 25% |
| 3 | 표본 200건에서 실제 신호대잡음비 측정 | 사람이 평가. 대부분의 팀이 측정하지 않는 숫자 |
| 4 | 로컬 모델 위에 검색+압축 경로 구현 | 압축된 컨텍스트로도 표본 질문에 정확히 답함 |
| 5 | 프롬프트 프리픽스를 고정하고 바이트 단위로 불변화 | 캐시 적중률은 측정하는 것이지 기대하는 것이 아님 |
| 6 | 자체 수치로 비용 모델 재실행 | 위의 모든 가정이 실측값으로 대체됨 |
효과가 가장 큰 단계는 5번이지만 겉보기에는 정리 작업입니다. 캐시 가격은 '절대 변하지 않는 프롬프트 프리픽스'를 최대 30× 우대합니다. 프리픽스 정돈은 마무리 작업이 아니라 설계 요구사항이어야 합니다.
[실측] 바이트-토큰 환산율은 이번 검토에서 자체 코퍼스를 20만 어휘 토크나이저로 측정했습니다. 중국어 중심 3.0 바이트/token, 마크업 포함 영어 페이지 3.2, 영어 일반 텍스트 3.7. 사내 메모리 스택은 전체 284,222 바이트 = 95,303 토큰이며, 한 세션에서 실제 주입되는 양은 8,766 바이트 = 3,004 토큰으로 실측 31.7× 압축입니다. [공개] 가격은 벤더 공식 pro 등급 한산 시간대 가격(위안/백만 토큰): 입력 미적중 4.50, 캐시 적중 0.15, 출력 13.50. 0.5B / 3B / 4B / 8B 디코드 속도 215.86 / 102.01 / 90 / 61.11 tok/s는 벤더 공개 온디바이스 실측값입니다. [가정] 팀 규모, 턴 수, 캐시 적중률, 출력 길이, 전기 요금, 하드웨어 상각은 모두 스캔 파라미터입니다. [도출] 비용·절감·신호대잡음비·지연은 위 데이터에서 계산됩니다. 모델은 B2 대비 2.0× 압축률만 주장하며, 자체 실측은 이미 31.7×입니다 —— 관측값의 약 1/4만 주장하여 통제 코퍼스와 실제 트래픽 사이의 차이에 대한 여유를 남겼습니다.