Token economics

端末側オーケストレーションでクラウド LLM のトークン費を削る

オフィスアシスタント、スキル実行、ナレッジベース検索 —— どの呼び出しも二度支払います。一度は金額として、一度は S/N 比として。どちらもどれだけ送るかで決まります。本稿では、検索・ノイズ除去・圧縮をローカルモデルへ前倒ししたときに何が変わるかを、計算過程とともに示します。前提はすべて出典を明記しています。

Bestom エンジニアリングノート —— 当社のプラットフォーム/システムエンジニアが、エッジ推論ホストに関する社内検討からまとめたものです。数値にはすべて出典ラベルを付けています:[実測] 本検討で実行、[公開] ベンダー公表の価格表または実測スループット、[前提] 置き換え可能なスキャンパラメータ、[導出] 上記三者からの計算値。想定規模は 30 名 × 稼働 22 日 × 1 人 1 日 30 回 = 月間 19,800 リクエストです。

請求額はリクエストが社内網を出る前に決まる

ローカルオーケストレーションが変える 3 つのこと

いずれもモデルを賢くする話ではありません。すべて「何を読ませるか」の話です。

入力トークンが請求額のすべて

1 回の回答は数百トークン。ところが雑に組み立てたプロンプトは数万トークンになります。pro ティアの定価では、入力は未ヒット 4.50 元/100 万トークン、ヒット時 0.15 元、出力は 13.50 元。キャッシュ済み入力は未キャッシュの 30× 安価です。効くのは回答側ではありません。

S/N 比も同じレバーで動く

タスクが本当に必要とするのが 2,000 トークンなのに、1 回の呼び出しが 70,400 トークンを運んでいるなら、モデルが読む内容のうち関連するのは 6.2% にすぎません。残りは費用であるだけでなく、誤った箇所に引きずられる機会でもあります。コストと精度が同じ方向に動くのは珍しく、活かす価値があります。

フィルタリングは小さいモデルの仕事

検索・重複排除・要約・プレフィックス固定はフロンティアモデルを必要としません。102.01 tok/s でデコードする端末(エッジ AI アクセラレータ上の 3B モデルの公表実測値)なら、数百トークンの整形済みコンテキストを数秒で生成できます。ローカル工程で支払うのはレイテンシであり、金額ではありません。

ナレッジベースメモリ/ノートローカル・オーケストレータ検索 · 重複排除圧縮 · プレフィックス固定整形済みコンテキスト4,000 tokクラウド索引は 1 回だけ構築ネットワーク境界端末内で完結リクエストの 25%回答

図 1 —— 各工程の実行場所。ネットワーク境界を越えるのは整形済みコンテキストのみです。

コストモデル

同じ予算の 3 通りの使い方

同じナレッジベース、同じ質問、同じチーム。違うのはオーケストレーションだけです。クラウド費は pro ティアで計算し、端末連携方式は自前ハードウェアも計上します。

方式1 ターンのコンテキストターン数1 回の入力月間入力クラウド+端末/月
B1 —— オーケストレーションなし32,000 tok2.270,400 tok1,393.9 M tok6,078 元
B2 —— クラウド側 RAG8,000 tok1.814,400 tok285.1 M tok1,372 元
P —— 端末クラウド連携4,000 tok1.45,600 tok83.2 M tok503 元

比較対象として誠実なのは B2 です。「設計なし」と比べれば見栄えのよい数字が出ますが、何も証明しません。したがって以下の結論値はすべてクラウド側 RAG(多くのチームが既に運用している構成)に対する値です。

63.3%クラウド側 RAG に対する削減率
869 元月あたり · 年間 10,427 元
50.0%コンテキストの関連率(25.0% から改善)
B1 —— 編排なし6,078B2 —— クラウド側 RAG1,372P —— 端末連携503元 / 月

図 2 —— 月間総コスト(クラウド+ローカルハードウェア)。端末連携を最後に置いたのは、それが最小だからです。

どこで削れているのか

アブレーション:各機構を 1 つずつ切る

4 つの機構は相互に作用するため、寄与度を単純合算はできません。意味があるのは「他 3 つを維持したまま 1 つだけ外したときの増分」です。

機構無効化時のコスト総寄与に占める割合
プレフィックス固定 —— キャッシュヒット率 10% → 65%+163 元/月32%
コンテキスト圧縮 —— 8,000 → 4,000 tok+139 元/月27%
ローカル処理 —— 25% を端末で完結+112 元/月22%
ターン収束 —— 1.8 → 1.4 ターン+96 元/月19%

結論は直感に反します。最大の単一要因はコンテキスト圧縮ではなくキャッシュヒット率で、32% 対 27% です。キャッシュ済み入力は未キャッシュの 30× 安いため、プロンプトのプレフィックスをバイト単位で不変にすることは、短くすることより効きます。トークン数だけを見ているチームは、大きいほうの半分を残しています。

感度分析

圧縮はどこまで必要か

圧縮率はあなたの環境で最も外れやすい前提なので、断定せずスキャンします。効果は比例しません。最初の半減が最も大きく、最後の半減は最も小さい。

1 ターンのコンテキストB2 に対する圧縮比関連率コスト/月B2 に対する削減
2,000 tok4.0×100.0%433 元68.4%
3,000 tok2.7×66.7%468 元65.9%
4,000 tok —— モデル採用値2.0×50.0%503 元63.3%
6,000 tok1.3×33.3%572 元58.3%
8,000 tok —— 圧縮なし1.0×25.0%642 元53.2%
16,000 tok0.5×12.5%920 元32.9%

ローカル圧縮を完全に外し、コンテキストを B2 のままにしても、ローカル処理とターン収束だけで削減のおよそ半分を担います。本構成は圧縮率だけに賭けた設計ではありません。

ハードウェアの現実

小型ボックスで足りる理由 —— ただし無償ではない

端末側オーケストレーションが行うのはトークン単位のテキスト処理、すなわち検索・順位付け・要約です。NPU に求められる最も軽い仕事です。

端末側モデルデコード速度オーケストレーションに適合するか
215.86 tok/s0.5B —— 意図ルーティング、タグ付け適合。余裕あり
102.01 tok/s3B —— 検索+要約(本稿の採用構成)適合 —— 採用した構成
90 tok/s4B —— 長い要約、指示追従の改善適合。ただし余裕は小さい
61.11 tok/s8B —— 狭いタスクではクラウド品質に接近レイテンシ予算が許す場合のみ

無償ではありません。ローカル工程にはコストがあります:150 元/月のハードウェア償却と 17 元/月の電力費は、上記の 503 元にすでに含まれています。さらに大規模ナレッジベースの初回処理は prefill 支配の作業で、インデックスに償却すべきもので、クエリごとに繰り返してはなりません。リクエストごとにナレッジベース全体を再埋め込みする構成は、トークンで削った以上にレイテンシを失います。

手法

自社スタックで再現する 6 ステップ

#ステップ次に進む前のゲート
1リクエスト単位でトークン量を記録し、入力/キャッシュ済み入力/出力に分ける支出をアカウント単位ではなく機能単位で説明できる
2各リクエストを分類する:そもそもクラウドが必要か端末で完結する実測比率を得る —— 本稿の採用値は 25%
3抽出した 200 件で実際の S/N 比を測定する人手評価。多くのチームが測っていない数字
4ローカルモデル上に検索+圧縮パスを実装する圧縮後もコンテキストが抽出問題に正答できる
5プロンプトのプレフィックスを固定し、バイト単位で不変にするキャッシュヒット率は測定するもので、期待するものではない
6自社の数字でコストモデルを再計算する上記の前提がすべて実測値に置き換わる

最も効くのは第 5 ステップですが、見た目は片付け作業です。キャッシュ価格は「決して変わらないプロンプトプレフィックス」を最大 30× 優遇します。プレフィックスの整頓は片付けではなく設計要件にすべきです。

続けて読む

関連ノート

エッジ推論ボックスをご検討中ですか

ワークロード、コンテキスト規模、レイテンシ目標をお送りください。適合するアクセラレータのクラスと、あなたのトラフィックでローカル工程に意味があるかどうかをお答えします。

プロジェクトを相談する → 技術ノート一覧
—

本ページの数値の根拠

[実測] バイト/トークン換算率は本検討の自社コーパスを 20 万語彙のトークナイザで実測:中文主体 3.0 バイト/token、マークアップを含む英語ページ 3.2、英語プレーンテキスト 3.7。社内メモリ基盤は全体 284,222 バイト = 95,303 トークン、1 セッションで実際に注入されるのは 8,766 バイト = 3,004 トークン、実測 31.7× の圧縮です。[公開] 価格はベンダー公式 pro ティアの閑散時間帯価格(人民元/100 万トークン):入力未ヒット 4.50、キャッシュヒット 0.15、出力 13.50。0.5B / 3B / 4B / 8B のデコード速度 215.86 / 102.01 / 90 / 61.11 tok/s はベンダー公表の端末実測値です。[前提] チーム規模、ターン数、キャッシュヒット率、出力長、電力単価、ハードウェア償却はいずれもスキャンパラメータです。[導出] コスト・削減額・S/N 比・レイテンシは上記から計算されます。モデルは B2 に対して 2.0× の圧縮率しか主張しておらず、自社実測はすでに 31.7× です —— 観測値のおよそ 1/4 に留めることで、統制コーパスと本番トラフィックの差に対する余裕を確保しています。