オフィスアシスタント、スキル実行、ナレッジベース検索 —— どの呼び出しも二度支払います。一度は金額として、一度は S/N 比として。どちらもどれだけ送るかで決まります。本稿では、検索・ノイズ除去・圧縮をローカルモデルへ前倒ししたときに何が変わるかを、計算過程とともに示します。前提はすべて出典を明記しています。
Bestom エンジニアリングノート —— 当社のプラットフォーム/システムエンジニアが、エッジ推論ホストに関する社内検討からまとめたものです。数値にはすべて出典ラベルを付けています:[実測] 本検討で実行、[公開] ベンダー公表の価格表または実測スループット、[前提] 置き換え可能なスキャンパラメータ、[導出] 上記三者からの計算値。想定規模は 30 名 × 稼働 22 日 × 1 人 1 日 30 回 = 月間 19,800 リクエストです。
いずれもモデルを賢くする話ではありません。すべて「何を読ませるか」の話です。
1 回の回答は数百トークン。ところが雑に組み立てたプロンプトは数万トークンになります。pro ティアの定価では、入力は未ヒット 4.50 元/100 万トークン、ヒット時 0.15 元、出力は 13.50 元。キャッシュ済み入力は未キャッシュの 30× 安価です。効くのは回答側ではありません。
タスクが本当に必要とするのが 2,000 トークンなのに、1 回の呼び出しが 70,400 トークンを運んでいるなら、モデルが読む内容のうち関連するのは 6.2% にすぎません。残りは費用であるだけでなく、誤った箇所に引きずられる機会でもあります。コストと精度が同じ方向に動くのは珍しく、活かす価値があります。
検索・重複排除・要約・プレフィックス固定はフロンティアモデルを必要としません。102.01 tok/s でデコードする端末(エッジ AI アクセラレータ上の 3B モデルの公表実測値)なら、数百トークンの整形済みコンテキストを数秒で生成できます。ローカル工程で支払うのはレイテンシであり、金額ではありません。
図 1 —— 各工程の実行場所。ネットワーク境界を越えるのは整形済みコンテキストのみです。
同じナレッジベース、同じ質問、同じチーム。違うのはオーケストレーションだけです。クラウド費は pro ティアで計算し、端末連携方式は自前ハードウェアも計上します。
| 方式 | 1 ターンのコンテキスト | ターン数 | 1 回の入力 | 月間入力 | クラウド+端末/月 |
|---|---|---|---|---|---|
| B1 —— オーケストレーションなし | 32,000 tok | 2.2 | 70,400 tok | 1,393.9 M tok | 6,078 元 |
| B2 —— クラウド側 RAG | 8,000 tok | 1.8 | 14,400 tok | 285.1 M tok | 1,372 元 |
| P —— 端末クラウド連携 | 4,000 tok | 1.4 | 5,600 tok | 83.2 M tok | 503 元 |
比較対象として誠実なのは B2 です。「設計なし」と比べれば見栄えのよい数字が出ますが、何も証明しません。したがって以下の結論値はすべてクラウド側 RAG(多くのチームが既に運用している構成)に対する値です。
図 2 —— 月間総コスト(クラウド+ローカルハードウェア)。端末連携を最後に置いたのは、それが最小だからです。
4 つの機構は相互に作用するため、寄与度を単純合算はできません。意味があるのは「他 3 つを維持したまま 1 つだけ外したときの増分」です。
| 機構 | 無効化時のコスト | 総寄与に占める割合 |
|---|---|---|
| プレフィックス固定 —— キャッシュヒット率 10% → 65% | +163 元/月 | 32% |
| コンテキスト圧縮 —— 8,000 → 4,000 tok | +139 元/月 | 27% |
| ローカル処理 —— 25% を端末で完結 | +112 元/月 | 22% |
| ターン収束 —— 1.8 → 1.4 ターン | +96 元/月 | 19% |
結論は直感に反します。最大の単一要因はコンテキスト圧縮ではなくキャッシュヒット率で、32% 対 27% です。キャッシュ済み入力は未キャッシュの 30× 安いため、プロンプトのプレフィックスをバイト単位で不変にすることは、短くすることより効きます。トークン数だけを見ているチームは、大きいほうの半分を残しています。
圧縮率はあなたの環境で最も外れやすい前提なので、断定せずスキャンします。効果は比例しません。最初の半減が最も大きく、最後の半減は最も小さい。
| 1 ターンのコンテキスト | B2 に対する圧縮比 | 関連率 | コスト/月 | B2 に対する削減 |
|---|---|---|---|---|
| 2,000 tok | 4.0× | 100.0% | 433 元 | 68.4% |
| 3,000 tok | 2.7× | 66.7% | 468 元 | 65.9% |
| 4,000 tok —— モデル採用値 | 2.0× | 50.0% | 503 元 | 63.3% |
| 6,000 tok | 1.3× | 33.3% | 572 元 | 58.3% |
| 8,000 tok —— 圧縮なし | 1.0× | 25.0% | 642 元 | 53.2% |
| 16,000 tok | 0.5× | 12.5% | 920 元 | 32.9% |
ローカル圧縮を完全に外し、コンテキストを B2 のままにしても、ローカル処理とターン収束だけで削減のおよそ半分を担います。本構成は圧縮率だけに賭けた設計ではありません。
端末側オーケストレーションが行うのはトークン単位のテキスト処理、すなわち検索・順位付け・要約です。NPU に求められる最も軽い仕事です。
| 端末側モデル | デコード速度 | オーケストレーションに適合するか |
|---|---|---|
| 215.86 tok/s | 0.5B —— 意図ルーティング、タグ付け | 適合。余裕あり |
| 102.01 tok/s | 3B —— 検索+要約(本稿の採用構成) | 適合 —— 採用した構成 |
| 90 tok/s | 4B —— 長い要約、指示追従の改善 | 適合。ただし余裕は小さい |
| 61.11 tok/s | 8B —— 狭いタスクではクラウド品質に接近 | レイテンシ予算が許す場合のみ |
無償ではありません。ローカル工程にはコストがあります:150 元/月のハードウェア償却と 17 元/月の電力費は、上記の 503 元にすでに含まれています。さらに大規模ナレッジベースの初回処理は prefill 支配の作業で、インデックスに償却すべきもので、クエリごとに繰り返してはなりません。リクエストごとにナレッジベース全体を再埋め込みする構成は、トークンで削った以上にレイテンシを失います。
| # | ステップ | 次に進む前のゲート |
|---|---|---|
| 1 | リクエスト単位でトークン量を記録し、入力/キャッシュ済み入力/出力に分ける | 支出をアカウント単位ではなく機能単位で説明できる |
| 2 | 各リクエストを分類する:そもそもクラウドが必要か | 端末で完結する実測比率を得る —— 本稿の採用値は 25% |
| 3 | 抽出した 200 件で実際の S/N 比を測定する | 人手評価。多くのチームが測っていない数字 |
| 4 | ローカルモデル上に検索+圧縮パスを実装する | 圧縮後もコンテキストが抽出問題に正答できる |
| 5 | プロンプトのプレフィックスを固定し、バイト単位で不変にする | キャッシュヒット率は測定するもので、期待するものではない |
| 6 | 自社の数字でコストモデルを再計算する | 上記の前提がすべて実測値に置き換わる |
最も効くのは第 5 ステップですが、見た目は片付け作業です。キャッシュ価格は「決して変わらないプロンプトプレフィックス」を最大 30× 優遇します。プレフィックスの整頓は片付けではなく設計要件にすべきです。
ワークロード、コンテキスト規模、レイテンシ目標をお送りください。適合するアクセラレータのクラスと、あなたのトラフィックでローカル工程に意味があるかどうかをお答えします。
プロジェクトを相談する → 技術ノート一覧[実測] バイト/トークン換算率は本検討の自社コーパスを 20 万語彙のトークナイザで実測:中文主体 3.0 バイト/token、マークアップを含む英語ページ 3.2、英語プレーンテキスト 3.7。社内メモリ基盤は全体 284,222 バイト = 95,303 トークン、1 セッションで実際に注入されるのは 8,766 バイト = 3,004 トークン、実測 31.7× の圧縮です。[公開] 価格はベンダー公式 pro ティアの閑散時間帯価格(人民元/100 万トークン):入力未ヒット 4.50、キャッシュヒット 0.15、出力 13.50。0.5B / 3B / 4B / 8B のデコード速度 215.86 / 102.01 / 90 / 61.11 tok/s はベンダー公表の端末実測値です。[前提] チーム規模、ターン数、キャッシュヒット率、出力長、電力単価、ハードウェア償却はいずれもスキャンパラメータです。[導出] コスト・削減額・S/N 比・レイテンシは上記から計算されます。モデルは B2 に対して 2.0× の圧縮率しか主張しておらず、自社実測はすでに 31.7× です —— 観測値のおよそ 1/4 に留めることで、統制コーパスと本番トラフィックの差に対する余裕を確保しています。