JA
API & MCPドキュメント

Mariner GPS Tools エージェント & API プラットフォーム

ベンチマークの手法と結果

9 種類の AI モデルで、Mariner GPS Tools がモデルのトークン使用量、応答時間、正答率にどう影響するか、そして結果をどのように測定したかをご覧ください。

ベンチマークが測定するもの

同じ航法タスクを Mariner GPS Tools ありとなしで比較し、モデルの生成トークン、応答時間、正答率への影響を測定しています。各タスクでは同じモデル、プロンプト、設定を使用し、MCP ツールが利用できるかどうかだけが異なります。

主要な結果

84%モデル生成トークンを削減テストした 9 モデルの中央値。
100%MCP 使用時の正答率本番 MCP の観測 594 件中 594 件が許容誤差内。
91.6%MCP なしの正答率モデル単独で回答した594件の観測結果。

2026年9月測定 · 9 モデル · 航法ケース 22 件 · 3 回反復 · 観測 1188 件 · 本番 Mariner GPS Tools MCP

モデルクラス別の結果

各数値は、そのクラスに属する 3 モデルの中央値です。クラスは各プロバイダー自身によるモデルの位置づけに従い、結果を確認する前に確定しました。

生成トークンの削減率
小型・高効率94.1%
汎用93.0%
高性能78.4%
全体の中央値84%
正答
LLM ベースライン91.6% (544/594)
LLM + MCP100% (594/594)

ツール別の結果

このスイートは 5 つの計算ツールすべてを 22 ケースで対象とし、短い沿岸区間から大洋横断までを含み、180 度経線をまたぐ航路、南半球の航路、高緯度の航路も含みます。数値は、条件を満たすすべてのモデルで改善が見られた場合にのみ公開します。

この表は、各ツールの有効な観測、つまりトークンと応答時間のすべての比較と同じく正しい回答のみをまとめて集計しています。各ツールのページには、条件を満たしたモデルの中央値、つまりベンチマークがツールごとに公開している数値を掲載しているため、両者はわずかに異なる場合があります。

ツール生成トークン高速化正答: LLM ベースライン, LLM + MCP
初期真方位を計算-91.6%5.1×LLM ベースライン: 101/108, LLM + MCP: 108/108
大圏距離を計算-91.0%4.4×LLM ベースライン: 94/108, LLM + MCP: 108/108
クロストラックエラー(XTE)を計算-94.5%9.8×LLM ベースライン: 106/135, LLM + MCP: 135/135
座標を解析して書式化未公表+7.1%2.9× 遅いLLM ベースライン: 108/108, LLM + MCP: 108/108

モデルはこのタスクを単独でも効率的に処理できました。これらの単独の変換テストでは、ツールの使用によって削減できた分を上回るオーバーヘッドが発生しました。

速度を変換未公表+33.0%4.1× 遅いLLM ベースライン: 135/135, LLM + MCP: 135/135

モデルはこのタスクを単独でも効率的に処理できました。これらの単独の変換テストでは、ツールの使用によって削減できた分を上回るオーバーヘッドが発生しました。

ツールによって結果が異なる理由

MCP ツールを使うと、リクエストごとに一定のオーバーヘッドが加わります。方位、距離、クロストラックエラーのような複雑な計算では、モデル自身の作業が大きく減ることでそれが相殺されます。私たちのテストでは、これらのツールは生成トークンと応答時間を大きく削減しつつ、正答率 100% を維持しました。

単位や座標の変換などの単純なタスクでは、モデル自身がすばやく答えを計算できることがよくあります。このベンチマークでは、これらのタスクでツールを使用すると、テストしたすべてのモデルで所要時間が長くなり、全体として使用するトークン数も増えました。

テストした 9 モデル全体では、生成トークンの削減率は 7.3% から 95.4%、エンドツーエンドの性能はベースラインの 0.6× から 5.8× の範囲でした。

生成トークンと総トークン

生成トークンとは、推論を含むモデルの出力トークンです。ツールが置き換える作業そのものであるため、これを主要指標としています。

手法と正しさの確認

  • ベースラインのテストと MCP のテストでは、同じプロンプト、タスク、モデル、設定を使用します。違いは Mariner GPS Tools が接続されているかどうかだけです。
  • モデルにツールを使うようには指示していません。呼び出すかどうかはモデル自身が判断します。
  • トークン数は各モデルプロバイダーから直接取得しています。MCP の数値には、ツール定義と、ツールの使用にかかわるすべてのモデルターンが含まれます。
  • 回答は、独立に計算した期待値と固定の許容誤差に照らして確認します。正しさの判定に LLM は使いません。
  • トークン数と応答時間の比較には、正しい回答を使用しています。不正解やモデルまたはツールの失敗は、モデルがタスクを拒否したケースを含め、精度の結果には引き続き含まれます。プロバイダーの障害など、インフラ上の理由で失敗した実行は再試行し、元の失敗した実行は除外しました。
  • すべてのツール呼び出しは Mariner GPS Tools の本番 MCP エンドポイントを使用し、ネットワークと MCP の往復は応答時間に含まれます。
  • 各ケースは、モデルと条件ごとに 3 回実行します。掲載している数値は中央値であり、選別した最良の実行ではありません。

再現性

ベンチマーク実施日2026年9月20日
ベンチマークアプリケーションwn-mcp-bench 0.1.0 (40436f25ed54)
スイートmariner-tools v0.2.0
スイートのハッシュ(SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP エンドポイントhttps://marinergps.tools/mcp
MCP サーバーmariner-tools 1.0.0 · MCP 2025-11-25
推論エフォートmedium
実行e8d9d909-831b-4e5e-91aa-cf1413c81096
システムプロンプト(両条件共通)text
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API および MCP ドキュメント