TL
API & MCPDokumentasyon

Platform ng Agent at API ng Mariner GPS Tools

Metodolohiya at mga resulta ng benchmark

Tingnan kung paano naaapektuhan ng Mariner GPS Tools ang paggamit ng token ng model, ang oras ng pagtugon, at ang kawastuhan sa 9 AI model, at kung paano namin sinukat ang mga resulta.

Ano ang sinusukat ng benchmark

Inihahambing namin ang parehong mga navigation task nang may at walang Mariner GPS Tools upang sukatin ang epekto sa mga token na ginenerate ng model, sa oras ng pagtugon, at sa kawastuhan. Ginagamit ng bawat task ang parehong model, prompt, at mga setting, at ang tanging pagkakaiba ay kung available ba ang mga MCP tool.

Mga pangunahing resulta

84%mas kaunting token na ginenerate ng modelMedian sa 9 model na sinubok.
100%tamang sagot gamit ang MCP594/594 na observation sa production MCP ang nasa loob ng tolerance.
91.6%tamang sagot nang walang MCP594 observation na sinagot ng model nang mag-isa.

Sinukat noong Setyembre 2026 · 9 model · 22 navigation case · 3 pag-uulit · 1188 observation · Production Mariner GPS Tools MCP

Mga resulta ayon sa klase ng model

Ang bawat numero ay ang median ng tatlong model sa klaseng iyon. Ang mga klase ay sumusunod sa pagpoposisyon ng bawat provider sa sariling model nito at itinakda bago basahin ang mga resulta.

Pagbawas ng generated token
Maliit / episyente94.1%
Pangkalahatang gamit93.0%
Advanced78.4%
Kabuuang median84%
Mga tamang sagot
LLM baseline91.6% (544/594)
LLM + MCP100% (594/594)

Mga resulta ayon sa tool

Sinasaklaw ng suite ang lahat ng limang calculator sa 22 case, mula sa maiikling coastal leg hanggang sa mga paglalayag sa karagatan, kabilang ang mga rutang tumatawid sa antimeridian, nasa southern hemisphere, at nasa high latitude. Naglalathala lamang ng pigura kung saan nakinabang ang bawat kwalipikadong model.

Pinagsasama ng talahanayang ito ang mga magagamit na observation ng bawat tool: tamang sagot lamang, gaya ng sa bawat paghahambing ng token at oras ng tugon. Sinisipi ng mga page ng tool ang median sa mga kwalipikadong model, na siyang numerong inilalathala ng benchmark para sa bawat tool, kaya maaaring magkaiba nang kaunti ang dalawa.

ToolMga generated tokenSpeed-upMga tamang sagot: LLM baseline, LLM + MCP
Kalkulahin ang paunang true bearing-91.6%5.1×LLM baseline: 101/108, LLM + MCP: 108/108
Kalkulahin ang great-circle distance-91.0%4.4×LLM baseline: 94/108, LLM + MCP: 108/108
Kalkulahin ang cross track error (XTE)-94.5%9.8×LLM baseline: 106/135, LLM + MCP: 135/135
Basahin at i-format ang mga coordinateHindi inilathala+7.1%2.9× mas mabagalLLM baseline: 108/108, LLM + MCP: 108/108

Mahusay na nagawa ng mga model ang gawaing ito nang mag-isa. Sa mga standalone conversion test na ito, mas malaki ang overhead na idinagdag ng paggamit ng tool kaysa sa natipid nito.

I-convert ang mga bilisHindi inilathala+33.0%4.1× mas mabagalLLM baseline: 135/135, LLM + MCP: 135/135

Mahusay na nagawa ng mga model ang gawaing ito nang mag-isa. Sa mga standalone conversion test na ito, mas malaki ang overhead na idinagdag ng paggamit ng tool kaysa sa natipid nito.

Bakit nag-iiba ang resulta depende sa tool

Ang paggamit ng MCP tool ay nagdaragdag ng kaunting overhead sa bawat request. Sa mas kumplikadong kalkulasyon gaya ng bearing, distance, at cross track error, nababawi ito dahil mas kaunti na ang trabahong ginagawa mismo ng model. Sa aming mga pagsubok, malaki ang naibawas ng mga tool na ito sa generated token at oras ng pagtugon, habang pinapanatili ang 100% na kawastuhan.

Para sa mas simpleng gawain tulad ng unit at coordinate conversion, kadalasang mabilis na nakukuwenta ng mga model ang sagot nang mag-isa. Sa benchmark na ito, mas matagal ang paggamit ng tool para sa mga gawaing ito sa bawat model na sinubukan at mas maraming token ang nagamit sa kabuuan.

Sa 9 model na sinubukan, ang pagbawas ng generated token ay mula 7.3% hanggang 95.4%, habang ang end-to-end na performance ay mula 0.6× hanggang 5.8× ng baseline.

Mga generated token at kabuuang token

Ang mga generated token ay ang mga output token ng model, kasama ang reasoning. Ang mga ito ang pangunahing metric dahil ang mga ito ang trabahong pinapalitan ng tool.

Metodolohiya at mga pagsusuri sa katumpakan

  • Ginagamit ng baseline at MCP na mga test ang parehong prompt, task, model, at mga setting. Ang tanging pagkakaiba ay kung nakakabit ba ang Mariner GPS Tools.
  • Hindi sinasabihan ang mga model na gamitin ang mga tool. Sila ang nagpapasya kung tatawagin ang mga ito.
  • Ang mga bilang ng token ay direktang galing sa bawat provider ng model. Kasama sa mga numero ng MCP ang mga tool definition at bawat turn ng model na kasangkot sa paggamit ng tool.
  • Sinusuri ang mga sagot laban sa mga expected value na kinalkula nang hiwalay at mga nakatakdang tolerance. Walang LLM na humahatol sa katumpakan.
  • Mga tamang sagot ang ginagamit sa paghahambing ng token at response time. Kasama pa rin sa accuracy results ang mga maling sagot at pagkabigo ng model o tool, kabilang ang mga pagkakataong tumanggi ang model sa gawain. Ang mga run na nabigo dahil sa infrastructure, tulad ng outage ng provider, ay inulit at hindi isinama ang mga orihinal na nabigong run.
  • Lahat ng tool call ay dumadaan sa production MCP endpoint ng Mariner GPS Tools, at kasama sa mga oras ng tugon ang network at MCP round-trip.
  • Ang bawat case ay pinapatakbo nang 3 beses para sa bawat model at kondisyon. Ang mga iniulat na numero ay median, hindi piling pinakamahusay na run.

Reproducibility

Petsa ng benchmarkSetyembre 20, 2026
Benchmark applicationwn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Hash ng suite (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP endpointhttps://marinergps.tools/mcp
MCP servermariner-tools 1.0.0 · MCP 2025-11-25
Reasoning effortmedium
Rune8d9d909-831b-4e5e-91aa-cf1413c81096
System prompt, sa parehong kondisyontext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API at MCP dokumentasyon