Platform ng Agent at API ng Mariner GPS Tools
Metodolohiya at mga resulta ng benchmark
Tingnan kung paano naaapektuhan ng Mariner GPS Tools ang paggamit ng token ng model, ang oras ng pagtugon, at ang kawastuhan sa 9 AI model, at kung paano namin sinukat ang mga resulta.
Ano ang sinusukat ng benchmark
Inihahambing namin ang parehong mga navigation task nang may at walang Mariner GPS Tools upang sukatin ang epekto sa mga token na ginenerate ng model, sa oras ng pagtugon, at sa kawastuhan. Ginagamit ng bawat task ang parehong model, prompt, at mga setting, at ang tanging pagkakaiba ay kung available ba ang mga MCP tool.
Mga pangunahing resulta
Sinukat noong Setyembre 2026 · 9 model · 22 navigation case · 3 pag-uulit · 1188 observation · Production Mariner GPS Tools MCP
Mga resulta ayon sa klase ng model
Ang bawat numero ay ang median ng tatlong model sa klaseng iyon. Ang mga klase ay sumusunod sa pagpoposisyon ng bawat provider sa sariling model nito at itinakda bago basahin ang mga resulta.
Mga resulta ayon sa tool
Sinasaklaw ng suite ang lahat ng limang calculator sa 22 case, mula sa maiikling coastal leg hanggang sa mga paglalayag sa karagatan, kabilang ang mga rutang tumatawid sa antimeridian, nasa southern hemisphere, at nasa high latitude. Naglalathala lamang ng pigura kung saan nakinabang ang bawat kwalipikadong model.
Pinagsasama ng talahanayang ito ang mga magagamit na observation ng bawat tool: tamang sagot lamang, gaya ng sa bawat paghahambing ng token at oras ng tugon. Sinisipi ng mga page ng tool ang median sa mga kwalipikadong model, na siyang numerong inilalathala ng benchmark para sa bawat tool, kaya maaaring magkaiba nang kaunti ang dalawa.
Mahusay na nagawa ng mga model ang gawaing ito nang mag-isa. Sa mga standalone conversion test na ito, mas malaki ang overhead na idinagdag ng paggamit ng tool kaysa sa natipid nito.
Mahusay na nagawa ng mga model ang gawaing ito nang mag-isa. Sa mga standalone conversion test na ito, mas malaki ang overhead na idinagdag ng paggamit ng tool kaysa sa natipid nito.
Bakit nag-iiba ang resulta depende sa tool
Ang paggamit ng MCP tool ay nagdaragdag ng kaunting overhead sa bawat request. Sa mas kumplikadong kalkulasyon gaya ng bearing, distance, at cross track error, nababawi ito dahil mas kaunti na ang trabahong ginagawa mismo ng model. Sa aming mga pagsubok, malaki ang naibawas ng mga tool na ito sa generated token at oras ng pagtugon, habang pinapanatili ang 100% na kawastuhan.
Para sa mas simpleng gawain tulad ng unit at coordinate conversion, kadalasang mabilis na nakukuwenta ng mga model ang sagot nang mag-isa. Sa benchmark na ito, mas matagal ang paggamit ng tool para sa mga gawaing ito sa bawat model na sinubukan at mas maraming token ang nagamit sa kabuuan.
Sa 9 model na sinubukan, ang pagbawas ng generated token ay mula 7.3% hanggang 95.4%, habang ang end-to-end na performance ay mula 0.6× hanggang 5.8× ng baseline.
Mga generated token at kabuuang token
Ang mga generated token ay ang mga output token ng model, kasama ang reasoning. Ang mga ito ang pangunahing metric dahil ang mga ito ang trabahong pinapalitan ng tool.
Metodolohiya at mga pagsusuri sa katumpakan
- Ginagamit ng baseline at MCP na mga test ang parehong prompt, task, model, at mga setting. Ang tanging pagkakaiba ay kung nakakabit ba ang Mariner GPS Tools.
- Hindi sinasabihan ang mga model na gamitin ang mga tool. Sila ang nagpapasya kung tatawagin ang mga ito.
- Ang mga bilang ng token ay direktang galing sa bawat provider ng model. Kasama sa mga numero ng MCP ang mga tool definition at bawat turn ng model na kasangkot sa paggamit ng tool.
- Sinusuri ang mga sagot laban sa mga expected value na kinalkula nang hiwalay at mga nakatakdang tolerance. Walang LLM na humahatol sa katumpakan.
- Mga tamang sagot ang ginagamit sa paghahambing ng token at response time. Kasama pa rin sa accuracy results ang mga maling sagot at pagkabigo ng model o tool, kabilang ang mga pagkakataong tumanggi ang model sa gawain. Ang mga run na nabigo dahil sa infrastructure, tulad ng outage ng provider, ay inulit at hindi isinama ang mga orihinal na nabigong run.
- Lahat ng tool call ay dumadaan sa production MCP endpoint ng Mariner GPS Tools, at kasama sa mga oras ng tugon ang network at MCP round-trip.
- Ang bawat case ay pinapatakbo nang 3 beses para sa bawat model at kondisyon. Ang mga iniulat na numero ay median, hindi piling pinakamahusay na run.
Reproducibility
Setyembre 20, 2026wn-mcp-bench 0.1.0 (40436f25ed54)mariner-tools v0.2.0b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066https://marinergps.tools/mcpmariner-tools 1.0.0 · MCP 2025-11-25mediume8d9d909-831b-4e5e-91aa-cf1413c81096You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.