FY
API & MCPDokumintaasje

Aginten- en API-platfoarm fan Mariner GPS Tools

Benchmarkmetodology en resultaten

Sjoch hoe't Mariner GPS Tools ynfloed hat op it tokenferbrûk fan it model, de antwurdtiid en de krektens by 9 AI-modellen, en hoe't wy de resultaten metten hawwe.

Wat de benchmark mjit

Wy fergelykje deselde navigaasjetaken mei en sûnder Mariner GPS Tools om it effekt op generearre modeltokens, antwurdtiid en krektens te mjitten. Elke taak brûkt itselde model, deselde prompt en deselde ynstellingen, mei de beskikberens fan de MCP-ark as it iennige ferskil.

Wichtichste resultaten

84%minder generearre modeltokensMediaan oer 9 teste modellen.
100%korrekt mei MCP594/594 waarnimmingen mei de produksje-MCP binnen de tolerânsje.
91,6%korrekt sûnder MCP594 waarnimmingen beantwurde troch it model allinnich.

Metten yn Septimber 2026 · 9 modellen · 22 navigaasjegefallen · 3 werhellingen · 1188 waarnimmingen · Produksje-MCP fan Mariner GPS Tools

Resultaten per modelklasse

Elk sifer is de mediaan fan de trije modellen yn dy klasse. De klassen folgje de posysjonearring fan it model troch de oanbieder sels en binne fêstlein foardat de resultaten besjoen waarden.

Reduksje fan generearre tokens
Lyts / effisjint94,1%
Algemien gebrûk93,0%
Avansearre78,4%
Totale mediaan84%
Korrekte antwurden
LLM-baseline91,6% (544/594)
LLM + MCP100% (594/594)

Resultaten per ark

De suite beslacht alle fiif rekkenmasines oer 22 gefallen, fan koarte kusttrajekten oant oseaanoerstekken, wêrûnder rûtes oer de antimeridiaan, op it súdlik healrûn en op hege breedtegraden. In sifer wurdt allinne publisearre dêr't elk kwalifisearjend model der foardiel by hie.

Dizze tabel nimt de brûkbere waarnimmingen fan elk ark byinoar: allinnich korrekte antwurden, lykas by alle ferlikings fan tokens en reaksjetiid. De arksiden neame de mediaan oer de kwalifisearjende modellen, it sifer dat de benchmark per ark publisearret, sadat de twa in bytsje ferskille kinne.

ArkGenerearre tokensFersnellingKorrekte antwurden: LLM-baseline, LLM + MCP
Begjinkoers berekkenje-91,6%5,1×LLM-baseline: 101/108, LLM + MCP: 108/108
Grutsirkelôfstân berekkenje-91,0%4,4×LLM-baseline: 94/108, LLM + MCP: 108/108
Dwersôfwiking berekkenje-94,5%9,8×LLM-baseline: 106/135, LLM + MCP: 135/135
Koördinaten ynterpretearje en opmeitsjeNet publisearre+7,1%2,9× stadigerLLM-baseline: 108/108, LLM + MCP: 108/108

De modellen fierden dizze taak sels effisjint út. By dizze selsstannige konverzjetests joech it brûken fan it ark mear ekstra kosten as dat it besparre.

Faasje omrekkenjeNet publisearre+33,0%4,1× stadigerLLM-baseline: 135/135, LLM + MCP: 135/135

De modellen fierden dizze taak sels effisjint út. By dizze selsstannige konverzjetests joech it brûken fan it ark mear ekstra kosten as dat it besparre.

Wêrom't de resultaten per ark ferskille

It brûken fan in MCP-ark jout by elk fersyk wat overhead. By yngewikkelder berekkeningen lykas koers, ôfstân en dwersôfwiking wurdt dat kompensearre trochdat it model sels folle minder wurk docht. Yn ús tests joegen dizze ark in dúdlike reduksje fan generearre tokens en antwurdtiden, wylst de krektens op 100% bleau.

By ienfâldiger taken, lykas it omrekkenjen fan ienheden en koördinaten, kinne modellen it antwurd faak sels fluch berekkenje. Yn dizze benchmark duorre it brûken fan in ark foar dizze taken langer foar elk teste model en waarden der yn totaal mear tokens brûkt.

Oer de 9 teste modellen rûn de reduksje fan generearre tokens útinoar fan 7,3% oant 95,4%, wylst de end-to-end-prestaasje tusken 0,6× en 5,8× fan de baseline lei.

Generearre tokens en totale tokens

Generearre tokens binne de útfiertokens fan it model, ynklusyf redenearring. Se binne de wichtichste maatstêf om't se it wurk foarmje dat it ark ferfangt.

Metodology en korrektheidskontrôles

  • De baseline- en MCP-tests brûke deselde prompt, taak, model en ynstellingen. It ienige ferskil is oft Mariner GPS Tools keppele is.
  • Modellen wurdt net sein dat se de ark brûke moatte. Se beslute sels oft se se oanroppe.
  • De tokentallen komme streekrjocht fan elke modeloanbieder. De MCP-sifers omfetsje de arkdefinysjes en elke modeloprop dy't by it brûken fan in ark heart.
  • Antwurden wurde kontrolearre oan de hân fan ûnôfhinklik berekkene ferwachte wearden en fêste tolerânsjes. Gjin inkel LLM beoardielet de korrektheid.
  • Ferlikings fan tokens en reaksjetiid brûke korrekte antwurden. Ferkearde antwurden en flaters fan it model of ark telle noch altyd mei yn de resultaten foar krektens, ek yn gefallen dêr't in model de taak wegere. Runs dy't om ynfrastruktuerredenen mislearre, lykas in steuring by in provider, waarden opnij útfierd en de oarspronklike mislearre runs waarden útsletten.
  • Alle arkoproppen geane fia it produksje-MCP-einpunt fan Mariner GPS Tools, wêrby't netwurk- en MCP-roundtrips yn de reaksjetiden ynbegrepen binne.
  • Elk gefal wurdt foar elk model en elke kondysje 3 kear útfierd. De rapportearre sifers binne medianen, gjin selektearre bêste runs.

Reprodusearberens

Benchmarkdatum20 Septimber 2026
Benchmarkapplikaasjewn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Suite-hash (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP-einpunthttps://marinergps.tools/mcp
MCP-tsjinnermariner-tools 1.0.0 · MCP 2025-11-25
Redenearynspanningmedium
Rune8d9d909-831b-4e5e-91aa-cf1413c81096
Systeemprompt, beide kondysjestext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API & MCP dokumintaasje