NL
API & MCPDocumentatie

Mariner GPS Tools agent- en API-platform

Benchmarkmethodologie en resultaten

Bekijk hoe Mariner GPS Tools het tokengebruik van het model, de responstijd en de nauwkeurigheid beïnvloedt bij 9 AI-modellen, en hoe wij de resultaten hebben gemeten.

Wat de benchmark meet

We vergelijken dezelfde navigatietaken met en zonder Mariner GPS Tools om het effect op gegenereerde modeltokens, responstijd en nauwkeurigheid te meten. Elke taak gebruikt hetzelfde model, dezelfde prompt en dezelfde instellingen, met de beschikbaarheid van de MCP-tools als enige verschil.

Belangrijkste resultaten

84%minder gegenereerde modeltokensMediaan over 9 geteste modellen.
100%correct met MCP594/594 waarnemingen met de productie-MCP binnen de tolerantie.
91,6%correct zonder MCP594 waarnemingen die alleen door het model zijn beantwoord.

Gemeten in september 2026 · 9 modellen · 22 navigatiegevallen · 3 herhalingen · 1188 waarnemingen · Productie-MCP van Mariner GPS Tools

Resultaten per modelklasse

Elk cijfer is de mediaan van de drie modellen in die klasse. De klassen volgen de positionering van het model door de aanbieder zelf en zijn vastgelegd voordat de resultaten werden bekeken.

Reductie van gegenereerde tokens
Klein / efficiënt94,1%
Algemeen gebruik93,0%
Geavanceerd78,4%
Totale mediaan84%
Correcte antwoorden
LLM-baseline91,6% (544/594)
LLM + MCP100% (594/594)

Resultaten per tool

De suite dekt alle vijf rekenhulpen in 22 gevallen, van korte kusttrajecten tot oceaanoversteken, waaronder routes over de antimeridiaan, op het zuidelijk halfrond en op hoge breedtegraden. Een cijfer wordt alleen gepubliceerd waar elk in aanmerking komend model baat had.

Deze tabel voegt de bruikbare waarnemingen van elke tool samen: alleen correcte antwoorden, zoals bij alle vergelijkingen van tokens en responstijd. De toolpagina's vermelden de mediaan over de in aanmerking komende modellen, het cijfer dat de benchmark per tool publiceert, waardoor de twee licht kunnen verschillen.

ToolGegenereerde tokensVersnellingCorrecte antwoorden: LLM-baseline, LLM + MCP
Initiële ware koers berekenen-91,6%5,1×LLM-baseline: 101/108, LLM + MCP: 108/108
Grootcirkelafstand berekenen-91,0%4,4×LLM-baseline: 94/108, LLM + MCP: 108/108
Koersafwijking (XTE) berekenen-94,5%9,8×LLM-baseline: 106/135, LLM + MCP: 135/135
Coördinaten lezen en opmakenNiet gepubliceerd+7,1%2,9× tragerLLM-baseline: 108/108, LLM + MCP: 108/108

De modellen voerden deze taak zelf al efficiënt uit. Bij deze zelfstandige conversietests zorgde het gebruik van de tool voor meer overhead dan het bespaarde.

Snelheden omrekenenNiet gepubliceerd+33,0%4,1× tragerLLM-baseline: 135/135, LLM + MCP: 135/135

De modellen voerden deze taak zelf al efficiënt uit. Bij deze zelfstandige conversietests zorgde het gebruik van de tool voor meer overhead dan het bespaarde.

Waarom de resultaten per tool verschillen

Het gebruik van een MCP-tool brengt bij elk verzoek wat overhead met zich mee. Bij complexere berekeningen zoals koers, afstand en koersafwijking wordt dat gecompenseerd doordat het model zelf veel minder werk doet. In onze tests leverden deze tools een aanzienlijke vermindering van gegenereerde tokens en responstijden op, terwijl de nauwkeurigheid op 100% bleef.

Voor eenvoudigere taken, zoals het omrekenen van eenheden en coördinaten, kunnen modellen het antwoord vaak zelf snel berekenen. In deze benchmark duurde het gebruik van een tool voor deze taken bij elk getest model langer en werden er in totaal meer tokens gebruikt.

Over de 9 geteste modellen liep de reductie van gegenereerde tokens uiteen van 7,3% tot 95,4%, terwijl de end-to-end-prestatie tussen 0,6× en 5,8× van de baseline lag.

Gegenereerde tokens en totale tokens

Gegenereerde tokens zijn de uitvoertokens van het model, inclusief redenering. Ze zijn de belangrijkste maatstaf omdat ze het werk vormen dat de tool vervangt.

Methodologie en correctheidscontroles

  • De baseline- en MCP-tests gebruiken dezelfde prompt, taak, model en instellingen. Het enige verschil is of Mariner GPS Tools gekoppeld is.
  • Modellen krijgen niet te horen dat ze de tools moeten gebruiken. Ze beslissen zelf of ze die aanroepen.
  • De tokencijfers komen rechtstreeks van elke modelaanbieder. De MCP-cijfers omvatten de tooldefinities en elke modelaanroep die bij het gebruik van een tool hoort.
  • Antwoorden worden gecontroleerd aan de hand van onafhankelijk berekende verwachte waarden en vaste toleranties. Geen enkel LLM beoordeelt de correctheid.
  • Voor vergelijkingen van tokens en responstijd worden correcte antwoorden gebruikt. Onjuiste antwoorden en fouten van het model of de tools blijven meetellen in de nauwkeurigheidsresultaten, ook wanneer een model de taak weigerde. Runs die om infrastructuurredenen mislukten, zoals een storing bij een provider, werden opnieuw uitgevoerd en de oorspronkelijke mislukte runs werden uitgesloten.
  • Alle toolaanroepen gebruiken het productie-MCP-eindpunt van Mariner GPS Tools, waarbij netwerk- en MCP-roundtrips in de responstijden zijn inbegrepen.
  • Elk geval wordt voor elk model en elke conditie 3 keer uitgevoerd. De gerapporteerde cijfers zijn medianen, geen geselecteerde beste runs.

Reproduceerbaarheid

Benchmarkdatum20 september 2026
Benchmarkapplicatiewn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Suite-hash (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP-eindpunthttps://marinergps.tools/mcp
MCP-servermariner-tools 1.0.0 · MCP 2025-11-25
Redeneerinspanningmedium
Rune8d9d909-831b-4e5e-91aa-cf1413c81096
Systeemprompt, beide conditiestext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API- en MCP-documentatie