DE
API & MCPDokumentation

Mariner GPS Tools Agenten- & API-Plattform

Benchmark-Methodik und Ergebnisse

Sehen Sie, wie sich Mariner GPS Tools auf Tokenverbrauch, Antwortzeit und Genauigkeit von 9 KI-Modellen auswirkt und wie wir die Ergebnisse gemessen haben.

Was der Benchmark misst

Wir vergleichen dieselben Navigationsaufgaben mit und ohne Mariner GPS Tools, um die Auswirkung auf generierte Modell-Tokens, Antwortzeit und Genauigkeit zu messen. Jede Aufgabe verwendet dasselbe Modell, denselben Prompt und dieselben Einstellungen; der einzige Unterschied ist die Verfügbarkeit der MCP-Tools.

Wichtigste Ergebnisse

84 %weniger generierte Modell-TokensMedian über 9 getestete Modelle.
100 %korrekt mit MCP594/594 Beobachtungen mit dem Produktions-MCP innerhalb der Toleranz.
91,6 %korrekt ohne MCP594 Beobachtungen, die das Modell allein beantwortet hat.

Gemessen im September 2026 · 9 Modelle · 22 Navigationsfälle · 3 Wiederholungen · 1188 Beobachtungen · Produktions-MCP von Mariner GPS Tools

Ergebnisse nach Modellklasse

Jeder Wert ist der Median der drei Modelle der jeweiligen Klasse. Die Klassen folgen der Positionierung des Modells durch den jeweiligen Anbieter und wurden festgelegt, bevor die Ergebnisse gelesen wurden.

Reduktion der generierten Tokens
Klein / effizient94,1 %
Allzweck93,0 %
Fortgeschritten78,4 %
Gesamtmedian84 %
Korrekte Antworten
LLM-Baseline91,6 % (544/594)
LLM + MCP100 % (594/594)

Ergebnisse nach Tool

Die Suite deckt alle fünf Rechner mit 22 Fällen ab, von kurzen Küstenabschnitten bis zu Ozeanpassagen, einschließlich Routen über den Antimeridian, auf der Südhalbkugel und in hohen Breiten. Ein Wert wird nur dort veröffentlicht, wo jedes qualifizierte Modell profitiert hat.

Diese Tabelle fasst die verwertbaren Beobachtungen jedes Tools zusammen: nur korrekte Antworten, wie bei allen Token- und Antwortzeitvergleichen. Die Tool-Seiten nennen den Median über die qualifizierten Modelle, also den Wert, den der Benchmark pro Tool veröffentlicht, sodass beide leicht voneinander abweichen können.

ToolGenerierte TokensBeschleunigungKorrekte Antworten: LLM-Baseline, LLM + MCP
Anfangsrechtweisende Peilung berechnen-91,6 %5,1×LLM-Baseline: 101/108, LLM + MCP: 108/108
Großkreisentfernung berechnen-91,0 %4,4×LLM-Baseline: 94/108, LLM + MCP: 108/108
Kursabweichung (XTE) berechnen-94,5 %9,8×LLM-Baseline: 106/135, LLM + MCP: 135/135
Koordinaten einlesen und formatierenNicht veröffentlicht+7,1 %2,9× langsamerLLM-Baseline: 108/108, LLM + MCP: 108/108

Die Modelle bewältigten diese Aufgabe bereits selbst effizient. Bei diesen eigenständigen Konvertierungstests verursachte die Verwendung des Tools mehr zusätzlichen Aufwand, als sie einsparte.

Geschwindigkeiten umrechnenNicht veröffentlicht+33,0 %4,1× langsamerLLM-Baseline: 135/135, LLM + MCP: 135/135

Die Modelle bewältigten diese Aufgabe bereits selbst effizient. Bei diesen eigenständigen Konvertierungstests verursachte die Verwendung des Tools mehr zusätzlichen Aufwand, als sie einsparte.

Warum die Ergebnisse je nach Tool unterschiedlich ausfallen

Die Nutzung eines MCP-Tools verursacht bei jeder Anfrage etwas Overhead. Bei komplexeren Berechnungen wie Peilung, Entfernung und Kursabweichung wird das dadurch ausgeglichen, dass das Modell selbst deutlich weniger Arbeit leistet. In unseren Tests erzielten diese Tools deutliche Reduktionen bei den generierten Tokens und den Antwortzeiten, bei durchgehend 100% Genauigkeit.

Bei einfacheren Aufgaben wie der Einheiten- und Koordinatenumrechnung können Modelle die Antwort oft schnell selbst berechnen. In diesem Benchmark dauerte die Verwendung eines Tools für diese Aufgaben bei jedem getesteten Modell länger und verbrauchte insgesamt mehr Tokens.

Über die 9 getesteten Modelle hinweg reichte die Reduktion der generierten Tokens von 7,3 % bis 95,4 %, während die End-to-End-Leistung zwischen 0,6× und 5,8× der Baseline lag.

Generierte Tokens und Gesamt-Tokens

Generierte Tokens sind die Ausgabe-Tokens des Modells, einschließlich Reasoning. Sie sind die zentrale Kennzahl, weil sie die Arbeit darstellen, die das Tool ersetzt.

Methodik und Korrektheitsprüfungen

  • Baseline- und MCP-Tests verwenden denselben Prompt, dieselbe Aufgabe, dasselbe Modell und dieselben Einstellungen. Der einzige Unterschied ist, ob Mariner GPS Tools angebunden ist.
  • Den Modellen wird nicht gesagt, dass sie die Tools verwenden sollen. Sie entscheiden selbst, ob sie sie aufrufen.
  • Die Token-Zahlen stammen direkt von den jeweiligen Modellanbietern. Die MCP-Zahlen enthalten die Tooldefinitionen und jeden Modellaufruf, der zur Tool-Nutzung gehört.
  • Antworten werden anhand unabhängig berechneter Erwartungswerte und fester Toleranzen geprüft. Kein LLM beurteilt die Korrektheit.
  • Für Vergleiche von Tokens und Antwortzeiten werden korrekte Antworten verwendet. Falsche Antworten sowie Modell- und Toolfehler werden weiterhin in den Genauigkeitsergebnissen berücksichtigt, einschließlich Fällen, in denen ein Modell die Aufgabe abgelehnt hat. Läufe, die aus Infrastrukturgründen wie einem Ausfall des Anbieters fehlgeschlagen sind, wurden wiederholt und die ursprünglichen fehlgeschlagenen Läufe ausgeschlossen.
  • Alle Tool-Aufrufe laufen über den Produktions-MCP-Endpunkt von Mariner GPS Tools, wobei Netzwerk- und MCP-Roundtrips in den Antwortzeiten enthalten sind.
  • Jeder Fall wird für jedes Modell und jede Bedingung 3-mal ausgeführt. Die angegebenen Werte sind Mediane, keine ausgewählten besten Läufe.

Reproduzierbarkeit

Benchmark-Datum20. September 2026
Benchmark-Anwendungwn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Suite-Hash (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP-Endpunkthttps://marinergps.tools/mcp
MCP-Servermariner-tools 1.0.0 · MCP 2025-11-25
Reasoning-Aufwandmedium
Laufe8d9d909-831b-4e5e-91aa-cf1413c81096
Systemprompt, beide Bedingungentext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API- und MCP-Dokumentation