PL
API & MCPDokumentacja

Platforma agentów i API Mariner GPS Tools

Metodologia i wyniki benchmarku

Zobacz, jak Mariner GPS Tools wpływa na zużycie tokenów przez model, czas odpowiedzi i poprawność w 9 modelach AI oraz jak zmierzyliśmy wyniki.

Co mierzy benchmark

Porównujemy te same zadania nawigacyjne z Mariner GPS Tools i bez niego, aby zmierzyć wpływ na tokeny wygenerowane przez model, czas odpowiedzi i poprawność. Każde zadanie korzysta z tego samego modelu, promptu i ustawień, a jedyną różnicą jest dostępność narzędzi MCP.

Najważniejsze wyniki

84%mniej tokenów wygenerowanych przez modelMediana dla 9 przetestowanych modeli.
100%poprawnych odpowiedzi z MCP594/594 obserwacji z produkcyjnym MCP w granicach tolerancji.
91,6%poprawnych odpowiedzi bez MCP594 obserwacji, na które model odpowiedział samodzielnie.

Pomiar: wrzesień 2026 · 9 modeli · 22 przypadków nawigacyjnych · 3 powtórzenia · 1188 obserwacje · Produkcyjny MCP Mariner GPS Tools

Wyniki według klasy modelu

Każda wartość to mediana z trzech modeli w danej klasie. Klasy odpowiadają temu, jak każdy dostawca sam pozycjonuje model, i zostały ustalone przed odczytaniem wyników.

Redukcja wygenerowanych tokenów
Małe / wydajne94,1%
Ogólnego przeznaczenia93,0%
Zaawansowane78,4%
Mediana ogólna84%
Poprawne odpowiedzi
LLM, wariant bazowy91,6% (544/594)
LLM + MCP100% (594/594)

Wyniki według narzędzia

Zestaw obejmuje wszystkie pięć kalkulatorów w 22 przypadkach, od krótkich odcinków przybrzeżnych po przejścia oceaniczne, w tym trasy przez antypołudnik, na półkuli południowej i w wysokich szerokościach geograficznych. Wynik publikujemy tylko tam, gdzie skorzystał każdy kwalifikujący się model.

Ta tabela łączy użyteczne obserwacje każdego narzędzia: tylko poprawne odpowiedzi, tak jak we wszystkich porównaniach tokenów i czasu odpowiedzi. Strony narzędzi podają medianę z modeli, które się zakwalifikowały, czyli wartość publikowaną przez benchmark dla danego narzędzia, więc obie liczby mogą się nieznacznie różnić.

NarzędzieWygenerowane tokenyPrzyspieszeniePoprawne odpowiedzi: LLM, wariant bazowy, LLM + MCP
Oblicz początkowy namiar rzeczywisty-91,6%5,1×LLM, wariant bazowy: 101/108, LLM + MCP: 108/108
Oblicz odległość po ortodromie-91,0%4,4×LLM, wariant bazowy: 94/108, LLM + MCP: 108/108
Oblicz boczne odchylenie od trasy (XTE)-94,5%9,8×LLM, wariant bazowy: 106/135, LLM + MCP: 135/135
Odczytaj i sformatuj współrzędneNieopublikowane+7,1%2,9× wolniejLLM, wariant bazowy: 108/108, LLM + MCP: 108/108

Modele sprawnie radziły sobie z tym zadaniem samodzielnie. W tych niezależnych testach konwersji użycie narzędzia wprowadziło większy narzut, niż pozwoliło zaoszczędzić.

Przelicz prędkościNieopublikowane+33,0%4,1× wolniejLLM, wariant bazowy: 135/135, LLM + MCP: 135/135

Modele sprawnie radziły sobie z tym zadaniem samodzielnie. W tych niezależnych testach konwersji użycie narzędzia wprowadziło większy narzut, niż pozwoliło zaoszczędzić.

Dlaczego wyniki różnią się w zależności od narzędzia

Użycie narzędzia MCP dodaje do każdego żądania pewien narzut. Przy bardziej złożonych obliczeniach, takich jak kurs, odległość i boczne odchylenie od trasy, równoważy go to, że model wykonuje sam znacznie mniej pracy. W naszych testach narzędzia te przyniosły wyraźne ograniczenie wygenerowanych tokenów i czasów odpowiedzi, zachowując przy tym 100% poprawności.

W przypadku prostszych zadań, takich jak konwersja jednostek i współrzędnych, modele często potrafią szybko obliczyć odpowiedź samodzielnie. W tym benchmarku użycie narzędzia do tych zadań trwało dłużej dla każdego testowanego modelu i łącznie zużywało więcej tokenów.

Wśród 9 przetestowanych modeli redukcja wygenerowanych tokenów wynosiła od 7,3% do 95,4%, a wydajność całego przebiegu mieściła się w przedziale od 0,6× do 5,8× wariantu bazowego.

Wygenerowane tokeny a łączna liczba tokenów

Wygenerowane tokeny to tokeny wyjściowe modelu, łącznie z rozumowaniem. Są głównym wskaźnikiem, ponieważ odpowiadają pracy, którą zastępuje narzędzie.

Metodologia i kontrole poprawności

  • Testy bazowe i testy z MCP używają tego samego promptu, zadania, modelu i ustawień. Jedyna różnica polega na tym, czy Mariner GPS Tools jest podłączone do żądania.
  • Modelom nie mówi się, aby użyły narzędzi. Same decydują, czy je wywołać.
  • Liczby tokenów pochodzą bezpośrednio od każdego dostawcy modelu. Liczby dla MCP obejmują definicje narzędzi oraz każdą turę modelu związaną z użyciem narzędzia.
  • Odpowiedzi są sprawdzane względem niezależnie obliczonych wartości oczekiwanych i stałych tolerancji. Poprawności nie ocenia żaden LLM.
  • Porównania liczby tokenów i czasu odpowiedzi wykorzystują poprawne odpowiedzi. Niepoprawne odpowiedzi oraz błędy modelu lub narzędzi nadal są uwzględniane w wynikach dokładności, w tym przypadki, w których model odmówił wykonania zadania. Uruchomienia zakończone niepowodzeniem z przyczyn infrastrukturalnych, takich jak awaria dostawcy, zostały powtórzone, a pierwotne nieudane uruchomienia wykluczono.
  • Wszystkie wywołania narzędzi korzystają z produkcyjnego punktu końcowego MCP Mariner GPS Tools, a opóźnienia sieci i komunikacji z MCP są wliczone w czasy odpowiedzi.
  • Każdy przypadek jest uruchamiany 3 razy dla każdego modelu i wariantu. Podawane wartości to mediany, a nie wybrane najlepsze przebiegi.

Odtwarzalność

Data benchmarku20 września 2026
Aplikacja benchmarkowawn-mcp-bench 0.1.0 (40436f25ed54)
Zestawmariner-tools v0.2.0
Skrót zestawu (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
Punkt końcowy MCPhttps://marinergps.tools/mcp
Serwer MCPmariner-tools 1.0.0 · MCP 2025-11-25
Poziom rozumowaniamedium
Przebiege8d9d909-831b-4e5e-91aa-cf1413c81096
Prompt systemowy, oba wariantytext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
Dokumentacja API i MCP