Platforma agentów i API Mariner GPS Tools
Metodologia i wyniki benchmarku
Zobacz, jak Mariner GPS Tools wpływa na zużycie tokenów przez model, czas odpowiedzi i poprawność w 9 modelach AI oraz jak zmierzyliśmy wyniki.
Co mierzy benchmark
Porównujemy te same zadania nawigacyjne z Mariner GPS Tools i bez niego, aby zmierzyć wpływ na tokeny wygenerowane przez model, czas odpowiedzi i poprawność. Każde zadanie korzysta z tego samego modelu, promptu i ustawień, a jedyną różnicą jest dostępność narzędzi MCP.
Najważniejsze wyniki
Pomiar: wrzesień 2026 · 9 modeli · 22 przypadków nawigacyjnych · 3 powtórzenia · 1188 obserwacje · Produkcyjny MCP Mariner GPS Tools
Wyniki według klasy modelu
Każda wartość to mediana z trzech modeli w danej klasie. Klasy odpowiadają temu, jak każdy dostawca sam pozycjonuje model, i zostały ustalone przed odczytaniem wyników.
Wyniki według narzędzia
Zestaw obejmuje wszystkie pięć kalkulatorów w 22 przypadkach, od krótkich odcinków przybrzeżnych po przejścia oceaniczne, w tym trasy przez antypołudnik, na półkuli południowej i w wysokich szerokościach geograficznych. Wynik publikujemy tylko tam, gdzie skorzystał każdy kwalifikujący się model.
Ta tabela łączy użyteczne obserwacje każdego narzędzia: tylko poprawne odpowiedzi, tak jak we wszystkich porównaniach tokenów i czasu odpowiedzi. Strony narzędzi podają medianę z modeli, które się zakwalifikowały, czyli wartość publikowaną przez benchmark dla danego narzędzia, więc obie liczby mogą się nieznacznie różnić.
Modele sprawnie radziły sobie z tym zadaniem samodzielnie. W tych niezależnych testach konwersji użycie narzędzia wprowadziło większy narzut, niż pozwoliło zaoszczędzić.
Modele sprawnie radziły sobie z tym zadaniem samodzielnie. W tych niezależnych testach konwersji użycie narzędzia wprowadziło większy narzut, niż pozwoliło zaoszczędzić.
Dlaczego wyniki różnią się w zależności od narzędzia
Użycie narzędzia MCP dodaje do każdego żądania pewien narzut. Przy bardziej złożonych obliczeniach, takich jak kurs, odległość i boczne odchylenie od trasy, równoważy go to, że model wykonuje sam znacznie mniej pracy. W naszych testach narzędzia te przyniosły wyraźne ograniczenie wygenerowanych tokenów i czasów odpowiedzi, zachowując przy tym 100% poprawności.
W przypadku prostszych zadań, takich jak konwersja jednostek i współrzędnych, modele często potrafią szybko obliczyć odpowiedź samodzielnie. W tym benchmarku użycie narzędzia do tych zadań trwało dłużej dla każdego testowanego modelu i łącznie zużywało więcej tokenów.
Wśród 9 przetestowanych modeli redukcja wygenerowanych tokenów wynosiła od 7,3% do 95,4%, a wydajność całego przebiegu mieściła się w przedziale od 0,6× do 5,8× wariantu bazowego.
Wygenerowane tokeny a łączna liczba tokenów
Wygenerowane tokeny to tokeny wyjściowe modelu, łącznie z rozumowaniem. Są głównym wskaźnikiem, ponieważ odpowiadają pracy, którą zastępuje narzędzie.
Metodologia i kontrole poprawności
- Testy bazowe i testy z MCP używają tego samego promptu, zadania, modelu i ustawień. Jedyna różnica polega na tym, czy Mariner GPS Tools jest podłączone do żądania.
- Modelom nie mówi się, aby użyły narzędzi. Same decydują, czy je wywołać.
- Liczby tokenów pochodzą bezpośrednio od każdego dostawcy modelu. Liczby dla MCP obejmują definicje narzędzi oraz każdą turę modelu związaną z użyciem narzędzia.
- Odpowiedzi są sprawdzane względem niezależnie obliczonych wartości oczekiwanych i stałych tolerancji. Poprawności nie ocenia żaden LLM.
- Porównania liczby tokenów i czasu odpowiedzi wykorzystują poprawne odpowiedzi. Niepoprawne odpowiedzi oraz błędy modelu lub narzędzi nadal są uwzględniane w wynikach dokładności, w tym przypadki, w których model odmówił wykonania zadania. Uruchomienia zakończone niepowodzeniem z przyczyn infrastrukturalnych, takich jak awaria dostawcy, zostały powtórzone, a pierwotne nieudane uruchomienia wykluczono.
- Wszystkie wywołania narzędzi korzystają z produkcyjnego punktu końcowego MCP Mariner GPS Tools, a opóźnienia sieci i komunikacji z MCP są wliczone w czasy odpowiedzi.
- Każdy przypadek jest uruchamiany 3 razy dla każdego modelu i wariantu. Podawane wartości to mediany, a nie wybrane najlepsze przebiegi.
Odtwarzalność
20 września 2026wn-mcp-bench 0.1.0 (40436f25ed54)mariner-tools v0.2.0b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066https://marinergps.tools/mcpmariner-tools 1.0.0 · MCP 2025-11-25mediume8d9d909-831b-4e5e-91aa-cf1413c81096You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.