FR
API & MCPDocumentation

Plateforme d'agents et d'API Mariner GPS Tools

Méthodologie et résultats du benchmark

Découvrez comment Mariner GPS Tools influe sur la consommation de jetons du modèle, le temps de réponse et l'exactitude sur 9 modèles d'IA, et comment nous avons mesuré les résultats.

Ce que mesure le benchmark

Nous comparons les mêmes tâches de navigation avec et sans Mariner GPS Tools afin de mesurer l'effet sur les jetons générés par le modèle, le temps de réponse et l'exactitude. Chaque tâche utilise le même modèle, le même prompt et les mêmes paramètres, la disponibilité des outils MCP étant la seule différence.

Résultats principaux

84 %de jetons générés par le modèle en moinsMédiane sur 9 modèles testés.
100 %de réponses correctes avec MCP594/594 observations sur le MCP de production dans la tolérance.
91,6 %de réponses correctes sans MCP594 observations auxquelles le modèle a répondu seul.

Mesuré en septembre 2026 · 9 modèles · 22 cas de navigation · 3 répétitions · 1188 observations · MCP de production de Mariner GPS Tools

Résultats par classe de modèle

Chaque chiffre est la médiane des trois modèles de la classe. Les classes suivent le positionnement que chaque fournisseur donne à son modèle et ont été fixées avant la lecture des résultats.

Réduction des jetons générés
Petit / efficace94,1 %
Usage général93,0 %
Avancé78,4 %
Médiane globale84 %
Réponses correctes
LLM de référence91,6 % (544/594)
LLM + MCP100 % (594/594)

Résultats par outil

La suite couvre les cinq calculateurs sur 22 cas, des courts trajets côtiers aux traversées océaniques, y compris des routes franchissant l'antiméridien, dans l'hémisphère sud et à haute latitude. Un chiffre n'est publié que là où tous les modèles éligibles en ont tiré profit.

Ce tableau regroupe les observations exploitables de chaque outil : uniquement les réponses correctes, comme dans toutes les comparaisons de jetons et de temps de réponse. Les pages des outils indiquent la médiane sur les modèles éligibles, c'est-à-dire le chiffre que le benchmark publie par outil, si bien que les deux peuvent légèrement différer.

OutilJetons générésGain de vitesseRéponses correctes: LLM de référence, LLM + MCP
Calculer le relèvement vrai initial-91,6 %5,1×LLM de référence: 101/108, LLM + MCP: 108/108
Calculer la distance orthodromique-91,0 %4,4×LLM de référence: 94/108, LLM + MCP: 108/108
Calculer l'écart de route (XTE)-94,5 %9,8×LLM de référence: 106/135, LLM + MCP: 135/135
Analyser et formater les coordonnéesNon publié+7,1 %2,9× plus lentLLM de référence: 108/108, LLM + MCP: 108/108

Les modèles ont effectué cette tâche efficacement par eux-mêmes. Dans ces tests de conversion indépendants, l'utilisation de l'outil a ajouté plus de surcoût qu'elle n'en a économisé.

Convertir les vitessesNon publié+33,0 %4,1× plus lentLLM de référence: 135/135, LLM + MCP: 135/135

Les modèles ont effectué cette tâche efficacement par eux-mêmes. Dans ces tests de conversion indépendants, l'utilisation de l'outil a ajouté plus de surcoût qu'elle n'en a économisé.

Pourquoi les résultats varient selon l'outil

L'utilisation d'un outil MCP ajoute un certain surcoût à chaque requête. Pour les calculs plus complexes comme le relèvement, la distance et l'écart de route, il est compensé par le fait que le modèle travaille lui-même beaucoup moins. Lors de nos tests, ces outils ont produit des réductions substantielles des jetons générés et des temps de réponse, tout en conservant 100% d'exactitude.

Pour les tâches plus simples, comme la conversion d'unités et de coordonnées, les modèles peuvent souvent calculer rapidement la réponse eux-mêmes. Dans ce benchmark, l'utilisation d'un outil pour ces tâches a pris plus de temps pour chaque modèle testé et a utilisé davantage de jetons au total.

Sur les 9 modèles testés, la réduction des jetons générés allait de 7,3 % à 95,4 %, tandis que les performances de bout en bout se situaient entre 0,6× et 5,8× la référence.

Jetons générés et jetons totaux

Les jetons générés sont les jetons de sortie du modèle, raisonnement compris. Ils constituent l'indicateur principal, car ils représentent le travail que l'outil remplace.

Méthodologie et vérifications d'exactitude

  • Les tests de référence et les tests MCP utilisent le même prompt, la même tâche, le même modèle et les mêmes paramètres. La seule différence est que Mariner GPS Tools est connecté ou non.
  • Il n'est pas demandé aux modèles d'utiliser les outils. Ce sont eux qui décident de les appeler ou non.
  • Les décomptes de jetons proviennent directement de chaque fournisseur de modèles. Les chiffres MCP incluent les définitions d'outils et chaque tour du modèle qui participe à l'utilisation d'un outil.
  • Les réponses sont vérifiées par rapport à des valeurs attendues calculées indépendamment et à des tolérances fixes. Aucun LLM ne juge l'exactitude.
  • Les comparaisons de jetons et de temps de réponse utilisent les réponses correctes. Les réponses incorrectes ainsi que les échecs du modèle ou des outils restent comptabilisés dans les résultats de précision, y compris lorsqu'un modèle a refusé la tâche. Les exécutions ayant échoué pour des raisons d'infrastructure, comme une panne du fournisseur, ont été relancées et les échecs initiaux ont été exclus.
  • Tous les appels d'outils passent par le point de terminaison MCP de production de Mariner GPS Tools, les allers-retours réseau et MCP étant inclus dans les temps de réponse.
  • Chaque cas est exécuté 3 fois pour chaque modèle et chaque condition. Les chiffres publiés sont des médianes, et non des meilleures exécutions sélectionnées.

Reproductibilité

Date du benchmark20 septembre 2026
Application de benchmarkwn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Empreinte de la suite (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
Point de terminaison MCPhttps://marinergps.tools/mcp
Serveur MCPmariner-tools 1.0.0 · MCP 2025-11-25
Effort de raisonnementmedium
Exécutione8d9d909-831b-4e5e-91aa-cf1413c81096
Prompt système, les deux conditionstext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
Documentation API et MCP