Plateforme d'agents et d'API Mariner GPS Tools
Méthodologie et résultats du benchmark
Découvrez comment Mariner GPS Tools influe sur la consommation de jetons du modèle, le temps de réponse et l'exactitude sur 9 modèles d'IA, et comment nous avons mesuré les résultats.
Ce que mesure le benchmark
Nous comparons les mêmes tâches de navigation avec et sans Mariner GPS Tools afin de mesurer l'effet sur les jetons générés par le modèle, le temps de réponse et l'exactitude. Chaque tâche utilise le même modèle, le même prompt et les mêmes paramètres, la disponibilité des outils MCP étant la seule différence.
Résultats principaux
Mesuré en septembre 2026 · 9 modèles · 22 cas de navigation · 3 répétitions · 1188 observations · MCP de production de Mariner GPS Tools
Résultats par classe de modèle
Chaque chiffre est la médiane des trois modèles de la classe. Les classes suivent le positionnement que chaque fournisseur donne à son modèle et ont été fixées avant la lecture des résultats.
Résultats par outil
La suite couvre les cinq calculateurs sur 22 cas, des courts trajets côtiers aux traversées océaniques, y compris des routes franchissant l'antiméridien, dans l'hémisphère sud et à haute latitude. Un chiffre n'est publié que là où tous les modèles éligibles en ont tiré profit.
Ce tableau regroupe les observations exploitables de chaque outil : uniquement les réponses correctes, comme dans toutes les comparaisons de jetons et de temps de réponse. Les pages des outils indiquent la médiane sur les modèles éligibles, c'est-à-dire le chiffre que le benchmark publie par outil, si bien que les deux peuvent légèrement différer.
Les modèles ont effectué cette tâche efficacement par eux-mêmes. Dans ces tests de conversion indépendants, l'utilisation de l'outil a ajouté plus de surcoût qu'elle n'en a économisé.
Les modèles ont effectué cette tâche efficacement par eux-mêmes. Dans ces tests de conversion indépendants, l'utilisation de l'outil a ajouté plus de surcoût qu'elle n'en a économisé.
Pourquoi les résultats varient selon l'outil
L'utilisation d'un outil MCP ajoute un certain surcoût à chaque requête. Pour les calculs plus complexes comme le relèvement, la distance et l'écart de route, il est compensé par le fait que le modèle travaille lui-même beaucoup moins. Lors de nos tests, ces outils ont produit des réductions substantielles des jetons générés et des temps de réponse, tout en conservant 100% d'exactitude.
Pour les tâches plus simples, comme la conversion d'unités et de coordonnées, les modèles peuvent souvent calculer rapidement la réponse eux-mêmes. Dans ce benchmark, l'utilisation d'un outil pour ces tâches a pris plus de temps pour chaque modèle testé et a utilisé davantage de jetons au total.
Sur les 9 modèles testés, la réduction des jetons générés allait de 7,3 % à 95,4 %, tandis que les performances de bout en bout se situaient entre 0,6× et 5,8× la référence.
Jetons générés et jetons totaux
Les jetons générés sont les jetons de sortie du modèle, raisonnement compris. Ils constituent l'indicateur principal, car ils représentent le travail que l'outil remplace.
Méthodologie et vérifications d'exactitude
- Les tests de référence et les tests MCP utilisent le même prompt, la même tâche, le même modèle et les mêmes paramètres. La seule différence est que Mariner GPS Tools est connecté ou non.
- Il n'est pas demandé aux modèles d'utiliser les outils. Ce sont eux qui décident de les appeler ou non.
- Les décomptes de jetons proviennent directement de chaque fournisseur de modèles. Les chiffres MCP incluent les définitions d'outils et chaque tour du modèle qui participe à l'utilisation d'un outil.
- Les réponses sont vérifiées par rapport à des valeurs attendues calculées indépendamment et à des tolérances fixes. Aucun LLM ne juge l'exactitude.
- Les comparaisons de jetons et de temps de réponse utilisent les réponses correctes. Les réponses incorrectes ainsi que les échecs du modèle ou des outils restent comptabilisés dans les résultats de précision, y compris lorsqu'un modèle a refusé la tâche. Les exécutions ayant échoué pour des raisons d'infrastructure, comme une panne du fournisseur, ont été relancées et les échecs initiaux ont été exclus.
- Tous les appels d'outils passent par le point de terminaison MCP de production de Mariner GPS Tools, les allers-retours réseau et MCP étant inclus dans les temps de réponse.
- Chaque cas est exécuté 3 fois pour chaque modèle et chaque condition. Les chiffres publiés sont des médianes, et non des meilleures exécutions sélectionnées.
Reproductibilité
20 septembre 2026wn-mcp-bench 0.1.0 (40436f25ed54)mariner-tools v0.2.0b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066https://marinergps.tools/mcpmariner-tools 1.0.0 · MCP 2025-11-25mediume8d9d909-831b-4e5e-91aa-cf1413c81096You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.