Plataforma de agentes y API Mariner GPS Tools
Metodología y resultados del benchmark
Descubre cómo afecta Mariner GPS Tools al uso de tokens del modelo, al tiempo de respuesta y a la exactitud en 9 modelos de IA, y cómo medimos los resultados.
Qué mide el benchmark
Comparamos las mismas tareas de navegación con y sin Mariner GPS Tools para medir el efecto en los tokens generados por el modelo, el tiempo de respuesta y la exactitud. Cada tarea usa el mismo modelo, el mismo prompt y la misma configuración, y la única diferencia es si las herramientas MCP están disponibles.
Resultados principales
Medido en septiembre de 2026 · 9 modelos · 22 casos de navegación · 3 repeticiones · 1188 observaciones · MCP de producción de Mariner GPS Tools
Resultados por clase de modelo
Cada cifra es la mediana de los tres modelos de esa clase. Las clases siguen el posicionamiento que cada proveedor da a su modelo y se fijaron antes de leer los resultados.
Resultados por herramienta
La suite cubre las cinco calculadoras en 22 casos, desde tramos costeros cortos hasta travesías oceánicas, incluidas rutas que cruzan el antimeridiano, en el hemisferio sur y en latitudes altas. Solo se publica una cifra donde todos los modelos aptos se beneficiaron.
Esta tabla agrupa las observaciones utilizables de cada herramienta: solo respuestas correctas, como en todas las comparaciones de tokens y de tiempo de respuesta. Las páginas de las herramientas citan la mediana de los modelos aptos, que es la cifra que el benchmark publica por herramienta, por lo que ambas pueden diferir ligeramente.
Los modelos realizaron esta tarea de forma eficiente por sí solos. En estas pruebas de conversión independientes, usar la herramienta añadió más sobrecarga de la que ahorró.
Los modelos realizaron esta tarea de forma eficiente por sí solos. En estas pruebas de conversión independientes, usar la herramienta añadió más sobrecarga de la que ahorró.
Por qué los resultados varían según la herramienta
Usar una herramienta MCP añade cierto coste adicional a cada solicitud. En cálculos más complejos, como el rumbo, la distancia y el error de derrota, eso se compensa porque el modelo hace mucho menos trabajo por su cuenta. En nuestras pruebas, estas herramientas lograron reducciones notables de tokens generados y de tiempos de respuesta, manteniendo un 100% de exactitud.
Para tareas más sencillas, como la conversión de unidades y coordenadas, los modelos suelen poder calcular la respuesta rápidamente por sí solos. En este benchmark, usar una herramienta para estas tareas tardó más con todos los modelos probados y utilizó más tokens en total.
Entre los 9 modelos probados, la reducción de tokens generados osciló entre 7,3 % y 95,4 %, mientras que el rendimiento de extremo a extremo osciló entre 0,6× y 5,8× la referencia.
Tokens generados y tokens totales
Los tokens generados son los tokens de salida del modelo, incluido el razonamiento. Son la métrica principal porque representan el trabajo que la herramienta sustituye.
Metodología y comprobaciones de corrección
- Las pruebas de referencia y las pruebas con MCP usan el mismo prompt, la misma tarea, el mismo modelo y la misma configuración. La única diferencia es si Mariner GPS Tools está conectado.
- A los modelos no se les indica que usen las herramientas. Ellos deciden si las llaman.
- Los recuentos de tokens proceden directamente de cada proveedor de modelos. Las cifras con MCP incluyen las definiciones de herramientas y cada turno del modelo que interviene en el uso de una herramienta.
- Las respuestas se comprueban frente a valores esperados calculados de forma independiente y tolerancias fijas. Ningún LLM juzga la corrección.
- Las comparaciones de tokens y tiempo de respuesta utilizan respuestas correctas. Las respuestas incorrectas y los fallos del modelo o de las herramientas siguen contando en los resultados de precisión, incluidos los casos en los que un modelo rechazó la tarea. Las ejecuciones que fallaron por motivos de infraestructura, como una interrupción del proveedor, se volvieron a intentar y se excluyeron los fallos originales.
- Todas las llamadas a herramientas usan el endpoint MCP de producción de Mariner GPS Tools, con los viajes de ida y vuelta de red y de MCP incluidos en los tiempos de respuesta.
- Cada caso se ejecuta 3 veces para cada modelo y cada condición. Las cifras publicadas son medianas, no las mejores ejecuciones seleccionadas.
Reproducibilidad
20 de septiembre de 2026wn-mcp-bench 0.1.0 (40436f25ed54)mariner-tools v0.2.0b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066https://marinergps.tools/mcpmariner-tools 1.0.0 · MCP 2025-11-25mediume8d9d909-831b-4e5e-91aa-cf1413c81096You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.