IT
API & MCPDocumentazione

Piattaforma per agenti e API Mariner GPS Tools

Metodologia e risultati del benchmark

Scopri come Mariner GPS Tools incide sul consumo di token del modello, sul tempo di risposta e sull'accuratezza su 9 modelli AI, e come abbiamo misurato i risultati.

Che cosa misura il benchmark

Confrontiamo le stesse attività di navigazione con e senza Mariner GPS Tools per misurare l'effetto sui token generati dal modello, sul tempo di risposta e sull'accuratezza. Ogni attività usa lo stesso modello, lo stesso prompt e le stesse impostazioni, con la disponibilità degli strumenti MCP come unica differenza.

Risultati principali

84%di token generati dal modello in menoMediana su 9 modelli testati.
100%di risposte corrette con MCP594/594 osservazioni sull'MCP di produzione entro la tolleranza.
91,6%di risposte corrette senza MCP594 osservazioni a cui il modello ha risposto da solo.

Misurato a settembre 2026 · 9 modelli · 22 casi di navigazione · 3 ripetizioni · 1188 osservazioni · MCP di produzione di Mariner GPS Tools

Risultati per classe di modello

Ogni valore è la mediana dei tre modelli di quella classe. Le classi seguono il posizionamento che ciascun fornitore dà al proprio modello e sono state fissate prima di leggere i risultati.

Riduzione dei token generati
Piccolo / efficiente94,1%
Uso generale93,0%
Avanzato78,4%
Mediana complessiva84%
Risposte corrette
LLM di riferimento91,6% (544/594)
LLM + MCP100% (594/594)

Risultati per strumento

La suite copre tutti e cinque i calcolatori su 22 casi, da brevi tratte costiere a traversate oceaniche, comprese rotte che attraversano l'antimeridiano, nell'emisfero australe e ad alta latitudine. Un dato viene pubblicato solo dove ogni modello idoneo ne ha tratto vantaggio.

Questa tabella aggrega le osservazioni utilizzabili di ciascuno strumento: solo le risposte corrette, come in tutti i confronti di token e di tempo di risposta. Le pagine degli strumenti riportano la mediana sui modelli idonei, che è il valore pubblicato dal benchmark per ogni strumento, quindi i due possono differire leggermente.

StrumentoToken generatiAumento di velocitàRisposte corrette: LLM di riferimento, LLM + MCP
Calcola il rilevamento vero iniziale-91,6%5,1×LLM di riferimento: 101/108, LLM + MCP: 108/108
Calcola la distanza ortodromica-91,0%4,4×LLM di riferimento: 94/108, LLM + MCP: 108/108
Calcolare l'errore di fuori rotta (XTE)-94,5%9,8×LLM di riferimento: 106/135, LLM + MCP: 135/135
Interpreta e formatta coordinateNon pubblicato+7,1%2,9× più lentoLLM di riferimento: 108/108, LLM + MCP: 108/108

I modelli hanno gestito questo compito in modo efficiente da soli. In questi test di conversione indipendenti, l'uso dello strumento ha aggiunto più overhead di quanto ne abbia risparmiato.

Converti velocitàNon pubblicato+33,0%4,1× più lentoLLM di riferimento: 135/135, LLM + MCP: 135/135

I modelli hanno gestito questo compito in modo efficiente da soli. In questi test di conversione indipendenti, l'uso dello strumento ha aggiunto più overhead di quanto ne abbia risparmiato.

Perché i risultati variano da strumento a strumento

L'uso di uno strumento MCP comporta un certo costo aggiuntivo per ogni richiesta. Nei calcoli più complessi come rotta, distanza ed errore di fuori rotta, questo è compensato dal fatto che il modello lavora molto meno per conto proprio. Nei nostri test questi strumenti hanno prodotto riduzioni consistenti dei token generati e dei tempi di risposta, mantenendo un'accuratezza del 100%.

Per attività più semplici, come la conversione di unità e coordinate, i modelli possono spesso calcolare rapidamente la risposta da soli. In questo benchmark, l'uso di uno strumento per queste attività ha richiesto più tempo per ogni modello testato e ha utilizzato complessivamente più token.

Sui 9 modelli testati, la riduzione dei token generati è andata da 7,3% a 95,4%, mentre le prestazioni end-to-end sono andate da 0,6× a 5,8× rispetto al riferimento.

Token generati e token totali

I token generati sono i token di output del modello, ragionamento incluso. Sono la metrica principale perché rappresentano il lavoro che lo strumento sostituisce.

Metodologia e controlli di correttezza

  • I test di riferimento e quelli con MCP usano lo stesso prompt, la stessa attività, lo stesso modello e le stesse impostazioni. L'unica differenza è se Mariner GPS Tools è collegato.
  • Ai modelli non viene detto di usare gli strumenti. Sono loro a decidere se chiamarli.
  • I conteggi dei token arrivano direttamente da ciascun fornitore di modelli. I valori con MCP includono le definizioni degli strumenti e ogni turno del modello coinvolto nell'uso di uno strumento.
  • Le risposte sono verificate rispetto a valori attesi calcolati in modo indipendente e a tolleranze fisse. Nessun LLM giudica la correttezza.
  • I confronti relativi ai token e ai tempi di risposta utilizzano risposte corrette. Le risposte errate e gli errori del modello o degli strumenti continuano a essere conteggiati nei risultati di accuratezza, inclusi i casi in cui un modello ha rifiutato l'attività. Le esecuzioni non riuscite per motivi infrastrutturali, come un'interruzione del provider, sono state ripetute e gli errori originali esclusi.
  • Tutte le chiamate agli strumenti usano l'endpoint MCP di produzione di Mariner GPS Tools, con i round trip di rete e MCP inclusi nei tempi di risposta.
  • Ogni caso viene eseguito 3 volte per ciascun modello e condizione. I valori riportati sono mediane, non le migliori esecuzioni selezionate.

Riproducibilità

Data del benchmark20 settembre 2026
Applicazione di benchmarkwn-mcp-bench 0.1.0 (40436f25ed54)
Suitemariner-tools v0.2.0
Hash della suite (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
Endpoint MCPhttps://marinergps.tools/mcp
Server MCPmariner-tools 1.0.0 · MCP 2025-11-25
Impegno di ragionamentomedium
Esecuzionee8d9d909-831b-4e5e-91aa-cf1413c81096
Prompt di sistema, entrambe le condizionitext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
Documentazione API e MCP