Piattaforma per agenti e API Mariner GPS Tools
Metodologia e risultati del benchmark
Scopri come Mariner GPS Tools incide sul consumo di token del modello, sul tempo di risposta e sull'accuratezza su 9 modelli AI, e come abbiamo misurato i risultati.
Che cosa misura il benchmark
Confrontiamo le stesse attività di navigazione con e senza Mariner GPS Tools per misurare l'effetto sui token generati dal modello, sul tempo di risposta e sull'accuratezza. Ogni attività usa lo stesso modello, lo stesso prompt e le stesse impostazioni, con la disponibilità degli strumenti MCP come unica differenza.
Risultati principali
Misurato a settembre 2026 · 9 modelli · 22 casi di navigazione · 3 ripetizioni · 1188 osservazioni · MCP di produzione di Mariner GPS Tools
Risultati per classe di modello
Ogni valore è la mediana dei tre modelli di quella classe. Le classi seguono il posizionamento che ciascun fornitore dà al proprio modello e sono state fissate prima di leggere i risultati.
Risultati per strumento
La suite copre tutti e cinque i calcolatori su 22 casi, da brevi tratte costiere a traversate oceaniche, comprese rotte che attraversano l'antimeridiano, nell'emisfero australe e ad alta latitudine. Un dato viene pubblicato solo dove ogni modello idoneo ne ha tratto vantaggio.
Questa tabella aggrega le osservazioni utilizzabili di ciascuno strumento: solo le risposte corrette, come in tutti i confronti di token e di tempo di risposta. Le pagine degli strumenti riportano la mediana sui modelli idonei, che è il valore pubblicato dal benchmark per ogni strumento, quindi i due possono differire leggermente.
I modelli hanno gestito questo compito in modo efficiente da soli. In questi test di conversione indipendenti, l'uso dello strumento ha aggiunto più overhead di quanto ne abbia risparmiato.
I modelli hanno gestito questo compito in modo efficiente da soli. In questi test di conversione indipendenti, l'uso dello strumento ha aggiunto più overhead di quanto ne abbia risparmiato.
Perché i risultati variano da strumento a strumento
L'uso di uno strumento MCP comporta un certo costo aggiuntivo per ogni richiesta. Nei calcoli più complessi come rotta, distanza ed errore di fuori rotta, questo è compensato dal fatto che il modello lavora molto meno per conto proprio. Nei nostri test questi strumenti hanno prodotto riduzioni consistenti dei token generati e dei tempi di risposta, mantenendo un'accuratezza del 100%.
Per attività più semplici, come la conversione di unità e coordinate, i modelli possono spesso calcolare rapidamente la risposta da soli. In questo benchmark, l'uso di uno strumento per queste attività ha richiesto più tempo per ogni modello testato e ha utilizzato complessivamente più token.
Sui 9 modelli testati, la riduzione dei token generati è andata da 7,3% a 95,4%, mentre le prestazioni end-to-end sono andate da 0,6× a 5,8× rispetto al riferimento.
Token generati e token totali
I token generati sono i token di output del modello, ragionamento incluso. Sono la metrica principale perché rappresentano il lavoro che lo strumento sostituisce.
Metodologia e controlli di correttezza
- I test di riferimento e quelli con MCP usano lo stesso prompt, la stessa attività, lo stesso modello e le stesse impostazioni. L'unica differenza è se Mariner GPS Tools è collegato.
- Ai modelli non viene detto di usare gli strumenti. Sono loro a decidere se chiamarli.
- I conteggi dei token arrivano direttamente da ciascun fornitore di modelli. I valori con MCP includono le definizioni degli strumenti e ogni turno del modello coinvolto nell'uso di uno strumento.
- Le risposte sono verificate rispetto a valori attesi calcolati in modo indipendente e a tolleranze fisse. Nessun LLM giudica la correttezza.
- I confronti relativi ai token e ai tempi di risposta utilizzano risposte corrette. Le risposte errate e gli errori del modello o degli strumenti continuano a essere conteggiati nei risultati di accuratezza, inclusi i casi in cui un modello ha rifiutato l'attività. Le esecuzioni non riuscite per motivi infrastrutturali, come un'interruzione del provider, sono state ripetute e gli errori originali esclusi.
- Tutte le chiamate agli strumenti usano l'endpoint MCP di produzione di Mariner GPS Tools, con i round trip di rete e MCP inclusi nei tempi di risposta.
- Ogni caso viene eseguito 3 volte per ciascun modello e condizione. I valori riportati sono mediane, non le migliori esecuzioni selezionate.
Riproducibilità
20 settembre 2026wn-mcp-bench 0.1.0 (40436f25ed54)mariner-tools v0.2.0b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066https://marinergps.tools/mcpmariner-tools 1.0.0 · MCP 2025-11-25mediume8d9d909-831b-4e5e-91aa-cf1413c81096You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.