FI
API & MCPDokumentaatio

Mariner GPS Tools -agentti- ja API-alusta

Vertailutestin menetelmä ja tulokset

Katso, miten Mariner GPS Tools vaikuttaa mallin tokenien käyttöön, vastausaikaan ja tarkkuuteen 9 tekoälymallissa ja miten mittasimme tulokset.

Mitä vertailutesti mittaa

Vertaamme samoja navigointitehtäviä Mariner GPS Toolsin kanssa ja ilman sitä mitataksemme vaikutuksen mallin tuottamiin tokeneihin, vastausaikaan ja tarkkuuteen. Jokaisessa tehtävässä käytetään samaa mallia, kehotetta ja asetuksia, ja ainoa ero on se, ovatko MCP-työkalut käytettävissä.

Keskeiset tulokset

84 %vähemmän mallin tuottamia tokeneitaMediaani 9 testatun mallin kesken.
100 %oikein MCP:n kanssa594/594 tuotannon MCP:llä tehdystä havainnosta toleranssin sisällä.
91,6 %oikein ilman MCP:tä594 havaintoa, joihin malli vastasi yksin.

Mitattu: syyskuu 2026 · 9 mallia · 22 navigointitapausta · 3 toistoa · 1188 havaintoa · Tuotannon Mariner GPS Tools MCP

Tulokset malliluokittain

Jokainen luku on luokan kolmen mallin mediaani. Luokat noudattavat kunkin palveluntarjoajan omaa kuvausta mallin asemasta, ja ne lukittiin ennen tulosten lukemista.

Tuotettujen tokenien vähenemä
Pieni / tehokas94,1 %
Yleiskäyttöinen93,0 %
Edistynyt78,4 %
Kokonaismediaani84 %
Oikeat vastaukset
LLM-perustaso91,6 % (544/594)
LLM + MCP100 % (594/594)

Tulokset työkaluittain

Testisarja kattaa kaikki viisi laskuria 22 tapauksessa, lyhyistä rannikko-osuuksista valtameriylityksiin, mukaan lukien antimeridiaanin ylittävät, eteläisen pallonpuoliskon ja korkeiden leveysasteiden reitit. Luku julkaistaan vain siellä, missä jokainen ehdot täyttävä malli hyötyi.

Tässä taulukossa on yhdistetty kunkin työkalun käyttökelpoiset havainnot: vain oikeat vastaukset, kuten kaikissa tokeni- ja vasteaikavertailuissa. Työkalusivuilla ilmoitetaan mediaani ehdot täyttäneiden mallien kesken, eli luku, jonka vertailutesti julkaisee työkalukohtaisesti, joten luvut voivat poiketa hieman toisistaan.

TyökaluTuotetut tokenitNopeutusOikeat vastaukset: LLM-perustaso, LLM + MCP
Laske alkuperäinen tosisuuntima−91,6 %5,1×LLM-perustaso: 101/108, LLM + MCP: 108/108
Laske isoympyräetäisyys−91,0 %4,4×LLM-perustaso: 94/108, LLM + MCP: 108/108
Laske sivupoikkeama (XTE)−94,5 %9,8×LLM-perustaso: 106/135, LLM + MCP: 135/135
Tulkitse ja muotoile koordinaatitEi julkaistu+7,1 %2,9× hitaampiLLM-perustaso: 108/108, LLM + MCP: 108/108

Mallit suoriutuivat tästä tehtävästä tehokkaasti itsenäisesti. Näissä erillisissä muunnostesteissä työkalun käyttö aiheutti enemmän lisäkuormaa kuin säästi.

Muunna nopeuksiaEi julkaistu+33,0 %4,1× hitaampiLLM-perustaso: 135/135, LLM + MCP: 135/135

Mallit suoriutuivat tästä tehtävästä tehokkaasti itsenäisesti. Näissä erillisissä muunnostesteissä työkalun käyttö aiheutti enemmän lisäkuormaa kuin säästi.

Miksi tulokset vaihtelevat työkalun mukaan

MCP-työkalun käyttö tuo jokaiseen pyyntöön jonkin verran lisäkuormaa. Monimutkaisemmissa laskuissa, kuten suunnassa, etäisyydessä ja sivupoikkeamassa, sen tasapainottaa se, että malli tekee itse selvästi vähemmän työtä. Testeissämme nämä työkalut vähensivät tuotettuja tokeneita ja vastausaikoja huomattavasti ja säilyttivät samalla 100%:n tarkkuuden.

Yksinkertaisemmissa tehtävissä, kuten yksiköiden ja koordinaattien muuntamisessa, mallit pystyvät usein laskemaan vastauksen nopeasti itse. Tässä vertailutestissä työkalun käyttäminen näihin tehtäviin kesti kauemmin kaikilla testatuilla malleilla ja käytti kokonaisuutena enemmän tokeneita.

Kaikkiaan 9 testatussa mallissa tuotettujen tokenien vähenemä vaihteli välillä 7,3 %–95,4 %, ja päästä päähän -suorituskyky oli 0,6×–5,8× perustasoon nähden.

Tuotetut tokenit ja kokonaistokenit

Tuotetut tokenit ovat mallin tulostetokeneita, päättely mukaan lukien. Ne ovat päämittari, koska ne ovat se työ, jonka työkalu korvaa.

Menetelmä ja oikeellisuustarkistukset

  • Perustaso- ja MCP-testeissä käytetään samaa kehotetta, tehtävää, mallia ja asetuksia. Ainoa ero on se, onko Mariner GPS Tools liitetty pyyntöön.
  • Malleille ei kerrota, että niiden pitäisi käyttää työkaluja. Ne päättävät itse, kutsuvatko ne niitä.
  • Tokenimäärät tulevat suoraan kultakin mallin tarjoajalta. MCP-luvut sisältävät työkalumäärittelyt ja jokaisen mallin vuoron, joka liittyy työkalun käyttöön.
  • Vastaukset tarkistetaan riippumattomasti laskettuja odotusarvoja ja kiinteitä toleransseja vasten. Oikeellisuutta ei arvioi mikään LLM.
  • Tokenien ja vastausajan vertailuissa käytetään oikeita vastauksia. Virheelliset vastaukset sekä mallin ja työkalujen virheet lasketaan edelleen mukaan tarkkuustuloksiin, myös tapauksissa, joissa malli kieltäytyi tehtävästä. Infrastruktuurisyistä, kuten palveluntarjoajan käyttökatkosta, epäonnistuneet ajot suoritettiin uudelleen ja alkuperäiset epäonnistuneet ajot jätettiin pois.
  • Kaikki työkalukutsut käyttävät Mariner GPS Toolsin tuotannon MCP-päätepistettä, ja verkon ja MCP:n edestakaiset kutsut sisältyvät vasteaikoihin.
  • Jokainen tapaus ajetaan 3 kertaa kullekin mallille ja ehdolle. Raportoidut luvut ovat mediaaneja, eivät valittuja parhaita ajoja.

Toistettavuus

Vertailutestin päivämäärä20. syyskuuta 2026
Vertailutestisovelluswn-mcp-bench 0.1.0 (40436f25ed54)
Testisarjamariner-tools v0.2.0
Testisarjan tiiviste (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP-päätepistehttps://marinergps.tools/mcp
MCP-palvelinmariner-tools 1.0.0 · MCP 2025-11-25
Päättelytasomedium
Ajoe8d9d909-831b-4e5e-91aa-cf1413c81096
Järjestelmäkehote, molemmat ehdottext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API & MCP -asiakirjat