ID
API & MCPDokumentasi

Platform Agen & API Mariner GPS Tools

Metodologi dan hasil benchmark

Lihat bagaimana Mariner GPS Tools memengaruhi penggunaan token model, waktu respons, dan akurasi pada 9 model AI, serta bagaimana kami mengukur hasilnya.

Apa yang diukur benchmark

Kami membandingkan tugas navigasi yang sama dengan dan tanpa Mariner GPS Tools untuk mengukur pengaruhnya terhadap token yang dihasilkan model, waktu respons, dan akurasi. Setiap tugas memakai model, prompt, dan pengaturan yang sama, dengan ketersediaan alat MCP sebagai satu-satunya perbedaan.

Hasil utama

84%lebih sedikit token yang dihasilkan modelMedian dari 9 model yang diuji.
100%benar dengan MCP594/594 observasi MCP produksi berada dalam toleransi.
91,6%benar tanpa MCP594 observasi yang dijawab oleh model tanpa alat.

Diukur September 2026 · 9 model · 22 kasus navigasi · 3 pengulangan · 1188 observasi · MCP produksi Mariner GPS Tools

Hasil menurut kelas model

Setiap angka adalah median dari tiga model dalam kelas tersebut. Kelas mengikuti pemosisian model oleh masing-masing penyedia dan ditetapkan sebelum hasil dibaca.

Pengurangan token yang dihasilkan
Kecil / efisien94,1%
Serbaguna93,0%
Lanjutan78,4%
Median keseluruhan84%
Jawaban benar
Baseline LLM91,6% (544/594)
LLM + MCP100% (594/594)

Hasil menurut alat

Rangkaian uji mencakup kelima kalkulator dalam 22 kasus, dari etape pesisir pendek hingga pelayaran samudra, termasuk rute antimeridian, belahan bumi selatan, dan lintang tinggi. Angka hanya dipublikasikan jika setiap model yang memenuhi syarat memperoleh manfaat.

Tabel ini menggabungkan observasi yang dapat digunakan dari setiap alat: hanya jawaban yang benar, seperti pada semua perbandingan token dan waktu respons. Halaman alat mengutip median dari model yang memenuhi syarat, yaitu angka yang dipublikasikan benchmark per alat, sehingga keduanya bisa sedikit berbeda.

AlatToken yang dihasilkanPercepatanJawaban benar: Baseline LLM, LLM + MCP
Hitung haluan sejati awal-91,6%5,1×Baseline LLM: 101/108, LLM + MCP: 108/108
Hitung jarak lingkaran besar-91,0%4,4×Baseline LLM: 94/108, LLM + MCP: 108/108
Hitung cross track error (XTE)-94,5%9,8×Baseline LLM: 106/135, LLM + MCP: 135/135
Uraikan dan format koordinatTidak dipublikasikan+7,1%2,9× lebih lambatBaseline LLM: 108/108, LLM + MCP: 108/108

Model menangani tugas ini secara efisien tanpa alat. Dalam pengujian konversi mandiri ini, penggunaan alat menambah lebih banyak overhead daripada yang dihemat.

Konversi kecepatanTidak dipublikasikan+33,0%4,1× lebih lambatBaseline LLM: 135/135, LLM + MCP: 135/135

Model menangani tugas ini secara efisien tanpa alat. Dalam pengujian konversi mandiri ini, penggunaan alat menambah lebih banyak overhead daripada yang dihemat.

Mengapa hasilnya berbeda-beda menurut alat

Menggunakan alat MCP menambah sedikit overhead pada setiap permintaan. Untuk perhitungan yang lebih kompleks seperti arah, jarak, dan cross track error, hal itu terimbangi karena model mengerjakan jauh lebih sedikit sendiri. Dalam pengujian kami, alat-alat ini menghasilkan pengurangan yang besar pada token yang dihasilkan dan waktu respons, sekaligus mempertahankan akurasi 100%.

Untuk tugas yang lebih sederhana seperti konversi unit dan koordinat, model sering kali dapat menghitung jawabannya sendiri dengan cepat. Dalam benchmark ini, penggunaan alat untuk tugas-tugas tersebut membutuhkan waktu lebih lama pada setiap model yang diuji dan secara keseluruhan menggunakan lebih banyak token.

Pada 9 model yang diuji, pengurangan token yang dihasilkan berkisar dari 7,3% hingga 95,4%, sedangkan kinerja ujung-ke-ujung berada pada kisaran 0,6× hingga 5,8× dari baseline.

Token yang dihasilkan dan total token

Token yang dihasilkan adalah token keluaran model, termasuk penalaran. Token ini menjadi metrik utama karena merupakan pekerjaan yang digantikan oleh alat.

Metodologi dan pemeriksaan kebenaran

  • Pengujian baseline dan MCP memakai prompt, tugas, model, dan pengaturan yang sama. Satu-satunya perbedaan adalah apakah Mariner GPS Tools terpasang.
  • Model tidak diberi tahu untuk memakai alat. Model sendiri yang memutuskan apakah akan memanggilnya.
  • Angka token diambil langsung dari masing-masing penyedia model. Angka MCP mencakup definisi alat dan setiap giliran model yang terlibat dalam penggunaan sebuah alat.
  • Jawaban diperiksa terhadap nilai harapan yang dihitung secara independen dan toleransi tetap. Tidak ada LLM yang menilai kebenaran.
  • Perbandingan token dan waktu respons menggunakan jawaban yang benar. Jawaban yang salah serta kegagalan model atau alat tetap dihitung dalam hasil akurasi, termasuk kasus ketika model menolak tugas. Proses yang gagal karena masalah infrastruktur, seperti gangguan penyedia, dijalankan ulang dan kegagalan awal dikecualikan.
  • Semua panggilan alat memakai titik akhir MCP produksi Mariner GPS Tools, dengan waktu bolak-balik jaringan dan MCP termasuk dalam waktu respons.
  • Setiap kasus dijalankan 3 kali untuk setiap model dan kondisi. Angka yang dilaporkan adalah median, bukan run terbaik yang dipilih.

Reproduksibilitas

Tanggal benchmark20 September 2026
Aplikasi benchmarkwn-mcp-bench 0.1.0 (40436f25ed54)
Rangkaian ujimariner-tools v0.2.0
Hash rangkaian uji (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
Titik akhir MCPhttps://marinergps.tools/mcp
Server MCPmariner-tools 1.0.0 · MCP 2025-11-25
Tingkat penalaranmedium
Rune8d9d909-831b-4e5e-91aa-cf1413c81096
Prompt sistem, kedua kondisitext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
Dokumentasi API & MCP