TR
API & MCPDokümantasyon

Mariner GPS Tools Aracı ve API Platformu

Kıyaslama yöntemi ve sonuçları

Mariner GPS Tools'un modelin token kullanımını, yanıt süresini ve doğruluğunu 9 yapay zekâ modelinde nasıl etkilediğini ve sonuçları nasıl ölçtüğümüzü görün.

Kıyaslama neyi ölçer

Aynı seyir görevlerini Mariner GPS Tools ile ve olmadan karşılaştırarak modelin ürettiği tokenlar, yanıt süresi ve doğruluk üzerindeki etkiyi ölçüyoruz. Her görev aynı modeli, istemi ve ayarları kullanır; tek fark, MCP araçlarının kullanılabilir olup olmamasıdır.

Öne çıkan sonuçlar

%84daha az üretilen model tokenıTest edilen 9 modelin medyanı.
%100MCP ile doğruÜretim MCP'siyle yapılan 594 gözlemin 594 tanesi tolerans dahilinde.
%91,6MCP olmadan doğruModelin tek başına yanıtladığı 594 gözlem.

Ölçüm: Eylül 2026 · 9 model · 22 seyir senaryosu · 3 tekrar · 1188 gözlem · Üretim Mariner GPS Tools MCP'si

Model sınıfına göre sonuçlar

Her değer, o sınıftaki üç modelin medyanıdır. Sınıflar, her sağlayıcının modeli kendi konumlandırmasına göre belirlenmiş ve sonuçlar okunmadan önce sabitlenmiştir.

Üretilen token azalması
Küçük / verimli%94,1
Genel amaçlı%93,0
Gelişmiş%78,4
Genel medyan%84
Doğru yanıtlar
LLM temel durumu%91,6 (544/594)
LLM + MCP%100 (594/594)

Araca göre sonuçlar

Test paketi, beş hesaplayıcının tamamını 22 senaryoda kapsar; kısa kıyı ayaklarından okyanus geçişlerine kadar uzanır ve antimeridyen, güney yarımküre ve yüksek enlem rotalarını içerir. Bir değer yalnızca uygun modellerin tamamının fayda gördüğü yerde yayımlanır.

Bu tablo, her aracın kullanılabilir gözlemlerini bir araya getirir: tüm token ve yanıt süresi karşılaştırmalarında olduğu gibi yalnızca doğru yanıtlar. Araç sayfaları ise uygun modellerin medyanını verir; bu, kıyaslamanın araç başına yayımladığı değerdir ve bu nedenle ikisi arasında küçük farklar olabilir.

AraçÜretilen tokenlarHızlanmaDoğru yanıtlar: LLM temel durumu, LLM + MCP
İlk gerçek kerterizi hesapla-%91,65,1×LLM temel durumu: 101/108, LLM + MCP: 108/108
Büyük daire mesafesini hesapla-%91,04,4×LLM temel durumu: 94/108, LLM + MCP: 108/108
Rotadan sapmayı (XTE) hesapla-%94,59,8×LLM temel durumu: 106/135, LLM + MCP: 135/135
Koordinatları ayrıştır ve biçimlendirYayımlanmadı+%7,12,9× daha yavaşLLM temel durumu: 108/108, LLM + MCP: 108/108

Modeller bu görevi kendi başlarına verimli bir şekilde gerçekleştirdi. Bu bağımsız dönüştürme testlerinde araç kullanımı, sağladığı tasarruftan daha fazla ek yük getirdi.

Hızları dönüştürYayımlanmadı+%33,04,1× daha yavaşLLM temel durumu: 135/135, LLM + MCP: 135/135

Modeller bu görevi kendi başlarına verimli bir şekilde gerçekleştirdi. Bu bağımsız dönüştürme testlerinde araç kullanımı, sağladığı tasarruftan daha fazla ek yük getirdi.

Sonuçlar araca göre neden değişiyor

Bir MCP aracı kullanmak her isteğe bir miktar ek maliyet getirir. Rota, mesafe ve rotadan sapma gibi daha karmaşık hesaplamalarda bu, modelin kendi başına çok daha az iş yapmasıyla dengelenir. Testlerimizde bu araçlar, üretilen token ve yanıt sürelerinde belirgin azalmalar sağladı ve bu sırada %100 doğruluğu korudu.

Birim ve koordinat dönüştürme gibi daha basit görevlerde modeller çoğu zaman yanıtı kendi başlarına hızlıca hesaplayabilir. Bu benchmarkta, bu görevler için araç kullanmak test edilen her modelde daha uzun sürdü ve toplamda daha fazla token kullandı.

Test edilen 9 modelde üretilen token azalması %7,3 ile %95,4 arasında, uçtan uca başarım ise temel duruma göre 0,6× ile 5,8× arasında değişti.

Üretilen tokenlar ve toplam tokenlar

Üretilen tokenlar, akıl yürütme dâhil modelin çıktı tokenlarıdır. Aracın yerini aldığı işi temsil ettikleri için ana ölçüttürler.

Yöntem ve doğruluk denetimleri

  • Temel durum ve MCP testleri aynı istemi, görevi, modeli ve ayarları kullanır. Tek fark, Mariner GPS Tools'un isteğe eklenmiş olup olmamasıdır.
  • Modellere araçları kullanmaları söylenmez. Onları çağırıp çağırmayacaklarına kendileri karar verir.
  • Token sayıları doğrudan her model sağlayıcısından gelir. MCP sayıları, araç tanımlarını ve bir aracın kullanımına katılan her model turunu içerir.
  • Yanıtlar, bağımsız olarak hesaplanmış beklenen değerlere ve sabit toleranslara göre denetlenir. Doğruluğu hiçbir LLM değerlendirmez.
  • Token ve yanıt süresi karşılaştırmalarında doğru yanıtlar kullanılır. Yanlış yanıtlar ile model veya araç hataları, modelin görevi reddettiği durumlar da dahil olmak üzere doğruluk sonuçlarında sayılmaya devam eder. Sağlayıcı kesintisi gibi altyapı nedenleriyle başarısız olan çalıştırmalar yeniden denendi ve ilk başarısız çalıştırmalar hariç tutuldu.
  • Tüm araç çağrıları Mariner GPS Tools'un üretim MCP uç noktasını kullanır ve ağ ile MCP gidiş-dönüşleri yanıt sürelerine dâhildir.
  • Her senaryo, her model ve koşul için 3 kez çalıştırılır. Bildirilen değerler medyandır, seçilmiş en iyi çalıştırmalar değildir.

Yeniden üretilebilirlik

Kıyaslama tarihi20 Eylül 2026
Kıyaslama uygulamasıwn-mcp-bench 0.1.0 (40436f25ed54)
Test paketimariner-tools v0.2.0
Test paketi özeti (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP uç noktasıhttps://marinergps.tools/mcp
MCP sunucusumariner-tools 1.0.0 · MCP 2025-11-25
Akıl yürütme düzeyimedium
Çalıştırmae8d9d909-831b-4e5e-91aa-cf1413c81096
Sistem istemi, her iki koşultext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API ve MCP belgeleri