HI
API & MCPदस्तावेज़ीकरण

Mariner GPS Tools एजेंट और API प्लेटफ़ॉर्म

बेंचमार्क कार्यप्रणाली और परिणाम

देखें कि Mariner GPS Tools मॉडल के टोकन उपयोग, प्रतिक्रिया समय और शुद्धता को 9 AI मॉडलों में कैसे प्रभावित करता है, और हमने परिणाम कैसे मापे।

बेंचमार्क क्या मापता है

हम समान नेविगेशन कार्यों की तुलना Mariner GPS Tools के साथ और उसके बिना करते हैं, ताकि मॉडल द्वारा जनरेट किए गए टोकन, प्रतिक्रिया समय और शुद्धता पर पड़ने वाला प्रभाव माप सकें। प्रत्येक कार्य एक ही मॉडल, प्रॉम्प्ट और सेटिंग्स का उपयोग करता है, और अंतर केवल इतना है कि MCP टूल उपलब्ध हैं या नहीं।

मुख्य परिणाम

84%कम जनरेट किए गए मॉडल टोकनपरीक्षित 9 मॉडलों की माध्यिका।
100%MCP के साथ सहीप्रोडक्शन MCP के 594/594 प्रेक्षण सहनसीमा के भीतर।
91.6%MCP के बिना सहीमॉडल द्वारा अकेले उत्तर दिए गए 594 प्रेक्षण।

सितंबर 2026 में मापा गया · 9 मॉडल · 22 नेविगेशन केस · 3 पुनरावृत्तियाँ · 1188 प्रेक्षण · प्रोडक्शन Mariner GPS Tools MCP

मॉडल श्रेणी के अनुसार परिणाम

प्रत्येक आँकड़ा उस श्रेणी के तीन मॉडलों की माध्यिका है। श्रेणियाँ प्रत्येक प्रदाता द्वारा मॉडल की अपनी स्थिति-निर्धारण के अनुसार हैं और परिणाम देखने से पहले तय कर दी गई थीं।

जनरेट किए गए टोकन में कमी
छोटे / किफ़ायती94.1%
सामान्य उपयोग93.0%
उन्नत78.4%
समग्र माध्यिका84%
सही उत्तर
LLM बेसलाइन91.6% (544/594)
LLM + MCP100% (594/594)

टूल के अनुसार परिणाम

इस सूट में पाँचों कैलकुलेटर 22 केसों में शामिल हैं, छोटे तटीय खंडों से लेकर महासागरीय यात्राओं तक, जिनमें प्रतियाम्योत्तर (180° देशांतर) पार करने वाले, दक्षिणी गोलार्ध के और उच्च-अक्षांश मार्ग भी हैं। आँकड़ा केवल वहीं प्रकाशित किया जाता है जहाँ हर पात्र मॉडल को लाभ हुआ।

यह तालिका हर टूल के उपयोग योग्य प्रेक्षणों को एक साथ मिलाकर दिखाती है: केवल सही उत्तर, जैसा कि टोकन और प्रतिक्रिया समय की हर तुलना में होता है। टूल पेज पात्र मॉडलों की माध्यिका बताते हैं, जो वह आँकड़ा है जिसे बेंचमार्क हर टूल के लिए प्रकाशित करता है, इसलिए दोनों में थोड़ा अंतर हो सकता है।

टूलजनरेट किए गए टोकनगति-वृद्धिसही उत्तर: LLM बेसलाइन, LLM + MCP
प्रारंभिक वास्तविक दिशा की गणना करें-91.6%5.1×LLM बेसलाइन: 101/108, LLM + MCP: 108/108
महावृत्त दूरी की गणना करें-91.0%4.4×LLM बेसलाइन: 94/108, LLM + MCP: 108/108
क्रॉस ट्रैक एरर (XTE) निकालें-94.5%9.8×LLM बेसलाइन: 106/135, LLM + MCP: 135/135
निर्देशांकों को पार्स और प्रारूपित करेंप्रकाशित नहीं+7.1%2.9× धीमाLLM बेसलाइन: 108/108, LLM + MCP: 108/108

मॉडलों ने इस कार्य को अपने आप कुशलता से पूरा किया। इन स्वतंत्र रूपांतरण परीक्षणों में, टूल के उपयोग से जितनी बचत हुई उससे अधिक अतिरिक्त ओवरहेड जुड़ा।

गतियों को परिवर्तित करेंप्रकाशित नहीं+33.0%4.1× धीमाLLM बेसलाइन: 135/135, LLM + MCP: 135/135

मॉडलों ने इस कार्य को अपने आप कुशलता से पूरा किया। इन स्वतंत्र रूपांतरण परीक्षणों में, टूल के उपयोग से जितनी बचत हुई उससे अधिक अतिरिक्त ओवरहेड जुड़ा।

परिणाम टूल के अनुसार अलग-अलग क्यों होते हैं

MCP टूल का उपयोग हर अनुरोध में कुछ अतिरिक्त लागत जोड़ता है। दिशा, दूरी और क्रॉस ट्रैक एरर जैसी अधिक जटिल गणनाओं में इसकी भरपाई इस बात से हो जाती है कि मॉडल को स्वयं कहीं कम काम करना पड़ता है। हमारे परीक्षणों में इन टूल ने जनरेट किए गए टोकन और प्रतिक्रिया समय में उल्लेखनीय कमी दी, और साथ ही 100% शुद्धता बनाए रखी।

यूनिट और निर्देशांक रूपांतरण जैसे सरल कार्यों के लिए मॉडल अक्सर स्वयं ही जल्दी उत्तर की गणना कर सकते हैं। इस बेंचमार्क में, इन कार्यों के लिए टूल का उपयोग हर परीक्षण किए गए मॉडल में अधिक समय लेता था और कुल मिलाकर अधिक टोकन इस्तेमाल करता था।

परीक्षण किए गए 9 मॉडलों में, जनरेट किए गए टोकन में कमी 7.3% से 95.4% तक रही, जबकि एंड-टू-एंड प्रदर्शन बेसलाइन के 0.6× से 5.8× तक रहा।

जनरेट किए गए टोकन और कुल टोकन

जनरेट किए गए टोकन मॉडल के आउटपुट टोकन हैं, जिनमें रीज़निंग शामिल है। ये मुख्य मीट्रिक हैं क्योंकि यही वह कार्य है जिसकी जगह टूल लेता है।

कार्यप्रणाली और शुद्धता की जाँचें

  • बेसलाइन और MCP परीक्षण एक ही प्रॉम्प्ट, कार्य, मॉडल और सेटिंग्स का उपयोग करते हैं। अंतर केवल इतना है कि Mariner GPS Tools संलग्न है या नहीं।
  • मॉडलों से टूल उपयोग करने को नहीं कहा जाता। वे स्वयं तय करते हैं कि उन्हें कॉल करना है या नहीं।
  • टोकन के आँकड़े सीधे हर मॉडल प्रदाता से आते हैं। MCP के आँकड़ों में टूल परिभाषाएँ और टूल उपयोग में शामिल हर मॉडल टर्न गिना जाता है।
  • उत्तरों की जाँच स्वतंत्र रूप से गणना किए गए अपेक्षित मानों और निश्चित सहनसीमाओं के विरुद्ध की जाती है। शुद्धता का निर्णय किसी LLM से नहीं कराया जाता।
  • टोकन और प्रतिक्रिया-समय की तुलना में सही उत्तरों का उपयोग किया जाता है। गलत उत्तर और मॉडल या टूल की विफलताएँ सटीकता के परिणामों में फिर भी गिनी जाती हैं, जिनमें वे मामले भी शामिल हैं जहाँ मॉडल ने कार्य करने से इनकार किया। बुनियादी ढाँचे से जुड़े कारणों, जैसे प्रदाता की सेवा बंद होने, के कारण विफल रन दोबारा चलाए गए और मूल विफल रन को बाहर रखा गया।
  • सभी टूल कॉल Mariner GPS Tools के प्रोडक्शन MCP एंडपॉइंट का उपयोग करते हैं, और नेटवर्क तथा MCP राउंड-ट्रिप प्रतिक्रिया समय में शामिल हैं।
  • हर केस को प्रत्येक मॉडल और स्थिति के लिए 3 बार चलाया जाता है। प्रस्तुत आँकड़े माध्यिकाएँ हैं, चुने हुए सर्वश्रेष्ठ रन नहीं।

पुनरुत्पादनीयता

बेंचमार्क की तिथि20 सितंबर 2026
बेंचमार्क एप्लिकेशनwn-mcp-bench 0.1.0 (40436f25ed54)
सूटmariner-tools v0.2.0
सूट हैश (SHA-256)b185cd2a8b8d49b5852a281646b6c65570eb793b531914b8ae2daf5f5a2df066
MCP एंडपॉइंटhttps://marinergps.tools/mcp
MCP सर्वरmariner-tools 1.0.0 · MCP 2025-11-25
रीज़निंग एफ़र्टmedium
रनe8d9d909-831b-4e5e-91aa-cf1413c81096
सिस्टम प्रॉम्प्ट, दोनों स्थितियों मेंtext
You are a capable assistant helping with navigation calculations. Answer the user's task. When you have the result, end your reply with exactly one line of the form
FINAL: {"<field>": <number>, ...}
containing every requested field as a plain JSON number (no units, no text inside the JSON). Nothing may follow that line.
API और MCP दस्तावेज़